텍스트 파일 글자가 깨질 때: 읽는 방법
.txt를 열었더니 본문 대신 「媛�ы⑸��」이나 � 기호가 줄지어 있습니다. 파일이 망가진 것은 아닙니다. 프로그램이 다른 인코딩으로 읽었을 뿐입니다. 원인과 텍스트를 읽는 방법을 알려 드립니다.
왜 이런 일이 생길까
컴퓨터는 텍스트를 바이트로 저장하고, 인코딩은 바이트를 글자로 바꾸는 표입니다. 요즘은 거의 모든 것이 UTF-8을 씁니다. 웹사이트, Mac, Linux, Android, 최신 Windows의 메모장도 마찬가지입니다. 오래된 한국어 파일은 EUC-KR(CP949)로 저장된 경우가 많습니다.
한 인코딩으로 쓴 파일을 다른 인코딩으로 읽으면 글자가 엉뚱한 문자로 바뀝니다. 텍스트 자체는 멀쩡하며, 올바르게 읽기만 하면 됩니다.
깨진 글자가 알려 주는 것
媛�ы⑸��— 뜻 없는 한자와 � 기호가 섞임: 파일은 UTF-8인데 EUC-KR로 읽혔습니다.�����— 물음표가 든 마름모: 파일은 EUC-KR 같은 옛 인코딩인데 UTF-8로 읽혔습니다.
1. OsonKit에서 파일 열기
파일을 OsonKit에 끌어다 놓으세요. 인코딩은 바이트 자체로 판별합니다. 파일 앞부분의 표시(BOM)가 있으면 UTF-8 또는 UTF-16, 오류 없이 UTF-8로 읽히면 UTF-8입니다. 선택된 인코딩은 파일 옆에 표시됩니다. 파일은 브라우저에서 읽히며 어디로도 전송되지 않습니다.
- 10MB까지의 파일.
- 지원 인코딩: UTF-8, UTF-16(BOM 포함), Windows-1251, Windows-1252. EUC-KR(CP949)은 지원하지 않으므로 이런 파일은 올바르게 표시되지 않습니다.
- 뷰어이므로 텍스트를 읽고 복사할 수 있지만 편집은 할 수 없습니다.
2. 텍스트를 UTF-8로 다시 저장하기
파일을 다른 사람에게 보내야 한다면 어디서나 열리도록 저장하세요. OsonKit에서 텍스트를 복사해 메모장의 새 문서에 붙여 넣고 저장합니다. EUC-KR 파일은 한국어 Windows의 메모장으로 바로 열면 ANSI로 올바르게 읽힙니다. Windows 10(2019년 이후)과 Windows 11의 메모장은 기본으로 UTF-8로 저장하며, 최신 프로그램과 휴대폰은 모두 이를 읽을 수 있습니다.
CSV 파일 글자가 깨진다면
.csv도 마찬가지입니다. UTF-8로 내보낸 CSV를 Excel에서 열면 한글이 깨질 수 있습니다. CSV 뷰어는 텍스트와 같은 방식으로 인코딩을 판별해 표를 정상적인 글자로 보여 줍니다.