テキストファイルが文字化けする:読み方
.txt を開いたら、本文の代わりに「縺薙s縺ォ縺。縺ッ」や � が並んでいる。ファイルは壊れていません。プログラムが違う文字コードで読んだだけです。原因とテキストの読み方を説明します。
なぜ起きるのか
コンピューターはテキストをバイトとして保存し、文字コードはバイトを文字に変換する表です。現在はほぼすべてが UTF-8 を使います。Web サイト、Mac、Linux、Android、最近の Windows のメモ帳もそうです。古い日本語のファイルは Shift_JIS で保存されていることが多いです。
ある文字コードで書かれたファイルを別の文字コードで読むと、文字が別の文字に置き換わります。テキスト自体は無事で、正しく読み直すだけで済みます。
文字化けの見分け方
縺薙s縺ォ縺。縺ッ— 「縺」と半角カナが混ざる:ファイルは UTF-8 なのに Shift_JIS として読まれています。�����— 疑問符の入ったひし形:ファイルは Shift_JIS などの古い文字コードなのに UTF-8 として読まれています。
1. OsonKit でファイルを開く
ファイルを OsonKit にドロップします。文字コードはバイトそのものから判定されます。ファイル先頭の印(BOM)があれば UTF-8 か UTF-16、エラーなく UTF-8 として読めれば UTF-8 です。選ばれた文字コードはファイルの横に表示されます。ファイルはブラウザ内で読み込まれ、どこにも送信されません。
- 10 MB までのファイル。
- 対応する文字コード:UTF-8、UTF-16(BOM 付き)、Windows-1251、Windows-1252。Shift_JIS と EUC-JP には対応していません。これらのファイルは正しく表示されません。
- ビューアーなので、テキストの閲覧とコピーはできますが、編集はできません。
2. テキストを UTF-8 で保存し直す
ファイルを人に渡すなら、どこでも開ける形で保存しましょう。OsonKit からテキストをコピーし、メモ帳の新しい文書に貼り付けて保存します。Shift_JIS のファイルは、日本語版 Windows のメモ帳で直接開けば ANSI として正しく読めます。Windows 10(2019 年以降)と Windows 11 のメモ帳は既定で UTF-8 で保存し、最近のプログラムやスマートフォンはすべてこれを読めます。
CSV が文字化けする場合
.csv でも同じことが起きます。UTF-8 で書き出された CSV を Excel で開くと、日本語が「縺」だらけになることがあります。CSV ビューアーはテキストと同じ方法で文字コードを判定し、表を正しい文字で表示します。