Textdatei zeigt seltsame Zeichen: so lesen Sie sie
Sie öffnen eine .txt-Datei und sehen „Grüße“ oder Reihen von � statt Text. Die Datei ist nicht kaputt: Das Programm hat sie nur in der falschen Kodierung gelesen. So entsteht das – und so lesen Sie den Text.
Warum das passiert
Ein Computer speichert Text als Bytes, und eine Kodierung ist die Tabelle, die Bytes in Buchstaben übersetzt. Heute nutzt fast alles UTF-8: Websites, Mac, Linux, Android und der Editor in aktuellen Windows-Versionen. Ältere Dateien verwenden oft Windows-1252 (Westeuropa).
Wird eine Datei in einer anderen Kodierung gelesen, als sie geschrieben wurde, werden Buchstaben zu fremden Zeichen. Der Text selbst ist unversehrt – er muss nur richtig gelesen werden.
Was die seltsamen Zeichen verraten
Grüße–Ãgefolgt von einem weiteren Zeichen: Die Datei ist UTF-8, wurde aber als Westeuropäisch gelesen.Gr��e– Rauten mit Fragezeichen: Die Datei ist in einer älteren Kodierung, wurde aber als UTF-8 gelesen.Привет– viele «Р» und «С»: russischer Text in UTF-8, gelesen als Windows-1251.
1. Öffnen Sie die Datei in OsonKit
Ziehen Sie die Datei auf OsonKit. Die Kodierung wird an den Bytes selbst erkannt: Eine Markierung am Dateianfang (BOM) zeigt UTF-8 oder UTF-16 an; Text, der sich fehlerfrei als UTF-8 lesen lässt, ist UTF-8; sonst zählt OsonKit, wie viele Bytes kyrillischen Buchstaben ähneln, und wählt Windows-1251 oder Windows-1252. Die gewählte Kodierung steht neben der Datei. Die Datei wird im Browser gelesen und nirgendwohin gesendet.
- Dateien bis 10 MB.
- Erkannt werden UTF-8, UTF-16 (mit BOM), Windows-1251 und Windows-1252. Andere ältere Kodierungen – Shift_JIS, GBK, EUC-KR, Windows-1254, Windows-1256 und weitere – werden nicht unterstützt.
- Es ist ein Viewer: Sie können den Text lesen und kopieren, aber nicht bearbeiten.
2. Speichern Sie den Text neu als UTF-8
Wenn Sie die Datei weitergeben, speichern Sie sie so, dass sie überall aufgeht. Kopieren Sie den Text aus OsonKit, fügen Sie ihn in ein neues Dokument im Editor ein und speichern Sie. Der Editor in Windows 10 (seit 2019) und Windows 11 speichert standardmäßig als UTF-8, das jedes moderne Programm und Handy versteht.
Wenn die Zeichen in einer CSV-Datei stehen
Bei .csv ist es genauso: Ein Export aus dem Onlinebanking oder einer Buchhaltungssoftware zeigt in Excel à in jedem Umlaut. Der CSV-Viewer erkennt die Kodierung wie bei Text und zeigt die Tabelle mit normalen Buchstaben.