Zeichenkodierung von Dateien umwandeln (UTF-8 mit BOM, Shift_JIS)
Wandeln Sie die Zeichenkodierung einer CSV- oder Textdatei um. Mit einem BOM öffnet Excel UTF-8 korrekt; alternativ nach Shift_JIS. Läuft vollständig im Browser.
Empfohlene Einstellungen je Zweck
Welche Kodierung passt, hängt vom Empfänger ab. Nutzen Sie dies als Orientierung.
| Ihr Vorhaben | Empfohlene Einstellung |
|---|---|
| Eine UTF-8-CSV direkt in Excel öffnen | UTF-8 mit BOM |
| In ein älteres Warenwirtschaftssystem importieren | Shift_JIS mit CRLF |
| Die Datei aus einem Programm lesen | UTF-8 ohne BOM und LF |
| In Excel für Mac öffnen | UTF-8 mit BOM |
| In Google Tabellen importieren | UTF-8, BOM optional |
| Text für ein altes E-Mail-Programm vorbereiten | ISO-2022-JP (JIS) |
Die Kodierungen in Kürze
Was dieses Werkzeug unterstützt und worauf zu achten ist.
| Kodierung | Hinweise |
|---|---|
| UTF-8 | Der heutige Standard; deckt alle Schriften und Emojis ab. |
| UTF-8 mit BOM | Drei Markierungsbytes am Anfang, damit Excel die Kodierung nicht falsch errät. |
| Shift_JIS | Lange auf japanischem Windows verwendet. Emojis und manche Kanji-Varianten fehlen. |
| EUC-JP | Japanische Kodierung, vor allem auf UNIX-Systemen verwendet. |
| ISO-2022-JP (JIS) | Die Kodierung japanischer E-Mails. Halbbreites Katakana ist nicht darstellbar. |
Tipps
- Soll die Datei nur in Excel geöffnet werden, ist UTF-8 mit BOM die sicherste Wahl: kein Zeichen geht verloren.
- Bei der Umwandlung nach Shift_JIS werden nicht darstellbare Zeichen durch „?“ ersetzt. Das Werkzeug listet sie vorher auf.
- Fügen Sie Dateien, die ein Programm einliest, kein BOM hinzu – es landet meist im Namen der ersten Spalte.
Häufige Fragen
Übrigens – Was unleserlicher Text verrät
Unleserlicher Text folgt erkennbaren Mustern. Ketten unzusammenhängender Kanji entstehen, wenn UTF-8-Bytes als Shift_JIS gelesen werden: Ein japanisches Zeichen belegt in UTF-8 drei Bytes, paarweise neu gelesen ergeben sie völlig andere Zeichen. Der umgekehrte Fehler liefert Reihen von Ersatzzeichen, weil die Bytefolgen ungültig sind.
Das BOM wurde für UTF-16 erfunden, wo es die Bytereihenfolge angibt. UTF-8 kennt diese Ambiguität nicht, weshalb der Unicode-Standard davon abrät – in der Windows-Welt hat es dennoch überlebt, weil Programme, die die Kodierung nur erraten können, eine ausdrückliche Markierung brauchten.