Mojibake-Konverter & Reparatur — Zeichenkodierungs-Tool

Fügen Sie unlesbaren Text (Mojibake) ein und erkennen Sie sofort, welche Kodierungskombination die Zeichensalat-Anzeige verursacht hat – mit bewerteten Reparaturvorschlägen. Unterstützt auch die gezielte Umwandlung zwischen UTF-8, Shift_JIS, EUC-JP und JIS (ISO-2022-JP) – kostenlos, keine Anmeldung nötig.

Was ist Mojibake und warum passiert es?

Mojibake entsteht, wenn ein Computer beim Anzeigen von Text eine andere Zeichenkodierung annimmt als diejenige, mit der der Text ursprünglich gespeichert wurde. Jede Kodierung übersetzt Bytes in Zeichen nach eigenen Regeln, und wird dieselbe Byte-Folge mit den falschen Regeln gelesen, entsteht statt lesbarem Japanisch eine Kette aus scheinbar zufälligen Symbolen. Besonders bei japanischem Text tritt dieses Problem häufig auf, weil UTF-8, Shift_JIS, EUC-JP und JIS (ISO-2022-JP) parallel im Einsatz sind.

Dieses Werkzeug testet automatisch die wahrscheinlichsten Kodierungskombinationen zwischen diesen vier Systemen und ordnet die Ergebnisse danach, wie stark sie nach lesbarem Japanisch oder ASCII aussehen. Wichtig zu wissen: nicht jedes Mojibake lässt sich reparieren. Wenn beim ersten fehlerhaften Einlesen bereits Bytes der ursprünglichen Zeichenkette verloren gingen, zeigt sich das als sich wiederholendes „?" oder „�" – in diesem Fall ist eine Wiederherstellung allein aus der Zeichenkette unmöglich. Kennen Sie das betroffene Kodierungspaar bereits, nutzen Sie direkt den Tab „Manuelle Umwandlung".

So reparieren Sie unlesbaren Text Schritt für Schritt

  1. Unlesbaren Text in den Tab „Automatische Reparatur" einfügen Fügen Sie den betroffenen Text in das Eingabefeld ein. Er wird ausschließlich lokal im Browser verarbeitet und niemals an einen Server übertragen.
  2. Die bewerteten Reparaturvorschläge durchsehen Prüfen Sie die Liste der Kandidaten und achten Sie besonders auf den mit „Beste Übereinstimmung" markierten Eintrag – meist ist genau dieser der gesuchte Originaltext.
  3. Bei Bedarf zur manuellen Umwandlung wechseln Erscheint kein überzeugender Vorschlag, wechseln Sie in den Tab „Manuelle Umwandlung" und wählen Sie „Kodierung, in der er aktuell erscheint" sowie „tatsächliche ursprüngliche Kodierung" gezielt selbst aus.
  4. Bei anhaltendem Misserfolg die Originaldatei neu öffnen Lässt sich der Text weiterhin nicht reparieren, öffnen Sie die ursprüngliche Datei erneut in einem Texteditor und geben Sie dabei die korrekte Kodierung ausdrücklich vor.

Tipps für die Nutzung

  • Wenn mehrere Vorschläge erscheinen, ist meist der mit „Beste Übereinstimmung" markierte – in der Regel das natürlichste Japanisch oder ASCII – der richtige.
  • Das klassische „縺薙繧薙?..."-Muster aus E-Mails und CSV-Dateien lässt sich fast immer mit dem Paar UTF-8 → Shift_JIS auflösen.
  • Wenn der Text zu einer Folge aus „?" oder „�" geworden ist, wurde wahrscheinlich ein Teil der ursprünglichen Byte-Sequenz verloren, was eine vollständige Wiederherstellung auf Textebene erschwert.
  • Nutzen Sie den Tab „Manuelle Umwandlung" für ein Ergebnis in einem Schritt, wenn Sie bereits wissen, welches Kodierungspaar das Problem verursacht hat.

Typische Anwendungsfälle

CSV-Dateien von Geschäftspartnern prüfen

Wird eine von einem Partner erhaltene CSV-Datei in der Tabellenkalkulation als Zeichensalat angezeigt, fügen Sie den Inhalt einer betroffenen Zelle hier ein, um den echten Text zu erkennen, bevor Sie um eine erneute Zusendung bitten.

Alte E-Mails wieder lesbar machen

Betreff oder Text einer E-Mail aus einem älteren Mail-Programm sind unlesbar geworden? Mit diesem Tool stellen Sie den Inhalt selbst wieder her, ohne den Absender erneut kontaktieren zu müssen.

Verstümmelte Logs und Datenbankeinträge entziffern

Wenn sich die Kodierungseinstellung eines Systems irgendwann unbemerkt geändert hat, lassen sich betroffene Logzeilen oder Datenbankfelder hier einzeln nachträglich entschlüsseln.

Kodierungskonflikte gezielt nachvollziehen

Mit dem Tab „Manuelle Umwandlung" lässt sich ausprobieren, welche Kodierungspaarung welche Art von Zeichensalat erzeugt – nützlich, um das Prinzip dahinter besser zu verstehen.

Begriffe rund um Zeichenkodierung

UTF-8
Die heute weltweit dominierende Unicode-Kodierung. Sie stellt japanische Zeichen meist mit drei Bytes dar und wird von den meisten modernen Systemen und Browsern standardmäßig verwendet.
Shift_JIS
Eine ältere japanische Kodierung, die vor allem in klassischen Windows-Umgebungen und älterer Software noch verbreitet ist. Ein Zeichen belegt dabei ein oder zwei Bytes.
EUC-JP
Eine vor allem unter Unix- und Linux-Systemen historisch verbreitete japanische Kodierung, die auch heute noch in manchen älteren Serveranwendungen vorkommt.
JIS (ISO-2022-JP)
Eine ältere, auf reinem ASCII basierende Kodierung, die durch Escape-Sequenzen zwischen Zeichensätzen umschaltet. Sie wurde besonders im E-Mail-Verkehr in Japan lange eingesetzt.
Zeichenkodierung
Das Regelwerk, nach dem Bytes in darstellbare Zeichen übersetzt werden. Wenden Speichern und Anzeigen unterschiedliche Regeln an, entsteht Mojibake statt des beabsichtigten Textes.
Nicht wiederherstellbares Mojibake
Der Fall, in dem Teile der ursprünglichen Byte-Sequenz bereits beim ersten fehlerhaften Einlesen dauerhaft verloren gingen. Erkennbar an sich wiederholendem „?" oder „�"; eine Reparatur ist dann auf Zeichenebene grundsätzlich nicht mehr möglich.

Häufig gestellte Fragen

Es entsteht, wenn die zum Speichern eines Textes verwendete Kodierung von der Kodierung abweicht, die beim Anzeigen angenommen wird. Japanischer Text ist dafür besonders anfällig, weil UTF-8, Shift_JIS und EUC-JP alle noch im Einsatz sind und Diskrepanzen zwischen ihnen die Hauptursache für Mojibake sind.

Nein. Je nach Art der Diskrepanz kann ein Teil der ursprünglichen Byte-Sequenz bereits bei der ersten (falschen) Dekodierung dauerhaft verloren gehen, sodass eine vollständige Wiederherstellung allein aus der Zeichenkette unmöglich wird. Das gilt besonders, wenn eine japanische Mehrbyte-Kodierung als eine andere fehlinterpretiert wird; zu „?" oder „�" gewordener Text lässt sich in der Regel nicht wiederherstellen.

UTF-8 ist heute die vorherrschende Kodierung, aber manche älteren japanischen Systeme und Legacy-Windows-Anwendungen gehen weiterhin von Shift_JIS aus. Da UTF-8-Byte-Sequenzen für japanische Zeichen oft zufällig auch gültige Shift_JIS-Byte-Sequenzen sind, geht dabei keine Information verloren – genau deshalb lässt sich diese spezielle Diskrepanz meist umkehren.

Nein. Die gesamte Umwandlung läuft lokal im JavaScript Ihres Browsers, daher ist die Nutzung auch mit Texten sicher, die Passwörter oder persönliche Daten enthalten.
Tool-kun

Übrigens – Warum „縺薙繧薙?縺ォ縺。縺ッ" zum Gesicht des japanischen Mojibake wurde

Wer nach japanischem Mojibake sucht, stößt fast sicher auf „縺薙繧薙?縺ォ縺。縺ッ" (das eigentlich „こんにちは", also „Hallo", lauten sollte) – unter japanischen Internetnutzern ist es zu einer Art Kult-Symbol geworden. Es ist das Lehrbuchbeispiel dafür, was passiert, wenn UTF-8-Text in einer Anwendung geöffnet wird, die Shift_JIS annimmt, etwa in einer alten Version des Windows-Editors oder diversen Legacy-Systemen.

Diese besondere Paarung tritt so häufig auf, weil ein Shift_JIS-Decoder die 3-Byte-Sequenzen, die UTF-8 für japanische Zeichen verwendet, zwangsweise als 2-Byte-Shift_JIS-Zeichen neu interpretiert. Durch einen Zufall fällt der Großteil dieser neu interpretierten Sequenzen in den Bereich gültiger Shift_JIS-Zeichen, sodass kein Fehler auftritt – der Text sieht nur verstümmelt aus, bleibt aber insgeheim vollständig wiederherstellbar. Genau diese Eigenschaft ist der Grund, warum eine automatische Reparatur wie diese so oft erfolgreich ist.

Wird umgekehrt Shift_JIS-Text so geöffnet, als wäre er EUC-JP, entstehen dagegen meist ungültige Byte-Sequenzen, die sofort verworfen werden – Informationen gehen in dem Moment unwiderruflich verloren, und eine Wiederherstellung auf Textebene wird dann grundsätzlich unmöglich. Diese Trennung zwischen „wiederherstellbarem" und „nicht wiederherstellbarem" Zeichensalat erklärt zu einem großen Teil, warum japanische Zeichenkodierungsprobleme Entwickler seit Jahrzehnten leise zur Verzweiflung treiben.