Convertisseur et Réparateur de Mojibake (Texte Illisible)

Collez un texte illisible (mojibake) pour détecter instantanément la combinaison d'encodages qui en est la cause, avec des candidats de réparation classés. Prend aussi en charge la conversion explicite entre UTF-8, Shift_JIS, EUC-JP et JIS (ISO-2022-JP) — gratuit, sans inscription.

Qu'est-ce que le mojibake ?

Le mojibake apparaît lorsque l'encodage utilisé pour enregistrer un texte ne correspond pas à celui employé pour le relire. Un fichier écrit en UTF-8 mais rouvert en supposant du Shift_JIS, par exemple, affichera une suite de caractères sans rapport avec le texte d'origine, même si aucun octet n'a réellement disparu. Le japonais y est particulièrement exposé, car trois encodages (UTF-8, Shift_JIS, EUC-JP) et une variante historique (JIS) coexistent encore aujourd'hui dans des logiciels, des e-mails et des bases de données de générations différentes.

Cet outil teste automatiquement les combinaisons d'encodages les plus courantes et classe les résultats selon leur ressemblance avec du japonais ou de l'ASCII lisible, afin de vous éviter de deviner vous-même la bonne paire. Cependant, toutes les situations ne se valent pas : si la séquence d'octets d'origine a déjà été perdue lors d'un premier décodage incorrect, le texte se transforme en une suite de « ? » ou de « � », et aucune reconstruction n'est alors possible à partir de la seule chaîne de caractères. Si vous connaissez déjà avec certitude l'encodage source et l'encodage cible, l'onglet « Conversion manuelle » vous permettra d'aller plus vite qu'en attendant les candidats automatiques.

Comment réparer un texte illisible

  1. Collez le texte illisible Ouvrez l'onglet « Réparation automatique » et collez-y le texte mojibake. Rien n'est envoyé à un serveur : tout se passe dans votre navigateur.
  2. Examinez les candidats proposés Plusieurs résultats possibles s'affichent, classés par plausibilité. Repérez celui portant le badge « Meilleure correspondance », généralement le bon.
  3. Passez en mode manuel si besoin Si aucun candidat ne semble correct, ouvrez l'onglet « Conversion manuelle » et choisissez explicitement l'encodage apparent et l'encodage d'origine supposé.
  4. Rouvrez le fichier source si la réparation échoue Si le texte reste illisible malgré tout, revenez au fichier d'origine et rouvrez-le dans un éditeur de texte en précisant manuellement le bon encodage.

Astuces pour en tirer le meilleur parti

  • Lorsque plusieurs candidats apparaissent, celui marqué « Meilleure correspondance » — généralement le japonais ou l'ASCII le plus naturel — est habituellement le bon.
  • Le motif classique « 縺薙繧薙?... » observé dans les e-mails et les fichiers CSV se résout presque toujours avec la paire UTF-8 → Shift_JIS.
  • Si le texte s'est transformé en une suite de « ? » ou de « � », une partie de la séquence d'octets d'origine a probablement été perdue, ce qui complique une récupération complète au niveau du texte.
  • Utilisez l'onglet « Conversion manuelle » pour obtenir un résultat en une seule étape lorsque vous connaissez déjà la paire d'encodages responsable du problème.

Cas d'usage courants

Un fichier CSV reçu d'un partenaire s'affiche mal

Avant de redemander l'envoi du fichier, collez ici le contenu d'une cellule illisible pour vérifier rapidement s'il s'agit d'un simple problème d'encodage récupérable.

Un e-mail ancien s'affiche en mojibake

Un message provenant d'un client de messagerie ancien ou mal configuré peut afficher un objet ou un corps de texte illisible. Récupérez son contenu sans avoir à solliciter l'expéditeur.

Des journaux ou des enregistrements de base de données sont corrompus

Lorsque le paramètre d'encodage d'un système a changé au fil du temps, certaines lignes de logs ou certains champs stockés deviennent illisibles. Cet outil aide à retrouver leur contenu d'origine.

Comprendre quel décalage produit quel type de mojibake

L'onglet manuel permet d'expérimenter volontairement différentes paires d'encodages afin de mieux reconnaître, à l'avenir, la signature visuelle de chaque type de décalage.

Glossaire des encodages

UTF-8
Encodage Unicode devenu le standard du Web, capable de représenter la quasi-totalité des langues du monde. Les caractères japonais y occupent le plus souvent 3 octets.
Shift_JIS
Encodage japonais historique, très répandu sous Windows avant la généralisation d'Unicode. Encore présent dans d'anciens logiciels et systèmes hérités.
EUC-JP
Encodage japonais longtemps privilégié sur les systèmes de type Unix et certains serveurs. Sa structure d'octets diffère de celle du Shift_JIS et de l'UTF-8.
JIS (ISO-2022-JP)
Encodage plus ancien, basé sur des séquences d'échappement, longtemps utilisé pour l'échange de courrier électronique en japonais afin de rester compatible avec des systèmes limités à l'ASCII.
Encodage de caractères
Règle qui associe chaque caractère à une séquence d'octets pour le stockage et la transmission. Un texte n'a de sens que si l'on connaît l'encodage utilisé pour le lire.
Mojibake irréversible
Cas où la séquence d'octets d'origine a déjà été perdue lors d'un premier décodage incorrect, souvent visible sous la forme de « ? » ou de « � ». Aucune réparation au niveau du texte n'est alors possible.

Questions fréquentes

Il se produit lorsque l'encodage utilisé pour enregistrer un texte diffère de celui supposé par le lecteur lors de son affichage. Le japonais y est particulièrement exposé car UTF-8, Shift_JIS et EUC-JP sont tous encore utilisés, et les décalages entre eux sont la principale cause du mojibake.

Non. Selon le type de décalage, une partie de la séquence d'octets d'origine peut être définitivement perdue dès le premier décodage (incorrect), rendant impossible une récupération complète à partir de la seule chaîne de caractères. C'est particulièrement vrai lorsqu'un encodage japonais multi-octets est mal interprété comme un autre ; un texte transformé en « ? » ou « � » ne peut généralement pas être restauré.

UTF-8 est aujourd'hui l'encodage dominant, mais certains anciens systèmes japonais et applications Windows héritées supposent encore du Shift_JIS. Comme les séquences d'octets UTF-8 des caractères japonais s'avèrent souvent aussi être des séquences Shift_JIS valides, aucune information n'est perdue dans le processus — c'est précisément pourquoi ce décalage particulier peut généralement être inversé.

Non. Toute la conversion s'exécute localement dans le JavaScript de votre navigateur, ce qui la rend sûre même pour du texte contenant des mots de passe ou des informations personnelles.
Tool-kun

Anecdote — Pourquoi « 縺薙繧薙?縺ォ縺。縺ッ » est devenu le visage du mojibake japonais

Cherchez « mojibake japonais » et vous tomberez presque certainement sur « 縺薙繧薙?縺ォ縺。縺ッ » (qui devrait se lire « こんにちは », c'est-à-dire « bonjour ») — c'est devenu une sorte d'icône culturelle parmi les internautes japonais. C'est le résultat typique de l'ouverture d'un texte UTF-8 dans une application qui suppose du Shift_JIS, comme une ancienne version du Bloc-notes Windows ou divers systèmes anciens.

Cette association particulière revient constamment parce qu'un décodeur Shift_JIS réinterprète de force les séquences de 3 octets qu'UTF-8 utilise pour les caractères japonais comme s'il s'agissait de caractères Shift_JIS de 2 octets. Par coïncidence, la plupart de ces séquences réinterprétées tombent dans la plage des caractères Shift_JIS valides, si bien qu'aucune erreur ne se produit : le texte paraît simplement illisible tout en restant, secrètement, entièrement récupérable. C'est exactement cette propriété qui explique pourquoi un réparateur automatique comme celui-ci réussit si souvent.

À l'inverse, ouvrir un texte Shift_JIS comme s'il s'agissait d'EUC-JP produit généralement des séquences d'octets invalides qui sont purement et simplement rejetées, détruisant l'information sur le moment — la récupération au niveau de la chaîne devient alors impossible en principe. Cette distinction entre mojibake « récupérable » et « irrécupérable » explique en grande partie pourquoi les problèmes d'encodage des caractères japonais frustrent silencieusement les ingénieurs depuis des décennies.