Convertitore e Correttore di Mojibake (Testo Corrotto)
Incolla un testo con caratteri corrotti (mojibake) e lo strumento riconosce all'istante la combinazione di codifiche che ha causato il problema, proponendo le possibili ricostruzioni. È prevista anche la conversione esplicita fra UTF-8, Shift_JIS, EUC-JP e JIS (ISO-2022-JP) — gratuito, senza registrazione.
Consigli
- Se compaiono più ricostruzioni, quella corretta è di norma la ricostruzione contrassegnata come ipotesi più probabile, cioè quella che restituisce il giapponese più naturale.
- Le sequenze come «縺薙繧薙?...», frequenti nei programmi di posta e nei file CSV, si risolvono quasi sempre con la combinazione da UTF-8 a Shift_JIS.
- Se il testo è degenerato in una successione di punti interrogativi o di rombi, è molto probabile che una parte della sequenza di byte originaria sia perduta e la ricostruzione dal solo testo diventa assai difficile.
- La scheda della conversione esplicita permette di ottenere subito il risultato quando già conoscete la combinazione di codifiche da ripristinare.
Domande frequenti
A proposito — perché «縺薙繧薙?縺ォ縺。縺ッ» è il simbolo dei testi giapponesi corrotti
Cercando notizie sui testi giapponesi corrotti si incontra immancabilmente la sequenza «縺薙繧薙?縺ォ縺。縺ッ», che in origine era il saluto «konnichiwa»: è diventata una sorta di icona culturale fra chi in Giappone usa Internet. Si tratta dello schema tipicissimo che compare quando un testo scritto in UTF-8 viene aperto con un'applicazione che presume Shift_JIS, come il vecchio blocco note di Windows o certi sistemi datati.
Questa combinazione ricorre così spesso perché il decodificatore Shift_JIS interpreta a forza come caratteri a due byte le sequenze di tre byte con cui UTF-8 rappresenta un carattere giapponese. Per pura coincidenza la maggior parte di esse ricade in intervalli interpretabili come caratteri Shift_JIS validi: non si genera dunque alcun errore e si crea la condizione peculiare di un testo che sembra irrimediabilmente corrotto ma è in realtà ricostruibile. È grazie a questa proprietà che il ripristino automatico di strumenti come questo riesce con alta probabilità.
Al contrario, in combinazioni come un testo scritto in Shift_JIS e aperto presumendo EUC-JP si producono spesso sequenze di byte non valide e l'informazione stessa va perduta: in quel caso la ricostruzione a livello di testo è impossibile per principio. Che la questione delle codifiche giapponesi abbia tormentato per anni chi lavora nell'informatica dipende proprio dalla convivenza di corruzioni recuperabili e corruzioni irrecuperabili.