Conversor y Reparador de Mojibake (Texto Ilegible)
Pega un texto ilegible (mojibake) y detecta al instante qué combinación de codificaciones lo causó, con candidatos de reparación clasificados. También convierte explícitamente entre UTF-8, Shift_JIS, EUC-JP y JIS (ISO-2022-JP) — gratis y sin registro.
¿Qué es el mojibake y por qué ocurre?
El mojibake aparece cuando la codificación con la que se guardó un texto no coincide con la codificación que asume el programa que lo muestra. Cada codificación —UTF-8, Shift_JIS, EUC-JP o JIS (ISO-2022-JP)— traduce los mismos caracteres japoneses a secuencias de bytes distintas, así que si el lector usa una tabla equivocada, el resultado es una cadena de símbolos sin sentido en lugar del texto original. El japonés es especialmente propenso a este problema porque varias codificaciones conviven todavía en distintos sistemas, correos y bases de datos.
Esta herramienta prueba por fuerza bruta las combinaciones más probables entre esas cuatro codificaciones y ordena los resultados según lo natural que resulte el japonés o el ASCII obtenido, para que puedas identificar de un vistazo el candidato correcto. Sin embargo, no todo mojibake tiene solución: si la secuencia de bytes original ya se perdió durante una primera decodificación fallida —algo que se reconoce por una fila de signos "?" o "�"— ya no existe información suficiente para reconstruir el texto, y ninguna herramienta puede recuperarlo a partir de la cadena resultante. En ese caso, o si ya conoces con certeza el par de codificaciones implicado, te conviene usar directamente la pestaña de conversión manual.
Cómo usar el reparador de mojibake
- Pega el texto ilegible en la pestaña de reparación automática Copia el fragmento de texto ilegible y pégalo en el campo de la pestaña "Reparación automática". Todo el análisis ocurre en tu navegador, así que nada se envía a ningún servidor externo.
- Revisa los candidatos de reparación clasificados La herramienta muestra varias posibles combinaciones de codificación ordenadas por probabilidad. Busca la etiqueta "Mejor coincidencia": suele señalar directamente el resultado correcto.
- Si ningún candidato convence, prueba la conversión manual Cuando la lista automática no ofrezca un resultado claro, cambia a la pestaña "Conversión manual" e indica explícitamente en qué codificación aparece el texto y cuál crees que es la original.
- Si sigue sin poder repararse, vuelve al archivo original Si ningún par de codificaciones produce un resultado legible, es posible que los bytes ya se hayan perdido. Vuelve a abrir el archivo original en un editor de texto indicando expresamente la codificación correcta.
Consejos para aprovecharla mejor
- Cuando aparecen varios candidatos, el marcado como "Mejor coincidencia" —normalmente el japonés o ASCII con aspecto más natural— suele ser el correcto.
- El clásico patrón "縺薙繧薙?..." que aparece en correos y archivos CSV casi siempre se resuelve con el par UTF-8 → Shift_JIS.
- Si el texto se ha convertido en una serie de "?" o "�", es probable que se haya perdido parte de la secuencia de bytes original, lo que dificulta una recuperación completa a nivel de texto.
- Usa la pestaña "Conversión manual" para obtener el resultado en un solo paso cuando ya sepas qué par de codificaciones causó el problema.
Casos prácticos
Un CSV de un proveedor no se ve bien en la hoja de cálculo
Cuando una celda de un archivo CSV recibido de un socio comercial se muestra con símbolos extraños, pega aquí su contenido para comprobar el texto real antes de pedirle que lo reenvíe con otra codificación.
Recuperar un correo antiguo sin molestar al remitente
Si el asunto o el cuerpo de un correo enviado desde un cliente de correo antiguo llega ilegible, puedes intentar recuperarlo tú mismo aquí en lugar de pedirle al remitente que lo reenvíe.
Diagnosticar registros o bases de datos con codificación mixta
En sistemas donde la configuración de codificación cambió en algún momento, es habitual encontrar registros o entradas de base de datos con mojibake. Esta herramienta ayuda a identificar qué combinación de codificaciones los generó.
Experimentar con la pestaña manual para entender el fenómeno
Prueba distintas combinaciones en la pestaña manual para ver con tus propios ojos qué tipo de mojibake produce cada desajuste de codificación; es una forma práctica de entender por qué ocurre este problema.
Glosario
- UTF-8
- Codificación de caracteres Unicode de longitud variable y la más utilizada hoy en la web. Representa los caracteres japoneses con secuencias de 3 bytes, y es compatible con ASCII para los caracteres latinos básicos.
- Shift_JIS
- Codificación japonesa clásica, muy usada en versiones antiguas de Windows y en numerosos sistemas heredados japoneses. Representa la mayoría de caracteres japoneses con 2 bytes.
- EUC-JP
- Codificación de caracteres japoneses desarrollada para entornos Unix, todavía presente en sistemas más antiguos. Utiliza distintos rangos de bytes que Shift_JIS, por lo que confundirla con esta última suele producir mojibake grave.
- JIS (ISO-2022-JP)
- Codificación basada en secuencias de escape, tradicionalmente empleada en el correo electrónico japonés. A diferencia de Shift_JIS o EUC-JP, solo usa bytes de 7 bits, lo que la hace compatible con sistemas de correo antiguos.
- Codificación de caracteres
- El sistema de reglas que traduce cada carácter de texto a una secuencia concreta de bytes para almacenarlo o transmitirlo, y que permite reconstruirlo de vuelta al leerlo. Si el emisor y el receptor no usan la misma regla, el resultado es mojibake.
- Mojibake irreversible
- Caso en el que la secuencia de bytes original ya se perdió durante una decodificación incorrecta previa, normalmente visible como una serie de signos "?" o "�". Ninguna herramienta puede reconstruir el texto original a partir de esa cadena.
Preguntas frecuentes
A propósito — Por qué "縺薙繧薙?縺ォ縺。縺ッ" se convirtió en el rostro del mojibake japonés
Busca mojibake japonés y casi seguro te encontrarás con "縺薙繧薙?縺ォ縺。縺ッ" (que debería leerse "こんにちは," es decir, "hola") — se ha convertido en una especie de icono cultural entre los usuarios japoneses de internet. Es el resultado de manual de abrir texto UTF-8 en una aplicación que asume Shift_JIS, como una versión antigua del Bloc de notas de Windows o diversos sistemas heredados.
Este emparejamiento concreto aparece constantemente porque un decodificador Shift_JIS reinterpreta a la fuerza las secuencias de 3 bytes que UTF-8 usa para los caracteres japoneses como si fueran caracteres Shift_JIS de 2 bytes. Por casualidad, la mayoría de esas secuencias reinterpretadas caen dentro del rango de caracteres Shift_JIS válidos, así que no se produce ningún error: el texto simplemente parece ilegible mientras permanece, en secreto, totalmente recuperable. Esa propiedad es precisamente la razón por la que un reparador automático como este tiene tanto éxito.
En cambio, abrir texto Shift_JIS como si fuera EUC-JP suele producir secuencias de bytes no válidas que se descartan directamente, destruyendo información en el momento en que ocurre; la recuperación a nivel de cadena se vuelve entonces imposible en principio. Esta división entre mojibake "recuperable" y "no recuperable" explica en buena parte por qué los problemas de codificación de caracteres japoneses han frustrado silenciosamente a los ingenieros durante décadas.