Convertidor de codificación de archivos (UTF-8 con BOM, Shift_JIS)
Convierta la codificación de un archivo CSV o de texto. Añada un BOM para que Excel abra UTF-8 correctamente, o convierta a Shift_JIS. Todo en su navegador.
Ajustes recomendados según el uso
La codificación adecuada depende de quién reciba el archivo. Úselo como referencia.
| Qué quiere hacer | Ajuste recomendado |
|---|---|
| Abrir un CSV UTF-8 directamente en Excel | UTF-8 con BOM |
| Importar en un sistema de gestión antiguo | Shift_JIS con CRLF |
| Leer el archivo desde un programa | UTF-8 sin BOM y LF |
| Abrir en Excel para Mac | UTF-8 con BOM |
| Importar en Google Sheets | UTF-8, con o sin BOM |
| Preparar texto para un cliente de correo antiguo | ISO-2022-JP (JIS) |
Las codificaciones en breve
Lo que admite esta herramienta y a qué prestar atención.
| Codificación | Notas |
|---|---|
| UTF-8 | El estándar actual; cubre todos los alfabetos y los emojis. |
| UTF-8 con BOM | Tres bytes iniciales para que Excel no adivine mal la codificación. |
| Shift_JIS | Muy usada en Windows en japonés. No admite emojis ni algunos kanji variantes. |
| EUC-JP | Codificación japonesa usada sobre todo en sistemas UNIX. |
| ISO-2022-JP (JIS) | La codificación del correo japonés. No admite katakana de media anchura. |
Consejos
- Si el archivo solo se va a abrir en Excel, UTF-8 con BOM es la opción más segura: no se pierde ningún carácter.
- Al convertir a Shift_JIS, los caracteres que no se pueden representar se sustituyen por «?». La herramienta los enumera antes.
- No añada un BOM a los archivos que vaya a leer un programa: suele acabar dentro del nombre de la primera columna.
Preguntas frecuentes
A propósito — Lo que revela el texto ilegible
El texto ilegible tiene patrones reconocibles. Las cadenas de kanji sin relación aparecen cuando bytes UTF-8 se leen como Shift_JIS: un carácter japonés ocupa tres bytes en UTF-8, así que releerlos de dos en dos produce caracteres completamente distintos. El error contrario genera filas de caracteres de sustitución, porque las secuencias de bytes son inválidas.
El BOM se inventó para UTF-16, donde indica el orden de los bytes. UTF-8 no tiene esa ambigüedad y el estándar Unicode recomienda no usarlo, pero sobrevive en el mundo Windows porque las aplicaciones que solo pueden adivinar la codificación necesitaban una marca explícita.