Convertidor de codificación de archivos (UTF-8 con BOM, Shift_JIS)

Convierta la codificación de un archivo CSV o de texto. Añada un BOM para que Excel abra UTF-8 correctamente, o convierta a Shift_JIS. Todo en su navegador.

Ajustes recomendados según el uso

La codificación adecuada depende de quién reciba el archivo. Úselo como referencia.

Qué quiere hacer Ajuste recomendado
Abrir un CSV UTF-8 directamente en Excel UTF-8 con BOM
Importar en un sistema de gestión antiguo Shift_JIS con CRLF
Leer el archivo desde un programa UTF-8 sin BOM y LF
Abrir en Excel para Mac UTF-8 con BOM
Importar en Google Sheets UTF-8, con o sin BOM
Preparar texto para un cliente de correo antiguo ISO-2022-JP (JIS)

Las codificaciones en breve

Lo que admite esta herramienta y a qué prestar atención.

Codificación Notas
UTF-8 El estándar actual; cubre todos los alfabetos y los emojis.
UTF-8 con BOM Tres bytes iniciales para que Excel no adivine mal la codificación.
Shift_JIS Muy usada en Windows en japonés. No admite emojis ni algunos kanji variantes.
EUC-JP Codificación japonesa usada sobre todo en sistemas UNIX.
ISO-2022-JP (JIS) La codificación del correo japonés. No admite katakana de media anchura.

Por qué los archivos CSV salen con caracteres ilegibles

Cuando los caracteres se descomponen al abrir un CSV en Excel, la causa es casi siempre un desajuste entre la codificación del archivo y la que Excel presupone. Si el CSV no lleva ninguna marca, Excel en Windows supone que el contenido está en la codificación histórica local —en entorno japonés, Shift_JIS—. Pero hoy los servicios web y los programas escriben los CSV casi siempre en UTF-8, y leer una secuencia de bytes UTF-8 como Shift_JIS produce cadenas descompuestas como «譁�蟄怜喧縺�».

Hay dos soluciones. Una es convertir el archivo a Shift_JIS; la otra, dejarlo en UTF-8 y añadir al principio un BOM (Byte Order Mark, una marca de 3 bytes). Con BOM, Excel reconoce «esto es UTF-8» y los caracteres ilegibles desaparecen sin tocar el contenido. Esta herramienta admite ambas conversiones y determina automáticamente la codificación del archivo de origen. Todo el proceso ocurre en el navegador: el archivo nunca se envía a un servidor.

Cómo usar la conversión de codificación

  1. Elija el archivo Arrastre y suelte un archivo CSV o de texto, o haga clic para seleccionarlo. Al leerlo se determinan automáticamente la codificación y el fin de línea.
  2. Compruebe la detección en la previsualización Si los caracteres se leen bien en la previsualización, la detección ha funcionado. Si aparecen descompuestos, puede que haya elegido algo que no es un archivo de texto.
  3. Elija la codificación de destino Para abrirlo en Excel, «UTF-8» más «añadir BOM»; para importarlo en un sistema de gestión antiguo, «Shift_JIS».
  4. Descargue Pulse «Convertir y descargar» y el archivo se guarda con un sufijo de codificación añadido al nombre original (_utf8bom, _sjis, etc.).

Consejos para aprovecharla mejor

  • Si el archivo solo se va a abrir en Excel, UTF-8 con BOM es la opción más segura: no se pierde ningún carácter.
  • Al convertir a Shift_JIS, los caracteres que no se pueden representar se sustituyen por «?». La herramienta los enumera antes.
  • No añada un BOM a los archivos que vaya a leer un programa: suele acabar dentro del nombre de la primera columna.

Cuándo le hace falta

Un CSV exportado de un servicio web sale ilegible en Excel

Muchos servicios exportan datos de ventas o listas de socios en UTF-8; abiertos directamente en Excel, los caracteres se descomponen. Basta con añadir un BOM.

No se puede importar en un software contable o de nóminas

Los sistemas de gestión antiguos a veces solo aceptan CSV en Shift_JIS. Convierta el archivo UTF-8 a Shift_JIS para que la importación funcione.

Al leer por programa un CSV con BOM, la primera columna sale mal

El BOM son tres bytes invisibles y, si se lee tal cual, se cuela en el primer nombre de campo. Convertir a UTF-8 sin BOM lo resuelve.

Fines de línea distintos (CRLF/LF) hacen que todo parezca una sola línea

Un archivo creado en Mac con LF puede aparecer como una única línea en una aplicación antigua de Windows, porque los saltos se ignoran. Convertir a CRLF antes de entregarlo lo resuelve. Al contrario, un archivo CRLF creado en Windows deja un ^M al final de línea en los comandos Unix: en ese caso convierta a LF.

Ver el contenido de un archivo ilegible

Como la codificación se detecta automáticamente y el archivo se relee correctamente, puede ver en la previsualización el contenido de un archivo que no se abría de forma legible.

Términos de codificación de caracteres

Codificación de caracteres
La regla que hace corresponder los caracteres con las secuencias de bytes del ordenador. Si la regla difiere entre la escritura y la lectura, aparecen caracteres ilegibles.
BOM
Siglas de Byte Order Mark, una marca de 3 bytes (EF BB BF) situada al inicio del archivo. Indica a las aplicaciones que se trata de UTF-8, pero al leer por programa puede tratarse como un carácter sobrante.
Fin de línea
Los bytes que señalan el final de una línea. Windows usa CRLF (2 bytes), Mac y Linux LF (1 byte): al pasar de un sistema a otro, todo puede parecer una sola línea o surgir líneas de más.
Shift_JIS
Una codificación muy extendida durante años en el entorno Windows japonés. Cubre menos caracteres que UTF-8 y no puede representar emojis ni algunas variantes de carácter.
Caracteres ilegibles (mojibake)
El estado en que, tras leer con la codificación equivocada, se alinean caracteres sin sentido. Una secuencia como «譁�蟄怜喧» es el caso típico de UTF-8 leído como Shift_JIS.

Preguntas frecuentes

Si el destinatario es Excel, elija UTF-8 con BOM: evita el problema sin perder ningún carácter. Shift_JIS solo es necesario cuando el sistema receptor lo exige.

Tres bytes (EF BB BF) al principio del archivo. No se muestran como texto, pero aplicaciones como Excel los leen para identificar UTF-8.

No. La detección, la conversión y la descarga se realizan en su navegador, así que el contenido nunca sale de su dispositivo.
Tool-kun

A propósito — Lo que revela el texto ilegible

El texto ilegible tiene patrones reconocibles. Las cadenas de kanji sin relación aparecen cuando bytes UTF-8 se leen como Shift_JIS: un carácter japonés ocupa tres bytes en UTF-8, así que releerlos de dos en dos produce caracteres completamente distintos. El error contrario genera filas de caracteres de sustitución, porque las secuencias de bytes son inválidas.

El BOM se inventó para UTF-16, donde indica el orden de los bytes. UTF-8 no tiene esa ambigüedad y el estándar Unicode recomienda no usarlo, pero sobrevive en el mundo Windows porque las aplicaciones que solo pueden adivinar la codificación necesitaban una marca explícita.