Conversor de codificação de arquivos (UTF-8 com BOM, Shift_JIS)

Converta a codificação de um arquivo CSV ou de texto. Adicione um BOM para o Excel abrir UTF-8 corretamente, ou converta para Shift_JIS. Tudo no seu navegador.

Configurações recomendadas por finalidade

A codificação certa depende de quem recebe o arquivo. Use como referência.

O que você quer fazer Configuração recomendada
Abrir um CSV UTF-8 diretamente no Excel UTF-8 com BOM
Importar em um sistema de gestão antigo Shift_JIS com CRLF
Ler o arquivo em um programa UTF-8 sem BOM e LF
Abrir no Excel para Mac UTF-8 com BOM
Importar no Google Sheets UTF-8, com ou sem BOM
Preparar texto para um cliente de e-mail antigo ISO-2022-JP (JIS)

As codificações em resumo

O que esta ferramenta aceita e a que prestar atenção.

Codificação Observações
UTF-8 O padrão atual; abrange todos os alfabetos e os emojis.
UTF-8 com BOM Três bytes iniciais para que o Excel não erre a codificação.
Shift_JIS Muito usada no Windows em japonês. Não representa emojis nem alguns kanji variantes.
EUC-JP Codificação japonesa usada principalmente em sistemas UNIX.
ISO-2022-JP (JIS) A codificação do e-mail japonês. Não representa katakana de meia largura.

Dicas

  • Se o arquivo só precisa abrir no Excel, UTF-8 com BOM é a opção mais segura: nenhum caractere é perdido.
  • Ao converter para Shift_JIS, os caracteres que não podem ser representados viram «?». A ferramenta lista antes quais seriam perdidos.
  • Não adicione BOM a arquivos que um programa vai ler: ele costuma acabar dentro do nome da primeira coluna.

Perguntas frequentes

Se o destino for o Excel, escolha UTF-8 com BOM: resolve o problema sem perder caracteres. Shift_JIS só é necessário quando o sistema receptor exige.

Três bytes (EF BB BF) no início do arquivo. Não aparecem como texto, mas aplicativos como o Excel os leem para identificar UTF-8.

Não. Detecção, conversão e download acontecem no seu navegador, portanto o conteúdo nunca sai do seu dispositivo.
Tool-kun

Curiosidade — O que o texto ilegível revela

Texto ilegível tem padrões reconhecíveis. Sequências de kanji sem relação surgem quando bytes UTF-8 são lidos como Shift_JIS: um caractere japonês ocupa três bytes em UTF-8, então relê-los de dois em dois produz caracteres totalmente diferentes. O erro inverso gera fileiras de caracteres de substituição, porque as sequências de bytes são inválidas.

O BOM foi criado para o UTF-16, onde indica a ordem dos bytes. O UTF-8 não tem essa ambiguidade e o padrão Unicode recomenda não usá-lo, mas ele sobrevive no mundo Windows porque aplicativos que só conseguem adivinhar a codificação precisavam de uma marca explícita.