Conversor de codificação de arquivos (UTF-8 com BOM, Shift_JIS)
Converta a codificação de um arquivo CSV ou de texto. Adicione um BOM para o Excel abrir UTF-8 corretamente, ou converta para Shift_JIS. Tudo no seu navegador.
Configurações recomendadas por finalidade
A codificação certa depende de quem recebe o arquivo. Use como referência.
| O que você quer fazer | Configuração recomendada |
|---|---|
| Abrir um CSV UTF-8 diretamente no Excel | UTF-8 com BOM |
| Importar em um sistema de gestão antigo | Shift_JIS com CRLF |
| Ler o arquivo em um programa | UTF-8 sem BOM e LF |
| Abrir no Excel para Mac | UTF-8 com BOM |
| Importar no Google Sheets | UTF-8, com ou sem BOM |
| Preparar texto para um cliente de e-mail antigo | ISO-2022-JP (JIS) |
As codificações em resumo
O que esta ferramenta aceita e a que prestar atenção.
| Codificação | Observações |
|---|---|
| UTF-8 | O padrão atual; abrange todos os alfabetos e os emojis. |
| UTF-8 com BOM | Três bytes iniciais para que o Excel não erre a codificação. |
| Shift_JIS | Muito usada no Windows em japonês. Não representa emojis nem alguns kanji variantes. |
| EUC-JP | Codificação japonesa usada principalmente em sistemas UNIX. |
| ISO-2022-JP (JIS) | A codificação do e-mail japonês. Não representa katakana de meia largura. |
Dicas
- Se o arquivo só precisa abrir no Excel, UTF-8 com BOM é a opção mais segura: nenhum caractere é perdido.
- Ao converter para Shift_JIS, os caracteres que não podem ser representados viram «?». A ferramenta lista antes quais seriam perdidos.
- Não adicione BOM a arquivos que um programa vai ler: ele costuma acabar dentro do nome da primeira coluna.
Perguntas frequentes
Curiosidade — O que o texto ilegível revela
Texto ilegível tem padrões reconhecíveis. Sequências de kanji sem relação surgem quando bytes UTF-8 são lidos como Shift_JIS: um caractere japonês ocupa três bytes em UTF-8, então relê-los de dois em dois produz caracteres totalmente diferentes. O erro inverso gera fileiras de caracteres de substituição, porque as sequências de bytes são inválidas.
O BOM foi criado para o UTF-16, onde indica a ordem dos bytes. O UTF-8 não tem essa ambiguidade e o padrão Unicode recomenda não usá-lo, mas ele sobrevive no mundo Windows porque aplicativos que só conseguem adivinhar a codificação precisavam de uma marca explícita.