Conversor de codificação de arquivos (UTF-8 com BOM, Shift_JIS)
Converta a codificação de um arquivo CSV ou de texto. Adicione um BOM para o Excel abrir UTF-8 corretamente, ou converta para Shift_JIS. Tudo no seu navegador.
Configurações recomendadas por finalidade
A codificação certa depende de quem recebe o arquivo. Use como referência.
| O que você quer fazer | Configuração recomendada |
|---|---|
| Abrir um CSV UTF-8 diretamente no Excel | UTF-8 com BOM |
| Importar em um sistema de gestão antigo | Shift_JIS com CRLF |
| Ler o arquivo em um programa | UTF-8 sem BOM e LF |
| Abrir no Excel para Mac | UTF-8 com BOM |
| Importar no Google Sheets | UTF-8, com ou sem BOM |
| Preparar texto para um cliente de e-mail antigo | ISO-2022-JP (JIS) |
As codificações em resumo
O que esta ferramenta aceita e a que prestar atenção.
| Codificação | Observações |
|---|---|
| UTF-8 | O padrão atual; abrange todos os alfabetos e os emojis. |
| UTF-8 com BOM | Três bytes iniciais para que o Excel não erre a codificação. |
| Shift_JIS | Muito usada no Windows em japonês. Não representa emojis nem alguns kanji variantes. |
| EUC-JP | Codificação japonesa usada principalmente em sistemas UNIX. |
| ISO-2022-JP (JIS) | A codificação do e-mail japonês. Não representa katakana de meia largura. |
Por que arquivos CSV aparecem com caracteres ilegíveis
Quando os caracteres se desmancham ao abrir um CSV no Excel, a causa é quase sempre uma incompatibilidade entre a codificação do arquivo e a que o Excel presume. Se o CSV não traz nenhuma marca, o Excel no Windows supõe que o conteúdo está na codificação histórica local — em ambiente japonês, o Shift_JIS. Mas hoje serviços web e programas gravam CSV quase sempre em UTF-8, e ler uma sequência de bytes UTF-8 como Shift_JIS produz cadeias desmanchadas como «譁�蟄怜喧縺�».
Há duas soluções. Uma é converter o arquivo para Shift_JIS; a outra é deixá-lo em UTF-8 e acrescentar no início um BOM (Byte Order Mark, uma marca de 3 bytes). Com BOM, o Excel reconhece «isto é UTF-8» e os caracteres ilegíveis desaparecem sem mexer no conteúdo. Esta ferramenta atende às duas conversões e determina automaticamente a codificação do arquivo de origem. Todo o processamento ocorre no navegador: o arquivo nunca é enviado a um servidor.
Como usar a conversão de codificação
- Escolha o arquivo Arraste e solte um arquivo CSV ou de texto, ou clique para selecioná-lo. Ao ler, a codificação e o fim de linha são determinados automaticamente.
- Confira a detecção na pré-visualização Se os caracteres se leem bem na pré-visualização, a detecção deu certo. Se aparecerem desmanchados, talvez você tenha escolhido algo que não é um arquivo de texto.
- Escolha a codificação de destino Para abrir no Excel, «UTF-8» mais «acrescentar BOM»; para importar num sistema de gestão antigo, «Shift_JIS».
- Baixe Pressione «Converter e baixar» e o arquivo é salvo com um sufixo de codificação acrescentado ao nome original (_utf8bom, _sjis e assim por diante).
Dicas para aproveitar melhor
- Se o arquivo só precisa abrir no Excel, UTF-8 com BOM é a opção mais segura: nenhum caractere é perdido.
- Ao converter para Shift_JIS, os caracteres que não podem ser representados viram «?». A ferramenta lista antes quais seriam perdidos.
- Não adicione BOM a arquivos que um programa vai ler: ele costuma acabar dentro do nome da primeira coluna.
Quando isso é necessário
Um CSV exportado de um serviço web sai ilegível no Excel
Muitos serviços exportam dados de vendas ou listas de associados em UTF-8; abertos direto no Excel, os caracteres se desmancham. Basta acrescentar um BOM.
Não é possível importar num software contábil ou de folha de pagamento
Sistemas de gestão antigos às vezes só aceitam CSV em Shift_JIS. Converta o arquivo UTF-8 para Shift_JIS para que a importação funcione.
Ao ler por programa um CSV com BOM, a primeira coluna sai errada
O BOM são três bytes invisíveis e, lendo como está, ele se infiltra no primeiro nome de campo. Converter para UTF-8 sem BOM resolve.
Fins de linha diferentes (CRLF/LF) fazem tudo parecer uma única linha
Um arquivo criado no Mac com LF pode aparecer como uma única linha num aplicativo antigo do Windows, porque as quebras são ignoradas. Converter para CRLF antes de entregá-lo resolve. Ao contrário, um arquivo CRLF criado no Windows deixa um ^M no fim da linha nos comandos Unix: nesse caso converta para LF.
Ver o conteúdo de um arquivo ilegível
Como a codificação é detectada automaticamente e o arquivo relido corretamente, você pode ver na pré-visualização o conteúdo de um arquivo que não abria de forma legível.
Termos de codificação de caracteres
- Codificação de caracteres
- A regra que associa os caracteres às sequências de bytes no computador. Se a regra diferir entre a gravação e a leitura, surgem caracteres ilegíveis.
- BOM
- Sigla de Byte Order Mark, uma marca de 3 bytes (EF BB BF) posta no início do arquivo. Ela informa aos aplicativos que se trata de UTF-8, mas na leitura por programa pode ser tratada como um caractere sobrando.
- Fim de linha
- Os bytes que assinalam o fim de uma linha. O Windows usa CRLF (2 bytes), Mac e Linux usam LF (1 byte): ao passar de um sistema a outro, tudo pode parecer uma única linha ou surgirem linhas a mais.
- Shift_JIS
- Uma codificação por muitos anos bastante difundida no ambiente Windows japonês. Cobre menos caracteres que o UTF-8 e não consegue representar emojis nem algumas variantes de caractere.
- Caracteres ilegíveis (mojibake)
- O estado em que, após a leitura com a codificação errada, se alinham caracteres sem sentido. Uma sequência como «譁�蟄怜喧» é o caso típico de UTF-8 lido como Shift_JIS.
Perguntas frequentes
Curiosidade — O que o texto ilegível revela
Texto ilegível tem padrões reconhecíveis. Sequências de kanji sem relação surgem quando bytes UTF-8 são lidos como Shift_JIS: um caractere japonês ocupa três bytes em UTF-8, então relê-los de dois em dois produz caracteres totalmente diferentes. O erro inverso gera fileiras de caracteres de substituição, porque as sequências de bytes são inválidas.
O BOM foi criado para o UTF-16, onde indica a ordem dos bytes. O UTF-8 não tem essa ambiguidade e o padrão Unicode recomenda não usá-lo, mas ele sobrevive no mundo Windows porque aplicativos que só conseguem adivinhar a codificação precisavam de uma marca explícita.