Conversor e Reparador de Mojibake (Texto Corrompido)

Cole um texto corrompido (mojibake) e detecte na hora qual combinação de codificações o causou, com candidatos de reparo classificados. Também converte explicitamente entre UTF-8, Shift_JIS, EUC-JP e JIS (ISO-2022-JP) — grátis e sem cadastro.

O que é mojibake e por que ele acontece

Mojibake é o nome dado ao texto que aparece como uma sequência de símbolos sem sentido — como "縺薙繧薙?縺ォ縺。縺ッ" — quando a codificação de caracteres usada para salvar um arquivo não é a mesma que o programa usou para lê-lo depois. O conteúdo original nunca muda; o que muda é a "chave de leitura" aplicada aos bytes armazenados. Em japonês, esse problema é particularmente frequente porque três codificações diferentes (UTF-8, Shift_JIS e EUC-JP) continuam circulando lado a lado em sistemas antigos e novos, e basta um e-mail, uma exportação de planilha ou um arquivo salvo em outro sistema operacional para que a combinação errada seja aplicada.

Esta ferramenta testa, do lado do seu navegador, as combinações mais prováveis entre essas codificações e ordena os resultados por quão parecido com japonês ou ASCII legível cada um ficou. Vale lembrar, porém, que nem todo mojibake pode ser desfeito: quando os bytes originais já foram descartados durante a primeira leitura incorreta, o texto se transforma em uma sequência de "?" ou "�", e nesse ponto a informação original já se perdeu — não há como reconstruí-la a partir apenas da string resultante. Se você já sabe qual par de codificações causou o problema, a aba de conversão manual costuma resolver o caso em uma única etapa.

Como usar o reparador de mojibake

  1. Cole o texto corrompido na aba de reparo automático Cole o trecho ilegível no campo de texto. Tudo é processado no seu próprio navegador, então nenhum dado é enviado a servidores externos.
  2. Analise os candidatos de reparo classificados A ferramenta lista os resultados prováveis em ordem de legibilidade. Procure o selo "Melhor correspondência", que costuma indicar o texto correto na maioria dos casos.
  3. Se nenhum candidato convencer, use a conversão manual Vá até a aba "Conversão manual" e selecione explicitamente a codificação em que o texto aparece hoje e a codificação original que você presume ser a real.
  4. Se ainda assim não for possível recuperar, volte ao arquivo original Reabra o arquivo de origem em um editor de texto, especificando manualmente a codificação correta no momento da abertura, antes que o conteúdo seja salvo novamente de forma corrompida.

Dicas para aproveitar melhor

  • Quando vários candidatos aparecem, o marcado como "Melhor correspondência" — geralmente o japonês ou ASCII com aparência mais natural — costuma ser o correto.
  • O padrão clássico "縺薙繧薙?..." visto em e-mails e arquivos CSV quase sempre se resolve com o par UTF-8 → Shift_JIS.
  • Se o texto virou uma sequência de "?" ou "�", é provável que parte da sequência de bytes original tenha se perdido, dificultando uma recuperação completa em nível de texto.
  • Use a aba "Conversão manual" para obter o resultado em uma única etapa quando você já souber qual par de codificações causou o problema.

Quando esta ferramenta é útil

Um CSV de um parceiro comercial não abre corretamente na planilha

Antes de pedir que reenviem o arquivo, cole aqui o conteúdo de uma célula corrompida para conferir qual era o texto original e economizar uma rodada de e-mails.

Um e-mail antigo chegou com o assunto ou o corpo ilegível

Mensagens vindas de clientes de e-mail antigos às vezes salvam a codificação errada. Recupere o conteúdo aqui mesmo, sem precisar incomodar quem enviou.

Logs ou registros de banco de dados com codificação inconsistente

Quando a configuração de codificação de um sistema muda ao longo do tempo, registros antigos podem aparecer corrompidos nas consultas atuais. Use a ferramenta para conferir o conteúdo real desses trechos.

Entender na prática qual erro de codificação produz qual tipo de mojibake

A aba manual permite experimentar livremente cada combinação de "aparece como" e "é na verdade", o que ajuda a reconhecer de cabeça o padrão visual de cada tipo de corrupção no futuro.

Glossário de codificações

UTF-8
Codificação Unicode de largura variável (1 a 4 bytes por caractere) e hoje o padrão dominante na web, em sistemas operacionais modernos e em praticamente todo software novo.
Shift_JIS
Codificação japonesa mais antiga, de largura variável (1 ou 2 bytes), amplamente usada em versões antigas do Windows japonês e ainda presente em muitos sistemas legados e arquivos salvos há anos.
EUC-JP
Codificação japonesa historicamente associada a sistemas Unix e Linux, também de largura variável, comum em servidores antigos e em alguns bancos de dados mais antigos.
JIS (ISO-2022-JP)
Codificação baseada apenas em caracteres de 7 bits, criada para trafegar com segurança por sistemas de e-mail antigos que só suportavam esse intervalo; ainda aparece ocasionalmente em cabeçalhos de mensagens mais antigas.
Codificação de caracteres
A regra que traduz cada caractere de texto em uma sequência específica de bytes para armazenamento ou transmissão, e que precisa ser a mesma tanto na gravação quanto na leitura para o texto aparecer correto.
Mojibake irreversível
Caso em que os bytes originais já foram descartados durante uma primeira decodificação incorreta, restando apenas marcadores como "?" ou "�" no lugar dos caracteres — nessa situação, nenhuma ferramenta consegue reconstruir o texto original a partir da string.

Perguntas frequentes

Acontece quando a codificação usada para salvar um texto difere da codificação que o leitor assume ao exibi-lo. O japonês é especialmente propenso a isso porque UTF-8, Shift_JIS e EUC-JP ainda estão todas em uso, e divergências entre elas são a principal causa do mojibake.

Não. Dependendo do tipo de divergência, parte da sequência de bytes original pode se perder permanentemente durante a decodificação (incorreta) inicial, tornando impossível a recuperação completa apenas a partir da string. Isso é especialmente verdade quando uma codificação japonesa multibyte é lida erroneamente como outra; texto transformado em "?" ou "�" geralmente não pode ser restaurado.

UTF-8 é a codificação dominante hoje, mas alguns sistemas japoneses antigos e aplicativos legados do Windows ainda assumem Shift_JIS. Como as sequências de bytes UTF-8 para caracteres japoneses frequentemente também acabam sendo sequências válidas em Shift_JIS, nenhuma informação se perde no processo — exatamente por isso essa divergência específica geralmente pode ser revertida.

Não. Toda a conversão é executada localmente no JavaScript do seu navegador, então é seguro usar até mesmo com texto contendo senhas ou informações pessoais.
Tool-kun

Curiosidade — Por que "縺薙繧薙?縺ォ縺。縺ッ" se tornou o rosto do mojibake japonês

Procure por mojibake japonês e você quase certamente encontrará "縺薙繧薙?縺ォ縺。縺ッ" (que deveria ser lido como "こんにちは," ou seja, "olá") — tornou-se uma espécie de ícone cultural entre os usuários japoneses da internet. É o resultado clássico de abrir texto UTF-8 em um aplicativo que assume Shift_JIS, como uma versão antiga do Bloco de Notas do Windows ou vários sistemas legados.

Esse par específico aparece constantemente porque um decodificador Shift_JIS reinterpreta forçadamente as sequências de 3 bytes que o UTF-8 usa para caracteres japoneses como se fossem caracteres Shift_JIS de 2 bytes. Por coincidência, a maioria dessas sequências reinterpretadas cai dentro do intervalo de caracteres Shift_JIS válidos, então nenhum erro ocorre — o texto apenas parece corrompido enquanto permanece, secretamente, totalmente recuperável. Essa propriedade é exatamente o motivo pelo qual um reparador automático como este tem tanto sucesso.

Por outro lado, abrir texto Shift_JIS como se fosse EUC-JP tende a produzir sequências de bytes inválidas que são descartadas de imediato, destruindo informação no momento em que isso ocorre — a recuperação em nível de string se torna então impossível em princípio. Essa divisão entre mojibake "recuperável" e "irrecuperável" explica boa parte de por que os problemas de codificação de caracteres japoneses frustram silenciosamente engenheiros há décadas.