Conversor e Reparador de Mojibake (Texto Corrompido)
Cole um texto corrompido (mojibake) e detecte na hora qual combinação de codificações o causou, com candidatos de reparo classificados. Também converte explicitamente entre UTF-8, Shift_JIS, EUC-JP e JIS (ISO-2022-JP) — grátis e sem cadastro.
O que é mojibake e por que ele acontece
Mojibake é o nome dado ao texto que aparece como uma sequência de símbolos sem sentido — como "縺薙繧薙?縺ォ縺。縺ッ" — quando a codificação de caracteres usada para salvar um arquivo não é a mesma que o programa usou para lê-lo depois. O conteúdo original nunca muda; o que muda é a "chave de leitura" aplicada aos bytes armazenados. Em japonês, esse problema é particularmente frequente porque três codificações diferentes (UTF-8, Shift_JIS e EUC-JP) continuam circulando lado a lado em sistemas antigos e novos, e basta um e-mail, uma exportação de planilha ou um arquivo salvo em outro sistema operacional para que a combinação errada seja aplicada.
Esta ferramenta testa, do lado do seu navegador, as combinações mais prováveis entre essas codificações e ordena os resultados por quão parecido com japonês ou ASCII legível cada um ficou. Vale lembrar, porém, que nem todo mojibake pode ser desfeito: quando os bytes originais já foram descartados durante a primeira leitura incorreta, o texto se transforma em uma sequência de "?" ou "�", e nesse ponto a informação original já se perdeu — não há como reconstruí-la a partir apenas da string resultante. Se você já sabe qual par de codificações causou o problema, a aba de conversão manual costuma resolver o caso em uma única etapa.
Como usar o reparador de mojibake
- Cole o texto corrompido na aba de reparo automático Cole o trecho ilegível no campo de texto. Tudo é processado no seu próprio navegador, então nenhum dado é enviado a servidores externos.
- Analise os candidatos de reparo classificados A ferramenta lista os resultados prováveis em ordem de legibilidade. Procure o selo "Melhor correspondência", que costuma indicar o texto correto na maioria dos casos.
- Se nenhum candidato convencer, use a conversão manual Vá até a aba "Conversão manual" e selecione explicitamente a codificação em que o texto aparece hoje e a codificação original que você presume ser a real.
- Se ainda assim não for possível recuperar, volte ao arquivo original Reabra o arquivo de origem em um editor de texto, especificando manualmente a codificação correta no momento da abertura, antes que o conteúdo seja salvo novamente de forma corrompida.
Dicas para aproveitar melhor
- Quando vários candidatos aparecem, o marcado como "Melhor correspondência" — geralmente o japonês ou ASCII com aparência mais natural — costuma ser o correto.
- O padrão clássico "縺薙繧薙?..." visto em e-mails e arquivos CSV quase sempre se resolve com o par UTF-8 → Shift_JIS.
- Se o texto virou uma sequência de "?" ou "�", é provável que parte da sequência de bytes original tenha se perdido, dificultando uma recuperação completa em nível de texto.
- Use a aba "Conversão manual" para obter o resultado em uma única etapa quando você já souber qual par de codificações causou o problema.
Quando esta ferramenta é útil
Um CSV de um parceiro comercial não abre corretamente na planilha
Antes de pedir que reenviem o arquivo, cole aqui o conteúdo de uma célula corrompida para conferir qual era o texto original e economizar uma rodada de e-mails.
Um e-mail antigo chegou com o assunto ou o corpo ilegível
Mensagens vindas de clientes de e-mail antigos às vezes salvam a codificação errada. Recupere o conteúdo aqui mesmo, sem precisar incomodar quem enviou.
Logs ou registros de banco de dados com codificação inconsistente
Quando a configuração de codificação de um sistema muda ao longo do tempo, registros antigos podem aparecer corrompidos nas consultas atuais. Use a ferramenta para conferir o conteúdo real desses trechos.
Entender na prática qual erro de codificação produz qual tipo de mojibake
A aba manual permite experimentar livremente cada combinação de "aparece como" e "é na verdade", o que ajuda a reconhecer de cabeça o padrão visual de cada tipo de corrupção no futuro.
Glossário de codificações
- UTF-8
- Codificação Unicode de largura variável (1 a 4 bytes por caractere) e hoje o padrão dominante na web, em sistemas operacionais modernos e em praticamente todo software novo.
- Shift_JIS
- Codificação japonesa mais antiga, de largura variável (1 ou 2 bytes), amplamente usada em versões antigas do Windows japonês e ainda presente em muitos sistemas legados e arquivos salvos há anos.
- EUC-JP
- Codificação japonesa historicamente associada a sistemas Unix e Linux, também de largura variável, comum em servidores antigos e em alguns bancos de dados mais antigos.
- JIS (ISO-2022-JP)
- Codificação baseada apenas em caracteres de 7 bits, criada para trafegar com segurança por sistemas de e-mail antigos que só suportavam esse intervalo; ainda aparece ocasionalmente em cabeçalhos de mensagens mais antigas.
- Codificação de caracteres
- A regra que traduz cada caractere de texto em uma sequência específica de bytes para armazenamento ou transmissão, e que precisa ser a mesma tanto na gravação quanto na leitura para o texto aparecer correto.
- Mojibake irreversível
- Caso em que os bytes originais já foram descartados durante uma primeira decodificação incorreta, restando apenas marcadores como "?" ou "�" no lugar dos caracteres — nessa situação, nenhuma ferramenta consegue reconstruir o texto original a partir da string.
Perguntas frequentes
Curiosidade — Por que "縺薙繧薙?縺ォ縺。縺ッ" se tornou o rosto do mojibake japonês
Procure por mojibake japonês e você quase certamente encontrará "縺薙繧薙?縺ォ縺。縺ッ" (que deveria ser lido como "こんにちは," ou seja, "olá") — tornou-se uma espécie de ícone cultural entre os usuários japoneses da internet. É o resultado clássico de abrir texto UTF-8 em um aplicativo que assume Shift_JIS, como uma versão antiga do Bloco de Notas do Windows ou vários sistemas legados.
Esse par específico aparece constantemente porque um decodificador Shift_JIS reinterpreta forçadamente as sequências de 3 bytes que o UTF-8 usa para caracteres japoneses como se fossem caracteres Shift_JIS de 2 bytes. Por coincidência, a maioria dessas sequências reinterpretadas cai dentro do intervalo de caracteres Shift_JIS válidos, então nenhum erro ocorre — o texto apenas parece corrompido enquanto permanece, secretamente, totalmente recuperável. Essa propriedade é exatamente o motivo pelo qual um reparador automático como este tem tanto sucesso.
Por outro lado, abrir texto Shift_JIS como se fosse EUC-JP tende a produzir sequências de bytes inválidas que são descartadas de imediato, destruindo informação no momento em que isso ocorre — a recuperação em nível de string se torna então impossível em princípio. Essa divisão entre mojibake "recuperável" e "irrecuperável" explica boa parte de por que os problemas de codificação de caracteres japoneses frustram silenciosamente engenheiros há décadas.