乱码转换・自动修复工具|支持UTF-8/Shift_JIS/EUC-JP

只需粘贴乱码文本,即可自动检测导致乱码的编码组合并给出修复候选。同时支持在UTF-8・Shift_JIS・EUC-JP・JIS(ISO-2022-JP)之间进行明确指定的转换,免费使用、无需注册。

什么是乱码

乱码是指文本在保存时使用的字符编码,与之后读取或显示时假定的编码不一致,导致原本的文字被错误解读为一堆看不懂的符号。日文尤其容易中招,因为UTF-8、Shift_JIS、EUC-JP等多种编码至今仍在不同系统中并存,只要保存方与读取方假设不同,乱码就会出现。

本工具会自动穷举UTF-8・Shift_JIS・EUC-JP・JIS(ISO-2022-JP)之间的常见编码组合,并按修复结果中日文与ASCII可读字符的比例进行排序,帮你快速找到最可能正确的还原版本。但需要注意,并非所有乱码都可以修复:如果原始字节序列在最初的错误解码阶段就已丢失,画面上会出现连续的「?」或「�」,这种情况仅凭字符串本身无法逆向还原。如果你已经明确知道导致乱码的编码组合,也可以直接使用「手动指定转换」标签。

使用方法

  1. 将乱码文本粘贴到自动修复标签中 把出现乱码的文本原样粘贴到「乱码自动修复」标签的输入框。所有处理都在浏览器本地完成,不会发送到任何外部服务器。
  2. 查看排序后的修复候选 系统会列出多个可能的修复结果,注意查找标有「最佳候选」标签的那一项,它通常就是最接近原文的版本。
  3. 若无满意结果,改用手动指定转换 当自动修复没有给出理想候选时,切换到「手动指定转换」标签,明确选择「当前显示的乱码编码」与「原本的编码」再试一次。
  4. 仍无法修复时检查原始文件 如果两种方式都无法还原,问题可能出在原始文件本身。请返回原文件,用文本编辑器指定正确的编码重新打开。

用好本工具的小技巧

  • 出现多个候选时,标有「最佳候选」标签、看起来最自然的日文或ASCII文本通常就是正确答案。
  • 邮件和CSV文件中常见的「縺薙繧薙?...」这类乱码,几乎都能通过UTF-8→Shift_JIS的组合解决。
  • 若文本变成连续的「?」或「�」,说明原始字节序列可能已部分丢失,仅从字符串层面很难完全还原。
  • 如果已知导致乱码的编码组合,可在「手动指定转换」标签中一步完成转换查看结果。

适用场景

合作方发来的CSV在表格软件中显示异常

把出问题的单元格内容粘贴到这里,先确认真实文字内容,再决定是否需要请对方用其他编码重新发送文件。

旧邮件客户端导出的邮件主题或正文乱码

无需再联系发件人确认,直接把乱码内容粘贴进来即可尝试自行还原邮件的真实内容。

读取因编码设置变化而变成乱码的日志或数据库记录

系统迁移、版本升级等原因导致某段时期的日志或数据库字段编码发生漂移时,可用本工具逐条排查还原。

在手动标签中做实验,理解不同编码组合的乱码规律

通过手动指定「当前显示编码」与「原本编码」的各种组合,直观了解哪种误配会产生哪种乱码,加深对字符编码的理解。

术语解释

UTF-8
目前互联网上最主流的字符编码,可表示几乎所有语言的文字。日文字符通常占用3个字节,兼容性强,是网页和现代系统的事实标准。
Shift_JIS
日本本土长期使用的传统编码,常见于旧版Windows系统和部分历史悠久的日文软件。日文字符多为2字节,与UTF-8误配时是最常见的乱码来源之一。
EUC-JP
主要用于早期Unix・Linux系统的日文编码,常见于旧版服务器程序和日文数据库。与其他编码混淆时容易产生难以还原的乱码。
JIS (ISO-2022-JP)
一种通过特殊转义序列在纯ASCII环境中切换字符集的编码方式,历史上常用于日文电子邮件的正文传输,现在较少见但偶尔仍会遇到。
字符编码
将文字转换为计算机可存储的字节序列,以及反向解读这些字节序列的规则集合。保存与读取双方使用的规则不一致,就会产生乱码。
不可逆乱码
指原始字节序列在最初的错误解码阶段就已经丢失或损毁的乱码,表现为连续的「?」或「�」符号。这类乱码仅凭字符串本身无法逆向还原。

常见问题

当保存文本时使用的编码与读取方假定的编码不一致时就会出现乱码。日文尤其容易出现这种情况,因为UTF-8、Shift_JIS、EUC-JP三种编码目前都在使用,彼此之间的假定不一致是乱码的主要原因。

不能。根据乱码类型的不同,原始字节序列的部分信息可能在最初的(错误)解码过程中就已丢失,仅凭字符串本身无法完全还原。尤其是当一种日文多字节编码被误读为另一种时,还原会非常困难,变成「?」或「�」的部分基本无法恢复。

目前最普及的编码是UTF-8,但一些较旧的日本系统和部分传统Windows应用程序仍然默认使用Shift_JIS。由于UTF-8中日文字符的字节序列往往恰好也是有效的Shift_JIS字节序列,因此信息不会丢失,这正是这种特定错配通常可以被还原的原因。

不会。所有转换处理均在浏览器本地的JavaScript中完成,因此即使文本中包含密码或个人信息也可以安全使用。
工具君

闲话 ― 为什么「縺薙繧薙?縺ォ縺。縺ッ」成了日文乱码的代名词

搜索日文乱码几乎必定会遇到「縺薙繧薙?縺ォ縺。縺ッ」(本应显示为「こんにちは」,即「你好」)这一字符串,它在日本网民之间已经成为一种文化符号。这是将UTF-8编码的文本在假定为Shift_JIS的应用程序(例如旧版Windows记事本或部分传统系统)中打开时出现的典型乱码模式。

这种组合之所以如此常见,是因为Shift_JIS解码器会强行将UTF-8中日文字符使用的3字节序列,重新解释为2字节的Shift_JIS字符。碰巧大部分被重新解释后的字节序列恰好落在有效的Shift_JIS字符范围内,因此不会报错——文本看起来乱码,实际上却完全可以还原。正是这一特性,使得本工具这类自动修复能够以较高概率成功。

相比之下,将Shift_JIS文本按EUC-JP打开的组合,往往会产生无效字节序列而被直接丢弃,信息在那一瞬间就已损毁,从字符串层面进行还原也就成为原理上不可能之事。日文字符编码问题长期困扰工程师,正是因为「可还原的乱码」与「不可还原的乱码」长期混杂在一起。