字元編碼轉換・亂碼自動修復
貼上亂碼文本,自動檢測導致亂碼的編碼組合並給出修復候選。同時支援在UTF-8・Shift_JIS・EUC-JP・JIS(ISO-2022-JP)之間進行明確指定的轉換。
使用提示
- 出現多個候選時,標有「最佳候選」標籤、看起來最自然的日文或ASCII文本通常就是正確答案。
- 郵件和CSV檔案中常見的「縺薙繧薙?...」這類亂碼,幾乎都能通過UTF-8→Shift_JIS的組合解決。
- 若文本變成連續的「?」或「�」,說明原始位元組序列可能已部分丟失,僅從字串層面很難完全還原。
- 如果已知導致亂碼的編碼組合,可在「手動指定轉換」標籤中一步完成轉換檢視結果。
常見問題
當儲存文本時使用的編碼與讀取方假定的編碼不一致時就會出現亂碼。日文尤其容易出現這種情況,因為UTF-8、Shift_JIS、EUC-JP三種編碼目前都在使用,彼此之間的假定不一致是亂碼的主要原因。
不能。根據亂碼型別的不同,原始位元組序列的部分資訊可能在最初的(錯誤)解碼過程中就已丟失,僅憑字串本身無法完全還原。尤其是當一種日文多位元組編碼被誤讀為另一種時,還原會非常困難,變成「?」或「�」的部分基本無法恢復。
目前最普及的編碼是UTF-8,但一些較舊的日本系統和部分傳統Windows應用程式仍然預設使用Shift_JIS。由於UTF-8中日文字元的位元組序列往往恰好也是有效的Shift_JIS位元組序列,因此資訊不會丟失,這正是這種特定錯配通常可以被還原的原因。
不會。所有轉換處理均在瀏覽器本地的JavaScript中完成,因此即使文本中包含密碼或個人資訊也可以安全使用。
閒話 ― 為什麼「縺薙繧薙?縺ォ縺。縺ッ」成了日文亂碼的代名詞
搜尋日文亂碼幾乎必定會遇到「縺薙繧薙?縺ォ縺。縺ッ」(本應顯示為「こんにちは」,即「你好」)這一字串,它在日本網民之間已經成為一種文化符號。這是將UTF-8編碼的文本在假定為Shift_JIS的應用程式(例如舊版Windows記事本或部分傳統系統)中開啟時出現的典型亂碼模式。
這種組合之所以如此常見,是因為Shift_JIS解碼器會強行將UTF-8中日文字元使用的3位元組序列,重新解釋為2位元組的Shift_JIS字元。碰巧大部分被重新解釋後的位元組序列恰好落在有效的Shift_JIS字元範圍內,因此不會報錯——文本看起來亂碼,實際上卻完全可以還原。正是這一特性,使得本工具這類自動修復能夠以較高機率成功。
相比之下,將Shift_JIS文本按EUC-JP開啟的組合,往往會產生無效位元組序列而被直接丟棄,資訊在那一瞬間就已損毀,從字串層面進行還原也就成為原理上不可能之事。日文字元編碼問題長期困擾工程師,正是因為「可還原的亂碼」與「不可還原的亂碼」長期混雜在一起。