Convertitore di codifica dei file (UTF-8 con BOM, Shift_JIS)
Converta la codifica di un file CSV o di testo. Aggiunga un BOM perché Excel apra correttamente l'UTF-8, oppure converta in Shift_JIS. Tutto nel browser.
Impostazioni consigliate per ogni scopo
La codifica giusta dipende da chi riceve il file. Da usare come riferimento.
| Cosa vuole fare | Impostazione consigliata |
|---|---|
| Aprire un CSV UTF-8 direttamente in Excel | UTF-8 con BOM |
| Importare in un gestionale datato | Shift_JIS con CRLF |
| Leggere il file da un programma | UTF-8 senza BOM e LF |
| Aprire in Excel per Mac | UTF-8 con BOM |
| Importare in Fogli Google | UTF-8, BOM facoltativo |
| Preparare un testo per un client di posta datato | ISO-2022-JP (JIS) |
Le codifiche in breve
Che cosa supporta questo strumento e a cosa fare attenzione.
| Codifica | Note |
|---|---|
| UTF-8 | Lo standard attuale; copre tutti gli alfabeti e le emoji. |
| UTF-8 con BOM | Tre byte iniziali perché Excel non sbagli a indovinare la codifica. |
| Shift_JIS | Usata a lungo su Windows giapponese. Non rappresenta emoji né alcuni kanji varianti. |
| EUC-JP | Codifica giapponese usata soprattutto sui sistemi UNIX. |
| ISO-2022-JP (JIS) | La codifica della posta giapponese. Non rappresenta i katakana a mezza larghezza. |
Suggerimenti
- Se il file deve solo aprirsi in Excel, UTF-8 con BOM è la scelta più sicura: non si perde alcun carattere.
- La conversione in Shift_JIS sostituisce con «?» i caratteri non rappresentabili. Lo strumento li elenca prima.
- Non aggiunga il BOM ai file che verranno letti da un programma: finisce spesso nel nome della prima colonna.
Domande frequenti
Curiosità — Che cosa rivela un testo illeggibile
Il testo illeggibile segue schemi riconoscibili. Le sequenze di kanji senza relazione compaiono quando byte UTF-8 vengono letti come Shift_JIS: in UTF-8 un carattere giapponese occupa tre byte, rileggerli a coppie produce caratteri completamente diversi. L'errore opposto genera file di caratteri sostitutivi, perché le sequenze di byte non sono valide.
Il BOM è nato per UTF-16, dove indica l'ordine dei byte. UTF-8 non ha questa ambiguità e lo standard Unicode ne sconsiglia l'uso; è sopravvissuto nel mondo Windows perché le applicazioni che possono solo indovinare la codifica avevano bisogno di un contrassegno esplicito.