Convertisseur d'encodage de fichiers (UTF-8 avec BOM, Shift_JIS)
Convertissez l'encodage d'un fichier CSV ou texte. Ajoutez un BOM pour qu'Excel ouvre l'UTF-8 correctement, ou convertissez en Shift_JIS. Tout se passe dans votre navigateur.
Réglages recommandés selon l'usage
L'encodage approprié dépend du destinataire. À utiliser comme repère.
| Ce que vous voulez faire | Réglage recommandé |
|---|---|
| Ouvrir un CSV UTF-8 directement dans Excel | UTF-8 avec BOM |
| Importer dans un logiciel de gestion ancien | Shift_JIS avec CRLF |
| Lire le fichier depuis un programme | UTF-8 sans BOM et LF |
| Ouvrir dans Excel pour Mac | UTF-8 avec BOM |
| Importer dans Google Sheets | UTF-8, BOM facultatif |
| Préparer un texte pour un client de messagerie ancien | ISO-2022-JP (JIS) |
Les encodages en bref
Ce que cet outil prend en charge et les points de vigilance.
| Encodage | Remarques |
|---|---|
| UTF-8 | La norme actuelle ; couvre toutes les écritures et les émojis. |
| UTF-8 avec BOM | Trois octets de marquage au début pour qu'Excel ne se trompe pas d'encodage. |
| Shift_JIS | Longtemps utilisé sur Windows japonais. Ne gère ni les émojis ni certains kanji variants. |
| EUC-JP | Encodage japonais surtout utilisé sur les systèmes UNIX. |
| ISO-2022-JP (JIS) | L'encodage du courrier japonais. Ne gère pas les katakana demi-largeur. |
Astuces
- Si le fichier doit seulement s'ouvrir dans Excel, UTF-8 avec BOM est le choix le plus sûr : aucun caractère n'est perdu.
- La conversion en Shift_JIS remplace par « ? » les caractères non représentables. L'outil les énumère au préalable.
- N'ajoutez pas de BOM aux fichiers lus par un programme : il finit généralement dans le nom de la première colonne.
Questions fréquentes
Anecdote — Ce que révèle un texte illisible
Un texte illisible suit des motifs reconnaissables. Les suites de kanji sans rapport apparaissent quand des octets UTF-8 sont lus comme du Shift_JIS : un caractère japonais occupe trois octets en UTF-8, les relire deux par deux produit donc des caractères entièrement différents. L'erreur inverse donne des rangées de caractères de remplacement, les séquences d'octets étant invalides.
Le BOM a été inventé pour UTF-16, où il indique l'ordre des octets. UTF-8 n'a pas cette ambiguïté et la norme Unicode déconseille d'en mettre ; il a néanmoins survécu dans le monde Windows, car les applications qui ne peuvent que deviner l'encodage avaient besoin d'un marqueur explicite.