Tabella delle codifiche Unicode

Strumento gratuito che, inserito un carattere, mette a confronto punto di codice Unicode, sequenza di byte UTF-8 e rappresentazioni protette per JavaScript, HTML, indirizzi web e fogli di stile. Tutto avviene nel navigatore.

Tabella delle codifiche dei caratteri più comuni

Carattere Punto di codice UTF-8 Note
A U+0041 41 Lettera maiuscola latina (ASCII, un byte)
0 U+0030 30 Cifra (ASCII, un byte)
U+0020 20 Spazio (ASCII, un byte)
! U+0021 21 Punto esclamativo (segno ASCII, un byte)
@ U+0040 40 Chiocciola (segno ASCII, un byte)
© U+00A9 C2 A9 Segno del diritto d'autore (supplemento Latin-1, due byte)
U+20AC E2 82 AC Simbolo dell'euro (tre byte)
U+2192 E2 86 92 Freccia a destra (segno direzionale, tre byte)
U+3042 E3 81 82 Sillabario giapponese hiragana (tre byte)
U+6F22 E6 BC A2 Ideogramma (unificazione CJK, tre byte)
U+D55C ED 95 9C Sillaba coreana hangul (tre byte)
😀 U+1F600 F0 9F 98 80 Faccina (fuori dal piano multilingue di base, quattro byte; in JavaScript una coppia surrogata)

Consigli per l'uso

  • Nel campo si può inserire più di un carattere: in tal caso i risultati compaiono in blocchi separati, uno per carattere.
  • Le faccine si trovano fuori dal piano multilingue di base di Unicode, cioè oltre U+FFFF, e nelle stringhe di JavaScript sono perciò rappresentate da due unità di codice, la coppia surrogata: è per questo che nella riga della notazione protetta per JavaScript compaiono due sequenze `\uXXXX`.
  • Nella notazione protetta per i fogli di stile si scrive l'esadecimale del punto di codice, come `\41`; se subito dopo segue un carattere interpretabile come cifra esadecimale, cioè da 0 a 9 o da a a f, conviene aggiungere in coda uno spazio come separatore.
  • I riferimenti HTML si possono scrivere in decimale, A, oppure in esadecimale, A: il navigatore li interpreta come lo stesso carattere.
  • Il pulsante di copia porta negli appunti il valore di ciascuna riga: comodo per incollarlo direttamente nel codice o in un foglio di stile.

Domande frequenti

Le stringhe di JavaScript sono rappresentate internamente in UTF-16 e una singola unità di codice copre soltanto sedici bit, da 0 a 65535. Unicode comprende però moltissimi punti di codice a partire da U+10000, dove ricade la maggior parte delle faccine: essi sono rappresentati dalla combinazione di due unità di codice particolari, il surrogato alto e quello basso. Estraendo i caratteri uno a uno con il metodo charCodeAt si ottengono separatamente i due valori: per ricavare il punto di codice corretto occorre usare codePointAt.

Il punto di codice Unicode, per esempio U+3042, è il numero che individua «quale carattere» sia. UTF-8 è invece una delle codifiche che permettono di conservare e trasmettere quel punto di codice come sequenza di byte. A parità di punto di codice, UTF-8 lo rappresenta con una lunghezza variabile da uno a quattro byte, mentre altre codifiche come UTF-16 o UTF-32 producono sequenze diverse.

Perché rappresenta i caratteri ASCII — lettere, cifre e segni fondamentali — con un solo byte, mantenendo un'elevata compatibilità con i sistemi anglofoni preesistenti, e insieme sa esprimere i caratteri di tutto il mondo. Nel 2026 la grande maggioranza dei testi in rete è codificata in UTF-8, che è anche la codifica raccomandata per l'HTML.

No, sono diversi. I riferimenti HTML si scrivono A in decimale oppure A in esadecimale, con il prefisso x, e valgono soltanto dentro un documento HTML. La notazione protetta dei fogli di stile si scrive invece `\41`, con il solo esadecimale, senza U+ né x, e si usa nei selettori e nei valori delle proprietà. Occorre scegliere la forma giusta secondo l'uso.
Tool-kun

A proposito — Unicode, che ha unificato codifiche fino ad allora disparate

Prima della comparsa di Unicode le codifiche dei caratteri variavano da paese a paese e da lingua a lingua. Per il solo giapponese convivevano Shift_JIS, EUC-JP, il codice JIS e altri ancora, e lo scambio di testi fra sistemi diversi produceva di continuo caratteri corrotti. La versione 1.0 di Unicode, pubblicata nel 1991, si proponeva di risolvere quella confusione assegnando un numero unico, il punto di codice, a ogni carattere del mondo.

Unicode e la norma internazionale ISO/IEC 10646 furono elaborati dapprima separatamente, ma in seguito i due progetti si coordinarono fino a condividere lo stesso repertorio di caratteri e le stesse assegnazioni. Oggi Unicode raccoglie oltre centocinquantamila caratteri, faccine comprese, e ogni anno una nuova versione ne aggiunge altri.

UTF-8 è una codifica progettata nel 1992 da Ken Thompson e Rob Pike: la sua idea rivoluzionaria fu di rappresentare tutti i caratteri Unicode conservando la piena compatibilità all'indietro con ASCII. Quella scelta si è rivelata vincente e le ha guadagnato la posizione di standard di fatto per la codifica dei documenti sul web.