UTILS.
100% nel browser
🔤

Ispettore di caratteri Unicode

Scomponi qualsiasi stringa in code point e mostra per ognuno l'esadecimale U+, categoria, blocco, byte UTF-8/UTF-16, entità HTML, escape JS, percent-encoding e flag.

Inserisci testo sopra per ispezionare ogni carattere.

Informazioni su questo strumento

L'Ispettore di caratteri Unicode divide una stringa nei suoi singoli code point e mostra tutto su ciascuno. Itera per code point (non per unità a 16 bit), così i caratteri astrali e le emoji composte da coppie surrogate vengono gestiti correttamente. Per ogni code point ottieni il glifo, il suo valore esadecimale U+XXXX, il valore decimale, un nome per i caratteri ben noti, la categoria generale e il blocco Unicode a cui appartiene.

Tutta l'analisi è derivata algoritmicamente nel tuo browser e nulla viene caricato. Le codifiche vengono calcolate da principi primi: i byte UTF-8 seguono le regole di codifica da 1 a 4 byte, le unità di codice UTF-16 sono una singola unità nel BMP o una coppia surrogata alta/bassa (D800–DBFF / DC00–DFFF) al di sopra, l'entità numerica HTML è &#nnnn;, l'escape JavaScript è \uXXXX per il BMP o \u{XXXXX} per i code point astrali, e il percent-encoding sono i byte UTF-8 scritti come %XX. La categoria generale (Lu, Ll, Nd, Mn, Zs, Cc, e così via) viene rilevata con espressioni regolari di property-escape Unicode.

L'ispettore segnala i caratteri che spesso causano bug o sono usati per nascondere testo: caratteri a larghezza zero (200B–200D, 2060, FEFF), controlli bidirezionali (200E, 200F, 202A–202E, 2066–2069), segni combinanti e caratteri di controllo C0/C1 — questi vengono mostrati come un punto così il contenuto invisibile diventa visibile. Una riga di riepilogo riporta il conteggio dei code point, la lunghezza UTF-16 (String.length) e il conteggio totale di byte UTF-8. Questo strumento serve per l'ispezione; per normalizzare tra NFC e NFD usa il normalizzatore Unicode. Copia la scomposizione completa come testo separato da tabulazioni.

Domande frequenti

Perché un'emoji conta come una voce ma ha lunghezza 2?
Molte emoji e tutti i caratteri sopra U+FFFF sono singoli code point codificati in UTF-16 come una coppia surrogata — due unità a 16 bit. L'ispettore itera per code point, quindi mostra una riga, mentre String.length di JavaScript conta le due unità, che il riepilogo riporta separatamente.
Come vengono derivati i byte UTF-8 e UTF-16?
Vengono calcolati direttamente dal code point: UTF-8 usa le regole standard da 1 a 4 byte, e UTF-16 è un'unità per i caratteri BMP o una coppia surrogata alta+bassa (D800–DBFF poi DC00–DFFF) per quelli astrali. Il percent-encoding è semplicemente quei byte UTF-8 come %XX.
Cosa significano i flag?
Evidenziano i caratteri facili da non notare: a larghezza zero (200B–200D, 2060, FEFF), controlli bidirezionali che possono riordinare il testo, segni combinanti che si attaccano a una lettera precedente e caratteri di controllo. Tali caratteri vengono visualizzati come un punto centrale così il contenuto nascosto o invisibile viene rivelato.
Mostra il nome ufficiale del carattere Unicode?
Nomina i caratteri ben noti (codici di controllo, spazi, controlli a larghezza zero e bidi) e mostra sempre il blocco Unicode e la categoria generale per ogni code point. I nomi completi per carattere dal database Unicode non sono inclusi, quindi il nome del blocco serve altrimenti come descrittore.

Altri strumenti