UTILS.
100% in de browser
🔤

Unicode-teken-inspecteur

Splits elke string in code points en toon van elk de U+ hex, categorie, blok, UTF-8/UTF-16-bytes, HTML-entiteit, JS-escape, percent-codering en vlaggen.

Voer hierboven tekst in om elk teken te inspecteren.

Over deze tool

De Unicode-teken-inspecteur splitst een string in zijn afzonderlijke code points en toont alles over elk. Het itereert per code point (niet per 16-bit unit), dus astrale tekens en emoji die uit surrogaatparen bestaan, worden correct behandeld. Voor elk code point krijg je de glyph, de U+XXXX hex-waarde, de decimale waarde, een naam voor bekende tekens, de algemene categorie, en het Unicode-blok waartoe het behoort.

Alle analyse wordt algoritmisch afgeleid in je browser en er wordt niets geüpload. De coderingen worden vanaf de basis berekend: de UTF-8-bytes volgen de 1-tot-4-byte-coderingsregels, de UTF-16 code units zijn een enkele unit in de BMP of een hoog/laag surrogaatpaar (D800–DBFF / DC00–DFFF) daarboven, de numerieke HTML-entiteit is &#nnnn;, de JavaScript-escape is \uXXXX voor de BMP of \u{XXXXX} voor astrale code points, en de percent-codering is de UTF-8-bytes geschreven als %XX. De algemene categorie (Lu, Ll, Nd, Mn, Zs, Cc, enzovoort) wordt gedetecteerd met reguliere expressies met Unicode-property-escapes.

De inspecteur markeert tekens die vaak bugs veroorzaken of gebruikt worden om tekst te verbergen: zero-width-tekens (200B–200D, 2060, FEFF), bidirectionele controls (200E, 200F, 202A–202E, 2066–2069), combining marks, en C0/C1-controltekens — deze worden als een punt getoond zodat onzichtbare inhoud zichtbaar wordt. Een samenvattingsregel rapporteert het aantal code points, de UTF-16-lengte (String.length), en het totale UTF-8-byte-aantal. Deze tool is voor inspectie; gebruik de Unicode-normalizer om tussen NFC en NFD te normaliseren. Kopieer de volledige uitsplitsing als tab-gescheiden tekst.

Veelgestelde vragen

Waarom telt een emoji als één vermelding maar lengte 2?
Veel emoji en alle tekens boven U+FFFF zijn enkele code points, in UTF-16 gecodeerd als een surrogaatpaar — twee 16-bit units. De inspecteur itereert per code point, dus toont één rij, terwijl JavaScript's String.length de twee units telt, wat de samenvatting apart rapporteert.
Hoe worden de UTF-8- en UTF-16-bytes afgeleid?
Ze worden direct berekend uit het code point: UTF-8 gebruikt de standaard 1–4-byte-regels, en UTF-16 is één unit voor BMP-tekens of een hoog+laag surrogaatpaar (D800–DBFF dan DC00–DFFF) voor astrale. De percent-codering is simpelweg die UTF-8-bytes als %XX.
Wat betekenen de vlaggen?
Ze lichten makkelijk te missen tekens uit: zero-width (200B–200D, 2060, FEFF), bidirectionele controls die tekst kunnen herordenen, combining marks die aan een voorgaande letter hechten, en controltekens. Zulke tekens worden weergegeven als een middenpunt zodat verborgen of onzichtbare inhoud onthuld wordt.
Toont het de officiële Unicode-tekennaam?
Het benoemt bekende tekens (controlcodes, spaties, zero-width- en bidi-controls) en toont altijd het Unicode-blok en de algemene categorie voor elk code point. Volledige per-teken-namen uit de Unicode-database zijn niet meegeleverd, dus de bloknaam dient anders als beschrijver.

Meer tools