Over deze tool
De Unicode-teken-inspecteur splitst een string in zijn afzonderlijke code points en toont alles over elk. Het itereert per code point (niet per 16-bit unit), dus astrale tekens en emoji die uit surrogaatparen bestaan, worden correct behandeld. Voor elk code point krijg je de glyph, de U+XXXX hex-waarde, de decimale waarde, een naam voor bekende tekens, de algemene categorie, en het Unicode-blok waartoe het behoort.
Alle analyse wordt algoritmisch afgeleid in je browser en er wordt niets geüpload. De coderingen worden vanaf de basis berekend: de UTF-8-bytes volgen de 1-tot-4-byte-coderingsregels, de UTF-16 code units zijn een enkele unit in de BMP of een hoog/laag surrogaatpaar (D800–DBFF / DC00–DFFF) daarboven, de numerieke HTML-entiteit is &#nnnn;, de JavaScript-escape is \uXXXX voor de BMP of \u{XXXXX} voor astrale code points, en de percent-codering is de UTF-8-bytes geschreven als %XX. De algemene categorie (Lu, Ll, Nd, Mn, Zs, Cc, enzovoort) wordt gedetecteerd met reguliere expressies met Unicode-property-escapes.
De inspecteur markeert tekens die vaak bugs veroorzaken of gebruikt worden om tekst te verbergen: zero-width-tekens (200B–200D, 2060, FEFF), bidirectionele controls (200E, 200F, 202A–202E, 2066–2069), combining marks, en C0/C1-controltekens — deze worden als een punt getoond zodat onzichtbare inhoud zichtbaar wordt. Een samenvattingsregel rapporteert het aantal code points, de UTF-16-lengte (String.length), en het totale UTF-8-byte-aantal. Deze tool is voor inspectie; gebruik de Unicode-normalizer om tussen NFC en NFD te normaliseren. Kopieer de volledige uitsplitsing als tab-gescheiden tekst.