UTILS.
100 % dans le navigateur
🔤

Inspecteur de caractères Unicode

Décomposez toute chaîne en points de code et affichez pour chacun son hexadécimal U+, sa catégorie, son bloc, ses octets UTF-8/UTF-16, son entité HTML, son échappement JS, son encodage pourcent et ses drapeaux.

Saisissez du texte ci-dessus pour inspecter chaque caractère.

À propos de cet outil

L'inspecteur de caractères Unicode divise une chaîne en ses points de code individuels et affiche tout à propos de chacun. Il itère par point de code (et non par unité de 16 bits), de sorte que les caractères astraux et les émojis composés de paires de substitution sont gérés correctement. Pour chaque point de code, vous obtenez le glyphe, sa valeur hexadécimale U+XXXX, la valeur décimale, un nom pour les caractères bien connus, la catégorie générale, et le bloc Unicode auquel il appartient.

Toute l'analyse est dérivée algorithmiquement dans votre navigateur et rien n'est téléversé. Les encodages sont calculés à partir de principes premiers : les octets UTF-8 suivent les règles d'encodage de 1 à 4 octets, les unités de code UTF-16 sont une seule unité dans le BMP ou une paire de substitution haute/basse (D800–DBFF / DC00–DFFF) au-delà, l'entité numérique HTML est &#nnnn;, l'échappement JavaScript est \uXXXX pour le BMP ou \u{XXXXX} pour les points de code astraux, et l'encodage pourcent correspond aux octets UTF-8 écrits en %XX. La catégorie générale (Lu, Ll, Nd, Mn, Zs, Cc, etc.) est détectée avec des expressions régulières à échappement de propriété Unicode.

L'inspecteur signale les caractères qui causent souvent des bugs ou servent à masquer du texte : les caractères de largeur nulle (200B–200D, 2060, FEFF), les contrôles bidirectionnels (200E, 200F, 202A–202E, 2066–2069), les marques combinantes, et les caractères de contrôle C0/C1 — ils sont affichés sous forme de point afin que le contenu invisible devienne visible. Une ligne de résumé rapporte le nombre de points de code, la longueur UTF-16 (String.length), et le nombre total d'octets UTF-8. Cet outil sert à l'inspection ; pour normaliser entre NFC et NFD, utilisez le normaliseur Unicode. Copiez la décomposition complète sous forme de texte séparé par des tabulations.

Foire aux questions

Pourquoi un émoji compte-t-il pour une entrée mais une longueur de 2 ?
De nombreux émojis et tous les caractères au-dessus de U+FFFF sont des points de code uniques encodés en UTF-16 comme une paire de substitution — deux unités de 16 bits. L'inspecteur itère par point de code, il affiche donc une ligne, tandis que String.length de JavaScript compte les deux unités, ce que le résumé rapporte séparément.
Comment les octets UTF-8 et UTF-16 sont-ils dérivés ?
Ils sont calculés directement à partir du point de code : UTF-8 utilise les règles standards de 1 à 4 octets, et UTF-16 est une unité pour les caractères BMP ou une paire de substitution haute+basse (D800–DBFF puis DC00–DFFF) pour les astraux. L'encodage pourcent correspond simplement à ces octets UTF-8 en %XX.
Que signifient les drapeaux ?
Ils mettent en évidence les caractères faciles à manquer : largeur nulle (200B–200D, 2060, FEFF), contrôles bidirectionnels qui peuvent réordonner le texte, marques combinantes qui s'attachent à une lettre précédente, et caractères de contrôle. De tels caractères sont affichés sous forme de point médian afin que le contenu caché ou invisible soit révélé.
Affiche-t-il le nom officiel du caractère Unicode ?
Il nomme les caractères bien connus (codes de contrôle, espaces, contrôles de largeur nulle et bidi) et affiche toujours le bloc Unicode et la catégorie générale pour chaque point de code. Les noms complets par caractère de la base de données Unicode ne sont pas inclus, le nom du bloc sert donc de descripteur sinon.

Plus d'outils