UTILS.
100 % im Browser
🔤

Unicode-Zeichen-Inspektor

Zerlege jeden String in Codepunkte und zeige für jeden den U+-Hex, die Kategorie, den Block, UTF-8/UTF-16-Bytes, HTML-Entität, JS-Escape, Prozentkodierung und Kennzeichnungen.

Gib oben Text ein, um jedes Zeichen zu untersuchen.

Über dieses Tool

Der Unicode-Zeichen-Inspektor zerlegt einen String in seine einzelnen Codepunkte und zeigt alles über jeden. Er iteriert nach Codepunkt (nicht nach 16-Bit-Einheit), sodass Astral-Zeichen und Emoji aus Surrogatpaaren korrekt behandelt werden. Für jeden Codepunkt erhältst du das Glyph, seinen U+XXXX-Hexwert, den Dezimalwert, einen Namen für bekannte Zeichen, die allgemeine Kategorie und den Unicode-Block, zu dem es gehört.

Die gesamte Analyse wird algorithmisch in deinem Browser abgeleitet und nichts wird hochgeladen. Die Kodierungen werden von Grund auf berechnet: Die UTF-8-Bytes folgen den 1-bis-4-Byte-Kodierungsregeln, die UTF-16-Codeeinheiten sind eine einzelne Einheit in der BMP oder ein High-/Low-Surrogatpaar (D800–DBFF / DC00–DFFF) darüber, die HTML-Numerik-Entität ist &#nnnn;, der JavaScript-Escape ist \uXXXX für die BMP oder \u{XXXXX} für Astral-Codepunkte, und die Prozentkodierung sind die UTF-8-Bytes als %XX geschrieben. Die allgemeine Kategorie (Lu, Ll, Nd, Mn, Zs, Cc und so weiter) wird mit Unicode-Property-Escape-regulären Ausdrücken erkannt.

Der Inspektor kennzeichnet Zeichen, die oft Fehler verursachen oder zum Verstecken von Text verwendet werden: Nullbreite-Zeichen (200B–200D, 2060, FEFF), bidirektionale Steuerzeichen (200E, 200F, 202A–202E, 2066–2069), kombinierende Zeichen und C0/C1-Steuerzeichen – diese werden als Punkt angezeigt, sodass unsichtbarer Inhalt sichtbar wird. Eine Zusammenfassungszeile meldet die Codepunkt-Anzahl, die UTF-16-Länge (String.length) und die gesamte UTF-8-Byte-Anzahl. Dieses Tool dient der Inspektion; um zwischen NFC und NFD zu normalisieren, verwende den Unicode-Normalisierer. Kopiere die vollständige Aufschlüsselung als tabulatorgetrennten Text.

Häufig gestellte Fragen

Warum zählt ein Emoji als ein Eintrag, hat aber die Länge 2?
Viele Emoji und alle Zeichen über U+FFFF sind einzelne Codepunkte, die in UTF-16 als Surrogatpaar kodiert werden – zwei 16-Bit-Einheiten. Der Inspektor iteriert nach Codepunkt, sodass er eine Zeile anzeigt, während JavaScripts String.length die zwei Einheiten zählt, was die Zusammenfassung separat meldet.
Wie werden die UTF-8- und UTF-16-Bytes abgeleitet?
Sie werden direkt aus dem Codepunkt berechnet: UTF-8 verwendet die Standard-1–4-Byte-Regeln, und UTF-16 ist eine Einheit für BMP-Zeichen oder ein High-+Low-Surrogatpaar (D800–DBFF dann DC00–DFFF) für Astral-Zeichen. Die Prozentkodierung sind einfach diese UTF-8-Bytes als %XX.
Was bedeuten die Kennzeichnungen?
Sie heben leicht zu übersehende Zeichen hervor: Nullbreite (200B–200D, 2060, FEFF), bidirektionale Steuerzeichen, die Text umordnen können, kombinierende Zeichen, die sich an einen vorherigen Buchstaben anhängen, und Steuerzeichen. Solche Zeichen werden als Mittelpunkt angezeigt, sodass versteckter oder unsichtbarer Inhalt aufgedeckt wird.
Zeigt es den offiziellen Unicode-Zeichennamen?
Es benennt bekannte Zeichen (Steuercodes, Leerzeichen, Nullbreite- und Bidi-Steuerzeichen) und zeigt immer den Unicode-Block und die allgemeine Kategorie für jeden Codepunkt. Vollständige zeichenweise Namen aus der Unicode-Datenbank sind nicht gebündelt, sodass der Blockname ansonsten als Beschreibung dient.

Weitere Tools