Über dieses Tool
Der Unicode-Zeichen-Inspektor zerlegt einen String in seine einzelnen Codepunkte und zeigt alles über jeden. Er iteriert nach Codepunkt (nicht nach 16-Bit-Einheit), sodass Astral-Zeichen und Emoji aus Surrogatpaaren korrekt behandelt werden. Für jeden Codepunkt erhältst du das Glyph, seinen U+XXXX-Hexwert, den Dezimalwert, einen Namen für bekannte Zeichen, die allgemeine Kategorie und den Unicode-Block, zu dem es gehört.
Die gesamte Analyse wird algorithmisch in deinem Browser abgeleitet und nichts wird hochgeladen. Die Kodierungen werden von Grund auf berechnet: Die UTF-8-Bytes folgen den 1-bis-4-Byte-Kodierungsregeln, die UTF-16-Codeeinheiten sind eine einzelne Einheit in der BMP oder ein High-/Low-Surrogatpaar (D800–DBFF / DC00–DFFF) darüber, die HTML-Numerik-Entität ist &#nnnn;, der JavaScript-Escape ist \uXXXX für die BMP oder \u{XXXXX} für Astral-Codepunkte, und die Prozentkodierung sind die UTF-8-Bytes als %XX geschrieben. Die allgemeine Kategorie (Lu, Ll, Nd, Mn, Zs, Cc und so weiter) wird mit Unicode-Property-Escape-regulären Ausdrücken erkannt.
Der Inspektor kennzeichnet Zeichen, die oft Fehler verursachen oder zum Verstecken von Text verwendet werden: Nullbreite-Zeichen (200B–200D, 2060, FEFF), bidirektionale Steuerzeichen (200E, 200F, 202A–202E, 2066–2069), kombinierende Zeichen und C0/C1-Steuerzeichen – diese werden als Punkt angezeigt, sodass unsichtbarer Inhalt sichtbar wird. Eine Zusammenfassungszeile meldet die Codepunkt-Anzahl, die UTF-16-Länge (String.length) und die gesamte UTF-8-Byte-Anzahl. Dieses Tool dient der Inspektion; um zwischen NFC und NFD zu normalisieren, verwende den Unicode-Normalisierer. Kopiere die vollständige Aufschlüsselung als tabulatorgetrennten Text.