Tentang alat ini
Unicode Character Inspector membagi string menjadi code point individualnya dan menampilkan segala hal tentang masing-masing. Ia beriterasi berdasarkan code point (bukan berdasarkan unit 16-bit), sehingga karakter astral dan emoji yang terbuat dari pasangan surrogate ditangani dengan benar. Untuk setiap code point Anda mendapatkan glyph, nilai hex U+XXXX-nya, nilai desimal, nama untuk karakter yang terkenal, kategori umum, dan blok Unicode tempatnya berada.
Semua analisis diturunkan secara algoritmik di browser Anda dan tidak ada yang diunggah. Encoding dihitung dari prinsip dasar: byte UTF-8 mengikuti aturan encoding 1-hingga-4-byte, unit kode UTF-16 adalah satu unit di BMP atau pasangan surrogate tinggi/rendah (D800–DBFF / DC00–DFFF) di atasnya, entitas numerik HTML adalah &#nnnn;, escape JavaScript adalah \uXXXX untuk BMP atau \u{XXXXX} untuk code point astral, dan percent-encoding adalah byte UTF-8 yang ditulis sebagai %XX. Kategori umum (Lu, Ll, Nd, Mn, Zs, Cc, dan seterusnya) dideteksi dengan ekspresi reguler properti-escape Unicode.
Inspector menandai karakter yang sering menyebabkan bug atau digunakan untuk menyembunyikan teks: karakter zero-width (200B–200D, 2060, FEFF), kontrol bidirectional (200E, 200F, 202A–202E, 2066–2069), combining mark, dan karakter kontrol C0/C1 — ini ditampilkan sebagai titik sehingga konten tak terlihat menjadi terlihat. Baris ringkasan melaporkan jumlah code point, panjang UTF-16 (String.length), dan total jumlah byte UTF-8. Alat ini untuk inspeksi; untuk menormalkan antara NFC dan NFD gunakan normalizer Unicode. Salin rincian lengkap sebagai teks yang dipisahkan tab.