UTILS.
100% di peramban
🔤

Inspector Karakter Unicode

Pecah string apa pun menjadi code point dan tampilkan hex U+, kategori, blok, byte UTF-8/UTF-16, entitas HTML, escape JS, percent-encoding, dan flag masing-masing.

Masukkan teks di atas untuk menginspeksi setiap karakter.

Tentang alat ini

Unicode Character Inspector membagi string menjadi code point individualnya dan menampilkan segala hal tentang masing-masing. Ia beriterasi berdasarkan code point (bukan berdasarkan unit 16-bit), sehingga karakter astral dan emoji yang terbuat dari pasangan surrogate ditangani dengan benar. Untuk setiap code point Anda mendapatkan glyph, nilai hex U+XXXX-nya, nilai desimal, nama untuk karakter yang terkenal, kategori umum, dan blok Unicode tempatnya berada.

Semua analisis diturunkan secara algoritmik di browser Anda dan tidak ada yang diunggah. Encoding dihitung dari prinsip dasar: byte UTF-8 mengikuti aturan encoding 1-hingga-4-byte, unit kode UTF-16 adalah satu unit di BMP atau pasangan surrogate tinggi/rendah (D800–DBFF / DC00–DFFF) di atasnya, entitas numerik HTML adalah &#nnnn;, escape JavaScript adalah \uXXXX untuk BMP atau \u{XXXXX} untuk code point astral, dan percent-encoding adalah byte UTF-8 yang ditulis sebagai %XX. Kategori umum (Lu, Ll, Nd, Mn, Zs, Cc, dan seterusnya) dideteksi dengan ekspresi reguler properti-escape Unicode.

Inspector menandai karakter yang sering menyebabkan bug atau digunakan untuk menyembunyikan teks: karakter zero-width (200B–200D, 2060, FEFF), kontrol bidirectional (200E, 200F, 202A–202E, 2066–2069), combining mark, dan karakter kontrol C0/C1 — ini ditampilkan sebagai titik sehingga konten tak terlihat menjadi terlihat. Baris ringkasan melaporkan jumlah code point, panjang UTF-16 (String.length), dan total jumlah byte UTF-8. Alat ini untuk inspeksi; untuk menormalkan antara NFC dan NFD gunakan normalizer Unicode. Salin rincian lengkap sebagai teks yang dipisahkan tab.

Pertanyaan yang sering diajukan

Mengapa emoji dihitung sebagai satu entri tetapi panjang 2?
Banyak emoji dan semua karakter di atas U+FFFF adalah code point tunggal yang di-encode dalam UTF-16 sebagai pasangan surrogate — dua unit 16-bit. Inspector beriterasi berdasarkan code point, sehingga menampilkan satu baris, sedangkan String.length JavaScript menghitung dua unit, yang dilaporkan ringkasan secara terpisah.
Bagaimana byte UTF-8 dan UTF-16 diturunkan?
Mereka dihitung langsung dari code point: UTF-8 menggunakan aturan standar 1–4 byte, dan UTF-16 adalah satu unit untuk karakter BMP atau pasangan surrogate tinggi+rendah (D800–DBFF lalu DC00–DFFF) untuk yang astral. Percent-encoding hanyalah byte UTF-8 tersebut sebagai %XX.
Apa arti flag itu?
Mereka menyoroti karakter yang mudah terlewat: zero-width (200B–200D, 2060, FEFF), kontrol bidirectional yang dapat mengurutkan ulang teks, combining mark yang menempel pada huruf sebelumnya, dan karakter kontrol. Karakter semacam itu ditampilkan sebagai titik tengah sehingga konten tersembunyi atau tak terlihat terungkap.
Apakah menampilkan nama karakter Unicode resmi?
Ia menamai karakter yang terkenal (kode kontrol, spasi, kontrol zero-width dan bidi) dan selalu menampilkan blok Unicode serta kategori umum untuk setiap code point. Nama per-karakter lengkap dari basis data Unicode tidak disertakan, sehingga nama blok berfungsi sebagai deskriptor selain itu.

Alat lainnya