เกี่ยวกับเครื่องมือนี้
ตัวตรวจสอบอักขระ Unicode แยกสตริงเป็นจุดโค้ดแต่ละตัวและแสดงทุกอย่างเกี่ยวกับแต่ละตัว มันวนซ้ำทีละจุดโค้ด (ไม่ใช่ทีละหน่วย 16 บิต) ดังนั้นอักขระ astral และอีโมจิที่ทำจาก surrogate pair จึงถูกจัดการอย่างถูกต้อง สำหรับทุกจุดโค้ด คุณจะได้ glyph, ค่าฐานสิบหก U+XXXX, ค่าฐานสิบ, ชื่อสำหรับอักขระที่รู้จักดี, หมวดหมู่ทั่วไป และบล็อก Unicode ที่มันอยู่
การวิเคราะห์ทั้งหมดได้มาจากอัลกอริทึมในเบราว์เซอร์ของคุณและไม่มีการอัปโหลด การเข้ารหัสถูกคำนวณจากหลักการพื้นฐาน: ไบต์ UTF-8 เป็นไปตามกฎการเข้ารหัส 1 ถึง 4 ไบต์ หน่วยโค้ด UTF-16 เป็นหน่วยเดียวใน BMP หรือ surrogate pair สูง/ต่ำ (D800–DBFF / DC00–DFFF) เหนือมัน HTML numeric entity คือ &#nnnn; JavaScript escape คือ \uXXXX สำหรับ BMP หรือ \u{XXXXX} สำหรับจุดโค้ด astral และ percent-encoding คือไบต์ UTF-8 ที่เขียนเป็น %XX หมวดหมู่ทั่วไป (Lu, Ll, Nd, Mn, Zs, Cc และอื่นๆ) ตรวจจับด้วยนิพจน์ปกติ Unicode property-escape
ตัวตรวจสอบทำเครื่องหมายอักขระที่มักทำให้เกิดบั๊กหรือใช้ซ่อนข้อความ: อักขระ zero-width (200B–200D, 2060, FEFF), ตัวควบคุมทิศทางสองทาง (200E, 200F, 202A–202E, 2066–2069), เครื่องหมายผสม และอักขระควบคุม C0/C1 — สิ่งเหล่านี้แสดงเป็นจุดเพื่อให้เนื้อหาที่มองไม่เห็นปรากฏ บรรทัดสรุปรายงานจำนวนจุดโค้ด ความยาว UTF-16 (String.length) และจำนวนไบต์ UTF-8 ทั้งหมด เครื่องมือนี้ใช้ตรวจสอบ; หากต้องการทำ normalize ระหว่าง NFC และ NFD ให้ใช้ตัว normalize Unicode คัดลอกการแยกวิเคราะห์เต็มเป็นข้อความคั่นด้วยแท็บ