इस टूल के बारे में
Unicode कैरेक्टर इंस्पेक्टर एक स्ट्रिंग को उसके अलग-अलग code points में विभाजित करता है और प्रत्येक के बारे में सब कुछ दिखाता है। यह code point द्वारा iterate करता है (16-बिट unit द्वारा नहीं), इसलिए surrogate pairs से बने astral वर्ण और emoji सही ढंग से संभाले जाते हैं। प्रत्येक code point के लिए आपको glyph, इसका U+XXXX hex मान, दशमलव मान, प्रसिद्ध वर्णों के लिए एक नाम, general category, और यह जिस Unicode block से संबंधित है, मिलता है।
सारा विश्लेषण आपके ब्राउज़र में एल्गोरिदमिक रूप से व्युत्पन्न होता है और कुछ भी अपलोड नहीं होता। एन्कोडिंग पहले सिद्धांतों से गणना किए जाते हैं: UTF-8 बाइट्स 1-से-4-बाइट एन्कोडिंग नियमों का अनुसरण करते हैं, UTF-16 code units BMP में एकल unit हैं या इसके ऊपर एक high/low surrogate pair (D800–DBFF / DC00–DFFF), HTML numeric entity &#nnnn; है, JavaScript escape BMP के लिए \uXXXX या astral code points के लिए \u{XXXXX} है, और percent-encoding UTF-8 बाइट्स को %XX के रूप में लिखा गया है। general category (Lu, Ll, Nd, Mn, Zs, Cc, इत्यादि) Unicode property-escape रेगुलर एक्सप्रेशन्स से पहचानी जाती है।
इंस्पेक्टर उन वर्णों को फ़्लैग करता है जो अक्सर bugs पैदा करते हैं या टेक्स्ट छिपाने के लिए उपयोग होते हैं: zero-width वर्ण (200B–200D, 2060, FEFF), bidirectional controls (200E, 200F, 202A–202E, 2066–2069), combining marks, और C0/C1 control वर्ण — इन्हें एक dot के रूप में दिखाया जाता है ताकि अदृश्य सामग्री दृश्यमान हो जाए। एक सारांश पंक्ति code-point count, UTF-16 लंबाई (String.length), और कुल UTF-8 बाइट count रिपोर्ट करती है। यह टूल निरीक्षण के लिए है; NFC और NFD के बीच normalize करने के लिए Unicode normalizer का उपयोग करें। पूरा विभाजन tab-अलग किए गए टेक्स्ट के रूप में कॉपी करें।