UTILS.
100% ब्राउज़र में
🔤

Unicode कैरेक्टर इंस्पेक्टर

किसी भी स्ट्रिंग को code points में तोड़ें और प्रत्येक का U+ hex, category, block, UTF-8/UTF-16 बाइट्स, HTML entity, JS escape, percent-encoding, और flags दिखाएँ।

प्रत्येक वर्ण का निरीक्षण करने के लिए ऊपर टेक्स्ट दर्ज करें।

इस टूल के बारे में

Unicode कैरेक्टर इंस्पेक्टर एक स्ट्रिंग को उसके अलग-अलग code points में विभाजित करता है और प्रत्येक के बारे में सब कुछ दिखाता है। यह code point द्वारा iterate करता है (16-बिट unit द्वारा नहीं), इसलिए surrogate pairs से बने astral वर्ण और emoji सही ढंग से संभाले जाते हैं। प्रत्येक code point के लिए आपको glyph, इसका U+XXXX hex मान, दशमलव मान, प्रसिद्ध वर्णों के लिए एक नाम, general category, और यह जिस Unicode block से संबंधित है, मिलता है।

सारा विश्लेषण आपके ब्राउज़र में एल्गोरिदमिक रूप से व्युत्पन्न होता है और कुछ भी अपलोड नहीं होता। एन्कोडिंग पहले सिद्धांतों से गणना किए जाते हैं: UTF-8 बाइट्स 1-से-4-बाइट एन्कोडिंग नियमों का अनुसरण करते हैं, UTF-16 code units BMP में एकल unit हैं या इसके ऊपर एक high/low surrogate pair (D800–DBFF / DC00–DFFF), HTML numeric entity &#nnnn; है, JavaScript escape BMP के लिए \uXXXX या astral code points के लिए \u{XXXXX} है, और percent-encoding UTF-8 बाइट्स को %XX के रूप में लिखा गया है। general category (Lu, Ll, Nd, Mn, Zs, Cc, इत्यादि) Unicode property-escape रेगुलर एक्सप्रेशन्स से पहचानी जाती है।

इंस्पेक्टर उन वर्णों को फ़्लैग करता है जो अक्सर bugs पैदा करते हैं या टेक्स्ट छिपाने के लिए उपयोग होते हैं: zero-width वर्ण (200B–200D, 2060, FEFF), bidirectional controls (200E, 200F, 202A–202E, 2066–2069), combining marks, और C0/C1 control वर्ण — इन्हें एक dot के रूप में दिखाया जाता है ताकि अदृश्य सामग्री दृश्यमान हो जाए। एक सारांश पंक्ति code-point count, UTF-16 लंबाई (String.length), और कुल UTF-8 बाइट count रिपोर्ट करती है। यह टूल निरीक्षण के लिए है; NFC और NFD के बीच normalize करने के लिए Unicode normalizer का उपयोग करें। पूरा विभाजन tab-अलग किए गए टेक्स्ट के रूप में कॉपी करें।

अक्सर पूछे जाने वाले प्रश्न

एक emoji एक प्रविष्टि के रूप में क्यों गिना जाता है लेकिन लंबाई 2?
कई emoji और U+FFFF से ऊपर के सभी वर्ण एकल code points हैं जो UTF-16 में surrogate pair के रूप में एन्कोड होते हैं — दो 16-बिट units। इंस्पेक्टर code point द्वारा iterate करता है, इसलिए यह एक row दिखाता है, जबकि JavaScript का String.length दो units गिनता है, जिसे सारांश अलग से रिपोर्ट करता है।
UTF-8 और UTF-16 बाइट्स कैसे व्युत्पन्न होते हैं?
वे सीधे code point से गणना किए जाते हैं: UTF-8 स्टैंडर्ड 1–4 बाइट नियम उपयोग करता है, और UTF-16 BMP वर्णों के लिए एक unit है या astral वर्णों के लिए एक high+low surrogate pair (D800–DBFF फिर DC00–DFFF)। percent-encoding बस वे UTF-8 बाइट्स %XX के रूप में है।
flags का क्या अर्थ है?
वे आसानी से छूट जाने वाले वर्णों को हाइलाइट करते हैं: zero-width (200B–200D, 2060, FEFF), bidirectional controls जो टेक्स्ट को पुनर्क्रमित कर सकते हैं, combining marks जो पिछले अक्षर से जुड़ते हैं, और control वर्ण। ऐसे वर्ण एक middle dot के रूप में प्रदर्शित होते हैं ताकि छिपी या अदृश्य सामग्री प्रकट हो।
क्या यह आधिकारिक Unicode कैरेक्टर नाम दिखाता है?
यह प्रसिद्ध वर्णों (control codes, spaces, zero-width और bidi controls) को नाम देता है और हमेशा प्रत्येक code point के लिए Unicode block और general category दिखाता है। Unicode डेटाबेस से पूर्ण प्रति-वर्ण नाम बंडल नहीं किए गए हैं, इसलिए block नाम अन्यथा descriptor के रूप में कार्य करता है।

और टूल