Про цей інструмент
Інспектор символів Unicode розбиває рядок на окремі кодові точки й показує все про кожну. Він ітерує за кодовими точками (а не за 16-бітними одиницями), тож астральні символи та емодзі, складені з сурогатних пар, обробляються правильно. Для кожної кодової точки ви отримуєте гліф, її hex-значення U+XXXX, десяткове значення, назву для добре відомих символів, загальну категорію та блок Unicode, до якого вона належить.
Увесь аналіз виводиться алгоритмічно у вашому браузері й ніщо не завантажується. Кодування обчислюються з перших принципів: байти UTF-8 дотримуються правил кодування від 1 до 4 байтів, кодові одиниці UTF-16 — це єдина одиниця в BMP або пара високого/низького сурогата (D800–DBFF / DC00–DFFF) вище нього, числова HTML-сутність — це &#nnnn;, JavaScript-екранування — це \uXXXX для BMP або \u{XXXXX} для астральних кодових точок, а percent-кодування — це байти UTF-8, записані як %XX. Загальна категорія (Lu, Ll, Nd, Mn, Zs, Cc тощо) визначається за допомогою регулярних виразів властивостей Unicode.
Інспектор позначає символи, що часто спричиняють баги або використовуються для приховування тексту: символи нульової ширини (200B–200D, 2060, FEFF), двонаправлені керуючі (200E, 200F, 202A–202E, 2066–2069), комбінувальні знаки та керуючі символи C0/C1 — вони показуються як крапка, тож невидимий вміст стає видимим. Рядок підсумку повідомляє кількість кодових точок, довжину UTF-16 (String.length) та загальну кількість байтів UTF-8. Цей інструмент для інспекції; щоб нормалізувати між NFC та NFD, використовуйте нормалізатор Unicode. Скопіюйте повну розбивку як текст, розділений табуляцією.