UTILS.
100% у браузері
🔤

Інспектор символів Unicode

Розбивайте будь-який рядок на кодові точки й показуйте для кожної U+ hex, категорію, блок, байти UTF-8/UTF-16, HTML-сутність, JS-екранування, percent-кодування та прапорці.

Введіть текст вище, щоб інспектувати кожен символ.

Про цей інструмент

Інспектор символів Unicode розбиває рядок на окремі кодові точки й показує все про кожну. Він ітерує за кодовими точками (а не за 16-бітними одиницями), тож астральні символи та емодзі, складені з сурогатних пар, обробляються правильно. Для кожної кодової точки ви отримуєте гліф, її hex-значення U+XXXX, десяткове значення, назву для добре відомих символів, загальну категорію та блок Unicode, до якого вона належить.

Увесь аналіз виводиться алгоритмічно у вашому браузері й ніщо не завантажується. Кодування обчислюються з перших принципів: байти UTF-8 дотримуються правил кодування від 1 до 4 байтів, кодові одиниці UTF-16 — це єдина одиниця в BMP або пара високого/низького сурогата (D800–DBFF / DC00–DFFF) вище нього, числова HTML-сутність — це &#nnnn;, JavaScript-екранування — це \uXXXX для BMP або \u{XXXXX} для астральних кодових точок, а percent-кодування — це байти UTF-8, записані як %XX. Загальна категорія (Lu, Ll, Nd, Mn, Zs, Cc тощо) визначається за допомогою регулярних виразів властивостей Unicode.

Інспектор позначає символи, що часто спричиняють баги або використовуються для приховування тексту: символи нульової ширини (200B–200D, 2060, FEFF), двонаправлені керуючі (200E, 200F, 202A–202E, 2066–2069), комбінувальні знаки та керуючі символи C0/C1 — вони показуються як крапка, тож невидимий вміст стає видимим. Рядок підсумку повідомляє кількість кодових точок, довжину UTF-16 (String.length) та загальну кількість байтів UTF-8. Цей інструмент для інспекції; щоб нормалізувати між NFC та NFD, використовуйте нормалізатор Unicode. Скопіюйте повну розбивку як текст, розділений табуляцією.

Поширені запитання

Чому емодзі рахується як один запис, але має довжину 2?
Багато емодзі та всі символи вище U+FFFF є одиничними кодовими точками, закодованими в UTF-16 як сурогатна пара — дві 16-бітні одиниці. Інспектор ітерує за кодовими точками, тож показує один рядок, тоді як String.length у JavaScript рахує дві одиниці, які підсумок повідомляє окремо.
Як виводяться байти UTF-8 та UTF-16?
Вони обчислюються безпосередньо з кодової точки: UTF-8 використовує стандартні правила 1–4 байтів, а UTF-16 — це одна одиниця для символів BMP або пара високого+низького сурогата (D800–DBFF потім DC00–DFFF) для астральних. Percent-кодування — це просто ці байти UTF-8 як %XX.
Що означають прапорці?
Вони виділяють легко пропущені символи: нульової ширини (200B–200D, 2060, FEFF), двонаправлені керуючі, що можуть переупорядкувати текст, комбінувальні знаки, які приєднуються до попередньої літери, та керуючі символи. Такі символи відображаються як серединна крапка, тож прихований чи невидимий вміст розкривається.
Чи показує він офіційну назву символу Unicode?
Він називає добре відомі символи (керуючі коди, пробіли, керуючі нульової ширини та bidi) і завжди показує блок Unicode й загальну категорію для кожної кодової точки. Повні назви кожного символу з бази даних Unicode не включено, тож інакше назва блоку слугує дескриптором.

Більше інструментів