UTILS.
100% en el navegador
🔤

Inspector de caracteres Unicode

Desglosa cualquier cadena en puntos de código y muestra de cada uno su hex U+, categoría, bloque, bytes UTF-8/UTF-16, entidad HTML, escape JS, codificación porcentual e indicadores.

Introduce texto arriba para inspeccionar cada carácter.

Acerca de esta herramienta

El Inspector de caracteres Unicode divide una cadena en sus puntos de código individuales y muestra todo sobre cada uno. Itera por punto de código (no por unidad de 16 bits), así que los caracteres astrales y los emoji formados por pares sustitutos se manejan correctamente. Para cada punto de código obtienes el glifo, su valor hex U+XXXX, el valor decimal, un nombre para los caracteres bien conocidos, la categoría general y el bloque Unicode al que pertenece.

Todo el análisis se deriva algorítmicamente en tu navegador y nada se sube. Las codificaciones se calculan desde primeros principios: los bytes UTF-8 siguen las reglas de codificación de 1 a 4 bytes, las unidades de código UTF-16 son una sola unidad en el BMP o un par sustituto alto/bajo (D800–DBFF / DC00–DFFF) por encima de él, la entidad numérica HTML es &#nnnn;, el escape de JavaScript es \uXXXX para el BMP o \u{XXXXX} para puntos de código astrales, y la codificación porcentual son los bytes UTF-8 escritos como %XX. La categoría general (Lu, Ll, Nd, Mn, Zs, Cc, etc.) se detecta con expresiones regulares de escape de propiedad Unicode.

El inspector señala los caracteres que a menudo causan errores o se usan para ocultar texto: caracteres de ancho cero (200B–200D, 2060, FEFF), controles bidireccionales (200E, 200F, 202A–202E, 2066–2069), marcas combinantes y caracteres de control C0/C1 — estos se muestran como un punto para que el contenido invisible se haga visible. Una línea de resumen informa del recuento de puntos de código, la longitud UTF-16 (String.length) y el recuento total de bytes UTF-8. Esta herramienta es para inspección; para normalizar entre NFC y NFD usa el normalizador Unicode. Copia el desglose completo como texto separado por tabulaciones.

Preguntas frecuentes

¿Por qué un emoji cuenta como una entrada pero tiene longitud 2?
Muchos emoji y todos los caracteres por encima de U+FFFF son puntos de código únicos codificados en UTF-16 como un par sustituto — dos unidades de 16 bits. El inspector itera por punto de código, así que muestra una fila, mientras que String.length de JavaScript cuenta las dos unidades, que el resumen informa por separado.
¿Cómo se derivan los bytes UTF-8 y UTF-16?
Se calculan directamente del punto de código: UTF-8 usa las reglas estándar de 1–4 bytes, y UTF-16 es una unidad para caracteres BMP o un par sustituto alto+bajo (D800–DBFF luego DC00–DFFF) para los astrales. La codificación porcentual son simplemente esos bytes UTF-8 como %XX.
¿Qué significan los indicadores?
Resaltan caracteres fáciles de pasar por alto: ancho cero (200B–200D, 2060, FEFF), controles bidireccionales que pueden reordenar texto, marcas combinantes que se adjuntan a una letra anterior y caracteres de control. Tales caracteres se muestran como un punto medio para que el contenido oculto o invisible se revele.
¿Muestra el nombre oficial del carácter Unicode?
Nombra los caracteres bien conocidos (códigos de control, espacios, controles de ancho cero y bidi) y siempre muestra el bloque Unicode y la categoría general de cada punto de código. Los nombres completos por carácter de la base de datos Unicode no están incluidos, así que el nombre del bloque sirve como descriptor en otros casos.

Más herramientas