Guía

Cómo ver los datos de cada carácter y sus bytes UTF-8

Escribe un texto y ejecuta la inspección para consultar los datos de sus caracteres, sus puntos de código y sus bytes UTF-8. Si dejas la entrada vacía, obtendrás un resultado válido con cero caracteres y cero bytes.

Herramienta Inspector Unicode

Para qué sirve la inspección

Esta herramienta permite examinar un texto carácter por carácter para consultar los datos asociados a cada elemento procesado. El resultado reúne la posición, el valor del carácter, el punto de código numérico, su notación hexadecimal en mayúsculas, los bytes UTF-8 expresados en hexadecimal y una etiqueta de categoría amplia. También presenta un recuento de caracteres y un total de bytes UTF-8, dos medidas útiles para comprobar cómo se codifica un texto.

Puede servirte para revisar texto ASCII, caracteres de otros sistemas de escritura o símbolos individuales cuando necesitas localizar diferencias entre posiciones y representaciones. La entrada no es obligatoria, así que también puedes observar qué información aparece al procesar una cadena vacía. La herramienta muestra datos por posición, no una interpretación visual del texto ni una explicación lingüística de su contenido.

Pasos para revisar un texto

  1. Introduce en la entrada el texto que quieras revisar. Puedes escribir una palabra, una cadena formada por varios tipos de caracteres o un fragmento más extenso; si omites la entrada, se utiliza una cadena vacía.

  2. Ejecuta la inspección mediante el control disponible. Cuando hay texto, se procesa cada carácter y se prepara una información individual para su posición.

  3. Recorre las entradas generadas y comprueba el carácter, su posición, el punto de código numérico, la notación hexadecimal en mayúsculas, los bytes UTF-8 en hexadecimal y la etiqueta de categoría.

  4. Consulta los valores globales que acompañan a la lista. El recuento corresponde al número de caracteres procesados, mientras que el total de bytes suma la longitud de la codificación UTF-8 de esos caracteres.

  5. Para una comprobación inicial, prueba con texto ASCII, con un símbolo emoji o con texto CJK, opciones incluidas entre los ejemplos satisfactorios disponibles. Después repite la operación sin escribir nada para observar el caso vacío.

  6. Lee la categoría como una orientación general obtenida a partir de rangos numéricos del punto de código. No la uses como una identificación detallada de un bloque Unicode, una escritura, un idioma o una propiedad concreta.

Lectura de los datos obtenidos

La lista individual te permite relacionar una posición del texto con su valor y sus representaciones numérica y hexadecimal. Los bytes UTF-8 aparecen en hexadecimal, mientras que el recuento y el total de bytes resumen el conjunto procesado desde perspectivas distintas.

Es normal que el número de caracteres y los bytes UTF-8 no coincidan. El primer valor cuenta los caracteres procesados y el segundo agrega la longitud codificada de cada uno, de modo que la comparación debe hacerse entendiendo qué mide cada indicador.

Si no introduces texto, el procesamiento se completa correctamente y el resultado comunica cero caracteres y cero bytes UTF-8. Ese caso sirve para distinguir una entrada vacía de una lista que contenga elementos.

Las categorías requieren prudencia porque proceden de rangos numéricos amplios. La inspección trabaja con los caracteres que procesa de la cadena, no con agrupaciones de grafemas percibidas por el usuario, normalización ni análisis de la apariencia mostrada.

Ejemplo práctico

Una persona quiere comprobar la representación de una palabra ASCII antes de compararla con otra entrada.

Escribe «Sol» en la entrada y ejecuta la inspección; después revisa las entradas individuales y compara los dos totales mostrados.

La respuesta contiene una entrada para la palabra procesada con su posición, valor, punto de código numérico, notación hexadecimal, bytes UTF-8 y categoría, además del recuento de caracteres y el total de bytes.

Limitaciones

  • Las categorías son orientaciones amplias basadas en rangos numéricos, no clasificaciones detalladas de Unicode, escrituras, idiomas o propiedades de caracteres.

Errores frecuentes

  • Un error habitual es interpretar la categoría como una clasificación Unicode detallada. Para corregirlo, úsala solo como una orientación basada en rangos numéricos y verifica por separado cualquier propiedad específica que necesites.

Preguntas frecuentes

¿Puedo usar la herramienta sin introducir texto?

Cuando no introduces texto, la herramienta procesa una cadena vacía y comunica cero caracteres junto con cero bytes UTF-8. La entrada opcional permite comprobar ese comportamiento sin añadir contenido.

¿Por qué pueden diferir el recuento de caracteres y los bytes UTF-8?

Las dos cifras representan medidas distintas: una cuenta los caracteres procesados y la otra suma la longitud de sus codificaciones UTF-8. Por eso pueden mostrar valores diferentes para una misma entrada.

¿La categoría identifica con precisión el tipo de carácter?

La categoría ofrece una orientación amplia calculada mediante rangos numéricos del punto de código. No basta para confirmar un bloque Unicode, una escritura, un idioma ni una propiedad detallada del carácter.

Herramienta

Inspector Unicode