Comment inspecter les caractères, les points de code et les octets UTF-8 d’un texte
Saisissez le texte à examiner, lancez le traitement, puis rapprochez les lignes individuelles des compteurs de caractères et d’octets UTF-8. Sans saisie, le traitement réussi indique zéro caractère et zéro octet.
Comprendre l’intérêt de cette analyse
Cet outil permet d’examiner un texte caractère par caractère et de rapprocher sa lecture humaine de sa représentation numérique. Pour chaque caractère parcouru, il présente sa valeur, son point de code, son écriture hexadécimale en majuscules, ses octets UTF-8 en hexadécimal et une catégorie générale.
Vous pouvez lui fournir un texte ordinaire, un pictogramme, un contenu CJK ou aucune saisie. Cette possibilité convient notamment lorsqu’il faut comprendre pourquoi le nombre de caractères ne correspond pas à la taille occupée par l’encodage UTF-8. Les informations affichées décrivent le traitement de la chaîne ; elles ne constituent pas une classification Unicode normative et ne mesurent pas les unités de texte perçues par un lecteur.
Suivre la procédure de vérification
-
Repérez la zone de saisie prévue pour le texte. Entrez ou collez le contenu à examiner, ou laissez cette zone sans contenu si vous souhaitez vérifier le cas vide.
-
Utilisez le contrôle qui lance le traitement. Avec une entrée non vide, parcourez les lignes produites : chacune indique la position du caractère, sa valeur, son point de code numérique, sa notation hexadécimale en majuscules, ses octets UTF-8 sous forme hexadécimale et une catégorie.
-
Consultez ensuite les compteurs globaux. Le premier indique combien de caractères ont été traités ; le second additionne la longueur encodée en UTF-8 de ces caractères. Vous pouvez rapprocher ce total de la longueur de chaque représentation affichée.
-
Pour tester l’absence de saisie, relancez le traitement sans texte ou omettez l’entrée. Dans ce cas vérifié, le résultat indique zéro caractère et zéro octet UTF-8.
Interpréter les informations affichées
Le compteur de caractères correspond au nombre de caractères parcourus, tandis que le total UTF-8 additionne les octets nécessaires à leur encodage. Ces mesures portent donc sur deux aspects différents d’une même entrée, ce qui explique qu’elles puissent présenter des nombres différents.
Les informations individuelles servent à relier un caractère visible à une valeur numérique et à une suite d’octets. La notation hexadécimale facilite la comparaison entre lignes, notamment lorsque plusieurs caractères ne prennent pas la même place dans leur encodage.
L’étiquette de catégorie doit être lue comme une indication générale fondée sur de larges plages de points de code. Elle ne permet pas de conclure à l’appartenance normative à un bloc Unicode, à un script, à une langue ou à une propriété de caractère.
Enfin, une entrée vide ne se confond pas avec un espace : la première correspond ici à un traitement réussi sans caractère, alors que le second est un contenu à examiner.
Exemple pratique
Vous souhaitez comparer la représentation numérique d’un pictogramme avec la taille de son encodage UTF-8.
Saisissez un seul pictogramme dans la zone de texte, lancez le traitement, puis observez la ligne produite et les compteurs associés.
Le résultat présente une ligne pour le pictogramme traité, avec sa position, sa valeur, son point de code numérique, sa notation hexadécimale en majuscules, ses octets UTF-8 en hexadécimal et une catégorie ; deux compteurs suivent pour le nombre de caractères et le total d’octets.
Limites
- Les catégories restent générales, car elles reposent sur de larges plages de points de code et non sur une classification Unicode normative.
Erreurs fréquentes
- Une zone qui semble vide peut contenir un espace ; supprimez ce caractère avant le lancement si vous voulez obtenir le résultat associé à une entrée réellement vide.
Questions fréquentes
Puis-je lancer l’analyse sans saisir de texte ?
Oui, lorsque vous omettez le texte ou laissez la saisie vide, le traitement réussi affiche zéro caractère et zéro octet UTF-8.
Quelles informations apparaissent pour chaque caractère ?
Pour une entrée non vide, une ligne fournit la position, la valeur, le point de code numérique, la forme hexadécimale en majuscules, les octets UTF-8 et la catégorie du caractère parcouru.
Pourquoi les compteurs de caractères et d’octets diffèrent-ils ?
Le premier compteur concerne le nombre de caractères parcourus, alors que le second additionne leurs longueurs encodées en UTF-8 ; une différence entre les deux est donc possible.