Unicode-Inspektor verwenden: Codepunkte und UTF-8-Bytes prüfen
Geben Sie eine Textprobe ein und starten Sie die Verarbeitung. Danach können Sie pro verarbeitetem Zeichen Codepunkt-, UTF-8-Byte- und Kategorienangaben sowie die beiden Gesamtwerte lesen.
Einsatzmöglichkeiten des Unicode-Inspektors
Der Unicode-Inspektor hilft Ihnen dabei, Text Zeichen für Zeichen zu betrachten und Unterschiede zwischen Zeichenwerten, Codepunkten und UTF-8-Bytes nachvollziehbar zu machen. Für die einzelnen verarbeiteten Zeichen erscheinen die Position, der Zeichenwert, der numerische Codepunkt, eine großgeschriebene hexadezimale Schreibweise, die UTF-8-Bytes in Hexadezimalform und ein breites Kategorienlabel. Zusätzlich sehen Sie die Anzahl der verarbeiteten Zeichen sowie die gesamte UTF-8-Bytezahl.
Das Werkzeug eignet sich für kurze Textproben aus unterschiedlichen Zeichensätzen. Sie können beispielsweise gewöhnlichen ASCII-Text, ein einzelnes Emoji oder CJK-Text untersuchen. Das Eingabefeld ist optional und verwendet standardmäßig eine leere Zeichenfolge. Dadurch lässt sich auch nachvollziehen, welche Zusammenfassung bei einer Prüfung ohne eingegebenen Text erscheint.
Eine Textprüfung durchführen
-
Öffnen Sie den Unicode-Inspektor und suchen Sie das optionale Eingabefeld für den Text, den Sie untersuchen möchten.
-
Geben Sie eine kurze Textprobe ein. Für einen ersten Vergleich können Sie eine deutsche Begrüßung, ein einzelnes Emoji oder eine Folge mit CJK-Zeichen verwenden. Lassen Sie das Feld leer, wenn Sie die leere Eingabe prüfen wollen.
-
Starten Sie die Verarbeitung mit der dafür vorgesehenen Steuerung. Bei leerem Text wird die Verarbeitung erfolgreich abgeschlossen und weist null verarbeitete Zeichen sowie null UTF-8-Bytes aus.
-
Lesen Sie danach die Angaben zu den einzelnen verarbeiteten Zeichen. Achten Sie auf Position, Zeichenwert, numerischen Codepunkt, großgeschriebene hexadezimale Codepunktnotation, UTF-8-Bytes in Hexadezimalform und Kategorienlabel.
-
Vergleichen Sie zum Schluss die beiden Summen mit den Einzelangaben. Die Zeichenanzahl entspricht der Anzahl der verarbeiteten Zeichen. Die gesamte UTF-8-Bytezahl ergibt sich aus der Summe der Byte-Längen, die für die verarbeiteten Zeichen kodiert wurden.
-
Wiederholen Sie die Prüfung mit einer zweiten Textprobe, wenn Sie die Unterschiede zwischen kurzen ASCII-, Emoji- oder CJK-Beispielen gegenüberstellen möchten.
Bedeutung der angezeigten Werte
Die Einzelangaben beschreiben die verarbeiteten Zeichen in ihrer Reihenfolge. Der numerische Codepunkt und seine hexadezimale Form bezeichnen denselben Wert in zwei Darstellungen, während die Byteangabe die jeweilige UTF-8-Kodierung sichtbar macht. Die Gesamtzahl der Bytes lässt sich durch Addition der Byte-Längen der einzelnen Einträge nachvollziehen.
Die gemeldete Zeichenanzahl sollten Sie nicht ohne Weiteres mit der Zahl sichtbarer Symbole in einer Oberfläche gleichsetzen. Das Ergebnis bezieht sich auf die verarbeiteten Zeichen und beschreibt weder Graphem-Cluster noch Normalisierung oder gerenderten Text. Besonders bei zusammengesetzten sichtbaren Darstellungen kann deshalb ein anderer Eindruck entstehen.
Die Kategorienlabels bieten nur eine breite Einordnung anhand numerischer Codepunktbereiche. Sie sind keine maßgebliche Aussage über Unicode-Blöcke, Schriften, Sprachen oder sonstige Zeicheneigenschaften. Nutzen Sie sie daher als Orientierung innerhalb dieser Anzeige und nicht als vollständige Unicode-Klassifikation.
Praktisches Beispiel
Sie möchten nachvollziehen, welche Codepunkt- und UTF-8-Angaben für die kurze deutsche Begrüßung angezeigt werden.
Geben Sie „Hallo“ als Text ein und starten Sie die Verarbeitung. Prüfen Sie anschließend die Einzelangaben und vergleichen Sie die beiden ausgewiesenen Gesamtwerte.
Die Ausgabe enthält Einträge für die verarbeiteten Zeichen mit Position, Zeichenwert, numerischem Codepunkt, großgeschriebener hexadezimaler Codepunktnotation, UTF-8-Bytes in Hexadezimalform und Kategorienlabel sowie eine Zeichenanzahl und eine UTF-8-Bytegesamtzahl.
Einschränkungen
- Die Anzeige zählt verarbeitete Zeichen und verwendet breite Kategorien aus numerischen Codepunktbereichen; sie ersetzt daher keine maßgebliche Unicode-Klassifikation und keine Analyse sichtbarer Graphem-Cluster.
Häufige Fehler
- Wenn Sie Angaben zu einem Zeichen erwarten, das Ergebnis aber null Zeichen zeigt, wurde vermutlich kein Text eingegeben. Tragen Sie das gewünschte Zeichen ein und starten Sie die Verarbeitung erneut; eine leere Eingabe wird korrekt als Prüfung mit null Zeichen und null UTF-8-Bytes behandelt.
Häufige Fragen
Was passiert ohne Eingabe?
Wenn das Feld leer bleibt, wird die Verarbeitung erfolgreich abgeschlossen. Das Ergebnis weist dann null verarbeitete Zeichen und null UTF-8-Bytes aus.
Welche Angaben erscheinen für ein Zeichen?
Für nicht leeren Text sehen Sie pro verarbeitetem Zeichen die Position, den Zeichenwert, den numerischen Codepunkt, seine großgeschriebene hexadezimale Darstellung, die UTF-8-Bytes in Hexadezimalform und ein Kategorienlabel.
Wie wird die gesamte UTF-8-Bytezahl gebildet?
Die Bytegesamtzahl entsteht, indem die kodierten Byte-Längen der verarbeiteten Zeichen addiert werden. Deshalb kann sie von der gemeldeten Zeichenanzahl abweichen.