Guia

Como inspecionar os caracteres Unicode de um texto

O Unicode Inspector mostra, carácter a carácter, pontos de código, bytes UTF-8, posições, contagens e etiquetas de categoria amplas. Introduza um texto, ou deixe a entrada vazia, para consultar o resultado correspondente.

Ferramenta Inspetor Unicode

Para que serve o Unicode Inspector

O Unicode Inspector serve para observar um texto carácter a carácter. Para cada carácter não vazio, apresenta o valor do carácter, a posição, o ponto de código numérico, a notação hexadecimal em maiúsculas, a representação dos bytes UTF-8 em hexadecimal e uma etiqueta de categoria ampla. É útil quando pretende perceber como diferentes símbolos, acentos, emojis ou caracteres de outros sistemas de escrita são processados.

O campo de texto é opcional. Pode analisar texto comum, um único emoji, texto CJK ou deixar o campo vazio, consoante o que pretende verificar. A análise não se limita a mostrar o texto: também apresenta contagens e informação de codificação associada aos caracteres processados.

Como analisar um texto, passo a passo

  1. Abra o Unicode Inspector e localize o campo de entrada de texto.
  2. Introduza ou cole o conteúdo que pretende analisar. Pode usar uma frase com letras e acentos, um símbolo, um emoji ou texto de outro sistema de escrita. Também pode deixar o campo vazio ou omitir a entrada.
  3. Inicie o processamento através do controlo disponível na página.
  4. Consulte o resultado carácter a carácter. Para cada item, verifique a posição, o carácter, o ponto de código numérico, a forma hexadecimal do ponto de código, os bytes UTF-8 em hexadecimal e a etiqueta de categoria apresentada.
  5. Observe as contagens globais. Compare o número de caracteres processados com o total de bytes UTF-8 para perceber se o texto ocupa mais bytes do que caracteres na codificação UTF-8.

Se quiser comparar conteúdos, faça uma análise separada para cada texto e mantenha registo dos resultados que lhe interessam. Para uma verificação rápida, um texto ASCII simples pode servir de referência antes de testar acentos, emojis ou outros símbolos.

Como interpretar o resultado

A contagem de caracteres corresponde ao número de caracteres processados. O total de bytes UTF-8 é calculado somando o comprimento, em bytes, da codificação UTF-8 de cada carácter. Por isso, os dois números podem ser diferentes, sobretudo quando o texto contém símbolos cuja representação UTF-8 usa mais do que um byte.

A posição e o ponto de código ajudam a localizar um carácter específico no resultado. A notação hexadecimal oferece outra forma de ler o mesmo ponto de código, enquanto os bytes UTF-8 mostram a representação codificada. A etiqueta de categoria deve ser lida como uma classificação ampla baseada em intervalos numéricos de pontos de código; não equivale a uma classificação normativa de blocos, scripts, idiomas ou propriedades de caracteres Unicode.

Quando a entrada está vazia, o processamento é bem-sucedido e o resultado indica zero caracteres e zero bytes UTF-8. Isso permite distinguir uma entrada sem conteúdo de um texto que contém caracteres, mesmo que estes sejam visualmente discretos.

Exemplo prático

Uma pessoa quer verificar como as letras acentuadas de «Olá!» aparecem no resultado e compara a contagem de caracteres com o total de bytes UTF-8.

Introduza a frase «Olá!» e inicie o processamento. Consulte as linhas individuais e depois compare as duas contagens globais.

O resultado apresenta itens por carácter, com posição, valor, ponto de código numérico, forma hexadecimal, bytes UTF-8 em hexadecimal e etiqueta de categoria, além da contagem de caracteres e do total de bytes.

Limitações

  • As etiquetas de categoria são amplas e baseiam-se em intervalos numéricos de pontos de código; não devem ser tratadas como classificação oficial de blocos, scripts, idiomas ou propriedades Unicode.

Erros comuns

  • Erro: tratar a etiqueta de categoria como uma identificação oficial de script ou propriedade Unicode. Correção: use essa etiqueta apenas como indicação ampla baseada no intervalo numérico do ponto de código e consulte o carácter, o ponto de código e os bytes UTF-8 para a análise pretendida.

Perguntas frequentes

Que informação é apresentada para cada carácter?

O texto é processado carácter a carácter e o resultado inclui o valor, a posição, o ponto de código, a notação hexadecimal, os bytes UTF-8 e uma etiqueta de categoria ampla.

Porque é que a contagem de caracteres pode ser diferente do total de bytes UTF-8?

A contagem de caracteres é o número de caracteres processados; o total de bytes UTF-8 é a soma dos comprimentos das representações UTF-8 desses caracteres. Assim, os totais podem ser diferentes.

Posso analisar uma entrada vazia?

Sim. Quando o texto está vazio, o processamento é bem-sucedido e o resultado indica zero caracteres e zero bytes UTF-8.

Ferramenta

Inspetor Unicode