Como analisar as palavras mais frequentes num texto
Introduza o texto, ajuste o filtro de palavras funcionais, o comprimento mínimo e o número de termos apresentados, e execute a análise. Depois, leia os termos ordenados pela frequência e confirme os totais de tokens retidos e de termos distintos.
Para que serve a análise de frequência de palavras
O Word Frequency Map serve para perceber quais são os termos que mais se repetem num texto e observar a distribuição do vocabulário retido. Pode ser útil para uma primeira leitura de artigos, entrevistas, notas de pesquisa ou rascunhos, sobretudo quando pretende comparar a frequência dos termos em vez de os procurar manualmente. A análise aceita texto opcional e, quando não recebe texto, termina com zero tokens retidos e sem entradas de palavras.
Como configurar e executar a análise
-
Prepare um texto não vazio e introduza-o no campo de texto. O conteúdo é convertido para minúsculas. Letras ASCII, espaços e apóstrofos são preservados; os restantes caracteres são substituídos por espaços e o texto restante é separado pelos espaços. Assim, acentos, algarismos e pontuação não ficam disponíveis como parte dos tokens analisados.
-
Se necessário, altere o filtro de palavras funcionais. Este filtro está ativo por predefinição: depois de aplicado o comprimento mínimo, os termos incluídos no conjunto interno de palavras funcionais são excluídos. Desative-o apenas quando quiser que esses termos também entrem na contagem.
-
Defina o comprimento mínimo dos tokens. O valor predefinido é 3 caracteres. O valor fornecido é convertido num número inteiro, usa 3 quando não está preenchido ou é avaliado como falso e fica limitado a um mínimo de 1. Tenha em conta que esta regra pode retirar termos curtos antes da contagem.
-
Escolha o limite de termos apresentados. A predefinição é 30. O valor é convertido para um número inteiro, usa 30 quando não está preenchido ou é avaliado como falso e fica restringido ao intervalo de 5 a 100.
-
Execute a análise e leia a lista apresentada. Os termos retidos são ordenados pela contagem, da frequência mais alta para a mais baixa, e a lista respeita o limite escolhido. Confirme também os totais gerais para saber quantos tokens foram retidos e quantos termos distintos existem.
Como interpretar os resultados
Use a contagem para identificar padrões de repetição, não para concluir que uma palavra representa por si só o tema ou a qualidade do texto. A percentagem de cada termo é calculada a partir dos tokens retidos e apresentada com duas casas decimais; a barra relativa é arredondada a uma casa decimal. O total de tokens retidos e o número de termos distintos ajudam a contextualizar a lista.
Compare resultados apenas quando mantiver as mesmas opções. Alterar o filtro de palavras funcionais, o comprimento mínimo ou o limite de apresentação pode mudar a lista e os totais. Um limite baixo pode ocultar termos distintos que foram retidos, enquanto a normalização do texto impede a análise de algarismos, pontuação e letras que não pertençam ao conjunto ASCII. Por isso, trate o resultado como uma contagem do texto normalizado e filtrado, não como um inventário de todas as palavras tal como aparecem no original.
Exemplo prático
Uma pessoa analisa um parágrafo de uma entrevista para verificar quais os termos de pelo menos quatro caracteres que se repetem mais vezes.
Introduza o texto, mantenha o filtro de palavras funcionais ativo, defina o comprimento mínimo para 4 e escolha apresentar até 10 termos. Execute a análise e compare os termos no topo com os totais gerais.
A saída apresenta uma lista ordenada de termos retidos, cada um com a sua contagem, percentagem arredondada a duas casas decimais e barra relativa arredondada a uma casa decimal, além do total de tokens retidos e do número de termos distintos.
Limitações
- Os resultados referem-se ao texto normalizado e aos tokens que permanecem depois do filtro de palavras funcionais, do comprimento mínimo e do limite de apresentação; algarismos, pontuação, letras não ASCII e termos fora da lista apresentada podem não aparecer.
Erros comuns
- Introduzir um valor não numérico num limite preenchido pode fazer a análise falhar. Corrija-o usando um número inteiro; para o comprimento mínimo, use pelo menos 1, e para o limite de termos, um valor entre 5 e 100.
Perguntas frequentes
Posso executar a análise sem introduzir texto?
Sim, mas o resultado será vazio: quando o texto é omitido ou está vazio, a operação termina com zero tokens retidos e sem entradas de palavras.
Porque é que algumas palavras não aparecem?
Depende das opções: o filtro de palavras funcionais está ativo por predefinição e o comprimento mínimo predefinido é de 3 caracteres. Os termos excluídos por essas regras não entram nos tokens retidos nem nas percentagens.
A lista apresenta todos os termos encontrados?
A lista mostra primeiro os termos com maior contagem e respeita o limite configurado, entre 5 e 100 depois da normalização do valor. Um limite inferior pode deixar de fora termos retidos que não cabem na lista apresentada.