如何使用文本统计工具分析文本
输入一段文本并执行分析,即可查看长度、词频、字符分类、可读性和时间估算等统计结果。输入留空或只含空白时,工具也会返回对应的空输入统计。
先了解它能分析什么
这款文本统计工具适合在写作、编辑或内容复核时,快速查看一段文本的长度、词语分布、字符组成以及可读性相关估算。它接受一项可选的文本输入,未输入内容时也能返回结果。
按顺序完成文本分析
- 在文本输入区域粘贴或输入一段内容。输入可以留空;如果只输入空格或换行,也会按空白内容处理。
- 执行分析并查看结果。对于非空文本,先关注按空白分隔的词数、原始字符数、去除空白后的字符数、句子数、段落数和行数。
- 查看词语统计。工具会把按空白分隔的词转换为由小写字母和数字组成的形式进行频率统计,显示频率最高的十五个归一化词语,并给出不同归一化词语的数量。
- 查看字符分类,包括字母、数字、空白、标点、大写字母和小写字母的计数。这些分类针对原始文本中的字符。
- 当文本超过五个词时,再查看可读性估算。工具会根据元音组启发式估算音节,计算四舍五入的可读性分数,将分数限制在 0 至 100,并根据分数区间给出六级标签。
- 对非空文本,查看最多五种不同的最长字母词形、四舍五入后的平均词长、每句平均词数,以及按每分钟 200 词和 130 词计算的阅读与朗读时间估算。即使文本很短,这两类时间估算也至少按一分钟计。
- 如果多个最长词长度相同,不要把它们的显示先后顺序当作固定规则。
如何理解分析结果
先用长度统计判断文本规模,再结合词频和字符分类定位写作特征。例如,词数和句数可以帮助你估计段落密度,词频可以提示反复出现的词语,字符分类则能显示数字、标点或大小写的使用情况。
可读性结果只适用于超过五个词的文本,并且属于估算,不应把分数当作对内容质量的单独判断。平均词长、每句平均词数以及阅读和朗读时间同样是基于统计规则的参考值。对于空文本或只含空白的输入,统计数值为零,可读性等级不可用,词语列表为空,阅读和朗读时间估算也为零。
使用示例
编辑在检查一段简短英文文案时,希望先了解它的基本长度、词语重复情况和可读性相关结果。
输入“This is a short sample text.”,执行分析后,依次查看长度、词频、字符分类和可读性相关栏目。
结果应包含文本长度统计、归一化词频列表、不同词语数量、字符分类计数、可读性估算,以及最长词、平均词长和时间估算等相应栏目。
使用限制
- 可读性估算仅针对超过五个词的文本,且基于启发式规则;相同长度的最长词,其显示顺序不固定。
常见错误
- 常见问题是只输入空格或换行后,期待出现可读性等级。原因是这类内容按空白输入处理;请改为输入超过五个词的非空文本,再查看可读性估算。
常见问题
不输入文本时会发生什么?
当输入为空或只含空白时,统计数值会返回零,可读性等级不可用,词语列表为空,阅读和朗读时间估算为零。
为什么短文本没有可读性结果?
只有文本超过五个词时才会进行可读性估算;五个词或更少的文本不应期待可读性分数。
最长词列表的顺序固定吗?
如果多个最长词长度相同,它们的先后排列没有得到固定保证,因此应关注词形和长度,不要据显示顺序判断优先级。