如何按顺序清理文本中的空格、网址和 HTML 标签
把文本放入输入区域,选择需要的清理操作并按顺序运行即可。空文本会返回空结果;不认识的选项会跳过,但部分不兼容的非空选项可能导致失败。
先了解它能处理什么
这是一款用于整理文本的清理工具,适合处理复制来的网页内容、通知文本或需要统一格式的草稿。你可以选择空格与换行整理、字符规范化、指定内容移除和重复词清理等操作。输入文本不是必需的;缺少文本或文本为空时,工具会返回空结果,不执行清理。
按顺序清理文本
- 将需要整理的内容放入文本输入区域。若暂时不提供文本,也可以提交空内容,结果会为空。
- 在清理选项中选择需要的操作,并按照希望的先后顺序排列。可选方向包括:整理每行首尾空白、合并连续空格或制表符、删除只含空白的行、统一部分 Unicode 空格;将部分弯引号改为直引号、将若干破折号统一为连字符、把单字符省略号改为三个句点、统一换行符并移除指定控制字符;移除符合工具匹配规则的 HTML 样式标签、HTTP 或 HTTPS 网址、类似电子邮件地址的文本、单个数字和部分标点;以及合并由空白分隔的紧邻重复词。
- 检查选项顺序后运行清理。已识别的选项会依次处理,因此先移除内容再整理空白,和先整理空白再移除内容,可能得到不同的文本。工具不认识的选项会跳过,不会执行对应处理。
- 如果选项输入采用文本形式,请只填写工具认可的清理选项集合。空值表示不选择操作;某些不兼容的非空内容可能导致处理失败。完成后查看输出,并抽查网址、数字、标点或标签是否仍存在,因为这些处理依据工具自身的匹配规则和字符集合。
如何理解清理结果
输出反映的是已选操作的组合,而不是对文本进行全面的安全过滤。整理空白主要改变空格、制表符、空白行和部分换行表现;字符规范化会处理列出的字符类别;内容移除只针对工具能够匹配的特定网址、类似电子邮件地址、标签、数字或标点模式。重复词清理只处理彼此紧邻、以空白分隔且大小写不敏感的重复词。
如果结果与预期不同,先核对选项是否被识别,再检查应用顺序。未识别的选项会被跳过;不兼容的非空选项内容则可能直接失败。对于需要保留数字、网址、标点或原始引号的文本,不要勾选相应的移除或规范化操作。
使用示例
你收到一段含有多余行首空白和空白行的通知文字,需要先统一排版,再交给其他工具处理。
输入“ 你好
你好 你好 ”,只选择空白整理相关操作并运行,然后检查输出的行首、行尾、连续空白和空白行。
输出中每行首尾的空白被整理,连续空格或制表符被合并,只含空白的行被移除;未选择的其他内容保持原样。
使用限制
- 工具只支持已列出的处理类别和匹配规则,不是全面的内容过滤器;网址、类似电子邮件地址、标点、控制字符或重复词若不符合相应规则,可能保留。
常见错误
- 常见问题是把不兼容的非空内容填入选项输入。请改用工具认可的清理选项集合;空值表示不选择操作,而部分不兼容内容可能导致处理失败。
常见问题
它能删除文本中的网址吗?
可以,但只会处理符合工具匹配规则的 HTTP 或 HTTPS 网址样式;不能据此推断所有网址都会被移除。
它会清理重复词吗?
可以选择重复词清理,但它只处理以空白分隔、彼此紧邻且大小写不敏感的重复词,其他重复内容可能保留。
不输入文本也能运行吗?
可以。缺少文本或文本为空时,工具会成功返回空结果,并且不应用清理操作。