指南

如何从文本中提取 HTTP 和 HTTPS 链接并去重

粘贴文字并提交后,工具会按匹配范围提取其中的小写 http 或 https 地址。默认设置会按首次出现顺序去重,需要保留重复项时再关闭去重。

工具 提取 URL 链接

先确认输入范围

这款工具适合整理聊天记录、日志片段、文档内容或网页文字中的网络地址。它会扫描你提供的文本,寻找以小写 http 或 https 协议标记开头、并符合字符边界的地址样式内容;处理重点是输入文字本身。文本可以不填写,适合先熟悉结果形式,也适合处理暂时没有匹配内容的材料。

按顺序提取地址

  1. 准备一段需要整理的文字,内容可以来自聊天记录、日志或其他文档。2. 将文字粘贴到输入区域;该输入不是必填项。3. 检查去重设置,默认保持仅保留不同结果的选项开启。4. 保持默认设置提交后,重复出现的地址只保留第一次遇到的那一项,并按照它们在原文中的首次出现顺序排列。5. 如果整理目标需要保留每次出现的记录,请关闭仅保留不同结果的选项,再提交相同文字。6. 查看处理状态和结果数量;基础文本处理会返回成功结果,空文本也会成功完成,但不会得到提取地址。

读懂列表与数量

先看结果列表,再根据去重状态判断总数代表什么。开启去重时,总数表示保留下来的不同匹配项数量,不等于原文中地址出现的次数;关闭去重时,重复匹配会继续出现在结果里。若某段文字没有被提取,先检查开头是否使用了小写的 http 或 https 协议标记,再检查中间是否出现空白或受支持的分隔字符。提取结果只说明文字符合当前匹配范围,不表示地址已经被访问、验证或确认可用。该能力不使用网络访问。

使用示例

一名编辑需要从采访记录中整理正文出现的 HTTP 和 HTTPS 地址。

将一段采访记录粘贴到输入区域,其中包含两个相同的 HTTPS 地址和一个 HTTP 地址,保持默认去重设置后提交。

结果呈现去重后的地址列表和总数;开启默认去重时,相同的 HTTPS 地址只保留它在原文中第一次出现的位置。

使用限制

  • 当前范围不涵盖裸域名或其他协议,提取本身也不代表地址可访问;该能力不使用网络访问。

常见错误

  • 把裸域名或其他协议地址当成可提取内容时,结果可能没有对应项目;请改为检查地址开头的小写 http 或 https 协议标记,并留意空白及受支持分隔符造成的边界。

常见问题

不输入文字也能处理吗?

当文本为空时,处理仍会成功完成,提取列表为空,结果总数为零。

怎样保留重复地址?

当你关闭仅保留不同结果的选项后,同一地址的多次出现会分别留在结果中。

它能提取所有链接吗?

当前范围只覆盖以小写 http 或 https 协议标记开头、并受空白和支持分隔符限制的内容,因此裸域名及其他协议不能按已支持范围处理。

工具

提取 URL 链接