如何从文本中提取所有 URL 和链接
无论您是审核页面的链接、从文档中收集来源,还是从导出中提取每个链接,目视扫描文本并一次复制一个 URL 都是乏味且容易出错的。一次将它们全部提取出来,就可以将繁琐的工作变成一个简单的步骤。以下是链接提取的工作原理以及它真正有用的地方。
它是如何运作的
URL 提取器会扫描您的文本并提取与 Web 链接形状匹配的所有内容,即以 http:// 或 https:// 开头,后跟域和路径的所有内容。它清楚地列出了每一项,每行一项,并删除了重复项。粘贴文章、文档、原始 HTML 源代码、聊天导出或任何包含链接的文本,您只需返回 URL。它比通读文本寻找链接要快得多、更可靠,而且它不会错过隐藏在段落中间的链接。
它捕获了什么,没有捕获什么
提取器匹配包含协议、http:// 或 https:// 前缀的 URL,其中涵盖标准的完整 Web 链接。它通常不会匹配没有协议编写的裸域,例如“example.com”本身,因为它们在纯文本中是不明确的; “example.com”可以是句子的结尾或文件名。如果您的来源有未使用协议编写的链接,您可能需要添加它。对于绝大多数真实链接(包括协议),提取是可靠的。
链接提取有用的地方
其用途涵盖多种工作。 SEO 专家从页面中提取所有链接,以审核它们是否存在损坏或可疑的目标。研究人员从文档中提取每个源 URL 来检查或存档它们。开发人员从 HTML 或日志文件中获取链接。内容团队收集草稿中的每个链接,以在发布之前验证它们是否全部有效。营销人员从导出中提取 URL 以构建参考列表。在每种情况下,一步获得完整列表才能使后续工作成为可能。
与其他工具结合
提取通常是第一步。获得 URL 列表后,您可以按字母顺序对它们进行排序以按域分组,如果合并了多个源,则删除任何剩余的重复项,或者添加前缀和后缀以将每个源包装为报告或一段代码。由于一切都在浏览器本地运行,因此您可以对机密文档执行整个工作流程、提取、排序、格式化,而无需将任何内容离开您的设备。