PDF 包含数十个指向网站、电子邮件地址和内部文档参考的超链接。您需要每个链接的列表以进行验证、存档或重新利用。手动单击每个链接并复制 URL 非常繁琐且容易出错。 PDF链接提取工具从PDF中读取链接注释并将其导出到结构化列表。
PDF 中的超链接存储为链接注释,它们是页面上具有关联操作的对象。该操作通常是打开网址或电子邮件客户端的 URI 操作。提取工具读取这些注释,提取 URL,并将它们编译成列表。

PDF 超链接如何存储
PDF 链接注释有两个组件:页面上定义可单击区域的矩形区域,以及单击该区域时执行的操作。 URI 操作存储目标 URL。链接还可能具有可见文本,即带有下划线或彩色的单词,但 URL 存储在操作中,而不是存储在可见文本中。
内部链接使用 GoTo 操作导航到文档中的特定页面或指定目标。这些不是 URL,而是 PDF 内部导航命令。提取工具可以报告内部链接的目标页码或命名目标。
从链接注释中提取 PDF 数据 需要一个可以在对象级别解析 PDF 结构的工具。通用文本提取工具看不到链接注释,因为注释不是页面内容。需要专用的链接提取工具。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
提取和导出链接
将 PDF 加载到链接提取工具中。该工具扫描每个页面的链接注释并编译结果。每个条目通常包括页码、可见链接文本(如果可用)、URL 或目标以及链接类型(Web、电子邮件或内部)。
WukongPDF通过浏览器提供PDF导出工具。链接提取可作为文档分析功能的一部分。
组织提取的链接列表
将提取的链接导出到 CSV 或 Excel 文件以进行排序和过滤。按类型对链接进行分组:外部网站、电子邮件地址和内部文档引用。通过测试示例来验证每个外部链接。旧版 PDF 中的链接可能指向不再存在的网站。
使用链接列表进行验证和维护
对于已发布的文档,链接列表可作为质量保证工具。验证每个链接都导航到预期目的地并且没有链接损坏。更新源文档中断开的链接并重新生成 PDF。
对于存档的 PDF,链接列表记录了文档在发布时引用的外部资源。即使链接的资源不再可用,该信息也具有历史价值。
处理特殊链接类型
使用 mailto: URL 的电子邮件链接应通过向每个提取的电子邮件地址发送测试消息来验证。旧版 PDF 中的电子邮件地址可能不再有效。链接提取会报告 PDF 中显示的地址,而不验证该地址是否仍然有效。
执行代码而不是导航到 URL 的 JavaScript 链接无法提取为简单 URL。提取工具报告 JavaScript 操作存在,但无法确定其目标。这些链接需要手动检查才能了解其用途。
打开 PDF 中嵌入文件的文件附件链接是内部引用,而不是外部 URL。提取工具报告附件名称,但无法提取 URL。要访问附件,请打开 PDF 并使用附件面板。
大型文档的自动链接验证
对于具有数百个链接的文档,自动链接检查可以节省数小时的手动验证时间。将链接列表导出为 CSV,然后使用链接检查器工具读取 CSV 并测试每个 URL。检查器报告哪些链接返回错误、重定向或响应缓慢。
分发的 PDF 中的损坏链接会造成较差的阅读体验,并表明该文档已过时。为主动分发的 PDF 安排定期链接验证。使用更正的链接更新源文档并重新生成 PDF。
PDF 作为网站的一部分,链接验证过程可以与网站链接检查工作流程集成。验证网站链接的相同工具可以处理提取的 PDF 链接列表,从而为所有已发布内容提供统一的链接运行状况报告。
提取的链接列表还可以用作文档的站点地图,显示文档如何连接到外部资源。这种文档参考的网络视图对于理解文档范围和识别可能需要与文档一起存档的资源非常有价值。
链接提取报告应区分在可见页面文本中找到的链接和仅存在于没有可见文本的 PDF 结构中的链接。当链接注释覆盖页面上没有文本内容的区域时,可能会出现不可见链接。
PDF 页眉和页脚中的链接(例如页脚中在每页上重复的 URL)会在提取报告中多次出现。对这些重复链接进行分组可以避免多次报告相同的 URL。
使用 IP 地址而不是域名的链接目标应在提取报告中标记。 IP 地址链接可能表明 PDF 是在目标服务拥有正确的域名之前创建的。
当提取的链接列表将与 PDF 一起发布时,请验证是否无意中包含了任何内部或管理 URL。链接提取可以揭示不适合公众可见的 URL。
链接提取过程还可以识别文档中不再存在的引用页面或指定目的地的损坏的内部链接。这些损坏的内部链接对于读者来说是导航死胡同。
对于属于较大文档集合一部分的 PDF,请合并从所有文档中提取的链接列表以创建主链接索引。该索引显示哪些文档引用了哪些外部资源。
对提取的 URL 进行正则表达式匹配可以识别遵循特定模式的链接,例如指向特定域的链接、带有跟踪参数的链接或使用已弃用的协议(如 HTTP)的链接。
提取的链接列表是元数据工件,应与 PDF 一起存档。未来的研究人员可以使用链接列表来了解文档上下文和参考文献,而无需手动打开每个链接。
某些 PDF 创建工具将链接信息作为镜像链接目标的文本嵌入到文档中。该文本可能会出现在可点击链接旁边或下方,并且即使没有链接注释访问权限也可以通过文本提取来提取。
为了符合辅助功能要求,PDF 中的每个链接都应该有一个可识别的替代文本来描述链接的用途。链接提取报告可用于审核整个文档中的链接可访问性。
| 链接类型 | PDF 操作 | 提取输出 | 验证 |
|---|---|---|---|
| 外部网址 | URI 操作 | 完整网址 | 测试链接;检查重定向 |
| 电子邮件(邮寄地址:) | URI 操作 | 电子邮件 | 发送测试消息 |
| 内部页面参考 | 转到操作 | 页码或指定目的地 | 点击验证导航 |
| JavaScript 链接 | JavaScript 动作 | 操作代码(不是 URL) | 需要人工检查 |
链接失效是指由于目标页面被删除或重组而导致超链接随着时间的推移而停止工作的现象,它会像影响网页一样影响 PDF。今天执行的链接提取可能会在几年后用于审核存档 PDF 中的哪些链接仍然有效。
从包含多个嵌入文档的 PDF 包中提取链接时,每个嵌入文档都有自己的一组链接。提取工具应单独处理每个嵌入文档,并使用源文档名称标记提取的链接。
使用 bit.ly 或 t.co 等 URL 缩短器的链接会掩盖实际目的地。提取报告包括 PDF 中的缩短 URL。将缩短的 URL 解析到最终目的地并将两者都包含在报告中,可以提供每个链接指向何处的完全透明度。
提取的链接列表可以导入到电子表格中并按域排序。按域排序可以揭示文档最常引用的外部网站。主要链接到一个域的文档可能与该组织有赞助或从属关系。
对于可访问性审核,链接提取报告可以识别缺乏描述性文本的链接。可见文本为“单击此处”或“阅读更多”的链接不提供有关其目的地的上下文。应在源文档中更新这些非描述性链接,以包含有意义的链接文本。
政府和法律 PDF 通常包含法规、法规和法院判决的链接。这些文档的链接提取报告充当权限表,列出每个法律引用及其 URL 以供验证。
链接提取是一种简单但强大的功能,可将静态 PDF 转换为可验证、分析和重新利用的结构化参考数据集。
提取的链接列表可作为文档的质量保证工具,并作为想要探索引用来源的读者的参考资源。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
