没有PDF 书签 的扫描 PDF 是一个黑匣子。读者如果不滚动每一页就无法跳转到特定的章节或部分。为 200 页的扫描文档手动添加书签和目录需要花费数小时点击页面并输入章节标题。 AI PDF工具现在可以分析扫描的内容,识别章节标题和分节符,并自动生成书签和目录,将人工工作时间缩短为人工智能处理和验证的几分钟。
人工智能方法分两个阶段进行。首先,OCR PDF从扫描图像中提取文本。然后,人工智能分析读取提取的文本,识别结构模式,例如重复出现的标题样式、编号部分和主题更改,并提出书签层次结构。生成的书签需要人工验证,但人工智能会进行劳动密集型工作,查找每个部分的开始位置和名称。
WukongPDF 的 PDF 工具支持扫描文档的 OCR 处理和书签生成。

步骤 1:对扫描的 PDF 进行 OCR
在人工智能分析文档结构之前,必须从扫描图像中提取文本。使用前面章节中描述的任何工具对扫描的 PDF 运行 OCR:Acrobat Pro、Tesseract 或 OCRmyPDF。 OCR 步骤会生成一个可搜索的 PDF,其文本位于页面图像后面。 OCR输出的质量直接影响AI生成书签的质量。如果 OCR 误读了章节标题,书签将反映错误。
对于具有混合扫描质量的文档,请以 400 DPI 运行 OCR 以获得最高的文本识别精度。请特别注意每个新部分的前几个单词,其中通常包含将成为书签的标题文本。如果每章的首页是带有装饰字体或背景图案的扫描图像,这些页面上的 OCR 准确度可能会低于纯文本页面。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
使用 Acrobat Pro 的自动书签功能
Acrobat Pro 可以根据文本格式模式生成书签。打开可搜索的 PDF 并转到“书签”面板。单击选项菜单并选择从结构新建书签。 Acrobat 分析标记的文档结构并创建与标题层次结构匹配的书签。如果 PDF 未标记,请改用“从页面文本新建书签”,它会分析字体大小和样式以识别可能的标题。
实际上,自动生成的书签只是一个起点,而不是成品。展开书签树并查看每个条目。重命名 OCR 误读的书签。删除误报的书签,例如被解释为标题的页码。对嵌套在层次结构中错误级别的书签重新排序。人工智能得到的结构大致正确。人工审核使其完全正确。
人工智能驱动的语义书签生成
较新的人工智能工具不仅限于字体分析,还可以理解文档的语义结构。他们阅读全文并确定主题边界,而不仅仅是格式更改。以整页图像开头且没有标题文本的章节可能会被基于字体的分析错过,但会被语义分析识别,因为主题发生了变化。这些工具可通过云人工智能服务和一些企业文档管理平台获得。
语义分析还改进了书签标签。人工智能可以生成像第 3 章:实验结果这样的描述性标签,而不是使用页面顶部的任何粗体文本,即使这些单词没有一起出现在文档中。标签是根据上下文合成的,提供比原始文本提取更有用的书签。
从书签生成目录
创建并验证书签后,从中生成目录页面。在 Acrobat Pro 中,可以将书签导出到文本文件,在文字处理程序中将其格式化为 TOC 页,然后使用“合并文件”工具将其插入到 PDF 的开头。可以使用 Acrobat 的链接工具将 TOC 条目链接到相应的页面,从而创建与书签结构匹配的可单击 TOC。
在文档工作流程中,为了重复处理类似格式的扫描文档,可以通过脚本自动生成书签和创建目录。使用 pikepdf 库的 Python 脚本可以读取 OCR 输出、使用正则表达式识别标题模式、创建 PDF 书签对象并将其插入文档中。基于脚本的方法可处理数百个具有一致标题模式的扫描 PDF,无需人工干预。
| 方法 | 工作原理 | 准确度 |
|---|---|---|
| Acrobat 自动书签 | 检测文本模式,例如粗体标题 | 适合格式清晰的文本 |
| 人工智能驱动的语义分析 | 分析内容含义以识别部分 | 更适合各种格式 |
| 混合:人工智能+人工审核 | 人工智能生成,人类验证并纠正 | 最适合重要文件 |
限制以及何时仍需要人力
人工智能书签生成最适合结构清晰、一致的文档:教科书、报告、手册和标题遵循可预测模式的正式文档。它对于结构不规则的文档效果较差,例如杂志、时事通讯和创意布局,其中部分边界是视觉而不是文本。对于这些文档,人工智能提供了一个粗略的起点,需要比自动化节省的时间更多的人工纠正。
在实践中,如果文档在导航错误可能产生后果的环境中使用,例如法律备案、监管提交或医疗记录,则应披露人工智能生成的书签的准确性。文档元数据中的注释指出书签是人工智能生成和人工审核的,这提供了透明度,并为依赖书签结构进行导航的读者设定了适当的期望。
AI 生成的书签和目录将扫描的 PDF 从平面图像序列转换为可导航文档。人工智能完成寻找部分边界的劳动密集型工作。人工审核员提供准确性验证。他们一起制作专业的书签文档,所需时间仅为手动书签所需的一小部分。
将人工智能生成的书签与人类创建的书签进行比较
当涉及文档工作流程时,对于示例文档,手动创建书签并与 AI 生成的书签进行比较。比较揭示了人工智能的优势(通常是一致性和速度)和劣势(通常是模糊的标题和不规则的部分结构)。了解人工智能的性能有助于校准人工审核工作。
随着人工智能模型通过对更多文档进行训练并接受更正来改进,差距正在缩小。人类的角色从纠正许多错误转变为验证可接受的输出,这比从头开始创建书签更快、更简单。
人工智能生成的书签对于数字化项目特别有价值,因为数以千计的扫描文档需要导航。这种规模的手动书签是不可行的。人工智能处理和采样验证使得大规模导航可以在预算内实现。
实际上,OCR 和人工智能书签的结合将扫描的档案变成了可导航的数字图书馆。研究人员可以浏览书签树以了解结构、跳转到感兴趣的部分以及在集合中搜索术语。
随着人工智能文档分析工具变得更加复杂,人工智能和人类创建的书签之间的差距将会缩小。未来的工具可能会生成与细心的人类审阅者创建的书签没有区别的书签。
书签生成是人工智能文档理解的一种应用。识别部分边界的相同技术还可以生成摘要、提取关键发现以及识别集合中文档之间的关系。
在大多数工具中,人工智能生成的书签的质量阈值取决于文档用例。法律文件要求近乎完美的准确性。内部参考文档容忍偶尔出现的错误,人类读者可以即时纠正。
根据组织特定的文档格式训练自定义 AI 模型可以提高书签的准确性。该模型学习组织文档中使用的特征标题模式、字体选择和章节编号约定。
对于公开发布的文档,人工智能生成的书签应包含一个可见的注释,表明它们是自动生成的。该披露管理读者的期望并鼓励报告错误以进行纠正。
通常,书签生成过程可以集成到文档摄取管道中。当新的扫描文档进入系统时,OCR 和 AI 书签会在文档提供给用户之前自动运行。
人工智能书签减少了扫描的馆藏可导航的障碍。当人工智能处理大部分工作时,以前因手动添加书签而成本高昂的项目变得可行。
在这种情况下,实际上,生成书签的相同人工智能分析还可以建议文档元数据,例如标题、作者和主题关键字。书签层次结构通常揭示可以推断元数据的文档逻辑结构。
在文档处理方面,对于历史文档集合,人工智能书签必须应对过时的字体、下降的扫描质量和非标准布局。历史文献的准确性低于现代文献。
应系统地收集浏览人工智能书签文档的用户的反馈。用户关于不正确书签的报告会反馈到人工智能训练管道中,从而提高未来文档的准确性。
人工智能驱动的文档分析并不是取代人类判断,而是人类能力的放大器。人工智能在几分钟内处理数千页,识别模式和结构。人类审阅者利用人工智能所缺乏的上下文理解来验证输出。他们共同取得了任何一方都无法单独取得的成果。
AI 生成的书签将平面扫描的 PDF 转换为可导航文档。人工智能可以识别需要花费几个小时才能手动找到的部分边界。人工审核员验证准确性并纠正边缘情况。该合作伙伴关系可以在很短的时间内生成带有专业书签的文档。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
