Tips & Tricks

如何对扫描的 PDF 进行 OCR 使其可搜索

How to OCR a Scanned PDF to Make It Searchable

OCR 对扫描的 PDF 有何作用

光学字符识别将扫描的PDF(页面图像的集合)转换为可搜索文档。

OCR PDF流程分析每个页面图像,识别字符的形状,并在页面图像后面创建不可见的文本层。 OCR 后,您可以搜索文档中的单词、选择和复制文本,以及使用屏幕阅读器朗读文档。

OCR 将被动的文本图像转换为支持文本选择和屏幕阅读器的主动、可搜索文档。

OCR 的准确性直接取决于原始扫描的质量,干净的 300 DPI 扫描可产生最佳结果。

没有 OCR 的扫描 PDF 就像一本文本相册。您可以查看这些文字,但无法与它们互动。您无法搜索特定术语。您不能复制段落来引用它。您无法使用屏幕阅读器。 OCR 增加了交互功能,使数字文档的用途超越了简单的查看。

OCR 的准确性取决于原始扫描的质量。在 300 DPI 下进行干净、高分辨率的扫描,加上均匀的照明和清晰的焦点,可为标准打印文本提供 99% 以上的 OCR 准确度。低分辨率扫描、以一定角度拍摄的文档照片或褶皱或污渍原件的扫描会产生较低的精度。扫描质量直接决定OCR输出的质量。

OCR 添加的PDF 可搜索 文本图层与页面图像是分开的。 OCR 后 PDF 的视觉外观不会改变。该页面看起来仍然像扫描图像。在该图像的背后,已识别的文本作为搜索引擎、屏幕阅读器和文本选择工具可以访问的不可见字符数据存在。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

如何在不同设备上对扫描的 PDF 运行 OCR

在 Windows 上,Adobe Acrobat Pro 可以对扫描的 PDF 运行 OCR。打开 PDF,选择扫描和 OCR 工具,然后选择识别文本。 Acrobat 处理每个页面、识别文本并添加可搜索文本图层。保存文件。 PDF 现在支持搜索和文本选择。 Acrobat Pro 提供 Windows 上最准确的 OCR。

在 Mac 上,内置预览应用程序不包含 OCR。多个第三方 Mac PDF 工具提供 OCR 功能。 PDF Expert 和 PDFpen 都包含 OCR 引擎,可处理扫描的 PDF 并添加可搜索的文本层。 OCR 质量可与标准文档的 Windows 工具相媲美。

WukongPDF 的基于浏览器的 OCR 工具适用于任何操作系统。上传扫描的 PDF,选择 OCR 引擎的文档语言,然后运行识别。处理完成后下载可搜索的 PDF。基于浏览器的方法使 OCR 无需安装软件即可访问。

对于 iPhone 和 Android,包含 OCR 的扫描仪应用程序会在捕获期间处理扫描。 Adobe Scan、Microsoft Lens 和 iPhone Notes 应用程序中的内置扫描仪都会在扫描文档时自动执行 OCR。扫描后生成的 PDF 可立即搜索,无需单独的 OCR 处理步骤。

提高有挑战性文档的 OCR 准确性

运行 OCR 之前选择正确的文档语言。 OCR 引擎使用特定于语言的词典和字符频率数据来解析不明确的字符。使用法语设置对法语文档运行 OCR 比使用英语设置产生更好的结果。对于多语言文档,选择主要语言并手动更正次要语言段落中的错误。

在 OCR 之前对扫描页面进行歪斜校正。稍微旋转的扫描页面,即使是一两度,也会降低 OCR 准确性,因为 OCR 引擎期望文本行是水平的。大多数扫描软件都具有自动纠偏功能。如果扫描在捕获过程中未进行歪斜校正,请在运行 OCR 之前对 PDF 页面进行歪斜校正。

提高文本较小或布局复杂的文档的扫描分辨率。低于 10 点的文本需要更高的扫描分辨率才能实现准确的 OCR。对于大多数文档来说,300 DPI 的扫描速度就足够了。对于包含 8 点或更小的文本的文档,请以 400 或 600 DPI 扫描,以便为 OCR 引擎提供足够的像素数据来区分各个字符。

对于具有混合内容类型的文档,例如将文本与照片或插图相结合的页面,OCR 引擎应配置为仅识别文本区域。尝试从图像区域识别文本会产生垃圾字符。大多数 OCR 工具都包含区域选择功能,可让您指定哪些页面区域包含文本。

验证和纠正 OCR 输出

OCR 完成后,通过搜索页面上可以看到的几个单词来验证输出。如果搜索找到它们,则 OCR 成功。如果搜索遗漏了明显的单词,则 OCR 准确性可能不足以满足该页面的特定字体、布局或图像质量。

对于 OCR 准确性至关重要的文档(例如必须完全可搜索的法律或医疗记录),请手动检查已识别的文本。某些 PDF 工具允许您查看和编辑隐藏文本图层。纠正识别错误,特别是 OCR 引擎更可能误识别的专有名称、数字和技术术语。

最常见的 OCR 错误涉及字符混淆。字母 l 和数字 1 在许多字体中看起来都很相似。字母 rn 在一起看起来像字母 m。

字母 cl 看起来像字母 d。这些字符混淆产生的单词在视觉上与原始单词相似但在文本上是错误的。手动检查关键部分可以发现这些错误。

验证 OCR 输出后,使用表明已使用 OCR 处理的文件名保存文档。像 Report-OCR.pdf 或 Report-Searchable.pdf 这样的文件名将可搜索版本与原始的纯图像扫描区分开来。

当您第一次需要在大型文档中查找特定信息时,可搜索扫描 PDF 的实际好处就变得显而易见。没有 OCR 的 200 页扫描合同需要手动阅读每一页以查找特定条款。可搜索版本可在几秒钟内找到该子句。对于任何您希望多次参考的文档,OCR 投资都是值得的。

经过 OCR 处理的 PDF 也可供屏幕阅读器访问,使依赖辅助技术阅读文档的视障人士也可以使用它们。屏幕阅读器完全无法访问没有 OCR 的扫描 PDF,因为没有文本可供朗读。添加 OCR 使文档易于访问,这是包括第 508 条和 WCAG 在内的可访问性标准所要求的。

对于英语以外语言的文档,请在处理前选择正确的 OCR 语言。 OCR 引擎使用特定于语言的字符识别模型。使用日语模型识别的日语文档比使用英语模型识别的相同文档产生更好的结果。

OCR 还可以提取文本以便在其他文档中重复使用。当您需要在自己的报告中引用扫描文档中的段落时,OCR 可以使文本可复制。如果没有 OCR,您将需要手动重新输入该段落。通过 OCR 处理的文档进行复制和粘贴,可以显着节省时间。

对于要存档的扫描文档,OCR 是必不可少的保存步骤。目前存档的纯图像扫描 PDF 不为未来的研究人员提供搜索功能。可搜索的 PDF 允许通过文本搜索访问文档内容,从而显着提高文档对未来用户的实用性。

OCR 后 PDF 的文件大小不会发生明显变化。 OCR 数据向每页添加少量文本数据,通常每页几千字节。原始页面图像保持不变。对于可搜索文本层提供的功能改进来说,文件大小的增加可以忽略不计。

OCR 添加的可搜索文本层与可视页面图像是分开的。当您在 OCR 处理的 PDF 中搜索单词时,搜索会匹配文本图层,而不是图像。搜索结果会突出显示页面图像上找到文本的区域。

经过 OCR 处理的 PDF 支持文本到语音阅读,使有视觉障碍的人以及任何喜欢听文档而不是阅读文档的人都可以阅读它们。除了简单的可搜索性之外,这种辅助功能是 OCR 的一个显着优势。

对于涉及数百或数千个扫描页面的大型 OCR 项目,批量 OCR 处理可节省大量时间。配置 OCR 设置一次并将其应用到整个文档批次。检查页面样本的准确性,而不是检查每个页面。

OCR 文本图层可以导出为纯文本文件,从而允许文档内容在其他应用程序中使用。导出已识别的文本,在文本编辑器或文字处理程序中打开它,并将其用作新文档的基础。

每次您需要在文档中查找信息时,OCR 处理的 PDF 的长期价值都会得到体现。合同、手册或参考文档的可搜索 PDF 成为您可以查询的资源,而不是必须手动阅读的静态文件。

将 OCR 实施作为文档扫描工作流程中的标准步骤可确保您数字化的每个文档从进入数字图书馆的那一刻起就可以搜索。每次您需要在扫描过的任何文档中查找信息时,扫描过程中额外几秒钟的 OCR 处理都会带来好处。

对于管理数字文档库的任何人来说,OCR 是可应用于扫描 PDF 的最有影响力的处理步骤。它将被动图像文件转换为主动、可搜索、可访问的文档。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →