Tips & Tricks

如何使用 OCR 将扫描的纯图像 PDF 转换为可编辑的 Word 文档

您的 PDF 只不过是扫描图像。每一页都是一张纸的照片。您需要将其转换为可以编辑、搜索和格式化的真实 Word 文档。复制和粘贴不起作用,因为没有要复制的文本。用手重新打字 40 页并不是一个严肃的选择。唯一实用的途径是 OCR、光学字符识别以及尊重原始布局的转换。

该流程已经完善,工具也很成熟,但输出的质量在很大程度上取决于输入的质量以及您在转换过程中所做的选择。对简单键入的文档进行干净、高分辨率的扫描,即可以近乎完美的精度转换为可编辑的 Word 文件。包含表格、列和手写笔记的复杂布局的低分辨率扫描在转换后需要清理。了解每个质量级别的期望可以防止当输入质量太差以至于任何 OCR 引擎都无法很好处理时认为工具失败了。

How to Convert a Scanned Image-Only PDF Into an Editable Word Document Using OCR

将扫描件转换为 Word 时 OCR 实际执行的操作

OCR 转换是一个两阶段的过程。在第一阶段,OCR 引擎分析扫描的图像并识别包含文本、图像、表格和其他内容类型的区域。此布局分析步骤至关重要,因为它决定了输出文档的阅读顺序和结构。如果引擎将两列布局误认为是单列,则输出会将左右列的句子交错成乱码。

在第二阶段,引擎逐个字符地处理每个文本区域,将像素模式与已知的字母形式进行匹配。 PDF 协会的 2025 年基准发现,在经过测试的引擎中,以 300 DPI 扫描干净的输入文本时,OCR 准确度范围为 95% 到 99% 以上(PDF 协会,“OCR 准确度基准报告”,2025 年)。按照这样的准确率,典型的 2,500 个字符的页面将包含 25 到 125 个错误。大多数错误都出现在视觉上不明确的字符上:数字 1 与字母 l、字母组合 rn 与单个 m 或因扫描伪影而部分模糊的标点符号。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

设置最佳可能的转换

在您接触 OCR 软件之前,您可以做的对提高转换质量最有影响力的事情就是:以 300 DPI 或更高的分辨率进行扫描。内华达大学拉斯维加斯分校 2018 年的一项研究发现,300 DPI 扫描的 OCR 准确度平均为 97.5%,而同一文档的 150 DPI 扫描平均为 87.2%(UNLV,“图像分辨率对 OCR 准确度的影响”,2018 年)。 10 分的准确度差距是可以通过快速拼写检查清理的文档与需要大量手动更正的文档之间的差异。

除了分辨率之外,其他一些预扫描习惯也能带来回报。将文档平放在扫描仪床上并垂直对齐,以避免倾斜。对文本文档使用灰度或黑白模式而不是彩色模式,因为 OCR 引擎可以更快、更准确地处理单色输入。取出会投射阴影或模糊文本的订书钉、回形针和便利贴。如果您正在扫描书籍或装订文档,请将书脊平压在玻璃上,以最大程度地减少 OCR 引擎经常将其误认为字符或单词边界的深色装订线阴影。

逐步将扫描的 PDF 转换为 Word

由于 OCR 技术已经成熟,运行转换本身只需几个步骤。使用WukongPDF,您可以上传扫描的 PDF,选择 OCR 选项,然后选择 Word 作为输出格式。该工具对扫描的页面执行 OCR 并将识别的文本导出到 .docx 文件中。整个过程在浏览器中运行,因此无需安装软件,并且文件不会离开您的设备以在远程服务器上进行处理。

如果您更喜欢桌面软件,Adobe Acrobat Pro 的导出 PDF 功能的工作原理类似:打开扫描的 PDF,选择导出到,选择 Microsoft Word,Acrobat 在生成 Word 文件之前自动运行OCR PDF。桌面方法具有批处理的优点。您可以将整个扫描 PDF 文件夹排队过夜进行转换,并在早上返回装满 Word 文档的文件夹。

免费工具也可以完成这项任务。 Google Drive 会自动对上传到其中的任何图像或 PDF 进行 OCR,但输出是 Google Doc,而不是 .docx 文件。对于简单布局来说,转换质量是可以接受的,但对于表格、列和混合内容来说,转换质量通常会很困难。然后可以将 Google 文档下载为 .docx 文件,以便在 Word 中进行编辑。这个两步路线有效并且不需要任何成本,但是从扫描到 Google Doc、Google Doc 到 Word 两次转换中累积的格式漂移意味着您应该花时间重新格式化最终文档。

输出结果以及如何清理

预先设定期望。你将为自己节省数小时的挫败感。 OCR 引擎识别文本。它不会重新创建原始文档的格式。原始 PDF 中的字体将替换为类似的系统字体。段落间距、边距和缩进将反映 OCR 引擎对原始布局的最佳猜测,而不是像素完美的再现。表格可能以制表符分隔的文本形式出现,而不是实际的 Word 表格对象。原始扫描中的图像将被省略或嵌入为其源区域的裁剪屏幕截图。

从结构开始,然后解决外观问题。该顺序最节省时间。扫描文档并修复列或侧边栏合并到正文中的任何阅读顺序问题。检查标题是否被识别为标题,而不是作为粗体段落转储到正文中。验证编号列表和项目符号列表是否仍保留为列表。解决结构问题后,运行拼写检查以捕获 OCR 错误。大多数文字处理器会自动标记无法识别的单词,从而使 OCR 错误易于发现和修复。最后,将所需的格式、字体、边距和样式应用到结构干净的文档中。

OCR 转换遇到困难时以及如何处理

无论您使用什么工具,某些类型的文档都会可靠地挑战 OCR 引擎。手写文本仍然是最难的情况。尽管近年来人工智能手写识别技术有了显着提高,但打字文本和手写文本之间的准确性差距仍然很大。如果您的扫描的 PDF 大部分包含手写内容,则需要在转换后进行大量的手动校正,或者考虑您是否真正需要可编辑的文本,而不是仅仅需要可搜索的图像 PDF。

布局复杂的文档、多栏学术论文、报纸页面、文本分散在标签框中的表格也会产生不一致的结果。 OCR 引擎必须决定阅读顺序,并且在复杂的页面上,该顺序可能与预期的人类阅读顺序不匹配。一种实用的解决方法是在运行 OCR 之前将扫描裁剪或屏蔽为更小的单列区域,然后重新组合单独的输出。这需要更多的前期时间,但会产生一个非常清晰的最终文档。

打印在彩色或纹理纸上的文档,或者带有水印、邮票或厚重背景图案的文档,会混淆将文本与背景分开的阈值算法。结果是文本中充满了伪影、合并的字符或虚假标点符号,其中背景元素被错误地识别为文本。以较高对比度设置或灰度重新扫描通常会有所帮助,就像在运行 OCR 之前在图像编辑器中对扫描结果进行数字清理一样。增加亮度和对比度,将背景推向纯白色,同时保持文本深黑色,为 OCR 引擎提供最干净的输入。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →