Tips & Tricks

如何在保留原始文件名的同时对扫描的 PDF 批量运行 OCR

在扫描文档的文件夹上运行OCR PDF 应生成可搜索的 PDF,其名称与原始文件相匹配。当批量 OCR 工具对输出文件进行一般性重命名(如 output1.pdf、output2.pdf)时,原始版本和可搜索版本之间的连接就会丢失。通过 OCR 过程保留文件名可以使扫描的文档井然有序且可追踪。

文件名保留是一个配置细节,而不是功能限制。大多数 OCR 工具默认根据输入文件名生成输出文件名或允许指定输出命名模式。关键是在运行批处理之前找到正确的设置或命令行标志,而不是在发现 200 个文件已重命名之后。

WukongPDF的扫描的PDFOCR工具单独和批量处理文档,同时保留原始文件名。

How to Batch-Run OCR on Scanned PDFs While Keeping Original Filenames

使用 Acrobat Pro 的操作向导进行批量 OCR

Acrobat Pro 的操作向导可自动对文件夹执行多步骤 PDF 处理。转到“工具”、“操作向导”、“新建操作”。将识别文本步骤添加到操作中,选择正确的 OCR 语言和输出设置。添加“保存”步骤,将文件保存到指定的输出文件夹,并可选择附加后缀(例如 _OCR)以区分可搜索文件和原始文件。

对输入文件夹运行操作。 Acrobat 打开每个文件,运行 OCR,保存输出并将后缀附加到原始文件名,然后移至下一个文件。输出文件夹包含可搜索的 PDF,其名称类似于与原始 report.pdf 对应的 report_OCR.pdf。后缀方法保留了原始文件名,同时清楚地表明哪些文件已经过 OCR 处理。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

使用 Tesseract 进行命令行批量 OCR

Tesseract 一次处理一个图像文件。对于扫描 PDF 文件夹的批量 OCR,首先将每个 PDF 页面转换为图像,运行 Tesseract,然后重新组合成可搜索的 PDF。 shell 脚本处理管道。对于文件夹中的每个 PDF,该脚本都会提取基本文件名,将页面转换为 TIFF 图像,使用适当的语言标志运行 Tesseract,并使用原始基本文件名生成可搜索的 PDF。

该脚本使用参数扩展来去除文件扩展名:base=${f%.pdf} 给出不带 .pdf 的文件名。 Tesseract 的输出名为 $base,生成的可搜索 PDF 保存为 ${base}_searchable.pdf。原始文件名保留在输出名称中。一行循环处理整个文件夹:for f in *.pdf;做 tesseract $f ${f%.pdf} -l eng PDF;完毕。

使用 OCRmyPDF 简化批量 OCR

OCRmyPDF 是一个基于 Python 的命令行工具,可将 OCR 文本图层添加到现有 PDF 中。它在内部处理图像提取、OCR 和 PDF 重组。单个命令可处理一个 PDF:ocrmypdf input.pdf output.pdf。输出保留页面图像,并在其后面添加可识别的文本作为不可见层。

对于批处理,OCRmyPDF 接受带有 --batch 标志的文件夹路径,或者可以在 shell 脚本中循环。与 Tesseract 相比,PDF 处理的主要优势在于 OCRmyPDF 直接处理 PDF 输入和输出。不需要中间图像转换。可以为每个文件指定输出文件名,保留原始命名约定。对于大容量扫描文档数字化,OCRmyPDF 与 shell 循环相结合,提供了从原始扫描到可搜索档案的最有效路径。

工具间歇法文件名处理
Acrobat Pro 动作向导创建动作,应用于文件夹保留原始文件名,添加后缀
超立方 CLIShell for 循环遍历文件夹输出与输入文件名匹配
OCR我的PDF每个文件或批处理单个命令根据设置覆盖或创建新文件

验证批量 OCR 输出

批处理后,在归档原始文件之前验证输出文件的样本。从按字母顺序排序的文件列表的不同部分打开三到五个输出 PDF。搜索扫描图像中可见的单词。如果搜索找到该单词,则该文件的 OCR 成功。抽查每个样本文件的第一页、中间页和最后一页。如果页面具有不同的扫描质量,则文档中的 OCR 质量可能会有所不同。

当涉及文档工作流程时,对于 OCR 失败的文档(由搜索未找到任何内容的 PDF 指示),请使用调整后的设置重新运行 OCR。如果原始扫描质量较低,请将图像分辨率提高到 400 DPI。如果 Tesseract 的结果不佳,请尝试不同的 OCR 引擎。单独处理问题文件,而不是重新运行整个批次。

具有文件名保留功能的批量 OCR 将无法访问的扫描文档文件夹转换为可搜索的存档,其中每个文件都可以追溯到其原始文件。文件名是原始扫描件和 OCR 增强版之间的链接。

OCR 增强扫描 PDF 的长期存储

设置完成后,在批量 OCR 处理后,将可搜索的 PDF 存储在保留页面图像和 OCR 文本层的位置。具有嵌入文本层的 PDF/A 格式是档案标准。使用 Acrobat Pro 或 Ghostscript 以及 PDF/A 输出设置将 OCR 输出转换为 PDF/A。

实际上,OCR 文本层会增加最小的文件大小开销,通常为 5% 到 15%。为了可搜索性而牺牲稍大的文件几乎总是值得的。无法搜索的扫描文档的用处明显低于可以搜索的扫描文档。

实际上,批量 OCR 输出的目录结构应反映处理嵌套文件夹时的输入结构。保留相对路径结构的递归批处理脚本可确保 OCR 增强型文件保持与原始文件相同的组织层次结构。

就文档工作流程而言,对于包含数千个文档的超大型批量 OCR 项目,请考虑将工作负载分散到多个会话或计算机上。 OCR 计算量大,一批一万页在单台机器上可能需要几个小时。

设置完成后,在完成批量 OCR 项目后,生成一个处理清单,列出每个输入文件、其输出文件、所使用的 OCR 引擎和设置以及处理日期。清单充当文档和已处理文件的记录。

实际上,从不可搜索的扫描档案到可搜索的 OCR 增强馆藏的转变是影响最大的数字化活动之一。搜索以前无法访问的文档的能力将它们从静态记录转变为活跃的信息资源。

OCR 处理速度因文档复杂程度而异。纯文本页面处理速度很快。带有表格、混合字体或装饰元素的页面需要更长的时间。一批统一的文本页面比一批不同的内容完成得更快。

在大多数工具中,OCR 语言设置会影响批处理时间和准确性。仅选择文档中实际存在的语言可以避免不必要的处理开销,并减少未使用的语言模型中的错误字符识别。

对于同时包含文本和照片的文档,OCR 引擎可能会尝试识别照片区域中的文本,从而产生噪声字符。 OCR 后过滤通过分析已识别文本的空间分布来消除这些伪影。

通常,OCR 输入图像的 DPI 设置会平衡处理速度和准确性。 300 DPI 是标准建议。 400 DPI 提高了小文本的准确性。 200 DPI 处理速度更快,但可能会丢失精细字符。

批量 OCR 后,使用已知出现在原始文件中的术语对处理后的文件运行关键字搜索测试。未找到关键字的文件需要通过调整设置或手动审核来重新处理。

OCR 输出文件应存储在将处理后的文件与原始文件分开的文件夹结构中。这可以防止意外重新处理已经 OCR 增强的文件并保持存档井井有条。

在这种情况下,实际上,OCR 文本层可以被提取并单独存储为每个文档的纯文本文件。单独的文本文件支持在整个存档中进行全文搜索,而无需单独打开每个 PDF。

对于文档处理,对于高价值的扫描档案,请考虑使用两种不同的引擎运行 OCR 并比较输出。引擎之间的差异突出了需要手动验证的不确定识别。

批量 OCR 是纸质档案和数字搜索之间的桥梁。纸质文档文件柜经过扫描和 OCR 处理后,就成为可搜索的知识库。从物理到可搜索数字的转变是组织可以做出的最有影响力的信息管理转型之一。

具有文件名保存功能的批量 OCR 是无法访问的扫描文档文件夹和可搜索数字档案之间的桥梁。处理过程是自动化的。文件名提供可追溯性。 OCR 文本层使每个文档都可被发现。这种组合将静态集合转变为活动信息资源。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →