扫描书籍、论文、期刊或分类帐等装订卷会生成 PDF,其中页面在纵向和横向方向之间交替。打开的书籍的左侧页面以一个方向扫描,右侧页面以另一个方向扫描,或者以交替页面旋转方式扫描整本书,因为扫描仪操作员在不旋转扫描图像的情况下翻转每一页的书籍。结果是 PDF 中,在屏幕上查看时,每隔一个页面都旋转了 90 或 180 度。在没有首先规范页面方向的情况下对此文档运行 OCR 会生成在正确方向和旋转之间交替的文本,从而使识别的文本无法用于搜索或提取。该解决方案需要一个预处理步骤,在 OCR 处理之前检测并纠正每个页面的方向。

为什么装订卷扫描会产生交替的页面方向
扫描装订卷时,每页展开都会将两页面朝下放在扫描仪床上。书籍的左页出现在扫描仪床的右侧,右页出现在左侧,彼此相对旋转 180 度。如果扫描仪操作员没有纠正每个页面的这种旋转,则扫描的 PDF 中包含的页面每隔一个页面都是颠倒的。一本 200 页的书会生成一个包含 200 页的 PDF,其中 100 页方向正确,100 页旋转 180 度。该模式是规则且可预测的:所有奇数页可能正确定向,所有偶数页旋转,反之亦然。
一些装订卷的扫描方法是将打开的书放在扫描仪上,文本水平运行,生成包含左页和右页的单个图像。然后,该图像被分割成两个单独的页面,但分割过程并不总是旋转右侧页面以匹配左侧页面的方向。结果是左侧页面方向正确而右侧页面旋转 90 度的 PDF,反之亦然。 OCR 引擎期望文本在页面上从左到右水平排列,但无法识别旋转页面上的文本,因为文本是垂直或颠倒的。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
在 OCR 处理之前检测页面方向
运行 OCR 之前,请检查 PDF 查看器中的页面缩略图。交替方向在缩略图面板中立即可见,其中每个其他缩略图都出现旋转。计算方向模式:奇数页正确、偶数页旋转是最常见的模式,但反之亦然。如果模式一致,则批量旋转操作可以在单个命令中纠正所有受影响的页面。大多数 PDF 查看器允许在缩略图面板中选择多个页面,并同时对所有选定页面应用旋转。选择所有偶数页,根据需要将其旋转 180 度或 90 度,然后保存文档。缩略图面板现在以正确的方向显示所有页面。
WukongPDF 的OCR PDF 工具独立处理每个页面,但它假设文本是水平方向的。如果页面旋转,OCR 引擎要么无法识别任何文本,要么会产生乱码输出,因为它试图将垂直或颠倒的文本视为水平文本。在 OCR 之前纠正页面方向是必需的预处理步骤。旋转受影响的页面并保存文档后,对规范化的 PDF 运行 OCR。所有页面的识别准确性将保持一致,因为现在每个页面都以 OCR 引擎期望的方向显示文本。
处理文档中不一致的方向模式
并非所有装订卷都会产生干净的交替图案。由两个不同操作员扫描的书籍、在不同时间扫描的多卷集或在初始扫描后部分重新扫描的文档可能具有不规则的方向图案。第 1 到 50 页可能遵循交替模式,第 51 到 80 页可能都被正确定向,因为它们是通过正确的旋转重新扫描的,而第 81 到 200 页可能会返回到交替模式。检测和校正必须分段进行,而不是一次批量操作。
对于不规则的方向模式,滚动缩略图和旋转单个页面或页面范围的手动方法是最可靠的方法。从第一页开始并浏览缩略图。当您遇到旋转的页面时,请确定有多少连续页面共享该方向。选择范围并应用旋转。继续阅读文档,直到每一页的方向都正确。该过程每页需要一到两秒,因此 200 页的文档大约需要五分钟。时间花得很值,因为正确方向页面上的 OCR 准确度比旋转页面上的准确度要高得多。
大型约束体积项目的自动方向检测
对于涉及数百或数千页的数字化项目,手动逐页方向检查变得不切实际。自动方向检测工具可以通过分析文本方向来识别旋转的页面。这些工具对整个页面的文本字符进行采样,并通过识别哪种旋转会产生预期语言的有效单词来确定主导方向。文本识别在 0 度时成功但在 90、180 和 270 度时失败的页面方向正确。 180 度识别成功但 0 度识别失败的页面是上下颠倒的,需要旋转。自动检测可以快速处理大型文档集,并且在 OCR 开始之前对结果进行手动抽查以确认自动化工作正常。
验证交替方向的 OCR 输出
更正页面方向并运行 OCR 后,验证整个文档的识别质量是否一致。搜索出现在最初正确页面和最初旋转页面上的文本。搜索应该在两种类型的页面上找到具有相同可靠性的实例。如果未找到原始旋转页面上的文本,则可能未正确应用旋转校正,或者 OCR 引擎可能在保存旋转之前处理了某些页面。重新打开文档,确认缩略图面板中的所有页面方向均正确,并在必要时重新运行 OCR。
对于原件扫描质量因页面而异的装订卷,例如书籍的某些页面平压在扫描仪玻璃上,而其他页面在书脊附近有弯曲,OCR 准确性将相应变化。方向校正解决了旋转问题,但不能补偿其他扫描质量问题。曲率较大的页面可能需要重新扫描或使用扭曲校正滤镜进行预处理,然后 OCR 才能达到可接受的精度。当源图像尽可能干净且方向一致时,扫描的 PDF 到可搜索文本管道的效果最佳。方向校正是第一步,也是最有影响力的一步。去扭曲、对比度调整和去斑点是后续步骤,可进一步提高具有挑战性的装订体积扫描的识别精度。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
