Tips & Tricks

如何批量校正扫描 PDF 中的旋转页面

由单张纸扫描仪生成的扫描的 PDF 的页面通常会稍微旋转,通常旋转一到五度。以稍微不同的角度送入扫描仪的每页都会生成一份文档,其中每页的旋转方式都不同。阅读这样的文档很烦人。轻微的倾斜会使文本更难以扫描,并且打印此类页面会浪费内容倾斜的纸张。批量纠偏可在一次操作中纠正每个页面的旋转,将所有页面拉直至统一方向。

倾斜校正通常通过检测文本行的主角来分析每个页面上的内容,并将页面旋转相反的量以使文本达到水平。该过程是自动化的、特定于页面的且非破坏性的。它不会裁剪或调整页面大小。它仅应用每个单独页面所需的旋转校正。 裁剪 PDF 工具与纠偏相结合,生成的扫描文档看起来就像每一页都完美笔直地通过扫描仪。

WukongPDF 的PDF 质量 增强工具包括扫描文档的歪斜校正和页面校直。对于大型扫描 PDF 的批量处理,下述专用工具提供专门的歪斜校正功能。

How to Batch-Deskew Rotated Pages in a Scanned PDF

倾斜校正算法如何检测页面旋转

纠偏算法的工作原理是分析不同候选旋转角度下像素强度的投影直方图。它将页面图像以每个候选角度投影到水平轴上,并测量文本行对齐的锐度。在正确的角度下,文本行完全水平,投影会在每个文本行的垂直位置产生尖锐的峰值。在不正确的角度下,峰会涂抹在多个投影行上。该算法评估预期倾斜范围(通常为负 10 度到正 10 度)内的角度,并选择产生最尖锐投影峰值的角度。

该算法还考虑内容类型。一页具有清晰线条结构的纯文本会产生强烈的歪斜校正信号。以照片或图形为主且没有清晰的水平文本线的页面会产生微弱的信号,并且算法可能会默认进行零校正以避免基于不可靠的数据进行旋转。好的歪斜校正工具会报告每个页面的计算角度,以便您可以检查校正似乎不正确的页面。

WukongPDF

尝试裁剪 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

方法 1:Acrobat Pro 的优化扫描页面

Adobe Acrobat Pro 在其扫描页面增强工具中包含批量校正歪斜功能。打开扫描的 PDF,然后转到“工具”、“扫描和 OCR”、“增强”,然后选择“优化扫描的页面”。在优化对话框中,选中拉直和倾斜校正选项。将输出设置为所需的分辨率,对于要重新打印的文档,通常为 300 DPI;对于仅屏幕查看,通常为 150 DPI。 Acrobat 处理每个页面,单独校正歪斜,并生成优化的 PDF。

Acrobat 的倾斜校正是保守的。它可以纠正超过大约一度的明显倾斜的页面,但可能会留下半度以下的非常微妙的倾斜而不进行纠正。对于大多数文档来说,这种保守的行为是合适的。旋转正确方向的页面的错误倾斜校正比不改变几乎察觉不到的倾斜更具破坏性。优化后,以适合宽度的缩放方式翻阅文档,并目视检查文本行是否呈水平状态。未更正的页面应该仍然可读。

方法 2:用于专业批量校正偏移的 ScanTailor

ScanTailor 是一款专为扫描文档设计的开源后处理工具。它通过多个阶段处理一批扫描页面,包括纠偏、内容检测、边距裁剪和输出格式化。首先使用 pdfimages 或 Acrobat Pro 的导出所有图像功能等工具提取单个页面图像,将扫描的 PDF 导入 ScanTailor。

ScanTailor 会在每个页面上显示检测到的重叠倾斜角度。在全局应用校正之前,您可以手动调整自动检测不正确的任何页面的角度。纠偏后,继续进行内容选择阶段,识别文本区域并剪掉空白边距,然后导出为 PDF。 ScanTailor 的处理比 Acrobat Pro 的处理更彻底,可为需要校正歪斜和边距裁剪的文档生成更清晰的输出。

工具批量能力?准确度
Adobe Acrobat Pro(优化扫描页面)是的,过滤器适用于所有页面适合轻微到中度的倾斜
ScanTailor(开源)是的,专为批量设计出色的逐页内容检测
ImageMagick + 纠偏 CLI是的,完全可编写脚本好,使用主导文本线角度

方法 3:使用 ImageMagick 进行命令行纠偏

对于脚本化批处理工作流程,ImageMagick 的转换命令包含一个纠偏运算符。命令 Convert input.png -deskew 40% output.png 分析图像并应用检测到的旋转校正。百分比参数(本例中为 40%)设置歪斜校正操作覆盖图像部分的阈值。

在文档工作流程中,要通过 ImageMagick 处理整个 PDF,请使用 pdfimages 或类似工具将 PDF 拆分为单独的页面图像。使用 shell 循环在每个页面图像上运行去歪斜命令。然后使用 ImageMagick 的转换命令将拉直的图像重新组合成 PDF,并按顺序列出页面图像。命令行方法是完全自动化且免费的,使其适合 GUI 工具需要太多手动交互的大批量批处理。对于具有清晰文本行结构的文档,ImageMagick 的纠偏输出质量与 Acrobat Pro 的输出质量相当。

批量纠偏可在几分钟内将弯曲的扫描 PDF 转换为经过专业校正的文档。自动校正单独应用于每个页面,处理逐页变化,这使得手动校正对于多页文档来说不切实际。

将歪斜校正与其他扫描页面校正相结合

当与单个处理管道中的其他扫描页面校正配合使用时,去歪斜是最有效的。纠偏后,应用内容检测来识别文本区域并裁剪掉空白边距。然后应用阈值过滤器将灰度页面转换为干净的黑白页面,从而提高 OCR 准确性并减小文件大小。最后,在拉直、裁剪和阈值化的页面上运行 OCR,生成可搜索的文档。

ScanTailor 和 OCRmyPDF 等工具将所有这些步骤组合到一个自动化管道中。 OCRmyPDF 是一个基于 Python 的命令行工具,它接受扫描的 PDF、校正每个页面、应用自适应阈值、使用 Tesseract 运行 OCR,并输出嵌入 OCR 文本层的可搜索 PDF。单个命令 ocrmypdf --deskew input.pdf output.pdf 一次性处理纠偏、阈值处理和 OCR。对于大批量扫描文档数字化项目,组合管道可以端到端地处理文档,而无需在任何阶段进行人工干预。

校准混合内容页面的相差校正灵敏度

混合文本和照片的页面(例如图画书或杂志扫描件)提出了纠偏挑战。照片缺乏清晰的文本行方向,倾斜校正算法可能会被图像边缘而不是文本误导。大多数工具允许设置置信度阈值,以防止在检测到的角度不确定时进行校正。

对于混合内容页面,请保守地设置倾斜校正灵敏度。 0.3 度的倾斜几乎无法察觉。将好页面旋转 0.5 度的错误校正比保持微小的倾斜不受影响更具破坏性。批量校正歪斜后,翻阅文档并识别歪斜程度更大的页面。手动将这些页面重置为其原始方向。

只需运行单个命令或单击优化对话框,批量纠偏即可将弯曲的扫描文档转换为专业对齐的文件。自动校正可处理每页的变化,从而使手动校正变得不切实际。与裁剪、阈值处理和 OCR 相结合,纠偏是将原始扫描件转换为干净、可搜索、专业呈现的数字文档的处理流程中的一个步骤。

直页是读者在扫描文档中注意到的第一个质量信号。在他们阅读单词之前,在评估内容之前,页面方向会告诉他们文档是否经过精心准备。批量纠偏可确保文档中的每一页都发送正确的信号。

批量校正歪斜是扫描文档处理流程中的一个步骤,但正是这个步骤决定了文档看起来是经过专业准备的还是粗心扫描的。在读者阅读单个单词之前,平直的页面就向读者发出了质量的信号。与裁剪、阈值处理和 OCR 相结合,歪斜校正可将原始扫描件转换为精美的数字文档。

WukongPDF

尝试裁剪 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →