Tips & Tricks

如何 OCR 从新闻纸或低质量纸张扫描的 PDF,并从反面显示

扫描新闻纸、薄字典纸或低质量的办公用纸生成的 PDF 存在一个令人抓狂的问题:页面背面的文本在您真正想要阅读的文本后面渗出,形成微弱的重影。这种现象称为“透显”或“透色”,它会令 OCR 引擎感到困惑,因为它们无法区分前景文本和背景噪音。 OCR 输出变成了预期文本和页面另一侧反向文本片段的混合体,导致输出出现乱码、无法使用。

透视与黑暗或不均匀的背景有根本的不同。它不是可以通过简单的阈值调整来消除的均匀噪声。它是结构化文本,向后打印并且颜色变暗,但仍然是结构化的。标准 OCR 引擎将页面上的任何深色标记视为潜在文本,并且背面的鬼字符具有足够的对比度以触发错误的字符识别。要解决此问题,需要对扫描图像进行预处理,以在 OCR 引擎发现渗色之前抑制渗色。对于新闻纸来说,预处理步骤不是可选的。这是可搜索文档和数字文件之间的区别,数字文件仅比原始照片有用一点。

数字保护联盟 2025 年的一项研究发现,未经预处理的新闻纸扫描的 OCR 准确度平均为 67%,而干净的激光打印页面的 OCR 准确度为 98%。通过优化的预处理,相同的新闻纸扫描达到了 94% 的准确率(数字保护联盟,“降解纸质介质上的 OCR 性能”,2025 年)。原始新闻纸 OCR 与预处理新闻纸 OCR 之间 27 个百分点的差距代表了可搜索文档与实际上不可用于文本查询的文档之间的差异。

How to OCR a PDF Scanned From Newsprint or Low-Quality Paper With Show-Through From the Reverse Side

为什么标准 OCR 在新闻纸和薄纸上失败

OCR PDF 流程的工作原理是检测图像中像素值与背景相差超过阈值的区域。在带有深色文本的干净白纸上,阈值很容易设置:任何比 50% 灰色暗的东西都是文本,任何浅色的东西都是背景。在新闻纸上,纸张本身是灰色的,反面的透显也是灰色的,通常只比正面的前景文本稍浅。单一的全局阈值无法将两者分开。如果将阈值设置得足够高以排除显示,则前景文本中的细笔划和衬线也会丢失。如果您将其设置得足够低以捕获所有前景文本,则显示也会被捕获。

报纸带来了超出展示范围的额外挑战。随着时间的推移,纸张通常会泛黄,形成不均匀的背景,在一页上从米色变成棕色。文本以小字体打印在窄列中,通常为 6 到 8 磅。墨水扩散数十年会导致字母彼此模糊,从而缩小“e”等字符中的间隙。和“a”。纸张表面本身可能具有制造过程中产生的纹理,在高分辨率扫描中显示为细颗粒,OCR 引擎将其误读为标点符号。这些问题中的每一个都使其他问题复杂化,而仅处理其中一个问题的预处理管道会使其余问题降低 OCR 准确性。

WukongPDF 使用自适应预处理来处理扫描的 PDF,在运行 OCR 之前自动检测透显并应用适当的背景抑制。这种方法通过扫描生成可搜索的文本,这会使标准 OCR 引擎感到困惑,并且它适用于从干净的办公纸到发黄的新闻纸的各种纸张类型。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

抑制透显的预处理技术

对于透视来说,最有效的单一预处理步骤是背景估计和扣除。该技术扫描页面图像,基于背景在整个页面上缓慢变化而文本变化剧烈的假设,构建每个像素的局部背景颜色的模型。然后从原始图像中减去背景模型,有效地消除透显,同时保留前景文本。 ScanTailor 等工具和开源 Tesseract OCR 引擎及其内置预处理模块实现了该技术的变体。

一种相关的方法是使用双边滤波器,它可以在保留边缘的同时平滑图像。该滤镜通过将其与周围背景进行平均来减少微弱的透光,但它保留了前景文本的锐利边缘。结果是图像更清晰,OCR 引擎可以在统一的背景下看到清晰的文本。双边过滤在计算上比简单的阈值处理更昂贵,通常每页需要几秒钟,但新闻纸扫描的质量改进值得任何具有持久价值的文档的处理时间。

对于透显特别严重的扫描,一种称为小波分解的技术可以将图像分成不同的频带。透光是微弱且低对比度的,通常占据高频带的低幅度分量。通过抑制这些成分并从剩余波段重建图像,您可以消除透显,同时保留大部分文本细节。该技术需要专门的图像处理软件,但产生的结果是简单方法无法比拟的,特别是在反面文本几乎与前景文本一样暗的页面上。

分步:扫描设置以最大限度地减少透显

处理透显的最佳方法是在扫描时减少透显。将一张黑纸放在正在扫描的页面后面。黑色背衬吸收原本会穿过薄纸、从扫描仪盖上反射并照亮反面文本的光线。这个简单的步骤可以将透印率减少 50% 至 80%,具体取决于纸张厚度。对于非常薄的纸张,例如航空信纸或圣经纸,黑色底纸对于可用的扫描来说基本上是必需的。

以扫描仪支持的最高光学分辨率进行扫描,文档扫描仪通常为 300 至 600 DPI。更高的分辨率可以捕获相对于显示的前景文本的更多细节,并且额外的像素为预处理算法提供了更多的数据可供使用。以彩色或灰度扫描,而不是黑白扫描。黑白扫描在扫描时应用无法撤消的硬阈值,如果该阈值对于页面的任何部分来说是错误的,则信息将永远丢失。彩色或灰度扫描保留完整的色调范围,并允许您在扫描后尝试不同的预处理设置,这对于最佳阈值在整个页面上变化的页面至关重要。

对于大型PDF Archive项目,在适当的扫描技术上的投资可以在减少后处理工作量方面获得数倍的回报。需要大量预处理才能用于 OCR 的扫描也需要对文件的每次使用进行大量处理,包括显示、打印以及未来使用更好的 OCR 技术进行重新处理。第一次正确扫描是任何数字化项目中最具成本效益的步骤。

OCR 后纠正和验证

在预处理扫描上运行 OCR 后,输出中仍会包含有挑战性的页面上的错误。针对识别的文本运行拼写检查器以标记可能的 OCR 错误。拼写检查器标记为拼写错误的单词是手动更正的候选单词。对于重要文档,请人工检查随机的页面样本,并将 OCR 文本与原始扫描进行比较,以估计错误率。 95% 的准确率意味着大约二十分之一的单词是错误的,这对于搜索目的来说可能是可以接受的,但对于创建忠实的数字转录来说却是不可接受的。

对于重要的PDF可搜索项目,请考虑在同一预处理扫描上使用两个不同的OCR引擎并比较它们的输出。当两个引擎对某个词达成一致时,几乎可以肯定它是正确的。当他们不同意时,两个版本都可以进行手动审核。这种双引擎方法仅显示真正模糊的文本,而不是要求审阅者阅读可能长达数百页的文档的每一页,从而减少了手动更正工作量。

当扫描的文档具有长期价值时,适当的预处理和验证的努力是合理的。 1950 年的一篇新闻纸文章经过一次数字化、仔细预处理并验证准确性后,将在几十年内保持可搜索和引用。使用默认设置进行数字化且未进行预处理的同一篇文章可能会生成非常混乱的 OCR 输出,以致于在搜索时实际上会丢失,即使人类仍然可以很好地读取原始扫描图像。

对于管理大型历史报纸馆藏的机构来说,开发标准化预处理管道是一项投资,可以为未来的每个数字化项目以及研究人员针对馆藏运行的每个未来搜索查询带来红利。应记录管道中每种扫描仪型号和纸张类型的特定设置,以便新员工无需反复试验即可重现结果。记录完善的管道还可以在 OCR 技术改进时重新处理集合,通过更新的识别引擎应用相同的预处理,从相同的原始扫描中提取更好的文本,而无需返回原始物理文档。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →