Others

您可以对在带图案、纹理或水印的纸张背景上打印文本的 PDF 进行 OCR 吗

光学字符识别的工作原理是检测浅色背景上的深色形状并将这些形状与已知的字母图案进行匹配。当背景不是均匀的浅色而是包含图案、纹理或水印时,识别引擎面临着一个根本上更困难的问题。页面上的每个图案元素都是潜在的误报,OCR 必须将其与实际文本区分开来。带水印的纸张、有纹理的信纸、方格安全印刷品和装饰性边框都会增加视觉噪音,从而降低 OCR 准确性。问题不在于 OCR 是否能够处理这些背景,而在于它在什么条件下能够成功,以及何时准确度降至有用点以下。

Can You OCR a PDF Where the Text Is Printed Over a Patterned, Textured, or Watermarked Paper Background

背景图案如何干扰字符识别

OCR 引擎首先通过称为阈值处理的过程将其转换为二进制黑白图像来处理页面。每个比截止值暗的像素都会变成黑色。每个变亮的像素都会变成白色。在带有深色文本的干净白色页面上,阈值处理会产生清晰的图像,每个字母都清晰可见。在图案背景上,比阈值暗的图案元素变成与文本混合的黑色像素。然后,OCR 引擎尝试将这些模式片段解释为字母的一部分。穿过“e”中间的水印线可能会导致引擎看到带有杂散标记的“c”。带有小点的纹理背景可能会导致引擎看到不存在的时间段。

背景图案的具体类型决定了 OCR 错误的性质。精细的点图案(例如安全纸或老式打字纸上的点图案)会产生斑点噪声,OCR 引擎可能会将其解释为字符上的标点符号或重音符号。线条图案(例如直纹笔记本纸或方格纸)会产生连续的干扰,可以与字符笔画合并,如果线条与上升部分对齐,则将“l”变成“b”。具有大文本或徽标的水印会创建背景暗度发生变化的区域,导致阈值处理丢失深色水印区域中的文本或将水印片段引入浅色区域中的文本。

图案的密度相对于文本的密度非常重要。正如大多数专业水印的设计那样,比文本明显浅的水印可以通过阈值处理而不会留下可见的伪影。 OCR 引擎的默认阈值通常设置为将黑色文本与白纸分开,仅记录 10% 到 15% 灰度的水印可能完全低于该阈值。对于接近文本暗度 40% 到 60% 的图案,问题最为严重,其中阈值处理无法将图案与文本清楚地分开,因为它们的强度范围重叠。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

提高图案背景 OCR 准确性的预处理技术

多种图像预处理技术可以在 OCR 引擎处理页面之前减少或消除背景图案。最广泛有效的技术是自适应阈值处理,它为页面的每个区域计算不同的亮度截止值,而不是使用单个全局截止值。在背景有图案的区域中,自适应阈值会进行调整,将平均图案亮度视为背景级别,从而在抑制图案的同时保留文本。大多数现代 OCR 软件都包含自适应阈值选项,但默认情况下可能未启用它。

第二种技术是使用傅里叶变换或类似数学工具的频率滤波。背景图案往往是规则的和周期性的,这意味着它们在图像中占据特定的频率。相比之下,文本是不规则的,并且占据的频率范围很广。频域滤波器可以识别并抑制与背景图案相关的窄频带,同时保留文本的宽带信号。该技术功能强大,但需要专门的图像处理软件,通常用于大规模数字化项目而不是单个文档。

WukongPDF 的OCR PDF 工具包括处理常见背景变化的图像预处理。对于具有轻度至中度背景图案的文档,内置预处理可能足以产生可用的文本识别,而无需额外的手动步骤。关键是在处理整个文档之前在代表性页面上测试识别。如果测试页的准确度可以接受,则继续进行该批次。如果测试页显示明显错误,则图像可能需要在 OCR 之前进行外部预处理。

当手动转录在大量模式文档上击败 OCR 时

有一个质量阈值,低于该阈值 OCR 输出需要大量手动校正,因此从头开始输入文本会更快。对于具有厚重背景图案、密集水印或覆盖整个页面的安全打印的文档,OCR 可能会生成其中 20% 或更多字符错误的文本。在多页文档中纠正五分之一的字符比重新输入内容需要更长的时间,尤其是当错误不明显时,例如在误读背景点的地方插入句号,这会改变句子的含义,而在校对过程中不易发现。

经济决策取决于文件的长度和所需的准确性。带有水印的信纸上的单页信件可以在几分钟内手动转录。一本印在纹理纸上的 200 页书需要数周的手工工作,即使是不完美的 OCR(正确捕获 85% 的文本)也能提供实质性的领先优势。对于大型项目,最佳工作流程通常是 OCR 和积极的预处理,然后对输出进行人工审核,并接受审核步骤将识别并纠正模式引起的错误。当根据源材料的难度校准准确性预期时,扫描 PDF 到可搜索文本管道的效果最佳。

选择正确的扫描设置以最大限度地减少背景干扰

当您控制扫描过程时,一些设置可以在图像到达 OCR 引擎之前降低背景图案的可见性。以灰度而不是彩色扫描可以消除基于颜色的图案,例如有色水印或彩色安全线,否则会产生对比度变化。将扫描仪亮度设置为略高于正常亮度可将浅色背景图案推至检测阈值以下,同时保留深色文本。亮度增加 10% 到 15% 通常足以消除水印而不影响文本的可读性。

某些扫描仪具有专门为彩色或有图案纸张上的文档设计的背景去除或背景平滑功能。此功能分析页面并识别主要背景颜色或图案,然后将其标准化为白色,同时保留前景内容。如果可用,应为任何将进行 OCR 的文档启用此设置。干净源图像的识别精度的提高远远超过通过后扫描图像处理所能实现的。

评估图案化文档的 OCR 准确性:接受哪些内容以及重新输入哪些内容

可接受的 OCR 准确性的实际阈值取决于如何使用提取的文本。对于整个文档档案的全文搜索,80% 的准确度可能就足够了。即使周围文本的 20% 包含错误,搜索特定名称或帐号仍会找到该文档。对于提取将重新发布、引用或用于进一步分析的文本,95% 的准确度是更合适的最小值。低于该水平,纠正 OCR 错误所花费的时间接近手动转录文档所需的时间。是否接受 OCR 输出或从头开始重新输入的决定应基于测量的准确性评估,而不是浏览几页形成的印象。

测量 OCR 准确性需要将已识别文本的样本与原始文档进行比较。选择三到五个有代表性的页面,统计原稿的字符总数,统计 OCR 输出中的字符错误(包括替换、插入和删除),并计算错误率。此测量需要十到十五分钟,并为决定是否进行自动更正、手动审核或完全重新输入提供了客观基础。该测量还可以识别最常见的错误类型,指导纠正策略的选择。如果错误集中在特定模式类型中,有针对性的预处理也许能够解决它们。如果错误是随机分布的,则 OCR 准确性将受到源图像基本质量的限制,而不是任何特定的可纠正问题。

纸张上的背景图案在设计时从未考虑到 OCR。它们的用途从品牌识别到防伪安全再到简单的装饰吸引力。从这些文档中捕获的PDF图像将这些模式带入数字领域,在那里它们成为文本提取的障碍。了解哪些模式可以通过预处理来缓解以及哪些需要手动工作,可以让您对每个文档做出明智的决策,而不是对每次扫描应用相同的 OCR 工作流程并希望得到最好的结果。在了解文档的特定背景挑战方面投入的时间会带来更高的准确性、更少的手动校正以及忠实代表原始内容的数字文本输出。

图案背景上的 OCR 位于扫描技术、图像处理和文档工作流程设计的交叉点。没有一种技术可以解决所有图案背景挑战,但适当的扫描设置、自适应预处理和现实的准确性期望的结合可以为绝大多数文档产生可用的结果。工具已经存在,技术也很成熟。系统地应用它们可以将令人沮丧的 OCR 失败转变为可管理的质量控制流程。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →