Tips & Tricks

如何 OCR PDF 并保持原始页面布局完整

在扫描文档上运行OCR PDF会提取文本,但输出通常会剥夺原始可读的视觉结构。标题变成简单的段落,列折叠成单个文本流,表格分解成混乱的片段。 OCR 后保持原始页面布局完整意味着识别的文本保持在其所属位置,保留赋予文档含义的阅读顺序、列结构和空间关系。这需要在处理之前而不是之后选择正确的 OCR 设置和输出格式。

How to OCR a PDF and Keep the Original Page Layout Intact

OCR 布局保留的工作原理

OCR 引擎分两个不同的阶段处理扫描页面。第一阶段分析页面图像以识别区域、内容块,例如文本列、图像、表格和标题。第二阶段在每个区域内运行字符识别。保留布局的 OCR 方法保留每个识别单词的空间坐标,不仅记录文本内容,还记录文本在页面上出现的位置。这些坐标定义了文档的阅读顺序和视觉层次结构。

启用布局保留后,OCR 输出会将不可见的文本层直接嵌入到 PDF 中的原始扫描图像之上。每个识别的单词位于扫描中其源字符的精确像素位置。这意味着文档在查看时看起来与原始文档相同,但屏幕阅读器可以选择、搜索和访问下面的文本。 扫描的 PDF 成为一种混合文档,具有原始扫描的视觉保真度和数字创建文件的文本功能。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

选择正确的 OCR 输出模式

大多数 OCR 工具至少提供三种输出模式,它们之间的选择决定了布局是否有效。可搜索图像模式将原始扫描页面保留为可见层,并在其下方添加不可见文本层。这可以完美地保留布局,因为视觉页面不会改变。文本和图像模式创建一个新页面,其中包含已识别的文本和重新定位的提取图像以近似原始布局。此模式会部分保留布局,并且适用于简单的单列文档,但复杂的多列页面可能会略有变化。

仅文本模式会丢弃所有图像和格式,生成没有布局信息的纯文本流。当布局很重要时,应该完全避免这种模式。对于PDF质量和布局保真度都很重要的文档,可搜索图像模式提供了最佳平衡。文件大小将比纯文本导出更大,因为原始图像数据仍然存在,但对于将以原始视觉形式读取、共享或存档的任何文档来说,这种权衡是值得的。

处理多列和复杂布局

多列文档对 OCR 布局保留提出了最艰巨的挑战,因为阅读顺序在页面上呈锯齿状。两栏的学术论文需要 OCR 引擎从左栏一直读取,然后再跳回到右栏的顶部。如果没有正确的区域检测,OCR 输出可能会交错两列中的行,从而产生无意义的文本,其中每隔一行属于不同的列。

现代 OCR 引擎使用区域检测算法,通过分析文本块之间的间隙来识别列边界。在对多列文档运行 OCR 之前,请检查该工具是否提供列检测或自动区域设置。如果该工具错误识别列边界,大多数桌面 OCR 应用程序都允许您在页面上手动绘制区域矩形以指导识别顺序。绘制区域需要更多的时间,但可以保证输出中正确的读取顺序。

保留表格和数值数据

表格以通用 OCR 难以解释的方式组合布局和数据。使表格易于人眼读取的网格结构,以一致的列宽和对齐方式交替行,需要 OCR 引擎识别单元格边界以及同一行或列中的单元格之间的关系。当布局保留正常工作时,原始文档中的表格会在 OCR 输出中生成一个表格,其中每个值都位于其正确的单元格中。

下表比较了不同 OCR 输出模式如何处理表保存:

OCR输出模式表结构单元对齐
可搜索图像保留原始图像准确,内置于源代码中
文字与图像重建为文本表近似值,可能会漂移
仅文本彻底迷失了未保留对齐方式

影响布局质量的 OCR 设置

输出模式之外的几个设置会影响原始布局的识别效果。输入图像的 DPI 设置是最关键的。 300 DPI 的扫描为 OCR 引擎提供足够的像素密度,以区分字符形状并准确检测布局区域。以 150 DPI 或更低的分辨率进行扫描会产生模糊的字符边缘,从而使识别引擎和区域检测算法感到困惑。以 600 DPI 扫描可稍微提高准确性,但会增加处理时间和文件大小,但对于大多数文档而言并没有相应的好处。

纠偏校正可以校直以微小角度扫描的页面。即使两度倾斜也会导致区域检测将列边界误解为对角线分隔线。在 OCR 之前启用自动纠偏可以改善几乎所有情况下的布局保留。同样,去斑滤光片可去除杂散点和扫描仪噪声,区域检测器可能将其解释为微小的文本块,从而使识别的区域破碎并破坏读取顺序。 WukongPDF 等工具会自动应用这些预处理校正,生成更清晰的区域地图,并在不同文档类型中保留更准确的布局。

OCR 后验证布局准确性

在启用布局保留的情况下运行 OCR 后,请在存档或分发文档之前验证结果。打开输出 PDF 并启用文本选择工具。将光标拖动到每列中的段落上,并确认选择遵循正确的阅读顺序,而不会跳到相邻列。搜索表格中出现的单词并验证搜索结果是否突出显示了正确的单元格位置。从中间列复制一个段落并将其粘贴到文本编辑器中,以检查各行是否以正确的顺序显示。

对于布局错误会导致混乱的重要文档,原始扫描件和 OCR 输出之间的逐页比较是最可靠的验证方法。并排打开两个文件,抽查每个段落的第一句话、每个表格标题以及页眉或页脚中出现的任何文本。在此阶段捕获区域检测错误每页需要几秒钟的时间。几个月后,当有人尝试搜索文档并得到乱码结果时发现它,代价要高得多。

为布局繁重的文档选择正确的 OCR 引擎

不同的 OCR 引擎以不同的复杂程度处理布局保留。 Tesseract 是由 Google 维护的开源引擎,在简单的单列文档上表现良好,但在不进行额外预处理的情况下,在处理多列学术论文或杂志布局时可能会遇到困难。 ABBYY FineReader 是一款商业引擎,在布局保留的独立基准中始终排名最高,因为它在运行字符识别之前分析整个页面结构,构建保留文本块之间空间关系的区域图。

对于布局保留至关重要的文档,请在处理整个文档之前花时间在代表性示例页面上测试两个不同的 OCR 引擎。使用每个引擎对单个复杂页面进行 OCR,并并排比较输出。查看两个结果中的读取顺序、列分隔和表结构。处理文档中最具挑战性的页面的引擎可能会很好地处理其余页面。十五分钟的测试投入可以避免以后数小时的手动布局校正。

WukongPDF 包括可保留页面布局和阅读顺序的 OCR 功能,对于需要准确可搜索 PDF 且无需安装桌面 OCR 软件的用户来说,它是一个实用的选择。基于云的处理可有效处理多页文档,返回原始视觉外观完好无损的可搜索 PDF。

布局保存中经常被忽视的一个因素是原始扫描的质量和状况。倾斜、起皱或低对比度的原始页面迫使 OCR 引擎将其分析资源用于纠正图像缺陷,而不是映射布局结构。在运行 OCR 之前,目视检查每个页面。如果扫描显示倾斜的文本块、装订书沿书脊的深色阴影或与背景合并的褪色文本,请对图像进行预处理。

保留布局和剥离布局的 OCR 输出之间的文件大小差异可能很大。可搜索的图像 PDF 将原始扫描页面保留为全分辨率图像层,并覆盖不可见的文本,从而导致文件大小比纯文本输出大几倍。对于存储不受限制的归档目的,较大的文件是布局保真度的值得权衡。

对于涉及历史文献的档案项目,布局保存显得尤为重要,因为原始文献的外观具有历史和证据价值。正确识别每个单词但将它们重新排列成单列文本块的 OCR 输出破坏了原始内容的视觉上下文。在这些项目中,可搜索图像方法是强制性的,任何纯文本输出都应被视为查找辅助工具,而不是原始文档的替代品。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →