
为什么 OCR 难以应对重叠的脚注文本和边距内容
当文本位于干净、可预测的块中、行距一致且内容区域之间清晰分隔时,光学字符识别引擎效果最佳。对标准商业信函或新颖页面进行OCR PDF操作通常会产生准确的结果,因为文本以有序的段落排列,各边都有较宽的边距。学术论文提出了一个根本上更难的问题,因为它们的布局故意将多个不同的文本流打包成物理上非常接近的位置,脚注、页边引用和正文文本经常在其边界处接触或重叠。
核心挑战是分割,即 OCR 引擎在尝试字符识别之前将页面图像划分为文本区域的步骤。当正文中的上标脚注参考编号位于脚注分隔线的正上方,并且该线位于脚注文本本身的正上方(字体大小较小)时,分段算法必须决定一个文本区域的结束位置和下一个文本区域的开始位置。这里错误的分割决策会导致识别错误,因为来自两个不同文本流的字符被输入到识别引擎中,就好像它们是一条连续的线一样。输出读起来就像乱码,混合了正文文字和脚注片段。
边缘引用为问题添加了第三个文本流。在遵循芝加哥风格的人文论文或使用蓝皮书格式的法律文档中,页边注释、行号或平行引文沿着主文本栏垂直或水平排列。这些边距元素通常以较小的磅值打印,有时为 7 或 8 磅,并且可能使用 OCR 引擎在正常尺寸下已经难以处理的斜体或压缩字体。当边距文本与正文接触时(这种情况经常发生在格式紧凑、装订线狭窄的期刊中),分段挑战就变成了三向而不是双向。
扫描 PDF源的纸张质量也增加了 OCR 难度。许多学术论文都是从装订本扫描而来,书脊附近的页面弯曲会导致文本弯曲和扭曲。页面底部的脚注是受书脊弯曲影响最大的部分,因为它们距离装订最近。弯曲页面的物理变形、小字体以及与上方正文的紧密结合,为 OCR 准确性带来了不利条件的完美风暴。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
预处理扫描页面以分离重叠的文本区域
提高具有重叠文本元素的学术页面 OCR 准确性的最有效方法是在页面图像到达 OCR 引擎之前对其进行预处理。这种预处理将不同的文本流分开,因此引擎永远不必做出不明确的分段决策。
首先对扫描页面进行倾斜校正,以确保所有文本行完全水平运行。即使原始扫描件倾斜一度,也可能导致脚注文本漂移到页面边缘的正文区域,从而产生正确对齐的页面上不会存在的错误重叠。大多数文档扫描软件都包含自动纠偏功能,但对于从装订卷扫描的学术论文,沿正文基线绘制参考线的手动纠偏可以比自动校正产生更准确的结果。
去偏后,下一步是区域遮蔽。使用图像编辑器或专用 OCR 预处理工具,在正文区域和脚注区域之间绘制水平分隔线。这一行告诉下游 OCR 引擎将其上方的所有内容视为一个文本区域,将其下方的所有内容视为单独的文本区域。在存在脚注的页面上,分隔符应位于脚注规则的正上方,脚注规则是传统上将印刷学术作品中的正文与脚注分隔开的短水平线。在没有脚注的页面上,不需要分隔符。
对于边距引用和行号,垂直屏蔽是等效的方法。在边距文本和主文本列之间绘制垂直分隔符。在同时具有左边距行号和右边距引文的页面上,两侧都需要垂直分隔符。目标是将页面划分为矩形区域,其中每个区域恰好包含一个文本流。然后,OCR 引擎独立处理每个区域并生成单独的识别文本输出,您可以在识别完成后以正确的阅读顺序重新组合这些文本输出。
配置多流学术页面的 OCR 设置
大多数专业 OCR 引擎都提供有助于多列和多流页面布局的设置。启用自动布局分析是起点,但对于具有近距离文本流的学术页面,手动区域配置比全自动分析产生更好的结果。
为正文、脚注区域和每个页边距文本区域定义单独的识别区域。在每个区域中,设置适当的语言、预期字体大小范围和文本方向。正文文本区域应为水平从左到右方向的 10 到 12 点文本。脚注区域应该有 8 到 10 点的文本,仍然是水平的,但要注意脚注文本通常包括 URL、DOI 和引文字符串,这些可能会混淆期望自然散文的语言模型。
特别是对于正文文本区域,启用忽略上标和下标文本的设置以进行行分割。上标脚注参考数字和数学指数通常较小并高于基线,如果引擎将它们视为正常文本行的一部分,则会导致行高计算错误。出于分段目的而忽略上标定位可以保持正文行的完整性,而脚注标记则被识别为不影响行边界的单独小元素。
当每个区域的识别结果保存到单独的文本文件或组合输出中的单独标记部分时,PDF 到文本 输出质量显着提高。这种区域分隔的输出可以轻松验证正文文本没有渗入脚注文本,并且页边引用出现在其自己明确标记的输出部分中,而不是与主要内容交错。
学术 OCR 输出的识别后清理
即使进行了仔细的预处理和区域配置,在紧密排列的学术页面上,一些识别错误也是不可避免的。结构化的识别后清理过程会在文本进入最终文档之前捕获并纠正这些残留错误。
仅对正文输出运行拼写检查,并将拼写检查字典设置为文档的主要语言。正文中被标记为拼写错误的单词实际上是拼写正确的脚注内容,这是一个明显的迹象,表明正文文本区域边界过于宽松并捕获了脚注文本。调整这些页面的区域边界并重新运行识别,而不是手动编辑脚注片段。
对于脚注文本输出,请验证每个脚注是否以其预期的参考编号开头,并且脚注文本连续流动,而没有散布正文文本片段。常见的识别后错误模式是正文文本行出现在脚注文本的中间,其中正文文本列在页面上的延伸位置低于预期的区域边界。在识别的脚注文本旁边查看原始页面图像可以快速捕获这些入侵,因为句子主题突然从学术主题转移到不相关的正文段落主题。
WukongPDF 的 OCR 工具支持对复杂页面布局进行基于区域的识别,包括带有脚注和页边内容的多栏学术论文。在开始识别过程之前定义每个区域的语言、字体大小范围和文本方向设置,可生成比同一页面上的单区域处理更准确的OCR PDF输出,并且分离的输出格式使识别后验证变得简单。
处理特殊情况:数学符号、非拉丁文字和混合语言
STEM 领域的学术论文为重叠文本挑战添加了数学符号。散布在正文中的方程和公式会产生额外的分段复杂性,因为数学符号使用符号、希腊字母和二维格式(例如分数和上标),这些格式不遵循与散文文本相同的布局规则。为文档文本设计的 OCR 引擎在数学符号上表现不佳,而为数学设计的引擎在文档文本上表现不佳。
对于混合数学和散文的页面,最实用的方法是两次通过 OCR 策略。第一遍使用文档优化引擎来识别所有散文文本区域,包括正文、脚注和页边引用。第二遍在包含方程的特定页面区域上使用数学感知识别引擎。将两个输出合并到一个组合文档中,同时保留文档引擎的散文准确性和数学引擎的公式准确性,从而产生最可靠的总体结果。
对于混合拉丁文和非拉丁文的论文,例如脚注中带有阿拉伯文、中文或西里尔文引文的英文论文,请使用正确的主要脚本配置每个识别区域。正文区域使用文档的主要语言。包含非拉丁脚本段落的脚注区域可能需要多脚本识别配置,该配置可以在单个文本区域内的脚本之间进行切换。
下表总结了学术论文中不同页面区域的推荐 OCR 区域配置。
| 页面区域 | 预期字体大小 | 方向 | 特殊设置 |
|---|---|---|---|
| 正文 | 10-12分 | 水平的 | 忽略上标进行线分割 |
| 脚注 | 8-10分 | 水平的 | 如果引文包含非拉丁文本,则为多脚本 |
| 左边距(行号) | 7-9分 | 水平或垂直 | 提取为单独的输出;不与身体融合 |
| 右边距(引文) | 7-9分 | 水平的 | 提取为单独的输出 |
| 方程/公式 | 多变的 | 水平二维布局 | 在第二遍中使用数学感知引擎 |
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
