Tips & Tricks

如何 OCR 包含多种语言或非英语文本的 PDF

您扫描双语合同。左栏是英文的。右栏是西班牙语。两种语言都需要可搜索,但为一种语言配置的标准 OCR 运行会破坏另一种语言。应用于西班牙语文本的英语 OCR 会产生无意义的结果,因为识别引擎需要不同的字母频率和单词模式。西班牙语 OCR 应用于英语也会产生类似的乱码结果。您需要同时理解两种语言的 OCR。

多语言OCR PDF是现代识别引擎的一项功能,可以在单个文档中的语言模型之间进行切换。引擎检测每个文本块所用的语言并应用适当的识别模型。结果是文档中所有语言的准确文本识别。

How to OCR a PDF That Contains Multiple Languages or Non-English Text

OCR 引擎如何处理多种语言

OCR 引擎通过将字符形状与每种语言中字母的训练模型进行比较来识别文本。英语模型知道字母“e”是指字母“e”。最常见的是“th”。经常一起出现,并且诸如“qx”之类的某些字符组合可以被使用。几乎不会发生。西班牙模特知道像“a”这样的重音字符带重音符号“n”带波形符和倒问号很常见。法语模型需要频繁的重音元音和特定的二合字母。

当您为 OCR 作业指定多种语言时,引擎会加载所有指定语言的字符模型。当它处理页面上的每个文本块时,它会评估哪种语言模型最匹配观察到的字符模式并应用该模型。语言检测在文本块级别自动进行,因此可以正确处理包含英语正文和法语脚注的页面,而无需手动语言标记。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

设置多语言 OCR

OCR 工具的语言选择允许多种语言。选择文档中出现的所有语言。对于英语-西班牙语双语合同,请同时选择英语和西班牙语。对于包含英语、法语和德语的欧盟文档,请选择全部三个。对于包含英文文本和古希腊语引文的学术著作,请选择英语和希腊语。引擎加载所有必要的模型。

语言覆盖范围和准确性之间需要权衡。每种额外的语言都会在识别过程中添加更多的字符模型,这会增加不同语言的相似字符之间混淆的机会。西里尔字母“a”看起来与拉丁字母“a”相同但代表不同的声音并出现在不同的上下文中。添加不必要的语言会增加引擎错误分类文本块和应用错误语言模型的风险。仅选择文档中实际出现的语言,而不是您认为可能有用的每种语言。

常见的多语言OCR场景及处理方法

最常见的多语言场景是主要使用一种语言的文档,其中包含另一种语言的短文、引文或脚注。一篇英文学术文章,脚注中引用了法文。德语说明手册,附有英语技术术语。具有英文定义条款的西班牙语法律合同。对于这些文档,主要语言包含大部分文本,而辅助语言则出现在简短的、可预测的上下文中。

识别引擎可以很好地处理这些混合语言文档,因为语言切换被本地化到特定的文本块。英文正文是用英文模型识别的。法国报价被法国模型认可。由于两种语言出现在单独的文本块中,因此引擎的语言检测可以正确识别每个块要使用的模型。

更具挑战性的场景是语言在同一行上交错的文档,例如语言教科书在同一行上显示英语句子,然后显示西班牙语翻译。 OCR 引擎可能会将整行视为一个文本块,并将一种语言模型应用于所有文本块,从而在另一种语言的行的一半中产生错误。对于这些文档,最准确的方法是对文档进行 OCR 两次,每种语言一次,然后手动合并结果。这是劳动密集型的,并且仅适用于准确性至关重要的短文档。

验证多语言 OCR 结果

运行多语言 OCR 后,通过检查每种语言的文本来验证结果。搜索您知道的每种语言中出现的单词。确认搜索找到它。选择每种语言的文本并复制它以确认字符正确。请特别注意重音字符和特殊符号。对于主导语言模型中不存在的字符,扫描的 PDF 识别最有可能失败,因为引擎可能默认为最接近的拉丁语等效字符。

多语言文档中常见的 OCR 错误包括将重音字符替换为非重音字符、带重音的 e 变为 e、带波形符的 n 变为 n、特殊标点符号(如西班牙语中的倒问号)替换为标准问号,以及将西里尔文或希腊语等非拉丁文字误识别为视觉上相似的拉丁字符。这些错误通常集中在第二语言段落中。如果第二语言内容很重要,请根据原始文档手动验证这些段落。 WukongPDF 的 OCR 工具为每个识别的文本块提供置信度分数,分数较低表示识别引擎不太确定的块。

对于混合拉丁字母语言与非拉丁文字的文档,例如带有中文或阿拉伯语引文的英文文档,多语言 OCR 挑战更为重要,因为字符形状根本不同。识别引擎必须区分完全独立的书写系统。为文档中显示的每个脚本系列选择特定语言。 WukongPDF 的PDF 格式 处理支持在单个 OCR 作业中混合拉丁文、西里尔文、阿拉伯文、CJK 和印度文脚本,但准确性因脚本和扫描质量而异。

改进具有不同语言部分的文档的多语言 OCR 的实用技术:在运行 OCR 之前按语言预先分隔文档。如果 20 页的合同前 10 页为英语,后 10 页为西班牙语,请将文档拆分为两个文件,在第一个文件上运行英语 OCR,在第二个文件上运行西班牙语 OCR,然后重新合并。这完全避免了多语言模型开销,并产生稍高的准确性,因为每个 OCR 作业都使用针对其正在处理的确切文本进行优化的单一语言模型。拆分、OCR 单独、重新合并工作流程需要额外几分钟的时间,但可以可靠地为具有清晰语言边界的文档提供最佳准确性。对于语言在同一页面上真正交错且分离不切实际的文档,保留多语言 OCR 方法。

多语言 OCR 的最后一个提示:如果文档包含从右到左的脚本(如阿拉伯语、希伯来语或波斯语)以及从左到右的脚本(如英语或法语),则文本方向会增加复杂性。 OCR 引擎不仅必须检测每个文本块所使用的语言,还必须检测文本流动的方向。阿拉伯文本块应从右到左识别,而其下方的英文标题应从左到右识别。当您在设置中指定两种语言系列时,大多数现代 OCR 引擎都能很好地处理混合方向文档。 OCR 后,通过复制一段阿拉伯语并将其粘贴到文本编辑器中来验证文本方向。字符应按正确的阅读顺序出现,而不是颠倒。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →