您扫描双语菜单。菜名是意大利语。描述是英文的。价格是与语言无关的数字。您只需提取意大利语文本即可创建意大利语单词列表,或者只需提取英语文本即可发送给其他语言对的翻译人员。对整个文档运行 OCR 会产生两种语言的混合,这对于可搜索性来说很好,但不适合选择性提取。
从多语言OCR PDF文档中仅提取一种语言的文本需要一个 OCR 引擎,该引擎可以识别每个文本块的编写语言,并仅提取与目标语言匹配的块。这是比标准 OCR 更具选择性的操作,标准 OCR 可以识别所有文本,无论语言如何。

语言选择性 OCR 的工作原理
具有多语言支持的 OCR 引擎可以配置为同时识别多种语言的文本。当您指定“意大利语和英语”时与 OCR 语言一样,引擎可以识别这两种语言的文本。它还用识别的语言标记每个识别的文本块。意大利语文本块被标记为意大利语。一段英文文本被标记为英语。语言标记可以实现选择性提取。
OCR 后,您可以通过语言标签过滤识别的文本。仅导出标记为意大利语的块。输出是一个仅包含菜单中的意大利语文本的文档。已识别但已过滤掉的英文描述不会出现在输出中。这种选择性提取对于翻译工作流程、语言学习材料和内容分析非常有用,在这些情况下,您需要将特定语言的文本与其他语言的周围文本隔离。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
分步:提取特定语言的文本
将扫描的 PDF 上传到 WukongPDF 的 OCR 工具。选择文档中存在的语言。对于意大利语-英语菜单,请选择意大利语和英语。运行 OCR。该工具可识别所有文本并按语言标记每个块。 OCR 完成后,使用语言过滤器选择意大利语。将过滤后的文本导出为纯文本文件、Word 文档或仅包含意大利语块的新 PDF。
语言检测的准确性取决于语言的独特性。意大利语和英语使用相同的字母表,但有不同的单词模式。 OCR 引擎通过分析词频来区分它们。意大利语有许多以元音结尾的单词。英语有很多以辅音结尾的单词。语言越独特,语言标记就越准确。两种密切相关的语言,例如西班牙语和葡萄牙语,可能会被引擎在短文本块上混淆。
在同一行处理混合语言文本
有些文档在一行中混合了多种语言,例如语言教科书将法语句子与英语翻译在同一行中配对。 OCR 引擎可能会将整个行分类为主导语言,从而错误地标记小语种单词。对于这些文档,块级别的语言选择性提取不够精确。你需要一种不同的方法。
另一种方法是运行 OCR 两次,一次将每种语言作为单一识别语言。仅限意大利语的 OCR 通行证可以很好地识别意大利语文本,但会破坏英语文本。仅限英语的通行证可以很好地识别英语,但会破坏意大利语。比较两个输出并手动为每个文本段选择正确的版本。这种双通道方法需要更多时间,但可以为语言在句子级别交错的文档生成最准确的特定于语言的提取。
验证和清理提取的文本
提取目标语言的文本后,验证语言过滤是否准确。扫描提取的文本,查找明显使用错误语言的单词。从菜单中提取的意大利语文本不应包含“grilled”等英语单词。或“与……一起食用”。除非菜单故意在意大利语描述中使用这些词。包含意外外来词的过滤文本表示需要手动更正的语言标记错误。
以目标语言运行拼写检查。意大利语拼写检查将标记意大利语提取中错误包含的英语单词。拼写检查标志是一种无需读取每个提取的单词即可查找语言标记错误的有效方法。经过语言过滤和拼写检查的提取 PDF 数据已准备好进行翻译、分析或存档。 WukongPDF 的扫描 PDF 具有语言过滤功能的 OCR 可以生成比后处理混合语言 OCR 输出更清晰的单语言摘录,从而删除不需要的语言。
语言选择性 OCR 的实际应用:从翻译文档创建双语术语表。分别提取所有源语言术语和所有目标语言术语。按它们在页面上的位置对齐它们,因为每个源术语在页面上或相邻列中大致相同的垂直位置处都有相应的目标术语。对齐的输出成为翻译人员可以用来确保未来翻译的一致性的术语列表。这种术语表构建技术广泛应用于技术翻译,其中术语的一致性至关重要。
对于语言位于单独列中的文档(例如两列双语合同),语言选择性提取变成列选择任务。左栏是一种语言,右栏是另一种语言。不要依赖语言检测(这可能会混淆相似的语言),而是裁剪 PDF 以单独提取每一列。在每列上运行单语言 OCR。对于具有清晰的列语言分隔的文档,这种列裁剪方法比语言过滤更可靠。
对于涉及历史多语言文档的档案项目,语言选择性 OCR 与元数据标记相结合创建了一个可搜索的档案,研究人员可以在其中在数千个文档中查找特定语言的内容。每个文档的 OCR 输出都标有检测到的语言。搜索 18 世纪法语文档的研究人员可以在多语言集合中筛选出仅法语文本。这种选择性方法将档案 OCR 从一种生硬的混合语言的工具转变为用于语言研究的精密工具。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
