在全球商业、学术研究和法律文件审查中,收到用您不会说的语言编写的扫描版 PDF 比以往任何时候都更加常见。您需要提取文本、翻译它并理解文档的内容。挑战不仅仅在于对文件运行 OCR。它正在使用正确的语言设置运行 OCR,因此提取的文本足够准确,可以进行翻译。在OCR PDF处理期间选择错误的语言会产生任何翻译引擎都无法挽救的乱码输出。
OCR 引擎看不到字母。他们看到形状并将这些形状与特定语言的字符模式进行匹配。如果您告诉 OCR 引擎该文档是英文的,但实际上是俄文的,引擎会将西里尔字母映射到它所知道的最接近的拉丁字符。结果是一串看似随机的字母,与原始文本没有任何关系。正确设置语言或在可用的情况下使用自动检测是整个 OCR 到翻译流程中最重要的决定。
WukongPDF 的 PDF 到文本和 OCR 工具从扫描文档中提取文本以进行翻译和分析。将正确的 OCR 语言选择与可靠的翻译服务相结合,可在五分钟内将无法阅读的外语扫描件转变为可理解的文档。

步骤 1:识别文档语言
在接触任何 OCR 软件之前,请确定文档的语言。如果文档元数据或文件名暗示了语言,请从那里开始。如果没有,请打开 PDF 并查看几页。即使不阅读文本,视觉线索也会大大缩小可能性。文字家族各具特色:拉丁文字适用于大多数欧洲语言。西里尔字母用于俄语、乌克兰语、保加利亚语和塞尔维亚语。阿拉伯文字涵盖阿拉伯语、波斯语和乌尔都语。 CJK 涵盖中文、日文和韩文。天城文涵盖印地语、马拉地语和尼泊尔语。
如果您甚至无法直观地识别脚本系列,请截取代表性段落的屏幕截图并将其上传到谷歌翻译的图像翻译功能或反向图像搜索。在大多数情况下,这些工具可以识别脚本和特定语言。知道文档是泰语而不是老挝语,或者是韩语而不是日语,就可以区分准确的 OCR 输出和无用的字符噪声。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
步骤 2:选择支持目标语言的 OCR 工具
并非所有 OCR 工具都支持所有语言。 Adobe Acrobat Pro 附带了大约 40 种语言的 OCR 引擎。其识别文本工具在设置对话框中包含一个语言选择下拉列表。 Tesseract 是由 Google 维护的免费开源 OCR 引擎,通过可下载的语言数据文件支持 100 多种语言。 Google Cloud Vision API 拥有最广泛的语言覆盖范围,涵盖 200 多种语言,并包括自动语言检测作为可选功能。
对于您可以识别的单一语言文档,只要您在运行 OCR 之前指定正确的语言,任何这些工具都可以工作。对于包含多种语言的文档,例如包含英语和法语条款的双语合同,您需要一个支持多种并发语言或可以按段落自动检测的工具。 Google Cloud Vision 和 Tesseract 以及适当的语言数据包都可以处理多语言文档,尽管语言切换边界的准确性从来都不是完美的。
步骤 3:使用正确的语言配置并运行 OCR
在 Adobe Acrobat Pro 中,打开扫描的 PDF,转到“工具”,然后选择“扫描和 OCR”,然后选择“识别文本”,然后选择“在此文件中”。单击语言选择器旁边的编辑按钮。在“识别文本”对话框中,从下拉列表中选择正确的主要语言。如果文档包含第二种语言,请单击“添加语言”按钮并选择它。 Acrobat 同时处理两种语言。单击“确定”,然后单击“识别文本”。 Acrobat 运行 OCR 通道并将识别的文本作为不可见层嵌入到扫描图像后面。该文档现在可供搜索。
在 Tesseract 中,命令行调用使用 -l 标志指定语言:tesseract input.pdf 输出 -l rus 表示俄语,tesseract input.pdf 输出 -l jpn 表示日语,或 tesseract input.pdf 输出 -l fra+eng 表示法语-英语双语文档。先安装所需的语言数据文件; Tesseract 默认情况下仅提供英语。对于 Google Cloud Vision,API 调用包含一个 languageHints 参数,该参数接受 BCP-47 语言代码数组。 Cloud Vision 还提供自动语言检测模式,完全不需要语言提示,当您确实不知道文档的语言时,它是最简单的选择。
步骤 4:复制提取的文本并翻译
OCR 完成后,在将文本发送到翻译之前验证文本质量。在 Acrobat 中,打开查找工具并搜索您在文档中认识的常用单词。如果搜索找到匹配项,则 OCR 起作用。选择提取的文本的一段,将其复制并粘贴到纯文本编辑器中。扫描明显的 OCR 错误:重复的符号、中间中断的单词或大块无法识别的字符。如果超过 5% 的文本出现损坏,请使用不同的语言设置或更高分辨率设置重新运行 OCR。
提取的文本通过视觉完整性检查后,复制整个文本并将其粘贴到翻译工具中。 Google Translate、DeepL 或 Microsoft Translator 都接受纯文本输入。对于较长的文档,DeepL 和 Google Translate 支持可搜索 PDF 的直接文件上传,从而跳过手动复制步骤。翻译输出足以供理解、研究和内部业务使用。为了获得法律、医学或出版级的准确性,请将可搜索的 PDF 发送给专业的翻译人员,他们将使用 OCR 层作为起点,并根据原始扫描页面纠正机器翻译。
处理具有混合脚本或非标准字体的文档
混合脚本的文档(例如包含拉丁脚本中的英语技术术语的阿拉伯研究论文)会使需要单一脚本的 OCR 引擎感到困惑。首先为主要脚本配置 OCR,然后在同一文档上运行针对少数脚本的第二遍。通过导出两个 OCR 图层并在文本编辑器中组合它们来合并结果。由于引擎针对主要脚本进行了优化,因此少数脚本段落的准确性会较低。
即使选择了正确的语言,非标准字体(包括装饰字体、旧打字机字体和类似手写的草书字体)也会降低 OCR 准确性。通过将 PDF 页面转换为 400 DPI 或更高的高分辨率图像、应用锐化滤镜并增加对比度,对这些文档进行预处理,然后再将其输入 OCR 引擎。 Tesseract 的内置预处理通过 --psm 3 启用自动页面分割,可处理适度的字体变化。对于严重退化或程式化的文本,Google Cloud Vision API 通常优于本地 OCR 引擎,因为其模型已经在更大的现实世界字体样本语料库上进行了训练。
| OCR 工具 | 多语言支持 | 自动检测 | 最适合 |
|---|---|---|---|
| Adobe Acrobat 专业版 | 40多种语言 | 手动选择 | 文档专业,准确度高 |
| 超正方体(开源) | 100多种语言 | 需要手动选择 | 批处理、脚本、免费 |
| 谷歌云视觉 | 200多种语言 | 自动检测可用 | API集成、混合脚本 |
| 在线OCR服务 | 10-50种语言 | 手动选择 | 快速单文档 OCR |
对翻译内容采取行动之前验证准确性
OCR 和机器翻译引入了两层潜在错误:OCR 误识别和翻译歧义。对于重要文档,请请双语同事或专业翻译人员将随机选择的翻译段落与原始 PDF 进行比较,以抽查输出。五分钟的验证可以发现灾难性的失败,例如错误的语言设置产生了看似合理但完全错误的文本。
如果您经常处理外语扫描的 PDF,请构建一个清单:识别语言、选择匹配的 OCR 引擎、使用正确的语言参数运行 OCR、抽查提取的文本的字符准确性、翻译并验证示例段落。在两三个文档之后,工作流程就变成例行公事,从打开文件到读取翻译结果只需不到五分钟。
在文档处理方面,对于安全敏感的文档,离线 OCR 完全避免了云暴露。下载语言数据文件一次后,Tesseract 在本地运行,无需网络请求。 Adobe Acrobat Pro 还可以通过识别文本功能在本地执行 OCR,而无需登录 Document Cloud。对于法律证据开示或敏感商业信函等机密外语材料,本地 OCR 与离线文本审阅相结合,可将原始文档内容保留在您的受控环境中。
当仅 OCR 不够时:辅助转录服务
对于由于字体严重退化、手写文本或严重混合脚本而导致 OCR 准确性低得无法使用的文档,辅助转录服务可提供人工验证的输出。这些服务将初始机器 OCR 通行证与人工审核和纠正相结合,通常按页收费。周转时间从几个小时到几天不等。对于准确性不容妥协的单一关键文件,例如外语出生证明或专利申请,人工转录的成本是合理的,因为对错误识别的文本进行操作的风险是合理的。首先运行机器 OCR 以评估质量。如果超过 15% 的单词无法识别或明显错误,请升级为辅助转录,而不是花费数小时手动纠正机器输出。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
