Tips & Tricks

複数の言語または英語以外のテキストを含む PDF を OCR する方法

バイリンガル契約書をスキャンします。左の欄は英語です。右の列はスペイン語です。両方の言語が検索可能である必要がありますが、一方の言語用に構成された標準 OCR 実行では、もう一方の言語が破壊されてしまいます。スペイン語のテキストに英語の OCR を適用すると、認識エンジンが異なる文字の頻度と単語のパターンを期待するため、無意味な結果が生成されます。スペイン語 OCR を英語に適用すると、同様に文字化けした結果が生成されます。両方の言語を同時に理解できる OCR が必要です。

多言語 OCR PDF は、単一のドキュメント内で言語モデルを切り替えることができる最新の認識エンジンの機能です。このエンジンは、各テキスト ブロックがどの言語で書かれているかを検出し、適切な認識モデルを適用します。その結果、ドキュメント内のすべての言語で正確なテキストが認識されます。

How to OCR a PDF That Contains Multiple Languages or Non-English Text

OCR エンジンが複数の言語を処理する方法

OCR エンジンは、各言語で文字がどのように見えるかのトレーニング済みモデルと文字の形状を比較することによってテキストを認識します。英語モデルは、文字「e」が「e」であることを知っています。最も一般的なのは、「th」です。頻繁に一緒に出現し、「qx」のような特定の文字の組み合わせは、ほとんど発生しません。スペイン語モデルは、「a」のようなアクセント付き文字が発音されることを知っています。アクセント付き「n」チルダ付き、逆疑問符が一般的です。フランス語モデルでは、頻繁にアクセントのある母音と特定の二重文字が想定されます。

OCR ジョブに複数の言語を指定すると、エンジンは指定されたすべての言語の文字モデルをロードします。ページ上の各テキスト ブロックを処理するときに、どの言語モデルが観察された文字パターンに最もよく一致するかを評価し、そのモデルを適用します。言語の検出はテキスト ブロック レベルで自動的に行われるため、英語の本文とフランス語の脚注を含むページは、手動で言語タグを付けなくても正しく処理されます。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

多言語 OCR のセットアップ

OCR ツールの言語選択では複数の言語が可能です。文書内に表示されるすべての言語を選択します。英語とスペイン語のバイリンガル契約の場合は、英語とスペイン語の両方を選択します。英語、フランス語、ドイツ語を含む EU 文書の場合は、3 つすべてを選択します。英語のテキストと古代ギリシャ語の引用を含む学術著作の場合は、「英語とギリシャ語」を選択します。エンジンは必要なすべてのモデルをロードします。

言語範囲と正確さの間にはトレードオフの関係があります。言語を追加するたびに、認識プロセスにさらに多くの文字モデルが追加されるため、異なる言語の類似した文字間で混同される可能性が高くなります。キリル文字「a」は、ラテン文字の「a」と同じに見えます。しかし、異なる音を表し、異なる文脈で現れます。不要な言語を追加すると、エンジンがテキスト ブロックを誤って分類し、間違った言語モデルを適用するリスクが増加します。役に立つと思われるすべての言語を選択するのではなく、文書に実際に登場する言語のみを選択してください。

一般的な多言語 OCR シナリオとその処理方法

最も一般的な多言語シナリオは、主に 1 つの言語で書かれ、短い文章、引用、または脚注が別の言語で書かれた文書です。英語の学術論文で、脚注にフランス語の引用が含まれています。英語の専門用語を記載したドイツ語の取扱説明書。英語で定義された用語を含むスペイン語の法的契約書。これらの文書では、主言語がテキストの大部分を占め、第 2 言語は短く予測可能な文脈に現れます。

言語の切り替えが特定のテキスト ブロックにローカライズされているため、認識エンジンはこれらの混合言語ドキュメントを適切に処理します。英語の本文は英語モデルで認識されます。フランス語の引用はフランス語モデルで認識されます。 2 つの言語は別々のテキスト ブロックに表示されるため、エンジンの言語検出は各ブロックにどのモデルを使用するかを正確に識別します。

より困難なシナリオは、同じ行に言語が交互に配置されているドキュメントです。たとえば、同じ行に英語の文が表示され、そのスペイン語への翻訳が表示されている語学教科書などです。 OCR エンジンは行全体を 1 つのテキスト ブロックとして扱い、そのすべてに 1 つの言語モデルを適用すると、他の言語の行の半分でエラーが発生する場合があります。これらのドキュメントの場合、最も正確なアプローチは、ドキュメントを 2 回 (各言語で 1 回ずつ) OCR し、結果を手動で結合することです。これは労働集約的であり、正確さが重要な短い文書の場合にのみ実用的です。

多言語 OCR 結果の検証

多言語 OCR を実行した後、各言語のテキストをチェックして結果を確認します。各言語で出現することがわかっている単語を検索します。検索で見つかったことを確認します。各言語のテキストを選択してコピーし、文字が正しいことを確認します。アクセント付きの文字や特殊記号には特に注意してください。 Scanned PDF の認識は、主要な言語モデルに存在しない文字では失敗する可能性が最も高くなります。これは、エンジンがデフォルトで最も近いラテン語に相当する文字を使用する可能性があるためです。

多言語文書でよくある OCR エラーには、アクセント付き文字がアクセントなしの対応する文字に置き換えられる、アクセント付きの e が e になる、チルダ付きの n が n になる、スペイン語の逆疑問符のような特殊な句読点が標準の疑問符に置き換えられる、キリル文字やギリシャ語などの非ラテン文字が視覚的に似たラテン文字として誤認識されるなどが含まれます。これらの間違いは通常、第 2 言語の文章に集中しています。第 2 言語のコンテンツが重要な場合は、それらの文章を元の文書と照らし合わせて手動で検証します。 WukongPDF の OCR ツールは、認識された各テキスト ブロックの信頼スコアを提供します。スコアが低いほど、認識エンジンの信頼性が低いブロックを示します。

中国語やアラビア語の引用が含まれる英語文書など、ラテンアルファベット言語と非ラテン文字が混在する文書の場合、文字の形状が根本的に異なるため、多言語 OCR の課題はより重要になります。認識エンジンは、まったく別個の書記体系を区別する必要があります。ドキュメント内に表示される各スクリプト ファミリに対して特定の言語を選択します。 WukongPDF の PDF 形式 の処理では、単一の OCR ジョブでのラテン文字、キリル文字、アラビア語、CJK、およびインド語スクリプトの混合がサポートされていますが、精度はスクリプトとスキャン品質によって異なります。

個別の言語セクションを持つドキュメントの多言語 OCR を改善するための実用的なテクニック: OCR を実行する前にドキュメントを言語ごとに事前に分離します。 20 ページの契約書の最初の 10 ページが英語、最後の 10 ページがスペイン語である場合、文書を 2 つのファイルに分割し、最初のファイルで英語の OCR を実行し、2 番目のファイルでスペイン語の OCR を実行してから、再結合します。これにより、複数言語モデルのオーバーヘッドが完全に回避され、各 OCR ジョブが処理対象の正確なテキストに最適化された単一言語モデルを使用するため、精度がわずかに高くなります。分割、個別に OCR、再マージのワークフローにはさらに数分かかりますが、言語境界が明確なドキュメントに対して最高の精度が確実に得られます。多言語 OCR アプローチは、複数の言語が同じページ上に実際に交互に配置されており、分離が現実的ではない文書に対してのみ使用してください。

多言語 OCR に関する最後のヒント: ドキュメントに、英語やフランス語などの左から右へのスクリプトと並んで、アラビア語、ヘブライ語、ペルシャ語などの右から左へのスクリプトが含まれている場合、テキストの方向により複雑さが増します。 OCR エンジンは、各テキスト ブロックがどの言語で書かれているかだけでなく、テキストがどの方向に流れるかを検出する必要があります。アラビア語テキストのブロックは右から左に認識される必要がありますが、その下の英語のキャプションは左から右に認識される必要があります。最新の OCR エンジンは、設定で両方の言語ファミリーを指定すると、混合方向のドキュメントを適切に処理します。 OCR 後、アラビア語の一節をコピーしてテキスト エディターに貼り付けて、テキストの方向を確認します。文字は、逆ではなく、正しい読み順で表示される必要があります。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →