二か国語のメニューをスキャンします。料理名はイタリア語です。説明は英語です。価格は言語に依存しない数値です。イタリア語の単語リストを作成するにはイタリア語のテキストのみを抽出するか、別の言語ペアの翻訳者に送信するには英語のテキストのみを抽出する必要があります。文書全体に対して OCR を実行すると、両方の言語が混在して生成されます。これは検索性には問題ありませんが、選択的な抽出には適していません。
多言語OCR PDF ドキュメントから 1 つの言語のみでテキストを抽出するには、各テキスト ブロックがどの言語で書かれているかを識別し、ターゲット言語に一致するブロックのみを抽出できる OCR エンジンが必要です。これは、言語に関係なくすべてのテキストを認識する標準の OCR よりも選択的な操作です。

言語選択型 OCR の仕組み
複数言語をサポートする OCR エンジンは、複数言語のテキストを同時に認識するように構成できます。 「イタリア語と英語」を指定すると、 OCR 言語として、エンジンは両方のテキストを認識します。また、認識された各テキスト ブロックに、認識された言語のタグが付けられます。イタリア語テキストのブロックは、イタリア語としてタグ付けされます。英語のテキストのブロックには英語のタグが付けられます。言語タグ付けにより、選択的な抽出が可能になります。
OCR 後、認識されたテキストを言語タグでフィルタリングできます。イタリア語としてタグ付けされたブロックのみをエクスポートします。出力は、メニューのイタリア語テキストのみを含むドキュメントです。英語の説明は認識されますが、除外されたため、出力には表示されません。この選択的抽出は、翻訳ワークフロー、言語学習教材、および周囲の他の言語のテキストから特定の言語のテキストを分離する必要があるコンテンツ分析に役立ちます。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
ステップバイステップ: 特定の言語でのテキストの抽出
スキャンした PDF を WukongPDF の OCR ツールにアップロードします。ドキュメント内に存在する言語を選択します。イタリア語と英語のメニューの場合は、イタリア語と英語の両方を選択します。 OCRを実行します。このツールはすべてのテキストを認識し、言語ごとに各ブロックにタグを付けます。 OCR が完了したら、言語フィルターを使用してイタリア語を選択します。フィルターされたテキストをプレーン テキスト ファイル、Word 文書、またはイタリア語ブロックのみを含む新しい PDF としてエクスポートします。
言語検出の精度は、言語の独自性に依存します。イタリア語と英語は同じアルファベットを使用しますが、単語のパターンが異なります。 OCR エンジンは、単語の頻度を分析することでそれらを区別します。イタリア語には母音で終わる単語がたくさんあります。英語には子音で終わる単語がたくさんあります。言語が明確であればあるほど、言語タグ付けはより正確になります。スペイン語とポルトガル語など、密接に関連する 2 つの言語は、短いテキスト ブロックのエンジンによって混同される可能性があります。
同じ行上の混合言語テキストの処理
一部の文書では、フランス語の文と英語の翻訳が同じ行に組み合わされている語学教科書など、1 行内に複数の言語が混在しています。 OCR エンジンは行全体を主要言語として分類し、少数言語の単語に誤ってタグを付ける可能性があります。これらのドキュメントの場合、ブロック レベルでの言語選択抽出は十分な精度ではありません。別のアプローチが必要です。
別の方法は、OCR を 2 回実行し、各言語を単一の認識言語として 1 回ずつ実行することです。イタリア語専用の OCR パスは、イタリア語のテキストを適切に認識しますが、英語のテキストは破損します。英語専用パスでは英語はよく認識されますが、イタリア語は混乱します。 2 つの出力を比較し、各テキスト セグメントの正しいバージョンを手動で選択します。このデュアルパスアプローチでは時間はかかりますが、言語が文レベルでインターリーブされているドキュメントに対して、最も正確な言語固有の抽出が行われます。
抽出されたテキストの検証とクリーニング
ターゲット言語のテキストを抽出した後、言語フィルタリングが正確であることを確認します。抽出されたテキストをスキャンして、明らかに間違った言語で書かれている単語を探します。メニューからイタリア語のテキストを抽出する場合は、「グリル」などの英語の単語を含めないでください。または「添えて」メニューのイタリア語の説明に意図的にそれらの単語が使用されていない限り。フィルタリングされたテキストに予期しない外来語が含まれている場合は、手動で修正する必要がある言語タグ付けエラーを示しています。
ターゲット言語でスペルチェックを実行します。イタリア語のスペル チェックは、イタリア語の抽出に誤って含まれていた英語の単語にフラグを立てます。スペル チェック フラグは、抽出されたすべての単語を読まなくても、言語タグ付けのエラーを見つける効率的な方法です。言語フィルターとスペルチェックが行われたPDF データの抽出 は、翻訳、分析、またはアーカイブに使用できる状態になっています。 WukongPDF の スキャン PDF 言語フィルタリングを使用した OCR は、混合言語 OCR 出力を後処理して不要な言語を削除するよりも、よりクリーンな単一言語抽出を生成します。
言語選択型 OCR の実用的なアプリケーション: 翻訳された文書から対訳用語集を作成します。すべてのソース言語の用語とすべてのターゲット言語の用語を個別に抽出します。各ソース用語には、ページ上または隣接する列のほぼ同じ垂直位置に対応するターゲット用語があるため、ページ上の位置に基づいてそれらを揃えます。調整された出力は、翻訳者が将来の翻訳間で一貫性を確保するために使用できる用語リストになります。この用語集構築手法は、用語の一貫性が重要な技術翻訳で広く使用されています。
2 列の対訳契約書など、言語が別の列にある文書の場合、言語選択抽出は列選択タスクになります。左の列は 1 つの言語、右の列は別の言語です。類似した言語を混同する可能性がある言語検出に頼るのではなく、PDF をトリミングして各列を個別に抽出します。各列に対して単一言語 OCR を実行します。この列切り取りアプローチは、明確な列形式の言語分離を持つドキュメントの言語フィルタリングよりも信頼性が高くなります。
歴史的な多言語文書を含むアーカイブ プロジェクトの場合、言語選択型 OCR とメタデータのタグ付けを組み合わせることで、検索可能なアーカイブが作成され、研究者は数千の文書から特定の言語のコンテンツを見つけることができます。各ドキュメントの OCR 出力には、検出された言語のタグが付けられます。 18 世紀のフランス語文書を検索する研究者は、多言語コレクション全体からフランス語のテキストのみをフィルタリングできます。この選択的なアプローチにより、アーカイブ OCR は、言語を混合する鈍いツールから言語研究のための精密機器に変わります。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
