話せない言語で書かれたスキャンされた PDF を受け取ることは、グローバルなビジネス、学術研究、法的文書のレビューにおいて、これまで以上に一般的になっています。テキストを抽出して翻訳し、文書の内容を理解する必要があります。課題は、ファイルに対して OCR を実行することだけではありません。正しい言語設定で OCR を実行しているため、抽出されたテキストは翻訳できるほど正確です。 OCR PDF の処理中に間違った言語を選択すると、翻訳エンジンが修復できない文字化けした出力が生成されます。
OCR エンジンは文字を認識しません。彼らは形状を認識し、その形状を特定の言語の文字パターンと照合します。 OCR エンジンに文書が英語であるが、実際にはロシア語であると伝えると、エンジンはキリル文字を認識している最も近いラテン文字にマッピングします。その結果、元のテキストとは何の関係もない、ランダムに見える文字列が生成されます。言語設定を正しく行うか、可能な場合は自動検出を使用するかが、OCR から翻訳までのパイプライン全体の中で最も重要な決定です。
WukongPDF の PDF to Text および OCR ツールは、翻訳と分析のためにスキャンされた文書からテキストを抽出します。適切な OCR 言語の選択と信頼できる翻訳サービスを組み合わせることで、読めない外国語のスキャン結果が 5 分以内に理解できる文書に変わります。

ステップ 1: ドキュメント言語を特定する
OCR ソフトウェアに触れる前に、文書の言語を確実に識別してください。ドキュメントのメタデータまたはファイル名がその言語を示唆している場合は、そこから始めてください。そうでない場合は、PDF を開いて数ページをご覧ください。テキストを読まなくても、視覚的な手がかりは可能性を大幅に狭めます。文字ファミリーは独特です。ラテン文字はほとんどのヨーロッパ言語に対応します。キリル文字は、ロシア語、ウクライナ語、ブルガリア語、セルビア語に使用されます。アラビア文字には、アラビア語、ペルシア語、ウルドゥー語が含まれます。 CJK は中国語、日本語、韓国語をカバーします。デヴァナーガリーはヒンディー語、マラーティー語、ネパール語をカバーしています。
スクリプトファミリーさえ視覚的に識別できない場合は、代表的な段落のスクリーンショットを撮り、Google 翻訳の画像翻訳機能または逆画像検索にアップロードしてください。これらのツールは、ほとんどの場合、スクリプトと特定の言語の両方を識別します。文書がラオス語ではなくタイ語であること、または日本語ではなく韓国語であることを知っているかどうかで、正確な OCR 出力と無用な文字ノイズの違いが生じます。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
ステップ 2: ターゲット言語をサポートする OCR ツールを選択する
すべての OCR ツールがすべての言語をサポートしているわけではありません。 Adobe Acrobat Pro には、約 40 の言語に対応する OCR エンジンが付属しています。テキスト認識ツールには、設定ダイアログに言語選択ドロップダウンが含まれています。 Tesseract は、Google が管理する無料のオープンソース OCR エンジンで、ダウンロード可能な言語データ ファイルを通じて 100 以上の言語をサポートしています。 Google Cloud Vision API は 200 を超える言語をカバーしており、オプション機能として自動言語検出が含まれています。
識別できる単一言語のドキュメントの場合、OCR を実行する前に正しい言語を指定していれば、これらのツールはいずれも機能します。英語とフランス語の両方の条項を含むバイリンガル契約書など、複数の言語が含まれる文書の場合は、複数の同時言語をサポートするか、段落ごとに自動検出できるツールが必要です。適切な言語データ パックを備えた Google Cloud Vision と Tesseract は両方とも多言語ドキュメントを処理しますが、言語切り替え境界の精度は決して完璧ではありません。
ステップ 3: 正しい言語で OCR を構成して実行する
Adobe Acrobat Pro で、スキャンした PDF を開き、[ツール]、[スキャンと OCR] の順に移動し、[テキストの認識]、[このファイル内] の順に選択します。言語セレクターの横にある「編集」ボタンをクリックします。 [テキストの認識] ダイアログで、ドロップダウンから正しい第一言語を選択します。文書に第 2 言語が含まれている場合は、「言語の追加」ボタンをクリックしてその言語も選択します。 Acrobat は両方の言語を同時に処理します。 「OK」をクリックし、「テキストを認識」をクリックします。 Acrobat は OCR パスを実行し、認識されたテキストをスキャン画像の背後に非表示のレイヤーとして埋め込みます。ドキュメントが検索可能になりました。
Tesseract では、コマンド ライン呼び出しで -l フラグを使用して言語を指定します。 tesseract input.pdf out -l rus (ロシア語の場合)、tesseract input.pdf out -l jpn (日本語の場合)、または tesseract input.pdf out -l fra+eng (フランス語と英語のバイリンガル ドキュメントの場合)。最初に必要な言語データ ファイルをインストールします。 Tesseract はデフォルトで英語のみで出荷されます。 Google Cloud Vision の場合、API 呼び出しには、BCP-47 言語コードの配列を受け入れる languageHints パラメーターが含まれています。 Cloud Vision は、言語のヒントをまったく必要としない自動言語検出モードも提供しており、文書の言語がまったくわからない場合に最も簡単なオプションになります。
ステップ 4: 抽出したテキストをコピーして翻訳
OCR が完了したら、翻訳に送信する前にテキストの品質を確認します。 Acrobat で検索ツールを開き、文書内で認識される一般的な単語を検索します。検索で一致するものが見つかった場合、OCR は機能しています。抽出したテキストの段落を選択してコピーし、プレーン テキスト エディターに貼り付けます。明らかな OCR エラー (繰り返しの記号、途中で切れる単語、または認識できない文字の大きなブロック) をスキャンします。テキストの 5% 以上が破損していると思われる場合は、別の言語設定またはより高い解像度設定で OCR を再実行します。
抽出されたテキストが視覚的健全性チェックに合格したら、テキスト全体をコピーして翻訳ツールに貼り付けます。 Google 翻訳、DeepL、または Microsoft Translator はすべて、プレーン テキスト入力を受け入れます。長いドキュメントの場合、DeepL と Google 翻訳は検索可能な PDF の直接ファイル アップロードをサポートしており、手動でのコピー手順を省略できます。翻訳出力は、理解、研究、社内業務での使用には十分です。法律、医療、または出版グレードの精度を得るには、検索可能な PDF をプロの人間の翻訳者に送信します。翻訳者は、出発点として OCR レイヤーを使用し、元のスキャンされたページに対して機械翻訳を修正します。
スクリプトまたは非標準フォントが混在するドキュメントの処理
ラテン文字で英語の専門用語を含むアラビア語の研究論文など、文字が混在するドキュメントは、単一の文字を期待する OCR エンジンを混乱させます。最初に主要なスクリプトの OCR を構成してから、同じドキュメント上の少数派のスクリプトをターゲットとする 2 番目のパスを実行します。両方の OCR レイヤーをエクスポートし、テキスト エディターで結合することにより、結果を結合します。エンジンは主要なスクリプトに対して最適化されているため、少数派のスクリプトの部分の精度は低くなります。
装飾書体、古いタイプライター フォント、手書きのような筆記体フォントなどの非標準フォントは、正しい言語が選択されている場合でも OCR の精度を低下させます。これらのドキュメントを OCR エンジンに入力する前に、PDF ページを 400 DPI 以上の高解像度画像に変換し、鮮明化フィルターを適用し、コントラストを高めることによって前処理します。 Tesseract の組み込み前処理は、自動ページ セグメンテーション用に --psm 3 で有効になり、適度なフォントのバリエーションを処理します。著しく劣化したテキストや様式化されたテキストの場合、Google Cloud Vision API のモデルは現実世界のフォント サンプルのより大きなコーパスでトレーニングされているため、通常、ローカル OCR エンジンよりも優れたパフォーマンスを発揮します。
| OCR ツール | 多言語サポート | 自動検出 | 最適な用途 |
|---|---|---|---|
| アドビ アクロバット プロ | 40以上の言語 | 手動選択 | プロフェッショナルな文書、高精度 |
| Tesseract (オープンソース) | 100以上の言語 | 手動選択が必要です | バッチ処理、スクリプト作成、無料 |
| Googleクラウドビジョン | 200以上の言語 | 自動検出が利用可能 | API統合、混合スクリプト |
| オンラインOCRサービス | 10~50の言語 | 手動選択 | 単一ドキュメントの迅速な OCR |
翻訳されたコンテンツに基づいて行動する前に正確さを検証する
OCR の後に機械翻訳を行うと、OCR の誤認識と翻訳の曖昧さという 2 つの層の潜在的なエラーが発生します。重要な文書の場合は、バイリンガルの同僚またはプロの翻訳者に、ランダムに選択した翻訳の段落を元の PDF と比較してもらい、出力をスポットチェックします。 5 分間の検証では、間違った言語設定により、一見もっともらしく見えても完全に不正確なテキストが生成されるなど、致命的な失敗を検出します。
外国語でスキャンした PDF を定期的に扱う場合は、チェックリストを作成します。言語を特定し、一致する OCR エンジンを選択し、正しい言語パラメータで OCR を実行し、抽出されたテキストの文字精度をスポットチェックし、翻訳し、サンプル段落を検証します。文書が 2 つまたは 3 つあると、ワークフローは日常的なものになり、ファイルを開いて翻訳結果を読み取るまでに 5 分もかかりません。
文書処理に関しては、セキュリティーが重要な文書の場合、オフライン OCR によりクラウドへの露出が完全に回避されます。 Tesseract は、言語データ ファイルを一度ダウンロードすると、ネットワーク リクエストなしでローカルで実行されます。 Adobe Acrobat Pro は、Document Cloud にサインインしなくても、テキスト認識機能を介してローカルで OCR を実行します。法的証拠開示や機密性の高いビジネス通信などの機密の外国語資料の場合、ローカル OCR とオフライン テキスト レビューを組み合わせて、元の文書コンテンツを管理された環境内に保持します。
OCR だけでは不十分な場合: 文字起こし支援サービス
極端なフォントの劣化、手書きのテキスト、またはスクリプトの混在が原因で OCR 精度が使用できないほど低い文書の場合、文字起こし支援サービスは人間による検証済みの出力を提供します。これらのサービスは、最初のマシン OCR パスと人間によるレビューおよび修正を組み合わせたもので、通常はページごとに課金されます。所要時間は数時間から数日です。外国語の出生証明書や特許出願など、正確性が交渉の余地のない単一の重要な文書の場合、誤って認識されたテキストに基づいて作業を行うリスクを考えれば、人間による転写のコストは正当化されます。最初にマシン OCR を実行して品質を評価します。単語の 15% 以上が認識されない、または明らかに間違っている場合は、機械出力を手動で修正するのに何時間も費やすのではなく、文字起こし支援にエスカレーションします。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
