スキャンされた画像だけの PDF があります。どのページも一枚の紙の写真です。これを、編集、検索、書式設定できる実際の Word 文書に変換する必要があります。コピーするテキストがないため、コピー&ペーストは機能しません。 40 ページを手作業で再入力することは、深刻な選択肢ではありません。唯一の実用的な方法は、OCR、光学式文字認識、および元のレイアウトを尊重する変換です。
プロセスは十分に確立されており、ツールは成熟していますが、出力の品質は入力の品質と変換時の選択に大きく依存します。シンプルなタイプの文書をクリーンで高解像度でスキャンすると、ほぼ完璧な精度で編集可能な Word ファイルに変換されます。表、列、手書きメモを含む複雑なレイアウトを低解像度でスキャンした場合は、変換後にクリーンアップが必要になります。各品質レベルで何が予想されるかを把握しておくと、入力が単に OCR エンジンにとって適切に処理できないほど劣化していたときに、ツールが失敗したと考えるフラストレーションを防ぐことができます。

スキャンを Word に変換するときに OCR が実際に行うこと
OCR 変換は 2 段階のプロセスです。最初の段階では、OCR エンジンがスキャンされた画像を分析し、テキスト、画像、表、その他のコンテンツ タイプを含む領域を識別します。このレイアウト分析ステップは、出力ドキュメントの読み取り順序と構造を決定するため、重要です。エンジンが 2 列のレイアウトを 1 つの列と間違えた場合、出力では左右の列の文が挟まれて意味不明になります。
第 2 段階では、エンジンは各テキスト領域を 1 文字ずつ処理し、ピクセル パターンを既知の文字形式と照合します。 PDF Association による 2025 年のベンチマークでは、入力されたテキストのクリーンな 300 DPI スキャンでの OCR 精度は、テストされたエンジン全体で 95% から 99% 以上の範囲であることがわかりました (PDF Association、「OCR Accuracy Benchmark Report」、2025)。この精度では、2,500 文字の一般的なページには 25 ~ 125 個のエラーが含まれることになります。これらのエラーのほとんどは、数字の 1 と文字の l、文字の組み合わせ rn と単一の m、またはスキャンアーチファクトによって部分的に隠されている句読点など、視覚的にあいまいな文字に発生します。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
可能な限り最適な変換のためのセットアップ
変換品質を向上させるためにできる最も効果的なことは、OCR ソフトウェアに触れる前に行うことです。それは、300 DPI 以上でスキャンすることです。ネバダ大学ラスベガス校による 2018 年の研究では、300 DPI スキャンでの OCR 精度は平均 97.5% であり、同じ文書の 150 DPI スキャンでは平均 87.2% であったことがわかりました (UNLV、「OCR 精度に対する画像解像度の影響」、2018 年)。 10 ポイントの精度の差は、簡単なスペルチェックでクリーンアップできる文書と、大規模な手動修正が必要な文書との差です。
解像度以外にも、スキャン前の習慣がいくつか役に立ちます。傾きを避けるため、ドキュメントをスキャナー ベッド上に平らに、まっすぐに揃えて置きます。 OCR エンジンはモノクロ入力をより高速かつ正確に処理するため、テキスト ドキュメントにはカラーではなくグレースケール モードまたは白黒モードを使用します。影を落としたり文字を隠したりするホチキス針、クリップ、付箋などは取り除いてください。本や製本された文書をスキャンする場合は、背表紙をガラスに平らに押し付けて、OCR エンジンが文字や単語の境界として誤って認識する暗い溝の影を最小限に抑えます。
スキャンした PDF を Word に段階的に変換する
OCR テクノロジーが成熟した現在、変換の実行自体はほんの数ステップで完了します。 WukongPDF では、スキャンした PDF をアップロードし、OCR オプションを選択し、出力形式として Word を選択します。このツールは、スキャンされたページで OCR を実行し、認識されたテキストを .docx ファイルにエクスポートします。プロセス全体がブラウザーで実行されるため、ソフトウェアをインストールする必要はなく、ファイルがデバイスから離れてリモート サーバーで処理されることもありません。
デスクトップ ソフトウェアを使用する場合は、Adobe Acrobat Pro の PDF エクスポート機能も同様に機能します。スキャンした PDF を開き、エクスポート先を選択し、Microsoft Word を選択すると、Acrobat は Word ファイルを生成する前に OCR PDF を自動的に実行します。デスクトップアプローチにはバッチ処理という利点があります。スキャンした PDF のフォルダー全体を変換のために一晩キューに入れ、朝になると Word 文書でいっぱいのフォルダーに戻ることができます。
無料のツールでもこのタスクを処理できます。 Google ドライブはアップロードされた画像や PDF を自動的に OCR 処理しますが、出力は .docx ファイルではなく Google ドキュメントになります。変換品質は単純なレイアウトでは許容範囲ですが、表、列、および混合コンテンツでは問題が発生することがよくあります。 Google ドキュメントは、Word で編集するために .docx ファイルとしてダウンロードできます。この 2 段階のルートは機能し、費用はかかりませんが、スキャンから Google ドキュメントへ、Google ドキュメントから Word へという 2 つの変換によって書式設定が蓄積され、最終的な文書の再書式設定に時間がかかることが予想されます。
出力から期待できることとそれをクリーンアップする方法
事前に期待値を設定します。何時間もイライラする必要がなくなります。 OCR エンジンはテキストを認識します。元のドキュメントの書式設定は再作成されません。元の PDF のフォントは、同様のシステム フォントに置き換えられます。段落の間隔、余白、インデントは、ピクセル完璧な再現ではなく、元のレイアウトでの OCR エンジンの最良の推測を反映します。表は、実際の Word 表オブジェクトではなく、タブ区切りのテキストとして届く場合があります。元のスキャンの画像は省略されるか、ソース領域の切り取られたスクリーンショットとして埋め込まれます。
構造から始めて、次に化粧品に取り組みます。この順序が最も時間を節約します。文書に目を通し、列やサイドバーが本文に溶け込んでいる読み上げ順序の問題を修正します。見出しが太字の段落として本文にダンプされるのではなく、見出しとして認識されていることを確認します。番号付きリストと箇条書きリストがリストとして残っていることを確認します。構造的な問題が解決したら、スペルチェックを実行して OCR エラーを検出します。ほとんどのワード プロセッサは、認識できない単語に自動的にフラグを立てるため、OCR エラーを簡単に発見して修正できます。最後に、目的の書式設定、フォント、余白、スタイルを構造的にきれいなドキュメントに適用します。
OCR 変換がうまくいかない場合とその対処法
特定の種類のドキュメントは、使用するツールに関係なく、確実に OCR エンジンに挑戦します。手書きのテキストは依然として最も困難なケースです。 AI を活用した手書き認識は近年大幅に向上しましたが、入力されたテキストと手書きのテキストの精度の差は依然として大きいです。 スキャン PDF にほとんど手書きのコンテンツが含まれている場合は、変換後に大幅な手動修正を行うか、編集可能なテキストが本当に必要なのか、単に検索可能な画像 PDF が必要なのかを検討してください。
複雑なレイアウトの文書、複数段組みの学術論文、新聞のページ、ラベル付きのボックスにテキストが散在するフォームでも、一貫性のない結果が生成されます。 OCR エンジンは読み取り順序を決定する必要がありますが、複雑なページでは、その順序が人間が意図した読み取り順序と一致しない可能性があります。実際的な回避策の 1 つは、OCR を実行する前にスキャンを小さな単一列領域にトリミングまたはマスクしてから、個別の出力を再組み立てすることです。これには事前に時間がかかりますが、劇的にきれいな最終ドキュメントが作成されます。
色付きの紙やテクスチャーのある紙に印刷された文書、または透かし、スタンプ、または濃い背景パターンのある文書は、テキストと背景を分離するしきい値処理アルゴリズムを混乱させます。その結果、背景要素がテキストとして誤認されたアーティファクト、マージされた文字、または偽の句読点が散りばめられたテキストが生成されます。コントラストを高く設定したり、グレースケールで再スキャンしたりすると、OCR を実行する前に画像エディターでスキャンをデジタル的にクリーニングすると効果があることがよくあります。明るさとコントラストを上げて背景を純白に近づけ、テキストを暗い黒のままにすると、OCR エンジンに可能な限りクリーンな入力が得られます。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
