Tips & Tricks

スキャンした PDF を OCR して検索可能にする方法

How to OCR a Scanned PDF to Make It Searchable

OCR によるスキャンされた PDF の処理

光学式文字認識は、ページ画像のコレクションであるScanned PDFを検索可能な文書に変換します。

OCR PDF プロセスは、各ページ画像を分析し、文字の形状を識別し、ページ画像の背後に非表示のテキスト レイヤーを作成します。 OCR 後、文書内の単語を検索し、テキストを選択してコピーし、スクリーン リーダーを使用して文書を読み上げることができます。

OCR は、テキストのパッシブなイメージを、テキスト選択とスクリーン リーダーをサポートするアクティブな検索可能なドキュメントに変換します。

OCR の精度は元のスキャンの品質に直接依存し、クリーンな 300 DPI スキャンで最良の結果が得られます。

OCR を使用せずにスキャンした PDF は、テキストのフォト アルバムのようなものです。言葉を見ることはできますが、対話することはできません。特定の用語を検索することはできません。段落をコピーして引用することはできません。スクリーンリーダーは使用できません。 OCR は、デジタル文書を単なる表示を超えて役立つ対話型機能を追加します。

OCR の精度は、元のスキャンの品質に依存します。均一な照明と鮮明な焦点を備えた 300 DPI でのクリーンな高解像度スキャンにより、標準的な印刷テキストに対して 99% 以上の OCR 精度が得られます。低解像度のスキャン、斜めから撮影した文書の写真、またはしわや汚れのある原稿のスキャンでは、精度が低くなります。スキャンの品質は、OCR 出力の品質を直接決定します。

OCR によって追加された PDF Searchable テキスト レイヤーは、ページ画像とは別のものです。 PDF の外観は OCR 後も変わりません。ページは依然としてスキャンされた画像のように見えます。その画像の背後には、認識されたテキストが目に見えない文字データとして存在し、検索エンジン、スクリーン リーダー、テキスト選択ツールがアクセスできます。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

さまざまなデバイスでスキャンした PDF で OCR を実行する方法

Windows では、Adobe Acrobat Pro はスキャンされた PDF で OCR を実行できます。 PDF を開き、[スキャンと OCR] ツールを選択し、[テキストの認識] を選択します。 Acrobat は各ページを処理し、テキストを認識し、検索可能なテキストレイヤーを追加します。ファイルを保存します。 PDF で検索とテキスト選択がサポートされるようになりました。 Acrobat Pro は、Windows 上で最も正確な OCR を提供します。

Mac では、組み込みのプレビュー アプリケーションには OCR が含まれていません。いくつかのサードパーティ Mac PDF ツールは OCR 機能を提供します。 PDF Expert と PDFpen には両方とも、スキャンされた PDF を処理し、検索可能なテキスト レイヤーを追加する OCR エンジンが含まれています。 OCR の品質は、標準ドキュメント用の Windows ツールと同等です。

WukongPDF のブラウザベースの OCR ツールは、どのオペレーティング システムでも動作します。スキャンした PDF をアップロードし、OCR エンジンのドキュメント言語を選択して、認識を実行します。処理が完了したら、検索可能な PDF をダウンロードします。ブラウザベースのアプローチにより、ソフトウェアをインストールせずに OCR にアクセスできます。

iPhone および Android の場合、OCR を含むスキャナ アプリがキャプチャ中にスキャンを処理します。 Adobe Scan、Microsoft Lens、iPhone Notes アプリの内蔵スキャナーはすべて、ドキュメントのスキャン時に OCR を自動的に実行します。結果として得られる PDF は、別の OCR 処理ステップを必要とせずに、スキャン後すぐに検索可能です。

困難なドキュメントの OCR 精度の向上

OCR を実行する前に、正しいドキュメント言語を選択してください。 OCR エンジンは、言語固有の辞書と文字頻度データを使用して、あいまいな文字を解決します。フランス語設定でフランス語文書に対して OCR を実行すると、英語設定を使用するよりも良い結果が得られます。多言語ドキュメントの場合は、第一言語を選択し、第二言語の一節のエラーを手動で修正します。

OCR の前にスキャンしたページの傾きを補正します。 OCR エンジンはテキスト行が水平であると想定するため、スキャンされたページが 1 ~ 2 度でもわずかに回転していると、OCR の精度が低下します。ほとんどのスキャン ソフトウェアには自動デスキュー機能が含まれています。キャプチャ中にスキャンのスキューを補正しなかった場合は、OCR を実行する前に PDF ページのスキューを補正してください。

小さなテキストまたは複雑なレイアウトを含むドキュメントのスキャン解像度を上げます。 10 ポイント未満のテキストでは、正確な OCR を実現するためにより高いスキャン解像度が必要です。ほとんどのドキュメントには 300 DPI でのスキャンで十分です。 8 ポイント以下のテキストを含むドキュメントの場合は、400 または 600 DPI でスキャンして、個々の文字を区別するのに十分なピクセル データを OCR エンジンに提供します。

テキストと写真やイラストを組み合わせたページなど、コンテンツ タイプが混在するドキュメントの場合、OCR エンジンはテキスト ゾーンのみを認識するように設定する必要があります。画像領域からテキストを認識しようとすると、文字化けが発生します。ほとんどの OCR ツールには、テキストが含まれるページ領域を指定できるゾーン選択機能が含まれています。

OCR 出力の検証と修正

OCR が完了したら、ページ上に表示されるいくつかの単語を検索して出力を確認します。検索でそれらが見つかった場合、OCR は成功しています。検索で明らかな単語が見つからない場合は、そのページの特定のフォント、レイアウト、または画質に対して OCR の精度が不十分である可能性があります。

完全に検索可能でなければならない法的記録や医療記録など、OCR の精度が重要な文書の場合は、認識されたテキストを手動で確認します。一部の PDF ツールでは、非表示のテキスト レイヤーを表示および編集できます。特に OCR エンジンが誤認識する可能性が高い固有名、数字、専門用語などの認識エラーを修正します。

最も一般的な OCR エラーには、文字の混同が含まれます。文字 l と数字の 1 は、多くのフォントで似ています。文字 rn を組み合わせると文字 m のように見えることがあります。

cl という文字は、d という文字のように見えることがあります。このような文字の混乱により、見た目は元の単語と似ていますが、テキスト的には間違った単語が生成されます。重要なセクションを手動でレビューすると、これらのエラーが見つかります。

OCR 出力を確認した後、OCR で処理されたことを示すファイル名でドキュメントを保存します。 Report-OCR.pdf や Report-Searchable.pdf のようなファイル名は、検索可能なバージョンと元の画像のみのスキャンを区別します。

検索可能なスキャン PDF の実際的な利点は、大きな文書の中から特定の情報を見つける必要があるときに初めて明らかになります。 OCR なしでスキャンされた 200 ページの契約書では、特定の条項を見つけるためにすべてのページを手動で読む必要があります。検索可能なバージョンでは、数秒で文節が見つかります。複数回参照することが予想されるドキュメントの場合、OCR への投資はそれだけで元が取れます。

OCR 処理された PDF はスクリーン リーダーでもアクセスできるため、支援技術を利用して文書を読む視覚障害のある人も PDF を利用できます。 OCR なしでスキャンされた PDF には、読み上げられるテキストがないため、スクリーン リーダーはまったくアクセスできません。 OCR を追加すると、ドキュメントにアクセスできるようになります。これは、セクション 508 や WCAG などのアクセシビリティ標準で要求されています。

英語以外の言語のドキュメントの場合は、処理する前に正しい OCR 言語を選択してください。 OCR エンジンは、言語固有の文字認識モデルを使用します。日本語モデルで認識された日本語のドキュメントは、英語モデルで認識された同じドキュメントよりもはるかに優れた結果を生成します。

OCR を使用すると、テキストを抽出して他のドキュメントで再利用することもできます。スキャンした文書の一節を独自のレポートに引用する必要がある場合、OCR を使用するとテキストがコピー可能になります。 OCR を使用しない場合は、文章を手動で再入力する必要があります。 OCR 処理された文書からコピーして貼り付けることができるため、大幅に時間が節約されます。

スキャンした文書をアーカイブする場合、OCR は重要な保存手順です。現在アーカイブされている画像のみのスキャンされた PDF には、将来の研究者が検索できる機能はありません。検索可能な PDF では、テキスト検索を通じてドキュメントのコンテンツにアクセスできるため、将来のユーザーにとってドキュメントの有用性が大幅に向上します。

PDF のファイル サイズは OCR 後でも大幅に変化しません。 OCR データは、各ページに少量のテキスト データ (通常は 1 ページあたり数キロバイト) を追加します。元のページの画像は変更されません。検索可能なテキスト レイヤーによる機能向上を考慮すると、ファイル サイズの増加は無視できます。

OCR によって追加された検索可能なテキスト レイヤーは、ビジュアル ページ イメージとは別のものです。 OCR 処理された PDF で単語を検索すると、画像ではなくテキスト レイヤーが検索されます。検索結果では、ページ画像上のテキストが見つかった領域が強調表示されます。

OCR 処理された PDF はテキスト読み上げをサポートしているため、視覚障害のある人や、文書を読むよりも聞くことを好むすべての人が PDF にアクセスできます。このアクセシビリティ機能は、単純な検索機能を超えた OCR の大きな利点です。

数百または数千のスキャンされたページを伴う大規模な OCR プロジェクトの場合、バッチ OCR 処理により時間を大幅に節約できます。 OCR 設定を一度構成すると、ドキュメント バッチ全体に適用されます。すべてのページを確認するのではなく、ページのサンプルを確認して正確性を確認してください。

OCR テキスト レイヤーはプレーン テキスト ファイルとしてエクスポートできるため、ドキュメントのコンテンツを他のアプリケーションで使用できます。認識されたテキストをエクスポートし、テキスト エディターまたはワード プロセッサで開き、新しいドキュメントのベースとして使用します。

OCR 処理された PDF の長期的な価値は、文書内の情報を検索する必要があるたびに発揮されます。契約書、マニュアル、または参考文書の検索可能な PDF は、手動で読み取る必要がある静的ファイルではなく、クエリできるリソースになります。

ドキュメント スキャン ワークフローの標準ステップとして OCR を実装すると、デジタル化したすべてのドキュメントがデジタル ライブラリに入った瞬間から検索可能になります。スキャン中の数秒間の追加 OCR 処理は、これまでにスキャンした文書内の情報を見つける必要があるたびに役に立ちます。

デジタル ドキュメント ライブラリを管理する人にとって、OCR はスキャンされた PDF に適用できる唯一の最も影響力のある処理ステップです。パッシブな画像ファイルを、アクティブで検索可能でアクセス可能なドキュメントに変換します。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →