スキャンされた文書に対して OCR PDF を実行するとテキストが抽出されますが、出力では、多くの場合、元の文書を読みやすくするための視覚的な構造が取り除かれます。見出しは単純な段落になり、列は 1 つのテキスト ストリームに折りたたまれ、表はごちゃ混ぜの断片に溶けます。 OCR 後も元のページ レイアウトをそのまま維持するということは、認識されたテキストが本来あるべき位置に配置され、文書に意味を与える読み取り順序、列構造、空間関係が維持されることを意味します。これには、処理後ではなく、処理前に適切な OCR 設定と出力形式を選択する必要があります。

OCR レイアウト保存の仕組み
OCR エンジンは、スキャンされたページを 2 つの異なる段階で処理します。最初の段階では、ページ画像を分析して、ゾーン、テキスト列、画像、表、ヘッダーなどのコンテンツのブロックを識別します。第 2 ステージでは、各ゾーン内で文字認識を実行します。レイアウトを保持する OCR アプローチでは、認識されたすべての単語の空間座標が維持され、テキストの内容だけでなく、それがページ上のどこに表示されるかが記録されます。これらの座標は、文書の読み取り順序と視覚的な階層を定義します。
レイアウトの保存が有効になっている場合、OCR 出力では、PDF 内の元のスキャン画像の上に非表示のテキスト レイヤーが直接埋め込まれます。認識された各単語は、スキャン内のソース文字の正確なピクセル位置に位置します。つまり、表示するとドキュメントはオリジナルと同じに見えますが、その下のテキストは選択可能、検索可能で、スクリーン リーダーからアクセス可能です。 スキャン PDF は、元のスキャンの視覚的な忠実性とデジタル作成されたファイルのテキスト機能を備えたハイブリッド ドキュメントになります。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
適切な OCR 出力モードの選択
ほとんどの OCR ツールには少なくとも 3 つの出力モードが用意されており、それらの出力モードの選択によってレイアウトが存続するかどうかが決まります。検索可能な画像モードでは、スキャンされた元のページが表示レイヤーとして保持され、その下に非表示のテキスト レイヤーが追加されます。これにより、ビジュアル ページが変更されないため、レイアウトが完全に維持されます。テキストと画像モードでは、認識されたテキストと抽出された画像を元のレイアウトに近づけるために再配置された新しいページが作成されます。このモードはレイアウトを部分的に保持し、単純な 1 列のドキュメントにはうまく機能しますが、複雑な複数列のページはわずかにずれる可能性があります。
テキストのみモードでは、すべての画像と書式設定が破棄され、レイアウト情報のないプレーン テキスト ストリームが生成されます。レイアウトが重要な場合には、このモードは完全に避けるべきです。 PDF 品質 とレイアウトの忠実度の両方が重要なドキュメントの場合、検索可能な画像モードが最適なバランスを提供します。元の画像データが残るため、ファイル サイズはテキストのみのエクスポートよりも大きくなりますが、元の視覚的な形式で読み取り、共有、またはアーカイブされるドキュメントにとっては、トレードオフの価値があります。
複数列および複雑なレイアウトの処理
複数列のドキュメントでは、読み取り順序がページ全体でジグザグになるため、OCR レイアウトの保持が最も困難になります。 2 列の学術論文では、OCR エンジンが左の列を最後まで読み取ってから、右の列の先頭に戻る必要があります。適切なゾーン検出がないと、OCR 出力で両方の列の行がインターリーブされ、1 行おきに異なる列に属する無意味なテキストが生成される可能性があります。
最新の OCR エンジンは、テキスト ブロック間のギャップを分析することで列の境界を識別するゾーン検出アルゴリズムを使用します。複数列のドキュメントで OCR を実行する前に、ツールが列検出または自動ゾーン設定を提供しているかどうかを確認してください。ツールが列の境界を誤って認識した場合、ほとんどのデスクトップ OCR アプリケーションでは、認識順序をガイドするためにページ上にゾーンの四角形を手動で描画できます。ゾーンの描画には事前に時間がかかりますが、出力での正しい読み取り順序が保証されます。
テーブルと数値データの保存
テーブルは、一般的な OCR では解釈が困難な方法でレイアウトとデータを組み合わせています。一貫した列幅と配置で行を交互に並べて表を人間の目に読みやすくするグリッド構造では、OCR エンジンがセル境界と、同じ行または列内のセル間の関係の両方を認識する必要があります。レイアウトの保存が正しく機能している場合、元のドキュメント内の表から、適切なセルに各値を含む表が OCR 出力に生成されます。
次の表は、さまざまな OCR 出力モードがテーブルの保存をどのように処理するかを比較しています。
| OCR 出力モード | テーブル構造 | セルアライメント |
|---|---|---|
| 検索可能な画像 | 元の画像は保存されます | 正確、ソースに組み込まれている |
| テキストと画像 | テキストテーブルとして再構築 | おおよその値であり、変動する可能性があります |
| テキストのみ | 完全に失われた | アライメントは保持されません |
レイアウトの品質に影響を与える OCR 設定
出力モード以外のいくつかの設定は、元のレイアウトがどの程度認識されるかに影響します。入力画像の DPI 設定が最も重要です。 300 DPI でのスキャンにより、OCR エンジンが文字の形状を識別し、レイアウト ゾーンを正確に検出するのに十分なピクセル密度が提供されます。 150 DPI 以下でスキャンすると、文字のエッジがぼやけて、認識エンジンとゾーン検出アルゴリズムの両方が混乱します。 600 DPI でスキャンすると精度がわずかに向上しますが、処理時間とファイル サイズが増加しますが、ほとんどのドキュメントではそれに比例したメリットはありません。
デスキュー補正は、わずかな角度でスキャンされたページをまっすぐにします。 2 度の傾きでも、ゾーン検出によって列の境界が対角線の分割線として誤って解釈される可能性があります。 OCR の前に自動デスキューを有効にすると、ほぼすべてのケースでレイアウトの保存が向上します。同様に、スペックル除去フィルターは、ゾーン検出器が小さなテキスト ブロックとして解釈する可能性のある漂遊ドットやスキャナ ノイズを除去します。これらは、認識されたゾーンを断片化し、読み取り順序を壊す可能性があります。 WukongPDF のようなツールは、これらの前処理補正を自動的に適用し、よりクリーンなゾーン マップを作成し、さまざまな種類のドキュメントにわたってより正確なレイアウトを保持します。
OCR後のレイアウト精度の検証
レイアウト保持を有効にして OCR を実行した後、ドキュメントをアーカイブまたは配布する前に結果を確認してください。出力 PDF を開き、テキスト選択ツールを有効にします。各列の段落にカーソルをドラッグし、選択内容が隣接する列にジャンプせずに正しい読み上げ順序に従っていることを確認します。表内に表示される単語を検索し、検索結果で正しいセルの位置が強調表示されていることを確認します。中央の列から段落をコピーし、テキスト エディタに貼り付けて、行が正しい順序で表示されることを確認します。
レイアウト エラーが混乱を引き起こす重要なドキュメントの場合、元のスキャンと OCR 出力をページごとに比較することが最も信頼性の高い検証方法です。両方のファイルを並べて開き、各段落の最初の文、すべての表ヘッダー、およびヘッダーまたはフッターに表示されるテキストを徹底的にチェックします。この段階でゾーン検出エラーを検出するには、1 ページあたり数秒かかります。数か月後、誰かが文書を検索しようとして結果が文字化けしたときにそれを発見すると、はるかにコストがかかります。
レイアウトの多いドキュメントに適した OCR エンジンの選択
さまざまな OCR エンジンが、さまざまな高度なレベルでレイアウトの保存を処理します。 Google が管理するオープンソース エンジンである Tesseract は、単純な 1 列のドキュメントでは良好に動作しますが、追加の前処理を行わないと複数列の学術論文や雑誌のレイアウトでは困難になる可能性があります。商用エンジンである ABBYY FineReader は、文字認識を実行する前にページ全体の構造を分析し、テキスト ブロック間の空間関係を保持するゾーン マップを構築するため、レイアウト保持に関する独立したベンチマークで常に最高位にランクされています。
レイアウトの保持が重要なドキュメントの場合は、ドキュメント全体を処理する前に、時間をかけて代表的なサンプル ページで 2 つの異なる OCR エンジンをテストします。各エンジンで単一の複雑なページを OCR し、出力を並べて比較します。両方の結果の読み取り順序、列の分離、およびテーブルの構造を確認してください。ドキュメント内で最も困難なページを処理するエンジンは、残りのページを適切に処理する可能性があります。この 15 分のテスト投資により、後で何時間も手動でレイアウトを修正する必要がなくなります。
WukongPDF には、ページ レイアウトと読み取り順序を保持する OCR 機能が含まれており、デスクトップ OCR ソフトウェアをインストールせずに正確に検索可能な PDF を必要とするユーザーにとって実用的な選択肢となります。クラウドベースの処理は複数ページのドキュメントを効率的に処理し、元の外観をそのままにした検索可能な PDF を返します。
レイアウトの保存において見落とされがちな要素の 1 つは、元のスキャンの品質と状態です。元のページが歪んでいたり、しわが寄っていたり、コントラストが低い場合、OCR エンジンは、レイアウト構造をマッピングするのではなく、画像の欠陥を修正することに分析リソースを費やすことになります。 OCR を実行する前に、各ページを目視で検査します。スキャンで傾いたテキスト ブロック、製本された本の背に沿った暗い影、または背景と同化した色あせたテキストが示された場合は、画像を前処理します。
レイアウトが保持された OCR 出力とレイアウトが削除された OCR 出力のファイル サイズの違いは、かなり大きくなる可能性があります。検索可能な画像 PDF では、スキャンされた元のページが、目に見えないテキスト オーバーレイを備えたフル解像度の画像レイヤーとして保存されるため、ファイル サイズはテキストのみの出力よりも数倍大きくなります。ストレージに制約がないアーカイブ目的の場合、レイアウトの忠実性を犠牲にしてファイルを大きくすることは価値があります。
歴史的文書を含むアーカイブ プロジェクトでは、元の文書の物理的な外観には歴史的および証拠的価値があるため、レイアウトの保存がさらに重要になります。すべての単語を正しく認識しながら、単語を 1 列のテキスト ブロックに再配置する OCR 出力は、元の単語の視覚的なコンテキストを破壊します。これらのプロジェクトでは、検索可能な画像のアプローチが必須であり、テキストのみの出力は元の文書の置き換えではなく、検索補助として扱う必要があります。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
