スキャンされた文書に対して OCR PDF を実行すると、認識されたテキストが生成されます。ほとんどのユーザーにとって、目標は検索可能な PDF です。しかし、認識されたテキストをデータベースにインポートしたり、検索エンジンでインデックスを作成したり、アプリケーションでクエリしたりする必要がある場合、標準の OCR 出力形式は理想的ではありません。 OCR 結果をデータベースのインポートとインデックス作成に最適化された構造化形式でエクスポートすると、スキャンされたドキュメント アーカイブが、ビジネス システムと統合されるクエリ可能なデータに変わります。
重要なポイント
データベース対応の OCR 出力形式には、表形式データの CSV、構造化ドキュメント コンテンツの JSON、階層構造を保持する必要があるドキュメントの XML が含まれます。標準の OCR 出力との主な違いは、データベース指向の形式には、一貫したフィールド マッピング、データ型インジケーター、および信頼性の低い認識結果のエラー処理が含まれていることです。 OCR の前に PDF を準備すると、スキュー補正、コントラスト強調、解像度調整などを行うことができ、エクスポートされるデータの品質が大幅に向上します。

データベースに適した出力形式を選択する
CSV 出力は、各ドキュメントがデータベース内の 1 行に対応するスキャンされたフォームや表に最適です。各フォーム フィールドは列になり、スキャンされた各ドキュメントは行になります。 CSV は、変換せずにスプレッドシート アプリケーションやリレーショナル データベースに直接インポートします。制限は、CSV では階層データを表現できないことです。複数の項目を含む請求書など、スキャンされたドキュメントにネストされた構造がある場合、CSV では構造を平坦化するか、出力を複数のファイルに分割する必要があります。
JSON 出力は、ネストされた変数構造を自然に処理します。ヘッダー セクションと複数の品目を持つ請求書は、ヘッダー配列と品目配列を持つ JSON オブジェクトとして表されます。 JSON は、MongoDB などのドキュメント データベース、Elasticsearch などの検索インデックス、およびほとんどの最新のアプリケーション プラットフォームにインポートされます。 OCR から JSON、データベースへのPDF データの抽出 パイプラインは、2025 年の文書理解アプリケーションの最も一般的なアーキテクチャです。JSON 構造は OCR 信頼スコアも保存するため、データベース クエリで信頼性の低い結果を自動的に除外できます。
XML 出力は、スキャンされたドキュメントが業界標準のスキーマに準拠する必要がある場合に推奨されます。法律、医療、政府の文書処理では、多くの場合、特定の文書タイプ定義に対して検証する XML 出力が必要になります。 XML 形式は、単一のファイルで構造とメタデータの両方をサポートしており、多くのエンタープライズ コンテンツ管理システムに必要な入力形式です。 WukongPDF の OCR ツールは CSV、JSON、および XML 出力形式をサポートしているため、後処理を行わずにデータベースのインポート パイプラインに一致する形式を選択できます。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
OCR 精度を向上させるためにスキャンした PDF を前処理する
もともと色付きの紙に印刷されていた文書や経年劣化で黄変した文書の場合、OCR の前にスキャンを純粋な白黒に変換すると、認識精度が大幅に向上します。 OCR エンジンは、色付きまたはテクスチャ付きの背景からテキストを分離するのに苦労します。背景を削除しながらテキストを保持するしきい値を使用して白黒に変換すると、OCR エンジンにクリーンな入力が提供されます。ほとんどのスキャン ソフトウェアと画像エディタには、調整可能なしきい値を備えた白黒変換機能が含まれています。さまざまなしきい値で数ページをテストし、最もきれいなテキストを生成する設定を見つけます。
データベースのインポートにより OCR エラーが増幅されます。検索可能な PDF 内の文字の読み間違いは、ちょっとした不便です。データベース フィールドで同じエラーが発生すると、レコードが見つからなかったり、誤って分類されたり、間違ったエンティティに一致したりする可能性があります。 OCR の前にスキャンされたドキュメントの前処理に時間を投資すると、エラー率が大幅に減少します。最も影響力のある 3 つの前処理ステップは、たとえ数度回転したページでも傾きを補正すること、テキストが背景に対してはっきりと目立つようにコントラストを高めること、スキャン解像度が少なくとも 300 DPI であることを保証することです。
傾き補正は、わずかな角度でスキャンされたページを補正します。 2 度回転しただけでも、OCR エンジンが行の端の文字を誤って読み取る可能性があります。ほとんどの OCR ツールには自動デスキュー機能が含まれていますが、それがドキュメント上で正しく動作することを確認することは価値があります。 OCR 処理されたページをいくつか開き、認識されたテキスト ボックスが表示されているテキストと一致していることを確認します。ボックスの位置がずれている場合は、データベース内にガベージ データが生成されるデスキューの失敗を示します。コントラストの強調は、古くなった紙や黄ばんだ紙からスキャンされた文書の場合に特に重要です。 OCR の前にテキストと背景のコントラストを高めると、困難なスキャンの認識精度が 10 ~ 20% 向上します。
OCR 出力フィールドをデータベース列にマップする
フィールドの位置がページごとに大きく異なるドキュメントの場合、キーワード アンカーは固定座標よりも信頼性が高くなります。ターゲット データの位置ではなく、その前後にあるテキストに基づいて抽出ルールを定義します。 「請求書合計ラベルの後の数値を抽出する」などのルールは、そのラベルがページ上のどこに表示されるかに関係なく機能します。キーワードベースの抽出では、OCR 出力に元の空間順序で完全に認識されたテキストが含まれる必要がありますが、JSON 出力では保持されますが、CSV 出力では通常保持されません。
OCR 出力とデータベース インポートの間のギャップはフィールド マッピングです。 OCR は、ページ位置ごとに整理されたテキストを生成します。データベースはフィールド名ごとに編成されたテキストを想定しています。このギャップを埋めるには、事実上、ページ 1 の右上隅にあるテキストが請求書番号であり、それが invoice_number 列に入るというマッピングを定義する必要があります。すべてのドキュメントにわたってレイアウトが一貫している構造化フォームの場合は、位置座標またはキーワード アンカーを使用してマッピングを 1 回定義します。
レイアウトが異なる半構造化ドキュメントの場合は、位置マッピングの代わりにキーワードベースのマッピングを使用します。 「ページ上の位置に関係なく、請求書番号というテキストに続く数字が請求書番号である」などのルールを定義します。キーワードベースのマッピングはレイアウトのバリエーション全体にわたって信頼性が高くなりますが、認識されたテキストと位置メタデータを OCR 出力に含める必要があります。これは、可変レイアウト ドキュメントに対して CSV ではなく JSON または XML 出力を選択するもう 1 つの理由です。 JSON および XML の位置メタデータにより、キーワードベースのフィールド抽出が可能になります。大規模なデータベース インポート プロジェクトの場合、WukongPDF の Scanned PDF OCR パイプラインには、データベースに直接取り込む準備ができた一貫した構造の CSV または JSON ファイルを出力する構成可能なフィールド マッピングが含まれています。
データベース インポートでの OCR 信頼スコアの処理
精度が重要なデータベース アプリケーションの場合は、2 パス OCR ワークフローを実装します。最初のパスでは、すべてのドキュメントが標準設定で処理されます。信頼度スコアがしきい値を下回るドキュメントにはフラグが付けられ、高解像度、デスキュー、コントラスト調整などの拡張設定で再処理されます。 2 パスのアプローチでは、バッチ全体の速度を低下させるのではなく、追加の処理時間を必要なドキュメントに集中させます。
すべての OCR 結果には信頼度スコアが含まれます。これは通常、認識されたテキストがページ上の内容と一致するというエンジンの確実性を示す 0 ~ 100 の数値です。 OCR 結果をデータベースにインポートするときは、信頼度のしきい値を決定します。しきい値を超える結果は自動的にインポートされます。しきい値を下回る結果には、人間によるレビューのためにフラグが立てられます。しきい値は、アプリケーションのエラーのコストによって異なります。ユーザーは結果をざっと読んで不適切な一致を無視できるため、検索インデックスはしきい値を低くしても許容できます。数値が計算に直接入力される金融データベースには、高いしきい値 (通常は 95 以上) が必要です。
認識されたテキストと一緒に信頼スコアをデータベースに保存します。 invoice_total のような値が 250.00、信頼度が 98 のフィールドは信頼できます。信頼度 62 の同じ値は暫定的なものとして扱う必要があります。データベースにクエリを実行するアプリケーションは、信頼スコアを使用して信頼度の低い値を黄色のハイライトや警告アイコンなどの視覚的なインジケーターで表示し、データに依存する前にデータを確認するようユーザーに警告できます。信頼スコアにより、フラット テキスト出力では提供できないデータ品質の次元が追加されます。
よくある質問
データベースのインポートを準備するときに、スキャンしたページとネイティブのデジタル ページが混在する PDF をどのように処理すればよいですか?スキャンされたページは OCR によって処理され、デジタル ページはテキスト抽出によって個別に処理され、結果が結合されます。デジタル ページには OCR は必要ありませんが、デジタル ページで OCR を実行すると、元のデジタル テキストが完全に正確であった場合に認識エラーが発生し、実際にテキストの品質が低下する可能性があります。ほとんどのバッチ処理ツールは、スキャンされたページとデジタル ページを検出し、それらのページを適切な処理パスに自動的にルーティングできます。
データベースのインポートでは、1 回のバッチで何ページのスキャン済みページを処理できますか?
最新の OCR エンジンは、標準的なハードウェアで 1 時間あたり数千ページを処理できます。実際の制限は OCR 速度ではなく、検証時間です。完全なバッチを運用データベースにインポートする前に、出力のサンプルを確認する時間を確保します。 5% のランダムなサンプル レビューにより、バッチ全体に影響を与える系統的な OCR エラーが検出されます。
抽出したデータと一緒にスキャンした元の PDF をデータベースに保存する必要がありますか?
はい、データベースがサポートしている場合はいつでも可能です。抽出されたデータにリンクされたソース PDF を保存すると、監査証跡が提供されます。データ品質に関する疑問が生じた場合、ユーザーは元のスキャンを開いて、抽出された値をソース文書と照合して検証できます。抽出されたデータとソース文書の間のこのリンクは、多くの規制産業におけるコンプライアンスのために必要です。
OCR はデータベースインポート用の手書きテキストを処理できますか?
手書き認識は大幅に改善されましたが、印刷されたテキスト認識よりも精度が低いままです。データベースのインポートでは、フォーム上の個々のボックスに数字が書かれているなど、手書きに制約がある場合を除き、手書きフィールドは自動的にインポートされるのではなく、人間によるレビューにルーティングされる必要があります。非構造化ドキュメント上の自由形式の手書きは、ほとんどのアプリケーションで自動データベース インポートを行うには十分な信頼性がありません。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
