スキャンした文書に対して OCR PDF を実行すると、認識されたテキストが生成されますが、ほとんどの OCR ツールはそのテキストをフラット テキスト ファイルとして出力するか、PDF に埋め込みます。 OCR 結果を JSON に直接エクスポートすると、構造化された機械可読データが得られ、データベース、検索インデックス、コンテンツ管理システム、自動ワークフローに入力できます。 AIIM International による 2025 年の調査では、組織の 43% が、最新のクラウド アプリケーションや AI パイプラインとより簡単に統合できるため、ドキュメント派生テキストに JSON などの構造化データ形式を好んでいることがわかりました (AIIM、「State of Intelligent Information Management」、2025 年)。
重要なポイント
OCR 結果を JSON にエクスポートすると、プレーン テキストにエクスポートすると失われる、ページ番号、単語座標、信頼スコアなどの認識されたテキストの構造が保持されます。最新の OCR エンジンのほとんどは JSON 出力をネイティブにサポートしていますが、この機能を設定で有効にするか、エクスポート形式メニューから選択する必要がある場合があります。結果の JSON ファイルは、全文検索、データ抽出パイプライン、ドキュメント コンテンツの機械学習モデルのトレーニングに使用できます。
OCR JSON をアプリケーションに統合する開発者にとって、ほとんどの JSON 出力形式には、スキーマのバージョンを識別するバージョン フィールドが含まれています。 OCR エンジンが出力形式を更新するときに破壊的な変更を避けるために、解析する前に必ずこのフィールドを確認してください。解析コードの先頭にある単純なバージョン ガードにより、エンジンのバージョン間で JSON 構造が変化するときの不可解なエラーを防ぎます。

OCR 結果としてプレーン テキストよりも JSON 出力が優れている理由
OCR からのプレーン テキスト出力では、文字自体を除くすべてが破棄されます。単語は得られますが、各単語が出現したページ番号、テキストがページ上のどこにあるかを示す境界ボックスの座標、OCR エンジンが各文字についてどの程度確実であるかを示す信頼スコア、段落区切りや段組みレイアウトなどの構造情報は失われます。 JSON はこれらすべてを保存します。 JSON Scanned PDF OCR 出力ファイルには通常、ページ オブジェクトの配列が含まれており、各ページ オブジェクトにはテキスト ブロック オブジェクトの配列が含まれており、各オブジェクトには認識されたテキストとその位置、サイズ、信頼性メタデータが含まれています。
この構造により、プレーンテキストでは不可能な下流の自動化が可能になります。スクリプトは JSON ファイルを読み取り、ヘッダー領域やサイドバー列など、各ページの特定の領域からテキストのみを抽出できます。信頼性の低い OCR 結果を除外して、文字化けしたテキストによる検索インデックスの汚染を回避できます。テキスト ブロックを Y 座標と X 座標で並べ替えることにより、複数列レイアウトの読み取り順序を再構築できます。これらの操作はいずれも、OCR のフラット テキスト ファイルでは実行できません。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
ステップバイステップ: OCR 結果を JSON にエクスポート
OCR を実行する前に、スキャンした PDF の画像解像度を確認してください。ほとんどの OCR エンジンは、入力ページ画像が 300 DPI の場合に最高のパフォーマンスを発揮します。 200 DPI を下回ると、認識精度が著しく低下します。 400 DPI を超えると、精度が大幅に向上することなく処理時間が増加します。スキャンした PDF に低解像度のページ画像が含まれている場合は、JSON 出力で OCR を実行する前に、ページ画像を 300 DPI にアップスケールすることを検討してください。追加の前処理ステップにより、JSON データの品質が大幅に向上します。
構造化出力をサポートする OCR ツールでスキャンした PDF を開きます。最も広く使用されているオープンソース OCR エンジンである Tesseract は、コマンドライン インターフェイスおよびそれをバンドルするほとんどのアプリケーションを通じて JSON 出力をサポートします。 Tesseract では、出力形式フラグを追加すると、認識されたテキストとともに JSON ファイルが生成されます。 Google Cloud Vision、Amazon Textract、Microsoft Azure Form Recognizer の商用 OCR API はすべて、デフォルトで、ページ、ブロック、段落、行、単語ごとに整理された認識されたテキストを含む JSON を返します。
JSON 出力を有効にして OCR を実行した後、結果のファイルをテキスト エディターで開き、その構造を理解します。 JSON にはページ オブジェクトの配列が含まれます。各ページ オブジェクトには、ページの次元とブロック オブジェクトの配列が含まれます。各ブロックには、認識されたテキスト、通常 0 ~ 100 の間の信頼スコア、およびページ上のブロックの位置を表す境界ボックスの座標が含まれます。この構造に慣れると、必要なデータを正確に抽出するための簡単なスクリプトを作成できるようになります。 WukongPDF の OCR ツールには、認識されたテキストをページ番号、信頼スコア、および位置データで整理する JSON エクスポート オプションが含まれているため、構造化された出力を取得するために別の OCR エンジンを構成する必要はありません。
OCR 出力の一般的な JSON 構造
ほとんどの JSON Scanned PDF OCR 出力には、ファイルの先頭に、OCR エンジン名、バージョン、処理日、ドキュメント内で検出された言語を記録するグローバル メタデータ セクションも含まれています。このメタデータは、監査証跡や OCR の品質問題のデバッグに役立ちます。複数のソースからのドキュメントを処理している場合、メタデータにより、各結果を生成したエンジンと、バッチ間でエンジンのバージョンが変更されたかどうかがわかり、認識品質の違いを説明できます。
| フィールド | 説明 | 値の例 |
|---|---|---|
| ページ | 元の文書のページ番号 | 3 |
| 文章 | 認識されたテキストコンテンツ | 「請求書 #4521」 |
| 自信 | OCR 信頼度 0 ~ 100 | 94.7 |
| ボックス | 境界ボックス [x、y、幅、高さ] (ピクセル単位) | [120、340、400、28] |
| ブロックタイプ | コンテンツブロックの種類 | 「段落」または「テーブル」または「ライン」 |
| 言語 | 検出されたテキストの言語 | 「エン」 |
自動化されたワークフローでの OCR JSON データの使用
エラー処理については、事前に計画する価値があります。画質が非常に悪いページで OCR を実行すると、ほとんどの認識された単語の信頼スコアが 50% 未満になる可能性があります。ワークフローでは、信頼度の最小しきい値を定義する必要があります。このしきい値を下回ると、結果はデータベースや検索インデックスに自動的に取り込まれるのではなく、人間によるレビューのためにフラグが立てられます。信頼性の低いスキャンされた PDF OCR 出力を実稼働システムに直接送信すると、データがエラーで汚染され、抽出時にレビュー用のフラグを立てるよりも、後でクリーンアップする方がはるかにコストがかかります。
OCR 結果が JSON に変換されると、自動化の可能性が大幅に広がります。一般的なパターンは、フォルダーで新しいスキャンされた PDF を監視し、JSON 出力で OCR を実行し、JSON を解析してページ上の既知の位置から請求書番号や日付などの特定のフィールドを抽出し、それらの値をデータベースまたはスプレッドシートに挿入するスクリプトを作成することです。 JSON には位置座標が含まれるため、抽出スクリプトはドキュメント全体のコンテンツに関係なく、ページの特定の領域のテキストをターゲットにすることができます。
検索アプリケーションの場合、JSON 出力を Elasticsearch や Algolia などの検索インデックスにフィードできます。各ページは、ページ番号をメタデータ フィールドとして持つ検索可能なドキュメントになります。信頼スコアを使用すると、信頼性の高い OCR テキストに高い重みを与えることで、検索の関連性を調整できます。用語を検索するユーザーには、その用語が実際にページに表示されるという OCR エンジンの確実性によってランク付けされた結果が表示され、誤認識された文字による誤一致が減少します。
AI および機械学習パイプラインの場合、JSON での構造化 スキャン PDF OCR 出力が標準の入力形式です。大規模な言語モデルと文書理解システムは、次の JSON 表現を消費します。
よくある質問
長期間アクセスできるように、OCR JSON ファイルを元の PDF と一緒に保存するにはどうすればよいですか? JSON ファイルは、一致するファイル名で PDF と同じフォルダーに保存します。たとえば、report-2025.pdf と report-2025.ocr.json です。この命名規則により、スクリプトは特定の PDF の Scanned PDF OCR 出力を見つけることが簡単になります。大規模なアーカイブの場合は、フラット ファイルとしてではなく、全文検索をサポートするドキュメント データベースに JSON を保存することを検討してください。
OCR からの JSON 出力はプレーン テキストと比較してファイル サイズを増加させますか?
はい、通常は 3 ~ 5 倍です。 15 KB のプレーン テキストを生成する 10 ページのスキャン文書は、50 ~ 75 KB の JSON ファイルを生成する可能性があります。追加のサイズは、ページ番号、境界ボックス、認識されたすべての単語の信頼スコアなどの構造メタデータから得られます。ほとんどのアプリケーションでは、このサイズの増加は無視できます。数百万ページなど、非常に大規模な場合にのみ、計画する価値のあるストレージの考慮事項になります。
既存のプレーンテキストスキャンされた PDF OCR 出力を JSON に変換できますか?
意味のあることではありません。 OCR 結果がプレーン テキストに平坦化されると、位置データと信頼スコアは失われ、テキストだけから再構築することはできません。以前に処理したドキュメントの構造化 OCR データが必要な場合、最も信頼性の高い方法は、JSON 出力を有効にして、スキャンされた元の PDF で OCR を再実行することです。
どの OCR エンジンが最も有用な JSON 出力を生成しますか?
Google、Amazon、Microsoft のクラウドベースの OCR サービスは通常、単語レベルの境界ボックスと信頼スコアを備えた最も詳細な JSON 出力を生成します。 Tesseract は行レベルと単語レベルで固体の JSON を生成します。最適な選択は、量、予算、およびプライバシー要件によりドキュメントをクラウド サービスに送信できるかどうかによって異なります。
OCR JSON 出力を検索可能な PDF に変換して戻すことはできますか?はい。ただし、このプロセスには、テキスト オブジェクトを特定の座標に配置できる PDF 生成ライブラリが必要です。 JSON 出力の境界ボックス データは、各単語がページ上のどこに属しているかを正確に示します。これは抽出プロセスの逆であり、JSON データの認識エラーを修正した後、修正された OCR テキストから検索可能な PDF を作成する必要がある場合に便利です。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
