光学式文字認識はテキスト用に設計されています。文字の行を見つけて個々の文字に分割し、それらの形状を既知の文字パターンと照合します。手書きの図、ホワイトボードに描かれたフローチャート、ナプキンに描かれた組織図、エンジニアのノートに鉛筆で書かれた回路図には、機械が認識できるテキストはほとんど含まれていません。標準の OCR では、線や図形を文字として誤分類するため、何も生成されないか、無意味な文字がごちゃ混ぜに生成されます。
図には、テキストとは根本的に異なる認識アプローチが必要です。
OCR PDF ツールを使用して手書きの図から情報を抽出するには、特殊な図認識、手動注釈、または OCR がテキスト ラベルを処理し、画像のエクスポートによって手動または AI 支援による解釈のために図の構造が保存されるハイブリッド アプローチを使用することを意味します。 WukongPDF の Scanned PDF および OCR ツールはテキスト部分を処理し、以下のワークフローは OCR で読み取れない部分の処理をカバーします。

図やスケッチで標準 OCR が失敗する理由
OCR エンジンは、テキストの統計的パターンを検索します。つまり、単語と文字のギャップが予想される範囲内に収まり、一定の間隔で配置された、ほぼ同じ高さの文字のほぼ水平な線です。手書きの図は、これらの前提のすべてに違反します。線が水平ではありません。図形は文字ではありません。要素間のギャップはテキストの間隔とは関係がありません。エンジンはそのテキスト モデルをモデルに一致しないコンテンツに適用し、出力はノイズになります。
印刷ページ上で 98% の精度を達成する同じエンジンが、図上では 0% の意味のある出力を返す可能性があります。これは、エンジンが悪いからではなく、要求されていることを実行するよう要求されていないためです。これは、図で OCR を試行する前に理解しておくべき基本的な不一致です。問題は、どの OCR エンジンを使用するかということではありません。問題は、図からどのような情報が必要なのか、OCR でその情報を抽出できるのか、それとも別のツールが必要なのかということです。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
図を保持しながらテキストラベルを抽出する
ほとんどの手書きの図には、フローチャート ボックスのラベル、スケッチ グラフの軸タイトル、回路図のコンポーネント名、組織図ボックスの名前など、テキストが含まれています。このテキストは OCR が実際に役立つものです。スキャンしたドキュメントと同様に、図ページで OCR を実行します。エンジンはテキスト ラベルを検索し、認識された文字列として返します。図の要素から発生するノイズは無視してください。認識可能な単語やフレーズの出力をフィルターします。これが必要なテキスト ラベルになります。
図ページを OCR テキスト出力とともに高解像度画像としてエクスポートします。画像は視覚的な図の構造を保持します。 OCR テキスト出力には、各画像を開かなくても、コレクション内の特定の図を検索できる検索可能なラベルが用意されています。検索可能なラベルと視覚的なイメージの組み合わせは、どちらか一方を単独で使用するよりも、最も実用的な目的に役立ちます。 OCR エンジンが図の構造を理解していなくても、予算の承認を含むフローチャートを検索し、画像を開いて図を表示できます。
AI を活用した図認識ツールの使用
図データに基づいてトレーニングされた特殊なツールは、一般的な OCR エンジンではできない方法で手書きの図を解釈できます。これらのツールは、一般的な図の種類、フローチャート、組織図、マインド マップ、ネットワーク図を認識し、それらを Microsoft Visio、Lucidchart、Draw.io などのアプリケーションで編集可能なバージョンに変換します。認識は完全ではなく、線が誤って解釈され、形状が誤って分類される可能性がありますが、出力は手動クリーンアップの開始点であり、図を最初から再描画するよりもはるかに高速です。
図認識ツールにフィードする前に、利用可能な最高の解像度 (理想的には 600 DPI) で図をスキャンします。手描きの線は印刷された線よりも細く、一貫性がありません。また、解像度が高いため、認識アルゴリズムはより多くのデータを処理できます。テキスト OCR には適している 150 DPI スキャンでは、手描きの図に曖昧な線トレースが生成されます。この場合、認識アルゴリズムは意図的な線、汚れ、および紙のテクスチャを区別できません。
より良い認識結果を得るための図の準備
ツールの選択よりも、ソース画像の品質が認識精度を左右します。均一な拡散照明の下で図を撮影します。携帯電話やカメラによって投影される影を避けてください。平らでコントラストの高い面に紙を置きます。画像を図で埋めるようにショットをフレームに入れ、周囲の空き領域を最小限に抑えます。鉛筆スケッチの明るくて平らな高解像度の写真は、プロがインクを入れた図の照明が不十分な写真よりも優れた認識結果を生成できます。
認識ツールに送信する前に画像を強化します。コントラストを上げて線を暗くし、紙の背景を明るくします。色に意味がない場合はグレースケールに変換します。わずかにシャープ化フィルターを適用して、線のエッジを鮮明にします。これらの拡張機能は、基本的な画像エディタで利用でき、所要時間は 30 秒で、マージナル ソース画像の認識精度を 20 ~ 30 パーセント向上させることができます。認識ツールは強化された画像を認識します。原作がもっと読みにくかったとは知りません。
自動認識の代替としての手動注釈
図の数が少ない場合は、認識ツールを使用するよりも手動で注釈を付けた方が高速です。 PDF 注釈ツールで図のイメージを開きます。重要な要素を説明するテキスト コメントを追加します: プロセスはここから開始、決定点: 予算は 10,000 を超え、財務ディレクターの承認が必要です。注釈は、PDF 内の図の画像と一緒に存在する検索可能なテキストです。今後の読者は、注釈内の用語を検索して図を見つけることができます。
注釈は、図を理解することを強制します。フローチャートを言葉で説明するということは、元の作成者の意図を解釈する必要があることを意味します。この解釈ステップは、自動認識が見逃したり、黙って誤解釈したりする元の図のエラーや曖昧さを捕らえます。注釈付けに費やされる時間は理解に費やされる時間であり、その理解は認識ツールが生み出すことができる以上の価値を追加します。
| 図の内容 | OCR 結果 | 推奨されるアプローチ |
|---|---|---|
| 図上に印刷されたテキストラベル | 高精度 | 標準 OCR、認識可能な単語のフィルター出力 |
| 手書きのテキストラベル | 中程度の精度 | 手書き認識モードによる OCR、出力の検証 |
| 線、矢印、ボックス、図形 | ノイズでも何でもない | 画像としてエクスポート、手動で注釈を付ける、または図ツールを使用する |
| テキストと図要素の混合 | テキストは復元されましたが、図は失われました | ラベルのための OCR + 視覚的な構造のための画像エクスポート |
| 標準的な図の種類 (フローチャート、組織図) | 貧しい | AI 図認識ツール、その後手動クリーンアップ |
結果の保存と整理
処理後、各図は 3 つの形式で存在する必要があります。つまり、PDF 内のスキャンされた元のページ、検索可能にするために OCR で抽出したテキスト ラベル、および編集可能にするために注釈付きバージョンまたは図ツールで再構築したものです。 3 つすべてを、一貫した名前を付けてドキュメント管理システムまたはクラウド フォルダーにまとめて保存します。オリジナルは権威ある記録です。 OCR テキストにより検索が可能になります。注釈付きまたは再構築されたバージョンにより、将来の編集が可能になります。
図を含む PDF に説明的なメタデータを追加します。タイトル、作成者、日付、および [ドキュメント プロパティ] フィールドに図の内容の簡単な説明があるため、完全な OCR を使用しなくても、オペレーティング システムの検索でファイルを見つけることができます。 Q3-2025-Budget-Flowchart を読み取るメタデータを含む図は、ファイル名検索によって適切な人物にたどり着きますが、ホワイトボードの写真を無題にスキャンした場合には見つかりません。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
