Tips & Tricks

手書きのメモと入力したテキストの両方を含む文書を OCR する方法

誰かが手書きで記入した紙のフォームをスキャンします。フォームに印刷された文字は鮮明です。ボックス内の手書きの回答は乱雑ではありますが、人間には判読可能です。フォームを検索可能にし、手書きの回答をテキストとして抽出できるようにするために、スキャンに対して OCR を実行します。印刷されたテキストの OCR 結果はほぼ完璧です。手書きの OCR 結果は意味不明です。印刷されたフォントで訓練された認識エンジンは、人間の手書きの変化に富んだ不規則な形状を理解することができません。

タイプされたテキストと手書きのテキストの両方を含むドキュメントは、OCR PDF エンジンにとって二重の課題となります。印刷されたテキストには標準の OCR が必要ですが、これはうまく機能します。手書きには特殊な手書き認識が必要ですが、精度が低く、別の設定が必要です。両方を 1 つのドキュメントで処理するには、各コンテンツ タイプを適切に扱う戦略が必要です。

How to OCR a Document That Contains Both Handwritten Notes and Typed Text Together

OCR エンジンにとって手書きが非常に難しい理由

印刷テキスト OCR は、文字の形状を既知のフォント パターンと照合することによって機能します。 「a」という文字は、 12 ポイントの Times New Roman は、いつ登場してもほぼ同じに見えます。 OCR エンジンは、Times New ローマ字の外観のモデルを保存し、そのモデルと照合します。手書きにはそのようなモデルはありません。すべての人は「a」です。違って見える。同じ人の「a」でも、周囲の文字、書く速度、ペンの角度、疲労によって、発生する度に変化します。照合するための固定パターンはありません。

手書き認識では、数千または数百万の手書きサンプルでトレーニングされた機械学習モデルが使用されます。これらのモデルは、手書き文字がどのように変化するかの統計的パターンを学習し、単一のテンプレートから大幅に逸脱している場合でも文字を認識できます。手書き認識の精度はディープラーニングによって劇的に向上しましたが、それでも印刷されたテキスト認識には大幅に遅れています。 PDF Association による 2025 年のベンチマークでは、クリーン スキャンでの印刷テキストの OCR 精度が 97% 以上であることがわかりました。同じベンチマークでの手書き認識精度はおよそ 80% ~ 85% でした。これは、手書き単語の約 5 ~ 6 個に 1 個にエラーが含まれていることを意味します (PDF Association、「OCR Accuracy Benchmark Report」、2025 年)。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

タイプと手書きが混在するドキュメントに対する OCR の戦略

最も効果的な戦略は、文書をタイプされた領域と手書きの領域に分離し、それぞれを適切な認識エンジンで処理することです。この分離は、ドキュメントをセクションにトリミングまたはマスクすることによって手動で行うことも、領域ごとにコンテンツ タイプを検出する認識エンジンによって自動的に行うこともできます。

WukongPDF の OCR ツールは、ページ上の各テキスト領域が印刷されたものであるか手書きであるかを検出し、適切な認識モデルを適用します。印刷されたラベルと手書きの回答が含まれるフォームでは、ラベルが印刷されたテキスト モデルで高精度に認識されます。手書きの回答は、手書きの品質が許容する精度で手書きモデルを使用して処理されます。出力は、両方の認識結果を組み合わせた単一のテキスト レイヤーです。

スキャンの向上による手書き OCR の精度の向上

スキャン品質は、印刷されたテキストの認識よりも手書きの認識に大きな影響を与えます。最低 300 DPI でスキャンします。解像度が高くなると、認識エンジンが分析する文字あたりのピクセル数が増えます。純粋な白黒ではなく、グレースケール モードまたはカラー モードを使用します。手書きストロークの微妙なグレーの変化には、純粋な白黒のしきい値処理では無視される文字の形状に関する情報が含まれています。手書きの「e」ループが部分的に塗りつぶされている箇所は、グレースケールでは認識できる場合がありますが、白と黒のしきい値処理を行うと区別できないブロブになります。

手書きの文字はできるだけ濃く、一貫性のあるものにしてください。鉛筆の手書きは、グラファイトの線がより薄く変化しやすいため、ペンよりも認識するのが困難です。白い紙に青または黒のインクを塗ると、最高のコントラストが得られます。赤インク、緑インク、または色紙を使用すると、コントラストと精度が低下します。フォーム入力プロセスを制御する場合は、最良の OCR 結果を得るためにフォームを黒インクで入力するように指定します。フォーム自体のこの小さな指示により、下流のデータ抽出精度が 10 ~ 15 パーセント ポイント向上します。

手書き OCR 出力のレビューと修正

OCR 後、Scanned PDF テキスト レイヤーでは、手書き領域に集中してエラーが発生します。印刷されたテキストはほぼ完璧になります。手書きの回答に焦点を当てて検討してください。 PDF を開いて、一般的な手書き OCR エラーを検索します。数字の 1 は、多くの場合、文字 l として認識されます。数字の 0 は、多くの場合、文字 O として認識されます。多くの場合、「+h」として認識されます。 t の横棒が h に溶け込んでいるからです。

データベースまたはスプレッドシートに抽出する必要があるフォーム データの場合、手書きフィールドを手動で確認することが不可欠です。認識エンジンは最良の推測を提供します。人間がその推測を元の筆跡と照合して検証する必要があります。この検証ステップでは、OCR による時間の節約が人間による品質管理の必要性によって部分的に相殺されます。純節約額はボリュームによって異なります。フォームが 10 個ある場合は、OCR とレビューよりも手動でデータを入力した方が速い場合があります。 500 フォームの場合、レビュー手順が OCR の信頼度が低いフィールドに限定されるため、OCR とレビューの方が大幅に高速になります。 WukongPDF の OCR 出力には、認識された各テキスト ブロックの信頼度スコアが含まれているため、信頼度によって並べ替えて、信頼度の低い結果のみを確認できます。

医療摂取フォーム、保険請求書、政府申請書など、大量に処理されるフォームの場合は、フォームの設計自体で手書き OCR の精度を向上させることができます。名前や住所を 1 つの長い行で入力するのではなく、個別の文字ボックス (1 文字につき 1 つのボックス) を使用してフォームを設計します。個々の文字ボックスにより、ライターは文字を分離する必要があり、OCR エンジンが認識を試みる前に各文字を分離できるため、認識精度が大幅に向上します。これは、世界中の納税フォームや入国管理書類で使用されているのと同じ原則です。ボックスはフォームに記入する人にとってはやや不便ですが、ボックスを使用すると大規模な自動データ抽出が可能になります。これは、大量のフォーム処理に必要なトレードオフです。

混合ドキュメントの OCR 後の実用的な品質チェックポイント: エンジンが手書きと印刷されたテキストを混同したことを示す、一般的な OCR エラー パターンの検索を実行します。 「cl」を検索します。そして、それが「d」であるはずでないことを確認します。 「0」を検索します。各インスタンスが実際に大文字の O ではなくゼロであることを確認します。「1」を検索します。これら 3 つの検索は、印刷認識と手書き認識の両方で、文字レベルの OCR エラーの大部分を検出します。見つかったエラーを修正し、ドキュメントの目的にとって重要な特定の名前、番号、または日付をもう一度検索します。印刷された指示にタイプミスがあるフォームは迷惑です。手書きの薬の投与量を間違えた帳票は危険です。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →