ノートに手書きし、携帯電話で写真を撮り、スキャンした PDF として保存した会議メモのページには、検索、コピー アンド ペースト、スクリーン リーダーではまったくアクセスできない貴重な情報が含まれています。言葉は人間の目には見えますが、コンピュータにとっては単なるイメージ上の形状にすぎません。これらの手書きメモを編集可能な入力テキストに変換すると、検索、コピーが可能になり、あらゆるドキュメントやアプリケーションで使用できるようになります。
手書きの認識は、人それぞれに個性があるため、印刷されたテキストの認識よりも困難です。文字の形状は印刷された書体よりも個人間ではるかに異なるため、認識エンジンはこの変動に対応する必要があります。
スキャンした OCR PDF ドキュメント内の手書きメモを編集可能なタイプ付きテキストに変換するには、筆記体と印刷された手書きを認識できる手書き対応 OCR エンジンと、印刷されたテキスト OCR と比較して高い手書き認識のエラー率を処理するワークフローが必要です。 WukongPDF の スキャン PDF および OCR ツールはテキスト認識をサポートしており、以下のガイダンスでは手書き認識の精度を最大限に高めることがカバーされています。

なぜ手書き認識は印刷されたテキスト OCR よりもはるかに難しいのか
印刷テキスト OCR は、文字の形状を既知の書体パターンと照合することによって機能します。 Times New Roman の文字 A は、私が入力しても、あなたが入力しても、機械が印刷しても、同じように見えます。認識エンジンには、一般的なフォントのすべての文字に対して明確で一貫したテンプレートがあります。 A という文字は人によって見た目が異なるため、手書き認識にはそのようなテンプレートがありません。エンジンは、形状、サイズ、傾き、文字間の接続などの膨大なバリエーションにわたる手書き文字の統計的パターンを認識する必要があります。
単語内の文字がつながっている筆記体手書きは、さらに複雑さを加えます。認識エンジンは、各文字を認識する前に、接続された文字を個々の文字に分割する必要があります。文字 m を r と n に分割したり、2 つの文字を 1 つに結合したりする不適切な分割は、手書き認識エラーの主な原因です。各文字が個別に書かれた印刷手書きは、認識エンジンによる処理が大幅に容易になり、より正確な結果が得られます。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
手書き認識のためのスキャン画像の準備
ソース画像の品質は手書き認識の精度における最大の要素であり、認識エンジンの選択よりも重要です。手書きのページを最低 300 DPI でスキャンまたは写真撮影します。小さい手書きや密集した手書きの場合は 600 DPI を推奨します。ページ全体に影のない均一な照明を確保します。遠近法の歪みを最小限に抑えるために、カメラまたは携帯電話をページと平行に持ちます。ソース画像が優れているほど、認識の精度が高くなります。
認識を実行する前に、スキャンした画像を強化します。コントラストを上げるとインクが暗くなり、用紙の背景が明るくなります。シャープ化フィルターを適用して、手書きストロークのエッジを鮮明にします。グローバルしきい値よりも不均一な照明を適切に処理する適応しきい値処理を使用して、画像をグレースケールまたは純粋な白黒に変換します。強化された画像により、認識エンジンに対して、より鮮明で明確な文字の形状が表示されます。
手書き対応 OCR エンジンの使用
Tesseract のような汎用 OCR エンジンには、構成設定を通じて有効にできる手書き認識モードが含まれています。 Tesseract では、手書きサポートを含む言語モデルを指定し、画像を単一のテキスト ブロックとして扱うようにページ セグメンテーション モードを設定します。 Google Cloud Vision API と Microsoft Azure Computer Vision には、クラウドベースの OCR サービスに手書き認識機能が含まれています。
Nebo、GoodNotes、Microsoft OneNote のインクからテキストへの機能などの専用の手書き認識アプリケーションは、手書き専用に最適化されており、多くの場合、手書きサービスに組み込まれた一般的な OCR エンジンよりも優れた結果が得られます。認識されたテキストを手書きアプリからエクスポートし、必要に応じて元のスキャンされた PDF と再統合します。
| 係数 | 精度への影響 | 推奨事項 |
|---|---|---|
| スキャン解像度 | 解像度が高くなると、文字ごとの詳細がより詳しく表示されます | 最小 300 DPI、小さな手書きの場合は 600 DPI |
| 点灯 | 影と不均一な照明によりキャラクターのエッジが見えにくくなる | 拡散した均一な照明。カメラのフラッシュを避ける |
| 手書きスタイル | 印刷された手書きの方が筆記体よりも簡単です | ソースを管理している場合は、より良い結果を得るために活字で書いてください |
| 画像補正 | よりクリーンな入力により、よりクリーンな認識が生成されます | コントラストを高め、鮮明にし、適応型しきい値処理を適用する |
認識されたテキストの確認と修正
手書き認識では常にエラーが発生します。通常、文字エラー率は手書きの品質と画像の状態に応じて 5 ~ 20% です。認識されたテキストを元の手書きページと照らし合わせて確認し、誤認識された単語を修正します。修正ステップには時間がかかりますが、出力を検索、コピー&ペースト、またはさらなる編集に使用できるようにするためには不可欠です。
法的記録や医療記録など、完全な正確性が要求される文書の場合は、認識されたテキストを元の手書きの置き換えではなく、検索インデックスとして扱います。スキャンした元の画像を信頼できる記録として保存します。認識されたテキストを使用して、元のスキャンで関連するページを見つけるキーワード検索を有効にします。検索可能な認識されたテキストと元の画像の組み合わせにより、テキストによる検索のしやすさと画像の忠実性の両方の長所が得られます。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
