印刷した文書の写真を携帯電話で撮ります。もしかしたら、それは図書館の本のページ、会議での配布資料、経費報告書に必要な領収書、または重要な情報が書かれた看板を見た可能性があります。写真は鮮明に読めますが、単なる写真です。その中の単語を検索することはできません。そこからテキストをコピーして貼り付けることはできません。編集することはできません。文章そのものではなく、文章の写真です。
光学式文字認識は、その写真を編集可能で検索可能なテキストに変換できます。そのためのツールは携帯電話とブラウザで利用できます。このプロセスでは、印刷されたページの写真を撮り、あたかも自分で入力したかのようにすべての単語を検索、選択、コピー、編集できるドキュメントを作成します。

OCR 用に可能な限り最高の写真を取得する
OCR の精度は、入力画像の品質に大きく依存します。明るく、ピントがはっきりと合った平らなページの写真は、95% ~ 99% の精度で OCR されます。照明が不十分で、ぼやけて、曲がったページの傾いた写真は、OCR の精度が 70% になる可能性があります。これは、およそ 3 ~ 4 単語に 1 単語にエラーが含まれていることを意味します。良い写真を撮るために費やした時間は、修正の手間が減り何倍にもなります。
文書を平らで明るい場所に置きます。自然光は拡散し影がないため理想的です。ページに影がかからないように位置を決めれば、オフィスの頭上の照明が機能します。携帯電話をページの真上に、斜めにではなく平行に持ちます。電話機を安定させるには、両手を使用するか、肘を床に置きます。フレームをページで埋め、端の周りに小さな余白を残します。画面をタップしてテキストに焦点を合わせます。携帯電話にドキュメント スキャン モードがある場合は、それを使用してください。 iPhone のメモ アプリには、ページの端を自動的に検出し、遠近感を修正し、コントラストを強化するドキュメントのスキャン機能が含まれています。 Android では、Google ドライブのスキャン機能でも同じことができます。
ページが製本された本のページであり、平らに置くことができない場合は、背表紙を軽く押して曲がりを減らし、ページがカメラから遠ざかる方向に曲がる溝の近くで OCR 精度が低くなるのを受け入れます。背表紙付近の重要なテキストについては、携帯電話をページに近づけて、特にその領域に焦点を当てた 2 枚目の写真を撮影して、湾曲したテキストの解像度を最大化します。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
携帯電話の内蔵ツールを使用して写真に OCR を実行する
iPhone には、カメラ アプリ、写真アプリ、Safari で直接動作する組み込み OCR 機能である Live Text が含まれています。カメラをテキストに向けると、ビューファインダーの隅に Live Text アイコンが表示されます。それをタップすると、携帯電話はテキストをリアルタイムで認識します。すぐに選択、コピー、ペーストできます。ライブラリに既にある写真の場合は、写真アプリで開き、Live Text アイコンを探します。タップすると、認識されたすべてのテキストが強調表示されます。選択した部分または全体をコピーできます。 Live Text はインターネット接続を必要とせず、デバイス上で完全に動作します。
Android スマートフォンには、Google フォトと Google アプリに Google レンズが組み込まれています。 Google フォトで写真を開き、レンズ アイコンをタップします。 Google レンズは画像内のテキストを識別し、選択、コピー、翻訳、検索できるようにします。 Apple の Live Text と同様に、Google レンズは、最近のデバイスでテキスト認識のためにオフラインで機能します。どちらのプラットフォームでも、内蔵 OCR は複数ページのドキュメントではなく、短い文章、数文、または段落用に設計されています。テキストは抽出されますが、フォーマットされたドキュメントは生成されません。
OCR PDF ツールを使用して写真を検索可能な PDF に変換する
適切なドキュメントにする必要がある写真、検索可能なテキスト レイヤーを備えた PDF の場合、ブラウザベースの OCR ツールがパイプライン全体を処理します。 WukongPDF では、JPEG、PNG、HEIC、およびその他の一般的な形式での写真のアップロードを受け入れます。写真をアップロードします。このツールはそれを処理し、テキストを認識し、元の写真を表示ページとして、認識されたテキストをその背後にある非表示の検索可能なレイヤーとして含む PDF を出力します。出力は写真とまったく同じように見えますが、単語を検索し、テキストを選択してコピーすると、ファイルは他の PDF と同じように動作します。
連続したページの写真が複数ある場合は、まとめてアップロードしてください。このツールはそれぞれを処理し、それらを単一の複数ページの検索可能な PDF に結合できます。これは、携帯電話で短いドキュメントをデジタル化するためのワークフローです。各ページの写真を撮り、バッチをアップロードし、OCR を実行して、ドキュメント全体の 1 つの検索可能な PDF をダウンロードします。このプロセスには 10 ページのドキュメントの場合に数分かかり、フラットベッド スキャナでスキャンした PDF と機能的に同等の結果が得られます。
写真からの OCR 出力のクリーンアップ
携帯電話で撮影した写真は、たとえ良い写真であっても、300 DPI でのフラットベッド スキャンよりも OCR 精度が低くなります。印刷されたページの携帯電話の写真は、通常 90% ~ 95% の精度で OCR されます。これは、およそ 20 単語に 1 単語にエラーがあることを意味します。エラーは、カメラのレンズによって歪みが生じるページの端付近、10 ポイント未満の小さなフォント、影や照明が不均一な領域など、予測可能な場所に集中しています。
写真から スキャン PDF を変換した後、PDF を開いて一般的な OCR エラーを検索します。 「cl」を検索します。これは多くの場合「d」として認識されます。 「ん」これは多くの場合「m」として認識されます。そして「1」これは多くの場合「l」として認識されます。テキストを読んで、見つけた間違いを修正してください。クリーンアップに必要な時間は、ドキュメントの長さと写真の品質によって異なります。単一ページの文書の校正には 5 ~ 10 分かかります。 20 ページの文書には 1 時間以上かかります。クリーンアップ ステップは、雑な OCR 結果と洗練されたプロフェッショナルなドキュメントを区別するものです。
写真がスキャナーを通過するとき
品質が最優先される場合、携帯電話の写真はフラットベッド スキャナーの代わりにはなりません。しかし、携帯電話の写真は、必要なときに手元にないスキャナよりもはるかに優れています。最高のカメラはあなたが持っているカメラです。図書館の本、会議の配布資料、ホワイトボードのメモ、領収書、看板、メニュー、およびデスクから離れた場所で遭遇したあらゆる印刷物からテキストをキャプチャする場合、電話で写真を撮ってから OCR を実行すると、つかの間の視覚的な出会いが永続的で検索可能で編集可能なテキストに変わります。 WukongPDF の Image to PDF パイプラインは、携帯電話の写真を 1 分以内に完成した PDF に接続し、世界中でテキストを目にすることと、それを文書として利用できるようになるまでのギャップを埋めます。
理解する価値のある制限が 1 つあります。テキスト ドキュメントの電話写真では、通常、同等のフラットベッド スキャンよりもファイル サイズが大きくなります。これは、電話のカメラが白黒ドキュメントであってもカラー情報をキャプチャするためです。 1 つのテキスト ページの携帯電話の写真は JPEG として 3 ~ 5 MB になる場合がありますが、同じページを白黒モードでフラットベッド スキャンすると 200 KB になる場合があります。携帯電話で多くのページをデジタル化する場合は、OCR を実行する前に写真をグレースケールに変換します。これにより、ファイル サイズが 60% ~ 80% 削減され、グレースケール変換により認識エンジンを混乱させる色のノイズや影が除去されるため、OCR の精度が向上することがよくあります。 iPhone と Android の両方に組み込まれている写真アプリを含むほとんどの写真編集アプリには、写真ごとに 1 回タップするだけでこれを実行できるグレースケール フィルターまたはモノラル フィルターが含まれています。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
