Others

パターン、テクスチャ、または透かしのある紙の背景の上にテキストが印刷されている PDF を OCR できますか?

光学式文字認識は、明るい背景上の暗い形状を検出し、それらの形状を既知の文字パターンと照合することによって機能します。背景が均一な明るい色ではなく、パターン、テクスチャ、または透かしが含まれている場合、認識エンジンは根本的に難しい問題に直面します。ページ上のすべてのパターン要素は潜在的な誤検知であり、OCR は実際のテキストと区別する必要があります。透かし入りの紙、テクスチャーのあるひな形、市松模様のセキュリティ プリント、装飾的な境界線はすべて視覚的なノイズを追加し、OCR の精度を低下させます。問題は、OCR がこれらの背景をまったく処理できるかどうかではなく、どのような条件下で OCR が成功するのか、また精度が有用な点を下回るのはいつかということです。

Can You OCR a PDF Where the Text Is Printed Over a Patterned, Textured, or Watermarked Paper Background

背景パターンが文字認識にどのように干渉するか

OCR エンジンは、最初にしきい値処理と呼ばれるプロセスを通じてページをバイナリの白黒画像に変換することでページを処理します。カットオフ値より暗いピクセルはすべて黒になります。すべてのピクセルが明るくなり、白になります。きれいな白いページに濃い色のテキストがある場合、しきい値処理により、各文字がはっきりと目立つ鮮明な画像が生成されます。パターンのある背景では、しきい値より暗いパターン要素がテキストに混ざった黒いピクセルになります。 OCR エンジンは、これらのパターンの断片を文字の一部として解釈しようとします。透かし線が「e」の中央を通過すると、エンジンには浮遊マークのある「c」が表示される可能性があります。小さなドットのあるテクスチャ背景により、エンジンは存在しない期間を認識する可能性があります。

背景パターンの特定のタイプによって、OCR エラーの性質が決まります。セキュリティ用紙やビンテージのタイプライター用紙などの細かいドット パターンはスペックル ノイズを生成し、OCR エンジンが文字の句読点やアクセントとして解釈する可能性があります。罫線付きノート用紙や方眼紙などの線パターンは、文字ストロークと結合する連続的な干渉を作成し、線がアセンダと一致すると「l」が「b」に変わります。大きなテキストやロゴを含む透かしは背景の暗さが変化する領域を作成し、しきい値処理によって暗い透かし領域のテキストが失われるか、透かしの断片が明るい領域のテキストとして導入されます。

テキストの密度に対するパターンの密度は非常に重要です。プロの透かしのほとんどがそう設計されているように、テキストよりも大幅に明るい透かしは、目に見えるアーティファクトを残さずにしきい値処理を通過する可能性があります。 OCR エンジンのデフォルトのしきい値は、通常、黒いテキストと白い紙を区別するように設定されており、10 ~ 15 パーセントのグレーのみを記録する透かしは、そのしきい値を完全に下回る可能性があります。この問題は、テキストの暗さの 40 ~ 60% に近いパターンで最も深刻になります。パターンの強度範囲が重なるため、しきい値処理でパターンとテキストをきれいに分離できません。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

パターン化された背景での OCR 精度を向上させる前処理テクニック

いくつかの画像前処理技術を使用すると、OCR エンジンがページを処理する前に背景パターンを削減または除去できます。最も広く効果的な手法は適応型しきい値処理です。これは、単一のグローバル カットオフを使用するのではなく、ページの領域ごとに異なる輝度カットオフを計算します。背景がパターン化されている領域では、パターンの平均輝度を背景レベルとして扱うように適応しきい値が調整され、パターンを抑制しながらテキストを保持します。最新の OCR ソフトウェアには適応型しきい値処理オプションが含まれていますが、デフォルトでは有効になっていない場合があります。

2 番目の手法は、フーリエ変換または同様の数学ツールを使用した周波数フィルタリングです。背景パターンは規則的かつ周期的になる傾向があり、画像内の特定の周波数を占有することを意味します。対照的に、テキストは不規則であり、広範囲の周波数を占めます。周波数領域フィルターは、テキストの広帯域信号を維持しながら、背景パターンに関連する狭い周波数帯域を識別して抑制できます。この技術は強力ですが、特殊な画像処理ソフトウェアが必要であり、通常は個別のドキュメントではなく大規模なデジタル化プロジェクトに使用されます。

WukongPDF の OCR PDF ツールには、一般的な背景の変化を処理する画像前処理が含まれています。軽度から中程度の背景パターンを持つ文書の場合、追加の手動手順を行わなくても、組み込みの前処理で十分に使用可能なテキスト認識を生成できる場合があります。重要なのは、文書全体の処理を開始する前に、代表的なページで認識をテストすることです。テスト ページで許容可能な精度が得られた場合は、バッチを続行します。テスト ページに重大なエラーが表示された場合、OCR の前に画像の外部前処理が必要になる場合があります。

パターンの多い文書では手動転写が OCR よりも優れている場合

品質のしきい値があり、このしきい値を下回ると OCR 出力に大量の手動修正が必要になり、最初からテキストを入力した方が速くなります。濃い背景パターン、濃い透かし、またはページ全体を覆うセキュリティ プリントのあるドキュメントの場合、OCR によって文字の 20% 以上が間違っているテキストが生成される場合があります。複数ページの文書で 5 文字中 1 文字を修正するのは、コンテンツを新たに入力するよりも時間がかかります。特に、背景のドットの読み違いにピリオドが挿入されるなど、明らかではないエラーの場合は、校正中に簡単に発見できずに文の意味が変わってしまいます。

経済的な決定は、文書の長さと必要な精度によって決まります。透かし入り便箋に印刷された 1 ページの手紙を手動で数分で転写できます。ざらつきのある紙に印刷された 200 ページの本は、数週間にわたる手作業に相当します。テキストの 85% を正確にキャプチャする不完全な OCR であっても、かなり有利なスタートを切ることができます。大規模なプロジェクトの場合、最適なワークフローは多くの場合、積極的な前処理を伴う OCR であり、その後、人間が出力をレビューし、レビュー ステップでパターンに起因するエラーを特定して修正することを受け入れます。 スキャン PDF から検索可能なテキストへのパイプラインは、ソース素材の難易度に応じて精度の期待が調整されている場合に最も効果的に機能します。

背景干渉を最小限に抑えるための適切なスキャン設定の選択

スキャン プロセスを制御する場合、いくつかの設定により、画像が OCR エンジンに到達する前に背景パターンの可視性が低下する可能性があります。カラーではなくグレースケールでスキャンすると、コントラストの変化を引き起こす、色付きの透かしや色付きのセキュリティ スレッドなどの色ベースのパターンが排除されます。スキャナーの明るさを通常よりわずかに高く設定すると、暗いテキストを維持しながら、明るい背景パターンが検出しきい値を下回ります。多くの場合、テキストの可読性に影響を与えることなく透かしを除去するには、明るさを 10 ~ 15 パーセント増加させるだけで十分です。

一部のスキャナには、色付きまたは模様のある紙のドキュメント用に特別に設計された背景除去または背景平滑化機能が含まれています。この機能はページを分析し、主要な背景の色またはパターンを特定し、前景のコンテンツを維持しながら背景を白に正規化します。利用可能な場合は、OCR を実行するすべてのドキュメントに対してこの設定を有効にする必要があります。クリーンなソース画像からの認識精度の向上は、スキャン後の画像処理によって達成できるものをはるかに超えています。

パターン化されたドキュメントの OCR 精度の評価: 何を受け入れ、何を再入力するか

許容可能な OCR 精度の実際のしきい値は、抽出されたテキストがどのように使用されるかによって異なります。文書アーカイブ全体にわたる全文検索の場合、80% の精度で十分な場合があります。特定の名前または口座番号を検索すると、周囲のテキストの 20% にエラーが含まれている場合でも文書が見つかります。再公開、引用、またはさらなる分析に使用されるテキストを抽出する場合、95% の精度がより適切な最小値です。このレベルを下回ると、OCR エラーの修正にかかる時間は、文書を手動で転記するのにかかる時間に近づきます。 OCR 出力を受け入れるか最初から再入力するかの決定は、数ページをざっと見ただけで形成される印象ではなく、測定された精度評価に基づいて行う必要があります。

OCR の精度を測定するには、認識されたテキストのサンプルを元の文書と比較する必要があります。代表的なページを 3 ~ 5 枚選択し、オリジナルの総文字数を数え、OCR 出力で置換、挿入、削除を含む文字エラーの数を数え、エラー率を計算します。この測定には 10 ~ 15 分かかり、自動修正、手動レビュー、または完全な再入力のいずれを続行するかを決定するための客観的な根拠が得られます。この測定により、最も一般的なエラーの種類も特定され、修正戦略の選択の指針となります。エラーが特定のパターン タイプに集中している場合は、対象を絞った前処理で対処できる可能性があります。エラーがランダムに分布している場合、OCR の精度は、特定の修正可能な問題ではなく、ソース画像の基本的な品質によって制限されます。

紙上の背景パターンは、OCR を念頭に置いてデザインされたものではありません。これらは、ブランドのアイデンティティから偽造に対するセキュリティ、単純な装飾的な魅力まで、さまざまな目的に役立ちます。これらの文書からキャプチャされたPDF 画像 は、パターンをデジタル領域に運び、テキスト抽出の障害となります。どのパターンが前処理によって軽減でき、どのパターンに手動作業が必要かを理解すると、すべてのスキャンに同じ OCR ワークフローを適用して最善の結果を期待するのではなく、各ドキュメントについて情報に基づいた意思決定を行うことができます。文書特有の背景上の課題を理解するために費やした時間は、精度の向上、手動修正の削減、元のコンテンツを忠実に表現したデジタル テキスト出力として報われます。

模様のある背景に対する OCR は、スキャン テクノロジー、画像処理、ドキュメント ワークフロー設計の交差点に位置します。パターン背景のすべての課題を単一の手法で解決できるわけではありませんが、適切なスキャン設定、適応型前処理、および現実的な精度の期待を組み合わせることで、大部分のドキュメントに対して使用可能な結果が得られます。ツールは存在し、テクニックは十分に確立されています。これらを体系的に適用すると、イライラする OCR の失敗が管理可能な品質管理プロセスに変わります。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →