淡い青色の背景を持つ文書、色付きのフォーム、または色付きの紙に印刷された証明書をスキャンします。スキャンは目に問題なく見えます。文字は背景よりも明らかに暗いです。検索可能なテキストを期待して OCR を実行すると、出力は意味不明なものになります。ランダムな文字、くっついた単語、認識可能な言語を形成しない文字。目で簡単に除外される背景色は、スキャンからは明らかではない方法で OCR エンジンを混乱させます。
OCR エンジンは、前景と背景の間のコントラストを検出することによって機能します。背景に色がある場合、たとえ薄い色合いであっても、効果的なコントラストが低下し、二値化プロセスにノイズが入ります。二値化プロセスは、OCR エンジンがどのピクセルがテキストでどのピクセルが背景であるかを判断する重要な最初のステップです。ネバダ大学による 2025 年のベンチマークでは、背景が色付きの文書の OCR 精度は、白い紙の同じ文書と比較して平均 23 パーセント ポイント低下したことがわかりました (UNLV、「ISRI OCR Accuracy Metrics」、2025)。この精度の低下は、手動による修正の増加、検索語の見逃しの増加、デジタル テキストの使用可能性の低下に直接つながります。

二値化の問題: OCR が最初に間違っている箇所
OCR PDF エンジンが文字を認識できる前に、二値化と呼ばれるプロセスを通じてカラーまたはグレースケール イメージを純粋な白黒表現に変換する必要があります。スキャンされた画像内のすべてのピクセルは、前景 (テキスト、黒に設定) または背景 (白に設定) のいずれかに分類されます。次に、エンジンは黒と白のピクセルのパターンを調べて個々の文字を識別します。 2 値化ステップでミスがあった場合、その後のすべてがそのミスに基づいて構築されるため、根本的に破損した入力をいくら賢明な文字認識で回復しても回復することはできません。
文書の背景に色が付いている場合、二値化アルゴリズムはしきい値の決定が困難になります。白いページでは、テキスト ピクセルは 0 ~ 255 の暗さスケールで 0 ~ 80 の値を持ち、背景ピクセルは 200 ~ 255 になります。文字と背景の間隔が広く、信頼性の高い閾値を設定しやすい。青みがかったページでは、テキスト ピクセルが 0 ~ 100、背景ピクセルが 140 ~ 180 になることがあります。ギャップは狭くなり、アルゴリズムはより細かく区別する必要があります。ほぼすべての印刷された色付き背景と同様に、背景色がわずかに異なる領域では、しきい値を超えて背景ピクセルがテキストとして分類され始め、ファントム文字が作成され、実際の文字が結合されます。
画像全体に単一のカットオフ値を適用するグローバルしきい値処理方法は、色付きの背景に対して特に脆弱です。これらの方法は、画像の全体的な明るさのヒストグラムを分析し、テキストと背景を表す 2 つの主要なピークを分離するしきい値を選択することによって機能します。背景に色が付いていると、ヒストグラムに 3 番目のピークが生じ、アルゴリズムが混乱し、多くの場合、しきい値が強すぎてセリフやクロスバーなどの文字の薄い部分が消去されたり、保守的すぎて認識段階でテキストとして解釈しようとする背景ノイズが残ったりする結果になります。
バイナリ化が失敗すると、実際には、OCR エンジンが破損した入力を受け取ることになります。白い背景にきれいな黒い図形であるはずの文字が、壊れたり、融合したり、ノイズに囲まれたりします。認識段階は、この劣化した入力に対して最善を尽くし、部分的な形状を文字モデルと照合しますが、二値化の品質が低下するにつれてエラー率は急速に上昇します。ユーザーが意味不明な出力として認識するものは、最初の処理ステップで導入され、後続の各段階で増幅されたエラーの累積的な影響です。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
特定の背景色とそれが最も問題を引き起こす理由
すべての背景色が OCR に等しく影響するわけではありません。黄色の背景は、特に古いまたは単純な OCR エンジンで最も問題を引き起こします。その理由は、黄色は輝度が高いため、カメラやスキャナーでは明るく見えますが、グレースケール変換では予想よりも白に近くなるからです。黄色の背景上のテキストは、色が鮮明に見えますが、グレースケール変換後はほとんど見えなくなります。これは、ほとんどの OCR エンジンが最初に画像を処理する方法です。人間の視覚システムは黄色味を除去するという優れた仕事をしますが、コンピュータビジョンアルゴリズムはこの生物学的利点を共有しません。
人間の目は背景色を簡単に除去しますが、ソフトウェアはそうではありません。
青と緑の背景は、関連しているものの別個の問題を引き起こします。これらの色は、輝度においては黒のテキストとよく区別されますが、スキャナやカメラが使用する個々の赤、緑、青のセンサー チャネルにおいては区別されません。スキャナの青色のチャネルは青色の背景を強く捕捉し、そのチャネル内の黒色のテキストとのコントラストを低下させます。 OCR エンジンは、多くの場合、単一チャネルまたは特定の重み付けされたチャネルの組み合わせで動作するため、予想よりもコントラストの低い画像が得られる可能性があります。
OCR が必要なスキャン PDF ドキュメントの場合、前処理の品質が最終結果を決定します。 WukongPDF は、OCR 処理中に適応型二値化を適用します。これにより、単一のグローバルしきい値を使用するのではなく、ページの各小さな領域の特性に基づいてしきい値がローカルに調整されます。このアプローチは、従来の固定しきい値方法よりも確実に色付きの背景を処理します。
赤とピンクの背景では、さらに別の課題が生じます。赤は黄色よりも輝度が低いため、グレースケールでは暗い灰色に変換されます。その結果、背景が赤いと、グレースケール画像内のテキストと背景の分離が少なくなります。赤形式の文書を処理する OCR エンジンは、暗い領域で背景を前景として扱い、バイナリ化された出力に暗い斑点を作成し、テキスト認識ステージが歪んだ文字として解釈しようとする可能性があります。政府の書類、医療摂取書類、教育証明書では色紙や色付きの背景が頻繁に使用されており、これは医療、教育、行政全体にわたる現実的な懸念事項となっています。
グラデーションの背景と模様のある紙
ページ全体で色の濃さが変化するグラデーション背景は、単色の背景よりもさらに困難です。上部の暗い色から下部の明るい色へと薄くなる領収書、内側に向かって徐々に薄くなる飾り枠のある証明書、または白に移行する色付きのヘッダーを持つフォームはすべて、最適な 2 値化しきい値が異なる領域を作成します。単一のグローバルしきい値を使用する OCR エンジンは、ページの一部を正しく 2 値化しますが、別の部分では失敗し、同じページ上でクリーン テキストと意味不明なテキストが交互に表示される出力を生成します。
小切手のセキュリティ パターン、透かし入りの紙のテクスチャ、一部の政府書類のドット マトリクス パターンなどの模様のある背景は、OCR にとって最悪のシナリオを示します。このパターンは、OCR エンジンがテキスト要素と誤認する可能性がある規則的な繰り返しテクスチャを作成します。エンジンは、パターンのドットをピリオドとして、またはパターンの線を文字として認識しようとする場合があります。出力では実際のテキストとパターンアーティファクトが混合され、実際の単語にランダムな句読点や単語であるかのように見える短い文字列が散在するような出力が生成されます。
背景パターンは、特定のドキュメントでテストしないと予測するのが難しい、潜伏的な方法でテキストと相互作用します。テキストの背後にある斜線パターンが 2 値化イメージ内の隣接する文字を接続し、OCR エンジンが 2 つまたは 3 つの文字を 1 つのグリフとして認識する可能性があります。ドット パターンにより、o、e、a などの文字のカウンターが埋められ、固体の塊と区別できなくなる場合があります。これらの相互作用は、パターンの頻度、テキスト サイズ、フォント デザインの特定の組み合わせに依存します。そのため、見た目が似ている背景を持つ 2 つのドキュメントが、劇的に異なる OCR 結果を生成する可能性があります。
色付き背景 OCR を修正する前処理テクニック
いくつかの前処理ステップにより、色付きの背景での OCR のPDF 品質 を大幅に向上させることができます。最も効果的なのは適応型しきい値処理です。これは、ページ全体に 1 つのしきい値を適用するのではなく、ピクセルの小さな近傍ごとに異なる 2 値化しきい値を計算します。適応型手法により、暗い背景領域のテキストのコントラストを維持しながら、明るい領域の背景をすべて同じ画像内で正しく除去できます。
カラー チャネルの選択も強力なテクニックです。スキャンされた画像を赤、緑、青の各チャネルで検査すると、多くの場合、テキストと背景の間のコントラストがフルカラー画像またはグレースケール変換よりも大幅に高いチャネルを 1 つ見つけることができます。青色の背景の場合、赤色のチャネルでは青色の背景が暗く表示され、黒色のテキストからの分離が高まるため、通常、赤色のチャネルが最高のコントラストを示します。この手法を試すのに費用はかからず、劇的な改善が得られます。
3 番目の技術である背景減算では、テキストがなければ背景がどのように見えるかを推定し、それを画像から差し引いて、均一な白い背景にテキストだけを残します。この方法は、背景が均一な色で徐々にしか変化しないドキュメント (色付きの紙や薄い色のフォームなど) に適しています。背景が複雑または急速に変化するドキュメントの場合、背景の減算は効果が低く、独自のアーティファクトが発生する可能性があります。
最新の AI ベースの前処理は、OCR 品質向上の最前線を表します。数百万の文書画像でトレーニングされたニューラル ネットワークは、アルゴリズムによるアプローチでは一致できない方法で、複雑な背景からテキストを分離する方法を学習できます。これらの AI プリプロセッサは、あらゆる背景色、パターン、グラデーションを処理でき、従来の方法では不可能なドキュメントからでもきれいな 2 値化出力を生成します。 2025 年の時点で、AI 前処理はいくつかの商用 OCR プラットフォームで利用可能であり、プレミアム アドオンではなく標準機能になりつつあります。
OCR を諦めて別のアプローチを使用する場合
背景に色が付いている一部の文書は、どれだけ前処理を適用しても OCR がうまくいきません。濃い色の紙に薄い文字が印刷された文書、金属インクや反射インクを使用した文書、テキスト自体に黒ではなく色の付いたインクが使用されている文書は、自動テキスト認識に対して特に耐性があります。このような場合、OCR パイプラインの最適化を続けるよりも、手動転写またはハイブリッド アプローチ (できる限り OCR して残りを入力する) の方が時間効率が良いことがよくあります。
正確にデジタル化する必要がある重要な文書の場合は、元のデジタル ソース ファイルがどこかに存在するかどうかを検討してください。 Word 文書から作成された PDF は、視覚的なレンダリングに色付きの背景がある場合でも、元のテキスト データを保持します。印刷版のスキャンではなくソース ファイルを入手できれば、OCR の問題は完全に回避できます。これは、特に従来のドキュメントの場合には常に可能であるとは限りませんが、OCR の最適化に時間を費やす前に調査する価値があります。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
