Tips & Tricks

新聞紙や裏写りのある低品質の紙からスキャンした PDF を OCR する方法

新聞紙、薄い辞書用紙、または低品質のオフィス用紙をスキャンすると、実際に読みたいテキストの後ろに、ページの裏側のテキストがかすかなゴースト画像として透けて見えてしまうという、とんでもない問題を抱えた PDF が生成されます。裏写りまたは裏抜けと呼ばれるこの現象は、前景のテキストと背景のノイズを区別できないため、OCR エンジンを混乱させます。 OCR 出力には、意図したテキストとページの反対側から反転されたテキストの断片が混在し、出力が文字化けして使用不能になります。

裏写りは、暗い背景や不均一な背景とは根本的に異なります。これは、単純なしきい値調整で除去できる均一なノイズではありません。それは構造化されたテキストであり、逆向きに印刷され、薄暗くなりますが、それでも構造化されています。標準的な OCR エンジンは、ページ上のあらゆる暗いマークを潜在的なテキストとして扱い、裏面からのゴースト文字は誤った文字認識を引き起こすのに十分なコントラストを持っています。これを解決するには、OCR エンジンが認識する前に、スキャンされた画像を前処理して裏写りを抑制する必要があります。新聞用紙の前処理ステップはオプションではありません。検索可能なドキュメントとデジタル ファイルの違いは、生の写真よりもわずかに役立つだけです。

Digital Preservation Coalition による 2025 年の調査では、前処理なしの新聞紙スキャンの OCR 精度は平均 67 パーセントであったのに対し、きれいなレーザー印刷されたページでは 98 パーセントであったことがわかりました。最適化された前処理により、同じ新聞紙スキャンで 94% の精度が達成されました (Digital Preservation Coalition、「劣化した紙媒体の OCR パフォーマンス」、2025 年)。未処理の新聞用紙 OCR と前処理された新聞用紙 OCR との 27 パーセント ポイントの差は、検索可能な文書と事実上テキスト クエリに使用できない文書との差を表しています。

How to OCR a PDF Scanned From Newsprint or Low-Quality Paper With Show-Through From the Reverse Side

なぜ標準 OCR が新聞紙や薄い紙では失敗するのか

OCR PDF プロセスは、ピクセル値が背景としきい値を超えて異なる画像の領域を検出することによって機能します。きれいな白い紙に濃い色のテキストがある場合、しきい値は簡単に設定できます。50 パーセントのグレーより濃い部分がテキスト、明るい部分が背景です。新聞用紙では、紙自体は灰色で、裏側からの裏写りも灰色で、多くの場合、表面の前景の文字よりわずかに明るいだけです。単一のグローバルしきい値では 2 つを分離できません。裏写りを排除するためにしきい値を十分に高く設定すると、前景テキストの細いストロークやセリフも失われます。すべての前景テキストをキャプチャできるほど低く設定すると、裏写りもキャプチャされます。

新聞では、裏写り以外にもさらなる課題が紹介されています。紙は経年とともに黄ばむことが多く、単一ページ全体でベージュから茶色に変化する不均一な背景が生じます。テキストは、小さなフォント サイズ (通常は 6 ~ 8 ポイント) で狭い列に印刷されます。数十年にわたってインクが広がると、文字同士がぼやけて「e」などの文字の隙間が埋まってしまうことがあります。そして「a」。また、紙の表面自体にも製造プロセスによるテクスチャーがあり、高解像度のスキャンでは細かい粒子として表示され、OCR エンジンが句読点として誤って読み取ることがあります。これらの問題はそれぞれ他の問題を複雑にし、そのうちの 1 つだけを処理する前処理パイプラインでは残りが残り、OCR の精度が低下します。

WukongPDF は、OCR を実行する前に裏写りを自動的に検出し、適切な背景抑制を適用する適応型前処理を使用して、スキャンされた PDF の処理を処理します。このアプローチは、標準の OCR エンジンを混乱させる可能性があるスキャンから検索可能なテキストを生成し、きれいなオフィスのストックから黄ばんだ新聞用紙まで、あらゆる種類の用紙で機能します。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

裏写りを抑制するための前処理テクニック

裏写りに対する最も効果的な単一の前処理ステップは、背景の推定と減算です。この手法では、背景がページ全体でゆっくりと変化し、テキストが急激に変化するという仮定に基づいて、ページ画像をスキャンして、各ピクセルでのローカル背景色がどうあるべきかのモデルを構築します。次に、背景モデルが元の画像から差し引かれ、前景のテキストを維持しながら裏写りを効果的に除去します。 ScanTailor や、前処理モジュールが組み込まれたオープンソースの Tesseract OCR エンジンなどのツールは、この手法のバリエーションを実装しています。

関連するアプローチは、エッジを維持しながら画像を滑らかにするバイラテラル フィルターを使用することです。このフィルターは、周囲の背景と平均化することでかすかな裏写りを軽減しますが、前景テキストの鋭いエッジは保持します。その結果、OCR エンジンが均一な背景に対してクリア テキストを認識する、よりクリーンな画像が得られます。双方向フィルタリングは単純なしきい値処理よりも計算コストが高く、通常は 1 ページあたり数秒かかりますが、新聞紙スキャンの品質向上は、永続的な価値のある文書の処理時間に見合う価値があります。

裏写りが特に深刻なスキャンの場合、ウェーブレット分解と呼ばれる技術を使用して、画像をさまざまな周波数帯域に分離できます。裏写りはかすかでコントラストが低く、通常、高周波数帯域の低振幅成分を占めます。これらのコンポーネントを抑制し、残りのバンドから画像を再構成することで、テキストの詳細の大部分を保持しながら裏写りを除去できます。この技術には特殊な画像処理ソフトウェアが必要ですが、特に裏面のテキストが前面のテキストとほぼ同じくらい暗いページでは、単純な方法では一致しない結果が得られます。

ステップバイステップ: 裏写りを最小限に抑えるためのスキャン設定

裏写りに対処する最善の方法は、スキャン時に裏写りを減らすことです。スキャンするページの後ろに黒い紙を置きます。黒い裏地は、薄い紙を通過し、スキャナーの蓋で反射し、裏面のテキストを照らす光を吸収します。この簡単な手順により、紙の厚さに応じて裏写りを 50 ~ 80% 減らすことができます。エアメール便箋や聖書用紙などの非常に薄い紙の場合、スキャンを使用するには基本的に黒い裏紙が必須です。

スキャナがサポートする最高の光学解像度 (ドキュメント スキャナの場合は通常 300 ~ 600 DPI) でスキャンします。解像度が高くなると、裏写りに比べて前景テキストの詳細がより詳細にキャプチャされ、追加のピクセルにより前処理アルゴリズムにより多くのデータを処理できるようになります。白黒ではなくカラーまたはグレースケールでスキャンします。白黒スキャンでは、スキャン時に元に戻すことのできないハードしきい値が適用されます。ページのいずれかの部分でそのしきい値が間違っていた場合、情報は永久に失われます。カラーまたはグレースケール スキャンでは、階調範囲全体が保存され、スキャン後にさまざまな前処理設定を試すことができます。これは、最適なしきい値がページ全体で異なるページには不可欠です。

大規模な PDF Archive プロジェクトの場合、適切なスキャン技術への投資は、後処理の労力を削減することで何倍も報われます。 OCR で使用できるようにするために大量の前処理が必要なスキャンは、表示、印刷、およびより優れた OCR テクノロジによる将来の再処理を含む、将来のファイルの使用のたびに大量の処理も必要になります。最初にスキャンを正しく行うことは、デジタル化プロジェクトにおいて最も費用対効果の高い手順です。

OCR 後の修正と検証

前処理されたスキャンで OCR を実行した後も、出力には問題のあるページでエラーが含まれます。認識されたテキストに対してスペル チェッカーを実行し、OCR エラーの可能性があることをフラグします。スペルチェッカーによってスペルミスのフラグが立てられた単語は、手動修正の候補となります。重要なドキュメントの場合は、人間がページのランダム サンプルをレビューし、OCR テキストを元のスキャンと比較してエラー率を推定します。 95 パーセントの正解率は、約 20 単語に 1 単語が間違っていることを意味します。これは、検索目的には許容されるかもしれませんが、忠実なデジタル文字起こしを作成するには許容されません。

重要なPDF Searchable プロジェクトの場合は、同じ前処理スキャンで 2 つの異なる OCR エンジンを使用し、その出力を比較することを検討してください。両方のエンジンが単語に一致する場合、それはほぼ確実に正しいです。一致しない場合は、両方のバージョンが手動レビューの対象になります。このデュアルエンジン アプローチでは、レビュー担当者が数百ページにも及ぶ文書のすべてのページを読む必要がなく、真に曖昧なテキストのみを明らかにすることで、手動による修正の作業負荷を軽減します。

スキャンされた文書に長期的な価値がある場合、適切な前処理と検証の努力が正当化されます。 1950 年の新聞記事は、一度デジタル化され、慎重に前処理され、正確性が検証されたものであれば、何十年も検索可能で引用可能です。同じ記事をデフォルト設定で前処理なしでデジタル化すると、人間が元のスキャン画像を完全に読み取ることができる場合でも、OCR 出力が非常に文字化けして事実上検索できなくなる可能性があります。

大規模な歴史的新聞コレクションを管理する機関にとって、標準化された前処理パイプラインの開発は、将来のすべてのデジタル化プロジェクトと、研究者がコレクションに対して実行する今後のすべての検索クエリにわたって利益をもたらす投資です。新しいスタッフ メンバーが試行錯誤せずに結果を再現できるように、スキャナ モデルと用紙の種類ごとに特定の設定を記載してパイプラインを文書化する必要があります。また、十分に文書化されたパイプラインにより、OCR テクノロジーが向上したときにコレクションを再処理することも可能になり、更新された認識エンジンで同じ前処理を適用して、元の物理文書に戻ることなく、同じ生のスキャンからより適切なテキストを抽出できます。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →