
OCR が脚注のテキストと余白の内容の重なりに苦労する理由
光学式文字認識エンジンは、テキストが一貫した行間隔とコンテンツ領域間の明確な分離を備えたクリーンで予測可能なブロックに収まっている場合に最適に機能します。標準的なビジネス レターや小説のページに対する OCR PDF 操作では、テキストが四辺に広い余白を持つ整然とした段落で流れるため、通常、正確な結果が得られます。学術論文は根本的に難しい問題を提示します。そのレイアウトは複数の異なるテキスト ストリームを意図的に物理的に近接して詰め込んでおり、脚注、欄外引用、本文が境界で接触したり重なったりすることがよくあります。
中心的な課題はセグメンテーションです。これは、OCR エンジンが文字認識を試みる前にページ画像をテキスト領域に分割するステップです。本文内の上付き脚注参照番号が脚注区切り線の真上にあり、その行が小さいフォント サイズで脚注テキスト自体の真上にある場合、セグメンテーション アルゴリズムは、1 つのテキスト領域がどこで終了し、次のテキスト領域が始まるかを決定する必要があります。ここで誤ったセグメンテーションの決定は、認識エラーにつながります。これは、2 つの異なるテキスト ストリームからの文字が、あたかも 1 本の連続した行であるかのように認識エンジンに入力されるためです。出力は、本文の単語と脚注の断片が混在した意味不明なものになります。
余白引用により、問題に 3 番目のテキスト ストリームが追加されます。シカゴ スタイルに従った人文科学の論文やブルーブック形式を使用した法律文書では、欄外注、行番号、または並行引用が本文欄に沿って垂直または水平に配置されます。これらの余白要素は、多くの場合、より小さいポイント サイズ (場合によっては 7 ポイントまたは 8 ポイント) で印刷され、OCR エンジンが通常のサイズですでに苦労している斜体または縮約フォントが使用される場合があります。欄外テキストが物理的に本文と接触する場合、これは狭い余白を持つ厳密にフォーマットされたジャーナルで頻繁に発生することであり、セグメンテーションの課題は双方向ではなく三方向になります。
Scanned PDF ソースの紙質も、OCR の難しさをさらに悪化させます。多くの学術論文は、綴じられた冊子からスキャンされており、背表紙近くのページの湾曲によってテキストが曲がったり歪んだりすることがあります。ページの下部にある脚注は、装丁に最も近い位置にあるため、背骨の湾曲の影響を最も受けやすいセクションです。湾曲したページによる物理的な歪み、小さいフォント サイズ、および上記の本文に近いことが組み合わさって、OCR の精度にとって悪条件の嵐を引き起こします。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
スキャンされたページを前処理して重複するテキスト領域を分離する
重複するテキスト要素を含む学術ページの OCR 精度を向上させる最も効果的な方法は、OCR エンジンに到達する前にページ画像を前処理することです。この前処理によってさまざまなテキスト ストリームが分離されるため、エンジンはあいまいなセグメンテーションの決定を行う必要がなくなります。
まず、スキャンしたページの傾きを補正して、すべてのテキスト行が完全に水平になるようにします。元のスキャンが 1 度傾いているだけでも、脚注のテキストがページ端の本文領域に流れ込み、適切に位置合わせされたページには存在しない誤った重なりが生じる可能性があります。ほとんどのドキュメント スキャン ソフトウェアには自動デスキューが含まれていますが、製本された冊子からスキャンされた学術論文の場合は、本文のベースラインに沿って引かれた基準線を使用した手動デスキューの方が、自動補正よりも正確な結果が得られます。
デスキュー後、次のステップは領域マスキングです。画像エディタまたは専用の OCR 前処理ツールを使用して、本文テキスト領域と脚注領域の間に水平の区切り線を描きます。この行は、下流の OCR エンジンに対して、その上にあるすべてのものを 1 つのテキスト領域として扱い、その下にあるすべてのものを別のテキスト領域として扱うように指示します。脚注が存在するページでは、セパレータは脚注ルールのすぐ上に配置する必要があります。これは、印刷された学術著作物で伝統的に本文と脚注を区切る短い水平線です。脚注のないページでは区切り文字は必要ありません。
余白引用と行番号については、垂直マスキングが同等のアプローチです。余白テキストとメインテキスト列の間に垂直区切り線を描きます。左余白の行番号と右余白の引用の両方を含むページでは、両側に垂直区切り文字が必要です。目標は、ページを長方形の領域に分割し、各領域にテキスト ストリームが 1 つだけ含まれるようにすることです。次に、OCR エンジンは各領域を個別に処理し、個別に認識されたテキスト出力を生成します。認識の完了後に、これらの出力を正しい読み取り順序で再組み立てできます。
マルチストリーム学術ページの OCR 設定の構成
ほとんどのプロフェッショナルな OCR エンジンは、複数列および複数ストリームのページ レイアウトに役立つ設定を提供します。 Enabling automatic layout analysis is the starting point, but for academic pages with close-proximity text streams, manual zone configuration produces better results than fully automatic analysis.
本文テキスト、脚注領域、および各余白テキスト領域に対して個別の認識ゾーンを定義します。各ゾーン内で、適切な言語、予想されるフォント サイズの範囲、およびテキストの方向を設定します。本文テキストゾーンには、水平方向の左から右への 10 ~ 12 ポイントのテキストが必要です。 Footnote zones should expect 8 to 10 point text, still horizontal but with awareness that footnote text often includes URLs, DOIs, and citation strings that may confuse language models expecting natural prose.
特に本文ゾーンについては、行分割のために上付き文字と下付き文字を無視する設定を有効にします。上付きの脚注参照番号と数学的指数は、通常は小さく、ベースラインよりも高くなっているため、エンジンがこれらを通常のテキスト行の一部として扱う場合、行の高さの計算エラーが発生します。セグメンテーションの目的で上付き文字の位置を無視すると、本文のテキスト行はそのまま維持されますが、脚注マーカーは行の境界に影響を与えない別個の小さな要素として認識されます。
各ゾーンの認識結果を個別のテキスト ファイルまたは結合された出力内の個別のマーク付きセクションに保存すると、PDF から Text への出力品質が大幅に向上します。このゾーン分離された出力により、本文テキストが脚注テキストに溶け込んでいないこと、および余白の引用がメインのコンテンツに挟まれるのではなく、明確にラベル付けされた独自の出力セクションに表示されることを簡単に検証できます。
アカデミック OCR 出力の認識後のクリーンアップ
注意深い前処理とゾーン構成を行ったとしても、ぎっしりと詰まった学術ページでは、ある程度の認識エラーは避けられません。構造化された認識後のクリーンアップ プロセスは、テキストが最終文書に入力される前に、これらの残留エラーを検出して修正します。
スペルチェック辞書をドキュメントの主言語に設定して、本文テキスト出力に対してのみスペルチェック パスを実行します。本文内でスペルミスのフラグが立てられた単語が、脚注の内容が正しく綴られていることが判明した場合は、本文とテキストのゾーンの境界が広すぎて脚注のテキストが取り込まれていることを示す明らかな兆候です。脚注の断片を手動で編集して削除するのではなく、これらのページのゾーン境界を調整し、認識を再実行します。
脚注テキスト出力の場合、各脚注が予期される参照番号で始まっていること、および脚注テキストが本文テキストの断片が散在することなく連続的に流れていることを確認してください。一般的な認識後のエラー パターンは、脚注テキストの中央に本文テキスト行が表示され、本文テキスト列が予想されるゾーン境界よりもページの下に伸びている場合です。認識された脚注テキストと並べて元のページ画像を確認すると、文のトピックが学術的な主題から無関係な本文の段落のトピックに突然移行するため、これらの侵入をすぐに発見できます。
WukongPDF の OCR ツールは、脚注や余白のコンテンツを含む複数段組みの学術論文など、複雑なページ レイアウトのゾーンベースの認識をサポートします。認識パスを開始する前に、言語、フォント サイズ範囲、およびテキストの向きのゾーンごとの設定を定義すると、同じページで単一ゾーン処理するよりも正確な OCR PDF 出力が生成され、出力形式が分離されているため、認識後の検証が簡単になります。
特殊なケースの処理: 数学表記、非ラテン文字、および混合言語
STEM 分野の学術論文では、重複するテキストの課題に数学的な表記が追加されます。数式表記では、散文テキストと同じレイアウト規則に従わない記号、ギリシャ文字、分数や上付き文字などの 2 次元書式設定が使用されるため、本文テキストに数式や数式が散在すると、分節化がさらに複雑になります。ドキュメント テキスト用に設計された OCR エンジンは数式表記ではパフォーマンスが低く、数学用に設計されたエンジンはドキュメント テキストではパフォーマンスが悪くなります。
数学と散文が混在するページに対する最も実用的なアプローチは、2 パス OCR 戦略です。最初のパスでは、ドキュメントに最適化されたエンジンを使用して、本文、脚注、欄外引用を含むすべての散文テキスト領域を認識します。 2 番目のパスでは、方程式を含む特定のページ領域で数学対応の認識エンジンを使用します。 2 つの出力を 1 つの結合ドキュメントにマージすると、ドキュメント エンジンの散文精度と数学エンジンの数式精度の両方が維持され、全体として最も信頼性の高い結果が得られます。
脚注にアラビア語、中国語、またはキリル文字の引用が含まれる英語の論文など、ラテン文字と非ラテン文字が混在する論文の場合は、各認識ゾーンを正しいプライマリ スクリプトで構成します。本文ゾーンでは、ドキュメントの主言語が使用されます。非ラテン文字の一節を含む脚注ゾーンには、単一のテキスト領域内でスクリプトを切り替えることができるマルチスクリプト認識構成が必要な場合があります。
以下の表は、学術論文のさまざまなページ領域に対する推奨される OCR ゾーン構成をまとめたものです。
| ページ領域 | 予想されるフォント サイズ | 方向 | 特殊設定 |
|---|---|---|---|
| 本文 | 10~12点 | 水平 | 線分化の上付き文字を無視する |
| 脚注 | 8~10点 | 水平 | 引用にラテン語以外のテキストが含まれる場合はマルチスクリプト |
| 左マージン (行番号) | 7~9点 | 水平または垂直 | 別の出力として抽出します。体と同化しない |
| 右余白 (引用) | 7~9点 | 水平 | 別の出力として抽出 |
| 方程式/公式 | 変数 | 横型 2D レイアウト | 2 番目のパスで数学対応エンジンを使用する |
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
