書籍、論文、日記、台帳などの製本された冊子をスキャンすると、ページが縦向きと横向きで交互に表示される PDF が生成されます。開いた本の左側のページはある方向でスキャンされ、右側のページは別の方向でスキャンされます。または、スキャナーのオペレーターがスキャンされた画像を回転せずに見開きごとに本を裏返したため、本全体がページを交互に回転してスキャンされます。その結果、画面上で表示すると、1 ページおきに 90 度または 180 度回転して表示される PDF が作成されます。最初にページの向きを正規化せずにこの文書に対して OCR を実行すると、正しい向きと回転が交互に行われるテキストが生成され、認識されたテキストが検索や抽出に使用できなくなります。このソリューションには、OCR で処理する前に各ページの向きを検出して修正する前処理ステップが必要です。

バインドされたボリュームのスキャンでページの向きが交互になる理由
製本されたボリュームをスキャンする場合、各スプレッド ページは 2 ページを裏向きにしてスキャナ ベッドに置きます。本の左ページはスキャナ ベッドの右側に表示され、右ページは左側に表示され、相互に 180 度回転されます。スキャナーのオペレーターが個々のページごとにこの回転を修正しない場合、スキャンされた PDF には 1 ページおきに上下が逆になったページが含まれます。 200 ページの本では、100 ページが正しい向きで、100 ページが 180 度回転された 200 ページの PDF が生成されます。パターンは規則的で予測可能です。すべての奇数ページが正しい方向に配置され、すべての偶数ページが回転されるか、またはその逆である可能性があります。
一部の製本された本は、開いた本をスキャナーに置き、テキストが水平に走るようにしてスキャンされ、左ページと右ページの両方を含む 1 つの画像が生成されます。次に、この画像は 2 つの別々のページに分割されますが、分割プロセスでは、左側のページの方向に合わせて右側のページが常に回転するとは限りません。結果として、左側のページが正しい向きで右側のページが 90 度回転された、またはその逆の PDF が作成されます。 OCR エンジンは、テキストがページ上で左から右に水平に配置されることを想定していますが、テキストが垂直または上下逆に配置されているため、回転されたページ上のテキストを認識できません。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
OCR 処理前のページの向きの検出
OCR を実行する前に、PDF ビューアでページのサムネイルを検査します。交互の方向はサムネイル パネルにすぐに表示され、サムネイルが 1 つおきに回転して表示されます。向きのパターンを数えます。奇数ページが正しく、偶数ページが回転するのが最も一般的なパターンですが、その逆も可能です。パターンに一貫性がある場合、バッチ ローテーション操作により、影響を受けるすべてのページを 1 つのコマンドで修正できます。ほとんどの PDF ビューアでは、サムネイル パネルで複数のページを選択し、選択したすべてのページに同時に回転を適用できます。偶数ページをすべて選択し、必要に応じて 180 度または 90 度回転して、ドキュメントを保存します。サムネイル パネルにすべてのページが正しい向きで表示されるようになりました。
WukongPDF の OCR PDF ツールは各ページを個別に処理しますが、テキストが水平方向に配置されていることを前提としています。ページが回転すると、OCR エンジンは垂直または上下逆のテキストを水平であるかのように読み取ろうとするため、テキストの認識に失敗するか、文字化けした出力を生成します。 OCR の前にページの向きを修正することは、必須の前処理ステップです。影響を受けるページを回転してドキュメントを保存した後、正規化された PDF で OCR を実行します。すべてのページで OCR エンジンが期待する方向でテキストが表示されるため、認識精度はすべてのページで一貫しています。
ドキュメント全体で一貫性のない方向パターンの処理
すべてのバインドされたボリュームがきれいな交互パターンを生成するわけではありません。 2 人の異なるオペレーターによってスキャンされた書籍、異なる時間にスキャンされた複数冊のセット、または最初のスキャン後に部分的に再スキャンされた文書には、不規則な向きのパターンが含まれる可能性があります。 1 ページから 50 ページは交互パターンに従い、51 ページから 80 ページは適切な回転で再スキャンされたためすべて正しい方向になっている可能性があり、81 ページから 200 ページは交互パターンに戻る可能性があります。検出と修正は、単一のバッチ操作ではなく、セクションごとに実行する必要があります。
不規則な方向パターンの場合は、サムネイルをスクロールして個々のページまたはページ範囲を回転する手動の方法が最も信頼性の高い方法です。 1 ページ目から始めて、サムネイルに目を通します。回転されたページに遭遇した場合は、その方向を共有する連続したページが何ページあるかを確認します。範囲を選択して回転を適用します。すべてのページが正しい方向になるまで文書を読み続けます。このプロセスには 1 ページあたり 1 ~ 2 秒かかるため、200 ページのドキュメントには約 5 分かかります。正しい向きのページの OCR 精度は、回転したページよりも大幅に高いため、時間を有効に活用できます。
大規模なバインドボリュームプロジェクトの方向検出の自動化
数百または数千ページに及ぶデジタル化プロジェクトの場合、ページごとに手動で向きをチェックすることは現実的ではありません。自動方向検出ツールは、テキストの方向を分析することで、回転されたページを識別できます。これらのツールは、ページ全体でテキスト文字をサンプリングし、どの回転によって期待される言語で有効な単語が生成されるかを認識することで、支配的な方向を決定します。テキスト認識が 0 度では成功するが、90、180、および 270 度では失敗するページは、正しい方向に向いています。 180 度では認識が成功するが、0 度では認識に失敗するページは上下逆になるため、回転する必要があります。自動検出は大規模なドキュメント セットを迅速に処理し、結果の手動スポット チェックにより、OCR が開始される前に自動化が正しく機能していることが確認されます。
交互の向きでの OCR 出力の検証
ページの向きを修正して OCR を実行した後、認識品質が文書全体で一貫していることを確認します。元の正しいページと元の回転されたページの両方に表示されるテキストを検索します。検索では、両方のタイプのページで同じ信頼性でインスタンスが見つかるはずです。元の回転ページ上のテキストが見つからない場合は、回転補正が正しく適用されていないか、回転が保存される前に OCR エンジンが一部のページを処理した可能性があります。ドキュメントを再度開き、サムネイル パネルですべてのページの向きが正しいことを確認し、必要に応じて OCR を再実行します。
一部のページがスキャナー ガラスに平らに押し付けられ、他のページが背の近くで湾曲している本など、元のスキャン品質がページ間で異なる製本本の場合、OCR の精度もそれに応じて変化します。向きの補正により回転の問題は解決されますが、他のスキャン品質の問題は補償されません。 OCR が許容可能な精度を達成するには、曲率が大きいページを再スキャンするか、歪み補正フィルターで前処理する必要がある場合があります。 スキャン PDF から検索可能なテキストへのパイプラインは、ソース画像ができるだけきれいで方向が揃っている場合に最適に機能します。向きの修正は、最初で最も影響力のあるステップです。歪み補正、コントラスト調整、斑点除去は、困難な境界ボリューム スキャンでの認識精度をさらに向上させるフォローアップ ステップです。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
