Tips & Tricks

本のページ PDF をトリミングして背表紙の影を削除する方法

本をページごとにスキャンすると、PDF が作成されます。この PDF では、どのページにも中央に暗い湾曲した影が走ります。この影は、ページが装丁に向かって曲がる本の背表紙によって投影されます。背表紙付近のテキストが暗くなり、ページの湾曲によって歪むことがあります。影は印刷時にインクやトナーを消費し、ページがプロフェッショナルではないように見え、影響を受けるテキストの OCR 精度を妨げます。スキャンした各ページから背表紙の影を切り取ると、視覚的なアーチファクトが除去され、読者の注意がコンテンツに集中します。本の厚さが表から裏に変わると、影の位置がページごとにわずかに移動するため、背表紙の影を除去するCrop PDF のアプローチをページごとに適用する必要があります。

How to Crop a Book Page PDF to Remove the Spine Shadow

本のスキャンに背表紙の影が現れる理由

フラットベッド スキャナは、本をガラス プラテンに押し付けます。背表紙に近いページは、製本によって妨げられているため、完全に平らにすることができません。ページとガラスの間にこの隙間があり、スキャナの光が異なる反射をする領域が生じ、背表紙の端から始まり、綴じ具からの距離が増すにつれて薄くなる影が生じます。開いた本の左ページでは、影は左端に沿って最も暗く、中央に向かって伸びています。右ページでは、右端に沿って影が最も濃くなります。

綴じ付近のページの湾曲によってもテキストが歪みます。背表紙付近の文字は、スキャナ センサーに対するページの角度に応じて圧縮または伸長して表示されます。トリミングすると、影や歪んだテキストが削除されます。別の方法は、画像処理を使用して影を明るくし、歪んだテキストの傾きを補正する方法ですが、より複雑で、影響を受けた領域を単にトリミングするだけできれいな結果が得られることはほとんどありません。本のスキャンからの スキャン PDF は、影領域の修正を試みるよりもトリミングの方が効果的です。

WukongPDF

PDFをトリミングしてみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

作物の境界を決定する

切り抜きツールをサポートする PDF ビューアで最初にスキャンしたページを開きます。背表紙の端を拡大して、影がページの背景を著しく暗くし始める場所を特定します。トリミング境界はこの点のすぐ内側に配置し、シャドウ ゾーン全体を削除する必要があります。暗いピクセルが残らないように、影の隣に通常のページ背景の小さな余白を含めます。トリミング境界が影にクリップされると、トリミングされたページの端に沿って暗い帯が残ります。

ページの端から切り抜き境界までの距離を測定します。この距離は、スキャン内のすべてのページのトリミング値になります。ただし、最適なトリミング距離は、本の左ページと右ページの間で異なる場合があり、また、ページの曲率が変化する本の表と裏の間でも異なる場合があります。本のさまざまなセクションのページのサンプルに目を通し、背表紙の影の幅が一貫しているかどうかを確認します。異なる場合は、同じトリミング距離を共有するセクションにページをグループ化します。各グループに適切なトリミング距離を適用します。

すべてのページにトリミングを適用する

トリミング境界を決定したら、PDF 内のすべてのページに境界を適用します。切り抜きをサポートするほとんどの PDF エディターは、同じ切り抜き四角形を一定範囲のページに適用できます。同じトリミング距離を共有するすべてのページを選択し、トリミング ツールを開き、トリミング値を入力して適用します。左ページと右ページで異なるクロップ値が必要な本のスキャンの場合は、左ページと右ページを別々のページ グループとして処理します。選択したすべてのページに同じトリミングを適用するPDFのバッチ操作には数秒かかります。

PDF が見開き 2 ページとしてスキャンされ、各 PDF ページに開かれた本の左ページと右ページの両方が表示される場合、トリミングはより複雑になります。背表紙の影がページの中央に流れます。ページの左半分をトリミングして背表紙の影の左側を削除し、右半分をトリミングして右側を削除します。一部の PDF ツールでは、各ページを中央で分割し、それぞれの半分を個別にトリミングして、見開きから個別のページを作成できます。 WukongPDF および同様のプラットフォームは、単一ページと見開きページの両方の書籍スキャンのトリミングを処理するトリミング ツールを提供します。

ページの背表紙付近のコンテンツを保存する

背表紙のシャドウ領域には、単純に破棄できないコンテンツが含まれている場合があります。ページ幅全体にわたる表には、シャドウ ゾーンにまで及ぶ列が含まれる場合があります。図や写真が装丁の近くに配置される場合があります。脚注や欄外注は影によって部分的に隠れる場合があります。これらのページでは、シャドウ ゾーン全体をトリミングすると、読者が必要とするコンテンツが削除されます。

これらの例外的なページは個別に処理してください。暗くなってもシャドウ ゾーンのコンテンツが判読できる場合は、その特定のページのトリミングをあまり積極的に行わず、シャドウの最も暗い部分のみを削除し、テキストは暗くなっても読める状態のままにします。コンテンツが判読できない場合は、より慎重に処理して物理的な書籍を再スキャンして、ページをさらに平坦化できるかどうかを検討してください。本をスキャナーのガラスにしっかりと押し付けたり、製本用に設計された V 字型プラテンを備えたブック スキャナーを使用したり、フラットベッドではなくオーバーヘッド カメラで本をスキャンしたりすると、ソース部分の背表紙の影が軽減されます。

収穫後の品質検証

トリミング後、PDF のすべてのページをスクロールして、影の残骸が残っていないこと、およびコンテンツが誤ってトリミングされていないことを確認します。特に、本の最初と最後に近いページには注意してください。ページの湾曲や影の幅が中央のページとは異なる場合があります。 100 ページには完璧な切り抜きが、5 ページでは攻撃的すぎる可能性があります。5 ページでは、綴じ具の片面にある薄いページの積み重ねにより、異なる湾曲が生じます。

トリミングされた PDF で OCR を実行し、シャドウ ゾーンでのオリジナルのトリミングされていないスキャンとテキスト認識精度を比較します。トリミングされたバージョンが、以前影が付いていた領域のテキストをより正確に認識した場合、トリミングは成功しています。トリミングされたバージョンで以前に認識されていたテキストが失われている場合は、トリミングが過度に行われた可能性があります。 PDF 品質 の目標は、すべての重要なコンテンツが保持され、邪魔なアーティファクトがすべて削除されたクリーンなページです。

背骨の影を除去するためのトリミングの代替案

トリミングは背骨の影を除去する最も簡単な方法ですが、これが唯一の方法ではありません。画像編集ソフトウェアは、部分的な明るさとコントラストの調整をシャドウ ゾーンに適用し、コンテンツを削除せずに背景を明るくし、テキストのコントラストを高めることができます。このアプローチでは、ページ上のすべての単語が保持されますが、ページごとの画像編集が必要になります。これは、短い文書または重要性の高い個々のページでのみ実用的です。

ScanTailor などの専用の書籍スキャン ソフトウェアには、各ページのテキスト領域を自動的に検出してその領域をトリミングするコンテンツ選択機能が含まれており、トリミング境界を手動で測定することなく背表紙の影を処理します。 ScanTailor は、スキャン画像を PDF に組み立てる前に処理します。書籍を定期的にスキャンして PDF に変換する場合、自動コンテンツ検出とトリミングを含むスキャン ワークフローに投資すると、手動によるトリミング PDFの調整にかかる時間を節約できます。

スキャナーに平らに押し付けることができない希少本や壊れやすい本の場合は、開いた本の真上に配置されたカメラでページを撮影することを検討してください。カメラのアプローチはガラス プラテンを完全に回避し、両側から慎重に照明を当てることで、後処理に依存して修正するのではなく、撮影段階で背骨の影を最小限に抑えることができます。

PDF をトリミングして完成させた後、書籍がパブリック ドメインにある場合は、クリーンアップされたデジタル バージョンをオンライン アーカイブまたはデジタル ライブラリに寄贈することを検討してください。スキャンのクリーンアップに費やす時間は、自分のプロジェクトだけでなく、読み取り可能なデジタル形式でテキストにアクセスする必要がある他の人にとっても有益です。

イラスト、写真、または地図が見開きページ間の余白にまたがる本の場合、背表紙の影をトリミングすると、画像の中央部分が犠牲になります。このような場合は、イラスト ページについては見開きページをそのままにし、テキストのみのページのみをトリミングすることを検討してください。ドキュメントのメタデータ内のメモにより、クロスガター コンテンツを保持するために特定のページが切り取られずに残されたことが説明できます。

書籍デジタル化プロジェクトのスキャン PDF クリーンアップ プロセスは、スキャン、トリミング、OCR、品質チェックの各ステップを分離する構造化されたワークフローの恩恵を受けます。スキャン時に各ページを切り取って完成させようとすると、結果に一貫性がなくなります。最初に本全体をスキャンしてから、ページ画像の完全なセットをトリミング手順を通じてバッチとして処理します。

書籍スキャンのトリミング PDF ワークフローは、大まかなスキャンを、読み取り、印刷、およびデジタル ライブラリ コレクションでの長期保存に適したクリーンなデジタル コピーに変換します。

背表紙の影が除去され、クリーン化されたスキャンされた PDF は、OCR 処理の準備ができており、画質の向上による恩恵を受けられます。

適切にトリミングされた書籍スキャンでは、スキャン プロセスの機械的アーチファクトが除去されながら、著者の言葉が保存されます。

本のスキャンは保存行為です。スキャナーの影が除去されたすべてのページは、将来の読者が気を散らすことなく読むことができるページになります。トリミングの段階での細心の注意は、物理的な書籍のコンテンツをデジタルの未来に持ち込むためのより大きな取り組みの一部です。

WukongPDF

PDFをトリミングしてみる

インストールは必要ありません。ブラウザで直接動作します。

始める →