Tips & Tricks

スキャンした 2 ページの本の見開きを 1 つの PDF ページに分割する方法

開いた本や製本されたレポートをフラットベッド スキャナーでスキャンします。各スキャンでは、左ページと右ページの 2 ページを並べて 1 つのワイド画像としてキャプチャします。生成された PDF を表示すると、各シートが見開きページになります。左ページのテキストが右ページのテキストと重なっています。 2 つのページ間の余白にまたがる語句を検索しても、何も返されません。 PDF は見た目は元の本に忠実ですが、読み物としては実質的に使用できません。

スキャンした 2 ページの見開きを個々の 1 ページの PDF に分割することは、書籍、製本レポート、雑誌をデジタル化する人にとって共通のニーズです。このプロセスでは、各倍幅ページを中央で分割し、半分を並べ替えて連続した 1 ページのドキュメントを作成します。適切なアプローチを使用すると、100 ページの書籍を 50 の見開きでスキャンすると、最初から最後まで正しく読み取れる 200 ページの PDF になります。

How to Separate a Two-Page Scanned Book Spread Into Individual Single PDF Pages

見開き2ページ問題を理解する

フラットベッド上で本をスキャンすると、スキャナはガラス領域全体を 1 つの画像としてキャプチャします。開いた本の両方のページがガラス上に収まる場合、スキャンでは 2 ページが並べて表示されます。 PDF はこれを単一の横長のページとして扱います。ページの寸法は 11 x 8.5 インチで、高さよりも幅が広い場合があります。元の本の各ページは、スキャンされた領域の約半分を占めます。課題は、この幅の広いページを 2 つの縦方向のページに分割し、それぞれに本の 1 ページが含まれるようにすることです。

正確な中心を単純に分割することは、完全に位置合わせされたスキャンには機能しますが、本のスキャンが完璧であることはほとんどありません。背骨により、溝付近に湾曲した歪みが生じる場合があります。左右のページの幅が同じでない場合があります。本がスキャン間でわずかにずれている可能性があり、その結果、分割ポイントがページごとに異なります。書籍スキャンに対する適切な分割 PDF アプローチでは、これらの不一致を処理する必要があります。

WukongPDF

PDFを分割してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

方法 1: 各スプレッドを左半分と右半分にクロップする

最も信頼性の高い方法は、2 段階のプロセスです。各スプレッドを切り取って左ページを抽出し、次に再度切り取って右ページを抽出します。スキャンした PDF を開きます。切り抜きツールを使用して、各ページの左半分を選択します。トリミングを適用すると、トリミング ボックスの外側のすべてが非表示になります。ファイルを左ページ バージョンとして保存します。次に、元のファイルを再度開き、右半分をトリミングして、右ページのバージョンとして保存します。最後に、2 つのファイルをインターリーブします。左側のファイルからページ 1、右側のファイルからページ 1、左側のファイルからページ 2、右側のファイルからページ 2 というように配置されます。

切り抜きツールは、切り抜き領域を名前付きプリセットとして保存できるため、左半分と右半分を一度定義し、ワンクリックですべてのページに適用できます。このツールは、すべての奇数ページまたはすべての偶数ページにクロップを適用するバッチもサポートしています。これは、すべてのスプレッドが一貫したレイアウトを共有する場合に便利です。

方法 2: ページ サイズによる分割

すべてのスプレッドがまったく同じ幅である場合 (自動ドキュメント フィーダーまたは専用のブック スキャナでスキャンした場合によくあること)、寸法ベースの分割は手動でトリミングするよりも高速です。ページ幅を 2 で分割し、その座標に分割点を設定します。幅 11 インチのスプレッドは 5.5 インチで分割されます。すべてのページに均等に分割を適用します。この方法は高速であり、文書全体に対して 1 回の操作で済みますが、見開きが完全に中央に配置されていない場合や、スキャン間で本がずれた場合には失敗します。

各スプレッドが手動で配置されたフラットベッドでスキャンされたドキュメントの場合、オペレータが合理的に一貫していれば、寸法ベースの分割により許容可能な結果が得られることがよくあります。確認するには、最初の数ページを分割し、分割線でテキストが切れていないことを確認します。分割によって常に片側のコンテンツがクリップされる場合は、分割座標を調整して再試行してください。サンプルで分割ポイントを確認したら、それをすべてのページに適用します。

方法 3: OCR を使用して余白を検出し、自動分割する

一部の高度なスキャン ソフトウェアには、自動拡散検出機能が含まれています。ソフトウェアはスキャンされた各ページを分析し、本のとじしろの暗い縦方向の帯を特定し、その線に沿ってページを分割します。これにより、固定座標を使用するのではなく、各ページの実際のコンテンツに適応するため、最も正確な分割が生成されます。余白は通常、ページ上で最も暗い垂直領域であり、画像分析アルゴリズムによって確実に検出されます。

WukongPDF の スキャンされた PDF 処理には、書籍スキャンの自動とじしろ検出が含まれています。スキャンをアップロードすると、ツールが各ページの背表紙の影を特定し、最適な分割線を計算し、ページが正しい読み取り順序で配置された単一ページの PDF を生成します。分割結果を手動で確認することをお勧めします。特に、とじしろをまたぐフルブリード画像を含むページの場合は、自動検出によりとじしろではなく画像の中央に分割線が配置される可能性があります。

分割後のページの並べ替え

スキャンしたスプレッドを分割すると、読み取り順序に合わせて並べ替える必要があるページが生成されます。見開きでスキャンされた本では、見開き 1 左、見開き 1 右、見開き 2 左、見開き 2 右の順序でページが生成されます。正しい読み取り順序は、見開き 1 右、見開き 2 左、見開き 2 右、見開き 3 左です。多くの場合、最初の左ページは表紙の内側か、タイトル ページの前の空白ページであるため、意図した順序を物理的な書籍と照らし合わせて確認してください。

並べ替えの手順は手動ですが簡単です。ページのサムネイルが表示されるビューアで分割 PDF を開きます。ページを正しい順序にドラッグします。 WukongPDF のページ並べ替えツールは、すべてのページをサムネイル グリッドとして表示するため、順序を確認して修正することが簡単になります。 200 ページの本を正しく再注文するには 10 ~ 15 分かかります。スキャンした本の PDF を正しく順序付けすると、最初から最後まで自然に読み進めることができますが、順序が正しくないと、読者はページ間を行ったり来たりする必要があり、これがまさに分割が解決しようとした問題です。

分割して並べ替えた後、最終的な単一ページの PDF で OCR を実行します。各ページのテキストの方向が正しく分離されるようになったため、見開きページで OCR を実行する場合と比較して OCR の精度が向上しました。単一ページ OCR では、読み上げ順序がページ順序と一致するテキスト レイヤーも生成されるため、語句を検索すると正しいページ順序で結果が返されます。変換されたPDF ページ は、読み取れない見開き画像の山ではなく、適切に順序付けされた検索可能なデジタル ブックになりました。

文書全体で左右のページの幅が等しくなく、分割点が不均一な本のスキャンの場合、繰り返し参照する文書については、ページごとに手動でトリミングする方が時間をかける価値があります。自動余白検出は、ページの 80% を正しく処理します。残りの 20% は、個別に注意する必要があります。通常は、ページ レイアウトが変更される章の最初と最後のページ、または余白をまたがるフルブリードのイラストが含まれるページです。これらのページでは、自動分割により画像の中央が切れてしまったり、反対側のページの一部が見えたままになったりすることがあります。分割後に各ページのサムネイルを開き、各行の最初の数単語と最後の数単語をチェックすると、分割境界でコンテンツが失われていないことが確認されます。検証パスには 1 ページあたり約 30 秒かかり、ほぼ正しい分割を正確に正しい分割に変換します。

WukongPDF

PDFを分割してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →