ほとんどの PDF 分割ツールは、ページ数に基づいてドキュメントを分割します。N ページごとに分割したり、特定のページ番号で分割したり、均等な部分に分割したりします。このアプローチは、ドキュメントの境界がどこにあるかをすでに正確に知っている場合に機能します。内部構造が不明な、さまざまな長さの不明な文書が明確な区切りページなしで結合された結合 PDF を扱う場合、完全に失敗します。ページ数をカウントする方法では、ある文書がどこで終わり、次の文書が始まるかを推測する必要があり、推測を誤ると文書が半分になったり、ある文書の末尾が次の文書の先頭と結合したりする可能性があります。
根本的により信頼性の高いアプローチは、あるソース ドキュメントから次のソース ドキュメントへの移行を示す、ページ レイアウトの方向、コンテンツ密度、または書式設定の変更を検出します。これらの構造的手がかりは、結合されたほぼすべての PDF に存在します。これは、たとえそれらの違いが、一般の読者には気づかないほど微妙なものであっても、ソース文書ごとに異なる書式設定特性が常に異なるためです。これらの信号を識別する方法を学ぶと、PDF の分割が推測から系統的なプロセスに変わります。

ドキュメントの境界を示すレイアウトベースの信号
複数のドキュメントを 1 つの PDF に結合すると、各ソースドキュメントには独自の書式設定 DNA が組み込まれます。文書 A では、余白が 1 インチのレターサイズのページ、Times New Roman の 12 ポイントの本文、および各ページに会社ロゴを含むヘッダーを使用する場合があります。文書 B は同じレターサイズのページを使用しますが、余白が狭く、11 ポイントの Calibri テキストが使用され、ヘッダーがまったくありません。ドキュメント C は、スプレッドシートの付録として完全に横向きに切り替わる可能性があります。これらの書式設定の変化は、人間がページのサムネイルをめくるとすぐにわかり、プログラムでページのプロパティを抽出できる PDF 分析ツールで測定できます。
以下の表は、ドキュメントの境界を検出するための最も信頼性の高いレイアウトベースの信号と、それぞれの評価方法をまとめたものです。
| 検出信号 | 測定内容 | 信頼性レベル |
|---|---|---|
| ページ寸法の変更 | レター、リーガル、A4、またはカスタム ページ サイズを切り替える | 非常に高い |
| 向きの変更 | 連続するページ間で縦向きから横向き、またはその逆 | 非常に高い |
| 文字密度の低下 | ページ面積あたりの文字数が大幅に減少、タイトルページに典型的 | 高い |
| フォントファミリーまたはサイズの変更 | 新しいソース文書の書式設定を示す、主要なフォントの変更 | 適度 |
| 余白幅変更 | 隣接するページ間の左右上下の余白が異なる | 適度 |
| ヘッダーまたはフッターの外観 | ページ上部または下部に繰り返し表示されるテキストの有無 | 存在すると高い |
PDFを分割してみる
インストールは必要ありません。ブラウザで直接動作します。
コンテンツ密度分析を使用して自然な分割ポイントを見つける
コンテンツ密度は、ページ上のテキスト文字、画像領域、空白の量として測定され、単一ドキュメント内の予測可能なパターンに従います。一般的なドキュメントは、テキスト密度が低く、空白スペースが多いタイトル ページから始まります。これに続くコンテンツ ページでは、一貫したテキスト密度が大幅に高くなります。書類が署名ページや付録で終わっている場合は、その時点で密度が再び変わる可能性があります。複数のドキュメントを結合すると、この密度パターンが新しいドキュメントごとに繰り返されます。つまり、タイトル ページで低密度の谷があり、コンテンツ ページ全体にわたってより高く一貫した密度のプラトーが続きます。
ページごとのコンテンツ密度を測定できるソフトウェアは、これらのパターンの繰り返しを識別し、分割点の候補としてフラグを立てることができます。結合された PDF の密度グラフには、コンテンツ ページとタイトル ページにそれぞれ対応する山と谷が表示されます。密度が急激に低下する谷が分割点の候補です。これらの谷がページ寸法の変更やフォントの変更などの他の構造変化と一致する場合、そのページが文書の境界を表す可能性が非常に高くなります。 WukongPDF の Split PDF ツールは、識別された各境界で分割点をマークし、各セグメントを個別の適切な名前の PDF として抽出できる視覚的なページ セレクターを提供します。
最強の境界信号として方向が変化する
縦から横、またはその逆のページの方向の変化は、ほとんどの場合ソース ドキュメント間の切り替えを示すため、ドキュメントの境界を示す最も信頼性の高い信号です。単一のドキュメント内では、ページはほぼ常に一貫した向きを維持します。縦長のレポートに挿入された横長のスプレッドシート、縦長の申請書と混合された横長の証明書、縦長の仕様ページと混合された横長の建築図面はすべて、新しいソース文書が向きの変更から始まることを明確に示しています。
方向変更時の分割は非常に簡単です。結合された PDF のページ サムネイルをスクロールし、前のページと向きが異なるすべてのページに注目します。これらの各ページは、おそらく新しい文書の始まりを示しています。向きが変わるまでのページを個別のファイルとして抽出します。結合された PDF に、すべて同じドキュメントに属する縦向きページと横向きページが混在している場合 (これはまれですが、折り込みページを含む高度にフォーマットされたレポートでは発生する可能性があります)、分割をコミットする前に、テキスト密度やフォントの一貫性などの他の信号をチェックして分割ポイントを確認します。
複数の信号を組み合わせて信頼性の高い自動分割を行う
単一のレイアウト信号が、あらゆる場合に文書境界を検出するのに完全に信頼できるということはありません。縦長のドキュメント内の横長のページは、新しいドキュメントの始まりではなく、同じレポート内のグラフまたは折り込みである可能性があります。密度の低下は、別のファイルの先頭ではなく、長い文書内の章のタイトル ページである可能性があります。最も信頼性の高い自動分割アプローチは、複数の信号を結合します。分割ポイントは、同じページで 2 つ以上のレイアウト信号が同時に変更された場合にのみ確認されます。方向の変更とフォントの変更は、新しい文書であることを強く示します。ページ寸法の変更と組み合わせた密度の低下も同様に信頼性があります。
すべての単一ページを手動で確認することが現実的ではない大規模な結合 PDF の場合、結合信号アプローチにより、許容可能な低いエラー率で自動分割が実現されます。分割ツールは各ページを処理し、すべてのレイアウト信号を計算し、複数の信号が同時に変化するページのみにフラグを立てます。フラグが設定されたページのみを手動で簡単にレビューし、各ページを表示してそれが本当に文書の境界を表していることを確認すると、文書内のすべてのページをレビューするのに必要な時間のほんの一部しかかかりません。 PDF Batch の自動化された複数信号検出とその後の対象となる人間による検証の処理パイプラインは、自動化の速度と人間の判断の正確さを組み合わせています。
PDFを分割してみる
インストールは必要ありません。ブラウザで直接動作します。
