Tips & Tricks

コンテンツが分割境界で連続するページにまたがる PDF を分割する方法

PDF をページ数ごとに分割するのは簡単です。 10 ページごと、または 50 ページごとに分割するようにツールに指示すると、まさにその通りに実行されます。問題は、分割する必要があるコンテンツがページの境界と一致していないときに始まります。 7 ページで始まり 9 ページで終わる 3 ページの表は、8 ページ以降の分割ではきれいに分離できません。 1 ページの最後の 3 行と次のページの最初の 20 行にまたがる契約書は、改ページでファイルを分割すると 2 つの断片に分割されます。このような状況では、別の分割戦略が必要になります。これは、PDF の内部コンテンツ ストリームを読み取り、改ページの位置に関係なく、論理セクションが実際に開始および終了する場所を特定するものです。

コンテンツに応じた分割は、ほとんどの基本的な PDF ツールの標準機能ではありませんが、テキスト抽出、パターン マッチング、およびページ数だけではなくコンテンツ マーカーによる分割をサポートするツールを組み合わせることで実現できます。 WukongPDF では、ページ番号のみに依存するのではなく、テキスト パターン、ブックマーク、またはセクション見出しに基づいて分割ポイントを定義できる、コンテンツに応じた分割が提供されます。これがどのように機能するかを理解すると、ページ数の分割によって使用できない出力が生成されたり、手動による介入が唯一の信頼できる解決策であるシナリオを制御できるようになります。

How to Split a PDF Where Content Spans Across Consecutive Pages at the Split Boundary

構造化文書のページ数分割が失敗する理由

文書管理専門家を対象とした 2025 年の調査では、回答者の 34 パーセントが、表、グラフ、契約条項などの主要なコンテンツ要素がソース PDF 内でページ境界を越えて分割されている文書に遭遇したことが判明しました (AIIM、「State of the Document Industry」、2025)。コンテンツがページにまたがる場合、ページ数の分割によってコンテンツがばらばらになり、周囲のコンテキストがなければ意味のない断片が残ります。財務表の半分を含む分割ファイルの受信者は、欠落している列を再構築できません。また、次のページの署名ブロックが欠落している分割契約の受信者は、契約を締結できません。

根本的な課題は、PDF ページ モデルがコンテンツ モデルではないことです。 PDF ページは、テキスト、画像、ベクター グラフィックスが任意の位置に描画されるキャンバスです。コンテンツの論理構造と物理ページ境界の間に必須の関係はありません。段落は 12 ページの下部付近で開始し、13 ページの上部で継続することができます。PDF 形式では、これを 2 つの個別のページ上の 2 つの個別のテキスト オブジェクトとして表現し、それらの間に明示的な接続はありません。それらが互いに属していることを知る唯一の方法は、テキストを読んで意味の流れを理解することですが、これは自動化ツールがコンテンツ分析を通じてのみ近似できるものです。

WukongPDF

PDFを分割してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

コンテンツに応じた PDF 分割への 3 つのアプローチ

最初のアプローチは、実装が最も簡単ですが、ブックマークごとに分割します。 PDF に適切に構造化されたブックマーク ツリーがある場合、各ブックマークは論理セクションの境界をマークします。ブックマーク階層を分割ポイントとして使用して、PDF を分割 することができ、章ごとまたはセクションごとに 1 つの出力ファイルを生成します。ブックマークが存在する場合、この方法は高速で信頼性が高くなりますが、多くの PDF にはブックマークがまったくないか、論理的なコンテンツ境界ではなくページ ラベルから自動生成されたブックマークが含まれています。ブックマークベースの分割は、テキスト分析を必要とせず、適切に構造化されたドキュメントに対して即座に機能するため、最初に試してみるアプローチです。

2 番目のアプローチは、テキストパターンによる分割です。 PDF の全文を抽出し、章見出し、法的条項番号、請求書番号など、セクションの境界を示す繰り返しパターンを検索します。どのページにどのセクションが含まれているかがわかったら、それらのページ番号でカットするように分割ツールに指示できます。制限としては、セクション見出しがセクションの最初のページになく、実際のセクションのコンテンツがその前のページから始まる可能性があることですが、ほとんどのビジネス文書では、見出しとコンテンツの位置が十分に近くなります。

最も正確なアプローチである構造による分割では、PDF のタグ付きコンテンツ構造を読み取るか、各ページのテキスト位置データから読み取り順序を再構築できるツールが必要です。 7 ページのテキスト ブロック A が論理的に 8 ページのテキスト ブロック B に先行し、8 ページのテキスト ブロック C が新しいセクションを開始するとツールが判断できる場合、分割ポイントを 7 ページと 8 ページの間ではなく、ブロック B と C の間に配置できます。このアプローチは、複数のコンテンツを正しく処理しますが、これをサポートしている消費者向けツールはほとんどありません。エンタープライズ ドキュメント処理プラットフォームと特殊な PDF SDK がこの機能を提供する可能性が高くなります。

複数のコンテンツを分割するための実践的なワークフロー

まず、ページごとのテキスト出力を生成するツールを使用して、完全な PDF のテキストを抽出します。抽出されたテキストをスキャンして、論理セクションが変更される箇所を探します。レポートの場合は、最上位の見出しを探してください。契約の場合は、記事番号またはセクション番号を探してください。請求書のバッチの場合は、請求書番号または顧客名を探します。各セクションが始まるページ番号をマークします。スプレッドシートを使用して、各セクションのタイトル、その開始ページ、および前のページ境界にまたがるコンテンツに関するメモを追跡します。

コンテンツが改ページにまたがっているように見える各境界について、N ページの最後のテキストが完全な文であるか、それとも明らかな続きであるかを確認します。ページが句読点のない単語の途中または文の途中で終了する場合、次のページで特定したセクション境界は正しい可能性が高く、たとえテキストがページを横切っていても、分割は改ページで発生するはずです。スパン テキストは前のセクションの一部であり、同じ出力ファイルに属します。この判断の判断は、自動化ツールがよく間違いを犯す箇所であるため、境界ページを手動で確認することに時間をかける価値はあります。

ページが完全な段落で終わり、次のページの途中で新しいセクションが始まる場合は、ページ内で分割できるツールが必要です。一部の専門的なPDF ページの抽出 ツールでは、「ページ 1 ~ 7、および見出しの付録 A までのページ 8 の上半分」など、ページ範囲とコンテンツ マーカーを指定して分割できます。これは最も正確なアプローチですが、ページごとのコンテンツ領域を選択するツールが必要です。ページ内分割が利用できない場合は、ページ境界で分割し、新しいセクションの最初の部分が前のファイルに残ることを受け入れるのが、通常、最も悪くないオプションです。

エッジケースの処理: テーブル、画像、複数列レイアウト

ページにまたがる表では、分割が最も困難になります。あるページの下部近くから始まり次のページの上部まで続く表の行をきれいに分割することはできません。最適な戦略は、分割出力が何に使用されるかによって異なります。分割 PDF の各セクションを個別に読み取る場合は、前後の出力ファイルの両方でスパニング テーブルのヘッダー行を複製し、各ファイルに完全な読み取り可能なテーブルが含まれるようにします。これには分割後に手動で編集する必要がありますが、使用可能な出力が生成されます。

スキャンされた文書の 2 ページ間の余白にまたがる画像も、特殊なケースです。本や雑誌の見開き 2 ページにわたって印刷された地図、図、写真は、ページレベルの分割によって中央で分割されます。これを修正するには、2 つの半分を切り取って 1 つの画像に再組み立てし、再組み立てされた画像を出力ファイルの新しいページに配置する必要があります。これは PDF 作業ではなく画像編集作業であり、通常は別のグラフィック アプリケーションで行われます。

複数列のレイアウトでは、別の問題が発生します。列にわたるテキストの読み取り順序が、抽出順序と一致しない可能性があります。上から下にテキストを 1 行ずつ抽出するツールでは、左列と右列のテキストが交互に配置されるため、テキスト パターン分析だけではセクションの開始位置と終了位置を判断することができません。複数列の PDF の場合は、列を認識したテキスト抽出をサポートするツールが必要です。このツールは、各列を個別のテキスト ストリームとして読み取り、意図した読み取り順序を保持します。この機能は一部の OCR エンジンおよび高度なテキスト抽出ライブラリで利用できますが、デフォルト設定以外の構成が必要です。

分割出力の検証: 送信前に確認すべきこと

分割後、各出力ファイルを開いて 3 つのことを確認します。まず、最初と最後のページに完全で読みやすいコンテンツが含まれていることを確認します。ファイルの終わりの単語の途中で続く文や、ファイルの先頭で本文なしで表示される見出しは、コンテンツを区切る分割ポイントを示しています。次に、セクション内の内部相互参照が引き続き機能することを確認します。 「15 ページの図 3 を参照」を参照してください。図 3 が別の出力ファイルに分割された場合、これは意味がありません。

3 番目に、ファイル マネージャーで正しく並べ替えられる番号付けスキームを使用して、元の順序を保持する方法で出力ファイルに名前が付けられていることを確認します。 「Report_Section_01_ Introduction.pdf」のような命名規則。 " Introduction.pdf" 、 "Methods.pdf" 、 "Results.pdf" は並べ替え可能なリストを生成します。意図した読み取り順序は保持されません。重要なビジネス文書の場合は、分割出力を配布する前に 2 人目の人にその出力を抜き打ちチェックしてもらいます。新鮮な目で見ると、分割を実行した人がドキュメントを長時間見つめた後に見落とす可能性のあるコンテンツの連続性の問題が見つかります。

WukongPDF

PDFを分割してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →