Tips & Tricks

各ドキュメントが認識可能な表紙またはタイトル シートで始まる PDF を分割する方法

各ファイルが空白のページまたは番号付きの章見出しで始まる場合、大きな PDF を個々のドキュメントに分割するのは簡単です。 PDF 内のドキュメントが視覚的な手がかりによってのみ分離されている場合、課題は完全に変わります。たとえば、会社のロゴが入った表紙、大きなフォントのタイトル シート、人間ならすぐに見つけられるが、自動化ツールでは検出するのが難しい特徴的なヘッダー ブロックなどです。この記事では、少数のドキュメントに適した手動の手法から、数百ページに及ぶ半自動の手法まで、表紙とタイトル シートを認識して PDF を分割する実践的な方法について説明します。

How to Split a PDF Where Each Document Starts With a Recognizable Cover Page or Title Sheet

標準のページ数分割がドキュメント バッチで失敗する理由

答えは、文書がどのように変化するかにあります。

ほとんどの PDF 分割ツールは、N ページごと、または入力した特定のページ番号でファイルを分割するという単純な原理で動作します。これは、バッチ内のすべてのドキュメントのページ数が同じ場合に機能します。単一ページの請求書の束がページ境界ごとにきれいに分割されます。 3 ページの契約書のコレクションが 3 ページごとに均等に分割されます。しかし、実際のレポート、申請書、通信のほとんどすべてのバッチに当てはまるように、文書の長さが異なる場合、ページ数の分割により文書が半分にカットされるか、ある文書の末尾が次の文書の先頭と結合されます。

表紙とタイトル シートは、結合された PDF 内のドキュメント間の自然な境界ですが、これらは視覚的な境界であり、構造的な境界ではありません。 PDF は、これらを他のページと同じ種類のページ オブジェクトとして保存します。このページが表紙である、またはこの段落がタイトルであるというメタデータ フラグはありません。分割ソフトウェアには、何を探すべきかを指示する必要があり、その指示はソフトウェアが表紙を、大きな見出しやロゴが含まれる通常のコンテンツ ページと区別できるように十分に具体的である必要があります。

分割を間違えると、不便以上の結果が生じます。複数ページの文書を半分に分割すると、2 つの不完全なファイルが生成されますが、どちらも単独では意味がありません。 2 つの文書を結合する分割では、予想されるコンテンツが終了した直後に、読者に他の人の情報が表示されるファイルが生成されます。法律文書、医療文書、財務文書の場合、2 番目のシナリオは機密保持の侵害です。適切に分割することは、ユーザビリティとコンプライアンスの両方にとって重要です。

WukongPDF

PDFを分割してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

手動による方法: 表紙を目で確認する

ドキュメントが約 20 個までのバッチの場合、多くの場合、自動ソリューションを構成するよりも手動で分割した方が高速です。結合された PDF を開き、サイドバーのページのサムネイルをスクロールします。表紙とタイトル シートは、通常、それに続くコンテンツ ページよりも多くの空白スペース、大きなテキスト、ロゴ、または異なるレイアウト密度があるため、視覚的に目立ちます。各ドキュメントの最初のページをクリックし、Shift キーを押しながら最後のページをクリックして、選択範囲を新しいファイルとして抽出します。

WukongPDF の Split PDF ツールは、手動分割を効率的に行う視覚的なページ セレクターを提供します。すべてのページがサムネイルとして表示され、クリックして各表紙の分割ポイントをマークすると、ツールは各セグメントを個別の適切な名前の PDF として抽出します。さまざまな長さの 15 個の文書を含む 100 ページのファイルの場合、プロセス全体にかかる時間は 2 分未満です。ビジュアル インターフェイスにより、ページ番号の推測が不要になり、抽出を開始する前に各分割ポイントを確認できます。

手動分割に役立つ習慣: 各文書のページ範囲を特定するときに、表紙のタイトルまたは参照番号をメモします。それを出力ファイル名として使用します。 split-1.pdf、split-2.pdf という名前のファイルが詰まったフォルダーは、元のマージされたファイルよりもわずかに役立つだけです。 Smith-Application.pdf、Jones-Contract.pdf という名前のファイルはすぐに使用できます。

半自動分割: テキストパターン検出

自動化は手動では不可能な範囲で拡張できます。

バッチが大きすぎて手動で分割できない場合、次のステップはテキストベースの検出です。バッチ分割機能を備えたほとんどの PDF ツールは、特定のテキスト文字列を検索し、そのテキストが表示されるたびにファイルを分割できます。すべての表紙に「申請フォーム」、「社外秘」、「ページ 1 」、または予測可能な形式の口座番号などの一貫したフレーズが含まれている場合、そのフレーズが分割トリガーになります。このツールは各ページのテキスト レイヤーをスキャンし、ターゲット文字列が見つかると、そのページの前に分割ポイントを挿入します。

テキストベースの分割の信頼性は 2 つの要素によって決まります。まず、トリガー テキストはすべての表紙に表示する必要があり、コンテンツ ページには決して表示しないでください。 「ページ 1」のようなフレーズは、文書の 6 ページに「詳細については 1 ページを参照してください」というテキストが含まれるまでは、良いトリガーのように見えます。次に、PDF にはテキスト レイヤーが必要です。 OCR なしでスキャンされた PDF は、表紙のテキストが検索可能な文字ではなくピクセルとしてのみ存在するため、テキストベースの分割を完全に無効にします。分割する前にマージされたファイルに対して OCR を実行すると、ステップが追加されますが自動化は維持され、この問題は解決されます。

構造検出: フォント サイズとページ密度の使用

より高度なアプローチでは、特定のテキストを検索するのではなく、各ページの視覚構造を分析します。表紙とタイトル シートは、コンテンツ ページとは明らかに異なる特性を持つ傾向があります。タイトルの周りに空白があるため、文字の密度が低くなります。見出しがあるため、平均フォント サイズは大きくなります。ページにはロゴなどの画像が含まれる場合がありますが、コンテンツ ページはテキストのみです。これらの特性を測定できるソフトウェアは、表紙にどのような単語が含まれているかを知る必要がなく、表紙に該当する可能性のある表紙にフラグを付けることができます。

この方法では、表紙の文言は異なるものの、レイアウトは一貫している場合に対処します。各表紙に「[クライアント名] を準備しました」と記載されている一連のクライアント レポートには、表紙ごとに異なるテキストが含まれています。検索する共通の文字列がないため、テキストベースの分割は失敗します。すべてのカバーが同じフォント サイズと同じロゴ配置を持つ同じテンプレートを使用しているため、構造ベースの分割は成功します。一貫性は単語ではなくデザインにあり、構造検出はテキスト検索で見逃した部分を捕捉します。

最良の結果を得るために分割する前にファイルを準備する

分割前のいくつかの準備ステップにより、どの方法でも成功率が大幅に向上します。まず、結合された PDF がスキャナーから取得されたものである場合は、OCR を実行して検索可能なテキスト レイヤーを作成します。手動で分割する予定がある場合でも、検索可能なテキストを使用すると、サムネイルをスクロールするのではなく、名前や参照番号を検索して特定のページにジャンプできます。次に、結合されたファイルに、個別のドキュメントに分割すべきではないページが含まれているかどうかを確認します。 FAX のカバー シート、回覧用紙、文書間の空白の区切りページは、それぞれを 1 ページの出力ファイルにするのではなく、分割する前に削除する必要があります。

3 番目に、低ズームで文書をスキャンして、すべての表紙が同じ方向を使用していることを確認します。縦長のドキュメントのバッチ内に 1 つの横長の表紙があると、特にページの寸法に基づいた構造検出を使用する場合、分割ツールの位置がずれる可能性があります。分割する前にページの向きを正規化します。これらの手順により、プロセスの開始までに数分かかりますが、分割が完了し、元のマージされたファイルが削除された後に、ミスカットされたドキュメントを発見してイライラすることはなくなります。 PDF ページ の準備作業は、手動クリーンアップを必要としない、クリーンで正確な出力ファイルとして成果をもたらします。

分割中に出力ファイルに系統的に名前を付ける

結合された PDF を分割する価値は、ページを分割するだけでなく、すぐに識別できる出力ファイルを作成することによってもたらされます。分割中に適用されるよく計画された命名規則により、受信者は各ファイルを開いてその内容を確認する必要がなくなります。表紙に請求書番号、顧客名、文書参照コードなどの一貫した要素が含まれている場合は、分割プロセス中にそのデータを抽出し、それをファイル名として使用します。テキストベースの検出をサポートするほとんどの分割ツールは、検出されたテキストを出力ファイル名として使用することもサポートしており、汎用分割ファイルのバッチを適切にラベル付けされたドキュメント セットに変換します。

表紙が共通のテキスト パターンを共有していないバッチの場合は、分割を開始する前に命名規則を確立します。すべての出力ファイルに一貫して適用される ClientName-DocumentType-Date.pdf のような形式により、以前は不透明な結合ファイルであったものから、並べ替え可能で検索可能なドキュメント ライブラリが作成されます。名前付けの手順にはファイルごとに数秒かかり、永続的な組織的価値が追加されます。適切な名前が付けられた個々の PDF のフォルダーは、文書アーカイブとして使用できます。連続番号が付けられた分割ファイルのフォルダーは、後で誰かが解決する必要があるパズルです。 PDF バッチ 分割プロセスは、すべての出力ファイルの名前が正しく指定され、整理されている場合にのみ完了します。

表紙検出による PDF の分割の学習に費やした時間は、最初の使用例を超えて、多くの種類のドキュメントで効果を発揮します。法的文書の束、請求書のバッチ、学生の記録コレクション、医療記録の編集、および契約セットはすべて、識別可能な最初のページで区切られた混合文書の同じパターンに従います。ある文書タイプに対して信頼性の高い分割ワークフローを確立したら、それを別の文書タイプに適応させるには、新しい表紙の固有の特性を識別するだけで済みます。このスキルは、ある文書タイプから別の文書タイプに迅速に移行し、新しいバッチが正常に処理されるたびに効率が向上します。

WukongPDF

PDFを分割してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →