50 ページの PDF を個々のページに分割すると、page-1.pdf から page-50.pdf という名前の 50 個のファイルが生成されます。名前は物理的なページの位置に関しては技術的に正確ですが、内容に関してはまったく役に立ちません。 7 ページには、署名と支払い条件が記載されたスミス契約書が含まれている可能性があります。 23 ページは、品目と合計を含むジョーンズの請求書である可能性があります。 50 個のファイルすべての名前を変更するには、各ファイルを開いてその内容を確認し、わかりやすいファイル名を入力します。これには、最初に PDF を分割するのとほぼ同じ時間がかかり、後でファイルを見つけられなくなる名前付けエラーのリスクが生じます。
実際の分割操作には数秒かかります。その後の名前変更作業は、ファイル数とコンテンツから名前を取得する方法があるかどうかに応じて、数分から数時間かかります。名前付けのステップを自動化することで、PDF の分割が退屈な作業から実際に効率的なワークフローに変わります。
分割 PDF を分割し、各ファイルを意味のあるカスタム名で保存するには、分割前にブックマークなどの文書構造から名前を導き出す命名パターンを設定するか、分割後に各ファイルからテキストを読み取って内容からわかりやすい名前を生成するバッチ名前変更ツールを使用することを意味します。 WukongPDF の PDF ページ 分割ツールは、ブックマーク テキストに基づくカスタム名前付けをサポートしており、以下のメソッドは、構造化された分割前アプローチとコンテンツ抽出後の分割アプローチの両方をカバーしています。

分割前の文書構造からのファイル名の導出
PDF に、各トップレベルのブックマークが説明的なタイトルを持つ論理セクションに対応する、よく整理されたブックマーク階層がある場合、ブックマークベースの分割により、ブックマークのテキストがファイル名として自動的に継承される出力ファイルが生成されます。各トップレベルのブックマークがクライアント名である月次クライアント レポートの PDF は、手動で名前を変更することなく、Smith-Corp.pdf、Jones-LLC.pdf、Acme-Inc.pdf という各クライアントにちなんだ名前のファイルに分割されます。ブックマーク テキストはファイルシステムに対して安全である必要があります。つまり、コロン、スラッシュ、バックスラッシュ、アスタリスク、疑問符など、オペレーティング システムがファイル名で禁止している文字を含めることはできません。
ブックマークは存在するが、そのテキストがファイル名として適していない、長すぎる、無効な文字が含まれている、または一貫性のない書式設定が使用されている場合は、分割する前にブックマークのテキストを編集してください。 Adobe Acrobat で、「ブックマーク」パネルを開き、各ブックマークを右クリックして「名前の変更」を選択し、目的のファイル名を入力します。ブックマークの編集手順は、数十のセクションがあるドキュメントの場合は数分かかりますが、分割操作により追加の介入なしで完全な名前のファイルが生成されると、クリーンなブックマークに費やした時間は即座に回収されます。
PDFを分割してみる
インストールは必要ありません。ブラウザで直接動作します。
汎用名で分割した後のコンテンツベースの名前の抽出
PDF にブックマークが完全に含まれていない、またはブックマーク テキストが意味のあるコンテンツ識別子を取得していないためにブックマーク ベースの名前付けが使用できない場合は、最初に一般的な連続名でドキュメントを分割し、コンテンツから抽出されたテキストに基づいて各出力ファイルの名前を変更します。名前一括変更ツールまたは Python スクリプトは、各分割ファイルの最初のページからテキストの最初の数行を読み取り、ラベル「Client:」の後に表示されるクライアント名や請求書 # に続く請求書番号などの既知のパターンを検索し、一致したテキストを新しいファイル名として使用します。
コンテンツ抽出アプローチは、各分割セクションが一貫した形式を共有し、予測可能な位置にあるテキストを識別する構造化ドキュメントに最適です。各ページの最初の行に「請求書 #」と続き、2 行目に「クライアント:」と続き、名前が続く月次請求書のフォルダーは、両方のフィールドを抽出して Invoice-1234-Acme-Corp.pdf のようなファイル名を作成するスクリプトによって名前をバッチ変更できます。このスクリプトは、バッチ内のすべてのファイルに同じ抽出および名前付けロジックを適用するため、手動で名前を変更する時間とエラー率の両方を排除します。
定期的なジョブの分割と名前のワークフローのスクリプト作成
スケジュールに従って繰り返される分割と名前のジョブ、毎月同じ配布リストの同じ月次レポート構造が同じ名前のセクションに分割されると、サイクルごとに手動プロセスを繰り返すのではなく、永続的なスクリプトを構築することが正当化されます。ページ範囲と対応する出力ファイル名を構成ファイルに一度書き込みます。スクリプトは構成を読み取り、指定された範囲に従って PDF を分割し、各出力ファイルに指定された名前を付けます。毎月、構成内の入力 PDF ファイル名のみを更新します。スクリプトは、サイクルごとに他のすべてを同様に処理します。
スクリプトと構成ファイルの両方をバージョン管理します。レポート構造が変更され、セクションが追加、削除、または再編成された場合は、それに合わせて構成を更新します。スクリプトのロジックは一定のままです。スクリプトに取り込まれた処理ロジックと、構成に取り込まれたドキュメント固有のデータがこのように分離されることで、ワークフローが長期間にわたって保守可能になります。月次分割を実行する人は、スクリプトを理解したり変更したりする必要はありません。簡単な構成ファイルを編集し、スクリプトを実行します。
| 命名方法 | 前提条件 | コンテンツ認識? | 最適な用途 |
|---|---|---|---|
| ブックマークベースの分割 | きれいなテキストを備えた適切に構造化されたブックマーク | はい、文書構造から派生した名前です | 見出し階層を持つドキュメント |
| コンテンツ抽出スクリプト | 各セクションの一貫したテキスト パターン | はい、文書の内容から派生した名前です | 構造化されたフォーム、請求書、レポート |
| スクリプト化された分割と名前 | 範囲と名前を含む構成ファイル | はい、完全にカスタマイズ可能です | 同一構造のジョブを繰り返し実行する |
ファイル名の競合と無効な文字の処理
同じ抽出名を生成する 2 つの分割ページまたはセクション、識別番号のない同じクライアントからの 2 つの請求書により、ファイル名の競合が発生し、その名前のファイルが既に存在するために 2 番目のファイルを保存できません。 2 つの文書を区別するためのサフィックス、シーケンス番号、日付、またはその他のフィールドを追加して競合を解決します。 Invoice-1234-Acme-Corp.pdf と Invoice-1235-Acme-Corp.pdf は請求書番号によって区別されます。識別フィールドが使用できない場合は、シーケンス カウンター (Acme-Corp-1.pdf および Acme-Corp-2.pdf) を追加します。
ファイル名として使用される抽出テキストからは、オペレーティング システムで禁止されている文字を削除する必要があります。コロン、スラッシュ、バックスラッシュ、アスタリスク、疑問符、山括弧、およびパイプ文字を削除するか、ハイフンまたはアンダースコアに置き換えます。先頭と末尾のスペースとピリオドをトリミングします。掃除のステップは日常的ではありますが、不可欠です。不正な文字が含まれているファイル名がクリーンアップされていないと、名前変更操作がオペレーティング システム エラーで失敗します。50 個のファイルのうちどのファイルが失敗の原因となったかを診断するのは、すべてのファイル名を事前にクリーンアップするよりもはるかに時間がかかります。
PDFを分割してみる
インストールは必要ありません。ブラウザで直接動作します。
