Tips & Tricks

バーコード区切りページを検出して PDF を分割する方法

文書の一括スキャンでは、何百もの個別の文書を含む 1 つの大規模な PDF が生成されます。各文書はバーコード ページのみで区切られています。バーコード (通常は白紙のシートに印刷されたコード 39 またはコード 128 のシンボル) は、ある文書がどこで終了し、次の文書が始まるかを自動化システムに伝える機械読み取り可能な区切り線として機能します。これらのバーコード区切りページを検出して PDF を分割するには、バーコード認識機能を備えたPDF 分割 ツールが必要です。このツールは各ページを読み取り、バーコードが含まれるページを特定し、それらのページを分割ポイントとして使用して文書を構成ファイルに分割します。

How to Split a PDF by Detecting Barcode Separator Pages

ドキュメントスキャンにおけるバーコード区切りページの仕組み

大量の紙文書をスキャンする前に、スタック内の個々の文書の上にバーコード区切りシートが配置されます。スキャナはスタック全体を単一の連続ジョブとしてフィードし、数千ページにもなる 1 つの PDF を作成します。バーコード シートは、元のドキュメントの各ペア間の境界で PDF 全体に分散されます。各バーコードは、文書タイプ コード、ケース番号、従業員 ID、ファイル参照など、その後に続くものを識別する情報をエンコードします。

バーコードは人間にとって視覚的に意味がある必要はありません。これは、さまざまな幅の垂直バーのパターンで印刷された機械読み取り可能なデータ キャリアです。 PDF Batch 処理ツールはバーコード値を読み取り、それを使用して分割ポイントと、オプションで抽出されたドキュメントのファイル名の両方を決定します。値 INV-2026-0047 をエンコードした区切りページ バーコードは、このページで新しいドキュメントを開始し、出力ファイルに INV-2026-0047.pdf という名前を付けるようにスプリッタに指示します。

WukongPDF

PDFを分割してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

バーコードベースの分割用に PDF を準備する

分割を実行する前に、PDF 内のすべての区切りページに、鮮明に印刷された破損していないバーコードが含まれていることを確認してください。バーコードが汚れていたり、ステープルの穴によって部分的に隠れていたり、斜めに印刷されている場合は、正しく認識されず、スプリッターが分割ポイントを見逃したり、誤った値を読み取ったりする可能性があります。 PDF をすばやくスクロールし、区切りページのランダムなサンプルを確認します。バーコードは、きれいな白い紙に濃い黒のインクで印刷し、四辺に少なくとも 4 分の 1 インチの余白を設けてください。

バーコード ページが、前のドキュメントの最後のページではなく、各ドキュメントの最初のページであることを確認します。この規則は、バーコード値が後続の文書を説明することを意味するため、文書スキャンではほぼ普遍的です。 PDF 内のバーコード ページが各ドキュメントの最後のページとして配置された場合、ほとんどのバーコード分割ツールにはこれを調整する設定がありますが、デフォルトではバーコードが各新しいドキュメントの最初のページにあると想定されています。

バーコード認識をサポートするツールの選択

バーコード認識にはページ画像の光学的分析が必要であるため、ページ数またはブックマークごとに分割する標準の PDF スプリッターではバーコードを検出できません。バーコードベースの分離を機能として明示的にリストしているドキュメント キャプチャ ツールまたはエンタープライズ コンテンツ管理ツールを探してください。 Adobe Acrobat Pro には、ドキュメント処理用のアクション ウィザードにバーコード認識が含まれています。バーコード検出を備えたブラウザベースの分割 PDF プラットフォームは、サーバー側で認識を処理し、分割ファイルをダウンロード可能なアーカイブとして返します。

バーコードで区切られた PDF を定期的に処理する組織には、Kofax、Ephesoft、Abbyy FlexiCapture などの専用のドキュメント キャプチャ ソフトウェアが最も信頼性の高いバーコード認識を提供します。これらのツールは、大量の文書の分離用に特別に設計されており、バーコード検証ルール、読み取り不可能なバーコードの例外処理、文書管理システムとの統合などの機能が含まれています。 WukongPDF および同様のプラットフォームは、エンタープライズ ソフトウェアをインストールしなくてもアクセスできるブラウザベースの分割を提供します。

バーコード認識設定を構成する

ほとんどのバーコード分割ツールでは、処理前にバーコード タイプを指定する必要があります。ドキュメント スキャンで最も一般的な 2 つのタイプは、英数字をエンコードし、法的記録や医療記録で広く使用されている Code 39 と、完全な ASCII 文字セットをエンコードし、同じデータに対してよりコンパクトなバーコードを生成する Code 128 です。ツール設定で正しいバーコード タイプを選択します。間違ったタイプを選択すると、すべてのバーコードが認識されなくなり、ツールは分割ポイントが見つからなかったと報告します。

一部のツールでは、バーコードの向きを設定できます。セパレータ ページのバーコードは通常、水平方向に印刷されますが、ページが横向きでスキャナーに送られた場合、またはバーコードがページの端に沿って垂直方向に印刷された場合、認識エンジンはどちらの向きでスキャンするかを認識する必要があります。可能な場合は方向を [自動] に設定します。これにより、エンジンは各ページの 4 つの可能な回転をすべてチェックするように指示されます。

バーコード値を使用した出力ファイルの名前付け

各区切りページのバーコード値は、分割トリガーと出力ファイル名の両方の役割を果たします。セパレーターに続くドキュメントのファイル名としてバーコード値を使用するように分割ツールを構成します。バーコード値 CASE-0042-HARRIS を持つセパレータは、そのセパレータから次のセパレータ ページまでのすべてのページを含む CASE-0042-HARRIS.pdf という名前の出力ファイルを生成します。

バーコード値がファイル名に安全な形式に従っていない場合 (スペース、特殊文字、またはファイル名に不正な文字が含まれている場合など)、値をサニタイズするようにツールを構成します。ほとんどのツールは、スペースを自動的にアンダースコアまたはハイフンに置き換え、Windows または macOS ファイル システムで許可されていない文字を削除します。最初の分割ジョブの後に出力ファイル名をチェックして、サニタイズにより、元の意味が伝わらなくなった文字列ではなく、読みやすく便利な名前が生成されたことを確認します。

読み取り不可能または欠落しているバーコードの処理

完璧なバーコード認識プロセスはありません。汚れたバーコード、斜めに給紙されたページ、スキャン中に誤って省略されたセパレータ シートはすべて分割エラーを引き起こします。ツールの例外処理を構成して、失われた分割ポイントの両側にあるドキュメントをサイレントにマージするのではなく、認識できないページにフラグを立てます。このツールは、バーコードが予期されたが見つからなかったすべてのページを、ページ番号と、可能であればページ画像のサムネイルとともにリストする例外レポートを生成する必要があります。

自動分割が完了したら、例外レポートを確認し、ツールで自動的に分割できなかったドキュメントを手動で分割します。元の PDF を開き、フラグの付いたページ番号に移動し、分割する場所を決定し、PDF ページ抽出ツールを使用してページを手動で抽出します。手動の例外処理手順では、バッチ内のすべてのドキュメントを手動で分割するのに数時間かかるのに比べ、少数の分割が失敗した場合は数分かかります。

今後のスキャン プロジェクトでは、コントラストの高いバーコード印刷を使用し、バーコードをスキャナーの影で隠れる可能性があるページの端から離して配置し、ドキュメント スタックに挿入する前にセパレータ ページでプレススキャン品質チェックを実行することで、バーコードの可読性を向上させます。

元の文書目録に対する分割結果の検証

自動バーコード分割が完了したら、出力ファイルの数を予想されるドキュメント数と比較します。元のスキャン プロジェクトがスキャン中の 247 個のドキュメントを記録した場合、分割によって正確に 247 個の出力ファイルが生成されるはずです。不一致は、2 つのドキュメントが 1 つの出力ファイルにマージされた分割ポイントの欠落、またはページの 1 つ上の何かがバーコードと間違えられたために 1 つのドキュメントが分割された誤った分割ポイントのいずれかを示します。

法的証拠開示や医療記録の移行など、一か八かの分割プロジェクトの場合は、ページ数の調整を実行します。すべての出力ファイルの合計ページ数は、元の PDF のページ数から区切りページを差し引いたものに等しい必要があります。 1 ページでも不一致がある場合は、分割が不完全であり、出力を手動で確認する必要があることを意味します。

区切りページは破棄せずに、別の PDF として保存します。これらのページのバーコード値は、各出力ファイルをスキャンされたバッチ内の元の位置に接続する監査証跡を提供します。数か月後に特定の文書について質問が生じた場合、区切りページのアーカイブでその文書の出所が正確に確認されます。

多機能プリンタからスキャンされたドキュメントの夜間処理など、スケジュールに従って実行される PDF バッチ 分割操作の場合、スキャンから分割、アーカイブまでのワークフロー全体を自動化します。監視フォルダーは新しい PDF を監視します。 PDF が到着すると、バーコード スプリッターが PDF を自動的に処理し、バーコード値に基づいて分類されたフォルダーに分割ファイルを配置します。自動化により、手動の分割タスクが人間の介入を必要としないバックグラウンド プロセスに変わります。

新しいドキュメント スキャン プロジェクトのバーコード タイプを選択するとき、バーコード値に文字と数字の両方が含まれる場合は、コード 39 ではなくコード 128 を選択してください。 Code 128 は、英数字データに対してよりコンパクトなバーコードを生成します。これは、スキャン性を損なうことなく、バーコード シンボルを区切りページに小さく印刷できることを意味します。

長期にわたる PDF Batch プロジェクトの場合は、スキャンしたドキュメントと一緒に保存されるプロジェクト ファイルにバーコード仕様と分割構成を文書化します。数か月または数年後にプロジェクトを再検討すると、ドキュメントは、使用されたバーコード タイプ、バーコード値が何を表すか、分割がどのように構成されたかなどの疑問に答えます。

バーコード品質の問題により、バーコードベースの PDF バッチ 分割を手動分離に置き換える必要がある場合、必要な時間が大幅に増加します。数分で自動的に分割されるバッチを手動で分割するには数時間かかる場合があります。

WukongPDF

PDFを分割してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →