自動ドキュメント フィーダーを備えたドキュメント スキャナーに 50 枚の請求書の束を置きます。スキャナは、50 ページすべてを順番に含む 1 つの PDF を生成します。ここで、各請求書を請求書番号で名前を付けた個別の PDF ファイルとして必要になります。 50 ページの PDF を手動で 50 個の個別のファイルに分割し、それぞれを開いて正しい名前で保存するには、1 時間かかる退屈な作業が必要です。ドキュメントの境界を検出して出力ファイルに名前を付けるバッチ分割ツールは、同じ作業を数秒で自動的に実行します。
スキャンされたバッチに関する分割 PDF の課題は、スキャナが個々の文書ではなく個々のページを認識することです。 10 ページの請求書は、スキャナーにとっては 10 枚の 1 ページの請求書とまったく同じように見えます。分割ツールはページのコンテンツを分析して、1 つのドキュメントがどこで終わり、次のドキュメントが始まるかを判断する必要があります。この分析では、ページ コンテンツ パターン、空白区切りページ、バーコード、または一貫したページ数を使用して、ドキュメントの境界を特定します。

バッチ スキャナが複数ドキュメントの PDF を生成する方法
自動ドキュメント フィーダーはページを順番に処理します。各ページはスキャナーを通過し、単一の出力 PDF に追加されます。スキャナは、1 ページから 3 ページが請求書 A、4 ページから 5 ページが請求書 B、6 ページから 8 ページが請求書 C であることを認識せず、気にも留めません。スキャナは、1 ページから 8 ページを 1 つのファイルに作成するだけです。
一部のスキャナは、セパレータ シート (ドキュメント間に挿入される空白ページ) をサポートしており、スキャナに新しい PDF を開始するよう信号を送ります。ただし、ほとんどのスキャン ワークフローでは、スキャン プロセスが遅くなるため、セパレータ シートをスキップします。結果として、複数のドキュメントが連結された単一の PDF Batch ファイルが生成されます。
この方法により、何時間もの手作業が数秒間の自動処理に変わります。
問題は両面スキャンによってさらに悪化します。 10 ページの文書を両面スキャンすると、20 ページの PDF が生成され、各物理ページは 2 つの PDF ページになります。分割ツールは、ページ 1 と 2 が別個の PDF ページとして表示される場合でも、同じドキュメントに属していることを認識する必要があります。
PDFを分割してみる
インストールは必要ありません。ブラウザで直接動作します。
スキャンされたバッチ内のドキュメントの境界を検出する方法
ページ数の一貫性は、最も簡単な検出方法です。バッチ内のすべてのドキュメントのページ数が同じ場合、分割ツールは合計ページ数をドキュメントのページ数で除算し、それらの境界で分割します。同じベンダーからの請求書のページ数は一貫していることがよくあります。この方法ではコンテンツ分析は必要ありません。
白紙ページの検出は、ドキュメント間に意図的に挿入された区切りページを識別します。スキャンされたバッチ内の空白ページは、文書の境界を示します。分割ツールは空白の区切りページを削除し、残りのページを空白ページの位置で個々のドキュメントに分割します。
コンテンツ パターンの検出は、最も洗練された方法です。分割ツールは、新しいドキュメントの開始を示す繰り返しパターンを探します。通常、請求書はベンダーのロゴ、住所、請求書番号で始まります。フォームはタイトルと日付フィールドで始まります。レポートは表紙から始まります。このツールはこれらのパターンを識別し、各パターンを文書境界としてマークします。
バーコード検出は、バーコードが印刷された区切りページを識別します。各ドキュメントの最初のページの上部にあるバーコードはドキュメント ID をエンコードします。分割ツールはバーコードを読み取り、エンコードされた値で出力ファイルに名前を付け、バーコードが出現するたびに分割します。この方法は、医療、法律、財務文書の処理でよく使用されます。
ドキュメント検出機能を備えた分割ツールの使用
WukongPDF は、ブラウザを介した スキャンされた PDF の処理を提供します。これには、スキャンされた複数のドキュメントのバッチを個別のファイルに分割する機能も含まれます。分割ツールは、コンテンツ パターンまたは指定されたページ数を使用してドキュメントの境界を検出できます。
分割する前にバッチをプレビューして、ページの順序と方向を確認します。ページを上下逆にスキャンしたり順序を間違えると、間違った順序の出力ファイルが生成されます。ほとんどの分割ツールには、分割前にスキャン エラーを修正するためのページ プレビューと並べ替え機能が含まれています。
検出されたコンテンツに基づいて出力ファイルの名前を設定します。分割ツールが各文書の最初のページから請求書番号または文書 ID を読み取ることができる場合は、その値を出力ファイル名として使用します。コンテンツベースの名前付けが使用できない場合は、説明的な接頭辞を付けた連番を使用します。
分割精度の検証
分割後、最初のいくつかと最後のいくつかの出力ファイルを確認します。最初の出力ファイルを開いて、正しいページが含まれていることを確認します。最後の出力ファイルを開き、バッチの最後のページが含まれていることを確認します。バッチの途中からファイルをスポットチェックします。これらのチェックは、ファイルが配布される前に境界検出エラーを検出します。
すべての出力ファイルの合計ページ数を元のバッチ ページ数と比較します。合計が一致する場合、すべてのページが出力ファイルに割り当てられています。合計が小さい場合は、分割中にページが失われています。合計が大きい場合は、ページが重複しています。
ドキュメントの境界があいまいなバッチでは、より強力な境界の証拠を必要とする保守的な設定で分割が実行されます。保守的に分割すると、単一のドキュメントが複数のファイルに誤って分割されるのではなく、一部のドキュメントが結合されたままになる可能性があります。結合されたドキュメントは、単一ドキュメントの断片よりも低いリスクで手動で分割できます。
分割して名前を付けるワークフローの自動化
繰り返しのバッチ スキャンと分割の場合は、ワークフローを自動化します。分割設定、境界検出方法、出力命名規則をプロファイルとして保存します。後続の各バッチは同じプロファイルで処理され、一貫した出力が生成されます。 2 回目のバッチ後には、初期セットアップ時間は回復します。
システムが予期する形式と一致するように出力の名前を構成することにより、分割出力をドキュメント管理システムと統合します。分割中に抽出されたドキュメント ID がドキュメント管理システムの命名規則と一致する場合、手動で名前を変更しなくても自動で取り込むことができます。
スキャンしたバッチでの文書の分離は、医療プロセスの患者記録、法的プロセスの事件ファイル、会計プロセスの請求書、政府のプロセス アプリケーションなど、紙のドキュメントを大量に処理する業界で一般的なニーズです。各業界には、独自の文書タイプ、ページ数、および境界パターンがあります。
バーコード セパレータ シートは、大量のスキャン操作にとって最も信頼性の高い方法です。文書管理システムからバーコード シートを印刷し、スキャンする前に各文書の上に置きます。分割ツールがバーコードを読み取って文書の境界を特定し、出力ファイルに名前を付けます。バーコードを使用すると、文書の開始位置と終了位置に関する曖昧さがなくなります。
光学式マーク認識では、各文書の最初のページにある、文書の種類や優先度を示すチェックボックスや黒丸を識別できます。分割ツールはこれらのマークを読み取り、認識されたタイプに基づいてドキュメントを別の出力フォルダーにルーティングします。
自動文書分離の精度を測定し、監視する必要があります。 99% の分離精度を備えた 500 枚のドキュメントのバッチでも、手作業による修正が必要な 5 つの誤って分割されたドキュメントが生成されます。時間の経過に伴うエラー率を追跡して、より高いエラー率を引き起こすドキュメントの種類またはスキャン条件を特定します。
ドキュメントの境界が一貫していないバッチの場合、スキャンと分割の間の人によるレビュー手順により、自動検出では見逃していた境界エラーが検出されます。レビュー担当者はページ ビューアでバッチをスキャンし、検出された境界を確認または調整して、自動分割をトリガーします。
分割後の出力ファイル形式には、アーカイブ用の PDF/A、配布用の圧縮 PDF、またはさらなる画像処理用の TIFF が含まれます。分割されたドキュメントのダウンストリームでの使用に基づいて出力形式を構成します。
分割ワークフローを文書管理システムと統合すると、紙から検索可能なアーカイブまでのシームレスなパイプラインが作成されます。スキャナーはバッチ PDF を生成し、スプリッターはそれを個々のドキュメントに分割し、OCR によって検索可能にし、ドキュメント管理システムによって検索用にインデックスを作成します。
クラウドベースの分割サービスは、デスクトップ ツールと同じ機能を提供し、どのデバイスからでもアクセスできるという利点があります。スキャンされたバッチ PDF がアップロードおよび処理され、個々のドキュメントが個別のファイルとして返されます。機密文書にクラウド サービスを使用する場合は、データ プライバシーに関する考慮事項が適用されます。
分割出力ファイルの命名規則は一貫性があり、並べ替え可能である必要があります。 YYYY-MM-DD_DocumentType_SequentialNumber のような形式では、時系列に並べ替えられ、ドキュメントの種類ごとにグループ化されたファイル名が生成されます。一貫した名前付けにより、下流システムによる自動処理が可能になります。
混合ドキュメント タイプを含むバッチを分割する場合、分割ツールはコンテンツ認識に基づいて、異なるドキュメント タイプを異なる出力フォルダーにルーティングできます。請求書は「Accounting」フォルダーに、契約書は「Legal」フォルダーに、通信は「Records」フォルダーに移動します。
分割されたドキュメントに対して OCR を実行する場合、スキャンされたページの解像度は OCR の精度に影響します。分割後に OCR 処理されるドキュメントの場合は、最低 300 DPI でスキャンします。
一部の分割ツールは、分割出力と一緒にマニフェスト ファイルを生成できます。マニフェストには、各出力ファイル名、ソース ページ範囲、分割中に抽出されたメタデータがリストされます。マニフェストは品質保証とドキュメント追跡をサポートします。
手動分割と比較した自動バッチ分割による時間の節約は、バッチ サイズに比例します。 50 個のドキュメントを手動で分割するバッチには、約 50 分の繰り返し作業が必要です。同じバッチの自動分割には、構成と処理時間に約 30 秒かかります。
スキャン解像度は、分割精度と出力ドキュメントの品質の両方に影響します。スキャンの解像度が高くなると、より鮮明なテキストが生成され、コンテンツベースの境界検出が向上します。その代償として、処理中のファイル サイズが大きくなります。分割目的の場合、正確な境界検出には通常 200 DPI で十分です。
| 検出方法 | 仕組み | 最適な用途 | 精度 |
|---|---|---|---|
| ページ数の一貫性 | 総ページ数を既知のドキュメントの長さで割ります | 同じソースからの統一ドキュメント | 既知のページ数では多い |
| 白紙ページの検出 | 空の区切りページを特定する | セパレータ付きでスキャンされたバッチ | 空白ページが本当に空の場合は高 |
| コンテンツパターン | 繰り返し現れるヘッダーパターンを認識する | 請求書、フォーム、レポート | 中~高;パターンの一貫性に依存する |
| バーコード認識 | 各ドキュメントの最初のページにあるバーコードを読み取ります | ヘルスケア、法律、財務関連の文書 | 非常に高い。バーコードは明確です |
PDFを分割してみる
インストールは必要ありません。ブラウザで直接動作します。
