您將一疊五十張發票放在帶有自動送稿機的文件掃描器上。掃描器產生一個 PDF,其中依序包含所有 50 頁。現在,您需要將每張發票作為單獨的 PDF 文件,並按發票編號命名。手動將 50 頁的 PDF 拆分為 50 個單獨的文件,打開每個文件,並使用正確的名稱保存,需要一個小時的繁瑣工作。批次分割工具可以自動偵測文件邊界並命名輸出文件,並在幾秒鐘內完成相同的工作。
掃描批次的分割 PDF 挑戰是掃描器看到的是單獨的頁面,而不是單獨的文件。對於掃描器來說,一張十頁發票看起來就像十張單獨的單頁發票。拆分工具必須分析頁面內容以確定一個文件的結束位置和下一個文件的開始位置。此分析使用頁面內容模式、空白分隔頁、條碼或一致的頁數來識別文件邊界。

批次掃描器如何產生多文件 PDF
自動送稿機依序處理頁面。每個頁面都會通過掃描器並附加到單一輸出 PDF 中。掃描器不知道也不關心第一頁到第三頁是發票 A,第四頁到第五頁是發票 B,第六頁到第八頁是發票 C。它只在單一文件中產生第一頁到第八頁。
某些掃描器支援分隔頁,即在文件之間插入空白頁,以指示掃描器開始建立新的 PDF。但大多數掃描工作流程都會跳過分隔頁,因為它們會減慢掃描過程。結果是一個包含多個串聯在一起的文檔的PDF Batch文件。
這種方法將數小時的手動工作變成了數秒鐘的自動化處理。
雙面掃描會使問題變得更加複雜。十頁文件掃描雙面列印會產生二十個 PDF 頁,每個實體頁變成兩個 PDF 頁。拆分工具必須了解第一頁和第二頁屬於同一文檔,即使它們顯示為單獨的 PDF 頁面。
嘗試拆分 PDF
無需安裝。直接在您的瀏覽器中工作。
檢測掃描批次中的文件邊界的方法
頁數一致性是最簡單的偵測方法。如果批次中的每個文件都具有相同的頁數,則分割工具會將總頁數除以文件頁數,並在這些邊界處進行分割。來自同一供應商的發票通常具有一致的頁數。該方法不需要內容分析。
空白頁偵測可識別有意插入文件之間的分隔頁。掃描批次中的空白頁表示文件邊界。拆分工具會刪除空白分隔頁,並在空白頁位置將剩餘頁面拆分為單獨的文件。
內容模式檢測是最複雜的方法。拆分工具會尋找指示新文件開始的重複模式。發票通常以供應商徽標、地址和發票號碼開頭。表單以標題和日期欄位開始。報告以封面頁開始。此工具可識別這些模式並將每次出現的情況標記為文件邊界。
條碼偵測可辨識有列印條碼的分隔頁。每個文件第一頁頂部的條碼對文件 ID 進行編碼。拆分工具讀取條碼,使用編碼值命名輸出文件,並在每個條碼出現時進行拆分。這種方法在醫療保健、法律和財務文件處理中很流行。
使用具有文件檢測功能的拆分工具
WukongPDF 透過瀏覽器提供掃描的 PDF 處理,包括將多文件掃描批次分割為單一文件的功能。拆分工具可以使用內容模式或指定的頁數來偵測文件邊界。
分割之前,預覽批次以驗證頁面順序和方向。顛倒或無序掃描的頁面將產生順序不正確的輸出檔。大多數拆分工具都包含頁面預覽和重新排序功能,用於在拆分之前修正掃描錯誤。
根據偵測到的內容配置輸出檔命名。如果分割工具可以從每個文件的第一頁讀取發票編號或文件 ID,請使用該值作為輸出檔名。如果基於內容的命名不可用,請使用帶有描述性前綴的順序編號。
驗證分割精度
分割後,驗證前幾個和後幾個輸出檔。打開第一個輸出檔並確認它包含正確的頁面。打開最後一個輸出檔並確認它包含該批次的最後幾頁。從批次中間抽查文件。這些檢查在分發文件之前捕獲邊界檢測錯誤。
將所有輸出檔案的總頁數與原始批次頁數進行比較。如果總和匹配,則每個頁面都被指派給一個輸出檔。如果總和較低,則在拆分過程中頁面會遺失。如果總和較高,則頁面被重複。
對於文檔邊界不明確的批次,使用需要更強邊界證據的保守設定運行分割。保守的拆分可能會將某些文件合併在一起,而不是將單一文件錯誤地拆分為多個文件。合併後的文件可以手動拆分,其風險比單一文件的碎片要低。
自動化拆分和命名工作流程
對於重複的批次掃描和分割,自動化工作流程。將分割設定、邊界偵測方法和輸出命名約定儲存為設定檔。每個後續批次均使用相同的設定檔進行處理,從而產生一致的輸出。第二批後恢復初始設定時間。
透過配置輸出命名以符合系統預期格式,將分割輸出與文件管理系統整合。拆分期間提取的與文件管理系統命名約定相符的文件 ID 允許自動攝取,無需手動重新命名。
掃描批次中的文件分離是大量處理紙本文件的行業的常見需求:醫療保健處理患者記錄、法律流程案例文件、會計流程發票和政府流程應用程式。每個產業都有自己的文件類型、頁數和邊界模式。
條碼分隔紙是大量掃描操作最可靠的方法。從文件管理系統列印條碼表,在掃描前將其放在每個文件的頂部,分割工具讀取條碼以識別文件邊界並命名輸出檔案。條碼消除了文件開始和結束位置的歧義。
光學標記識別可以識別每個文件首頁上指示文件類型或優先順序的複選框或實心圓圈。拆分工具讀取這些標記,並根據識別的類型將文件路由到不同的輸出資料夾。
應測量和監控自動文件分離的準確性。一批 500 個文檔,分離精度為 99%,但仍會產生 5 個錯誤分割的文檔,需要手動修正。追蹤一段時間內的錯誤率,以確定產生較高錯誤率的文件類型或掃描條件。
對於文件邊界不一致的批次,掃描和分割之間的人工審核步驟可以擷取自動偵測遺漏的邊界錯誤。審閱者在頁面檢視器中掃描批次,確認或調整偵測到的邊界,然後觸發自動分割。
分割後的輸出檔案格式可以包括用於存檔的 PDF/A、用於分發的壓縮 PDF 或用於進一步影像處理的 TIFF。根據下游使用的分離文檔配置輸出格式。
將分割工作流程與文件管理系統集成,建立從紙張到可搜尋存檔的無縫管道。掃描器產生批次 PDF,拆分器將其分成單獨的文檔,OCR 使它們可搜索,文檔管理系統對它們進行索引以供檢索。
基於雲端的分割服務提供與桌面工具相同的功能,並具有可從任何裝置存取的優勢。掃描的批次 PDF 將被上傳、處理,並且各個文件將作為單獨的文件返回。使用雲端服務處理敏感文件時,需要考慮資料隱私問題。
分割輸出檔案的命名約定應該一致且可排序。像 YYYY-MM-DD_DocumentType_SequentialNumber 這樣的格式會產生按時間順序排序並按文檔類型分組的檔案名稱。一致的命名可以實現下游系統的自動化處理。
當拆分包含混合文件類型的批次時,拆分工具可以根據內容識別將不同的文件類型路由到不同的輸出資料夾。發票轉到會計資料夾,合約轉到法律資料夾,信件轉到記錄資料夾。
如果對分割文件執行 OCR,則掃描頁面的解析度會影響 OCR 準確性。以至少 300 DPI 掃描拆分後將進行 OCR 處理的文件。
一些拆分工具可以在拆分輸出旁邊產生清單檔案。清單列出了每個輸出檔案名稱、來源頁面範圍以及拆分期間提取的任何元資料。清單支援品質保證和文件追蹤。
與手動拆分相比,自動批量拆分節省的時間與批量大小成正比。手動拆分一批 50 個文件需要大約 50 分鐘的重複工作。同一批的自動拆分需要大約 30 秒的配置和處理時間。
掃描解析度會影響分割精度和輸出文件品質。更高解析度的掃描可產生更清晰的文本,從而改善基於內容的邊界檢測。代價是處理過程中檔案大小較大。出於分割目的,200 DPI 通常足以進行精確的邊界檢測。
| 檢測方法 | 工作原理 | 最適合 | 準確度 |
|---|---|---|---|
| 頁數一致性 | 將總頁數除以已知文件長度 | 同一來源的統一文件 | 已知頁數較高 |
| 空白頁偵測 | 識別空分隔頁 | 帶分隔符號的掃描批次 | 如果空白頁確實是空的則高 |
| 內容模式 | 識別重複出現的標題模式 | 發票、表格、報告 | 中高;取決於模式一致性 |
| 條碼識別 | 讀取每個文件首頁上的條碼 | 醫療保健、法律、財務文件 | 非常高;條碼明確 |
嘗試拆分 PDF
無需安裝。直接在您的瀏覽器中工作。
