Tips & Tricks

如何透過偵測條碼分隔頁來分割 PDF

大量文件掃描會產生一個包含數百個單獨文件的大型 PDF,每個文件與下一個文件之間僅透過條碼頁面分隔開。條碼(通常是印在空白紙上的 Code 39 或 Code 128 符號)充當機器可讀的分隔符,告訴自動化系統一個文件的結束位置和下一個文件的起始位置。透過偵測這些條碼分隔頁來分割 PDF 需要具有條碼識別功能的Split PDF工具,該工具可讀取每個頁面,識別哪些頁麵包含條碼,並使用這些頁面作為分割點將文件分隔為其組成檔案。

How to Split a PDF by Detecting Barcode Separator Pages

條碼分隔頁在文件掃描中的工作原理

在掃描大量紙本文件之前,會將條碼分隔頁放置在堆疊中每個單獨文件的頂部。掃描器將整個堆疊作為連續作業送入,產生一個可能長達數千頁的 PDF。條碼表分佈在整個 PDF 中每對原始文件之間的邊界處。每個條碼都編碼可識別其後內容的資訊:文件類型代碼、案件編號、員工 ID 或文件參考。

條碼不需要對人類具有視覺意義。它是一種機器可讀的資料載體,以不同寬度的垂直條圖案印刷。 PDF Batch處理工具讀取條碼值並使用它來確定分割點以及(可選)提取文件的檔案名稱。編碼值 INV-2026-0047 的分隔頁條碼告訴分割器在此頁面開始一個新文件並將輸出檔案命名為 INV-2026-0047.pdf。

WukongPDF

嘗試拆分 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

準備 PDF 以進行基於條碼的分割

在執行分割之前,請先驗證 PDF 中的每個分隔頁都包含列印清晰、未損壞的條碼。弄髒、被訂書釘孔部分遮擋或以一定角度列印的條碼可能無法正確識別,導致分割器錯過分割點或讀取錯誤的值。快速捲動 PDF 並檢查分隔頁的隨機樣本。條碼應使用深黑色墨水列印在乾淨的白紙上,四面至少留有四分之一英吋的空白。

確認條碼頁面是每個文件的第一頁,而不是前一個文件的最後一頁。這種約定在文件掃描中幾乎是通用的,因為它意味著條碼值描述了後面的文件。如果 PDF 中的條碼頁面被放置為每個文件的最後一頁,則大多數條碼分割工具都有一個設定可以對此進行調整,但預設假設是條碼位於每個新文件的第一頁上。

選擇支援條碼識別的工具

按頁數或書籤劃分的標準 PDF 分割器無法偵測條碼,因為條碼辨識需要對頁面影像進行光學分析。尋找明確將基於條碼的分離列為一項功能的文件擷取或企業內容管理工具。 Adobe Acrobat Pro 在其用於文件處理的操作精靈中包含條碼識別。具有條碼檢測功能的基於瀏覽器的Split PDF平台處理識別伺服器端並將分割檔案作為可下載的檔案傳回。

對於定期處理條碼分隔 PDF 的組織來說,Kofax、Ephesoft 或 Abbyy FlexiCapture 等專用文件擷取軟體可提供最可靠的條碼識別。這些工具專為大容量文件分離而設計,包括條碼驗證規則、不可讀條碼的異常處理以及與文件管理系統整合等功能。 WukongPDF 和類似平台提供基於瀏覽器的拆分,無需安裝企業軟體即可存取。

配置條碼識別設定

大多數條碼分割工具要求您在處理之前指定條碼類型。文件掃描中最常見的兩種類型是 Code 39,它對字母數字字元進行編碼,廣泛用於法律和醫療記錄;Code 128,它對完整的 ASCII 字元集進行編碼,並為相同的資料產生更緊湊的條碼。在工具設定中選擇正確的條碼類型。選擇錯誤的類型會導致所有條碼無法識別,且該工具將報告未找到分割點。

有些工具提供條碼方向設定。分隔頁上的條碼通常水平列印,但如果頁面以橫向方向送入掃描儀,或者條碼沿頁面邊緣垂直列印,則識別引擎需要知道掃描哪個方向。如果可用,請將方向設為“自動”,這會告訴引擎檢查每個頁面的所有四種可能的旋轉。

使用條碼值命名輸出文件

每個分隔頁上的條碼值可以充當分割觸發器和輸出檔案名稱的雙重職責。設定拆分工具以使用條碼值作為分隔符號後面的文件的檔案名稱。條碼值為 CASE-0042-HARRIS 的分隔符號會產生一個名為 CASE-0042-HARRIS.pdf 的輸出文件,其中包含從該分隔符號到(但不包括)下一個分隔符號頁的所有頁面。

如果條碼值不遵循檔案命名安全格式,例如包含空格、特殊字元或檔案名稱中的非法字符,請設定工具以清理這些值。大多數工具會自動以底線或連字號取代空格,並刪除 Windows 或 macOS 檔案系統不允許的字元。檢查第一個分割作業後的輸出檔名,以確認清理產生了可讀、有用的名稱,而不是不再傳達原始意義的剝離字串。

處理無法讀取和遺失的條碼

沒有一個條碼識別過程是完美的。弄髒的條碼、傾斜送入的頁面以及掃描過程中意外遺漏的分隔頁都會產生分割錯誤。配置工具異常處理以標記無法識別的頁面,而不是默默地合併錯過的分割點兩側的文件。該工具應產生一份異常報告,列出預期有條碼但未找到的每個頁面,以及頁碼,如果可能的話,還包括頁面圖像的縮圖。

自動拆分完成後,查看異常報告並手動拆分該工具無法自動拆分的所有文件。開啟原始 PDF,導覽至標記的頁碼,確定應在何處進行拆分,然後使用 PDF 頁面擷取工具手動擷取頁面。對於少數錯過的拆分,手動異常處理步驟需要幾分鐘的時間,而手動拆分批次中的每個文件則需要數小時。

對於未來的掃描項目,可以透過使用更高對比度的條碼列印、將條碼放置在遠離掃描器陰影可能遮擋的頁面邊緣的位置以及在將分隔頁插入文件疊之前對分隔頁運行預掃描品質檢查來提高條碼的可讀性。

根據原始文檔清單驗證分割結果

自動條碼分割完成後,將輸出檔案的數量與預期文件計數進行比較。如果原始掃描項目記錄了 247 個正在掃描的文檔,則分割應恰好產生 247 個輸出文件。不匹配表示遺失分割點(其中兩個文件合併為一個輸出文件)或錯誤分割點(其中單一文件因其中一頁上的某些內容被誤認為是條碼而被分割)。

對於法律發現或醫療記錄遷移等高風險分割項目,請執行頁數核對。所有輸出檔案的總頁數應等於原始 PDF 的頁數減去分隔頁。即使一頁的差異也意味著分割不完美,需要手動檢查輸出。

將分隔頁另存為單獨的 PDF,而不是丟棄它們。這些頁面上的條碼值提供審核跟踪,將每個輸出檔案連接到其在掃描批次中的原始位置。如果幾個月後出現有關特定文件的問題,分隔頁存檔會準確確認該文件的來源。

對於按計畫執行的PDF批次分割操作,例如夜間處理多功能印表機掃描的文檔,可自動執行從掃描到分割再到存檔的整個工作流程。監視資料夾監視新的 PDF。當 PDF 到達時,條碼分割器會自動處理,並根據條碼值將分割後的檔案存放到分類資料夾中。自動化將手動拆分任務轉變為不需要人工關注的後台進程。

為新文件掃描項目選擇條碼類型時,如果條碼值同時包含字母和數字,請選擇 Code 128 而不是 Code 39。 Code 128 為字母數字資料產生更緊湊的條碼,這意味著可以在分隔頁上將條碼符號列印得更小,而不會失去可掃描性。

對於長期PDF Batch項目,將條碼規格和分割配置記錄在與掃描文件一起儲存的項目文件中。當幾個月或幾年後重新訪問該項目時,文件會回答使用哪種條碼類型、條碼值代表什麼以及如何配置拆分等問題。

當由於條碼品質問題而需要用手動分離替換基於條碼的PDF Batch分割時,所需的時間會急劇增加。在幾分鐘內自動拆分的批次可能需要數小時才能手動拆分。

WukongPDF

嘗試拆分 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →