當每個文件以空白頁或編號的章節標題開頭時,將大型 PDF 拆分為單獨的文件非常簡單。當 PDF 中的文件僅透過視覺提示分隔時,挑戰就完全改變了:帶有公司徽標的封面、較大字體的標題表或人類可以立即發現但自動化工具難以檢測的獨特標題塊。本文介紹了透過識別封面頁和標題頁來分割 PDF 的實用方法,從適合少量文件的手動方法到可擴展到數百頁的半自動技術。

為何文檔批次的標準頁數分割失敗
答案在於文檔的不同。
大多數 PDF 分割工具都遵循一個簡單的原則:每隔 N 頁或按您輸入的特定頁碼分割檔案。當批次中的每個文件具有相同的頁數時,此方法有效。一疊單頁發票在每個頁面邊界處都清晰地分開。三頁合約的集合每隔三頁均勻分割一次。但是,當文件長度不同時(幾乎所有現實世界中的一批報告、應用程式或信件都是這種情況),頁數拆分要么將文檔切成兩半,要么將一個文檔的尾部與下一個文檔的頭部合併。
封面頁和標題頁是合併 PDF 中文件之間的自然邊界,但它們是視覺邊界,而不是結構邊界。 PDF 將它們儲存為與任何其他頁面相同類型的頁面物件。沒有元資料標誌表明此頁面是封面或此段落是標題。必須告訴分割軟體要查找什麼,並且指令需要足夠具體,以便軟體能夠將封面頁與恰好包含大標題或標誌的常規內容頁區分開來。
錯誤分割的後果不只是不方便。將多頁文檔切成兩半的分割會產生兩個不完整的文件,這兩個文件本身都沒有意義。合併兩個文件的分割會產生一個文件,其中讀者在預期內容結束後立即看到其他人的信息。對於法律、醫療或財務文件,第二種情況是違反保密規定。正確分割對於可用性和合規性都很重要。
嘗試拆分 PDF
無需安裝。直接在您的瀏覽器中工作。
手動方法:用眼睛發現封面
對於最多約二十個文件的批次,手動拆分通常比配置自動化解決方案更快。開啟合併的 PDF 並捲動側邊欄中的頁面縮圖。封面頁和標題頁在視覺上很突出,因為它們通常比其後面的內容頁有更多的空白、更大的文字、標誌或不同的佈局密度。按一下每個文件的第一頁,按住 Shift 鍵按一下最後一頁,然後將所選內容提取為新檔案。
WukongPDF 的分割 PDF 工具提供了可視化頁面選擇器,使手動分割變得有效率。您可以將所有頁面視為縮圖,按一下以標記每個封面頁上的分割點,然後該工具會將每個片段提取為單獨的、正確命名的 PDF。對於包含 15 個不同長度文件的 100 頁文件,整個過程需要不到兩分鐘。視覺化介面消除了對頁碼的猜測,並允許您在進行提取之前驗證每個分割點。
手動拆分的一個有用習慣是:當您確定每個文件的頁面範圍時,請記下封面上的標題或參考號碼。使用它作為輸出檔名。充滿名為 split-1.pdf、split-2.pdf 的文件的資料夾僅比原始合併文件稍微有用一些。名為 Smith-Application.pdf、Jones-Contract.pdf 的檔案可立即使用。
半自動分割:文本模式檢測
自動化可擴展手動工作無法實現的範圍。
當批次太大而無法手動拆分時,下一步是基於文字的檢測。大多數具有批次分割功能的 PDF 工具都可以搜尋特定的文字字串,並在該文字出現時分割文件。如果每個封面頁都包含一致的短語,例如「申請表」、「機密」、「第 1 頁」或可預測格式的帳號,則該短語將成為分割觸發器。該工具掃描每個頁面的文字層,當找到目標字串時,它會在該頁面之前插入一個分割點。
基於文本的分割的可靠性取決於兩個因素。首先,觸發文字必須出現在每個封面頁上,並且永遠不會出現在內容頁上。像「第 1 頁」這樣的短語似乎是一個很好的觸發器,直到文件的第 6 頁也包含文字「請參閱第 1 頁以了解詳細資訊」。其次,PDF必須有文字層。沒有 OCR 的掃描 PDF 將完全擊敗基於文字的分割,因為封面文字僅以像素形式存在,而不是以可搜尋字元的形式存在。在拆分之前對合併檔案執行 OCR 可以解決此問題,新增一個步驟但保留自動化。
結構檢測:使用字體大小和頁面密度
更先進的方法分析每個頁面的視覺結構,而不是搜尋特定文字。封面頁和標題頁往往具有與內容頁明顯不同的特徵。由於標題周圍有空白,文字密度較低。由於標題的原因,平均字體較大。該頁面可以包含圖像,例如徽標,其中內容頁面僅為文字。可以測量這些屬性的軟體可以標記可能的封面頁,而無需知道其中出現的單字。
此方法處理封面頁措詞不同但版面一致的情況。一群客戶報告,每個封面都寫著“為[客戶姓名]做好準備”,每個封面上都有不同的文字。基於文字的拆分失敗,因為沒有可搜尋的公共字串。基於結構的分割之所以成功,是因為每個封面都使用相同的模板、相同的字體大小和相同的標誌位置。一致性在於設計,而不是單詞,結構檢測可以捕獲文字搜尋遺漏的內容。
分割前準備文件以獲得最佳結果
分裂前的一些準備步驟可以顯著提高任何方法的成功率。首先,如果合併的 PDF 來自掃描儀,請執行 OCR 以建立可搜尋的文字圖層。即使您打算手動拆分,使用可搜尋文字也可以讓您透過搜尋名稱或參考號跳到特定頁面,而不是捲動縮圖。其次,檢查合併的文件是否包含任何不應拆分為單獨文件的頁面。傳真封面、傳送單和文件之間的空白分隔頁應在分割前刪除,而不是變成自己的一頁輸出檔。
第三,以低變焦掃描文檔,檢查每個封面頁是否使用相同的方向。一批縱向文件中的單一橫向封面可能會導致分割工具未對齊,特別是如果它使用基於頁面尺寸的結構檢測。在分割之前規範頁面方向。這些步驟會在流程的前面增加幾分鐘的時間,但可以防止在分割完成並且原始合併文件已被刪除後發現誤切文件的挫折感。 PDF 頁面 的準備工作會帶來乾淨、準確的輸出文件,無需手動清理。
分割期間系統地命名輸出文件
拆分合併的 PDF 的價值不僅在於分離頁面,還在於產生可立即識別的輸出檔案。在拆分過程中應用精心策劃的命名約定可以使接收者無需打開每個文件來發現其內容。如果封麵包含一致的元素(例如發票編號、客戶名稱或文件參考代碼),請在分割過程中提取該資料並將其用作文件名稱。大多數支援基於文字的偵測的拆分工具還支援使用偵測到的文字作為輸出檔名,將一批通用拆分檔轉換為正確標記的文件集。
對於封面頁不共享通用文字模式的批次,請在開始分割之前建立命名約定。像 ClientName-DocumentType-Date.pdf 這樣的格式在所有輸出檔案中一致地應用,可以從先前不透明的合併文件建立一個可排序、可搜尋的文件庫。每個文件的命名步驟只需幾秒鐘,並增加了持久的組織價值。包含名稱良好的各個 PDF 的資料夾是一個可用的文件存檔。一個包含按順序編號的分割檔案的資料夾是一個稍後必須解決的難題。只有當每個輸出檔案都正確命名和組織時,PDF Batch 分割過程才算完成。
學習透過封面檢測分割 PDF 所花費的時間在超出初始用例的許多文件類型上都得到了回報。法律文件包、發票批次、學生記錄集、醫療記錄彙編和合約集都遵循相同的混合文件模式,由可識別的首頁分隔。一旦您為一種文件類型建立了可靠的分割工作流程,只需識別新封面的獨特特徵即可將其適應另一種文件類型。技能可以快速從一種文件類型轉移到另一種文件類型,並且成功處理每個新批次都會提高效率。
嘗試拆分 PDF
無需安裝。直接在您的瀏覽器中工作。
