Tips & Tricks

如何將兩頁掃描書籍分成單獨的單一 PDF 頁面

您可以在平板掃描器上掃描一本打開的書或裝訂好的報告。每次掃描都會並排捕捉兩頁(左頁和右頁)作為單一寬影像。當您查看生成的 PDF 時,每張紙都是跨頁的。左側頁面上的文字與右側頁面上的文字相衝突。搜尋跨越兩頁之間的間距的短語不會返回任何內容。 PDF 在視覺上忠於原書,但實際上無法用作閱讀文件。

對於數位化書籍、裝訂報告或雜誌的任何人來說,將兩頁的掃描跨頁分成單獨的單頁 PDF 是一種常見的需求。該過程包括將每個雙寬度頁面從中間拆分並將兩半重新排序為連續的單頁文件。如果採用正確的方法,100 頁的書籍掃描件、50 個跨頁就可以變成 200 頁的 PDF,可以從頭到尾正確閱讀。

How to Separate a Two-Page Scanned Book Spread Into Individual Single PDF Pages

理解兩頁展開問題

當在平板上掃描書籍時,掃描器會將整個玻璃區域捕捉為一個影像。如果打開的書的兩頁都適合玻璃板,則掃描會並排顯示兩頁。 PDF 將此視為單一橫向頁面。頁面尺寸可能為 11 x 8.5 英寸,寬度大於高度。原書的每一頁大約佔掃描區域的一半。挑戰在於將這個寬頁面分成兩個縱向頁面,每個頁麵包含一個書頁。

簡單地分割精確的中心可以實現完美對齊的掃描,但書籍掃描很少是完美的。脊椎可能會在排水溝附近產生彎曲變形。左右頁的寬度可能不同。這本書在掃描之間可能會略有變化,導致分割點因頁面而異。良好的書籍掃描分割 PDF方法必須處理這些不一致問題。

WukongPDF

嘗試拆分 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

方法 1:將每個展開裁剪為左右兩半

最可靠的方法是兩步驟過程:裁剪每個跨頁以提取左側頁面,然後再次裁剪以提取右側頁面。開啟掃描的 PDF。使用裁切工具選擇每個頁面的左半部。應用裁剪,隱藏裁剪框之外的所有內容。將文件另存為左頁版本。然後重新開啟原件,裁剪到右半部分,並另存為右頁版本。最後,交錯兩份文件:左側文件的第 1 頁、右側文件的第 1 頁、左側文件的第 2 頁、右側文件的第 2 頁,依此類推。

裁切工具支援將裁切區域儲存為命名預設,因此您可以定義一次“左半邊”和“右半邊”,然後一鍵將它們套用到所有頁面。該工具還支援將裁剪批次應用於所有奇數或所有偶數頁面,這在所有跨頁共享一致的佈局時非常有用。

方法2:依頁面尺寸分割

如果每個跨頁的寬度完全相同(這對於使用自動送稿機或專用書籍掃描器進行的掃描來說很常見),則基於尺寸的分割比手動裁切更快。將頁面寬度除以二並將分割點設定在該座標處。 11 英吋寬的跨幅在 5.5 英吋處裂開。將分割統一應用於所有頁面。此方法速度很快,只需對整個文件執行一次操作,但當跨頁未完全居中或書籍在掃描之間移動時,該方法就會失敗。

對於在平板上掃描的文件(每個跨頁都是手動放置的),如果操作員相當一致,基於尺寸的分割通常會產生可接受的結果。若要進行檢查,請分割前幾頁並驗證分割線處沒有文字被切斷。如果拆分始終在一側剪切內容,請調整拆分座標並重試。在樣本上驗證分割點後,將其套用到所有頁面。

方法 3:使用 OCR 偵測裝訂線並自動分割

一些先進的掃描軟體包括自動擴散檢測。軟體分析每個掃描的頁面,識別書籍裝訂線的深色垂直帶,並沿著該線分割頁面。這會產生最準確的分割,因為它適應每個頁面的實際內容而不是使用固定座標。裝訂線通常是頁面上最暗的垂直區域,可以透過影像分析演算法可靠地偵測到。

WukongPDF 的掃描 PDF 處理包括書籍掃描的自動裝訂線檢測。上傳掃描件,該工具會識別每頁上的書脊陰影,計算最佳分割線,並產生單頁 PDF,其中頁面按正確的閱讀順序排列。建議手動檢查分割結果,特別是對於具有跨裝訂線的全出血影像的頁面,其中自動檢測可能會將分割線放置在影像的中間而不是裝訂線處。

拆分後重新排序頁面

拆分掃描跨頁會產生需要重新排序為閱讀順序的頁面。掃描為跨頁的書籍會依下列順序產生頁面:左跨頁 1、右跨頁 1、左跨頁 2、右跨頁 2。正確的閱讀順序是:向右展開1,向左展開2,向右展開2,向左展開3。左第一頁通常是內封面或扉頁之前的空白頁,因此請根據實體書驗證預期的順序。

重新排序步驟是手動的,但很簡單。在顯示頁面縮圖的檢視器中開啟分割的 PDF。將頁面拖曳至正確的順序。 WukongPDF 的頁面重新排序工具將所有頁面顯示為縮圖網格,從而可以輕鬆查看和更正順序。一本 200 頁的書需要 10 到 15 分鐘才能正確重新排序。時間花得很值,因為掃描書籍的正確排序的 PDF 從頭到尾自然地閱讀,而錯誤排序的 PDF 則迫使讀者在頁面之間來回跳轉,這正是拆分要解決的問題。

分割和重新排序後,對最終的單頁 PDF 執行 OCR。現在,每個頁面上的文字都已正確定向和隔離,與在雙頁跨頁上執行 OCR 相比,這提高了 OCR 準確性。單頁 OCR 也會產生一個文字圖層,其中閱讀順序與頁面順序相匹配,因此搜尋短語會以正確的頁面順序傳回結果。轉換後的PDF頁面現在是一本正確排序的、可搜尋的數位圖書,而不是一堆不可讀的雙頁影像。

對於分割點不均勻的書籍掃描,即整個文檔中左頁和右頁的寬度不相等,對於您將反复參考的文檔,逐頁手動裁剪是值得的。自動裝訂線偵測可以正確處理 80% 的頁面。剩下的 20% 需要單獨關注,通常是頁面佈局變化的章節開頭和結尾的頁面,或者帶有橫跨裝訂線的全出血插圖的頁面。在這些頁面上,自動分割可能會切穿圖像的中間或留下相對頁面的一小部分可見。分割後打開每個頁面縮圖並檢查每行的前幾個單字和最後幾個單詞,確認分割邊界處沒有內容遺失。驗證過程每頁大約需要 30 秒,並將大部分正確的拆分轉換為完全正確的拆分。

WukongPDF

嘗試拆分 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →