逐頁掃描一本書會產生一個 PDF,其中每個頁面都有一個沿著中心延伸的黑色彎曲陰影,該陰影是由書脊投射的,頁面彎曲到裝訂處。書脊附近的文字變暗,有時會因頁面彎曲而變形。列印時陰影會消耗墨水或碳粉,使頁面看起來不專業,並影響受影響文字的 OCR 準確性。從每個掃描頁面中裁剪出書脊陰影可以消除視覺偽影,並將讀者的注意力集中在內容上。用於去除書脊陰影的裁剪 PDF 方法必須逐頁應用,因為隨著書籍厚度從正面到背面的變化,陰影位置在頁面之間略有移動。

為什麼書籍掃描中會出現書脊陰影
平板掃描器將書籍壓在玻璃壓板上。書脊附近的頁面無法完全平放,因為裝訂會阻止它。頁面和玻璃板之間的間隙形成了一個區域,掃描器光線在該區域反射不同,從而產生從書脊邊緣開始的陰影,並隨著與裝訂距離的增加而逐漸消失。在一本打開的書的左頁上,陰影沿著左邊緣最暗並向中心延伸。在右頁上,右邊緣的陰影最暗。
裝訂附近的頁面彎曲也會使文字變形。書脊附近的字元會出現壓縮或拉伸,具體取決於頁面相對於掃描器感測器的角度。裁剪可以去除陰影和扭曲的文字。另一種方法是使用圖像處理來減輕陰影併校正扭曲的文本,這種方法更加複雜,並且很少能產生像簡單地裁剪掉受影響區域那樣清晰的結果。書籍掃描的掃描的 PDF從裁剪中獲益更多,而不是從嘗試校正陰影區域中受益。
嘗試裁剪 PDF
無需安裝。直接在您的瀏覽器中工作。
確定作物邊界
在支援裁切工具的 PDF 檢視器中開啟第一個掃描頁面。放大書脊邊緣並確定陰影開始使頁面背景明顯變暗的位置。裁剪邊界應放置在該點的內部,從而移除整個陰影區域。在陰影旁邊包含一小部分正常頁面背景,以確保不保留任何變暗的像素。裁切到陰影中的裁切邊界會沿著裁切頁面的邊緣留下一條深色條。
測量從頁面邊緣到裁剪邊界的距離。此距離成為掃描中所有頁面的裁切值。然而,最佳裁剪距離在書籍的左頁和右頁之間可能不同,並且在頁面曲率變化的書籍的正面和背面之間也可能不同。掃描書籍不同部分的頁面樣本,檢查書脊陰影寬度是否一致。如果有所不同,請將頁面分組為共享相同裁剪距離的部分。對每組應用適當的裁剪距離。
將裁剪套用到所有頁面
確定裁剪邊界後,將其套用到 PDF 中的每個頁面。大多數支援裁剪的 PDF 編輯器可以將相同的裁剪矩形套用到一系列頁面。選擇所有共享相同裁切距離的頁面,開啟裁切工具,輸入裁切值並套用。對於左頁和右頁需要不同裁切值的書籍掃描,請將左頁和右頁作為單獨的頁面群組進行處理。將相同裁剪應用於所有選定頁面的裁剪 PDF 批次操作只需幾秒鐘。
如果 PDF 被掃描為兩頁跨頁,其中每個 PDF 頁面都顯示開啟的書本的左頁和右頁,則裁切會更加複雜。書脊陰影沿著頁面的中心延伸。裁剪頁面的左半部以刪除書脊陰影的左側,並裁剪頁面的右半部以刪除右側。有些 PDF 工具可以從中心分割每個頁面並獨立裁剪每一半,從而從跨頁中產生單獨的頁面。 WukongPDF 和類似平台提供了處理單頁和跨頁書籍掃描裁剪的裁剪工具。
保留書脊附近的頁面內容
書脊陰影區域可能包含不能簡單丟棄的內容。跨越整個頁面寬度的表格可能具有延伸到陰影區域的列。圖表或照片可以放置在裝訂附近。腳註或頁邊註釋可能會被陰影部分遮擋。對於這些頁面,裁剪整個陰影區域會刪除讀者需要的內容。
單獨處理這些異常頁面。如果陰影區域中的內容在變暗的情況下仍清晰可辨,請在該特定頁面上減少過度裁剪,僅刪除陰影最暗的部分,並保留變暗但仍可讀的文字。如果內容難以辨認,請考慮是否可以重新掃描實體書並進行更仔細的處理,以進一步平整頁面。將書籍更牢固地壓在掃描儀玻璃上,使用專為裝訂卷設計的帶有 V 形壓板的書籍掃描儀,或使用高架相機而不是平板掃描書籍,都可以從源頭減少書脊陰影。
裁剪後品質驗證
裁剪後,滾動瀏覽 PDF 的每一頁,以驗證沒有殘留陰影,並且沒有內容被意外裁剪。請特別注意書籍開頭和結尾附近的頁面,這些頁面的頁面曲率和陰影寬度可能與中間頁面不同。對於第 100 頁來說完美的裁剪對於第 5 頁可能過於激進,因為裝訂一側較薄的一疊頁面會產生不同的曲率。
對裁剪後的 PDF 執行 OCR,並將文字辨識精確度與陰影區域中原始未裁剪的掃描結果進行比較。如果裁剪後的版本能夠更準確地識別先前陰影區域中的文本,則裁剪成功。如果裁剪後的版本遺失了先前識別的文本,則裁剪可能過於激進。 PDF 品質 目標是保留所有重要內容並刪除所有分散注意力的工件的乾淨頁面。
去除脊椎陰影的裁剪替代方法
裁剪是消除書脊陰影最簡單的方法,但不是唯一的方法。影像編輯軟體可對陰影區域套用局部亮度和對比度調整,使背景變亮並增加文字對比度,而無需刪除內容。這種方法保留了頁面上的每個單字,但需要對每頁圖像進行編輯,這僅適用於短文檔或高度重要的單個頁面。
ScanTailor 等專用書籍掃描軟體包含內容選擇功能,可自動偵測每頁上的文字區域並裁切至該區域,處理書脊陰影,無需手動測量裁切邊界。 ScanTailor 在將掃描影像組合成 PDF 之前對其進行處理。如果您定期將書籍掃描為 PDF,那麼投資包含自動內容偵測和裁剪的掃描工作流程可以節省數小時的手動裁剪 PDF 調整時間。
對於無法平壓在掃描器上的稀有或易碎書籍,請考慮使用位於打開的書籍正上方的相機拍攝頁面。相機方法完全避免了玻璃壓板,並且透過兩側的仔細照明,可以最大限度地減少捕獲階段的書脊陰影,而不是依靠後處理來糾正它。
裁剪並定稿 PDF 後,如果該書屬於公共領域,請考慮將清理後的數位版本捐贈給線上檔案館或數位圖書館。清理掃描所花費的時間不僅可以使您自己的專案受益,還可以使任何需要以可讀數位格式存取該文字的人受益。
對於插圖、照片或地圖跨越對頁之間的裝訂線的書籍,裁剪書脊陰影會犧牲圖像的中心部分。在這些情況下,請考慮保持插圖頁面的兩頁跨頁完整,並僅裁剪純文字頁面。文件元資料中的註解可以解釋某些頁面未被裁切以保留跨裝訂線內容。
圖書數位化專案的掃描 PDF 清理流程受益於將掃描、裁剪、OCR 和品質檢查步驟分開的結構化工作流程。嘗試在掃描時裁切並定稿每一頁會導致結果不一致。首先掃描整本書,然後透過裁切步驟批次處理整套頁面影像。
用於圖書掃描的裁剪 PDF 工作流程可將粗略掃描轉換為適合閱讀、列印和在數位圖書館館藏中長期保存的乾淨數位副本。
清除了書脊陰影的清理後的掃描的 PDF 已準備好進行 OCR 處理,這得益於影像品質的提高
精心裁剪的書籍掃描保留了作者的文字,同時消除了掃描過程中的機械偽影
書籍掃描是一種保存行為。每一頁清除了掃描器陰影的頁面都是未來讀者能夠心無旁騖地閱讀的頁面。在裁切步驟中投入的精力是將實體書內容帶入數位未來的更大努力的一部分。
嘗試裁剪 PDF
無需安裝。直接在您的瀏覽器中工作。
