Tips & Tricks

如何裁剪书页 PDF 以消除书脊阴影

逐页扫描一本书会生成一个 PDF,其中每个页面都有一个沿着中心延伸的黑色弯曲阴影,该阴影是由书脊投射的,页面弯曲到装订处。书脊附近的文本变暗,有时会因页面弯曲而变形。打印时阴影会消耗墨水或碳粉,使页面看起来不专业,并影响受影响文本的 OCR 准确性。从每个扫描页面中裁剪出书脊阴影可以消除视觉伪影,并将读者的注意力集中在内容上。用于去除书脊阴影的裁剪 PDF 方法必须逐页应用,因为随着书籍厚度从正面到背面的变化,阴影位置在页面之间略有移动。

How to Crop a Book Page PDF to Remove the Spine Shadow

为什么书籍扫描中会出现书脊阴影

平板扫描仪将书籍压在玻璃压板上。书脊附近的页面无法完全平放,因为装订会阻止它。页面和玻璃板之间的间隙形成了一个区域,扫描仪光线在该区域反射不同,从而产生从书脊边缘开始的阴影,并随着与装订距离的增加而逐渐消失。在一本打开的书的左页上,阴影沿左边缘最暗并向中心延伸。在右页上,右边缘的阴影最暗。

装订附近的页面弯曲也会使文本变形。书脊附近的字符会出现压缩或拉伸,具体取决于页面相对于扫描仪传感器的角度。裁剪可以去除阴影和扭曲的文本。另一种方法是使用图像处理来减轻阴影并校正扭曲的文本,这种方法更加复杂,并且很少能产生像简单地裁剪掉受影响区域那样清晰的结果。书籍扫描的扫描的 PDF从裁剪中获益更多,而不是从尝试校正阴影区域中受益。

WukongPDF

尝试裁剪 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

确定作物边界

在支持裁剪工具的 PDF 查看器中打开第一个扫描页面。放大书脊边缘并确定阴影开始使页面背景明显变暗的位置。裁剪边界应放置在该点的内部,从而移除整个阴影区域。在阴影旁边包含一小部分正常页面背景,以确保不保留任何变暗的像素。裁剪到阴影中的裁剪边界会沿着裁剪页面的边缘留下一条深色条带。

测量从页面边缘到裁剪边界的距离。该距离成为扫描中所有页面的裁剪值。然而,最佳裁剪距离在书籍的左页和右页之间可能不同,并且在页面曲率变化的书籍的正面和背面之间也可能不同。扫描书籍不同部分的页面样本,检查书脊阴影宽度是否一致。如果有所不同,请将页面分组为共享相同裁剪距离的部分。对每组应用适当的裁剪距离。

将裁剪应用到所有页面

确定裁剪边界后,将其应用到 PDF 中的每个页面。大多数支持裁剪的 PDF 编辑器可以将相同的裁剪矩形应用于一系列页面。选择共享相同裁剪距离的所有页面,打开裁剪工具,输入裁剪值并应用。对于左页和右页需要不同裁剪值的书籍扫描,请将左页和右页作为单独的页面组进行处理。将相同裁剪应用于所有选定页面的裁剪 PDF 批处理操作只需几秒钟。

如果 PDF 被扫描为两页跨页,其中每个 PDF 页面都显示打开的书本的左页和右页,则裁剪会更加复杂。书脊阴影沿着页面的中心延伸。裁剪页面的左半部分以删除书脊阴影的左侧,并裁剪页面的右半部分以删除右侧。一些 PDF 工具可以从中心分割每个页面并独立裁剪每一半,从而从跨页中生成单独的页面。 WukongPDF 和类似平台提供了处理单页和跨页书籍扫描裁剪的裁剪工具。

保留书脊附近的页面内容

书脊阴影区域可能包含不能简单丢弃的内容。跨越整个页面宽度的表格可能具有延伸到阴影区域的列。图表或照片可以放置在装订附近。脚注或页边注释可能会被阴影部分遮挡。对于这些页面,裁剪整个阴影区域会删除读者需要的内容。

单独处理这些异常页面。如果阴影区域中的内容在变暗的情况下仍清晰可辨,请在该特定页面上减少过度裁剪,仅删除阴影最暗的部分,并保留变暗但仍可读的文本。如果内容难以辨认,请考虑是否可以重新扫描实体书并进行更仔细的处理,以进一步平整页面。将书籍更牢固地压在扫描仪玻璃上,使用专为装订卷设计的带有 V 形压板的书籍扫描仪,或使用高架相机而不是平板扫描书籍,都可以从源头减少书脊阴影。

裁剪后质量验证

裁剪后,滚动浏览 PDF 的每一页,以验证没有残留阴影,并且没有内容被意外裁剪。请特别注意书籍开头和结尾附近的页面,这些页面的页面曲率和阴影宽度可能与中间页面不同。对于第 100 页来说完美的裁剪对于第 5 页可能过于激进,因为装订一侧较薄的一叠页面会产生不同的曲率。

对裁剪后的 PDF 运行 OCR,并将文本识别精度与阴影区域中原始未裁剪的扫描结果进行比较。如果裁剪后的版本能够更准确地识别之前阴影区域中的文本,则裁剪成功。如果裁剪后的版本丢失了之前识别的文本,则裁剪可能过于激进。 PDF 质量 目标是保留所有重要内容并删除所有分散注意力的工件的干净页面。

去除脊柱阴影的裁剪替代方法

裁剪是消除书脊阴影最简单的方法,但不是唯一的方法。图像编辑软件可以对阴影区域应用局部亮度和对比度调整,使背景变亮并增加文本对比度,而无需删除内容。这种方法保留了页面上的每个单词,但需要对每页图像进行编辑,这仅适用于短文档或高度重要的单个页面。

ScanTailor 等专用书籍扫描软件包含内容选择功能,可自动检测每页上的文本区域并裁剪到该区域,处理书脊阴影,无需手动测量裁剪边界。 ScanTailor 在将扫描图像组合成 PDF 之前对其进行处理。如果您定期将书籍扫描为 PDF,那么投资包含自动内容检测和裁剪的扫描工作流程可以节省数小时的手动裁剪 PDF 调整时间。

对于无法平压在扫描仪上的稀有或易碎书籍,请考虑使用位于打开的书籍正上方的相机拍摄页面。相机方法完全避免了玻璃压板,并且通过两侧的仔细照明,可以最大限度地减少捕获阶段的书脊阴影,而不是依靠后处理来纠正它。

裁剪并定稿 PDF 后,如果该书属于公共领域,请考虑将清理后的数字版本捐赠给在线档案馆或数字图书馆。清理扫描所花费的时间不仅可以使您自己的项目受益,还可以使任何需要以可读数字格式访问该文本的人受益。

对于插图、照片或地图跨越对页之间的装订线的书籍,裁剪书脊阴影会牺牲图像的中心部分。在这些情况下,请考虑保持插图页面的两页跨页完整,并仅裁剪纯文本页面。文档元数据中的注释可以解释某些页面未被裁剪以保留跨装订线内容。

图书数字化项目的扫描 PDF 清理流程受益于将扫描、裁剪、OCR 和质量检查步骤分开的结构化工作流程。尝试在扫描时裁剪并定稿每一页会导致结果不一致。首先扫描整本书,然后通过裁剪步骤批量处理整套页面图像。

用于图书扫描的裁剪 PDF 工作流程可将粗略扫描转换为适合阅读、打印和在数字图书馆馆藏中长期保存的干净数字副本。

清除了书脊阴影的清理后的扫描的 PDF 已准备好进行 OCR 处理,这得益于图像质量的提高

精心裁剪的书籍扫描保留了作者的文字,同时消除了扫描过程中的机械伪影

书籍扫描是一种保存行为。每一页清除了扫描仪阴影的页面都是未来读者能够心无旁骛地阅读的页面。在裁剪步骤中投入的精力是将实体书内容带入数字未来的更大努力的一部分。

WukongPDF

尝试裁剪 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →