При сканировании книги страница за страницей создается PDF-файл, в котором каждая страница имеет темную изогнутую тень, идущую по центру, тень, отбрасываемую корешком книги, где страницы изгибаются в переплете. Текст возле корешка затемнен и иногда искажен из-за кривизны страницы. Тень потребляет чернила или тонер при печати, делает страницу непрофессиональной и мешает точности распознавания текста. Обрезка тени корешка каждой отсканированной страницы удаляет визуальный артефакт и фокусирует внимание читателя на содержании. Подход Crop PDF для удаления теней на корешке должен применяться страница за страницей, поскольку положение тени слегка меняется от страницы к странице при изменении толщины книги от передней к задней части.

Почему тени на позвоночнике появляются при сканировании книг
Планшетные сканеры прижимают книгу к стеклянному валику. Страница возле корешка не может лежать совершенно ровно, потому что этому препятствует переплет. Этот зазор между страницей и стеклом создает область, в которой свет сканера отражается по-разному, создавая тень, которая начинается от края корешка и исчезает по мере увеличения расстояния от переплета. На левой странице открытой книги тень самая темная вдоль левого края и распространяется к центру. На правой странице тень самая темная вдоль правого края.
Искривление страницы возле переплета также искажает текст. Символы возле корешка кажутся сжатыми или растянутыми в зависимости от угла страницы относительно датчика сканера. Обрезка удаляет тень и искаженный текст. Альтернатива, использующая обработку изображения для осветления тени и выравнивания искаженного текста, более сложна и редко дает такой чистый результат, как простое обрезка поврежденной области. Scanned PDF, полученный при сканировании книги, больше выигрывает от обрезки, чем от попытки исправления теневой области.
Попробуйте обрезать PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
Определение границ урожая
Откройте первую отсканированную страницу в программе просмотра PDF-файлов, поддерживающей инструменты обрезки. Увеличьте край корешка и определите, где тень начинает заметно затемнять фон страницы. Граница обрезки должна располагаться внутри этой точки, удаляя всю зону тени. Добавьте небольшой запас обычного фона страницы рядом с тенью, чтобы не оставалось затемненных пикселей. Граница обрезки, которая обрезается в тени, оставляет темную полосу вдоль края обрезанной страницы.
Измерьте расстояние от края страницы до границы обрезки. Это расстояние становится значением обрезки для всех страниц сканирования. Однако оптимальное расстояние обрезки может различаться для левой и правой страниц книги, а также для передней и задней части книги, где изменяется кривизна страницы. Просканируйте образцы страниц из разных разделов книги и проверьте, одинакова ли ширина тени корешка. Если оно различается, сгруппируйте страницы в разделы с одинаковым расстоянием обрезки. Примените соответствующее расстояние обрезки к каждой группе.
Применение обрезки ко всем страницам
Определив границу обрезки, примените ее к каждой странице PDF-файла. Большинство редакторов PDF, поддерживающих обрезку, могут применять один и тот же прямоугольник обрезки к ряду страниц. Выберите все страницы, которые имеют одинаковое расстояние обрезки, откройте инструмент обрезки, введите значения обрезки и примените. Если при сканировании книги левая и правая страницы требуют разных значений обрезки, обрабатывайте левую и правую страницы как отдельные группы страниц. Пакетная операция Crop PDF, применяющая одинаковую обрезку ко всем выбранным страницам, занимает секунды.
Если PDF-файл был отсканирован как двухстраничный разворот, где на каждой странице PDF показаны как левая, так и правая страницы открытой книги, обрезка будет более сложной. Тень корешка проходит по центру страницы. Обрежьте левую половину страницы, чтобы удалить левую часть тени корешка, и обрежьте правую половину, чтобы удалить правую сторону. Некоторые инструменты PDF могут разделить каждую страницу по центру и обрезать каждую половину независимо, создавая отдельные страницы из разворота. WukongPDF и аналогичные платформы предоставляют инструменты обрезки, которые позволяют кадрировать как одностраничные, так и разворотные книги.
Сохранение содержимого страницы вблизи позвоночника
Область тени позвоночника может содержать контент, который невозможно просто удалить. Таблица, занимающая всю ширину страницы, может иметь столбцы, выходящие в теневую зону. Рядом с переплетом может располагаться схема или фотография. Сноска или примечание на полях могут быть частично скрыты тенью. На этих страницах обрезка всей теневой зоны удаляет необходимый читателю контент.
Обрабатывайте эти исключительные страницы индивидуально. Если содержимое в теневой зоне разборчиво, несмотря на затемнение, обрежьте эту конкретную страницу менее агрессивно, удалив только самую темную часть тени и оставив текст затемненным, но все еще читаемым. Если содержание неразборчиво, подумайте, можно ли повторно отсканировать бумажную книгу с более осторожным обращением, чтобы еще больше сгладить страницу. Более плотное прижатие книги к стеклу сканера, использование книжного сканера с V-образным валиком, предназначенным для переплетенных томов, или сканирование книги с помощью верхней камеры, а не планшета, — все это уменьшает тень от корешка в источнике.
Проверка качества после сбора урожая
После обрезки прокрутите каждую страницу PDF-файла, чтобы убедиться, что не осталось остатков теней и что содержимое не было случайно обрезано. Обратите особое внимание на страницы в начале и конце книги, где кривизна страницы и ширина тени могут отличаться от средних страниц. Обрезка, идеальная для страницы 100, может оказаться слишком агрессивной для страницы 5, где более тонкая стопка страниц на одной стороне переплета создает другую кривизну.
Запустите распознавание текста в обрезанном PDF-файле и сравните точность распознавания текста с исходным необрезанным сканом в теневой зоне. Если обрезанная версия более точно распознает текст в ранее затененной области, обрезка прошла успешно. Если в обрезанной версии теряется ранее распознанный текст, возможно, обрезка была слишком агрессивной. Цель PDF Quality — чистая страница с сохранением всего необходимого контента и удалением всех отвлекающих артефактов.
Альтернативы обрезке для удаления теней позвоночника
Обрезка — это самый простой способ удаления теней на позвоночнике, но это не единственный подход. Программное обеспечение для редактирования изображений может применять локальные настройки яркости и контрастности к теневой зоне, осветляя фон и увеличивая контрастность текста, не удаляя содержимое. Этот подход сохраняет каждое слово на странице, но требует редактирования изображений на каждой странице, что практично только для коротких документов или отдельных страниц высокой важности.
Специальное программное обеспечение для сканирования книг, такое как ScanTailor, включает функцию выбора содержимого, которая автоматически определяет текстовую область на каждой странице и обрезает ее, обрабатывая тень корешка без ручного измерения границ обрезки. ScanTailor обрабатывает отсканированные изображения перед их объединением в PDF-файл. Если вы регулярно сканируете книги в PDF, то приобретение рабочего процесса сканирования, включающего автоматическое обнаружение и обрезку содержимого, сэкономит часы ручной настройки Crop PDF.
Для редких или хрупких книг, которые невозможно прижать к сканеру, рассмотрите возможность фотографирования страниц камерой, расположенной непосредственно над открытой книгой. Подход камеры полностью исключает использование стеклянной поверхности и при тщательном освещении с обеих сторон может минимизировать тень от позвоночника на этапе захвата, а не полагаться на постобработку для ее исправления.
После обрезки и окончательной обработки PDF-файла рассмотрите возможность передачи очищенной цифровой версии в онлайн-архив или цифровую библиотеку, если книга находится в свободном доступе. Часы, потраченные на очистку отсканированного изображения, могут принести пользу не только вашему собственному проекту, но и всем, кому нужен доступ к этому тексту в читаемом цифровом формате.
Для книг с иллюстрациями, фотографиями или картами, которые занимают переплет между разворотами, при обрезке тени корешка жертвуется центральная часть изображения. В таких случаях рассмотрите возможность сохранения двухстраничного разворота для страниц с иллюстрациями и обрезания только страниц, содержащих только текст. Примечание в метаданных документа может объяснить, что некоторые страницы были оставлены необрезанными, чтобы сохранить содержимое, расположенное через желоб.
Процесс очистки Scanned PDF для проектов оцифровки книг выгоден благодаря структурированному рабочему процессу, который разделяет этапы сканирования, обрезки, оптического распознавания символов и проверки качества. Попытка обрезать и завершить каждую страницу во время сканирования приводит к противоречивым результатам. Сначала отсканируйте всю книгу, а затем обработайте полный набор изображений страниц на этапе обрезки как пакет.
Рабочий процесс Crop PDF для сканирования книг преобразует черновое сканирование в чистую цифровую копию, пригодную для чтения, печати и длительного хранения в коллекциях цифровых библиотек.
Очищенный Отсканированный PDF с удаленными тенями на корешке готов к обработке OCR, что обеспечивает улучшенное качество изображения.
Хорошо обрезанное сканирование книги сохраняет слова автора, удаляя при этом механические артефакты процесса сканирования.
Сканирование книг — это акт сохранения. Каждая страница, очищенная от теней сканера, — это страница, которую будущие читатели смогут читать, не отвлекаясь. Забота, вложенная в этап обрезки, является частью более масштабных усилий по переносу содержания физических книг в цифровое будущее.
Попробуйте обрезать PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
