Tips & Tricks

Как разделить двухстраничный отсканированный книжный разворот на отдельные страницы PDF

Вы сканируете открытую книгу или переплетенный отчет на планшетном сканере. При каждом сканировании две страницы, расположенные рядом, левая и правая, захватываются как одно широкое изображение. Когда вы просматриваете полученный PDF-файл, каждый лист представляет собой двухстраничный разворот. Текст на левой странице пересекается с текстом на правой странице. Поиск фразы, пересекающей желоб между двумя страницами, ничего не дает. PDF-файл визуально соответствует оригинальной книге, но его практически невозможно использовать в качестве документа для чтения.

Разделение двухстраничного отсканированного разворота на отдельные одностраничные PDF-файлы — обычная необходимость для тех, кто оцифровывает книги, переплетенные отчеты или журналы. Этот процесс включает в себя разделение каждой страницы двойной ширины посередине и изменение порядка половин в последовательный одностраничный документ. При правильном подходе 100-страничный скан книги и 50 разворотов превращается в 200-страничный PDF-файл, который читается правильно от начала до конца.

How to Separate a Two-Page Scanned Book Spread Into Individual Single PDF Pages

Понимание проблемы двухстраничного разворота

Когда книга сканируется на планшете, сканер захватывает всю площадь стекла как одно изображение. Если обе страницы открытой книги помещаются на стекло, на скане будут видны две страницы, расположенные рядом. PDF-файл рассматривает это как одну страницу с альбомной ориентацией. Размеры страницы могут составлять 11 на 8,5 дюймов, то есть в ширину больше, чем в высоту. Каждая страница оригинальной книги занимает примерно половину сканируемой площади. Задача состоит в том, чтобы разделить эту широкую страницу на две портретно-ориентированные страницы, каждая из которых содержит одну книжную страницу.

Простое разделение точно по центру позволяет получить идеально выровненные сканы, но сканы книг редко бывают идеальными. Позвоночник может создать изогнутую деформацию возле желоба. Левая и правая страницы могут иметь разную ширину. Книга могла немного смещаться при сканировании, в результате чего точка разделения менялась от страницы к странице. Хороший подход Split PDF для сканирования книг должен учитывать эти несоответствия.

WukongPDF

Попробуйте разделить PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Метод 1: обрезать каждый разворот на левую и правую половины

Самый надежный метод — это двухэтапный процесс: обрежьте каждый разворот, чтобы извлечь левую страницу, затем снова обрежьте, чтобы извлечь правую страницу. Откройте отсканированный PDF-файл. Используйте инструмент обрезки, чтобы выделить левую половину каждой страницы. Примените обрезку, которая скроет все, что находится за пределами рамки обрезки. Сохраните файл как версию левой страницы. Затем снова откройте оригинал, обрежьте его до правой половины и сохраните как версию с правой страницей. Наконец, чередуйте два файла: страницу 1 из левого файла, страницу 1 из правого файла, страницу 2 из левого файла, страницу 2 из правого файла и так далее.

Инструмент обрезки поддерживает сохранение областей обрезки в виде именованных стилей, поэтому вы можете один раз определить левую половину и правую половину и применить их ко всем страницам одним щелчком мыши. Инструмент также поддерживает пакетное применение обрезки ко всем нечетным или всем четным страницам, что полезно, когда все развороты имеют одинаковый макет.

Метод 2: Разделение по размерам страницы

Если все развороты имеют одинаковую ширину, что характерно для сканирований, выполненных с помощью автоматического устройства подачи документов или специального книжного сканера, разделение по размерам происходит быстрее, чем обрезка вручную. Разделите ширину страницы на два и установите точку разделения по этой координате. Разворот шириной 11 дюймов делится на 5,5 дюймов. Примените разделение ко всем страницам равномерно. Этот метод быстрый, он требует одной операции для всего документа, но дает сбой, когда развороты не идеально отцентрированы или когда книга смещается между сканированиями.

Для документов, отсканированных на планшете, где каждый разворот размещался вручную, разделение по размерам часто дает приемлемые результаты, если оператор был достаточно последовательным. Для проверки разделите первые несколько страниц и убедитесь, что текст не обрезан по линии разделения. Если при разделении содержимое постоянно обрезается с одной стороны, отрегулируйте координату разделения и повторите попытку. После проверки точки разделения на образце примените ее ко всем страницам.

Метод 3: использование оптического распознавания символов для обнаружения переплета и автоматического разделения

Некоторые передовые программы сканирования включают автоматическое обнаружение распространения. Программное обеспечение анализирует каждую отсканированную страницу, определяет темную вертикальную полосу на переплете книги и разделяет страницу по этой линии. Это обеспечивает наиболее точное разделение, поскольку оно адаптируется к фактическому содержимому каждой страницы, а не использует фиксированную координату. Полость обычно представляет собой самую темную вертикальную область на странице и надежно обнаруживается алгоритмами анализа изображений.

Обработка Scanned PDF WukongPDF включает автоматическое обнаружение переплета при сканировании книг. Загрузите отсканированное изображение, и инструмент определит тень корешка на каждой странице, вычислит оптимальную линию разделения и создаст одностраничный PDF-файл со страницами в правильном порядке чтения. Рекомендуется вручную просмотреть результаты разделения, особенно для страниц с изображениями без полей, пересекающими переплет, где автоматическое обнаружение может поместить линию разделения через середину изображения, а не через переплет.

Изменение порядка страниц после разделения

При разделении отсканированного разворота получаются страницы, которые необходимо переупорядочить в последовательность чтения. В книге, отсканированной в виде разворота, страницы создаются в следующем порядке: разворот 1 влево, разворот 1 вправо, разворот 2 влево, разворот 2 вправо. Правильный порядок чтения: разворот 1 вправо, разворот 2 влево, разворот 2 вправо, разворот 3 влево. Первая левая страница часто представляет собой внутреннюю обложку или пустую страницу, предшествующую титульному листу, поэтому сверяйте предполагаемую последовательность с физической книгой.

Шаг изменения порядка выполняется вручную, но просто. Откройте разделенный PDF-файл в программе просмотра, которая показывает миниатюры страниц. Перетащите страницы в правильном порядке. Инструмент изменения порядка страниц WukongPDF отображает все страницы в виде сетки миниатюр, что упрощает просмотр и исправление последовательности. Правильный заказ книги объемом 200 страниц занимает от 10 до 15 минут. Время потрачено с пользой, потому что правильно упорядоченный PDF-файл отсканированной книги читается естественно от начала до конца, в то время как неправильно упорядоченный заставляет читателя прыгать вперед и назад между страницами, а это именно та проблема, которую должно было решить разделение.

After splitting and reordering, run OCR on the final single-page PDF. The text on each page is now correctly oriented and isolated, which improves OCR accuracy compared to running OCR on the double-page spreads. Одностраничное распознавание текста также создает текстовый слой, порядок чтения которого соответствует последовательности страниц, поэтому поиск фразы возвращает результаты в правильном порядке страниц. Преобразованные страницы PDF теперь представляют собой правильно упорядоченную цифровую книгу с возможностью поиска, а не груду нечитаемых двухстраничных изображений.

При сканировании книг с неравномерными точками разделения, когда левая и правая страницы не имеют одинаковой ширины по всему документу, постраничная ручная обрезка стоит потраченного времени для документов, на которые вы будете неоднократно ссылаться. Автоматическое определение переплета правильно обрабатывает 80% страниц. Остальные 20% требуют индивидуального внимания, обычно это страницы в начале и конце глав, где меняется макет страницы, или страницы с иллюстрациями без полей, которые занимают весь желоб. На этих страницах автоматическое разделение может прорезать середину изображения или оставить видимой часть противоположной страницы. Открытие миниатюры каждой страницы после разделения и проверка первых нескольких слов и последних нескольких слов каждой строки подтверждает, что содержимое не было потеряно на границе разделения. Проход проверки занимает примерно 30 секунд на страницу и преобразует разделение, которое в основном правильное, в абсолютно правильное.

WukongPDF

Попробуйте разделить PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →