При сканировании связанного тома, например книги, диссертации, журнала или бухгалтерской книги, создается PDF-файл, страницы которого чередуются с книжной и альбомной ориентацией. Левые страницы открытой книги сканируются в одной ориентации, а правые — в другой, или вся книга сканируется с попеременным поворотом страниц, поскольку оператор сканера переворачивал книгу для каждого разворота страницы, не поворачивая сканированное изображение. В результате получается PDF-файл, в котором каждая вторая страница при просмотре на экране поворачивается на 90 или 180 градусов. Запуск OCR в этом документе без предварительной нормализации ориентации страницы приводит к тому, что текст попеременно то ориентирован правильно, то повернут, что делает распознанный текст непригодным для поиска или извлечения. Решение требует этапа предварительной обработки, который определяет и корректирует ориентацию каждой страницы перед ее обработкой OCR.

Почему сканирование связанных томов приводит к изменению ориентации страниц
При сканировании переплетенного тома при каждом развороте две страницы кладутся на платформу сканера лицевой стороной вниз. Левая страница книги отображается на правой стороне платформы сканера, а правая страница — на левой стороне, повернутой на 180 градусов относительно друг друга. Если оператор сканера не корректирует это вращение для каждой отдельной страницы, отсканированный PDF-файл будет содержать страницы, на которых все остальные страницы перевернуты. Книга на 200 страниц создает PDF-файл с 200 страницами, из которых 100 страниц ориентированы правильно, а 100 повернуты на 180 градусов. Схема правильная и предсказуемая: все нечетные страницы могут быть правильно ориентированы, а все четные — повернуты, или наоборот.
Некоторые переплетенные тома сканируются путем помещения открытой книги на сканер так, чтобы текст располагался горизонтально, в результате чего создается одно изображение, содержащее как левую, так и правую страницы. Затем это изображение разделяется на две отдельные страницы, но в процессе разделения не всегда правая страница поворачивается в соответствии с ориентацией левой страницы. В результате получается PDF-файл, в котором левые страницы ориентированы правильно, а правые повернуты на 90 градусов или наоборот. Механизм OCR, который ожидает, что текст будет располагаться горизонтально слева направо по странице, не может распознать текст на повернутых страницах, поскольку текст расположен вертикально или перевернут.
Попробуйте PDF-распознавание текста
Никакой установки не требуется. Работает прямо в вашем браузере.
Определение ориентации страницы перед обработкой OCR
Прежде чем запускать распознавание текста, проверьте миниатюры страниц в средстве просмотра PDF-файлов. Альтернативная ориентация сразу видна на панели миниатюр, где все остальные миниатюры отображаются повернутыми. Подсчитайте образец ориентации: нечетные страницы правильные, а четные страницы повернуты — это наиболее распространенный образец, но возможен и обратный вариант. Если шаблон согласован, операция пакетного ротирования может исправить все затронутые страницы с помощью одной команды. Большинство программ просмотра PDF-файлов позволяют выбирать несколько страниц на панели миниатюр и одновременно применять поворот ко всем выбранным страницам. Выберите все четные страницы, поверните их на 180 или 90 градусов по мере необходимости и сохраните документ. На панели миниатюр теперь отображаются все страницы в правильной ориентации.
Инструмент OCR PDF WukongPDF обрабатывает каждую страницу независимо, но предполагает, что текст ориентирован горизонтально. Если страница повернута, механизм OCR либо не распознает какой-либо текст, либо выдает искаженные результаты, поскольку пытается прочитать вертикальный или перевернутый текст, как если бы он был горизонтальным. Исправление ориентации страницы перед распознаванием текста является обязательным этапом предварительной обработки. После поворота затронутых страниц и сохранения документа запустите распознавание текста в нормализованном PDF-файле. Точность распознавания будет одинаковой на всех страницах, поскольку теперь каждая страница представляет текст в той ориентации, которую ожидает механизм OCR.
Обработка противоречивых шаблонов ориентации в документе
Не все переплетенные тома создают четкий чередующийся рисунок. Книга, отсканированная двумя разными операторами, многотомный комплект, отсканированный в разное время, или документ, который был частично повторно отсканирован после первоначального сканирования, могут иметь неправильную структуру ориентации. Страницы с 1 по 50 могут следовать чередующемуся шаблону, страницы с 51 по 80 могут быть правильно ориентированы, поскольку они были повторно отсканированы с правильным поворотом, а страницы с 81 по 200 могут вернуться к чередующемуся шаблону. Обнаружение и исправление необходимо выполнять по частям, а не с помощью одной пакетной операции.
Для нестандартных шаблонов ориентации наиболее надежным методом является ручная прокрутка миниатюр и поворот отдельных страниц или диапазонов страниц. Начните с первой страницы и просмотрите миниатюры. Когда вы обнаружите повернутую страницу, определите, сколько последовательных страниц имеют такую же ориентацию. Выберите диапазон и примените вращение. Продолжайте просматривать документ, пока каждая страница не будет правильно ориентирована. Процесс занимает одну-две секунды на страницу, поэтому для документа объемом 200 страниц требуется примерно пять минут. Время потрачено с пользой, поскольку точность распознавания на правильно ориентированных страницах значительно выше, чем на повернутых.
Автоматическое определение ориентации для проектов с большим ограниченным объемом
Для проектов оцифровки, включающих сотни или тысячи страниц, ручная проверка ориентации страницы становится непрактичной. Инструменты автоматического определения ориентации могут идентифицировать повернутые страницы, анализируя направление текста. Эти инструменты отбирают текстовые символы по всей странице и определяют доминирующую ориентацию, распознавая, какое вращение дает допустимые слова на ожидаемом языке. Страница, на которой распознавание текста завершается успешно при угле 0 градусов, но не удается при угле 90, 180 и 270 градусов, ориентировано правильно. Страница, на которой распознавание удается при повороте на 180 градусов, но не удается при повороте на 0, перевернуто и требует поворота. Автоматическое обнаружение быстро обрабатывает большие наборы документов, а выборочная ручная проверка результатов подтверждает правильность работы автоматизации до начала распознавания.
Проверка вывода OCR при различных ориентациях
После исправления ориентации страницы и запуска OCR убедитесь, что качество распознавания одинаковое по всему документу. Ищите текст, который появляется как на изначально правильных, так и на изначально повернутых страницах. Поиск должен находить экземпляры на обоих типах страниц с одинаковой достоверностью. Если текст на первоначально повернутых страницах не найден, возможно, коррекция поворота была применена неправильно или механизм оптического распознавания символов обработал некоторые страницы до того, как поворот был сохранен. Снова откройте документ, убедитесь, что все ориентации страниц на панели миниатюр верны, и при необходимости повторно запустите распознавание текста.
Для переплетенных томов, в которых исходное качество сканирования варьируется на разных страницах, например книги, в которой некоторые страницы прижаты к стеклу сканера ровно, а другие имеют кривизну возле корешка, точность распознавания будет меняться соответствующим образом. Коррекция ориентации решает проблему вращения, но не компенсирует другие проблемы с качеством сканирования. Страницы со значительной кривизной, возможно, придется повторно отсканировать или предварительно обработать с помощью фильтра устранения искажений, прежде чем распознавание текста сможет достичь приемлемой точности. Конвейер Scanned PDF в текст с возможностью поиска работает лучше всего, когда исходные изображения максимально чистые и однородно ориентированы. Коррекция ориентации — первый и наиболее эффективный шаг. Устранение искажений, настройка контрастности и устранение пятен — это последующие шаги, которые еще больше повышают точность распознавания при сложных сканированиях ограниченного объема.
Попробуйте PDF-распознавание текста
Никакой установки не требуется. Работает прямо в вашем браузере.
