Отсканированный PDF-файл, собранный из разных источников, часто содержит страницы как в книжной, так и в альбомной ориентации. Финансовые таблицы отображаются в альбомной ориентации. Сопровождающие текстовые документы отображаются в виде книжных страниц. Запуск OCR в таком документе без учета смешанной ориентации приводит к распознанному тексту, в котором слова на страницах с альбомной ориентацией зашифрованы, повернуты или полностью пропущены, поскольку механизм OCR обработал эти страницы в неправильной ориентации.
Механизмы OCR PDF анализируют текстовые строки, чтобы определить позиции символов и порядок чтения. Когда страница повернута на 90 градусов относительно того, что ожидает движок, текстовые строки располагаются вертикально, а не горизонтально. Движок либо не может полностью распознать текст, либо пытается читать его вертикально, выдавая бессмысленный вывод. Документы со смешанной ориентацией требуют определения ориентации каждой страницы перед обработкой OCR.
Инструменты оптического распознавания символов Scanned PDF WukongPDF поддерживают смешанную ориентацию страниц с автоматическим определением поворота каждой страницы в процессе распознавания.
Почему ориентация страницы важна для точности распознавания
Механизмы OCR работают, обнаруживая строки символов и анализируя формы внутри каждой строки. Страница в книжной ориентации имеет текстовые строки, идущие горизонтально, что движок обрабатывает естественным образом. Страница в альбомной ориентации при просмотре без коррекции поворота имеет текстовые строки, идущие вертикально с точки зрения механизма оптического распознавания символов. Движок ожидает горизонтальный текст и не может прочитать вертикальный текст.
Решение состоит в том, чтобы определить ориентацию каждой страницы перед распознаванием текста и повернуть альбомные страницы в книжную ориентацию перед обработкой. После оптического распознавания страницы можно повернуть обратно в исходную ориентацию, при этом распознанный текстовый слой будет правильно расположен. Поворот во время обработки не приводит к необратимым изменениям документа; это только меняет то, как механизм OCR видит страницу.
Большинство автоматизированных инструментов OCR предполагают, что все страницы имеют одинаковую ориентацию, поскольку это обычный случай для документов, созданных одним сканером за один сеанс. Документы смешанной ориентации, часто создаваемые путем объединения сканирований из разных источников, требуют явной настройки для правильной обработки изменений на каждой странице.
Метод 1: Acrobat Pro с определением поворота страницы
Функция OCR Acrobat Pro может обрабатывать документы смешанной ориентации, если она настроена соответствующим образом. Откройте отсканированный PDF-файл в Acrobat Pro и выберите «Инструменты», «Сканирование и распознавание текста», «Распознать текст», «В этом файле». В диалоговом окне настроек «Распознавание текста» убедитесь, что в качестве основного языка документа выбран правильный язык распознавания. В разделе «Настройки» включите параметр «Устранение перекоса и выпрямления», который поможет Acrobat обнаружить поворот страницы.
Acrobat обрабатывает каждую страницу индивидуально и пытается определить доминирующую ориентацию текста. Для страниц, на которых обнаружение правильное, результат оптического распознавания текста будет точным и читаемым. Для страниц, на которых обнаружение не удается, например, с минимальным количеством текста или сложным визуальным фоном, выходные данные OCR могут быть зашифрованы или полностью отсутствовать. После обработки OCR особенно просмотрите альбомные страницы. Найдите текст, который вы можете увидеть визуально на этих страницах. Если поиск ничего не находит, возможно, Acrobat неправильно определил ориентацию.
Страницы, которые были идентифицированы неправильно, вручную поверните их с помощью инструмента «Упорядочить страницы» и повторно запустите распознавание текста только на этих страницах. Ручное вмешательство занимает всего лишь мгновение для каждой затронутой страницы и гарантирует, что каждая страница вносит точный распознанный текст в выводимый документ с возможностью поиска.
Метод 2: предварительная обработка с помощью OCRmyPDF
OCRmyPDF, инструмент командной строки с открытым исходным кодом, созданный на основе Tesseract OCR, обрабатывает страницы смешанной ориентации с помощью встроенной функции устранения перекоса. Команда ocrmypdf --deskew input.pdf output.pdf определяет ориентацию текста на каждой странице, поворачивает страницы по мере необходимости, запускает распознавание текста с помощью Tesseract и выводит PDF-файл с возможностью поиска. Флаг устранения перекоса является важным параметром для обработки документов смешанной ориентации.
OCRmyPDF обрабатывает страницы последовательно и автоматически применяет коррекцию ориентации для каждой страницы. Для документов с сильным поворотом или страниц, содержащих как горизонтальный, так и вертикальный текст, алгоритм выравнивания перекоса ориентирует страницу на основе доминирующего направления текста, что обеспечивает наилучшие результаты распознавания для большей части содержимого страницы. Направление текста меньшинства может иметь немного меньшую точность, но в целом все равно распознается.
В рабочих процессах с документами для пакетной обработки больших объемов документов смешанной ориентации OCRmyPDF в сочетании со сценарием оболочки, который обрабатывает все PDF-файлы в папке, обеспечивает полностью автоматическое распознавание текста без ручной настройки каждого документа. Автоматизация выполняет рутинную обработку, и только исключительные случаи требуют проверки человеком.
Проверка вывода OCR, особенно на страницах с альбомной ориентацией
После обработки OCR проверьте вывод на альбомных страницах в качестве отдельной целенаправленной проверки. Выделите текст на странице с альбомной ориентацией в выходном PDF-файле и скопируйте его в текстовый редактор. Скопированный текст должен читаться в правильном порядке, совпадая с визуальным содержимым страницы сверху вниз и слева направо. Если слова перепутаны, не в порядке или появляются в бессмысленной последовательности, значит, для этой страницы не удалось определить ориентацию.
Найдите конкретные известные термины, которые появляются на страницах с альбомной ориентацией. Финансовая таблица на горизонтальной странице может содержать определенные коды счетов, названия отделов или числовые значения, которые можно найти в выходных данных OCR. Если поиск не находит совпадений на страницах с альбомной ориентацией, но находит совпадения на страницах с книжной ориентацией того же документа, механизм OCR, скорее всего, полностью пропустил содержимое с альбомной ориентацией. Эти страницы требуют повторной обработки с указанной ручной ориентацией.
В рабочих процессах с документами для документов, которые будут служить в качестве архивов с возможностью поиска, этап проверки — это контроль качества, который выявляет проблемы оптического распознавания символов, связанные с ориентацией, прежде чем документ попадет в постоянную коллекцию. Непроверенный вывод OCR, который молча пропускает целые страницы контента, подрывает цель создания архива с возможностью поиска.
Пакетная обработка отсканированных коллекций смешанной ориентации
Для больших коллекций отсканированных документов со смешанной ориентацией ручная постраничная проверка нецелесообразна. Автоматизируйте процесс с помощью OCRmyPDF и флага устранения перекоса, а затем запустите сценарий проверки, который проверяет каждую выходную страницу на наличие текста, доступного для поиска. Страницы, на которых нет распознанных текстовых символов или очень мало символов, помечаются для проверки вручную и возможной повторной обработки.
Сценарий проверки считывает каждый PDF-файл, обработанный с помощью оптического распознавания символов, извлекает текстовый слой страницу за страницей и подсчитывает количество распознанных символов на каждой странице. Любая страница, количество символов ниже минимального порога, например десяти символов, помечается как потенциально необработанная или неправильно ориентированная. Помеченные страницы объединяются в отчет, который направляет усилия по ручной проверке только на те страницы, которые действительно требуют внимания человека, а не на проверку каждой страницы.
Что касается рабочих процессов, то для текущих проектов оцифровки, в которые регулярно поступают новые отсканированные документы, рабочий процесс пакетной обработки и проверки становится стандартной рабочей процедурой. Новые документы поступают в конвейер, автоматически обрабатываются с помощью оптического распознавания символов с определением ориентации, и только исключения требуют вмешательства человека. Автоматика справляется с рутиной. Человек-рецензент обрабатывает исключения.
Улучшение распознавания текста на страницах с внутренней ротацией
Некоторые отсканированные документы содержат страницы, на которых вращается содержимое внутри страницы, а не сама страница. Финансовую таблицу с альбомной ориентацией можно вставить в документ с книжной ориентацией, повернув содержимое таблицы на 90 градусов, сохранив при этом книжные размеры страницы. Эти страницы наиболее сложны для определения ориентации, поскольку размеры страницы не указывают на необходимость поворота.
При обработке документов для страниц с внутренней ротацией наиболее надежным подходом является предварительная обработка вручную. В Acrobat Pro используйте инструмент «Редактировать PDF», чтобы выбрать повернутую область содержимого, повернуть ее в правильную горизонтальную ориентацию и правильно расположить на странице. После исправления внутреннего поворота запустите распознавание текста на исправленной странице. Этап предварительной обработки вручную занимает около минуты на каждую затронутую страницу, но обеспечивает чистый и точный результат распознавания.
Идентификация страниц с внутренним поворотом требует визуального осмотра. Просканируйте документ и найдите страницы, на которых текст движется в неожиданном направлении относительно краев страницы. Страницы с внутренней ротацией относительно редки в большинстве коллекций документов, но непропорционально влияют на качество распознавания, когда они встречаются.
Выбор подходящего механизма оптического распознавания символов для документов смешанной ориентации
Различные механизмы OCR обрабатывают определение ориентации с разной точностью. Tesseract с препроцессором устранения перекоса хорошо справляется с умеренным поворотом, но может испытывать проблемы со страницами, повернутыми ровно на 90 или 180 градусов. Google Cloud Vision OCR включает встроенное определение ориентации, которое надежно обрабатывает все углы поворота. Для важных документов смешанной ориентации, где важна точность, облачные службы оптического распознавания символов обычно превосходят локальные механизмы при обработке ориентации.
Прежде чем переходить к большой партии, протестируйте выбранный механизм оптического распознавания символов на небольшой выборке страниц со смешанной ориентацией. Десятистраничный тест с известными шаблонами ориентации показывает, как движок обрабатывает определенные типы вращения в ваших документах. Проверка занимает несколько минут и предотвращает многочасовую повторную обработку, если определение ориентации механизма оказывается неадекватным для ваших конкретных типов документов.
Экспорт текста OCR из документов смешанной ориентации для проверки
После обработки OCR экспортируйте распознанный текст, чтобы проверить полноту на всех страницах. В Acrobat Pro перейдите в «Инструменты», «Экспортировать PDF» и выберите «Текст» в качестве выходного формата. Экспортированный текстовый файл должен содержать содержимое каждой страницы в правильном порядке чтения. Откройте текстовый файл и найдите известные вам термины, которые появляются на определенных страницах в альбомной ориентации. Если эти термины отсутствуют при экспорте, вероятно, эти страницы были неправильно ориентированы во время оптического распознавания символов и требуют повторной обработки.
Что касается обработки документов, то для документов, предназначенных для архивов с возможностью поиска, экспортированный текст служит независимой проверкой того, что каждая страница внесла свое содержимое в слой с возможностью поиска. Экспорт текста с пробелами или отсутствующими разделами указывает на ошибки распознавания, которые требуют внимания, прежде чем документ попадет в постоянный архив. Этап экспорта действует как контроль качества, который выявляет проблемы оптического распознавания символов, связанные с ориентацией, прежде чем они станут постоянными недостатками архива.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
