Tips & Tricks

Как распознать PDF-файл и сохранить исходный макет страницы нетронутым

При выполнении OCR PDF в отсканированном документе текст извлекается, но при выводе часто удаляется визуальная структура, которая делала оригинал читабельным. Заголовки превращаются в простые абзацы, столбцы сворачиваются в единый текстовый поток, а таблицы распадаются на беспорядочные фрагменты. Сохранение исходного макета страницы нетронутым после оптического распознавания означает, что распознанный текст остается на своем месте, сохраняя порядок чтения, структуру столбцов и пространственные отношения, которые придают документу его значение. Для этого необходимо выбрать правильные настройки оптического распознавания текста и формат вывода до обработки, а не после.

How to OCR a PDF and Keep the Original Page Layout Intact

Как работает сохранение макета OCR

Механизмы OCR обрабатывают отсканированную страницу в два отдельных этапа. На первом этапе анализируется изображение страницы для определения зон, блоков контента, таких как текстовые столбцы, изображения, таблицы и заголовки. На втором этапе выполняется распознавание символов внутри каждой зоны. Подход OCR с сохранением макета сохраняет пространственные координаты каждого распознанного слова, записывая не только то, что говорится в тексте, но и то, где на странице он появляется. Эти координаты определяют порядок чтения и визуальную иерархию документа.

Если включено сохранение макета, результаты оптического распознавания символов встраивают невидимые текстовые слои непосредственно поверх исходного отсканированного изображения в PDF-файл. Каждое распознанное слово находится в точной позиции пикселя своего исходного символа при сканировании. Это означает, что документ при просмотре выглядит идентично оригиналу, но текст под ним можно выбирать, осуществлять поиск и использовать для чтения с экрана. Сканированный PDF становится гибридным документом, сочетающим визуальную точность оригинального сканирования и текстовую функциональность файла, созданного в цифровой форме.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Выбор правильного режима вывода OCR

Большинство инструментов OCR предлагают как минимум три режима вывода, и выбор между ними определяет, сохранится ли макет. В режиме изображения с возможностью поиска исходная отсканированная страница остается видимым слоем, а под ним добавляется невидимый текстовый слой. Это идеально сохраняет макет, поскольку визуальная страница не меняется. В режиме «Текст и изображения» создается новая страница с распознанным текстом и извлеченными изображениями, расположенными так, чтобы приблизиться к исходному макету. Этот режим частично сохраняет макет и хорошо работает для простых документов с одним столбцом, но сложные страницы с несколькими столбцами могут немного смещаться.

В режиме «Только текст» все изображения и форматирование отбрасываются, создавая поток простого текста без информации о макете. Этот режим следует полностью избегать, когда макет имеет значение. Для документов, для которых важны Качество PDF и точность макета, режим изображения с возможностью поиска обеспечивает наилучший баланс. Размер файла будет больше, чем при экспорте только текста, поскольку исходные данные изображения остаются, но компромисс оправдан для любого документа, который будет читаться, делиться или архивироваться в исходной визуальной форме.

Обработка многоколоночных и сложных макетов

Документы с несколькими столбцами представляют собой сложную задачу для сохранения макета OCR, поскольку порядок чтения зигзагообразен по странице. Академическая статья с двумя столбцами требует, чтобы механизм оптического распознавания символов прочитал весь левый столбец до конца, прежде чем вернуться обратно к началу правого столбца. Без правильного определения зоны выходные данные OCR могут чередовать строки из обоих столбцов, создавая бессмысленный текст, в котором каждая вторая строка принадлежит другому столбцу.

Современные механизмы OCR используют алгоритмы обнаружения зон, которые определяют границы столбцов путем анализа промежутков между текстовыми блоками. Прежде чем запускать распознавание текста в документе с несколькими столбцами, проверьте, предлагает ли инструмент обнаружение столбцов или настройку автоматической зоны. Если инструмент неправильно определяет границы столбцов, большинство настольных приложений OCR позволяют вручную рисовать прямоугольники зон на странице, чтобы определить порядок распознавания. Рисование зон требует больше времени, но гарантирует правильный порядок чтения на выходе.

Сохранение таблиц и числовых данных

Таблицы объединяют макет и данные таким образом, что обычное OCR с трудом интерпретирует. Структура сетки, которая делает таблицу читабельной для человеческого глаза, чередуя строки с одинаковой шириной столбцов и выравниванием, требует, чтобы механизм OCR распознавал как границы ячеек, так и взаимосвязи между ячейками в одной строке или столбце. Если сохранение макета работает правильно, таблица в исходном документе создает таблицу в выходных данных OCR, где каждое значение находится в соответствующей ячейке.

В таблице ниже сравнивается, как различные режимы вывода OCR обеспечивают сохранение таблицы:

Режим вывода OCRСтруктура таблицыВыравнивание ячеек
Изображение с возможностью поискаИсходное изображение сохраненоТочный, встроенный в исходный код
Текст и изображенияРеконструировано в виде текстовой таблицыПриблизительно, может дрейфовать
Только текстПотерян полностьюВыравнивание не сохранилось

Настройки оптического распознавания символов, влияющие на качество макета

Несколько настроек, выходящих за рамки режима вывода, влияют на то, насколько хорошо исходный макет сохраняется при распознавании. Настройка DPI для входного изображения является наиболее важной. Сканирование с разрешением 300 точек на дюйм обеспечивает достаточную плотность пикселей для механизма оптического распознавания символов, чтобы различать формы символов и точно определять зоны макета. При сканировании с разрешением 150 точек на дюйм или ниже края символов становятся размытыми, что сбивает с толку как механизм распознавания, так и алгоритм обнаружения зон. Сканирование с разрешением 600 точек на дюйм немного повышает точность, но увеличивает время обработки и размер файла, но не дает пропорционального преимущества для большинства документов.

Коррекция перекоса выпрямляет страницы, отсканированные под небольшим углом. Даже наклон на два градуса может привести к тому, что обнаружение зоны ошибочно интерпретирует границу столбца как диагональный разделитель. Включение автоматического исправления перекоса перед распознаванием текста улучшает сохранение макета почти в каждом случае. Аналогично, фильтры удаления пятен удаляют случайные точки и шум сканера, которые детектор зон может интерпретировать как крошечные текстовые блоки, которые могут фрагментировать распознанные зоны и нарушать порядок чтения. Такие инструменты, как WukongPDF, автоматически применяют эти исправления предварительной обработки, создавая более чистые карты зон и более точное сохранение макета для различных типов документов.

Проверка точности макета после оптического распознавания текста

После запуска OCR с включенным сохранением макета проверьте результат перед архивированием или распространением документа. Откройте выходной PDF-файл и включите инструмент выделения текста. Перетащите курсор через абзац в каждом столбце и убедитесь, что выбор соответствует правильному порядку чтения, не переходя к соседним столбцам. Найдите слово, которое появляется в таблице, и убедитесь, что в результатах поиска выделено правильное расположение ячейки. Скопируйте абзац из среднего столбца и вставьте его в текстовый редактор, чтобы проверить правильность последовательности строк.

Для важных документов, ошибки макета которых могут привести к путанице, наиболее надежным методом проверки является постраничное сравнение исходного сканирования и результатов оптического распознавания символов. Откройте оба файла рядом и проверьте первое предложение каждого абзаца, каждый заголовок таблицы и любой текст, который появляется в верхних или нижних колонтитулах. Обнаружение ошибки обнаружения зоны на этом этапе занимает несколько секунд на страницу. Обнаружить его спустя несколько месяцев, когда кто-то попытается выполнить поиск в документе и получить искаженные результаты, будет гораздо дороже.

Выбор подходящего механизма оптического распознавания символов для документов с тяжелым макетом

Различные механизмы OCR обеспечивают сохранение макета с разной степенью сложности. Tesseract, движок с открытым исходным кодом, поддерживаемый Google, хорошо работает с простыми документами с одним столбцом, но может сталкиваться с трудностями с научными статьями с несколькими столбцами или макетами журналов без дополнительной предварительной обработки. Коммерческий движок ABBYY FineReader неизменно занимает первое место в независимых тестах по сохранению макета, поскольку перед запуском распознавания символов он анализирует всю структуру страницы и создает карту зон, сохраняющую пространственные отношения между текстовыми блоками.

Для документов, где сохранение макета имеет решающее значение, потратьте время на тестирование двух разных механизмов оптического распознавания символов на репрезентативной странице перед обработкой всего документа. Распознайте одну сложную страницу с помощью каждого механизма и сравните результаты. Посмотрите на порядок чтения, разделение столбцов и структуру таблицы в обоих результатах. Механизм, который обрабатывает самую сложную страницу вашего документа, скорее всего, справится и с остальными. Эти пятнадцатиминутные инвестиции в тестирование могут предотвратить часы ручной корректировки макета в дальнейшем.

WukongPDF включает функцию оптического распознавания символов, которая сохраняет макет страницы и порядок чтения, что делает его практичным выбором для пользователей, которым нужны точные PDF-файлы с возможностью поиска без установки программного обеспечения оптического распознавания символов на настольном компьютере. Облачная обработка эффективно обрабатывает многостраничные документы, возвращая PDF-файл с возможностью поиска с неповрежденным исходным внешним видом.

Одним из факторов, который часто упускают из виду при сохранении макета, является качество и состояние исходного отсканированного изображения. Перекошенная, морщинистая или низкоконтрастная исходная страница вынуждает механизм оптического распознавания текста тратить свои аналитические ресурсы на исправление дефектов изображения, а не на отображение структуры макета. Прежде чем запускать распознавание текста, визуально осмотрите каждую страницу. Если на скане виден наклоненный текстовый блок, темные тени вдоль корешка от переплетенной книги или блеклый текст, сливающийся с фоном, выполните предварительную обработку изображений.

Разница в размере файла между выходными данными OCR с сохранением макета и без макета может быть существенной. PDF-файл с изображением с возможностью поиска сохраняет исходную отсканированную страницу в виде слоя изображения с полным разрешением и невидимым наложением текста, в результате чего размеры файла в несколько раз превышают размер только текстового вывода. Для целей архивирования, когда объем памяти не ограничен, файл большего размера является выгодным компромиссом для точности макета.

Для архивных проектов, включающих исторические документы, сохранение макета приобретает дополнительную важность, поскольку внешний вид оригинального документа имеет историческую и доказательную ценность. Результат оптического распознавания символов, который правильно распознает каждое слово, но преобразует его в текстовый блок с одним столбцом, разрушил визуальный контекст оригинала. В этих проектах использование изображений с возможностью поиска является обязательным, и любой текстовый вывод следует рассматривать как средство поиска, а не как замену исходного документа.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →