Tips & Tricks

Как распознать PDF-файл для импорта и индексирования базы данных

Запуск OCR PDF на отсканированном документе приводит к распознаванию текста. Для большинства пользователей целью является PDF-файл с возможностью поиска. Но когда распознанный текст необходимо импортировать в базу данных, проиндексировать поисковой системой или запросить приложение, стандартные форматы вывода OCR не идеальны. Экспорт результатов оптического распознавания символов в структурированный формат, оптимизированный для импорта и индексирования базы данных, превращает архив отсканированных документов в доступные для запроса данные, которые интегрируются с бизнес-системами.

Основные выводы

Выходные форматы OCR, готовые для использования в базе данных, включают CSV для табличных данных, JSON для структурированного содержимого документа и XML для документов, которым необходимо сохранять иерархическую структуру. Ключевое отличие от стандартного вывода OCR заключается в том, что форматы, ориентированные на базы данных, включают согласованное сопоставление полей, индикаторы типов данных и обработку ошибок для результатов распознавания с низкой достоверностью. Подготовка PDF-файла перед распознаванием текста, включая устранение перекоса, повышение контрастности и настройку разрешения, значительно улучшает качество экспортируемых данных.

How to OCR a PDF for Database Import and Indexing

Выберите правильный формат вывода для вашей базы данных

Вывод в формате CSV идеально подходит для отсканированных форм и таблиц, где каждый документ соответствует одной строке в базе данных. Каждое поле формы становится столбцом, а каждый отсканированный документ — строкой. CSV импортируется непосредственно в приложения для работы с электронными таблицами и реляционные базы данных без преобразования. Ограничением является то, что CSV не может представлять иерархические данные. Если отсканированный документ имеет вложенные структуры, такие как счет-фактура с несколькими позициями, CSV заставляет вас либо сгладить структуру, либо разделить выходные данные на несколько файлов.

Вывод JSON естественным образом обрабатывает вложенные и переменные структуры. Счет с разделом заголовка и несколькими позициями представлен как объект JSON с массивом заголовков и массивом позиций. JSON импортируется в базы данных документов, такие как MongoDB, поисковые индексы, такие как Elasticsearch, и на большинство современных платформ приложений. Конвейер Extract PDF Data из OCR в JSON в базу данных является наиболее распространенной архитектурой для приложений распознавания документов в 2025 году. Структура JSON также сохраняет показатели достоверности OCR, что позволяет запросу базы данных автоматически отфильтровывать результаты с низкой достоверностью.

Вывод XML предпочтителен, когда отсканированные документы должны соответствовать схеме отраслевого стандарта. Обработка юридических, медицинских и правительственных документов часто требует вывода XML, который проверяется на соответствие определенному определению типа документа. Формат XML поддерживает как структуру, так и метаданные в одном файле и является обязательным входным форматом для многих систем управления корпоративным контентом. Инструмент OCR WukongPDF поддерживает форматы вывода CSV, JSON и XML, поэтому вы можете выбрать формат, соответствующий вашему конвейеру импорта базы данных, без постобработки.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Предварительная обработка отсканированных PDF-файлов для повышения точности распознавания

Для документов, которые изначально были напечатаны на цветной бумаге или пожелтели от времени, преобразование отсканированного изображения в чисто черно-белое перед распознаванием может значительно повысить точность распознавания. Механизм OCR с трудом отделяет текст от цветного или текстурированного фона. Преобразование в черно-белое изображение с пороговым значением, при котором сохраняется текст при удалении фона, дает механизму оптического распознавания символов чистый ввод. Большинство программ для сканирования и редакторов изображений включают черно-белое преобразование с регулируемым порогом. Проверьте несколько страниц с разными пороговыми значениями, чтобы найти настройку, обеспечивающую наиболее чистый текст.

Импорт базы данных увеличивает количество ошибок оптического распознавания символов. Неправильно прочитанный символ в PDF-файле с возможностью поиска доставляет незначительное неудобство. Одна и та же ошибка в поле базы данных может привести к тому, что запись будет невозможно найти, она будет отнесена к неправильной категории или сопоставлена с неправильным объектом. Затрачивая время на предварительную обработку отсканированных документов перед распознаванием текста, вы значительно снижаете количество ошибок. Три наиболее эффективных этапа предварительной обработки — это устранение перекоса страниц, повернутых даже на несколько градусов, повышение контрастности, чтобы текст резко выделялся на фоне, и обеспечение разрешения сканирования не менее 300 точек на дюйм.

Функция устранения перекоса корректирует страницы, отсканированные под небольшим углом. Даже поворот на два градуса может привести к тому, что механизмы оптического распознавания символов неправильно прочтут символы по краям строк. Большинство инструментов OCR включают автоматическое исправление перекоса, но стоит убедиться, что оно правильно активировано в ваших документах. Откройте несколько страниц, обработанных с помощью OCR, и проверьте, совпадают ли распознанные текстовые поля с видимым текстом. Невыровненные поля указывают на ошибку выравнивания, которая приведет к созданию мусора в базе данных. Повышение контрастности особенно важно для документов, отсканированных с состаренной или пожелтевшей бумаги. Увеличение контраста между текстом и фоном перед распознаванием текста может повысить точность распознавания на 10–20 процентов при сложных сканированиях.

Сопоставление полей вывода OCR со столбцами базы данных

Для документов, в которых позиции полей значительно различаются от страницы к странице, привязки ключевых слов более надежны, чем фиксированные координаты. Определите правила извлечения на основе текста, который предшествует или следует за целевыми данными, а не на его позиции. Такое правило, как «извлечь число после метки «Итог счета»» работает независимо от того, где эта метка появляется на странице. Извлечение на основе ключевых слов требует, чтобы выходные данные OCR включали полный распознанный текст с его исходным пространственным порядком, который сохраняется при выводе JSON, а при выводе в формате CSV — нет.

Разрыв между выводом OCR и импортом базы данных заключается в сопоставлении полей. OCR создает текст, упорядоченный по положению страницы. База данных ожидает текст, организованный по имени поля. Чтобы устранить этот пробел, необходимо определить сопоставление, которое, по сути, говорит, что текст в правом верхнем углу первой страницы — это номер счета-фактуры, и он помещается в столбец «voice_number». Для структурированных форм, в которых макет одинаков для всех документов, определите сопоставление один раз, используя позиционные координаты или привязки ключевых слов.

Для полуструктурированных документов с различным макетом используйте сопоставление на основе ключевых слов вместо позиционного сопоставления. Определите такие правила, как «число, которое следует за текстом «Номер счета», является номером счета, независимо от его положения на странице». Сопоставление на основе ключевых слов более надежно для разных вариантов макета, но требует, чтобы выходные данные OCR включали распознанный текст с позиционными метаданными. Это еще одна причина предпочесть вывод JSON или XML вместо CSV для документов с переменным макетом. Позиционные метаданные в JSON и XML делают возможным извлечение полей на основе ключевых слов. Для крупномасштабных проектов импорта баз данных конвейер Scanned PDF WukongPDF включает в себя настраиваемое сопоставление полей, которое выводит последовательно структурированный файл CSV или JSON, готовый для прямой загрузки в базу данных.

Обработка показателей достоверности OCR при импорте базы данных

Для приложений баз данных, где точность имеет решающее значение, внедрите двухпроходный рабочий процесс OCR. Первый проход обрабатывает все документы со стандартными настройками. Документы с показателями достоверности ниже порогового значения помечаются и повторно обрабатываются с расширенными настройками, такими как более высокое разрешение, выравнивание и настройка контрастности. Двухпроходной подход фокусирует дополнительное время обработки на документах, которые в этом нуждаются, а не замедляет весь пакет.

Каждый результат OCR имеет оценку достоверности, обычно число от 0 до 100, указывающее уверенность механизма в том, что распознанный текст соответствует тому, что находится на странице. При импорте результатов OCR в базу данных определите порог достоверности. Результаты, превышающие пороговое значение, импортируются автоматически. Результаты ниже порогового значения помечаются для проверки человеком. Порог зависит от стоимости ошибок в вашем приложении. Индекс поиска может допускать более низкий порог, поскольку пользователи могут просматривать результаты и игнорировать неверные совпадения. Финансовая база данных, в которой числа используются непосредственно в расчетах, требует высокого порога, обычно 95 или выше.

Сохраните оценку уверенности вместе с распознанным текстом в базе данных. Поле типа «voice_total» со значением 250,00 и достоверностью 98 является заслуживающим доверия. То же значение с достоверностью 62 следует рассматривать как предварительное. Приложения, которые запрашивают базу данных, могут использовать показатель достоверности для отображения значений низкой достоверности с помощью визуального индикатора, такого как желтая подсветка или значок предупреждения, предупреждая пользователей о необходимости проверить данные, прежде чем полагаться на них. Показатель достоверности добавляет измерение качества данных, которое не может обеспечить простой текстовый вывод.

Часто задаваемые вопросы

Как мне следует обрабатывать PDF-файлы, в которых отсканированные страницы смешаны с собственными цифровыми страницами, при подготовке к импорту базы данных? Обработайте отсканированные страницы с помощью оптического распознавания символов, а цифровые страницы — с помощью извлечения текста отдельно, а затем объедините результаты. Цифровые страницы не нуждаются в распознавании текста, и использование на них оптического распознавания символов может фактически ухудшить качество текста из-за появления ошибок распознавания там, где исходный цифровой текст был совершенно точным. Большинство инструментов пакетной обработки могут определять, какие страницы сканируются, а какие являются цифровыми, и автоматически направлять их по соответствующему пути обработки.

Сколько отсканированных страниц можно обработать для импорта в базу данных за один пакет?

Современные механизмы оптического распознавания символов могут обрабатывать тысячи страниц в час на стандартном оборудовании. Практическим ограничением является не скорость распознавания, а время проверки. Выделите время на проверку образца продукции перед импортом всей партии в производственную базу данных. Проверка 5-процентной случайной выборки выявляет систематические ошибки оптического распознавания символов, которые могут повлиять на всю партию.

Следует ли хранить исходный отсканированный PDF-файл вместе с извлеченными данными в базе данных?

Да, если база данных это поддерживает. Сохранение исходного PDF-файла, связанного с извлеченными данными, обеспечивает контрольный журнал. Когда возникает вопрос о качестве данных, пользователи могут открыть исходное сканирование и сверить извлеченное значение с исходным документом. Эта связь между извлеченными данными и исходным документом необходима для обеспечения соответствия во многих регулируемых отраслях.

Может ли OCR обрабатывать рукописный текст для импорта в базу данных?

Распознавание рукописного текста значительно улучшилось, но остается менее точным, чем распознавание печатного текста. При импорте базы данных рукописные поля следует направлять на проверку человеком, а не импортировать автоматически, за исключением случаев, когда рукописный ввод ограничен, например числа, написанные в отдельных полях формы. Свободный почерк в неструктурированных документах недостаточно надежен для автоматического импорта базы данных в большинстве приложений.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →