Tips & Tricks

Как экспортировать результаты OCR из PDF в JSON

При запуске OCR PDF в отсканированном документе создается распознанный текст, но большинство инструментов OCR выводят этот текст в виде простого текстового файла или встраивают его обратно в PDF-файл. Экспорт результатов OCR непосредственно в JSON дает вам структурированные машиночитаемые данные, которые можно вводить в базы данных, поисковые индексы, системы управления контентом и автоматизированные рабочие процессы. Опрос, проведенный AIIM International в 2025 году, показал, что 43 процента организаций теперь предпочитают форматы структурированных данных, такие как JSON, для текста, полученного из документов, поскольку они легче интегрируются с современными облачными приложениями и конвейерами искусственного интеллекта (AIIM, «Состояние интеллектуального управления информацией», 2025).

Основные выводы

Экспорт результатов OCR в JSON сохраняет структуру распознанного текста, включая номера страниц, координаты слов и показатели достоверности, которые теряются при экспорте в обычный текст. Большинство современных механизмов OCR изначально поддерживают вывод JSON, но эту функцию, возможно, придется включить в настройках или выбрать в меню формата экспорта. Полученный файл JSON можно использовать для полнотекстового поиска, конвейеров извлечения данных и обучения моделей машинного обучения на содержимом документа.

Для разработчиков, интегрирующих OCR JSON в приложения, большинство выходных форматов JSON включают поле версии, которое идентифицирует версию схемы. Всегда проверяйте это поле перед анализом, чтобы не нарушить изменения, когда механизм OCR обновляет выходной формат. Простая защита версий в начале кода синтаксического анализа предотвращает загадочные ошибки при изменении структуры JSON между версиями движка.

How to Export OCR Results From a PDF to JSON

Почему вывод JSON лучше, чем обычный текст для результатов распознавания

При выводе обычного текста при распознавании текста отбрасывается все, кроме самих символов. Вы получаете слова, но теряете номер страницы, на которой появилось каждое слово, координаты ограничивающей рамки, которые сообщают вам, где на странице находится текст, показатель достоверности, который показывает, насколько уверен механизм OCR в отношении каждого символа, а также любую структурную информацию, такую как разрывы абзацев и макеты столбцов. JSON сохраняет все это. Выходной файл JSON Scanned PDF OCR обычно содержит массив объектов страницы, каждый из которых содержит массив объектов текстовых блоков, каждый из которых содержит распознанный текст, а также его положение, размер и метаданные достоверности.

Эта структура обеспечивает последующую автоматизацию, которая невозможна при использовании обычного текста. Скрипт может читать файл JSON и извлекать текст только из определенной области каждой страницы, например из области заголовка или столбца боковой панели. Он может отфильтровывать результаты оптического распознавания символов с низкой достоверностью, чтобы избежать загрязнения индекса поиска искаженным текстом. Он может восстановить порядок чтения многоколоночного макета, сортируя текстовые блоки по их координатам Y и X. Ни одна из этих операций невозможна с простым текстовым файлом из OCR.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Пошаговое руководство: экспорт результатов OCR в JSON

Прежде чем запускать распознавание текста, проверьте разрешение изображения отсканированного PDF-файла. Большинство механизмов оптического распознавания символов работают лучше всего, когда входные изображения страниц имеют разрешение 300 точек на дюйм. Ниже 200 DPI точность распознавания заметно падает. При разрешении выше 400 DPI время обработки увеличивается без существенного улучшения точности. Если ваш отсканированный PDF-файл содержит изображения страниц с низким разрешением, рассмотрите возможность увеличения их разрешения до 300 точек на дюйм, прежде чем запускать распознавание текста с выводом JSON. Дополнительный этап предварительной обработки заметно улучшает качество данных JSON.

Откройте отсканированный PDF-файл в инструменте оптического распознавания символов, который поддерживает структурированный вывод. Tesseract, наиболее широко используемый механизм оптического распознавания символов с открытым исходным кодом, поддерживает вывод JSON через интерфейс командной строки и через большинство приложений, входящих в его состав. В Tesseract добавление флага формата вывода создает файл JSON вместе с распознанным текстом. Коммерческие API OCR от Google Cloud Vision, Amazon Textract и Microsoft Azure Form Recnower по умолчанию возвращают JSON, при этом распознанный текст организован по страницам, блокам, абзацам, строкам и словам.

После запуска OCR с включенным выводом JSON откройте полученный файл в текстовом редакторе, чтобы понять его структуру. JSON будет содержать массивы объектов страницы. Каждый объект страницы содержит размеры страницы и массивы блочных объектов. Каждый блок содержит распознанный текст, оценку достоверности (обычно от 0 до 100) и координаты ограничивающего прямоугольника, которые описывают положение блока на странице. Знакомство с этой структурой позволит вам писать простые сценарии для извлечения именно тех данных, которые вам нужны. Инструмент OCR WukongPDF включает опцию экспорта JSON, которая упорядочивает распознанный текст с номерами страниц, показателями достоверности и позиционными данными, поэтому вам не нужно настраивать отдельный механизм OCR для получения структурированного вывода.

Общие структуры JSON для вывода OCR

Большинство результатов OCR JSON Scanned PDF также включают раздел глобальных метаданных в верхней части файла, в котором записано имя механизма OCR, версия, дата обработки, а также язык или языки, обнаруженные в документе. Эти метаданные полезны для контроля и устранения проблем с качеством оптического распознавания символов. Если вы обрабатываете документы из нескольких источников, метаданные сообщают вам, какой механизм выдал каждый результат и менялась ли версия механизма между пакетами, что может объяснить различия в качестве распознавания.

ПолеОписаниеПример значения
страницаНомер страницы в исходном документе3
текстРаспознанный текстовый контент«Счет № 4521»;
уверенностьДостоверность оптического распознавания символов от 0 до 10094,7
bboxОграничивающая рамка [x, y, ширина, высота] в пикселях[120, 340, 400, 28]
тип_блокаТип блока контента"абзац"; или «стол»; или «линия»;
языкОбнаружен язык текста"en"

Использование данных OCR JSON в автоматизированных рабочих процессах

Обработку ошибок стоит планировать заранее. При распознавании текста на странице с очень плохим качеством изображения оценка достоверности для большинства распознаваемых слов может оказаться ниже 50 процентов. Ваш рабочий процесс должен определить минимальный порог достоверности, ниже которого результаты помечаются для проверки человеком, а не автоматически попадают в базу данных или поисковый индекс. Отправка результатов оптического распознавания символов Scanned PDF с низким уровнем достоверности прямо в рабочую систему загрязняет данные ошибками, которые гораздо дороже исправлять позже, чем отмечать для проверки в момент извлечения.

Когда результаты OCR передаются в формате JSON, возможности автоматизации значительно расширяются. Распространенным шаблоном является написание сценария, который отслеживает папку на наличие новых отсканированных PDF-файлов, запускает распознавание текста с выводом JSON, анализирует JSON для извлечения определенных полей, таких как номера счетов или даты, из известных позиций на странице, и вставляет эти значения в базу данных или электронную таблицу. Поскольку JSON включает позиционные координаты, сценарий извлечения может ориентироваться на текст в определенных областях страницы независимо от общего содержимого документа.

Для поисковых приложений выходные данные JSON можно передать в поисковый индекс, например Elasticsearch или Algolia. Каждая страница становится документом, доступным для поиска, с номером страницы в качестве поля метаданных. Оценки достоверности позволяют настроить релевантность поиска, придав больший вес тексту оптического распознавания символов с высокой достоверностью. Пользователи, выполняющие поиск по термину, видят результаты, ранжированные на основе уверенности механизма оптического распознавания символов в том, что термин действительно появляется на странице, что снижает количество ложных совпадений из-за неправильно распознанных символов.

Для конвейеров искусственного интеллекта и машинного обучения структурированный вывод Scanned PDF OCR в формате JSON является стандартным входным форматом. Большие языковые модели и системы понимания документов используют представления JSON

Часто задаваемые вопросы

Как мне хранить файлы OCR JSON вместе с исходными PDF-файлами для долгосрочного доступа? Храните файлы JSON в той же папке, что и PDF-файлы с соответствующими именами файлов. Например, report-2025.pdf и report-2025.ocr.json. Такое соглашение об именах позволяет сценариям легко найти выходные данные OCR Scanned PDF для данного PDF-файла. Для больших архивов рассмотрите возможность хранения JSON в базе данных документов, поддерживающей полнотекстовый поиск, а не в виде плоских файлов.

Увеличивает ли вывод JSON в результате оптического распознавания символов размер файла по сравнению с обычным текстом?

Да, обычно в 3-5 раз. Отсканированный 10-страничный документ, содержащий 15 КБ обычного текста, может создать файл JSON размером от 50 до 75 КБ. Дополнительный размер определяется структурными метаданными: номерами страниц, ограничивающими рамками и показателями достоверности для каждого распознанного слова. Для большинства приложений это увеличение размера незначительно. Только в очень больших масштабах, таких как миллионы страниц, такое хранилище становится достойным планирования.

Можно ли преобразовать существующий обычный текст Отсканированный PDF вывод OCR в JSON?

Не осмысленно. Как только результаты OCR преобразуются в простой текст, позиционные данные и показатели достоверности теряются и не могут быть восстановлены только по тексту. Если вам нужны структурированные данные OCR из ранее обработанных документов, наиболее надежный подход — повторно запустить OCR для исходных отсканированных PDF-файлов с включенным выводом JSON.

Какие механизмы оптического распознавания символов создают наиболее полезный вывод JSON?

Облачные службы оптического распознавания символов от Google, Amazon и Microsoft обычно выдают наиболее подробный результат в формате JSON с ограничивающими рамками на уровне слов и оценками достоверности. Tesseract создает надежный JSON на уровне строк и слов. Лучший выбор зависит от вашего объема, бюджета и того, позволяют ли требования конфиденциальности отправлять документы в облачный сервис.

Могу ли я преобразовать вывод OCR JSON обратно в PDF-файл с возможностью поиска? Да, хотя для этого процесса требуется библиотека создания PDF-файлов, которая может размещать текстовые объекты в определенных координатах. Данные ограничивающего прямоугольника в выходных данных JSON сообщают вам, где именно находится каждое слово на странице. Это процесс, обратный процессу извлечения, и он полезен, когда вам нужно создать PDF-файл с возможностью поиска из исправленного текста OCR после исправления ошибок распознавания в данных JSON.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →