Tips & Tricks

Как запустить OCR для большого пакета отсканированных PDF-файлов одновременно для большого проекта

У вас есть папка с 200 отсканированными PDF-файлами. Старые контракты, архивные отчеты, протоколы встреч десятилетней давности. Ни один из них не доступен для поиска. Чтобы найти конкретный документ, нужно открыть каждый файл и просканировать его глазами, а это медленно, подвержено ошибкам и неустойчиво по мере роста коллекции. Вам нужно запустить OCR для всего пакета сразу, а не для одного файла за раз.

Пакетное распознавание текста — это решение, и оно более доступно, чем думает большинство людей. Вам не нужна система документооборота предприятия или ферма серверов. В зависимости от размера вашего проекта и выбранных вами инструментов к концу дня у вас может быть 200 PDF-файлов с возможностью поиска. Ключом является выбор правильного подхода с учетом вашего объема и вашего комфорта при использовании технологий.

How to Run OCR on a Large Batch of Scanned PDFs All at Once for a Big Project

Перед началом: систематизация и оценка пакета документов

Большой пакетный проект OCR живет или умирает на стадии подготовки. Начните с сбора всех PDF-файлов в одну папку. Назовите их последовательно. Если файлы в настоящее время называются scan001.pdf, scan002.pdf и т. д., переименуйте их во что-нибудь описательное, прежде чем запускать распознавание текста. Процесс оптического распознавания символов не меняет имена файлов, а найти конкретный документ позже будет гораздо проще, если имя файла сообщит вам, что он содержит.

Затем оцените качество ваших сканирований. Откройте случайную выборку из 10–20 файлов и проверьте разрешение, перекос и контрастность. Если большинство сканирований имеют разрешение 300 точек на дюйм или выше, расположены вертикально и содержат темный текст на светлом фоне, пакетное распознавание текста даст отличные результаты с минимальным вмешательством вручную. Если сканы имеют низкое разрешение, перекошены или имеют цветной фон, ожидайте более низкую точность и запланируйте время для проверки и исправления вручную. Тест, проведенный Ассоциацией PDF в 2025 году, показал, что точность распознавания при чистых сканах с разрешением 300 точек на дюйм в среднем превышает 97%, тогда как при сканировании тех же документов со 150 точками на дюйм снижается примерно до 87% (Ассоциация PDF, «Отчет об эффективности распознавания текста», 2025). Качество вашего вклада определяет качество вашего результата.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Вариант 1. Пакетное распознавание текста на основе браузера для небольших и средних пакетов

Для пакетов, содержащих от 20 до 30 файлов, браузерный инструмент OCR PDF обеспечивает самый простой путь. Инструмент OCR WukongPDF обрабатывает несколько файлов за один сеанс. Загрузите файлы, выберите язык OCR и начните обработку. Инструмент добавляет текстовый слой с возможностью поиска на каждую страницу и возвращает файлы в виде PDF-файлов с возможностью поиска. Загрузите их все после завершения обработки.

Этот подход не требует установки программного обеспечения, написания сценариев и технической настройки. Компромисс заключается в том, что каждый файл необходимо загружать и скачивать, что занимает время, пропорциональное скорости вашего интернет-соединения и размерам файлов. Для 10 файлов по 5 МБ каждый общий объем передачи составляет 50 МБ вверх и 50 МБ вниз, что возможно при любом широкополосном соединении. Для 100 файлов по 20 МБ каждый общий объем передачи составляет 2 ГБ вверх и 2 ГБ вниз, что в большинстве случаев займет некоторое время. В этом масштабе настольный подход становится более практичным.

Вариант 2: настольное программное обеспечение для больших партий и полного контроля

Adobe Acrobat Pro включает функцию пакетного распознавания текста, предназначенную именно для этого случая использования. Откройте Acrobat, перейдите в «Инструменты», выберите «Улучшить сканирование» и выберите «Распознать текст». Выберите «В нескольких файлах». из раскрывающегося списка. Добавьте папку, содержащую ваши PDF-файлы, настройте параметры OCR, язык, выходной формат и качество и нажмите «ОК». Acrobat обрабатывает каждый файл в папке и сохраняет доступные для поиска версии вместе с оригиналами или в новой выходной папке по вашему выбору.

Подход к настольному компьютеру имеет несколько преимуществ для крупных проектов. Это не зависит от скорости вашего интернета. Он может работать всю ночь, пока ваш компьютер простаивает. Он дает вам полный контроль над параметрами оптического распознавания документов, требующих специальной обработки, например файлов, содержащих несколько языков, необычные шрифты или страницы со смешанной ориентацией. Главный недостаток – стоимость. Для Acrobat Pro требуется подписка. Если он у вас уже есть в работе, вас ждет функция пакетного распознавания текста. Если вы этого не сделаете, оцените, оправдывает ли размер проекта расходы на подписку.

Вариант 3. Бесплатное распознавание текста из командной строки для технических пользователей

Tesseract, механизм оптического распознавания символов с открытым исходным кодом, поддерживаемый Google, может обрабатывать целую папку PDF-файлов с помощью сценария оболочки. Установите Tesseract через Homebrew на Mac или с помощью встроенного установщика Windows. Напишите простой циклический сценарий, который берет каждый PDF-файл в папке, преобразует его в изображения, запускает Tesseract для каждого изображения и собирает распознанный текст в новый PDF-файл с возможностью поиска. Этот подход ничего не стоит, работает полностью автономно и масштабируется до тысяч файлов.

Компромисс – техническая сложность. Tesseract — это инструмент командной строки. Требуется удобство работы с терминалом, базовые знания сценариев и терпение для отладки неизбежных крайних случаев: PDF-файлы со страницами разного размера, файлы, в которых метаданные DPI отсутствуют или неверны, документы, в которых язык распознавания текста необходимо указывать для каждого файла. Для технически подкованного пользователя, работающего над личным проектом, Tesseract — это мощный и бесплатный инструмент. Для тех, кто хочет решение, которое работает без изучения интерфейса командной строки, подходы на основе браузера или рабочего стола гораздо более доступны.

Контроль качества: проверка пакета результатов оптического распознавания текста

После запуска пакетного оптического распознавания большого набора файлов Отсканированные PDF систематическая проверка качества предотвращает ситуацию, когда шесть месяцев спустя вы обнаружите, что четверть файлов имеют искаженные текстовые слои. Вам не обязательно проверять каждую страницу каждого файла, но вам следует проверить репрезентативную выборку.

Откройте один файл в начале пакета, один в середине и один в конце. Для каждого файла запустите поиск Ctrl+F по слову, которое вы видите на странице. Попробуйте выделить текст курсором. Просмотрите абзац, сравнивая его с видимым текстом. Если все три образца файлов пройдут эти тесты, пакетное распознавание текста, скорее всего, будет успешным во всех отношениях. Если в одном или нескольких образцах обнаружены проблемы, откройте большую выборку (возможно, 10 %), чтобы оценить, является ли проблема изолированной или широко распространенной.

К частым сбоям пакетного оптического распознавания относятся файлы, язык которых был установлен неправильно, в результате чего все символы с диакритическими знаками или нелатинские символы отображаются как тарабарщина, файлы с серьезным перекосом, которые не удалось исправить алгоритму исправления перекоса, а также файлы, разрешение которых было слишком низким для надежного распознавания. Для каждой из этих ошибок существует определенное исправление: исправьте настройки языка, вручную исправьте отсканированное изображение или выполните повторное сканирование с более высоким разрешением перед повторным запуском OCR для затронутых файлов.

После того как пакетное распознавание текста завершится и пройдет проверку качества, храните исходные неотсканированные файлы отдельно от версий, обработанных распознаванием текста. Дисковое пространство стоит недорого. Наличие оригиналов означает, что вы сможете повторно запустить распознавание текста в будущем, если станет доступен более совершенный механизм распознавания или если вы обнаружите, что определенная настройка дала бы лучшие результаты. Эта небольшая архивная привычка спасла бесчисленное количество проектов от необходимости повторного сканирования физических документов, которые были выброшены после первого прохода оптического распознавания символов.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →