Запуск OCR PDF в папке со сканированными документами должен создать PDF-файлы с возможностью поиска, имена которых соответствуют оригиналам. Когда инструменты пакетного оптического распознавания переименовывают выходные файлы в общем виде, например, output1.pdf, output2.pdf, связь между оригиналом и версией, доступной для поиска, теряется. Сохранение имен файлов с помощью процесса оптического распознавания символов позволяет организовать и отслеживать отсканированные документы.
Сохранение имени файла — это деталь конфигурации, а не ограничение функции. Большинство инструментов OCR по умолчанию генерируют имена выходных файлов на основе имен входных файлов или позволяют указать шаблон выходного именования. Ключевым моментом является поиск правильного параметра или флага командной строки перед запуском пакета, а не после обнаружения того, что 200 файлов были переименованы.
Инструменты оптического распознавания символов Scanned PDF WukongPDF обрабатывают документы индивидуально и в пакетном режиме, сохраняя при этом исходные имена файлов.

Пакетное распознавание текста с помощью мастера действий Acrobat Pro
Мастер действий Acrobat Pro автоматизирует многоэтапную обработку PDF-файлов в папке. Перейдите в Инструменты, Мастер действий, Новое действие. Добавьте к действию шаг «Распознать текст», выбрав правильный язык распознавания и настройки вывода. Добавьте шаг «Сохранить», который сохраняет файлы в указанную выходную папку, при необходимости добавляя суффикс, например _OCR, чтобы отличать файлы, доступные для поиска, от оригиналов.
Запустите действие во входной папке. Acrobat открывает каждый файл, запускает распознавание текста, сохраняет результат с суффиксом, добавленным к исходному имени файла, и переходит к следующему файлу. Выходная папка содержит доступные для поиска PDF-файлы с именами типа report_OCR.pdf, соответствующими исходному отчету report.pdf. Суффиксный подход сохраняет исходное имя файла, четко указывая, какие файлы были обработаны с помощью OCR.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
Пакетное распознавание текста из командной строки с помощью Tesseract
Tesseract обрабатывает по одному файлу изображения за раз. Для пакетного распознавания папки отсканированных PDF-файлов сначала преобразуйте каждую PDF-страницу в изображение, запустите Tesseract, а затем повторно объедините ее в PDF-файл с возможностью поиска. Сценарий оболочки управляет конвейером. Для каждого PDF-файла в папке сценарий извлекает базовое имя файла, преобразует страницы в изображения TIFF, запускает Tesseract с соответствующим языковым флагом и генерирует PDF-файл с возможностью поиска с исходным базовым именем файла.
Сценарий использует расширение параметров для удаления расширения файла: base=${f%.pdf} дает имя файла без расширения .pdf. Выходные данные Tesseract называются $base, а полученный PDF-файл с возможностью поиска сохраняется как ${base}_searchable.pdf. Исходное имя файла сохраняется в выходном имени. Однострочный цикл обрабатывает всю папку: for f в *.pdf; сделать тессеракт $f ${f%.pdf} -l eng PDF; сделанный.
Оптимизированное пакетное распознавание текста с помощью OCRmyPDF
OCRmyPDF — это инструмент командной строки на основе Python, который добавляет текстовый слой OCR к существующим PDF-файлам. Он выполняет внутреннее извлечение изображений, распознавание символов и сборку PDF-файлов. Одна команда обрабатывает один PDF-файл: ocrmypdf input.pdf output.pdf. При выводе изображения страниц сохраняются, а за ними добавляется распознанный текст в виде невидимого слоя.
Для пакетной обработки OCRmyPDF принимает путь к папке с флагом --batch или может быть зациклен в сценарии оболочки. Ключевое преимущество перед Tesseract для обработки PDF заключается в том, что OCRmyPDF работает напрямую с вводом и выводом PDF. Никакого преобразования промежуточного изображения не требуется. Имя выходного файла можно указать для каждого файла, сохраняя исходное соглашение об именах. Для оцифровки больших объемов отсканированных документов OCRmyPDF в сочетании с циклом оболочки обеспечивает наиболее эффективный путь от необработанных сканирований до архивов с возможностью поиска.
| Инструмент | Пакетный метод | Обработка имен файлов |
|---|---|---|
| Мастер действий Acrobat Pro | Создать действие, применить к папке | Сохраняет исходное имя файла, добавляет суффикс |
| Тессеракт CLI | Оболочка для цикла по папке | Вывод соответствует имени входного файла |
| OCRmyPDF | Одна команда для каждого файла или пакета | Перезаписывает или создает новый файл в соответствии с настройками |
Проверка выходных данных пакетного распознавания
После пакетной обработки проверьте образцы выходных файлов перед архивированием оригиналов. Откройте от трех до пяти выходных PDF-файлов из разных частей списка файлов, отсортированного по алфавиту. Найдите слово, видимое на отсканированном изображении. Если поиск находит слово, распознавание текста для этого файла выполнено успешно. Выборочно проверьте первую, среднюю и последнюю страницы каждого файла выборки. Качество оптического распознавания символов в документе может различаться, если страницы имеют разное качество сканирования.
Когда дело доходит до рабочих процессов с документами, для документов, в которых распознавание текста не удалось, о чем свидетельствует PDF-файл, в котором поиск ничего не дает, повторно запустите распознавание текста с измененными настройками. Увеличьте разрешение изображения до 400 DPI, если исходное сканирование низкого качества. Попробуйте другой механизм оптического распознавания символов, если Tesseract дал плохие результаты. Обрабатывайте проблемные файлы по отдельности, а не повторно запускайте весь пакет.
Пакетное распознавание символов с сохранением имен файлов преобразует папку недоступных отсканированных документов в архив с возможностью поиска, где каждый файл можно отследить до его оригинала. Имя файла является связующим звеном между исходным сканированием и версией с улучшенным распознаванием текста.
Долговременное хранение отсканированных PDF-файлов с функцией оптического распознавания символов
После настройки, после пакетной обработки OCR, сохраните PDF-файлы с возможностью поиска в месте, сохраняя как изображения страниц, так и текстовый слой OCR. Формат PDF/A со встроенным текстовым слоем является стандартом архивирования. Преобразуйте выходные данные OCR в PDF/A с помощью Acrobat Pro или Ghostscript с настройкой вывода PDF/A.
На практике текстовый слой OCR добавляет минимальные затраты на размер файла, обычно от 5 до 15 процентов. Компромисс файлов немного большего размера для удобства поиска почти всегда того стоит. Отсканированный документ, который нельзя найти, значительно менее полезен, чем тот, который можно.
На практике структура каталогов для пакетного вывода OCR должна отражать структуру ввода при обработке вложенных папок. Рекурсивный пакетный сценарий, сохраняющий структуру относительных путей, гарантирует, что файлы с улучшенным распознаванием текста сохраняют ту же организационную иерархию, что и оригиналы.
Когда дело доходит до рабочих процессов с документами, для очень больших пакетных проектов OCR с тысячами документов рассмотрите возможность разделения рабочей нагрузки между несколькими сеансами или компьютерами. OCR требует больших вычислительных ресурсов, и обработка пакета из десяти тысяч страниц может занять несколько часов на одном компьютере.
После настройки, после завершения пакетного проекта OCR, создайте манифест обработки, в котором будут перечислены все входные файлы, их выходные файлы, используемый механизм OCR и настройки, а также дата обработки. Манифест служит документацией и записью обработанных файлов.
Если посмотреть на это практически, то на практике переход от отсканированных архивов, недоступных для поиска, к коллекциям, доступным для поиска с помощью оптического распознавания символов, является одним из наиболее эффективных мероприятий по оцифровке. Возможность поиска ранее недоступных документов превращает их из статических записей в активные информационные ресурсы.
Скорость обработки OCR зависит от сложности документа. Текстовые страницы обрабатываются быстро. Страницы с таблицами, смешанными шрифтами или декоративными элементами занимают больше времени. Пакет однородных текстовых страниц заполняется быстрее, чем пакет различного контента.
В большинстве инструментов настройка языка OCR влияет на время и точность пакетной обработки. Выбор только тех языков, которые действительно присутствуют в документах, позволяет избежать ненужных затрат на обработку и снижает вероятность ошибочного распознавания символов из неиспользуемых языковых моделей.
Для документов, содержащих как текст, так и фотографии, механизм OCR может попытаться распознать текст в областях фотографии, создавая шумовые символы. Фильтрация пост-OCR удаляет эти артефакты, анализируя пространственное распределение распознанного текста.
Обычно настройка DPI для входных изображений OCR обеспечивает баланс между скоростью обработки и точностью. Стандартная рекомендация — 300 DPI. Разрешение 400 точек на дюйм повышает точность печати небольшого текста. Разрешение 200 DPI обрабатывается быстрее, но мелкие символы могут быть пропущены.
После пакетного оптического распознавания запустите тест поиска по ключевым словам в обработанных файлах, используя термины, которые, как известно, встречаются в оригиналах. Файлы, в которых ключевое слово не найдено, требуют повторной обработки с измененными настройками или проверки вручную.
Выходные файлы OCR должны храниться в структуре папок, которая отделяет обработанные файлы от оригиналов. Это предотвращает случайную повторную обработку файлов, уже улучшенных с помощью OCR, и сохраняет порядок в архиве.
В этом контексте на практике текстовый слой OCR можно извлечь и сохранить отдельно в виде обычного текстового файла для каждого документа. Отдельные текстовые файлы поддерживают полнотекстовый поиск по архиву без открытия каждого PDF-файла по отдельности.
При обработке документов для отсканированных архивов высокой ценности рассмотрите возможность запуска OCR с двумя разными механизмами и сравнения результатов. Расхождения между двигателями указывают на неопределенное распознавание, которое требует ручной проверки.
Пакетное распознавание текста — это мост между бумажными архивами и цифровым поиском. Картотека бумажных документов после сканирования и обработки с помощью оптического распознавания символов становится доступной для поиска базой знаний. Переход от физического к цифровому формату с возможностью поиска — одно из наиболее эффективных преобразований управления информацией, которые может осуществить организация.
Пакетное распознавание текста с сохранением имени файла — это мост между папкой недоступных отсканированных документов и цифровым архивом с возможностью поиска. Обработка автоматизирована. Имена файлов обеспечивают отслеживаемость. Текстовый слой OCR делает каждый документ доступным для обнаружения. Эта комбинация преобразует статическую коллекцию в активный информационный ресурс.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
