Вы сканируете бумажную форму, которую кто-то заполнил вручную. Печатный текст на форме четкий. Рукописные ответы в полях беспорядочны, но разборчивы для человека. Вы запускаете распознавание текста при сканировании, надеясь, что форма будет доступна для поиска, а рукописные ответы можно будет извлечь в виде текста. Результат распознавания печатного текста почти идеален. Результат распознавания почерка — тарабарщина. Механизм распознавания, обученный на печатных шрифтах, не может понять изменчивые, неправильные формы человеческого почерка.
Документы, содержащие как печатный, так и рукописный текст, представляют собой двойную проблему для механизмов OCR PDF. Для печатного текста требуется стандартное распознавание текста, которое работает хорошо. Для рукописного ввода требуется специализированное распознавание рукописного ввода, которое менее точно и требует других настроек. Для обработки обоих типов контента в одном документе требуется стратегия, которая соответствующим образом обрабатывает каждый тип контента.

Почему механизму оптического распознавания текста настолько сложнее писать от руки
Оптическое распознавание текста печатного текста работает путем сопоставления форм символов с известными образцами шрифтов. Буква «а» в 12-пунктовом Times New Roman каждый раз выглядит почти одинаково. Механизм OCR хранит модель того, как выглядят буквы Times New Roman, и сопоставляет ее с этой моделью. Почерк не имеет такой модели. Каждый человек "а" выглядит иначе. Даже «a» одного и того же человека варьируется от случая к случаю в зависимости от окружающих букв, скорости письма, угла наклона пера и усталости. Не существует фиксированного шаблона, которому можно было бы соответствовать.
Для распознавания рукописного ввода используются модели машинного обучения, обученные на тысячах или миллионах образцов почерка. Эти модели изучают статистические закономерности изменения рукописных букв и могут распознавать символы, даже если они значительно отличаются от какого-либо одного шаблона. Точность распознавания рукописного текста значительно улучшилась благодаря глубокому обучению, но она по-прежнему значительно отстает от распознавания печатного текста. Тест PDF Association, проведенный в 2025 году, показал, что точность распознавания печатного текста превышает 97 % при чистом сканировании. Точность распознавания рукописного текста по тому же тесту составляла примерно от 80% до 85%, что означает, что примерно одно из каждых пяти-шести рукописных слов содержит ошибку (PDF Association, «Отчет об эффективности распознавания текста», 2025 г.).
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
Стратегии распознавания текста в смешанных печатных и рукописных документах
Наиболее эффективная стратегия — разделить документ на печатные и рукописные области и обработать каждую с помощью соответствующего механизма распознавания. Это разделение можно выполнить вручную путем обрезки или маскировки документа на разделы или автоматически с помощью механизма распознавания, который определяет тип контента для каждой области.
Инструмент оптического распознавания символов WukongPDF определяет, напечатана ли каждая текстовая область на странице или написана от руки, и применяет соответствующую модель распознавания. На бланке с напечатанными метками и рукописными ответами метки распознаются по модели печатного текста с высокой точностью. Рукописные ответы обрабатываются с помощью модели рукописного ввода с той точностью, которую позволяет качество рукописного ввода. Результатом является один текстовый слой, объединяющий оба результата распознавания.
Повышение точности распознавания рукописного текста за счет лучшего сканирования
Качество сканирования оказывает большее влияние на распознавание рукописного текста, чем на распознавание печатного текста. Сканируйте с разрешением минимум 300 DPI. Более высокое разрешение дает механизму распознавания больше пикселей на символ для анализа. Используйте оттенки серого или цветной режим, а не чисто черно-белый. Тонкие серые вариации рукописного штриха несут информацию о форме букв, которую игнорирует чисто черно-белое пороговое определение. Рукописное «е»; где цикл частично заполнен, может быть распознан в оттенках серого, но становится неразличимым пятном при переходе к черно-белому.
Убедитесь, что почерк максимально темный и последовательный. Почерк карандашом распознать труднее, чем ручку, потому что графит создает более слабую и изменчивую линию. Синие или черные чернила на белой бумаге обеспечивают лучший контраст. Красные чернила, зеленые чернила или цветная бумага снижают контрастность и точность. Если вы контролируете процесс заполнения форм, укажите, что формы должны быть заполнены черными чернилами для достижения наилучших результатов распознавания. Эта небольшая инструкция в самой форме может повысить точность извлечения данных на 10–15 процентных пунктов.
Просмотр и исправление результатов распознавания рукописного текста
После OCR текстовый слой Scanned PDF будет содержать ошибки, сосредоточенные в рукописных областях. Печатный текст будет практически идеальным. Сосредоточьте свой обзор на рукописных ответах. Откройте PDF-файл и найдите типичные ошибки распознавания рукописного текста. Цифру 1 часто называют буквой l. Число 0 часто воспринимается как буква О. Сочетание букв «th» означает букву «th». часто обозначается как «+h»; потому что перекладина буквы t переходит в букву h.
Для данных формы, которые необходимо извлечь в базу данных или электронную таблицу, крайне важно вручную просмотреть поля, заполненные вручную. Механизм распознавания обеспечивает наилучшее предположение. Человек должен сверить это предположение с оригинальным почерком. На этом этапе проверки экономия времени при распознавании текста частично компенсируется необходимостью контроля качества человеком. Чистая экономия зависит от объема. Для 10 форм ввод данных вручную может оказаться быстрее, чем распознавание текста и проверка. Для 500 форм OCR плюс проверка выполняется значительно быстрее, поскольку этап проверки ограничен полями, в которых достоверность OCR низкая. Вывод WukongPDF OCR включает оценку достоверности для каждого распознанного текстового блока, что позволяет вам сортировать по достоверности и просматривать только результаты с низкой достоверностью.
Для форм, которые будут обрабатываться в больших объемах, таких как формы приема на лечение, страховые претензии или государственные заявления, сама конструкция формы может улучшить точность распознавания рукописного текста. Разработайте форму с отдельными полями символов, по одному полю на букву, а не с одной длинной строкой для имени или адреса. Отдельные поля символов заставляют пишущего разделять буквы, что значительно повышает точность распознавания, поскольку механизм OCR может изолировать каждый символ перед попыткой распознавания. Этот же принцип используется в налоговых формах и иммиграционных документах по всему миру. Поля немного неудобны для человека, заполняющего форму, но они позволяют автоматически извлекать данные в большом масштабе, что является компромиссом, которого требует обработка больших объемов форм.
Практическая проверка качества после оптического распознавания смешанных документов: запустите поиск распространенных шаблонов ошибок оптического распознавания символов, которые указывают на то, что механизм путает почерк с печатным текстом. Найдите "cl" и убедитесь, что это не должно было быть «d». Найдите "0" и убедитесь, что каждый экземпляр на самом деле равен нулю, а не заглавной букве O. Найдите «1»; и убедитесь, что это единица, а не строчная буква L или заглавная I. Эти три поиска выявляют большинство ошибок OCR на уровне символов как при распознавании печатных, так и рукописных символов. Исправьте найденные ошибки, а затем запустите еще раз поиск конкретных имен, чисел или дат, которые имеют решающее значение для цели документа. Форма, в которой в печатных инструкциях есть опечатка, раздражает. Форма, в которой написана неправильная дозировка лекарства, опасна.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
