Страница заметок о встрече, написанная от руки в блокноте, сфотографированная на телефон и сохраненная в виде отсканированного PDF-файла, содержит ценную информацию, совершенно недоступную для поиска, копирования и чтения с экрана. Слова видны человеческому глазу, но для компьютера они представляют собой всего лишь фигуры в изображении. Преобразование этих рукописных заметок в редактируемый печатный текст делает их доступными для поиска, копирования и использования в любом документе или приложении.
Распознавание рукописного текста сложнее, чем распознавание печатного текста, поскольку почерк каждого человека уникален. Формы букв у разных людей различаются гораздо сильнее, чем печатные шрифты, и механизм распознавания должен учитывать эту изменчивость.
Для преобразования рукописных заметок в отсканированном документе OCR PDF в редактируемый печатный текст требуется механизм распознавания рукописного ввода, который может распознавать рукописный и печатный рукописный ввод, а также рабочий процесс, который обрабатывает более высокий уровень ошибок при распознавании рукописного текста по сравнению с распознаванием печатного текста. Инструменты Scanned PDF и OCR WukongPDF поддерживают распознавание текста, а приведенные ниже рекомендации посвящены максимальному повышению точности распознавания рукописного текста.

Почему распознавание рукописного текста значительно сложнее, чем печатного текста OCR
Оптическое распознавание текста печатного текста работает путем сопоставления форм символов с известными образцами шрифтов. Буква А в Times New Roman выглядит одинаково, печатаю ли я ее, печатаете ли вы или печатает машина. Механизм распознавания имеет четкий, согласованный шаблон для каждого символа каждого распространенного шрифта. Распознавание рукописного ввода не имеет таких шаблонов, потому что буква А у каждого человека выглядит по-разному. Движок должен распознавать статистические закономерности рукописных символов, несмотря на огромные различия в форме, размере, наклоне и соединении букв.
Курсивный почерк, в котором буквы внутри слова соединены, добавляет дополнительный уровень сложности. Механизм распознавания должен сегментировать связанные буквы на отдельные символы, прежде чем распознавать каждый из них. Неправильная сегментация, разделение буквы m на r и n или объединение двух букв в одну — основной источник ошибок распознавания рукописного текста. Печатный почерк, где каждая буква пишется отдельно, значительно проще обрабатывается механизмами распознавания и дает более точные результаты.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
Подготовка отсканированного изображения к распознаванию рукописного ввода
Качество исходного изображения является важнейшим фактором точности распознавания рукописного текста, более важным, чем выбор механизма распознавания. Отсканируйте или сфотографируйте рукописную страницу с разрешением не менее 300 точек на дюйм, при этом для мелкого или плотного почерка рекомендуется разрешение 600 точек на дюйм. Обеспечьте равномерное освещение без теней по всей странице. Держите камеру или телефон параллельно странице, чтобы минимизировать искажение перспективы. Чем лучше исходное изображение, тем точнее распознавание.
Улучшите отсканированное изображение перед запуском распознавания. Увеличьте контрастность, чтобы затемнить чернила и осветлить фон бумаги. Примените фильтр резкости, чтобы сделать края рукописных штрихов более четкими. Преобразуйте изображение в оттенки серого или чисто черно-белое с помощью адаптивного порога, который справляется с неравномерным освещением лучше, чем глобальный порог. Улучшенное изображение представляет механизму распознавания более четкие и четкие формы символов.
Использование механизмов оптического распознавания текста с возможностью рукописного ввода
Механизмы оптического распознавания символов общего назначения, такие как Tesseract, включают режимы распознавания рукописного текста, которые можно включить в настройках конфигурации. В Tesseract укажите языковую модель, включающую поддержку рукописного ввода, и установите режим сегментации страниц, чтобы изображение рассматривалось как единый блок текста. Google Cloud Vision API и Microsoft Azure Computer Vision включают возможности распознавания рукописного ввода в свои облачные службы OCR.
Специальные приложения для распознавания рукописного текста, такие как Nebo, GoodNotes или функция преобразования рукописного текста в текст Microsoft OneNote, оптимизированы специально для рукописного ввода и часто дают лучшие результаты, чем обычные механизмы OCR, встроенные в службу рукописного ввода. Экспортируйте распознанный текст из приложения для рукописного ввода и при необходимости повторно интегрируйте его с исходным отсканированным PDF-файлом.
| Фактор | Влияние на точность | Рекомендация |
|---|---|---|
| Разрешение сканирования | Более высокое разрешение обеспечивает больше деталей для каждого символа. | Минимум 300 DPI, 600 DPI для мелкого почерка. |
| Освещение | Тени и неравномерное освещение скрывают края персонажей. | Рассеянное, равномерное освещение; избегайте вспышки камеры |
| Стиль почерка | Печатный почерк проще, чем рукопись | Если вы контролируете источник, пишите в печатном виде, чтобы получить лучшие результаты. |
| Улучшение изображения | Более чистый ввод обеспечивает более чистое распознавание | Увеличение контрастности, резкости, применение адаптивного порога |
Просмотр и исправление распознанного текста
Распознавание рукописного текста всегда приводит к ошибкам, обычно вероятность ошибок составляет 5–20 % в зависимости от качества рукописного ввода и условий изображения. Сравните распознанный текст с исходной рукописной страницей и исправьте неправильно распознанные слова. Этап исправления требует времени, но он необходим для того, чтобы результат можно было использовать для поиска, копирования и дальнейшего редактирования.
Для документов, требующих идеальной точности, таких как юридические записи или медицинские записи, рассматривайте распознанный текст как индекс поиска, а не как замену исходного рукописного текста. Сохраните исходное отсканированное изображение в качестве достоверной записи. Используйте распознанный текст, чтобы включить поиск по ключевым словам, позволяющий найти соответствующую страницу в исходном сканированном файле. Комбинация распознанного текста с возможностью поиска и исходного изображения обеспечивает лучшее из обоих: удобство поиска по тексту и точность изображения.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
