Tips & Tricks

Как распознать нарисованную от руки диаграмму или эскиз внутри PDF-файла

Оптическое распознавание символов предназначено для текста. Он находит строки символов, сегментирует их на отдельные буквы и сопоставляет эти формы с известными шаблонами символов. Нарисованная от руки диаграмма, блок-схема, нарисованная на доске, организационная схема, нарисованная на салфетке, принципиальная схема, нарисованная карандашом в блокноте инженера, почти не содержат машинораспознаваемого текста. Стандартное оптическое распознавание текста либо ничего не создает, либо создает беспорядочную мешанину бессмысленных символов из-за неправильной классификации линий и фигур как букв.

Диаграммы требуют принципиально иного подхода к распознаванию, чем текст.

Извлечение информации из нарисованной от руки диаграммы с помощью инструментов OCR PDF означает использование специализированного распознавания диаграмм, ручных аннотаций или гибридного подхода, при котором OCR обрабатывает любые текстовые метки, а экспорт изображений сохраняет структуру диаграммы для интерпретации вручную или с помощью искусственного интеллекта. Инструменты Scanned PDF и OCR WukongPDF обрабатывают части текста, а приведенный ниже рабочий процесс описывает, что делать с частями, которые OCR не может прочитать.

How to OCR a Hand-Drawn Diagram or Sketch Inside a PDF

Почему стандартное распознавание текста не работает на диаграммах и эскизах

Механизмы оптического распознавания символов ищут статистические шаблоны текста: примерно горизонтальные строки символов примерно одинаковой высоты, равномерно расположенные, с пробелами между словами и буквами, попадающими в ожидаемые диапазоны. Нарисованная от руки диаграмма нарушает каждое из этих предположений. Линии не горизонтальные. Фигуры не являются персонажами. Промежутки между элементами не имеют никакого отношения к интервалу между текстами. Механизм применяет свою текстовую модель к контенту, который не соответствует модели, и на выходе получается шум.

Тот же движок, который достигает 98% точности на печатной странице, может возвращать 0% значимых результатов на диаграмме не потому, что движок плох, а потому, что его никогда не просили сделать то, что от него просят. Это фундаментальное несоответствие, которое необходимо понять, прежде чем приступать к распознаванию символов на диаграмме. Вопрос не в том, какой механизм OCR использовать. Вопрос в том, какая информация вам нужна из диаграммы и может ли OCR извлечь эту информацию или требуется другой инструмент.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Извлечение текстовых меток с сохранением диаграммы

Большинство диаграмм, нарисованных от руки, содержат некоторый текст: метки в полях блок-схем, названия осей на эскизных графиках, имена компонентов на принципиальных схемах, имена в полях организационных диаграмм. С этим текстом действительно может помочь OCR. Запустите распознавание текста на странице схемы так же, как и в любом отсканированном документе. Движок найдет текстовые метки и вернет их как распознанные строки. Не обращайте внимания на шум, создаваемый элементами диаграммы. Отфильтруйте выходные данные на наличие узнаваемых слов и фраз, которые станут нужными вам текстовыми метками.

Экспортируйте страницу диаграммы как изображение с высоким разрешением вместе с текстовым выводом OCR. Изображение сохраняет структуру визуальной диаграммы. Текстовый вывод OCR предоставляет метки с возможностью поиска, которые позволяют находить определенные диаграммы в коллекции, не открывая каждое изображение. Сочетание ярлыков с возможностью поиска и визуального изображения служит большинству практических целей лучше, чем каждый из них по отдельности. Вы можете найти блок-схему, содержащую утверждение бюджета, и открыть изображение, чтобы увидеть диаграмму, при этом механизму OCR не нужно понимать структуру диаграммы.

Использование инструментов распознавания диаграмм на базе искусственного интеллекта

Специализированные инструменты, обученные на данных диаграмм, могут интерпретировать нарисованные от руки диаграммы так, как не могут обычные механизмы оптического распознавания символов. Эти инструменты распознают распространенные типы диаграмм, блок-схемы, организационные диаграммы, интеллектуальные карты, сетевые диаграммы и преобразуют их в редактируемые версии в таких приложениях, как Microsoft Visio, Lucidchart или Draw.io. Распознавание не является идеальным, линии могут быть неправильно интерпретированы, формы могут быть неправильно классифицированы, но выходные данные являются отправной точкой для ручной очистки, которая намного быстрее, чем перерисовка диаграммы с нуля.

Отсканируйте диаграмму с максимально возможным разрешением, в идеале 600 точек на дюйм, прежде чем передать ее в инструмент распознавания диаграмм. Нарисованные от руки линии тоньше и менее последовательные, чем напечатанные, а более высокое разрешение дает алгоритму распознавания больше данных для работы. Сканирование с разрешением 150 точек на дюйм, которое подходит для распознавания текста, создает неоднозначные линии на нарисованной от руки диаграмме, где алгоритм распознавания не может отличить намеренную линию, пятно и текстуру бумаги.

Подготовка диаграммы для улучшения результатов распознавания

Качество исходного изображения влияет на точность распознавания больше, чем выбор инструмента. Сфотографируйте диаграмму при равномерном рассеянном освещении. Избегайте теней, отбрасываемых телефоном или камерой. Положите бумагу на плоскую высококонтрастную поверхность. Скомпонуйте кадр так, чтобы заполнить изображение диаграммой, минимизируя пустую окружающую область. Хорошо освещенная, плоская фотография карандашного наброска с высоким разрешением может дать лучшие результаты распознавания, чем плохо освещенная фотография профессионально нарисованной диаграммы.

Улучшите изображение перед отправкой его в инструмент распознавания. Увеличьте контрастность, чтобы затемнить линии и осветлить фон бумаги. Преобразуйте в оттенки серого, если цвет не имеет смысла. Примените фильтр небольшой резкости, чтобы сделать края линий более четкими. Эти улучшения, доступные в любом базовом редакторе изображений, занимают 30 секунд и могут повысить точность распознавания на 20–30 процентных пунктов на маргинальных исходных изображениях. Инструмент распознавания видит улучшенное изображение. Не знаю, оригинал было труднее читать.

Ручная аннотация как альтернатива автоматическому распознаванию

Для небольшого количества диаграмм ручное аннотирование быстрее, чем борьба со средствами распознавания. Откройте изображение диаграммы в инструменте аннотаций PDF. Добавьте текстовые комментарии, описывающие ключевые элементы: Процесс начинается здесь, Момент принятия решения: бюджет превышает 10 000, Требуется одобрение финансового директора. Аннотации представляют собой текст с возможностью поиска, который находится рядом с изображением диаграммы внутри PDF-файла. Будущие читатели смогут поискать термины в аннотациях и найти схему.

Аннотация также поможет вам понять схему. Описание блок-схемы словами означает, что вы должны интерпретировать то, что задумал ее первоначальный автор. Этот шаг интерпретации выявляет ошибки и двусмысленности в исходной диаграмме, которые автоматическое распознавание либо упускает, либо молча неверно истолковывает. Время, потраченное на аннотирование, — это время, потраченное на понимание, и это понимание увеличивает ценность, превышающую все, что может создать инструмент распознавания.

Содержание диаграммыРезультат OCRРекомендуемый подход
Печатные текстовые этикетки на диаграммеВысокая точностьСтандартное распознавание текста, фильтрация вывода распознаваемых слов
Рукописные текстовые меткиУмеренная точностьOCR с режимом распознавания рукописного текста, проверка вывода
Линии, стрелки, коробки, фигурыШум или ничегоЭкспортируйте как изображение, добавляйте аннотации вручную или используйте инструмент диаграммы
Смешанные элементы текста и диаграммыТекст восстановлен, диаграмма утеряна.OCR для этикеток + экспорт изображений для визуальной структуры
Стандартные типы диаграмм (блок-схема, организационная диаграмма)БедныйИнструмент распознавания диаграмм AI, затем ручная очистка

Сохранение и организация результатов

После обработки каждая диаграмма должна существовать в трех формах: исходная отсканированная страница в формате PDF, текстовые метки, извлеченные с помощью OCR для возможности поиска, а также аннотированная версия или реконструкция с помощью инструмента диаграммы для возможности редактирования. Храните все три вместе в системе управления документами или в облачной папке с одинаковым названием. Оригинал является авторитетной записью. Текст OCR позволяет осуществлять поиск. Аннотированная или реконструированная версия позволяет редактировать в будущем.

Добавьте описательные метаданные в PDF-файл, содержащий диаграмму. Название, автор, дата и краткое описание содержимого диаграммы в полях «Свойства документа» позволяют найти файл с помощью поиска операционной системы даже без полного распознавания текста. Диаграмма с метаданными, считывающими Q3-2025-Budget-Flowchart, попадает к нужному человеку через поиск по имени файла, чего не дает скан фотографии на доске без названия.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →