Others

Можете ли вы распознать PDF-файл, текст которого напечатан на бумажном фоне с рисунком, текстурой или водяными знаками?

Оптическое распознавание символов работает путем обнаружения темных фигур на светлом фоне и сопоставления этих форм с известными образцами букв. Когда фон не имеет однородного светлого цвета, а вместо этого содержит узор, текстуру или водяной знак, механизм распознавания сталкивается с принципиально более сложной проблемой. Каждый шаблонный элемент на странице — это потенциально ложное срабатывание, которое OCR должен отличать от реального текста. Бумага с водяными знаками, текстурированные канцелярские товары, клетчатые защищенные отпечатки и декоративные рамки — все это добавляет визуальный шум, который снижает точность распознавания. Вопрос не в том, сможет ли OCR вообще справиться с этими фонами, а в том, при каких условиях это удается и когда точность падает ниже точки полезности.

Can You OCR a PDF Where the Text Is Printed Over a Patterned, Textured, or Watermarked Paper Background

Как фоновые узоры мешают распознаванию символов

Механизмы OCR обрабатывают страницу, сначала преобразуя ее в двоичное черно-белое изображение с помощью процесса, называемого пороговым определением. Каждый пиксель, который темнее порогового значения, становится черным. Каждый пиксель светлее становится белым. На чистой белой странице с темным текстом пороговая обработка дает четкое изображение, на котором четко выделяется каждая буква. На узорчатом фоне элементы узора, которые темнее порогового значения, становятся черными пикселями, смешанными с текстом. Затем механизм OCR пытается интерпретировать эти фрагменты шаблонов как части букв. Линия водяного знака, проходящая через середину буквы «e», может привести к тому, что движок увидит букву «c» с случайным знаком. Текстурированный фон с маленькими точками может привести к тому, что движок будет видеть периоды, которых нет.

Конкретный тип фонового рисунка определяет характер ошибок оптического распознавания символов. Мелкие точечные узоры, например, на ценной бумаге или старинной бумаге для пишущей машинки, создают пятнистый шум, который механизм оптического распознавания символов может интерпретировать как знаки препинания или акценты на символах. Узоры линий, такие как разлинованная тетрадная бумага или миллиметровая бумага, создают непрерывные помехи, которые могут сливаться со штрихами символов, превращая букву «l» в «b», если линия совпадает с верхним элементом. Водяные знаки с большим текстом или логотипами создают области, в которых темнота фона смещается, в результате чего при установлении порогового значения либо теряется текст в темных областях водяных знаков, либо вводятся фрагменты водяных знаков в виде текста в светлых областях.

Плотность рисунка относительно плотности текста имеет большое значение. Водяной знак, который значительно светлее текста, как и спроектировано большинство профессиональных водяных знаков, может пройти через пороговое значение, не оставляя видимых артефактов. Пороговое значение механизма OCR по умолчанию обычно установлено на отделение черного текста от белой бумаги, а водяной знак, который регистрирует только 10–15 процентов серого, может полностью упасть ниже этого порога. Проблема наиболее остра с узорами, степень затемнения текста которых приближается к 40–60 процентам, где пороговое значение не может четко отделить узор от текста, поскольку их диапазоны интенсивности перекрываются.

WukongPDF

Попробуйте PDF-распознавание текста

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Методы предварительной обработки, повышающие точность распознавания на узорчатом фоне

Некоторые методы предварительной обработки изображений могут уменьшить или устранить фоновые узоры до того, как механизм OCR обработает страницу. Наиболее эффективным методом является адаптивное пороговое определение, при котором рассчитывается разное ограничение яркости для каждой области страницы, а не используется одно глобальное ограничение. В областях, где фон имеет узор, адаптивный порог корректируется таким образом, чтобы считать среднюю яркость узора уровнем фона, сохраняя текст и подавляя узор. Большинство современных программ OCR включают опцию адаптивного порогового определения, хотя она может быть не включена по умолчанию.

Второй метод — частотная фильтрация с использованием преобразования Фурье или аналогичного математического инструмента. Фоновые узоры имеют тенденцию быть регулярными и периодическими, то есть они занимают определенные частоты в изображении. Текст, напротив, нерегулярен и занимает широкий диапазон частот. Фильтр частотной области может идентифицировать и подавлять узкие полосы частот, связанные с фоновым узором, сохраняя при этом широкополосный сигнал текста. Этот метод является мощным, но требует специального программного обеспечения для обработки изображений и обычно используется для крупномасштабных проектов оцифровки, а не для отдельных документов.

Инструмент OCR PDF WukongPDF включает предварительную обработку изображений, которая обрабатывает распространенные варианты фона. Для документов с легкими и умеренными фоновыми узорами встроенной предварительной обработки может быть достаточно для обеспечения удобного распознавания текста без дополнительных действий вручную. Ключевым моментом является проверка распознавания на репрезентативной странице, прежде чем приступать к обработке всего документа. Если тестовая страница обеспечивает приемлемую точность, приступайте к обработке партии. Если на тестовой странице обнаружены значительные ошибки, возможно, перед распознаванием изображения требуется внешняя предварительная обработка.

Когда ручная транскрипция превосходит распознавание текста на документах с большим количеством шаблонов

Существует порог качества, ниже которого вывод OCR требует настолько большого количества ручной коррекции, что ввод текста с нуля будет быстрее. Для документов с насыщенным фоновым рисунком, плотными водяными знаками или защищенными отпечатками, занимающими всю страницу, функция оптического распознавания символов может создать текст, в котором 20 или более процентов символов являются неправильными. Исправление одного символа из пяти в многостраничном документе занимает больше времени, чем ввод свежего содержимого, особенно если ошибки неочевидны, например, вставленная точка, в которой фоновая точка была неправильно прочитана, что меняет смысл предложения, и его не так легко обнаружить во время корректуры.

Экономическое решение зависит от длины документа и требуемой точности. Одностраничное письмо на бланках с водяными знаками можно переписать вручную за считанные минуты. 200-страничная книга, напечатанная на фактурной бумаге, — это недели ручной работы, и даже несовершенное распознавание текста, которое правильно распознает 85 процентов текста, дает существенное преимущество. Для крупных проектов оптимальным рабочим процессом часто является распознавание текста с агрессивной предварительной обработкой, за которой следует проверка результатов человеком, признавая, что на этапе проверки будут выявлены и исправлены ошибки, вызванные шаблонами. Конвейер Scanned PDF в текст с возможностью поиска работает лучше всего, когда требования к точности соответствуют сложности исходного материала.

Выбор правильных настроек сканирования для минимизации фоновых помех

Когда вы управляете процессом сканирования, некоторые настройки могут уменьшить видимость фонового рисунка еще до того, как изображение достигнет механизма оптического распознавания символов. Сканирование в оттенках серого, а не в цвете, устраняет цветные узоры, такие как тонированные водяные знаки или цветные защитные нити, которые в противном случае создавали бы различия в контрастности. Установка яркости сканера немного выше обычной приводит к тому, что светлые фоновые узоры становятся ниже порога обнаружения, сохраняя при этом темный текст. Увеличение яркости на 10–15 процентов часто бывает достаточно, чтобы устранить водяные знаки, не влияя при этом на читаемость текста.

Некоторые сканеры оснащены функцией удаления фона или сглаживания фона, специально разработанной для документов на цветной или узорчатой бумаге. Эта функция анализирует страницу и определяет доминирующий цвет или узор фона, а затем нормализует его до белого цвета, сохраняя при этом содержимое переднего плана. Если этот параметр доступен, его следует включить для любого документа, который будет подвергаться распознаванию. Повышение точности распознавания благодаря чистым исходным изображениям намного превосходит то, что может быть достигнуто за счет обработки изображений после сканирования.

Оценка точности оптического распознавания символов на шаблонных документах: что принять, а что перепечатать

Практический порог приемлемой точности распознавания зависит от того, как будет использоваться извлеченный текст. Для полнотекстового поиска по архиву документов точности 80 процентов может быть достаточно. Поиск по определенному имени или номеру счета все равно приведет к поиску документа, даже если 20 процентов окружающего текста содержат ошибки. Для извлечения текста, который будет переиздаваться, цитироваться или использоваться в дальнейшем анализе, более подходящим минимумом является 95-процентная точность. Ниже этого уровня время, затрачиваемое на исправление ошибок оптического распознавания символов, приближается к времени, которое потребовалось бы для расшифровки документа вручную. Решение о том, принимать ли результаты оптического распознавания символов или перепечатывать текст с нуля, должно основываться на измеренной оценке точности, а не на впечатлении, сложившемся после просмотра нескольких страниц.

Для измерения точности распознавания текста необходимо сравнить образец распознанного текста с исходным документом. Выберите от трех до пяти репрезентативных страниц, подсчитайте общее количество символов в оригинале, подсчитайте количество ошибок символов в выводе OCR, включая замены, вставки и удаления, и рассчитайте коэффициент ошибок. Это измерение занимает от десяти до пятнадцати минут и дает объективную основу для принятия решения о том, следует ли приступить к автоматическому исправлению, ручному просмотру или полному перепечатыванию. Измерение также определяет, какие типы ошибок наиболее распространены, что определяет выбор стратегии исправления. Если ошибки сосредоточены в определенных типах шаблонов, целевая предварительная обработка может помочь их устранить. Если ошибки распределены случайным образом, точность распознавания будет ограничена фундаментальным качеством исходного изображения, а не какой-либо конкретной исправимой проблемой.

Фоновые узоры на бумаге никогда не разрабатывались с учетом оптического распознавания символов. Они служат различным целям: от идентификации бренда до защиты от подделки и простой декоративной привлекательности. PDF Images, полученные из этих документов, переносят шаблоны в цифровую сферу, где они становятся препятствиями для извлечения текста. Понимание того, какие шаблоны можно устранить с помощью предварительной обработки, а какие требуют ручной работы, позволяет принимать обоснованные решения в отношении каждого документа, а не применять один и тот же рабочий процесс оптического распознавания символов для каждого сканирования и надеяться на лучшее. Время, потраченное на понимание конкретных фоновых проблем вашего документа, окупается более высокой точностью, меньшим количеством ручной коррекции и цифровым текстовым выводом, который точно представляет исходное содержимое.

Оптическое распознавание текста на узорчатом фоне находится на стыке технологий сканирования, обработки изображений и проектирования документооборота. Ни один метод не решает всех проблем, связанных с узорчатым фоном, но сочетание правильных настроек сканирования, адаптивной предварительной обработки и реалистичных ожиданий точности дает полезные результаты для подавляющего большинства документов. Инструменты существуют, а методы хорошо зарекомендовали себя. Их систематическое применение превращает досадный сбой оптического распознавания текста в управляемый процесс контроля качества.

WukongPDF

Попробуйте PDF-распознавание текста

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →