Вы сканируете документ с тонким синим фоном, цветную форму или распечатанный сертификат на тонированной бумаге. Сканирование выглядит нормально для ваших глаз. Текст явно темнее фона. Вы запускаете OCR, ожидая, что текст будет доступен для поиска, а результат — тарабарщина. Случайные символы, слипшиеся слова, буквы, не образующие узнаваемого языка. Цвет фона, который ваши глаза легко отфильтровывают, сбивает с толку механизм оптического распознавания символов, что не очевидно при взгляде на скан.
Механизмы OCR работают, определяя контраст между передним планом и фоном. Когда фон имеет цвет, даже легкий оттенок, это снижает эффективный контраст и вносит шум в процесс бинаризации — критический первый шаг, на котором механизм оптического распознавания символов решает, какие пиксели являются текстом, а какие — фоном. Тест, проведенный в 2025 году Университетом Невады, показал, что точность распознавания документов с цветным фоном снизилась в среднем на 23 процентных пункта по сравнению с тем же документом на белой бумаге (UNLV, «ISRI OCR Accuracy Metrics», 2025). Это снижение точности напрямую приводит к большему количеству ручных исправлений, большему количеству пропущенных поисковых запросов и менее пригодному для использования цифровому тексту.

Проблема бинаризации: где OCR идет не так в первую очередь
Прежде чем любой механизм OCR PDF сможет распознать символ, он должен преобразовать цветное или полутоновое изображение в чисто черно-белое представление посредством процесса, называемого бинаризацией. Каждый пиксель в отсканированном изображении классифицируется как передний план (текст, установленный на черный цвет) или фон (на белый цвет). Затем движок анализирует узоры черно-белых пикселей, чтобы идентифицировать отдельные символы. Если на этапе бинаризации совершаются ошибки, все последующее будет построено на этих ошибках, и никакое умное распознавание символов не сможет исправить фундаментально испорченный ввод.
Когда документ имеет цветной фон, алгоритм бинаризации сталкивается с трудным выбором порогового значения. На белой странице пиксели текста могут иметь значения от 0 до 80 по шкале темноты от 0 до 255, а пиксели фона — от 200 до 255. Разрыв между текстом и фоном велик, а пороговое значение легко установить с высокой степенью достоверности. На синей странице текстовые пиксели могут иметь значения от 0 до 100, а фоновые — от 140 до 180. Разрыв уже, и алгоритм должен проводить более тонкие различия. В областях, где цвет фона незначительно меняется, как это происходит почти во всех печатных цветных фонах, порог может пересечься и начать классифицировать пиксели фона как текст, создавая фантомные символы и объединяя реальные.
Методы глобального порогового определения, которые применяют одно значение обрезки ко всему изображению, особенно уязвимы для цветного фона. Эти методы работают путем анализа общей гистограммы яркости изображения и выбора порога, который разделяет два доминирующих пика, представляющих текст и фон. Цветной фон вводит третий пик на гистограмме, что запутывает алгоритм и часто приводит к слишком агрессивному порогу, стирающему тонкие части символов, такие как засечки и перекладины, или слишком консервативному, оставляющему фоновый шум, который затем этап распознавания пытается интерпретировать как текст.
Практическим последствием ошибки бинаризации является то, что механизм OCR получает искаженные входные данные. Символы, которые должны представлять собой чистые черные фигуры на белом фоне, вместо этого разрываются, сливаются или окружены шумом. Этап распознавания старается изо всех сил использовать этот ухудшенный входной сигнал, сопоставляя частичные формы с моделями символов, но частота ошибок быстро растет по мере снижения качества бинаризации. То, что пользователь воспринимает как тарабарский вывод, — это совокупный эффект ошибок, возникших на первом этапе обработки и усиливающихся на каждом последующем этапе.
Попробуйте PDF-распознавание текста
Никакой установки не требуется. Работает прямо в вашем браузере.
Конкретные цвета фона и почему они вызывают больше всего проблем
Не все цвета фона одинаково влияют на распознавание текста. Желтый фон вызывает больше всего проблем, особенно со старыми или простыми механизмами оптического распознавания символов. Причина в том, что желтый цвет имеет высокую яркость, то есть он кажется ярким для камеры или сканера, но при преобразовании в оттенки серого он воспринимается ближе к белому, чем можно было ожидать. Текст на желтом фоне может выглядеть четким, но почти невидимым после преобразования в оттенки серого, именно так большинство механизмов OCR сначала обрабатывают изображение. Зрительная система человека отлично справляется с фильтрацией желтых оттенков, но алгоритмы компьютерного зрения не обладают этим биологическим преимуществом.
Человеческий глаз легко отфильтровывает цвет фона, а программное обеспечение этого не делает.
Синий и зеленый фоны создают схожую, но отдельную проблему. Эти цвета хорошо отличаются от черного текста по яркости, но не по отдельным красным, зеленым и синим сенсорным каналам, которые используют сканеры и камеры. Синий канал сканера четко фиксирует синий фон, уменьшая контраст с черным текстом в этом канале. Механизм оптического распознавания символов, который часто работает с одним каналом или с определенной взвешенной комбинацией каналов, может получить изображение с меньшей контрастностью, чем ожидалось.
Для документов Отсканированные PDF, требующие оптического распознавания символов, качество предварительной обработки определяет конечный результат. WukongPDF применяет адаптивную бинаризацию во время обработки OCR, которая регулирует порог локально на основе характеристик каждой небольшой области страницы, а не с использованием одного глобального порога. Этот подход обрабатывает цветной фон более надежно, чем традиционные методы с фиксированным порогом.
Красный и розовый фон создают еще одну проблему. Красный имеет меньшую яркость, чем желтый, поэтому в оттенках серого он преобразуется в более темный серый. В результате красный фон создает меньшее разделение между текстом и фоном в изображении в оттенках серого. Механизм OCR, обрабатывающий документ в красной форме, может рассматривать фон как передний план в более темных областях, создавая темные пятна в бинаризированном выводе, которые затем этап распознавания текста пытается интерпретировать как искаженные символы. В государственных формах, медицинских документах и сертификатах об образовании часто используется цветная бумага или тонированный фон, что делает это практической проблемой в сфере здравоохранения, образования и государственного управления.
Градиентные фоны и узорчатая бумага
Градиентный фон, при котором интенсивность цвета меняется по всей странице, еще сложнее, чем сплошной цветной фон. Квитанция, цвет которой меняется от темного вверху к светлому внизу, сертификат с декоративной рамкой, которая постепенно исчезает внутрь, или форма с цветным заголовком, который переходит в белый, — все это создает области, в которых оптимальный порог бинаризации различается. Механизм OCR, использующий единый глобальный порог, правильно бинаризирует одну часть страницы и дает сбой в другой, создавая выходные данные, которые чередуются между чистым текстом и тарабарщиной на одной и той же странице.
Узорчатые фоны, такие как защитные узоры на чеках, текстуры бумаги с водяными знаками или точечно-матричные узоры на некоторых правительственных бланках, представляют собой наихудший сценарий для оптического распознавания символов. Шаблон создает регулярную повторяющуюся текстуру, которую механизм OCR может принять за текстовые элементы. Механизм может попытаться распознать точки узора как точки или линии узора как буквы. В выводе реальный текст смешивается с артефактами-шаблонами, создавая результат, в котором реальные слова перемежаются случайными знаками препинания и короткими последовательностями символов, которые выглядят так, как будто они могут быть словами, но таковыми не являются.
Фоновые шаблоны также взаимодействуют с текстом коварным образом, который трудно предсказать без тестирования конкретного документа. Диагональная линия позади текста может соединять соседние символы в бинаризованном изображении, в результате чего механизм оптического распознавания символов воспринимает две или три буквы как один глиф. Точечный узор может заполнить счетчики букв, таких как о, е и а, делая их неотличимыми от сплошных пятен. Эти взаимодействия зависят от конкретной комбинации частоты шаблонов, размера текста и дизайна шрифта, поэтому два документа с похожим фоном могут давать совершенно разные результаты оптического распознавания символов.
Методы предварительной обработки, исправляющие распознавание цветного фона
Несколько этапов предварительной обработки могут значительно улучшить Качество PDF при распознавании текста на цветном фоне. Наиболее эффективным является адаптивное пороговое определение, которое вычисляет разные пороги бинаризации для каждой небольшой окрестности пикселей, а не применяет одно пороговое значение ко всей странице. Адаптивные методы позволяют сохранить контрастность текста в темных областях фона и при этом правильно устранить фон в более светлых областях в пределах одного изображения.
Выбор цветового канала — еще один мощный метод. Исследуя отсканированное изображение в отдельных красных, зеленых и синих каналах, часто можно обнаружить один канал, в котором контраст между текстом и фоном значительно выше, чем в полноцветном изображении или при преобразовании в оттенки серого. Для синего фона красный канал обычно показывает лучший контраст, поскольку синий фон выглядит темным в красном канале, увеличивая отделение от черного текста. Этот метод ничего не стоит попробовать и может привести к значительным улучшениям.
Третий метод, вычитание фона, пытается оценить, как будет выглядеть фон без текста, а затем вычесть его из изображения, оставив только текст на однородном белом фоне. Этот подход хорошо работает для документов, в которых фон имеет однородный цвет, который меняется постепенно, например тонированная бумага или слегка окрашенные формы. Для документов со сложным или быстро меняющимся фоном вычитание фона менее эффективно и может привести к появлению собственных артефактов.
Современная предварительная обработка на основе искусственного интеллекта представляет собой передовой рубеж повышения качества оптического распознавания символов. Нейронные сети, обученные на миллионах изображений документов, могут научиться отделять текст от сложного фона способами, с которыми не могут справиться алгоритмические подходы. Эти препроцессоры искусственного интеллекта могут обрабатывать весь спектр фоновых цветов, узоров и градиентов, создавая чистый бинаризированный вывод даже из документов, которые превосходят традиционные методы. С 2025 года предварительная обработка ИИ будет доступна на нескольких коммерческих платформах оптического распознавания символов и станет стандартной функцией, а не надстройкой премиум-класса.
Когда отказаться от OCR и использовать альтернативные подходы
Некоторые документы с цветным фоном никогда не будут хорошо распознаваться, независимо от того, сколько предварительной обработки вы примените. Документы, напечатанные на темной бумаге со светлым текстом, документы металлизированными или светоотражающими чернилами, а также документы, в тексте которых используются цветные чернила, а не черные, особенно устойчивы к автоматическому распознаванию текста. В таких случаях ручная транскрипция или гибридный подход: распознавание того, что вы можете, а остальное — ввод, зачастую более эффективно с точки зрения времени, чем продолжение оптимизации конвейера распознавания.
Для важных документов, которые необходимо точно оцифровать, подумайте, существует ли где-нибудь исходный цифровой исходный файл. PDF-файл, созданный из документа Word, сохраняет исходные текстовые данные, даже если визуальный рендеринг имеет цветной фон. Если вы можете получить исходный файл, а не отсканированную печатную версию, вы полностью обойдете проблему оптического распознавания символов. Это не всегда возможно, особенно с устаревшими документами, но стоит изучить этот вопрос, прежде чем тратить часы на оптимизацию оптического распознавания символов.
Попробуйте PDF-распознавание текста
Никакой установки не требуется. Работает прямо в вашем браузере.
