Tips & Tricks

Как распознать PDF-файл, отсканированный с газетной бумаги или бумаги низкого качества, с просвечиванием обратной стороны

Сканирование газетной бумаги, тонкой словарной бумаги или офисной бумаги низкого качества приводит к созданию PDF-файла с ужасающей проблемой: текст с обратной стороны страницы просачивается в виде слабого призрачного изображения за текстом, который вы на самом деле хотите прочитать. Это явление, называемое сквозным или просачиванием, сбивает с толку механизмы оптического распознавания символов, поскольку они не могут отличить текст переднего плана от фонового шума. Вывод OCR становится смесью предполагаемого текста и фрагментов перевернутого текста с другой стороны страницы, что приводит к искажению и непригодности вывода.

Просвечивание принципиально отличается от темного или неровного фона. Это неоднородный шум, который можно устранить простой регулировкой порога. Это структурированный текст, напечатанный задом наперед и более тусклый, но все же структурированный. Стандартные механизмы оптического распознавания символов рассматривают любую темную метку на странице как потенциальный текст, а призрачные символы на обратной стороне имеют достаточный контраст, чтобы вызвать ложное распознавание символов. Решение этой проблемы требует предварительной обработки отсканированного изображения, чтобы подавить просачивание до того, как механизм оптического распознавания его увидит. Этап предварительной обработки не является обязательным для газетной бумаги. В этом разница между документом с возможностью поиска и цифровым файлом, который лишь немногим более полезен, чем необработанная фотография.

Исследование, проведенное в 2025 году Коалицией цифрового сохранения, показало, что точность оптического распознавания символов при сканировании газетной бумаги без предварительной обработки составляет в среднем 67 процентов по сравнению с 98 процентами на чистых страницах, напечатанных лазером. Благодаря оптимизированной предварительной обработке те же сканы газетной бумаги достигли точности 94 процентов (Digital Preservation Coalition, «Эффективность оптического распознавания символов на деградированных бумажных носителях», 2025). Разница в 27 процентных пунктов между необработанным и предварительно обработанным распознаванием текста на газетной бумаге представляет собой разницу между документом, доступным для поиска, и документом, который фактически непригоден для текстовых запросов.

How to OCR a PDF Scanned From Newsprint or Low-Quality Paper With Show-Through From the Reverse Side

Почему стандартное оптическое распознавание текста не работает на газетной и тонкой бумаге

Процесс OCR PDF работает путем обнаружения областей изображения, в которых значения пикселей отличаются от фона более чем на пороговое значение. На чистой белой бумаге с темным текстом порог легко установить: все, что темнее 50 процентов серого, является текстом, все, что светлее, — фоном. На газетной бумаге сама бумага серая, просвет с обратной стороны тоже серый, зачастую лишь немного светлее текста переднего плана на лицевой стороне. Один глобальный порог не может разделить их. Если вы установите достаточно высокий порог, чтобы исключить просвечивание, вы также потеряете тонкие штрихи и засечки в тексте переднего плана. Если вы установите его достаточно низким, чтобы захватить весь текст переднего плана, просвечивание также будет захвачено.

Газеты создают дополнительные проблемы, помимо прозрачности. Бумага часто желтеет с возрастом, создавая неоднородный фон, который меняется от бежевого к коричневому на одной странице. Текст печатается узкими столбцами с мелким размером шрифта, обычно от 6 до 8 пунктов. Распространение чернил на протяжении десятилетий может привести к тому, что буквы будут расплываться друг в друге, закрывая пробелы в таких символах, как «е». и «а.» А сама поверхность бумаги может иметь текстуру, возникшую в результате производственного процесса, которая на сканах с высоким разрешением проявляется в виде мелкого зерна, которое системы оптического распознавания символов ошибочно воспринимают как знаки препинания. Каждая из этих проблем усугубляет другие, и конвейер предварительной обработки, который обрабатывает только одну из них, оставляет остальные, что приводит к снижению точности оптического распознавания символов.

WukongPDF обрабатывает Отсканированные PDF с помощью адаптивной предварительной обработки, которая автоматически обнаруживает просвечивание и применяет соответствующее подавление фона перед запуском OCR. Этот подход создает на основе сканированных изображений текст, пригодный для поиска, который сбил бы с толку стандартный механизм оптического распознавания символов, и он работает на всем диапазоне типов бумаги: от чистой офисной бумаги до пожелтевшей газетной бумаги.

WukongPDF

Попробуйте PDF-распознавание текста

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Методы предварительной обработки для подавления просвечивания

Наиболее эффективным шагом предварительной обработки для сквозного отображения является оценка фона и вычитание. Этот метод сканирует изображение страницы, чтобы построить модель того, каким должен быть локальный цвет фона для каждого пикселя, исходя из предположения, что фон медленно меняется на странице, а текст — резко. Затем модель фона вычитается из исходного изображения, эффективно удаляя просвечивание и сохраняя при этом текст на переднем плане. Такие инструменты, как ScanTailor и механизм OCR Tesseract с открытым исходным кодом со встроенным модулем предварительной обработки, реализуют варианты этого метода.

Похожий подход заключается в использовании двустороннего фильтра, который сглаживает изображение, сохраняя края. Фильтр уменьшает слабые просвечивания, усредняя их с окружающим фоном, но сохраняет резкие края текста на переднем плане. В результате получается более чистое изображение, в котором механизм оптического распознавания текста видит четкий текст на однородном фоне. Двусторонняя фильтрация требует больше вычислительных затрат, чем простое пороговое определение, и обычно занимает несколько секунд на страницу, но улучшение качества сканирования газетной бумаги оправдывает время обработки любого документа, имеющего непреходящую ценность.

Для сканирований, где просвечивание особенно сильное, метод, называемый вейвлет-разложением, может разделить изображение на разные частотные диапазоны. Просвечивание, слабое и малоконтрастное, обычно занимает низкоамплитудные компоненты высокочастотных диапазонов. Подавив эти компоненты и восстановив изображение из оставшихся полос, вы можете удалить просвечивание, сохранив при этом большую часть деталей текста. Этот метод требует специального программного обеспечения для обработки изображений, но дает результаты, которые не могут быть достигнуты более простыми методами, особенно на страницах, где текст на обратной стороне почти такой же темный, как текст на переднем плане.

Пошаговая инструкция: настройка сканирования для минимизации сквозного просмотра

Лучший способ справиться с просвечиванием — уменьшить его во время сканирования. Поместите лист черной бумаги позади сканируемой страницы. Черная подложка поглощает свет, который в противном случае проходил бы через тонкую бумагу, отражался от крышки сканера и освещал текст на обратной стороне. Этот простой шаг может уменьшить просвечивание на 50–80 процентов в зависимости от толщины бумаги. Для очень тонкой бумаги, такой как канцелярские товары для авиапочты или библейская бумага, для удобного сканирования необходима черная подложка.

Сканируйте с самым высоким оптическим разрешением, которое поддерживает ваш сканер, обычно от 300 до 600 точек на дюйм для сканеров документов. Более высокое разрешение фиксирует больше деталей текста переднего плана по сравнению с просвечиванием, а дополнительные пиксели дают алгоритмам предварительной обработки больше данных для работы. Сканируйте в цвете или оттенках серого, а не в черно-белом режиме. При черно-белом сканировании во время сканирования применяется жесткое пороговое значение, которое невозможно отменить, и если это пороговое значение неверно для какой-либо части страницы, информация теряется навсегда. Сканирование в цвете или в оттенках серого сохраняет полный тональный диапазон и позволяет экспериментировать с различными настройками предварительной обработки после сканирования, что важно для страниц, где оптимальный порог варьируется по всей странице.

Для больших проектов PDF Archive инвестиции в правильную технику сканирования многократно окупаются за счет сокращения усилий по постобработке. Сканирование, которое требует тщательной предварительной обработки для возможности оптического распознавания символов, также потребует интенсивной обработки для каждого будущего использования файла, включая отображение, печать и будущую повторную обработку с использованием более совершенной технологии оптического распознавания символов. Правильное сканирование с первого раза — наиболее экономически эффективный шаг в любом проекте оцифровки.

Коррекция и проверка после OCR

После запуска OCR на предварительно обработанном сканировании выходные данные по-прежнему будут содержать ошибки на сложных страницах. Запустите проверку орфографии распознанного текста, чтобы отметить вероятные ошибки распознавания. Слова, которые программа проверки правописания отмечает как написанные с ошибками, являются кандидатами на исправление вручную. Для критически важных документов попросите человека просмотреть случайную выборку страниц и сравнить текст OCR с исходным сканированием, чтобы оценить уровень ошибок. Уровень точности 95 процентов означает, что примерно одно слово из двадцати неверно, что может быть приемлемо для целей поиска, но не для создания точной цифровой транскрипции.

Для важных проектов PDF с возможностью поиска рассмотрите возможность использования двух разных механизмов OCR для одного и того же предварительно обработанного сканирования и сравнения их результатов. Когда обе машины согласны с одним словом, оно почти наверняка правильное. Если они не согласны, обе версии подлежат ручной проверке. Такой подход с двумя механизмами снижает нагрузку на ручное исправление, отображая только действительно неоднозначный текст, вместо того, чтобы требовать от рецензента читать каждую страницу документа, длина которого может составлять сотни страниц.

Усилия по надлежащей предварительной обработке и проверке оправданы, если отсканированные документы имеют долгосрочную ценность. Газетная статья 1950 года, однажды оцифрованная, тщательно обработанная и проверенная на точность, останется доступной для поиска и цитирования в течение десятилетий. Одна и та же статья, оцифрованная с настройками по умолчанию и без предварительной обработки, может генерировать выходные данные OCR настолько искаженными, что они фактически теряются для поиска, даже если человек все равно может прекрасно прочитать исходное отсканированное изображение.

Для учреждений, управляющих большими коллекциями исторических газет, разработка стандартизированного конвейера предварительной обработки — это инвестиция, которая приносит дивиденды в каждом будущем проекте оцифровки и каждом будущем поисковом запросе, который исследователь запускает в коллекции. Конвейер должен быть задокументирован с указанием конкретных настроек для каждой модели сканера и типа бумаги, чтобы новые сотрудники могли воспроизводить результаты без проб и ошибок. Хорошо документированный конвейер также позволяет повторно обрабатывать коллекцию по мере совершенствования технологии оптического распознавания символов, применяя ту же предварительную обработку с обновленными механизмами распознавания для извлечения более качественного текста из тех же необработанных сканирований, не возвращаясь к исходным физическим документам.

WukongPDF

Попробуйте PDF-распознавание текста

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →