Others

В чем разница между текстом OCR и встроенным текстом в PDF-файле

Откройте отсканированный PDF-файл, и вы сможете выбирать, копировать и искать текст, как если бы это был собственный цифровой документ. Этот текст не был взят из оригинального сканирования. Сканер создал изображение страницы — сетку пикселей без каких-либо текстовых данных. Текст, который вы выбираете и ищете, представляет собой текст OCR, созданный программой оптического распознавания символов, которая анализирует изображение страницы и преобразует шаблоны пикселей в символы. Но не весь выбираемый текст в PDF-файле является текстом OCR. Некоторые PDF-файлы содержат встроенный текст, созданный в цифровом виде и никогда не проходящий через сканер или систему распознавания. Понимание разницы между текстом OCR и встроенным текстом объясняет, почему некоторые PDF-файлы ищутся идеально, а другие выдают искаженные результаты.

What Is the Difference Between OCR Text and Embedded Text in a PDF

Что такое текст OCR и как он попадает в PDF-файл

Текст OCR генерируется машиной. Механизм OCR PDF проверяет каждую форму символа в отсканированном изображении страницы, сравнивает ее с базой данных известных шаблонов символов и выводит наиболее вероятно совпадающий символ вместе с его положением на странице. Распознанный текст затем встраивается в PDF-файл в виде невидимого слоя, расположенного точно над символами исходного изображения. Когда вы выбираете и копируете текст из отсканированного PDF-файла, вы копируете его из этого невидимого слоя OCR, а не из видимого изображения. Если механизм OCR неправильно прочитает символ, скопированный текст будет содержать эту ошибку, даже если видимое изображение выглядит правильно.

Качество текста OCR зависит от нескольких факторов: разрешения и четкости исходного сканирования, шрифта, используемого в исходном документе, языка текста и сложности механизма OCR. Чистое сканирование напечатанного лазером документа на английском языке с разрешением 300 точек на дюйм, обработанное современным механизмом оптического распознавания символов, создает почти идеальный текст. Сканирование с разрешением 150 точек на дюйм документа, напечатанного методом матричной печати, на языке со сложной формой символов, обработанного базовым механизмом оптического распознавания символов, создает текст, пронизанный ошибками. Текст OCR является настолько точным, насколько позволяет механизм распознавания и качество сканирования.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Что такое встроенный текст и как он попадает в PDF-файл

Встроенный текст создается, но не распознается. Когда текстовый процессор, настольное издательское приложение или библиотека создания PDF-файлов создают PDF-файл, он записывает текст непосредственно в поток содержимого PDF. Каждый символ хранится в виде определенного кода, который сопоставляется с глифом в шрифте. Этап распознавания отсутствует, поскольку текст никогда не был изображением. Приложение, создавшее PDF-файл, точно знало, какие символы были написаны, и точно их записало. Когда вы выбираете и копируете текст из PDF-файла, созданного в цифровом формате, вы копируете именно те символы, которые напечатал автор.

Встроенный текст содержит информацию о форматировании, которой обычно не хватает в тексте OCR. Названия шрифтов, полужирный и курсивный начертание, а также интервал между символами сохраняются во внедренном тексте, поскольку они были указаны автором в исходном документе. Текст OCR может реконструировать часть этого форматирования, но он выводится из внешнего вида символов, а не сохраняется как явные метаданные. Сравнение формата PDF между отсканированной и затем распознаваемой страницей и исходной цифровой страницей показывает эту разницу. Версия OCR может позволять выделение текста, но сообщает, что каждый символ имеет один и тот же шрифт и одинаковую толщину. Цифровая версия сохраняет задуманные автором различия шрифтов.

Как определить, является ли текст в PDF-файле распознаваемым или встроенным

Самый надежный способ определить, создан ли текст в PDF-файле с помощью оптического распознавания символов или встроен, — это проверить свойства документа, в частности список шрифтов. Откройте PDF-файл в программе просмотра, которая может отображать информацию о шрифтах. Adobe Acrobat отображает список шрифтов в разделе «Файл», «Свойства документа», «Шрифты». Если в списке шрифтов отображаются шрифты с именами, включающими распознавание текста, или если шрифты указаны как неизвестные или как общий тип без определенного имени, текст, скорее всего, создан с помощью оптического распознавания символов. Если в списке шрифтов показаны определенные именованные шрифты, такие как Arial, Times New Roman или Calibri с такими подтипами, как Bold или Italic, текст почти наверняка встроен из цифрового источника.

Еще один практический тест — поиск распространенного шаблона ошибок оптического распознавания символов. Найдите в PDF-файле распространенные ошибки подстановки OCR, такие как комбинация букв rn, которую системы OCR часто ошибочно воспринимают как одну букву m. Если при поиске обнаруживаются случаи, когда сарай превращается в бац или кукуруза превращается в кукурузу, текст генерируется с помощью оптического распознавания символов. Встроенный текст не содержит этих ошибок подстановки, поскольку символы никогда не были визуально неоднозначными. Качество документа PDF с возможностью поиска зависит от того, точно ли основной текст, оптический или встроенный, представляет видимое содержимое.

Когда текст OCR и встроенный текст сосуществуют в одном PDF-файле

Один PDF-файл может содержать как текст OCR, так и встроенный текст на разных страницах или даже на одной странице. Пакет контракта может включать в себя текст контракта, созданный в цифровой форме, который содержит встроенный текст, а также отсканированную и обработанную с помощью оптического распознавания страницу подписи, которая содержит текст оптического распознавания символов. В исследовательском отчете могут сочетаться текстовые страницы, созданные в цифровом формате, со отсканированными и обработанными с помощью оптического распознавания символов фотографиями исторических вырезок из газет. Текст на третьей странице представляет собой встроенный текст с точностью до пикселя. Текст на седьмой странице представляет собой текст оптического распознавания символов, который может содержать ошибки распознавания.

Этот сценарий со смешанным контентом создает хитрую ловушку для любого, кто ищет или извлекает текст из PDF-файла. Результаты поиска со встроенных текстовых страниц будут точными. Результаты поиска на текстовых страницах OCR могут пропускать случаи, когда механизм OCR неправильно прочитал слово, или могут возвращать ложные совпадения, когда механизм OCR заменял похожее слово. При работе с PDF-файлами со смешанным содержимым проверяйте любой текст, извлеченный со страниц OCR, прежде чем полагаться на него. Самый безопасный подход — визуально проверять соответствующее изображение страницы всякий раз, когда извлеченный текст со страницы OCR используется для критической цели.

Улучшение качества текста OCR постфактум

Если PDF-файл содержит текст OCR низкого качества, возможности его улучшения ограничены тем фактом, что исходное сканирование и процесс OCR уже завершены. Вы не можете улучшить качество сканирования задним числом. Что вы можете сделать, так это повторно распознать PDF-файл с помощью более качественного движка. Извлеките изображения страниц из PDF-файла в самом высоком доступном разрешении и пропустите их через современный механизм оптического распознавания символов, который может дать более точные результаты, чем исходный проход оптического распознавания символов. Замените старый текстовый слой OCR новым.

Некоторые PDF-редакторы позволяют вручную исправлять ошибки OCR непосредственно в текстовом слое. Откройте PDF-файл в режиме редактирования, в котором отображается невидимый текст OCR. Нажмите на неверно распознанное слово и введите исправление. Этот процесс ручного исправления удобен для небольшого количества ошибок на нескольких страницах. Это непрактично для 200-страничного документа, в котором каждый абзац содержит ошибки распознавания. При крупномасштабных проблемах с качеством распознавания более эффективным подходом является повторное распознавание всего документа с использованием более качественного механизма.

Выбор между распознаванием текста и встроенным текстом для создания документа

При создании PDF-файла, который будет искаться, индексироваться или архивироваться, выбор между сканированием и оптическим распознаванием текста вместо создания собственного цифрового PDF-файла имеет долгосрочные последствия. Собственный цифровой PDF-файл со встроенным текстом меньше по размеру, выполняет поиск быстрее и идеально сохраняет точность текста. PDF-файл, отсканированный и обработанный с помощью оптического распознавания символов, сохраняет внешний вид исходного бумажного документа, но допускает возможность ошибок распознавания, которые со временем усугубляются по мере копирования, цитирования и ссылок на PDF-файл.

Для архивных проектов лучше всего сохранять оба формата. Сохраните скан с высоким разрешением в качестве архивного образца для обеспечения визуальной точности. Создайте собственную цифровую версию, перепечатав или применив высокоточное распознавание текста с ручной коррекцией, для поиска и анализа текста. Этот двухформатный подход обеспечивает подлинность исходного сканирования и удобство использования текста с возможностью поиска. WukongPDF поддерживает обработку OCR PDF для преобразования отсканированных документов в PDF-файлы с возможностью поиска, а полученный текстовый слой OCR обеспечивает функции поиска и копирования, которые позволяют использовать отсканированные документы в цифровых рабочих процессах.

Разрыв в долгосрочной надежности между оптическим распознаванием текста и встроенным текстом

PDF-файлы, обработанные OCR, устаревают иначе, чем PDF-файлы, созданные в цифровой форме. PDF-файл, созданный в цифровом формате, открытый через двадцать лет после создания, отображает текст идеально, поскольку коды символов однозначны, а шрифты встроены. PDF-файл с оптическим распознаванием символов, открытый через двадцать лет после создания, зависит от качества исходного сканирования и точности механизма оптического распознавания символов, доступного на тот момент. Ошибки распознавания, которые были едва заметны, когда документ был свежим, становятся серьезными препятствиями, когда исходный бумажный документ больше не доступен для проверки.

Для документов, предназначенных для долгосрочного хранения, встроенный текст из цифрового источника всегда предпочтительнее текста OCR. Если документ существует только на бумаге и его необходимо отсканировать, инвестируйте в сканирование и обработку оптического распознавания символов высочайшего качества, доступные на данный момент, и сохраняйте исходный бумажный документ как можно дольше. Бумажный оригинал является надежной защитой от ошибок оптического распознавания символов, которые могут стать очевидными только спустя годы.

Практический тест на отличие текста OCR PDF от встроенного текста: увеличьте масштаб абзаца до 300 процентов или выше и посмотрите на края символов. Текст OCR часто показывает небольшое несовпадение между видимым изображением символа и невидимым текстовым слоем. Встроенный текст отображается с идеальным выравниванием, поскольку формы и положения символов взяты из одной и той же программы шрифтов.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →