
Что делает распознавание текста со отсканированным PDF-файлом
Оптическое распознавание символов преобразует Отсканированный PDF, который представляет собой набор изображений страниц, в документ с возможностью поиска.
Процесс OCR PDF анализирует изображение каждой страницы, определяет форму символов и создает невидимый текстовый слой позади изображения страницы. После OCR вы можете искать слова в документе, выделять и копировать текст, а также использовать программы чтения с экрана для чтения документа вслух.
OCR преобразует пассивное изображение текста в активный документ с возможностью поиска, который поддерживает выделение текста и программы чтения с экрана.
Точность оптического распознавания символов напрямую зависит от качества исходного сканирования: чистые сканы с разрешением 300 точек на дюйм дают наилучшие результаты.
Отсканированный PDF-файл без распознавания текста похож на текстовый фотоальбом. Вы можете смотреть на слова, но не можете с ними взаимодействовать. Вы не можете искать конкретный термин. Вы не можете скопировать абзац, чтобы процитировать его. Вы не можете использовать программу чтения с экрана. OCR добавляет интерактивные возможности, которые делают цифровые документы не только простым просмотром, но и полезными.
Точность оптического распознавания символов зависит от качества исходного сканирования. Четкое сканирование с высоким разрешением (300 точек на дюйм), равномерным освещением и четкой фокусировкой обеспечивает точность распознавания текста стандартного печатного текста более 99 процентов. Сканирование с низким разрешением, фотография документа, сделанная под углом, или сканирование смятого или испачканного оригинала дают меньшую точность. Качество сканирования напрямую определяет качество вывода OCR.
Текстовый слой PDF с возможностью поиска, добавленный с помощью OCR, отделен от изображения страницы. Внешний вид PDF-файла не меняется после оптического распознавания символов. Страница по-прежнему выглядит как отсканированное изображение. За этим изображением распознанный текст существует в виде невидимых символьных данных, к которым могут получить доступ поисковые системы, программы чтения с экрана и инструменты выделения текста.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
Как запустить распознавание текста в отсканированном PDF-файле на разных устройствах
В Windows Adobe Acrobat Pro может запускать распознавание текста в отсканированных PDF-файлах. Откройте PDF-файл, выберите инструмент «Сканирование и распознавание текста» и выберите «Распознать текст». Acrobat обрабатывает каждую страницу, распознает текст и добавляет текстовый слой с возможностью поиска. Сохраните файл. PDF-файл теперь поддерживает поиск и выбор текста. Acrobat Pro обеспечивает наиболее точное распознавание текста в Windows.
На Mac встроенное приложение предварительного просмотра не поддерживает распознавание текста. Некоторые сторонние инструменты Mac PDF предоставляют возможность оптического распознавания символов. PDF Expert и PDFpen включают механизмы оптического распознавания символов, которые обрабатывают отсканированные PDF-файлы и добавляют текстовые слои с возможностью поиска. Качество распознавания сравнимо с инструментами Windows для стандартных документов.
Инструмент распознавания текста WukongPDF на основе браузера работает в любой операционной системе. Загрузите отсканированный PDF-файл, выберите язык документа для механизма OCR и запустите распознавание. Загрузите PDF-файл с возможностью поиска после завершения обработки. Подход на основе браузера делает распознавание текста доступным без установки программного обеспечения.
На iPhone и Android приложения для сканирования, включающие функцию оптического распознавания символов, обрабатывают сканирование во время захвата. Adobe Scan, Microsoft Lens и встроенный сканер в приложении iPhone Notes автоматически выполняют распознавание текста при сканировании документов. Полученный PDF-файл доступен для поиска сразу после сканирования, без отдельного этапа обработки OCR.
Повышение точности распознавания сложных документов
Перед запуском OCR выберите правильный язык документа. Механизм OCR использует словари для конкретного языка и данные о частоте символов для разрешения неоднозначных символов. Запуск OCR во французском документе с настройкой французского языка дает лучшие результаты, чем использование настройки английского языка. Для многоязычных документов выберите основной язык и вручную исправьте ошибки в фрагментах дополнительного языка.
Устраните перекосы отсканированных страниц перед распознаванием текста. Отсканированные страницы, слегка повернутые даже на один или два градуса, снижают точность распознавания, поскольку механизм распознавания ожидает, что текстовые строки будут горизонтальными. Большинство программ сканирования включают функцию автоматического выравнивания. Если отсканированное изображение не было исправлено во время захвата, выровняйте страницы PDF перед запуском OCR.
Увеличьте разрешение сканирования для документов с мелким текстом или сложным макетом. Текст ниже 10 пунктов требует более высокого разрешения сканирования для точного распознавания текста. Для большинства документов достаточно сканирования с разрешением 300 DPI. Документы с текстом размером 8 пунктов или меньше сканируйте с разрешением 400 или 600 точек на дюйм, чтобы предоставить механизму оптического распознавания символов достаточно данных о пикселях для различения отдельных символов.
Для документов со смешанными типами содержимого, например страниц, на которых текст сочетается с фотографиями или иллюстрациями, механизм оптического распознавания символов должен быть настроен на распознавание только текстовых зон. Попытка распознать текст из областей изображения приводит к появлению мусорных символов. Большинство инструментов OCR включают функцию выбора зоны, которая позволяет указать, какие области страницы содержат текст.
Проверка и исправление вывода OCR
После завершения OCR проверьте вывод, выполнив поиск по нескольким словам, которые вы видите на странице. Если поиск их находит, значит, распознавание текста прошло успешно. Если при поиске отсутствуют очевидные слова, точность распознавания может быть недостаточной для конкретного шрифта, макета или качества изображения этой страницы.
Для документов, для которых точность распознавания имеет решающее значение, например юридических или медицинских записей, которые должны быть полностью доступны для поиска, просмотрите распознанный текст вручную. Некоторые инструменты PDF позволяют просматривать и редактировать скрытый текстовый слой. Исправьте ошибки распознавания, особенно в именах собственных, числах и технических терминах, которые механизм OCR с большей вероятностью распознает неправильно.
Наиболее распространенные ошибки оптического распознавания символов связаны с путаницей символов. Буква l и цифра 1 во многих шрифтах выглядят одинаково. Буквы rn вместе могут выглядеть как буква m.
Буквы cl могут выглядеть как буква d. Из-за этой путаницы символов возникают слова, которые визуально похожи на оригинал, но неправильны по тексту. Ручной просмотр критических разделов выявляет эти ошибки.
После проверки вывода OCR сохраните документ с именем файла, указывающим, что он был обработан с помощью OCR. Имя файла, такое как Report-OCR.pdf или Report-Searchable.pdf, отличает версию с возможностью поиска от исходного отсканированного изображения.
Практическая польза отсканированного PDF-файла с возможностью поиска становится очевидной, когда вам впервые нужно найти конкретную информацию в большом документе. Отсканированный контракт на 200 страниц без распознавания текста требует ручного чтения каждой страницы, чтобы найти конкретный пункт. Версия с возможностью поиска находит это предложение за секунды. Инвестиции в OCR окупаются для любого документа, на который вы собираетесь ссылаться более одного раза.
PDF-файлы, обработанные с помощью оптического распознавания символов, также доступны для программ чтения с экрана, что делает их пригодными для использования людьми с нарушениями зрения, которые полагаются на вспомогательные технологии для чтения документов. Отсканированный PDF-файл без OCR совершенно недоступен для программ чтения с экрана, поскольку в нем нет текста, который можно было бы прочитать вслух. Добавление OCR делает документ доступным, что требуется стандартами доступности, включая Раздел 508 и WCAG.
Для документов на языках, отличных от английского, перед обработкой выберите правильный язык распознавания. Механизмы OCR используют модели распознавания символов, зависящие от языка. Документ на японском языке, распознанный по японской модели, дает гораздо лучшие результаты, чем тот же документ, распознанный по английской модели.
OCR также позволяет извлекать текст для повторного использования в других документах. Когда вам нужно процитировать отрывок из отсканированного документа в своем отчете, OCR делает текст копируемым. Без оптического распознавания текста вам пришлось бы вручную перепечатывать отрывок. Время, сэкономленное благодаря возможности копирования и вставки из документов, обработанных с помощью OCR, значительно увеличивается.
Для отсканированных документов, которые будут заархивированы, OCR является важным этапом сохранения. PDF-файл, отсканированный только с изображением и заархивированный сегодня, не предоставляет будущим исследователям возможности поиска. PDF-файл с возможностью поиска обеспечивает доступ к содержимому документа посредством текстового поиска, что значительно повышает полезность документа для будущих пользователей.
Размер файла PDF существенно не меняется после OCR. Данные OCR добавляют к каждой странице небольшой объем текстовых данных, обычно несколько килобайт на страницу. Исходные изображения страниц остаются неизменными. Увеличение размера файла незначительно по сравнению с функциональным улучшением, которое обеспечивает текстовый слой с возможностью поиска.
Слой текста с возможностью поиска, добавленный с помощью OCR, отделен от визуального изображения страницы. Когда вы ищете слово в PDF-файле, обработанном с помощью OCR, поиск соответствует текстовому слою, а не изображению. В результате поиска выделяется область изображения страницы, где был найден текст.
PDF-файлы, обработанные с помощью OCR, поддерживают преобразование текста в речь, что делает их доступными для людей с нарушениями зрения и для всех, кто предпочитает слушать документы, а не читать их. Эта функция доступности является существенным преимуществом OCR, помимо простой возможности поиска.
Для крупных проектов OCR, включающих сотни или тысячи отсканированных страниц, пакетная обработка OCR экономит значительное время. Настройте параметры OCR один раз и примените их ко всему пакету документов. Проверьте выборку страниц на предмет точности, а не проверяйте каждую страницу.
Текстовый слой OCR можно экспортировать как обычный текстовый файл, что позволяет использовать содержимое документа в других приложениях. Экспортируйте распознанный текст, откройте его в текстовом редакторе или текстовом процессоре и используйте в качестве основы для нового документа.
Долгосрочная ценность PDF-файла, обработанного с помощью OCR, проявляется каждый раз, когда вам нужно найти информацию в документе. PDF-файл контракта, руководства или справочного документа с возможностью поиска становится ресурсом, который вы можете запросить, а не статическим файлом, который нужно читать вручную.
Внедрение оптического распознавания символов в качестве стандартного шага в рабочий процесс сканирования документов гарантирует, что каждый документ, который вы оцифровываете, доступен для поиска с момента его поступления в вашу цифровую библиотеку. Несколько дополнительных секунд обработки оптического распознавания символов во время сканирования приносят дивиденды каждый раз, когда вам нужно найти информацию в любом документе, который вы когда-либо сканировали.
Для любого, кто управляет библиотекой цифровых документов, OCR — это единственный наиболее эффективный этап обработки, который вы можете применить к отсканированным PDF-файлам. Он преобразует пассивные файлы изображений в активные, доступные для поиска и доступные документы.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
