
Что такое отсканированный PDF-файл и чем он отличается от исходного PDF
Сканированный PDF создается путем захвата изображений физических бумажных страниц с помощью сканера или камеры телефона. Каждая страница PDF-файла представляет собой фотографию исходного документа. Текст, который вы видите на странице, существует только в виде пикселей изображения. В файле PDF нет реальных текстовых символов. Отсканированный PDF-файл — это, по сути, фотоальбом, где каждая фотография содержит текст.
Самый быстрый способ идентифицировать отсканированный PDF-файл — попробовать выделить текст на странице курсором.
Технология OCR устраняет разрыв между отсканированными и исходными PDF-файлами, добавляя текстовый слой с возможностью поиска.
Собственный PDF-файл, также называемый цифровым PDF-файлом или цифровым PDF-файлом, создается непосредственно из программного приложения. Когда вы экспортируете документ Word в PDF, сохраняете электронную таблицу в формате PDF или создаете PDF-файл из приложения для проектирования, результирующий файл содержит настоящие текстовые символы, которые можно выбирать и искать, а также векторную графику и встроенные шрифты.
Текст существует в виде данных, а не только в виде пикселей. Собственный PDF-файл — это структурированный документ, а не набор изображений страниц.
Формат PDF поддерживает оба типа содержимого в одном файле. PDF-файл может содержать некоторые страницы, представляющие собой отсканированные изображения, и другие страницы, представляющие собой собственный цифровой текст. Этот сценарий со смешанным содержанием часто встречается, когда документы собираются из нескольких источников, например отчет, в котором сочетаются текстовые страницы, созданные в цифровом формате, с отсканированными приложениями из печатных источников.
Практическая разница между отсканированными и исходными PDF-файлами влияет на все, что вы можете делать с документом. Вы можете искать слова в собственном PDF-файле, поскольку текст существует в виде символьных данных, доступных для поиска. Вы не можете выполнять поиск в отсканированном PDF-файле, если он не был обработан с помощью технологии OCR PDF, которая распознает текст в изображениях и добавляет невидимый текстовый слой с возможностью поиска. Вы можете выбрать и скопировать текст из собственного PDF-файла. Вы не можете выбрать текст из отсканированного PDF-файла. Вы можете редактировать текст в собственном PDF-файле с помощью PDF-редактора. Вы не можете редактировать текст в отсканированном PDF-файле, поскольку в нем нет текстовых символов, которые можно редактировать.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
Как определить, является ли PDF-файл сканированным или исходным
Самый быстрый тест — попытаться выделить текст в PDF-файле. Откройте PDF-файл, щелкните и перетащите слово с помощью мыши или пальца. Если текст выделяется при перетаскивании, PDF-файл содержит собственный текст, который можно выбрать. Если при попытке выделить текст ничего не происходит, скорее всего, страница представляет собой отсканированное изображение. Если некоторые слова выделяются, а другие нет, возможно, текстовый слой в PDF-файле частично или поврежден.
Тест масштабирования обеспечивает еще одну быструю проверку. Увеличьте масштаб фрагмента текста до 300 или 400 процентов. Если текст остается четким и четким при большом увеличении, скорее всего, это собственный векторный текст, который плавно масштабируется до любого размера. Если текст становится пиксельным и при большом увеличении имеет неровные края, это отсканированное изображение. Этот визуальный тест работает, поскольку векторный текст отображается плавно при любом уровне масштабирования, а текст на основе изображения при увеличении раскрывает свою пиксельную структуру.
Инструменты просмотра PDF-файлов также могут сообщать, содержит ли документ текст. В Adobe Acrobat на панели «Свойства документа» отображается количество страниц и наличие в файле текста, доступного для поиска. Некоторые средства просмотра отображают индикатор текстового слоя. Инструменты анализа документов могут сканировать PDF-файл и сообщать о проценте страниц, содержащих собственный текст, по сравнению с содержанием только изображений.
Размер файла может дать подсказку, хотя и не является окончательным. Отсканированный PDF-файл, состоящий из изображений страниц, обычно больше, чем исходный текстовый PDF-файл с тем же количеством страниц, поскольку изображения требуют больше места для хранения, чем текст. 10-страничный текстовый PDF-файл может иметь размер от 100 до 500 килобайт. Отсканированный PDF-файл на 10 страниц может иметь размер от 2 до 10 мегабайт. Однако собственный PDF-файл со встроенными изображениями высокого разрешения также может быть большим, поэтому размер файла сам по себе не является надежным индикатором.
Почему различие важно для повседневных задач PDF
Поиск — наиболее распространенная задача, на которую влияет различие отсканированных и исходных данных. Если вы получили 50-страничный PDF-файл и вам нужно найти каждое упоминание определенного термина, встроенный PDF-файл даст вам ответ за считанные секунды с помощью функции поиска. Отсканированный PDF-файл заставляет вас вручную сканировать каждую страницу визуально, что занимает несколько минут и может привести к пропуску событий. Возможность поиска в документе меняет ваше взаимодействие с ним.
Для извлечения текста для повторного использования в других документах требуется собственный текст. Если вам нужно процитировать абзац из PDF-файла в своем отчете, встроенный PDF-файл позволяет скопировать и вставить текст напрямую. Отсканированный PDF-файл требует повторного ввода текста или запуска OCR, чтобы его можно было извлечь. Для документов, на которые вы часто ссылаетесь, разница между мгновенным копированием и вставкой и перепечатыванием вручную является значительной.
Инструменты специальных возможностей, включая программы чтения с экрана, используемые людьми с нарушениями зрения, требуют наличия собственного текста. Программа чтения с экрана может читать вслух собственный PDF-файл, поскольку она имеет доступ к текстовым символам. Программа чтения с экрана не может прочитать отсканированный PDF-файл, поскольку в нем нет доступных текстовых символов. Чтобы сделать отсканированные PDF-файлы доступными, требуется обработка OCR для добавления текстового слоя, который могут интерпретировать программы чтения с экрана.
Формат Scanned PDF идеально подходит для архивных целей, когда документ необходимо просматривать только как изображение оригинала. Сканированная копия подписанного договора служит визуальной записью подписанного документа. Для любых целей, требующих взаимодействия с текстом, поиска, копирования, редактирования или доступности, необходим собственный PDF-файл или отсканированный PDF-файл с оптическим распознаванием текста.
Как преобразовать отсканированный PDF-файл в PDF-файл с возможностью поиска в исходном формате
Оптическое распознавание символов — это технология, которая преобразует отсканированные изображения страниц в доступные для поиска документы с текстовым слоем. Запустите распознавание текста в отсканированном PDF-файле с помощью инструмента PDF, поддерживающего обработку OCR. Инструмент анализирует каждое изображение страницы, распознает текстовые символы и добавляет невидимый текстовый слой позади изображения страницы. После оптического распознавания PDF-файл визуально выглядит идентично, но теперь доступен для поиска, а распознанный текст можно выделить и скопировать.
Точность распознавания зависит от качества исходного сканирования. Чистое сканирование с разрешением 300 точек на дюйм, равномерным освещением, плоскими страницами и четкой фокусировкой обеспечивает точность распознавания текста более 99 процентов.
Сканирование с низким разрешением (150 точек на дюйм) с тенями, изогнутыми страницами или размытым текстом может дать точность ниже 95 процентов, что потребует ручной коррекции. Качество сканирования определяет качество вывода OCR.
После запуска OCR проверьте результаты, выполнив поиск по нескольким словам, которые вы видите на странице. Если поиск их находит, значит, распознавание текста прошло успешно. Если при поиске отсутствуют очевидные слова, возможно, у OCR возникли проблемы с конкретным шрифтом, макетом или качеством изображения этой страницы. Повторно запустите распознавание текста с измененными настройками или отсканируйте более высокое качество, если оно доступно.
Инструмент OCR PDF WukongPDF обрабатывает отсканированные документы в браузере и возвращает PDF-файл с текстовым слоем с возможностью поиска. Загрузите отсканированный PDF-файл, запустите распознавание текста и загрузите документ, поддерживающий поиск, выделение текста и доступ к программе чтения с экрана. Процесс оптического распознавания символов сохраняет исходный внешний вид при добавлении текстового слоя, который делает документ интерактивным.
Разница в размере файлов между отсканированными и исходными PDF-файлами становится особенно важной при работе с большими коллекциями документов. В картотеке бумажных документов, отсканированных в PDF, могут появиться десятки тысяч отсканированных страниц PDF, каждая из которых представляет собой полное изображение. При 500 килобайтах на страницу для типичного сканирования в оттенках серого с разрешением 300 точек на дюйм 10 000 страниц занимают 5 гигабайт памяти. Запуск OCR для этих отсканированных PDF-файлов не уменьшает размер файла, поскольку изображения страниц остаются, но добавляет текстовый слой с возможностью поиска, что делает коллекцию практически пригодной для использования.
Для документов, требующих длительного архивирования, формат PDF/A является архивным стандартом. Как отсканированные PDF-файлы, так и собственные PDF-файлы можно конвертировать в PDF/A. Отсканированный PDF-файл, преобразованный в PDF/A, остается документом на основе изображения с добавлением архивных метаданных. Собственный PDF-файл, преобразованный в PDF/A, сохраняет свой текст и структурные свойства. PDF/A не меняет сканированный документ по сравнению с исходным. Он добавляет стандартизированные метаданные и усиливает структурные требования, которые улучшают долгосрочную сохранность.
Для PDF-файлов, в которых смешаны отсканированные и исходные страницы, примените OCR к отсканированным страницам, оставив исходные страницы нетронутыми. Большинство инструментов OCR могут обрабатывать определенные диапазоны страниц, поэтому вы можете запускать OCR только на тех страницах, которые в этом нуждаются. После обработки PDF-файл сохраняет собственный текст на исходных страницах и имеет текстовый слой с возможностью поиска на страницах, которые раньше содержали только изображения, что обеспечивает постоянную возможность поиска по всему документу.
Для документов, которые будут распечатаны и заполнены вручную, вполне достаточно отсканированного PDF-файла оригинальной формы. Получатель распечатывает PDF-файл, заполняет поля ручкой и либо возвращает физическую копию, либо сканирует ее обратно в цифровой формат. Для документов, которые должны быть заполнены в цифровом виде, собственный PDF-файл с полями формы значительно предпочтительнее, поскольку получатель может вводить текст непосредственно в поля.
Выбор между сканированием документа в PDF и созданием собственного PDF-файла из исходного исходного файла должен учитывать весь жизненный цикл документа, а не только насущную необходимость. Отсканированный PDF-файл контракта можно отправить по электронной почте другой стороне на рассмотрение. Если позже во время спора в этом контракте потребуется искать конкретный пункт, отсутствие возможности поиска в отсканированном PDF-файле становится серьезной проблемой. При создании собственного PDF-файла во время создания документа сохраняются параметры, которых нет при сканировании.
Современное программное обеспечение для сканирования часто включает в себя автоматическую обработку оптического распознавания символов, что стирает разницу между отсканированными и исходными PDF-файлами при практическом использовании. Документ, отсканированный с помощью приложения для телефона, которое выполняет распознавание текста сразу после захвата, создает PDF-файл, который технически является отсканированным изображением, но функционально доступен для поиска, как и собственный PDF-файл. Этот гибридный подход сочетает в себе удобство сканирования с возможностью поиска по собственному тексту.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
