PDF-файл приходит по электронной почте. Открыв его, вы обнаружите что-то похожее на распечатанный документ. Текст есть, форматирование правильное. А можно ли выделить текст курсором или курсор проходит по нему, как по фотографии? Ответ определяет, был ли PDF-файл создан путем сканирования бумаги или создан из цифрового источника, а также определяет все, как вы можете работать с файлом.
Нажав на текст и наблюдая, выделяет ли его курсор или игнорирует, можно получить ответ на вопрос за одну секунду.
Чтобы определить, был ли PDF-файл отсканирован или создан в цифровом виде, необходимо проверить наличие выделяемого текста, изучить структуру файла и найти характерные визуальные артефакты сканирования. Инструменты OCR PDF WukongPDF позволяют сделать отсканированные документы доступными для поиска, а шаги идентификации Сканированный PDF, приведенные ниже, подскажут, нужно ли вам в первую очередь распознавание текста.

Тест выбора текста
Откройте PDF-файл и попробуйте выделить слово текста с помощью инструмента выделения текста. Если курсор выделяет слово посимвольно, PDF-файл содержит выбираемый текст и был создан в цифровом виде или уже был распознан. Если курсор рисует прямоугольник выделения по всей области, не выделяя отдельные символы, страница представляет собой изображение и PDF-файл создан путем сканирования.
Тест выбора текста является быстрым и точным для одностраничных проверок. Для многостраничных документов проверьте несколько страниц с начала, середины и конца. В некоторых PDF-файлах сочетаются цифровые и отсканированные страницы, обычно это сопроводительное письмо, созданное в цифровом виде, за которым следуют отсканированные вложения. Тест выбора текста на каждой странице показывает, какие страницы какие.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
Проверка размера файла и количества страниц на предмет подсказок
Отсканированные PDF-файлы обычно больше, чем цифровые PDF-файлы с тем же количеством страниц, поскольку каждая страница представляет собой полностраничное изображение. 10-страничный PDF-файл, отсканированный с разрешением 300 точек на дюйм, часто имеет размер 5–15 МБ. 10-страничный цифровой PDF-файл того же содержания может иметь размер 100–500 КБ. Разница в размере файла является быстрой подсказкой еще до открытия файла.
Отсканированные PDF-файлы также имеют меньше внутренних функций. Никаких закладок, гиперссылок, встроенных шрифтов и метаданных, кроме основных свойств файла. Откройте «Свойства документа» и проверьте вкладку «Шрифты». В отсканированном PDF-файле шрифты не указаны, поскольку все содержимое представляет собой изображения. В цифровом PDF-файле перечислены шрифты, используемые в документе.
Проверка свойств файла для метода создания
Свойства документа часто включают приложение, создавшее PDF-файл. PDF-файл, созданный Adobe Acrobat из Microsoft Word, скорее всего, был цифровым. PDF-файл, созданный с помощью драйвера сканера Canon или HP Scan, был отсканирован. PDF-файл, созданный с помощью приложения OCR, может представлять собой отсканированный документ, обработанный для поиска.
Поле производителя в свойствах документа задается создающим приложением и не всегда является надежным, поскольку его можно изменить или подделать. Объедините информацию о производителе с тестом выбора текста и проверкой шрифта для уверенного определения. Три независимых теста, указывающие на один и тот же вывод, являются надежными.
| Тест | Результат в цифровом формате PDF | Результат сканирования PDF |
|---|---|---|
| Выбор текста | Курсор выделяет отдельные символы | Курсор рисует прямоугольник выделения поверх изображения |
| Размер файла (10 страниц) | 100-500 КБ | 5-15 МБ |
| Вкладка «Шрифты» в свойствах | Перечисляет встроенные шрифты | Пусто, без шрифтов |
| Поле производителя | Ворд, Акробат, Хром | Драйвер сканера, программное обеспечение для обработки изображений |
Поиск визуальных артефактов сканирования
Увеличьте масштаб текстовой области до 400%. Отсканированные PDF-файлы демонстрируют характерные артефакты захвата изображения: небольшое размытие по краям символов, неравномерную затемнение по странице из-за освещения сканера, а также пылинки или следы волос на стекле сканера, которые выглядят как слабые линии или пятна. Цифровые PDF-файлы демонстрируют четкие края символов при любом уровне масштабирования.
Отсканированные PDF-файлы с двусторонними страницами могут показывать ореолы, слабый перевернутый текст с другой стороны бумаги, проступающий сквозь него. Это явный признак сканирования, поскольку в цифровых PDF-файлах нет понятия непрозрачности бумаги. Призраки выглядят как серая тень текста позади основного текста, наиболее заметная в областях, где основной текст разрежен.
Использование полей метаданных PDF для получения дополнительных подсказок
Поля метаданных PDF, доступные через «Свойства документа», могут раскрыть происхождение документа. Поле «Название», содержащее имя файла исходного документа, например Annual-Report-2025-Final.docx, указывает, что PDF-файл был создан на основе этого файла Word. Пустое поле «Заголовок» или заголовок, соответствующий имени PDF-файла, являются нейтральными. Поле «Создатель», в котором указано Microsoft Word или Google Docs, указывает на цифровое происхождение.
Поля «Дата создания» и «Дата изменения» могут содержать подсказки о временной шкале. PDF-файл, созданный и измененный в один и тот же день с разницей в несколько минут, предполагает прямой цифровой экспорт. PDF-файл с датой изменения спустя годы после даты создания мог быть распознан или обработан. Метаданные рассказывают историю документа, и эта история показывает, проводилось ли сканирование.
Что делать, если вы знаете тип PDF
Для отсканированных PDF-файлов, которые должны быть доступны для поиска, запустите OCR, чтобы добавить текстовый слой. Процесс OCR распознает текст на изображениях страниц и добавляет за ними текст, доступный для выбора и поиска. Внешний вид не меняется. В PDF-файле появилась возможность поиска и возможность копирования и вставки.
Для цифровых PDF-файлов, которые должны выглядеть отсканированными (обычно это официальные репродукции документов), преобразование в изображение и обратно не требуется и ухудшает качество. Цифровой PDF-файл уже находится в оптимальной форме. Любая обработка, преобразующая текст в изображения, снижает качество, не добавляя ценности.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
