Два PDF-файла находятся рядом в папке. Оба имеют одинаковое количество страниц. Оба были созданы в одном году. Вы вводите один и тот же поисковый запрос в оба. Результаты возвращаются практически мгновенно. Другой делает паузу, показывает вращающийся индикатор прогресса и через несколько секунд сообщает, что термин был найден на двенадцатой странице. Разница в скорости поиска между этими двумя PDF-файлами не случайна. Это определяется тем, как был создан PDF-файл, встроен ли текст или сгенерирован с помощью оптического распознавания символов, как закодированы шрифты и включает ли структура документа функции поисковой оптимизации. Понимание того, почему некоторые документы PDF с возможностью поиска выполняются быстрее, чем другие, поможет вам создавать PDF-файлы с эффективным поиском и диагностировать медленные документы, требующие внимания.

Как на самом деле работает поиск PDF-файлов
При поиске в PDF-файле программа просмотра не сканирует видимые изображения страниц в поисках форм символов. Он запрашивает потоки текстового контента, встроенные в файл PDF. Каждая страница содержит один или несколько потоков контента, в которых перечислены символы на странице, их позиции и шрифты, используемые для их отображения. Функция поиска считывает эти потоки контента последовательно, символ за символом, ища совпадения с искомым термином. Скорость этого последовательного сканирования зависит от того, как организованы текстовые данные.
PDF-файлы с хорошо структурированными потоками контента, где текст отображается в логическом порядке чтения с последовательной кодировкой, можно искать так же быстро, как зритель может читать данные с диска. PDF-файл с фрагментированными потоками контента, где текст одного абзаца разбросан по нескольким объектам потока в непоследовательном порядке, заставляет функцию поиска переключаться между различными частями файла, повторно собирая текст в памяти, прежде чем его можно будет найти. Структура потоков контента PDF Format является основным фактором, определяющим скорость поиска.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
Встроенный текст и текст OCR в эффективности поиска
Встроенный текст, текст, созданный в текстовом процессоре или приложении для верстки и записанный непосредственно в PDF-файл, хранится в виде последовательности кодов символов. Каждый символ занимает известную позицию в потоке контента. Функция поиска линейно считывает поток и эффективно находит совпадения. Текст OCR PDF, текст, созданный путем оптического распознавания символов из изображения отсканированной страницы, сохраняется по-другому. Механизм оптического распознавания символов помещает каждое распознанное слово в его приблизительное положение на странице, но слова могут находиться не в строгом порядке чтения в потоке контента.
Текст OCR также может содержать ошибки распознавания. Символ, который механизм OCR ошибочно интерпретировал как другой символ, не будет соответствовать поисковому запросу, даже если видимый символ на странице выглядит правильно. Поиск контракта не приведет к обнаружению контракта, даже несмотря на то, что механизм OCR выдал это неверное распознавание и поместил его в поток контента. Функция поиска не видит изображение страницы. Он видит только текст OCR. Ошибки в этом тексте напрямую приводят к сбоям поиска.
Кодировка шрифта и ее влияние на поиск
Шрифты в PDF-файлах могут быть закодированы несколькими способами, и кодировка влияет на скорость поиска. Шрифт со стандартной кодировкой, такой как WinAnsiEncoding или MacRomanEncoding, сопоставляет коды символов непосредственно со стандартными глифами. Функция поиска может быстро обработать этот текст, поскольку сопоставление является простым. Шрифт с пользовательской кодировкой, где коды символов назначаются разработчиком шрифта произвольно, требует, чтобы функция поиска искала каждый код в таблице кодировок шрифтов, чтобы определить, какой символ он представляет. Этот поиск добавляет накладные расходы на каждое сравнение символов.
Шрифты CID, используемые для наборов символов Восточной Азии, используют двухуровневую кодировку, которая сопоставляет коды символов со значениями CID, а затем сопоставляет значения CID с Unicode. Поиск текста в шрифте с кодировкой CID требует разрешения этого двухуровневого сопоставления для каждого символа. PDF-файл, содержащий текст на китайском, японском или корейском языке в шрифте с кодировкой CID, будет искать медленнее, чем PDF-файл, содержащий английский текст со стандартным шрифтом, исключительно из-за дополнительного этапа разрешения кодировки. Выбор кодировки шрифтов PDF, сделанный при создании PDF-файла, влияет на производительность поиска на протяжении всего срока существования документа.
Роль дерева структуры страницы в поиске
PDF-файл с тегами включает в себя дерево структуры, в котором содержимое документа организовано в логические элементы, такие как разделы, абзацы и рисунки. Дерево структуры обеспечивает функцию поиска дорожной картой документа. Вместо линейного сканирования потоков контента с начала файла функция поиска может перемещаться по дереву структуры для поиска текста в определенных разделах документа. Поиск в PDF-файле с тегами может быть быстрее, поскольку дерево структуры обеспечивает индексацию, которой нет в простом потоке контента.
PDF-файлы без тегов, составляющие большинство находящихся в обращении PDF-файлов, не имеют такой структуры. У функции поиска нет другого выбора, кроме как последовательно сканировать потоки контента. Для коротких документов разница незначительна. Для документов, состоящих из сотен или тысяч страниц, наличие или отсутствие дерева структуры может привести к почти мгновенному получению результатов поиска и заметной задержке. Создание PDF-файлов с тегами — это передовой метод обеспечения специальных возможностей, который также повышает производительность PDF с возможностью поиска.
Встроенные поисковые индексы в PDF-файлах
Некоторые инструменты создания PDF-файлов могут встраивать поисковый индекс непосредственно в PDF-файл. Этот индекс представляет собой предварительно созданную таблицу поиска, которая сопоставляет слова со страницами, на которых они появляются. Поиск в PDF-файле со встроенным индексом можно осуществлять практически мгновенно, поскольку функция поиска запрашивает индекс, а не сканирует потоки контента. Поиск по индексу возвращает номера страниц, на которых встречается слово, и зритель переходит непосредственно к этим страницам.
Встроенные индексы редко встречаются в PDF-файлах общего назначения, поскольку они увеличивают размер файла и время создания индекса. Чаще всего они встречаются в больших справочных PDF-файлах, технических руководствах и коллекциях документов, где скорость поиска является приоритетом. Большинство рабочих процессов создания PDF-файлов по умолчанию не включают создание индекса. Отсутствие встроенного индекса является нормой. Когда вы сталкиваетесь с PDF-файлом, который ищется заметно быстрее, чем другие файлы аналогичного размера, вероятно, причиной является встроенный индекс.
Что вы можете сделать, чтобы улучшить скорость поиска
Если вы создаете PDF-файлы, которые будут часто просматриваться, создавайте их как PDF-файлы с тегами и стандартными кодировками шрифтов. Избегайте использования пользовательских кодировок шрифтов, если иным образом требования к дизайну не могут быть выполнены. Если PDF-файл будет содержать текст, написанный не на латинице, проверьте эффективность поиска на образце, прежде чем переходить к кодированию для всего документа. Небольшие инвестиции в настройки создания окупаются более быстрым поиском для каждого человека, использующего документ.
Для существующих PDF-файлов, поиск которых выполняется медленно, рассмотрите возможность повторного распознавания текста, созданного с помощью OCR, с помощью современного механизма, который создает более чистые потоки контента. Запустите PDF-файл с помощью инструмента анализа структуры, который может добавлять теги, если документ в настоящее время не имеет тегов. WukongPDF поддерживает повторную обработку OCR PDF и маркировку документов, что может повысить производительность поиска в существующих PDF-файлах без их воссоздания из исходных документов.
Разница в скорости поиска может объясняться датой создания PDF-файла и версией программного обеспечения, использованной для его создания. PDF-файл, созданный с помощью современной библиотеки PDF 2024 года, скорее всего, будет иметь более чистые потоки контента и более эффективное кодирование текста, чем PDF-файл, созданный с помощью устаревшего инструмента версии 2008 года. Формат PDF эволюционировал, а новые инструменты создания позволяют создавать файлы с лучшей структурой.
Для PDF-файлов, которые часто просматриваются в рамках рабочего процесса управления документами, рассмотрите возможность извлечения текста и создания внешнего поискового индекса. Система управления документами с индексом полнотекстового поиска запрашивает индекс, а не потоки содержимого PDF. Скорость поиска становится независимой от внутренней структуры PDF.
Количество шрифтов, используемых в PDF-файле, влияет на скорость поиска, поскольку при каждом изменении шрифта функция поиска требует загрузки новой таблицы кодировки. PDF-файл, в котором используются два шрифта, при прочих равных условиях выполняется быстрее, чем PDF-файл, в котором используется двадцать шрифтов.
Производительность документа PDF Searchable определяется во время создания выбором кодировки шрифта, организацией потока контента, маркировкой документа и встраиванием индекса. Эти варианты невидимы для автора документа, но сразу видны любому, кто выполняет поиск в документе.
Для коллекций документов, поиск в которых будет осуществляться часто, инвестиции в создание хорошо структурированных PDF-файлов с тегами и стандартными кодировками шрифтов приносят дивиденды каждый раз, когда пользователь вводит запрос, и получают почти мгновенные результаты.
В этой статье рассматриваются ключевые методы и рекомендации по работе с PDF-файлами в этом конкретном сценарии. Описанные здесь методы применимы к различным инструментам и платформам, предоставляя читателям возможность выбора подхода, который лучше всего соответствует их рабочему процессу и технической среде.
Описанные практические шаги прокладывают четкий путь от первоначальной проблемы к рабочему решению. Каждый метод был выбран за его надежность и доступность, гарантируя, что читатели смогут достичь стабильных результатов независимо от своего предыдущего опыта работы с инструментами PDF.
Различия в скорости поиска, описанные в этой статье, являются прямым результатом выбора, сделанного во время создания PDF-файла. Понимание этих факторов дает создателям документов возможность создавать PDF-файлы, которые обеспечивают более удобный поиск.
Инструменты и методы, описанные в этой статье, обеспечивают практический путь от первоначального вопроса к рабочему решению, которое можно применять в различных документах и сценариях.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
