У вас есть PDF-файл с возможностью поиска. Вы конвертируете его в Word для внесения изменений. Вы сохраняете отредактированный документ обратно в PDF. Новый PDF-файл выглядит идентично оригиналу, но когда вы ищете слово, которое, как вы знаете, есть в документе, поиск не дает результатов. Текст, который был доступен для поиска в исходном PDF-файле, невидим для функции поиска в новом PDF-файле. Обход через Word лишил текст возможности поиска.
Преобразование PDF в Word с последующим повторным преобразованием Word в PDF — это обычный рабочий процесс редактирования PDF-файлов, но каждый этап преобразования создает возможности для повреждения текстового слоя. Текст, который возвращается в формате PDF, может быть сохранен иначе, чем оригинал, сохранен в виде векторных контуров вместо кодов символов или растрирован в изображения. В результате каждого из этих результатов создается PDF-файл, текст которого виден, но недоступен для поиска.

Как текст сохраняется или теряется во время преобразования формата
В исходном PDF-файле с возможностью поиска текст хранится в виде кодов символов, сопоставленных глифам шрифта. Символ H сохраняется как код ASCII 72, который указывает программе чтения PDF-файлов отображать глиф H из встроенного шрифта. Функция поиска сканирует коды символов искомого слова и выделяет соответствующие позиции на странице. Это хранилище на основе кодов символов делает текст доступным для поиска.
Когда PDF-файл преобразуется в Word, конвертер извлекает коды символов и записывает их в документ Word как редактируемый текст. Текст в Word доступен для поиска, поскольку Word хранит его в виде кодов символов Юникода. Преобразование из PDF в Word сохраняет возможность поиска, если конвертер правильно извлекает коды символов.
Когда отредактированный документ Word сохраняется обратно в PDF, механизм Word PDF должен решить, как сохранить текст. Настройки по умолчанию сохраняют текст в виде кодов символов со встроенными шрифтами, сохраняя возможность поиска. Однако некоторые функции Word и настройки PDF приводят к тому, что текст сохраняется в виде векторных контуров или растеризуется в виде изображений.
Текстовые эффекты в Word, такие как тени текста, отражения, свечение и трехмерное вращение, заставляют механизм Word PDF преобразовывать затронутый текст в изображения. Визуально текст выглядит правильно, но не содержит кодов символов, которые могла бы найти функция поиска. Свойство PDF Searchable теряется для любого текста с примененными визуальными эффектами.
Попробуйте PDF в Word
Никакой установки не требуется. Работает прямо в вашем браузере.
Как сохранить возможность поиска по тексту при обратном обходе
Прежде чем сохранять отредактированный документ Word в PDF, проверьте настройки сохранения. В Word откройте «Файл», «Параметры», «Сохранить» и убедитесь, что установлен флажок «Встроить шрифты в файл». Этот параметр гарантирует, что шрифты будут внедрены в виде символьного текста, а не преобразованы в контуры или изображения.
Избегайте применения текстовых эффектов к контенту, который должен оставаться доступным для поиска. Используйте жирный шрифт, курсив и цветовое форматирование вместо эффектов тени, отражения и свечения. Визуальное различие может быть достигнуто без ущерба для поиска.
WukongPDF предоставляет инструменты PDF Converter, которые могут обрабатывать PDF-файлы для оптимизации хранения текста. Если PDF-файл был создан с текстом, недоступным для поиска, OCR может добавить текстовый слой с возможностью поиска позади существующего визуального содержимого.
Проверка возможности поиска после повторной конверсии
После сохранения документа Word в PDF откройте PDF и проверьте функцию поиска. Найдите слово, которое появляется на каждой странице. Если какая-либо страница не возвращает результатов для слова, которое явно присутствует, на этой странице есть текст, недоступный для поиска. Поисковый тест занимает несколько секунд и выявляет потерю возможности поиска до того, как документ будет распространен.
Если возможности поиска были потеряны, запустите распознавание текста в преобразованном PDF-файле, чтобы добавить текстовый слой с возможностью поиска. OCR распознает видимый текст и создает за ним коды символов. Затем функция поиска может найти текст по кодам символов, сгенерированным OCR. Это постфактумное исправление, а не профилактика, но оно восстанавливает возможность поиска в PDF-файле, который не доступен для поиска.
Для документов, которым требуется гарантированная возможность поиска, полностью избегайте обратного перехода из PDF в Word в PDF. Отредактируйте исходный исходный документ, файл Word, файл InDesign, документ Google и экспортируйте новый PDF-файл. Единый экспорт из источника в PDF сохраняет возможность поиска без промежуточных шагов преобразования.
Режим совместимости Word влияет на вывод PDF. Документы, сохраненные в старом формате DOC, а не в DOCX, могут использовать другие методы хранения текста, которые влияют на возможность поиска в PDF-файлах. Сохраняйте документы в текущем формате DOCX перед экспортом в PDF.
Текст в текстовых полях Word может быть растрирован во время экспорта PDF в зависимости от форматирования текстового поля. Текстовые поля с эффектами заливки, поворотом или изменением направления текста с большей вероятностью будут растеризованы, чем обычные текстовые поля.
Когда текст растрируется во время экспорта PDF, он становится изображением текста, а не закодированным текстом. Изображение отображается правильно, но символы представляют собой пиксели, а не коды. OCR может восстановить текст, но текст OCR может содержать ошибки распознавания.
Параметры экспорта PDF в Word включают растровый текст, если шрифты не могут быть встроены. Этот параметр растрирует текст, в котором используются шрифты с ограничениями на встраивание. Обеспечение возможности встраивания всех шрифтов предотвращает эту принудительную растеризацию.
После двустороннего преобразования сравните размер исходного PDF-файла и повторно преобразованного PDF-файла. Значительно больший размер восстановленного PDF-файла может указывать на то, что текст был растрирован в изображения, которые занимают больше места для хранения, чем закодированный текст.
Некоторые конвертеры PDF в Word предлагают режим преобразования на основе OCR для отсканированных PDF-файлов и режим извлечения текста для цифровых PDF-файлов. Использование неправильного режима приводит к неожиданным результатам. Цифровые PDF-файлы должны использовать извлечение текста, а не OCR, чтобы сохранить исходную кодировку символов.
Когда возможность поиска по тексту потеряна, функция «Найти» в средстве просмотра PDF не возвращает результатов для слов, которые явно присутствуют. Поиск общих слов, таких как или и, на каждой странице быстро подтверждает, есть ли во всем документе текст, пригодный для поиска.
Для документов, которые должны поддерживать возможность поиска в ходе нескольких циклов редактирования, создайте главный документ в редактируемом формате Word, Google Docs или InDesign и рассматривайте PDF-файл как формат распространения, доступный только для чтения. Все изменения происходят в мастере, и PDF-файл заново создается из мастера после каждого цикла редактирования.
Средства проверки читаемости могут проверять возможность поиска текста и идентифицировать страницы с текстом, недоступным для поиска. Запустите проверку доступности преобразованного PDF-файла, чтобы убедиться, что весь текст закодирован и доступен.
Стандарт PDF/UA требует, чтобы весь текст был закодирован как символы Юникода, что обеспечивает возможность поиска и доступ к программе чтения с экрана. Экспорт в PDF/UA из Word обеспечивает соблюдение требований к кодировке текста, сохраняющих возможность поиска.
Выбор конвертера PDF в Word влияет на сохранение текста. Преобразователи, которые отдают приоритет визуальной точности над редактируемостью текста, могут растрировать текст, в котором используются необычные шрифты или расположение. Преобразователи, которые отдают приоритет возможности редактирования текста, могут создавать более удобные для поиска выходные данные.
Когда текст хранится в PDF-файле в виде лигатур fi, fl, ffi, конвертер может разделить лигатуру на отдельные символы или сохранить ее как один символ. Поведение функции поиска зависит от того, как обрабатывалась лигатура во время преобразования.
Предотвращение потери поисковой способности при будущих конверсиях
Текст, который изначально был векторным в исходном PDF-файле, может быть преобразован в растровые изображения во время экспорта Word в PDF, если документ Word использует такие функции, как WordArt, SmartArt или встроенные диаграммы Excel. Эти функции отображаются в виде изображений в PDF-файле.
Настройки создания PDF-файлов в Word включают возможность создавать закладки из заголовков. Этот параметр сохраняет структуру документа, но не влияет на возможность поиска по тексту. Закладки и возможность поиска являются независимыми функциями.
Проверка возможности поиска путем поиска слова, которое появляется на каждой странице, например, обычного слова на языке документа, позволяет быстро выявить страницы с текстом, недоступным для поиска. Если какая-либо страница не возвращает результатов для общего слова, на этой странице возникла проблема с кодировкой текста.
Понимание условий, при которых теряется возможность поиска по тексту во время обратного перехода из PDF в Word в PDF, позволяет создателям документов делать осознанный выбор в отношении рабочего процесса редактирования и сохранять доступность и возможность поиска своего контента.
Сохранение возможности поиска по тексту посредством обратного преобразования PDF в Word в PDF требует внимания к настройкам преобразования на каждом этапе и понимания того, какие функции Word приводят к растеризации текста, а не к его кодированию в виде символов.
Для документов, в которых возможность поиска по тексту является требованием, создание рабочего процесса, сохраняющего исходный закодированный текст при каждом преобразовании формата, более эффективно, чем попытка восстановить возможность поиска после его потери.
Возможность поиска по тексту — это функция, которую пользователи считают само собой разумеющейся, пока она не исчезнет, а восстановление возможности поиска в PDF-файле, недоступном для поиска, требует либо повторной обработки исходного источника, либо запуска OCR на затронутых страницах для воссоздания текстового слоя.
Преобразование PDF в Word в PDF — это обычный рабочий процесс редактирования, который предоставляет множество возможностей для ухудшения или потери кодировки текста, а понимание каждой точки риска помогает пользователям сохранить возможность поиска на протяжении всего процесса.
Возможность поиска по тексту — это не косметическая функция, а фундаментальная возможность документа, которая влияет на доступность, возможность поиска, а также на возможность извлекать и повторно использовать контент для других целей.
Выбор конвертера PDF в Word существенно влияет на результат обработки: конвертеры, оптимизированные для возможности редактирования текста, обеспечивают более удобный для поиска результат, чем конвертеры, оптимизированные для визуальной точности.
Когда возможность поиска теряется во время прохождения туда и обратно, OCR может восстановить текстовый слой с возможностью поиска, но текст OCR будет содержать ошибки распознавания, которые необходимо исправить, чтобы документ был полностью надежным.
Для документов, для которых требуется возможность поиска, сохранение исходного исходного файла и экспорт свежих PDF-файлов после каждого цикла редактирования более надежны, чем сквозной обход через Word.
Формат PDF сохраняет текст принципиально иначе, чем форматы обработки текста, и каждый перевод между этими представлениями создает риск потери информации при кодировании текста.
| Обратный этап | Риск возможности поиска | Снижение риска |
|---|---|---|
| PDF в Word (извлечение) | Низкий, если используется преобразователь текстового извлечения. | Используйте конвертер с режимом извлечения текста |
| Редактирование в Word | Никто; Текст Word всегда доступен для поиска | Избегайте текстовых эффектов (тень, свечение, 3D) |
| Word в PDF (экспорт) | Середина; эффекты вызывают растеризацию | Встроить шрифты; избегать воздействия на текст, доступный для поиска |
| Постэкспортная проверка | Н/Д | Ищите общие слова на каждой странице |
Попробуйте PDF в Word
Никакой установки не требуется. Работает прямо в вашем браузере.
