При сведении PDF-файла все аннотации, поля форм и многослойное содержимое объединяются в один статический слой изображения. После выравнивания исходный текстовый слой, существовавший до выравнивания, исчезает. Текстовые символы, которые когда-то можно было выбирать, искать и извлекать, становятся пикселями в сведенном изображении. PDF Repair для сведенного документа спрашивает, можно ли восстановить исходный текстовый слой из сведенного вывода.
Краткий ответ зависит от того, был ли PDF-файл сведен с сохранением текстового слоя или без него. Некоторые операции сглаживания сохраняют исходный текст за сведенным изображением как скрытое содержимое. Другие операции выравнивания полностью отбрасывают текст, заменяя его визуализированным изображением. Восстановление возможно в первом случае и невозможно во втором.
Инструменты восстановления PDF формата WukongPDF могут обнаруживать и извлекать сохраненные текстовые слои из сведенных PDF-документов.

Как работает выравнивание PDF-файлов и что при этом удаляется
Сведение объединяет все видимые слои страницы PDF в одно визуализированное изображение. Аннотации, включая выделение, стикеры и пометки, объединяются с содержимым страницы. Поля формы преобразуются из интерактивных элементов в статические визуальные представления заполненных ими значений. Эффекты прозрачности преобразуются в непрозрачные пиксели. В результате получается страница, которая выглядит идентично оригиналу, но не имеет интерактивной или многоуровневой структуры.
На практике процесс сведения может сохранить или не сохранить исходный текстовый слой за сведенным изображением. Если сведение выполняется с помощью инструмента Flattener Preview в Acrobat Pro или с помощью инструмента «Предпечатная проверка» с определенными настройками, исходный текст может быть сохранен как невидимый слой. Когда сведение выполняется с помощью функции «Печать в PDF» или с помощью сторонних инструментов, текстовый слой обычно полностью удаляется.
Быстрый тест определяет, сохранился ли текст. Откройте сведенный PDF-файл и попробуйте выделить текст на странице. Если текст можно выделить и скопировать, значит, текстовый слой выдержал выравнивание. Если при нажатии на текст ничего не выделяется или выделяется вся страница как изображение, текстовый слой удаляется и остается только внешний вид.
Попробуйте восстановить PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
Метод 1: проверка наличия скрытого текстового слоя за сведенным изображением
В Acrobat Pro откройте сведенный PDF-файл и перейдите в «Инструменты», «Редактирование контента», «Редактировать текст и изображения». Нажмите на видимую текстовую область. Если Acrobat отображает ограничивающую рамку вокруг текста и разрешает редактирование, за сведенным изображением существует текстовый слой. Текст присутствует в данных файла, даже если при обычном просмотре он не виден как выбираемый текст.
Если текст присутствует, извлеките его с помощью функции «Экспорт PDF в текст» Acrobat Pro. Извлеченный текст может содержать исходное содержимое, даже если визуальная страница выглядит сплющенной. Скопируйте извлеченный текст и сравните его с образцом исходного контента. Если текст совпадает, исходный текстовый слой был успешно восстановлен из сведенного файла.
Глядя на это в целом, в реальных сценариях, если Acrobat не может найти редактируемый текст, текстовый слой был отброшен во время сведения. Визуальный текст на странице состоит из пикселей сведенного изображения, а не из кодов символов. Восстановление посредством извлечения текста невозможно, поскольку нет текстовых данных для извлечения.
Метод 2. Использование оптического распознавания символов для воссоздания слоя потерянного текста
Если исходный текстовый слой был удален во время сведения, OCR предоставляет путь для его воссоздания. Запустите распознавание текста в сведенном PDF-файле с помощью функции распознавания текста в Acrobat Pro. Механизм OCR анализирует пиксельное изображение каждой страницы, определяет формы символов и создает новый текстовый слой с распознанными символами.
Если рассматривать это в общих чертах, то на практике текстовый слой, воссозданный с помощью OCR, не является исходным текстом. OCR приводит к ошибкам распознавания, особенно в случае мелкого текста, необычных шрифтов или текста на сложном фоне. Воссозданный текст будет иметь точность примерно от 95 до 99 процентов для чистых стандартных документов и менее точен для документов со сложной типографикой или макетом.
После оптического распознавания сравните распознанный текст с известным образцом исходного контента, если он доступен. Исправьте ошибки оптического распознавания вручную или примите воссозданный текстовый слой как приближение к оригиналу. Вывод OCR можно использовать для поиска и извлечения текста, но он может содержать ошибки, которые требуют проверки, прежде чем использовать текст в юридических, финансовых или нормативных целях.
Проверка текста в структуре файла PDF
Чтобы окончательно проверить, существуют ли текстовые данные в сведенном PDF-файле, изучите структуру необработанного файла. Откройте PDF-файл в текстовом редакторе, который поддерживает работу с двоичными файлами, например VS Code или Notepad++. Найдите распознаваемые текстовые строки в исходном содержимом документа. Если в данных файла обнаружены текстовые строки, текстовый слой существует, даже если он недоступен через интерфейс чтения PDF-файлов.
Этот подход требует некоторого знакомства с внутренней структурой PDF. Текст в PDF-файле хранится в маркерах BT и ET, которые обозначают начало и конец текстовых объектов. Между этими маркерами указаны коды символов с командами позиционирования. Обнаружение маркеров BT и ET, содержащих распознаваемый текст, указывает на то, что текстовые данные пережили выравнивание.
С практической точки зрения, в реальных сценариях, если в данных файла не обнаружено текстовых строк, операция сглаживания полностью растрирует содержимое. Страницы представляют собой изображения и не содержат восстанавливаемой текстовой информации. OCR — единственный доступный способ создания текстового слоя.
Предотвращение потери текстового слоя при будущих операциях выравнивания
При выравнивании PDF-файла, в котором необходимо сохранить текстовый слой, используйте настройки, сохраняющие скрытый текст. В Acrobat Pro инструмент предварительного просмотра Flattener включает флажок для сохранения информации о наложении и плашечном цвете, что косвенно помогает сохранить текстовые данные. Инструмент Preflight предлагает исправления выравнивания, которые явно сохраняют текст.
Самый безопасный подход — сохранить несведенную копию PDF-файла перед сведением. В несведенной копии сохраняются все интерактивные элементы, аннотации и текстовые слои. Распространите сглаженную версию. Архивируйте несведенный оригинал. Если восстановление когда-либо понадобится, оригинал предоставляет полные исходные данные.
Если взглянуть шире, в рабочих процессах с документами для критически важных документов проверьте настройки сведения на копии, прежде чем применять их к оригиналу. Убедитесь, что текст остается восстанавливаемым после выравнивания. Измените настройки, если восстановление не удалось. Этап тестирования добавляет минуты к рабочему процессу и предотвращает необратимую потерю текста.
Использование предварительной проверки для обнаружения и извлечения слоев скрытого текста
Инструмент Acrobat Pro Preflight включает профили, специально предназначенные для анализа структуры содержимого PDF-файлов. В отчете «Инвентаризация» перечислены все текстовые объекты, присутствующие в файле, включая те, которые не видны при обычном просмотре. Выполнение этого отчета на сведенном PDF-файле показывает, выдержали ли текстовые данные процесс сглаживания.
Если в отчете «Предпечатная проверка» обнаружены текстовые объекты, используйте исправление «Экспортировать весь текст», чтобы извлечь их в отдельный файл. Затем извлеченный текст можно сравнить с видимым содержимым страницы, чтобы определить, какая часть исходного текста сохранилась и является ли он точным и полным.
Восстановление текста из частично сведенных PDF-файлов
Некоторые операции выравнивания влияют только на определенные элементы страницы, оставляя другие нетронутыми. Поля формы можно сгладить, а основной текст останется в виде выбираемых символов. Аннотации могут быть сглажены, пока основной текст страницы сохраняется. Изучите каждый тип элемента независимо, чтобы определить, что было сведено, а что сохранено.
Под широким углом зрения в рабочих процессах с документами для частично сведенных документов извлеките сохранившийся текст из не сведенных частей и объедините его с выводом OCR из сведенных частей. Гибридный подход максимизирует восстановление текста за счет использования исходного текста, если он доступен, и текста, восстановленного с помощью OCR, где оригинал был утерян.
Когда признать, что восстановление невозможно
В этом случае, если в структуре файла отсутствуют текстовые данные, если Acrobat не может найти редактируемый текст и если OCR дает неприемлемо неточные результаты, исходный текстовый слой невозможно восстановить. Примите этот вывод и займитесь сохранением того, что осталось, вместо того, чтобы тратить больше времени на попытки восстановления.
Задокументируйте попытку восстановления и ее результат. Обратите внимание на использованные инструменты, опробованные методы и сделанные выводы. Эта документация предназначена для будущих хранителей документов, которые могут иметь доступ к более совершенным инструментам восстановления и должны понимать, какие попытки предпринимались раньше.
Долгосрочная стратегия архивирования сведенных документов
Сведенные PDF-файлы часто создаются специально для целей архивирования, поскольку они удаляют интерактивные зависимости. При архивировании сведенных документов по возможности храните не сведенный оригинал рядом со сведенной версией. В оригинале сохраняется полная структура документа. Сведенная версия обеспечивает стабильный архивный формат.
Для документов, в которых существует только сведенная версия, запустите OCR, чтобы создать текстовый слой и встроить его в PDF-файл. Текст OCR, возможно, не идеален, но он позволяет осуществлять поиск и извлечение текста в будущем, что в противном случае было бы невозможно. Уровень OCR — это мост между сведенным изображением и будущими потребностями анализа документов.
Автоматическое обнаружение выравнивания коллекций документов
Организации, управляющие большими коллекциями документов, получают выгоду от автоматического обнаружения сведенных PDF-файлов. Сценарий, который открывает каждый PDF-файл, проверяет наличие выделяемого текста и помечает файлы, в которых текст отсутствует, идентифицирует документы, требующие обработки OCR. Автоматическое сканирование предотвращает бесшумное попадание сведенных документов в архив без текстовых слоев, доступных для поиска.
Интегрируйте обнаружение сведения в рабочий процесс приема документов. Когда новый PDF-файл поступает в систему, проверьте наличие текста. Если текст отсутствует, направьте документ в очередь обработки OCR, прежде чем он попадет в архив. Автоматическое обнаружение и исправление обеспечивает возможность поиска по каждому архивному документу.
Попробуйте восстановить PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
