Tips & Tricks

Как восстановить PDF-файл, который открывается с искаженным или зашифрованным текстом

PDF-файл, в котором отображается искаженный текст, случайные символы, ряды пустых квадратов или строки бессмысленных символов, может выглядеть как поврежденный файл, который невозможно восстановить. Документ открывается без сообщений об ошибках, количество страниц отображается правильно, любые изображения и графика отображаются нормально, но сами слова заменены чем-то совершенно нечитаемым. Этот шаблон обычно сигнализирует о проблеме с кодировкой шрифта, а не о структурном повреждении файла, что является хорошей новостью, поскольку проблемы со шрифтами часто можно устранить без специальных инструментов восстановления данных или служб судебно-медицинской экспертизы файлов. Базовое содержимое все еще может присутствовать в файле, закодированное таким образом, что средство просмотра PDF-файлов не может его интерпретировать из-за отсутствия или несоответствия данных шрифта.

How to Repair a PDF That Opens With Garbled or Scrambled Text

Диагностика кодировки шрифта и истинного повреждения файла

Первым шагом диагностики является определение того, связана ли проблема с кодировкой шрифта или с самой структурой PDF-файла. Проблема с кодировкой шрифта приводит к систематическим и последовательным искажениям во всем документе. Каждый экземпляр буквы А может стать пустым квадратом, или весь текст будет последовательно отображаться как случайные символы с диакритическими знаками из другого алфавита, но шаблон предсказуемо повторяется. Истинное повреждение файла приводит к нестабильному поведению: страницы вообще не отображаются, появляются сообщения об ошибках при попытке открыть файл или разделы документа совершенно пусты, в то время как другие разделы отображаются правильно. Страницы, которые отлично отображают изображения, но показывают искаженный текст, очень сильно указывают на проблемы со шрифтами, а не на структурные повреждения.

Откройте PDF-файл как минимум в двух разных программах просмотра, чтобы подтвердить диагноз. Если файл отображается правильно в Adobe Acrobat Reader, но не в браузерной программе просмотра, такой как Chrome или Edge, скорее всего, браузерная программа просмотра не поддерживает определенный формат встроенного шрифта, используемый в PDF-файле. Если файл отображается правильно в Chrome, но не в Preview на Mac, в Preview может отсутствовать поддержка определенной схемы кодировки шрифтов. Если файл отображает искаженный текст во всех программах просмотра, протестированных в разных операционных системах, данные шрифта в самом PDF-файле либо повреждены, либо отсутствуют, и необходима операция Repair PDF, обращающаяся к ресурсам шрифтов.

WukongPDF

Попробуйте восстановить PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Повторное встраивание отсутствующих или поврежденных шрифтов

Когда PDF-файл ссылается на шрифт, который не встроен в файл и не установлен в системе просмотра, программа просмотра PDF-файлов вынуждена заменить другой шрифт, который у нее есть. Эта замена часто приводит к смещению символов, поскольку замещающий шрифт имеет другую ширину символов, показатели интервалов и положения глифов, чем исходный шрифт. Текст выглядит как беспорядочные или случайные символы, поскольку коды символов, хранящиеся в PDF-файле, сопоставляются с совершенно другими глифами в замещающем шрифте, чем те, которые задумал автор документа. Решение состоит в том, чтобы повторно встроить в PDF-файл правильные шрифты, чтобы зрителю больше не приходилось гадать.

Откройте PDF-файл в инструменте, который может проверять и изменять ресурсы шрифтов на уровне документа. Проверьте список шрифтов, чтобы узнать, на какие шрифты ссылается документ, и является ли каждый из них полностью внедренным, частично внедренным как подмножество, содержащим только используемые символы, или указан как не встроенный вообще. Если шрифт отображается как невстроенный, вам необходимо либо установить именно этот шрифт в вашей системе и повторно сохранить PDF-файл с включенной опцией встраивания всех шрифтов, либо использовать инструмент PDF Fix PDF, который может найти и встроить необходимые данные шрифта из собственной лицензированной библиотеки шрифтов. Общие системные шрифты, такие как Arial, Times New Roman, Helvetica и Courier, доступны в большинстве библиотек шрифтов и могут быть встроены без лицензионных ограничений.

Использование метода печати в PDF для быстрого восстановления

Если искаженный текст вызван кодировкой шрифта, которую один конкретный просмотрщик обрабатывает правильно, а другие нет, самое быстрое практическое исправление заключается в использовании этого единственного работающего средства просмотра. Откройте PDF-файл в любой программе просмотра, которая правильно отображает текст на экране. Нажмите Ctrl-P или Command-P, чтобы открыть диалоговое окно печати, и выберите Microsoft Print to PDF или Save as PDF в качестве целевого принтера. Конвейер печати растрирует или перекодирует текст по мере его появления на экране и встраивает его в совершенно новый PDF-файл, используя стандартные, универсально поддерживаемые шрифты и кодировку, которую понимает каждый современный просмотрщик PDF-файлов, не требуя специальной обработки шрифтов.

Этот метод создает копию Repair PDF с чистым, читаемым текстом, который отображается одинаково везде, но существует важный компромисс, который необходимо понять, прежде чем приступать к его использованию. Печатный PDF-файл обычно теряет возможности выбора текста, возможности поиска и любые элементы интерактивной формы. Текст фактически становится частью изображения страницы. Для документа, который нужно только прочитать на экране и, возможно, распечатать один раз, это вполне приемлемое решение, требующее нескольких секунд. Для документа, который должен оставаться доступным для поиска, выбора или редактирования после восстановления, сначала попробуйте метод внедрения шрифтов и зарезервируйте печать в PDF в качестве запасного варианта.

Преобразование PDF в промежуточный формат

Если встраивание шрифтов не решает проблему и печать в PDF теряет слишком большую функциональность документа, преобразование PDF-файла через промежуточный формат может удалить нарушенную кодировку, сохраняя при этом текст как фактический текст. Экспортируйте PDF в документ Word с помощью конвертера PDF в Word. Процесс преобразования считывает поток содержимого PDF и выводит распознанный текст в новый формат, в котором используется собственная обработка и кодирование шрифтов Word, полностью независимо от того, что было повреждено в исходном PDF-файле. Откройте полученный файл Word, убедитесь, что текст читается правильно, внесите необходимые незначительные исправления форматирования, а затем экспортируйте его обратно в PDF с включенным встраиванием шрифтов.

Обход через Word заменяет сломанную кодировку чистой, соответствующей стандартам, но сложные макеты с несколькими столбцами, точным позиционированием или встроенной векторной графикой могут не полностью выдержать преобразование. В таблице ниже сравниваются три подхода к ремонту по факторам, которые имеют значение при выборе метода:

МетодВыбор текстаМакет сохраненСкорость
Повторно вставить шрифтыДаДаУмеренный
Печать в PDFНетДаБыстрый
PDF в Word в PDFДаЧастичныйМедленный

Решение проблем с кодировкой шрифтов Unicode и CID

PDF-файлы, созданные с использованием нелатинских шрифтов, таких как китайский, японский, корейский, арабский или кириллица, иногда отображают искаженный текст, особенно если шрифт использует кодировку CID (идентификатор символа), и средство просмотра не может сопоставить числовые CID с соответствующими символами Юникода. Это характерно для старых PDF-файлов, созданных с помощью программного обеспечения для сканирования или устаревших издательских систем, в которые встроены шрифты с использованием таблиц кодировки до Unicode, разработанных до того, как Unicode стал универсальным стандартом. Например, PDF-файл, полученный с помощью японского сканера 2005 года, может использовать шрифт CID, который современные средства просмотра не могут интерпретировать без исходного файла CMAP, специфичного для конкретного поставщика.

Специализированные инструменты PDF Fix PDF, которые явно поддерживают сопоставление CID с Unicode, могут восстановить правильные ассоциации символов. Эти инструменты считывают необработанные коды CID из данных шрифта и встроенной таблицы CMAP, если она присутствует, для восстановления сопоставления Unicode. Этот процесс автоматизирован в инструментах, предназначенных для восстановления шрифтов PDF, требующих только загрузки файла и загрузки исправленной версии. Для PDF-файлов, содержащих восточноазиатские языки, выберите инструмент восстановления, в наборе функций которого явно указана поддержка шрифтов CJK, поскольку общие инструменты восстановления шрифтов, разработанные в первую очередь для латинских алфавитов, могут не включать данные CMAP или модели распознавания глифов для этих систем письма.

Предотвращение искажения текста в создаваемых вами PDF-файлах

Если вы регулярно создаете PDF-файлы, которые приходят получателям с искаженным текстом, основной причиной почти всегда являются настройки встраивания шрифтов в программное обеспечение, генерирующее PDF-файл. При экспорте из Word, PowerPoint, InDesign или инструмента дизайна найдите диалоговое окно параметров экспорта или сохранения PDF и установите флажок «Встроить шрифты» или «Встроить все шрифты». Некоторые приложения предлагают дополнительный флажок «Встроить только символы, используемые в документе», что позволяет создать файл меньшего размера за счет подмножества шрифтов, но может вызвать проблемы с отображением, если PDF-файл позже будет редактироваться или объединяться с другим содержимым. Для максимальной кросс-платформенной совместимости встраивайте полный шрифт, а не его подмножество, если увеличение размера файла приемлемо.

Такие платформы, как WukongPDF, обрабатывают преобразование формата PDF с включенным по умолчанию комплексным внедрением шрифтов, избегая проблем с кодированием, возникающих из-за системных зависимостей шрифтов, которые работают только на компьютере создателя. При отправке PDF-файла, который должен правильно отображаться в различных операционных системах, устройствах и приложениях просмотра, быстрый проверочный тест заключается в открытии файла в браузерном средстве просмотра PDF, поскольку эти средства просмотра не имеют доступа к локально установленным системным шрифтам и немедленно выявят любые проблемы с внедрением шрифтов, которые в противном случае остались бы незамеченными, пока получатель не сообщит об искаженном тексте.

Когда следует признать, что PDF-файл не подлежит восстановлению

Несмотря на лучшие методы восстановления, некоторые PDF-файлы получили повреждения, которые невозможно восстановить. Если вы попытались повторно встроить шрифты, распечатать новый PDF-файл из каждой доступной программы просмотра и выполнить двустороннее преобразование через Word, но текст остался искаженным, возможно, файл имеет структурное повреждение в самом потоке содержимого, а не просто проблему с кодировкой шрифта. На этом этапе наиболее продуктивным способом обычно является найти исходный исходный документ и создать на его основе новый PDF-файл.

Сохраните поврежденный файл для справки, поскольку изображения и структура страницы могут оставаться частично неповрежденными, даже если текст невозможно восстановить. Если документ создан со сканера, повторное сканирование исходного бумажного документа создаст чистый PDF-файл с правильной кодировкой текста. Если документ был создан из файла Word или приложения для дизайна, попросите исходного автора повторно экспортировать его с явно включенным внедрением шрифтов. Свежий экспорт исходного документа позволяет обойти все проблемы кодирования, присутствующие в поврежденной копии, и создать чистый файл за меньшее время, чем при попытке дальнейшего восстановления.

WukongPDF

Попробуйте восстановить PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →