Вы открываете PDF-файл, который еще вчера прекрасно читался. Сегодня на каждой странице вместо текста отображаются случайные символы. Буквы были заменены квадратными прямоугольниками, вопросительными знаками, знаками плюса или строками совершенно несвязанных символов, таких как «%$#@!» где должны быть предложения. Структура документа сохранена. Страницы есть. Изображения в порядке. Но каждое слово на каждой странице превратилось в тарабарщину.
Это ошибка кодировки шрифта, и это одна из самых тревожных проблем с PDF-файлами, поскольку похоже, что файл поврежден и не подлежит восстановлению. В большинстве случаев содержимое не повреждено. В PDF-файле используются коды символов, которые зритель не может сопоставить с правильными формами букв. Исправление обычно включает в себя либо восстановление кодировки шрифта, установку отсутствующего шрифта, либо повторную визуализацию PDF-файла с помощью механизма, который правильно разрешает кодировку.

Три наиболее распространенные причины тарабарского текста в PDF-файлах
Причина первая: отсутствуют шрифты без встроенного резервного варианта. PDF-файл был создан с использованием шрифта, который не был встроен в файл, и в вашей системе этот шрифт не установлен. Средство просмотра PDF-файлов пытается заменить другой шрифт, но при замене используется другая кодировка символов. Код символа, который означал «A»; в исходном шрифте означает что-то другое в заменяющем шрифте. Зритель точно отображает заменяющий символ, поэтому каждая буква на странице заменяется другим символом.
Причина вторая: повреждены данные шрифта в PDF-файле. Шрифт встроен, но данные встроенного шрифта повреждены. Это может произойти, если PDF-файл частично загружен, передан через систему электронной почты, которая изменяет двоичные данные, или сохранен на неисправном запоминающем устройстве. Данные шрифта присутствуют, но содержат ошибки, из-за которых механизм рендеринга неправильно интерпретирует коды символов. Текст выглядит случайным, но на самом деле это детерминированный результат искаженного ввода. Каждый раз, когда вы открываете файл, один и тот же текст отображается как одна и та же тарабарщина, поскольку повреждение связано с сохраненными данными шрифта, а не с временной ошибкой рендеринга.
Причина третья: в PDF-файле указана неверная кодировка символов. PDF-файл содержит запись /Encoding, которая сообщает зрителю, как сопоставить коды символов с глифами, но указанная кодировка не соответствует тому, как на самом деле был написан текст. Чаще всего это происходит с PDF-файлами, созданными с помощью более старого или нестандартного программного обеспечения, которое записывало текст с использованием одной кодировки, но объявляло другую кодировку в метаданных файла. Программа просмотра применяет заявленную кодировку и выдает тарабарщину. Если вместо этого будет применена фактическая кодировка, которую использовал создатель, текст будет отображаться правильно. Это несоответствие между заявленной и фактической кодировкой является наиболее устранимой из трех причин, поскольку текстовые данные не повреждены. Только инструкции по отображению неверны.
Попробуйте восстановить PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
Как определить, какая проблема имеется в вашем PDF-файле
Быстрый набор тестов позволяет выявить причину. Сначала откройте PDF-файл в другой программе просмотра. Если он отображается правильно в Adobe Acrobat, но в вашем браузере отображается тарабарщина, проблема заключается в средстве рендеринга PDF браузера, а не в файле. Установите недостающий шрифт или используйте другую программу просмотра. Если PDF-файл показывает тарабарщину во всех программах просмотра, проблема в самом файле.
Во-вторых, проверьте список PDF Fonts в свойствах документа. В Acrobat перейдите в «Файл» — «Свойства» — «Шрифты». Если в списке шрифтов отображаются шрифты, помеченные как невстроенные, и эти шрифты не установлены в вашей системе, у вас проблема с отсутствующим шрифтом. Установите шрифт или откройте файл в системе, где он есть. Если в списке шрифтов отображаются встроенные шрифты, но текст по-прежнему бессвязный, скорее всего, данные встроенных шрифтов повреждены.
В-третьих, попробуйте выделить и скопировать бессмысленный текст. Вставьте его в текстовый редактор. Если вставленный текст является исходным правильным текстом, символы сохраняются в PDF-файле правильно, но отображение на дисплее нарушено. Это указывает на несоответствие объявления кодировки. Текстовые данные хорошие. Зритель просто показывает это неправильно. Если вставленный текст также является тарабарщиной, сами данные символов будут повреждены, что является более серьезной проблемой.
Как исправить PDF-файл, в котором отображаются случайные символы
Если шрифты отсутствуют, установите необходимый шрифт в вашей системе. Название шрифта указано в свойствах документа. Многие шрифты доступны для бесплатной загрузки, а коммерческие шрифты можно приобрести и установить. После установки шрифта снова откройте PDF-файл. Текст должен отображаться корректно. Если установка шрифта нецелесообразна, откройте PDF-файл в программе просмотра, которая имеет лучшую замену шрифтов, например Adobe Acrobat, а не в браузерной программе просмотра, или используйте WukongPDF для повторной визуализации PDF-файла со встроенными шрифтами. Процесс повторной визуализации разрешает все ссылки на шрифты и встраивает фактические формы символов, создавая автономный PDF-файл, который будет корректно отображаться в любой системе.
Исправление поврежденных встроенных шрифтов заключается в восстановлении или замене данных шрифта. Инструмент PDF Repair WukongPDF может обнаружить поврежденные потоки шрифтов и попытаться восстановить их из уцелевших данных. Если шрифт частично восстанавливается, инструмент извлекает неповрежденные части и реконструирует рабочее подмножество шрифта. Это не всегда успешно. Если повреждение сильное, текст может оказаться частично или полностью невосстановимым, и единственным выходом будет найти исходный исходный документ и воссоздать PDF-файл.
В случае несоответствия кодировки наиболее надежным решением во всех случаях является печать PDF-файла в новом PDF-файле. Откройте файл в любой программе просмотра, которая отображает его правильно, даже если только одна программа просмотра на одном конкретном компьютере отображает его правильно, и используйте функцию «Печать в PDF», чтобы создать новый файл. Процесс печати повторно отображает каждый символ, используя текущую систему рендеринга шрифтов, эффективно записывая правильные формы символов в новый PDF-файл в виде встроенных данных шрифта. Несоответствие кодировки устранено, поскольку в новом PDF-файле используется стандартная кодировка со встроенными шрифтами. Это исправление сохраняет внешний вид текста, но может привести к потере базовой кодировки символов, что имеет значение, если в дальнейшем текст необходимо будет доступен для поиска или извлечения. Для документов, для которых важна возможность поиска, используйте специальный инструмент Fix PDF, который исправляет кодировку, сохраняя текстовый слой.
Предотвращение проблем с кодировкой шрифтов в создаваемых PDF-файлах
Всегда встраивайте шрифты при создании PDF-файлов. Эта единственная настройка предотвращает подавляющее большинство проблем с бессмысленным текстом. В каждом приложении, которое экспортирует в PDF, Word, InDesign, Illustrator, PowerPoint, есть возможность встроить шрифты. Найдите это. Включите его. Полученный PDF-файл будет немного больше, обычно от 50 КБ до 200 КБ на шрифт, но он будет корректно отображаться в любой системе и в каждом средстве просмотра сейчас и в будущем.
Используйте стандартные кодировки. Избегайте использования пользовательских кодировок символов, если у вас нет конкретной причины и вы не понимаете последствий. Стандартная кодировка PDF, WinAnsiEncoding для латинского алфавита и Identity-H для Unicode, понятна каждому средству просмотра PDF-файлов. Пользовательские кодировки могут быть поняты программным обеспечением, которое их создало, и ничем больше. Стандартная кодировка со встроенными шрифтами — это наиболее переносимая и надежная комбинация текста PDF, который остается читаемым на всех платформах и с течением времени.
Если вы столкнулись с бессмысленным текстом в PDF-файле, созданном с помощью более старого или специализированного приложения, например, генератора отчетов мэйнфрейма, устаревшей системы учета или модуля вывода научных приборов, проблема кодировки может заключаться в таблице сопоставления символов PDF-файла, а не в отсутствующих шрифтах. Эти системы иногда создают PDF-файлы, в которых текст хранится с использованием специальной кодировки символов, которая сопоставляет коды символов с позициями глифов в шрифте, а не со значениями Unicode. Когда современный просмотрщик пытается извлечь текст в формате Unicode, сопоставление завершается неудачей и приводит к тарабарщине. Исправление этих файлов заключается в использовании инструмента восстановления PDF-файлов, который может обнаруживать нестандартные кодировки и либо заменять их стандартными сопоставлениями Unicode, либо извлекать текст как необработанные коды символов и перестраивать кодировку на основе данных шрифта. Это специализированная операция восстановления, выходящая за рамки тех, с которыми справляются инструменты PDF общего назначения, и для нее обычно требуется инструмент с явной поддержкой восстановления устаревшей кодировки.
Попробуйте восстановить PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
