Others

Почему я не могу редактировать текст в моем PDF-файле

Why Cannot I Edit Text in My PDF

Почему PDF-файл, похожий на текст, может оказаться недоступным для редактирования

Вы открываете PDF-файл, видите слова на экране и предполагаете, что можете их редактировать. Когда вы нажимаете на текст и ничего не происходит, или когда вы пытаетесь напечатать, а курсор не появляется, вы обнаруживаете, что PDF-файл, который выглядит как текстовый документ, на самом деле вообще не является редактируемым документом. Этот опыт удручающе распространен, поскольку PDF-файлы могут содержать текст в принципиально разных формах, только некоторые из которых доступны для редактирования.

Запуск OCR в отсканированном PDF-файле добавляет доступный для поиска и редактирования текстовый слой позади каждого изображения страницы в документе.

Преобразование из PDF в редактируемый формат и обратно является надежным запасным вариантом, когда прямое редактирование невозможно.

Редактор PDF может изменять текст, который существует в виде реальных текстовых объектов в PDF, при этом каждый символ представлен в виде выбираемого изменяемого кода символа. Это называется нативным или живым текстом. Формат PDF также может содержать текст, существующий только в виде изображения, например отсканированный документ, где текст является частью фотографии страницы. Текст на основе изображения нельзя выбирать, искать или редактировать, поскольку PDF-файл не содержит символьных данных, а только пиксели, которые формируют формы букв. Прежде чем вы сможете узнать, доступен ли PDF-файл для редактирования, вам необходимо знать, какой тип текста он содержит.

Самый быстрый тест — попытаться выделить текст в PDF-файле. Нажмите и перетащите слово. Если текст выделяется при перетаскивании, это собственный текст, и его потенциально можно редактировать. Если ничего не выделяется и курсор не меняется, текст основан на изображении и не может редактироваться напрямую. Если текст выделяется, но выделение неравномерное, некоторые слова выбираются, а другие пропускаются, то PDF-файл содержит смесь собственного текста и текста, который существует только как визуальные элементы, что является распространенной ситуацией в PDF-файлах, созданных старым программным обеспечением или путем объединения нескольких исходных документов.

WukongPDF

Попробуйте редактировать PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Распространенные причины, по которым невозможно редактировать текст PDF

Наиболее распространенная причина заключается в том, что PDF-файл представляет собой отсканированный документ. PDF-файл, созданный путем сканирования бумажных страниц с помощью планшетного сканера или приложения камеры телефона, содержит изображения текста, а не текстовые символы. Несмотря на то, что вы можете читать слова на экране, PDF-файл не содержит редактируемых текстовых данных. Чтобы сделать отсканированный PDF-файл доступным для редактирования, необходимо сначала запустить OCR, чтобы распознать текст на изображениях и создать невидимый текстовый слой позади каждого изображения страницы. После оптического распознавания текст становится доступным для поиска и, во многих PDF-редакторах, редактируемым, как если бы это был собственный текст.

Ограничения паролей или разрешений являются еще одним распространенным препятствием для редактирования. PDF-файл, защищенный паролем разрешений, можно открыть и просмотреть, но разрешения могут блокировать редактирование, копирование или печать. Если вы можете открыть PDF-файл и просмотреть текст, но инструменты редактирования недоступны или выдают сообщение об ошибке, проверьте настройки безопасности документа. В большинстве программ просмотра PDF-файлов на панели «Свойства документа» или «Безопасность» показано, какие разрешения ограничены. Если редактирование ограничено и у вас есть пароль разрешений, вы можете снять ограничения и включить редактирование.

PDF-файл может содержать текст, который был преобразован в контуры или кривые во время создания. Графические дизайнеры иногда преобразуют текст в контуры в таких приложениях, как Adobe Illustrator, перед созданием PDF-файла, чтобы гарантировать правильное отображение шрифтов независимо от того, установлены ли эти шрифты у получателя. Текст, преобразованный в контуры, визуально выглядит идентично исходному тексту, но состоит из векторных фигур, а не символьных данных. Инструмент «Нет редактирования PDF» может редактировать контурный текст как текст, поскольку информация о символах была удалена во время преобразования в контуры.

Проблемы с кодировкой шрифтов могут сделать текст недоступным для редактирования, даже если PDF-файл содержит собственные текстовые символы. В некоторых PDF-файлах используются пользовательские кодировки шрифтов, которые нестандартным образом сопоставляют коды символов с глифами. Инструмент редактирования видит коды символов, но не может определить, какие символы они представляют, поэтому отказывается их редактировать, чтобы не повредить текст. Эта проблема наиболее распространена в PDF-файлах, созданных специализированным программным обеспечением, устаревшими системами или документами, в которых используются нелатинские сценарии с настраиваемой обработкой шрифтов. Повторный экспорт PDF-файла из исходного приложения с включенным внедрением шрифтов часто решает проблему кодировки.

Как сделать отсканированный PDF-файл редактируемым с помощью OCR

Оптическое распознавание символов — это процесс, который преобразует изображения текста в реальный редактируемый текст. Современная технология оптического распознавания символов обеспечивает высокую точность и позволяет получать чистые, хорошо освещенные сканы печатного текста, напечатанного обычными шрифтами и типичными размерами. При запуске OCR в отсканированном PDF-файле за каждым изображением страницы добавляется скрытый текстовый слой, содержащий распознанные символы. После завершения OCR вы можете искать текст в документе и в большинстве редакторов PDF редактировать распознанный текст, как если бы он был изначально родным.

Качество вывода OCR зависит от качества отсканированных изображений. Сканирование с высоким разрешением 300 точек на дюйм, равномерным освещением, плоскими страницами и четкой фокусировкой обеспечивает точность распознавания текста стандартного печатного текста более 99 процентов. Сканирование с низким разрешением и разрешением 150 точек на дюйм с тенями, изогнутыми страницами переплетенной книги или нерезкими областями дает меньшую точность и требует большего количества ручной коррекции после оптического распознавания символов. Сканирование документов с учетом оптического распознавания символов, то есть плоских страниц, хорошего освещения и адекватного разрешения, значительно упрощает процесс редактирования.

Большинство редакторов PDF, поддерживающих OCR, включают выбор языка в настройки распознавания. Выбор правильного языка повышает точность, поскольку механизм OCR использует словари для конкретного языка и данные о частоте символов для разрешения неоднозначных символов. Документ на французском языке, распознанный с настройкой французского языка, дает лучшие результаты, чем тот же документ, распознанный с настройкой английского языка. Для многоязычных документов выберите основной язык и вручную исправьте все ошибки в фрагментах дополнительного языка.

Инструмент OCR PDF WukongPDF обрабатывает отсканированные документы в браузере и возвращает PDF-файл с доступным для поиска и редактируемым текстовым слоем. Механизм OCR поддерживает несколько языков и обрабатывает распространенные типы документов, включая письма, формы, квитанции и статьи. После OCR ранее нередактируемый отсканированный PDF-файл становится редактируемым, а распознанный текст доступен для выбора, поиска и изменения.

Альтернативные подходы, когда прямое редактирование PDF невозможно

Если PDF-файл невозможно сделать доступным для прямого редактирования либо потому, что это отсканированный документ без доступа к оптическому распознаванию символов, либо потому, что он имеет ограничения безопасности, которые вы не можете удалить, альтернативные рабочие процессы позволяют достичь того же результата другим путем. Преобразуйте PDF-файл в редактируемый формат, например Word или Google Docs, внесите изменения в этот формат и преобразуйте отредактированный документ обратно в PDF. Обход редактируемого формата туда и обратно занимает больше времени, чем прямое редактирование, но работает для любого PDF-файла, который можно открыть и просмотреть.

Для документов, которые требуют лишь незначительных исправлений, таких как исправление опечатки в одном абзаце, прагматичным обходным решением является использование инструментов аннотирования PDF-файла, чтобы покрыть неправильный текст белым прямоугольником и напечатать исправленный текст сверху. Этот метод на самом деле не редактирует основной текст и структуру документа, поэтому коррекция на основе аннотаций невидима для инструментов поиска и специальных возможностей, но для быстрых визуальных исправлений в документе, который будет распечатан или просмотрен как изображение, он дает приемлемые результаты.

Для документов, которые требуют обширного редактирования и не могут быть отредактированы напрямую, наиболее надежным подходом является возврат к исходному исходному документу, если он доступен.

Документ Word, Google Doc или файл InDesign, который использовался для создания PDF-файла, содержит редактируемый текст, который можно изменить и повторно экспортировать в новый PDF-файл. Обратиться к создателю документа за исходным файлом или найти исходный файл в своих собственных записях зачастую быстрее, чем пытаться редактировать несовместимый PDF-файл.

Некоторые PDF-файлы, которые кажутся содержащими собственный текст, на самом деле содержат текст таким образом, что инструменты редактирования не могут его изменить, хотя текст доступен для поиска и выбора. Эта ситуация возникает, когда PDF-файл имеет правильный текстовый слой, который позволяет осуществлять поиск и выбор, но базовая кодировка шрифта не позволяет инструменту редактирования сопоставить отредактированные символы обратно с правильными визуальными глифами. Инструмент редактирования может читать текст, но не может записать изменения обратно в документ без потенциального повреждения сопоставления символов. Эта защита от редактирования иногда является преднамеренной со стороны создателя документа.

Распространение инструментов редактирования PDF упростило редактирование PDF-файлов, но также привело к путанице в отношении того, что представляет собой редактирование. Добавление текстовой аннотации поверх страницы PDF — это не то же самое, что редактирование основного текста. Замена изображения на странице PDF — это не то же самое, что редактирование текста, описывающего изображение. Понимание разницы между изменениями на основе аннотаций, при которых новый контент накладывается поверх существующей страницы, и настоящим редактированием текста, при котором изменяется фактическое текстовое содержимое в структуре PDF, поможет вам выбрать правильный инструмент и правильный подход для каждой задачи редактирования.

Для документов, которые сопротивляются всем попыткам редактирования и содержат информацию, критически важную для обновления, ядерным вариантом является воссоздание документа с нуля. Используйте PDF-файл в качестве визуальной справки и перепечатывайте содержимое в текстовый процессор или приложение для дизайна, внося изменения в процессе воссоздания. Этот подход трудоемкий, но позволяет получить чистый, полностью редактируемый документ без остаточных проблем с форматированием, проблемами со шрифтами или артефактами преобразования. Восстановление документа из PDF-файла занимает время, пропорциональное длине и сложности документа, а для коротких документов, требующих значительного редактирования, это может оказаться быстрее, чем бороться с несовместимыми инструментами редактирования PDF-файлов.

WukongPDF

Попробуйте редактировать PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →