PDF-файл, наполненный фотографиями, диаграммами, логотипами и декоративными изображениями высокого разрешения, может оказаться непрактичным для рабочих процессов, ориентированных на текст. Если вам нужны только слова, удаление всех изображений PDF и экспорт только текстовой версии создаст файл значительно меньшего размера, содержащий только текстовое содержимое документа. Вопрос в том, является ли полученный текстовый вывод полным и пригодным для использования по назначению.
Короткий ответ — да, для текстовых PDF-файлов, где текст существует в виде выбираемых символов. Для отсканированных PDF-файлов, в которых текст является частью изображения, при удалении изображений удаляется все, включая текст. Основное различие заключается между PDF-файлами с собственным текстом, где текст и изображения представляют собой отдельные слои, и PDF-файлами на основе изображений, где вся страница представляет собой изображение без текстового слоя.
Извлечение PDF в Text удаляет изображения, сохраняя при этом текстовое содержимое. Для документов, в которых текст имеет основное значение, а изображения являются дополнительными, вполне пригоден вывод только текста. Для документов, в которых изображения передают важную информацию, таких как медицинские снимки или архитектурные чертежи, при выводе только текста теряется важное содержимое.
Инструменты обработки PDF-файлов WukongPDF включают функции удаления изображений и извлечения текста.

Разница между собственным текстом и PDF-файлами на основе изображений
Собственный текстовый PDF-файл хранит текст в виде кодов символов, расположенных на странице. Изображения — это отдельные объекты, наложенные или расположенные между текстовыми блоками. Когда вы удаляете изображения из собственного текстового PDF-файла, текст остается нетронутым и полностью читаемым. Структура документа, такая как заголовки, абзацы и разрывы страниц, сохраняется. Исчезают лишь декоративные и иллюстративные изображения.
PDF-файл на основе изображений хранит всю страницу в виде растрового изображения, обычно полученного со сканера или снимка экрана. Нет текстовых символов, которые можно было бы сохранить. Удаление изображений из PDF-файла на основе изображений удаляет все, создавая пустой документ. В отсканированных PDF-файлах, обработанных с помощью оптического распознавания символов, за изображением находится невидимый текстовый слой. При удалении изображения удаляется видимая отсканированная страница, но сохраняется текст оптического распознавания символов, который может содержать ошибки распознавания.
Чтобы определить тип PDF-файла, откройте его в любой программе чтения PDF-файлов и попробуйте выделить слово текста. Если вы можете выбрать отдельные символы, PDF-файл представляет собой собственный текст, а удаление изображений сохранит текст. Если при нажатии вся страница выбирается как один большой блок изображения, PDF-файл основан на изображениях, и при удалении изображений ничего не останется или останется только текстовый слой OCR.
Попробуйте сжать PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
Метод 1. Удаление изображений с помощью Acrobat Pro PDF Optimizer
Откройте PDF-файл в Acrobat Pro и выберите «Файл», «Сохранить как другое», «Оптимизированный PDF». В диалоговом окне «Оптимизатор PDF» нажмите «Удалить объекты» на левой панели. Установите флажок Удалить все изображения. В разделе «Очистка» установите флажок «Удалить неиспользуемые объекты». Нажмите «ОК» и сохраните оптимизированный файл под новым именем. Acrobat обрабатывает файл и удаляет все объекты растрового изображения.
На практике результирующее уменьшение размера файла может быть значительным. PDF-файл размером 20 МБ с фотографиями высокого разрешения может уменьшиться до размера менее 100 КБ, если документ представляет собой преимущественно текст со встроенными изображениями. Откройте оптимизированный файл и прокрутите каждую страницу, чтобы убедиться, что весь текстовый контент присутствует и читается. Проверьте области страницы, где изображения были удалены. Макет может немного измениться, поскольку место, ранее занимаемое изображениями, теперь пусто.
Если вместе с изображениями было удалено какое-либо важное содержимое, например диаграммы, которые хранились в виде изображений, а не векторной графики, отмените операцию и используйте более избирательный подход. Вместо того, чтобы удалять все изображения, сильно сожмите их или замените текстом-заполнителем, описывающим то, что было удалено.
Метод 2: Программное извлечение текста
Библиотеки Python, такие как PyMuPDF и pdfplumber, извлекают текст, игнорируя изображения. При извлечении считывается только текстовый слой, создавая чистый текстовый поток без каких-либо данных изображения. Извлеченный текст можно сохранить в виде файла .txt для редактирования или передать в новый текстовый PDF-файл. Программный подход позволяет использовать сценарии, повторять и обрабатывать пакетную обработку нескольких файлов.
Для отсканированных PDF-файлов, содержащих текстовый слой OCR, программное извлечение считывает текст OCR. Качество полностью зависит от точности оптического распознавания символов. Чисто отсканированный документ с помощью современного оптического распознавания символов может создать текст с точностью до 99 процентов. Плохо отсканированный документ с помощью старого оптического распознавания символов может содержать текст, требующий существенной ручной коррекции. Извлечение будет включать в себя любые ошибки OCR, присутствующие в текстовом слое.
Проверка качества после экстракции
После удаления изображений или текста проверьте качество вывода перед его использованием. Сравните количество слов в извлеченном тексте с оценкой, полученной вручную из исходного документа. Значительное несоответствие предполагает, что контент был утерян. Найдите известные термины, которые встречаются в оригинале, чтобы убедиться, что они присутствуют в выходных данных. Просмотрите первый и последний абзацы каждого основного раздела, чтобы убедиться в полноте.
Когда дело доходит до документооборота, для документов, где точность текста имеет решающее значение, таких как юридические документы или финансовые отчеты, попросите второго рецензента выборочно проверить извлеченный текст по сравнению с исходным PDF-файлом. Даже 99-процентная точность извлечения означает одну ошибку на сто слов, что может быть неприемлемо для точных документов. В ходе проверки выявляются ошибки извлечения, которые пропускают автоматические проверки качества.
| Тип документа | Безопасно раздеваться? | Альтернатива |
|---|---|---|
| Юридическое заключение | Да, текст является основным | Ничего не нужно |
| Отчет с диаграммами | Нет, диаграммы содержат данные | Компресс вместо полоски |
| Отсканированный документ | Нет, сканировать ЕСТЬ контент | Сначала OCR, затем извлеките текст |
Удаление изображений из PDF-файла целесообразно, когда текстовое содержимое является основным значением, а изображения второстепенными. Получаемый в результате текстовый файл значительно меньше, полностью доступен для поиска и готов к анализу текста, переводу или перепрофилированию контента. Решение об удалении изображений должно быть принято после подтверждения того, что текст сам по себе передает основное значение документа.
Когда дело доходит до рабочих процессов с документами, для документов, в которых изображения и текст работают вместе, сохраняйте полный PDF-файл и оптимизируйте его путем сжатия, а не удаления. Сжатый PDF-файл сохраняет визуальную связь между текстом и изображениями, одновременно уменьшая размер файла для распространения.
Что происходит с макетом PDF после удаления изображения
Во время типичных рабочих процессов, когда изображения удаляются, место, которое они занимали на странице, становится пустым. Текст, окруженный изображениями, может перестроиться в пустое пространство. Таблицы, включающие ячейки изображений, будут иметь пустые ячейки. Макеты страниц, разработанные с учетом размещения определенных изображений, могут выглядеть неудобно. Разрезанный PDF-файл оптимизирован для содержания, а не для визуального дизайна.
Для документов, где целостность макета имеет значение, рассмотрите возможность замены изображений текстом-заполнителем, а не удалением их полностью. Заголовок, например «Изображение удалено»: вместо каждого изображения можно вставить фотографию продукта. Заполнитель сохраняет структуру макета, признавая при этом, что визуальное содержимое было намеренно удалено.
Использование OCR для создания текстового слоя перед удалением изображения
При обработке документов для отсканированных PDF-файлов без текстового слоя запуск OCR перед удалением изображения создает текстовые данные, которые сохраняются в процессе удаления. OCRmyPDF может добавить текстовый слой к отсканированным PDF-файлам с помощью одной команды. После обработки OCR PDF-файл содержит как видимое отсканированное изображение, так и невидимый текстовый слой. При удалении изображений затем удаляется отсканированная страница с сохранением распознанного текста.
На практике качество оптического распознавания напрямую определяет удобство использования очищенного вывода. Документ с точностью распознавания текста 99 процентов создает пригодный для использования текст со случайными ошибками. Документ с точностью 80 процентов создает текст, требующий существенной ручной коррекции. Прежде чем приступать к удалению изображений из отсканированных документов, запустите распознавание текста и оцените качество текста на образце страницы.
Сжатие изображений как альтернатива удалению
Что касается документов, полное удаление изображений которых приведет к потере ценного содержимого, агрессивное сжатие изображений обеспечивает золотую середину. Уменьшение размера изображений до 72 точек на дюйм с высоким сжатием JPEG может уменьшить размер PDF-файла размером 20 МБ до 2–3 МБ, сохраняя при этом изображения распознаваемыми. Сжатые изображения имеют низкое качество, но все же передают визуальную информацию.
Сочетание сжатия с выборочным удалением изображений обеспечивает максимальную гибкость. Сохраняйте изображения на тех страницах, где они необходимы, например, диаграммы и фотографии, занимающие центральное место в содержании, и удаляйте декоративные изображения со страниц, где они не несут никакой информационной цели. Гибридный подход требует больше ручной работы, но обеспечивает наилучший баланс качества и размера.
Экспорт только текстового PDF-файла предназначен для конкретных случаев использования: подача контента в конвейеры анализа текста, создание облегченных версий для чтения на мобильных устройствах и подготовка документов к переводу, где изображения могут увеличить стоимость, не добавляя ценности. В каждом из этих вариантов использования текст — это продукт, а изображения — упаковка, которую можно выбросить.
Решение об удалении изображений должно быть задокументировано, чтобы будущие читатели текстовой версии понимали, что визуальный контент был удален намеренно. Краткое примечание в свойствах документа или на титульном листе предотвращает путаницу, когда кто-то сравнивает текстовую версию с оригиналом.
В большинстве инструментов экспорт только текстовых PDF-файлов является специализированным инструментом для конкретных нужд. Это не универсальная оптимизация. Для большинства документов сжатие является лучшим первым шагом, чем удаление изображения. Зарезервируйте удаление изображений для случаев, когда текст является единственным ценным содержимым, а цели документа служит только текст.
Понимание возможностей и ограничений удаления изображений гарантирует, что оно применяется к нужным документам по правильным причинам, создавая выходные данные, которые служат своей намеченной цели без непреднамеренной потери содержимого. PDF-файл, содержащий только текст, хорошо служит конкретным целям и должен применяться выборочно в зависимости от типа документа и предполагаемого использования.
Попробуйте сжать PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
