Tips & Tricks

Как обрезать PDF-файл, чтобы удалить верхние и нижние колонтитулы, номера страниц и водяные знаки

Вы загружаете PDF-файл исследовательской работы. Каждая страница имеет название журнала в заголовке и URL-адрес в нижнем колонтитуле. Вы хотите извлечь только чистый текст статьи, но эти верхние и нижние колонтитулы, а также номера страниц и декоративные правила появляются на каждой странице. Когда вы копируете и вставляете текст, строки верхнего и нижнего колонтитула чередуются с основным текстом, создавая беспорядок. Удаление этих повторяющихся элементов путем обрезки позволяет получить чистый и читаемый документ.

Обрезка PDF-файла для удаления верхних, нижних колонтитулов и номеров страниц — это целевая версия общей операции обрезки. Вместо удаления пустых полей вокруг всей страницы вы обрезаете определенные зоны, где находятся повторяющиеся элементы. Подход Crop PDF работает, когда эти элементы занимают одинаковые позиции на каждой странице.

How to Crop a PDF to Remove Headers, Footers, Page Numbers, and Watermarks

Измерение зон верхнего и нижнего колонтитула

Прежде чем обрезать, измерьте, сколько места занимают верхние и нижние колонтитулы. Откройте PDF-файл с масштабом 100%. Заголовок обычно занимает верхние 0,5–1 дюйм страницы. Нижний колонтитул обычно занимает нижнюю часть от 0,5 до 1 дюйма. Номера страниц обычно указываются в нижнем колонтитуле, но могут отображаться и в заголовке. Водяные знаки могут появляться где угодно, но обычно они располагаются по центру. Используйте линейку или инструмент измерения в средстве просмотра PDF-файлов, чтобы измерить точные расстояния от краев страницы до места начала и окончания основного текста.

Если линейка не видна, используйте ссылочный элемент на странице. Основной текст обычно начинается примерно на расстоянии от 0,75 до 1 дюйма от верха страницы размером с букву. Нижнее поле, где расположены нижний колонтитул и номера страниц, обычно составляет от 0,5 до 0,75 дюйма. Это стартовые оценки. Измеряйте свой конкретный документ, поскольку в академических журналах, правительственных публикациях и корпоративных шаблонах используются разные схемы маржи.

WukongPDF

Попробуйте обрезать PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Внесение урожая

Инструмент обрезки WukongPDF обеспечивает числовой ввод полей обрезки. Установите верхний край обрезки на измеренную высоту жатки, обычно 0,75 дюйма. Установите нижнее поле обрезки на измеренную высоту нижнего колонтитула, обычно 0,5 дюйма. Оставьте левое и правое поля равными нулю, если вы также не хотите обрезать боковые поля. Примените обрезку ко всем страницам. Верхние и нижние колонтитулы теперь находятся за пределами видимой области страницы. В документе отображается только основное содержимое.

Специальный метод для документов, в которых верхние и нижние колонтитулы расположены близко к основному тексту: слегка обрезать область основного текста, а не точно по границе. Перекрытие основного текста на 0,1 дюйма гарантирует, что фрагменты верхнего или нижнего колонтитула не останутся видимыми. Альтернативный вариант, оставляющий зазор в 0,05 дюйма, может привести к тому, что на некоторых страницах останется видимым кусочек повторяющегося текста, что будет выглядеть неряшливо и противоречит цели обрезки.

Обработка водяных знаков в центре страницы

Для водяного знака в центре страницы обрезка не поможет, поскольку при обрезке удаляются только внешние края. Центрированный «ЧЕРНОВИК»; или «КОНФИДЕНЦИАЛЬНО»; водяной знак перекрывает основной текст, и его нельзя обрезать, не удалив при этом содержимое, которое вы хотите сохранить. Для центрированных водяных знаков обрезка — неправильный инструмент. Вместо этого используйте инструмент удаления водяных знаков, который обнаруживает и удаляет слой водяных знаков, сохраняя при этом содержимое под ним.

Инструмент различает эти два случая. Инструмент обрезки PDF Pages обрабатывает повторяющиеся элементы, расположенные по краям. Инструмент водяных знаков обрабатывает водяные знаки, расположенные в содержимом. Знание того, какой инструмент использовать для какого типа нежелательных элементов, позволяет избежать разочарований, связанных с попыткой обрезать то, чего обрезка не может достичь.

Что делать, если верхние и нижние колонтитулы на разных страницах различаются

Некоторые документы имеют заголовки, которые меняются от раздела к разделу. Глава 1 может иметь короткий заголовок. Глава 2 может иметь более длинный заголовок, простирающийся дальше вниз по странице. Применение равномерного кадрирования на основе самого большого заголовка удаляет слишком много контента со страниц с более короткими заголовками. Решение состоит в том, чтобы разделить документ по разделам, применить к каждому разделу разные настройки обрезки и повторно объединить. Это требует больше работы, но дает более чистый результат, чем обрезка, которая разрезает основной текст на некоторых страницах или оставляет фрагменты заголовка на других.

Аналогичным образом, документы, в которых страницы с альбомной ориентацией смешаны с страницами с книжной ориентацией, требуют отдельной обработки. Заголовок, занимающий 0,75 дюйма вверху страницы с книжной ориентацией, занимает такое же физическое расстояние на странице с альбомной ориентацией, но размеры страницы разные. Примените обрезку к страницам с книжной ориентацией, а затем примените отдельно измеренную обрезку к страницам с альбомной ориентацией. Такой подход к каждой ориентации обеспечивает последовательную обрезку независимо от поворота страницы.

После обрезки: освобождение пространства

Обрезка скрывает содержимое, но не удаляет его и не уменьшает размер файла. Обрезанные данные верхнего и нижнего колонтитула все еще находятся в файле за пределами видимой области. Если размер файла имеет значение, сожмите обрезанный PDF-файл после обрезки. На этапе сжатия скрытые данные изображения отбрасываются. Размер файла уменьшается, а качество видимого содержимого не меняется, поскольку удаляются только скрытые области.

Для документов, которые будут перепечатываться или распространяться, рассмотрите возможность добавления примечания о том, что верхние и нижние колонтитулы были намеренно удалены. Краткая заметка на первой странице: «Верхние и нижние колонтитулы обрезаны для ясности». не позволяет получателю думать, что документ неисправен. Это особенно важно для юридических или научных документов, где верхние и нижние колонтитулы могут содержать идентифицирующую информацию, которую ожидают увидеть получатели. PDF Editor WukongPDF может добавлять к первой странице текстовую аннотацию, объясняющую обрезку, что быстрее, чем редактирование документа для вставки пояснительного абзаца.

Удаление верхних и нижних колонтитулов путем обрезки дает дополнительное преимущество в плане доступности. Программы чтения с экрана часто читают вслух текст верхнего и нижнего колонтитула на каждой странице, прерывая поток основного контента повторными объявлениями названия документа, URL-адреса или номера страницы. Это утомительно для пользователей программ чтения с экрана, особенно при работе с длинными документами. При обрезке верхних и нижних колонтитулов они удаляются с видимой страницы, но текст по-прежнему может присутствовать в слое содержимого PDF-файла и по-прежнему может быть прочитан вспомогательными технологиями. Для обеспечения полной доступности после обрезки пометьте обрезанные области верхнего и нижнего колонтитула как артефакты в дереве тегов PDF-файла. Артефакты игнорируются программами чтения с экрана. Этот двухэтапный процесс: визуальное обрезка и последующая структурная пометка как артефакты — создает документ, более понятный как для зрячих читателей, так и для пользователей ассистивных технологий.

Распространенный сценарий, в котором обрезка верхних и нижних колонтитулов особенно полезна: извлечение чистого текста статьи из академических PDF-файлов для создания заметок или управления цитированием. Журнальные статьи обычно содержат название журнала, DOI и номера страниц в верхнем и нижнем колонтитулах на каждой странице. Если их обрезать, получится чистый текст, который можно будет читать без визуальных помех. Однако имейте в виду, что при обрезке удаляется информация о цитировании. Если вам понадобится процитировать статью позже, запишите DOI и название журнала перед обрезкой или сохраните как обрезанную чистую версию, так и оригинал. Обрезанная версия предназначена для чтения. Оригинал предназначен для справки.

WukongPDF

Попробуйте обрезать PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →