Извлечение из PDF-файла только нечетных или только четных страниц является на удивление распространенной задачей. Двусторонний сканер может сканировать каждый лист как две отдельные страницы, но для отчета вам нужны только лицевые стороны. В объединенном документе страницы содержимого могут смешиваться с пустыми страницами-заполнителями, которые необходимо удалить. Или задание печати требует разделения двустороннего документа на два односторонних файла для принтера, который не поддерживает автоматическую двустороннюю печать. Инструменты Split PDF упрощают это извлечение, если вы поймете логику выбора страниц на основе шаблонов.
Основной принцип один и тот же для всех методов извлечения: определите диапазон страниц, используя нечетный или четный фильтр, а затем экспортируйте только те страницы, которые соответствуют фильтру. 100-страничный PDF-файл, в котором вам нужны все нечетные страницы, означает экспорт страниц с 1, 3, 5 до 99. Большинство инструментов PDF поддерживают это с помощью простой нотации шаблона. Разница между инструментами заключается в том, требуют ли они ввода номеров страниц вручную или принимают сокращение, например 1-100:нечетное.
Инструменты PDF Pages WukongPDF включают в себя функции извлечения и разделения страниц, которые осуществляют выбор на основе шаблонов непосредственно в браузере. Для пакетных операций с большими наборами документов описанные ниже подходы с использованием командной строки и сценариев обеспечивают лучшую автоматизацию.

Зачем извлекать нечетные или четные страницы?
На практике наиболее распространенным сценарием является обработка документов, отсканированных с помощью двустороннего сканирования. Сканер, установленный в дуплексный режим, сканирует лицевую сторону страницы 1 как страницу 1, обратную сторону как страницу 2, лицевую сторону страницы 2 как страницу 3 и так далее. Если вам нужны только лицевые стороны каждого листа, вы извлекаете нечетные страницы. Если вам нужны только обратные стороны, вы извлекаете четные страницы. Этот рабочий процесс является стандартным для проектов оцифровки архивов, обработки юридических документов и бухгалтерских отделов, которые сканируют обе стороны квитанций, но сохраняют только лицевую сторону.
Другой распространенный случай — документы с переменным содержимым и пустыми страницами. Некоторые генераторы PDF-файлов вставляют пустую страницу после каждой страницы содержимого, чтобы новые главы всегда начинались с правой страницы в макете для печати. Когда документ переходит к распространению только в цифровом формате, эти пустые страницы добавляют визуальный шум и увеличивают размер файла, не внося никакой информации. Извлечение только непустых страниц, которые часто имеют нечетный или четный шаблон, очищает документ. Прежде чем извлекать по четности, убедитесь, что пустые страницы последовательно занимают нечетное или четное положение по всему документу.
Типографии также используют извлечение нечетных чисел для подготовки документов к определенным методам переплета. Для идеального переплета требуется отдельная стопка для передней и задней страниц. Операция PDF Batch, которая разбивает PDF-файл книги на нечетные и четные компоненты, подготавливает обе стопки за секунды.
Попробуйте разделить PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
Метод 1: Использование системы организации страниц Adobe Acrobat Pro
Acrobat Pro обеспечивает наиболее наглядный подход к извлечению четных и нечетных данных. Откройте PDF-файл, перейдите в «Инструменты», затем «Упорядочить страницы». В режиме миниатюр отображается каждая страница с ее номером. Щелкните раскрывающийся список «Выбрать страницы» и выберите «Диапазон страниц». Введите шаблон для нечетных страниц, вводя отдельные номера страниц вручную, например 1,3,5,7 для небольшого документа. Для более длинных документов Acrobat изначально не поддерживает сокращение для нечетных и четных чисел, поэтому вам необходимо либо ввести полную последовательность, либо использовать обходной путь.
Практическим решением для более длинных документов в Acrobat Pro является использование инструмента «Извлечение» с обходным подходом. Откройте панель «Страницы» слева, выберите первую нечетную страницу, щелкнув ее миниатюру, затем, удерживая клавишу Ctrl, щелкайте каждую последующую нечетную страницу. После того, как все целевые страницы выбраны, щелкните правой кнопкой мыши и выберите «Извлечь страницы». В диалоговом окне установите флажок «Извлекать страницы как отдельные файлы», если вам нужны отдельные файлы страниц, или оставьте этот флажок снятым, чтобы получить один объединенный PDF-файл. Нажмите ОК. Acrobat создаст новый PDF-файл, содержащий только выбранные страницы. Этот метод возможен для документов объемом до 30 страниц. Кроме того, щелчок вручную становится подверженным ошибкам, а подход с использованием сценариев становится более практичным.
Метод 2: Онлайн-инструменты PDF и выбор на основе шаблона
Некоторые онлайн-инструменты PDF поддерживают извлечение страниц на основе шаблонов с нечетным/четным синтаксисом сокращений. Найдите в интерфейсе инструмента функции «Разделение», «Извлечение» или «Выбор страницы». Когда будет предложено ввести номера страниц, введите диапазон с модификатором нечетного или четного числа. Общие синтаксисы включают 1-100:нечетный или 1-100:четный или просто выбор нечетных страниц в раскрывающемся меню. Инструмент обрабатывает шаблон на стороне сервера и возвращает PDF-файл, содержащий только соответствующие страницы.
Онлайн-инструменты комфортно обрабатывают документы объемом до нескольких сотен страниц. Время обработки линейно зависит от количества страниц. Документ объемом 200 страниц может занять от 15 до 30 секунд. Большинство онлайн-инструментов также предлагают дополнительную обратную операцию. Если вы извлекаете нечетные страницы и хотите также получить четные страницы, запустите извлечение четных страниц в том же документе или установите флажок «Разделить на нечетные и четные», если инструмент предоставляет такую возможность. Загрузите оба выходных файла немедленно, поскольку бесплатные инструменты обычно удаляют обработанные файлы со своих серверов в течение нескольких часов.
Метод 3: Инструменты командной строки для пакетной обработки
Для пользователей, которым комфортно работать с командной строкой, pdftk и qpdf предлагают точный контроль над извлечением четных и нечетных данных без необходимости ручного нажатия. pdftk поддерживает операцию cat с шаблонами диапазонов страниц. Команда pdftk input.pdf cat 1-100odd output нечетных страниц.pdf извлекает все страницы с нечетными номерами из первых 100 страниц. Замените нечетное на четное для четных страниц. Инструмент обрабатывает документ типичных офисных размеров менее чем за секунду.
qpdf, более современная альтернатива, обеспечивает аналогичную функциональность с помощью флага --pages. Команда qpdf --empty --pages input.pdf 1-100:odd -- output.pdf выбирает нечетные страницы. qpdf обрабатывает зашифрованные PDF-файлы более изящно, чем pdftk, и сохраняет более широкий спектр функций PDF, включая закладки, ссылки и поля форм во время извлечения.
| Метод | Наилучший вариант для | Ограничение |
|---|---|---|
| Страницы организации Acrobat Pro | Визуальный выбор, небольшие наборы | Ручная обработка каждого документа |
| Онлайн-инструменты PDF | Быстрое извлечение, без установки | Ограничения на размер файлов на бесплатных уровнях |
| Командная строка (pdftk, qpdf) | Пакетная обработка, создание сценариев | Требуется знание командной строки |
| Автоматизация Python | Индивидуальные правила, большие масштабы | Требуется программирование |
Для повторяющихся пакетных операций оберните инструмент командной строки в сценарий оболочки, который проходит через папку PDF-файлов. Один цикл bash или PowerShell for может обработать сотни документов за считанные минуты. Подход с использованием командной строки также интегрируется в автоматизированные конвейеры документов, где PDF-файлы поступают в отслеживаемую папку, а обработанные файлы перемещаются в выходную папку без какого-либо вмешательства человека.
Автоматизация извлечения нечетно-четных с помощью Python
Библиотеки Python, такие как PyPDF2 и pikepdf, позволяют программировать извлечение страниц с помощью специальной логики, выходящей за рамки простых правил «нечет-чет». Сценарий Python может читать PDF-файл, перебирать его страницы, проверять номер страницы на соответствие любому условию и сохранять соответствующие страницы в новый файл. Логика может сочетать четность с другими фильтрами: извлекать нечетные страницы, но пропускать страницы размером меньше определенного размера, или извлекать четные страницы, только если они не пустые.
Базовый сценарий PyPDF2 для нечетных страниц требует менее 15 строк кода. Сценарий создает объект чтения для входного PDF-файла, объект записи для выходного файла, циклически перебирает страницы, используя enumerate с начальным индексом 1, проверяет, равен ли номер страницы по модулю 2 1 для нечетного или 0 для четного, и добавляет соответствующие страницы в средство записи. Сценарий последовательно обрабатывает документы любой длины, не утомляя ручным выбором, который ограничивает извлечение с помощью графического пользовательского интерфейса.
Проверка результата извлечения
После любого метода извлечения убедитесь, что выходные данные содержат правильные страницы и что ни одна страница не была удалена. Откройте одновременно исходный и извлеченный PDF-файлы. Прокрутите до нескольких известных страниц оригинала, например страниц 3, 7 и 15 для извлечения нечетных страниц, и убедитесь, что они появляются в извлеченном документе в правильном порядке. Убедитесь, что общее количество страниц извлеченного файла соответствует ожиданиям: извлечение нечетных страниц из 100-страничного документа должно дать 50 страниц.
Если ссылки на страницы или закладки в исходном PDF-файле указывают на определенные номера страниц, эти ссылки будут нарушены после извлечения, поскольку нумерация страниц изменилась. Закладка, которая в оригинале указывала на страницу 42, теперь указывает на любой контент, оказавшийся на новой позиции страницы 42, что вряд ли будет правильным. Для документов, которые в значительной степени зависят от внутренней навигации, запланируйте восстановление закладок после извлечения или используйте такой инструмент, как qpdf, который сохраняет места назначения ссылок во время процесса выбора страницы.
Извлечение нечетных или четных страниц из PDF-файла — это механическая операция, с которой надежно справляется любой из вышеперечисленных методов. Выбор правильного метода зависит от того, сколько документов вам необходимо обработать и является ли это разовой задачей или повторяющимся рабочим процессом. Для периодического извлечения данных из короткого документа визуальный выбор в Acrobat Pro является наиболее интуитивным. При пакетной обработке папки отсканированных двусторонних документов инструменты командной строки обрабатывают их все одной командой. Для автоматизированных конвейеров документов, где правила извлечения сочетаются с другими этапами обработки, сценарий Python обеспечивает гибкость, с которой не может сравниться ни один инструмент с графическим интерфейсом. Какой бы метод вы ни выбрали, всегда проверяйте количество выходных страниц и порядок страниц перед архивированием исходного файла или отправкой извлеченных страниц по назначению.
Обработка краевых случаев при извлечении нечетно-четных
Некоторые документы не следуют четкому чередующемуся шаблону. В PDF-файле с титульной страницей, за которой следует содержимое, отсканированное в режиме двустороннего сканирования, страница 1 является односторонней обложкой, а страницы со 2 по 101 — двусторонними сканами. Извлечение нечетных страниц из всего документа приведет к захвату обложки и лицевой стороны, что является желаемым результатом для большинства случаев использования. Если вам нужно исключить обложку, запустите извлечение со 2-й страницы до конца: 2-101нечет. Большинство инструментов командной строки и онлайн-сервисов поддерживают объединение диапазона страниц с модификатором нечетного или четного.
Документы со страницами разного размера представляют собой еще один крайний случай. PDF-файл, содержащий как страницы писем, так и страницы таблоидов, при разделении путем извлечения нечетно-четных страниц обеспечивает правильный выбор страниц, но может вызвать проблемы в последующих системах, которые ожидают однородных размеров страниц. После извлечения проверьте размеры страниц выходного документа. Если последующие процессы требуют одинаковых размеров страниц, перед дальнейшей обработкой обрежьте или измените размер извлеченных страниц до согласованного формата.
Попробуйте разделить PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
