Tips & Tricks

Как разделить PDF-файл по текстовому содержимому вместо количества страниц

Большинство инструментов разделения PDF делят документ по количеству страниц. Каждые десять страниц становятся новым файлом. Каждая сотня страниц становится новым файлом. Границы разделения являются чисто числовыми, без учета того, что на самом деле находится на страницах. Глава заканчивается в середине разделенного файла. Разрыв раздела переносит три страницы в новый документ. Разделение PDF-файла по текстовому содержимому, конкретным словам, фразам или шаблонам, появляющимся на страницах, создает выходные файлы, в которых каждый документ представляет собой логически завершенную единицу. Для операции Split PDF, которая считывает содержимое страницы и разбивает его по значимым границам, требуется инструмент, который может выполнять поиск в текстовом потоке и обрабатывать результаты.

How to Split a PDF by Text Content Instead of Page Count

Когда разделение по контенту лучше, чем разделение по страницам

Численное разделение работает, когда исходный документ имеет совершенно регулярную структуру. Счет-фактура, в которой каждый счет состоит ровно из двух страниц, можно с полной точностью разделить по количеству страниц. Но большинство реальных документов нерегулярны. Пакет медицинских записей содержит файлы пациентов объемом от двух до сорока страниц. Объединенный пакет контрактов объединяет соглашения различной продолжительности. В отсканированном файле корреспонденции смешаны письма на одну страницу с приложениями на десять страниц. Разделение на основе контента определяет естественные границы документа и разделяет его в этих точках.

PDF Пакет банковских выписок, каждая из которых начинается с текста «Период выписки» на первой странице, может быть разделена при каждом появлении этой фразы. Каждый выходной файл содержит один полный оператор. Пакет юридических документов, каждый новый документ которого начинается с фразы В СУДЕ, может быть разделен в каждом случае. Текстовый контент на странице служит сигналом разделения. Точки разделения — это те места, где, по словам контента, они должны быть, а не места, где находится произвольное количество страниц.

WukongPDF

Попробуйте разделить PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Идентификация текста разделенного сигнала

Просканируйте PDF-файл и найдите текстовую строку, которая надежно появляется в начале каждого логического документа. Текст должен быть уникальным в пределах границ документа. Фраза, которая появляется как в середине документа, так и в начале, приводит к ложному разделению. Фраза, которая иногда отсутствует, приводит к пропущенным разделениям. Тщательно выбирайте текст. Наиболее надежными сигналами разделения являются текст заголовка, который появляется только в начале нового раздела, номера счетов или номера дел, которые меняются в разных документах, или стандартизированные вступительные фразы, такие как дата выписки или номер счета.

Проверьте разделенный сигнал на выборке страниц перед обработкой всего документа. Найдите в PDF-файле текст сигнала и просмотрите каждое его появление. Убедитесь, что каждое появление действительно отмечает границу документа и что ни одна граница не пропускает сигнал. Скорректируйте текст сигнала, если тест выявляет ложные или пропущенные совпадения. Сигнал, работающий на девяноста процентах документов, по-прежнему требует ручного разделения оставшихся десяти процентов.

Запуск разделения на основе контента

Откройте PDF-файл в инструменте разделения, который поддерживает разделение по тексту. Найдите параметр «Разделить по тексту», «Разделить по содержимому» или «Разделить по шаблону поиска». Введите текст или шаблон сигнала. Инструмент выполняет поиск на каждой странице PDF-файла и определяет страницы, содержащие сигнал. Каждая совпадающая страница становится первой страницей нового выходного файла. Страницы между одним совпадением и следующим образуют тело выходного файла.

Настройте обработку самой страницы сигнала. Некоторые инструменты включают соответствующую страницу в качестве первой страницы нового файла, что обычно является желаемым поведением. Другие разделяются до или после матча, что может привести к тому, что страница сигнала окажется не в том файле. Прежде чем обрабатывать весь пакет, протестируйте конфигурацию на небольшом участке документа. WukongPDF и аналогичные платформы предоставляют функцию Split PDF с разделением по тексту, которое определяет границы документа по содержимому.

Именование выходных файлов с использованием разделенного сигнала

Текст, вызвавший разделение, также может называть выходной файл. Разделенный сигнал INV-, за которым следует номер счета-фактуры, может создать выходные файлы с именами INV-00472.pdf, INV-00473.pdf и т. д. Настройте инструмент для извлечения части соответствующего текста и использования его в качестве имени файла. Шаблон извлечения обычно представляет собой регулярное выражение или диапазон символов в соответствующей строке.

Если текст разделенного сигнала не подходит в качестве имени файла, например, длинная фраза, которая может привести к громоздким именам, настройте инструмент на использование последовательной нумерации в сочетании с фиксированным префиксом. Файлы называются Batch-001.pdf, Batch-002.pdf в порядке разделения. Разделение на основе контента обеспечивает правильные границы. Последовательное именование обеспечивает управляемость имен файлов. Отдельный индексный файл может сопоставить последовательные номера с идентификаторами документов, извлеченными из содержимого.

Обработка нестандартных документов и исключений

Ни одно разделение по контенту не является идеальным с первого раза. В некоторых документах сигнальный текст может находиться на второй странице, а не на первой, возможно, ему предшествует титульный лист. В некоторых документах текст сигнала может повторяться в нижнем колонтитуле, что приводит к ложному разделению. После автоматического разделения просмотрите результат. Проверьте первый и последние файлы на наличие правильных границ. Сравните количество файлов с ожидаемым количеством документов. Несовпадение означает, что сплиты были пропущены или сработали ошибочно.

В исключительных случаях вручную разделите или объедините затронутые файлы. Извлеките неправильно разделенные страницы из неправильного файла и вставьте их в правильный файл. Разделение по содержанию обрабатывает большинство документов автоматически. Ручная коррекция обрабатывает крайние случаи. Сочетание автоматического разделения и целенаправленной ручной коррекции обрабатывает большую партию гораздо быстрее, чем чисто ручное разделение.

Задокументируйте разделенный сигнал и конфигурацию для будущих пакетов того же типа документа. Когда в следующий раз поступит такой же PDF-файл, разделенная конфигурация будет готова. Разделение на основе контента — это инвестиция в автоматизацию. Время настройки окупается при каждом повторном использовании конфигурации.

Разделение на основе содержимого особенно эффективно для обработки повторяющихся типов документов. Как только текст разделенного сигнала определен для пакета ежемесячных отчетов, тот же сигнал будет работать для каждого последующего месяца. Первоначальные инвестиции в идентификацию правильного текста сигнала и тестирование конфигурации разделения окупаются в каждом последующем цикле обработки.

Для документов, в которых текст разделенного сигнала непоследовательен в пакете, двухпроходной подход может повысить точность. Первый проход разделяется с использованием широкого сигнала, который улавливает большинство границ. Второй проход проверяет выходные данные и разделяет файлы, которые были неправильно разделены. Автоматизированный первый проход обрабатывает большинство. Второй проход вручную обрабатывает исключения.

Подход Split PDF, основанный на содержании, а не на количестве страниц, представляет собой разницу между пакетом файлов, который имеет смысл для получателя, и пакетом, который необходимо пересортировать вручную. Дополнительное время настройки составляет лишь часть времени, сэкономленного за счет отсутствия необходимости вручную разделять документы после произвольного разделения по количеству страниц.

Методы, описанные в этой статье, обеспечивают практическую основу для решения этой конкретной задачи PDF. Каждый метод был выбран из-за его надежности и доступности для различных инструментов и платформ.

При правильном подходе и соответствующей конфигурации инструментов то, что на первый взгляд кажется сложной задачей по документированию, становится простым процессом с предсказуемыми и воспроизводимыми результатами.

WukongPDF и аналогичные платформы предоставляют инструменты, необходимые для реализации рабочих процессов, описанных в этой статье, делая эти операции с PDF доступными через интерфейс на основе браузера без необходимости установки программного обеспечения для настольного компьютера.

Практические шаги, описанные в этой статье, проведут читателя от первоначальной задачи до полного решения, охватывая ключевые решения и варианты конфигурации, которые определяют качество конечного результата.

Как и во многих операциях с PDF, качество вывода зависит от тщательности, проявленной на этапе установки и настройки. Потратив время на понимание доступных настроек и их тестирование на образцах документов перед последовательной обработкой всего пакета, вы получите лучшие результаты, чем принятие конфигурации по умолчанию.

Описанные здесь инструменты и методы доступны пользователям с любым уровнем технического опыта: от тех, кто предпочитает графические интерфейсы, до тех, кто умеет работать с командной строкой. Экосистема PDF предлагает несколько путей к одному и тому же результату.

Документирование конкретных настроек и рабочего процесса для каждого типа задач PDF создает ссылку многократного использования, которая экономит время в будущих проектах и обеспечивает согласованность, когда разные члены команды выполняют одну и ту же операцию.

Способность эффективно выполнять эту операцию с PDF — ценный навык для любого, кто регулярно работает с цифровыми документами. Независимо от того, возникает ли задача ежедневно или время от времени, наличие надежного рабочего процесса экономит время и дает стабильные профессиональные результаты.

Формат PDF продолжает развиваться, а инструменты для работы с PDF-файлами совершенствуются с каждым поколением. Если вы будете в курсе новых возможностей и обновленных инструментов, ваши рабочие процессы с документами останутся эффективными и будут использовать преимущества последних достижений.

В этой статье были рассмотрены основные методы и соображения для этой задачи PDF. С практикой описанные здесь шаги становятся второй натурой, и то, что когда-то казалось сложной операцией с документом, становится рутинной частью рабочего процесса.

Благодаря знаниям, полученным из этой статьи, читатели смогут уверенно подойти к этой задаче PDF и эффективно и последовательно достигать результатов профессионального качества.

WukongPDF

Попробуйте разделить PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →