Tips & Tricks

Как разделить PDF-файл, где каждый документ начинается с узнаваемой титульной страницы или титульного листа

Разделить большой PDF-файл на отдельные документы очень просто, если каждый файл начинается с пустой страницы или пронумерованного заголовка главы. Задача полностью меняется, когда документы внутри PDF-файла разделены только визуальными признаками: титульной страницей с логотипом компании, титульным листом, набранным более крупным шрифтом, или характерным блоком заголовка, который человек может сразу заметить, но автоматизированные инструменты с трудом обнаруживают. В этой статье рассматриваются практические методы разделения PDF-файла путем распознавания титульных страниц и титульных листов: от ручных подходов, подходящих для нескольких документов, до полуавтоматических методов, которые масштабируются до сотен страниц.

How to Split a PDF Where Each Document Starts With a Recognizable Cover Page or Title Sheet

Почему стандартное разделение по количеству страниц не работает для пакетов документов

Ответ заключается в том, насколько различаются документы.

Большинство инструментов разделения PDF-файлов работают по простому принципу: делите файл после каждых N страниц или по определенным введенным вами номерам страниц. Это работает, когда каждый документ в пакете имеет одинаковое количество страниц. Стопка одностраничных счетов-фактур четко разделяется на границах каждой страницы. Коллекция трехстраничных контрактов делится поровну на каждой третьей странице. Но когда документы различаются по длине, что характерно практически для любого реального пакета отчетов, приложений или корреспонденции, разделение по количеству страниц либо разрезает документы пополам, либо объединяет конец одного документа с заголовком следующего.

Титульные страницы и титульные листы являются естественными границами между документами в объединенном PDF-файле, но это визуальные, а не структурные границы. PDF-файл хранит их как объекты страницы того же типа, что и любая другая страница. Не существует флага метаданных, указывающего, что эта страница является обложкой или этот абзац является заголовком. Программному обеспечению для разделения необходимо указать, что искать, и инструкции должны быть достаточно конкретными, чтобы программное обеспечение могло отличить титульную страницу от обычной страницы с контентом, которая содержит большой заголовок или логотип.

Последствия неправильного разделения более чем неудобны. Разделение, при котором многостраничный документ разрезается пополам, создает два неполных файла, ни один из которых сам по себе не имеет смысла. Разделение, объединяющее два документа, создает файл, в котором читатель видит чужую информацию сразу после окончания ожидаемого содержимого. Для юридических, медицинских или финансовых документов второй сценарий представляет собой нарушение конфиденциальности. Правильное разделение имеет значение как для удобства использования, так и для соответствия требованиям.

WukongPDF

Попробуйте разделить PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Ручные методы: определение титульных страниц на глаз

Для пакетов, содержащих примерно двадцать документов, разделение вручную часто оказывается быстрее, чем настройка автоматического решения. Откройте объединенный PDF-файл и прокрутите миниатюры страниц на боковой панели. Титульные страницы и титульные листы выделяются визуально, поскольку обычно на них больше пустого пространства, более крупный текст, логотипы или другая плотность макета, чем на страницах с содержимым, которые следуют за ними. Щелкните первую страницу каждого документа, щелкните последнюю страницу, удерживая клавишу Shift, и извлеките выделенное в новый файл.

Инструмент Split PDF WukongPDF предоставляет визуальный выбор страниц, который делает разделение вручную эффективным. Вы видите все страницы в виде миниатюр, щелкните, чтобы отметить точки разделения на каждой титульной странице, и инструмент извлекает каждый сегмент как отдельный PDF-файл с соответствующим названием. Для 100-страничного файла, содержащего 15 документов разной длины, весь процесс занимает менее двух минут. Визуальный интерфейс исключает необходимость догадываться о номерах страниц и позволяет проверить каждую точку разделения перед извлечением.

Полезная привычка для разделения вручную: определяя диапазон страниц каждого документа, записывайте заголовок или номер ссылки на титульной странице. Используйте это как имя выходного файла. Папка, полная файлов с именами «split-1.pdf, Split-2.pdf», лишь незначительно полезнее исходного объединенного файла. Файлы с именами Smith-Application.pdf, Jones-Contract.pdf можно использовать немедленно.

Полуавтоматическое разделение: обнаружение текстовых шаблонов

Автоматизация масштабируется там, где ручные усилия не могут.

Если партия слишком велика для разделения вручную, следующим шагом является обнаружение на основе текста. Большинство инструментов PDF с возможностью пакетного разделения могут искать определенные текстовые строки и разбивать файл всякий раз, когда этот текст появляется. Если каждая титульная страница содержит последовательную фразу, например «Форма заявки», «Конфиденциально», «Страница 1» или номер счета в предсказуемом формате, эта фраза становится триггером разделения. Инструмент сканирует текстовый слой каждой страницы и, когда находит целевую строку, вставляет точку разделения перед этой страницей.

Надежность текстового разделения зависит от двух факторов. Во-первых, текст триггера должен появляться на каждой титульной странице и никогда не появляться на странице контента. Фраза типа «Страница 1» кажется хорошим триггером до тех пор, пока страница 6 документа не будет содержать текст «Подробности см. на странице 1». Во-вторых, PDF-файл должен иметь текстовый слой. Отсканированные PDF-файлы без оптического распознавания символов полностью исключают разделение по тексту, поскольку текст титульной страницы существует только в виде пикселей, а не в виде символов, доступных для поиска. Запуск OCR объединенного файла перед разделением решает эту проблему, добавляя шаг, но сохраняя автоматизацию.

Структурное обнаружение: использование размера шрифта и плотности страницы

Более продвинутый подход анализирует визуальную структуру каждой страницы, а не ищет конкретный текст. Титульные и титульные листы, как правило, имеют заметно отличающиеся характеристики от страниц с содержанием. Плотность текста ниже из-за пустого пространства вокруг заголовка. Средний размер шрифта больше из-за заголовка. Страница может содержать изображение, например логотип, тогда как страницы с содержимым содержат только текст. Программное обеспечение, которое может измерять эти свойства, может отмечать вероятные титульные страницы, не зная, какие слова на них появляются.

Этот метод обрабатывает случаи, когда титульные страницы различаются по формулировке, но имеют одинаковую структуру. Пакет отчетов клиентов, в которых на каждой титульной странице написано «Подготовлено для [имя клиента]», имеет разный текст на каждой обложке. Разбиение на основе текста не удается, поскольку нет общей строки для поиска. Разделение на основе структуры является успешным, поскольку на каждой обложке используется один и тот же шаблон с одинаковыми размерами шрифта и одинаковым размещением логотипа. Последовательность заключается в дизайне, а не в словах, а структурное обнаружение фиксирует то, что упускает текстовый поиск.

Подготовка файлов перед разделением для достижения наилучших результатов

Несколько подготовительных шагов перед разделением значительно повышают вероятность успеха любого метода. Во-первых, если объединенный PDF-файл получен со сканера, запустите OCR, чтобы создать текстовый слой с возможностью поиска. Даже если вы планируете разбивать вручную, наличие текста с возможностью поиска позволяет переходить к определенным страницам, выполняя поиск по именам или ссылочным номерам, а не прокручивая миниатюры. Во-вторых, проверьте, есть ли в объединенном файле страницы, которые не следует разбивать на отдельные документы. Титульные листы факса, маршрутные листы и пустые страницы-разделители между документами следует удалять перед разделением, а не превращать в отдельные одностраничные выходные файлы.

В-третьих, отсканируйте документ при небольшом увеличении, чтобы убедиться, что каждая титульная страница имеет одинаковую ориентацию. Одна титульная страница в альбомной ориентации в пакете документов с книжной ориентацией может привести к смещению инструмента разделения, особенно если он использует структурное обнаружение на основе размеров страницы. Нормализуйте ориентацию страницы перед разделением. Эти шаги добавляют несколько минут к началу процесса, но избавляют от разочарований, связанных с обнаружением неправильно разрезанных документов после завершения разделения и удаления исходного объединенного файла. Работа по подготовке PDF Pages окупается чистыми и точными выходными файлами, которые не требуют ручной очистки.

Систематическое присвоение имен выходным файлам во время разделения

Ценность разделения объединенного PDF-файла заключается не только в разделении страниц, но и в создании выходных файлов, которые можно сразу идентифицировать. Хорошо спланированное соглашение об именах, применяемое во время разделения, избавляет получателя от необходимости открывать каждый файл для обнаружения его содержимого. Если титульные страницы содержат одинаковый элемент, например номер счета, имя клиента или ссылочный код документа, извлеките эти данные в процессе разделения и используйте их в качестве имени файла. Большинство инструментов разделения, которые поддерживают обнаружение на основе текста, также поддерживают использование обнаруженного текста в качестве имени выходного файла, превращая пакет общих разделенных файлов в правильно маркированный набор документов.

Для пакетов, в которых титульные страницы не имеют общего текстового шаблона, перед началом разделения установите соглашение об именовании. Такой формат, как ClientName-DocumentType-Date.pdf, последовательно применяемый ко всем выходным файлам, создает сортируемую библиотеку документов с возможностью поиска из того, что ранее было непрозрачным объединенным файлом. Шаг присвоения имени занимает несколько секунд на каждый файл и добавляет непреходящую организационную ценность. Папка с хорошо названными отдельными PDF-файлами представляет собой полезный архив документов. Папка с последовательно пронумерованными разделенными файлами — это головоломка, которую кому-то придется разгадать позже. Процесс разделения PDF Batch завершается только тогда, когда каждый выходной файл правильно назван и организован.

Время, затраченное на обучение разделению PDF-файлов с помощью определения титульной страницы, окупается для многих типов документов, выходящих за рамки первоначального варианта использования. Пакеты юридических документов, пакеты счетов, коллекции студенческих записей, медицинские записи и наборы контрактов — все они следуют одной и той же схеме смешанных документов, разделенных идентифицируемыми первыми страницами. После того как вы установили надежный рабочий процесс разделения для одного типа документа, его адаптация к другому требует только определения уникальных характеристик новых титульных страниц. Навык быстро переносится с одного типа документа на другой, а повышение эффективности увеличивается с каждой новой пакетной обработкой.

WukongPDF

Попробуйте разделить PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →