Tips & Tricks

Как разделить PDF-файл, обнаружив страницы-разделители штрих-кода

При массовом сканировании документов создается один массивный PDF-файл, содержащий сотни отдельных документов, каждый из которых отделен от другого не более чем страницей со штрих-кодом. Штрих-код, обычно символ Code 39 или Code 128, напечатанный на чистом листе, действует как машиночитаемый разделитель, который сообщает автоматизированным системам, где заканчивается один документ и начинается следующий. Для разделения PDF-файла путем обнаружения страниц-разделителей штрих-кодов требуется инструмент Split PDF с возможностью распознавания штрих-кодов, который считывает каждую страницу, определяет, какие страницы содержат штрих-коды, и использует эти страницы в качестве точек разделения для разделения документа на составляющие его файлы.

How to Split a PDF by Detecting Barcode Separator Pages

Как страницы-разделители штрих-кода работают при сканировании документов

Перед сканированием большой партии бумажных документов лист-разделитель штрих-кода помещается поверх каждого отдельного документа в стопке. Сканер обрабатывает всю стопку как одно непрерывное задание, создавая один PDF-файл длиной в тысячи страниц. Листы со штрих-кодами распределены по всему PDF-файлу на границе между каждой парой исходных документов. Каждый штрих-код кодирует информацию, которая идентифицирует то, что следует за ним: код типа документа, номер дела, идентификатор сотрудника или ссылку на файл.

Штрих-код не обязательно должен быть визуально значимым для людей. Это машиночитаемый носитель данных, напечатанный в виде вертикальных полос различной ширины. Инструмент обработки PDF Batch считывает значение штрих-кода и использует его для определения точки разделения и, при необходимости, имени файла для извлеченного документа. Штрих-код разделительной страницы, кодирующий значение INV-2026-0047, указывает разделителю начать новый документ с этой страницы и назвать выходной файл INV-2026-0047.pdf.

WukongPDF

Попробуйте разделить PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Подготовка PDF-файла к разделению на основе штрих-кода

Прежде чем запускать разделение, убедитесь, что каждая страница-разделитель в PDF-файле содержит четко напечатанный неповрежденный штрих-код. Штрих-код, который размазан, частично закрыт отверстием для скоб или напечатан под углом, может быть не распознан правильно, в результате чего разделитель либо пропустит точку разделения, либо считывает неправильное значение. Быстро прокрутите PDF-файл и проверьте случайную выборку страниц-разделителей. Штрих-код должен быть напечатан темно-черными чернилами на чистой белой бумаге с оставлением не менее четверти дюйма свободного пространства со всех сторон.

Убедитесь, что страницы со штрих-кодом являются первой страницей каждого документа, а не последней страницей предыдущего документа. Это соглашение практически универсально при сканировании документов, поскольку оно означает, что значение штрих-кода описывает следующий документ. Если вместо этого страницы со штрих-кодом в вашем PDF-файле были размещены на последней странице каждого документа, большинство инструментов разделения штрих-кода имеют настройку, позволяющую это настроить, но по умолчанию предполагается, что штрих-код находится на первой странице каждого нового документа.

Выбор инструмента, поддерживающего распознавание штрих-кода

Стандартные разделители PDF, которые разделяют по количеству страниц или по закладкам, не могут обнаружить штрих-коды, поскольку распознавание штрих-кода требует оптического анализа изображения страницы. Найдите инструмент для захвата документов или управления корпоративным контентом, в котором в качестве функции явно указано разделение на основе штрих-кода. Adobe Acrobat Pro включает распознавание штрих-кода в свой мастер действий для обработки документов. Браузерные платформы Split PDF с функцией обнаружения штрих-кода выполняют распознавание на стороне сервера и возвращают разделенные файлы в виде загружаемого архива.

Для организаций, которые регулярно обрабатывают PDF-файлы, разделенные штрих-кодом, специальное программное обеспечение для захвата документов, такое как Kofax, Ephesoft или Abbyy FlexiCapture, обеспечивает наиболее надежное распознавание штрих-кода. Эти инструменты разработаны специально для разделения больших объемов документов и включают в себя такие функции, как правила проверки штрих-кодов, обработку исключений для нечитаемых штрих-кодов и интеграцию с системами управления документами. WukongPDF и аналогичные платформы обеспечивают разделение на основе браузера, доступное без установки корпоративного программного обеспечения.

Настройка параметров распознавания штрих-кода

Большинство инструментов разделения штрих-кода требуют указания типа штрих-кода перед обработкой. Двумя наиболее распространенными типами сканирования документов являются код 39, который кодирует буквенно-цифровые символы и широко используется в юридических и медицинских записях, и код 128, который кодирует полный набор символов ASCII и создает более компактные штрих-коды для тех же данных. Выберите правильный тип штрих-кода в настройках инструмента. Выбор неправильного типа приведет к тому, что все штрих-коды останутся нераспознанными, и инструмент сообщит, что точки разделения не найдены.

Некоторые инструменты предлагают настройку ориентации штрих-кода. Штрих-коды на страницах-разделителях обычно печатаются горизонтально, но если страницы проходили через сканер в альбомной ориентации или если штрих-код был напечатан вертикально вдоль края страницы, механизму распознавания необходимо знать, какую ориентацию сканировать. Установите ориентацию на «Авто», если она доступна, что заставит движок проверять все четыре возможных поворота для каждой страницы.

Именование выходных файлов с использованием значений штрих-кода

Значение штрих-кода на каждой странице-разделителе может служить одновременно триггером разделения и именем выходного файла. Настройте инструмент разделения на использование значения штрих-кода в качестве имени файла документа, следующего за разделителем. Разделитель со значением штрих-кода CASE-0042-HARRIS создает выходной файл с именем CASE-0042-HARRIS.pdf, содержащий все страницы от этого разделителя до следующей страницы-разделителя, но не включая ее.

Если значения штрих-кода не соответствуют формату, безопасному для именования файлов, например содержат пробелы, специальные символы или символы, которые недопустимы в именах файлов, настройте инструмент для очистки значений. Большинство инструментов автоматически заменяют пробелы символами подчеркивания или дефисами и удаляют символы, которые не поддерживаются файловыми системами Windows или macOS. Проверьте имена выходных файлов после первого задания разделения, чтобы убедиться, что в результате очистки были созданы читаемые и полезные имена, а не строки удаленных символов, которые больше не передают исходное значение.

Обработка нечитаемых и отсутствующих штрих-кодов

Ни один процесс распознавания штрих-кода не идеален. Смазанные штрих-коды, перекошенные страницы и листы-разделители, случайно пропущенные при сканировании, приводят к ошибкам разделения. Настройте обработку исключений инструмента, чтобы отмечать нераспознанные страницы, а не автоматически объединять документы по обе стороны от пропущенной точки разделения. Инструмент должен создать отчет об исключениях, в котором будут перечислены все страницы, на которых ожидался, но не был найден штрих-код, а также номер страницы и, если возможно, миниатюра изображения страницы.

После завершения автоматического разделения просмотрите отчет об исключениях и вручную разделите все документы, которые инструмент не смог разделить автоматически. Откройте исходный PDF-файл, перейдите к отмеченным номерам страниц, определите, где должно произойти разделение, и извлеките страницы вручную с помощью инструмента извлечения страниц PDF. Шаг обработки исключений вручную для нескольких пропущенных разделений занимает несколько минут по сравнению с часами ручного разделения для каждого документа в пакете.

В будущих проектах сканирования улучшите читаемость штрих-кодов, используя более контрастную печать штрих-кодов, размещая штрих-коды подальше от краев страниц, где их может затмить тень сканера, и выполняя проверку качества перед сканированием на страницах-разделителях перед их вставкой в стопку документов.

Проверка результатов разделения по описи исходного документа

После завершения автоматического разделения штрих-кода сравните количество выходных файлов с ожидаемым количеством документов. Если в исходном проекте сканирования зарегистрировано 247 сканируемых документов, при разделении должно получиться ровно 247 выходных файлов. Несоответствие указывает либо на пропущенные точки разделения, когда два документа были объединены в один выходной файл, либо на ложные точки разделения, когда один документ был разделен, потому что что-то на одной из его страниц было ошибочно принято за штрих-код.

Для проектов разделения с высокими ставками, таких как юридическое расследование или миграция медицинских записей, выполните сверку количества страниц. Общее количество страниц во всех выходных файлах должно равняться количеству страниц исходного PDF-файла за вычетом страниц-разделителей. Расхождение хотя бы на одну страницу означает, что разделение не было идеальным и требует ручной проверки вывода.

Сохраните страницы-разделители как отдельный PDF-файл, а не удаляйте их. Значения штрих-кодов на этих страницах обеспечивают контрольный журнал, который связывает каждый выходной файл с его исходным положением в сканируемом пакете. Если несколько месяцев спустя возникает вопрос о конкретном документе, архив разделительной страницы точно подтвердит, откуда взялся этот документ.

Для операций разделения PDF Batch, выполняемых по расписанию, таких как ночная обработка отсканированных документов на многофункциональном принтере, автоматизируйте весь рабочий процесс: от сканирования до разделения и архивирования. Просматриваемая папка отслеживает наличие новых PDF-файлов. Когда приходит PDF-файл, разделитель штрих-кодов автоматически обрабатывает его и помещает разделенные файлы в папки, классифицированные на основе значений штрих-кода. Автоматизация превращает задачу разделения вручную в фоновый процесс, не требующий человеческого внимания.

При выборе типа штрих-кода для нового проекта сканирования документов выберите «Код 128», а не «Код 39», если значения штрих-кода будут содержать как буквы, так и цифры. Code 128 создает более компактные штрих-коды для буквенно-цифровых данных, что означает, что символ штрих-кода можно напечатать на разделительной странице меньшего размера без потери возможности сканирования.

Для долгосрочных проектов PDF Batch задокументируйте характеристики штрих-кода и конфигурацию разделения в файле проекта, который хранится вместе со сканированными документами. Когда проект возвращается через несколько месяцев или лет, документация отвечает на вопросы о том, какой тип штрих-кода использовался, что представляют собой значения штрих-кода и как было настроено разделение.

При замене разделения на основе штрих-кода PDF Batch на ручное разделение необходимо из-за проблем с качеством штрих-кода, необходимое время резко увеличивается. Пакет, который автоматически разделяется за считанные минуты, может занять несколько часов, чтобы отделиться вручную.

WukongPDF

Попробуйте разделить PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →