Вы кладете стопку из пятидесяти счетов на сканер документов с устройством автоматической подачи документов. Сканер создает один PDF-файл, содержащий последовательно все пятьдесят страниц. Теперь вам нужен каждый счет в виде отдельного PDF-файла с именем по номеру счета. Разделение пятидесятистраничного PDF-файла вручную на пятьдесят отдельных файлов, открытие каждого из них и сохранение под правильным именем занимает час утомительной работы. Инструмент пакетного разделения, который определяет границы документа и автоматически присваивает имена выходным файлам, выполняет ту же работу за считанные секунды.
Проблема Split PDF при сканировании пакетов заключается в том, что сканер видит отдельные страницы, а не отдельные документы. Счет на десять страниц выглядит для сканера точно так же, как десять отдельных одностраничных счетов. Инструмент разделения должен анализировать содержимое страницы, чтобы определить, где заканчивается один документ и начинается следующий. В этом анализе используются шаблоны содержимого страниц, пустые страницы-разделители, штрих-коды или постоянное количество страниц для определения границ документа.

Как пакетные сканеры создают многодокументные PDF-файлы
Автоматические устройства подачи документов обрабатывают страницы последовательно. Каждая страница проходит через сканер и добавляется в один выходной PDF-файл. Сканер не знает и не заботится о том, что страницы с первой по третью — это счет-фактура A, страницы с четвертой по пятую — это счет-фактура B, а страницы с шестой по восьмую — это счет-фактура C. Он просто создает страницы с первой по восьмую в одном файле.
Некоторые сканеры поддерживают разделительные листы — пустые страницы, вставленные между документами, которые сигнализируют сканеру о необходимости начать новый PDF-файл. Но в большинстве рабочих процессов сканирования разделительные листы пропускаются, поскольку они замедляют процесс сканирования. В результате получается один файл PDF Batch, содержащий несколько документов, объединенных вместе.
Этот метод превращает часы ручной работы в секунды автоматизированной обработки.
Проблема усугубляется двусторонним сканированием. При двустороннем сканировании десятистраничного документа получается двадцать страниц PDF, причем каждая физическая страница превращается в две страницы PDF. Инструмент разделения должен понимать, что первая и вторая страницы принадлежат одному и тому же документу, даже если они отображаются как отдельные страницы PDF.
Попробуйте разделить PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
Методы обнаружения границ документа в пакете сканирования
Согласованность количества страниц — это самый простой метод обнаружения. Если все документы в пакете содержат одинаковое количество страниц, инструмент разделения делит общее количество страниц на количество страниц документа и разделяет их по этим границам. Счета-фактуры от одного и того же поставщика часто имеют одинаковое количество страниц. Этот метод не требует контент-анализа.
Обнаружение пустых страниц идентифицирует страницы-разделители, которые были намеренно вставлены между документами. Пустая страница в отсканированном пакете указывает на границу документа. Инструмент разделения удаляет пустые страницы-разделители и разбивает оставшиеся страницы на отдельные документы в местах пустых страниц.
Обнаружение шаблонов контента — самый сложный метод. Инструмент разделения ищет повторяющиеся шаблоны, обозначающие начало нового документа. Счет-фактура обычно начинается с логотипа поставщика, адреса и номера счета-фактуры. Форма начинается с поля заголовка и даты. Отчет начинается с титульной страницы. Инструмент идентифицирует эти шаблоны и отмечает каждое их появление как границу документа.
Обнаружение штрих-кода идентифицирует разделительные страницы с напечатанными штрих-кодами. Штрих-код в верхней части первой страницы каждого документа кодирует идентификатор документа. Инструмент разделения считывает штрих-код, называет выходной файл закодированным значением и разбивает его при каждом появлении штрих-кода. Этот метод популярен в сфере обработки медицинских, юридических и финансовых документов.
Использование инструментов разделения с возможностями обнаружения документов
WukongPDF обеспечивает обработку Отсканированных PDF через браузер, включая возможность разделения пакетов сканирования нескольких документов на отдельные файлы. Инструмент разделения может определять границы документа, используя шаблоны содержимого или заданное количество страниц.
Перед разделением просмотрите пакет, чтобы проверить порядок и ориентацию страниц. Страницы, отсканированные в перевернутом виде или в неправильном порядке, приведут к созданию неправильно упорядоченных выходных файлов. Большинство инструментов разделения включают функцию предварительного просмотра страницы и изменения порядка для исправления ошибок сканирования перед разделением.
Настройте имя выходного файла на основе обнаруженного содержимого. Если инструмент разделения может считать номер счета-фактуры или идентификатор документа с первой страницы каждого документа, используйте это значение в качестве имени выходного файла. Если именование на основе содержимого недоступно, используйте последовательную нумерацию с описательным префиксом.
Проверка точности разделения
После разделения проверьте несколько первых и несколько последних выходных файлов. Откройте первый выходной файл и убедитесь, что он содержит правильные страницы. Откройте последний выходной файл и убедитесь, что он содержит последние страницы пакета. Выборочная проверка файла из середины пакета. Эти проверки выявляют ошибки обнаружения границ до распространения файлов.
Сравните общее количество страниц всех выходных файлов с исходным количеством страниц в пакете. Если сумма совпадает, каждая страница была назначена выходному файлу. Если сумма меньше, страницы были потеряны при разделении. Если сумма больше, страницы дублировались.
Пакеты, в которых границы документа неоднозначны, выполняют разделение с консервативными настройками, которые требуют более строгого подтверждения границ. Консервативное разделение может привести к объединению некоторых документов вместо неправильного разделения одного документа на несколько файлов. Объединенные документы можно разделить вручную с меньшим риском, чем фрагменты одного документа.
Автоматизация рабочего процесса разделения и имени
Для периодического пакетного сканирования и разделения автоматизируйте рабочий процесс. Сохраните настройки разделения, метод определения границ и соглашение об именовании выходных данных в виде профиля. Каждая последующая партия обрабатывается по одному и тому же профилю, обеспечивая стабильный результат. Время начальной настройки восстанавливается после второй партии.
Интегрируйте разделенный вывод с системами управления документами, настроив именование вывода в соответствии с ожидаемым форматом системы. Идентификатор документа, извлеченный во время разделения и соответствующий соглашению об именовании системы управления документами, позволяет автоматически принимать его без переименования вручную.
Разделение документов на сканированные пакеты является распространенной необходимостью в отраслях, которые обрабатывают большие объемы бумажных документов: здравоохранение обрабатывает записи пациентов, судебные дела, бухгалтерский учет обрабатывает счета и государственные органы обрабатывают заявки. В каждой отрасли существуют свои типы документов, количество страниц и шаблоны границ.
Листы-разделители штрих-кодов — наиболее надежный метод для операций сканирования больших объемов. Распечатайте лист со штрих-кодом из системы управления документами, поместите его поверх каждого документа перед сканированием, а инструмент разделения считывает штрих-код, чтобы определить границы документа и назвать выходные файлы. Штрих-код устраняет двусмысленность относительно того, где начинаются и заканчиваются документы.
Оптическое распознавание меток позволяет идентифицировать флажки или закрашенные кружки на первой странице каждого документа, указывающие тип или приоритет документа. Инструмент разделения считывает эти метки и направляет документы в разные выходные папки в зависимости от распознанного типа.
Точность автоматического разделения документов должна измеряться и контролироваться. В пакете из 500 документов с точностью разделения 99 % по-прежнему остается 5 неправильно разделенных документов, требующих исправления вручную. Отслеживайте частоту ошибок с течением времени, чтобы определить типы документов или условия сканирования, которые приводят к более высокому уровню ошибок.
Для пакетов, в которых границы документов несовместимы, этап проверки человеком между сканированием и разделением выявляет ошибки границ, которые не учитываются при автоматическом обнаружении. Рецензент просматривает пакет в средстве просмотра страниц, подтверждает или корректирует обнаруженные границы, а затем запускает автоматическое разделение.
Формат выходного файла после разделения может включать PDF/A для архивирования, сжатый PDF для распространения или TIFF для дальнейшей обработки изображений. Настройте выходной формат на основе дальнейшего использования отдельных документов.
Интеграция разделенного рабочего процесса с системой управления документами обеспечивает плавный переход от бумажных документов к архиву с возможностью поиска. Сканер создает пакетный PDF-файл, разделитель разделяет его на отдельные документы, распознавание текста делает их доступными для поиска, а система управления документами индексирует их для поиска.
Облачные сплит-сервисы предлагают те же возможности, что и настольные инструменты, но с преимуществом доступности с любого устройства. Отсканированный пакетный PDF-файл загружается, обрабатывается, а отдельные документы возвращаются в виде отдельных файлов. Соображения конфиденциальности данных применяются при использовании облачных сервисов для конфиденциальных документов.
Соглашение об именах разделенных выходных файлов должно быть единообразным и допускающим сортировку. Такой формат, как ГГГГ-ММ-ДД_DocumentType_SequentialNumber, создает имена файлов, которые сортируются в хронологическом порядке и группируются по типу документа. Согласованное наименование обеспечивает автоматическую обработку последующими системами.
При разделении пакетов, содержащих документы смешанного типа, инструмент разделения может направлять документы разных типов в разные выходные папки на основе распознавания содержимого. Счета-фактуры попадают в папку «Бухгалтерия», договоры — в папку «Юридические вопросы», а корреспонденция — в папку «Записи».
Разрешение отсканированных страниц влияет на точность распознавания, если распознавание текста будет выполняться для разделенных документов. Сканируйте документы с разрешением не менее 300 DPI, которые будут обработаны оптическим распознаванием символов после разделения.
Некоторые инструменты разделения могут генерировать файл манифеста вместе с выходными данными разделения. В манифесте перечислены все имена выходных файлов, диапазон исходных страниц и все метаданные, извлеченные во время разделения. Манифест поддерживает обеспечение качества и отслеживание документов.
Экономия времени при автоматическом разделении партий по сравнению с разделением вручную пропорциональна размеру партии. Пакет из 50 документов, разделенный вручную, требует примерно 50 минут повторяющейся работы. Автоматическое разделение одной и той же партии требует примерно 30 секунд времени настройки и обработки.
Разрешение сканирования влияет как на точность разделения, так и на качество выходного документа. Сканирование с более высоким разрешением создает более четкий текст, что улучшает обнаружение границ на основе содержимого. Компромисс — больший размер файлов во время обработки. Для целей разделения обычно достаточно 200 точек на дюйм для точного определения границ.
| Метод обнаружения | Как это работает | Наилучший вариант для | Точность |
|---|---|---|---|
| Согласованность количества страниц | Разделить общее количество страниц на известную длину документа | Единые документы из одного источника | Высокий для известного количества страниц |
| Обнаружение пустой страницы | Определить пустые страницы-разделители | Сканированные пакеты с разделителями | Высокий, если пустые страницы действительно пусты. |
| Шаблон контента | Распознавание повторяющихся шаблонов заголовков | Счета, формы, отчеты | Средне-Высокий; зависит от постоянства рисунка |
| Распознавание штрих-кода | Считайте штрих-код на первой странице каждого документа. | Медицинские, юридические, финансовые документы | Очень высокий; штрих-код однозначен |
Попробуйте разделить PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
