Tips & Tricks

Как преобразовать многостраничную таблицу PDF в единую непрерывную таблицу Excel без артефактов разрыва страниц или повторяющихся строк заголовков

How to Convert a Multi-Page PDF Table Into a Single Continuous Excel Table With No Page-Break Artifacts or Repeated Header Rows

Почему многостраничные таблицы PDF разбиваются на фрагменты при преобразовании в Excel

Преобразование таблицы PDF, состоящей из нескольких страниц, в электронную таблицу Excel кажется задачей, которую следует автоматизировать. Выберите страницы, запустите преобразование и получите единую непрерывную таблицу. В действительности все обстоит иначе, поскольку механизм преобразования PDF в Excel рассматривает каждую страницу как независимый холст и создает отдельную таблицу или отдельный лист для каждой страницы. В результате получается фрагментированная электронная таблица, в которой на каждом листе появляется одна и та же строка заголовка таблицы, строки разбивают средние данные на границах страниц, а объединение десятков таблиц на уровне страницы в один непрерывный набор данных требует нескольких часов копирования и вставки вручную.

Межстраничное обнаружение обрабатывает это автоматически.

Этот подход работает для большинства финансовых документов.

Основная причина заключается в том, как PDF-файлы представляют содержимое страницы. Страница PDF — это автономная поверхность для рисования, не имеющая собственной концепции контента, который пересекает границы страницы. Таблица, которая начинается внизу страницы 12 и продолжается вверху страницы 13, представлена в PDF-файле как два независимых набора векторных линий и текстовых объектов. Механизм преобразования не имеет структурного сигнала, сообщающего ему, что эти две таблицы уровня страницы на самом деле представляют собой одну непрерывную таблицу. Если механизм не выполняет межстраничный анализ контента, который большинство базовых конвертеров пропускают в пользу скорости, выходные данные точно воспроизводят фрагментацию на уровне страниц, существующую в исходном PDF-файле.

Повторяющиеся строки заголовка усугубляют проблему фрагментации. В большинстве многостраничных таблиц строка заголовка столбца повторяется вверху каждой новой страницы для удобства чтения в печатной версии или версии PDF. Когда каждая страница преобразуется в отдельный лист или отдельный диапазон таблицы, повторяющаяся строка заголовка отображается как строка данных в каждом выходном сегменте. Консолидация 20 страниц преобразованного вывода означает ручную идентификацию и удаление 19 копий повторяющейся строки заголовка, прежде чем данные можно будет объединить в одну непрерывную таблицу.

WukongPDF

Попробуйте PDF в Excel

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Подготовка таблицы PDF к чистому преобразованию

Качество вывода Extract PDF Data во многом зависит от того, как структурирована таблица PDF до начала преобразования. Таблицы, созданные как реальные объекты таблиц PDF с определенными границами ячеек и ячейками данных, преобразуются более четко, чем таблицы, созданные в виде визуального расположения строк и текстовых полей, которые для человека-читателя выглядят как таблицы. Если вы контролируете процесс создания PDF-файла, создание таблицы с использованием библиотеки PDF, поддерживающей семантические структуры таблиц, дает значительно лучшие результаты преобразования, чем печать визуального макета таблицы из текстового процессора или приложения для работы с электронными таблицами.

Перед запуском преобразования проверьте структуру таблицы PDF с помощью инструмента проверки PDF, который может определить, хранится ли содержимое таблицы в виде тегированных элементов таблицы или в виде несвязанных текстовых объектов. Таблицы с тегами содержат структурные метаданные, которые сообщают механизмам преобразования, какой текст принадлежит какой ячейке и какие ячейки принадлежат какой строке. Механизмы преобразования, которые могут читать теги PDF, создают структурированный вывод Excel с правильным сопоставлением ячеек с ячейками. Визуальные таблицы без тегов требуют, чтобы механизм преобразования определял структуру таблицы на основе позиций текста и штриховых рисунков, что по своей сути менее надежно.

Если таблица не размечена, этап предварительной обработки, который добавляет теги таблицы в PDF-файл перед преобразованием, значительно улучшает качество вывода. Профессиональные редакторы PDF могут автоматически определять области таблицы и применять теги таблицы к обнаруженной структуре. Хотя автоматическая пометка не идеальна, особенно в таблицах с объединенными ячейками или неравномерной высотой строк, она обеспечивает структурную основу, с которой может работать механизм преобразования, и создает выходные данные, требующие гораздо меньше ручной очистки, чем преобразование полностью непомеченного оригинала.

Выполнение преобразования с включенным обнаружением межстраничной таблицы

Не все конвертеры PDF в Excel поддерживают обнаружение межстраничных таблиц, а среди тех, которые поддерживают, эта функция может быть не включена по умолчанию. Прежде чем запускать преобразование, проверьте в настройках конвертера наличие параметров с надписью «Обнаружение многостраничных таблиц», «Объединение таблиц на страницах», «Непрерывное обнаружение таблиц» или аналогичной терминологии. Включение этого параметра дает указание механизму анализировать структуру таблицы на соседних страницах и объединять обнаруженные продолжения в одну выходную таблицу.

Межстраничное обнаружение работает путем сравнения структуры столбцов таблиц, найденных на последовательных страницах. Если страница 8 заканчивается таблицей с пятью столбцами определенной относительной ширины, а страница 9 начинается с таблицы, имеющей ту же структуру из пяти столбцов с одинаковой шириной столбцов, механизм определяет с высокой вероятностью межстраничное продолжение и объединяет два сегмента. При сравнении допустимы небольшие различия в абсолютных позициях столбцов, поскольку верхние и нижние колонтитулы на разных страницах могут смещать положение таблицы на странице, даже если ширина столбцов остается одинаковой.

Обнаружение становится менее надежным, если разрывы страниц происходят в середине строки таблицы, а не между строками. В строке, разделенной по границе страницы, верхняя половина отображается на одной странице, а нижняя половина — на следующей, при этом поля страницы или нижний колонтитул занимают пространство между двумя половинами. Алгоритмы обнаружения таблиц, которые ищут полные строки, могут не распознать разделенную строку как принадлежащую той же таблице. Выбор макета таблицы в исходном приложении, который позволяет избежать разделения строк по границам страницы перед экспортом в PDF, полностью устраняет этот режим сбоя обнаружения.

Очистка преобразованного вывода для удаления артефактов разрыва страницы

Даже если включено межстраничное обнаружение, некоторые артефакты преобразования обычно сохраняются в выходных данных Excel и требуют очистки вручную или с помощью сценария. Наиболее распространенным артефактом является дублирующаяся строка заголовка, вставленная механизмом преобразования в каждую точку перехода страницы. Если механизм обнаружил межстраничное продолжение, но не распознал повторяющийся заголовок как заголовок, текст заголовка отображается как строка данных. Быстрое сканирование первого столбца выходной таблицы в поисках значений, соответствующих известному тексту заголовка, идентифицирует эти повторяющиеся строки заголовка для удаления.

Пустые строки в точках перехода страниц — второй по распространенности артефакт. Если на странице PDF имеется поле, нижний колонтитул или пустое пространство между концом тела таблицы и нижней частью страницы, механизм преобразования может вставить в эту позицию одну или несколько пустых строк. Проход с фильтрацией и удалением совершенно пустых строк удаляет эти артефакты за считанные секунды.

Для больших многостраничных таблиц очистка по сценарию более эффективна, чем проверка каждой строки вручную. Короткий макрос Excel или сценарий Python, который считывает преобразованную книгу, удаляет строки, где первая ячейка соответствует известному тексту заголовка, удаляет полностью пустые строки и объединяет данные из нескольких листов в один лист, может обработать сотни страниц преобразованной таблицы менее чем за минуту.

Конвертер PDF в Excel WukongPDF включает обнаружение межстраничных таблиц, которое идентифицирует продолжающиеся таблицы за границами страниц и создает консолидированный вывод с дедупликацией заголовков. Для таблиц, созданных в виде структур PDF с тегами, преобразование сохраняет выравнивание форматирования ячеек, форматирование чисел и стиль текста в выходных данных Excel, сокращая время очистки после преобразования с часов до минут для больших многостраничных табличных документов.

Обработка сложных структур таблиц на разрывах страниц

Таблицы с объединенными ячейками, вложенными заголовками или нерегулярным количеством столбцов создают дополнительные проблемы при межстраничном преобразовании. В таблице с объединенной строкой заголовка, охватывающей все столбцы в верхней части таблицы, этот объединенный заголовок не должен повторяться на страницах продолжения, но некоторые инструменты создания PDF-файлов все равно повторяют его как часть конфигурации строки заголовка. Механизм преобразования видит повторяющийся объединенный заголовок на каждой странице и обрабатывает его как обычную строку данных в выходных данных.

Для таблиц с вложенными заголовками столбцов, где заголовок занимает две или три строки, а родительские категории охватывают несколько подстолбцов, межстраничное обнаружение должно соответствовать сложной структуре заголовка на разных страницах.

Если структура заголовка на странице 7 соответствует структуре на странице 8, включая тот же шаблон слияния и метки подзаголовков, движок может уверенно объединить две таблицы уровня страницы. Если структура заголовка отличается, либо из-за изменения структуры таблицы в середине документа, либо из-за того, что при создании PDF-файла были введены варианты форматирования, механизм обрабатывает их как отдельные таблицы, даже если они логически принадлежат друг другу.

Самый надежный подход к сложным многостраничным таблицам — преобразовать всю таблицу за одну операцию после подтверждения того, что структура PDF поддерживает межстраничное распознавание. Для критически важных данных, где точность имеет первостепенное значение, выборочная проверка количества строк в выходных данных по сравнению с известным количеством строк из исходного источника данных обеспечивает быструю проверку того, что ни одна строка не была потеряна или дублирована в процессе преобразования.

При преобразовании финансовых отчетов, регистров счетов или журналов транзакций, занимающих десятки страниц, совокупный эффект небольших ошибок преобразования может поставить под угрозу аналитическую ценность данных. Единственная недостающая строка в журнале транзакций означает, что финансовые итоги, рассчитанные на основе преобразованных данных, не будут соответствовать итоговым суммам исходного документа. Одна дублированная строка заголовка, ошибочно идентифицированная как строка данных, может привести к ложной транзакции, которая приведет к сбою при аудите. Проверка количества строк постранично с исходным документом, по крайней мере, при первом преобразовании нового типа документа, обеспечивает уверенность в точности преобразования до того, как данные попадут в аналитические рабочие процессы.

Для повторяющихся преобразований, в которых периодически обрабатывается один и тот же тип документа, например ежемесячные банковские выписки или еженедельные отчеты о продажах, создайте шаблон преобразования, который запоминает параметры обнаружения, сопоставления столбцов и правила очистки, которые работали для предыдущих преобразований того же типа документа. Шаблон фиксирует знания, полученные при устранении неполадок при первом преобразовании, и автоматически применяет их к последующим преобразованиям, сокращая время очистки каждого преобразования с нескольких часов почти до нуля для известных форматов документов.

WukongPDF

Попробуйте PDF в Excel

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →