Others

Можете ли вы сортировать данные таблицы PDF на отдельные листы Excel?

Когда вы извлекаете данные таблицы из PDF-файла в Excel, строки поступают в том порядке, в котором они появляются на странице. Если вам нужно, чтобы эти строки были отсортированы на отдельных листах по категориям, например, записи о продажах, сгруппированные по регионам, или счета-фактуры, сгруппированные по поставщикам, метод вырезания и вставки вручную работает для десяти строк, но становится непрактичным для сотен. Вопрос в том, могут ли инструменты преобразования PDF в Excel автоматически сортировать и классифицировать данные во время процесса извлечения или вам нужно выполнять сортировку после того, как данные поступят в Excel.

Основные выводы

Стандартное преобразование PDF в Excel не сортирует и не классифицирует данные. Он извлекает строки в порядке страниц и помещает их на один лист. Для автоматической категоризации на отдельные листы по значению категории требуется либо макрос Excel после преобразования, преобразование Power Query, либо расширенный инструмент извлечения со встроенной логикой категоризации. Лучший подход зависит от того, является ли категоризация разовой задачей или повторяющимся рабочим процессом.

Can You Sort PDF Table Data Into Separate Excel Worksheets

Что может и чего не может стандартное преобразование PDF в Excel

Стандартный инструмент преобразования считывает визуальный макет страницы PDF, определяет структуру таблицы путем определения линий сетки и выровненных текстовых блоков, а также сопоставляет обнаруженные ячейки с ячейками Excel. В выводе сохраняется порядок строк и структура столбцов исходной таблицы. Это точное воспроизведение PDF-файла, но это не обработка данных. Инструмент не считывает содержимое ячеек, чтобы понять, что означают данные. Строка, содержащая "Запад" в столбце «Регион» и строке, содержащей «Восток»; извлекаются одинаково. В инструменте нет механизма определения принадлежности этих строк к разным категориям.

Некоторые расширенные инструменты Extract PDF Data выходят за рамки визуального извлечения и применяют распознавание образов для идентификации поля категории в таблице. Эти инструменты можно настроить с помощью правила, которое, по сути, гласит: «сканировать столбец C извлеченных данных, идентифицировать уникальные значения в этом столбце и создавать отдельный вывод для каждого уникального значения». Это не стандартное преобразование PDF. Это специализированная функция извлечения данных, которая находится на стыке оптического распознавания символов, распознавания таблиц и преобразования данных. Если ваш рабочий процесс требует этого, ищите инструменты, которые явно рекламируют категоризацию или группировку данных в своем списке функций.

WukongPDF

Попробуйте PDF в Excel

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Сортировка после преобразования с помощью макросов Excel и Power Query

Для пользователей, которые предпочитают полностью избегать макросов и Power Query, встроенные функции фильтрации и сортировки Excel в сочетании с созданием листов вручную являются подходящим подходом для наборов данных среднего размера. Применяйте фильтры к столбцу категории, выбирайте по одному значению категории, копируйте отфильтрованные строки и вставляйте их в новый лист. Для набора данных с пятью категориями и 200 строками этот ручной подход занимает около пяти минут и не требует никаких настроек или технических знаний, кроме базовой навигации в Excel.

Наиболее широко применимый подход — преобразовать всю таблицу PDF в один лист Excel, а затем использовать встроенные инструменты Excel для сортировки и разделения данных. Простой макрос VBA может считывать уникальные значения в указанном столбце, создавать новый лист для каждого уникального значения и копировать соответствующие строки в соответствующий лист. Макросу требуется менее минуты для запуска наборов данных с тысячами строк и он выполняет категоризацию точно так, как указано, без двусмысленности автоматического распознавания образов.

Power Query предлагает альтернативу без макросов для пользователей, знакомых с инструментами преобразования данных Excel. Загрузите преобразованные данные в Power Query через вкладку «Данные». Используйте функцию «Группировать по», чтобы агрегировать строки по категориям или фильтровать данные для каждого значения категории и загружать каждый отфильтрованный результат в отдельный лист. Преобразования Power Query повторяемы: сохраните запрос и в следующий раз, когда вы конвертируете PDF-файл с аналогичной структурой, обновите запрос, чтобы применить ту же логику сортировки к новым данным. Для повторяющихся рабочих процессов Power Query более удобен в обслуживании, чем макрос VBA, поскольку этапы преобразования видны в редакторе запросов и могут быть настроены без чтения кода.

Настройка автоматической категоризации для повторяющегося импорта PDF

При создании преобразования Power Query для повторяющегося импорта PDF используйте имя файла PDF в качестве параметра запроса, чтобы тот же запрос работал для новых файлов без изменений. В редакторе Power Query создайте параметр FilePath и укажите его на этапе источника данных. Каждый раз, когда вы получаете новый PDF-файл, обновите параметр FilePath, чтобы он указывал на новый файл, и обновите его. Все преобразование, включая сортировку по категориям и разделение листов, выполняется автоматически на новых данных.

Если вы регулярно получаете PDF-таблицы с одинаковой структурой, например еженедельные отчеты о продажах или ежемесячные пакеты счетов, потратьте время на настройку повторяемого рабочего процесса. Начните с преобразования одного типичного PDF-файла в Excel. Откройте Power Query и запишите преобразование, которое фильтрует, сортирует и разделяет данные именно так, как вам нужно. Сохраните запрос. Для последующих PDF-файлов преобразуйте их в Excel, откройте книгу и обновите запрос. Весь процесс, от получения PDF-файла до классифицирования данных Excel, после создания запроса занимает менее двух минут.

Для крупномасштабных рабочих процессов, включающих десятки PDF-файлов в день, рассмотрите специальную платформу извлечения данных, которая соединяет преобразование PDF-файлов с выводом электронных таблиц через API. Эти платформы позволяют определять шаблоны извлечения, определяющие, какие столбцы содержат данные категорий и как следует разделить выходные данные. Шаблон настраивается один раз и автоматически применяется к каждому входящему PDF-файлу. Платформы с такой возможностью включают в себя корпоративные службы обработки документов и некоторых поставщиков облачных API PDF. Преобразование PDF-файла в Excel с помощью WukongPDF обеспечивает четкую, структурированную таблицу, готовую к преобразованиям Power Query, с согласованным сопоставлением столбцов, что делает автоматическую категоризацию надежной в пакетах аналогичных документов.

Когда ручная категоризация по-прежнему является лучшим выбором

Гибридные рабочие процессы могут быть эффективными, когда автоматизация обрабатывает рутинные случаи, а ручная проверка — крайние случаи. Настройте Power Query для автоматической сортировки строк, в которых столбец категории содержит стандартные значения, в соответствующие рабочие листы. Любые строки с нестандартными или пустыми значениями категорий направляются на лист проверки, где пользователь может определить правильную категоризацию. Этот подход максимизирует охват автоматизации, не заставляя систему делать предположения о неоднозначных данных.

Автоматизация не всегда является правильным ответом. Если вы получаете небольшое количество PDF-файлов с таблицами, структура которых варьируется от одного документа к другому, время, затраченное на настройку макроса или Power Query, может превысить время, необходимое для сортировки данных вручную. Для одноразовой задачи с количеством строк менее 50 выбор строк для каждой категории, вырезание и вставка их на новые листы занимает несколько минут и не требует настройки. Точка безубыточности обычно составляет около трех экземпляров одной и той же структуры документа. Если вы будете выполнять одну и ту же категоризацию для одного и того же типа PDF три или более раз, автоматизация окупится.

Ручная категоризация также имеет смысл, когда логика категорий требует человеческого суждения. Столбец «Регион» со значениями типа «Запад» и «Запад». «Восток», и «Центральный»; является простым для автоматического разделения. Столбец «Примечания», в котором категория подразумевается содержанием текстового описания, например, разделение срочных и несрочных элементов на основе формулировок, а не стандартизированного кода, требует наличия человека-читателя. Ни один автоматизированный инструмент не может надежно классифицировать данные на основе тонкого, неструктурированного текста. В этих случаях извлеките все данные на один лист и классифицируйте их вручную.

Часто задаваемые вопросы

Что делать, если таблица PDF занимает несколько страниц с повторяющимися строками заголовков? Большинство конвертеров PDF в Excel рассматривают строки заголовков как данные, когда они повторяются на каждой странице. После преобразования вы увидите текст заголовка, перемежающийся строками данных на каждом разрыве страницы. Используйте фильтр Excel, чтобы выбрать и удалить все строки, в которых первый столбец содержит текст заголовка. Этот шаг очистки необходим перед выполнением какой-либо сортировки или категоризации, поскольку строки заголовков будут ошибочно классифицированы как данные.

Могу ли я разделить данные таблицы PDF на отдельные файлы Excel, а не на отдельные листы?

Да. И макросы VBA, и Power Query могут сохранять данные каждой категории в отдельной книге Excel, а не на отдельном листе в той же книге. В VBA используйте методы Workbooks.Add и SaveAs. В Power Query загрузите каждый отфильтрованный результат в отдельное соединение и экспортируйте каждое соединение в отдельный файл. Выбор между листами и книгами зависит от того, как будут распределяться данные. Если данные каждой категории передаются разным людям, отдельные книги становятся более чистыми.

Что делать, если в таблице PDF объединены ячейки, охватывающие несколько категорий?

Объединенные ячейки — известная проблема автоматической категоризации. Таблица PDF, в которой в столбце «Регион» используются объединенные ячейки для обозначения нескольких строк как «Запад». будет извлечен с меткой, появляющейся только в первой строке группы. Перед сортировкой заполните столбец категории, чтобы каждая строка имела значение категории. В Excel выберите столбец, нажмите Ctrl+G, нажмите «Специальные», выберите «Пробелы», введите = и нажмите стрелку вверх, затем нажмите Ctrl+Enter. Это заполнит все пустые ячейки значением из ячейки выше.

Влияет ли точность распознавания текста на сортировку по категориям?

Да, существенно. Если OCR неправильно читает слово «Запад»; как «Запад»; или "ВВест" эти значения становятся отдельными категориями в отсортированном выводе. Всегда проверяйте уникальные значения в столбце категории после преобразования и перед сортировкой. Быстрое сканирование сводной таблицы столбца категории сразу же выявляет ошибки OCR. Исправьте ошибки вручную или с помощью прохода поиска и замены перед запуском категоризации.

WukongPDF

Попробуйте PDF в Excel

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →