Извлечение данных таблицы из PDF-файла в Excel должно привести к созданию электронной таблицы, строки и столбцы которой соответствуют исходной таблице. Но иногда вывод транспонируется. Строки становятся столбцами, столбцы — строками, а данные шифруются. Это не случайная ошибка. Это имеет определенные причины, связанные с тем, как механизм преобразования PDF в Excel интерпретирует визуальное расположение таблицы. Понимание того, почему происходит транспонирование, поможет вам выбрать настройки преобразования, обеспечивающие правильно ориентированный вывод.
Основные выводы
Транспонирование PDF в Excel происходит, когда механизм преобразования неправильно определяет направление чтения таблицы, обычно из-за объединенных ячеек, несовместимой ширины столбцов или текста, который визуально выровнен по строкам, но хранится в PDF в порядке столбцов. Исправление зависит от причины. Настройка параметров преобразования, предварительная обработка PDF-файла для уточнения структуры таблицы или постобработка выходных данных Excel для обратного преобразования данных в правильную ориентацию — все это устраняет различные основные причины.

Почему данные таблицы PDF транспонируются во время извлечения
Таблицы, в которых используются точки-выноски или другие визуальные соединители между столбцами, такие как оглавление с точками, соединяющими названия глав с номерами страниц, почти гарантированно транспонируются, поскольку точки-выноски создают непрерывную визуальную линию, которую алгоритм обнаружения интерпретирует как разделитель строк. Удалите точки-выноски из исходного документа перед созданием PDF-файла, если таблица позже будет преобразована обратно в Excel.
Внутренняя структура PDF-файла имеет такое же значение, как и визуальный макет. Таблица, которая выглядит идеально выровненной на экране, может храниться как текстовые объекты в порядке, не соответствующем визуальному порядку чтения. Программное обеспечение для создания PDF-файлов определяет порядок текстовых объектов. Некоторые приложения записывают текстовые объекты в том порядке, в котором они были добавлены в документ, причем это может быть столбец за столбцом, а не строка за строкой. Вот почему два PDF-файла, которые выглядят одинаково, могут давать разные результаты преобразования: их внутренний порядок текстовых объектов различен.
Таблица PDF не сохраняется как таблица в файле. Он хранится в виде отдельных текстовых объектов, расположенных в определенных координатах на странице. Механизм преобразования должен просмотреть эти координаты и сделать вывод, какие текстовые объекты принадлежат каким строкам и столбцам. Алгоритм вывода использует горизонтальное и вертикальное выравнивание текста для группировки его в строки и столбцы. Если выравнивание неоднозначно, алгоритм может сначала группировать текст по вертикальному выравниванию, создавая столбцы, которые должны быть строками.
Объединенные ячейки являются наиболее распространенным триггером транспозиции. Таблица со строкой заголовка, охватывающей несколько столбцов, создает визуальную структуру, в которой верхняя строка не совпадает с границами столбцов под ней. Механизм преобразования рассматривает объединенный заголовок и отдельные столбцы под ним как два разных шаблона выравнивания. Он может интерпретировать объединенный заголовок как строку из нескольких столбцов или столбцы ниже как данные из нескольких строк, и неоднозначность приводит к транспозиции. Таблицы, в которых первый столбец содержит объединенные ячейки, охватывающие несколько строк, не менее проблематичны, поскольку вертикальное слияние нарушает выравнивание строк, которое механизм использует для группировки данных по горизонтали.
Попробуйте PDF в Excel
Никакой установки не требуется. Работает прямо в вашем браузере.
Настройте параметры преобразования, чтобы предотвратить транспонирование
Если таблица PDF была создана на веб-странице с помощью функции печати браузера, структура таблицы в PDF может быть менее структурированной, чем таблица из специального приложения для создания отчетов. PDF-файлы, созданные в браузере, часто имеют более слабое выравнивание между текстовыми элементами, что значительно затрудняет обнаружение таблиц. По возможности экспортируйте таблицы в PDF из исходного приложения, а не распечатывайте их из браузера, чтобы получить наиболее надежные результаты преобразования.
В некоторых таблицах PDF в качестве наглядного пособия для читателей используются чередующиеся цвета строк. Эти чередующиеся цвета могут сбить с толку алгоритм обнаружения таблицы, поскольку он воспринимает строки разного цвета как принадлежащие разным разделам таблицы. Удаление фоновых цветов из PDF-файла перед преобразованием или предварительное преобразование в оттенки серого устраняет этот источник путаницы и повышает согласованность определения структуры таблицы.
Если инструмент преобразования включает режим обнаружения таблиц, включите его. Обнаружение таблиц сообщает движку искать линии сетки, фоновую заливку и согласованные шаблоны выравнивания текста, которые указывают на структуру таблицы. В этом режиме применяется дополнительный анализ, выходящий за рамки извлечения текста по умолчанию, и с большей вероятностью правильно определяется ориентация строк и столбцов. Некоторые инструменты также предлагают функцию «Транспонировать вывод». флажок специально для обработки случаев, когда извлечение по умолчанию создает транспонированные данные. Если ваш вывод транспонирован и инструмент имеет эту опцию, проверка ее при второй попытке преобразования приведет к правильной ориентации.
Для Извлечения PDF-данных из отсканированных таблиц запустите OCR специально в табличном режиме. Механизмы OCR, предназначенные для общего распознавания текста, могут не сохранять пространственные отношения между текстовыми блоками. Механизм OCR в табличном режиме сохраняет структуру строк и столбцов в распознанном выводе. Конвертер PDF-to-Excel WukongPDF включает автоматическое обнаружение структуры таблицы, которое определяет отношения строк и столбцов на основе как визуального выравнивания, так и шаблонов содержимого, что снижает вероятность транспонирования по сравнению с обычным извлечением текста.
Исправление после преобразования: транспонирование данных Excel обратно
После транспонирования проверьте типы данных в каждом столбце. Excel мог интерпретировать столбец чисел как текст после транспонирования, поскольку транспонированные данные содержали метку заголовка в том же столбце. Выберите каждый столбец и убедитесь, что тип данных соответствует содержимому. Числа, отформатированные как текст, не будут рассчитываться правильно, а даты, отформатированные как текст, не будут сортироваться в хронологическом порядке. Исправьте типы данных после транспонирования, чтобы обеспечить полную работоспособность электронной таблицы.
Если выходные данные транспонированы и повторное преобразование нецелесообразно, Excel может транспонировать данные за несколько щелчков мышью. Выберите диапазон транспонированных данных, скопируйте его, щелкните правой кнопкой мыши новое место и в разделе «Параметры вставки» выберите «Транспонировать». Строки и столбцы меняются местами, восстанавливая исходную ориентацию. Это отлично работает для простых таблиц, где единственной проблемой является перестановка строк и столбцов. Для сложных таблиц с объединенными ячейками транспонирование в Excel неправильно обрабатывает объединенные ячейки и может привести к созданию макета, который будет хуже отличаться от оригинала.
Перед транспонированием сравните исходную таблицу PDF с выходными данными Excel, чтобы убедиться, что транспонирование является единственной проблемой. Если выходные данные также содержат смещенные ячейки, отсутствующие данные или неправильно объединенные ячейки, транспонирование не устранит эти проблемы. В таких случаях необходима ручная реконструкция или повторное преобразование данных с другими настройками. Исправление транспонирования — это решение в один клик для конкретного случая, когда данные полны и правильно выровнены, но ориентированы неправильно.
Предварительная обработка PDF для более чистого извлечения таблицы
Если таблица PDF была создана определенным приложением, например SAP, Oracle Reports или устаревшей мэйнфреймовой системой, найдите в Интернете известные проблемы преобразования выходных PDF-файлов этого конкретного приложения. Корпоративные системы отчетности часто генерируют PDF-файлы с предсказуемыми особенностями структуры таблиц, и другие пользователи могут задокументировать оптимальные настройки преобразования для этого конкретного источника. Целевой поиск избавляет от проб и ошибок при тестировании нескольких подходов к конверсии.
Если конкретный PDF-файл последовательно создает транспонированный результат при нескольких попытках преобразования, перед преобразованием выполните предварительную обработку PDF-файла. Используйте редактор PDF, чтобы удалить фоновую заливку, линии сетки или декоративные элементы, которые могут затруднить работу алгоритма обнаружения таблицы. Чистая таблица с черным текстом на белом фоне и тонкими последовательными линиями сетки преобразуется более надежно, чем таблица с чередующимися цветами строк, толстыми границами и встроенными значками. Удаление визуального шума перед преобразованием улучшает способность механизма преобразования правильно идентифицировать структуру таблицы.
Для сканированных таблиц настройте сканирование так, чтобы оно было идеально прямым. Таблица, сканируемая даже под углом в один градус, приводит к небольшому наклону каждой строки, и механизм преобразования может интерпретировать наклон как выравнивание столбца. Большинство программ сканирования включают функцию устранения перекоса, которая автоматически выпрямляет страницу. Включите эту опцию перед сканированием или используйте инструмент устранения перекоса отсканированного PDF-файла перед преобразованием. Прямые строки необходимы для правильного определения строк и столбцов.
Часто задаваемые вопросы
Позволяет ли преобразование таблицы PDF в CSV вместо Excel избежать проблемы транспонирования? Преобразование CSV использует тот же алгоритм обнаружения таблиц, что и преобразование Excel. Если алгоритм транспонирует данные, выходные данные CSV также будут транспонированы. Выходной формат не влияет на логику обнаружения. Преимущество CSV заключается в том, что его легче проверять в текстовом редакторе, что делает транспонирование сразу видимым, когда вы открываете файл и видите, что ожидаемые 5 столбцов стали 20.
Происходит ли транспонирование чаще с определенными типами таблиц PDF?
Да. Таблицы с объединенными ячейками заголовков, таблицы с непостоянным количеством столбцов в строке и таблицы, в которых первый столбец использует вертикальную ориентацию текста, с наибольшей вероятностью будут транспонированы. Таблицы с простой, однородной структурой сетки редко транспонируются. Чем регулярнее таблица, тем надежнее преобразование.
Можно ли автоматизировать обнаружение и исправление транспонированных выходных данных Excel?
Проверка количества столбцов в выходных данных Excel по сравнению с ожидаемым числом в исходной таблице — это простая автоматизированная проверка. Если таблица PDF имеет 5 столбцов и 20 строк, а выходные данные Excel содержат 20 столбцов и 5 строк, данные транспонируются. Сценарий может обнаружить это несоответствие и либо транспонировать данные, либо пометить файл для проверки вручную. Эта автоматизированная проверка качества позволяет выявить транспозицию до того, как данные попадут в последующие рабочие процессы.
Почему одна и та же таблица PDF правильно преобразуется при одной попытке и транспонируется при другой?
Обычно это происходит из-за того, что в двух попытках используются несколько разные настройки преобразования или инструмент преобразования использует другой внутренний путь обработки в зависимости от размера файла или пороговых значений сложности. Если вы столкнулись с противоречивыми результатами, задокументируйте точные параметры, обеспечивающие правильный вывод, и используйте эти параметры для всех будущих преобразований похожих таблиц.
Попробуйте PDF в Excel
Никакой установки не требуется. Работает прямо в вашем браузере.
