Others

Почему преобразование таблицы PDF в Excel иногда объединяет соседние числовые столбцы в одну ячейку

Вы конвертируете чисто отформатированную таблицу PDF в Excel, открываете выходные данные и обнаруживаете, что то, что раньше было двумя отдельными столбцами чисел в PDF-файле, превратилось в один столбец со значениями типа «1,2503,780». в каждой ячейке. Два числовых значения из соседних столбцов были объединены в одну текстовую строку, и данные теперь бесполезны для вычислений. Это наиболее распространенная жалоба на преобразование PDF в Excel, и она возникает из-за того, что преобразователь неправильно определил, где заканчивается один столбец и начинается следующий.

Обнаружение границ столбцов в таблицах PDF является принципиально сложной проблемой, поскольку PDF-файлы не содержат структуры таблицы. Таблица PDF — это просто текст, расположенный по определенным координатам, с горизонтальными и вертикальными линиями, нарисованными рядом с текстом. Конвертер должен определять границы столбцов на основе расстояния между текстовыми блоками, выравнивания текста по строкам или положения нарисованных линий. Если числовые столбцы узкие, а числа в соседних столбцах расположены близко друг к другу, преобразователь может объединить их в один более широкий столбец, считывая оба числа как одну текстовую строку. Конвертер видит непрерывный горизонтальный ряд чисел и не может определить, где в исходном макете был разрыв столбца.

Why Does Converting a PDF Table to Excel Sometimes Merge Adjacent Numeric Columns Into a Single Cell

Почему соседние числовые столбцы особенно уязвимы для слияния

Числовые столбцы в таблицах PDF обычно узкие, поскольку числа короткие. Столбец значений валют может содержать такие записи, как «1250,00». или «42,50», редко превышает 12 символов. Два узких числовых столбца рядом, например, «Цена за единицу»; и «Расширенная цена», между ними часто бывает всего несколько точек пустого пространства. Если алгоритм разделения столбцов преобразователя использует порог минимального разрыва, превышающий фактический разрыв между столбцами, он рассматривает два столбца как один и объединяет их значения.

Проблема усугубляется тем, что числа выровнены по правому краю. В правильно отформатированной таблице PDF числовые столбцы выравниваются по правому краю, поэтому числа в каждой строке заканчиваются в одном и том же горизонтальном положении. Пространство между концом числа, выровненного по правому краю в столбце A, и началом числа, выровненного по левому краю в столбце B, может составлять всего несколько пунктов. Визуальный осмотр PDF-файла показывает явный пробел, но алгоритму конвертера может потребоваться больший пробел для уверенного определения границы столбца, рассматривая узкое пространство как обычный межсловный интервал, а не как разделитель столбцов.

Связанная проблема возникает с отрицательными числами и круглыми скобками. Значение, отображаемое как «(1,250,00)»; включает как скобку, так и запятую, которые преобразователь может интерпретировать как несколько отдельных токенов. Открывающая скобка связывается с предыдущим столбцом, числовая часть помещается в текущий столбец, а закрывающая скобка удаляется или прикрепляется к следующему столбцу. В результате получается ячейка, содержащая частичные данные, требующие тщательной очистки вручную. Таблицы, использующие европейский формат чисел, где запятая является десятичным разделителем, а точка — разделителем тысяч, еще больше сбивают с толку конвертеры, предполагающие формат чисел в США.

WukongPDF

Попробуйте PDF в Excel

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Как определить проблемные таблицы перед преобразованием

Перед конвертированием откройте PDF-файл и увеличьте область таблицы. Ищите столбцы, в которых расстояние между крайним правым символом одного столбца и крайним левым символом следующего столбца визуально мало, меньше ширины примерно одного символа. Это столбцы, которые с наибольшей вероятностью будут объединены во время преобразования. Если вы видите таблицы с такими узкими интервалами между столбцами, запланируйте ручное исправление после преобразования или рассмотрите альтернативный метод извлечения.

Также проверьте таблицы, в которых используются точки-выноски, строки точек, соединяющие имя товара, выровненное по левому краю, и цену, выровненную по правому краю. Точки-выноски располагаются в пространстве между столбцами и часто ошибочно воспринимаются как данные, а не как визуальное форматирование. Преобразователь, который рассматривает точки-выноски как содержимое, создаст столбец, содержащий только точки, или неправильно разобьет таблицу, поскольку не сможет отличить точки-выноски от данных. Таблицы с объединенными ячейками заголовков, охватывающими несколько столбцов, являются еще одним проблемным местом. Конвертер видит широкий текстовый блок в строке заголовка и может неправильно сопоставить его с более узкими столбцами данных ниже.

Для критически важных данных, где точность имеет значение, извлечение Extract PDF Data с использованием специализированного программного обеспечения для распознавания таблиц более надежно, чем преобразование PDF в Excel общего назначения. Программное обеспечение для извлечения данных, разработанное специально для таблиц, использует несколько сигналов, положение текста, метрики шрифта, положение строки и согласованность выравнивания строк для построения более точной модели столбцов. Дополнительные затраты на специализированное программное обеспечение для извлечения данных оправданы, если альтернативой являются часы ручной очистки Excel для каждой преобразованной таблицы.

Стратегии ручной коррекции объединенных столбцов

Когда объединение столбцов неизбежно, функция Excel «Текст в столбцы» является самым быстрым инструментом исправления. Выберите объединенный столбец, откройте «Данные», «Текст в столбцы» и выберите «С разделителями». Если объединенные значения последовательно разделяются пробелом, выберите «Пробел» в качестве разделителя. Если они разделены переменным количеством пробелов, выберите «Фиксированная ширина» и вручную поместите линию разрыва столбца между двумя значениями. Excel предварительно просматривает разделение перед его применением, поэтому вы можете корректировать положение разрыва до тех пор, пока разделение не станет правильным для всех строк.

Для значений, которые были объединены без какого-либо разделителя, например "12503780" где разделение должно быть между "1250" и "3780" Текст в столбцы не может помочь, потому что нет разделителя, по которому можно было бы разделить. Вам необходимо знать ожидаемую ширину каждого столбца. Если первый столбец всегда содержит четыре цифры, а второй всегда содержит четыре цифры, используйте функции Excel ВЛЕВО и ВПРАВО с известным количеством символов, чтобы извлечь значения в отдельные столбцы. Этот подход работает только тогда, когда ширина столбцов фиксирована и согласована, что часто встречается в таблицах, экспортированных из систем баз данных с фиксированной шириной полей.

WukongPDF преобразует таблицы PDF в Excel с функцией обнаружения столбцов, которая анализирует выравнивание текста, интервал и положение строк для определения границ столбцов даже в плотно расположенных числовых таблицах. Преобразование сохраняет числовое форматирование, поэтому извлеченные значения можно сразу использовать для вычислений без очистки вручную. Для сложных таблиц, которые не поддаются автоматическому обнаружению столбцов, рассмотрите возможность использования подхода на основе OCR в качестве альтернативного пути. Сделайте снимок экрана таблицы PDF, запустите его с помощью инструмента OCR с возможностями распознавания таблиц и экспортируйте распознанную таблицу в Excel. Современные механизмы оптического распознавания символов, включающие определение структуры таблицы, часто более надежны при разделении столбцов, чем традиционные преобразователи PDF в Excel, поскольку они напрямую анализируют визуальный макет.

WukongPDF

Попробуйте PDF в Excel

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →