Others

Почему при преобразовании PDF в Excel иногда появляются пустые ячейки там, где должны быть данные

Вы конвертируете таблицу PDF в Excel, открываете результат и смотрите на электронную таблицу с пустыми ячейками, где должны быть числа. В исходном PDF-файле явно были данные в этих позициях. Вы можете увидеть это на экране. Но в файле Excel были пробелы, пропущенные значения или целые строки, превращенные в пустое пространство. Это один из самых неприятных результатов преобразования PDF в Excel, поскольку неясно, что пошло не так и как это исправить.

Основная причина обычно не в самом инструменте преобразования. Это несоответствие между тем, как PDF хранит данные таблицы, и тем, что механизм преобразования ожидает найти. Понимание конкретных причин появления пустых ячеек делает проблему скорее разрешимой, чем загадочной.

Why Does Converting a PDF to Excel Sometimes Produce Blank Cells Where Data Should Be

Файл PDF содержит изображение таблицы, а не фактические данные таблицы

Это самая распространенная причина появления пустых ячеек после преобразования PDF в Excel. Если PDF-файл был создан на основе сканирования, снимка экрана или печати в PDF из приложения, которое растеризовало его выходные данные, таблица, которую вы видите на странице, представляет собой плоское изображение. Здесь нет базовых ячеек данных, структур строк и столбцов, а также текстовых потоков, которые может анализировать инструмент преобразования.

Когда инструмент преобразования обнаруживает таблицу на основе изображения, у него есть два варианта: запустить OCR, чтобы попытаться распознать текст и восстановить структуру таблицы, или полностью пропустить изображение, поскольку он не может его проанализировать. Многие базовые преобразователи PDF в Excel используют второй путь. Они извлекают реальные данные, которые могут найти, и оставляют контент на основе изображений. В результате получается электронная таблица с пустыми ячейками на месте изображения таблицы. Решение заключается в использовании PDF Converter, включающего функцию оптического распознавания текста, например WukongPDF, который распознает текст в изображениях и восстанавливает сетку таблицы. Преобразование не будет точным до пикселя, но данные будут появляться в ячейках, а не исчезать в пустом пространстве.

WukongPDF

Попробуйте PDF в Excel

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

В макете таблицы используются сложные объединенные или вложенные ячейки

Даже если таблица состоит из реальных текстовых данных, способ ее структурирования в исходном приложении может привести к сбою в работе механизма преобразования. Такие приложения, как Microsoft Excel, Google Sheets и программное обеспечение для создания отчетов, часто создают таблицы с объединенными ячейками, где один заголовок охватывает несколько столбцов, вложенные таблицы, где ячейка содержит другую мини-таблицу внутри, или многоуровневые заголовки с группировкой родительских и дочерних столбцов.

PDF не был разработан для представления табличных структур. Он был разработан для размещения символов в определенных координатах x,y на странице. PDF-файл хранит таблицу в виде тысяч независимых команд позиционирования символов. Механизм преобразования должен перепроектировать структуру таблицы, анализируя пространственное расположение этих символов. Объединенные ячейки чрезвычайно усложняют этот анализ. То, что для читателя-человека выглядит как одна логическая ячейка, для механизма преобразования выглядит как текст, охватывающий неоднозначную область, которая может представлять собой одну широкую ячейку или несколько узких ячеек. Когда механизм угадывает неправильно, данные оказываются в неправильных столбцах, разбиваются по ячейкам или опускаются, поскольку механизм не может разрешить неоднозначность.

Идеального универсального решения этой проблемы не существует, поскольку исходная структура таблицы была потеряна при преобразовании документа в PDF. Если у вас есть доступ к исходному файлу, экспорт непосредственно из Excel или Google Sheets в формат .xlsx, а не преобразование PDF в Excel, полностью сохраняет структуру таблицы. Если PDF-файл — ваша единственная копия, инструмент преобразования с расширенным обнаружением таблиц, который позволяет вам вручную определять границы столбцов или корректировать обнаруженные области таблицы, дает вам наилучшие шансы на чистое восстановление данных.

Несогласованная или отсутствующая информация о разделителе

Механизмы преобразования определяют границы столбцов, анализируя горизонтальные промежутки между группами символов. Если две колонки расположены очень близко друг к другу, движок может объединить их в одну. Если столбец содержит ячейки с сильно различающимся объемом текста, движок может разделить столбец на несколько столбцов в узких точках. Обе ошибки приводят к появлению пустых ячеек либо потому, что данные, которые должны заполнить два отдельных столбца, были забиты в один, оставляя другой столбец пустым, либо потому, что фантомный столбец разбивает созданные ячейки, в которых данных нет.

Таблицы с пустыми ячейками в исходном документе создают особенно сложный вариант этой проблемы. Если исходная таблица намеренно содержит пустые ячейки, механизм преобразования видит большие пробелы и может сместить определение границы столбца, смещая каждую строку ниже пробела. Одна пустая ячейка в строке 3 может нарушить все сопоставление столбцов для строк с 4 по 50, создав каскад невыровненных данных, который выглядит как ошибка преобразования, но на самом деле является структурной двусмысленностью в исходном документе.

Как минимизировать пустые ячейки при следующем преобразовании

Несколько практических изменений значительно повышают вероятность успешной конверсии. Во-первых, всегда используйте инструмент, который поддерживает определение структуры таблицы, а не универсальный конвертер PDF в текст. Инструменты, разработанные специально для Extract PDF Data, используют алгоритмы, обученные на макетах таблиц, и дают значительно лучшие результаты, чем извлечение текста общего назначения. Преобразование PDF-файла в Excel в WukongPDF включает обнаружение структуры таблицы, которая обрабатывает общие макеты, включая объединенные ячейки, многоуровневые заголовки и таблицы со смешанными типами данных.

Во-вторых, проверьте PDF перед конвертированием. Если вы можете выбрать и скопировать отдельные ячейки или столбцы текста из таблицы с помощью средства просмотра PDF-файлов, таблица состоит из реальных текстовых данных и будет конвертироваться достаточно хорошо. Если вы щелкнете по таблице, и все будет выделено как один блок, или если выделение текста вообще не работает, таблица представляет собой изображение и требует преобразования на основе OCR.

В-третьих, будьте готовы очистить вывод. Даже лучшие инструменты преобразования создают электронные таблицы, которые требуют ручной настройки. Проверьте первые несколько строк каждого столбца, чтобы убедиться, что значения помещены в правильные столбцы. Ищите столбцы, которые полностью пусты, если вы видите данные в исходном PDF-файле в этом положении. Это признаки того, что инструмент неправильно определил границы столбца. Исправление сопоставления столбцов в первых нескольких строках часто приводит к каскадным исправлениям во всей остальной таблице.

Что делать, если преобразование продолжает выдавать пустые ячейки

Если вы попробовали несколько инструментов, и при преобразовании постоянно появляются пустые ячейки в определенных позициях, проблема, скорее всего, связана с самим PDF-файлом, а не с инструментами. Данные таблицы могут храниться в виде векторной графики, где числа изображаются в виде фигур, а не кодируются как текстовые символы. Чаще всего это происходит с PDF-файлами, созданными с помощью старых программ САПР, специализированных инструментов отчетности или некоторых систем планирования ресурсов предприятия, которые отображают выходные данные в PDF с помощью команд графического рисования, а не размещения текста. В этих случаях распознавание текста является единственным вариантом, и вам следует рассчитывать на то, что вам придется вручную просматривать и исправлять выходные данные, поскольку распознавание векторных табличных данных по своей природе подвержено ошибкам.

Самый продуктивный запасной вариант, когда автоматическое преобразование неоднократно терпит неудачу, — это сделать снимок экрана таблицы в высоком разрешении, пропустить его через специальный инструмент OCR, который специализируется на распознавании таблиц, и экспортировать в Excel. Этот двухэтапный процесс (снимок экрана, а затем распознавание текста) полностью обходит внутреннее представление данных PDF-файла и рассматривает таблицу как чистое изображение, что, по иронии судьбы, может быть более надежным для определенных типов искаженных PDF-файлов, чем попытка анализа поврежденных или нестандартных текстовых данных.

WukongPDF

Попробуйте PDF в Excel

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →