Tips & Tricks

Как распознать отсканированную таблицу и экспортировать только числа

Отсканированная таблица в PDF-файле представляет собой сетку чисел, заключенную в изображение. Человеческий глаз видит строки и столбцы. Программное обеспечение OCR видит изображение страницы и пытается извлечь любой текст, который может найти. В результате часто получается путаница, в которой теряются связи между числами. Значение из третьего столбца попадает во второй столбец. Заголовок строки привязан к неверным данным. Запуск OCR в отсканированной таблице и экспорт только числовых данных, четко сопоставленных со строками и столбцами, требует настроек OCR, сохраняющих структуру таблицы, и шага экспорта, который изолирует числа от окружающего текста. Процесс OCR PDF для извлечения таблицы более трудоемкий, чем обычный процесс распознавания текста.

How to OCR a Scanned Table and Export Only the Numbers

Почему общее распознавание символов не работает на таблицах

Обычное OCR обрабатывает изображение страницы как непрерывный поток текста. Он распознает символы и выводит их в том порядке, в котором они появляются на странице, обычно слева направо, сверху вниз. Стол нарушает этот поток. Механизм OCR обнаруживает короткие фрагменты текста, разделенные большими пробелами. Он должен решить, являются ли эти фрагменты частью одного абзаца, отдельными строками или элементами таблицы. Общие механизмы OCR не предназначены для проведения такого различия.

Число в ячейке таблицы отделено от соседей пробелом. Заголовок столбца над ним может быть распознан как отдельный текстовый блок. Метка строки слева от нее может быть распознана как другой отдельный блок. Вывод OCR представляет эти три части как несвязный текст. Связь между заголовком столбца, меткой строки и значением данных теряется. Таблица Scanned PDF превращается в кучу чисел, не имеющих структурного значения.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Использование механизмов OCR с поддержкой таблиц

Специализированные механизмы оптического распознавания символов включают обнаружение таблиц в качестве основной функции. Эти механизмы анализируют изображение страницы и определяют структуру таблицы, определяя линии сетки, выравнивание столбцов и постоянный интервал между строками. Они обрабатывают таблицу как структурированный объект, распознавая каждую ячейку индивидуально и записывая положение ее строки и столбца. Выходные данные представляют собой структурированный формат, например электронную таблицу или файл CSV, в котором структура таблицы сохраняется.

Adobe Acrobat Pro включает в себя OCR с поддержкой таблиц. При запуске OCR в отсканированном документе включите параметр «Распознавать текст» и убедитесь, что параметр «Распознавание таблиц» активен. Механизм OCR идентифицирует таблицы на странице и извлекает их как структурированные данные. Браузерные платформы OCR PDF, включая WukongPDF, также поддерживают распознавание таблиц, возвращая извлеченные данные в формате электронных таблиц.

Экспорт только числовых данных

После того как OCR распознает структуру таблицы, выходные данные обычно включают в себя весь текст таблицы: метки строк, заголовки столбцов и значения данных. Чтобы экспортировать только числа, отфильтруйте выходные данные. В электронной таблице удалите текстовые столбцы и сохраните числовые столбцы. Или в настройках экспорта OCR укажите, что следует извлекать только числовые данные. Некоторые инструменты OCR могут определять тип данных в каждой ячейке и позволяют выборочный экспорт числовых ячеек.

Числовой экспорт полезен, когда данные таблицы будут переданы в другую систему. Финансовая модель, которой нужны данные о квартальных доходах, не нуждается в метках строк. Статистический анализ, для которого необходимы значения измерений, не требует заголовков столбцов. Шаг Extract PDF Data создает чистый набор числовых данных, готовый к импорту. Текстовые метки можно экспортировать отдельно и использовать в качестве справки, чтобы понять, что обозначают числа.

Очистка и проверка извлеченных чисел

OCR никогда не бывает идеальным. Числа особенно подвержены ошибкам, поскольку многие символы выглядят одинаково. Ноль можно распознать как букву О. Единицу можно распознать как строчную букву L. Запятую можно распознать как точку. После извлечения числовых данных просканируйте выходные данные на наличие ошибок OCR. Ищите числа, которые выходят за пределы диапазона по сравнению с их соседями. Квартальный доход в размере сорока пяти тысяч долларов в столбце значений около четырехсот пятидесяти тысяч долларов является тревожным сигналом.

Сравните полученные итоговые значения с любыми сводными цифрами в исходном документе. Если исходная таблица содержит строку итогов внизу, просуммируйте извлеченные числа и сравните сумму с исходной. Несоответствие указывает на ошибку OCR в одной или нескольких ячейках. Отсканированный оригинал PDF является источником истины. Выходные данные OCR представляют собой приближение, требующее проверки.

Обработка отсканированных таблиц с плохим качеством изображения

Таблица, напечатанная на матричном принтере, дважды фотокопированная и отсканированная с низким разрешением, представляет собой серьезную проблему распознавания. Линии сетки могут быть прерваны или отсутствовать. Цифры могут быть тусклыми или частично неясными. Механизм OCR может вообще не обнаружить структуру таблицы, возвращаясь к обычному распознаванию текста. Предварительно обработайте отсканированное изображение перед распознаванием символов. Увеличьте контрастность, чтобы сделать слабые числа темнее. Примените фильтр удаления пятен, чтобы удалить случайные точки, которые механизм OCR может интерпретировать как десятичные точки или запятые.

Если качество изображения таблицы слишком плохое для автоматического оптического распознавания символов, единственным вариантом может быть ручная транскрипция. Введите числа в электронную таблицу вручную, читая их по отсканированному изображению. Это медленно, но дает совершенно точные данные. Компромисс времени между ручной транскрипцией и коррекцией OCR зависит от размера таблицы и точности OCR. Небольшую таблицу с низкой точностью распознавания текста быстрее расшифровать вручную. Большая таблица с хорошей точностью распознавания быстрее корректирует выходные данные оптического распознавания символов.

Извлечение чистых числовых данных из отсканированной таблицы — это многоэтапный процесс, требующий тщательной настройки оптического распознавания символов и тщательной проверки. Извлеченные цифры затем могут поступать в системы анализа, моделирования или отчетности, как если бы они были созданы в цифровом виде.

WukongPDF предоставляет инструменты, необходимые для этого рабочего процесса, через платформу на основе браузера, которая работает во всех операционных системах и устройствах.

Методы, описанные в этой статье, можно реализовать с помощью инструментов PDF, доступных на большинстве платформ, включая браузерные службы, настольные и мобильные приложения.

При правильном подходе и соответствующей конфигурации эта задача PDF становится рутинной операцией, обеспечивающей согласованные и надежные результаты для любого документа.

Понимание этих концепций и применение описанных здесь методов помогут вам эффективно справиться с этим сценарием PDF и быть уверенным в качестве вывода.

Рабочие процессы и лучшие практики, описанные в этой статье, обеспечивают прочную основу для работы с PDF-файлами в этом конкретном контексте, будь то для личного, профессионального или организационного использования.

В этой статье описаны основные концепции и практические шаги, необходимые для эффективного решения этой задачи PDF, от начальной настройки до окончательной проверки вывода.

Как и во многих операциях с документами, качество результата зависит от тщательности, проявленной при настройке, и тщательности этапа проверки перед распространением или архивированием окончательного документа.

Возможность надежного выполнения этой операции является ценным дополнением к любому документообороту, экономит время и дает профессиональные результаты, которые хорошо отражаются на человеке и организации.

Независимо от того, выполняете ли вы эту операцию впервые или совершенствуете устоявшийся рабочий процесс, описанные здесь принципы и методы предоставляют четкое и практическое руководство.

Экосистема PDF продолжает развиваться, регулярно появляются новые инструменты и возможности. Получение информации о доступных опциях гарантирует, что рабочие процессы с документами останутся эффективными.

Время, потраченное на освоение этих методов работы с PDF, многократно окупается за счет более быстрой обработки документов, меньшего количества ошибок и более профессиональных результатов, отвечающих потребностям получателей.

В этой статье представлен всесторонний обзор темы, охватывающий как фундаментальные концепции, так и практические методы, необходимые для достижения желаемых результатов.

Обладая этими знаниями, читатели могут с уверенностью подойти к поставленной задаче и создать документы, соответствующие профессиональным стандартам качества и надежности.

Методы и подходы, изложенные в этой статье, представляют собой современные лучшие практики для решения этого аспекта управления PDF-документами.

Следуя приведенным здесь рекомендациям, читатели смогут добиться стабильных и качественных результатов, избегая при этом распространенных ошибок, которые приводят к разочарованию и напрасным усилиям.

Формат PDF остается стандартом для обмена документами между отраслями и платформами. Овладение этими методами повышает как личную продуктивность, так и организационные способности.

Читатели, применяющие эти методы, обнаружат, что задачи, которые когда-то казались сложными, становятся простыми и выполнимыми с практикой и правильной конфигурацией инструментов.

Инвестиции в обучение правильной работе с PDF-файлами приносят дивиденды при выполнении бесчисленных задач с документами, что делает это одним из наиболее практичных навыков на современном цифровом рабочем месте.

С практикой эти операции с PDF-файлами становятся второй натурой, позволяя специалистам по работе с документами сосредоточиться на содержимом, а не бороться с проблемами формата файлов.

Рекомендации, представленные в этой статье, помогут читателям справиться с этим аспектом работы с PDF компетентно и уверенно.

Овладение этим навыком работы с PDF — это инвестиция, которая продолжает приносить прибыль с каждым обработанным документом и оптимизацией каждого рабочего процесса.

Точное извлечение числовых данных из отсканированных таблиц преобразует бумажные записи в полезную цифровую информацию.

Этот навык, однажды развитый, становится постоянной и ценной частью любого профессионального инструментария для работы с документами.

Полученные здесь знания применимы к различным инструментам, платформам и типам документов, что делает их универсально полезными для всех, кто работает с PDF-файлами.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →