Tips & Tricks

Как распознать квитанцию или счет в формате PDF и экспортировать позиции непосредственно в электронную таблицу

Коробка с квитанциями. Папка со счетами в формате PDF. Годовые бизнес-расходы, которые необходимо ввести в электронную таблицу для подготовки налогов, составления отчетов о расходах или анализа бюджета. Вводить каждую позицию из каждой квитанции вручную в Excel — это медленно, подвержено ошибкам и утомительно. Более эффективный рабочий процесс использует OCR для чтения текста квитанции и экспорта распознанных позиций непосредственно в структурированную электронную таблицу.

Конвейер OCR PDF в электронные таблицы значительно усовершенствовался. Современные механизмы оптического распознавания символов могут распознавать макеты квитанций, идентифицировать позиции по их положению и шаблонам форматирования, а также экспортировать структурированные данные, требующие минимальной очистки. То, что раньше занимало часы ручного ввода данных, теперь требует нескольких минут автоматической обработки с кратким этапом проверки.

How to OCR a PDF Receipt or Invoice and Export the Line Items Directly to a Spreadsheet

Подготовка квитанций и счетов-фактур для OCR

Качество исходного изображения определяет точность вывода OCR, что определяет объем очистки, которую вам нужно будет выполнить. Сканируйте или фотографируйте чеки на плоской темной поверхности при равномерном освещении. Убедитесь, что чек ровный, не смятый и не сложен. Запишите всю квитанцию, включая название магазина вверху и общую сумму внизу. Отсутствие названия магазина означает, что выходные данные OCR не имеют идентификации поставщика.

Если квитанции на термобумаге выцвели, увеличьте контраст перед запуском OCR. Выцветшая квитанция, текст которой едва виден человеческому глазу, практически невидима для оптического распознавания символов. Используйте редактор изображений или приложение для сканирования с усилением контрастности, чтобы затемнить текст и осветлить фон. Улучшенное изображение может выглядеть неестественно для человеческого глаза, но дает значительно лучшие результаты распознавания.

Группируйте поступления по типу перед обработкой. Чеки из одного и того же магазина часто имеют схожие макеты, и их совместная обработка позволяет механизму оптического распознавания символов изучить шаблон макета и повысить точность всей партии. Смешивание квитанций из разных магазинов заставляет механизм OCR рассматривать каждую квитанцию как уникальный макет.

WukongPDF

Попробуйте PDF-распознавание текста

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Настройка OCR для извлечения данных квитанции

Выберите настройки OCR, оптимизированные для квитанций. В квитанциях обычно используются мелкие шрифты, узкая бумага и термопечать, при которой печатаются символы с непостоянной плотностью чернил. Настройки оптического распознавания символов, оптимизированные для чеков, включают сканирование с более высоким разрешением, не менее 300 точек на дюйм, а также вывод в оттенках серого, а не черно-белый, чтобы сохранить незначительные различия в плотности символов.

WukongPDF обеспечивает обработку OCR через браузер, позволяя сканировать или загружать квитанции и извлекать текст. Функция оптического распознавания символов на основе браузера обрабатывает файлы локально, сохраняя ваши финансовые документы на вашем устройстве.

Для Extract PDF Data из чеков механизм OCR должен различать описания товаров, количества, цены за единицу и итоговые суммы по строкам. Чтобы сделать это различие, движок использует сигналы положения. Товары обычно располагаются слева, количества и цены — справа, а итоговые суммы строк — в крайнем правом столбце. Чем более последовательным является макет квитанции, тем точнее идентификация полей.

Экспорт данных OCR в формат электронной таблицы

После завершения OCR экспортируйте распознанные данные в формат CSV или Excel. При экспорте должно сохраняться разделение полей, определенное во время OCR: имя поставщика в одном столбце, дата в другом, описание каждой позиции, количество, цена за единицу и общая сумма строки в отдельных столбцах. Большинство инструментов OCR включают опцию экспорта квитанции в электронную таблицу.

Преобразование Scanned PDF в электронную таблицу не является идеальным. Будьте готовы потратить от пяти до десяти минут на проверку и очистку каждого чека. Сравните выходные данные электронной таблицы с исходным изображением квитанции. Убедитесь, что отдельные позиции соответствуют общей сумме чека. Убедитесь, что налог был правильно определен и отделен от цены товара. На этапе проверки выявляются ошибки OCR до того, как они попадут в ваши отчеты о расходах.

Для периодической обработки чеков сохраните настройки оптического распознавания символов и экспортируйте конфигурацию в качестве предустановки. Каждая последующая партия квитанций обрабатывается с одинаковыми настройками, обеспечивая согласованный результат. Предустановленный подход особенно полезен для владельцев бизнеса, которые обрабатывают ежемесячные отчеты о расходах от одного и того же набора поставщиков.

Обработка многостраничных счетов и сложных квитанций

Многостраничные счета требуют особого обращения, поскольку отдельные позиции могут выходить за границы страниц. Механизм OCR должен распознавать, что элементы на второй странице являются продолжением элементов на первой странице, а не новым набором элементов. Большинство инструментов OCR обрабатывают это правильно, когда страницы счета-фактуры обрабатываются как один документ.

К чекам из ресторана с написанными от руки суммами чаевых добавляется этап ручной проверки. OCR может читать напечатанные суммы, но с трудом справляется с почерком, особенно с почерком, добавленным после того, как квитанция была напечатана, когда ручка могла пересечь печатный текст. Сумма чаевых и скорректированная сумма должны быть проверены и введены вручную, если OCR не может их прочитать.

После экспорта в электронную таблицу используйте инструменты работы с электронными таблицами, чтобы классифицировать расходы. Добавьте столбец категории и присвойте каждой строке категорию расходов на основе поставщика или описания позиции. Категоризация в процессе проверки OCR более эффективна, чем категоризация после обработки всех квитанций.

Для квитанций, распечатанных на обеих сторонах, что становится все более распространенным из соображений защиты окружающей среды, сканируйте обе стороны и обрабатывайте их как один документ. Механизм OCR считывает лицевую и оборотную стороны как последовательные страницы. Позиции, продолжающиеся от лицевой стороны к обратной стороне чека, должны рассматриваться как одна транзакция, если магазин печатает уведомление о продолжении на лицевой стороне.

Символы валют и десятичные разделители различаются в зависимости от региона. В чеке из европейского магазина в качестве десятичного разделителя используется символ евро и запятая. Перед обработкой настройте механизм OCR для правильной локали. Постобработка электронной таблицы для стандартизации форматов денежных единиц поступлений из разных стран обеспечивает согласованность финансовой отчетности.

Формат даты на квитанциях сильно различается. ММ/ДД/ГГГГ в США, ДД/ММ/ГГГГ в Европе, ГГГГ/ММ/ДД в некоторых частях Азии. OCR экспортирует дату как распознанный текст. Электронная таблица должна правильно интерпретировать дату в зависимости от происхождения поступления. Добавление столбца страны получения помогает интерпретировать дату на этапе очистки.

Для отчетности о расходах выходные данные таблицы OCR можно импортировать непосредственно в бухгалтерское программное обеспечение или платформы управления расходами. Большинство платформ поддерживают импорт CSV со стандартными столбцами: дата, поставщик, описание, сумма, категория и способ оплаты. Сопоставление выходных столбцов OCR с ожидаемыми столбцами платформы — это последний шаг в конвейере от получения к отчету.

Сохраните исходный PDF-файл квитанции вместе с выходными данными электронной таблицы OCR. PDF-файл служит авторитетной записью. Электронная таблица служит рабочими данными. Если возникают вопросы по конкретной транзакции, можно просмотреть исходный PDF-файл квитанции, чтобы проверить интерпретацию OCR.

Для постоянных поставщиков с единообразными форматами квитанций точность распознавания текста со временем повышается по мере того, как механизм изучает макет. Для первого поступления от нового поставщика может потребоваться более тщательная ручная очистка, чем для десятого. Сохранение исправленных результатов в качестве обучающего примера для механизма OCR ускоряет процесс обучения.

Ставки налога на квитанции различаются в зависимости от местоположения и типа продукта. OCR может признать сумму налога, но не ставку налога. Расчет налоговой ставки на основе суммы налога и промежуточной суммы помогает проверить точность OCR. Если рассчитанная ставка не соответствует какой-либо известной налоговой ставке для места покупки, либо OCR неправильно интерпретирует суммы, либо в квитанции содержатся как облагаемые, так и необлагаемые налогом статьи.

Для деловых расходов, оплаченных за счет личных и деловых средств, например, бизнес-ланча, когда один человек заплатил за весь стол, в квитанции должна быть указана деловая часть. Аннотацию следует добавлять в электронную таблицу после оптического распознавания символов, а не в PDF-файл квитанции, чтобы сохранить исходную квитанцию для целей аудита.

Окупаемость инвестиций в OCR квитанций становится положительной примерно после пятидесяти чеков по сравнению с вводом данных вручную. Для предприятий, обрабатывающих сотни квитанций ежемесячно, экономия времени приводит к измеримому сокращению затрат на рабочую силу и ускорению циклов отчетности о расходах.

Облачные платформы управления квитанциями сочетают распознавание текста с мобильными приложениями, которые делают фотографии квитанций в момент получения. Данные о поступлениях передаются непосредственно в отчеты о расходах без промежуточного этапа сохранения и последующей обработки PDF-файлов, что еще больше упрощает рабочий процесс.

Налоговое управление США и другие налоговые органы принимают цифровые копии квитанций при условии, что цифровое изображение разборчиво и точно соответствует оригиналу. Вывод электронной таблицы OCR в сочетании с исходным PDF-файлом квитанции удовлетворяет требованиям ведения учета, делая данные гораздо более полезными для подготовки налогов.

Для компаний, которые обрабатывают квитанции из нескольких стран, система OCR должна обрабатывать разные языки, валюты, форматы дат и налоговые структуры. Квитанция из Франции выглядит иначе, чем квитанция из Японии, и систему OCR необходимо настроить для каждого регионального формата.

Долгосрочная ценность оцифрованных квитанций выходит за рамки необходимости немедленной отчетности о расходах. Исторические данные о квитанциях можно анализировать на предмет структуры расходов, переговоров с поставщиками и прогнозирования бюджета. Эта информация недоступна, когда квитанции остаются в бумажной форме или в виде PDF-файлов, недоступных для поиска.

Сочетание технологии OCR и экспорта электронных таблиц преобразует квитанции из статических записей в анализируемые данные, которые поддерживают финансовое управление, соблюдение налогового законодательства и бизнес-аналитику.

Переход от бумажных квитанций к цифровым данным, обработанным с помощью оптического распознавания символов, представляет собой одно из наиболее практичных применений автоматизации документов для малого бизнеса и частных лиц, управляющих своими финансами.

Обработка квитанций OCR превращает утомительную и чреватую ошибками задачу ручного ввода данных в быстрый автоматизированный рабочий процесс, который окупается экономией времени после первых нескольких десятков квитанций.

Поле полученияСовет по распознаванию OCRЭкспорт столбца
Название магазинаОбычно вверху; самый большой шрифтПродавец
ДатаИщите шаблоны дат вверху.Дата
ПозицииТекстовые блоки с выравниванием по левому краюОписание, Кол-во, Цена за единицу
ИтогоДо уплаты налогов; часто помечаетсяИтого
НалогПосле промежуточного итога; процентный или фиксированныйНалог
ОбщийСамая большая сумма; часто жирныйОбщий
WukongPDF

Попробуйте PDF-распознавание текста

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →