Tips & Tricks

Как распознать пакет квитанций и экспортировать только релевантные для налогообложения позиции

Налоговый сезон приходит с коробкой из-под обуви, папкой с вложениями в электронную почту или стопкой бумажных квитанций, которые накапливались месяцами. Каждая квитанция должна быть классифицирована, каждая позиция должна быть сопоставлена с категорией вычитаемых расходов, а общая сумма должна быть введена в таблицу подготовки налогов или систему бухгалтерского учета. Выполнение этого вручную для сотни квитанций занимает целый день и приводит к ошибкам транскрипции. Пакетная обработка OCR полностью меняет математику.

Оптическое распознавание символов на одном чеке — решаемая проблема. Реальный выигрыш в эффективности достигается за счет пакетной обработки процесса: загрузки десятков или сотен PDF-файлов квитанций в конвейер OCR, извлечения структурированных данных, а не необработанного текста, и фильтрации выходных данных по позициям, которые важны для налоговой отчетности. Опрос, проведенный Национальной ассоциацией налоговых специалистов в 2025 году, показал, что самозанятые налогоплательщики, которые использовали инструменты автоматической обработки квитанций, экономили в среднем 18 часов за налоговый год по сравнению с теми, кто обрабатывал квитанции вручную (NATP, «Обзор технологий налогового сезона», 2025). Правильный конвейер OCR PDF превращает целый день ручного ввода данных в задачу проверки и подтверждения, занимающую менее часа. Возможности пакетной обработки WukongPDF обеспечивают первоначальное преобразование квитанций смешанного формата в согласованный формат Сканированный PDF с высоким разрешением, готовый к извлечению OCR, поэтому вы запускаете конвейер с чистыми, единообразными входными данными независимо от того, как изначально поступила каждая квитанция.

How to OCR a Batch of Receipts and Export Only the Tax-Relevant Line Items

Чем OCR квитанции отличается от OCR общего документа

OCR общего назначения берет изображение страницы и создает блок текста. OCR квитанций должен пойти на несколько шагов дальше: он должен идентифицировать каждую позицию в квитанции, извлечь имя и дату поставщика, отделить общую сумму от промежуточной суммы и суммы налога, классифицировать каждую позицию по типу расходов и игнорировать остатки баллов по картам лояльности, текст политики возврата, приглашения на участие в опросах и другой нефинансовый контент, напечатанный на квитанции.

Квитанции представляют собой особые проблемы, которых нет в обычных документах. Чеки на термобумаге со временем тускнеют, что снижает контрастность и затрудняет различение символов. Чеки часто мнутся, сгибаются или фотографируются под углом, что создает искажение перспективы. Макеты квитанций сильно различаются в разных системах торговых точек, при этом не существует стандартного формата, в котором дата, поставщик, товары и итоговые суммы отображаются на странице. Специализированные API-интерфейсы OCR квитанций от таких поставщиков, как Veryfi, Mindee и Taggun, специально обучены макетам квитанций и справляются с этими крайними случаями гораздо лучше, чем обычный механизм OCR, ориентированный на изображения квитанций.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Построение конвейера от квитанции к налоговым данным. Шаг за шагом

Конвейер состоит из четырех этапов: захват, распознавание текста, извлечение и экспорт. Каждый этап требует настройки, соответствующей вашим конкретным требованиям к налоговой отчетности.

На этапе сбора преобразуйте каждую квитанцию в согласованный формат. Если у вас есть бумажные квитанции, отсканируйте их с разрешением 300 точек на дюйм в оттенках серого и сохраните в формате PDF. Если вы фотографируете квитанции на телефон, используйте специальное приложение для сканирования, такое как Adobe Scan или Microsoft Lens, а не собственное приложение камеры. Эти приложения автоматически обрезают края квитанции, исправляют перспективные искажения и повышают контрастность. Если ваши квитанции приходят от поставщиков в виде вложений по электронной почте, настройте правило пересылки электронной почты, которое будет отправлять их в специальную папку. В конце этапа сбора все квитанции должны храниться в одной папке в виде чистых, читаемых PDF-файлов или изображений с высоким разрешением.

Для этапа OCR выберите инструмент, который поддерживает пакетную обработку через API или функцию просмотра папок. Загрузите все PDF-файлы квитанций одновременно, а не обрабатывайте их по одному. Большинство API-интерфейсов OCR квитанций принимают ZIP-файл документов или список URL-адресов, указывающих на сохраненные файлы. Настройте механизм OCR для извлечения структурированных полей вместо возврата необработанного текста. Как минимум запросите имя поставщика, дату транзакции, общую сумму, сумму налога и отдельные позиции с их описаниями и ценами.

На этапе извлечения механизм OCR возвращает данные JSON, которые вы фильтруете до релевантного с точки зрения налогообложения контента. Не каждая позиция в квитанции квалифицируется как вычитаемый расход. Квитанция из магазина канцелярских товаров может включать как предметы, подлежащие франшизе, такие как бумага для принтера, так и не подлежащие вычету предметы, такие как закуски для комнаты отдыха. На этапе извлечения необходимы правила, которые классифицируют статьи расходов по категориям: питание и развлечения, канцелярские товары, подписки на программное обеспечение, командировки, оборудование и т. д. Некоторые платформы OCR квитанций включают встроенную категоризацию расходов на основе описаний поставщиков и товаров. Для настраиваемых правил экспортируйте необработанные данные о позициях в электронную таблицу и примените теги категорий вручную или с помощью таблицы поиска.

На этапе экспорта выдаются выходные данные, необходимые вашей программе подготовки налоговых деклараций или налоговому программному обеспечению. Общие форматы включают CSV-файл со столбцами для поставщика, даты, категории, описания статьи, суммы и суммы налога или сводный отчет, объединяющий итоговые суммы по категориям расходов. Если вы используете QuickBooks, Xero или другую учетную платформу, многие инструменты распознавания квитанций напрямую интегрируются с этими платформами и автоматически помещают категоризированные позиции в правильные счета расходов. Согласно отчету о продукте Intuit за 2025 год, малые предприятия, использующие автоматизированный сбор данных для квитанций, сократили свои затраты на подготовку налогов на конец года в среднем на 400–600 долларов США по сравнению с теми, кто доставлял необработанные файлы квитанций своему бухгалтеру (Intuit, «QuickBooks Business Insights Report», 2025).

Общие категории квитанций, которые действительно интересуют IRS

IRS группирует деловые расходы в определенные категории в Приложении C, и ваше извлечение статей должно напрямую соответствовать этим категориям. Наиболее часто проверяемые категории заслуживают самого тщательного рассмотрения.

IRS Категория C Типичные позицииТребования к документации
Питание (50% франшиза)Ресторанные чеки, кейтеринг, кофе-встречи с клиентамиДата, участники, деловая цель, сумма
Канцелярские товарыБумага, тонер, ручки, транспортировочные материалы, чистящие средства.Квитанция с детализированными позициями
Программное обеспечение и подпискиИнструменты SaaS, облачное хранилище, ресурсы дизайна, сервисы APIСчет или квитанция с расчетным периодом
ПутешествоватьАвиаперелет, гостиница, аренда автомобиля, пробег, парковка, дорожные сборыКвитанция плюс маршрут или запись в календаре
Оборудование и амортизацияКомпьютеры, мониторы, мебель, техника на сумму более 2500 долларов США.Квитанция плюс дата ввода в эксплуатацию
Профессиональные услугиЮридические расходы, бухгалтерские сборы, консультации, внештатная помощьСчет с описанием услуги

IRS требует, чтобы все деловые расходы были как обычными, так и необходимыми. Обычные расходы — это расходы, которые распространены и приняты в вашей отрасли. Необходимые расходы – это расходы, которые полезны и подходят для вашего бизнеса. Извлечение отдельных статей из конвейера OCR квитанций должно помечать любые расходы, которые вы не можете объяснить как обычные и необходимые, давая вам возможность пересмотреть их до того, как бухгалтер увидит полный список.

Обработка мультивалютных и международных квитанций

Подрядчики и малые предприятия, которые работают с международными клиентами или выезжают за границу, накапливают квитанции в нескольких валютах. IRS требует, чтобы все расходы были указаны в долларах США по обменному курсу, действующему на дату транзакции. Инструменты OCR квитанций, поддерживающие извлечение нескольких валют, могут определять валюту по символу валюты квитанции или коду ISO и записывать как исходную сумму, так и тип валюты.

Шаг конвертации валюты обычно происходит после извлечения, а не внутри механизма OCR. Экспортируйте извлеченные данные в электронную таблицу, добавьте столбец с обменным курсом на дату транзакции и рассчитайте эквивалент в долларах США. IRS публикует среднегодовые обменные курсы, которые вы можете использовать для повторяющихся небольших транзакций, но отдельные крупные транзакции должны конвертироваться по дневному курсу на определенную дату. Для традиционных рабочих процессов с документами, которые сканируют квитанции только с изображениями без встроенного текста, каждый из этих шагов становится более трудоемким, что делает выделенный конвейер PDF Metadata с учетом валюты более эффективным выбором для тех, у кого ежегодно имеется более нескольких международных квитанций.

Готова к аудиту документация: что должен включать вывод вашего конвейера OCR

Успешная защита от аудита начинается за несколько месяцев или лет до получения аудиторского письма. Записи, которые вы ведете сегодня, — это то, что вы покажете одитору завтра. Хорошо спроектированный конвейер OCR выдает выходные данные, удовлетворяющие требованиям документации IRS, с минимальными дополнительными усилиями.

По каждой статье, которую вы претендуете на вычет, IRS ожидает увидеть пять частей информации: сумму, дату, место или поставщика, деловую цель и связь с вашим бизнесом, если расходы включают развлечения или обеды с другими людьми. Ваш конвейер OCR автоматически фиксирует сумму, дату и поставщика во время извлечения. Остальные поля требуют вашего ввода. Включите в свой конвейер этап проверки, на котором вы добавляете бизнес-цель и краткое описание каждой позиции перед экспортом окончательного файла, готового к уплате налогов. Этот этап проверки также является подходящим моментом для того, чтобы отметить любые расходы, которые попадают в серую зону, например, обед с клиентом, бизнес-цель которого является реальной, но документация скудна.

Проверка на основе электронных таблиц, при которой вы просматриваете извлеченные позиции в файле CSV и заполняете недостающие поля, является наиболее распространенным подходом. Для повторяющихся расходов, таких как ежемесячная подписка на программное обеспечение, вы можете установить описания бизнес-целей по умолчанию, которые будут применяться автоматически. При разовых покупках указывается краткое примечание, например «Ресурсы дизайна клиентского проекта». или «замена оргтехники»; соответствует стандарту документации. Сохраняйте исходные PDF-файлы квитанций, упорядоченные по месяцам и годам, в структуре папок, соответствующей периодам подачи налоговых деклараций. Данные, извлеченные с помощью OCR, дают вам 80 % пути к документации, готовой к аудиту. Вдумчивый шаг обзора закрывает оставшийся пробел.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →