Tips & Tricks

領収書のバッチを OCR して税関連項目のみをエクスポートする方法

納税の季節には、靴箱、電子メールの添付ファイルのフォルダー、または何か月も蓄積された紙の領収書の束が届きます。各領収書を分類し、各明細を控除可能な経費カテゴリと照合し、合計を納税準備スプレッドシートまたは会計システムに入力する必要があります。 100 枚のレシートに対してこれを手動で行うと、午後丸一日かかり、転記エラーが発生します。 OCR バッチ処理は計算を完全に変えます。

単一のレシートの光学式文字認識は、解決された問題です。実際の効率の向上は、プロセスをバッチ処理することによってもたらされます。つまり、数十または数百の領収書 PDF を OCR パイプラインにフィードし、生のテキストではなく構造化データを抽出し、税務申告に重要な項目に出力をフィルタリングすることです。 National Association of Tax Professionals による 2025 年の調査では、自動領収書処理ツールを使用した自営業の納税者は、手動で領収書を処理した納税者と比較して、課税年度ごとに平均 18 時間を節約できたことがわかりました (NATP、「納税シーズン技術調査」、2025 年)。適切な OCR PDF パイプラインは、丸 1 日かかっていた手動データ入力を 1 時間未満で完了するレビューと確認のタスクに変えます。 WukongPDF のバッチ処理機能は、混合フォーマットのレシートを、OCR 抽出に対応した一貫した高解像度の スキャン PDF 形式に初期変換する処理を行うため、各レシートが最初にどのように到着したかに関係なく、クリーンで均一な入力でパイプラインを開始できます。

How to OCR a Batch of Receipts and Export Only the Tax-Relevant Line Items

領収書 OCR と一般的な文書 OCR の違い

汎用 OCR はページ画像を取得し、テキストのブロックを生成します。領収書 OCR は、さらにいくつかのステップを行う必要があります。領収書の各明細を識別し、ベンダー名と日付を抽出し、合計を小計および税額から分離し、各明細を経費タイプごとに分類し、ロイヤルティ カードのポイント残高、返品ポリシーのテキスト、調査への招待状、および領収書に印刷されたその他の非財務コンテンツを無視する必要があります。

領収書には、一般的な文書にはない特有の課題があります。感熱紙のレシートは時間の経過とともに色あせ、コントラストが低下し、文字が見分けにくくなります。レシートは、しわになったり、折り畳まれたり、遠近感が歪むような角度で撮影されたりすることがよくあります。レシートのレイアウトは POS システムによって大きく異なり、日付、ベンダー、品目、合計がページ上に表示される場所に標準的な形式はありません。 Veryfi、Mindee、Taggun などのプロバイダーが提供する特殊なレシート OCR API は、レシート レイアウトに特化してトレーニングされており、レシート画像を対象とした一般的な OCR エンジンよりもはるかに優れたこれらのエッジ ケースを処理します。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

領収書から納税データへのパイプラインを段階的に構築する

パイプラインには、キャプチャ、OCR、抽出、エクスポートの 4 つのステージがあります。各段階では、特定の税金報告要件に一致する構成が必要です。

キャプチャ段階では、すべてのレシートを一貫した形式に変換します。紙の領収書がある場合は、グレースケールの 300 DPI でスキャンし、PDF として保存します。携帯電話でレシートの写真を撮る場合は、ネイティブのカメラ アプリではなく、Adobe Scan や Microsoft Lens などの専用のスキャン アプリを使用してください。これらのアプリは、レシートの端に合わせて自動的にトリミングし、遠近感の歪みを修正し、コントラストを強化します。領収書がベンダーから電子メールの添付ファイルとして到着した場合は、領収書を専用のフォルダーに送信する電子メール転送ルールを設定します。キャプチャ段階の最後には、すべての領収書がクリーンで読みやすい PDF または高解像度の画像として 1 つのフォルダーに保存されている必要があります。

OCR ステージでは、API またはフォルダー監視機能を介したバッチ処理をサポートするツールを選択します。すべての領収書 PDF を一度に 1 つずつ処理するのではなく、一度にアップロードします。ほとんどのレシート OCR API は、ドキュメントの ZIP ファイル、または保存されたファイルを指す URL のリストを受け入れます。生のテキストを返すのではなく、構造化フィールドを抽出するように OCR エンジンを構成します。少なくとも、ベンダー名、取引日、合計金額、税額、および個々の項目とその説明と価格をリクエストします。

抽出段階では、OCR エンジンが JSON データを返し、それを税関連コンテンツにフィルターします。領収書のすべての項目が損金算入の対象となるわけではありません。事務用品店からのレシートには、プリンター用紙などの控除対象品目と、休憩室のスナックなどの控除対象外品目の両方が含まれる場合があります。抽出段階では、経費カテゴリ (食事と娯楽、事務用品、ソフトウェアのサブスクリプション、旅行、設備など) ごとに品目を分類するルールが必要です。一部の領収書 OCR プラットフォームには、ベンダーと品目の説明に基づいた経費の分類が組み込まれています。カスタマイズされたルールの場合は、生の品目データをスプレッドシートにエクスポートし、手動またはルックアップ テーブルを通じてカテゴリ タグを適用します。

エクスポート段階では、税務作成者または税務ソフトウェアが必要とする出力が生成されます。一般的な形式には、ベンダー、日付、カテゴリ、明細項目の説明、金額、税額の列を含む CSV ファイル、または経費カテゴリごとに合計を集計した概要レポートが含まれます。 QuickBooks、Xero、または別の会計プラットフォームを使用している場合、多くの領収書 OCR ツールはそれらのプラットフォームと直接統合され、分類された明細を正しい経費勘定に自動的にプッシュします。 2025 年の Intuit 製品レポートによると、領収書の自動データ キャプチャを使用している中小企業は、未加工の領収書ファイルを会計士に納品している中小企業と比較して、年末の税務準備コストを平均 400 ドルから 600 ドル削減しました (Intuit、「QuickBooks Business Insights Report」、2025 年)。

IRS が実際に考慮する一般的な領収書のカテゴリ

IRS は事業経費をスケジュール C の特定のカテゴリにグループ化するため、項目の抽出はこれらのカテゴリに直接マッピングされる必要があります。最も一般的に監査されるカテゴリは、最も慎重な項目のレビューに値します。

IRS スケジュール C カテゴリ一般的な品目文書要件
食事(50%控除)レストランの領収書、ケータリング、クライアントとのコーヒーミーティング日程、出席者、事業目的、金額
事務用品紙、トナー、ペン、配送資材、クリーニング用品明細項目が記載された領収書
ソフトウェアとサブスクリプションSaaS ツール、クラウド ストレージ、デザイン アセット、API サービス請求期間が記載された請求書または領収書
旅行航空券、ホテル、レンタカー、走行距離、駐車場、通行料領収書と旅程またはカレンダーの記入
設備と減価償却費2,500 ドル以上のコンピューター、モニター、家具、機械領収書とサービス開始日
プロフェッショナルサービス弁護士費用、会計費用、コンサルティング、フリーランスのサポートサービス説明付きの請求書

IRS は、各事業経費が通常かつ必要なものであることを要求しています。通常の経費とは、業界で一般的で受け入れられている経費のことです。必要経費とは、ビジネスにとって有益で適切な経費のことです。領収書 OCR パイプラインから項目を抽出すると、通常の経費と必要な経費の両方として説明できない経費にフラグが付けられ、会計士が完全なリストを確認する前に再検討する機会が得られます。

複数通貨および国際的な領収書の処理

海外の顧客と仕事をしたり海外旅行をしたりする請負業者や中小企業は、複数の通貨で領収書を蓄積します。 IRS は、取引日の為替レートを使用して、すべての経費を米ドルで報告することを義務付けています。複数通貨の抽出をサポートする領収書 OCR ツールは、領収書の通貨記号または ISO コードから通貨を検出し、元の金額と通貨タイプの両方を記録できます。

通貨換算ステップは通常、OCR エンジン内ではなく、抽出後に行われます。抽出したデータをスプレッドシートにエクスポートし、取引日の為替レートの列を追加して、USD 相当額を計算します。 IRS は、定期的な小規模取引に使用できる年間平均為替レートを公開していますが、個々の大規模取引は特定の日付の日次レートで換算する必要があります。テキストが埋め込まれていない画像のみのレシート スキャンを生成する従来のドキュメント ワークフローの場合、これらの各手順はより労働集約的になるため、毎年数枚以上の国際レシートを扱う人にとっては、通貨認識を備えた専用の PDF メタデータ パイプラインがより効率的な選択肢となります。

監査対応ドキュメント: OCR パイプライン出力に含める必要があるもの

監査防御を成功させるには、監査レターが到着する数か月または数年前に開始します。今日保存した記録は、明日監査人に提示するものになります。適切に設計された OCR パイプラインは、追加の労力を最小限に抑えながら IRS の文書化要件を満たす出力を生成します。

IRS は、控除として申請する項目ごとに、金額、日付、場所またはベンダー、事業目的、および経費に接待や他人との食事が含まれる場合は事業との関係という 5 つの情報を確認することを期待しています。 OCR パイプラインは、抽出中に金額、日付、ベンダーを自動的にキャプチャします。残りのフィールドには入力が必要です。最終的な税務対応ファイルをエクスポートする前に、各項目にビジネス目的と簡単な説明を追加するレビュー ステップをパイプラインに組み込みます。この検討ステップは、事業目的は本物だが文書が薄いクライアントとの食事など、グレーゾーンに該当する経費にフラグを立てるのに適した時期でもあります。

スプレッドシート ベースのレビューでは、CSV ファイル内の抽出された行項目に目を通し、欠落しているフィールドを埋めることが最も一般的なアプローチです。毎月のソフトウェアのサブスクリプションなどの定期的な経費については、自動的に適用されるデフォルトのビジネス目的の説明を設定できます。 1 回限りの購入の場合は、「クライアント プロジェクトのデザイン アセット」などの簡単なメモが必要です。または「事務機器の交換」文書化基準を満たしています。元の領収書 PDF を月と年ごとに整理し、納税申告期間に一致するフォルダー構造に保管します。 OCR で抽出されたデータにより、監査対応の文書化への道のりの 80% が得られます。思慮深いレビュー手順により、残りのギャップが埋められます。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →