Tips & Tricks

PDF 請求書から数値と合計のみを Excel スプレッドシートに抽出する方法

クライアントは 47 項目の PDF 請求書を電子メールで送信します。会計ソフトウェアの Excel スプレッドシートに合計が必要です。請求書はスキャンした画像なので、番号を選択してコピーするだけでは済みません。すべての行を手動で再入力することもできますが、これには 15 分かかり、少なくとも 1 つの入力エラーが発生します。あるいは、データを自動的に抽出して、2 分以内にクリーンなスプレッドシートを作成することもできます。

PDF 請求書および財務書類を Excel に変換することは、エラーが発生しやすい手動データ入力を自動抽出に置き換えるため、PDF から Excel への最も価値の高いユースケースの 1 つです。このテクノロジーは、品目、数量、単価、合計を含む、明確な表レイアウトを備えた適切に構造化された請求書が確実に変換されるまでに成熟しました。

How to Extract Only the Numbers and Totals From a PDF Invoice Into an Excel Spreadsheet

請求書がデータ抽出の準備ができているかどうかを確認する

抽出を試みる前に、PDF の種類を確認してください。クリックしてドラッグして、請求書の番号を選択してみてください。個々の番号を選択してコピーできる場合、PDF には実際のテキスト データが含まれています。抽出は簡単になります。クリックしてページ全体を 1 つのブロックとして選択するか、何も選択しない場合、請求書はスキャンされた画像になります。抽出には最初のステップとして OCR が必要ですが、精度は低くなりますが、それでも手動入力よりもはるかに高速です。

請求書のレイアウトを確認してください。明確な列ヘッダー、説明、数量、単価、合計、品目ごとに 1 行を含む単純なテーブルは、ほぼ完璧な精度で変換されます。結合されたセル、複数行の説明、品目がちりばめられた小計、または複数の列にまたがる割引行を含む請求書は、表検出アルゴリズムが不規則な行と列のパターンに対処するのに苦労するため、変換があまりきれいに行われません。テーブル構造が規則的であればあるほど、抽出結果はより良くなります。

WukongPDF

PDFをExcelに変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

ステップバイステップ: 請求書データを Excel に抽出する

請求書がテキストベースの PDF である場合、PDF-to-Excel ツールは抽出を直接処理します。 PDFをアップロードします。出力形式として Excel を選択します。このツールはページ レイアウトを分析し、テーブル構造を検出し、データを .xlsx ファイルにエクスポートします。結果のスプレッドシートを開きます。品目は、元の請求書の各列を含む行で、別の Excel 列に表示されます。請求書の列ヘッダーは最初の行として表示されます。

請求書がスキャンされた画像である場合は、最初に OCR ツールを使用して OCR を実行します。 OCR プロセスにより、スキャンされたページにテキスト レイヤーが追加されます。次に、OCR 処理されたファイルに対して PDF から Excel への変換を実行します。この 2 段階のワークフローは、実際の最も一般的なシナリオ、つまり印刷、署名され、スキャンされてコンピューターに取り込まれた PDF 請求書を処理します。 OCR ステップではテキストを認識します。 Excel 変換ステップでは、それをスプレッドシートに抽出します。

抽出されたデータのクリーンアップ

抽出後は、クリーンアップを行う必要があります。最も一般的な問題は、テキストとして認識された数値、単一のテキスト フィールドに数値と結合された通貨記号、一貫性のない形式の日付、Excel が数値として認識しない括弧または末尾のマイナス記号で表される負の値です。

「$1,234.56」などのテキストとして保存された通貨値の場合、 Excel が文字列として扱うセルでは、Excel の VALUE 関数を SUBSTITUTE とともに使用して、ドル記号とカンマを削除します: =VALUE(SUBSTITUTE(SUBSTITUTE(SUBSTITUTE(A1,"$",""),",",""))。これにより、テキストが合計や計算が可能な数値に変換されます。列全体の場合は、最初の行に数式を適用し、下にドラッグします。日付の場合は、DATEVALUE 関数を使用するか、日付形式を指定して Excel のテキストを列に変換ウィザードを使用します。これらのクリーンアップ手順にはスプレッドシートごとに数分かかり、静的 PDF として開始されたものから完全に機能する Excel ファイルが生成されます。

抽出された合計金額を元の請求書と照合する

クリーンアップ後、抽出されたデータを元の請求書と照合して検証します。 Excel で品目の合計を合計し、その合計を請求書の合計と比較します。数値が一致する場合、少なくとも金額に関しては抽出は正確でした。元の請求書をスプレッドシートの対応する行と比較して、いくつかの個別の項目を抜き取りチェックします。最初の項目、真ん中の項目、最後の項目にチェックを入れます。これらが一致する場合、抽出は信頼できます。

合計が一致しない場合は、スプレッドシートをスキャンして、抽出によって間違った列にデータが配置された行を探します。よくあるエラーは、「ウィジェット モデル 3、5 個パック」などの番号を含む項目の説明です。ここで、抽出エンジンは「3」を解釈しました。数量として「5」を指定します。単価として設定し、ファントム広告申込情報を作成します。これらの抽出アーティファクトは、無意味なデータ行を生成するため、簡単に発見できます。成果物の行を削除し、合計を再計算します。合計は正しい値に収束するはずです。

複数ページの請求書および請求書のバッチの処理

複数ページにわたる 1 つの請求書の場合は、1 回の操作ですべてのページを変換します。 WukongPDF はすべてのページを処理し、結合されたデータを 1 つのスプレッドシートにエクスポートします。各ページに独自のテーブルがある場合、テーブルはスプレッドシート内で垂直方向に積み重ねられ、間に空白行またはヘッダー行が配置されます。重複したヘッダーを削除し、データ行を結合してテーブルを統合します。

複数の請求書のバッチ (おそらく 1 か月分の仕入先請求書) の場合、各請求書を個別に処理し、結果をマスター スプレッドシートに統合します。ベンダー、請求書番号、日付、品目説明、数量、単価、合計の列を含むテンプレートを作成します。各請求書から抽出したデータをテンプレートにコピーします。この構造化されたアプローチにより、すべての請求書の検索、並べ替えが可能で、すぐに計算式に対応できるレコードが生成されます。 PDF データの抽出 ツールは、1 つのセッションで複数の請求書をバッチ処理するPDF Converter をサポートし、マスター テンプレートにすばやく統合できる請求書ごとに個別のスプレッドシートを生成します。手動データ入力と比較して節約される時間は、請求書の数に比例して増加します。 1 つの請求書で 10 分短縮されます。請求書が 100 件あれば、勤務日全体が節約されます。

定期的な請求書処理の実践的な詳細: 同じベンダーから毎月請求書を受け取る場合は、そのベンダーの請求書レイアウトの数式と列マッピングが事前に構成された Excel テンプレートを作成します。そのベンダーから初めて請求書を抽出するときは、Excel のどの列がどの請求書のフィールドに対応しているかをメモしてください。品目合計の SUM 式、合計を請求書の合計と照合する検証式、不一致を強調表示する条件付き書式を設定します。これをベンダー固有のテンプレートとして保存します。来月、新しい請求書を抽出するときに、データをテンプレートに貼り付けると、数式と書式設定がすでに設定されています。このテンプレート アプローチにより、1 年間にわたる毎月の請求書に繰り返しかかる設定作業が何時間も節約され、手動再入力による計算式エラーのリスクが事実上排除されます。数十の定期仕入先からの請求書を処理している組織では、仕入先固有のテンプレートのフォルダーを使用すると、請求書データの抽出が毎週の作業から貼り付けて確認する操作に変わります。

WukongPDF

PDFをExcelに変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →