銀行取引明細書を PDF としてダウンロードして開くと、日付、説明、借方、貸方、および残高の整然とした列が表示されます。これらの列がスプレッドシートの列になることを期待して PDF を Excel に変換します。代わりに、列 A に日付、列 B に説明の断片、列 C に追加の説明、列 D に借方と貸方の金額が一緒にまとめられ、残高が列 E のどこかに押し込まれた、混乱が生じます。PDF は表構造ではなく視覚的な位置にテキストを格納しているため、列の位置がずれています。
PDF から Excel への銀行取引明細書の変換は、最もリクエストが多く、最も問題が多い文書変換の 1 つです。 PDF 形式では、銀行取引明細書表をページ上に配置されたテキスト文字の集合として扱います。コンバーターはこれらの位置からテーブル構造をリバース エンジニアリングする必要がありますが、位置がきれいなグリッドに完全に整列していない場合、リバース エンジニアリングは失敗します。

PDF テーブルがスプレッドシート列に適切にマッピングされない理由
スプレッドシートでは、セルには明示的な境界があります。行 3、列 B のセルには値が 1 つだけ含まれています。 PDF では、テキストはページ上の特定の x 座標と y 座標に配置されます。列 B のように見える部分に属するテキストは、x 座標の範囲にわたる可能性があります。コンバーターは、列内のほとんどの値の開始位置と終了位置を確認して列の境界を推測する必要がありますが、値の長さが異なる場合、推測が間違っていることがよくあります。
銀行取引明細書の可変幅列は、位置ずれの主な原因です。 「説明」列は、「日付」列や「金額」列よりもはるかに幅が広くなります。長い説明は、視覚的に次の列に属するスペースにまで及ぶ場合があります。コンバーターは、長いテキストが 1 つの列に属しているのか、それとも次の列にはみ出しているのかを判断する必要があり、コンバーターが異なれば決定も異なります。
複数行のエントリがあると、問題がさらに複雑になります。長い説明を持つ銀行取引は 2 行目に折り返される場合があります。 PDF では、これは同じ x 位置を持つ 2 つの別々のテキスト オブジェクトとして表示されます。コンバータは、これら 2 つのテキスト オブジェクトが新しい行ではなく同じセルに属していることを認識する必要があります。複数行のエントリをマージしないと、Excel 出力にファントム行が作成されます。
PDFをExcelに変換してみる
インストールは必要ありません。ブラウザで直接動作します。
さまざまなコンバーターによるテーブル検出の処理方法
基本コンバータは単純な列検出アルゴリズムを使用します。つまり、テキストが始まる最も一般的な x 位置を見つけて、それらを列境界として定義します。これは、厳格で一貫した列幅を持つステートメントに対して機能します。ページ間で列の幅が異なるステートメントや、テキストが列を超えて拡張される場合があるステートメントでは失敗します。
高度なコンバーターは、銀行取引明細書レイアウトでトレーニングされた機械学習モデルを使用します。これらのモデルは、左側の短い日付、中央の長い説明、右側の通貨金額という一般的なパターンを認識し、境界位置が完全に一致していない場合でも列を識別できます。これらの高度なコンバーターのPDF データの抽出 の精度は大幅に高くなりますが、通常は有料ツールまたはエンタープライズ ツールでのみ利用できます。
WukongPDF は、ブラウザを通じて表形式データを抽出するための PDF Converter ツールを提供します。変換では各ページが処理され、テーブル構造が特定され、データが Excel 形式にエクスポートされます。
位置ずれした変換出力の手動クリーンアップ
変換後、ほとんどの場合、Excel 出力は手動でクリーンアップする必要があります。日付列など、一貫したデータが含まれる列でスプレッドシートを並べ替えます。間違った列に日付が含まれている行は位置がずれています。これらの行を正しい列位置にドラッグします。クリーンアップは面倒ですが体系的です。
Excel の Text to Columns 機能を使用して、結合されたセルを分割します。セルに借方金額と貸方金額の両方がスペースで区切られて含まれている場合、テキストを列に分割すると、それらの金額が別々の列に分割されます。元の銀行取引明細書の一貫した形式に基づいて分割ポイントを定義します。
同じ銀行から定期的にダウンロードする取引明細書を、正しい列構造を持つ Excel テンプレートを作成し、それを使用して各変換を検証します。変換されたデータをテンプレートと比較し、予想されるパターンと一致しない行にフラグを立てます。テンプレートのアプローチは、複数の変換試行にわたって一貫して不整合を検出します。
銀行データの PDF 変換の代替手段
ほとんどの銀行は、PDF 明細書に加えて、構造化フォーマットでの取引データのダウンロードを提供しています。 CSV、QFX、および OFX 形式はデータのインポート用に設計されており、変換する必要はありません。 PDF 明細書を変換する前に、銀行が構造化されたダウンロード オプションを提供しているかどうかを確認してください。構造化フォーマットは、ずれの問題なく Excel または会計ソフトウェアにきれいにインポートされます。
PDF としてのみ利用できる銀行取引明細書については、汎用の PDF コンバーターではなく、専用の財務文書プロセッサーの使用を検討してください。これらの特殊なツールは財務文書のレイアウトでトレーニングされており、列の検出、複数行の結合、通貨の書式設定を汎用ツールよりも正確に処理します。
銀行取引明細書では、クレジットは緑、借方は赤など、取引タイプが色分けされているため、PDF 変換がさらに複雑になります。色の情報は視覚的なものであり、テキストの位置には影響しませんが、視覚的な書式設定を分析するコンバーターは色の変化を列境界として解釈し、出力に追加のファントム列を生成する可能性があります。
複数通貨の銀行取引明細書では、換算がさらに複雑になります。 USD と EUR の両方での取引を含む明細書には、異なる位置または異なる書式設定の金額列が含まれる場合があります。コンバーターは、2 セットの金額列が同じ論理構造に属していることを認識しない可能性があり、単一通貨ステートメントよりも断片化された Excel 出力が生成されます。
同じ銀行取引明細書の形式を定期的に変換する場合は、時間をかけてコンバータ設定を 1 回構成し、プリセットとして保存します。このプリセットは、特定のステートメント レイアウトで機能する列検出パラメーター、複数行の結合動作、および通貨の書式設定をキャプチャします。ツールがデータに合わせて調整されているため、後続の各変換は最初の変換よりも正確になります。
Excel 出力を変換してクリーンアップした後、トランザクション数と合計金額を PDF のオリジナルと比較します。 Excel には 237 行があり、PDF には 240 のトランザクションがリストされている場合、変換中に 3 つのトランザクションが失われたかマージされました。不足しているトランザクションを見つけて手動で追加し、データセットを完成させます。
一部の銀行では明細書を交互の行の網掛けでフォーマットしており、1 行おきに明るい灰色の背景が付いています。このシェーディングは、PDF の視覚的な書式設定要素です。 Excelに変換するとシェーディングが消えたり、適用が不均一になる場合があります。シェーディングの喪失はデータの精度には影響しませんが、Excel 出力を視覚的にスキャンすることが困難になります。
銀行のロゴや飾り枠などのグラフィック要素を含む PDF ステートメントはデータ変換には影響しませんが、Excel 出力では不明瞭な画像として表示される可能性があります。見た目をきれいにするために、これらの画像を Excel ファイルから削除する必要があります。抽出可能なデータは含まれません。
複数の通貨での取引を含む国際銀行の明細書では、変換の複雑さが増加します。為替レート、通貨記号、およびさまざまな小数点区切り文字により、解析がさらに難しくなります。複数通貨換算の手動検証は特に重要です。
オンライン バンキング ポータルから生成される PDF 明細書は通常テキストベースであり、スキャンした紙の明細書よりも正確に変換されます。銀行がオンライン ポータルを通じてダウンロード可能な PDF 明細書を提供している場合は、印刷された明細書をスキャンするのではなく、それらを使用してください。デジタル オリジナルには、より確実に変換される、よりクリーンなテキスト データが含まれています。
Excel 変換をクリーンアップした後、Excel データ検証ツールを使用して異常がないかチェックします。明細期間外の日付、予期される形式と一致しない金額、異常に短いまたは長い説明をフィルターします。これらの異常は、多くの場合、手動による修正が必要な変換エラーを示します。
ステートメントのメタデータに埋め込まれた PDF 生成日は、正しいバージョンのステートメントを変換していることを確認するのに役立ちます。同じ期間の 1 月にダウンロードされた明細書と 3 月にダウンロードされた明細書は同一である必要があります。
変換された Excel データを会計ソフトウェアにインポートする場合は、会計ソフトウェアが期待するインポート形式と一致するように Excel 列を書式設定します。ほとんどの会計ソフトウェアでは、特定の列名とデータ形式が必要です。
PDF を前処理してテキスト レイヤーを強化することで、変換精度を向上させることができます。テキストベースの PDF で OCR を実行すると、コンバーターが元のテキスト位置データよりも正確に解析できるクリーンなテキスト レイヤーが作成されます。
銀行取引明細書 PDF がオンライン バンキングから生成される場合、メタデータ内の PDF 作成日は取引明細書日付ではなく、ダウンロード日に対応します。発言期間は発言内容内に記載しております。変換されたデータを時間に依存する分析に使用する前に、どの日付を使用しているかを確認してください。
ずれた PDF から Excel への変換をクリーンアップするために費やした労力は、データが会計システムに確実にインポートされたり、スプレッドシートで分析されたり、財務報告ツールと統合されたりするときに報われます。
PDF から Excel への位置ずれの根本原因を理解することは、ユーザーが適切な変換アプローチを選択し、適切なクリーンアップ手法を適用し、代替データ ソースが PDF 変換よりも優れた結果を生み出す時期を認識するのに役立ちます。
変換により許容できない結果が生じた場合、CSV などの構造化フォーマットでデータを銀行に直接リクエストすると、PDF 変換のクリーンアップでイライラすることなく、使用可能なスプレッドシート データへの最もクリーンなパスが提供されます。
| 変換の問題 | 原因 | クリーンアップテクニック |
|---|---|---|
| 結合されたセル | 複数行の説明が行にまたがる | テキストから列への変換または手動分割を使用する |
| 幻の列 | コンバーターは 1 つのトランザクションを 2 つに分割します | 日付順に並べ替えます。重複した行を結合する |
| トランザクションの欠落 | OCR が行を欠落したかコンバータがスキップされました | 行数と元の PDF の比較。手動で追加する |
| 列の位置がずれている | 可変幅の説明列 | 位置がずれているセルを正しい列にドラッグします |
PDFをExcelに変換してみる
インストールは必要ありません。ブラウザで直接動作します。
