您下載 PDF 格式的銀行對帳單,打開它,然後看到整齊的日期、描述、借項、貸項和餘額列。您將 PDF 轉換為 Excel,希望這些欄位成為電子表格列。相反,您會得到一團糟:A 列中的日期,B 列中的描述片段,C 列中的更多描述,D 列中的借方和貸方金額混合在一起,而餘額則被推入 E 列中的某處。這些列未對齊,因為 PDF 將文字儲存在視覺位置中,而不是表格結構中。
從PDF 到 Excel 的銀行對帳單轉換是最需要且最有問題的文件轉換之一。 PDF 格式將銀行對帳單表視為位於頁面上的文字字元的集合。轉換器必須從這些位置對錶結構進行逆向工程,當這些位置與乾淨的網格不完全對齊時,逆向工程就會失敗。

為什麼 PDF 表格不能清楚地對應到電子表格列
在電子表格中,單元格具有明確的邊界。第 3 行 B 列中的儲存格僅包含一個值。在 PDF 中,文字放置在頁面上特定的 x 和 y 座標處。屬於 B 列的文字可能跨越一定範圍的 x 座標。轉換器必須透過查看列中大多數值的起始和結束位置來猜測列邊界,當值長度變化時,猜測通常是錯誤的。
銀行對帳單中的可變寬度列是造成錯位的主要原因。 「描述」欄位比「日期」或「金額」欄位寬得多。長描述可能會延伸到視覺上屬於下一欄的空間。轉換器必須決定長文本是屬於一列還是已經溢出到下一列,並且不同的轉換器會做出不同的決定。
多行條目使問題變得更加複雜。具有長描述的銀行交易可能會換行到第二行。在 PDF 中,這顯示為具有相同 x 位置的兩個單獨的文字物件。轉換器必須認識到這兩個文字物件屬於同一單元格,而不是新行。未能合併多行項目會在 Excel 輸出中建立虛擬行。
嘗試 PDF 轉 Excel
無需安裝。直接在您的瀏覽器中工作。
不同的轉換器如何處理表格檢測
基本轉換器使用簡單的列檢測演算法:找到文字開始的最常見的 x 位置並將其定義為列邊界。這適用於嚴格、一致的列寬的語句。對於頁面之間的列寬度不同或文字偶爾超出其列的語句,它會失敗。
高級轉換器使用根據銀行對帳單佈局進行訓練的機器學習模型。這些模型可以識別常見的模式,左邊是短日期,中間是長描述,右邊是貨幣金額,即使邊界位置不完全一致,也可以識別列。這些高級轉換器的提取 PDF 資料準確性明顯更高,但它們通常僅在付費或企業工具中可用。
WukongPDF透過瀏覽器提供PDF Converter工具來擷取表格資料。轉換處理每個頁面,識別表格結構,並將資料匯出為 Excel 格式。
手動清理未對齊的轉換輸出
轉換後,Excel 輸出幾乎總是需要一些手動清理。依應包含一致資料的欄位對電子表格進行排序,例如「日期」列。日期位於錯誤列中的行未對齊。將這些行拖曳到正確的列對齊位置。清理工作雖然繁瑣但係統化。
使用 Excel 的「文字分列」功能來分割合併的儲存格。如果儲存格同時包含以空格分隔的借方金額和貸方金額,「文字分列」可以將它們分割為單獨的欄位。根據原始銀行對帳單的一致格式定義分割點。
您定期從同一家銀行下載的報表,建立具有正確列結構的 Excel 模板,並使用它來驗證每次轉換。將轉換後的資料與範本進行比較,並標記與預期模式不符的行。模板方法可以在多次轉換嘗試中一致地捕獲錯位。
銀行資料 PDF 轉換的替代方案
除 PDF 報表外,大多數銀行還提供結構化格式的交易資料下載。 CSV、QFX 和 OFX 格式專為資料匯入而設計,不需要轉換。在轉換 PDF 對帳單之前,請檢查您的銀行是否提供結構化下載選項。結構化格式將乾淨地匯入 Excel 或會計軟體,不會出現錯位問題。
對於僅以 PDF 形式提供的銀行對帳單,請考慮使用專用的財務文件處理器而不是通用 PDF 轉換器。這些專用工具接受過財務文件佈局的培訓,並且比通用工具更準確地處理列檢測、多行合併和貨幣格式設定。
具有顏色編碼交易類型的銀行對帳單(例如貸方綠色,借方紅色)增加了 PDF 轉換的複雜性。顏色資訊是視覺的,不會影響文字定位,但分析視覺格式的轉換器可能會將顏色變化解釋為列邊界,從而在輸出中產生額外的虛擬列。
多幣種銀行對帳單會帶來額外的轉換複雜性。包含美元和歐元交易的報表可能具有不同位置或不同格式的金額欄位。轉換器可能無法識別兩組金額列屬於相同邏輯結構,從而產生比單貨幣報表更分散的 Excel 輸出。
對於相同銀行對帳單格式的重複轉換,請投入時間配置一次轉換器設定並將其儲存為預設。此預設擷取適用於您的特定報表版面配置的列偵測參數、多行合併行為和貨幣格式。隨後的每次轉換都比第一次更準確,因為該工具已根據您的資料進行了調整。
轉換並清理 Excel 輸出後,將交易計數和總金額與 PDF 原始檔案進行比較。如果 Excel 有 237 行,但 PDF 列出了 240 個事務,則轉換過程中會遺失或合併 3 個事務。尋找並手動新增缺少的交易以完成資料集。
有些銀行使用交替的行陰影格式化報表,每隔一行都有淺灰色背景。此陰影是 PDF 中的視覺格式元素。轉換為 Excel 時,底紋可能會遺失,或套用不一致。陰影的遺失不會影響資料的準確性,但會使 Excel 輸出更難以目視掃描。
包含銀行徽標和裝飾邊框等圖形元素的 PDF 報表不會影響資料轉換,但它們可能會在 Excel 輸出中顯示為雜散影像。應從 Excel 檔案中刪除這些影像以清理外觀。它們不包含可提取的資料。
對於包含多種貨幣交易的國際銀行的報表,轉換的複雜性會增加。匯率、貨幣符號和不同的小數分隔符號增加了解析挑戰。多貨幣兌換的手動驗證尤其重要。
從網路銀行入口網站產生的 PDF 報表通常基於文本,並且比掃描的紙本報表轉換更準確。如果您的銀行透過其線上入口網站提供可下載的 PDF 報表,請使用這些報表而不是掃描列印的報表。數位原件具有更清晰的文字數據,轉換更可靠。
清理 Excel 轉換後,使用 Excel 資料驗證工具檢查是否有異常。過濾報表期間以外的日期、與預期格式不符的金額以及異常短或長的描述。這些異常通常表示需要手動更正的轉換錯誤。
報表元資料中嵌入的 PDF 產生日期可用於驗證您正在轉換的報表版本是否正確。一月份下載的報表和三月下載的同一期間的報表應該是相同的。
如果轉換後的 Excel 資料將會匯入會計軟體中,請設定 Excel 欄位的格式以符合會計軟體預期的匯入格式。大多數會計軟體需要特定的列名稱和資料格式。
透過對 PDF 進行預處理以增強文字層,可以提高轉換精度。在基於文字的 PDF 上執行 OCR 會建立一個更清晰的文字圖層,轉換器可以比原始文字定位資料更準確地解析該文字圖層。
從網路銀行產生銀行對帳單 PDF 時,元資料中的 PDF 建立日期對應於下載日期,而不是對帳單日期。聲明期限在聲明內容中註明。在使用轉換後的資料進行時間敏感分析之前,請先驗證您正在使用哪個日期。
當資料可靠地匯入會計系統、在電子表格中進行分析或與財務報告工具整合時,為清理錯位的 PDF 到 Excel 轉換而付出的努力就會得到回報。
了解 PDF 到 Excel 不一致的根本原因有助於使用者選擇正確的轉換方法、應用適當的清理技術,並識別替代資料來源何時會產生比 PDF 轉換更好的結果。
當轉換產生不可接受的結果時,直接從銀行請求 CSV 等結構化格式的資料可以提供獲取可用電子表格資料的最乾淨的路徑,而不會遇到 PDF 轉換清理的麻煩。
| 轉換問題 | 原因 | 清理技術 |
|---|---|---|
| 合併儲存格 | 多行描述跨越行 | 使用文字分列或手動拆分 |
| 幻影行 | 轉換器將一筆交易分成兩筆 | 按日期排序;合併重複行 |
| 缺少交易 | OCR 漏掉一行或轉換器跳過 | 計算行數與 PDF 原始文件的行數;手動添加 |
| 未對齊的列 | 可變寬度描述列 | 將未對齊的儲存格拖曳到正確的列中 |
嘗試 PDF 轉 Excel
無需安裝。直接在您的瀏覽器中工作。
