Others

您可以將 PDF 表格資料排序到單獨的 Excel 工作表嗎

當您將 PDF 中的表格資料提取到 Excel 中時,行會按照它們在頁面上出現的順序到達。如果您需要將這些行按類別分類到單獨的工作表中,例如按地區分組的銷售記錄或按供應商分組的發票,則手動剪切和粘貼方法適用於十行,但對於數百行則變得不切實際。問題是PDF到Excel轉換工具是否可以在提取過程中自動對資料進行排序和分類,或者是否需要在資料到達Excel後處理排序。

要點

標準 PDF 到 Excel 轉換不會對資料進行排序或分類。它按頁面順序提取行並將它們放置在單一工作表中。以類別值自動分類為單獨的工作表需要轉換後 Excel 巨集、Power Query 轉換或具有內建分類邏輯的進階擷取工具。最佳方法取決於分類是一次性任務還是重複工作流程。

Can You Sort PDF Table Data Into Separate Excel Worksheets

標準 PDF 到 Excel 轉換可以做什麼和不能做什麼

標準轉換工具讀取 PDF 頁面的視覺佈局,透過偵測網格線和對齊的文字區塊來識別表格結構,並將偵測到的儲存格對應到 Excel 儲存格。輸出保留原始表的行順序和列結構。這是PDF的忠實複製,但不是資料處理。該工具不會讀取單元格的內容來理解資料的含義。包含“West”的行是在“地區”列和包含“東部”的行中被相同地提取。該工具沒有機制來檢測這些行是否屬於不同的類別。

一些高級提取 PDF 資料工具不僅限於視覺提取,還應用模式識別來識別表中的類別欄位。這些工具可以配置有這樣的規則:實際上,「掃描提取的資料的C列,識別該列中的唯一值,並為每個唯一值建立單獨的輸出。」這不是標準的 PDF 轉換。它是一種專門的資料提取功能,位於 OCR、表格識別和資料轉換的交叉點。如果您的工作流程需要這樣做,請尋找在其功能清單中明確宣傳資料分類或資料分組的工具。

WukongPDF

嘗試 PDF 轉 Excel

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

使用 Excel 巨集和 Power Query 進行轉換後排序

對於喜歡完全避免巨集和 Power Query 的使用者來說,Excel 的內建篩選和排序功能與手動工作表建立相結合是處理中等大小資料集的有效方法。將篩選器套用於類別列,一次選擇一個類別值,複製篩選後的行,然後將其貼上到新工作表中。對於具有 5 個類別和 200 行的資料集,此手動方法大約需要 5 分鐘,並且除了基本的 Excel 導航之外不需要任何設定或技術知識。

應用最廣泛的方法是將整個 PDF 表格轉換為單一 Excel 工作表,然後使用 Excel 的內建工具對資料進行排序和分割。一個簡單的 VBA 巨集可以讀取指定列中的唯一值,為每個唯一值建立一個新工作表,並將符合的行複製到對應的工作表中。該巨集只需不到一分鐘的時間即可在具有數千行的資料集上運行,並完全按照指定執行分類,而不會出現自動模式識別的歧義。

Power Query 為熟悉 Excel 資料轉換工具的使用者提供了一種無巨集的替代方案。透過「資料」標籤將轉換後的資料載入到 Power Query 中。使用分組依據功能按類別聚合行,或篩選每個類別值的資料並將每個篩選結果載入到單獨的工作表中。 Power Query 轉換是可重複的:儲存查詢,下次轉換類似結構的 PDF 時,刷新查詢以將相同的排序邏輯套用至新資料。對於重複工作流程,Power Query 比 VBA 巨集更容易維護,因為轉換步驟在查詢編輯器中可見,且無需閱讀程式碼即可進行調整。

設定重複 PDF 匯入的自動分類

在為定期 PDF 匯入建置 Power Query 轉換時,請使用 PDF 檔案名稱作為查詢參數,以便相同的查詢適用於新檔案而無需修改。在 Power Query 編輯器中,建立一個名為 FilePath 的參數並在資料來源步驟中引用它。每次收到新的 PDF 時,請更新 FilePath 參數以指向新檔案並刷新。整個轉換(包括基於類別的排序和工作表分割)會在新資料上自動執行。

如果您定期收到類似結構的 PDF 表格,例如每週銷售報告或每月發票批次,請投入時間設定可重複的工作流程。首先將一份代表性 PDF 轉換為 Excel。開啟 Power Query 並記錄轉換,該轉換可根據您的需求精確篩選、排序和分割資料。儲存查詢。對於後續 PDF,請轉換為 Excel、開啟工作簿並重新整理查詢。查詢到位後,從 PDF 到達到分類 Excel 資料的整個過程只需不到兩分鐘。

對於每天涉及數十個 PDF 的大容量工作流程,請考慮使用專用的資料擷取平台,透過 API 將 PDF 轉換連接到電子表格輸出。這些平台可讓您定義提取模板,指定哪些列包含類別資料以及如何拆分輸出。此範本配置一次並自動套用於每個傳入的 PDF。具有此功能的平台包括企業文件處理服務和一些基於雲端的 PDF API 提供者。 WukongPDF 的 PDF 到 Excel 轉換可產生乾淨、結構化的表格輸出,可用於 Power Query 轉換,並具有一致的列映射,使跨批次的相似文件的自動分類變得可靠。

當手動分類仍然是最佳選擇

當自動化處理常規情況而手動審核處理邊緣情況時,混合工作流程會非常有效。設定 Power Query 以自動將類別列包含標準值的行排序到指定的工作表中。任何具有非標準或空白類別值的行都會路由到「審核」工作表,人們可以在其中確定正確的分類。這種方法可以最大限度地提高自動化覆蓋範圍,而無需強迫系統對不明確的數據進行猜測。

自動化並不總是正確的答案。如果您收到少量 PDF,其表格的結構各不相同,則配置巨集或 Power Query 所花費的時間可能會超過手動對資料進行排序所需的時間。對於少於 50 行的一次性任務,選擇每個類別的行並將其剪下並貼上到新工作表中需要幾分鐘,並且不需要任何設定。損益平衡點通常是同一文檔結構出現三次左右。如果您將對同一類型的 PDF 執行相同的分類三次或多次,那麼自動化就會帶來回報。

當類別邏輯需要人類判斷時,手動分類也有意義。具有諸如“West”之類的值的“Region”列“東方”,和“中央”對於自動分割來說很簡單。註釋列的類別是由文字描述的內容暗示的,例如根據措辭而不是標準化代碼區分緊急和非緊急項目,需要人類讀者。沒有任何自動化工具可以根據細緻入微的非結構化文字可靠地對資料進行分類。在這些情況下,請將所有資料提取到一張表中並手動對其進行分類。

常見問題

如果 PDF 表格跨越多個頁面且標題行重複,該怎麼辦?當標題行在每頁上重複時,大多數 PDF 到 Excel 轉換器都會將其視為資料。轉換後,您會發現標題文字在每個分頁符號處散佈著資料行。使用 Excel 的篩選器選取並刪除第一列包含標題文字的所有行。在執行任何排序或分類之前,必須執行此清理步驟,因為標題行可能會被錯誤分類為資料。

我可以將 PDF 表格資料拆分為單獨的 Excel 檔案而不是單獨的工作表嗎?

是的。 VBA 巨集和 Power Query 都可以將每個類別的資料儲存到單獨的 Excel 工作簿,而不是同一工作簿中的單獨工作表。在 VBA 中,使用 Workbooks.Add 和 SaveAs 方法。在 Power Query 中,將每個篩選結果載入到單獨的連接,並將每個連接匯出到自己的檔案。工作表和工作簿之間的選擇取決於資料的分佈方式。如果每個類別的資料交給不同的人,則單獨的工作簿會更乾淨。

如果 PDF 表格合併了跨多個類別的儲存格怎麼辦?

合併單元格是自動分類的已知問題。一個 PDF 表格,其中 Region 列使用合併儲存格將多行標記為「West」將提取僅出現在群組的第一行中的標籤。在排序之前,請填寫類別列,以便每一行都有一個類別值。在 Excel 中,選取列,按 Ctrl+G,按一下特殊,選取空白,鍵入 = 並按向上箭頭,然後按 Ctrl+Enter。這將使用上面儲存格中的值填入所有空白儲存格。

OCR 準確度是否會影響基於類別的排序?

是的,顯著。如果 OCR 誤讀“West”作為“西”或“VVest”,則這些值在排序輸出中成為單獨的類別。轉換後和排序前,請務必檢查類別列中的唯一值。快速掃描類別列的資料透視表會立即發現 OCR 錯誤。在運行分類之前,手動或使用查找和替換過程來修正錯誤。

WukongPDF

嘗試 PDF 轉 Excel

無需安裝。直接在您的瀏覽器中工作。

立即開始 →