您將 PDF 表格轉換為 Excel,打開結果,然後盯著電子表格,其中應該包含數字的空白單元格。原始 PDF 顯然在這些位置有數據。您可以在螢幕上看到它。但 Excel 檔案有間隙、缺失值或整行縮減為空白。這是 PDF 到 Excel 轉換過程中最令人沮喪的結果之一,因為問題出在哪裡或如何修復並不明顯。
根本原因通常不是轉換工具本身。 PDF 儲存表格資料的方式與轉換引擎所期望找到的內容不符。了解空白單元格的具體原因可以使問題變得可解決而不是神秘。

PDF 包含表格影像,而非實際表格資料
這是 PDF 到 Excel 轉換後出現空白儲存格最常見的原因。如果 PDF 是透過掃描、螢幕截圖或從光柵化其輸出的應用程式列印到 PDF 來建立的,則您在頁面上看到的表格是平面圖像。沒有底層資料單元,沒有行和列結構,也沒有轉換工具可以解析的文字流。
當轉換工具遇到基於圖像的表格時,它有兩種選擇:運行 OCR 來嘗試識別文字並重建表格結構,或者完全跳過圖像,因為它無法解析圖像。許多基本的PDF 到 Excel 轉換器都採取第二條路徑。他們提取他們能找到的真實數據,並留下基於圖像的內容。結果是一個電子表格,表格影像所在的位置有空白儲存格。解決方法是使用包含 OCR 的PDF 轉換器,如WukongPDF,它可以識別影像中的文字並重建表格網格。轉換不會是像素完美的,但資料將出現在單元格中,而不是消失在空白區域中。
嘗試 PDF 轉 Excel
無需安裝。直接在您的瀏覽器中工作。
表格佈局使用複雜的合併或嵌套單元格
即使表格由真實的文字資料組成,原始應用程式的結構方式也可能擊敗轉換引擎。 Microsoft Excel、Google Sheets 和報表軟體等應用程式通常會建立具有合併儲存格的表格(其中單一標題跨越多個欄位)、巢狀表格(其中一個儲存格內部包含另一個迷你表格)或具有父子列分組的多層標題。
PDF 並不是為表示表格結構而設計的。它旨在將字元放置在頁面上特定的 x,y 座標處。 PDF 將表格儲存為數千個獨立的字元定位命令。轉換引擎必須透過分析這些字元的空間排列來對錶結構進行逆向工程。合併的單元使這種分析變得非常複雜。對於人類讀者來說看起來像一個邏輯單元的內容在轉換引擎看來就像跨越一個模糊區域的文本,該區域可能是一個寬單元或幾個窄單元。當引擎猜測錯誤時,資料最終會出現在錯誤的列中、跨單元格分割或因引擎無法解決歧義而被省略。
對此沒有完美的通用修復方法,因為當文件轉換為 PDF 時,原始表格結構丟失了。如果您有權存取原始文件,直接從 Excel 或 Google Sheets 匯出為 .xlsx 格式,而不是 PDF 到 Excel 轉換,可以完美保留表格結構。如果 PDF 是您唯一的副本,那麼具有進階表格偵測功能的轉換工具(可讓您手動定義列邊界或調整偵測到的表格區域)為您提供乾淨復原資料的最佳機會。
分隔符資訊不一致或缺失
轉換引擎透過分析字元組之間的水平間隙來偵測列邊界。如果兩列非常接近,引擎可能會將它們合併為一列。如果列包含文字量差異很大的儲存格,則引擎可能會在窄點處將該列拆分為多個列。這兩個錯誤都會產生空白單元格,要么是因為本應填充兩個單獨列的資料被塞進了一列,使另一列為空,要么是因為虛擬列中斷創建了不存在資料的單元格。
原始文件中帶有空白單元格的表格會導致此問題的一個特別棘手的變體。如果原始表故意包含空單元格,則轉換引擎會看到更大的間隙,並可能會移動其列邊界檢測,從而使間隙下方的每一行錯位。第 3 行中的單一空白單元格可能會破壞第 4 行到第 50 行的整個列映射,從而產生一系列未對齊的數據,這些數據看起來像是轉換失敗,但實際上是源文件中的結構模糊。
如何在下次轉換時最大限度地減少空白單元
一些實際的調整可以顯著提高您的轉換成功率。首先,始終使用支援表結構檢測的工具,而不是通用的 PDF 到文字轉換器。專為提取 PDF 資料設計的工具使用在表格佈局上訓練的演算法,並產生比通用文字提取更好的結果。 WukongPDF 的 PDF 到 Excel 轉換包括表格結構偵測,可處理常見版面配置,包括合併儲存格、多層標題和具有混合資料類型的表格。
其次,在轉換之前檢查 PDF。如果您可以使用 PDF 檢視器從表格中選取並複製單一儲存格或文字列,則該表格由真實文字資料組成,並且轉換效果相當好。如果單擊表格,整個內容突出顯示為單一區塊,或者文字選擇根本不起作用,則表格是圖像,需要基於 OCR 的轉換。
第三,準備好清理輸出。即使是最好的轉換工具也會產生需要一些手動調整的電子表格。檢查每列的前幾行以驗證值是否位於正確的列中。當您可以在原始 PDF 中的該位置看到資料時,請尋找完全空白的欄位。這些跡象表明該工具錯誤識別了列邊界。修復前幾行中的列映射通常會在電子表格的其餘部分中進行級聯更正。
當轉換持續產生空白儲存格時該怎麼辦
如果您嘗試了多種工具,並且轉換過程始終在特定位置產生空白儲存格,則問題可能出在 PDF 本身,而不是工具。表格資料可以儲存為向量圖形,其中數字被繪製為形狀而不是編碼為文字字元。這種情況最常發生在由較舊的 CAD 軟體、專用報告工具或某些透過圖形繪製命令而不是文字放置將輸出呈現為 PDF 的企業資源規劃系統產生的 PDF 中。在這些情況下,OCR 是唯一的選擇,您應該手動檢查和更正輸出,因為向量繪製表格資料的 OCR 本質上容易出錯。
當自動轉換反覆失敗時,最有效的後備方法是以高解析度截取表格的螢幕截圖,透過專門用於表格識別的專用 OCR 工具運行它,然後匯出到 Excel。這個兩步驟過程(螢幕截圖然後 OCR)完全繞過 PDF 的內部資料表示,並將表格視為純圖像,諷刺的是,對於某些類型的格式錯誤的 PDF,這比嘗試解析損壞或非標準的文字資料更可靠。
嘗試 PDF 轉 Excel
無需安裝。直接在您的瀏覽器中工作。
