您對 PDF 進行 OCR 識別,識別出的文字將顯示在 PDF 編輯器內的文字方塊中。你可以閱讀它。您可以複製並貼上它。但您真正想要的是 Markdown 文件中的文本,標題格式為散列,列表為星號,鏈接為方括號對,段落由空行分隔。 Markdown 是開發人員、技術作家、部落客以及任何需要乾淨、可移植文字的人的通用語言,這些文字可以放入靜態網站產生器、筆記應用程式或程式碼儲存庫中。
從掃描的 PDF 到 Markdown 文件的流程分為兩步:OCR 識別文本,然後格式化步驟將識別的文本轉換為 Markdown 語法。每個步驟都有影響最終輸出品質的工具選擇。

步驟 1:OCR PDF 以提取識別的文本
OCR 步驟與使任何 PDF 可搜尋相同。使用OCR PDF工具處理掃描的頁面。該工具會為每個頁面新增一個文字圖層。對於 Markdown 匯出,您希望 OCR 輸出的格式能夠保留盡可能多的結構資訊:哪些文字是標題,哪些文字是正文,哪些文字是清單或表格的一部分。標準 OCR 引擎輸出純文本,這會遺失所有結構資訊。標題和正文段落成為由換行符號分隔的不可區分的文字區塊。
為獲得最佳結果,請使用支援佈局感知文字擷取的 OCR 引擎。這些引擎分析頁面上文字的空間排列,並可以根據字體大小、位置和與其他元素的接近程度來區分標題、正文、說明文字和腳註。 OCR 引擎捕捉的結構資訊越多,Markdown 轉換就越乾淨。 Adobe Acrobat Pro 的匯出至功能包括「帶格式的文字」功能。保留一些結構線索的選項。 OCR 引擎保留字體大小和位置元數據,下游轉換工具可以使用這些元數據來推斷標題層級和段落分隔符號。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
步驟2:將識別的文本轉換為Markdown
一旦 PDF 具有文字圖層,就可以透過多種路徑進行到 Markdown 的轉換。最簡單的是從支援 Markdown 作為輸出格式的 PDF 編輯器直接匯出。當 PDF 經過 OCR 處理時,WukongPDF 的匯出選項包括 Markdown 作為目標格式。選擇 Markdown 作為輸出格式,工具會產生一個 .md 文件,其中識別的文字根據 Markdown 約定進行格式化:以較大字體開頭的行成為雜湊前綴標題,縮排的行成為列表項,常規段落由空白行分隔。
如果直接 Markdown 匯出不可用,則管道是:將識別的文字匯出為保留格式的富文本格式(例如 RTF 或 HTML),然後使用轉換工具將該中間格式轉換為 Markdown。 Pandoc,通用文件轉換器,可以很好地處理這個管道。將 PDF 中的文字匯出為 HTML,然後執行:pandoc input.html -f html -t markdown -o output.md。 Pandoc 將 HTML 標題標籤翻譯為 Markdown 雜湊,將 HTML 清單標籤翻譯為 Markdown 清單標記,將 HTML 連結標籤翻譯為 Markdown 連結語法。輸出的品質取決於從 PDF 匯出的 HTML 的品質。如果 PDF 匯出產生乾淨、結構良好的 HTML,則 Pandoc 會產生乾淨的 Markdown。如果匯出產生帶有內聯樣式和非語意標籤的混亂 HTML,則 Markdown 也會相應地混亂。
清除 Markdown 輸出中的 OCR 錯誤
已辨識文字中的 OCR 錯誤會原封不動地傳遞到 Markdown 輸出。常見錯誤包括混淆字符,例如“cl”和“cl”。被識別為“d”, “rn”被識別為“m”,和“1”被識別為“l”,尤其是在較小的字體大小或較低品質的掃描中。如果要發布或共享文本,則必須對 Markdown 文件進行審查以發現這些錯誤。
大多數程式碼編輯器和 Markdown 編輯器都包含拼字檢查功能,可以突出顯示無法識別的單詞,從而使 OCR 錯誤易於發現。處理突出顯示的單字並根據原始 PDF 進行更正。特別注意專有名詞、技術術語和數字,它們最有可能被錯誤識別,如果發布錯誤,危害也最大。 OCR 識別出「123,000 美元」的財務報告為「$128,000」包含自動拼字檢查無法捕獲的重大錯誤,因為兩者都是有效的數位格式。根據來源文件手動驗證關鍵值是唯一可靠的保障措施。
在 Markdown 轉換中保留圖片和表格
Markdown 透過引用外部檔案來處理映像:。將 PDF 轉換為 Markdown 時,需要提取 PDF 中的圖像並將其儲存為單獨的文件,並將參考連結插入到 Markdown 文字的正確位置。 WukongPDF 的PDF Export to Markdown 包括影像擷取作為轉換的一部分。 PDF 中的每個圖像都以 PNG 或 JPEG 檔案形式保存在 Markdown 文件旁邊的資料夾中,並且 Markdown 文字包含適當的圖像參考標籤。
桌子更具挑戰性。 Markdown 表格使用管道和破折號語法,該語法易於人類閱讀,但自動轉換器很難從 PDF 表格資料生成,因為 PDF 不將表格儲存為結構化資料。他們將字元儲存在位置上。轉換器必須從字元位置對表格網格進行逆向工程,這對於具有合併單元格、多行單元格內容或不等列寬的複雜表格產生不完美的結果。具有統一列和單行單元格內容的簡單網格表可以可靠地轉換。複雜的表格可能需要在 Markdown 輸出中手動重組。如果表格轉換效果不佳,請考慮將其匯出為單獨的圖像,而不是作為 Markdown 表格語法。複雜表格的清晰可讀圖像比呈現為未對齊列的亂碼 Markdown 更有用。
使用 Markdown 文件
產生的 Markdown 檔案可以在任何文字編輯器、Obsidian 或 Notion 等筆記應用程式、Hugo 或 Jekyll 等靜態網站產生器或 VS Code 等程式碼編輯器中開啟。透過 Markdown,您可以產生用於網站的 HTML、用於分發的 PDF、用於文字處理的 DOCX,或者只是將文字保留為可搜尋、版本可控的純文字格式,該格式將在幾十年內可讀取。
這條管道的價值在檔案資料中最為明顯。舊的掃描報告、歷史文獻、絕版出版物,都不僅可以搜索,而且可以轉換。 2005 年的掃描報告會變成 Markdown 文件,可以在現代編輯器中進行編輯、轉換為網站、在部落格文章中引用或以程式設計方式進行分析。將文字鎖定在圖像內 20 年的PDF 格式 不再限制內容的使用方式。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
