Tips & Tricks

如何 OCR 用您不會說的語言編寫的 PDF 文檔

在全球商業、學術研究和法律文件審查中,收到用您不會說的語言編寫的掃描的 PDF 比以往任何時候都更加常見。您需要提取文字、翻譯它並理解文件的內容。挑戰不僅僅在於對檔案運行 OCR。它正在使用正確的語言設定來運行 OCR,因此提取的文字足夠準確,可以進行翻譯。在OCR PDF處理期間選擇錯誤的語言會產生任何翻譯引擎都無法挽救的亂碼輸出。

OCR 引擎看不到字母。他們看到形狀並將這些形狀與特定語言的字元模式進行匹配。如果您告訴 OCR 引擎該文件是英文的,但實際上是俄文的,引擎會將西里爾字母映射到它所知道的最接近的拉丁字符。結果是一串看似隨機的字母,與原始文字沒有任何關係。正確設定語言或在可用的情況下使用自動偵測是整個 OCR 到翻譯流程中最重要的決定。

WukongPDF 的 PDF 到文字和 OCR 工具從掃描文件中提取文字以進行翻譯和分析。將正確的 OCR 語言選擇與可靠的翻譯服務相結合,可在五分鐘內將無法閱讀的外語掃描件轉變為可理解的文件。

How to OCR a PDF Document Written in a Language You Don't Speak

步驟 1:識別文檔語言

在接觸任何 OCR 軟體之前,請確定文件的語言。如果文檔元資料或檔案名稱暗示了語言,請從那裡開始。如果沒有,請開啟 PDF 並查看幾頁。即使不閱讀文本,視覺線索也會大大縮小可能性。文字家族各具特色:拉丁文字適用於大多數歐洲語言。西里爾字母用於俄語、烏克蘭語、保加利亞語和塞爾維亞語。阿拉伯文字涵蓋阿拉伯語、波斯語和烏爾都語。 CJK 涵蓋中文、日文和韓文。天城文涵蓋印地語、馬拉地語和尼泊爾語。

如果您甚至無法直觀地識別腳本系列,請截取代表性段落的螢幕截圖並將其上傳到Google翻譯的圖像翻譯功能或反向圖像搜尋。在大多數情況下,這些工具可以識別腳本和特定語言。知道文檔是泰語而不是老撾語,或者是韓語而不是日語,就可以區分準確的 OCR 輸出和無用的字符噪聲。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

步驟 2:選擇支援目標語言的 OCR 工具

並非所有 OCR 工具都支援所有語言。 Adobe Acrobat Pro 隨附了約 40 種語言的 OCR 引擎。其識別文字工具在設定對話框中包含語言選擇下拉清單。 Tesseract 是由 Google 維護的免費開源 OCR 引擎,透過可下載的語言資料檔案支援 100 多種語言。 Google Cloud Vision API 擁有最廣泛的語言覆蓋範圍,涵蓋 200 多種語言,並包含自動語言偵測作為選用功能。

對於您可以識別的單一語言文檔,只要您在執行 OCR 之前指定正確的語言,任何這些工具都可以運作。對於包含多種語言的文檔,例如包含英語和法語條款的雙語合同,您需要一個支援多種並發語言或可以按段落自動檢測的工具。 Google Cloud Vision 和 Tesseract 以及適當的語言資料包都可以處理多語言文檔,儘管語言切換邊界的準確性從來都不是完美的。

步驟 3:使用正確的語言配置並執行 OCR

在 Adobe Acrobat Pro 中,開啟掃描的 PDF,前往“工具”,然後選擇“掃描和 OCR”,然後選擇“識別文字”,然後選擇“在此文件中”。點擊語言選擇器旁邊的編輯按鈕。在「識別文字」對話方塊中,從下拉清單中選擇正確的主要語言。如果文件包含第二種語言,請按一下「新增語言」按鈕並選擇它。 Acrobat 同時處理兩種語言。按一下“確定”,然後按一下“識別文字”。 Acrobat 運行 OCR 通道並將識別的文字作為不可見層嵌入到掃描影像後面。該文件現在可供搜尋。

在 Tesseract 中,命令列呼叫使用 -l 標誌指定語言:tesseract input.pdf 輸出 -l rus 表示俄語,tesseract input.pdf 輸出 -l jpn 表示日語,或 tesseract input.pdf 輸出 -l fra+eng 表示法語-英語雙語文檔。先安裝所需的語言資料檔; Tesseract 預設僅提供英文。對於 Google Cloud Vision,API 呼叫包含一個 languageHints 參數,該參數接受 BCP-47 語言代碼數組。 Cloud Vision 還提供自動語言偵測模式,完全不需要語言提示,當您確實不知道文件的語言時,它是最簡單的選擇。

步驟 4:複製提取的文本並翻譯

OCR 完成後,在將文字傳送到翻譯之前驗證文字品質。在 Acrobat 中,開啟尋找工具並蒐索您在文件中認識的常用單字。如果搜尋找到匹配項,則 OCR 會起作用。選擇提取的文字的一段,將其複製並貼上到純文字編輯器中。掃描明顯的 OCR 錯誤:重複的符號、中間中斷的單字或大塊無法辨識的字元。如果超過 5% 的文字出現損壞,請使用不同的語言設定或更高解析度設定重新執行 OCR。

提取的文字通過視覺完整性檢查後,複製整個文字並將其貼到翻譯工具中。 Google Translate、DeepL 或 Microsoft Translator 都接受純文字輸入。對於較長的文檔,DeepL 和 Google Translate 支援可搜尋 PDF 的直接文件上傳,從而跳過手動複製步驟。翻譯輸出足以供理解、研究和內部業務使用。為了獲得法律、醫學或出版級的準確性,請將可搜尋的 PDF 發送給專業的翻譯人員,他們將使用 OCR 層作為起點,並根據原始掃描頁面修正機器翻譯。

處理具有混合腳本或非標準字體的文檔

混合腳本的文檔(例如包含拉丁腳本中的英語技術術語的阿拉伯研究論文)會使需要單一腳本的 OCR 引擎感到困惑。首先為主要腳本配置 OCR,然後在同一文件上執行針對少數腳本的第二遍。透過匯出兩個 OCR 圖層並在文字編輯器中組合它們來合併結果。由於引擎針對主要腳本進行了最佳化,因此少數腳本段落的準確性會較低。

即使選擇了正確的語言,非標準字體(包括裝飾字體、舊打字機字體和類似手寫的草書字體)也會降低 OCR 準確性。透過將 PDF 頁面轉換為 400 DPI 或更高的高解析度影像、套用銳利化濾鏡並增加對比度,對這些文件進行預處理,然後再將其輸入 OCR 引擎。 Tesseract 內建的預處理透過 --psm 3 啟用自動頁面分割,可處理適度的字體變化。對於嚴重退化或程式化的文本,Google Cloud Vision API 通常優於本地 OCR 引擎,因為其模型已經在更大的現實世界字體樣本語料庫上進行了訓練。

OCR 工具多語言支持自動檢測最適合
Adobe Acrobat 專業版40多種語言手動選擇文件專業,準確度高
超立方體(開源)100多種語言需要手動選擇批次、腳本、免費
Google雲端視覺200多種語言自動檢測可用API整合、混合腳本
線上OCR服務10-50種語言手動選擇快速單文檔 OCR

對翻譯內容採取行動之前驗證準確性

OCR 和機器翻譯引入了兩層潛在錯誤:OCR 誤識別和翻譯歧義。對於重要文檔,請請雙語同事或專業翻譯人員將隨機選擇的翻譯段落與原始 PDF 進行比較,以抽查輸出。五分鐘的驗證可以發現災難性的失敗,例如錯誤的語言設定產生了看似合理但完全錯誤的文字。

如果您經常處理外語掃描的 PDF,請建立清單:識別語言、選擇匹配的 OCR 引擎、使用正確的語言參數來執行 OCR、抽查擷取的文字的字元準確性、翻譯並驗證範例段落。在两三个文档之后,工作流程就变成例行公事,从打开文件到读取翻译结果只需不到五分钟。

在文件處理方面,對於安全敏感的文檔,離線 OCR 完全避免了雲端暴露。下載語言資料檔案一次後,Tesseract 在本地運行,無需網路請求。 Adobe Acrobat Pro 還可以透過識別文字功能在本機執行 OCR,而無需登入 Document Cloud。對於法律證據開示或敏感商業信函等機密外語資料,本地 OCR 與離線文字審查相結合,可將原始文件內容保留在您的受控環境中。

當僅 OCR 不夠時:輔助轉錄服務

對於由於字體嚴重退化、手寫文字或嚴重混合腳本而導致 OCR 準確性低得無法使用的文檔,輔助轉錄服務可提供人工驗證的輸出。這些服務將初始機器 OCR 通行證與人工審核和糾正相結合,通常按頁收費。週轉時間從幾個小時到幾天不等。對於準確性不容妥協的單一關鍵文件,例如外語出生證明或專利申請,人工轉錄的成本是合理的,因為對錯誤識別的文本進行操作的風險是合理的。首先運行機器 OCR 以評估品質。如果超過 15% 的單字無法辨識或明顯錯誤,請升級為輔助轉錄,而不是花費數小時手動修正機器輸出。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →