Tips & Tricks

如何 OCR 包含多種語言或非英語文字的 PDF

您掃描雙語合約。左欄是英文的。右欄是西班牙文。兩種語言都需要可搜索,但為一種語言配置的標準 OCR 運行會破壞另一種語言。應用於西班牙語文本的英語 OCR 會產生無意義的結果,因為識別引擎需要不同的字母頻率和單字模式。西班牙語 OCR 應用於英語也會產生類似的亂碼結果。您需要同时理解两种语言的 OCR。

多語言OCR PDF是現代識別引擎的一項功能,可以在單一文件中的語言模型之間進行切換。引擎偵測每個文字區塊所使用的語言並應用適當的辨識模型。結果是文檔中所有語言的準確文字識別。

How to OCR a PDF That Contains Multiple Languages or Non-English Text

OCR 引擎如何處理多種語言

OCR 引擎透過將字元形狀與每種語言中字母的訓練模型進行比較來識別文字。英語模型知道字母“e”是指字母“e”。最常見的是“th”。經常一起出現,並且諸如“qx”之類的某些字元組合可以被使用。幾乎不會發生。西班牙模特兒知道像“a”這樣的重音字符帶重音符號“n”帶波形符和倒問號很常見。法語模型需要頻繁的重音元音和特定的二合字母。

當您為 OCR 作業指定多種語言時,引擎會載入所有指定語言的字元模型。當它處理頁面上的每個文字區塊時,它會評估哪種語言模型最匹配觀察到的字元模式並應用該模型。語言偵測在文字區塊層級自動進行,因此可以正確處理包含英文正文和法語腳註的頁面,而無需手動語言標記。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

設定多語言 OCR

OCR 工具的語言選擇允許多種語言。選擇文檔中出現的所有語言。對於英語-西班牙語雙語合同,請同時選擇英語和西班牙語。對於包含英語、法語和德語的歐盟文檔,請選擇全部三個。對於包含英文文本和古希臘文引文的學術著作,請選擇英文和希臘文。引擎載入所有必要的模型。

語言覆蓋範圍和準確性之間需要權衡。每種額外的語言都會在識別過程中添加更多的字元模型,這會增加不同語言的相似字元之間混淆的機會。西里爾字母“a”看起來與拉丁字母“a”相同但代表不同的聲音並出現在不同的上下文中。增加不必要的語言會增加引擎錯誤分類文字區塊和應用錯誤語言模型的風險。僅選擇文件中實際出現的語言,而不是您認為可能有用的每種語言。

常見的多語OCR場景及處理方法

最常見的多語言場景是主要使用一種語言的文檔,其中包含另一種語言的短文、引文或腳註。一篇英文學術文章,註腳中引用了法文。德語說明手冊,附有英語技術術語。具有英文定義條款的西班牙文法律合約。對於這些文檔,主要語言包含大部分文本,而輔助語言則出現在簡短的、可預測的上下文中。

識別引擎可以很好地處理這些混合語言文檔,因為語言切換被本地化到特定的文字區塊。英文正文是用英文模型辨識的。法國報價被法國模型認可。由於兩種語言出現在單獨的文字區塊中,引擎的語言偵測可以正確識別每個區塊要使用的模型。

更具挑戰性的場景是語言在同一行上交錯的文檔,例如語言教科書在同一行上顯示英語句子,然後顯示西班牙語翻譯。 OCR 引擎可能會將整行視為一個文字區塊,並將一種語言模型應用於所有文字區塊,從而在另一種語言的行的一半中產生錯誤。對於這些文檔,最準確的方法是對文檔進行 OCR 兩次,每種語言一次,然後手動合併結果。這是勞動密集型的,並且僅適用於準確性至關重要的短文檔。

驗證多語言 OCR 結果

執行多語言 OCR 後,透過檢查每種語言的文字來驗證結果。搜尋您知道的每種語言中出現的單字。確認搜尋找到它。選擇每種語言的文字並複製它以確認字元正確。請特別注意重音字元和特殊符號。對於主導語言模型中不存在的字符,掃描的 PDF 識別最有可能失敗,因為引擎可能預設為最接近的拉丁語等效字符。

多語言文件中常見的 OCR 錯誤包括將重音字元替換為非重音字元、帶有重音的 e 變為 e、帶波形符的 n 變為 n、特殊標點符號(如西班牙語中的倒問號)替換為標準問號,以及將西里爾文或希臘語等非拉丁文字誤識別為視覺上相似的拉丁語字元。這些錯誤通常集中在第二語言段落。如果第二語言內容很重要,請根據原始文件手動驗證這些段落。 WukongPDF 的 OCR 工具為每個識別的文字區塊提供置信度分數,分數較低表示識別引擎不太確定的區塊。

對於混合拉丁字母語言與非拉丁文字的文檔,例如帶有中文或阿拉伯語引文的英文文檔,多語言 OCR 挑戰更為重要,因為字元形狀根本不同。辨識引擎必須區分完全獨立的書寫系統。為文件中顯示的每個腳本系列選擇特定語言。 WukongPDF 的PDF 格式 處理支援在單一 OCR 作業中混合拉丁文、西里爾文、阿拉伯文、CJK 和印度文腳本,但準確性因腳本和掃描品質而異。

改進具有不同語言部分的文件的多語言 OCR 的實用技術:在執行 OCR 之前按語言預先分隔文件。如果 20 頁的合約前 10 頁為英語,後 10 頁為西班牙語,請將文件拆分為兩個文件,在第一個文件上執行英語 OCR,在第二個文件上執行西班牙語 OCR,然後重新合併。這完全避免了多語言模型開銷,並產生稍高的準確性,因為每個 OCR 作業都使用針對其正在處理的確切文字進行最佳化的單一語言模型。分割、OCR 單獨、重新合併工作流程需要額外幾分鐘的時間,但可以可靠地為具有清晰語言邊界的文件提供最佳準確性。對於語言在同一頁上真正交錯且分離不切實際的文檔,保留多語言 OCR 方法。

多語言 OCR 的最後一個提示:如果文件包含從右到左的腳本(如阿拉伯語、希伯來語或波斯語)以及從左到右的腳本(如英語或法語),則文字方向會增加複雜性。 OCR 引擎不僅必須偵測每個文字區塊所使用的語言,還必須偵測文字流動的方向。阿拉伯文本區塊應從右到左識別,而其下方的英文標題應從左到右識別。當您在設定中指定兩種語言系列時,大多數現代 OCR 引擎都能很好地處理混合方向文件。 OCR 後,透過複製一段阿拉伯語並將其貼到文字編輯器中來驗證文字方向。字元應按正確的閱讀順序出現,而不是顛倒。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →