Tips & Tricks

當存在多種語言時,如何從僅一種特定語言的掃描 PDF 中提取文本

您掃描雙語選單。菜名是義大利語。描述是英文的。價格是與語言無關的數字。您只需提取義大利語文字即可建立義大利語單字列表,或只需提取英文文字即可發送給其他語言對的翻譯人員。對整個文件運行 OCR 會產生兩種語言的混合,這對於可搜尋性來說很好,但不適合選擇性提取。

從多語言OCR PDF文件中僅提取一種語言的文字需要一個 OCR 引擎,該引擎可以識別每個文字區塊的編寫語言,並僅提取與目標語言相符的區塊。這是比標準 OCR 更具選擇性的操作,標準 OCR 可以識別所有文本,無論語言如何。

How to Extract Text From a Scanned PDF in Only One Specific Language When Multiple Languages Are Present

語言選擇性 OCR 的工作原理

具有多語言支援的 OCR 引擎可以配置為同時識別多種語言的文字。當您指定「義大利語和英語」時與 OCR 語言一樣,引擎可以識別這兩種語言的文字。它還用識別的語言標記每個識別的文字區塊。義大利文文字區塊被標記為義大利文。一段英文文本被標記為英語。語言標記可以實現選擇性提取。

OCR 後,您可以透過語言標籤過濾識別的文字。僅匯出標記為義大利語的區塊。輸出是一個僅包含選單中的義大利文文字的文件。已識別但已過濾掉的英文描述不會出現在輸出中。這種選擇性提取對於翻譯工作流程、語言學習材料和內容分析非常有用,在這些情況下,您需要將特定語言的文本與其他語言的周圍文本隔離。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

分步:提取特定語言的文本

將掃描的 PDF 上傳到 WukongPDF 的 OCR 工具。選擇文檔中存在的語言。對於義大利語-英語選單,請選擇義大利語和英語。運行 OCR。該工具可識別所有文字並按語言標記每個區塊。 OCR 完成後,使用語言過濾器選擇義大利語。將過濾後的文字匯出為純文字檔案、Word 文件或僅包含義大利語區塊的新 PDF。

語言檢測的準確性取決於語言的獨特性。義大利語和英語使用相同的字母表,但有不同的單字模式。 OCR 引擎透過分析詞頻來區分它們。義大利語有許多以元音結尾的單字。英語有很多以子音結尾的單字。語言越獨特,語言標記越準確。兩種密切相關的語言,例如西班牙語和葡萄牙語,可能會被引擎在短文本區塊上混淆。

在同一行處理混合語言文本

有些文件在一行中混合了多種語言,例如語言教科書將法語句子與英語翻譯在同一行中配對。 OCR 引擎可能會將整個行分類為主導語言,從而錯誤地標記小語種單字。對於這些文檔,區塊層級的語言選擇性提取不夠精確。你需要一種不同的方法。

另一種方法是執行 OCR 兩次,一次將每種語言作為單一識別語言。僅限義大利語的 OCR 通行證可以很好地識別義大利語文本,但會破壞英語文本。僅限英語的通行證可以很好地識別英語,但會破壞義大利語。比較兩個輸出並手動為每個文字段選擇正確的版本。這種雙通道方法需要更多時間,但可以為語言在句子層級交錯的文檔產生最準確的特定於語言的提取。

驗證和清理提取的文本

提取目標語言的文字後,驗證語言過濾是否準確。掃描擷取的文本,找出明顯使用錯誤語言的單字。從選單中提取的意大利文字不應包含“grilled”等英語單字。或「與…一起食用」。除非菜單故意在意大利語描述中使用這些詞。包含意外外來詞的過濾文字表示需要手動更正的語言標記錯誤。

以目標語言執行拼字檢查。義大利語拼字檢查將標記義大利語提取中錯誤包含的英語單字。拼字檢查標誌是一種無需讀取每個提取的單字即可找到語言標記錯誤的有效方法。經過語言過濾和拼字檢查的提取 PDF 資料已準備好進行翻譯、分析或存檔。 WukongPDF 的掃描 PDF 具有語言過濾功能的 OCR 可以產生比後處理混合語言 OCR 輸出更清晰的單語言摘錄,從而刪除不需要的語言。

語言選擇性 OCR 的實際應用:從翻譯文件建立雙語術語表。分別提取所有來源語言術語和所有目標語言術語。按它們在頁面上的位置對齊它們,因為每個來源術語在頁面上或相鄰列中大致相同的垂直位置處都有相應的目標術語。對齊的輸出成為翻譯人員可以用來確保未來翻譯的一致性的術語清單。這種術語表建構技術廣泛應用於技術翻譯,其中術語的一致性至關重要。

對於語言位於單獨列中的文件(例如兩列雙語合約),語言選擇性提取變成列選擇任務。左欄是一種語言,右欄是另一種語言。不要依賴語言檢測(這可能會混淆相似的語言),而是裁剪 PDF 以單獨提取每一列。在每列上執行單語言 OCR。對於具有清晰的列語言分隔的文檔,這種列裁剪方法比語言過濾更可靠。

對於涉及歷史多語言文件的檔案項目,語言選擇性 OCR 與元資料標記相結合創建了一個可搜尋的檔案,研究人員可以在其中在數千個文件中找到特定語言的內容。每個文件的 OCR 輸出都標有偵測到的語言。搜尋 18 世紀法語文件的研究人員可以在多語言集合中篩選出僅法語文本。這種選擇性方法將檔案 OCR 從一種生硬的混合語言的工具轉變為用於語言研究的精密工具。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →