Tips & Tricks

如何使用 OCR 將列印頁面的照片轉換為可編輯、可搜尋的文本

您用手機拍攝列印文件的照片。也許它是圖書館書中的一頁、會議的講義、費用報告所需的收據,或者您看到的包含重要資訊的標誌。照片很清晰,可以看懂,但它只是一張照片。您無法在其中搜尋單字。您無法從中複製和貼上文字。您無法編輯它。這是一張文字照片,而不是文字本身。

光學字元辨識可以將該照片轉換為可編輯、可搜尋的文本,並且您的手機和瀏覽器上提供了執行此操作的工具。該過程拍攝列印頁面的照片並產生一個文檔,您可以在其中搜尋、選擇、複製和編輯每個單詞,就像您自己鍵入一樣。

How to Turn a Photo of a Printed Page Into Editable, Searchable Text Using OCR

為 OCR 取得最佳照片

OCR 準確性在很大程度上取決於輸入影像的品質。一張光線充足、聚焦清晰的平面照片的 OCR 準確率可達 95% 至 99%。光線不佳、模糊、傾斜的彎曲頁面照片的 OCR 準確率可能為 70%,這意味著大約每三到四個單字中就有一個包含錯誤。花在拍攝一張好照片的時間會在減少校正工作量的情況下得到數倍的回報。

將文件放在平坦且光線充足的表面上。自然光是理想的選擇,因為它是漫射的且無陰影。如果您調整自己的位置,使陰影不會落在頁面上,那麼頭頂辦公室的照明就會發揮作用。將手機直接放在頁面上方,與頁面平行,而不是傾斜。使用雙手或將手肘放在表面上以保持手機穩定。用頁面填滿框架,在邊緣周圍留下小邊距。點擊螢幕以聚焦於文字。如果您的手機有文件掃描模式,請使用它。在 iPhone 上,Notes 應用程式包含掃描文件功能,可自動偵測頁面邊緣、校正透視並增強對比度。在 Android 上,Google Drive 的掃描功能也具有相同的功能。

如果頁面來自裝訂書並且無法平放,請輕輕按壓書脊以減少彎曲,並接受靠近頁面遠離相機彎曲的裝訂線處 OCR 準確度會較低的事實。對於書脊附近的關鍵文本,請專門針對該區域拍攝第二張照片,並將手機靠近頁面,以最大限度地提高彎曲文本的分辨率。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

使用手機的內建工具對照片運行 OCR

iPhone 包括即時文本,這是內建 OCR 功能,可直接在相機應用程式、照片應用程式和 Safari 中使用。將相機對準文本,即時文字圖示會出現在取景器的一角。點擊它,手機就會即時識別文字。您可以立即選擇、複製並貼上它。對於圖庫中已有的照片,請在「照片」應用程式中將其打開,然後尋找「即時文字」圖示。點擊它可突出顯示所有已識別的文字。您可以複製選定的部分或全部。即時文字完全在裝置上運行,無需網路連線。

Android 手機的 Google Photos 和 Google 應用程式內建 Google Lens。在 Google 相簿中開啟照片,然後點擊鏡頭圖示。 Google Lens 可以識別圖像中的文本,並允許您選擇、複製、翻譯或搜尋它。與 Apple 的 Live Text 一樣,Google Lens 可以在最新裝置上離線進行文字辨識。對於這兩個平台,內建 OCR 都是為短文、幾句話或一個段落而設計的,而不是為多頁文件設計的。它提取文字但不產生格式化文檔。

使用OCR PDF工具將照片轉換為可搜尋的 PDF

對於需要成為適當文件的照片(具有可搜尋文字層的 PDF),基於瀏覽器的 OCR 工具可以處理整個管道。 WukongPDF 接受 JPEG、PNG、HEIC 和其他常見格式的照片上傳。上傳照片。該工具對其進行處理,識別文本,並輸出 PDF,其中原始照片作為可見頁面,識別的文本作為其後面的不可見可搜尋層。輸出看起來與照片一模一樣,但您現在可以搜尋單字、選擇和複製文本,並且文件的行為與任何其他 PDF 一樣。

如果您有多張連續頁面的照片,請將它們一起上傳。該工具會處理每一個,然後您可以將它們組合成一個多頁可搜尋 PDF。這是使用手機對簡短文件進行數位化的工作流程:拍攝每個頁面、上傳批次、執行 OCR,然後下載整個文件的單一可搜尋 PDF。對於 10 頁文檔,該過程需要幾分鐘,生成的結果在功能上與平板掃描器掃描的 PDF 相同。

清理照片中的 OCR 輸出

用手機拍攝的照片,即使是好的照片,在 300 DPI 下產生的 OCR 準確度也低於平板掃描。列印頁面的手機照片的 OCR 準確率通常為 90% 到 95%,這意味著大約 20 個單字中就有一個會出現錯誤。錯誤集中在可預測的位置:相機鏡頭造成失真的頁面邊緣附近、低於 10 磅的小字體以及有陰影或照明不均勻的區域。

從照片轉換掃描的 PDF 後,開啟 PDF 並蒐索常見的 OCR 錯誤。搜尋“cl”通常被認為是“d”, “rn”通常被認為是“m”,和“1”通常被認為是“l”。通讀文字並糾正您發現的任何錯誤。清理所需的時間取決於文件的長度和照片品質。單頁文件需要 5 到 10 分鐘進行校對。一份 20 頁的文檔需要一個小時或更長。清理步驟是將草率的 OCR 結果與精美、專業的文件區分開來的。

當照片勝過掃描器

當品質是重中之重時,手機照片並不能取代平板掃描器。但手機照片比您需要時不在身邊的掃描器好得多。最好的相機就是您擁有的相機。為了從圖書館書籍、會議講義、白板筆記、收據、標牌、菜單以及您在辦公桌之外遇到的任何印刷材料中捕獲文本,手機照片和 OCR 將短暫的視覺體驗轉換為永久的、可搜索的、可編輯的文本。 WukongPDF 的影像到 PDF 管道可在一分鐘內將手機照片連接到完成的 PDF,從而縮小在現實世界中查看文字與將其作為文件使用之間的差距。

值得理解的一個限制是:文字文件的手機照片通常會產生比同等平板掃描文件更大的文件大小,因為手機相機甚至可以捕獲黑白文件的顏色資訊。單一文字頁面的手機照片(JPEG 格式)可能為 3 到 5 MB,而同一頁面的黑白模式平板掃描可能為 200 KB。如果您要使用手機對許多頁面進行數位化,請在運行 OCR 之前將照片轉換為灰階。這可以將檔案大小減少 60% 到 80%,並且通常可以提高 OCR 準確性,因為灰階轉換消除了混淆識別引擎的色彩雜訊和陰影。大多數照片編輯應用程式(包括 iPhone 和 Android 上的內建照片應用程式)都包含灰階或單色濾鏡,只需輕按每張照片即可完成此操作。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →