
為什麼看起來像文本的 PDF 可能無法編輯
您打開 PDF,看到螢幕上的文字,並假設您可以編輯它們。當您點擊文字但沒有任何反應,或者當您嘗試打字但遊標沒有出現時,您會發現看起來像文字文件的 PDF 實際上根本不是可編輯的文件。這種經驗非常常見,因為 PDF 可以包含完全不同形式的文本,其中只有一些是可編輯的。
對掃描的 PDF 執行 OCR 會在文件中的每個頁面影像後面新增一個可搜尋和可編輯的文字圖層。
當無法直接編輯時,從 PDF 到可編輯格式的相互轉換是可靠的後備方案。
PDF 編輯器可以修改 PDF 中作為實際文本物件存在的文本,其中每個字元表示為可選擇、可修改的字元代碼。這稱為本機文字或即時文字。 PDF 格式 也可以包含僅作為影像存在的文本,例如文字是頁面照片一部分的掃描文件。無法選擇、搜尋或編輯基於圖像的文本,因為 PDF 不包含字元數據,僅包含恰好形成字母形狀的像素。在知道 PDF 是否可編輯之前,您需要知道它包含哪種類型的文字。
最快的測試是嘗試選擇 PDF 中的文字。點擊並拖曳一個單字。如果文字在您拖曳時突出顯示,則它是本機文字並且可以進行編輯。如果沒有突出顯示且遊標沒有變化,則文字是基於圖像的並且不能直接編輯。如果文字突出顯示但突出顯示參差不齊,選擇了一些單字但跳過了其他單詞,則 PDF 混合了本機文字和僅作為視覺元素存在的文本,這是由舊軟體創建的 PDF 或透過組合多個來源文件創建的 PDF 中的常見情況。
嘗試編輯 PDF
無需安裝。直接在您的瀏覽器中工作。
無法編輯 PDF 文本的常見原因
最常見的原因是 PDF 是掃描文件。透過使用平板掃描器或手機相機應用程式掃描紙本頁面所建立的 PDF 包含文字影像,而不是實際的文字字元。儘管您可以閱讀螢幕上的文字,但 PDF 檔案不包含可編輯的文字資料。要使掃描的 PDF 可編輯,您必須先執行 OCR 來識別圖像中的文本,並在每個頁面圖像後面建立一個不可見的文本圖層。 OCR 後,文字變得可搜索,並且在許多 PDF 編輯器中可像原始文字一樣進行編輯。
密碼或權限限制是編輯的另一個常見障礙。受權限密碼保護的 PDF 可以開啟和查看,但權限可能會阻止編輯、複製或列印。如果您可以開啟 PDF 並查看文本,但編輯工具呈現灰色或顯示錯誤訊息,請檢查文件的安全設定。在大多數 PDF 檢視器中,文件屬性或安全性面板會顯示受限的權限。如果編輯受到限制且您擁有權限密碼,則可以取消限制並啟用編輯。
PDF 可能包含在建立過程中轉換為輪廓或曲線的文字。圖形設計師有時會在創建 PDF 之前在 Adobe Illustrator 等應用程式中將文字轉換為輪廓,以確保字體正確顯示,無論收件人是否安裝了這些字體。轉換為輪廓的文字在視覺上看起來與本機文字相同,但由向量形狀而不是字元資料組成。沒有編輯 PDF] 工具可以將輪廓文本編輯為文本,因為在轉換為輪廓期間字符資訊被丟棄。
即使 PDF 包含本機文字字符,字體編碼問題也可能導致文字無法編輯。某些 PDF 使用自訂字體編碼,以非標準方式將字元代碼對應到字形。編輯工具可以看到字符代碼,但無法確定它們代表哪些字符,因此它拒絕編輯它們以避免損壞文字。此問題在由專用軟體、舊系統產生的 PDF 或使用具有自訂字體處理的非拉丁腳本的文檔中最常見。在啟用字體嵌入的情況下從原始應用程式重新匯出 PDF 通常可以解決編碼問題。
如何使用 OCR 使掃描的 PDF 可編輯
光學字元辨識是將文字影像轉換為實際可編輯文字的過程。現代 OCR 技術非常準確,可以以典型尺寸對常見字體的列印文字進行乾淨、明亮的掃描。在掃描的 PDF 上執行 OCR 會在包含已辨識字元的每個頁面影像後面新增一個隱藏文字圖層。 OCR 完成后,您可以在文档中搜索文本,并在大多数 PDF 编辑器中编辑识别的文本,就好像它是原始文本一样。
OCR 輸出的品質取決於掃描影像的品質。 300 DPI 的高解析度掃描,具有均勻的照明、平坦的頁面和清晰的焦點,可為標準列印文字提供 99% 以上的 OCR 準確度。以 150 DPI 進行低解析度掃描,如果存在陰影、裝訂書的彎曲頁面或失焦區域,則會產生較低的精度,並且在 OCR 後需要更多的手動校正。掃描文件時考慮到 OCR,即平面頁面、良好的照明和足夠的分辨率,使編輯過程變得更加順暢。
大多數支援 OCR 的 PDF 編輯器都將語言選擇作為識別設定的一部分。選擇正確的語言可以提高準確性,因為 OCR 引擎使用特定於語言的字典和字元頻率資料來解析不明確的字元。使用法語設定識別的法語文件比使用英語設定識別的相同文件產生更好的結果。對於多語言文檔,選擇主要語言並手動更正輔助語言段落中的任何錯誤。
WukongPDF 的 OCR PDF 工具在瀏覽器中處理掃描文件並傳回具有可搜尋、可編輯文字層的 PDF。 OCR 引擎支援多種語言並處理常見文件類型,包括信件、表格、收據和文章。 OCR 後,先前不可編輯的掃描 PDF 變成可編輯,辨識出的文字可供選擇、搜尋和修改。
無法直接編輯 PDF 時的替代方法
當 PDF 無法直接編輯時,無論是因為它是無法存取 OCR 的掃描文檔,還是因為它具有無法刪除的安全限制,替代工作流程可讓您透過不同的路徑獲得相同的結果。將 PDF 轉換為可編輯格式(例如 Word 或 Google 文件),以該格式進行更改,然後將編輯後的文件轉換回 PDF。往返可編輯格式比直接編輯需要更長的時間,但適用於任何可以開啟和檢視的 PDF。
對於只需要進行少量更正的文檔,例如修復單個段落中的拼寫錯誤,使用 PDF 的註釋工具用白色矩形覆蓋不正確的文本,然後在頂部鍵入更正的文本是一種實用的解決方法。此方法不會真正編輯底層文字和文件結構,因此基於註釋的校正對於搜尋和輔助工具來說是不可見的,但對於將列印或作為影像檢視的文件進行快速視覺校正,它會產生可接受的結果。
對於需要大量編輯且無法直接編輯的文檔,最可靠的方法是返回原始來源文檔(如果有)。
用於建立 PDF 的 Word 文件、Google Doc 或 InDesign 檔案包含可以修改並重新匯出為新 PDF 的可編輯文字。聯絡文件的建立者取得來源文件,或在您自己的記錄中尋找來源文件,通常比費力編輯不合作的 PDF 更快。
一些看似包含本機文本的 PDF 實際上以編輯工具無法修改的方式儲存文本,即使文本是可搜尋和可選擇的。當 PDF 具有正確的文字圖層(允許搜尋和選擇)但底層字體編碼阻止編輯工具將編輯的字元映射回正確的視覺字形時,就會發生這種情況。編輯工具可以讀取文本,但無法將更改寫回文檔,否則可能會破壞字元映射。這種對編輯的防禦有時是文檔創建者有意為之的。
PDF 編輯工具的激增使得編輯 PDF 變得比以往任何時候都更加容易,但它也造成了人們對於什麼是編輯的困惑。在 PDF 頁面頂部添加文字註釋與編輯底層文字不同。替換 PDF 頁面上的圖像與編輯描述圖像的文字不同。了解基於註釋的變更(將新內容覆蓋在現有頁面之上)與真正的文字編輯(修改 PDF 結構中的實際文字內容)之間的區別,有助於您為每個編輯任務選擇正確的工具和正確的方法。
對於拒絕所有編輯嘗試並包含對更新至關重要的資訊的文檔,核心選項是從頭開始重新建立文檔。使用 PDF 作為視覺參考,並將內容重新輸入到文字處理程式或設計應用程式中,從而在重新建立過程中進行編輯。這種方法是勞力密集的,但會產生乾淨、完全可編輯的文檔,沒有殘留的格式問題、字體問題或轉換工件。從 PDF 重新建立文件所需的時間與文件的長度和複雜性成正比,對於需要大量編輯的短文檔,它實際上比使用不合作的 PDF 編輯工具要快。
嘗試編輯 PDF
無需安裝。直接在您的瀏覽器中工作。
