Tips & Tricks

如何一次尋找並編輯 PDF 中出現的每個單字或片語

您有一份 60 頁的合同,在與另一方共享之前,您需要刪除客戶姓名、地址、帳號和任何其他機密資訊的所有實例。該名稱在 30 個不同的頁面中出現了 47 次。手動尋找和編輯每個事件將花費一個小時,而且您幾乎肯定會錯過一些事件。搜尋和編輯功能可以在幾秒鐘內完成這項工作,在一次操作中找到每一個匹配項並編輯它們。

當您確切知道哪些單字、片語或模式需要刪除時,基於搜尋的編輯是清理文件最有效的方法。它將文字搜尋與永久內容刪除結合,如果操作正確,它可以保證目標文字的實例不會在文件中保留下來。

How to Find and Redact Every Occurrence of a Word or Phrase Across a PDF at Once

PDF 密文與在文本上繪製黑框有何不同

一個常見且危險的錯誤是將編輯與繪圖混淆。有些人打開 PDF,在敏感文字上繪製黑色矩形,並假設該文字已隱藏。它不是。黑色矩形是位於頁面頂部的註釋。原始文字仍在其下面的文件中。任何在可以隱藏註釋的檢視器中開啟 PDF 的人,或從頁面複製並貼上文字的人,都可以恢復所謂的已編輯資訊。這個錯誤導致了現實世界的資料洩露,法院文件、政府文件和公司披露無意中暴露了經過編輯的訊息,因為作者使用了繪圖工具而不是編輯工具。

真正的PDF 密文 會永久刪除文件中的文字和圖像資料。當您套用密文時,工具會從 PDF 資料流中刪除底層內容,並在其位置放置不透明的覆蓋層。原來的信息已經沒有了。它無法透過隱藏註釋、複製文字或檢查文件的內部結構來恢復。對於任何涉及隱私或機密性的文檔,真正的編輯是唯一可接受的方法。

WukongPDF

嘗試編輯 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

分步:找出並編輯每個出現的單字

在支援基於搜尋的密文的工具中開啟 PDF。編輯工具包括搜尋和編輯功能。輸入您要尋找的單字或短語。該工具搜尋整個文件並列出每個匹配項,以及頁碼、周圍上下文和匹配預覽。查看清單以確認您想要編輯所有實例。有時,一個單字既作為敏感資訊又作為通用術語出現。如果客戶的姓氏是「Rice」而且文件中還討論了商品大米,你需要單獨查看每個匹配項,而不是盲目地全部編輯。

查看符合項目後,選擇您要編輯的符合項目。您可以選擇單一符合項目、特定頁面上的所有符合項目或文件中的所有符合項目。應用修訂。該工具將永久刪除選定的文本,並在每個位置放置一個黑框或您選擇的密文標記。以新名稱儲存編輯後的檔案。原始未編輯文件應與已編輯版本分開安全儲存。編輯是不可逆的,這就是重點。如果您只有經過編輯的版本,則您不會意外發送未經過編輯的版本。

編輯模式:電子郵件地址、電話號碼和 ID 號碼

除了確切的文字之外,許多編輯場景都涉及模式。文件中的每個電子郵件地址都需要刪除。每個格式為 123-45-6789 的社會安全號碼都需要刪除。每個 16 位元格式的信用卡號都需要刪除。進階編輯工具支援正規表示式或正規表示式,它定義模式而不是精確的文字。像 \b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z|a-z]{2,}\b 這樣的正規表示式符合電子郵件地址。 \b\d{3}-\d{2}-\d{4}\b 等正規表示式與社會安全號碼相符。

基於模式的編輯功能強大,但需要謹慎。太寬泛的正規表示式將符合您不打算編輯的文字。太窄的正規表示式會錯過不完全符合模式的實例。運行基於模式的密文後,在應用之前手動檢查每個匹配項。正規表示式查找候選者。人類的判斷決定哪些候選者實際上包含敏感資訊。 WukongPDF 的PDF 編輯器 支援精確匹配搜索和基於模式的密文搜索,並具有匹配審核界面,可在提交密文之前顯示上下文中的每個匹配項。

驗證編輯是否完成

編輯後,透過兩次測試驗證結果。首先,目視掃描文件。已編輯區域應清楚標示您選擇的覆蓋層、黑框、白框或自訂文字(例如[已編輯])。不應顯示任何敏感文字。其次,嘗試提取文字。在任何 PDF 檢視器中,按 Ctrl-A 選擇頁面上的所有文本,然後將其複製並貼上到文本編輯器中。貼上的文字不應包含任何經過編輯的資訊。如果貼上的輸出中出現密文,則表示密文未正確應用,覆蓋層被放置為註釋而不是永久內容刪除,且文件不安全。

第三,在經過編輯的 PDF 中搜尋經過編輯的術語。按 Ctrl-F 並搜尋敏感字詞或片語。搜尋應傳回零結果。如果找到任何匹配項,則密文會錯過它們,如果文本存儲為圖像而不是可選文本,或者文本出現在文檔元數據字段而不是頁面內容中,則可能會發生這種情況。對於基於圖像的文本,對經過編輯的文件運行 OCR 並蒐索 OCR 輸出。如果 OCR 識別出所謂的已編輯文本,則圖像未經過編輯,只有文本圖層經過編輯,您還需要編輯圖像層。 WukongPDF 的PDF 隱私 密文工具可同時密文文本圖層和圖像層,從而縮小了這一共同差距。

編輯掃描文件和純圖像 PDF

掃描的 PDF 提出了獨特的編輯挑戰,因為文字是圖像的一部分,而不是單獨的文字圖層。基於搜尋的密文無法找到圖像中的單字。沒有可搜尋的文字。若要編輯掃描文檔,您必須先執行 OCR 以建立可搜尋文字圖層,然後搜尋該文字圖層以尋找並標記編輯區域,然後將編輯套用到底層影像。文字層標識敏感資訊在頁面上的位置。然後,編輯工具會從影像中永久刪除這些像素區域。

編輯掃描文件後,對編輯版本再次執行 OCR,並驗證新識別的文字不包含編輯資訊。這種雙重 OCR 驗證捕獲了掃描文檔密文最常見的失敗模式:OCR 引擎找到了文本,您將其標記為密文,但密文矩形稍微未對齊,並且沒有完全覆蓋文本像素,導致字符片段可見。一個字母的幾個像素足以讓有決心的人重建原始單字。將編輯區域放大至 200%,並確認完整的像素級覆蓋範圍。

除了文字和模式之外,徹底的編輯過程還應該檢查文件元資料。每個頁面都經過完美編輯的 PDF 仍然可能透過其文件屬性洩露敏感資訊:作者欄位可能包含資訊被編輯者的姓名,標題可能包含機密項目名稱,關鍵字欄位可能列出應刪除的術語。編輯頁面內容後,開啟文件屬性並清除作者、主題、標題和關鍵字欄位。如果 PDF 包含嵌入的文件附件(有時在包含支援電子表格或資料檔案的報告中會發生這種情況),則必須單獨編輯或刪除這些附件。它們不受頁面級編輯的影響。全面的修訂清單涵蓋三層:頁面內容、元資料欄位和嵌入文件。缺少其中任何一層都可能會取消對其他兩層的保護。

WukongPDF

嘗試編輯 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →