一份長達 300 頁的法律證據開示文件包含分散在各頁面中的電話號碼、電子郵件地址和社會安全號碼。手動尋找和編輯每一項都需要花費數天的時間,而且仍然有丟失一些的風險。基於模式的自動密文在整個文件中搜尋與特定格式、電話號碼、電子郵件地址、信用卡號相符的文本,並在單一操作中將密文應用於每個符合項目。問題不在於這是否可能,而是它的準確性如何以及需要什麼樣的監督。
基於模式的PDF修訂使用正規表示式來識別與預先定義或自訂模式相符的文字。電話號碼模式與 (555) 123-4567 或 555-123-4567 等序列相符。電子郵件模式與 name@domain.com 等序列相符。社會安全號碼模式與 ###-##-#### 相符。該工具掃描 PDF 文字圖層,找到每個匹配項,並同時編輯它們。

基於模式的編輯如何工作
密文工具首先從 PDF 內容流中提取文字並搜尋指定的模式。找到符合項目後,工具會記錄該頁面上符合文字的頁碼和座標。在所有頁面上完成搜尋後,工具會將密文標記套用到每個記錄的位置,覆蓋文字並將其從文字圖層中刪除。
基於模式的編輯的準確性取決於兩個因素:模式的精確度和 PDF 文字層的品質。精確的模式可以捕獲預期的文本,同時避免錯誤匹配。電話號碼模式必須區分實際電話號碼和其他恰好具有相同長度的數字序列,例如發票號碼、日期範圍或零件號碼。
模式匹配可以找到人眼需要數小時才能找到的內容。
文字圖層品質決定了圖案是否能夠找到文字。如果 PDF 是使用 OCR 從掃描文件建立的,則 OCR 可能會錯誤識別某些字元。數字「5」被誤識別為「S」的電話號碼將與電話號碼模式不符。編輯工具無法編輯它找不到的內容,而 OCR 錯誤會在模式檢測中造成差距。
嘗試編輯 PDF
無需安裝。直接在您的瀏覽器中工作。
常見模式及其陷阱
社會安全號碼是最常見的編輯模式,並且最有可能產生錯誤匹配。在正確位置帶有連字符的九位數字序列可能是社會安全號碼,但也可能是產品代碼、文件 ID 或以不常見格式編寫的日期範圍。基於模式的編輯無法理解上下文。它符合模式,但不符合含義。
電子郵件地址更容易準確匹配,因為 @ 符號具有獨特性,並且很少出現在電子郵件地址之外。但是,基於文字的模式搜尋可能無法匹配作為 mailto 連結而不是可見文字嵌入 PDF 中的電子郵件地址。編輯工具搜尋可見文字圖層,而不是底層連結註解。
信用卡號遵循特定的格式,即 16 位數字,有時分為四組,可透過 Luhn 演算法檢查。包括 Luhn 驗證在內的基於模式的編輯工具可顯著減少錯誤匹配,因為隨機 16 位元序列很少能通過檢查。如果您的密文工具不包括 Luhn 驗證,請在應用密文之前手動檢查信用卡匹配。
自訂模式可讓您編輯特定於組織的資訊。員工 ID 格式、客戶帳號模式或內部專案代碼可以定義為自訂正規表示式。自訂模式的PDF安全性好處是它們針對通用模式會錯過的信息,使編輯更加全面。
在應用密文之前檢查模式匹配
在未先檢查匹配項的情況下,切勿套用基於模式的密文。透過檢查步驟,您可以取消選擇錯誤匹配並手動新增錯過的匹配。產生 500 個匹配的模式可能有 480 個正確匹配和 20 個錯誤匹配。如果套用 20 個錯誤匹配,則會錯誤地編輯應保持可見的文字。審查步驟可以防止這種情況發生。
大多數密文工具在審閱面板中將符合項目顯示為反白的文字。捲動瀏覽符合清單並根據頁面上的上下文驗證每個符合清單。取消選擇明顯不是預期目標的匹配項。這種手動檢查比手動查找每個實例更快,因為該工具已經完成了搜索,但它對準確性仍然至關重要。
套用密文並儲存文件後,透過將 PDF 轉換為純文字並在文字輸出中搜尋密文模式來驗證密文。如果文字檔案中出現任何模式,則密文未完成。此編輯後驗證捕獲文字層中但未成功編輯的模式匹配。
基於模式的編輯的局限性
基於模式的密文僅適用於文字儲存為字元的基於文字的 PDF。未經 OCR 處理的掃描 PDF 會將文字儲存為影像,且不包含供模式匹配器搜尋的字元資料。在嘗試基於模式的密文之前,對掃描的 PDF 執行 OCR,以了解 OCR 錯誤會導致遺漏某些模式匹配。
以向量輪廓而不是字元代碼儲存的文字(例如已在設計軟體中轉換為路徑的文字)對於基於模式的編輯是不可見的。文字看起來像頁面上的文本,但 PDF 包含每個字元形狀的繪圖說明,而不是字元代碼。基於模式的密文無法找到以此格式儲存的文字。
PDF 隱私 法規越來越要求組織證明正確執行了編輯。基於模式的編輯報告記錄了搜尋了哪些模式、找到了多少匹配項、應用了多少個以及手動覆蓋了多少個模式,從而提供了編輯過程中盡職調查的證據。
WukongPDF 透過瀏覽器提供編輯工具,可以在本地處理 PDF。基於模式的密文在文件文字圖層中搜尋符合的模式並套用密文標記。基於瀏覽器的方法在編輯過程中將文件資料保留在您的裝置上。
對於僅應隱藏部分匹配文字的模式,有時需要進行部分編輯。僅應顯示最後四位數字的電話號碼,或應保持網域可見的電子郵件地址。支援捕獲組的基於模式的密文工具可讓您定義匹配模式的哪些部分要密文以及哪些部分保持可見。
套用模式為基礎的密文後,在文件中搜尋密文資訊的片段。如果網域是唯一的,則編輯為 j***@domain.com 的電子郵件地址可能仍可識別。為了最大程度地保護隱私,請編輯整個匹配模式,而不是嘗試部分編輯。
包含相同模式的基於文字和基於圖像的實例的文件(例如同時包含打字頁面和掃描頁面的 PDF),基於模式的密文處理基於文字的實例,而基於圖像的密文必須單獨應用於掃描頁面。
基於模式的編輯是綜合文件清理策略的組成部分。其他元件包括元資料刪除、隱藏內容刪除以及評論和註釋剝離。已徹底進行模式編輯但在元資料中仍包含作者姓名和組織的文檔仍可能洩漏敏感資訊。
對於法律發現文檔,基於模式的編輯必須與人工審核結合。模式可以找到電話號碼,但無法找到不包含電話號碼的電話對話的引用。手動審查可以捕獲模式匹配遺漏的上下文引用。
跨組織共享的模式庫可以提高編輯一致性。一家處理數百份發現文件的律師事務所為常見敏感資料類型開發了一個經過測試的模式庫。在整個公司共享這個庫可以確保每個文件都使用相同的模式進行編輯。
在將新模式套用到完整文件之前,在範例文件上測試新模式至關重要。由於格式變化、OCR 偽影或不常見的資料格式,在測試中完美運行的模式可能會在實際文件中產生意外的匹配。
修訂審核追蹤應與修訂文件一起保存。審計追蹤記錄了使用了哪些模式、每個模式找到了多少個匹配項,以及是否有任何匹配項被手動覆蓋。該文件支援品質保證和法規遵從性。
在執行密文之前,可以在 PDF 工具之外測試模式匹配的正規表示式。線上正規表示式測試器可讓您輸入範例文字並查看哪些模式匹配。根據文件文字的代表性樣本測試您的電話號碼、電子郵件和 SSN 模式,以驗證它們是否捕獲了預期目標。
與手動編輯相比,基於模式的編輯節省了大量時間。包含 500 個敏感模式實例的文件需要基於模式的工具在一分鐘內尋找和編輯。手動編輯同一文件需要幾個小時。
對於將定期編輯的文件(例如始終包含相同類型敏感資料的月度報告),請將模式集儲存為預設。將預設套用至每個新報表可確保一致的編輯,而無需每次重新配置模式。
培訓員工正確的編輯技術與擁有正確的工具同樣重要。基於模式的編輯工具在未經訓練的人手中可能會產生錯誤的安全感。工作人員應該了解該工具可以做什麼和不能做什麼、審查配對的重要性以及編輯後驗證步驟。
對於受 GDPR、HIPAA 或類似隱私法規約束的組織,基於模式的編輯應成為記錄的資料保護流程的一部分。該流程應指定要搜尋哪些模式、由誰審查匹配項以及在發布文件之前如何驗證修訂內容。
| 模式 | 正規表示式範例 | 錯誤匹配風險 | 驗證提示 |
|---|---|---|---|
| 電話(美國) | \(\d{3}\) \d{3}-\d{4} | 中:匹配發票號碼 | 檢查上下文;取消選擇非電話匹配 |
| 電子郵件 | \S+@\S+\.\S+ | Low:@有特色 | 驗證域名是真實存在的電子郵件域名 |
| 社會安全號碼 | \d{3}-\d{2}-\d{4} | 高:匹配產品代碼 | 對 SSN 模式至關重要的手動審核 |
| 信用卡 | \d{4}-\d{4}-\d{4}-\d{4} | Luhn 檢查低 | 啟用 Luhn 驗證(如果可用) |
嘗試編輯 PDF
無需安裝。直接在您的瀏覽器中工作。
