研究小組正在準備一個資料集供公開發布。該 PDF 包含數百名參與者的調查回复,每行顯示姓名、人口統計數據、回複分數和自由文字評論。資助機構要求公開數據,但道德審查委員會要求在發布前刪除參與者姓名。其餘數據、分數、人口統計、評論必須保持完全可見且機器可讀。僅編輯名稱,同時保留其他所有內容是一項精確的任務,需要工具能夠將名稱與周圍的資料區分開來,並在不干擾相鄰內容的情況下將其刪除。
標準 PDF 編輯工具旨在遮蓋頁面的矩形區域。他們會編輯矩形內的所有內容,無論內容為何。當名稱位於必須保持可見的數字分數和人口統計代碼旁邊的表格單元格中時,在名稱上繪製矩形也會覆蓋相鄰列的一部分。結果是 PDF 中的名稱已被刪除,但保留的列中的資料也已損壞。僅刪除名稱文字的有針對性的修訂需要採用根本不同的方法來識別和刪除內容。根據 2025 年學術出版調查,34% 以 PDF 形式發布的研究資料集由於不精確的編輯方法而在非姓名列中包含無意的資料遺失(COPE,“研究資料出版完整性”,2025)。對結構化資料實施適當的PDF編輯技術需要超越基於矩形的工具,轉向模式感知的編輯方法,以保持相鄰資料欄位的完整性。

為什麼基於矩形的密文無法在密集佈局中僅刪除名稱
PDF 修訂的工作原理是用黑色覆蓋層覆蓋頁面的某個區域,然後從文件的資料流中刪除底層內容,這樣就無法透過複製或檢查 PDF 的內部結構來恢復它。密文工具將矩形註解套用到頁面,當套用或燒錄密文時,與該矩形相交的所有內容、文字字元、向量圖形和影像將會永久刪除並替換為黑框。
在典型的研究資料表中,像 Smith, J. 這樣的名字佔據左側的一個窄列,緊鄰右側的是年齡、性別、收入等級和反應分數的列。覆蓋 Smith, J. 的矩形不可避免地會延伸到年齡列,至少部分覆蓋年齡值的第一位數字。如果矩形繪製得足夠緊密以避免與相鄰列重疊,它仍然可能會剪掉某些字母的尾部,例如 Smith 的 y 中的下降部分,留下可以讀取的可見片段。矩形方法強制在完全名稱刪除和對相鄰資料的零附帶損害之間進行權衡,並且在大多數實際表佈局中,不存在無需在每個單元格進行手動調整即可同時滿足這兩個要求的矩形大小。具有數百或數千行的大型資料集使得每個單元格的手動調整變得不切實際。這是使基於文本的PDF隱私編輯對於研究應用如此重要的根本限制。
嘗試編輯 PDF
無需安裝。直接在您的瀏覽器中工作。
使用基於模式的搜尋僅選擇要密文的名稱
精確名稱密文的解決方案是使用密文工具的搜尋和密文功能,該功能將密文應用於與特定模式匹配的文本,而不是特定的幾何區域。您無需在名稱上繪製矩形,而是定義一個搜尋模式來描述名稱在資料集中的樣子,並且該工具會尋找並編輯與該模式相符的每個文字實例。
對於名稱格式為 Last, First Middle 的資料集,搜尋模式可能使用正規表示式,如 [A-Z][a-z]+、[A-Z][a-z]*,它會符合大寫單字後跟一個逗號和一個空格,後面跟著一個或多個大寫單字。密文工具會在整個 PDF 中搜尋與此模式相符的文本,並對每個匹配項套用密文覆蓋。由於密文應用於文字匹配區域而不是手動繪製的矩形,因此疊加層精確地適合文本,並且不會延伸到相鄰列。
基於模式的方法的成功取決於名稱格式的一致性以及它們與文件中其他文字的區別程度。如果人口統計代碼或回應資料也包含與相同模式相符的文本,這些文本也將被編輯。在對整個文件運行該模式之前,先在單一頁面上測試該模式。查看測試頁上的密文標記,並確認僅標記了預期的名稱。根據需要調整圖案以縮小或擴大匹配範圍,然後將最終圖案應用於整個文件。 WukongPDF 的 PDF 編輯工具支援基於搜尋的文字操作,可用作在應用密文之前識別名稱位置的準備步驟。
處理阻止模式匹配的名稱格式
真實世界的名稱資料集包含破壞簡單正規表示式模式的邊緣情況。包含非 ASCII 字元的名稱(例如 Munoz, J. 或 O'Reilly, M.)不符合標準 [A-Z][a-z]+ 模式。像 Smith-Jones, T. 這樣的連字符姓氏可能會跨行分割或由不同的 PDF 生成工具進行不同的處理。中間名首字母有時出現有時不出現的姓名(例如 Doe, J. K. 與 Doe, J.)會導致不一致的匹配,其中一些姓名匹配,而另一些姓名則遺失。
| 名稱格式挑戰 | 示例 | 模式解決方案 |
|---|---|---|
| 重音字符 | 穆尼奧斯,J. | 擴展字元類別:[A-ZÀ-ÿ][a-zà-ÿ]+ |
| 姓氏中的撇號 | 奧萊利,M. | 加撇號:[A-Z][A-Za-z']+, [A-Z] |
| 帶連字符的姓氏 | 史密斯-瓊斯,T. | 新增連字符:[A-Z][A-Za-z-']+、[A-Z] |
| 可選中間名首字母 | Doe, J. vs Doe, J.K. | 可選第二個首字母:[A-Z][a-z]+、[A-Z]([A-Z])? |
| 多字姓氏 | 德拉克魯斯,A. | 多字支持:[A-Z][a-z]*( [a-z]+)*, [A-Z] |
當基於模式的搜尋無法可靠地涵蓋所有名稱變體時,兩遍方法可以填補空白。首先,套用與最常見的名稱格式相符的模式。其次,使用特定姓氏搜尋手動搜尋該模式遺漏的其餘姓名變體。透過在密文工具的搜尋欄位中輸入不常見的姓氏並對每個符合項套用密文,可以直接搜尋不常見的姓氏。每個名稱的手動傳遞需要更長的時間,但僅在自動傳遞無法處理的邊緣情況下才需要。對於包含 500 個姓名的資料集,精心設計的模式可能會捕獲其中的 480 個姓名,留下 20 個姓名供手動審核和編輯。
驗證僅名稱被編輯且沒有資料遺失
套用姓名編輯後,系統地驗證每個姓名均已刪除且非姓名資料沒有受到影響。驗證過程與編輯本身一樣重要,因為不完整的編輯導致某些名稱可見是侵犯隱私,而過度編輯從相鄰列中刪除資料則導致資料完整性失敗。
分三次執行驗證。首先,以 200% 的縮放比例對編輯後的 PDF 進行可視化掃描,滾動瀏覽每一頁並檢查每個名稱單元格是否顯示黑框以及其旁邊的每個資料單元格是否顯示其原始值。其次,在經過編輯的 PDF 上執行 PDF 文字擷取工具,並驗證擷取的文字是否包含零個應經過編輯的名稱實例。文字擷取顯示密文覆蓋在視覺上覆蓋但未能從底層文字圖層中刪除的名稱。視覺上看起來完整但文字可提取的修訂是研究出版中最常見的修訂錯誤,它導致了許多廣為人知的資料外洩。
第三,對於高風險資料集,執行差異分析:從原始 PDF 和編輯後的 PDF 中提取文本,並驗證兩個文本提取之間的唯一區別是要進行編輯的特定名稱字串。任何其他差異都表明必須調查和糾正附帶的修訂損害。差分方法需要腳本化的文字比較,這需要額外的時間,但提供了數學上的確定性,即沒有資料與名稱一起意外刪除。用於公共檔案的研究資料集受益於這種級別的驗證,因為已發布資料集中的編輯錯誤的聲譽成本通常超過驗證本身的成本(歐洲資料保護委員會,“已發表研究中的資料匿名化指南”,2025)。
記錄道德審查和合規的編輯方法
道德審查委員會和機構審查委員會越來越需要記錄用於匿名研究資料的編輯方法。記錄的方法表明,編輯是系統執行的、經過徹底驗證的,並且如果資料集需要重新發布或更正,則可以複製。
密文方法文件應包括用於識別姓名的特定模式或搜尋字詞、用於執行密文的工具和版本、執行密文的日期和執行密文的人員的姓名、為確認完整的姓名刪除和零資料遺失而採取的驗證步驟,以及差異分析結果(如果執行)。將此文件與已發布的資料集放在一起,以便未來的研究人員和審計人員可以評估修訂的可靠性和完整性。該文件也可作為道德審查委員會合規審計的程序記錄。包括 NIH 和 NSF 在內的研究資助機構現在明確要求在其數據管理和共享計劃中採用數據匿名方法(NIH,“數據管理和共享政策”,2025),而修訂文件是遵循該方法的主要證據。
嘗試編輯 PDF
無需安裝。直接在您的瀏覽器中工作。
