您可以使用 PDF 編輯器的編輯工具從 PDF 中編輯社會安全號碼。您會看到出現黑框,儲存文件並發送。收件人將 PDF 轉換為 Word 進行編輯,並發現社會安全號碼在轉換後的文件中完全可見,就好像從未發生過編輯一樣。這不是一個錯誤。當文件進行格式轉換時,這是大多數編輯工具的預期行為,並且它已經導致了真正的資料外洩。
2024 年,英國資訊專員辦公室報告稱,PDF 編輯不當是涉及政府文件的資料外洩的第三大常見原因(ICO,“資料安全事件趨勢”,2024 年)。最常見的根本原因不是無法編輯,而是無法驗證編輯是否在文件的整個生命週期(包括其可能在下游進行的任何格式轉換)中倖存下來。

正確的 PDF 編輯如何在數據層面發揮作用
正確的PDF編輯與在文本上繪製黑框有著根本的不同。當您使用真正的密文工具時,會發生兩件事:可見文字被黑色矩形覆蓋,並且底層文字內容從 PDF 的文字圖層中刪除。字元本身將從檔案的資料流中刪除。閱讀器應用程式在黑盒子下沒有任何內容可顯示,因為那裡什麼都沒有。
當您使用註釋工具在文字上繪製黑色矩形並將其稱為「編輯」時,您就完成了安全專家所說的「裝飾編輯」。文字仍然存在於 PDF 的資料層中,完好無損且可提取。任何人都可以選擇文字、複製它、貼上到其他地方,並閱讀黑框下的每個單字。將 PDF 轉換為任何其他格式,轉換工具會讀取底層文本,而不是視覺疊加層。編輯消失了,因為它從一開始就不是真實的。
真實編輯和表面編輯之間的區別非常重要,以至於政府機構和律師事務所現在將其納入對處理敏感文件的員工的強制性培訓中。一份未經不當編輯的法庭文件、《資訊自由法》回應或監管提交文件可能會大規模暴露個人數據,其聲譽和法律後果遠遠超過使用適當的編輯工具所花費的幾秒鐘時間。
當一份文件經過多人之手時,就會出現特別危險的情況。 A 進行適當的修訂,B 開啟檔案並看到黑框,假設修訂已完成,然後將其轉發。但是,如果 A 在沒有意識到的情況下使用了修飾性編輯工具,那麼 B 對黑盒子的信心就是錯誤的。这种信任链问题就是为什么组织应该对单一的、经过验证的编辑工具进行标准化,并培训所有员工正确使用它。
裝飾性編輯的一個特別陰險的變體是白盒編輯。有些使用者在文字上繪製白色矩形,假設白色的白色會使文字不可見。这会失败,因为选择文本或转换文档会显示下面的文本,并且屏幕阅读器软件会大声朗读它,而不管视觉颜色如何。白盒密文根本就不是密文。
嘗試編輯 PDF
無需安裝。直接在您的瀏覽器中工作。
格式轉換期間密文會發生什麼情況
格式轉換透過讀取來源 PDF 並將其內容寫入不同的格式來建立新文件。轉換工具解析 PDF 結構並提取文字、圖像和佈局資訊。對於PDF格式轉換,關鍵問題是轉換工具在密文區域找到什麼文字內容。
如果密文是真實的且文字已從 PDF 內容流中刪除,則轉換工具在這些區域中找不到任何內容,也不會寫入任何內容。輸出文檔中沒有經過編輯的文字。如果密文是裝飾性的,即一個黑框覆蓋,下面仍然存在文本,則轉換工具會找到文本並盡職地將其寫入輸出文檔中。黑框是視覺元素,而不是資料元素,大多數轉換工具在提取文字內容時都會忽略視覺覆蓋。
WukongPDF 提供了一個編輯工具,可以刪除資料層級的內容,而不僅僅是視覺層級的內容。當您透過正確實施的在文件文字流上執行的PDF Security工具套用密文時,刪除的資訊無法透過格式轉換重新出現,因為資料根本不再存在於文件中。
一些 PDF 到 Word 轉換器專門嘗試保留註釋,包括註釋框、突出顯示和繪製的形狀。如果將修飾編輯用作註釋,則轉換器可以將黑色矩形忠實地再現為 Word 形狀。但由於底層文本從未被刪除,Word 文件將同時顯示黑色矩形及其下方的文本,任何移動或刪除該矩形的人都可以選擇、複製並且完全可見。
格式轉換並不是經過編輯的內容外洩的唯一途徑。只需選擇經過修飾編輯的 PDF 中的所有文字並將其貼到文字編輯器中即可顯示經過編輯的內容。使用「尋找」功能在 PDF 中搜尋經過編輯的術語,即使該術語在視覺上被遮蓋,也能找到它。螢幕閱讀器和輔助工具讀取底層文字圖層。這些替代提取路徑都繞過了修飾編輯所依賴的視覺覆蓋。
基於 OCR 的編輯和重新出現的文本問題
掃描的 PDF 為密文添加了另一層複雜性。掃描文件本質上是一張紙的照片。文字不儲存為字符,而是儲存為圖像中的像素。對文字圖層進行操作的標準編輯工具無法從圖像中刪除文本,因此它們會在圖像上繪製黑框。這是必要的修飾編輯,而不是選擇。
要正確編輯掃描的 PDF,您需要一個工具來修改實際影像數據,將編輯區域中的像素值替換為純黑色。修改圖像後,您可以在文件上執行 OCR,以僅為未編輯的內容建立文字圖層。如果在編輯之前進行 OCR,則編輯內容的 OCR 文字位於文字圖層中,並將由任何格式轉換工具提取。
掃描 PDF 密文的一個常見錯誤是先進行 OCR 以使文件可搜索,然後套用密文標記,然後重新儲存。此序列使 OCR 產生的文字圖層在密文標記下完好無損。任何後續轉換或文字擷取都將從 OCR 圖層還原經過編輯的文字。正確的順序是:首先對影像像素進行編輯,然後對清理後的影像進行 OCR。此順序可確保文字圖層永遠不會包含經過編輯的內容。
如何驗證密文是否能順利轉換
確保您的編輯是永久性的唯一方法是對其進行測試。編輯 PDF 後,將其轉換為純文字檔案並蒐索任何編輯內容。如果文字檔案包含經過編輯的數據,則您的編輯無效。更快的驗證方法是在編輯後選擇 PDF 中的所有文字並將其貼到文字編輯器中。如果貼上緩衝區包含經過編輯的文本,則該編輯是裝飾性的。
對於掃描的 PDF,將頁面轉換為 PNG 等影像格式,並以高縮放比例目視檢查編輯區域。如果您可以透過黑色覆蓋層看到原始內容的任何痕跡,特別是在高亮度螢幕上或列印時,則表示密文不充分。可見內容的單一像素有時足以重建原始資訊。
建立包含每個步驟的驗證清單,並要求將其作為文件發布流程的一部分。與因編輯失敗導致資料外洩而花費數小時、數天或數月的補救時間相比,驗證編輯所需的幾分鐘可以忽略不計。對於任何處理個人資料或機密資訊的組織來說,此步驟都不是可選的。
元資料編輯:經常被忽略的層
即使可見文字被正確編輯,PDF 仍然可能透過其元資料外洩敏感資訊。 PDF 元資料包括文件標題、作者姓名、建立日期、修改歷史記錄,有時還包括審閱或簽署文件的人員姓名。格式轉換工具通常會在可能的情況下保留元數據,因此經過編輯的元數據可以像預期的文件內容一樣在轉換中倖存下來。
SANS Institute 於 2025 年進行的一項研究分析了政府網站上的 500 個公開的經過編輯的 PDF,發現其中 12% 的元資料欄位中包含尚未清理的敏感資訊(SANS Institute,“公開發布文件中的隱藏資料”,2025)。在某些情況下,可以使用未編輯的元資料交叉引用和確認文件正文中的編輯資訊。在發布之前清理元資料與編輯可見內容一樣重要。
相同的驗證過程應適用於任何進行轉換的文檔,無論轉換是如何執行的。如果您的工作流程包含自動轉換步驟,請在該自動化中建立編輯驗證檢查,而不是依賴手動抽查。在轉換後的輸出中搜尋已知經過編輯的術語的腳本可以捕獲手動檢查可能遺漏的故障。
將修訂驗證建置到標準文件審核清單中可確保永遠不會跳過此關鍵的安全步驟。
嘗試編輯 PDF
無需安裝。直接在您的瀏覽器中工作。
