您打开 PDF,选择一段文本,按删除键,在其位置键入新文本,然后保存文件。新文本出现在屏幕上。您发送文件。收件人在 PDF 中搜索仅出现在旧文本中的术语,并且搜索找到了它。您认为已删除的旧文本仍在文件中,隐藏在新文本后面,在屏幕上不可见,但完全存在于文档数据中。这种令人不安的经历揭示了 PDF 编辑的一个基本事实:您所看到的并不是全部。
浏览器和基本桌面应用程序中提供的PDF编辑器工具通常将内容添加到PDF,而不是真正替换它。当您删除段落并键入新文本时,编辑器会在旧文本上绘制一个白色矩形,并将新文本放在顶部。旧文本保留在文件数据层中。任何提取文本、搜索文档或将其转换为其他格式的人都可以恢复您认为已删除的内容。

PDF 编辑的实际工作原理:叠加,而不是替换
PDF 文件不适合编辑。该格式被创建为最终输出格式,相当于打印页面的数字格式。当 PDF 编辑器修改文档时,它不会重写原始文本对象。它添加了覆盖旧对象的新对象。原始文本对象保留在文件中,因为删除它们需要重建页面内容流,这比添加覆盖层的操作要复杂得多。
这种覆盖方法对于文档安全性和PDF格式完整性具有重要影响。文档大小随着每次编辑而增加,因为旧内容永远不会被删除,只会被覆盖。经过十次编辑的 PDF 包含原始内容加上九层编辑。即使可见页数和表观内容保持不变,文件大小也会随着每次修订而增加。
覆盖方法以编辑质量换取编辑速度,并且在隐藏内容重新出现之前,这种权衡是不可见的。
文本编辑时重叠问题最为严重。编辑器可能会绘制一个白色矩形来隐藏旧文本并将新文本放置在单独的文本对象中。白色矩形在视觉上覆盖了旧文本,但旧文本仍然在文本层中。屏幕阅读器可以读取旧文本和新文本。搜索发现两者都存在。文本提取工具两者兼而有之。编辑是装饰性的。
正确实施的PDF编辑器密文工具会从文本层中删除内容。同一应用程序中的通用文本编辑工具可能不会。用户合理地期望删除意味着删除,但 PDF 格式使删除比添加更困难,并且许多编辑者选择了更简单的路径。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
旧文本何时可以重新出现
覆盖层隐藏的旧文本可能会在几种常见情况下重新出现。将 PDF 转换为其他格式(例如 Word 或纯文本)会从文档中提取所有文本,包括隐藏的旧文本。转换工具直接读取 PDF 文本层,看不到白色覆盖矩形,因为这些是视觉元素,而不是文本内容。
在不同的查看器中打开 PDF 可能会显示隐藏的文本。以不同方式呈现页面的查看器可能会将白色覆盖矩形放置在错误的位置,或者可能根本不呈现它,从而暴露旧文本。基于浏览器的查看器、移动 PDF 应用程序和旧版桌面查看器都有自己的渲染怪癖,可能会影响叠加定位。
使用查找功能搜索文档会搜索文本层,而不是视觉层。搜索出现在已删除文本中的单词将会找到它,即使该单词在屏幕上不可见。这就是收件人发现文件中仍然存在所谓已删除内容的方式。
屏幕阅读器和辅助工具读取文本层。依靠屏幕阅读器的视障用户会听到当前文本和已删除的文本,通常没有迹象表明他们所听到的某些内容应该被隐藏。 PDF元数据和结构还可以保留文档修改历史记录中先前编辑的痕迹。
如何验证删除的文本是否确实消失
编辑 PDF 后,通过对编辑的文件运行文本提取来验证已删除的文本是否确实已删除。使用 Ctrl+A 复制 PDF 中的所有文本并将其粘贴到文本编辑器中。在粘贴的文本中搜索您删除的短语。如果出现这些短语,则删除是表面性的。或者,将编辑后的 PDF 转换为纯文本文件,然后在其中搜索已删除的内容。
第二种验证方法使用 PDF 查找功能。从已删除的文本中搜索独特的单词或短语。如果查找工具找到它,则该文本仍位于文档数据层中。大多数 PDF 阅读器中的查找工具直接搜索文本内容流,不受视觉覆盖的影响。
对于敏感文档,请使用专用的密文工具而不是通用编辑工具来删除内容。编辑工具旨在从数据层中剥离文本,而不仅仅是在视觉上覆盖它。编辑和编辑之间的区别就是隐藏内容和删除内容之间的区别。
如何正确删除 PDF 中的文本
WukongPDF 提供编辑工具以及通用编辑工具。当您需要从 PDF 中永久删除内容时,请使用密文功能,而不是文本编辑功能。密文从数据层中删除文本,并在其位置放置黑色标记或空白。后续的文本提取、搜索和转换将找不到已编辑的内容,因为它不再存在于文件中。
如果您已经编辑过 PDF 并且需要确保旧文本无法恢复,最安全的方法是将 PDF 打印为新 PDF。打印过程将每个页面呈现为类似图像的表示形式,丢弃所有隐藏的文本层和覆盖层。输出 PDF 仅包含页面上可见的内容。代价是新的 PDF 失去了文本可搜索性、链接和其他交互功能。
另一种方法是仅提取可见文本图层并从中构建新的 PDF,丢弃隐藏内容。这需要一个能够区分可见文本对象和隐藏文本对象并有选择地仅导出可见文本对象的工具。生成的 PDF 是干净的并且仅包含预期内容。
防止意外保留内容
编辑将在外部共享的 PDF 时,建立包含内容验证步骤的工作流程。编辑后,运行文本提取并搜索任何应该删除的内容。对于包含法律、财务或个人数据的文档,在文件脱离您的控制之前,应强制执行此验证步骤。
对于需要大量编辑的文档,请考虑使用 PDF 以外的格式。 Edit the document in its original format, Word, Google Docs, InDesign, and export a fresh PDF when the content is final.从源文档的全新导出不包含编辑历史记录,也不包含隐藏内容。 PDF 的预期用途是作为最终输出格式,而不是作为编辑画布。
问题不仅限于文本。使用基本编辑器从 PDF 中删除的图像也可能保留在文件数据中。编辑器在旧图像上绘制一个白色矩形,并将新图像放在上面。 The original image data is still embedded in the PDF, increasing the file size and remaining extractable by anyone who opens the file with a tool that can enumerate all embedded objects.
PDF 中的敏感信息保留是已记录的安全风险。 2023 年,澳大利亚信号局发布指导警告,使用非专用工具执行 PDF 编辑可能会使编辑的内容可恢复。该指南特别指出,在文本或图像上绘制黑框不会删除底层数据,并且转换后的文档可能会暴露所谓的已删除内容。
共享已编辑且不得包含先前内容痕迹的 PDF 的最安全方法是仅从可见内容重建 PDF。使用 PDF 打印机驱动程序将编辑后的文档打印为新的 PDF。此过程会按照屏幕上显示的方式呈现每个页面,并仅将可见内容写入新文件中。隐藏文本、删除的图像和编辑历史记录都将被丢弃,因为它们不是呈现的页面外观的一部分。
对于处理需要合法披露或信息自由请求的文档的组织来说,了解编辑和编辑之间的区别至关重要。为响应披露请求而生成的包含隐藏但可恢复文本的文档可能会导致严重的法律后果。法院和监管机构将隐藏内容视为公开内容,无论其在页面上是否可见。
对于包含敏感或机密信息的 PDF,最安全的编辑工作流程是编辑源文档,而不是 PDF。对原始 Word 文件、Google Doc 或设计文件进行更改,然后从编辑后的源中导出新的 PDF。全新导出不包含隐藏内容、编辑历史记录,也不包含可由确定的收件人恢复的先前版本的残留数据。
| 场景 | 如何暴露隐藏文本 | 风险级别 |
|---|---|---|
| PDF 到 Word 转换 | 转换器从数据层提取所有文本 | 高:所有隐藏文本变得可见 |
| 在 PDF 中搜索 | Find 函数搜索文本流,而不是视觉层 | 媒介:揭示隐藏文本的存在 |
| 屏幕阅读器访问 | 直接读取文本层,忽略覆盖 | 高:一起阅读新旧文本 |
| 不同的 PDF 查看器 | 备用查看器可能无法正确渲染叠加层 | 媒介:观众之间不一致 |
| 文本提取/复制粘贴 | 全选捕获数据层中的所有文本 | 高:隐藏文本出现在粘贴缓冲区中 |
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
