Others

您能否编辑 PDF 中的信息,使其在格式转换后仍能幸存?

您可以使用 PDF 编辑器的编辑工具从 PDF 中编辑社会安全号码。您会看到出现黑框,保存文件并发送。收件人将 PDF 转换为 Word 进行编辑,并发现社会安全号码在转换后的文档中完全可见,就好像从未发生过编辑一样。这不是一个错误。当文档进行格式转换时,这是大多数编辑工具的预期行为,并且它已经导致了真正的数据泄露。

2024 年,英国信息专员办公室报告称,PDF 编辑不当是涉及政府文件的数据泄露的第三大常见原因(ICO,“数据安全事件趋势”,2024 年)。最常见的根本原因不是无法编辑,而是无法验证编辑是否在文档的整个生命周期(包括其可能在下游进行的任何格式转换)中幸存下来。

Can You Redact Information From a PDF So It Survives Format Conversion

正确的 PDF 编辑如何在数据级别发挥作用

正确的PDF编辑与在文本上绘制黑框有着根本的不同。当您使用真正的密文工具时,会发生两件事:可见文本被黑色矩形覆盖,并且底层文本内容从 PDF 的文本层中删除。字符本身将从文件的数据流中删除。阅读器应用程序在黑匣子下没有任何内容可显示,因为那里什么也没有。

当您使用注释工具在文本上绘制黑色矩形并将其称为“编辑”时,您就完成了安全专家所说的“装饰性编辑”。文本仍然存在于 PDF 的数据层中,完好无损且可提取。任何人都可以选择文本、复制它、粘贴到其他地方,并阅读黑框下的每个单词。将 PDF 转换为任何其他格式,转换工具会读取底层文本,而不是视觉叠加层。编辑消失了,因为它从一开始就不是真实的。

真实编辑和表面编辑之间的区别非常重要,以至于政府机构和律师事务所现在将其纳入对处理敏感文件的员工的强制性培训中。一份未经不当编辑的法庭文件、《信息自由法》回应或监管提交文件可能会大规模暴露个人数据,其声誉和法律后果远远超过使用适当的编辑工具所花费的几秒钟时间。

当一份文件经过多人之手时,就会出现特别危险的情况。 A 进行适当的修订,B 打开文件并看到黑框,假设修订已完成,然后将其转发。但是,如果 A 在没有意识到的情况下使用了修饰性编辑工具,那么 B 对黑匣子的信心就是错误的。这种信任链问题就是为什么组织应该对单一的、经过验证的编辑工具进行标准化,并培训所有员工正确使用它。

装饰性编辑的一个特别阴险的变体是白盒编辑。一些用户在文本上绘制白色矩形,假设白色的白色会使文本不可见。这会失败,因为选择文本或转换文档会显示下面的文本,并且屏幕阅读器软件会大声朗读它,而不管视觉颜色如何。白盒密文根本就不是密文。

WukongPDF

尝试编辑 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

格式转换期间密文会发生什么情况

格式转换通过读取源 PDF 并将其内容写入不同的格式来创建新文档。转换工具解析 PDF 结构并提取文本、图像和布局信息。对于PDF格式转换,关键问题是转换工具在密文区域找到什么文本内容。

如果密文是真实的并且文本已从 PDF 内容流中删除,则转换工具在这些区域中找不到任何内容,也不会写入任何内容。输出文档中没有经过编辑的文本。如果密文是装饰性的,即一个黑框覆盖,下面仍然存在文本,则转换工具会找到文本并尽职地将其写入输出文档中。黑框是视觉元素,而不是数据元素,大多数转换工具在提取文本内容时都会忽略视觉覆盖。

WukongPDF 提供了一个编辑工具,可以删除数据级别的内容,而不仅仅是视觉级别的内容。当您通过正确实施的在文档文本流上运行的PDF Security工具应用密文时,删除的信息无法通过格式转换重新出现,因为数据根本不再存在于文件中。

一些 PDF 到 Word 转换器专门尝试保留注释,包括注释框、突出显示和绘制的形状。如果将修饰编辑用作注释,则转换器可以将黑色矩形忠实地再现为 Word 形状。但由于底层文本从未被删除,Word 文档将同时显示黑色矩形及其下方的文本,任何移动或删除该矩形的人都可以选择、复制并且完全可见。

格式转换并不是经过编辑的内容泄露的唯一途径。只需选择经过修饰编辑的 PDF 中的所有文本并将其粘贴到文本编辑器中即可显示经过编辑的内容。使用“查找”功能在 PDF 中搜索经过编辑的术语,即使该术语在视觉上被遮盖,也能找到它。屏幕阅读器和辅助工具读取底层文本层。这些替代提取路径都绕过了修饰编辑所依赖的视觉覆盖。

基于 OCR 的编辑和重新出现的文本问题

扫描的 PDF 给密文添加了另一层复杂性。扫描文档本质上是一张纸的照片。文本不存储为字符,而是存储为图像中的像素。对文本图层进行操作的标准编辑工具无法从图像中删除文本,因此它们会在图像上绘制黑框。这是必要的修饰编辑,而不是选择。

要正确编辑扫描的 PDF,您需要一个工具来修改实际图像数据,将编辑区域中的像素值替换为纯黑色。修改图像后,您可以在文档上运行 OCR,以仅为未编辑的内容创建文本图层。如果在编辑之前进行 OCR,则编辑内容的 OCR 文本位于文本图层中,并将由任何格式转换工具提取。

扫描 PDF 密文的一个常见错误是首先进行 OCR 以使文档可搜索,然后应用密文标记,然后重新保存。此序列使 OCR 生成的文本层在密文标记下完好无损。任何后续转换或文本提取都将从 OCR 层恢复经过编辑的文本。正确的顺序是:首先对图像像素进行编辑,然后对清理后的图像进行 OCR。此顺序可确保文本层永远不会包含经过编辑的内容。

如何验证密文是否能顺利转换

确保您的编辑是永久性的唯一方法是对其进行测试。编辑 PDF 后,将其转换为纯文本文件并搜索任何编辑内容。如果文本文件包含经过编辑的数据,则您的编辑无效。更快的验证方法是在编辑后选择 PDF 中的所有文本并将其粘贴到文本编辑器中。如果粘贴缓冲区包含经过编辑的文本,则该编辑是装饰性的。

对于扫描的 PDF,将页面转换为 PNG 等图像格式,并以高缩放比例目视检查编辑区域。如果您可以通过黑色覆盖层看到原始内容的任何痕迹,特别是在高亮度屏幕上或打印时,则说明密文不充分。可见内容的单个像素有时足以重建原始信息。

创建包含每个步骤的验证清单,并要求将其作为文档发布流程的一部分。与因编辑失败导致数据泄露而花费数小时、数天或数月的补救时间相比,验证编辑所需的几分钟可以忽略不计。对于任何处理个人数据或机密信息的组织来说,此步骤都不是可选的。

元数据编辑:经常被忽视的层

即使可见文本被正确编辑,PDF 仍然可能通过其元数据泄露敏感信息。 PDF 元数据包括文档标题、作者姓名、创建日期、修改历史记录,有时还包括审阅或签署文档的人员姓名。格式转换工具通常会在可能的情况下保留元数据,因此经过编辑的元数据可以像预期的文档内容一样在转换中幸存下来。

SANS Institute 于 2025 年进行的一项研究分析了政府网站上的 500 个公开的经过编辑的 PDF,发现其中 12% 的元数据字段中包含尚未清理的敏感信息(SANS Institute,“公开发布文档中的隐藏数据”,2025)。在某些情况下,可以使用未编辑的元数据交叉引用和确认文档正文中的编辑信息。在发布之前清理元数据与编辑可见内容一样重要。

相同的验证过程应适用于任何进行转换的文档,无论转换是如何执行的。如果您的工作流程包括自动转换步骤,请在该自动化中构建编辑验证检查,而不是依赖手动抽查。在转换后的输出中搜索已知经过编辑的术语的脚本可以捕获手动检查可能遗漏的故障。

将修订验证构建到标准文档审核清单中可确保永远不会跳过这一关键的安全步骤。

WukongPDF

尝试编辑 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →