研究小组正在准备一个数据集供公开发布。该 PDF 包含数百名参与者的调查回复,每行显示姓名、人口统计数据、回复分数和自由文本评论。资助机构要求公开数据,但道德审查委员会要求在发布前删除参与者姓名。其余数据、分数、人口统计、评论必须保持完全可见且机器可读。仅编辑名称,同时保留其他所有内容是一项精确的任务,需要工具能够将名称与周围的数据区分开来,并在不干扰相邻内容的情况下将其删除。
标准 PDF 编辑工具旨在遮盖页面的矩形区域。他们会编辑矩形内的所有内容,无论内容是什么。当名称位于必须保持可见的数字分数和人口统计代码旁边的表格单元格中时,在名称上绘制矩形也会覆盖相邻列的一部分。结果是 PDF 中的名称已被删除,但保留的列中的数据也已损坏。仅删除名称文本的有针对性的修订需要采用根本不同的方法来识别和删除内容。根据 2025 年学术出版调查,34% 以 PDF 形式发布的研究数据集由于不精确的编辑方法而在非姓名列中包含无意的数据丢失(COPE,“研究数据出版完整性”,2025)。对结构化数据实施适当的PDF编辑技术需要超越基于矩形的工具,转向模式感知的编辑方法,以保持相邻数据字段的完整性。

为什么基于矩形的密文无法在密集布局中仅删除名称
PDF 修订的工作原理是用黑色覆盖层覆盖页面的某个区域,然后从文档的数据流中删除底层内容,这样就无法通过复制或检查 PDF 的内部结构来恢复它。密文工具将矩形注释应用于页面,当应用或刻录密文时,与该矩形相交的所有内容、文本字符、矢量图形和图像将被永久删除并替换为黑框。
在典型的研究数据表中,像 Smith, J. 这样的名字占据左侧的一个窄列,紧邻右侧的是年龄、性别、收入等级和响应分数的列。覆盖 Smith, J. 的矩形不可避免地会延伸到年龄列,至少部分覆盖年龄值的第一位数字。如果矩形绘制得足够紧密以避免与相邻列重叠,它仍然可能会剪掉某些字母的尾部,例如 Smith 的 y 中的下降部分,留下可以读取的可见片段。矩形方法强制在完全名称删除和对相邻数据的零附带损害之间进行权衡,并且在大多数实际表布局中,不存在无需在每个单元格进行手动调整即可同时满足这两个要求的矩形大小。具有数百或数千行的大型数据集使得每个单元格的手动调整变得不切实际。这是使基于文本的PDF隐私编辑对于研究应用如此重要的根本限制。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
使用基于模式的搜索仅选择要密文的名称
精确名称密文的解决方案是使用密文工具的搜索和密文功能,该功能将密文应用于与特定模式匹配的文本,而不是特定的几何区域。您无需在名称上绘制矩形,而是定义一个搜索模式来描述名称在数据集中的样子,并且该工具会查找并编辑与该模式匹配的每个文本实例。
对于名称格式为 Last, First Middle 的数据集,搜索模式可能使用正则表达式,如 [A-Z][a-z]+、[A-Z][a-z]*,它匹配大写单词后跟一个逗号和一个空格,后跟一个或多个大写单词。密文工具会在整个 PDF 中搜索与此模式匹配的文本,并对每个匹配项应用密文覆盖。由于密文应用于文本匹配区域而不是手动绘制的矩形,因此叠加层精确地适合文本,并且不会延伸到相邻列。
基于模式的方法的成功取决于名称格式的一致性以及它们与文档中其他文本的区别程度。如果人口统计代码或响应数据也包含与相同模式匹配的文本,这些文本也将被编辑。在对整个文档运行该模式之前,先在单个页面上测试该模式。查看测试页上的密文标记,并确认仅标记了预期的名称。根据需要调整图案以缩小或扩大匹配范围,然后将最终图案应用到整个文档。 WukongPDF 的 PDF 编辑工具支持基于搜索的文本操作,可用作在应用密文之前识别名称位置的准备步骤。
处理阻止模式匹配的名称格式
真实世界的名称数据集包含破坏简单正则表达式模式的边缘情况。包含非 ASCII 字符的名称(例如 Munoz, J. 或 O'Reilly, M.)不符合标准 [A-Z][a-z]+ 模式。像 Smith-Jones, T. 这样的连字符姓氏可能会跨行分割或由不同的 PDF 生成工具进行不同的处理。中间名首字母有时出现有时不出现的姓名(例如 Doe, J. K. 与 Doe, J.)会导致不一致的匹配,其中一些姓名匹配,而另一些姓名丢失。
| 名称格式挑战 | 示例 | 模式解决方案 |
|---|---|---|
| 重音字符 | 穆尼奥斯,J. | 扩展字符类:[A-ZÀ-ÿ][a-zà-ÿ]+ |
| 姓氏中的撇号 | 奥莱利,M. | 添加撇号:[A-Z][A-Za-z']+, [A-Z] |
| 带连字符的姓氏 | 史密斯-琼斯,T. | 添加连字符:[A-Z][A-Za-z-']+、[A-Z] |
| 可选中间名首字母 | Doe, J. vs Doe, J.K. | 可选第二个首字母:[A-Z][a-z]+、[A-Z]([A-Z])? |
| 多字姓氏 | 德拉克鲁斯,A. | 多字支持:[A-Z][a-z]*( [a-z]+)*, [A-Z] |
当基于模式的搜索无法可靠地涵盖所有名称变体时,两遍方法可以填补空白。首先,应用与最常见的名称格式匹配的模式。其次,使用特定姓氏搜索手动搜索该模式遗漏的其余姓名变体。通过在密文工具的搜索字段中输入不常见的姓氏并对每个匹配项应用密文,可以直接搜索不常见的姓氏。每个名称的手动传递需要更长的时间,但仅在自动传递无法处理的边缘情况下才需要。对于包含 500 个姓名的数据集,精心设计的模式可能会捕获其中的 480 个姓名,留下 20 个姓名供人工审核和编辑。
验证仅名称被编辑并且没有数据丢失
应用姓名编辑后,系统地验证每个姓名均已删除且非姓名数据没有受到影响。验证过程与编辑本身一样重要,因为不完整的编辑导致某些名称可见是侵犯隐私,而过度编辑从相邻列中删除数据则导致数据完整性失败。
分三遍执行验证。首先,以 200% 的缩放比例对编辑后的 PDF 进行可视化扫描,滚动浏览每一页并检查每个名称单元格是否显示黑框以及其旁边的每个数据单元格是否显示其原始值。其次,在经过编辑的 PDF 上运行 PDF 文本提取工具,并验证提取的文本是否包含零个应经过编辑的名称实例。文本提取显示密文覆盖在视觉上覆盖但未能从底层文本层中删除的名称。视觉上看起来完整但文本可提取的修订是研究出版中最常见的修订错误,它导致了许多广为人知的数据泄露。
第三,对于高风险数据集,执行差异分析:从原始 PDF 和编辑后的 PDF 中提取文本,并验证两个文本提取之间的唯一区别是要进行编辑的特定名称字符串。任何其他差异都表明必须调查和纠正附带的修订损害。差分方法需要脚本化的文本比较,这需要额外的时间,但提供了数学上的确定性,即没有数据与名称一起被意外删除。用于公共档案的研究数据集受益于这种级别的验证,因为已发布数据集中的编辑错误的声誉成本通常超过验证本身的成本(欧洲数据保护委员会,“已发表研究中的数据匿名化指南”,2025)。
记录道德审查和合规的编辑方法
道德审查委员会和机构审查委员会越来越需要记录用于匿名研究数据的编辑方法。记录的方法表明,编辑是系统执行的、经过彻底验证的,并且如果数据集需要重新发布或更正,则可以复制。
密文方法文档应包括用于识别姓名的特定模式或搜索词、用于执行密文的工具和版本、执行密文的日期和执行密文的人员的姓名、为确认完整的姓名删除和零数据丢失而采取的验证步骤,以及差异分析结果(如果执行)。将此文档与已发布的数据集放在一起,以便未来的研究人员和审计人员可以评估修订的可靠性和完整性。该文件还可作为道德审查委员会合规审计的程序记录。包括 NIH 和 NSF 在内的研究资助机构现在明确要求在其数据管理和共享计划中采用数据匿名方法(NIH,“数据管理和共享政策”,2025),而修订文档是遵循该方法的主要证据。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
