Tips & Tricks

如何编辑 PDF 中的多行内容而不在编辑区域之间留下可检测的文本片段

从 PDF 中编辑一行文本非常简单。您在文本上绘制一个黑色矩形,它就会从视图中消失。编辑跨多行的文本或跨越多行不同长度的段落是简单方法失败的地方。如果在整个多行块上放置一个大矩形,您还会覆盖相邻的文本、空白区域以及可能应保持可见的相邻段落的部分。如果在每行上放置单独的矩形,则行与行之间的间隙(原始文档的背景颜色会透过该间隙显示)可能会显示文本片段,特别是上一行字母的下行部分和下行字母的上行部分。

一家数字取证公司在 2025 年进行的一项调查发现,在政府机构发布的据称经过编辑的 PDF 中,有 12% 的文本片段可以从各个编辑矩形之间的狭窄间隙中恢复(Forensic Focus,“公共记录中编辑失败的分析”,2025 年)。问题不在于编辑工具出现故障。问题在于,操作员使用了逐行密文技术,但不了解 PDF 中文本定位的工作原理,以及密文区域之间的间隙如何保留足够的每个字符以供重建。

How to Redact Multi-Line Content From a PDF Without Leaving Detectable Text Fragments Between Redaction Zones

PDF 中的文本定位如何造成密文空白

PDF 文本使用相对于页面的坐标进行定位。每个字符或字符组占据一个由其字体规格定义的边界框。字体上升高度、下降深度和行距决定每行文本占用多少垂直空间。当您通过在视觉上将密文矩形与屏幕上的文本对齐来绘制密文矩形时,很自然的趋势是使矩形足够高以覆盖可见字符。但可见字符并不占据文本行边界框的整个垂直范围。像“h”这样的高字母的上升部分是和“l”延伸到典型字符高度之上,并且像“g”这样的字母的下降部分延伸到典型的字符高度之上。和“y”延伸到基线以下。如果您的密文矩形的大小可以覆盖文本正文,但不能覆盖完整的上升部分和下降部分范围,则这些扩展笔画的片段在密文行之间的间隙中仍然可见。

第二个问题源自PDF密文工具,这些工具以屏幕分辨率标记密文区域。当以不同的缩放级别呈现时,在以 150% 缩放显示的页面上绘制的密文矩形的坐标可能不会与底层文本坐标精确对齐。在 150% 缩放时,即使是两三个像素的间隙也会转化为在 100% 缩放时一两个像素的间隙,这足以保留字符的可识别片段。

WukongPDF

尝试编辑 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

编辑多行内容:正确的矩形放置

编辑跨越多行的文本块的最安全方法是使用单个连续的编辑区域,该区域覆盖从第一行顶部到最后一行底部的整个矩形区域,从最左边字符的左边缘水平延伸到最右边字符的右边缘。这意味着如果文本左对齐,则覆盖一行的最后一个单词和右边距之间的空白,或者如果文本对齐,则覆盖整个行宽度。关键原则是密文区域必须是连续的,没有内部间隙,并且必须延伸到所有四个侧面的可见文本之外,以考虑上升部分、下降部分和任何隐藏的文本定位偏移。

对于句子中包含换行符且文本自然换行的段落,密文区域应该是从第 1 行顶部到第 N 行底部的单个矩形。对于每行都是单独条目的段落(例如列表或表格),当且仅当每个矩形在所有四个边上超出可见文本至少 6 个点并且每行之间存在明显的非文本间隙(例如表格边框或水平线)时,每行单独的矩形才是可接受的。如果有疑问,请使用单个连续区域。

验证密文区域是否覆盖所有文本片段

应用密文后,验证步骤不是可选的。打开密文文件并使用文本选择工具尝试选择密文区域中的文本。如果可以选择任何文本,则底层文本流不会被删除,并且仍然存在于文件中。许多编辑工具都提供“清理”功能。或“删除隐藏信息”应用编辑后的功能。此步骤会从 PDF 中删除所有编辑区域的基础文本内容,使其无法恢复。如果您的工具不提供此功能,则密文只是装饰性覆盖,任何在文本编辑器或 PDF 结构查看器中打开文件的人都可以恢复文本。

第二种验证方法是将编辑后的 PDF 导出为纯文本。密文区域的导出输出中出现的任何文本均表示密文不完整。该区域的文本流未正确删除。返回并在启用清理选项的情况下重新应用密文,或者使用其他工具来正确剥离文本内容,而不仅仅是在视觉上覆盖它。

特殊情况:编辑表格、列和表单中的文本

表格提出了一个独特的挑战,因为相邻单元格中的文本可能非常靠近,并且如果矩形太大,覆盖一个单元格的密文可能会渗透到相邻单元格中。表格的规则是编辑整个单元格而不是单元格内的文本。如果特定单元格包含敏感信息,请编辑整个单元格区域(包括单元格边框),以便表格结构清楚地表明该单元格的信息已被编辑。对于无法编辑整个列的窄列,请将编辑矩形扩展到列边框,并使用列网格作为精确放置的指南。

PDF 表单又增加了一层复杂性,因为表单字段数据与可见页面内容分开存储。编辑表单字段内的可视文本不会从 PDF 内部数据结构中删除字段值。任何在支持表单的 PDF 查看器中打开文件的人仍然可以单击该字段并查看原始值。要编辑表单字段数据,您必须首先拼合表单字段,这会将字段值转换为常规页面内容,然后将密文应用到拼合内容。

常见的编辑错误及其后果

最具破坏性的编辑错误,也是导致多起公开披露事件的错误,是使用注释工具绘制的深色矩形,而不是专用的编辑工具。注释是视觉叠加。任何打开 PDF 的人都可以移动、删除它们或使其透明。下面的文本保持完整且完全可搜索。正确的PDF隐私保护需要删除底层数据,而不仅仅是将其隐藏起来。始终使用专用的密文工具(切勿使用注释或绘图工具)来应用密文。

第二个常见错误是仅编辑可见页面内容,而保持元数据不变。 PDF 文档属性可能包含原始文件名、作者姓名和创建日期,这些信息揭示了密文要隐藏的信息。编辑可见内容后,检查文档属性并删除或清理可能包含敏感信息的任何元数据字段。 WukongPDF 提供了一个组合的编辑工作流程,可以在单个操作中处理可见内容和元数据,从而降低基于元数据的信息泄漏的风险。

未能考虑 PDF 增量保存历史是第三个重大错误。通过增量更新保存的 PDF 文件保留页面内容的所有先前版本。应用于页面当前版本的修订将从该版本中删除文本,但该文本仍然可以从文件中存储的先前增量保存中恢复。解决方案是使用完整保存而不是增量保存来保存编辑后的文档,增量保存会合并所有更改并丢弃修订历史记录。

多行模式的自动编辑

当需要在多个页面或多个文档中编辑相同类型的信息(例如社会安全号码、电子邮件地址或电话号码)时,手动放置矩形就变得不切实际且容易出错。基于模式的自动密文使用正则表达式来识别要密文的文本字符串,并在每次出现时自动绘制密文区域。优点是完整性:正确编写的模式可以捕获每个实例,包括操作员在手动检查期间可能错过的实例。缺点是写得不好的模式会产生误报,从而编辑本应保持可见的文本。

要安全地使用基于模式的密文,如果您的工具支持,请首先在预览模式下运行该模式,这会突出显示匹配项而不应用密文。查看匹配示例以验证该模式是否捕获了预期内容而没有捕获其他内容。根据需要调整图案,再次预览,然后将密文应用到整个文档。应用后,运行文本导出验证以确认没有与目标内容一起删除任何意外内容。

WukongPDF

尝试编辑 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →