您有一份 60 页的合同,在与另一方共享之前,您需要删除客户姓名、地址、帐号和任何其他机密信息的所有实例。该名称在 30 个不同的页面中出现了 47 次。手动查找和编辑每个事件将花费一个小时,而且您几乎肯定会错过一些事件。搜索和编辑功能可以在几秒钟内完成这项工作,在一次操作中找到每一个匹配项并编辑它们。
当您确切知道哪些单词、短语或模式需要删除时,基于搜索的编辑是清理文档的最有效方法。它将文本搜索与永久内容删除相结合,如果操作正确,它可以保证目标文本的实例不会在文档中保留下来。

PDF 密文与在文本上绘制黑框有何不同
一个常见且危险的错误是将编辑与绘图混淆。有些人打开 PDF,在敏感文本上绘制黑色矩形,并假设该文本已隐藏。它不是。黑色矩形是位于页面顶部的注释。原始文本仍在其下面的文件中。任何在可以隐藏注释的查看器中打开 PDF 的人,或者从页面复制并粘贴文本的人,都可以恢复所谓的已编辑信息。这个错误导致了现实世界的数据泄露,法院文件、政府文件和公司披露无意中暴露了经过编辑的信息,因为作者使用了绘图工具而不是编辑工具。
真正的PDF 密文 会永久删除文件中的文本和图像数据。当您应用密文时,该工具会从 PDF 数据流中删除底层内容,并在其位置放置不透明的覆盖层。原来的信息已经没有了。它无法通过隐藏注释、复制文本或检查文件的内部结构来恢复。对于任何涉及隐私或机密性的文档,真正的编辑是唯一可接受的方法。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
分步:查找并编辑每个出现的单词
在支持基于搜索的密文的工具中打开 PDF。编辑工具包括搜索和编辑功能。输入您要查找的单词或短语。该工具搜索整个文档并列出每个匹配项,以及页码、周围上下文和匹配预览。查看列表以确认您想要编辑所有实例。有时,一个单词既作为敏感信息又作为通用术语出现。如果客户的姓氏是“Rice”而且文档中还讨论了商品大米,你需要单独查看每个匹配项,而不是盲目地全部编辑。
查看匹配项后,选择您要编辑的匹配项。您可以选择单个匹配项、特定页面上的所有匹配项或文档中的所有匹配项。应用修订。该工具将永久删除选定的文本,并在每个位置放置一个黑框或您选择的密文标记。以新名称保存编辑后的文件。原始未编辑文件应与已编辑版本分开安全存储。编辑是不可逆的,这就是重点。如果您只有经过编辑的版本,则您不会意外发送未经过编辑的版本。
编辑模式:电子邮件地址、电话号码和 ID 号码
除了确切的文字之外,许多编辑场景都涉及模式。文档中的每个电子邮件地址都需要删除。每个格式为 123-45-6789 的社会安全号码都需要删除。每个 16 位格式的信用卡号都需要删除。高级编辑工具支持正则表达式或正则表达式,它定义模式而不是精确的文本。像 \b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z|a-z]{2,}\b 这样的正则表达式匹配电子邮件地址。 \b\d{3}-\d{2}-\d{4}\b 等正则表达式与社会安全号码匹配。
基于模式的编辑功能强大,但需要谨慎。太宽泛的正则表达式将匹配您不打算编辑的文本。太窄的正则表达式会错过不完全符合模式的实例。运行基于模式的密文后,在应用之前手动检查每个匹配项。正则表达式查找候选者。人类的判断决定哪些候选者实际上包含敏感信息。 WukongPDF 的PDF 编辑器 支持精确匹配搜索和基于模式的密文搜索,并具有匹配审核界面,可在提交密文之前显示上下文中的每个匹配项。
验证编辑是否完成
编辑后,通过两次测试验证结果。首先,目视扫描文档。已编辑区域应清楚地标有您选择的覆盖层、黑框、白框或自定义文本(例如[已编辑])。不应显示任何敏感文本。其次,尝试提取文本。在任何 PDF 查看器中,按 Ctrl-A 选择页面上的所有文本,然后将其复制并粘贴到文本编辑器中。粘贴的文本不应包含任何经过编辑的信息。如果粘贴的输出中出现密文,则说明密文未正确应用,覆盖层被放置为注释而不是永久内容删除,并且文档不安全。
第三,在经过编辑的 PDF 中搜索经过编辑的术语。按 Ctrl-F 并搜索敏感词或短语。搜索应返回零结果。如果找到任何匹配项,则密文会错过它们,如果文本存储为图像而不是可选文本,或者文本出现在文档元数据字段而不是页面内容中,则可能会发生这种情况。对于基于图像的文本,对经过编辑的文件运行 OCR 并搜索 OCR 输出。如果 OCR 识别出所谓的已编辑文本,则图像未经过编辑,只有文本图层经过编辑,您还需要编辑图像层。 WukongPDF 的PDF 隐私 密文工具可同时密文文本层和图像层,从而缩小了这一共同差距。
编辑扫描文档和纯图像 PDF
扫描的 PDF 提出了独特的编辑挑战,因为文本是图像的一部分,而不是单独的文本层。基于搜索的密文无法找到图像中的单词。没有可搜索的文字。要编辑扫描文档,您必须首先运行 OCR 以创建可搜索文本图层,然后搜索该文本图层以查找并标记编辑区域,然后将编辑应用到底层图像。文本层标识敏感信息在页面上的位置。然后,编辑工具会从图像中永久删除这些像素区域。
编辑扫描文档后,对编辑版本再次运行 OCR,并验证新识别的文本不包含编辑信息。这种双重 OCR 验证捕获了扫描文档密文最常见的失败模式:OCR 引擎找到了文本,您将其标记为密文,但密文矩形稍微未对齐,并且没有完全覆盖文本像素,导致字符片段可见。一个字母的几个像素足以让有决心的人重建原始单词。将编辑区域放大至 200%,并确认完整的像素级覆盖。
除了文字和模式之外,彻底的编辑过程还应该检查文档元数据。每个页面都经过完美编辑的 PDF 仍然可能通过其文档属性泄露敏感信息:作者字段可能包含信息被编辑者的姓名,标题可能包含机密项目名称,关键字字段可能列出应删除的术语。编辑页面内容后,打开文档属性并清除作者、主题、标题和关键字字段。如果 PDF 包含嵌入的文件附件(有时在包含支持电子表格或数据文件的报告中会发生这种情况),则必须单独编辑或删除这些附件。它们不受页面级编辑的影响。全面的修订清单涵盖三层:页面内容、元数据字段和嵌入文件。缺少其中任何一层都可能会取消对其他两层的保护。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
