一份长达 300 页的法律证据开示文件包含分散在各个页面中的电话号码、电子邮件地址和社会安全号码。手动查找和编辑每一项都需要花费数天的时间,而且仍然有丢失一些的风险。基于模式的自动密文在整个文档中搜索与特定格式、电话号码、电子邮件地址、信用卡号相匹配的文本,并在单个操作中将密文应用于每个匹配项。问题不在于这是否可能,而在于它的准确性如何以及需要什么样的监督。
基于模式的PDF修订使用正则表达式来识别与预定义或自定义模式匹配的文本。电话号码模式与 (555) 123-4567 或 555-123-4567 等序列匹配。电子邮件模式与 name@domain.com 等序列匹配。社会安全号码模式与 ###-##-#### 匹配。该工具扫描 PDF 文本层,找到每个匹配项,并同时编辑它们。

基于模式的编辑如何工作
密文工具首先从 PDF 内容流中提取文本并搜索指定的模式。找到匹配项后,该工具会记录该页面上匹配文本的页码和坐标。在所有页面上完成搜索后,该工具会将密文标记应用到每个记录的位置,覆盖文本并将其从文本层中删除。
基于模式的编辑的准确性取决于两个因素:模式的精度和 PDF 文本层的质量。精确的模式可以捕获预期的文本,同时避免错误匹配。电话号码模式必须区分实际电话号码和恰好具有相同长度的其他数字序列,例如发票号码、日期范围或零件号。
模式匹配可以找到人眼需要数小时才能找到的内容。
文本层质量决定了图案是否能够找到文本。如果 PDF 是使用 OCR 从扫描文档创建的,则 OCR 可能会错误识别某些字符。数字“5”被误识别为“S”的电话号码将与电话号码模式不匹配。编辑工具无法编辑它找不到的内容,并且 OCR 错误会在模式检测中造成差距。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
常见模式及其陷阱
社会安全号码是最常见的编辑模式,并且最有可能产生错误匹配。在正确位置带有连字符的九位数字序列可能是社会安全号码,但也可能是产品代码、文档 ID 或以不常见格式编写的日期范围。基于模式的编辑无法理解上下文。它符合模式,但不符合含义。
电子邮件地址更容易准确匹配,因为 @ 符号具有独特性,并且很少出现在电子邮件地址之外。但是,基于文本的模式搜索可能无法匹配作为 mailto 链接而不是可见文本嵌入 PDF 中的电子邮件地址。编辑工具搜索可见文本层,而不是底层链接注释。
信用卡号遵循特定的格式,即 16 位数字,有时分为四组,可通过 Luhn 算法检查。包括 Luhn 验证在内的基于模式的编辑工具可显着减少错误匹配,因为随机 16 位序列很少能通过检查。如果您的密文工具不包括 Luhn 验证,请在应用密文之前手动检查信用卡匹配。
自定义模式允许您编辑特定于组织的信息。员工 ID 格式、客户帐号模式或内部项目代码可以定义为自定义正则表达式。自定义模式的PDF安全性好处是它们针对通用模式会错过的信息,使编辑更加全面。
在应用密文之前检查模式匹配
在未先检查匹配项的情况下,切勿应用基于模式的密文。通过检查步骤,您可以取消选择错误匹配并手动添加错过的匹配。产生 500 个匹配的模式可能有 480 个正确匹配和 20 个错误匹配。如果应用 20 个错误匹配,则会错误地编辑应保持可见的文本。审查步骤可以防止这种情况发生。
大多数密文工具在审阅面板中将匹配项显示为突出显示的文本。滚动浏览匹配列表并根据页面上的上下文验证每个匹配列表。取消选择明显不是预期目标的匹配项。这种手动检查比手动查找每个实例更快,因为该工具已经完成了搜索,但它对于准确性仍然至关重要。
应用密文并保存文档后,通过将 PDF 转换为纯文本并在文本输出中搜索密文模式来验证密文。如果文本文件中出现任何模式,则密文未完成。此编辑后验证捕获文本层中但未成功编辑的模式匹配。
基于模式的编辑的局限性
基于模式的密文仅适用于文本存储为字符的基于文本的 PDF。未经 OCR 处理的扫描 PDF 将文本存储为图像,并且不包含供模式匹配器搜索的字符数据。在尝试基于模式的密文之前,对扫描的 PDF 运行 OCR,了解 OCR 错误会导致丢失某些模式匹配。
以矢量轮廓而不是字符代码存储的文本(例如已在设计软件中转换为路径的文本)对于基于模式的编辑是不可见的。文本看起来像页面上的文本,但 PDF 包含每个字符形状的绘图说明,而不是字符代码。基于模式的密文无法找到以此格式存储的文本。
PDF 隐私 法规越来越要求组织证明正确执行了编辑。基于模式的编辑报告记录了搜索了哪些模式、找到了多少匹配项、应用了多少个以及手动覆盖了多少个模式,从而提供了编辑过程中尽职调查的证据。
WukongPDF 通过浏览器提供编辑工具,可以在本地处理 PDF。基于模式的密文在文档文本层中搜索匹配的模式并应用密文标记。基于浏览器的方法在编辑过程中将文档数据保留在您的设备上。
对于仅应隐藏部分匹配文本的模式,有时需要进行部分编辑。仅应显示最后四位数字的电话号码,或应保持域可见的电子邮件地址。支持捕获组的基于模式的密文工具可让您定义匹配模式的哪些部分要密文以及哪些部分保持可见。
应用基于模式的密文后,在文档中搜索密文信息的片段。如果域是唯一的,则编辑为 j***@domain.com 的电子邮件地址可能仍可识别。为了最大程度地保护隐私,请编辑整个匹配模式,而不是尝试部分编辑。
包含相同模式的基于文本和基于图像的实例的文档(例如同时包含打字页面和扫描页面的 PDF),基于模式的密文处理基于文本的实例,而基于图像的密文必须单独应用于扫描页面。
基于模式的编辑是综合文档清理策略的组成部分。其他组件包括元数据删除、隐藏内容删除以及评论和注释剥离。已彻底进行模式编辑但在元数据中仍包含作者姓名和组织的文档仍可能泄漏敏感信息。
对于法律发现文档,基于模式的编辑必须与人工审核相结合。模式可以查找电话号码,但无法找到对不包含电话号码的电话对话的引用。手动审查可以捕获模式匹配遗漏的上下文引用。
跨组织共享的模式库可以提高编辑一致性。一家处理数百份发现文档的律师事务所为常见敏感数据类型开发了一个经过测试的模式库。在整个公司共享这个库可以确保每个文档都使用相同的模式进行编辑。
在将新模式应用到完整文档之前,在示例文档上测试新模式至关重要。由于格式变化、OCR 伪影或不常见的数据格式,在测试中完美运行的模式可能会在实际文档中产生意外的匹配。
修订审核跟踪应与修订文档一起保存。审计跟踪记录了使用了哪些模式、每个模式找到了多少个匹配项,以及是否有任何匹配项被手动覆盖。该文档支持质量保证和法规遵从性。
在运行密文之前,可以在 PDF 工具之外测试模式匹配的正则表达式。在线正则表达式测试器可让您输入示例文本并查看哪些模式匹配。根据文档文本的代表性样本测试您的电话号码、电子邮件和 SSN 模式,以验证它们是否捕获了预期目标。
与手动编辑相比,基于模式的编辑节省了大量时间。包含 500 个敏感模式实例的文档需要基于模式的工具在一分钟内查找和编辑。手动编辑同一文档需要几个小时。
对于将定期编辑的文档(例如始终包含相同类型敏感数据的月度报告),请将模式集保存为预设。将预设应用于每个新报告可确保一致的编辑,而无需每次重新配置模式。
培训员工正确的编辑技术与拥有正确的工具同样重要。基于模式的编辑工具在未经训练的人手中可能会产生错误的安全感。工作人员应该了解该工具可以做什么和不能做什么、审查匹配的重要性以及编辑后验证步骤。
对于受 GDPR、HIPAA 或类似隐私法规约束的组织,基于模式的编辑应成为记录的数据保护流程的一部分。该流程应指定要搜索哪些模式、由谁审查匹配项以及在发布文档之前如何验证修订内容。
| 模式 | 正则表达式示例 | 错误匹配风险 | 验证提示 |
|---|---|---|---|
| 电话(美国) | \(\d{3}\) \d{3}-\d{4} | 中:匹配发票号码 | 检查上下文;取消选择非电话匹配 |
| 电子邮件 | \S+@\S+\.\S+ | Low:@有特色 | 验证域名是真实的电子邮件域名 |
| 社会保障号码 | \d{3}-\d{2}-\d{4} | 高:匹配产品代码 | 对 SSN 模式至关重要的手动审核 |
| 信用卡 | \d{4}-\d{4}-\d{4}-\d{4} | Luhn 检查低 | 启用 Luhn 验证(如果可用) |
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
