作为法律证据开示回复的一部分,一份 PDF 文件会出现在您的办公桌上。文档属性面板为空。作者、创建日期和修改历史字段已被有意或无意地删除。您需要确定该文档的创建时间和创建者。通常回答这些问题的元数据已经消失,但 PDF 可能仍包含其来源的可恢复证据。
当文档通过旨在在共享之前删除潜在敏感信息的清理工具时,PDF 元数据 剥离很常见。这些工具删除文档信息字典、标准元数据字段,通常还删除 XMP 元数据流。可见页面内容被保留。纪录片背景被删除。

剥离后元数据可以隐藏在哪里
文档信息字典是元数据剥离的主要目标,其中存储了作者、标题、主题、关键字、创建者、生产者、创建日期和修改日期。剥离后,这些字段在查询时返回空或默认值。
XMP 元数据存储在 PDF 中的单独流中,仅针对信息字典的基本元数据剥离器经常会丢失 XMP 元数据。 XMP 可以包含相同的字段以及自定义属性。检查完整文件结构的修复PDF检查工具可以揭示剥离后幸存的XMP元数据。
页面级元数据(包括原始页面尺寸、生成每个页面的软件以及页面内容流中嵌入的修改时间戳)很少被剥离,因为剥离工具不会检查页面内容中是否有类似元数据的数据。
尝试修复 PDF
无需安装。直接在您的浏览器中工作。
恢复剥离元数据的技术方法
在可以处理二进制文件的文本编辑器中检查 PDF 文件。在文件头和各个对象流中搜索 Creator 和 Producer 字符串。这些字符串标识最初创建 PDF 的软件和最后修改 PDF 的软件。即使文档信息字典已被清空,字符串仍然存在。
检查嵌入的字体元数据。 PDF 中嵌入的字体保留自己的元数据,包括字体创建日期以及用于创建或修改字体文件的软件。这些日期提供了一个终点站,文档不能在其嵌入字体存在之前创建。
WukongPDF通过浏览器提供PDF版本控制检查,可以检查文档属性并识别文件结构内的可恢复元数据元素。
元数据恢复可以揭示什么,不能揭示什么
可恢复的元数据可以识别创建软件、操作系统,通常还可以识别创建日期范围。 2023 年夏天,Windows 10 上的 Microsoft Word 2016 创建的 PDF 显着缩小了来源范围。可恢复的元数据无法识别创建文档的特定用户或创建文档的特定计算机,除非该信息存储在自定义元数据字段中。
修改历史记录比创建信息更难恢复。某些 PDF 编辑器的每次保存操作都会写入新的修改日期,但不会保留以前的日期。可恢复的修改历史记录是保存增量保存信息的编辑者的保存历史记录。
防止未来文档中的元数据丢失
在外部共享 PDF 之前,请检查元数据以确定是否应保留或删除它。剥离所有元数据会删除以后可能需要的文档上下文。保留元数据共享可能是机密的信息。这个决定应该是经过深思熟虑的。
在 PDF 之外维护一个文档寄存器,记录重要文档的创建日期、作者和版本历史记录。外部寄存器不受 PDF 元数据操作的影响,并提供文档出处的独立记录。
PDF 文件系统元数据(操作系统在文件本身上存储的创建和修改日期)独立于 PDF 内部元数据。即使 PDF 内部创建日期已被删除,文件系统仍可能记录文件首次保存到当前存储位置的时间。
电子邮件附件在电子邮件系统元数据中保留电子邮件日期。如果 PDF 是作为电子邮件附件接收的,则电子邮件日期会提供该文档的最新可能创建日期。通过电子邮件发送后无法创建 PDF。
独立于文件元数据跟踪文档历史的文档管理系统可能在元数据被剥离之前记录了原始创建日期、作者和修改事件。在文档管理系统中搜索文档 ID 或文件名可以恢复预剥离元数据。
PDF增量保存结构,如果文件是增量保存而不是完全重写,则保留文档信息字典的先前版本。对增量保存数据的取证检查可以揭示早期版本中存在但在当前版本中被覆盖的元数据值。
PDF 中嵌入的字体在字体文件元数据中带有自己的创建和修改日期。这些日期不受 PDF 元数据剥离的影响。最近的字体日期提供了文档创建日期的下限。
PDF 中嵌入的图像带有原始图像文件中的 EXIF 元数据,包括拍摄日期、相机信息和用于编辑的软件。 PDF 图像中嵌入的 EXIF 数据不受 PDF 元数据剥离操作的影响。
恢复的元数据应与恢复方法和置信度评估一起记录。从文件系统时间戳恢复的元数据的置信度低于从嵌入字体创建日期恢复的元数据。该文档允许未来的用户评估恢复信息的可靠性。
从剥离的 PDF 中恢复元数据是一项取证工作,它将文件结构的技术检查与文档来源的上下文研究相结合,恢复的信息通常是部分的而不是完整的。
在决定在共享之前从 PDF 中删除元数据时,应意识到稍后可能需要删除的信息,并且恢复选项是有限且不确定的。
从剥离的 PDF 中恢复元数据将技术分析与上下文研究相结合,以重建文档的起源故事。
PDF 文件本身的文件系统时间戳独立于内部 PDF 元数据。
从剥离的 PDF 中恢复元数据需要检查文件结构和外部源。
元数据恢复是一个结合了技术和上下文分析的调查过程。
文档信息字典中的 PDF 生成者字段标识创建该文件的软件,这些信息在大多数元数据剥离中仍然存在。
使用十六进制编辑器检查原始 PDF 文件可以揭示文档信息字典不再引用的元数据片段。
PDF 内的字体文件中嵌入的创建日期为文档创建提供了终点站。
PDF 中的 XMP 元数据流与文档信息字典是分开的,如果工具仅针对字典,则可以在剥离后保留下来。
PDF 的修改历史记录有时可以根据每次编辑累积的增量保存部分来重建。
无论 PDF 元数据操作如何,嵌入 PDF 中的图像 EXIF 数据都会保留原始图像捕获日期。
文档管理系统日志可以记录 PDF 被处理以供分发之前的原始元数据值。
发送 PDF 的消息中的电子邮件标题可以提供文档的最新可能创建日期。
页数和页面尺寸可以帮助识别创建软件,因为不同的应用程序具有不同的默认页面尺寸。
PDF 版本号 1.4、1.7、2.0 指示创建文档时哪些规范功能可用。
交叉引用表分析可以揭示对象添加到文件的顺序,提供相对的时间顺序。
PDF 中的对象编号是连续的,编号较低的对象通常先于编号较高的对象创建。
PDF目录中的文档语言设置可能指示原始作者的语言和区域设置。
创建组织定义的自定义元数据字段可以使用标识文档源的命名约定。
PDF 输出意图(如果存在)可识别目标打印条件并可指示文档的预期用途。
嵌入的颜色配置文件提供有关创建文档的颜色管理环境的信息。
页面布局初始视图设置可以指示文档是设计用于屏幕查看还是打印查看。
PDF 中的注释和注释在注释属性中带有自己的创建日期和作者信息。
交互式 PDF 中的表单字段可能包含引用组织系统或日期的默认值或 JavaScript。
PDF 查看器标题栏中显示的文档标题可以设置为与元数据标题字段不同。
即使元数据被删除,书签和文档大纲也会保留部分结构。
文档中的超链接可能引用包含日期信息或组织标识符的 URL。
文档中使用的字体列表可以从页面内容流中恢复,并且可以指示创建软件。
页面标签(PDF 查看器中显示的逻辑页码)可能与物理页码不同,并揭示文档结构。
页面内容中嵌入的水印文本可能包含在文档创建期间应用的日期或作者信息。
可以将文档校验和或哈希与已知文件进行比较,以识别原始来源。
文件大小模式、大图像、多种字体、复杂矢量图形,可以指示文档类型和创建软件。
特定 PDF 功能、图层、组合、富媒体的存在表明使用的是哪个软件版本。
从文档中提取文本可以显示页眉和页脚文本,其中包括日期、文档 ID 或作者姓名。
文档加密方式,如果有密码保护,则表明创建软件的安全能力。
每个页面的纸张尺寸和方向元数据可以指示文档是在公制还是英制测量区域中创建的。
通常可以从 PDF 生成者字符串中识别文档创建平台(Windows、Mac 或 Linux)。
将这些取证线索拼接在一起可以产生文档来源的相当完整的图片,即使在故意剥离元数据之后也是如此。
恢复剥离的元数据需要检查内部 PDF 结构和外部上下文源。
| 证据来源 | 它揭示了什么 | 可靠性 | 剥离电阻 |
|---|---|---|---|
| XMP 元数据流 | 作者、日期、自定义字段 | 高的 | 经常被基本脱衣舞者错过 |
| 嵌入字体日期 | 字体创建日期 | 中等的 | 非常高(在字体文件中) |
| 图像 EXIF 数据 | 拍摄日期、相机、软件 | 中等的 | 非常高(在图像数据中) |
| 文件系统时间戳 | 文件创建/修改 | 低的 | 不适用(PDF 外部) |
尝试修复 PDF
无需安装。直接在您的浏览器中工作。
