Tips & Tricks

如何修复打开时出现乱码或乱码文本的 PDF

显示乱码文本、随机符号、空白方块行或无意义字符串的 PDF 可能看起来像是无法实际恢复的损坏文件。文档打开时没有错误消息,页数显示正确,所有图像或图形显示正常,但文字本身已被完全无法阅读的内容所取代。这种模式通常表示字体编码问题,而不是结构性文件损坏,这是个好消息,因为字体问题通常无需专业数据恢复工具或取证文件修复服务即可修复。底层内容可能仍然存在于文件中,由于字体数据丢失或不匹配,其编码方式 PDF 查看器无法解释。

How to Repair a PDF That Opens With Garbled or Scrambled Text

诊断字体编码与真实文件损坏

第一个诊断步骤是确定问题是否源于字体编码或 PDF 文件结构本身。字体编码问题会在整个文档中产生系统的、一致的乱码。字母 A 的每个实例都可能变成空心正方形,或者所有文本始终显示为来自不同字母表的随机重音字符,但该模式会按预期重复。真正的文件损坏会产生不一致的行为:页面根本无法呈现,尝试打开文件时出现错误消息,或者文档的某些部分完全空白,而其他部分显示正确。完美呈现图像但显示乱码文本的页面非常强烈地表明字体问题而不是结构损坏。

至少在两个不同的查看器中打开 PDF 以确认诊断。如果文件在 Adobe Acrobat Reader 中正确显示,但在基于浏览器的查看器(如 Chrome 或 Edge)中显示不正确,则浏览器查看器很可能不支持 PDF 中使用的特定嵌入字体格式。如果文件在 Chrome 中正确显示,但在 Mac 上的预览中无法正确显示,则预览可能缺乏对特定字体编码方案的支持。如果文件在不同操作系统上测试的每个查看器中显示乱码,则 PDF 本身内的字体数据已损坏或丢失,并且需要进行修复 PDF 操作来解决字体资源问题。

WukongPDF

尝试修复 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

重新嵌入丢失或损坏的字体

当 PDF 引用未嵌入文件中且未安装在查看系统上的字体时,PDF 查看器将被迫替换其可用的其他字体。这种替换经常会导致字符错位,因为替换字体的字符宽度、间距度量和字形位置与原始字体不同。文本显示为混乱或随机符号,因为 PDF 中存储的字符代码映射到替代字体中的字形与文档作者想要的字形完全不同。解决方案是将正确的字体重新嵌入 PDF 中,以便查看者不再需要猜测。

在可以在文档级别检查和修改字体资源的工具中打开 PDF。检查字体清单,查看文档引用了哪些字体,以及每种字体是否完全嵌入、作为仅包含所使用字符的子集部分嵌入、或列为根本未嵌入。如果字体显示为未嵌入,您需要在系统上安装该字体,并在启用嵌入所有字体选项的情况下重新保存 PDF,或者使用 PDF Fix PDF 工具,该工具可以从其自己的许可字体库中找到并嵌入所需的字体数据。大多数字体库中都提供了 Arial、Times New Roman、Helvetica 和 Courier 等常见系统字体,并且可以在没有许可限制的情况下嵌入。

使用打印到 PDF 技术进行快速恢复

如果乱码文本是由某个特定查看器正确处理而其他查看器不能正确处理的字体编码引起的,那么最快的实际修复方法就是利用该单个工作查看器。在能够在屏幕上正确呈现文本的查看器中打开 PDF。按 Ctrl-P 或 Command-P 打开打印对话框,然后选择 Microsoft 打印到 PDF 或另存为 PDF 作为目标打印机。打印管道对屏幕上显示的文本进行光栅化或重新编码,并使用标准的、普遍支持的字体和编码将其嵌入到全新的 PDF 中,每个现代 PDF 查看器都可以理解,无需特殊的字体处理。

此方法会生成一个修复 PDF 副本,其中包含干净、可读的文本,并且在各处一致显示,但在实施之前需要了解一个重要的权衡。打印的 PDF 通常会失去文本的选择性、可搜索性和任何交互式表单元素。文本有效地成为页面图像的一部分。对于只需要在屏幕上阅读并可能打印一次的文档,这是一个完全可以接受的解决方案,只需几秒钟。对于修复后需要保持可搜索、可选择或可编辑的文档,请首先尝试字体嵌入方法,并保留打印到 PDF 作为后备。

通过中间格式转换 PDF

当字体嵌入无法解决问题并且打印到 PDF 会丢失太多文档功能时,通过中间格式转换 PDF 可以去除损坏的编码,同时将文本保留为实际文本。使用 PDF 到 Word 转换器将 PDF 导出到 Word 文档。转换过程读取 PDF 内容流,并将识别的文本输出为使用 Word 自己的字体处理和编码的新格式,完全独立于原始 PDF 中的任何损坏。打开生成的 Word 文件,确认文本全文阅读正确,进行所需的细微格式更正,然后将其导出回 PDF,并启用字体嵌入。

Word 的往返过程会用干净、符合标准的编码替换损坏的编码,但具有多列、精确定位或嵌入矢量图形的复杂布局可能无法完美地完成转换。下表比较了三种修复方法以及选择应用哪种方法时的重要因素:

方法文本可选保留布局速度
重新嵌入字体是的是的缓和
打印为 PDF是的快速地
PDF 到 Word 到 PDF是的部分的慢的

处理 Unicode 和 CID 字体编码问题

使用非拉丁文字(例如中文、日文、韩文、阿拉伯文或西里尔文)创建的 PDF 有时会显示乱码文本,特别是当字体使用 CID(字符标识符)编码并且查看者无法将数字 CID 映射回其对应的 Unicode 字符时。这对于扫描软件或传统出版系统生成的旧版 PDF 来说很常见,这些系统使用 Unicode 成为通用标准之前设计的预 Unicode 编码表嵌入字体。例如,来自 2005 年日本扫描仪的 PDF 可能使用 CID 字体,如果没有原始供应商特定的 CMAP 文件,现代查看者就无法解释该字体。

明确支持 CID 到 Unicode 映射的专用 PDFFix PDF 工具可以重建正确的字符关联。这些工具从字体数据和嵌入的 CMAP 表(如果存在)中读取原始 CID 代码,以重建 Unicode 映射。该过程在专为 PDF 字体修复而设计的工具中是自动化的,只需要您上传文件并下载正确的版本。对于包含东亚语言的 PDF,请选择在其功能集中明确列出 CJK 字体支持的修复工具,因为主要为拉丁文字设计的通用字体修复工具可能不包括这些书写系统的 CMAP 数据或字形识别模型。

防止您创建的 PDF 中出现乱码文本

如果您经常创建的 PDF 到达收件人时出现乱码,则根本原因几乎总是生成 PDF 的软件中的字体嵌入设置。从 Word、PowerPoint、InDesign 或设计工具导出时,找到 PDF 导出或保存选项对话框,然后选中标记为“嵌入字体”或“嵌入所有字体”的框。某些应用程序提供了一个附加复选框,用于仅嵌入文档中使用的字符,这会通过子集字体创建较小的文件,但如果稍后编辑 PDF 或与其他内容合并,可能会导致显示问题。为了获得最大的跨平台兼容性,只要文件大小的增加是可以接受的,就嵌入完整的字体而不是子集。

WukongPDF 等平台处理PDF 格式 转换,默认情况下启用全面的字体嵌入,避免因仅适用于创建者计算机的系统特定字体依赖性而产生的编码问题。当发送必须在不同操作系统、设备和查看器应用程序中正确显示的 PDF 时,快速验证测试是在基于浏览器的 PDF 查看器中打开文件,因为这些查看器无法访问本地安装的系统字体,并且会立即显示任何字体嵌入问题,否则这些问题在收件人报告乱码文本之前不会被注意到。

何时接受 PDF 无法修复

尽管采用了最好的修复技术,但某些 PDF 仍遭受了无法实际恢复的损坏。如果您尝试过重新嵌入字体、从每个可用查看器打印到新的 PDF,以及通过 Word 进行往返转换,并且文本仍然是乱码,则该文件可能在内容流本身中存在结构损坏,而不仅仅是字体编码问题。此时,最有效的方法通常是找到原始源文档并从中生成新的 PDF。

保留损坏的文件以供参考,因为即使文本无法恢复,图像和页面结构可能仍部分完整。如果文档来自扫描仪,则重新扫描原始纸质文档会生成具有正确文本编码的干净 PDF。如果文档是从 Word 文件或设计应用程序创建的,请要求原始作者在显式启用字体嵌入的情况下重新导出它。从源文档进行全新导出可以绕过损坏副本中存在的所有编码问题,并在比尝试进一步修复更短的时间内生成干净的文件。

WukongPDF

尝试修复 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →