
为什么看起来像文本的 PDF 可能无法编辑
您打开 PDF,看到屏幕上的文字,并假设您可以编辑它们。当您点击文本但没有任何反应,或者当您尝试打字但光标没有出现时,您会发现看起来像文本文档的 PDF 实际上根本不是可编辑的文档。这种经历非常常见,因为 PDF 可以包含完全不同形式的文本,其中只有一些是可编辑的。
对扫描的 PDF 运行 OCR 会在文档中的每个页面图像后面添加一个可搜索和可编辑的文本层。
当无法直接编辑时,从 PDF 到可编辑格式的相互转换是可靠的后备方案。
PDF 编辑器可以修改 PDF 中作为实际文本对象存在的文本,其中每个字符表示为可选择、可修改的字符代码。这称为本机文本或实时文本。 PDF 格式 还可以包含仅作为图像存在的文本,例如文本是页面照片一部分的扫描文档。无法选择、搜索或编辑基于图像的文本,因为 PDF 不包含字符数据,仅包含恰好形成字母形状的像素。在知道 PDF 是否可编辑之前,您需要知道它包含哪种类型的文本。
最快的测试是尝试选择 PDF 中的文本。单击并拖动一个单词。如果文本在您拖动时突出显示,则它是本机文本并且可以进行编辑。如果没有突出显示并且光标没有变化,则文本是基于图像的并且不能直接编辑。如果文本突出显示但突出显示参差不齐,选择了一些单词但跳过了其他单词,则 PDF 混合了本机文本和仅作为视觉元素存在的文本,这是由旧软件创建的 PDF 或通过组合多个源文档创建的 PDF 中的常见情况。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
无法编辑 PDF 文本的常见原因
最常见的原因是 PDF 是扫描文档。通过使用平板扫描仪或手机相机应用程序扫描纸质页面创建的 PDF 包含文本图像,而不是实际的文本字符。尽管您可以阅读屏幕上的文字,但 PDF 文件不包含可编辑的文本数据。要使扫描的 PDF 可编辑,您必须首先运行 OCR 来识别图像中的文本,并在每个页面图像后面创建一个不可见的文本层。 OCR 后,文本变得可搜索,并且在许多 PDF 编辑器中可像原始文本一样进行编辑。
密码或权限限制是编辑的另一个常见障碍。受权限密码保护的 PDF 可以打开和查看,但权限可能会阻止编辑、复制或打印。如果您可以打开 PDF 并查看文本,但编辑工具呈灰色或显示错误消息,请检查文档的安全设置。在大多数 PDF 查看器中,文档属性或安全面板会显示受限制的权限。如果编辑受到限制并且您拥有权限密码,则可以取消限制并启用编辑。
PDF 可能包含在创建过程中转换为轮廓或曲线的文本。图形设计师有时会在创建 PDF 之前在 Adobe Illustrator 等应用程序中将文本转换为轮廓,以确保字体正确显示,无论收件人是否安装了这些字体。转换为轮廓的文本在视觉上看起来与本机文本相同,但由矢量形状而不是字符数据组成。没有编辑 PDF] 工具可以将轮廓文本编辑为文本,因为在转换为轮廓期间字符信息被丢弃。
即使 PDF 包含本机文本字符,字体编码问题也可能导致文本无法编辑。某些 PDF 使用自定义字体编码,以非标准方式将字符代码映射到字形。编辑工具可以看到字符代码,但无法确定它们代表哪些字符,因此它拒绝编辑它们以避免损坏文本。此问题在由专用软件、旧系统生成的 PDF 或使用具有自定义字体处理的非拉丁脚本的文档中最常见。在启用字体嵌入的情况下从原始应用程序重新导出 PDF 通常可以解决编码问题。
如何使用 OCR 使扫描的 PDF 可编辑
光学字符识别是将文本图像转换为实际可编辑文本的过程。现代 OCR 技术非常准确,可以以典型尺寸对常见字体的打印文本进行干净、明亮的扫描。在扫描的 PDF 上运行 OCR 会在包含已识别字符的每个页面图像后面添加一个隐藏文本层。 OCR 完成后,您可以在文档中搜索文本,并在大多数 PDF 编辑器中编辑识别的文本,就好像它是原始文本一样。
OCR 输出的质量取决于扫描图像的质量。 300 DPI 的高分辨率扫描,具有均匀的照明、平坦的页面和清晰的焦点,可为标准打印文本提供 99% 以上的 OCR 准确度。以 150 DPI 进行低分辨率扫描,如果存在阴影、装订书的弯曲页面或失焦区域,则会产生较低的精度,并且在 OCR 后需要更多的手动校正。扫描文档时考虑到 OCR,即平面页面、良好的照明和足够的分辨率,使编辑过程变得更加顺畅。
大多数支持 OCR 的 PDF 编辑器都将语言选择作为识别设置的一部分。选择正确的语言可以提高准确性,因为 OCR 引擎使用特定于语言的词典和字符频率数据来解析不明确的字符。使用法语设置识别的法语文档比使用英语设置识别的相同文档产生更好的结果。对于多语言文档,选择主要语言并手动更正辅助语言段落中的任何错误。
WukongPDF 的 OCR PDF 工具在浏览器中处理扫描文档并返回带有可搜索、可编辑文本层的 PDF。 OCR 引擎支持多种语言并处理常见文档类型,包括信件、表格、收据和文章。 OCR 后,之前不可编辑的扫描 PDF 变得可编辑,识别出的文本可供选择、搜索和修改。
无法直接编辑 PDF 时的替代方法
当 PDF 无法直接编辑时,无论是因为它是无法访问 OCR 的扫描文档,还是因为它具有无法删除的安全限制,替代工作流程可让您通过不同的路径获得相同的结果。将 PDF 转换为可编辑格式(例如 Word 或 Google 文档),以该格式进行更改,然后将编辑后的文档转换回 PDF。往返可编辑格式比直接编辑需要更长的时间,但适用于任何可以打开和查看的 PDF。
对于只需要进行少量更正的文档,例如修复单个段落中的拼写错误,使用 PDF 的注释工具用白色矩形覆盖不正确的文本,然后在顶部键入更正的文本是一种实用的解决方法。此方法不会真正编辑底层文本和文档结构,因此基于注释的校正对于搜索和辅助工具来说是不可见的,但对于将打印或作为图像查看的文档进行快速视觉校正,它会产生可接受的结果。
对于需要大量编辑且无法直接编辑的文档,最可靠的方法是返回原始源文档(如果有)。
用于创建 PDF 的 Word 文档、Google Doc 或 InDesign 文件包含可以修改并重新导出为新 PDF 的可编辑文本。联系文档的创建者获取源文件,或者在您自己的记录中查找源文件,通常比费力编辑不合作的 PDF 更快。
一些看似包含本机文本的 PDF 实际上以编辑工具无法修改的方式存储文本,即使文本是可搜索和可选择的。当 PDF 具有正确的文本图层(允许搜索和选择)但底层字体编码阻止编辑工具将编辑的字符映射回正确的视觉字形时,就会出现这种情况。编辑工具可以读取文本,但无法将更改写回文档,否则可能会破坏字符映射。这种对编辑的防御有时是文档创建者有意为之的。
PDF 编辑工具的激增使得编辑 PDF 变得比以往任何时候都更加容易,但它也造成了人们对于什么是编辑的困惑。在 PDF 页面顶部添加文本注释与编辑底层文本不同。替换 PDF 页面上的图像与编辑描述图像的文本不同。了解基于注释的更改(将新内容覆盖在现有页面之上)与真正的文本编辑(修改 PDF 结构中的实际文本内容)之间的区别,有助于您为每个编辑任务选择正确的工具和正确的方法。
对于拒绝所有编辑尝试并包含对更新至关重要的信息的文档,核心选项是从头开始重新创建文档。使用 PDF 作为视觉参考,并将内容重新输入到文字处理程序或设计应用程序中,从而在重新创建过程中进行编辑。这种方法是劳动密集型的,但会生成干净、完全可编辑的文档,没有残留的格式问题、字体问题或转换工件。从 PDF 重新创建文档所需的时间与文档的长度和复杂性成正比,对于需要大量编辑的短文档,它实际上比使用不合作的 PDF 编辑工具要快。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
