您有一个可搜索的 PDF。您将其转换为 Word 进行编辑。您将编辑后的文档保存回 PDF。新的 PDF 看起来与原始 PDF 相同,但当您搜索文档中已知的单词时,搜索不会返回任何结果。原始 PDF 中可搜索的文本对于新 PDF 中的搜索功能不可见。 Word 的往返剥夺了文本的可搜索性。
将PDF 转换为Word,然后将Word 重新转换为PDF 是编辑PDF 的常见工作流程,但每个转换步骤都会带来文本层损坏的机会。以 PDF 格式返回的文本的存储方式可能与原始文本不同,存储为矢量轮廓而不是字符代码,或者光栅化为图像。这些结果中的每一个都会生成一个 PDF,其中文本可见但不可搜索。

文本在格式转换过程中如何保存或丢失
在原始的可搜索 PDF 中,文本存储为映射到字体字形的字符代码。字符 H 存储为 ASCII 代码 72,它告诉 PDF 阅读器显示嵌入字体中的 H 字形。搜索功能扫描搜索词的字符代码并突出显示页面上的相应位置。这种基于字符代码的存储使得文本可搜索。
当PDF转换为Word时,转换器会提取字符代码并将它们作为可编辑文本写入Word文档中。 Word 中的文本是可搜索的,因为 Word 将其存储为 Unicode 字符代码。只要转换器正确提取字符代码,从 PDF 到 Word 的转换就可以保留可搜索性。
当编辑后的Word文档保存回PDF时,Word PDF引擎必须决定如何存储文本。默认设置将文本存储为带有嵌入字体的字符代码,从而保留可搜索性。但是,某些 Word 功能和 PDF 设置会导致文本存储为矢量轮廓或光栅化为图像。
Word 中的文本效果(例如文本阴影、反射、发光和 3D 旋转)会导致 Word PDF 引擎将受影响的文本转换为图像。文本在视觉上看起来正确,但没有可供搜索功能查找的字符代码。对于应用了视觉效果的任何文本,PDF 可搜索 属性都会丢失。
尝试 PDF 转 Word
无需安装。直接在您的浏览器中工作。
如何通过往返保持文本可搜索性
将编辑后的 Word 文档保存为 PDF 之前,请检查保存设置。在 Word 中,打开“文件”、“选项”、“保存”,并确保选中“在文件中嵌入字体”。此设置可确保字体作为基于字符的文本嵌入,而不是转换为轮廓或图像。
避免将文本效果应用于需要保持可搜索的内容。使用粗体、斜体和颜色格式,而不是阴影、反射和发光效果。可以在不牺牲可搜索性的情况下实现视觉区分。
WukongPDF 提供PDF Converter 工具,可以处理 PDF 以优化文本存储。如果使用不可搜索的文本创建 PDF,OCR 可以在现有可视内容后面添加可搜索的文本层。
验证重新转换后的可搜索性
将Word文档保存为PDF后,打开PDF并测试搜索功能。搜索每页上出现的单词。如果任何页面未返回明显存在的单词的结果,则该页面具有无法搜索的文本。搜索测试需要几秒钟的时间,并在分发文档之前捕获可搜索性损失。
如果丢失了可搜索性,请对重新转换的 PDF 运行 OCR 以添加可搜索文本图层。 OCR 识别可见文本并在其后面创建字符代码。然后,搜索功能可以通过 OCR 生成的字符代码查找文本。这是事后修复,而不是预防,但它恢复了不可搜索的 PDF 的可搜索性。
对于需要保证可搜索性的文档,请完全避免 PDF 到 Word 到 PDF 的往返过程。编辑原始源文档、Word 文件、InDesign 文件、Google 文档,并导出新的 PDF。从源文件到 PDF 的单一导出保留了可搜索性,无需中间转换步骤。
Word 兼容模式会影响 PDF 输出。以较旧的 DOC 格式而不是 DOCX 格式保存的文档可能会使用不同的文本存储方法,从而影响 PDF 的可搜索性。在导出为 PDF 之前,将文档保存为当前 DOCX 格式。
在 PDF 导出过程中,Word 文本框中的文本可能会被光栅化,具体取决于文本框格式。具有填充效果、旋转或文本方向更改的文本框比纯文本框更有可能被光栅化。
当文本在 PDF 导出过程中被光栅化时,它会变成文本图像而不是编码文本。图像显示正确,但字符是像素,而不是代码。 OCR 可以恢复文本,但 OCR 文本可能包含识别错误。
当字体可能未嵌入时,Word 中的 PDF 导出选项包括位图文本设置。此设置对使用具有嵌入限制的字体的文本进行光栅化。确保所有字体都允许嵌入可以防止这种强制光栅化。
往返转换后,比较原始 PDF 和重新转换的 PDF 的文件大小。重新转换的 PDF 显着增大可能表明文本已光栅化为图像,这比编码文本消耗更多的存储空间。
一些 PDF 到 Word 转换器为扫描的 PDF 提供基于 OCR 的转换模式,为数字 PDF 提供文本提取模式。使用错误的模式会产生意想不到的结果。数字 PDF 应使用文本提取(而不是 OCR)来保留原始字符编码。
当文本可搜索性丧失时,PDF 查看器中的查找功能不会返回明显存在的单词的结果。在每个页面上搜索诸如“或”之类的常用词可以快速确认整个文档是否具有可搜索的文本。
对于必须通过多个编辑周期保持可搜索性的文档,以可编辑格式、Word、Google Docs 或 InDesign 建立主文档,并将 PDF 视为只读分发格式。所有编辑都在母版中进行,并且在每个编辑周期后从母版重新生成 PDF。
辅助功能检查器可以验证文本的可搜索性并识别具有不可搜索文本的页面。对重新转换的 PDF 运行辅助功能检查,以确认所有文本均已编码且可访问。
PDF/UA 标准要求所有文本都编码为 Unicode 字符,以确保可搜索性和屏幕阅读器访问。从 Word 导出到 PDF/UA 会强制执行保留可搜索性的文本编码要求。
PDF 到 Word 转换器的选择会影响文本保存。将视觉保真度置于文本可编辑性之上的转换器可能会光栅化使用不常见字体或位置的文本。优先考虑文本可编辑性的转换器可能会产生更多可搜索的输出。
当文本在 PDF 中存储为连字 fi、fl、ffi 时,转换器可能会将连字拆分为单独的字符或将其保留为单个字符。搜索函数的行为取决于转换期间连字的处理方式。
防止未来转换中的可搜索性损失
如果 Word 文档使用艺术字、SmartArt 或嵌入的 Excel 图表等功能,则源 PDF 中最初基于矢量的文本可能会在 Word 到 PDF 导出过程中转换为光栅图像。这些功能在 PDF 输出中呈现为图像。
Word 中的 PDF 创建设置包括从标题创建书签的选项。此选项保留文档结构,但不影响文本可搜索性。书签和可搜索性是独立的功能。
通过搜索每个页面上出现的单词(例如文档语言中的常用单词)来测试可搜索性,可以快速识别具有不可搜索文本的页面。如果任何页面没有返回常见单词的结果,则该页面存在文本编码问题。
了解在 PDF 到 Word 到 PDF 往返过程中文本可搜索性丢失的情况,使文档创建者能够对其编辑工作流程做出明智的选择,并保持其内容的可访问性和可查找性。
要在 PDF 到 Word 到 PDF 的往返过程中保持文本的可搜索性,需要注意每个步骤的转换设置,并了解哪些 Word 功能会导致文本被光栅化而不是编码为字符。
对于需要文本可搜索性的文档,建立一个工作流程来通过每次格式转换保留原始编码文本比在丢失后尝试恢复可搜索性更有效。
文本可搜索性是用户认为理所当然的一项功能,直到它不存在为止,恢复不可搜索的 PDF 的可搜索性需要从原始源重新处理或在受影响的页面上运行 OCR 以重新创建文本图层。
PDF 到 Word 到 PDF 的往返过程是一种常见的编辑工作流程,它会带来多种文本编码降级或丢失的机会,了解每个风险点有助于用户在整个过程中保持可搜索性。
文本可搜索性不是一个装饰性的功能,而是一种基本的文档功能,它会影响可访问性、可查找性以及提取和重新利用内容以用于其他用途的能力。
PDF 到 Word 转换器的选择会显着影响往返的结果,针对文本可编辑性进行优化的转换器比针对视觉保真度进行优化的转换器产生更多可搜索的输出。
当往返过程中失去可搜索性时,OCR 可以恢复可搜索的文本层,但 OCR 文本将包含识别错误,必须更正这些错误才能使文档完全可靠。
对于需要可搜索性的文档,维护原始源文件并在每个编辑周期后导出新的 PDF 比通过 Word 进行往返更可靠。
PDF 格式以与文字处理格式根本不同的方式保存文本,并且这些表示形式之间的每次转换都会带来文本编码中信息丢失的风险。
| 往返阶段 | 可搜索性风险 | 缓解 |
|---|---|---|
| PDF 到 Word(提取) | 如果使用文本提取转换器则较低 | 使用具有文本提取模式的转换器 |
| 在 Word 中编辑 | 没有任何; Word 文本始终可搜索 | 避免文本效果(阴影、发光、3D) |
| Word 转 PDF(导出) | 中等的;影响导致光栅化 | 嵌入字体;避免对可搜索文本的影响 |
| 出口后验证 | 不适用 | 在每个页面上搜索常用词 |
尝试 PDF 转 Word
无需安装。直接在您的浏览器中工作。
