您将 PDF 转换为 Word 并打开结果。文字在那里,但布局是一场灾难。两栏报告已合并为一个杂乱的栏。 PDF 中整齐排列的表格现在变成了一堆分散在页面上的浮动文本片段。要点已经失去了子弹。粗体标题是纯文本。从技术上讲,转换是有效的,文字是正确的,但文档需要大量清理,因此您最好从头开始重新输入。
PDF 到 Word 转换后格式损坏是人们放弃转换后的文档并重新开始的最常见原因。但问题往往不在于转换工具。 PDF 包含的内容与转换引擎期望找到的内容不匹配。了解格式中断的具体原因使您能够在 PDF 创建阶段防止格式中断或对转换后的 Word 文档应用有针对性的修复。

为什么 PDF 表格在转换为 Word 期间会中断
PDF 不将表格存储为表格。它们将字符存储在页面上特定的 x,y 坐标处。对于人类读者来说,看起来井井有条的表格对于 PDF 来说只是数千个独立的字符位置。 PDF 到 Word 转换引擎必须通过分析字符的空间排列来对表结构进行逆向工程。它通过查找类似垂直位置的字符来查找行。它通过查找类似水平位置的字符来查找列。它根据字符位置的间隙猜测单元格边界的位置。
可以预见的是,这种逆向工程过程会失败。当表合并单元格时,它会失败,因为在合并单元格的位置不存在指示列边界的空间模式。当单元格包含多行文本时,它会失败,因为单元格内的垂直组织对于检测算法来说看起来像行边界。当表没有可见的网格线时,它会失败,因为该算法依赖一致的列间隙来检测列边界,而网格线提供了边界位置的视觉确认。当表格是扫描的而不是数字创建的时,它会失败,因为扫描的表格是根本没有字符位置数据的图像。
尝试 PDF 转 Word
无需安装。直接在您的浏览器中工作。
如何修复转换后的 Word 文档中的损坏表格
当表格以分散文本形式到达 Word 时,最快的修复方法是使用“将文本转换为表格”功能将其转换为正确的 Word 表格。选择表中应包含的所有文本。转到“插入”、“表格”、“将文本转换为表格”。 Word 会提示您输入列数和分隔单元格的分隔符。如果转换引擎使用制表符分隔单元格,请选择“制表符”。如果使用逗号,请选择逗号。单击“确定”,Word 将根据文本构建结构化表格。此修复需要 30 秒,并生成一个格式正确的表格,您可以像任何其他 Word 表格一样对其进行编辑、排序和设置样式。
如果文本分隔不一致(当转换引擎放置一些带有制表符的单元格和另一些带有空格的单元格时会发生这种情况),则需要手动清理。逐列工作。查找第一列文本的结束位置和第二列文本的开始位置。在每列边界插入制表符。然后使用带有制表符分隔符的将文本转换为表格。这种手动方法需要更长的时间,但当自动检测失败时会产生干净的表。
修复合并为单列的多列布局
多列 PDF 提出了类似的空间分析挑战。转换引擎必须确定第一列结束位置和第二列开始位置,并且必须保持读取顺序:第一列从上到下,然后第二列从上到下。当引擎猜测错误时,要么各列交错,第一列中的行,第二列中的行,第一列中的行,产生交替的乱码,要么各列合并成一个宽列,因此第一列和第二列中的文本看起来是混乱的。
修复合并的多列布局需要手动分隔列。在转换后的 Word 文档中,确定第一列文本的结束位置和第二列文本的开始位置。在这些边界处插入分节符或分栏符。从第二列中剪切文本并将其粘贴到第二列中。这对于长文档来说很乏味,但它会产生结构正确的结果。对于将来的转换,请使用明确支持多列布局检测的PDF转换器。 WukongPDF 检测多列布局并在导出的 Word 文档中保留正确的阅读顺序,从而完全避免交错问题。
恢复格式:标题、粗体、斜体和列表
对表和列进行结构修复后,恢复视觉格式。 Word 的格式刷是最快的工具。在文档中查找一个格式正确的元素:标题、粗体术语、斜体引文。选择它,双击格式刷图标,然后将格式绘制到相同类型的其他元素上。双击“格式刷”可使其保持活动状态,因此您可以将其应用于多个选择,而无需每次都重新选择。
对于标题,应用 Word 的内置标题样式,而不是手动粗体和字体大小格式。选择文本,然后单击样式库中的标题 1、标题 2 或标题 3。使用真实的标题样式而不是视觉格式可以启用 Word 的导航窗格、自动生成目录以及使用书签正确导出 PDF。从视觉格式到语义样式的升级将转换后的文档从清理后的混乱状态转换为结构正确的工作文件。
在 PDF 创建阶段防止格式损坏
格式化损坏的最佳修复方法就是防止它发生。创建稍后可能需要转换回 Word 的 PDF 时,请在源文档中使用这些做法。使用通过插入表格功能创建的真实表格,而不是看起来像表格的制表符对齐文本。使用真实的标题样式,而不是手动更改粗体和字体大小。使用真正的项目符号和编号列表,而不是手动输入星号和数字。保持布局简单。避免文本框、浮动图像和手动定位的元素,这些元素在页面上看起来不错,但在 PDF 中会产生混乱的字符位置。
导出启用结构标签的 PDF。在 Word 的“另存为 PDF”对话框中,单击“选项”并选中“可访问性的文档结构标签”。结构标签告诉 PDF 转换引擎哪些元素是标题、哪些是表格、哪些是列表。此结构信息在往返过程中仍然存在:Word 到 PDF 到 Word。源文档中的结构越清晰,转换后的输出中的结构就越清晰。 WukongPDF 的PDF 格式 转换工具在 PDF 到 Word 转换过程中保留文档结构,将清理工作从几小时缩短到几分钟。
将复杂的 PDF 转换为 Word 时可节省大量清理时间的特定技术:分两遍进行。在第一遍中,仅关注结构修复。使用“将文本转换为表格”修复表格。分离合并的列。恢复阅读顺序。请勿触摸字体、颜色、间距或任何视觉格式。使用 Word 的样式工具可以在几分钟内修复结构合理但格式丑陋的文档。一份格式精美、表格破碎、列乱的文档无论看起来如何都几乎无法使用。在第二遍中,结构正确后,应用格式:标题样式、字体选择、边距、间距。这种两遍方法可以让您在正确的时间专注于正确的问题,并防止出现常见的陷阱,即花费 20 分钟调整表格上的字体大小,而您后来意识到由于列已合并而需要从头开始重建。
尝试 PDF 转 Word
无需安装。直接在您的浏览器中工作。
