将多列 PDF 布局转换为 Word 通常会生成一个文档,其中来自不同列的文本在单个流中混合在一起。一篇两栏的研究论文变成了一个又长又乱的段落。三栏的时事通讯变得难以阅读。在PDF 到Word 转换过程中保留列结构需要识别和维护原始布局几何形状的转换设置,将每一列视为独立的文本流而不是将它们合并为一个。
要点
PDF 到 Word 转换工具通过分析每个页面上文本的空间排列来处理多列布局。支持列检测的工具可识别文本块之间的间隙并重建列阅读顺序。不同转换工具的色谱柱保存质量差异很大。具有简单两列布局的文档可以很好地使用大多数工具进行转换。具有复杂杂志风格布局且文本和图像重叠的文档可能需要在转换后进行手动清理。

PDF 转换期间列检测的工作原理
原始 PDF 中的字体大小和行距会影响列检测的准确性。文本非常小的文档(例如 8 点财务表格)对检测算法提出了挑战,因为列之间的空白按比例较小。如果原始文档允许,在创建 PDF 之前增加字体大小或列间距可以改善转换结果。对于源文档不可用的现有 PDF,请接受小文本多列布局将需要更多手动清理的事实。
支持列检测的PDF转换器可分析每个页面上文本块的水平位置。共享相同左边缘且宽度一致的文本块将分组为一列。然后转换器从上到下读取每一列,然后再移动到下一列。这会生成一个 Word 文档,其中每一列的文本都位于单独的文本流中,Word 将其表示为链接的文本框或每个 PDF 列一列的表格。
检测算法依赖于一致的列宽和列之间的清晰间隙。列之间有 2 毫米间隙的文档对算法提出了挑战,因为如此窄的间隙可能被解释为正常的字间距而不是列边界。具有不等宽度的列的文档(例如宽的主列和窄的侧边栏)也会对算法提出挑战,因为它必须区分列和缩进的段落。列检测最适合具有标准布局的文档:等宽的列,间隔至少 5 毫米的空白。
尝试 PDF 转 Word
无需安装。直接在您的浏览器中工作。
列保留的转换设置
对于具有复杂多列布局且无法通过任何自动设置完全转换的文档,请考虑转换为 Word 以外的格式。将 PDF 转换为桌面出版格式(如 Adobe InDesign 或 Affinity Publisher)比 Word 更能忠实地保留列结构,因为这些应用程序从头开始就专为多列布局而设计。从发布应用程序将最终编辑的文档导出回 PDF。
初始转换后,将 Word 文档保存为 DOCX 格式,而不是旧的 DOC 格式。 DOCX 比 DOC 更可靠地处理复杂的布局,包括列结构。如果转换工具提供输出格式选择,请始终为包含大量列的文档选择 DOCX。从 PDF 转换为 DOC,然后另存为 DOCX 会增加不必要的格式转换,从而可能会导致布局错误。
如果转换后的 Word 文档将每一列放在单独的文本框中(这是保留布局转换的默认行为),则您可以从每个文本框中提取文本,并使用 Word 的链接文本框功能将其流入基于单列的布局中。按阅读顺序链接文本框,文本不断地流过它们。这种方法保留了列布局和将文本编辑为连续流的能力。
在转换设置中,查找与布局保留相关的选项。 “保留流畅的文本”尝试将文本重建为可编辑的 Word 段落,这对于需要进一步编辑的文档来说是理想的选择。 “保留页面布局”将文本放置在定位的文本框中,保留精确的视觉布局,但更难编辑。对于列保留,可以选择“保留流动文本”。启用列检测通常会产生可编辑性和结构的最佳平衡。 WukongPDF 的 PDF 到 Word 转换器包括列检测模式,可识别多列布局并重建正确的阅读顺序,将每列的文本放置在单独的 Word 部分中。
如果转换器为扫描文档提供 OCR 选项,甚至可以为数字 PDF 启用该选项。 OCR 引擎的布局分析通常比文本提取引擎的空间分析更擅长检测列。 OCR 将页面处理为图像并识别文本区域,这使得列检测比直接解析 PDF 内容流更有效。缺点是基于 OCR 的转换速度较慢,并且可能会在已经数字化的文本上引入识别错误。对列保真度具有最高优先级且文档长度易于管理的文档使用基于 OCR 的转换。
转换后手动恢复列
如果自动转换生成的文档中不同列的文本以错误的顺序交错,Word 的查找和替换通配符可以帮助分隔合并的文本。搜索指示原始布局中的分栏符的模式,例如一致数量的空格或出现在一列末尾和下一列开头的特定标点符号模式。通配符搜索和替换比手动剪切每个段落并将其粘贴回正确的列顺序更快。
对于列顺序带有语义的文档,例如左列为原文、右列为译文的双语文档,保留列配对至关重要。转换后,检查左列中的每个段落是否对应于右列中的正确段落。文档开头的一个错位会贯穿所有后续段落。成对列文档的验证步骤比标准多列布局更耗时,但对于文档可用而言这是必要的。
当自动列检测产生混乱的结果时,手动恢复是后备方案。在 Word 中,使用“布局”选项卡下的“列”功能为文档的每个部分设置正确的列数。然后将混乱的转换中的文本剪切并粘贴到正确的列顺序中。这是最耗时的方法,但会生成结构完美的文档。对于 10 页两栏的论文,手动修复需要 15 到 30 分钟,具体取决于布局的复杂程度。
在手动恢复列时,使用原始 PDF 作为视觉参考。在屏幕的一侧打开 PDF,在另一侧打开 Word 文档。逐页浏览文档,验证 Word 文档每一列中的文本与 PDF 相应列中的文本是否匹配。这种并排比较可以捕捉到原本不会被注意到的顺序混乱的段落。对于列结构有意义的文档,例如左右列呈现对比观点的比较分析,额外的验证时间是值得的。
常见问题
对于列较多的文档,是一次性转换整个 PDF 还是逐页转换更好?立即转换整个文档可为检测算法提供更多数据来处理。它可以识别跨页面一致的列模式并统一应用它们。逐页转换会迫使算法单独重新检测每个页面的列结构,即使所有页面的列布局相同,这也可能会产生不一致的结果。
我是否可以设置与常用 PDF 列布局相匹配的 Word 模板,以便更容易预测转换?是的。创建具有正确的列数、边距和字体设置的 Word 模板。将 PDF 转换为 Word 后,将转换后的文本导入到模板中。该模板提供列结构,并由导入的文本填充它。这种方法将布局定义与内容提取分开,并在类似结构的 PDF 的多次转换中产生更一致的结果。
我可以将包含三列或更多列的 PDF 转换为 Word 并保持所有列完好无损吗?
是的,但是成功率会随着列数的增加而降低。两列布局可以很好地使用现代工具进行转换。三列布局可以使用最好的工具进行可接受的转换,但可能需要一些清理。具有四栏或更多栏的布局(例如密集的报纸页面)几乎总是需要手动进行转换后工作。狭窄的列留给检测算法可靠地识别空白间隙的空间很小。
将基于列的 PDF 转换为 Word 是否会影响列之间的图像和图形?
跨多列的图像通常可以正确转换,因为它们被检测为与文本不同的对象。嵌入列中的图像(例如与文本内嵌的小插图)可能会破坏列检测,因为图像会破坏算法试图遵循的文本流。转换后,检查列边界附近的图像位置是否正确,文本是否按预期在图像周围流动。
我是否应该以不同于数字文档的方式转换扫描的多栏文档?
扫描的文档必须先经过 OCR,然后再进行列检测,这增加了一个步骤,但也提供了机会。专为文档转换而设计的 OCR 引擎通常比文本提取引擎具有更复杂的布局分析,因为 OCR 最初正是针对此用例而开发的。与应用于同等数字 PDF 的文本提取引擎相比,应用于扫描的多列文档的高质量 OCR 引擎可以产生更好的列保存效果。
尝试 PDF 转 Word
无需安装。直接在您的浏览器中工作。
