Others

您可以将 PDF 转换为 Word 并保留从右到左语言的原始阅读顺序吗

当源文档是英文且采用简单的从左到右、从上到下的阅读顺序时,将 PDF 转换为 Word 就足够具有挑战性了。当源文档为阿拉伯语、希伯来语、波斯语或乌尔都语时,转换还必须正确确定文本从右到左流动、RTL 文本中的数字从左到右书写以及整体页面布局从右侧开始。大多数 PDF 到 Word 转换器主要针对 LTR 文档进行设计和测试,其在 RTL 内容上的性能从不完美到完全无法使用。

PDF 格式没有明确地将阅读顺序存储为文本的属性。它将单个文本运行存储为页面上的定位字形。对于 LTR 文本,转换器可以合理地假设文本从左到右、从上到下阅读,因为这与物理布局匹配。对于 RTL 文本,这个假设是完全错误的。在页面上从右向左阅读的一行阿拉伯文本将被假定 LTR 顺序的转换器反转,产生每行向后拼写的输出。这不是一个小格式问题。对于讲阿拉伯语的人来说,阿拉伯语的反行是无法阅读的。

2025 年对多种语言的 PDF 到文本提取准确性的研究发现,在同一组转换工具中,RTL 提取错误率比 LTR 提取错误率高 3.6 倍,其中词序反转是最常见的错误类型(计算语言研究所,“多语言 PDF 文本提取准确性”,2025 年)。研究还发现这些错误不是随机的。特定工具始终正确地处理 RTL 或产生系统性反向输出,这意味着为 RTL 转换选择正确的工具比调整转换设置更重要,并且切换工具可以修复似乎无可救药地损坏的转换。

Can You Convert a PDF to Word and Preserve the Original Reading Order for Right-to-Left Languages

PDF 如何存储 RTL 文本以及简单提取失败的原因

在 PDF 中,文本存储为一系列字形索引和定位命令。对于每个文本运行,PDF 指定字体、字符的字形代码以及页面上每个字形的 X 和 Y 坐标。没有明确的标志表明“此文本是阿拉伯语”。或“此行从右向左读。” PDF 转换器 必须从 Unicode 字符代码推断文本方向,这些代码通过 Unicode 双向算法对方向性进行编码。阿拉伯语和希伯来语字符具有固有的 RTL 方向,并且 Unicode 算法指定如何重新排序 RTL 和 LTR 字符的混合序列以进行显示。

问题在于 PDF 中字形的原始提取顺序可能与原始文本中字符的逻辑顺序不匹配。 PDF 编写器可以自由地将字形以任何顺序放置在页面上,并且某些编写器软件将 RTL 字形从左到右放置在内容流中,即使阅读顺序是从右到左。按提取顺序连接字形的转换器将生成正确或向后读取的文本,具体取决于原始 PDF 编写器选择对文本进行编码的方式。同一个阿拉伯语文档,当从两个不同的文字处理器打印为 PDF 时,可以生成具有不同字形顺序的内容流,并且对一个文档完美工作的转换器可能会为另一个文档生成相反的文本。

Unicode 标准附件 9 中指定的 Unicode 双向算法定义了如何对具有混合方向性的字符序列进行重新排序以进行显示。正确实现此算法的转换器可以正确处理大多数 RTL 文本,无论 PDF 内容流中的字形顺序如何。然而,实施质量各不相同。该算法可以很好地处理常见情况,但也有边缘情况,涉及嵌套方向覆盖、方向边界标点符号以及混合脚本文本(例如阿拉伯语句子中的英语技术术语)。

WukongPDF

尝试 PDF 转 Word

无需安装。直接在您的浏览器中工作。

立即开始 →

选择处理 RTL 读取顺序的转换器

RTL 文档最可靠的转换器是在文本提取期间实现 Unicode 双向算法的转换器。 Adobe Acrobat Pro 和几个开源库(包括 Apache PDFBox 和 pdfplumber)在不同程度上支持该算法。在提交 RTL 文档批次的转换器之前,请使用单个代表性页面对其进行测试。将文本提取到 Word 并逐字比较输出与原始 PDF。检查句子中的词序是否颠倒、RTL 文本中数字的正确位置以及混合的 LTR/RTL 序列(例如阿拉伯语段落中的英文公司名称)。

如果您的转换器始终反转 RTL 文本,有时可以通过使用经过中间格式的转换路径来解决该问题。使用正确处理 RTL 的工具将 PDF 转换为 HTML 或标记文本格式。然后将中间格式导入到Word中。这个两步过程不如直接 PDF 到 Word 转换方便,但当直接路径生成反向文本时,间接路径是获得可用输出的唯一自动路径。

WukongPDF 支持 RTL 感知转换,当源文档的元数据指示 RTL 语言时,该转换会自动应用正确的阅读方向和文本对齐方式。该转换器检测文档的主要脚本,并在文本提取过程中应用适当的方向规则,生成具有正确段落方向、文本对齐和字符顺序的 Word 文档。

使用 RTL 文档保留页面布局结构

阅读顺序影响的不仅仅是文本。 RTL 文档的整个页面布局相对于 LTR 文档是镜像的。阿拉伯语书籍的第一页就是英语读者认为的最后一页。表格从右向左排列。列表在右侧缩进。装订边距位于右侧页面的右侧。正确处理文本方向但不调整布局结构的转换将生成一个 Word 文档,其中文本读取正确,但所有内容的位置都像 LTR 文档一样,其中左对齐段落和左缩进列表对于 RTL 读者来说看起来是错误的。

当 PDF 到 Word 的转换用于编辑和重新导出时,保留PDF 格式布局不太重要,因为编辑器将调整结构。当转换用于存档或参考目的时,Word 文档在视觉上应与原始 PDF 相匹配,因此布局保留更为重要。在这些情况下,请选择一个能够保留原始文本框定位、列布局和边距对齐的转换器。转换后,手动验证每个页面上的文本方向是否正确。检查阿拉伯语和希伯来语文本的段落对齐方式是否设置为右对齐,而不是默认的左对齐。验证所有表的列是否按从右到左的正确顺序排列。这些手动检查会发现自动转换无法检测到的问题,因为转换器不理解内容的语义。

WukongPDF

尝试 PDF 转 Word

无需安装。直接在您的浏览器中工作。

立即开始 →