Tips & Tricks

如何将 PDF 导出为保留段落和标题的干净文本文件

您需要采用您可以使用的格式的 PDF 文本。不是带有格式的 Word 文档,不是带有隐藏文本层的可搜索 PDF,而是纯文本文件,其中段落是段落,标题是标题。 PDF 到文本 的转换可保留文档结构,为您提供可供分析、重新调整用途或存档的内容。该文本文件可以在任何编辑器中打开,可以通过脚本进行处理,并且在当前文档格式可能已过时的几十年后仍然可读。

结构良好的文本导出的价值不仅仅是方便。纯文本是有史以来最便携的数字格式。打开 1970 年编写的文本文件就像昨天编写的文件一样容易。将 PDF 转换为干净的结构化文本可确保无论软件如何发展,文档内容仍然可访问。

How to Export a PDF as a Clean Text File With Paragraphs and Headings Preserved

为什么简单的复制粘贴不能保留段落结构

当您选择 PDF 中的所有文本并复制它时,剪贴板会按照文本在 PDF 内容流中出现的顺序接收文本。内容流是一系列绘图指令,而不是逻辑文档结构。原始 PDF 创建者将文本换行以适合页面的位置会出现换行符。段落分隔符可以由剪贴板捕获丢失的额外行间距来表示。标题可能会显示为常规文本,但不表明其结构作用。

复制粘贴输出需要手动重新格式化才能恢复原始段落结构。您必须扫描粘贴的文本,确定段落开始和结束的位置,删除段落内文本换行符,并在它们所属的位置添加段落分隔符。对于多页文档,这种手动清理可能比重新键入内容花费更长的时间。

PDF 格式 文本的内部表示与文字处理器表示文本的方式根本不同。文字处理器将文本存储为带有段落标记的流。 PDF 将文本存储为页面上的定位字符。从定位字符转换为流动段落需要一个能够理解段落检测的排版约定的提取工具。

了解这种差异是清洁萃取的关键。

WukongPDF

尝试 PDF 转 Word

无需安装。直接在您的浏览器中工作。

立即开始 →

使用结构化文本提取工具

专用文本提取工具在数据级别分析 PDF 并重建逻辑文档结构。他们通过查看行距、缩进和字体变化来检测段落边界。它们通过检测较大的字体大小、粗体格式和编号模式来识别标题。输出保留文本格式中反映的文档层次结构。

WukongPDF 提供PDF Export 功能,用于通过浏览器从 PDF 中提取文本。提取保留了段落结构,其中源 PDF 包含足够的格式信息来识别它。对于缺少格式提示的 PDF,提取的文本将保持原始阅读顺序。

选择文本提取工具时,请在与您经常处理的文档类似的文档上进行测试。提取文本并将其与原始 PDF 进行比较。检查段落边界是否正确,标题是否可识别,以及重音字母和符号等特殊字符是否保留。适用于一种文档类型的工具可能不适用于另一种文档。

在文本提取过程中处理特殊内容

表格是文本提取中最具挑战性的内容类型。 PDF 中的表格在视觉上以行和列的形式呈现数据,但内部表示可能以阅读顺序、列顺序或不可预测的顺序存储单元格。不专门处理表格的文本提取工具会生成交错文本,其中 A 列值出现在 B 列值之间。对于具有重要表格内容的 PDF,请考虑转换为 CSV 或 Excel,而不是纯文本。

如果项目符号或数字存储为单独定位的字符而不是文本流的一部分,则列表(无论是项目符号列表还是编号列表)都可能在提取过程中丢失其结构。提取的文本可能会将列表项显示为单独的段落,而不指示它们属于列表。一些提取工具会检测列表模式并添加前缀字符以保留列表结构。

脚注和尾注提出了空间挑战。在 PDF 视觉布局中,脚注出现在页面底部,远离引用它的文本。在文本提取中,脚注可能出现在包含参考文献的段落中间,也可能出现在不相关的段落之间。最好的提取工具将脚注推迟到文档末尾或将其插入段落边界。

对提取的文本进行后处理以实现最大程度的清洁

提取后,对文本文件运行清理过程。使用查找和替换将多个空格转换为单个空格。删除行结尾处的尾随空格。如果扫描原始 PDF,请检查常见的 OCR 伪影:重复的字符、单词之间缺少空格以及错误识别的标点符号。

对于标题标识很重要的文档,请扫描提取的文本以查找行首以粗体文本或全部大写文本开头的部分。这些格式模式通常指示标题。手动使用一致的前缀标记标题,例如二级标题的##,以使纯文本中的文档结构清晰。

输出文本文件的编码对于长期可用性很重要。 UTF-8 是现代文本文件的标准编码,支持几乎所有书写系统的字符。保存为 UTF-8 的文本文件可以在任何现代设备上正确打开。 ASCII 或 Latin-1 等较旧的编码会丢失非英语语言中的字符。从 PDF 导出文本时,请验证导出工具是否使用 UTF-8 编码,或将输出转换为 UTF-8 作为后处理步骤。

对于包含多种语言文本的 PDF,文本提取必须处理所有存在语言的字符集。偶尔包含法语或德语单词的英语文档使用扩展拉丁字符集中的字符。混合英语和日语的文档需要完整的 Unicode 支持。大多数现代提取工具都能正确处理多语言文本,但在包含非英语文本的页面上测试输出可确认字符处理。

页眉和页脚在提取过程中呈现重复出现的文本,这可能会使输出混乱。每页上出现的页码、文档标题和日期戳都会与主要内容一起提取。某些提取工具可以检测并删除重复的页眉和页脚文本。如果您的工具不包含此功能,则识别跨多个页面重复的行的后处理脚本可以将其过滤掉。

对于具有复杂多列布局的 PDF,文本的提取顺序可能很难以编程方式确定。两栏的学术论文应首先提取第一栏,然后提取第二栏。报纸布局的每页上的文章跨栏不同,即使是最好的提取算法也面临着挑战。对于这些文档,提取的文本可能需要手动重新排序才能恢复预期的阅读顺序。

提取的文本文件可以通过自然语言处理工具进一步处理进行分析。情感分析、关键词提取和主题建模都适用于纯文本输入。将 PDF 转换为干净的文本可以解锁文档集合的这些分析功能,否则需要手动阅读和注释。

从使用连字(将两个或多个字母组合成单个字形的特殊印刷字符)的 PDF 中提取文本可能会产生意外的结果。 fi 和 fl 等常见连字可能会提取为单个字符或两个单独的字符,具体取决于 PDF 编码。广泛使用连字的文档(常见于专业排版书籍和学术期刊)需要仔细验证提取文本的准确性。

对于从扫描书籍创建的 PDF(其中对页被扫描为单个图像),文本提取必须首先将每个扫描图像分成左页和右页,然后对每一半运行 OCR。如果无法拆分对页,则会导致文本中左页的最后一个单词与右页的第一个单词重叠。

PDF 的纯文本输出可以作为各种下游流程的输入。文本分析工具可以识别关键主题和情绪。翻译工具可以将文本转换为其他语言。搜索索引工具可以使文档内容在整个组织中可被发现。纯文本文件是通用交换格式,它将 PDF 连接到更广泛的文本处理工具生态系统。

从 PDF 文件夹中批量提取文本会生成可搜索的文本语料库。提取的文本文件可以通过桌面搜索工具建立索引,从而可以通过单个搜索框搜索数百个 PDF 的内容。此功能可将静态文档存档转换为可搜索的知识库,而无需修改原始 PDF 文件。

从 PDF 导出的干净文本以最便携和最持久的形式表示文档内容,可用于从全文搜索到自然语言处理再到长期存档保存的任何用例,并且格式在未来几十年内仍保持可读。

投入时间进行正确的文本提取设置会产生干净、结构化的输出,作为文档内容搜索、分析、翻译和归档的基础。

从 PDF 中提取的结构良好的文本文件以最易于访问且面向未来的形式保留文档内容。

生成的文本文件将满足您未来几年的需求。

内容类型萃取行为质量提示
正文段落提取为流动文本检查段落分隔符是否与原文相符
标题通过字体大小/粗体检测;用##标记验证所有已识别的标题
表格细胞可以交错;考虑 CSV 导出对于表格数据,使用 Excel/CSV 输出
列表子弹可能会丢失;手动添加前缀检查列表项是否已分组
WukongPDF

尝试 PDF 转 Word

无需安装。直接在您的浏览器中工作。

立即开始 →