Tips & Tricks

如何 OCR PDF 并将识别的文本导出为 Markdown 文件

您对 PDF 进行 OCR 识别,识别出的文本将显示在 PDF 编辑器内的文本框中。你可以阅读它。您可以复制并粘贴它。但您真正想要的是 Markdown 文件中的文本,标题格式为散列,列表为星号,链接为方括号对,段落由空行分隔。 Markdown 是开发人员、技术作家、博主以及任何需要干净、可移植文本的人的通用语言,这些文本可以放入静态站点生成器、笔记应用程序或代码存储库中。

从扫描的 PDF 到 Markdown 文件的流程分为两步:OCR 识别文本,然后格式化步骤将识别的文本转换为 Markdown 语法。每个步骤都有影响最终输出质量的工具选择。

How to OCR a PDF and Export the Recognized Text as a Markdown File

步骤 1:OCR PDF 以提取识别的文本

OCR 步骤与使任何 PDF 可搜索相同。使用OCR PDF工具处理扫描的页面。该工具向每个页面添加一个文本层。对于 Markdown 导出,您希望 OCR 输出的格式能够保留尽可能多的结构信息:哪些文本是标题,哪些文本是正文,哪些文本是列表或表格的一部分。标准 OCR 引擎输出纯文本,这会丢失所有结构信息。标题和正文段落成为由换行符分隔的不可区分的文本块。

为获得最佳结果,请使用支持布局感知文本提取的 OCR 引擎。这些引擎分析页面上文本的空间排列,并可以根据字体大小、位置和与其他元素的接近程度来区分标题、正文、说明文字和脚注。 OCR 引擎捕获的结构信息越多,Markdown 转换就越干净。 Adobe Acrobat Pro 的导出到功能包括“带格式的文本”功能。保留一些结构线索的选项。 OCR 引擎保留字体大小和位置元数据,下游转换工具可以使用这些元数据来推断标题级别和段落分隔符。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

步骤2:将识别的文本转换为Markdown

一旦 PDF 具有文本层,就可以通过多种路径进行到 Markdown 的转换。最简单的是从支持 Markdown 作为输出格式的 PDF 编辑器直接导出。当 PDF 经过 OCR 处理时,WukongPDF 的导出选项包括 Markdown 作为目标格式。选择 Markdown 作为输出格式,该工具会生成一个 .md 文件,其中识别的文本根据 Markdown 约定进行格式化:以较大字体开头的行成为哈希前缀标题,缩进的行成为列表项,常规段落由空行分隔。

如果直接 Markdown 导出不可用,则管道是:将识别的文本导出为保留格式的富文本格式(例如 RTF 或 HTML),然后使用转换工具将该中间格式转换为 Markdown。 Pandoc,通用文档转换器,可以很好地处理这个管道。将 PDF 中的文本导出为 HTML,然后运行:pandoc input.html -f html -t markdown -o output.md。 Pandoc 将 HTML 标题标签翻译为 Markdown 哈希,将 HTML 列表标签翻译为 Markdown 列表标记,将 HTML 链接标签翻译为 Markdown 链接语法。输出的质量取决于从 PDF 导出的 HTML 的质量。如果 PDF 导出生成干净、结构良好的 HTML,则 Pandoc 会生成干净的 Markdown。如果导出生成带有内联样式和非语义标签的混乱 HTML,则 Markdown 也会相应地混乱。

清除 Markdown 输出中的 OCR 错误

已识别文本中的 OCR 错误会原封不动地传递到 Markdown 输出。常见错误包括混淆字符,例如“cl”和“cl”。被识别为“d”, “rn”被识别为“m”,和“1”被识别为“l”,尤其是在较小的字体大小或较低质量的扫描中。如果要发布或共享文本,则必须对 Markdown 文件进行审查以发现这些错误。

大多数代码编辑器和 Markdown 编辑器都包含拼写检查功能,可以突出显示无法识别的单词,从而使 OCR 错误易于发现。处理突出显示的单词并根据原始 PDF 进行更正。特别注意专有名词、技术术语和数字,它们最有可能被错误识别,如果发布错误,危害也最大。 OCR 识别出“123,000 美元”的财务报告为“$128,000”包含自动拼写检查无法捕获的重大错误,因为两者都是有效的数字格式。根据源文档手动验证关键值是唯一可靠的保障措施。

在 Markdown 转换中保留图像和表格

Markdown 通过引用外部文件来处理图像:![alt text](path/to/image.png)。将 PDF 转换为 Markdown 时,需要提取 PDF 中的图像并保存为单独的文件,并将参考链接插入到 Markdown 文本的正确位置。 WukongPDF 的PDF Export to Markdown 包括图像提取作为转换的一部分。 PDF 中的每个图像都以 PNG 或 JPEG 文件形式保存在 Markdown 文件旁边的文件夹中,并且 Markdown 文本包含适当的图像参考标签。

桌子更具挑战性。 Markdown 表格使用管道和破折号语法,该语法易于人类阅读,但自动转换器很难从 PDF 表格数据生成,因为 PDF 不将表格存储为结构化数据。他们将字符存储在位置上。转换器必须从字符位置对表格网格进行逆向工程,这对于具有合并单元格、多行单元格内容或不等列宽的复杂表格产生不完美的结果。具有统一列和单行单元格内容的简单网格表可以可靠地转换。复杂的表格可能需要在 Markdown 输出中手动重组。如果表格转换效果不佳,请考虑将其导出为单独的图像,而不是作为 Markdown 表格语法。复杂表格的清晰可读图像比呈现为未对齐列的乱码 Markdown 更有用。

使用 Markdown 文件

生成的 Markdown 文件可以在任何文本编辑器、Obsidian 或 Notion 等笔记应用程序、Hugo 或 Jekyll 等静态站点生成器或 VS Code 等代码编辑器中打开。通过 Markdown,您可以生成用于网站的 HTML、用于分发的 PDF、用于文字处理的 DOCX,或者只是将文本保留为可搜索、版本可控的纯文本格式,该格式将在几十年内可读。

这条管道的价值在档案材料中最为明显。旧的扫描报告、历史文献、绝版出版物,都不仅可以搜索,而且可以转换。 2005 年的扫描报告会变成 Markdown 文件,可以在现代编辑器中进行编辑、转换为网站、在博客文章中引用或以编程方式进行分析。将文本锁定在图像内 20 年的PDF 格式 不再限制内容的使用方式。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →