Tips & Tricks

如何将 PDF 手册转换为一组相互链接的 HTML 页面

PDF 产品手册是一个独立的文档。一组相互链接的 HTML 页面是一个可导航的网站。将前者转换为后者使得内容可以通过搜索引擎发现,可以在任何带有浏览器的设备上访问,并且可以轻松更新而无需重新生成整个文档。 PDF Export 到 HTML 的转换保留了内容,同时添加了静态 PDF 无法提供的 Web 原生导航。

转换不仅仅涉及将 PDF 保存为 HTML。每个章节或主要部分都成为其自己的 HTML 页面。内部交叉引用成为页面之间的超链接。目录成为导航侧边栏或菜单。页码被命名的锚点替换。结果是一个最初作为 PDF 手册的文档网站。

WukongPDF 的Web 到 PDF 工具可双向工作,支持从 Web 内容生成 PDF 和从 PDF 进行 Web 导出。

How to Convert a PDF Manual Into a Set of Interlinked HTML Pages

根据 PDF 规划 HTML 结构

转换之前,将 PDF 结构映射到 Web 结构。确定每个 HTML 页面的开始和结束位置。包含 10 章的 100 页 PDF 手册变成大约 10 到 12 个 HTML 页,其中引言、每章和附录作为单独的页面。该映射可确保转换生成逻辑 Web 导航结构,而不是每个 PDF 页面一个 HTML 文件。

识别 PDF 中将成为超链接的内部交叉引用。 PDF 中阅读第 5 章了解详细信息的句子将成为指向第 5 章 HTML 页面的可点击链接。目录条目成为导航链接。索引条目成为其引用部分的链接。在转换过程中保留此交叉引用结构可以保持文档的可用性。

WukongPDF

尝试 PDF 转 Word

无需安装。直接在您的浏览器中工作。

立即开始 →

方法 1:通过 Microsoft Word 导出为 HTML

使用 Acrobat Pro 的导出到 Word 功能或在线转换器将 PDF 转换为 Word 格式。在 Microsoft Word 中打开生成的 DOCX。使用 Word 的标题样式可确保整个文档的标题层次结构一致。每个标题 1 都成为潜在的 HTML 页面断点。

在 Word 中,转到“文件”、“另存为”,然后从格式下拉列表中选择“网页”、“筛选”。已过滤的 HTML 选项可生成更清晰的 HTML,而无需使用使标准网页选项变得臃肿的 Office 特定标记。 Word 将文档另存为带有嵌入图像的单个 HTML 文件。对于多页输出,请按章节将 Word 文档拆分为单独的文件,并将每个文件另存为 HTML。

方法 2:专用 PDF 到 HTML 转换器

有多种工具专门用于将 PDF 转换为结构化 HTML。 Adobe Acrobat Pro 的“文件”、“导出”下的“导出为 HTML”选项可以为简单的布局生成不错的结果。输出保留文本格式、图像位置和基本表结构。 PDF 中的链接将转换为 HTML 超链接。

对于更复杂的 PDF,专门的转换服务和开源工具(如 pdf2htmlEX)可生成更高保真度的输出。 pdf2htmlEX 将每个 PDF 页面转换为具有精确定位的文本和图像的 HTML 页面,保留精确的视觉布局。代价是 HTML 是注重布局的而不是语义结构化的,这使得它比从结构化内容构建的 HTML 更难编辑和维护。

方法 3:手动 HTML 重建以获得最佳质量

当谈到文档工作流程时,对于质量和可维护性都很重要的手册,提取内容并以 HTML 形式重建它会产生最佳结果。使用干净段落提取一章中描述的技术从 PDF 中提取所有文本。以全分辨率提取所有图像。使用静态站点生成器或简单的 HTML 模板来组装页面。

在实践中,手动重建方法最初需要更多时间,但会生成干净、语义化且易于更新的 HTML。当产品发生变化并且手册需要修订时,编辑结构良好的 HTML 页面比重新导出和重新转换整个 PDF 更快。对干净 HTML 的初始投资会在每个后续更新周期中得到回报。

创建页面之间的导航

将每个部分转换为自己的 HTML 页面后,构建页面之间的导航。在每个页面的顶部和底部添加上一个和下一个链接。从目录条目构建导航侧边栏。添加面包屑导航,显示当前页面在文档层次结构中的位置。

实际上,在实践中,内部导航将一组独立的 HTML 页面转换为一个内聚的 Web 文档。从搜索引擎结果登陆页面的读者可以导航到相邻页面,而无需返回搜索结果。导航结构尊重读者浏览内容的旅程。

随着时间的推移维护转换后的 HTML

转换后的 HTML 页面是动态文档,当源 PDF 发生更改时,应更新这些文档。建立同步更新的流程。修订 PDF 手册时,确定哪些部分发生了更改,并仅更新那些 HTML 页面,而不是重新生成整个站点。

将 HTML 源代码与 PDF 源代码一起存储在版本控制中。跟踪任一格式的每次修订,并记录 PDF 部分和 HTML 页面之间的关系。版本控制存储库是 PDF 和 HTML 版本手册的唯一真实来源。

将 PDF 手册转换为相互链接的 HTML 页面,将文档的覆盖范围扩展到网络搜索、移动设备和喜欢基于浏览器阅读的用户。该转换是一项一次性投资,可为以前仅作为可下载文件存在的内容提供持续的网络展示。

转换方法努力输出质量
通过 Word 导出为 HTML低的干净但可能会丢失复杂的格式
专用 PDF 转 HTML 工具中等的良好的布局保存
在 HTML 中手动重建高的最好的质量,最严格的控制

当谈到文档工作流程时,对于产品文档团队来说,PDF 到 HTML 的转换弥合了面向打印的创作工作流程和现代用户期望的基于 Web 的交付之间的差距。 PDF 仍然是权威的印刷版。 HTML 提供可访问、可搜索、可链接的网络版本。

使转换后的 HTML 能够响应移动设备

在大多数工具中,PDF 转换的初始 HTML 输出通常使用与 PDF 页面尺寸匹配的固定宽度布局。这在手机和平板电脑上效果不佳。转换后,添加响应式 CSS,以针对不同屏幕宽度重排内容。具有最大宽度和灵活图像的简单响应式包装器可将转换后的内容适应移动屏幕。

响应式设计是 HTML 相对于 PDF 在内容交付方面的主要优势之一。在手机上查看 PDF 需要捏合和缩放才能阅读。具有响应式设计的 HTML 页面会自动将文本重新格式化为可读大小。响应式转换步骤增加了基本格式转换之外的价值。

搜索引擎元数据提高了转换后的 HTML 页面的可发现性:

通常,转换后的 HTML 页面受益于 PDF 中不需要的元数据。向每个页面添加标题标签、元描述和开放图谱标签。 HTML 标题应与章节标题匹配。元描述应以 150 到 160 个字符概括该部分内容。这些添加使得转换后的内容可以通过搜索引擎发现。

对于多页文档集,添加列出所有 HTML 页面的 sitemap.xml 文件。将站点地图提交给搜索引擎。页面之间的内部链接应使用包含相关关键字的描述性锚文本。 SEO 添加将转换后的 HTML 从静态文档转储转换为搜索优化的 Web 资源。

在 HTML 转换期间处理图像和图形

必须提取 PDF 中嵌入的图像并将其保存为 HTML 页面的单独图像文件。 Acrobat Pro 导出为 HTML 会自动提取图像并将其放置在子文件夹中。 HTML 使用相对路径引用图像。确保上传到 Web 服务器时图像文件夹与 HTML 文件一起传输。

对于文档处理,对于带有图表、屏幕截图或照片的手册,PDF 提取的图像质量通常足以用于 Web 显示。 PDF 图像的打印分辨率通常高于屏幕所需的分辨率。 HTML 导出可能会自动对图像进行缩减采样。如果图像出现像素化或过大,请检查输出图像分辨率并调整导出设置。

通常,PDF 手册的互连 HTML 版本可以为仅 PDF 无法覆盖的受众提供服务。通过查询查找特定部分的搜索引擎用户。需要响应式文本的移动读者。使用 HTML 比 PDF 效果更好的辅助技术的用户。 HTML 版本扩展了文档的范围,但没有取代 PDF 作为权威的打印版本。

对于同时为印刷版和网络读者提供服务的文档,将 PDF 保留为主要格式并生成 HTML 作为分发格式可以两全其美。 PDF 保留了打印保真度。 HTML 提供网络可访问性。两者都源自相同的权威内容。

关于文档工作流程,对于大多数文档,此处描述的 PDF 到 HTML 转换工作流程会生成同时为人类读者和搜索引擎服务的输出。 HTML 版本的可发现性、可导航性和可访问性是 PDF 原始版本所无法比拟的。这两种格式相辅相成,PDF 充当权威版本,HTML 充当可访问的分发格式。

对于文档团队来说,提供 PDF 和 HTML 格式的内容可以满足所有用户的需求:喜欢下载和打印的用户,以及喜欢在线阅读和搜索的用户。双格式方法最大限度地提高了文档内容的可访问性和覆盖范围,满足所有受众的喜好,从需要打印和注释的人到在线搜索和阅读的人。

WukongPDF

尝试 PDF 转 Word

无需安装。直接在您的浏览器中工作。

立即开始 →