Tips & Tricks

如何将网页的一部分转换为干净的单页 PDF,没有广告或导航

您找到想要另存为 PDF 的文章、食谱、教程或参考页。您按 Ctrl+P,选择“另存为 PDF”,结果一团糟。该 PDF 包括带有导航菜单的网站标题、带有广告和相关帖子的侧边栏、带有版权和社交媒体链接的页脚以及带有数十个用户帖子的评论部分。您想要的实际内容仅填充每个页面的中间三分之一。

Web 到 PDF 输出从整个网页转换为您想要的内容部分需要使用浏览器阅读器模式、专用的干净打印扩展程序或手动页面设置调整。目标是 PDF 只包含内容,格式清晰便于阅读,没有分散注意力的界面元素。

How to Convert a Section of a Webpage Into a Clean Single-Page PDF Without Ads or Navigation

使用浏览器阅读器模式进行干净的 PDF 输出

大多数现代浏览器都包含阅读器模式,可以从网页中提取主要内容并以干净、无干扰的格式显示。在 Chrome、Edge 和 Firefox 中,当浏览器检测到页面上的文章时,阅读器模式图标会出现在地址栏中。单击该图标进入阅读器模式,然后从阅读器模式视图打印为 PDF。

阅读器模式产生的 PDF 输出比打印整个网页要干净得多。阅读器模式去掉了导航、侧边栏、广告和评论,只留下文章标题、文本和图像。文本采用适当大小的可读字体格式。结果看起来像文档而不是网站的屏幕截图。

并非所有网页都会触发阅读器模式。食谱网站、教程页面和长篇文章通常效果很好。产品页面、论坛主题和交互式 Web 应用程序通常不会。如果阅读器模式不可用,请使用下述替代方法之一。

WukongPDF

尝试将 Word 转为 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

干净网页到 PDF 转换的替代方法

PrintFriendly 和 PDF、Mercury Reader 和 Clearly 等浏览器扩展提供了超越内置阅读器模式的增强型干净打印功能。这些扩展可以在打印前删除特定的页面元素、调整文本大小以及将多页文章合并到单个流动文档中。

WukongPDF提供PDF导出工具,可以处理保存为HTML或打印为PDF的网页内容。该平台可以裁剪、清理和重新格式化 PDF 输出,以删除不需要的元素。

使用浏览器开发人员工具的手动方法可以在打印之前删除特定元素。右键单击不需要的元素,选择“检查”,然后从 HTML 中删除该元素节点。对每个不需要的元素重复此操作。将清理后的页面打印为 PDF。这种方法提供了精确的控制,但一次性转换非常耗时。

配置网页 PDF 输出的打印设置

在将网页打印为 PDF 之前,请打开浏览器打印对话框并调整设置。将边距设置为“最小”或“无”以最大化内容区域。如果页面使用背景颜色或属于内容一部分的图像,则启用背景图形。禁用页眉和页脚以避免 URL、日期和页码覆盖在保存的 PDF 上。

对于PDF格式优化,选择与内容匹配的纸张尺寸。包含大图像的宽幅文章可能会受益于横向方向。窄文本列可能会受益于调整边距的纵向方向。浏览器打印预览显示内容如何适合所选的纸张尺寸。

如果网页内容跨越多个打印页面且分页不方便,请首先使用阅读器模式,该模式会将文本重排为单列。重排的文本在段落边界处自然地跨页面中断,而不是在段落内的任意位置处中断。

组织保存的网页 PDF

使用文章标题和日期命名保存的 PDF。描述性文件名使 PDF 可以在您的文件系统中找到。将网页 PDF 保存到专用文件夹,而不是与其他文档混合。保存文章的文件夹成为个人参考库。

如果您将许多网页另存为 PDF,请将源 URL 添加到 PDF 元数据或第一页的注释中。如果您需要检查更新或与其他人共享链接,则可以通过该 URL 返回实时网页。

一些网站使用无限滚动来在读者向下滚动时加载附加内容。打印无限滚动页面仅捕获当前加载的内容。滚动到页面底部以在打印为 PDF 之前加载所有内容。

付费文章可能无法完整打印。可以打印可见的预览,但不能打印付费专区后面的完整文章。如果您有订阅,请在打印前登录,以便加载完整的文章内容并可用于 PDF 转换。

使用深色模式或自定义配色方案的网页打印时可能会出现反色或缺少背景的情况。浏览器打印对话框通常包含打印背景的选项。如果页面使用深色背景和浅色文本(在没有背景的情况下打印时变得不可见),请启用此选项。

对于包含分步照片的食谱和教程,打印布局应保留每个步骤及其照片。如果分页符将照片与其步骤说明分开,请调整打印边距或使用阅读器模式将它们放在一起。

将网页保存为 PDF 后,将页面 URL 和访问日期添加为首页或 PDF 元数据中的注释。当您在几个月后引用保存的文章并需要检查原始网页是否已更新时,此出处信息非常有价值。

可以使用文件夹或通过向 PDF 元数据添加类别标签来将已保存的网页 PDF 集合组织为类别。保存时的组织工作可防止堆积未分类的保存文章。

对于在初始页面呈现后加载的动态内容的网页(例如延迟加载的图像或 JavaScript 生成的表格),请等待所有内容加载后再打印。滚动浏览整个页面以触发延迟加载。打印捕获是当前页面状态的快照。

一些网站检测打印请求并通过 CSS 媒体查询提供页面的打印优化版本。打印版本可能会重新排列内容、隐藏导航和调整字体大小。如果打印版本设计良好,默认打印输出可能是可以接受的,无需额外的清理。

保存的网页 PDF 成为内容的永久副本,可能会从网络上更改或消失。 PDF 捕获保存时存在的内容,与原始网站的可用性无关。这种持久性是将网页保存为 PDF 而不是依赖书签的主要原因。

已保存的网页 PDF 的组织良好的集合,经过正确命名和分类,可作为个人知识库,随着时间的推移而增长,并且无论互联网连接或网站如何变化,都可以保持可访问性。

浏览器阅读器模式和专用的干净打印扩展代表了实现同一目标的两种不同方法,即从发布者设计的网页呈现中提取用户想要的内容,并且每种方法更适合不同类型的 Web 内容。

保存的网页 PDF 是及时的快照,保留了您发现内容时的原样。出于研究、法律和参考目的,此快照具有书签或链接所没有的证据价值。

从网页保存干净、以内容为中心的 PDF 的能力支持依赖于以稳定、便携式格式捕获 Web 内容的研究、参考和归档工作流程。

将网页内容干净地提取为 PDF 格式会创建一个永久、可移植的记录,该记录独立于原始网站的继续存在,这使其对于研究引文、法律证据和个人参考收藏很有价值。

每次引用保存的文档时,在将其保存为 PDF 之前清理网页所花费的几分钟都会得到回报,因为可以阅读、搜索和共享干净的 PDF,而无需在原始网站界面中导航。

能够从网页中提取您想要的内容并将其另存为干净、可读的 PDF,将短暂的 Web 内容转换为您可以引用、搜索和共享的永久个人文档。

将网页内容保存为干净的 PDF 的做法支持广泛的个人和专业工作流程,从学术研究和法律文档到食谱收集和教程存档,每个工作流程都受益于 PDF 格式的持久性和可移植性。

从网页生成干净的 PDF 所需的几个额外步骤、激活阅读器模式、调整打印设置、删除不需要的元素,是对所保存内容的未来可用性的投资,使其更具可读性、更可共享且外观更专业。

将杂乱的网页转换为干净、重点突出的 PDF(仅包含读者重视的内容)代表了捕获网站和捕获网站旨在传达的信息之间的区别。

从网页保存的干净 PDF 会以永久格式保留您重视的内容。

从网页中保存干净的 PDF 可将转瞬即逝的在线内容转变为永久的个人文档,即使原始网页已更改或从互联网上消失很长时间,这些文档仍可访问和可读。

从网页保存的干净 PDF 可捕捉最佳内容。

方法最适合输出质量努力
浏览器阅读器模式文章、博客文章干净的;良好的排版一键点击
打印友好扩展没有阅读器模式的页面可定制;删除元素点击几下
手动删除元素包含特定不需要的部分的页面精准控制高的;开发者工具
复制粘贴到文字处理程序纯文本内容基本的;图片可能需要手动插入中等的
WukongPDF

尝试将 Word 转为 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →