Tips & Tricks

如何將 PDF 手冊轉換為一組相互連結的 HTML 頁面

PDF 產品手冊是一個獨立的文件。一組相互連結的 HTML 頁面是一個可導航的網站。將前者轉換為後者使得內容可以透過搜尋引擎發現,可以在任何具有瀏覽器的設備上訪問,並且可以輕鬆更新而無需重新生成整個文件。 PDF Export 到 HTML 的轉換保留了內容,同時加入了靜態 PDF 無法提供的 Web 原生導覽。

轉換不僅涉及將 PDF 保存為 HTML。每個章節或主要部分都成為自己的 HTML 頁面。內部交叉引用成為頁面之間的超連結。目錄成為導航側邊欄或選單。頁碼被命名的錨點替換。結果是一個最初作為 PDF 手冊的文檔網站。

WukongPDF 的Web 到 PDF 工具可雙向運作,支援從 Web 內容產生 PDF 和從 PDF 進行 Web 匯出。

How to Convert a PDF Manual Into a Set of Interlinked HTML Pages

根據 PDF 規劃 HTML 結構

轉換之前,將 PDF 結構對應到 Web 結構。確定每個 HTML 頁面的開始和結束位置。包含 10 章的 100 頁 PDF 手冊變成大約 10 到 12 個 HTML 頁,其中引言、每章和附錄作為單獨的頁面。此對應可確保轉換產生邏輯 Web 導覽結構,而不是每個 PDF 頁面一個 HTML 檔案。

識別 PDF 中將成為超連結的內部交叉引用。 PDF 中閱讀第 5 章以了解詳細資訊的句子將成為指向第 5 章 HTML 頁面的可點擊連結。目錄條目成為導航連結。索引條目成為其引用部分的連結。在轉換過程中保留此交叉引用結構可以保持文件的可用性。

WukongPDF

嘗試 PDF 轉 Word

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

方法 1:透過 Microsoft Word 匯出為 HTML

使用 Acrobat Pro 的匯出至 Word 功能或線上轉換器將 PDF 轉換為 Word 格式。在 Microsoft Word 中開啟產生的 DOCX。使用 Word 的標題樣式可確保整個文件的標題層次結構一致。每個標題 1 都成為潛在的 HTML 頁面斷點。

在 Word 中,前往“文件”、“另存為”,然後從格式下拉清單中選擇“網頁”、“篩選”。已過濾的 HTML 選項可產生更清晰的 HTML,而無需使用使標準網頁選項變得臃腫的 Office 特定標記。 Word 將文件儲存為具有嵌入影像的單一 HTML 檔案。對於多頁輸出,請按章節將 Word 文件拆分為單獨的文件,並將每個文件另存為 HTML。

方法 2:專用 PDF 到 HTML 轉換器

有多種工具專門用於將 PDF 轉換為結構化 HTML。 Adobe Acrobat Pro 的「檔案」、「匯出」下的「匯出為 HTML」選項可以為簡單的佈局產生不錯的結果。輸出保留文字格式、影像位置和基本表結構。 PDF 中的連結將轉換為 HTML 超連結。

對於更複雜的 PDF,專門的轉換服務和開源工具(如 pdf2htmlEX)可產生更高保真度的輸出。 pdf2htmlEX 將每個 PDF 頁面轉換為具有精確定位的文字和圖像的 HTML 頁面,保留精確的視覺佈局。代價是 HTML 是注重佈局的而不是語義結構化的,這使得它比從結構化內容構建的 HTML 更難編輯和維護。

方法 3:手動 HTML 重建以獲得最佳品質

當涉及文件工作流程時,對於品質和可維護性都很重要的手冊,提取內容並以 HTML 形式重建它會產生最佳結果。使用乾淨段落提取一章中描述的技術從 PDF 中提取所有文字。以全解析度擷取所有影像。使用靜態網站產生器或簡單的 HTML 範本來組裝頁面。

在實踐中,手動重建方法最初需要更多時間,但會產生乾淨、語義化且易於更新的 HTML。當產品變更且手冊需要修訂時,編輯結構良好的 HTML 頁面比重新匯出和重新轉換整個 PDF 更快。對乾淨 HTML 的初始投資會在每個後續更新周期中得到回報。

創建頁面之間的導航

將每個部分轉換為自己的 HTML 頁面後,建立頁面之間的導覽。在每個頁面的頂部和底部添加上一個和下一個連結。從目錄條目建立導航側邊欄。新增麵包屑導航,顯示目前頁面在文件層次結構中的位置。

實際上,在實踐中,內部導航將一組獨立的 HTML 頁面轉換為一個內聚的 Web 文件。從搜尋引擎結果登陸頁面的讀者可以導航到相鄰頁面,而無需返回搜尋結果。導航結構尊重讀者瀏覽內容的旅程。

隨著時間的推移維護轉換後的 HTML

轉換後的 HTML 頁面是動態文檔,當來源 PDF 發生變更時,應更新這些文檔。建立同步更新的流程。修訂 PDF 手冊時,確定哪些部分發生了更改,並僅更新那些 HTML 頁面,而不是重新產生整個網站。

將 HTML 原始碼與 PDF 原始碼一起儲存在版本控制中。追蹤任一格式的每次修訂,並記錄 PDF 部分和 HTML 頁面之間的關係。版本控制儲存庫是 PDF 和 HTML 版本手冊的唯一真實來源。

將 PDF 手冊轉換為相互連結的 HTML 頁面,將文件的覆蓋範圍擴展到網路搜尋、行動裝置和喜歡基於瀏覽器閱讀的使用者。該轉換是一項一次性投資,可為以前僅作為可下載檔案存在的內容提供持續的網路展示。

轉換方法努力輸出質量
透過 Word 匯出為 HTML低的乾淨但可能會失去複雜的格式
專用 PDF 轉 HTML 工具中等的良好的佈局保存
在 HTML 中手動重建高的最好的質量,最嚴格的控制

當談到文件工作流程時,對於產品文件團隊來說,PDF 到 HTML 的轉換彌合了面向列印的創作工作流程和現代用戶期望的基於 Web 的交付之間的差距。 PDF 仍然是權威的印刷版。 HTML 提供可存取、可搜尋、可連結的網頁版本。

使轉換後的 HTML 能夠回應行動裝置

在大多數工具中,PDF 轉換的初始 HTML 輸出通常會使用與 PDF 頁面尺寸相符的固定寬度佈局。這在手機和平板電腦上效果不佳。轉換後,新增響應式 CSS,以針對不同螢幕寬度重新排列內容。具有最大寬度和靈活影像的簡單響應式包裝器可將轉換後的內容適應移動螢幕。

響應式設計是 HTML 相對於 PDF 在內容傳遞方面的主要優勢之一。在手機上查看 PDF 需要捏合和縮放才能閱讀。具有響應式設計的 HTML 頁面會自動將文字重新格式化為可讀大小。響應式轉換步驟增加了基本格式轉換以外的價值。

搜尋引擎元資料提高了轉換後的 HTML 頁面的可發現性:

通常,轉換後的 HTML 頁面受益於 PDF 中不需要的元資料。為每個頁面新增標題標籤、元描述和開放圖譜標籤。 HTML 標題應與章節標題相符。元描述應以 150 到 160 個字元概括該部分內容。這些添加使得轉換後的內容可以透過搜尋引擎發現。

對於多頁文件集,新增列出所有 HTML 頁面的 sitemap.xml 檔案。將網站地圖提交給搜尋引擎。頁面之間的內部連結應使用包含相關關鍵字的描述性錨文本。 SEO 新增將轉換後的 HTML 從靜態文件轉儲轉換為搜尋優化的 Web 資源。

在 HTML 轉換期間處理圖像和圖形

必須提取 PDF 中嵌入的圖像並將其儲存為 HTML 頁面的單獨圖像檔案。 Acrobat Pro 匯出為 HTML 會自動擷取映像並將其放置在子資料夾中。 HTML 使用相對路徑引用圖像。確保上傳到 Web 伺服器時圖像資料夾與 HTML 檔案一起傳輸。

對於文件處理,對於具有圖表、螢幕截圖或照片的手冊,PDF 提取的影像品質通常足以用於 Web 顯示。 PDF 影像的列印解析度通常高於螢幕所需的解析度。 HTML 匯出可能會自動對影像進行縮減取樣。如果影像出現像素化或過大,請檢查輸出影像解析度並調整匯出設定。

通常,PDF 手冊的互連 HTML 版本可以為僅 PDF 無法覆蓋的受眾提供服務。透過查詢尋找特定部分的搜尋引擎使用者。需要響應式文字的移動讀者。使用 HTML 比 PDF 效果更好的輔助技術的使用者。 HTML 版本擴展了文件的範圍,但沒有取代 PDF 作為權威的列印版本。

對於同時為印刷版和網路讀者提供服務的文檔,將 PDF 保留為主要格式並產生 HTML 作為分發格式可以兩全其美。 PDF 保留了列印保真度。 HTML 提供網頁可存取性。兩者都源自於相同的權威內容。

關於文件工作流程,對於大多數文檔,此處所述的 PDF 到 HTML 轉換工作流程會產生同時為人類讀者和搜尋引擎服務的輸出。 HTML 版本的可發現性、可導航性和可存取性是 PDF 原始版本所無法比擬的。這兩種格式相輔相成,PDF 充當權威版本,HTML 充當可訪問的分發格式。

對於文件團隊來說,提供 PDF 和 HTML 格式的內容可以滿足所有用戶的需求:喜歡下載和列印的用戶,以及喜歡在線上閱讀和搜尋的用戶。雙格式方法最大限度地提高了文件內容的可訪問性和覆蓋範圍,滿足所有受眾的喜好,從需要列印和註釋的人到在線搜尋和閱讀的人。

WukongPDF

嘗試 PDF 轉 Word

無需安裝。直接在您的瀏覽器中工作。

立即開始 →