Tips & Tricks

如何從 PDF 中提取所有超連結並將其匯出到可點擊列表

PDF 包含數十個指向網站、電子郵件地址和內部文件參考的超連結。您需要每個連結的清單以進行驗證、存檔或重新利用。手動點擊每個連結並複製 URL 非常繁瑣且容易出錯。 PDF連結擷取工具從PDF讀取連結註解並將其匯出到結構化清單。

PDF 中的超連結儲存為連結註釋,它們是頁面上具有關聯操作的物件。此操作通常是開啟網址或電子郵件用戶端的 URI 操作。提取工具讀取這些註釋,提取 URL,並將它們編譯成列表。

How to Extract All the Hyperlinks From a PDF and Export Them to a Clickable List

PDF 超連結如何存儲

PDF 連結註解有兩個元件:頁面上定義可點選區域的矩形區域,以及按一下該區域時執行的動作。 URI 操作儲存目標 URL。連結還可能具有可見文本,即帶有下劃線或彩色的單詞,但 URL 存儲在操作中,而不是存儲在可見文本中。

內部連結使用 GoTo 操作導覽至文件中的特定頁面或指定目標。這些不是 URL,而是 PDF 內部導覽命令。提取工具可以報告內部連結的目標頁碼或命名目標。

從連結註釋中提取 PDF 資料 需要一個可以在物件層級解析 PDF 結構的工具。通用文字擷取工具看不到連結註釋,因為註釋不是頁面內容。需要專用的連結擷取工具。

WukongPDF

嘗試編輯 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

提取和導出鏈接

將 PDF 載入到連結提取工具中。該工具掃描每個頁面的連結註釋並編譯結果。每個條目通常包括頁碼、可見連結文字(如果可用)、URL 或目標以及連結類型(Web、電子郵件或內部)。

WukongPDF透過瀏覽器提供PDF匯出工具。連結提取可作為文件分析功能的一部分。

組織提取的連結列表

將提取的連結匯出到 CSV 或 Excel 文件以進行排序和過濾。按類型對連結進行分組:外部網站、電子郵件地址和內部文件引用。透過測試範例來驗證每個外部連結。舊版 PDF 中的連結可能指向不再存在的網站。

使用連結列表進行驗證和維護

對於已發布的文檔,連結清單可作為品質保證工具。驗證每個連結都導航到預期目的地並且沒有連結損壞。更新來源文件中斷開的連結並重新產生 PDF。

對於已存檔的 PDF,連結清單記錄了文件在發佈時引用的外部資源。即使連結的資源不再可用,該資訊也具有歷史價值。

處理特殊連結類型

使用 mailto: URL 的電子郵件連結應透過向每個提取的電子郵件地址發送測試訊息來驗證。舊版 PDF 中的電子郵件地址可能不再有效。連結提取會報告 PDF 中顯示的地址,而不驗證該地址是否仍然有效。

執行程式碼而不是導航到 URL 的 JavaScript 連結無法提取為簡單 URL。提取工具會報告 JavaScript 操作存在,但無法確定其目標。這些連結需要手動檢查才能了解其用途。

開啟 PDF 中嵌入文件的文件附件連結是內部引用,而不是外部 URL。擷取工具會報告附件名稱,但無法擷取 URL。若要存取附件,請開啟 PDF 並使用附件面板。

大型文檔的自動連結驗證

對於具有數百個連結的文檔,自動連結檢查可以節省數小時的手動驗證時間。將連結清單匯出為 CSV,然後使用連結檢查器工具讀取 CSV 並測試每個 URL。檢查器報告哪些連結回傳錯誤、重定向或回應緩慢。

分發的 PDF 中的損壞連結會造成較差的閱讀體驗,並表明該文件已過時。為主動分發的 PDF 安排定期連結驗證。使用修正的連結更新來源文件並重新產生 PDF。

PDF 作為網站的一部分,連結驗證流程可以與網站連結檢查工作流程整合。驗證網站連結的相同工具可以處理提取的 PDF 連結列表,從而為所有已發佈內容提供統一的連結運行狀況報告。

提取的連結清單也可以用作文件的網站地圖,顯示文件如何連接到外部資源。這種文件參考的網路視圖對於理解文件範圍和識別可能需要與文件一起存檔的資源非常有價值。

連結提取報告應區分在可見頁面文字中找到的連結和僅存在於沒有可見文字的 PDF 結構中的連結。當連結註釋覆蓋頁面上沒有文字內容的區域時,可能會出現不可見連結。

PDF 頁首和頁尾中的連結(例如頁尾中在每頁重複的 URL)會在提取報告中多次出現。對這些重複連結進行分組可以避免多次報告相同的 URL。

使用 IP 位址而不是網域名稱的連結目標應在提取報告中標記。 IP 位址連結可能表示 PDF 是在目標服務擁有正確的網域名稱之前建立的。

當提取的連結清單將與 PDF 一起發佈時,請驗證是否無意中包含了任何內部或管理 URL。連結提取可以揭示不適合公眾可見的 URL。

連結提取過程還可以識別文件中不再存在的引用頁面或指定目的地的損壞的內部連結。這些損壞的內部連結對於讀者來說是導航死胡同。

對於屬於較大文件集合一部分的 PDF,請合併從所有文件中提取的連結清單以建立主連結索引。此索引顯示哪些文件引用了哪些外部資源。

對提取的 URL 進行正則表達式匹配可以識別遵循特定模式的鏈接,例如指向特定域的鏈接、帶有跟踪參數的鏈接或使用已棄用的協議(如 HTTP)的鏈接。

提取的連結清單是元資料工件,應與 PDF 一起存檔。未來的研究人員可以使用連結清單來了解文件上下文和參考文獻,而無需手動開啟每個連結。

某些 PDF 建立工具將連結資訊作為鏡像連結目標的文字嵌入到文件中。該文字可能會出現在可點擊連結旁邊或下方,即使沒有連結註釋存取權限也可以透過文字擷取來提取。

為了符合輔助功能要求,PDF 中的每個連結都應該有一個可識別的替代文字來描述連結的用途。連結提取報告可用於審核整個文件中的連結可存取性。

連結類型PDF 操作提取輸出驗證
外部網址URI 操作完整網址測試連結;檢查重定向
電子郵件(郵寄地址:)URI 操作電子郵件發送測試訊息
內部頁參考轉到操作頁碼或指定目的地點擊驗證導航
JavaScript 連結JavaScript 動作操作代碼(不是 URL)需要人工檢查

連結失效是指由於目標頁面被刪除或重組而導致超連結隨著時間的推移而停止工作的現象,它會像影響網頁一樣影響 PDF。今天執行的連結提取可能會在幾年後用於審核存檔 PDF 中的哪些連結仍然有效。

從包含多個嵌入文件的 PDF 套件中提取連結時,每個嵌入文件都有自己的一組連結。提取工具應單獨處理每個嵌入文檔,並使用來源文檔名稱標記提取的連結。

使用 bit.ly 或 t.co 等 URL 縮短器的連結會掩蓋實際目的地。提取報告包括 PDF 中的縮短 URL。將縮短的 URL 解析到最終目的地並將兩者都包含在報告中,可以提供每個連結指向何處的完全透明度。

提取的連結清單可以匯入到電子表格中並按網域排序。按網域排序可以揭示文件最常引用的外部網站。主要連結到一個網域的文件可能與該組織有贊助或從屬關係。

對於可訪問性審核,連結提取報告可以識別缺乏描述性文字的連結。可見文字為「按此」或「閱讀更多」的連結不提供有關其目的地的上下文。應在來源文件中更新這些非描述性鏈接,以包含有意義的連結文字。

政府和法律 PDF 通常包含法規、法規和法院判決的連結。這些文件的連結提取報告充當權限表,列出每個法律引用及其 URL 以供驗證。

連結提取是一種簡單但強大的功能,可將靜態 PDF 轉換為可驗證、分析和重複利用的結構化參考資料集。

擷取的連結清單可作為文件的品質保證工具,並作為想要探索引用來源的讀者的參考資源。

WukongPDF

嘗試編輯 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →