PDF には、Web サイト、電子メール アドレス、内部文書参照への多数のハイパーリンクが含まれています。検証、アーカイブ、または再利用するには、すべてのリンクのリストが必要です。各リンクを手動でクリックして URL をコピーするのは面倒で、間違いが発生しやすくなります。 PDF リンク 抽出ツールは、PDF からリンク注釈を読み取り、構造化リストにエクスポートします。
PDF 内のハイパーリンクは、リンク注釈として保存されます。リンク注釈は、関連するアクションを持つページ上のオブジェクトです。このアクションは通常、Web アドレスまたは電子メール クライアントを開く URI アクションです。抽出ツールはこれらの注釈を読み取り、URL を抽出してリストにコンパイルします。

PDF ハイパーリンクの保存方法
PDF リンク注釈には 2 つのコンポーネントがあります。1 つはクリック可能な領域を定義するページ上の長方形の領域、もう 1 つは領域がクリックされたときに実行されるアクションです。 URI アクションにはターゲット URL が保存されます。リンクには、下線付きまたは色付きで表示される単語が表示されるテキストも含まれる場合がありますが、URL は表示されるテキストではなくアクションに保存されます。
内部リンクは、ドキュメント内の特定のページまたは名前付きのリンク先に移動する GoTo アクションを使用します。これらは URL ではなく、PDF 内部のナビゲーション コマンドです。抽出ツールは、内部リンクの宛先ページ番号または名前付き宛先をレポートできます。
リンク注釈から PDF データを抽出には、PDF 構造をオブジェクト レベルで解析できるツールが必要です。注釈はページのコンテンツではないため、汎用のテキスト抽出ツールではリンク注釈が表示されません。専用のリンク抽出ツールが必要です。
PDFを編集してみる
インストールは必要ありません。ブラウザで直接動作します。
リンクの抽出とエクスポート
PDF をリンク抽出ツールにロードします。このツールは、リンク注釈のすべてのページをスキャンし、結果をコンパイルします。通常、各エントリには、ページ番号、表示可能なリンク テキスト(使用可能な場合)、URL または宛先、およびリンクの種類(Web、電子メール、または内部)が含まれます。
WukongPDF は、ブラウザを介して PDF Export ツールを提供します。リンク抽出は、ドキュメント分析機能の一部として利用できます。
抽出したリンクリストを整理する
抽出したリンクを CSV または Excel ファイルにエクスポートして、並べ替えやフィルター処理を行います。リンクをタイプ別にグループ化します: 外部 Web サイト、電子メール アドレス、内部文書参照。サンプルをテストして、各外部リンクを検証します。古い PDF 内のリンクは、もう存在しない Web サイトを指している場合があります。
検証と保守のためのリンク リストの使用
公開されたドキュメントの場合、リンク リストは品質保証ツールとして機能します。すべてのリンクが目的の宛先に移動していること、およびリンクが切れていないことを確認します。ソース文書内の壊れたリンクを更新し、PDF を再生成します。
アーカイブされた PDF の場合、リンク リストには、公開時にドキュメントが参照した外部リソースが記載されています。この情報には、リンクされたリソースが利用できなくなった後でも歴史的価値があります。
特殊なリンク タイプの処理
mailto を使用した電子メール リンク: URL は、抽出された各電子メール アドレスにテスト メッセージを送信して検証する必要があります。古い PDF 内の電子メール アドレスは無効になっている可能性があります。リンク抽出では、アドレスがまだアクティブであるかどうかは検証されずに、PDF に表示されるアドレスがそのままレポートされます。
URL に移動するのではなくコードを実行する JavaScript リンクは、単純な URL として抽出できません。抽出ツールは、JavaScript アクションが存在するが、そのターゲットを特定できないことを報告します。これらのリンクの目的を理解するには、手動で検査する必要があります。
PDF 内の埋め込みファイルを開く添付ファイルのリンクは、外部 URL ではなく内部参照です。抽出ツールは添付ファイル名を報告しますが、URL を抽出できません。添付ファイルにアクセスするには、PDF を開いて添付ファイル パネルを使用します。
大きなドキュメントのリンク検証の自動化
数百ものリンクが含まれるドキュメントの場合、自動リンクチェックにより手動検証にかかる時間を節約できます。リンク リストを CSV にエクスポートし、リンク チェッカー ツールを使用して CSV を読み取り、各 URL をテストします。チェッカーは、どのリンクがエラーを返しているか、リダイレクトしているか、または応答が遅いかを報告します。
配布された PDF 内のリンク切れは、読者エクスペリエンスを低下させ、ドキュメントが古いことを示唆します。アクティブに配布されている PDF の定期的なリンク検証をスケジュールします。リンクを修正してソース文書を更新し、PDF を再生成します。
Web サイトの一部である PDF の場合、リンク検証プロセスを Web サイトのリンク チェック ワークフローと統合できます。 Web サイトのリンクを検証するのと同じツールで、抽出された PDF リンク リストを処理し、公開されたすべてのコンテンツにわたる統合されたリンクの健全性レポートを提供できます。
抽出されたリンク リストは、ドキュメントが外部リソースにどのように接続されているかを示すドキュメントのサイトマップとしても機能します。文書参照のこのネットワーク ビューは、文書の範囲を理解し、文書と一緒にアーカイブする必要があるリソースを特定するのに役立ちます。
リンク抽出レポートでは、表示されているページ テキスト上で見つかったリンクと、表示されているテキストのない PDF 構造内にのみ存在するリンクを区別する必要があります。リンク注釈がテキスト コンテンツのないページ領域をカバーしている場合、非表示リンクが発生する可能性があります。
ページごとに繰り返されるページ フッターの URL など、PDF ヘッダーとフッター内のリンクは、抽出レポートに複数回表示されます。これらの繰り返しリンクをグループ化すると、同じ URL が何十回も報告されることがなくなります。
ドメイン名ではなく IP アドレスを使用するリンク先には、抽出レポートでフラグを付ける必要があります。 IP アドレスのリンクは、ターゲット サービスが適切なドメイン名を持つ前に PDF が作成されたことを示している場合があります。
抽出したリンク リストを PDF と一緒に公開する場合は、内部 URL や管理 URL が誤って含まれていないことを確認してください。リンクを抽出すると、一般に公開することを意図していない URL が明らかになる可能性があります。
リンク抽出プロセスでは、文書内に存在しないページや名前付きリンク先を参照する壊れた内部リンクも特定できます。これらの壊れた内部リンクは、読者にとってナビゲーションの行き止まりになります。
より大きなドキュメント コレクションの一部である PDF の場合は、すべてのドキュメントから抽出されたリンク リストを統合して、マスター リンク インデックスを作成します。インデックスは、どのドキュメントがどの外部リソースを参照しているかを示します。
抽出された URL での正規表現の照合により、特定のドメインへのリンク、追跡パラメーターを含むリンク、HTTP などの非推奨のプロトコルを使用するリンクなど、特定のパターンに従うリンクを識別できます。
抽出されたリンク リストはメタデータ アーティファクトであり、PDF と一緒にアーカイブする必要があります。将来の研究者は、すべてのリンクを手動で開かなくても、リンク リストを使用して文書のコンテキストや参照を理解できます。
一部の PDF 作成ツールは、リンク先を反映するテキストとしてリンク情報を文書に埋め込みます。このテキストは、クリック可能なリンクの横または下に表示される場合があり、リンク注釈にアクセスしなくてもテキスト抽出によって抽出できます。
アクセシビリティに準拠するために、PDF 内のすべてのリンクには、リンクの目的を説明する識別可能な代替テキストが必要です。リンク抽出レポートを使用して、ドキュメント全体でのリンクのアクセス可能性を監査できます。
| リンクタイプ | PDF アクション | 抽出された出力 | 検証 |
|---|---|---|---|
| 外部URL | URIアクション | 完全な URL | テストリンク;リダイレクトをチェックする |
| 電子メール (mailto:) | URIアクション | 電子メールアドレス | テストメッセージを送信する |
| 内部ページ参照 | GoToアクション | ページ番号または名前付き宛先 | クリックしてナビゲーションを確認してください |
| JavaScript リンク | JavaScript アクション | アクションコード (URL ではありません) | 手動検査が必要 |
リンク腐れは、ターゲット ページが削除されたり再構成されたりすることでハイパーリンクが時間の経過とともに機能しなくなる現象で、Web ページと同様に PDF にも影響します。今日実行されたリンク抽出は、数年後にアーカイブされた PDF 内のどのリンクがまだアクティブであるかを監査するために使用できます。
複数の埋め込みドキュメントを含む PDF ポートフォリオからリンクを抽出する場合、各埋め込みドキュメントには独自のリンクのセットがあります。抽出ツールは各埋め込みドキュメントを個別に処理し、抽出されたリンクにソースドキュメント名を付ける必要があります。
bit.ly や t.co などの短縮 URL を使用するリンクでは、実際のリンク先がわかりにくくなります。抽出レポートには、PDF にある短縮 URL が含まれています。短縮 URL を最終的な宛先に解決し、両方をレポートに含めることで、各リンクがどこにつながっているかを完全に透明化できます。
抽出されたリンク リストはスプレッドシートにインポートし、ドメインごとに並べ替えることができます。ドメインごとに並べ替えると、ドキュメントが最も頻繁に参照する外部 Web サイトが明らかになります。主に 1 つのドメインにリンクしているドキュメントは、その組織とスポンサーシップまたは提携関係を持っている可能性があります。
アクセシビリティ監査の場合、リンク抽出レポートは説明テキストが欠落しているリンクを特定できます。表示テキストが「ここをクリック」または「続きを読む」であるリンクには、リンク先に関するコンテキストが表示されません。これらの説明的ではないリンクは、意味のあるリンク テキストを含めるようにソース ドキュメント内で更新する必要があります。
政府および法律の PDF には、法令、規制、裁判所の判決へのリンクが含まれることがよくあります。これらの文書のリンク抽出レポートは典拠表として機能し、すべての法的参照とその URL を検証用にリストします。
リンク抽出は、静的 PDF を検証、分析、再利用できる参照の構造化データセットに変換する、シンプルですが強力な機能です。
抽出されたリンク リストは、文書の品質保証ツールとして、また引用されたソースを探索したい読者のための参照リソースとして機能します。
PDFを編集してみる
インストールは必要ありません。ブラウザで直接動作します。
