Ein PDF enthält Dutzende Hyperlinks zu Websites, E-Mail-Adressen und internen Dokumentverweisen. Sie benötigen eine Liste aller Links zur Überprüfung, Archivierung oder Wiederverwendung. Das manuelle Klicken auf jeden Link und das Kopieren der URL ist mühsam und fehleranfällig. Ein PDF-Links-Extraktionstool liest die Linkanmerkungen aus dem PDF und exportiert sie in eine strukturierte Liste.
Hyperlinks in PDFs werden als Linkanmerkungen gespeichert, bei denen es sich um Objekte auf der Seite mit einer zugehörigen Aktion handelt. Bei der Aktion handelt es sich in der Regel um eine URI-Aktion, die eine Webadresse oder einen E-Mail-Client öffnet. Das Extraktionstool liest diese Anmerkungen, extrahiert die URLs und stellt sie in einer Liste zusammen.

So werden PDF-Hyperlinks gespeichert
Eine PDF-Linkanmerkung besteht aus zwei Komponenten: einem rechteckigen Bereich auf der Seite, der den anklickbaren Bereich definiert, und einer Aktion, die ausgeführt wird, wenn auf den Bereich geklickt wird. Die URI-Aktion speichert die Ziel-URL. Der Link kann auch sichtbaren Text enthalten, d. h. die Wörter werden unterstrichen oder farbig angezeigt. Die URL wird jedoch in der Aktion und nicht im sichtbaren Text gespeichert.
Interne Links verwenden GoTo-Aktionen, die zu einer bestimmten Seite oder einem benannten Ziel innerhalb des Dokuments navigieren. Dabei handelt es sich nicht um URLs, sondern um PDF-interne Navigationsbefehle. Das Extraktionstool kann die Zielseitennummer oder das benannte Ziel für interne Links melden.
Extrahieren von PDF-Daten aus Linkanmerkungen erfordert ein Tool, das die PDF-Struktur auf Objektebene analysieren kann. Allzweck-Textextraktionstools erkennen keine Linkanmerkungen, da es sich bei Anmerkungen nicht um Seiteninhalte handelt. Es ist ein spezielles Link-Extraktionstool erforderlich.
Versuchen Sie es mit „PDF bearbeiten“.
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Extrahieren und Exportieren von Links
Laden Sie das PDF in ein Link-Extraktionstool. Das Tool durchsucht jede Seite nach Linkanmerkungen und stellt die Ergebnisse zusammen. Jeder Eintrag enthält normalerweise die Seitenzahl, den sichtbaren Linktext (falls verfügbar), die URL oder das Ziel sowie den Linktyp, Web, E-Mail oder intern.
WukongPDF bietet PDF-Export-Tools über den Browser. Die Linkextraktion ist als Teil der Dokumentanalysefunktionen verfügbar.
Organisieren der extrahierten Linkliste
Exportieren Sie die extrahierten Links zum Sortieren und Filtern in eine CSV- oder Excel-Datei. Gruppieren Sie Links nach Typ: externe Websites, E-Mail-Adressen und interne Dokumentreferenzen. Überprüfen Sie jeden externen Link, indem Sie ein Beispiel testen. Links in älteren PDFs verweisen möglicherweise auf Websites, die nicht mehr existieren.
Verwendung der Linkliste zur Überprüfung und Wartung
Bei veröffentlichten Dokumenten dient die Linkliste als Qualitätssicherungsinstrument. Stellen Sie sicher, dass jeder Link zum beabsichtigten Ziel führt und dass keine Links unterbrochen sind. Aktualisieren Sie defekte Links im Quelldokument und generieren Sie das PDF neu.
Bei archivierten PDFs dokumentiert die Linkliste, auf welche externen Ressourcen das Dokument zum Zeitpunkt der Veröffentlichung verwiesen hat. Diese Informationen haben auch dann historischen Wert, wenn die verknüpften Ressourcen nicht mehr verfügbar sind.
Umgang mit speziellen Linktypen
E-Mail-Links mit mailto: URLs sollten überprüft werden, indem an jede extrahierte E-Mail-Adresse eine Testnachricht gesendet wird. E-Mail-Adressen in älteren PDFs sind möglicherweise nicht mehr gültig. Die Linkextraktion meldet die Adresse so, wie sie im PDF erscheint, ohne zu prüfen, ob die Adresse noch aktiv ist.
JavaScript-Links, die Code ausführen, anstatt zu einer URL zu navigieren, können nicht als einfache URLs extrahiert werden. Das Extraktionstool meldet, dass eine JavaScript-Aktion vorhanden ist, kann jedoch deren Ziel nicht ermitteln. Diese Links müssen manuell überprüft werden, um ihren Zweck zu verstehen.
Dateianhangslinks, die eingebettete Dateien im PDF öffnen, sind interne Verweise und keine externen URLs. Das Extraktionstool meldet den Namen des Anhangs, kann jedoch keine URL extrahieren. Um auf die Anhänge zuzugreifen, öffnen Sie die PDF-Datei und verwenden Sie den Bereich „Anhänge“.
Automatisieren der Linküberprüfung für große Dokumente
Bei Dokumenten mit Hunderten von Links erspart die automatische Linkprüfung Stunden der manuellen Überprüfung. Exportieren Sie die Linkliste in eine CSV-Datei und verwenden Sie dann ein Link-Checker-Tool, das die CSV-Datei liest und jede URL testet. Der Prüfer meldet, welche Links Fehler zurückgeben, umleiten oder langsam reagieren.
Defekte Links in verteilten PDFs führen zu einem schlechten Leseerlebnis und deuten darauf hin, dass das Dokument veraltet ist. Planen Sie eine regelmäßige Linküberprüfung für aktiv verteilte PDFs. Aktualisieren Sie das Quelldokument mit korrigierten Links und generieren Sie das PDF neu.
Bei PDFs, die Teil einer Website sind, kann der Linküberprüfungsprozess in den Workflow zur Überprüfung von Website-Links integriert werden. Dieselben Tools, die Website-Links überprüfen, können extrahierte PDF-Linklisten verarbeiten und so einheitliche Linkzustandsberichte für alle veröffentlichten Inhalte bereitstellen.
Die extrahierte Linkliste kann auch als Sitemap für das Dokument dienen und zeigt, wie das Dokument mit externen Ressourcen verbunden ist. Diese Netzwerkansicht der Dokumentreferenzen ist hilfreich, um den Umfang des Dokuments zu verstehen und Ressourcen zu identifizieren, die möglicherweise zusammen mit dem Dokument archiviert werden müssen.
Der Link-Extraktionsbericht sollte zwischen Links unterscheiden, die im sichtbaren Seitentext gefunden wurden, und Links, die nur in der PDF-Struktur ohne sichtbaren Text vorhanden sind. Unsichtbare Links können auftreten, wenn die Linkanmerkung einen Bereich der Seite ohne Textinhalt abdeckt.
Links in PDF-Kopf- und -Fußzeilen, beispielsweise eine URL in der Seitenfußzeile, die auf jeder Seite wiederholt wird, erscheinen im Extraktionsbericht mehrmals. Durch die Gruppierung dieser sich wiederholenden Links wird vermieden, dass dieselbe URL dutzende Male gemeldet wird.
Linkziele, die IP-Adressen anstelle von Domänennamen verwenden, sollten im Extraktionsbericht gekennzeichnet werden. IP-Adresslinks können darauf hinweisen, dass die PDF-Datei erstellt wurde, bevor der Zieldienst einen richtigen Domänennamen hatte.
Wenn die extrahierte Linkliste zusammen mit der PDF-Datei veröffentlicht wird, stellen Sie sicher, dass keine internen oder administrativen URLs versehentlich eingefügt wurden. Durch die Linkextraktion können URLs aufgedeckt werden, die nicht für die öffentliche Sichtbarkeit gedacht waren.
Der Linkextraktionsprozess kann auch defekte interne Links identifizieren, die auf Seiten oder benannte Ziele verweisen, die im Dokument nicht mehr vorhanden sind. Diese defekten internen Links sind für die Leser Navigations-Sackgassen.
Konsolidieren Sie für PDFs, die Teil einer größeren Dokumentensammlung sind, die extrahierten Linklisten aus allen Dokumenten, um einen Master-Link-Index zu erstellen. Der Index zeigt, welche Dokumente auf welche externen Ressourcen verweisen.
Der Abgleich mit regulären Ausdrücken auf den extrahierten URLs kann Links identifizieren, die bestimmten Mustern folgen, z. B. Links zu einer bestimmten Domain, Links mit Tracking-Parametern oder Links, die veraltete Protokolle wie HTTP verwenden.
Die extrahierte Linkliste ist ein Metadatenartefakt, das zusammen mit dem PDF archiviert werden sollte. Zukünftige Forscher können die Linkliste verwenden, um den Dokumentkontext und die Referenzen zu verstehen, ohne jeden Link manuell öffnen zu müssen.
Einige PDF-Erstellungstools betten Linkinformationen als Text in das Dokument ein, der das Linkziel widerspiegelt. Dieser Text kann neben oder unter dem anklickbaren Link erscheinen und kann durch Textextraktion auch ohne Zugriff auf Linkanmerkungen extrahiert werden.
Aus Gründen der Barrierefreiheit sollte jeder Link in einem PDF eine erkennbare Textalternative haben, die den Zweck des Links beschreibt. Der Link-Extraktionsbericht kann verwendet werden, um die Link-Zugänglichkeit im gesamten Dokument zu prüfen.
| Link-Typ | PDF-Aktion | Extrahierte Ausgabe | Verifizierung |
|---|---|---|---|
| Externe URL | URI-Aktion | Vollständige URL | Testlink; Suchen Sie nach Weiterleitungen |
| E-Mail (mailto:) | URI-Aktion | E-Mail-Adresse | Testnachricht senden |
| Interne Seitenreferenz | GoTo-Aktion | Seitenzahl oder benanntes Ziel | Klicken Sie, um die Navigation zu überprüfen |
| JavaScript-Link | JavaScript-Aktion | Aktionscode (nicht URL) | Manuelle Inspektion erforderlich |
Link Rot, das Phänomen, bei dem Hyperlinks mit der Zeit nicht mehr funktionieren, weil die Zielseiten entfernt oder neu strukturiert werden, betrifft PDFs genauso wie Webseiten. Eine heute durchgeführte Linkextraktion kann Jahre später verwendet werden, um zu überprüfen, welche Links in einem archivierten PDF noch aktiv sind.
Beim Extrahieren von Links aus einem PDF-Portfolio, das mehrere eingebettete Dokumente enthält, verfügt jedes eingebettete Dokument über einen eigenen Linksatz. Das Extraktionstool sollte jedes eingebettete Dokument separat verarbeiten und die extrahierten Links mit dem Namen des Quelldokuments kennzeichnen.
Links, die URL-Shortener wie bit.ly oder t.co verwenden, verschleiern das eigentliche Ziel. Der Extraktionsbericht enthält die verkürzte URL, wie sie im PDF zu finden ist. Das Auflösen der verkürzten URLs zu ihren endgültigen Zielen und die Einbeziehung beider in den Bericht sorgt für vollständige Transparenz darüber, wohin jeder Link führt.
Die extrahierte Linkliste kann in eine Tabelle importiert und nach Domäne sortiert werden. Die Sortierung nach Domäne zeigt, auf welche externen Websites das Dokument am häufigsten verweist. Ein Dokument, das überwiegend auf eine Domain verweist, kann in einer Sponsoring- oder Zugehörigkeitsbeziehung zu dieser Organisation stehen.
Zur Prüfung der Barrierefreiheit kann der Link-Extraktionsbericht Links identifizieren, denen beschreibender Text fehlt. Ein Link, dessen sichtbarer Text „Hier klicken“ oder „Weiterlesen“ lautet, bietet keinen Kontext zu seinem Ziel. Diese nicht beschreibenden Links sollten im Quelldokument aktualisiert werden, um aussagekräftigen Linktext aufzunehmen.
Regierungs- und Rechts-PDFs enthalten häufig Links zu Gesetzen, Verordnungen und Gerichtsentscheidungen. Der Link-Extraktionsbericht für diese Dokumente dient als Autoritätsverzeichnis und listet alle rechtlichen Verweise mit ihrer URL zur Überprüfung auf.
Die Linkextraktion ist eine einfache, aber leistungsstarke Funktion, die ein statisches PDF in einen strukturierten Datensatz mit Referenzen umwandelt, der überprüft, analysiert und für andere Zwecke verwendet werden kann.
Die extrahierte Linkliste dient als Qualitätssicherungsinstrument für das Dokument und als Referenzressource für Leser, die die zitierten Quellen erkunden möchten.
Versuchen Sie es mit „PDF bearbeiten“.
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
