Een PDF bevat tientallen hyperlinks naar websites, e-mailadressen en interne documentreferenties. U hebt een lijst met elke link nodig voor verificatie, archivering of hergebruik. Handmatig op elke link klikken en de URL kopiëren is vervelend en foutgevoelig. Een extractietool PDF Links leest de linkannotaties uit de PDF en exporteert deze naar een gestructureerde lijst.
Hyperlinks in PDF's worden opgeslagen als linkannotaties, dit zijn objecten op de pagina met een bijbehorende actie. De actie is doorgaans een URI-actie waarmee een webadres of een e-mailclient wordt geopend. De extractietool leest deze annotaties, extraheert de URL's en compileert ze in een lijst.

Hoe PDF-hyperlinks worden opgeslagen
Een PDF-linkannotatie bestaat uit twee componenten: een rechthoekig gebied op de pagina dat het klikbare gebied definieert, en een actie die wordt uitgevoerd wanneer op het gebied wordt geklikt. Met de URI-actie wordt de doel-URL opgeslagen. De link kan ook zichtbare tekst bevatten, waarbij de woorden onderstreept of gekleurd worden weergegeven, maar de URL wordt opgeslagen in de actie en niet in de zichtbare tekst.
Interne links gebruiken GoTo-acties die naar een specifieke pagina of benoemde bestemming binnen het document navigeren. Dit zijn geen URL's maar interne PDF-navigatieopdrachten. De extractietool kan het bestemmingspaginanummer of de benoemde bestemming voor interne links rapporteren.
PDF-gegevens extraheren uit koppelingsannotaties vereist een tool die de PDF-structuur op objectniveau kan ontleden. Hulpprogramma's voor tekstextractie voor algemene doeleinden zien geen linkannotaties omdat annotaties geen pagina-inhoud zijn. Er is een speciale tool voor het extraheren van links nodig.
Probeer PDF bewerken
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Koppelingen extraheren en exporteren
Laad de PDF in een tool voor het extraheren van links. De tool scant elke pagina op linkannotaties en compileert de resultaten. Elk item bevat doorgaans het paginanummer, de zichtbare linktekst, indien beschikbaar, de URL of bestemming, en het linktype, web, e-mail of intern.
WukongPDF biedt hulpmiddelen voor PDF Export via de browser. Linkextractie is beschikbaar als onderdeel van de documentanalysefuncties.
Het organiseren van de geëxtraheerde linklijst
Exporteer de geëxtraheerde links naar een CSV- of Excel-bestand om ze te sorteren en te filteren. Groepeer links op type: externe websites, e-mailadressen en interne documentreferenties. Verifieer elke externe link door een voorbeeld te testen. Links in oudere pdf's kunnen verwijzen naar websites die niet meer bestaan.
Gebruik van de koppelingslijst voor verificatie en onderhoud
Voor gepubliceerde documenten dient de linklijst als kwaliteitsborgingsinstrument. Controleer of elke link naar de beoogde bestemming navigeert en dat er geen links verbroken zijn. Werk verbroken koppelingen in het brondocument bij en genereer de PDF opnieuw.
Voor gearchiveerde PDF's documenteert de koppelingenlijst naar welke externe bronnen het document verwijst op het moment van publicatie. Deze informatie heeft historische waarde, zelfs nadat de gekoppelde bronnen niet langer beschikbaar zijn.
Omgaan met speciale linktypen
E-maillinks met mailto: URL's moeten worden geverifieerd door een testbericht naar elk geëxtraheerd e-mailadres te sturen. E-mailadressen in oudere PDF's zijn mogelijk niet meer geldig. De linkextractie rapporteert het adres zoals het in de PDF verschijnt, zonder te valideren of het adres nog actief is.
JavaScript-links die code uitvoeren in plaats van naar een URL te navigeren, kunnen niet als eenvoudige URL's worden geëxtraheerd. De extractietool meldt dat er een JavaScript-actie bestaat, maar kan het doel ervan niet bepalen. Deze links vereisen handmatige inspectie om hun doel te begrijpen.
Links naar bestandsbijlagen waarmee ingesloten bestanden in de PDF worden geopend, zijn interne verwijzingen en geen externe URL's. De extractietool rapporteert de naam van de bijlage, maar kan geen URL extraheren. Om toegang te krijgen tot de bijlagen, opent u de PDF en gebruikt u het bijlagenpaneel.
Linkverificatie automatiseren voor grote documenten
Voor documenten met honderden links bespaart geautomatiseerde linkcontrole uren aan handmatige verificatie. Exporteer de linklijst naar CSV en gebruik vervolgens een tool voor linkcontrole die de CSV leest en elke URL test. De checker rapporteert welke links retourneren, omleiden of traag reageren.
Verbroken koppelingen in gedistribueerde PDF's zorgen voor een slechte leeservaring en suggereren dat het document verouderd is. Plan periodieke linkverificatie voor actief gedistribueerde PDF's. Werk het brondocument bij met gecorrigeerde koppelingen en genereer de PDF opnieuw.
PDF's die deel uitmaken van een website, kan het linkverificatieproces worden geïntegreerd met de workflow voor het controleren van websitelinks. Dezelfde tools die websitelinks verifiëren, kunnen geëxtraheerde PDF-linklijsten verwerken, waardoor uniforme linkstatusrapporten voor alle gepubliceerde inhoud worden geboden.
De geëxtraheerde lijst met links kan ook dienen als sitemap voor het document en laat zien hoe het document verbinding maakt met externe bronnen. Deze netwerkweergave van documentreferenties is waardevol voor het begrijpen van de documentomvang en het identificeren van bronnen die mogelijk naast het document moeten worden gearchiveerd.
Het linkextractierapport moet onderscheid maken tussen links die zijn gevonden in zichtbare paginatekst en links die alleen in de PDF-structuur bestaan zonder zichtbare tekst. Onzichtbare links kunnen voorkomen wanneer de linkannotatie een gedeelte van de pagina bedekt zonder tekstinhoud.
Koppelingen in de kop- en voetteksten van PDF's, zoals een URL in de voettekst van de pagina die op elke pagina wordt herhaald, verschijnen meerdere keren in het extractierapport. Door deze herhalende links te groeperen, wordt voorkomen dat dezelfde URL tientallen keren wordt gerapporteerd.
Linkbestemmingen die IP-adressen gebruiken in plaats van domeinnamen moeten worden gemarkeerd in het extractierapport. IP-adreslinks kunnen erop wijzen dat de PDF is gemaakt voordat de doelservice een juiste domeinnaam had.
Wanneer de geëxtraheerde lijst met links naast de pdf wordt gepubliceerd, controleer dan of er per ongeluk interne of administratieve URL's zijn opgenomen. Door het extraheren van links kunnen URL's worden onthuld die niet bedoeld waren voor publieke zichtbaarheid.
Het linkextractieproces kan ook verbroken interne links identificeren die verwijzen naar pagina's of benoemde bestemmingen die niet langer in het document voorkomen. Deze verbroken interne links zijn voor lezers een doodlopende weg voor de navigatie.
Voor PDF's die deel uitmaken van een grotere documentverzameling, consolideert u de geëxtraheerde koppelingslijsten van alle documenten om een hoofdkoppelingsindex te maken. De index laat zien welke documenten naar welke externe bronnen verwijzen.
Door middel van reguliere expressies op de geëxtraheerde URL's kunnen links worden geïdentificeerd die specifieke patronen volgen, zoals links naar een bepaald domein, links met trackingparameters of links die gebruikmaken van verouderde protocollen zoals HTTP.
De geëxtraheerde koppelingslijst is een metagegevensartefact dat naast de PDF moet worden gearchiveerd. Toekomstige onderzoekers kunnen de linklijst gebruiken om de documentcontext en referenties te begrijpen zonder elke link handmatig te openen.
Sommige tools voor het maken van PDF's sluiten koppelingsinformatie in het document in als tekst die de bestemming van de koppeling weerspiegelt. Deze tekst kan naast of onder de klikbare link verschijnen en kan worden geëxtraheerd door tekstextractie, zelfs zonder toegang tot linkannotaties.
Voor naleving van de toegankelijkheidsregels moet elke link in een PDF een waarneembaar tekstalternatief hebben dat het doel van de link beschrijft. Het linkextractierapport kan worden gebruikt om de toegankelijkheid van links in het hele document te controleren.
| Linktype | PDF-actie | Geëxtraheerde uitvoer | Verificatie |
|---|---|---|---|
| Externe URL | URI-actie | Volledige URL | Testlink; controleer op omleidingen |
| E-mail (mailnaar:) | URI-actie | E-mailadres | Testbericht verzenden |
| Interne paginaref | Ga naar actie | Paginanummer of benoemde bestemming | Klik om de navigatie te verifiëren |
| JavaScript-link | JavaScript-actie | Actiecode (geen URL) | Handmatige inspectie vereist |
Linkrot, het fenomeen waarbij hyperlinks na verloop van tijd niet meer werken omdat de doelpagina's worden verwijderd of geherstructureerd, is net zo van invloed op PDF's als op webpagina's. Een linkextractie die vandaag wordt uitgevoerd, kan jaren later worden gebruikt om te controleren welke links in een gearchiveerde PDF nog steeds actief zijn.
Wanneer u koppelingen extraheert uit een PDF-portfolio die meerdere ingesloten documenten bevat, heeft elk ingesloten document zijn eigen set koppelingen. De extractietool moet elk ingesloten document afzonderlijk verwerken en de geëxtraheerde links labelen met de naam van het brondocument.
Links die URL-verkorters gebruiken, zoals bit.ly of t.co, verbergen de daadwerkelijke bestemming. Het extractierapport bevat de verkorte URL zoals gevonden in de PDF. Het omzetten van de verkorte URL's naar hun eindbestemmingen en het opnemen van beide in het rapport biedt volledige transparantie over waar elke link naartoe leidt.
De geëxtraheerde linklijst kan in een spreadsheet worden geïmporteerd en op domein worden gesorteerd. Sorteren op domein maakt duidelijk naar welke externe websites het document het vaakst verwijst. Een document dat voornamelijk naar één domein linkt, kan een sponsor- of affiliatierelatie met die organisatie hebben.
Voor toegankelijkheidscontrole kan het linkextractierapport links identificeren die geen beschrijvende tekst bevatten. Een link waarvan de zichtbare tekst Klik hier of Lees meer is, biedt geen context over de bestemming ervan. Deze niet-beschrijvende links moeten in het brondocument worden bijgewerkt om betekenisvolle linktekst op te nemen.
Overheids- en juridische pdf's bevatten vaak links naar statuten, regelgeving en rechterlijke uitspraken. Het linkextractierapport voor deze documenten dient als een tabel met autoriteiten, waarin elke juridische referentie met de bijbehorende URL ter verificatie wordt vermeld.
Linkextractie is een eenvoudige maar krachtige mogelijkheid die een statische PDF omzet in een gestructureerde dataset met referenties die kan worden geverifieerd, geanalyseerd en opnieuw kan worden gebruikt.
De geëxtraheerde linklijst dient als hulpmiddel voor kwaliteitsborging van het document en als referentiebron voor lezers die de geciteerde bronnen willen verkennen.
Probeer PDF bewerken
Geen installatie nodig. Werkt rechtstreeks in uw browser.
