Tips & Tricks

Comment extraire tous les hyperliens d'un PDF et les exporter vers une liste cliquable

Un PDF contient des dizaines de liens hypertextes vers des sites Web, des adresses e-mail et des références de documents internes. Vous avez besoin d'une liste de chaque lien pour la vérification, l'archivage ou la réutilisation. Cliquer manuellement sur chaque lien et copier l'URL est fastidieux et sujet aux erreurs. Un outil d'extraction PDF Links lit les annotations de liens du PDF et les exporte vers une liste structurée.

Les hyperliens dans les PDF sont stockés sous forme d'annotations de lien, qui sont des objets sur la page avec une action associée. L'action est généralement une action URI qui ouvre une adresse Web ou un client de messagerie. L'outil d'extraction lit ces annotations, extrait les URL et les compile dans une liste.

How to Extract All the Hyperlinks From a PDF and Export Them to a Clickable List

Comment les hyperliens PDF sont stockés

Une annotation de lien PDF comporte deux composants : une région rectangulaire sur la page qui définit la zone cliquable et une action qui s'exécute lorsque l'utilisateur clique sur la région. L'action URI stocke l'URL cible. Le lien peut également contenir du texte visible, les mots apparaissant soulignés ou colorés, mais l'URL est stockée dans l'action et non dans le texte visible.

Les liens internes utilisent des actions GoTo qui permettent d'accéder à une page spécifique ou à une destination nommée dans le document. Ce ne sont pas des URL mais des commandes de navigation internes au PDF. L'outil d'extraction peut signaler le numéro de page de destination ou la destination nommée pour les liens internes.

Extraire les données PDF à partir des annotations de lien nécessite un outil capable d'analyser la structure PDF au niveau de l'objet. Les outils d'extraction de texte à usage général ne voient pas les annotations de liens, car les annotations ne constituent pas le contenu de la page. Un outil d’extraction de liens dédié est nécessaire.

WukongPDF

Essayez de modifier le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Extraction et exportation de liens

Chargez le PDF dans un outil d'extraction de liens. L'outil analyse chaque page à la recherche d'annotations de liens et compile les résultats. Chaque entrée comprend généralement le numéro de page, le texte du lien visible si disponible, l'URL ou la destination et le type de lien, Web, e-mail ou interne.

Le WukongPDF fournit les outils PDF Export via le navigateur. L'extraction de liens est disponible dans le cadre des fonctionnalités d'analyse de documents.

Organisation de la liste des liens extraits

Exportez les liens extraits vers un fichier CSV ou Excel pour les trier et les filtrer. Regroupez les liens par type : sites Web externes, adresses e-mail et références de documents internes. Vérifiez chaque lien externe en testant un échantillon. Les liens dans les anciens PDF peuvent pointer vers des sites Web qui n'existent plus.

Utilisation de la liste de liens pour la vérification et la maintenance

Pour les documents publiés, la liste de liens sert d’outil d’assurance qualité. Vérifiez que chaque lien dirige vers la destination prévue et qu'aucun lien n'est rompu. Mettez à jour les liens rompus dans le document source et régénérez le PDF.

Pour les PDF archivés, la liste de liens documente les ressources externes référencées par le document au moment de la publication. Ces informations ont une valeur historique même après que les ressources liées ne sont plus disponibles.

Gestion des types de liens spéciaux

Liens par courrier électronique utilisant mailto : les URL doivent être vérifiées en envoyant un message test à chaque adresse e-mail extraite. Les adresses e-mail des anciens PDF peuvent ne plus être valides. L'extraction de lien rapporte l'adresse telle qu'elle apparaît dans le PDF sans valider si l'adresse est toujours active.

Les liens JavaScript qui exécutent du code plutôt que de naviguer vers une URL ne peuvent pas être extraits sous forme de simples URL. L'outil d'extraction signale qu'une action JavaScript existe mais ne peut pas déterminer sa cible. Ces liens nécessitent une inspection manuelle pour comprendre leur objectif.

Les liens de pièces jointes qui ouvrent les fichiers incorporés dans le PDF sont des références internes et non des URL externes. L'outil d'extraction indique le nom de la pièce jointe mais ne peut pas extraire d'URL. Pour accéder aux pièces jointes, ouvrez le PDF et utilisez le panneau des pièces jointes.

Automatisation de la vérification des liens pour les documents volumineux

Pour les documents comportant des centaines de liens, la vérification automatisée des liens permet d'économiser des heures de vérification manuelle. Exportez la liste de liens au format CSV, puis utilisez un outil de vérification de liens qui lit le CSV et teste chaque URL. Le vérificateur signale quels liens renvoient des erreurs, redirigent ou répondent lentement.

Les liens rompus dans les PDF distribués créent une mauvaise expérience de lecture et suggèrent que le document est obsolète. Planifiez une vérification périodique des liens pour les PDF activement distribués. Mettez à jour le document source avec les liens corrigés et régénérez le PDF.

Pour les fichiers PDF faisant partie d'un site Web, le processus de vérification des liens peut être intégré au flux de travail de vérification des liens du site Web. Les mêmes outils qui vérifient les liens vers des sites Web peuvent traiter les listes de liens PDF extraites, fournissant ainsi des rapports unifiés sur l’état des liens sur tout le contenu publié.

La liste de liens extraite peut également servir de plan du site pour le document, montrant comment le document se connecte aux ressources externes. Cette vue réseau des références de documents est utile pour comprendre la portée du document et identifier les ressources qui peuvent devoir être archivées avec le document.

Le rapport d'extraction de liens doit faire la distinction entre les liens trouvés sur le texte de la page visible et les liens qui existent uniquement dans la structure PDF sans texte visible. Des liens invisibles peuvent apparaître lorsque l'annotation du lien couvre une zone de la page sans contenu textuel.

Les liens dans les en-têtes et pieds de page PDF, tels qu'une URL dans le pied de page qui se répète sur chaque page, apparaissent plusieurs fois dans le rapport d'extraction. Regrouper ces liens répétitifs évite de signaler des dizaines de fois la même URL.

Les destinations de liens qui utilisent des adresses IP plutôt que des noms de domaine doivent être signalées dans le rapport d'extraction. Les liens d'adresse IP peuvent indiquer que le PDF a été créé avant que le service cible ne dispose d'un nom de domaine approprié.

Lorsque la liste de liens extraite sera publiée avec le PDF, vérifiez qu'aucune URL interne ou administrative n'a été incluse par inadvertance. L'extraction de liens peut révéler des URL qui n'étaient pas destinées à être visibles publiquement.

Le processus d'extraction de liens peut également identifier les liens internes rompus qui référencent des pages ou des destinations nommées qui n'existent plus dans le document. Ces liens internes rompus sont des impasses de navigation pour les lecteurs.

Pour les PDF faisant partie d'une collection de documents plus vaste, consolidez les listes de liens extraites de tous les documents pour créer un index principal de liens. L'index montre quels documents font référence à quelles ressources externes.

La correspondance d'expressions régulières sur les URL extraites peut identifier les liens qui suivent des modèles spécifiques, tels que des liens vers un domaine particulier, des liens avec des paramètres de suivi ou des liens utilisant des protocoles obsolètes comme HTTP.

La liste de liens extraite est un artefact de métadonnées qui doit être archivé avec le PDF. Les futurs chercheurs peuvent utiliser la liste de liens pour comprendre le contexte et les références du document sans ouvrir manuellement chaque lien.

Certains outils de création de PDF intègrent des informations sur le lien dans le document sous forme de texte qui reflète la destination du lien. Ce texte peut apparaître à côté ou en dessous du lien cliquable et peut être extrait par extraction de texte même sans accès aux annotations de lien.

Pour des raisons de conformité en matière d'accessibilité, chaque lien dans un PDF doit avoir une alternative textuelle perceptible qui décrit l'objectif du lien. Le rapport d'extraction de liens peut être utilisé pour vérifier l'accessibilité des liens dans le document.

Type de lienAction PDFSortie extraiteVérification
URL externeAction d'URIURL complèteLien de test ; vérifier les redirections
E-mail (mailto :)Action d'URIAdresse emailEnvoyer un message test
Référence page interneAction Aller àNuméro de page ou destination nomméeCliquez pour vérifier la navigation
Lien JavascriptAction JavascriptCode d'action (pas d'URL)Inspection manuelle requise

La pourriture des liens, phénomène dans lequel les hyperliens cessent de fonctionner au fil du temps parce que les pages cibles sont supprimées ou restructurées, affecte les PDF tout comme les pages Web. Une extraction de lien effectuée aujourd'hui peut être utilisée des années plus tard pour vérifier quels liens dans un PDF archivé sont toujours actifs.

Lors de l'extraction de liens à partir d'un portefeuille PDF contenant plusieurs documents intégrés, chaque document intégré possède son propre ensemble de liens. L'outil d'extraction doit traiter chaque document intégré séparément et étiqueter les liens extraits avec le nom du document source.

Les liens qui utilisent des raccourcisseurs d'URL comme bit.ly ou t.co obscurcissent la destination réelle. Le rapport d'extraction inclut l'URL raccourcie telle que trouvée dans le PDF. Résoudre les URL raccourcies vers leurs destinations finales et inclure les deux dans le rapport offre une transparence totale sur la destination de chaque lien.

La liste de liens extraite peut être importée dans une feuille de calcul et triée par domaine. Le tri par domaine révèle à quels sites Web externes le document fait référence le plus fréquemment. Un document qui renvoie principalement à un domaine peut avoir une relation de parrainage ou d'affiliation avec cette organisation.

Pour l'audit d'accessibilité, le rapport d'extraction de liens peut identifier les liens dépourvus de texte descriptif. Un lien dont le texte visible est Cliquez ici ou Lire la suite ne fournit aucun contexte sur sa destination. Ces liens non descriptifs doivent être mis à jour dans le document source pour inclure un texte de lien significatif.

Les PDF gouvernementaux et juridiques incluent souvent des liens vers des lois, des règlements et des décisions de justice. Le rapport d'extraction de liens pour ces documents sert de tableau d'autorités, répertoriant chaque référence juridique avec son URL pour vérification.

L'extraction de liens est une fonctionnalité simple mais puissante qui transforme un PDF statique en un ensemble de données structurées de références qui peuvent être vérifiées, analysées et réutilisées.

La liste de liens extraite sert d'outil d'assurance qualité pour le document et de ressource de référence pour les lecteurs qui souhaitent explorer les sources citées.

WukongPDF

Essayez de modifier le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →