Tips & Tricks

Comment extraire des images d'un PDF à leur résolution d'origine

Extraire des images d’un PDF semble simple. Cliquez sur Exporter, choisissez un format d'image et les images apparaissent. Mais les images qui émergent sont souvent plus petites, plus douces ou plus compressées que les originaux placés dans le document. Cela se produit parce que de nombreux outils PDF sous-échantillonnent et recompressent les images lors de l'extraction, appliquant une deuxième série de perte de qualité en plus de la compression appliquée lors de la première intégration des images. L'extraction d'images à leur résolution d'origine préserve chaque pixel initialement placé dans le PDF, produisant des fichiers de sortie identiques aux images sources. L'extraction PDF vers Image à la résolution originale nécessite un outil qui respecte les données d'image intégrées plutôt que de restituer la page à un DPI fixe.

How to Extract Images From a PDF at Their Original Resolution

Pourquoi l'extraction d'images standard perd en qualité

La plupart des visionneuses PDF et des outils d'extraction de base n'extraient pas réellement les fichiers image originaux du PDF. Ils restituent chaque page à une résolution spécifiée, généralement 150 ou 300 DPI, puis découpent la page rendue en rectangles d'image en fonction de l'endroit où l'outil détecte le contenu de l'image. Ce processus de rendu applique un deuxième cycle de compression JPEG aux images déjà compressées lors de leur intégration. Le résultat est une perte de génération similaire à l'enregistrement d'un fichier JPEG, sa réouverture et son enregistrement à nouveau. Chaque cycle supprime davantage de données visuelles.

L'extraction de la résolution originale contourne entièrement l'étape de nouveau rendu. Au lieu de restituer la page et de découper les images à partir du rendu, l'outil lit les flux d'images intégrés directement à partir de la structure du fichier PDF. Chaque flux d'images contient les octets exacts qui ont été insérés dans le PDF lors de la création du document. L'extraction de ces flux produit des fichiers identiques bit pour bit aux images originales. Une photographie de 3 000 x 2 000 pixels intégrée dans le PDF apparaît sous la forme d'un fichier de 3 000 x 2 000 pixels. Le processus d'extraction PDF Images préserve chaque pixel.

WukongPDF

Essayez PDF en image

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Outils prenant en charge l’extraction en résolution originale

Adobe Acrobat Pro inclut une fonction Exporter toutes les images qui peut exporter à la résolution d'origine. Ouvrez le PDF, accédez au panneau Outils et sélectionnez Exporter le PDF. Choisissez Image comme format de sortie et dans les paramètres, sélectionnez le format JPEG ou PNG et recherchez une option intitulée Exporter toutes les images à la résolution d'origine ou avec une formulation similaire. Les images extraites apparaissent dans le dossier de sortie à leurs dimensions en pixels d'origine.

Les outils de ligne de commande offrent l'accès le plus direct aux flux d'images intégrés. L'outil pdfimages, qui fait partie du package open source poppler-utils, extrait les images des PDF sans les recompresser. L'exécution de pdfimages -j input.pdf outputprefix extrait toutes les images JPEG avec leur compression d'origine. L'exécution de pdfimages -png input.pdf outputprefix convertit toutes les images au format PNG sans perte lors de l'extraction tout en préservant les dimensions d'origine en pixels. Les plates-formes WukongPDF et PDF vers Image basées sur un navigateur gèrent l'extraction de la résolution originale côté serveur et renvoient les images dans une archive téléchargeable.

Gérer les images intégrées dans plusieurs formats

Un seul PDF peut contenir des images dans plusieurs formats différents. Les images JPEG sont courantes pour les photographies. Les images JPEG 2000 apparaissent dans certains fichiers PDF d'archives et d'ingénierie. Les images PNG sont utilisées pour les captures d’écran et les graphiques transparents. Les images TIFF apparaissent dans les documents numérisés. Les données bitmap brutes peuvent être stockées sans aucune compression. L’outil d’extraction doit gérer chaque format correctement. Un outil qui suppose que toutes les images sont au format JPEG produira une sortie corrompue lorsqu'il rencontrera un PNG ou un TIFF.

Le tableau ci-dessous résume la manière dont les différents formats d'images intégrées doivent être gérés lors de l'extraction :

Format embarquéMeilleur format d'exportationRemarques
JPEG (DCTDécode)JPEG (original)Déjà compressé ; en outre, JPEG se compresse deux fois
JPEG 2000 (JPXDécode)PNG ou JPEG 2000Tous les téléspectateurs ne prennent pas en charge JPEG 2000
PNG ou bitmap brutPNG (sans perte)Préserve exactement toutes les données de pixels
TIFF ou données numériséesTIFF ou PNGTIFF préserve les données de numérisation de plusieurs pages

Identification de la résolution originale d'une image intégrée

Avant l’extraction, il est utile de connaître la résolution réelle des images intégrées. Ouvrez le PDF dans une visionneuse pouvant afficher les propriétés de l'image. Cliquez sur une image et recherchez un panneau de propriétés qui affiche les dimensions en pixels. Divisez les dimensions des pixels par les dimensions physiques de l'image sur la page pour calculer le DPI effectif. Une image de 1 500 x 1 200 pixels affichée dans une zone de 5 x 4 pouces sur la page a une résolution effective de 300 DPI. La résolution originale est de 1 500 x 1 200 pixels quelle que soit la taille d'affichage sur la page.

Si le DPI effectif est faible, l'image a été intégrée à une faible résolution et aucune méthode d'extraction ne peut récupérer des détails qui ne figurent pas dans les données intégrées. L'extraction en résolution originale préserve ce qui s'y trouve. Cela ne crée pas de détails qui n’ont jamais été intégrés. Une image de 72 DPI extraite à la résolution originale est toujours une image de 72 DPI. L’avantage de l’extraction à la résolution originale est d’éviter une perte de qualité supplémentaire, et non d’augmenter la résolution comme par magie.

Organisation et nommage des images extraites

Un PDF contenant des dizaines d'images produit une pile de fichiers portant des noms génériques tels que img-001.jpg, img-002.jpg une fois extrait. Renommez les fichiers de manière descriptive avant de les utiliser. Si les images proviennent d'un catalogue de produits, nommez-les avec le SKU ou le nom du produit. S'ils proviennent d'un rapport, nommez-les avec le numéro du chiffre. L'étape de renommage prend quelques minutes pour un lot d'images, mais permet de gagner beaucoup plus de temps lorsque vous devez rechercher une image spécifique des jours ou des semaines plus tard.

Conservez les images extraites dans un dossier nommé d'après le PDF source afin que la provenance soit claire. Si les images doivent être utilisées dans un nouveau document ou téléchargées sur un site Web, incluez le nom du PDF source dans les métadonnées de l'image ou dans un fichier texte d'accompagnement. Savoir d'où vient une image permet de revenir à la source pour une version plus haute résolution si nécessaire ultérieurement. WukongPDF prend en charge PDF Export avec extraction d'images en résolution originale, produisant une sortie organisée qui conserve la connexion entre le document source et les ressources extraites.

Vérification de la qualité de l'extraction

Après avoir extrait les images à la résolution d'origine, vérifiez la qualité de sortie en ouvrant un échantillon des fichiers extraits et en les comparant côte à côte avec les mêmes images affichées dans le PDF avec un niveau de zoom élevé. L'image extraite doit afficher le même niveau de détail que la vue PDF agrandie. Si l'image extraite présente des artefacts de blocage JPEG qui ne sont pas visibles dans le PDF, l'extraction peut avoir appliqué une compression supplémentaire. Si les dimensions en pixels de l'image extraite sont plus petites que prévu, l'outil peut avoir sous-échantillonné lors de l'extraction plutôt que d'extraire à la résolution d'origine.

Lorsque les images extraites seront utilisées dans une publication imprimée, confirmez les exigences de résolution auprès de l'imprimante avant de finaliser. Une image de 300 DPI dans ses dimensions d'origine en pixels peut être suffisante pour un placement d'impression d'une demi-page, mais insuffisante pour une image de couverture à fond perdu. L'extraction de la résolution originale préserve ce qui est là. Cela ne crée pas une résolution qui n'était pas dans l'intégration d'origine.

Pour les PDF archivés dont les images originales ne sont plus disponibles à partir d'aucune autre source, les images extraites à la résolution originale deviennent les meilleures copies disponibles. Traitez-les comme des maîtres des archives. Enregistrez-les dans un format sans perte tel que PNG ou TIFF, et créez des copies de travail ou des versions Web à partir de ces originaux plutôt que de les réextraire du PDF à chaque fois.

Pour les images PDF qui ont été intégrées à des résolutions inhabituellement élevées, les fichiers extraits peuvent être plus volumineux que prévu. Une photographie de 600 DPI extraite à la résolution originale produit un fichier adapté à une impression de haute qualité mais inutilement volumineux pour une utilisation sur le Web ou une pièce jointe à un courrier électronique. Après l'extraction, créez des versions redimensionnées pour la distribution et conservez le fichier extrait dans la résolution originale comme maître d'archives.

Lorsque vous extrayez des images d'un PDF que vous n'avez pas créé, soyez conscient du statut de droit d'auteur des images intégrées. L'extraction en résolution originale produit des copies adaptées à la réutilisation, ce qui signifie que les implications en termes de droits d'auteur de cette réutilisation s'appliquent. Si le PDF est un document accessible au public, les images peuvent être utilisables dans le cadre d'un usage loyal ou selon les conditions de publication du document. Si le PDF est un document propriétaire ou sous licence, les images intégrées comportent les mêmes restrictions d'utilisation que le document lui-même.

L'extraction PDF vers Image à la résolution originale est particulièrement utile pour les photographes et les graphistes qui reçoivent leur propre travail au format PDF et ont besoin de récupérer les fichiers image originaux qui ont été placés dans le document lors de la mise en page.

Pour les concepteurs et les créateurs de contenu qui reçoivent des épreuves PDF de leur travail, l'extraction à la résolution originale offre un moyen de récupérer les images qui peuvent avoir été perdues dans les fichiers de travail.

Les images PDF intégrées dans un PDF sont souvent les versions survivantes de la plus haute qualité de ces images

L'extraction d'images à leur résolution d'origine est une décision de configuration unique qui affecte chaque image sortant du PDF. Prendre le temps de configurer correctement l'outil d'extraction avant d'exécuter le lot garantit que chaque image apparaît dans sa pleine qualité, prête pour toute utilisation ultérieure.

L'extraction de la résolution originale préserve l'intégrité des données d'image intégrées. Lorsque les images extraites sont les seules copies survivantes de ces photographies, logos ou graphiques, cette intégrité est importante.

La décision d’extraire les images à la résolution d’origine plutôt qu’à un DPI par défaut est un choix qui donne la priorité à la qualité plutôt qu’à la commodité. Les fichiers seront plus gros. Le processus peut prendre un peu plus de temps. Mais les images seront exactement telles qu’elles étaient lorsqu’elles ont été placées dans le PDF.

WukongPDF

Essayez PDF en image

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →