Others

Pouvez-vous supprimer toutes les images d'un PDF et exporter une version texte uniquement

Un PDF contenant des photographies haute résolution, des graphiques, des logos et des images décoratives peut s'avérer peu pratique pour les flux de travail axés sur le texte. Lorsque vous n'avez besoin que des mots, la suppression de toutes les images PDF et l'exportation d'une version texte uniquement produisent un fichier considérablement plus petit contenant uniquement le contenu textuel du document. La question est de savoir si la sortie texte uniquement résultante est complète et utilisable aux fins prévues.

La réponse courte est oui pour les PDF basés sur du texte où le texte existe sous forme de caractères sélectionnables. Pour les PDF numérisés dans lesquels le texte fait partie de l'image, la suppression des images supprime tout, y compris le texte. La principale distinction réside entre les PDF texte natifs, dans lesquels le texte et les images sont des calques séparés, et les PDF basés sur des images, dans lesquels la page entière est une image sans calque de texte.

L'extraction PDF vers Texte supprime les images tout en préservant le contenu du texte. Pour les documents dans lesquels le texte porte la signification principale et les images sont complémentaires, une sortie texte uniquement est parfaitement utilisable. Pour les documents dans lesquels les images transmettent des informations essentielles, telles que des analyses médicales ou des dessins architecturaux, la sortie texte uniquement perd son contenu essentiel.

Les outils de traitement PDF de WukongPDF incluent des capacités de suppression d'images et d'extraction de texte.

Can You Strip All Images From a PDF and Export a Text-Only Version

La différence entre le texte natif et les PDF basés sur des images

Un PDF texte natif stocke le texte sous forme de codes de caractères positionnés sur la page. Les images sont des objets distincts superposés ou positionnés entre des blocs de texte. Lorsque vous supprimez des images d’un PDF texte natif, le texte reste intact et entièrement lisible. La structure du document telle que les titres, les paragraphes et les sauts de page est préservée. Seules les images décoratives et illustratives disparaissent.

Un PDF basé sur une image stocke la page entière sous forme d'image raster, généralement à partir d'un scanner ou d'une capture d'écran. Il n'y a aucun caractère de texte à conserver. Supprimer des images d'un PDF basé sur des images supprime tout, produisant un document vierge. Pour les PDF numérisés qui ont été traités par OCR, il y a une couche de texte invisible derrière l'image. La suppression d'image supprime la page numérisée visible mais préserve le texte OCR, qui peut contenir des erreurs de reconnaissance.

Pour déterminer le type de PDF dont vous disposez, ouvrez-le dans n'importe quel lecteur PDF et essayez de sélectionner un mot de texte. Si vous pouvez sélectionner des caractères individuels, le PDF est du texte natif et la suppression d'image préservera le texte. Si un clic sélectionne une page entière sous la forme d'un grand bloc d'image, le PDF est basé sur des images et la suppression des images ne laissera rien ou seulement le calque de texte OCR.

WukongPDF

Essayez de compresser le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Méthode 1 : Suppression d'images avec Acrobat Pro PDF Optimizer

Ouvrez le PDF dans Acrobat Pro et accédez à Fichier, Enregistrer sous un autre, PDF optimisé. Dans la boîte de dialogue PDF Optimizer, cliquez sur Supprimer les objets dans le panneau de gauche. Cochez la case intitulée Supprimer toutes les images. Sous Nettoyage, cochez Supprimer les objets inutilisés. Cliquez sur OK et enregistrez le fichier optimisé sous un nouveau nom. Acrobat traite le fichier et supprime chaque objet image raster.

En pratique, la réduction de la taille des fichiers qui en résulte peut être considérable. Un PDF de 20 Mo contenant des photographies haute résolution peut être réduit à moins de 100 Ko si le document était principalement constitué de texte avec des images intégrées. Ouvrez le fichier optimisé et faites défiler chaque page pour confirmer que tout le contenu du texte est présent et lisible. Vérifiez les zones de page où les images ont été supprimées. La mise en page peut légèrement changer car l'espace précédemment occupé par les images est désormais vide.

Si un contenu essentiel a été supprimé avec les images, tel que des graphiques stockés sous forme d'images plutôt que de graphiques vectoriels, annulez l'opération et utilisez une approche plus sélective. Au lieu de supprimer toutes les images, compressez-les fortement ou remplacez-les par un texte d'espace réservé décrivant ce qui a été supprimé.

Méthode 2 : Extraction de texte programmatique

Les bibliothèques Python telles que PyMuPDF et pdfplumber extraient le texte tout en ignorant les images de manière native. L'extraction lit uniquement la couche de texte, produisant un flux de texte propre sans aucune donnée d'image. Le texte extrait peut être enregistré sous forme de fichier .txt pour être modifié ou inséré dans un nouveau PDF contenant uniquement du texte. L'approche programmatique est scriptable, reproductible et gère le traitement par lots de plusieurs fichiers.

Pour les PDF numérisés dotés d'une couche de texte OCR, l'extraction par programmation lit le texte OCR. La qualité dépend entièrement de la précision de l’OCR. Un document proprement numérisé avec une OCR moderne peut produire un texte précis à 99 %. Un document mal numérisé avec un ancien OCR peut produire un texte nécessitant une correction manuelle importante. L'extraction inclura toutes les erreurs OCR présentes dans la couche de texte.

Vérification de la qualité post-extraction

Après avoir supprimé des images ou extrait du texte, vérifiez la qualité de sortie avant de l'utiliser. Comparez le nombre de mots du texte extrait avec une estimation manuelle du document original. Un écart significatif suggère que le contenu a été perdu. Recherchez les termes connus qui apparaissent dans l’original pour confirmer qu’ils sont présents dans le résultat. Examinez les premier et dernier paragraphes de chaque section principale pour vérifier qu'ils sont complets.

En ce qui concerne les flux de travail documentaires, pour les documents pour lesquels l'exactitude du texte est essentielle, tels que les dépôts juridiques ou les rapports financiers, demandez à un deuxième réviseur de vérifier de manière ponctuelle le texte extrait par rapport au PDF d'origine. Même une extraction précise à 99 % signifie une erreur pour cent mots, ce qui peut être inacceptable pour des documents précis. La passe de vérification détecte les erreurs d’extraction qui n’ont pas été détectées lors des contrôles de qualité automatisés.

Type de documentDénudage sécuritaire ?Alternative
Note juridiqueOui, le texte est primordialAucun nécessaire
Rapport avec graphiquesNon, les graphiques contiennent des donnéesCompresser au lieu de dépouiller
Document numériséNon, scanner EST le contenuOCR d'abord, puis extrayez le texte

Supprimer des images d'un PDF est approprié lorsque le contenu du texte est la valeur principale et que les images sont accessoires. Le fichier texte uniquement résultant est considérablement plus petit, entièrement consultable et prêt pour l’analyse de texte, la traduction ou la réutilisation du contenu. La décision de supprimer les images doit être prise après avoir vérifié que le texte transmet seul le sens essentiel du document.

En ce qui concerne les flux de travail documentaires, pour les documents dans lesquels les images et le texte fonctionnent ensemble, conservez le PDF complet et optimisez-le par compression plutôt que par suppression. Un PDF compressé préserve la relation visuelle entre le texte et les images tout en réduisant la taille du fichier à distribuer.

Qu'arrive-t-il à la mise en page PDF après la suppression de l'image

Lors des flux de travail typiques, lorsque les images sont supprimées, l'espace qu'elles occupaient sur la page devient vide. Le texte enroulé autour des images peut refluer dans l'espace vide. Les tableaux contenant des cellules d’image auront des cellules vides. Les mises en page conçues autour d’emplacements d’images spécifiques peuvent sembler gênantes. Le PDF supprimé est optimisé pour le contenu, pas pour la conception visuelle.

Pour les documents où l'intégrité de la mise en page est importante, envisagez de remplacer les images par du texte d'espace réservé plutôt que de les supprimer entièrement. Une légende telle que Image supprimée : photographie du produit peut être insérée à la place de chaque image. L'espace réservé préserve la structure de mise en page tout en reconnaissant que le contenu visuel a été intentionnellement supprimé.

Utiliser l'OCR pour créer un calque de texte avant de supprimer l'image

Avec le traitement des documents, pour les PDF numérisés dépourvus de calque de texte, l'exécution de l'OCR avant la suppression de l'image crée les données de texte que le processus de suppression préserve. OCRmyPDF peut ajouter une couche de texte aux PDF numérisés en une seule commande. Après le traitement OCR, le PDF contient à la fois l'image numérisée visible et un calque de texte invisible. La suppression des images supprime ensuite la page numérisée tout en préservant le texte reconnu.

En pratique, la qualité OCR détermine directement la convivialité de la sortie supprimée. Un document avec une précision OCR de 99 % produit un texte utilisable avec des erreurs occasionnelles. Un document avec une précision de 80 % produit un texte qui nécessite d'importantes corrections manuelles. Avant de vous engager dans la suppression d'images sur des documents numérisés, exécutez l'OCR et évaluez la qualité du texte sur un exemple de page.

Compression d'images comme alternative au décapage

En ce qui concerne les documents pour lesquels la suppression complète des images entraînerait la perte d'un contenu précieux, une compression d'image agressive constitue un terrain d'entente. La réduction de la taille des images à 72 DPI avec une compression JPEG élevée peut réduire un PDF de 20 Mo à 2 à 3 Mo tout en gardant les images reconnaissables. Les images compressées sont de mauvaise qualité mais transmettent toujours les informations visuelles.

La combinaison de la compression et de la suppression sélective des images offre la plus grande flexibilité. Conservez les images sur les pages où elles sont essentielles, comme les diagrammes et les photographies au cœur du contenu, et supprimez les images décoratives des pages où elles ne servent à rien d'information. L’approche hybride nécessite plus de travail manuel mais produit le meilleur équilibre entre qualité et taille.

L'exportation PDF texte uniquement sert des cas d'utilisation spécifiques : introduire du contenu dans des pipelines d'analyse de texte, créer des versions allégées pour la lecture mobile et préparer des documents à traduire là où les images augmenteraient le coût sans ajouter de valeur. Pour chacun de ces cas d’utilisation, le texte est le produit et les images sont des emballages qui peuvent être jetés.

La décision de supprimer les images doit être documentée afin que les futurs lecteurs de la version texte comprennent que le contenu visuel a été intentionnellement supprimé. Une brève note dans les propriétés du document ou sur une page de garde évite toute confusion lorsque quelqu'un compare la version texte uniquement avec l'original.

Dans la plupart des outils, l’exportation PDF texte uniquement est un outil spécialisé pour des besoins spécifiques. Il ne s'agit pas d'une optimisation à usage général. Pour la plupart des documents, la compression constitue une meilleure première étape que la suppression de l’image. Réservez la suppression d'image aux cas où le texte est le seul contenu précieux et où l'objectif du document est atteint par le texte seul.

Comprendre les capacités et les limites de la suppression d'images garantit qu'elle est appliquée aux bons documents pour les bonnes raisons, produisant une sortie qui répond à son objectif sans perte de contenu involontaire. Le PDF texte uniquement répond bien à des objectifs spécifiques et doit être appliqué de manière sélective en fonction du type de document et de l’utilisation prévue.

WukongPDF

Essayez de compresser le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →