L'aplatissement d'un PDF fusionne toutes les annotations, champs de formulaire et contenu en couches en un seul calque d'image statique. Une fois aplati, le calque de texte d'origine qui existait avant l'aplatissement disparaît. Les caractères de texte qui étaient autrefois sélectionnables, consultables et extractibles deviennent des pixels dans l'image aplatie. PDF Repair pour un document aplati demande si le calque de texte d'origine peut être récupéré à partir de la sortie aplatie.
La réponse courte dépend si le PDF a été aplati avec ou sans conservation du calque de texte. Certaines opérations d'aplatissement préservent le texte original derrière l'image aplatie en tant que contenu masqué. D'autres opérations d'aplatissement suppriment entièrement le texte et le remplacent par l'image rendue. La récupération est possible dans le premier cas et impossible dans le second.
Les outils de récupération PDF Format de WukongPDF peuvent détecter et extraire les couches de texte préservées des documents PDF aplatis.

Comment fonctionne l'aplatissement des PDF et ce qu'il supprime
L'aplatissement combine tous les calques visibles d'une page PDF en une seule image rendue. Les annotations, notamment les surlignages, les notes autocollantes et les annotations de dessin, sont fusionnées avec le contenu de la page. Les champs de formulaire sont convertis d'éléments interactifs en représentations visuelles statiques de leurs valeurs remplies. Les effets de transparence sont résolus en pixels opaques. Le résultat est une page qui semble identique à l’originale mais qui n’a pas de structure interactive ou en couches.
En pratique, le processus d'aplatissement peut ou non préserver le calque de texte d'origine derrière l'image aplatie. Lorsque l'aplatissement est effectué via l'aperçu d'aplatissement d'Acrobat Pro ou via l'outil de contrôle en amont avec certains paramètres, le texte original peut être conservé sous forme de calque invisible. Lorsque l'aplatissement est effectué via Imprimer au format PDF ou via des outils tiers, le calque de texte est généralement entièrement supprimé.
Un test rapide détermine si le texte a été préservé. Ouvrez le PDF aplati et essayez de sélectionner du texte sur une page. Si le texte peut être sélectionné et copié, le calque de texte a survécu à l'aplatissement. Si cliquer sur le texte ne sélectionne rien ou sélectionne la page entière en tant qu'image, le calque de texte a été supprimé et seule l'apparence visuelle demeure.
Essayez de réparer le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Méthode 1 : Vérification d'un calque de texte caché derrière l'image aplatie
Dans Acrobat Pro, ouvrez le PDF aplati et accédez à Outils, Édition de contenu, Modifier le texte et les images. Cliquez sur une zone de texte visible. Si Acrobat affiche un cadre de délimitation autour du texte et autorise la modification, un calque de texte existe derrière l'image aplatie. Le texte est présent dans les données du fichier même s'il peut ne pas être visible sous forme de texte sélectionnable lors d'une visualisation normale.
Si le texte est présent, extrayez-le à l’aide de la fonctionnalité Exporter un PDF vers du texte d’Acrobat Pro. Le texte extrait peut contenir le contenu original même si la page visuelle apparaît aplatie. Copiez le texte extrait et comparez-le à un échantillon du contenu original. Si le texte correspond, le calque de texte d'origine a été récupéré avec succès à partir du fichier aplati.
D'une manière générale, dans des scénarios réels, si Acrobat ne parvient pas à trouver du texte modifiable, le calque de texte a été supprimé lors de l'aplatissement. Le texte visuel sur la page est composé de pixels dans l'image aplatie et non de codes de caractères. La récupération via l'extraction de texte n'est pas possible car il n'y a aucune donnée texte à extraire.
Méthode 2 : Utiliser l'OCR pour recréer le calque de texte perdu
Lorsque le calque de texte d'origine a été supprimé lors de l'aplatissement, l'OCR fournit un chemin pour le recréer. Exécutez l'OCR sur le PDF aplati à l'aide de la fonctionnalité Reconnaître le texte d'Acrobat Pro. Le moteur OCR analyse l'image en pixels de chaque page, identifie les formes de caractères et crée un nouveau calque de texte avec les caractères reconnus.
D’une manière générale, dans la pratique, la couche de texte recréée par OCR n’est pas le texte original. L'OCR introduit des erreurs de reconnaissance, en particulier avec du texte de petite taille, des polices inhabituelles ou du texte sur des arrière-plans complexes. Le texte recréé sera précis à environ 95 à 99 % pour les documents propres et standards, et moins précis pour les documents dont la typographie ou la mise en page sont difficiles.
Après l'OCR, comparez le texte reconnu avec un échantillon connu du contenu original si disponible. Corrigez manuellement les erreurs OCR ou acceptez le calque de texte recréé comme approximation de l'original. La sortie OCR est utilisable pour la recherche et l'extraction de texte, mais peut contenir des erreurs qui nécessitent une vérification avant de s'appuyer sur le texte à des fins juridiques, financières ou réglementaires.
Vérification du texte dans la structure du fichier PDF
Pour vérifier définitivement si des données texte existent dans un PDF aplati, examinez la structure brute du fichier. Ouvrez le PDF dans un éditeur de texte capable de gérer les fichiers binaires, tel que VS Code ou Notepad++. Recherchez des chaînes de texte reconnaissables à partir du contenu du document d'origine. Si des chaînes de texte sont trouvées dans les données du fichier, le calque de texte existe même s'il n'est pas accessible via l'interface du lecteur PDF.
Cette approche nécessite une certaine familiarité avec la structure interne du PDF. Le texte d'un PDF est stocké dans les marqueurs BT et ET, qui indiquent le début et la fin des objets texte. Entre ces marqueurs, des codes de caractères sont répertoriés avec des commandes de positionnement. La recherche de marqueurs BT et ET contenant du texte reconnaissable indique que les données textuelles ont survécu à l'aplatissement.
D'un point de vue pratique, dans des scénarios réels, si aucune chaîne de texte n'est trouvée dans les données du fichier, l'opération d'aplatissement a complètement rastérisé le contenu. Les pages sont des images et ne contiennent aucune information textuelle récupérable. L'OCR est le seul moyen disponible pour créer un calque de texte.
Prévenir la perte de couche de texte lors des futures opérations d'aplatissement
Lors de l'aplatissement d'un PDF qui doit conserver son calque de texte, utilisez des paramètres qui préservent le texte masqué. Dans Acrobat Pro, l’outil Flattener Preview comprend une case à cocher permettant de conserver les informations de surimpression et de tons directs, ce qui contribue indirectement à préserver les données de texte. L'outil Preflight propose des corrections d'aplatissement qui conservent explicitement le texte.
L'approche la plus sûre consiste à enregistrer une copie non aplatie du PDF avant de l'aplatir. La copie non aplatie conserve tous les éléments interactifs, annotations et calques de texte. Distribuez la version aplatie. Archivez l'original non aplati. Si une récupération est nécessaire, l'original fournit les données sources complètes.
En adoptant une vision plus large, dans les flux de travail documentaires, pour les documents critiques, testez les paramètres d'aplatissement sur une copie avant de les appliquer à l'original. Vérifiez que le texte reste récupérable après l'aplatissement. Ajustez les paramètres si la récupération échoue. L'étape de test ajoute des minutes au flux de travail et évite la perte permanente de texte.
Utilisation du contrôle en amont pour détecter et extraire les calques de texte cachés
L'outil Acrobat Pro Preflight comprend des profils spécialement conçus pour analyser la structure du contenu PDF. Le rapport d'inventaire répertorie tous les objets texte présents dans le fichier, y compris ceux qui ne sont pas visibles lors d'une visualisation normale. L'exécution de ce rapport sur un PDF aplati révèle si les données textuelles ont survécu au processus d'aplatissement.
Si le rapport de contrôle en amont identifie des objets texte, utilisez le correctif Exporter tout le texte pour les extraire dans un fichier séparé. Le texte extrait peut ensuite être comparé au contenu visible de la page pour déterminer la part du texte original qui a été préservée et s'il est exact et complet.
Récupération de texte à partir de PDF partiellement aplatis
Certaines opérations d'aplatissement affectent uniquement des éléments de page spécifiques tout en laissant les autres intacts. Les champs du formulaire peuvent être aplatis tandis que le corps du texte reste sous forme de caractères sélectionnables. Les annotations peuvent être aplaties tandis que le texte de la page sous-jacente survit. Examinez chaque type d'élément indépendamment pour déterminer ce qui a été aplati et ce qui a été conservé.
Sous un grand angle, dans les flux de travail documentaires, pour les documents partiellement aplatis, extrayez le texte survivant des parties non aplaties et combinez-le avec la sortie OCR des parties aplaties. L'approche hybride maximise la récupération de texte en utilisant le texte original lorsqu'il est disponible et le texte reconstruit par OCR là où l'original a été perdu.
Quand accepter que la récupération ne soit pas possible
Si cela se produit, si aucune donnée texte n'existe dans la structure du fichier, si Acrobat ne parvient pas à trouver du texte modifiable et si l'OCR produit des résultats inacceptablement inexacts, la couche de texte d'origine ne peut pas être récupérée. Acceptez cette conclusion et passez à la préservation de ce qui reste plutôt que d’investir plus de temps dans des tentatives de rétablissement.
Documentez la tentative de récupération et son résultat. Notez les outils utilisés, les méthodes essayées et la conclusion tirée. La documentation est destinée aux futurs dépositaires de documents qui pourraient avoir accès à de meilleurs outils de récupération et devraient comprendre ce qui a été tenté auparavant.
Stratégie d'archivage à long terme pour les documents aplatis
Les PDF aplatis sont souvent créés spécifiquement à des fins d'archivage, car ils suppriment les dépendances interactives. Lors de l'archivage de documents aplatis, stockez autant que possible l'original non aplati à côté de la version aplatie. L'original préserve la structure complète du document. La version aplatie fournit le format d'archives stable.
Pour les documents dont seule la version aplatie existe, exécutez l'OCR pour créer un calque de texte et l'intégrer dans le PDF. Le texte OCR n'est peut-être pas parfait, mais il permet de futures recherches et extractions de texte qui seraient autrement impossibles. La couche OCR constitue un pont entre l’image aplatie et les futurs besoins d’analyse de documents.
Détection automatisée d'aplatissement pour les collections de documents
Les organisations gérant de grandes collections de documents bénéficient de la détection automatisée des PDF aplatis. Un script qui ouvre chaque PDF, vérifie la présence de texte sélectionnable et signale les fichiers où le texte est absent identifie les documents nécessitant un traitement OCR. L'analyse automatisée empêche les documents aplatis d'entrer silencieusement dans les archives sans couches de texte consultables.
Intégrez la détection d’aplatissement dans le flux de travail d’ingestion de documents. Lorsqu'un nouveau PDF entre dans le système, vérifiez la présence de texte. Si le texte est absent, acheminez le document vers une file d'attente de traitement OCR avant qu'il n'atteigne l'archive. La détection et la correction automatisées garantissent que chaque document archivé est consultable.
Essayez de réparer le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
