Others

Comment savoir si un PDF a été créé en numérisant du papier ou à partir d'une source numérique

Un PDF arrive par email. L'ouvrir révèle ce qui ressemble à un document imprimé. Le texte est là, la mise en forme est correcte. Mais peut-on sélectionner le texte avec le curseur, ou le curseur passe-t-il dessus comme s'il s'agissait d'une photographie ? La réponse détermine si le PDF a été créé par numérisation de papier ou généré à partir d'une source numérique, et elle détermine tout sur la façon dont vous pouvez travailler avec le fichier.

Cliquer sur le texte et regarder si le curseur le sélectionne ou l'ignore répond à la question en une seconde.

Déterminer si un PDF a été numérisé ou créé numériquement implique de vérifier le texte sélectionnable, d'examiner la structure du fichier et de rechercher des artefacts visuels révélateurs de la numérisation. Les outils OCR PDF de WukongPDF peuvent rendre les documents numérisés consultables, et les étapes d'identification Scanned PDF ci-dessous vous indiquent si vous avez besoin d'OCR en premier lieu.

How to Tell If a PDF Was Created by Scanning Paper or From a Digital Source

Le test de sélection de texte

Ouvrez le PDF et essayez de sélectionner un mot de texte avec l'outil de sélection de texte. Si le curseur met en surbrillance le mot caractère par caractère, le PDF contient du texte sélectionnable et a été créé numériquement ou a déjà été OCR. Si le curseur dessine un rectangle de sélection sur toute la zone sans mettre en évidence des caractères individuels, la page est une image et le PDF a été créé par numérisation.

Le test de sélection de texte est rapide et définitif pour les contrôles d'une seule page. Pour les documents de plusieurs pages, testez quelques pages depuis le début, le milieu et la fin. Certains PDF mélangent des pages numériques et numérisées, généralement une lettre de motivation créée numériquement suivie de pièces jointes numérisées. Le test de sélection de texte sur chaque page révèle quelles pages correspondent à quelles pages.

WukongPDF

Essayez l'OCR PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Vérification de la taille du fichier et du nombre de pages pour les indices

Les PDF numérisés sont généralement plus grands que les PDF numériques avec le même nombre de pages, car chaque page est une image pleine page. Un PDF numérisé de 10 pages à 300 DPI fait souvent entre 5 et 15 Mo. Un PDF numérique de 10 pages du même contenu peut peser entre 100 et 500 Ko. La différence de taille de fichier est un indice rapide avant même d’ouvrir le fichier.

Les PDF numérisés ont également tendance à avoir moins de fonctionnalités internes. Pas de signets, pas d'hyperliens, pas de polices intégrées, pas de métadonnées au-delà des propriétés de base du fichier. Ouvrez les propriétés du document et vérifiez l'onglet Polices. Un PDF numérisé ne contient aucune police car tout le contenu est constitué d'images. Un PDF numérique répertorie les polices utilisées dans le document.

Vérification des propriétés du fichier pour la méthode de création

Les propriétés du document incluent souvent l'application qui a créé le PDF. Un PDF créé par Adobe Acrobat à partir de Microsoft Word était probablement numérique. Un PDF créé par Canon Scanner Driver ou HP Scan a été numérisé. Un PDF créé par une application OCR peut être un document numérisé qui a été traité à des fins de recherche.

Le champ producteur dans les propriétés du document est défini par l'application créatrice et n'est pas toujours fiable car il peut être modifié ou usurpé. Combinez les informations du producteur avec le test de sélection de texte et la vérification des polices pour une détermination sûre. Trois tests indépendants pointant vers la même conclusion sont fiables.

TestRésultat PDF numériqueRésultat PDF numérisé
Sélection de texteLe curseur met en évidence les caractères individuelsLe curseur dessine un rectangle de sélection sur l'image
Taille du fichier (10 pages)100-500 Ko5-15 Mo
Onglet Polices dans PropriétésRépertorie les polices intégréesVide, pas de polices
Domaine producteurWord, Acrobat, ChromePilote de scanner, logiciel d'imagerie

Recherche d'artefacts visuels de numérisation

Zoomez à 400% sur une zone de texte. Les PDF numérisés présentent les artefacts caractéristiques de la capture d'image : un léger flou au niveau des bords des caractères, une obscurité inégale sur la page en raison de l'éclairage du scanner et des taches de poussière ou des marques de cheveux sur la vitre du scanner qui apparaissent sous forme de lignes ou de points pâles. Les PDF numériques affichent des bords de caractères nets quel que soit le niveau de zoom.

Les PDF numérisés de pages recto-verso peuvent présenter des images fantômes et du texte légèrement inversé de l'autre côté du papier qui transparaît. C'est un signe définitif de numérisation car les PDF numériques n'ont aucune notion d'opacité du papier. Les images fantômes apparaissent sous la forme d'une ombre grise de texte derrière le texte principal, plus visible dans les zones où le texte principal est clairsemé.

Utilisation des champs de métadonnées PDF pour des indices supplémentaires

Les champs de métadonnées PDF, accessibles via les propriétés du document, peuvent révéler l'origine du document. Un champ Titre contenant le nom du fichier du document d'origine, comme Annual-Report-2025-Final.docx, indique que le PDF a été créé à partir de ce fichier Word. Un champ Titre vide ou un titre correspondant au nom du fichier PDF est neutre. Un champ Créateur répertoriant Microsoft Word ou Google Docs indique l'origine numérique.

Les champs Date de création et Date de modification peuvent fournir des indices sur la chronologie. Un PDF créé et modifié à la même date à quelques minutes d’intervalle suggère une exportation numérique directe. Un PDF avec une date de modification des années après la date de création peut avoir été OCR ou traité. Les métadonnées racontent l'historique du document, et cet historique révèle si une numérisation a été impliquée.

Que faire une fois que vous connaissez le type de PDF

Pour les PDF numérisés qui doivent pouvoir être recherchés, exécutez l'OCR pour ajouter un calque de texte. Le processus OCR reconnaît le texte dans les images de la page et ajoute du texte sélectionnable et consultable derrière elles. L'aspect visuel ne change pas. Le PDF gagne en capacité de recherche et de copier-coller.

Pour les PDF numériques qui doivent avoir l'air numérisés, généralement pour les reproductions de documents d'aspect officiel, la conversion en image et en arrière est inutile et dégrade la qualité. Le PDF numérique est déjà sous sa forme optimale. Tout traitement convertissant du texte en images réduit la qualité sans ajouter de valeur.

WukongPDF

Essayez l'OCR PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →