
Qu'est-ce qu'un PDF numérisé et en quoi est-il différent d'un PDF natif
Un PDF numérisé est créé en capturant des images de pages papier physiques à l'aide d'un scanner ou de l'appareil photo d'un téléphone. Chaque page du PDF est une photographie du document original. Le texte que vous voyez sur la page existe uniquement sous forme de pixels dans l'image. Aucun caractère de texte réel n'est stocké dans le fichier PDF. Un PDF numérisé est essentiellement un album photo dans lequel chaque photo contient du texte.
Le moyen le plus rapide d'identifier un PDF numérisé est d'essayer de sélectionner du texte sur la page avec votre curseur.
La technologie OCR comble le fossé entre les PDF numérisés et les PDF natifs en ajoutant une couche de texte consultable.
Un PDF natif, également appelé PDF numérique ou PDF né numérique, est créé directement à partir d'une application logicielle. Lorsque vous exportez un document Word au format PDF, enregistrez une feuille de calcul au format PDF ou créez un PDF à partir d'une application de conception, le fichier résultant contient des caractères de texte réels, sélectionnables et consultables, ainsi que des graphiques vectoriels et des polices intégrées.
Le texte existe sous forme de données, pas seulement sous forme de pixels. Un PDF natif est un document structuré, pas une collection d'images de pages.
Le Format PDF prend en charge les deux types de contenu dans le même fichier. Un PDF peut contenir certaines pages contenant des images numérisées et d'autres pages contenant du texte numérique natif. Ce scénario de contenu mixte est courant lorsque les documents sont assemblés à partir de plusieurs sources, comme un rapport combinant des pages de texte créées numériquement avec des annexes numérisées à partir de sources imprimées.
La différence pratique entre les PDF numérisés et les PDF natifs affecte tout ce que vous pouvez faire avec le document. Vous pouvez rechercher des mots dans un PDF natif car le texte existe sous forme de données de caractères consultables. Vous ne pouvez pas rechercher un PDF numérisé à moins qu'il n'ait été traité avec la technologie OCR PDF qui reconnaît le texte dans les images et ajoute une couche de texte invisible consultable. Vous pouvez sélectionner et copier du texte à partir d'un PDF natif. Vous ne pouvez pas sélectionner de texte à partir d'un PDF numérisé. Vous pouvez modifier le texte d'un PDF natif avec un éditeur PDF. Vous ne pouvez pas modifier le texte d'un PDF numérisé car il n'y a aucun caractère de texte à modifier.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Comment savoir si un PDF est numérisé ou natif
Le test le plus rapide consiste à essayer de sélectionner du texte dans le PDF. Ouvrez le PDF et cliquez et faites glisser sur un mot avec votre souris ou votre doigt. Si le texte est mis en surbrillance lorsque vous faites glisser, le PDF contient du texte natif sélectionnable. Si rien ne se passe lorsque vous essayez de sélectionner du texte, la page est probablement une image numérisée. Si certains mots sont mis en surbrillance mais d'autres non, le PDF peut comporter un calque de texte partiel ou endommagé.
Le test de zoom fournit une autre vérification rapide. Zoomez à 300 ou 400 pour cent sur une section de texte. Si le texte reste net et net à fort grossissement, il s’agit probablement d’un texte vectoriel natif qui s’adapte facilement à n’importe quelle taille. Si le texte devient pixellisé et présente des bords irréguliers à fort grossissement, il s'agit d'une image numérisée. Ce test visuel fonctionne car le texte vectoriel s'affiche de manière fluide à n'importe quel niveau de zoom, tandis que le texte basé sur une image révèle sa structure en pixels lorsqu'il est agrandi.
Les outils de visualisation PDF peuvent également indiquer si un document contient du texte. Dans Adobe Acrobat, le panneau Propriétés du document affiche le nombre de pages et si le fichier contient du texte consultable. Certaines visionneuses affichent un indicateur de calque de texte. Les outils d'analyse de documents peuvent numériser un PDF et indiquer le pourcentage de pages contenant du texte natif par rapport au contenu contenant uniquement des images.
La taille du fichier peut fournir une indication, même si elle n’est pas définitive. Un PDF numérisé composé d'images de pages est généralement plus grand qu'un PDF texte natif du même nombre de pages, car les images nécessitent plus de stockage que le texte. Un PDF texte natif de 10 pages peut peser entre 100 et 500 kilo-octets. Un PDF numérisé de 10 pages peut peser entre 2 et 10 mégaoctets. Cependant, un PDF natif contenant des images intégrées haute résolution peut également être volumineux, de sorte que la taille du fichier à elle seule ne constitue pas un indicateur fiable.
Pourquoi la distinction est importante pour les tâches PDF quotidiennes
La recherche est la tâche la plus courante affectée par la distinction numérisée et native. Si vous recevez un PDF de 50 pages et que vous avez besoin de trouver chaque mention d'un terme spécifique, un PDF natif vous donne la réponse en quelques secondes grâce à la fonction de recherche. Un PDF numérisé vous oblige à numériser manuellement chaque page visuellement, ce qui prend quelques minutes et peut manquer des occurrences. La possibilité de rechercher un document transforme la façon dont vous interagissez avec celui-ci.
L'extraction de texte pour la réutilisation dans d'autres documents nécessite du texte natif. Si vous devez citer un paragraphe d'un PDF dans votre propre rapport, un PDF natif vous permet de copier et coller directement le texte. Un PDF numérisé vous oblige à retaper le texte ou à exécuter l'OCR pour le rendre extractible. Pour les documents auxquels vous faites fréquemment référence, la différence entre le copier-coller instantané et la retape manuelle est significative.
Les outils d'accessibilité, y compris les lecteurs d'écran utilisés par les personnes malvoyantes, nécessitent du texte natif. Un lecteur d'écran peut lire à haute voix un PDF natif car il peut accéder aux caractères du texte. Un lecteur d'écran ne peut pas lire un PDF numérisé car il n'y a aucun caractère de texte auquel accéder. Rendre les PDF numérisés accessibles nécessite un traitement OCR pour ajouter une couche de texte que les lecteurs d'écran peuvent interpréter.
Le format Scanned PDF est parfaitement adapté à des fins d'archivage où le document doit uniquement être visualisé comme une image de l'original. Une copie numérisée d'un contrat signé sert d'enregistrement visuel du document signé. Pour tout objectif nécessitant une interaction avec le texte, une recherche, une copie, une modification ou une accessibilité, un PDF natif ou un PDF numérisé avec OCR est nécessaire.
Comment convertir un PDF numérisé en un PDF de type natif consultable
La reconnaissance optique des caractères est la technologie qui convertit les images de pages numérisées en documents consultables avec une couche de texte. Exécutez l'OCR sur le PDF numérisé à l'aide d'un outil PDF prenant en charge le traitement OCR. L'outil analyse chaque image de page, reconnaît les caractères du texte et ajoute un calque de texte invisible derrière l'image de la page. Après l'OCR, le PDF semble visuellement identique mais est désormais consultable et le texte reconnu peut être sélectionné et copié.
La précision de l'OCR dépend de la qualité de la numérisation originale. Une numérisation nette à 300 DPI avec un éclairage uniforme, des pages plates et une mise au point nette produit une précision OCR supérieure à 99 %.
Une numérisation basse résolution à 150 DPI avec des ombres, des pages incurvées ou du texte flou peut produire une précision inférieure à 95 %, nécessitant une correction manuelle. La qualité de la numérisation détermine la qualité de la sortie OCR.
Après avoir exécuté l'OCR, vérifiez les résultats en recherchant quelques mots que vous pouvez voir sur la page. Si la recherche les trouve, l'OCR a réussi. Si la recherche manque des mots évidents, l'OCR peut avoir eu des difficultés avec la police spécifique, la mise en page ou la qualité de l'image de cette page. Réexécutez l'OCR avec les paramètres ajustés ou sur une numérisation de meilleure qualité si disponible.
L'outil OCR PDF de WukongPDF traite les documents numérisés dans le navigateur et renvoie un PDF avec une couche de texte consultable. Téléchargez le PDF numérisé, exécutez l'OCR et téléchargez un document prenant en charge la recherche, la sélection de texte et l'accès au lecteur d'écran. Le processus OCR préserve l'apparence visuelle d'origine tout en ajoutant la couche de texte qui rend le document interactif.
La différence de taille de fichier entre les PDF numérisés et les PDF natifs devient particulièrement importante lorsqu'il s'agit de grandes collections de documents. Un classeur de documents papier numérisés au format PDF peut produire des dizaines de milliers de pages PDF numérisées, chaque page étant une image complète. À 500 kilo-octets par page pour une numérisation typique en niveaux de gris de 300 DPI, 10 000 pages consomment 5 gigaoctets de stockage. L'exécution de l'OCR sur ces PDF numérisés ne réduit pas la taille du fichier, car les images de la page restent, mais elle ajoute la couche de texte consultable qui rend la collection pratiquement utilisable.
Pour les documents nécessitant un archivage à long terme, le format PDF/A est la norme d'archivage. Les PDF numérisés et les PDF natifs peuvent être convertis en PDF/A. Un PDF numérisé converti en PDF/A reste un document basé sur une image avec l'ajout de métadonnées d'archives. Un PDF natif converti en PDF/A conserve son texte et ses propriétés structurelles. PDF/A ne modifie pas la nature numérisée par rapport à la nature native du document. Il ajoute des métadonnées standardisées et applique des exigences structurelles qui améliorent la préservabilité à long terme.
Pour les PDF qui mélangent des pages numérisées et natives, appliquez l'OCR aux pages numérisées tout en laissant les pages natives intactes. La plupart des outils OCR peuvent traiter des plages de pages spécifiques, vous pouvez donc exécuter l'OCR uniquement sur les pages qui en ont besoin. Après le traitement, le PDF conserve le texte natif sur les pages d'origine et comporte une couche de texte consultable sur les pages auparavant composées uniquement d'images, offrant ainsi une possibilité de recherche cohérente sur l'ensemble du document.
Pour les documents qui seront imprimés et remplis à la main, un PDF numérisé du formulaire original est parfaitement adéquat. Le destinataire imprime le PDF, remplit les espaces vides avec un stylo et renvoie la copie physique ou la numérise au format numérique. Pour les documents qui doivent être remplis numériquement, un PDF natif avec des champs de formulaire est largement supérieur car le destinataire peut saisir directement dans les champs.
Le choix entre numériser un document au format PDF et créer un PDF natif à partir du fichier source d'origine doit prendre en compte l'ensemble du cycle de vie du document, et pas seulement le besoin immédiat. Un PDF numérisé d'un contrat peut être envoyé par courrier électronique à l'autre partie pour examen. Si ce contrat doit ultérieurement faire l'objet d'une recherche pour une clause spécifique lors d'un litige, le manque de possibilité de recherche du PDF numérisé devient un handicap important. La création d'un PDF natif au moment de la création du document préserve les options que la numérisation ne préserve pas.
Les logiciels de numérisation modernes incluent souvent un traitement OCR automatique, brouillant la distinction entre les PDF numérisés et natifs dans la pratique. Un document numérisé avec une application téléphonique qui effectue l'OCR immédiatement après la capture produit un PDF qui est techniquement une image numérisée mais fonctionnellement consultable comme un PDF natif. Cette approche hybride combine la commodité de la numérisation avec la possibilité de recherche dans le texte natif.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
