
Qu'est-ce que l'OCR fait à un PDF numérisé
La reconnaissance optique de caractères transforme un PDF numérisé, qui est une collection d'images de pages, en un document consultable.
Le processus OCR PDF analyse chaque image de page, identifie la forme des caractères et crée un calque de texte invisible derrière l'image de la page. Après l'OCR, vous pouvez rechercher des mots dans le document, sélectionner et copier du texte et utiliser des lecteurs d'écran pour lire le document à haute voix.
L'OCR transforme une image passive de texte en un document actif et consultable qui prend en charge la sélection de texte et les lecteurs d'écran.
La précision de l'OCR dépend directement de la qualité de la numérisation originale, des numérisations nettes de 300 DPI produisant les meilleurs résultats.
Un PDF numérisé sans OCR est comme un album photo de texte. Vous pouvez regarder les mots mais vous ne pouvez pas interagir avec eux. Vous ne pouvez pas rechercher un terme spécifique. Vous ne pouvez pas copier un paragraphe pour le citer. Vous ne pouvez pas utiliser de lecteur d'écran. L'OCR ajoute des fonctionnalités interactives qui rendent les documents numériques utiles au-delà de la simple visualisation.
La précision de l'OCR dépend de la qualité de la numérisation originale. Une numérisation nette et haute résolution à 300 DPI avec un éclairage uniforme et une mise au point nette produit une précision OCR supérieure à 99 % pour le texte imprimé standard. Une numérisation à basse résolution, une photographie d'un document prise sous un angle ou une numérisation d'un original froissé ou taché produit une précision moindre. La qualité de la numérisation détermine directement la qualité de la sortie OCR.
La couche de texte PDF consultable ajoutée par OCR est distincte de l'image de la page. L'apparence visuelle du PDF ne change pas après l'OCR. La page ressemble toujours à une image numérisée. Derrière cette image, le texte reconnu existe sous forme de données de caractères invisibles auxquelles les moteurs de recherche, les lecteurs d'écran et les outils de sélection de texte peuvent accéder.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Comment exécuter l'OCR sur un PDF numérisé sur différents appareils
Sous Windows, Adobe Acrobat Pro peut exécuter l'OCR sur les PDF numérisés. Ouvrez le PDF, sélectionnez l'outil Numériser et OCR, puis choisissez Reconnaître le texte. Acrobat traite chaque page, reconnaît le texte et ajoute le calque de texte consultable. Enregistrez le fichier. Le PDF prend désormais en charge la recherche et la sélection de texte. Acrobat Pro fournit l'OCR le plus précis sous Windows.
Sur Mac, l'application Aperçu intégrée n'inclut pas l'OCR. Plusieurs outils PDF Mac tiers offrent une fonctionnalité OCR. PDF Expert et PDFpen incluent tous deux des moteurs OCR qui traitent les PDF numérisés et ajoutent des couches de texte consultables. La qualité OCR est comparable aux outils Windows pour les documents standards.
L'outil OCR basé sur un navigateur de WukongPDF fonctionne sur n'importe quel système d'exploitation. Téléchargez le PDF numérisé, sélectionnez la langue du document pour le moteur OCR et exécutez la reconnaissance. Téléchargez le PDF consultable une fois le traitement terminé. L'approche basée sur un navigateur rend l'OCR accessible sans installer de logiciel.
Pour iPhone et Android, les applications de numérisation qui incluent l'OCR traitent la numérisation pendant la capture. Adobe Scan, Microsoft Lens et le scanner intégré à l'application iPhone Notes effectuent tous automatiquement l'OCR lors de la numérisation de documents. Le PDF résultant peut être recherché immédiatement après la numérisation, sans étape de traitement OCR distincte.
Améliorer la précision de l'OCR pour les documents difficiles
Sélectionnez la langue correcte du document avant d’exécuter l’OCR. Le moteur OCR utilise des dictionnaires spécifiques à la langue et des données de fréquence de caractères pour résoudre les caractères ambigus. L'exécution de l'OCR sur un document français avec le paramètre de langue française produit de meilleurs résultats que l'utilisation du paramètre anglais. Pour les documents multilingues, sélectionnez la langue principale et corrigez manuellement les erreurs dans les passages de la langue secondaire.
Redressez les pages numérisées avant l'OCR. Les pages numérisées légèrement pivotées, même d'un ou deux degrés, réduisent la précision de l'OCR, car le moteur OCR s'attend à ce que les lignes de texte soient horizontales. La plupart des logiciels de numérisation incluent une fonction de redressement automatique. Si la numérisation n'a pas été redressée lors de la capture, redressez les pages PDF avant d'exécuter l'OCR.
Augmentez la résolution de numérisation des documents contenant du texte petit ou des mises en page complexes. Le texte inférieur à 10 points nécessite une résolution de numérisation plus élevée pour une OCR précise. Une numérisation à 300 DPI est suffisante pour la plupart des documents. Pour les documents contenant du texte de 8 points ou moins, numérisez à 400 ou 600 DPI pour donner au moteur OCR suffisamment de données de pixels pour distinguer les caractères individuels.
Pour les documents avec des types de contenu mixtes, tels que des pages combinant du texte avec des photographies ou des illustrations, le moteur OCR doit être configuré pour reconnaître uniquement les zones de texte. Tenter de reconnaître le texte des zones d'image produit des caractères inutiles. La plupart des outils OCR incluent une fonctionnalité de sélection de zone qui vous permet de spécifier quelles zones de page contiennent du texte.
Vérification et correction de la sortie OCR
Une fois l'OCR terminé, vérifiez le résultat en recherchant quelques mots que vous pouvez voir sur la page. Si la recherche les trouve, l'OCR a réussi. Si la recherche manque des mots évidents, la précision de l'OCR peut être insuffisante pour la police, la mise en page ou la qualité d'image spécifique de cette page.
Pour les documents pour lesquels la précision de l'OCR est essentielle, tels que les dossiers juridiques ou médicaux qui doivent être entièrement consultables, examinez manuellement le texte reconnu. Certains outils PDF vous permettent d'afficher et de modifier le calque de texte masqué. Corrigez les erreurs de reconnaissance, notamment dans les noms propres, les chiffres et les termes techniques que le moteur OCR est plus susceptible de mal reconnaître.
Les erreurs OCR les plus courantes concernent la confusion des caractères. La lettre l et le chiffre 1 se ressemblent dans de nombreuses polices. Les lettres rn ensemble peuvent ressembler à la lettre m.
Les lettres cl peuvent ressembler à la lettre d. Ces confusions de caractères produisent des mots visuellement similaires à l’original mais textuellement erronés. L’examen manuel des sections critiques détecte ces erreurs.
Après avoir vérifié la sortie OCR, enregistrez le document avec un nom de fichier indiquant qu'il a été traité avec OCR. Un nom de fichier tel que Report-OCR.pdf ou Report-Searchable.pdf distingue la version consultable de l'analyse originale d'image uniquement.
L’avantage pratique d’un PDF numérisé interrogeable devient évident la première fois que vous avez besoin de trouver une information spécifique dans un document volumineux. Un contrat numérisé de 200 pages sans OCR nécessite de lire manuellement chaque page pour trouver une clause spécifique. Une version consultable trouve la clause en quelques secondes. Pour tout document auquel vous comptez faire référence plus d’une fois, l’investissement OCR est rentabilisé.
Les PDF traités par OCR sont également accessibles aux lecteurs d'écran, ce qui les rend utilisables par les personnes malvoyantes qui s'appuient sur une technologie d'assistance pour lire les documents. Un PDF numérisé sans OCR est totalement inaccessible aux lecteurs d'écran car il n'y a pas de texte à lire à haute voix. L'ajout de l'OCR rend le document accessible, ce qui est requis par les normes d'accessibilité, notamment la section 508 et les WCAG.
Pour les documents rédigés dans des langues autres que l'anglais, sélectionnez la langue OCR correcte avant le traitement. Les moteurs OCR utilisent des modèles de reconnaissance de caractères spécifiques à la langue. Un document en japonais reconnu avec le modèle japonais produit de bien meilleurs résultats que le même document reconnu avec un modèle anglais.
L'OCR permet également l'extraction de texte pour la réutilisation dans d'autres documents. Lorsque vous devez citer un passage d'un document numérisé dans votre propre rapport, l'OCR rend le texte copiable. Sans OCR, vous devrez retaper manuellement le passage. Le temps gagné grâce à la possibilité de copier et coller des documents traités par OCR s'additionne considérablement.
Pour les documents numérisés qui seront archivés, l’OCR est une étape de préservation essentielle. Un PDF numérisé contenant uniquement des images archivé aujourd’hui n’offre aucune capacité de recherche aux futurs chercheurs. Un PDF consultable permet d'accéder au contenu du document via une recherche de texte, augmentant considérablement l'utilité du document pour les futurs utilisateurs.
La taille du fichier PDF ne change pas de manière significative après l'OCR. Les données OCR ajoutent une petite quantité de données texte à chaque page, généralement quelques kilo-octets par page. Les images de la page originale restent inchangées. L'augmentation de la taille du fichier est négligeable pour l'amélioration fonctionnelle apportée par la couche de texte consultable.
La couche de texte consultable ajoutée par OCR est distincte de l'image visuelle de la page. Lorsque vous recherchez un mot dans un PDF traité par OCR, la recherche correspond au calque de texte et non à l'image. Le résultat de la recherche met en évidence la zone de l'image de la page où le texte a été trouvé.
Les PDF traités par OCR prennent en charge la lecture de synthèse vocale, ce qui les rend accessibles aux personnes malvoyantes et à tous ceux qui préfèrent écouter des documents plutôt que de les lire. This accessibility feature is a significant benefit of OCR beyond simple searchability.
Pour les grands projets OCR impliquant des centaines ou des milliers de pages numérisées, le traitement OCR par lots permet de gagner un temps considérable. Configurez les paramètres OCR une fois et appliquez-les à l'ensemble du lot de documents. Examinez un échantillon de pages pour en vérifier l’exactitude plutôt que d’examiner chaque page.
La couche de texte OCR peut être exportée sous forme de fichier texte brut, permettant au contenu du document d'être utilisé dans d'autres applications. Exportez le texte reconnu, ouvrez-le dans un éditeur de texte ou un traitement de texte et utilisez-le comme base pour un nouveau document.
La valeur à long terme d’un PDF traité par OCR se réalise chaque fois que vous avez besoin de rechercher des informations dans le document. Un PDF consultable d'un contrat, d'un manuel ou d'un document de référence devient une ressource que vous pouvez interroger plutôt qu'un fichier statique que vous devez lire manuellement.
La mise en œuvre de l'OCR comme étape standard dans votre flux de travail de numérisation de documents garantit que chaque document que vous numérisez est consultable dès son entrée dans votre bibliothèque numérique. Les quelques secondes supplémentaires de traitement OCR lors de la numérisation s'avèrent payantes chaque fois que vous avez besoin de trouver des informations dans un document que vous avez déjà numérisé.
Pour toute personne gérant une bibliothèque de documents numériques, l’OCR est l’étape de traitement la plus efficace que vous puissiez appliquer aux PDF numérisés. Il transforme les fichiers image passifs en documents actifs, consultables et accessibles.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
