Others

Quelle est la différence entre le texte OCR et le texte intégré dans un PDF

Ouvrez un PDF numérisé et vous pouvez sélectionner, copier et rechercher le texte comme s'il s'agissait d'un document numérique natif. Ce texte ne provient pas de l'analyse originale. Le scanner a produit une image de la page, une grille de pixels sans aucune donnée textuelle. Le texte que vous sélectionnez et recherchez est du texte OCR, généré par un logiciel de reconnaissance optique de caractères qui a analysé l'image de la page et converti les motifs de pixels en caractères. Mais tout le texte sélectionnable dans un PDF n’est pas du texte OCR. Certains PDF contiennent du texte intégré créé numériquement, sans jamais passer par un scanner ou un moteur de reconnaissance. Comprendre la différence entre le texte OCR et le texte intégré explique pourquoi certains PDF effectuent une recherche parfaite tandis que d'autres produisent des résultats tronqués.

What Is the Difference Between OCR Text and Embedded Text in a PDF

Qu'est-ce qu'un texte OCR et comment il entre dans un PDF

Le texte OCR est généré automatiquement. Un moteur OCR PDF examine chaque forme de caractère dans une image de page numérisée, la compare à une base de données de modèles de caractères connus et génère le caractère correspondant le plus probable ainsi que sa position sur la page. Le texte reconnu est ensuite intégré dans le PDF sous la forme d'un calque invisible positionné précisément sur les caractères de l'image d'origine. Lorsque vous sélectionnez et copiez du texte à partir d'un PDF numérisé, vous copiez à partir de cette couche OCR invisible, et non à partir de l'image visible. Si le moteur OCR a mal lu un caractère, le texte copié contiendra cette erreur même si l'image visible semble correcte.

La qualité du texte OCR dépend de plusieurs facteurs : la résolution et la clarté de la numérisation originale, la police utilisée dans le document original, la langue du texte et la sophistication du moteur OCR. Une numérisation nette à 300 DPI d'un document anglais imprimé au laser et traité par un moteur OCR moderne produit un texte presque parfait. Une numérisation à 150 DPI d'un document imprimé par matrice de points dans un langage comportant des formes de caractères complexes traitées par un moteur OCR de base produit un texte criblé d'erreurs. Le texte OCR est aussi précis que le moteur de reconnaissance et la qualité de numérisation le permettent.

WukongPDF

Essayez l'OCR PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Qu'est-ce que le texte incorporé et comment il entre dans un PDF

Le texte intégré est créé et n'est pas reconnu. Lorsqu'un traitement de texte, une application de publication assistée par ordinateur ou une bibliothèque de création de PDF génère un PDF, il écrit le texte directement dans le flux de contenu PDF. Chaque caractère est stocké sous forme de code spécifique qui correspond à un glyphe dans une police. Il n’y a pas d’étape de reconnaissance car le texte n’a jamais été une image. L'application qui a créé le PDF savait exactement quels caractères étaient écrits et les enregistrait avec précision. Lorsque vous sélectionnez et copiez du texte à partir d'un PDF créé numériquement, vous copiez les caractères exacts que l'auteur a tapés.

Le texte intégré contient des informations de formatage qui manquent généralement au texte OCR. Les noms de police, le style gras et italique et l'espacement des caractères sont conservés dans le texte incorporé car ils ont été spécifiés par l'auteur dans le document source. Le texte OCR peut reconstruire une partie de ce formatage, mais il est déduit de l'apparence visuelle des caractères plutôt que stocké sous forme de métadonnées explicites. Une comparaison PDF Format entre une page numérisée puis OCR et une page numérique native révèle cette différence. La version OCR peut permettre la sélection de texte mais signale chaque caractère comme la même police avec le même poids. La version numérique conserve les distinctions de police voulues par l'auteur.

Comment savoir si le texte d'un PDF est OCR ou intégré

Le moyen le plus fiable de déterminer si le texte d'un PDF est généré par OCR ou intégré est de vérifier les propriétés du document, en particulier la liste des polices. Ouvrez le PDF dans une visionneuse pouvant afficher des informations sur la police. Adobe Acrobat affiche la liste des polices sous Fichier, Propriétés du document, Polices. Si la liste des polices affiche des polices dont les noms incluent l'OCR ou si les polices sont répertoriées comme inconnues ou comme type générique sans nom spécifique, le texte est probablement généré par OCR. Si la liste des polices affiche des polices spécifiques nommées telles que Arial, Times New Roman ou Calibri avec des sous-types comme Gras ou Italique, le texte est presque certainement intégré à partir d'une source numérique.

Un autre test pratique consiste à rechercher un modèle d'erreur OCR courant. Recherchez dans le PDF les erreurs de substitution OCR courantes, telles que la combinaison de lettres rn, que les moteurs OCR interprètent souvent à tort comme la lettre unique m. Si la recherche trouve des exemples de grange devenant bam ou de maïs devenant com, le texte est généré par OCR. Le texte incorporé ne contient pas ces erreurs de substitution car les caractères n'ont jamais été visuellement ambigus. La qualité PDF consultable d'un document dépend du fait que le texte sous-jacent, OCR ou intégré, représente avec précision le contenu visible.

Lorsque le texte OCR et le texte intégré coexistent dans le même PDF

Un seul PDF peut contenir à la fois du texte OCR et du texte intégré sur différentes pages ou même sur la même page. Un ensemble de contrats peut inclure le corps du contrat rédigé numériquement, qui contient du texte intégré, et une page de signature numérisée et traitée par OCR, qui contient du texte OCR. Un rapport de recherche peut combiner des pages de texte créées numériquement avec des photographies numérisées et traitées par OCR de coupures de journaux historiques. Le texte de la page trois est un texte intégré au pixel près. Le texte de la page sept est un texte OCR qui peut contenir des erreurs de reconnaissance.

Ce scénario de contenu mixte crée un piège subtil pour toute personne recherchant ou extrayant du texte du PDF. Les résultats de recherche à partir des pages de texte intégrées seront précis. Les résultats de recherche à partir des pages de texte OCR peuvent manquer des occurrences où le moteur OCR a mal lu un mot, ou peuvent renvoyer de fausses correspondances lorsque le moteur OCR a remplacé un mot similaire. Lorsque vous travaillez avec des PDF à contenu mixte, vérifiez tout texte extrait des pages OCR avant de vous y fier. L'approche la plus sûre consiste à vérifier visuellement l'image de la page correspondante chaque fois que le texte extrait d'une page OCR est utilisé à des fins critiques.

Améliorer la qualité du texte OCR après coup

Lorsqu'un PDF contient du texte OCR de mauvaise qualité, les options pour l'améliorer sont limitées par le fait que le processus de numérisation et d'OCR d'origine est déjà terminé. Vous ne pouvez pas améliorer rétroactivement la qualité de la numérisation. Ce que vous pouvez faire, c'est ré-OCR le PDF avec un meilleur moteur. Extrayez les images de page du PDF à la plus haute résolution disponible et exécutez-les via un moteur OCR moderne qui peut produire des résultats plus précis que la passe OCR d'origine. Remplacez l'ancien calque de texte OCR par le nouveau.

Certains éditeurs PDF vous permettent de corriger manuellement les erreurs OCR directement dans le calque de texte. Ouvrez le PDF dans un mode d'édition qui révèle le texte OCR invisible. Cliquez sur un mot mal reconnu et tapez la correction. Ce processus de correction manuelle est pratique pour une poignée d’erreurs sur quelques pages. Ce n'est pas pratique pour un document de 200 pages où chaque paragraphe contient des erreurs de reconnaissance. Pour les problèmes de qualité OCR à grande échelle, la ré-OCR de l’intégralité du document avec un meilleur moteur est l’approche la plus efficace.

Choisir entre l'OCR et le texte intégré pour la création de documents

Lors de la création d'un PDF qui sera recherché, indexé ou archivé, le choix entre la numérisation et l'OCR ou la génération d'un PDF numérique natif a des conséquences à long terme. Un PDF numérique natif avec texte intégré est plus petit, recherche plus rapidement et préserve parfaitement l'exactitude du texte. Un PDF numérisé et traité par OCR préserve l'apparence originale du document papier, mais introduit la possibilité d'erreurs de reconnaissance qui s'aggravent au fil du temps à mesure que le PDF est copié, cité et référencé.

Pour les projets d’archives, la meilleure pratique consiste à conserver les deux formats. Conservez la numérisation haute résolution comme maître d’archives pour la fidélité visuelle. Générez une version numérique native, soit en retapant ou en appliquant une OCR de haute précision avec correction manuelle, pour la recherche et l'analyse de texte. Cette approche double format offre l'authenticité de la numérisation originale et la facilité d'utilisation du texte consultable. WukongPDF prend en charge le traitement OCR PDF pour la conversion de documents numérisés en PDF consultables, et la couche de texte OCR résultante fournit la fonctionnalité de recherche et de copie qui rend les documents numérisés utilisables dans les flux de travail numériques.

L'écart de fiabilité à long terme entre l'OCR et le texte intégré

Les PDF OCRed vieillissent différemment des PDF créés numériquement. Un PDF créé numériquement, ouvert vingt ans après sa création, affiche parfaitement son texte, car les codes de caractères sont sans ambiguïté et les polices sont intégrées. Un PDF OCRed ouvert vingt ans après sa création dépend de la qualité de la numérisation originale et de la précision du moteur OCR disponible à ce moment-là. Les erreurs de reconnaissance, à peine perceptibles lorsque le document était frais, deviennent des obstacles importants lorsque le document papier original n'est plus disponible pour vérification.

Pour les documents destinés à une conservation à long terme, le texte intégré provenant d'une source numérique est toujours préférable au texte OCR. Si un document n'existe que sur papier et doit être numérisé, investissez dans un traitement de numérisation et d'OCR de la plus haute qualité disponible à ce moment-là et conservez le document papier original aussi longtemps que possible. L’original papier constitue la protection ultime contre les erreurs OCR qui ne se manifesteront que des années plus tard.

Un test pratique pour distinguer le texte OCR PDF du texte incorporé : zoomez à 300 % ou plus sur un paragraphe et regardez les bords des caractères. Le texte OCR présente souvent un léger désalignement entre l'image du caractère visible et le calque de texte invisible. Le texte intégré s'affiche avec un alignement parfait car les formes et les positions des caractères proviennent du même programme de polices.

WukongPDF

Essayez l'OCR PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →