
Pourquoi l'OCR a du mal avec le chevauchement du texte des notes de bas de page et du contenu des marges
Les moteurs de reconnaissance optique de caractères fonctionnent mieux lorsque le texte se trouve dans des blocs clairs et prévisibles avec un espacement des lignes cohérent et une séparation claire entre les zones de contenu. Une opération OCR PDF sur une lettre commerciale standard ou une nouvelle page produit généralement des résultats précis car le texte se déroule en paragraphes ordonnés avec de larges marges de tous les côtés. Les articles universitaires présentent un problème fondamentalement plus difficile car leur mise en page regroupe délibérément plusieurs flux de texte distincts à proximité physique étroite, les notes de bas de page, les citations en marge et le corps du texte se touchant ou se chevauchant souvent au niveau de leurs limites.
Le principal défi est la segmentation, l'étape où le moteur OCR divise l'image de la page en zones de texte avant de tenter la reconnaissance des caractères. Lorsqu'un numéro de référence de note de bas de page en exposant dans le corps du texte se trouve directement au-dessus d'une ligne de séparation de note de bas de page et que cette ligne se trouve directement au-dessus du texte de note de bas de page lui-même avec une taille de police plus petite, l'algorithme de segmentation doit décider où se termine une région de texte et où commence la suivante. Une mauvaise décision de segmentation se traduit ici par des erreurs de reconnaissance, car les caractères de deux flux de texte différents sont introduits dans le moteur de reconnaissance comme s'il s'agissait d'une seule ligne continue. Le résultat se lit comme du charabia mélangeant des mots du corps du texte avec des fragments de notes de bas de page.
Les citations en marge ajoutent un troisième flux de texte au problème. Dans les articles de sciences humaines suivant le style de Chicago ou les documents juridiques utilisant le format Bluebook, les notes en marge, les numéros de ligne ou les citations parallèles s'affichent verticalement ou horizontalement le long de la colonne de texte principale. Ces éléments de marge sont souvent imprimés avec une taille de point plus petite, parfois 7 ou 8 points, et peuvent utiliser des polices italiques ou condensées avec lesquelles les moteurs OCR ont déjà du mal à fonctionner en taille normale. Lorsque le texte en marge touche physiquement le corps du texte, ce qui arrive fréquemment dans les revues au format serré et aux gouttières étroites, le défi de segmentation devient triple au lieu de bidirectionnel.
La qualité du papier de la source PDF numérisé aggrave également la difficulté de l'OCR. De nombreux articles universitaires sont numérisés à partir de volumes reliés où la courbure de la page près du dos provoque la courbure et la déformation du texte. Les notes de bas de page en bas de page sont la section la plus affectée par la courbure du dos car elles sont les plus proches de la reliure. La combinaison de la distorsion physique de la page incurvée, de la petite taille de la police et de la proximité du corps du texte ci-dessus crée une tempête parfaite de conditions défavorables pour la précision de l'OCR.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Prétraitement de la page numérisée pour séparer les zones de texte qui se chevauchent
Le moyen le plus efficace d’améliorer la précision de l’OCR sur les pages académiques comportant des éléments de texte qui se chevauchent consiste à prétraiter l’image de la page avant qu’elle n’atteigne le moteur OCR. Ce prétraitement sépare les différents flux de texte afin que le moteur n'ait jamais à prendre de décisions de segmentation ambiguës.
Commencez par redresser la page numérisée pour vous assurer que toutes les lignes de texte sont parfaitement horizontales. Même une inclinaison d'un degré dans la numérisation originale peut entraîner la dérive du texte de la note de bas de page dans la zone du corps du texte au niveau des bords de la page, créant ainsi de faux chevauchements qui n'existeraient pas sur une page correctement alignée. La plupart des logiciels de numérisation de documents incluent le redressement automatique, mais pour les articles universitaires numérisés à partir de volumes reliés, le redressement manuel avec une ligne de référence tracée le long de la ligne de base du corps du texte produit des résultats plus précis que la correction automatique.
Après le redressement, l’étape suivante est le masquage des régions. À l’aide d’un éditeur d’images ou d’un outil de prétraitement OCR dédié, tracez une ligne de séparation horizontale entre la zone du corps du texte et la zone des notes de bas de page. Cette ligne indique au moteur OCR en aval de traiter tout ce qui se trouve au-dessus comme une seule région de texte et tout ce qui se trouve en dessous comme une région de texte distincte. Sur les pages contenant des notes de bas de page, le séparateur doit se trouver juste au-dessus de la règle de note de bas de page, la courte ligne horizontale qui sépare traditionnellement le corps du texte des notes de bas de page dans les ouvrages universitaires imprimés. Sur les pages sans notes de bas de page, aucun séparateur n'est nécessaire.
Pour les citations en marge et les numéros de ligne, le masquage vertical est l’approche équivalente. Dessinez un séparateur vertical entre le texte de marge et la colonne de texte principale. Sur les pages comportant à la fois des numéros de ligne dans la marge gauche et des citations dans la marge droite, les deux côtés ont besoin de séparateurs verticaux. L'objectif est de diviser la page en régions rectangulaires où chaque région contient exactement un flux de texte. Le moteur OCR traite ensuite chaque région indépendamment et produit des sorties de texte reconnues distinctes que vous pouvez réassembler dans le bon ordre de lecture une fois la reconnaissance terminée.
Configuration des paramètres OCR pour les pages académiques multi-flux
La plupart des moteurs OCR professionnels fournissent des paramètres qui facilitent les mises en page multi-colonnes et multi-flux. L'activation de l'analyse automatique de la mise en page est le point de départ, mais pour les pages académiques avec des flux de texte à proximité, la configuration manuelle des zones produit de meilleurs résultats qu'une analyse entièrement automatique.
Définissez des zones de reconnaissance distinctes pour le corps du texte, la zone de note de bas de page et chaque région de texte en marge. Dans chaque zone, définissez la langue appropriée, la plage de tailles de police attendue et l'orientation du texte. Les zones de corps de texte doivent s'attendre à un texte de 10 à 12 points dans une orientation horizontale de gauche à droite. Les zones de notes de bas de page doivent s'attendre à un texte de 8 à 10 points, toujours horizontal, mais en sachant que le texte des notes de bas de page comprend souvent des URL, des DOI et des chaînes de citation qui peuvent confondre les modèles linguistiques attendant une prose naturelle.
Pour la zone du corps de texte en particulier, activez le paramètre qui ignore le texte en exposant et en indice à des fins de segmentation de ligne. Les numéros de référence des notes de bas de page en exposant et les exposants mathématiques sont généralement plus petits et élevés au-dessus de la ligne de base, ce qui provoque des erreurs de calcul de la hauteur de ligne si le moteur les traite comme faisant partie de la ligne de texte normale. Ignorer le positionnement des exposants à des fins de segmentation conserve les lignes du corps du texte intactes tandis que les marqueurs de notes de bas de page sont reconnus comme de petits éléments distincts qui n'affectent pas les limites des lignes.
La qualité de sortie PDF vers Texte s'améliore considérablement lorsque le résultat de la reconnaissance de chaque zone est enregistré dans un fichier texte distinct ou dans une section marquée distincte au sein d'une sortie combinée. Cette sortie séparée par zones permet de vérifier facilement que le corps du texte n'a pas fondu dans le texte des notes de bas de page et que les citations en marge apparaissent dans leur propre section de sortie clairement étiquetée plutôt qu'entrelacées avec le contenu principal.
Nettoyage post-reconnaissance pour la sortie OCR académique
Même avec un prétraitement et une configuration de zone minutieux, certaines erreurs de reconnaissance sont inévitables sur des pages académiques très chargées. Un processus structuré de nettoyage post-reconnaissance détecte et corrige ces erreurs résiduelles avant que le texte n'entre dans le document final.
Exécutez une vérification orthographique sur le corps du texte uniquement, avec le dictionnaire de vérification orthographique défini sur la langue principale du document. Les mots signalés comme mal orthographiés dans le corps du texte qui s'avèrent être correctement orthographiés dans une note de bas de page sont un signe clair qu'une limite de zone de corps de texte était trop généreuse et capturait le texte de la note de bas de page. Ajustez la limite de zone pour ces pages et réexécutez la reconnaissance plutôt que de modifier manuellement les fragments de notes de bas de page.
Pour la sortie de texte de note de bas de page, vérifiez que chaque note de bas de page commence par son numéro de référence attendu et que le texte de la note de bas de page est continu sans fragments de corps de texte intercalés. Un modèle d'erreur post-reconnaissance courant est l'apparition de lignes de corps de texte au milieu du texte de note de bas de page, là où la colonne de corps de texte s'étendait plus bas sur la page que la limite de zone prévue. L'examen de l'image de la page originale à côté du texte de note de bas de page reconnu détecte rapidement ces intrusions car le sujet de la phrase passe brusquement du sujet académique à un sujet de paragraphe de corps sans rapport.
L'outil OCR de WukongPDF prend en charge la reconnaissance basée sur les zones pour les mises en page complexes, notamment les articles universitaires multicolonnes avec des notes de bas de page et du contenu en marge. La définition des paramètres par zone pour la langue, la plage de tailles de police et l'orientation du texte avant de démarrer la passe de reconnaissance produit une sortie OCR PDF plus précise que le traitement à zone unique sur les mêmes pages, et le format de sortie séparé facilite la vérification post-reconnaissance.
Gestion des cas particuliers : notation mathématique, écritures non latines et langues mixtes
Les articles universitaires dans les domaines STEM ajoutent une notation mathématique au défi des textes qui se chevauchent. Les équations et les formules entrecoupées de corps de texte créent une complexité de segmentation supplémentaire, car la notation mathématique utilise des symboles, des lettres grecques et un formatage bidimensionnel comme les fractions et les exposants qui ne suivent pas les mêmes règles de mise en page que le texte en prose. Les moteurs OCR conçus pour le texte d'un document fonctionnent mal sur la notation mathématique, et les moteurs conçus pour les mathématiques fonctionnent mal sur le texte d'un document.
L’approche la plus pratique pour les pages contenant un mélange de mathématiques et de prose est une stratégie OCR en deux passes. La première passe utilise un moteur optimisé pour les documents pour reconnaître toutes les zones de texte en prose, y compris le corps du texte, les notes de bas de page et les citations en marge. La deuxième passe utilise un moteur de reconnaissance mathématique sur les régions de page spécifiques contenant des équations. La fusion des deux sorties dans un document combiné qui préserve à la fois la précision de la prose du moteur de document et la précision des formules du moteur mathématique produit le résultat global le plus fiable.
Pour les articles qui mélangent des écritures latines et non latines, tels que les articles en anglais avec des citations arabes, chinoises ou cyrilliques dans les notes de bas de page, configurez chaque zone de reconnaissance avec l'écriture principale correcte. La zone du corps de texte utilise la langue principale du document. Les zones de note de bas de page contenant des passages en écriture non latine peuvent nécessiter une configuration de reconnaissance multi-écriture capable de basculer entre les écritures au sein d'une même région de texte.
Le tableau ci-dessous résume les configurations de zone OCR recommandées pour différentes régions de page dans les articles universitaires.
| Région de la page | Taille de police attendue | Orientation | Paramètres spéciaux |
|---|---|---|---|
| Corps du texte | 10-12 points | Horizontal | Ignorer l'exposant pour la segmentation de ligne |
| Notes de bas de page | 8-10 points | Horizontal | Multi-script si les citations incluent du texte non latin |
| Marge gauche (numéros de ligne) | 7-9 points | Horizontal ou vertical | Extraire en tant que sortie séparée ; ne fusionne pas avec le corps |
| Marge droite (Citations) | 7-9 points | Horizontal | Extraire en tant que sortie séparée |
| Équations/Formules | Variable | Horizontal avec mise en page 2D | Utiliser un moteur adapté aux mathématiques lors du deuxième passage |
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
