Tips & Tricks

Comment OCR un document contenant à la fois des notes manuscrites et du texte dactylographié

Vous numérisez un formulaire papier que quelqu’un a rempli à la main. Le texte imprimé sur le formulaire est clair. Les réponses manuscrites dans les cases sont désordonnées mais lisibles pour un humain. Vous exécutez l'OCR sur l'analyse, dans l'espoir de rendre le formulaire consultable et les réponses manuscrites extractibles sous forme de texte. Le résultat OCR du texte imprimé est presque parfait. Le résultat de l’OCR pour l’écriture manuscrite est du charabia. Le moteur de reconnaissance, entraîné sur les polices imprimées, ne peut pas donner de sens aux formes variables et irrégulières de l’écriture humaine.

Les documents contenant à la fois du texte dactylographié et manuscrit présentent un double défi pour les moteurs OCR PDF. Le texte imprimé nécessite une OCR standard, qui fonctionne bien. L'écriture manuscrite nécessite une reconnaissance d'écriture manuscrite spécialisée, qui est moins précise et nécessite des paramètres différents. La gestion des deux dans un seul document nécessite une stratégie qui traite chaque type de contenu de manière appropriée.

How to OCR a Document That Contains Both Handwritten Notes and Typed Text Together

Pourquoi l'écriture manuscrite est tellement plus difficile pour les moteurs OCR

L'OCR du texte imprimé fonctionne en faisant correspondre les formes de caractères avec des modèles de police connus. La lettre "a" dans Times New Roman en 12 points, il semble presque identique à chaque fois qu'il apparaît. Le moteur OCR stocke un modèle de l'apparence des lettres Times New Roman et compare ce modèle. L’écriture manuscrite n’a pas de tel modèle. Le « un » de chaque personne. semble différent. Même le « a » de la même personne varie d'une occurrence à l'autre en fonction des lettres environnantes, de la vitesse d'écriture, de l'angle du stylo et de la fatigue. Il n’y a pas de modèle fixe auquel correspondre.

La reconnaissance de l'écriture manuscrite utilise des modèles d'apprentissage automatique formés sur des milliers ou des millions d'échantillons d'écriture manuscrite. Ces modèles apprennent les modèles statistiques de variation des lettres manuscrites et peuvent reconnaître les caractères même lorsqu'ils s'écartent considérablement d'un modèle unique. La précision de la reconnaissance de l’écriture manuscrite s’est considérablement améliorée grâce à l’apprentissage profond, mais elle est encore loin derrière la reconnaissance des textes imprimés. Une étude de référence réalisée en 2025 par la PDF Association a révélé une précision OCR des textes imprimés supérieure à 97 % sur des numérisations propres. La précision de la reconnaissance de l'écriture manuscrite sur le même benchmark était d'environ 80 % à 85 %, ce qui signifie qu'environ un mot manuscrit sur cinq à six contient une erreur (PDF Association, « OCR Accuracy Benchmark Report », 2025).

WukongPDF

Essayez l'OCR PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Stratégies d'OCR sur des documents mixtes dactylographiés et manuscrits

La stratégie la plus efficace consiste à séparer le document en régions tapées et en régions manuscrites et à traiter chacune avec le moteur de reconnaissance approprié. Cette séparation peut être effectuée manuellement en recadrant ou en masquant le document en sections, ou automatiquement par un moteur de reconnaissance qui détecte le type de contenu par région.

L'outil OCR du WukongPDF détecte si chaque zone de texte sur la page est imprimée ou manuscrite et applique le modèle de reconnaissance approprié. Sur un formulaire avec des étiquettes imprimées et des réponses manuscrites, les étiquettes sont reconnues avec le modèle de texte imprimé avec une grande précision. Les réponses manuscrites sont traitées avec le modèle d'écriture manuscrite avec la précision permise par la qualité de l'écriture manuscrite. Le résultat est une seule couche de texte qui combine les deux résultats de reconnaissance.

Amélioration de la précision de l'OCR de l'écriture manuscrite grâce à une meilleure numérisation

La qualité de numérisation a un impact plus important sur la reconnaissance de l’écriture manuscrite que sur la reconnaissance du texte imprimé. Numérisez à 300 DPI minimum. Une résolution plus élevée donne au moteur de reconnaissance plus de pixels par caractère à analyser. Utilisez le mode niveaux de gris ou couleur plutôt que le noir et blanc pur. Les subtiles variations de gris dans un trait manuscrit contiennent des informations sur les formes de lettres que le pur seuil en noir et blanc écarte. Un « e » manuscrit. où la boucle est partiellement remplie peut être reconnaissable en niveaux de gris mais devient une goutte indiscernable lorsqu'elle est seuillée en noir et blanc.

Assurez-vous que l’écriture manuscrite est aussi sombre et cohérente que possible. L’écriture au crayon est plus difficile à reconnaître que celle au stylo car le graphite produit une ligne plus faible et plus variable. L'encre bleue ou noire sur papier blanc produit le meilleur contraste. L'encre rouge, l'encre verte ou le papier coloré réduisent le contraste et la précision. Si vous contrôlez le processus de remplissage des formulaires, précisez que les formulaires doivent être remplis à l'encre noire pour de meilleurs résultats OCR. Cette petite instruction sur le formulaire lui-même peut améliorer la précision de l’extraction des données en aval de 10 à 15 points de pourcentage.

Révision et correction de la sortie OCR de l'écriture manuscrite

Après l'OCR, la couche de texte Scanned PDF aura des erreurs concentrées dans les régions manuscrites. Le texte imprimé sera presque parfait. Concentrez votre révision sur les réponses manuscrites. Ouvrez le PDF et recherchez les erreurs OCR d’écriture manuscrite courantes. Le chiffre 1 est souvent reconnu comme la lettre l. Le chiffre 0 est souvent reconnu comme la lettre O. La combinaison de lettres "th" est souvent reconnue comme la lettre O. est souvent reconnu comme "+h" parce que la barre transversale du t se fond dans le h.

Pour les données de formulaire qui doivent être extraites dans une base de données ou une feuille de calcul, la révision manuelle des champs manuscrits est essentielle. Le moteur de reconnaissance fournit une meilleure estimation. Un humain doit vérifier cette supposition par rapport à l’écriture originale. C'est dans cette étape de vérification que le gain de temps de l'OCR est partiellement compensé par la nécessité d'un contrôle qualité humain. Les économies nettes dépendent du volume. Pour 10 formulaires, la saisie manuelle des données peut être plus rapide que l'OCR plus la révision. Pour 500 formulaires, la révision OCR plus est considérablement plus rapide car l’étape de révision est limitée aux champs pour lesquels la confiance OCR est faible. La sortie OCR du WukongPDF inclut un score de confiance pour chaque bloc de texte reconnu, vous permettant de trier par confiance et d'examiner uniquement les résultats de faible confiance.

Pour les formulaires qui seront traités en grand nombre, tels que les formulaires d'admission médicale, les réclamations d'assurance ou les demandes gouvernementales, la conception du formulaire elle-même peut améliorer la précision de l'OCR de l'écriture manuscrite. Concevez le formulaire avec des zones de caractères séparées, une zone par lettre, plutôt qu'une seule longue ligne pour un nom ou une adresse. Les cases de caractères individuelles obligent l'écrivain à séparer leurs lettres, ce qui améliore considérablement la précision de la reconnaissance, car le moteur OCR peut isoler chaque caractère avant de tenter la reconnaissance. C’est le même principe utilisé par les formulaires fiscaux et les documents d’immigration du monde entier. Les cases sont légèrement gênantes pour la personne qui remplit le formulaire, mais elles permettent une extraction automatisée des données à grande échelle, ce qui est le compromis qu'exige le traitement de gros volumes de formulaires.

Un point de contrôle qualité pratique après l'OCR sur des documents mixtes : lancez une recherche des modèles d'erreur OCR courants qui indiquent que le moteur a confondu l'écriture manuscrite avec le texte imprimé. Recherchez "cl" et vérifiez qu'il n'était pas censé être "d". Recherchez "0" et vérifiez que chaque instance est bien un zéro et non un O majuscule. Recherchez « 1 » dans le champ « 1 ». et vérifiez qu'il s'agit d'un un et non d'un L minuscule ou d'un I majuscule. Ces trois recherches détectent la majorité des erreurs OCR au niveau des caractères dans la reconnaissance imprimée et manuscrite. Corrigez les erreurs trouvées, puis lancez une recherche supplémentaire pour les noms, numéros ou dates spécifiques essentiels à l'objectif du document. Un formulaire dans lequel les instructions imprimées comportent une faute de frappe est ennuyeux. Un formulaire sur lequel la posologie manuscrite du médicament est erronée est dangereux.

WukongPDF

Essayez l'OCR PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →