Les moteurs OCR standard reposent sur une hypothèse fondamentale : le texte s'exécute horizontalement de gauche à droite sur la page. Cette hypothèse fonctionne pour l'anglais, l'espagnol, le français, l'allemand et la plupart des langues européennes. Cela échoue complètement pour le texte japonais placé verticalement dans des colonnes traditionnelles, pour les signes chinois où les caractères s'empilent de haut en bas, et pour les documents arabes et hébreux où le texte circule de droite à gauche. L'exécution de l'OCR standard sur ces documents produit une sortie dans laquelle les caractères sont reconnus individuellement mais assemblés dans le mauvais ordre, rendant le résultat inutile.
La capacité des moteurs OCR PDF à gérer des instructions de texte non standard s'est considérablement améliorée avec la dernière génération de systèmes de reconnaissance basés sur l'IA. Ces moteurs détectent l'orientation du texte avant de tenter la reconnaissance, identifient le sens de lecture et reconstruisent l'ordre logique de lecture quelle que soit la disposition visuelle. Pour les documents avec des directions de texte mixtes, comme un article japonais comprenant des citations horizontales en anglais, le moteur change de mode au milieu de la page.

Comment les moteurs OCR détectent et gèrent la direction du texte
Les moteurs OCR modernes commencent par une étape d'analyse de la mise en page qui identifie les zones de texte, détermine leur orientation et les classe par sens de lecture. Pour le texte horizontal, le moteur détecte la ligne de base et regroupe les caractères le long de celle-ci. Pour le texte vertical, le moteur détecte l'axe vertical et regroupe les caractères en colonnes. Pour le texte de droite à gauche, le moteur identifie le jeu de caractères dominant et inverse l'ordre des mots par défaut de gauche à droite.
La détection de la direction du texte repose sur plusieurs signaux. La présence de plages de caractères Unicode spécifiques indique des langues probables et leurs directions de texte typiques. La disposition spatiale des caractères détectés, qu'ils forment des lignes horizontales ou des colonnes verticales, fournit une preuve de disposition. Le rapport hauteur/largeur des cadres de délimitation des caractères fournit un troisième signal : les caractères latins sont généralement plus larges que hauts, tandis que les caractères CJK sont à peu près carrés et les caractères arabes se connectent horizontalement de manière à révéler le sens de lecture.
Les moteurs OCR les plus fiables combinent les trois types de signaux. Un document contenant à la fois l’écriture arabe, ce qui implique une lecture de droite à gauche, et l’écriture latine, ce qui implique une lecture de gauche à droite, nécessite que le moteur analyse chaque région de texte indépendamment. Un pipeline Extract PDF Data correctement configuré pour les documents multilingues inclut la détection de direction par région plutôt que d'appliquer une seule direction à la page entière.
Chaque système d'écriture nécessite une configuration OCR fondamentalement différente.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Paramètres OCR pour le texte vertical en japonais, chinois et coréen
Le texte vertical japonais, appelé tategaki, est le système d'écriture vertical le plus courant dans l'usage moderne. Il apparaît dans les romans, les journaux, les documents traditionnels et la correspondance formelle. En japonais vertical, les caractères se lisent de haut en bas, les colonnes progressant de droite à gauche sur la page. Les nombres et les mots latins intégrés dans le texte japonais vertical peuvent être pivotés ou placés horizontalement dans le flux vertical.
Pour OCR du texte japonais vertical, sélectionnez un moteur de reconnaissance qui prend explicitement en charge le tategaki. Les moteurs OCR à usage général peuvent détecter les caractères correctement mais les afficher dans un ordre horizontal de gauche à droite, produisant ainsi des déchets. Les moteurs OCR spécifiques au japonais comprennent l'ordre de lecture basé sur les colonnes et produisent un texte qui peut être lu naturellement. Tesseract, le moteur OCR open source, a ajouté une prise en charge verticale japonaise améliorée dans la version 5, et plusieurs moteurs commerciaux le proposent désormais.
Pour le texte vertical chinois, qui apparaît dans les publications traditionnelles, la calligraphie et certains documents formels, le défi de reconnaissance est similaire mais le jeu de caractères est plus large. Le chinois simplifié utilise environ 7 000 caractères couramment utilisés, tandis que le chinois traditionnel en utilise plus de 13 000. Le moteur OCR doit non seulement détecter la disposition verticale, mais également distinguer les caractères visuellement similaires qui ne diffèrent que par le détail des traits.
Le texte vertical coréen est rare dans les documents modernes mais apparaît dans les textes historiques et certaines publications traditionnelles. L'alphabet coréen, Hangul, assemble des lettres individuelles en blocs de syllabes et, en écriture verticale, ces blocs sont empilés de haut en bas. Les moteurs OCR qui gèrent le texte vertical coréen doivent reconnaître la structure des blocs de syllabes ainsi que les composants de lettres individuels dans chaque bloc.
Paramètres OCR pour le texte de droite à gauche en arabe, hébreu et persan
L'OCR arabe présente des défis uniques au-delà de la direction du texte. L'arabe est une écriture cursive dans laquelle la plupart des lettres se connectent à leurs voisines et la forme de la lettre change en fonction de sa position dans le mot : initiale, médiane, finale ou isolée. Le moteur OCR doit reconnaître ces formes contextuelles et les mapper au caractère abstrait correct. Les connexions manquées ou les fausses connexions entre les lettres produisent des erreurs de reconnaissance spécifiques aux écritures cursives.
Lors de la sélection de l'OCR hébreu, l'écriture n'est pas cursive mais inclut des points de voyelle, appelés niqqud, qui apparaissent sous forme de points et de tirets au-dessus, en dessous ou à l'intérieur des lettres. Ces marques de voyelles sont petites, généralement de 2 à 4 pixels dans une image numérisée, et se perdent facilement lors de la binarisation. Un moteur OCR qui ne gère pas explicitement le niqqud reconnaîtra correctement les consonnes mais supprimera les marques de voyelles, produisant ainsi un texte qu'un lecteur humain peut comprendre mais qui est techniquement incomplet.
Le persan et l'ourdou utilisent des versions étendues de l'écriture arabe avec des caractères supplémentaires. Un moteur OCR formé uniquement sur l'arabe manquera ces caractères supplémentaires ou les reconnaîtra à tort comme des lettres arabes similaires. Lorsque vous sélectionnez un moteur OCR pour ces langues, vérifiez qu'il répertorie spécifiquement la prise en charge de la langue exacte et de la variante d'écriture utilisée par votre document, et pas seulement de l'écriture arabe en général.
Gestion des documents à sens mixte
De nombreux documents du monde réel mélangent plusieurs directions de texte sur la même page. Un document technique japonais peut comporter un corps de texte japonais vertical, des légendes de figures horizontales en anglais et des équations mathématiques qui suivent leurs propres règles de mise en page. Une lettre commerciale en arabe peut inclure un nom de société en anglais et un bloc d'adresse au format de gauche à droite au-dessus du corps du texte de droite à gauche.
Pour les documents à sens mixte, l’étape de prétraitement OCR est essentielle. Le document doit être segmenté en régions de texte, et chaque région doit être classée indépendamment pour l'orientation du texte avant le début de la reconnaissance. La sélection manuelle de régions produit souvent de meilleurs résultats que la segmentation automatique pour les mises en page complexes. Dessinez des cadres de délimitation autour de chaque zone de texte et attribuez la langue et la direction correctes à chaque cadre.
Après l'OCR, vérifiez le résultat en vérifiant le texte qui traverse les limites de direction. Une erreur courante dans l'OCR à sens mixte consiste à mal définir la limite entre deux régions de texte, de sorte que le dernier mot d'une région de gauche à droite soit ajouté au début d'une région de droite à gauche, ou vice versa. La vérification ponctuelle de ces zones limites détecte les erreurs de segmentation de mise en page qui autrement produiraient un résultat déroutant.
Traitement post-OCR pour les instructions textuelles non standard
Une fois l'OCR terminée, le texte reconnu devra peut-être être réorganisé pour produire un ordre de lecture naturel. Certains moteurs OCR génèrent du texte japonais vertical dans l'ordre dans lequel il a été reconnu, de haut en bas dans chaque colonne, colonne par colonne de gauche à droite. Cet ordre ne correspond pas à l’ordre de lecture original, qui est colonne par colonne de droite à gauche. Une étape de post-traitement qui réorganise les colonnes produit la séquence de lecture correcte.
Pour les documents dont le contenu PDF numérisé comprend du texte bidirectionnel, de l'arabe avec des termes anglais intégrés, l'algorithme bidirectionnel Unicode spécifie comment déterminer l'ordre d'affichage. La sortie OCR doit inclure des caractères de contrôle bidirectionnels Unicode ou suivre l'algorithme afin que le texte s'affiche correctement lorsqu'il est collé dans des applications prenant en charge le texte bidirectionnel.
Le WukongPDF fournit un traitement OCR via le navigateur pour les PDF numérisés, avec des options de sélection de langue qui incluent la prise en charge des principaux systèmes d'écriture de droite à gauche et verticale. Tester l'OCR sur un exemple de page avant de traiter le document complet vous permet de vérifier que le sens du texte est correctement géré.
Pour les documents contenant du texte vertical et horizontal sur la même page, comme une mise en page de magazine japonais où l'article principal est vertical mais les légendes et les barres latérales sont horizontales, le zonage manuel produit les résultats OCR les plus précis. Dessinez des zones de reconnaissance distinctes pour les régions verticales et horizontales, attribuez la direction correcte du texte à chacune et exécutez l'OCR sur le document zoné. Le temps supplémentaire consacré au zonage est récompensé en termes de précision de reconnaissance.
Lors du traitement de documents historiques avec des mises en page de texte non standard, préparez-vous à ce que la précision de l'OCR soit inférieure à celle des documents imprimés modernes. Les polices historiques, l’impression inégale, le papier vieilli avec décoloration et les variantes de caractères non standard réduisent tous la confiance en matière de reconnaissance. Pour les travaux scientifiques ou archivistiques, traitez la sortie OCR comme un point de départ pour une transcription manuelle plutôt que comme un produit fini.
Certains moteurs OCR prennent en charge un mode de formation dans lequel vous fournissez des exemples de polices ou de styles d'écriture manuscrites spécifiques utilisés dans votre document. Entraîner le moteur sur quelques pages représentatives améliore la précision de la reconnaissance sur l’ensemble du document. Cette approche est particulièrement utile pour les documents imprimés dans des polices inhabituelles ou pour les collections de documents du même éditeur où la typographie est cohérente sur plusieurs volumes.
Une fois l'OCR terminée sur un document de droite à gauche, vérifiez que le sens du texte est correct en copiant quelques phrases de la sortie et en les collant dans une application prenant en charge le texte bidirectionnel, telle que Microsoft Word ou Google Docs. Si le texte apparaît dans l'ordre inverse, le moteur OCR n'a pas appliqué correctement le sens de droite à gauche et la sortie doit être retraitée avec des paramètres de sens corrigés.
Le temps investi dans la configuration des paramètres OCR corrects pour les instructions de texte non standard est immédiatement récompensé en termes de précision de reconnaissance. Un document qui nécessite 30 minutes de correction manuelle après une OCR médiocre peut nécessiter seulement 5 minutes de nettoyage après une OCR correctement configurée.
| Système d'écriture | Orientation | Exigence du moteur OCR | Défi clé |
|---|---|---|---|
| Japonais (tategaki) | Colonnes de haut en bas et de droite à gauche | Moteur avec prise en charge explicite du tategaki | Anglais horizontal mixte en flux vertical |
| Chinois (traditionnel) | Colonnes verticales, de droite à gauche | Grand jeu de caractères (13 000+) | Personnages visuellement similaires |
| arabe | Connexion cursive de droite à gauche | Moteur de script arabe avec formes positionnelles | Formes de lettres contextuelles ; signes diacritiques |
| hébreu | De droite à gauche, avec niqqud | Moteur de script hébreu avec prise en charge des voyelles | Petites marques de voyelles perdues lors de la binarisation |
| Persan / Ourdou | Arabe étendu de droite à gauche | Moteur spécifique à la langue | Caractères supplémentaires au-delà du jeu arabe |
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
