Tips & Tricks

Comment OCR un document PDF écrit dans une langue que vous ne parlez pas

Recevoir un PDF numérisé rédigé dans une langue que vous ne parlez pas est plus courant que jamais dans le monde des affaires, de la recherche universitaire et de l'examen de documents juridiques. Vous devez extraire le texte, le traduire et comprendre ce que dit le document. Le défi ne consiste pas seulement à exécuter l’OCR sur le fichier. Il exécute l'OCR avec les paramètres de langue corrects afin que le texte extrait soit suffisamment précis pour être traduit. La sélection de la mauvaise langue lors du traitement OCR PDF produit une sortie tronquée qu'aucun moteur de traduction ne peut récupérer.

Les moteurs OCR ne voient pas les lettres. Ils voient des formes et font correspondre ces formes avec des modèles de caractères pour une langue spécifique. Si vous indiquez au moteur OCR que le document est en anglais alors qu'il est en réalité en russe, le moteur mappe les formes cyrilliques aux caractères latins les plus proches qu'il connaît. Le résultat est une chaîne de lettres d’apparence aléatoire qui n’a aucun rapport avec le texte original. Choisir le bon paramètre de langue, ou utiliser la détection automatique lorsqu'elle est disponible, est la décision la plus importante dans l'ensemble du pipeline OCR-traduction.

Les outils PDF to Text et OCR de WukongPDF extraient le texte des documents numérisés à des fins de traduction et d'analyse. En associant la bonne sélection de langue OCR à un service de traduction fiable, vous transformez une numérisation en langue étrangère illisible en un document compréhensible en moins de cinq minutes.

How to OCR a PDF Document Written in a Language You Don't Speak

Étape 1 : Identifier la langue du document

Avant de toucher à un logiciel OCR, identifiez avec certitude la langue du document. Si les métadonnées du document ou le nom de fichier font allusion à la langue, commencez par là. Sinon, ouvrez le PDF et regardez quelques pages. Même sans lire le texte, les repères visuels réduisent considérablement les possibilités. Les familles d'écritures sont distinctes : l'écriture latine est utilisée dans la plupart des langues européennes. Le cyrillique est utilisé pour le russe, l'ukrainien, le bulgare et le serbe. L'écriture arabe couvre l'arabe, le persan et l'ourdou. CJK couvre le chinois, le japonais et le coréen. Devanagari couvre l'hindi, le marathi et le népalais.

Si vous ne parvenez même pas à identifier visuellement la famille de scripts, prenez une capture d'écran d'un paragraphe représentatif et téléchargez-la dans la fonction de traduction d'images de Google Translate ou dans une recherche d'images inversée. Ces outils identifient à la fois le script et le langage spécifique dans la plupart des cas. Savoir que le document est thaïlandais plutôt que laotien, ou coréen plutôt que japonais, fait la différence entre une sortie OCR précise et un bruit de caractères inutile.

WukongPDF

Essayez l'OCR PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Étape 2 : Sélectionnez un outil OCR prenant en charge la langue cible

Tous les outils OCR ne prennent pas en charge toutes les langues. Adobe Acrobat Pro est livré avec des moteurs OCR pour environ 40 langues. Son outil Reconnaître le texte comprend une liste déroulante de sélection de langue dans la boîte de dialogue des paramètres. Tesseract, le moteur OCR open source gratuit géré par Google, prend en charge plus de 100 langues via des fichiers de données linguistiques téléchargeables. L'API Google Cloud Vision offre la couverture linguistique la plus large, avec plus de 200 langues, et inclut la détection automatique des langues en tant que fonctionnalité facultative.

Pour un document rédigé dans une seule langue que vous pouvez identifier, n'importe lequel de ces outils fonctionne tant que vous spécifiez la langue correcte avant d'exécuter l'OCR. Pour un document contenant plusieurs langues, comme un contrat bilingue avec des clauses en anglais et en français, vous avez besoin d'un outil qui prend en charge plusieurs langues simultanément ou qui peut détecter automatiquement paragraphe par paragraphe. Google Cloud Vision et Tesseract, avec les packs de données linguistiques appropriés, gèrent tous deux des documents multilingues, bien que la précision des limites de changement de langue ne soit jamais parfaite.

Étape 3 : Configurer et exécuter l'OCR avec la bonne langue

Dans Adobe Acrobat Pro, ouvrez le PDF numérisé, accédez à Outils, puis Numériser et OCR, et sélectionnez Reconnaître le texte, puis Dans ce fichier. Cliquez sur le bouton Modifier à côté du sélecteur de langue. Dans la boîte de dialogue Reconnaître le texte, choisissez la langue principale correcte dans la liste déroulante. Si le document contient une deuxième langue, cliquez sur le bouton Ajouter une langue et sélectionnez-la également. Acrobat traite les deux langues simultanément. Cliquez sur OK, puis sur Reconnaître le texte. Acrobat exécute la passe OCR et intègre le texte reconnu sous forme de calque invisible derrière l'image numérisée. Le document est désormais consultable.

Dans Tesseract, l'invocation en ligne de commande spécifie la langue avec l'indicateur -l : tesseract input.pdf output -l rus pour le russe, tesseract input.pdf output -l jpn pour le japonais, ou tesseract input.pdf output -l fra+eng pour un document bilingue français-anglais. Installez d'abord les fichiers de données de langue requis ; Tesseract est livré en anglais uniquement par défaut. Pour Google Cloud Vision, l'appel d'API inclut un paramètre languageHints qui accepte un tableau de codes de langue BCP-47. Cloud Vision propose également un mode de détection automatique de la langue qui ne nécessite aucune indication de langue, ce qui en fait l'option la plus simple lorsque vous ne connaissez vraiment pas la langue du document.

Étape 4 : Copier le texte extrait et traduire

Une fois l'OCR terminée, vérifiez la qualité du texte avant de l'envoyer en traduction. Dans Acrobat, ouvrez l’outil Rechercher et recherchez un mot courant que vous reconnaissez dans le document. Si la recherche trouve des correspondances, l'OCR a fonctionné. Sélectionnez un paragraphe du texte extrait, copiez-le et collez-le dans un éditeur de texte brut. Recherchez les erreurs OCR évidentes : symboles répétés, mots interrompus au milieu ou gros blocs de caractères non reconnus. Si plus de 5 % du texte semble corrompu, réexécutez l'OCR avec un paramètre de langue différent ou un paramètre de résolution plus élevé.

Une fois que le texte extrait a passé un contrôle de cohérence visuelle, copiez l'intégralité du texte et collez-le dans un outil de traduction. Google Translate, DeepL ou Microsoft Translator acceptent tous la saisie de texte brut. Pour les documents plus longs, DeepL et Google Translate prennent en charge le téléchargement direct de fichiers PDF consultables, ce qui évite l'étape de copie manuelle. Le résultat de la traduction est suffisamment bon pour la compréhension, la recherche et l’utilisation professionnelle interne. Pour une précision juridique, médicale ou de qualité publication, envoyez le PDF consultable à un traducteur humain professionnel, qui utilisera la couche OCR comme point de départ et corrigera la traduction automatique par rapport aux pages numérisées originales.

Gestion des documents avec des scripts mixtes ou des polices non standard

Les documents qui mélangent des écritures, comme un document de recherche en arabe qui inclut des termes techniques anglais en écriture latine, confondent les moteurs OCR qui n'attendent qu'une seule écriture. Configurez d'abord l'OCR pour le script dominant, puis exécutez une deuxième passe ciblant le script minoritaire sur le même document. Fusionnez les résultats en exportant les deux calques OCR et en les combinant dans un éditeur de texte. La précision sur les passages du script minoritaire sera moindre car le moteur est optimisé pour le script principal.

Les polices non standard, notamment les polices décoratives, les anciennes polices de machine à écrire et les polices cursives de type manuscrit, réduisent la précision de l'OCR, même lorsque la langue correcte est sélectionnée. Prétraitez ces documents en convertissant les pages PDF en images haute résolution à 400 DPI ou plus, en appliquant un filtre de netteté et en augmentant le contraste avant de les insérer dans le moteur OCR. Le prétraitement intégré de Tesseract, activé avec --psm 3 pour la segmentation automatique des pages, gère les variations de police modérées. Pour le texte gravement dégradé ou stylisé, l'API Google Cloud Vision surpasse généralement les moteurs OCR locaux, car ses modèles ont été entraînés sur un plus grand corpus d'échantillons de polices du monde réel.

Outil OCRSupport multilingueAuto-détectionMeilleur pour
Adobe Acrobat Pro40+ languesSélection manuelleDocuments professionnels, haute précision
Tesseract (open source)100+ languesSélection manuelle requiseTraitement par lots, scripting, gratuit
Google Cloud Vision200+ languesDétection automatique disponibleIntégration API, scripts mixtes
Services ROC en ligne10 à 50 languesSélection manuelleOCR rapide pour un seul document

Vérifier l'exactitude avant d'agir sur le contenu traduit

L'OCR suivie de la traduction automatique introduit deux niveaux d'erreurs potentielles : la mauvaise reconnaissance de l'OCR et l'ambiguïté de la traduction. Pour les documents critiques, vérifiez le résultat en demandant à un collègue bilingue ou à un traducteur professionnel de comparer un paragraphe sélectionné au hasard de la traduction avec le PDF original. Une vérification de cinq minutes détecte les échecs catastrophiques, comme un mauvais paramètre de langue qui a produit un texte plausible mais totalement incorrect.

Si vous manipulez régulièrement des PDF numérisés en langues étrangères, créez une liste de contrôle : identifiez la langue, sélectionnez le moteur OCR correspondant, exécutez l'OCR avec le paramètre de langue correct, vérifiez sur place l'exactitude des caractères du texte extrait, traduisez et vérifiez un exemple de paragraphe. Après deux ou trois documents, le flux de travail devient routinier et prend moins de cinq minutes entre l'ouverture du fichier et la lecture du résultat traduit.

Lorsqu'il s'agit de traitement de documents, pour les documents sensibles en matière de sécurité, l'OCR hors ligne évite complètement l'exposition au cloud. Tesseract s'exécute localement sans requêtes réseau après avoir téléchargé une fois les fichiers de données de langue. Adobe Acrobat Pro effectue également l'OCR localement via la fonctionnalité Reconnaître le texte sans se connecter à Document Cloud. Pour les documents confidentiels en langue étrangère tels que les découvertes juridiques ou la correspondance commerciale sensible, l'OCR local associé à la révision de texte hors ligne conserve le contenu du document original dans votre environnement contrôlé.

Quand l'OCR seule ne suffit pas : les services de transcription assistée

Pour les documents pour lesquels la précision de l'OCR est inutilisable en raison d'une dégradation extrême des polices, de textes manuscrits ou de scripts fortement mélangés, les services de transcription assistée fournissent une sortie vérifiée par l'homme. Ces services combinent une première passe OCR machine avec une révision et une correction humaines, généralement facturées par page. Le délai d’exécution varie de quelques heures à quelques jours. Pour un seul document critique dont l’exactitude n’est pas négociable, comme un acte de naissance en langue étrangère ou un dépôt de brevet, le coût de la transcription humaine se justifie par le risque d’agir sur un texte mal reconnu. Exécutez d’abord l’OCR de la machine pour évaluer la qualité. Si plus de 15 % des mots ne sont pas reconnus ou sont manifestement erronés, passez à la transcription assistée plutôt que de passer des heures à corriger manuellement les résultats de la machine.

WukongPDF

Essayez l'OCR PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →