Tips & Tricks

Comment OCR un PDF et exporter le texte reconnu sous forme de fichier Markdown

Vous OCR un PDF et le texte reconnu apparaît dans une zone de texte à l'intérieur de votre éditeur PDF. Vous pouvez le lire. Vous pouvez le copier et le coller. Mais ce que vous voulez en réalité, c'est le texte d'un fichier Markdown, avec des titres formatés sous forme de hachages, des listes sous forme d'astérisques, des liens sous forme de paires crochets-parenthèses et des paragraphes séparés par des lignes vides. Markdown est la lingua franca des développeurs, des rédacteurs techniques, des blogueurs et de tous ceux qui ont besoin d'un texte clair et portable pouvant être déposé dans un générateur de site statique, une application de prise de notes ou un référentiel de code.

Passer d'un PDF numérisé à un fichier Markdown s'effectue en deux étapes : l'OCR reconnaît le texte, puis une étape de formatage convertit ce texte reconnu en syntaxe Markdown. Chaque étape comporte des choix d'outils qui affectent la qualité du résultat final.

How to OCR a PDF and Export the Recognized Text as a Markdown File

Étape 1 : OCR le PDF pour extraire le texte reconnu

L’étape OCR est la même que pour rendre n’importe quel PDF consultable. Utilisez un outil OCR PDF pour traiter les pages numérisées. L'outil ajoute un calque de texte à chaque page. Pour l'exportation Markdown, vous souhaitez que la sortie OCR soit dans un format qui préserve autant d'informations structurelles que possible : quel texte est un titre, quel texte est le corps, quel texte fait partie d'une liste ou d'un tableau. Les moteurs OCR standard génèrent du texte brut, qui perd toutes les informations structurelles. Un titre et un corps de paragraphe deviennent des blocs de texte indiscernables séparés par des sauts de ligne.

Pour de meilleurs résultats, utilisez un moteur OCR prenant en charge l’extraction de texte tenant compte de la mise en page. Ces moteurs analysent la disposition spatiale du texte sur la page et peuvent distinguer les titres, le corps du texte, les légendes et les notes de bas de page en fonction de la taille de la police, de la position et de la proximité avec d'autres éléments. Plus le moteur OCR capture d'informations structurelles, plus la conversion Markdown sera propre. La fonctionnalité Exporter vers d'Adobe Acrobat Pro comprend une fonction « Texte avec mise en forme » option qui préserve certains indices structurels. Le moteur OCR préserve les métadonnées de taille de police et de position que les outils de conversion en aval peuvent utiliser pour déduire les niveaux de titre et les sauts de paragraphe.

WukongPDF

Essayez l'OCR PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Étape 2 : Convertir le texte reconnu en Markdown

Une fois que le PDF comporte une couche de texte, la conversion en Markdown peut suivre plusieurs chemins. Le plus simple est une exportation directe depuis un éditeur PDF prenant en charge Markdown comme format de sortie. Les options d'exportation du WukongPDF incluent Markdown comme format cible lorsque le PDF a été traité par OCR. Sélectionnez Markdown comme format de sortie et l'outil génère un fichier .md avec le texte reconnu formaté selon les conventions Markdown : les lignes commençant par des polices plus grandes deviennent des en-têtes avec préfixe de hachage, les lignes en retrait deviennent des éléments de liste et les paragraphes normaux sont séparés par des lignes vides.

Si une exportation Markdown directe n'est pas disponible, le pipeline consiste à : exporter le texte reconnu vers un format de texte enrichi qui préserve le formatage, tel que RTF ou HTML, puis convertir ce format intermédiaire en Markdown à l'aide d'un outil de conversion. Pandoc, le convertisseur universel de documents, gère bien ce pipeline. Exportez le texte du PDF au format HTML, puis exécutez : pandoc input.html -f html -t markdown -o output.md. Pandoc traduit les balises de titre HTML en hachages Markdown, les balises de liste HTML en marqueurs de liste Markdown et les balises de lien HTML en syntaxe de lien Markdown. La qualité de la sortie dépend de la qualité de l'export HTML à partir du PDF. Si l'exportation PDF produit du HTML propre et bien structuré, Pandoc produit du Markdown propre. Si l'exportation produit du HTML désordonné avec des styles en ligne et des balises non sémantiques, le Markdown sera en conséquence désordonné.

Nettoyage des erreurs OCR dans la sortie Markdown

Les erreurs OCR dans le texte reconnu sont transmises sans modification à la sortie Markdown. Les erreurs courantes incluent des caractères confus tels que "cl" et "cl". reconnu comme "d", "rn" reconnu comme "m", et "1" reconnu comme "l", en particulier dans les tailles de police plus petites ou dans les numérisations de moindre qualité. Une révision du fichier Markdown pour détecter ces erreurs est essentielle si le texte doit être publié ou partagé.

La plupart des éditeurs de code et des éditeurs Markdown incluent une fonctionnalité de vérification orthographique qui met en évidence les mots non reconnus, ce qui facilite la détection des erreurs OCR. Parcourez les mots surlignés et corrigez-les par rapport au PDF original. Portez une attention particulière aux noms propres, aux termes techniques et aux chiffres, qui sont les plus susceptibles d'être mal reconnus et aussi les plus préjudiciables s'ils sont mal publiés. Un rapport financier dans lequel l'OCR a reconnu « 123 000 $ » comme "128 000 $" contient une erreur matérielle que la vérification orthographique automatisée ne détectera pas car les deux sont des formats numériques valides. La vérification manuelle des valeurs critiques par rapport au document source est la seule garantie fiable.

Préserver les images et les tableaux lors de la conversion Markdown

Markdown gère les images en référençant des fichiers externes : ![alt text](path/to/image.png). Lors de la conversion d'un PDF en Markdown, les images du PDF doivent être extraites et enregistrées en tant que fichiers séparés, et des liens de référence insérés dans le texte Markdown aux positions correctes. L'exportation PDF vers Markdown de WukongPDF inclut l'extraction d'images dans le cadre de la conversion. Chaque image du PDF est enregistrée sous forme de fichier PNG ou JPEG dans un dossier à côté du fichier Markdown, et le texte Markdown contient les balises de référence d'image appropriées.

Les tableaux sont plus difficiles. Les tableaux Markdown utilisent une syntaxe en barres et tirets facile à lire pour les humains, mais difficile à générer pour les convertisseurs automatisés à partir des données de tableaux PDF, car les PDF ne stockent pas les tableaux en tant que données structurées. Ils stockent les caractères à des positions. Le convertisseur doit procéder à une ingénierie inverse de la grille du tableau à partir des positions des caractères, ce qui produit des résultats imparfaits pour les tableaux complexes avec des cellules fusionnées, un contenu de cellules multilignes ou des largeurs de colonnes inégales. Les tableaux de grille simples avec des colonnes uniformes et un contenu de cellule sur une seule ligne sont convertis de manière fiable. Les tableaux complexes peuvent nécessiter une restructuration manuelle dans la sortie Markdown. Si un tableau se convertit mal, envisagez de l'exporter sous forme d'image distincte plutôt que sous forme de syntaxe de tableau Markdown. Une image clairement lisible d'un tableau complexe est plus utile qu'un Markdown tronqué qui s'affiche sous forme de colonnes mal alignées.

Utilisation du fichier Markdown

Le fichier Markdown résultant s'ouvre dans n'importe quel éditeur de texte, application de prise de notes comme Obsidian ou Notion, générateur de site statique comme Hugo ou Jekyll, ou éditeur de code comme VS Code. À partir de Markdown, vous pouvez générer du HTML pour un site Web, du PDF pour la distribution, du DOCX pour le traitement de texte ou simplement conserver le texte dans un format de texte brut consultable et contrôlable par version qui sera lisible pendant des décennies.

La valeur de ce pipeline est plus évidente avec les documents d’archives. Les anciens rapports numérisés, les documents historiques, les publications épuisées deviennent tous non seulement consultables mais transformables. Un rapport numérisé de 2005 devient un fichier Markdown qui peut être modifié dans un éditeur moderne, converti en site Web, cité dans un article de blog ou analysé par programme. Le Format PDF qui enfermait le texte dans une image pendant 20 ans ne contraint plus la manière dont le contenu peut être utilisé.

WukongPDF

Essayez l'OCR PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →