Others

Pourquoi la conversion d'un PDF en Excel produit-elle parfois des cellules vides là où les données devraient se trouver

Vous convertissez un tableau PDF en Excel, ouvrez le résultat et regardez une feuille de calcul avec des cellules vides là où devraient se trouver les nombres. Le PDF original contenait clairement des données à ces positions. Vous pouvez le voir sur l'écran. Mais le fichier Excel présentait des lacunes, des valeurs manquantes ou des lignes entières réduites à des espaces vides. C'est l'un des résultats les plus frustrants de la conversion PDF vers Excel, car il n'est pas évident de savoir ce qui n'a pas fonctionné ni comment y remédier.

La cause première n’est généralement pas l’outil de conversion lui-même. Il s'agit d'une inadéquation entre la manière dont le PDF stocke les données de son tableau et ce que le moteur de conversion s'attend à trouver. Comprendre les raisons spécifiques des cellules vides rend le problème résoluble plutôt que mystérieux.

Why Does Converting a PDF to Excel Sometimes Produce Blank Cells Where Data Should Be

Le PDF contient une image d'un tableau, pas des données réelles du tableau

Il s’agit de la raison la plus courante pour laquelle des cellules sont vides après une conversion PDF vers Excel. Si le PDF a été créé à partir d'une numérisation, d'une capture d'écran ou d'une impression au format PDF à partir d'une application qui a pixellisé sa sortie, le tableau que vous voyez sur la page est une image plate. Il n'y a pas de cellules de données sous-jacentes, pas de structures de lignes et de colonnes, ni de flux de texte qu'un outil de conversion peut analyser.

Lorsqu'un outil de conversion rencontre un tableau basé sur une image, il a deux choix : exécuter l'OCR pour essayer de reconnaître le texte et de reconstruire la structure du tableau, ou ignorer complètement l'image car il ne peut pas l'analyser. De nombreux convertisseurs de base PDF vers Excel empruntent la deuxième voie. Ils extraient les données réelles qu’ils peuvent trouver et laissent de côté le contenu basé sur des images. Le résultat est une feuille de calcul avec des cellules vides là où se trouvait l'image du tableau. Le correctif consiste à utiliser un PDF Converter qui inclut l'OCR, comme le WukongPDF, qui reconnaît le texte dans les images et reconstruit la grille du tableau. La conversion ne sera pas parfaite au pixel près, mais les données apparaîtront dans des cellules plutôt que de disparaître dans un espace vide.

WukongPDF

Essayez PDF vers Excel

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

La disposition du tableau utilise des cellules complexes fusionnées ou imbriquées

Même lorsqu'un tableau est constitué de données textuelles réelles, la façon dont l'application d'origine l'a structuré peut vaincre un moteur de conversion. Des applications telles que Microsoft Excel, Google Sheets et les logiciels de reporting créent souvent des tableaux avec des cellules fusionnées, dans lesquels un seul en-tête s'étend sur plusieurs colonnes, des tableaux imbriqués, dans lesquels une cellule contient un autre mini-tableau, ou des en-têtes à plusieurs niveaux avec des regroupements de colonnes parent et enfant.

Le PDF n'a pas été conçu pour représenter les structures de tableaux. Il a été conçu pour placer des caractères à des coordonnées x,y spécifiques sur une page. Un PDF stocke un tableau sous forme de milliers de commandes de positionnement de caractères indépendantes. Le moteur de conversion doit effectuer une rétro-ingénierie de la structure de la table en analysant la disposition spatiale de ces caractères. Les cellules fusionnées compliquent énormément cette analyse. Ce qui ressemble à une cellule logique pour un lecteur humain apparaît au moteur de conversion comme un texte s'étendant sur une zone ambiguë qui peut être une cellule large ou plusieurs cellules étroites. Lorsque le moteur se trompe, les données se retrouvent dans les mauvaises colonnes, réparties dans les cellules ou omises parce que le moteur n'a pas pu résoudre l'ambiguïté.

Il n’existe pas de solution universelle parfaite à ce problème, car la structure originale du tableau a été perdue lors de la conversion du document au format PDF. Si vous avez accès au fichier original, l'exportation directement depuis Excel ou Google Sheets au format .xlsx, plutôt que la conversion PDF vers Excel, préserve parfaitement la structure du tableau. Si le PDF est votre seule copie, un outil de conversion avec détection avancée des tableaux, qui vous permet de définir manuellement les limites des colonnes ou d'ajuster les zones de tableau détectées, vous offre les meilleures chances de récupérer les données proprement.

Informations de délimiteur incohérentes ou manquantes

Les moteurs de conversion détectent les limites des colonnes en analysant les espaces horizontaux entre les groupes de caractères. Si deux colonnes sont très rapprochées, le moteur peut les fusionner en une seule. Si une colonne contient des cellules avec des quantités de texte très variables, le moteur peut diviser la colonne en plusieurs colonnes aux points les plus étroits. Les deux erreurs produisent des cellules vides, soit parce que les données qui devraient remplir deux colonnes distinctes ont été entassées dans l'une, laissant l'autre colonne vide, soit parce que la colonne fantôme brise les cellules créées là où aucune donnée n'existe.

Les tableaux contenant des cellules vides dans le document original créent une variante particulièrement délicate de ce problème. Si le tableau d'origine contient des cellules intentionnellement vides, le moteur de conversion détecte des écarts plus importants et peut décaler sa détection des limites de colonnes, désalignant ainsi chaque ligne en dessous de l'écart. Une seule cellule vide dans la ligne 3 peut perturber l'ensemble du mappage des colonnes des lignes 4 à 50, produisant une cascade de données mal alignées qui ressemble à un échec de conversion mais constitue en réalité une ambiguïté structurelle dans le document source.

Comment minimiser les cellules vides lors de votre prochaine conversion

Plusieurs ajustements pratiques améliorent considérablement votre taux de réussite de conversion. Tout d’abord, utilisez toujours un outil prenant en charge la détection de la structure des tableaux plutôt qu’un convertisseur PDF en texte générique. Les outils conçus spécifiquement pour Extraire des données PDF utilisent des algorithmes entraînés sur la disposition des tableaux et produisent des résultats nettement meilleurs que l'extraction de texte à usage général. La conversion PDF vers Excel de WukongPDF inclut la détection de la structure des tableaux qui gère les mises en page courantes, notamment les cellules fusionnées, les en-têtes à plusieurs niveaux et les tableaux avec des types de données mixtes.

Deuxièmement, vérifiez le PDF avant de le convertir. Si vous pouvez sélectionner et copier des cellules ou des colonnes de texte individuelles du tableau à l'aide de votre visionneuse PDF, le tableau est constitué de données textuelles réelles et sera raisonnablement bien converti. Si vous cliquez sur le tableau et que l'ensemble est mis en évidence comme un seul bloc, ou si la sélection de texte ne fonctionne pas du tout, le tableau est une image et nécessite une conversion basée sur l'OCR.

Troisièmement, soyez prêt à nettoyer la sortie. Même les meilleurs outils de conversion produisent des feuilles de calcul qui nécessitent quelques ajustements manuels. Vérifiez les premières lignes de chaque colonne pour vérifier que les valeurs figurent dans les bonnes colonnes. Recherchez les colonnes entièrement vides lorsque vous pouvez voir les données dans le PDF d'origine à cet endroit. Ce sont des signes indiquant que l'outil a mal identifié les limites des colonnes. La correction du mappage des colonnes dans les premières lignes entraîne souvent des corrections en cascade dans le reste de la feuille de calcul.

Que faire lorsque la conversion continue de produire des cellules vides

Si vous avez essayé plusieurs outils et que la conversion produit systématiquement des cellules vides à des positions spécifiques, le problème vient probablement du PDF lui-même et non des outils. Les données du tableau peuvent être stockées sous forme de graphique vectoriel, dans lequel les nombres sont dessinés sous forme de formes plutôt que codés sous forme de caractères de texte. Cela se produit le plus souvent avec des fichiers PDF générés par des logiciels de CAO plus anciens, des outils de reporting spécialisés ou certains systèmes de planification des ressources de l'entreprise qui restituent la sortie au format PDF via des commandes de dessin graphique plutôt que par le placement de texte. Dans ces cas, l'OCR est la seule option, et vous devez vous attendre à examiner et corriger manuellement le résultat, car l'OCR des données tabulaires vectorielles est intrinsèquement sujette aux erreurs.

La solution de rechange la plus productive en cas d'échec répété de la conversion automatisée consiste à prendre une capture d'écran du tableau en haute résolution, à l'exécuter via un outil OCR dédié spécialisé dans la reconnaissance de tableaux et à l'exporter vers Excel. Ce processus en deux étapes, capture d'écran puis OCR, contourne entièrement la représentation interne des données du PDF et traite le tableau comme une image pure, ce qui, ironiquement, peut être plus fiable pour certains types de PDF mal formés que d'essayer d'analyser les données texte corrompues ou non standard.

WukongPDF

Essayez PDF vers Excel

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →