Others

Pourquoi la conversion d'un tableau PDF en Excel fusionne-t-elle parfois les colonnes numériques adjacentes en une seule cellule

Vous convertissez un tableau PDF proprement formaté en Excel, ouvrez la sortie et constatez que ce qui était deux colonnes de nombres distinctes dans le PDF est devenue une seule colonne avec des valeurs telles que « 1 2503 780 ». dans chaque cellule. Deux valeurs numériques de colonnes adjacentes ont été concaténées en une seule chaîne de texte et les données sont désormais inutiles pour le calcul. Il s'agit de la plainte la plus courante concernant la conversion PDF en Excel, et cela se produit parce que le convertisseur a mal évalué où se termine une colonne et où commence la suivante.

La détection des limites de colonnes dans les tableaux PDF est un problème fondamentalement difficile car les PDF ne contiennent pas de structure de tableau. Un tableau PDF est simplement du texte positionné à des coordonnées spécifiques, avec des lignes horizontales et verticales tracées à proximité du texte. Le convertisseur doit déduire les limites des colonnes à partir de l'espacement entre les blocs de texte, de l'alignement du texte sur les lignes ou de la position des lignes tracées. Lorsque les colonnes numériques sont étroites et que les nombres des colonnes adjacentes sont rapprochés, le convertisseur peut les fusionner en une seule colonne plus large, lisant les deux nombres comme une seule chaîne de texte. Le convertisseur voit une séquence horizontale continue de nombres et ne peut pas déterminer où se trouvait le saut de colonne dans la disposition d'origine.

Why Does Converting a PDF Table to Excel Sometimes Merge Adjacent Numeric Columns Into a Single Cell

Pourquoi les colonnes numériques adjacentes sont particulièrement vulnérables à la fusion

Les colonnes numériques des tableaux PDF ont tendance à être étroites car les nombres sont courts. Une colonne de valeurs monétaires peut contenir des entrées telles que « 1 250,00 » et « 1 250,00 ». ou "42,50", dépassant rarement 12 caractères. Deux colonnes numériques étroites côte à côte, telles que "Prix unitaire" et "Prix unitaire". et « Prix étendu », n'ont souvent que quelques points d'espace blanc entre eux. Si l'algorithme de division de colonnes du convertisseur utilise un seuil d'écart minimum supérieur à l'écart réel entre les colonnes, il considère les deux colonnes comme une seule et concatène leurs valeurs.

Le problème est aggravé par les nombres alignés à droite. Dans un tableau PDF bien formaté, les colonnes numériques sont alignées à droite, de sorte que les nombres de chaque ligne se terminent à la même position horizontale. L'espace entre la fin d'un nombre aligné à droite dans la colonne A et le début d'un nombre aligné à gauche dans la colonne B peut être aussi petit que quelques points. L'inspection visuelle du PDF montre un écart évident, mais l'algorithme du convertisseur peut nécessiter un écart plus grand pour identifier avec confiance une limite de colonne, traitant l'espace étroit comme un espacement normal des mots plutôt que comme un séparateur de colonne.

Un problème connexe se produit avec la notation des nombres négatifs et des parenthèses. Une valeur affichée sous la forme « (1 250,00) » comprend à la fois une parenthèse et une virgule, qu'un convertisseur peut interpréter comme plusieurs jetons distincts. La parenthèse ouvrante est associée à la colonne précédente, la partie numérique est placée dans la colonne actuelle et la parenthèse fermante est supprimée ou attachée à la colonne suivante. Le résultat est une cellule contenant des données partielles qui nécessitent un nettoyage manuel approfondi. Les tableaux utilisant le formatage des nombres européen, où la virgule est un séparateur décimal et le point est un séparateur de milliers, confondent davantage les convertisseurs qui supposent le formatage des nombres américain.

WukongPDF

Essayez PDF vers Excel

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Comment identifier les tables problématiques avant la conversion

Avant la conversion, ouvrez le PDF et zoomez sur la zone du tableau. Recherchez les colonnes dans lesquelles l'espace entre le caractère le plus à droite d'une colonne et le caractère le plus à gauche de la colonne suivante est visuellement petit, inférieur à environ une largeur de caractère. Ce sont les colonnes les plus susceptibles de fusionner lors de la conversion. Si vous voyez des tableaux avec ces espacements de colonnes serrés, prévoyez une correction manuelle après la conversion ou envisagez une méthode d'extraction alternative.

Recherchez également les tableaux qui utilisent des points de repère, des rangées de points reliant un nom d'article aligné à gauche à un prix aligné à droite. Les points de repère se trouvent dans l'espace entre les colonnes et sont souvent interprétés à tort comme des données plutôt que comme un formatage visuel. Un convertisseur qui traite les points de repère comme du contenu produira une colonne ne contenant que des points, ou divisera le tableau de manière incorrecte car il ne peut pas distinguer les points de repère des données. Les tableaux avec des cellules d’en-tête fusionnées s’étendant sur plusieurs colonnes constituent un autre problème. Le convertisseur voit un bloc de texte large dans la ligne d'en-tête et peut ne pas le mapper correctement aux colonnes de données plus étroites ci-dessous.

Pour les données critiques où la précision est importante, l'extraction Extraire des données PDF à l'aide d'un logiciel de reconnaissance de tableaux spécialisé est plus fiable que la conversion PDF vers Excel à usage général. Le logiciel d'extraction de données conçu spécifiquement pour les tableaux utilise plusieurs signaux, la position du texte, les métriques de police, la position des lignes et la cohérence de l'alignement entre les lignes, pour créer un modèle de colonne plus précis. Le coût supplémentaire d'un logiciel d'extraction spécialisé est justifié lorsque l'alternative consiste en des heures de nettoyage manuel d'Excel pour chaque table convertie.

Stratégies de correction manuelle pour les colonnes fusionnées

Lorsque les colonnes fusionnées sont inévitables, la fonctionnalité Texte en colonnes d'Excel est l'outil de correction le plus rapide. Sélectionnez la colonne fusionnée, ouvrez Données, Texte en colonnes et choisissez Délimité. Si les valeurs fusionnées sont systématiquement séparées par un espace, choisissez Espace comme délimiteur. S'ils sont séparés par un nombre variable d'espaces, choisissez Largeur fixe et placez manuellement la ligne de saut de colonne entre les deux valeurs. Excel prévisualise la répartition avant de l'appliquer, afin que vous puissiez ajuster la position de la rupture jusqu'à ce que la répartition soit correcte pour toutes les lignes.

Pour les valeurs fusionnées sans aucun délimiteur, telles que « 12503780 » où la répartition doit être comprise entre "1250" et "3780", Le texte en colonnes ne peut pas aider car il n'y a pas de délimiteur sur lequel diviser. Vous devez connaître la largeur attendue de chaque colonne. Si la première colonne contient toujours quatre chiffres et la seconde contient toujours quatre chiffres, utilisez les fonctions GAUCHE et DROITE d'Excel avec le nombre de caractères connu pour extraire les valeurs dans des colonnes séparées. Cette approche ne fonctionne que lorsque les largeurs de colonnes sont fixes et cohérentes, ce qui est courant dans les tables exportées à partir de systèmes de bases de données avec des largeurs de champ fixes.

WukongPDF convertit les tableaux PDF en Excel avec une détection de colonnes qui analyse l'alignement du texte, l'espacement et la position des lignes pour identifier les limites des colonnes, même dans les tableaux numériques étroitement espacés. La conversion préserve le formatage numérique afin que les valeurs extraites soient immédiatement utilisables pour le calcul sans nettoyage manuel. Pour les tableaux complexes qui résistent à la détection automatisée des colonnes, envisagez d’utiliser une approche basée sur l’OCR comme solution alternative. Capturez une capture d'écran du tableau PDF, exécutez-la via un outil OCR doté de capacités de reconnaissance de tableau et exportez le tableau reconnu vers Excel. Les moteurs OCR modernes qui incluent la détection de la structure des tableaux sont souvent plus fiables en matière de séparation des colonnes que les convertisseurs PDF vers Excel traditionnels, car ils analysent directement la présentation visuelle.

WukongPDF

Essayez PDF vers Excel

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →