Others

Perché le tabelle PDF scambiano righe e colonne durante la conversione di Excel

L'estrazione dei dati della tabella da un PDF a Excel dovrebbe produrre un foglio di calcolo in cui le righe e le colonne corrispondono alla tabella originale. Ma a volte l'output viene trasposto. Le righe diventano colonne, le colonne diventano righe e i dati vengono codificati. Questo non è un errore casuale. Ha cause specifiche legate a come il motore di conversione da PDF a Excel interpreta il layout visivo della tabella. Comprendere il motivo per cui avviene la trasposizione ti aiuta a scegliere le impostazioni di conversione che producono un output orientato correttamente.

Concetti chiave

La trasposizione da PDF a Excel si verifica quando il motore di conversione identifica erroneamente la direzione di lettura della tabella, in genere a causa di celle unite, larghezze di colonne incoerenti o testo allineato visivamente in righe ma archiviato nel PDF in ordine di colonne. La soluzione dipende dalla causa. La regolazione delle impostazioni di conversione, la pre-elaborazione del PDF per chiarire la struttura della tabella o la post-elaborazione dell'output di Excel per riportare i dati nell'orientamento corretto risolvono diverse cause principali.

Why Do PDF Tables Swap Rows and Columns During Excel Conversion

Perché i dati della tabella PDF vengono trasposti durante l'estrazione

Le tabelle che utilizzano punti iniziali o altri connettori visivi tra le colonne, come un sommario con punti che collegano i titoli dei capitoli ai numeri di pagina, hanno quasi la certezza di trasporre perché i punti iniziali creano una linea visiva continua che l'algoritmo di rilevamento interpreta come un separatore di riga. Rimuovi i punti leader dal documento di origine prima di creare il PDF se la tabella verrà successivamente riconvertita in Excel.

La struttura interna del PDF è importante tanto quanto il layout visivo. Una tabella che appare perfettamente allineata sullo schermo può essere memorizzata come oggetti di testo in un ordine che non corrisponde all'ordine di lettura visiva. Il software di creazione PDF determina l'ordine degli oggetti di testo. Alcune applicazioni scrivono oggetti di testo nell'ordine in cui sono stati aggiunti al documento, che può essere colonna per colonna anziché riga per riga. Questo è il motivo per cui due PDF che sembrano identici possono produrre risultati di conversione diversi: l'ordinamento interno degli oggetti di testo è diverso.

Una tabella PDF non viene memorizzata come tabella nel file. Viene memorizzato come singoli oggetti di testo posizionati su coordinate specifiche sulla pagina. Il motore di conversione deve esaminare queste coordinate e dedurre quali oggetti di testo appartengono a quali righe e colonne. L'algoritmo di inferenza utilizza l'allineamento orizzontale e verticale del testo per raggrupparlo in righe e colonne. Quando l'allineamento è ambiguo, l'algoritmo può raggruppare prima il testo in base all'allineamento verticale, producendo colonne che dovrebbero essere righe.

Le celle unite sono l'attivatore più comune per la trasposizione. Una tabella con una riga di intestazione che si estende su più colonne crea una struttura visiva in cui la riga superiore non si allinea con i limiti delle colonne sottostanti. Il motore di conversione vede l'intestazione unita e le singole colonne sottostanti come due diversi modelli di allineamento. Potrebbe interpretare l'intestazione unita come una riga a più colonne oppure potrebbe interpretare le colonne sottostanti come dati a più righe e l'ambiguità porta alla trasposizione. Le tabelle in cui la prima colonna contiene celle unite che si estendono su più righe sono ugualmente problematiche perché l'unione verticale interrompe l'allineamento delle righe utilizzato dal motore per raggruppare i dati orizzontalmente.

WukongPDF

Prova da PDF a Excel

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Regolare le impostazioni di conversione per impedire la trasposizione

Se la tabella PDF è stata generata da una pagina Web utilizzando la funzione di stampa del browser, la struttura della tabella nel PDF potrebbe essere meno strutturata di una tabella di un'applicazione di reporting dedicata. I PDF generati dal browser spesso presentano un allineamento più flessibile tra gli elementi di testo, il che rende notevolmente più difficile il rilevamento delle tabelle. Quando possibile, esporta le tabelle in PDF dall'applicazione originale anziché stamparle da un browser per ottenere risultati di conversione più affidabili.

Alcune tabelle PDF utilizzano colori di riga alternati come aiuto visivo per i lettori. Questi colori alternati possono confondere l'algoritmo di rilevamento della tabella perché vede le righe di colore diverso come appartenenti a sezioni diverse della tabella. L'eliminazione dei colori di sfondo dal PDF prima della conversione o la conversione prima in scala di grigi rimuove questa fonte di confusione e migliora la coerenza del rilevamento della struttura della tabella.

Se lo strumento di conversione include una modalità di rilevamento delle tabelle, abilitala. Il rilevamento della tabella indica al motore di cercare griglie, ombreggiature di sfondo e modelli di allineamento del testo coerenti che indicano una struttura di tabella. Questa modalità applica un'analisi aggiuntiva oltre all'estrazione del testo predefinita ed è più probabile che identifichi correttamente l'orientamento di righe e colonne. Alcuni strumenti offrono anche un comando "Transpose output" casella di controllo specifica per gestire i casi in cui l'estrazione predefinita produce dati trasposti. Se il tuo output è trasposto e lo strumento ha questa opzione, controllandolo in un secondo tentativo di conversione produrrà l'orientamento corretto.

Per Estrai dati PDF dalle tabelle scansionate, esegui l'OCR specificatamente in modalità tabella. I motori OCR progettati per il riconoscimento generale del testo potrebbero non preservare le relazioni spaziali tra i blocchi di testo. Un motore OCR in modalità tabella preserva la struttura di righe e colonne nell'output riconosciuto. Il convertitore da PDF a Excel di WukongPDF include il rilevamento automatico della struttura delle tabelle che identifica le relazioni tra righe e colonne in base sia all'allineamento visivo che ai modelli di contenuto, riducendo la probabilità di trasposizione rispetto all'estrazione di testo generico.

Correzione post-conversione: trasposizione dei dati Excel

Dopo la trasposizione, controlla i tipi di dati in ciascuna colonna. Excel potrebbe aver interpretato una colonna di numeri come testo dopo la trasposizione perché i dati trasposti includevano un'etichetta di intestazione nella stessa colonna. Seleziona ciascuna colonna e verifica che il tipo di dati corrisponda al contenuto. I numeri formattati come testo non verranno calcolati correttamente e le date formattate come testo non verranno ordinate cronologicamente. Correggi i tipi di dati dopo la trasposizione per garantire che il foglio di calcolo sia completamente funzionante.

Se l'output viene trasposto e la riconversione non è pratica, Excel può trasporre i dati in pochi clic. Seleziona l'intervallo di dati trasposti, copialo, fai clic con il pulsante destro del mouse su una nuova posizione e in Opzioni Incolla seleziona "Trasponi". Le righe e le colonne vengono scambiate, ripristinando l'orientamento originale. Funziona perfettamente per tabelle semplici in cui l'unico problema è l'inversione di riga/colonna. Per le tabelle complesse con celle unite, la trasposizione in Excel non gestisce correttamente le celle unite e potrebbe produrre un layout diverso dall'originale in modi peggiori.

Prima della trasposizione, confronta la tabella PDF originale con l'output Excel per confermare che la trasposizione è l'unico problema. Se l'output presenta anche celle disallineate, dati mancanti o celle unite in modo errato, la trasposizione non risolverà questi problemi. In questi casi è necessaria la ricostruzione manuale dei dati o la riconversione con impostazioni diverse. La correzione della trasposizione è una soluzione con un clic per il caso specifico in cui i dati sono completi e allineati correttamente ma orientati in modo errato.

Preelaborazione del PDF per un'estrazione più pulita della tabella

Se la tabella PDF è stata creata da un'applicazione specifica, come SAP, Oracle Reports o un sistema mainframe legacy, cerca online i problemi di conversione noti con l'output PDF di quella specifica applicazione. I sistemi di reporting aziendali spesso generano PDF con peculiarità prevedibili della struttura delle tabelle e altri utenti potrebbero aver documentato le impostazioni di conversione ottimali per quella specifica origine. Una ricerca mirata evita i tentativi e gli errori di testare più approcci di conversione.

Se un particolare PDF produce costantemente output trasposto in più tentativi di conversione, preelaborare il PDF prima della conversione. Utilizza un editor PDF per rimuovere eventuali ombreggiature di sfondo, griglie o elementi decorativi che potrebbero confondere l'algoritmo di rilevamento della tabella. Una tabella pulita con testo nero su sfondo bianco e griglie sottili e coerenti viene convertita in modo più affidabile rispetto a una tabella con colori delle righe alternati, bordi spessi e icone incorporate. La rimozione del rumore visivo prima della conversione migliora la capacità del motore di conversione di identificare correttamente la struttura della tabella.

Per le tabelle scansionate, regolare la scansione in modo che sia perfettamente diritta. Una tabella scansionata anche con un angolo di un grado provoca una leggera inclinazione di ogni riga e il motore di conversione potrebbe interpretare la pendenza come un allineamento di colonne. La maggior parte dei software di scansione include un'opzione di raddrizzamento che raddrizza automaticamente la pagina. Abilita questa opzione prima della scansione o utilizza uno strumento di allineamento sul PDF scansionato prima della conversione. Le righe dritte sono essenziali per il corretto rilevamento di righe e colonne.

Domande frequenti

Convertire una tabella PDF in CSV anziché in Excel evita il problema di trasposizione? La conversione CSV utilizza lo stesso algoritmo di rilevamento delle tabelle della conversione Excel. Se l'algoritmo traspone i dati, verrà trasposto anche l'output CSV. Il formato di output non influisce sulla logica di rilevamento. CSV ha il vantaggio di essere più facile da controllare in un editor di testo, il che rende la trasposizione immediatamente visibile quando si apre il file e si vede che le 5 colonne previste sono diventate 20.

La trasposizione avviene di più con alcuni tipi di tabelle PDF?

SÌ. Le tabelle con celle di intestazione unite, le tabelle con numeri incoerenti di colonne per riga e le tabelle in cui la prima colonna utilizza l'orientamento verticale del testo hanno maggiori probabilità di essere trasposte. Le tabelle con strutture a griglia semplici e uniformi raramente si traspongono. Più la tabella è regolare, più affidabile è la conversione.

Posso automatizzare il rilevamento e la correzione dell'output Excel trasposto?

Il controllo del numero di colonne nell'output di Excel rispetto al numero previsto dalla tabella originale è un semplice controllo automatizzato. Se la tabella PDF ha 5 colonne e 20 righe ma l'output Excel ha 20 colonne e 5 righe, i dati vengono trasposti. Uno script può rilevare questa mancata corrispondenza e trasporre i dati o contrassegnare il file per la revisione manuale. Questo controllo di qualità automatizzato rileva la trasposizione prima che i dati entrino nei flussi di lavoro a valle.

Perché la stessa tabella PDF viene convertita correttamente in un tentativo e trasposta in un altro?

Ciò è solitamente dovuto a impostazioni di conversione leggermente diverse utilizzate nei due tentativi oppure allo strumento di conversione che utilizza un percorso di elaborazione interno diverso in base alle dimensioni del file o alle soglie di complessità. Se riscontri risultati incoerenti, documenta le impostazioni esatte che producono l'output corretto e utilizza tali impostazioni per tutte le future conversioni di tabelle simili.

WukongPDF

Prova da PDF a Excel

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →