Converti una tabella PDF formattata in modo pulito in Excel, apri l'output e scopri che quelle che erano due colonne separate di numeri nel PDF sono diventate una singola colonna con valori come "1,2503,780" in ogni cella. Due valori numerici di colonne adiacenti sono stati concatenati in un'unica stringa di testo e i dati sono ora inutili per il calcolo. Questo è il reclamo più comune sulla conversione da PDF a Excel e si verifica perché il convertitore ha valutato erroneamente dove finisce una colonna e inizia quella successiva.
Il rilevamento dei limiti delle colonne nelle tabelle PDF è un problema fondamentalmente difficile perché i PDF non contengono la struttura della tabella. Una tabella PDF è semplicemente testo posizionato su coordinate specifiche, con linee orizzontali e verticali disegnate vicino al testo. Il convertitore deve dedurre i limiti delle colonne dalla spaziatura tra i blocchi di testo, dall'allineamento del testo tra le righe o dalla posizione delle linee disegnate. Quando le colonne numeriche sono strette e i numeri nelle colonne adiacenti sono vicini tra loro, il convertitore può unirle in un'unica colonna più ampia, leggendo entrambi i numeri come un'unica stringa di testo. Il convertitore vede una sequenza orizzontale continua di numeri e non è in grado di stabilire dove si trovava l'interruzione di colonna nel layout originale.

Perché le colonne numeriche adiacenti sono particolarmente vulnerabili all'unione
Le colonne numeriche nelle tabelle PDF tendono ad essere strette perché i numeri sono brevi. Una colonna di valori di valuta potrebbe contenere voci come "1.250,00" o "42,50", raramente supera i 12 caratteri. Due colonne numeriche strette affiancate, ad esempio "Prezzo unitario" e "Prezzo esteso", spesso hanno solo pochi punti di spazio bianco tra di loro. Se l'algoritmo di suddivisione delle colonne del convertitore utilizza una soglia di intervallo minimo maggiore dello spazio effettivo tra le colonne, vede le due colonne come una sola e concatena i relativi valori.
Il problema è aggravato dai numeri allineati a destra. In una tabella PDF ben formattata, le colonne numeriche sono allineate a destra, quindi i numeri in ciascuna riga terminano nella stessa posizione orizzontale. Lo spazio tra la fine di un numero allineato a destra nella colonna A e l'inizio di un numero allineato a sinistra nella colonna B può essere pari a pochi punti. L'ispezione visiva del PDF mostra un chiaro divario, ma l'algoritmo del convertitore potrebbe richiedere un divario più ampio per identificare con sicurezza il limite di una colonna, trattando lo spazio ristretto come una normale spaziatura delle parole anziché come un separatore di colonna.
Un problema correlato si verifica con i numeri negativi e la notazione delle parentesi. Un valore visualizzato come "(1.250,00)" include sia una parentesi che una virgola, che un convertitore può interpretare come più token separati. La parentesi di apertura viene associata alla colonna precedente, la parte numerica viene posizionata nella colonna corrente e la parentesi di chiusura viene eliminata o allegata alla colonna successiva. Il risultato è una cella contenente dati parziali che richiedono un'estesa pulizia manuale. Le tabelle che utilizzano la formattazione numerica europea, dove la virgola è un separatore decimale e il punto è un separatore delle migliaia, confondono ulteriormente i convertitori che presuppongono la formattazione numerica statunitense.
Prova da PDF a Excel
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Come identificare le tabelle dei problemi prima della conversione
Prima della conversione, apri il PDF e ingrandisci l'area della tabella. Cerca le colonne in cui lo spazio tra il carattere più a destra di una colonna e il carattere più a sinistra della colonna successiva è visivamente piccolo, inferiore approssimativamente alla larghezza di un carattere. Queste sono le colonne che con maggiore probabilità verranno unite durante la conversione. Se vedi tabelle con spaziature tra le colonne così strette, pianifica la correzione manuale dopo la conversione o considera un metodo di estrazione alternativo.
Controlla anche la presenza di tabelle che utilizzano punti leader, righe di punti che collegano il nome di un articolo allineato a sinistra a un prezzo allineato a destra. I punti leader si trovano nello spazio tra le colonne e spesso vengono interpretati erroneamente come dati piuttosto che come formattazione visiva. Un convertitore che tratta i punti leader come contenuto produrrà una colonna contenente solo punti o dividerà la tabella in modo errato perché non è in grado di distinguere i punti leader dai dati. Le tabelle con celle di intestazione unite che si estendono su più colonne rappresentano un altro punto problematico. Il convertitore vede un blocco di testo largo nella riga di intestazione e potrebbe non associarlo correttamente alle colonne di dati più strette sottostanti.
Per i dati critici in cui la precisione è importante, l'estrazione Estrai dati PDF utilizzando un software specializzato di riconoscimento delle tabelle è più affidabile della conversione da PDF a Excel per scopi generici. Il software di estrazione dati progettato specificamente per le tabelle utilizza più segnali, posizione del testo, metrica dei caratteri, posizione della linea e coerenza dell'allineamento tra le righe, per creare un modello di colonna più accurato. Il costo aggiuntivo del software di estrazione specializzato è giustificato quando l'alternativa sono ore di pulizia manuale di Excel per ciascuna tabella convertita.
Strategie di correzione manuale per le colonne unite
Quando le colonne unite sono inevitabili, la funzione Testo in colonne di Excel è lo strumento di correzione più veloce. Seleziona la colonna unita, apri Dati, Testo in colonne e scegli Delimitato. Se i valori uniti sono costantemente separati da uno spazio, scegli Spazio come delimitatore. Se sono separati da un numero variabile di spazi, scegli Larghezza fissa e posiziona manualmente la linea di interruzione di colonna tra i due valori. Excel visualizza in anteprima la divisione prima di applicarla, quindi puoi regolare la posizione di interruzione fino a quando la divisione non sarà corretta per tutte le righe.
Per i valori uniti senza alcun delimitatore, come "12503780" dove la divisione dovrebbe essere compresa tra "1250" e "3780", Il testo in colonne non può essere d'aiuto perché non esiste un delimitatore su cui dividere. È necessario conoscere la larghezza prevista di ciascuna colonna. Se la prima colonna contiene sempre quattro cifre e la seconda contiene sempre quattro cifre, utilizzare le funzioni SINISTRA e DESTRA di Excel con il conteggio dei caratteri noto per estrarre i valori in colonne separate. Questo approccio funziona solo quando le larghezze delle colonne sono fisse e coerenti, cosa comune nelle tabelle esportate da sistemi di database con larghezze di campo fisse.
WukongPDF converte le tabelle PDF in Excel con rilevamento delle colonne che analizza l'allineamento del testo, la spaziatura e la posizione della riga per identificare i limiti delle colonne anche nelle tabelle numeriche con spazi ristretti. La conversione preserva la formattazione numerica in modo che i valori estratti siano immediatamente utilizzabili per il calcolo senza pulizia manuale. Per le tabelle complesse che resistono al rilevamento automatizzato delle colonne, prendi in considerazione l'utilizzo di un approccio basato su OCR come percorso alternativo. Cattura uno screenshot della tabella PDF, eseguilo tramite uno strumento OCR con funzionalità di riconoscimento della tabella ed esporta la tabella riconosciuta in Excel. I moderni motori OCR che includono il rilevamento della struttura delle tabelle sono spesso più affidabili nella separazione delle colonne rispetto ai tradizionali convertitori da PDF a Excel perché analizzano direttamente il layout visivo.
Prova da PDF a Excel
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
