Converti una tabella PDF in Excel, apri il risultato e guardi un foglio di calcolo con celle vuote dove dovrebbero essere i numeri. Il PDF originale conteneva chiaramente dati in quelle posizioni. Puoi vederlo sullo schermo. Ma il file Excel presentava lacune, valori mancanti o intere righe ridotte a uno spazio bianco vuoto. Questo è uno dei risultati più frustranti della conversione da PDF a Excel perché non è ovvio cosa sia andato storto o come risolverlo.
La causa principale di solito non è lo strumento di conversione stesso. Si tratta di una discrepanza tra il modo in cui il PDF memorizza i dati della tabella e ciò che il motore di conversione si aspetta di trovare. Comprendere le ragioni specifiche delle celle vuote rende il problema risolvibile piuttosto che misterioso.

Il PDF contiene l'immagine di una tabella, non i dati effettivi della tabella
Questo è il motivo più comune per le celle vuote dopo la conversione da PDF a Excel. Se il PDF è stato creato da una scansione, uno screenshot o una stampa su PDF da un'applicazione che ne ha rasterizzato l'output, la tabella visualizzata sulla pagina è un'immagine piatta. Non sono presenti celle di dati sottostanti, strutture di righe e colonne e flussi di testo che uno strumento di conversione possa analizzare.
Quando uno strumento di conversione incontra una tabella basata su immagini, ha due scelte: eseguire l'OCR per provare a riconoscere il testo e ricostruire la struttura della tabella, oppure saltare completamente l'immagine perché non è in grado di analizzarla. Molti convertitori di base da PDF a Excel seguono la seconda strada. Estraggono i dati reali che riescono a trovare e tralasciano i contenuti basati su immagini. Il risultato è un foglio di calcolo con celle vuote dove si trovava l'immagine della tabella. La soluzione consiste nell'utilizzare un PDF Converter che includa l'OCR, come WukongPDF, che riconosce il testo nelle immagini e ricostruisce la griglia della tabella. La conversione non sarà perfetta al pixel, ma i dati appariranno nelle celle anziché scomparire in uno spazio vuoto.
Prova da PDF a Excel
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Il layout della tabella utilizza celle complesse unite o nidificate
Anche quando una tabella è composta da dati di testo reali, il modo in cui l'applicazione originale l'ha strutturata può sconfiggere un motore di conversione. Applicazioni come Microsoft Excel, Fogli Google e software di reporting spesso creano tabelle con celle unite, in cui una singola intestazione si estende su più colonne, tabelle nidificate, in cui una cella contiene un'altra mini-tabella al suo interno o intestazioni multilivello con raggruppamenti di colonne padre e figlio.
Il PDF non è stato progettato per rappresentare strutture di tabelle. È stato progettato per posizionare i caratteri in coordinate x,y specifiche su una pagina. Un PDF memorizza una tabella come migliaia di comandi di posizionamento dei caratteri indipendenti. Il motore di conversione deve effettuare il reverse engineering della struttura della tabella analizzando la disposizione spaziale di tali caratteri. Le celle unite complicano enormemente questa analisi. Ciò che a un lettore umano appare come una cella logica, al motore di conversione appare come un testo che si estende su un'area ambigua che potrebbe essere una cella larga o più celle strette. Quando il motore indovina, i dati finiscono nelle colonne sbagliate, divisi tra celle o omessi perché il motore non è riuscito a risolvere l'ambiguità.
Non esiste una soluzione universale perfetta per questo problema perché la struttura originale della tabella è andata persa quando il documento è stato convertito in PDF. Se hai accesso al file originale, l'esportazione diretta da Excel o Fogli Google al formato .xlsx, anziché la conversione da PDF a Excel, preserva perfettamente la struttura della tabella. Se il PDF è la tua unica copia, uno strumento di conversione con rilevamento avanzato delle tabelle, che ti consente di definire manualmente i limiti delle colonne o regolare le regioni della tabella rilevate, ti offre le migliori possibilità di recuperare i dati in modo pulito.
Informazioni sui delimitatori incoerenti o mancanti
I motori di conversione rilevano i limiti delle colonne analizzando gli spazi orizzontali tra gruppi di caratteri. Se due colonne sono molto vicine tra loro, il motore potrebbe unirle in una sola. Se una colonna contiene celle con quantità di testo molto variabili, il motore potrebbe dividere la colonna in più colonne nei punti più stretti. Entrambi gli errori producono celle vuote, perché i dati che dovrebbero riempire due colonne separate sono stati stipati in una, lasciando l'altra colonna vuota, o perché la colonna fantasma interrompe le celle create in cui non esistono dati.
Le tabelle con celle vuote nel documento originale creano una variante particolarmente complessa di questo problema. Se la tabella originale contiene celle intenzionalmente vuote, il motore di conversione rileva spazi più ampi e potrebbe spostare il rilevamento dei limiti delle colonne, disallineando ogni riga sotto lo spazio. Una singola cella vuota nella riga 3 può eliminare l'intera mappatura delle colonne per le righe dalla 4 alla 50, producendo una cascata di dati disallineati che sembra un errore di conversione ma in realtà è un'ambiguità strutturale nel documento di origine.
Come ridurre al minimo le celle vuote nella prossima conversione
Numerosi aggiustamenti pratici migliorano significativamente il tasso di successo della conversione. Innanzitutto, utilizza sempre uno strumento che supporti il rilevamento della struttura delle tabelle anziché un generico convertitore da PDF a testo. Gli strumenti progettati specificamente per Estrai dati PDF utilizzano algoritmi addestrati sui layout di tabella e producono risultati notevolmente migliori rispetto all'estrazione di testo generica. La conversione da PDF a Excel di WukongPDF include il rilevamento della struttura delle tabelle che gestisce layout comuni tra cui celle unite, intestazioni multilivello e tabelle con tipi di dati misti.
In secondo luogo, controlla il PDF prima di convertirlo. Se puoi selezionare e copiare singole celle o colonne di testo dalla tabella utilizzando il visualizzatore PDF, la tabella è composta da dati di testo reali e verrà convertita abbastanza bene. Se fai clic sulla tabella e l'intera cosa viene evidenziata come un singolo blocco, o se la selezione del testo non funziona affatto, la tabella è un'immagine e necessita di una conversione basata su OCR.
Terzo, preparati a pulire l'output. Anche i migliori strumenti di conversione producono fogli di calcolo che necessitano di modifiche manuali. Controlla le prime righe di ciascuna colonna per verificare i valori inseriti nelle colonne corrette. Cerca le colonne completamente vuote quando puoi vedere i dati nel PDF originale in quella posizione. Questi sono segni che lo strumento ha identificato erroneamente i limiti della colonna. La correzione della mappatura delle colonne nelle prime righe spesso comporta correzioni a cascata nel resto del foglio di calcolo.
Cosa fare quando la conversione continua a produrre celle vuote
Se hai provato più strumenti e la conversione produce costantemente celle vuote in posizioni specifiche, è probabile che il problema sia nel PDF stesso, non negli strumenti. I dati della tabella possono essere archiviati come grafica vettoriale, in cui i numeri vengono disegnati come forme anziché codificati come caratteri di testo. Ciò accade più spesso con i PDF generati da software CAD meno recenti, strumenti di reporting specializzati o alcuni sistemi di pianificazione delle risorse aziendali che eseguono il rendering dell'output in PDF tramite comandi di disegno grafico anziché il posizionamento del testo. In questi casi, l'OCR è l'unica opzione e dovresti aspettarti di rivedere e correggere manualmente l'output perché l'OCR dei dati tabulari disegnati da vettori è intrinsecamente soggetto a errori.
La soluzione più produttiva quando la conversione automatica fallisce ripetutamente è acquisire uno screenshot della tabella ad alta risoluzione, eseguirlo tramite uno strumento OCR dedicato specializzato nel riconoscimento delle tabelle ed esportarlo in Excel. Questo processo in due fasi, screenshot e poi OCR, ignora completamente la rappresentazione dei dati interni del PDF e tratta la tabella come un'immagine pura, che ironicamente può essere più affidabile per alcuni tipi di PDF non validi rispetto al tentativo di analizzare dati di testo danneggiati o non standard.
Prova da PDF a Excel
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
