Others

Waarom levert het converteren van een PDF naar Excel soms lege cellen op waar gegevens zouden moeten staan?

U converteert een PDF-tabel naar Excel, opent het resultaat en staart naar een spreadsheet met lege cellen waar cijfers zouden moeten staan. De originele PDF bevatte duidelijk gegevens op die posities. Je kunt het op het scherm zien. Maar het Excel-bestand kwam door met gaten, ontbrekende waarden of hele rijen die waren teruggebracht tot lege witruimte. Dit is een van de meest frustrerende gevolgen van de conversie van PDF naar Excel, omdat het niet duidelijk is wat er mis is gegaan of hoe dit kan worden opgelost.

De hoofdoorzaak is meestal niet de conversietool zelf. Het is een discrepantie tussen de manier waarop de PDF de tabelgegevens opslaat en wat de conversie-engine verwacht te vinden. Als u de specifieke redenen voor lege cellen begrijpt, wordt het probleem eerder oplosbaar dan mysterieus.

Why Does Converting a PDF to Excel Sometimes Produce Blank Cells Where Data Should Be

De pdf bevat een afbeelding van een tabel, geen werkelijke tabelgegevens

Dit is de meest voorkomende reden voor lege cellen na conversie van PDF naar Excel. Als de PDF is gemaakt op basis van een scan, een screenshot of een print-naar-PDF van een toepassing die de uitvoer heeft gerasterd, is de tabel die u op de pagina ziet een platte afbeelding. Er zijn geen onderliggende gegevenscellen, geen rij- en kolomstructuren en geen tekststromen die een conversietool kan parseren.

Wanneer een conversieprogramma een op afbeeldingen gebaseerde tabel tegenkomt, heeft het twee keuzes: voer OCR uit om te proberen de tekst te herkennen en de tabelstructuur te reconstrueren, of sla de afbeelding geheel over omdat deze niet kan worden geparseerd. Veel basisconverters van PDF naar Excel volgen de tweede weg. Ze extraheren de echte gegevens die ze kunnen vinden en laten op afbeeldingen gebaseerde inhoud achterwege. Het resultaat is een spreadsheet met lege cellen waar de tabelafbeelding stond. De oplossing is het gebruik van een PDF Converter die OCR bevat, zoals WukongPDF, die tekst in afbeeldingen herkent en het tabelraster reconstrueert. De conversie zal niet pixel-perfect zijn, maar de gegevens verschijnen in cellen in plaats van te verdwijnen in een lege ruimte.

WukongPDF

Probeer PDF naar Excel

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

De tabelindeling maakt gebruik van complexe samengevoegde of geneste cellen

Zelfs als een tabel bestaat uit echte tekstgegevens, kan de manier waarop de oorspronkelijke applicatie deze heeft gestructureerd een conversie-engine verslaan. Toepassingen zoals Microsoft Excel, Google Spreadsheets en rapportagesoftware maken vaak tabellen met samengevoegde cellen, waarbij een enkele kop meerdere kolommen omvat, geneste tabellen, waarbij een cel nog een minitabel bevat, of kopteksten met meerdere niveaus met bovenliggende en onderliggende kolomgroepen.

PDF is niet ontworpen om tabelstructuren weer te geven. Het is ontworpen om karakters op specifieke x,y-coördinaten op een pagina te plaatsen. Een PDF slaat een tabel op als duizenden onafhankelijke tekenpositioneringsopdrachten. De conversie-engine moet de tabelstructuur reverse-engineeren door de ruimtelijke indeling van die tekens te analyseren. Samengevoegde cellen bemoeilijken deze analyse enorm. Wat voor een menselijke lezer op één logische cel lijkt, ziet er voor de conversie-engine uit als tekst die een dubbelzinnig gebied bestrijkt dat uit één brede cel of meerdere smalle cellen kan bestaan. Als de engine verkeerd gokt, komen de gegevens in de verkeerde kolommen terecht, worden ze over cellen verdeeld of worden ze weggelaten omdat de engine de dubbelzinnigheid niet kon oplossen.

Er bestaat geen perfecte universele oplossing hiervoor, omdat de oorspronkelijke tabelstructuur verloren ging toen het document naar PDF werd geconverteerd. Als u toegang heeft tot het originele bestand, blijft de tabelstructuur perfect behouden als u rechtstreeks vanuit Excel of Google Spreadsheets naar het .xlsx-formaat exporteert, in plaats van een PDF-naar-Excel-conversie. Als de PDF uw enige kopie is, biedt een conversietool met geavanceerde tabeldetectie, waarmee u handmatig kolomgrenzen kunt definiëren of de gedetecteerde tabelgebieden kunt aanpassen, de beste kans om de gegevens netjes te herstellen.

Inconsistente of ontbrekende scheidingstekeninformatie

Conversiemotoren detecteren kolomgrenzen door de horizontale openingen tussen groepen tekens te analyseren. Als twee kolommen heel dicht bij elkaar staan, kan de engine ze samenvoegen tot één. Als een kolom cellen bevat met sterk variërende hoeveelheden tekst, kan de engine de kolom op de smalle punten in meerdere kolommen opsplitsen. Beide fouten produceren lege cellen, hetzij omdat gegevens die twee afzonderlijke kolommen zouden moeten vullen, in één kolom zijn gepropt, waardoor de andere kolom leeg blijft, hetzij omdat fantoomkolomafbrekingen cellen hebben gecreëerd waarin geen gegevens voorkomen.

Tabellen met lege cellen in het originele document creëren een bijzonder lastige variant van dit probleem. Als de oorspronkelijke tabel opzettelijk lege cellen bevat, ziet de conversie-engine grotere gaten en kan de detectie van de kolomgrenzen verschuiven, waardoor elke rij onder de opening verkeerd wordt uitgelijnd. Eén enkele lege cel in rij 3 kan de volledige kolomtoewijzing voor de rijen 4 tot en met 50 verstoren, waardoor een cascade van verkeerd uitgelijnde gegevens ontstaat die eruit ziet als een conversiefout, maar in werkelijkheid een structurele dubbelzinnigheid in het brondocument is.

Lege cellen minimaliseren bij uw volgende conversie

Verschillende praktische aanpassingen verbeteren uw conversiesucces aanzienlijk. Gebruik ten eerste altijd een tool die tabelstructuurdetectie ondersteunt, in plaats van een generieke PDF-naar-tekst-converter. Hulpprogramma's die specifiek zijn ontworpen voor PDF-gegevens extraheren gebruiken algoritmen die zijn getraind in tabelindelingen en produceren aanzienlijk betere resultaten dan tekstextractie voor algemene doeleinden. De PDF-naar-Excel-conversie van WukongPDF omvat tabelstructuurdetectie die algemene lay-outs verwerkt, waaronder samengevoegde cellen, headers met meerdere niveaus en tabellen met gemengde gegevenstypen.

Ten tweede: controleer de PDF voordat u deze converteert. Als u met uw PDF-viewer afzonderlijke cellen of tekstkolommen uit de tabel kunt selecteren en kopiëren, bestaat de tabel uit echte tekstgegevens en kan deze redelijk goed worden geconverteerd. Als u op de tabel klikt en het geheel als één blok wordt gemarkeerd, of als tekstselectie helemaal niet werkt, is de tabel een afbeelding en heeft deze op OCR gebaseerde conversie nodig.

Ten derde: wees voorbereid op het opschonen van de uitvoer. Zelfs de beste conversietools produceren spreadsheets die enige handmatige aanpassing vereisen. Controleer de eerste paar rijen van elke kolom om te controleren of de waarden in de juiste kolommen zijn terechtgekomen. Zoek naar kolommen die geheel leeg zijn als u op die positie gegevens in de originele PDF kunt zien. Dit zijn tekenen dat de tool de kolomgrenzen verkeerd heeft geïdentificeerd. Als u de kolomtoewijzing in de eerste paar rijen corrigeert, worden correcties vaak doorgevoerd in de rest van het spreadsheet.

Wat te doen als de conversie lege cellen blijft produceren

Als u meerdere tools hebt geprobeerd en de conversie consequent lege cellen op specifieke posities oplevert, ligt het probleem waarschijnlijk in de PDF zelf en niet in de tools. De tabelgegevens kunnen worden opgeslagen als een vectorafbeelding, waarbij de getallen als vormen worden getekend in plaats van gecodeerd als teksttekens. Dit gebeurt het vaakst bij PDF's die zijn gegenereerd door oudere CAD-software, gespecialiseerde rapportagetools of sommige enterprise resource planning-systemen die de uitvoer naar PDF weergeven via grafische tekenopdrachten in plaats van het plaatsen van tekst. In deze gevallen is OCR de enige optie en moet u verwachten dat u de uitvoer handmatig controleert en corrigeert, omdat OCR van vectorgetekende tabelgegevens inherent foutgevoelig is.

De meest productieve terugval wanneer geautomatiseerde conversie herhaaldelijk mislukt, is het maken van een screenshot van de tabel met hoge resolutie, deze via een speciale OCR-tool uitvoeren die gespecialiseerd is in tabelherkenning, en deze exporteren naar Excel. Dit tweestapsproces, eerst een screenshot en vervolgens OCR, omzeilt de interne gegevensrepresentatie van de PDF volledig en behandelt de tabel als een puur beeld, wat ironisch genoeg betrouwbaarder kan zijn voor bepaalde soorten misvormde PDF's dan wanneer je probeert de beschadigde of niet-standaard tekstgegevens te ontleden.

WukongPDF

Probeer PDF naar Excel

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →