Het extraheren van tabelgegevens uit een PDF naar Excel zou een spreadsheet moeten opleveren waarin de rijen en kolommen overeenkomen met de originele tabel. Maar soms wordt de uitvoer getransponeerd. Rijen worden kolommen, kolommen worden rijen en de gegevens worden vervormd. Dit is geen willekeurige fout. Dit heeft specifieke oorzaken die verband houden met de manier waarop de conversie-engine PDF naar Excel de visuele indeling van de tabel interpreteert. Als u begrijpt waarom transpositie plaatsvindt, kunt u conversie-instellingen kiezen die correct georiënteerde uitvoer opleveren.
Belangrijkste punten
Transpositie van PDF naar Excel vindt plaats wanneer de conversie-engine de leesrichting van de tabel verkeerd identificeert, meestal vanwege samengevoegde cellen, inconsistente kolombreedtes of tekst die visueel is uitgelijnd in rijen maar in kolomvolgorde in de PDF is opgeslagen. De oplossing is afhankelijk van de oorzaak. Het aanpassen van de conversie-instellingen, het voorbewerken van de PDF om de tabelstructuur te verduidelijken, of het nabewerken van de Excel-uitvoer om de gegevens terug naar de juiste oriëntatie te transponeren, pakken allemaal verschillende hoofdoorzaken aan.

Waarom PDF-tabelgegevens worden getransponeerd tijdens extractie
Tabellen die aanhaalpunten of andere visuele verbindingen tussen kolommen gebruiken, zoals een inhoudsopgave met punten die hoofdstuktitels met paginanummers verbinden, worden vrijwel gegarandeerd getransponeerd omdat de aanhaalpunten een doorlopende visuele lijn creëren die het detectiealgoritme interpreteert als een rijscheidingsteken. Verwijder aanhaalpunten uit het brondocument voordat u de PDF maakt als de tabel later weer naar Excel wordt geconverteerd.
De interne structuur van de PDF is net zo belangrijk als de visuele lay-out. Een tabel die er op het scherm perfect uitgelijnd uitziet, kan worden opgeslagen als tekstobjecten in een volgorde die niet overeenkomt met de visuele leesvolgorde. De software voor het maken van PDF's bepaalt de volgorde van de tekstobjecten. Sommige toepassingen schrijven tekstobjecten in de volgorde waarin ze aan het document zijn toegevoegd, bijvoorbeeld kolom voor kolom in plaats van rij voor rij. Dit is de reden waarom twee PDF's die er identiek uitzien, verschillende conversieresultaten kunnen opleveren: hun interne volgorde van tekstobjecten is anders.
Een PDF-tabel wordt niet als tabel in het bestand opgeslagen. Het wordt opgeslagen als individuele tekstobjecten die op specifieke coördinaten op de pagina zijn geplaatst. De conversie-engine moet naar deze coördinaten kijken en daaruit afleiden welke tekstobjecten in welke rijen en kolommen horen. Het inferentiealgoritme gebruikt de horizontale en verticale uitlijning van tekst om deze in rijen en kolommen te groeperen. Wanneer de uitlijning dubbelzinnig is, kan het algoritme tekst eerst groeperen op basis van verticale uitlijning, waardoor kolommen ontstaan die uit rijen moeten bestaan.
Samengevoegde cellen zijn de meest voorkomende trigger voor transpositie. Een tabel met een koprij die meerdere kolommen omvat, creëert een visuele structuur waarbij de bovenste rij niet uitgelijnd is met de kolomgrenzen eronder. De conversie-engine beschouwt de samengevoegde koptekst en de afzonderlijke kolommen eronder als twee verschillende uitlijningspatronen. Het kan de samengevoegde koptekst interpreteren als een rij met meerdere kolommen, of het kan de onderliggende kolommen interpreteren als gegevens met meerdere rijen, en de dubbelzinnigheid leidt tot transpositie. Tabellen waarvan de eerste kolom samengevoegde cellen bevat die meerdere rijen beslaan, zijn even problematisch omdat de verticale samenvoeging de uitlijning van de rijen verstoort die de engine gebruikt om gegevens horizontaal te groeperen.
Probeer PDF naar Excel
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Conversie-instellingen aanpassen om omzetting te voorkomen
Als de PDF-tabel is gegenereerd vanaf een webpagina met behulp van de afdrukfunctie van de browser, is de tabelstructuur in de PDF mogelijk minder gestructureerd dan een tabel uit een speciale rapportagetoepassing. Door de browser gegenereerde PDF's hebben vaak een lossere uitlijning tussen tekstelementen, waardoor tabeldetectie aanzienlijk moeilijker wordt. Exporteer indien mogelijk tabellen naar PDF vanuit de oorspronkelijke toepassing in plaats van ze af te drukken vanuit een browser, voor de meest betrouwbare conversieresultaten.
Sommige PDF-tabellen gebruiken afwisselende rijkleuren als visueel hulpmiddel voor de lezers. Deze afwisselende kleuren kunnen het tabeldetectiealgoritme in verwarring brengen, omdat het verschillend gekleurde rijen beschouwt als behorend tot verschillende tabelsecties. Door de achtergrondkleuren uit de PDF te verwijderen vóór de conversie, of eerst naar grijstinten te converteren, wordt deze bron van verwarring weggenomen en wordt de consistentie van de tabelstructuurdetectie verbeterd.
Als de conversietool een tabeldetectiemodus bevat, schakel deze dan in. Tabeldetectie vertelt de engine om te zoeken naar rasterlijnen, achtergrondschaduw en consistente tekstuitlijningspatronen die een tabelstructuur aangeven. Deze modus past extra analyse toe naast de standaard tekstextractie en zal waarschijnlijk de rij- en kolomoriëntatie correct identificeren. Sommige tools bieden ook een "Transpose-uitvoer" selectievakje specifiek om gevallen af te handelen waarin de standaardextractie getransponeerde gegevens oplevert. Als uw uitvoer is getransponeerd en de tool deze optie heeft, zal het controleren ervan bij een tweede conversiepoging de juiste oriëntatie opleveren.
Voor PDF-gegevens extraheren uit gescande tabellen voert u OCR specifiek uit in tabelmodus. OCR-engines die zijn ontworpen voor algemene tekstherkenning behouden mogelijk niet de ruimtelijke relaties tussen tekstblokken. Een OCR-engine in tabelmodus behoudt de rij- en kolomstructuur in de herkende uitvoer. De PDF-naar-Excel-converter van WukongPDF omvat automatische tabelstructuurdetectie die rij- en kolomrelaties identificeert op basis van zowel visuele uitlijning als inhoudspatronen, waardoor de kans op transpositie wordt verkleind in vergelijking met generieke tekstextractie.
Oplossing na conversie: de Excel-gegevens terugtransponeren
Controleer na het transponeren de gegevenstypen in elke kolom. Excel heeft mogelijk een kolom met getallen na de transpositie als tekst geïnterpreteerd, omdat de getransponeerde gegevens een koptekstlabel in dezelfde kolom bevatten. Selecteer elke kolom en controleer of het gegevenstype overeenkomt met de inhoud. Getallen die als tekst zijn opgemaakt, worden niet correct berekend, en datums die als tekst zijn opgemaakt, worden niet chronologisch gesorteerd. Herstel gegevenstypen na de transpositie om ervoor te zorgen dat de spreadsheet volledig functioneel is.
Als de uitvoer wordt getransponeerd en opnieuw converteren niet praktisch is, kan Excel de gegevens met een paar klikken omzetten. Selecteer het getransponeerde gegevensbereik, kopieer het, klik met de rechtermuisknop op een nieuwe locatie en selecteer onder Plakopties "Transponeren". De rijen en kolommen zijn verwisseld, waardoor de oorspronkelijke oriëntatie wordt hersteld. Dit werkt perfect voor eenvoudige tabellen waarbij het enige probleem de omkering van rijen/kolommen is. Voor complexe tabellen met samengevoegde cellen verwerkt de transpositie in Excel de samengevoegde cellen niet correct en kan een lay-out opleveren die op slechtere manieren afwijkt van het origineel.
Vergelijk vóór het transponeren de originele PDF-tabel met de Excel-uitvoer om te bevestigen dat transponeren het enige probleem is. Als de uitvoer ook verkeerd uitgelijnde cellen, ontbrekende gegevens of onjuist samengevoegde cellen bevat, zal transponeren deze problemen niet oplossen. In die gevallen is handmatige gegevensreconstructie of herconversie met verschillende instellingen noodzakelijk. De transpose fix is een oplossing met één klik voor het specifieke geval waarin de gegevens compleet en correct uitgelijnd zijn, maar verkeerd georiënteerd.
De PDF voorbewerken voor schonere tabelextractie
Als de PDF-tabel is gemaakt door een specifieke toepassing, zoals SAP, Oracle Reports of een ouder mainframesysteem, zoek dan online naar bekende conversieproblemen met de PDF-uitvoer van die specifieke toepassing. Bedrijfsrapportagesystemen genereren vaak PDF's met voorspelbare tabelstructuur-eigenaardigheden, en andere gebruikers hebben mogelijk de optimale conversie-instellingen voor die specifieke bron gedocumenteerd. Een gerichte zoekopdracht bespaart u het vallen en opstaan van het testen van meerdere conversiebenaderingen.
Als een bepaalde PDF consistent getransponeerde uitvoer produceert over meerdere conversiepogingen, moet u de PDF voorbewerken voordat u deze converteert. Gebruik een PDF-editor om achtergrondschaduw, rasterlijnen of decoratieve elementen te verwijderen die het tabeldetectiealgoritme in de war kunnen brengen. Een overzichtelijke tabel met zwarte tekst op een witte achtergrond en dunne, consistente rasterlijnen converteert betrouwbaarder dan een tabel met afwisselende rijkleuren, dikke randen en ingebedde pictogrammen. Het verwijderen van visuele ruis vóór de conversie verbetert het vermogen van de conversie-engine om de tabelstructuur correct te identificeren.
Voor gescande tabellen past u de scan aan zodat deze perfect recht is. Een tabel die zelfs onder een hoek van één graad wordt gescand, zorgt ervoor dat elke rij enigszins schuin staat, en de conversie-engine kan de helling interpreteren als een kolomuitlijning. De meeste scansoftware bevat een optie voor rechtzetten, waarmee de pagina automatisch rechtgetrokken wordt. Schakel deze optie in voordat u gaat scannen, of gebruik vóór de conversie een hulpmiddel voor het rechtzetten van de gescande PDF. Rechte rijen zijn essentieel voor een correcte rij- en kolomdetectie.
Veelgestelde vragen
Voorkomt het converteren van een PDF-tabel naar CSV in plaats van Excel het transpositieprobleem? CSV-conversie gebruikt hetzelfde tabeldetectiealgoritme als Excel-conversie. Als het algoritme de gegevens transponeert, wordt de CSV-uitvoer ook getransponeerd. Het uitvoerformaat heeft geen invloed op de detectielogica. CSV heeft wel het voordeel dat het makkelijker te inspecteren is in een teksteditor, waardoor de transpositie direct zichtbaar wordt als je het bestand opent en ziet dat de verwachte 5 kolommen 20 zijn geworden.
Gebeurt transpositie vaker bij bepaalde typen PDF-tabellen?
Ja. Tabellen met samengevoegde koptekstcellen, tabellen met een inconsistent aantal kolommen per rij en tabellen waarbij de eerste kolom een verticale tekstrichting gebruikt, zullen het meest waarschijnlijk worden getransponeerd. Tabellen met eenvoudige, uniforme rasterstructuren transponeren zelden. Hoe regelmatiger de tabel, hoe betrouwbaarder de conversie.
Kan ik de detectie en correctie van getransponeerde Excel-uitvoer automatiseren?
Het controleren van het aantal kolommen in de Excel-uitvoer ten opzichte van het verwachte aantal uit de oorspronkelijke tabel is een eenvoudige automatische controle. Als de PDF-tabel 5 kolommen en 20 rijen heeft, maar de Excel-uitvoer 20 kolommen en 5 rijen heeft, worden de gegevens getransponeerd. Een script kan deze discrepantie detecteren en de gegevens transponeren of het bestand markeren voor handmatige beoordeling. Deze geautomatiseerde kwaliteitscontrole vangt de omzetting op voordat de gegevens de stroomafwaartse workflows binnenkomen.
Waarom wordt dezelfde PDF-tabel bij de ene poging correct geconverteerd en bij een andere poging getransponeerd?
Dit komt meestal doordat bij de twee pogingen enigszins verschillende conversie-instellingen worden gebruikt, of doordat de conversietool een ander intern verwerkingspad gebruikt op basis van de bestandsgrootte of complexiteitsdrempels. Als u inconsistente resultaten tegenkomt, documenteer dan de exacte instellingen die de juiste uitvoer opleveren en gebruik deze instellingen voor alle toekomstige conversies van vergelijkbare tabellen.
Probeer PDF naar Excel
Geen installatie nodig. Werkt rechtstreeks in uw browser.
