U converteert een netjes opgemaakte PDF-tabel naar Excel, opent de uitvoer en ziet dat wat twee afzonderlijke kolommen met getallen in de PDF waren, één enkele kolom is geworden met waarden als "1.2503.780" in elke cel. Twee numerieke waarden uit aangrenzende kolommen zijn samengevoegd tot één tekstreeks en de gegevens zijn nu onbruikbaar voor berekeningen. Dit is de meest voorkomende klacht over de conversie van PDF naar Excel, en komt doordat de converter verkeerd heeft ingeschat waar de ene kolom eindigt en de volgende begint.
Detectie van kolomgrenzen in PDF-tabellen is een fundamenteel lastig probleem, omdat PDF's geen tabelstructuur bevatten. Een PDF-tabel bestaat uit tekst die op specifieke coördinaten is geplaatst, met horizontale en verticale lijnen nabij de tekst. De converter moet de kolomgrenzen afleiden uit de afstand tussen tekstblokken, uit de uitlijning van tekst over rijen of uit de positie van de getekende lijnen. Wanneer numerieke kolommen smal zijn en de getallen in aangrenzende kolommen dicht bij elkaar staan, kan de converter ze samenvoegen tot één bredere kolom, waarbij beide getallen als één tekstreeks worden gelezen. De converter ziet een doorlopende horizontale reeks getallen en kan niet zeggen waar het kolomeinde zich in de oorspronkelijke lay-out bevond.

Waarom aangrenzende numerieke kolommen bijzonder kwetsbaar zijn voor samenvoeging
Numerieke kolommen in PDF-tabellen zijn vaak smal omdat de cijfers kort zijn. Een kolom met valutawaarden kan vermeldingen bevatten als "1.250,00" of "42,50," zelden langer dan 12 tekens. Twee smalle numerieke kolommen naast elkaar, zoals "Eenheidsprijs" en "Verlengde prijs" hebben vaak slechts een paar punten witruimte ertussen. Als het kolomsplitsingsalgoritme van de converter een minimumafstandsdrempel gebruikt die groter is dan de werkelijke opening tussen de kolommen, beschouwt het de twee kolommen als één en voegt het hun waarden samen.
Het probleem wordt nog verergerd door rechts uitgelijnde getallen. In een goed opgemaakte PDF-tabel zijn numerieke kolommen rechts uitgelijnd, zodat de getallen in elke rij op dezelfde horizontale positie eindigen. De ruimte tussen het einde van een rechts uitgelijnd getal in kolom A en het begin van een links uitgelijnd getal in kolom B kan slechts enkele punten bedragen. Visuele inspectie van de PDF laat een duidelijke opening zien, maar het algoritme van de converter heeft mogelijk een grotere opening nodig om met zekerheid een kolomgrens te identificeren, waarbij de smalle ruimte wordt behandeld als normale woordafstand in plaats van als kolomscheidingsteken.
Een verwant probleem doet zich voor bij de notatie van negatieve getallen en haakjes. Een waarde die wordt weergegeven als "(1.250,00)" bevat zowel een haakje als een komma, die een converter kan interpreteren als meerdere afzonderlijke tokens. Het haakje openen wordt gekoppeld aan de vorige kolom, het numerieke gedeelte wordt in de huidige kolom geplaatst en het haakje sluiten wordt verwijderd of aan de volgende kolom gekoppeld. Het resultaat is een cel met gedeeltelijke gegevens die uitgebreid handmatig moeten worden opgeschoond. Tabellen die de Europese getalnotatie gebruiken, waarbij de komma een decimaal scheidingsteken is en de punt een scheidingsteken voor duizendtallen, verwarren converters die uitgaan van de Amerikaanse getalnotatie nog verder.
Probeer PDF naar Excel
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Probleemtabellen identificeren vóór conversie
Open vóór het converteren de PDF en zoom in op het tabelgebied. Zoek naar kolommen waarin de ruimte tussen het meest rechtse teken van de ene kolom en het meest linkse teken van de volgende kolom visueel klein is, minder dan ongeveer één tekenbreedte. Dit zijn de kolommen die tijdens de conversie het meest waarschijnlijk worden samengevoegd. Als u tabellen met deze kleine kolomafstanden ziet, plan dan een handmatige correctie na de conversie of overweeg een alternatieve extractiemethode.
Controleer ook of er tabellen zijn waarin aanlooppunten worden gebruikt, rijen met punten die een links uitgelijnde itemnaam verbinden met een rechts uitgelijnde prijs. Leader dots bevinden zich in de ruimte tussen de kolommen en worden vaak verkeerd gelezen als gegevens in plaats van als visuele opmaak. Een converter die aanlooppunten als inhoud behandelt, zal een kolom produceren die alleen maar punten bevat, of zal de tabel verkeerd splitsen omdat hij de aanlooppunten niet van de gegevens kan onderscheiden. Tabellen met samengevoegde koptekstcellen die meerdere kolommen beslaan, zijn een ander probleemgebied. De converter ziet een breed tekstblok in de koprij en wijst dit mogelijk niet correct toe aan de smallere gegevenskolommen eronder.
Voor kritieke gegevens waarbij nauwkeurigheid van belang is, is PDF-gegevens extraheren-extractie met behulp van gespecialiseerde tabelherkenningssoftware betrouwbaarder dan algemene PDF-naar-Excel-conversie. Software voor gegevensextractie die speciaal voor tabellen is ontworpen, maakt gebruik van meerdere signalen, tekstpositie, lettertypestatistieken, lijnpositie en uitlijningsconsistentie tussen rijen, om een nauwkeuriger kolommodel te bouwen. De extra kosten van gespecialiseerde extractiesoftware zijn gerechtvaardigd als het alternatief urenlange handmatige Excel-opschoning voor elke geconverteerde tabel is.
Handmatige correctiestrategieën voor samengevoegde kolommen
Wanneer samengevoegde kolommen onvermijdelijk zijn, is de functie Tekst naar kolommen van Excel het snelste correctiehulpmiddel. Selecteer de samengevoegde kolom, open Gegevens, Tekst naar kolommen en kies Gescheiden. Als de samengevoegde waarden consequent worden gescheiden door een spatie, kiest u Spatie als scheidingsteken. Als ze gescheiden zijn door een variabel aantal spaties, kiest u Vaste breedte en plaatst u de kolomeindelijn handmatig tussen de twee waarden. Excel geeft een voorbeeld van de splitsing weer voordat deze wordt toegepast, zodat u de afbreekpositie kunt aanpassen totdat de splitsing voor alle rijen correct is.
Voor waarden die zonder enig scheidingsteken zijn samengevoegd, zoals "12503780" waarbij de splitsing tussen "1250" en "3780," Tekst naar kolommen kan niet helpen, omdat er geen scheidingsteken is om op te splitsen. U moet de verwachte breedte van elke kolom weten. Als de eerste kolom altijd vier cijfers bevat en de tweede altijd vier cijfers, gebruikt u de functies LINKS en RECHTS van Excel met het bekende aantal tekens om de waarden in afzonderlijke kolommen te extraheren. Deze aanpak werkt alleen als de kolombreedtes vast en consistent zijn, wat gebruikelijk is in tabellen die worden geëxporteerd vanuit databasesystemen met vaste veldbreedtes.
WukongPDF converteert PDF-tabellen naar Excel met kolomdetectie die de uitlijning, spatiëring en lijnpositie van tekst analyseert om kolomgrenzen te identificeren, zelfs in numerieke tabellen met weinig tussenruimte. Bij de conversie blijft de numerieke opmaak behouden, zodat de geëxtraheerde waarden onmiddellijk bruikbaar zijn voor berekeningen zonder handmatig opschonen. Voor complexe tabellen die automatische kolomdetectie weerstaan, kunt u overwegen een op OCR gebaseerde aanpak als alternatief pad te gebruiken. Maak een screenshot van de PDF-tabel, voer deze door een OCR-tool met tabelherkenningsmogelijkheden en exporteer de herkende tabel naar Excel. Moderne OCR-engines die tabelstructuurdetectie bevatten, zijn vaak betrouwbaarder bij het scheiden van kolommen dan traditionele PDF-naar-Excel-converters, omdat ze de visuele lay-out rechtstreeks analyseren.
Probeer PDF naar Excel
Geen installatie nodig. Werkt rechtstreeks in uw browser.
