Het converteren van een PDF-indeling met meerdere kolommen naar Word levert vaak een document op waarin de tekst uit verschillende kolommen in één stroom wordt gemengd. Een onderzoekspaper met twee kolommen wordt één lange, gecodeerde paragraaf. Een nieuwsbrief met drie kolommen wordt onleesbaar. Om de kolomstructuur tijdens de conversie van PDF naar Word te behouden, zijn conversie-instellingen vereist die de oorspronkelijke lay-outgeometrie herkennen en behouden, waarbij elke kolom als een onafhankelijke tekststroom wordt behandeld in plaats van deze tot één tekststroom samen te voegen.
Belangrijkste punten
PDF-naar-Word-conversietools verwerken lay-outs met meerdere kolommen door de ruimtelijke indeling van tekst op elke pagina te analyseren. Tools die kolomdetectie ondersteunen, identificeren gaten tussen tekstblokken en reconstrueren de leesvolgorde van de kolommen. De kwaliteit van het behoud van kolommen varieert aanzienlijk tussen conversietools. Documenten met een eenvoudige lay-out met twee kolommen kunnen met de meeste tools goed worden geconverteerd. Documenten met complexe lay-outs in tijdschriftstijl met overlappende tekst en afbeeldingen moeten na de conversie mogelijk handmatig worden opgeschoond.

Hoe kolomdetectie werkt tijdens PDF-conversie
De lettergrootte en regelafstand in de originele PDF zijn van invloed op de nauwkeurigheid van de kolomdetectie. Documenten met zeer kleine tekst, zoals financiële tabellen met 8 punten, dagen het detectiealgoritme uit omdat de witruimte tussen de kolommen proportioneel kleiner is. Als het originele document dit toestaat, verbetert het vergroten van de lettergrootte of de kolomafstand voordat de PDF wordt gemaakt de conversieresultaten. Voor bestaande PDF's waarbij het brondocument niet beschikbaar is, moet u accepteren dat lay-outs met kleine tekst en meerdere kolommen meer handmatige opschoning vereisen.
Een PDF Converter die kolomdetectie ondersteunt, analyseert de horizontale posities van tekstblokken op elke pagina. Tekstblokken die dezelfde linkerrand delen en binnen een consistente breedte vallen, worden in een kolom gegroepeerd. De converter leest vervolgens elke kolom van boven naar beneden voordat hij naar de volgende kolom gaat. Dit levert een Word-document op waarin de tekst uit elke kolom zich in een afzonderlijke tekststroom bevindt, die Word weergeeft als gekoppelde tekstvakken of als een tabel met één kolom per PDF-kolom.
Het detectiealgoritme is gebaseerd op consistente kolombreedtes en duidelijke openingen tussen kolommen. Een document met een opening van 2 millimeter tussen de kolommen daagt het algoritme uit, omdat een dergelijke smalle opening kan worden geïnterpreteerd als normale woordafstand in plaats van als kolomgrens. Documenten met kolommen van ongelijke breedte, zoals een brede hoofdkolom en een smalle zijbalk, dagen het algoritme ook uit omdat het onderscheid moet maken tussen een kolom en een ingesprongen alinea. Kolomdetectie werkt het beste bij documenten met een standaardindeling: kolommen van gelijke breedte, gescheiden door minimaal 5 millimeter witruimte.
Probeer PDF naar Word
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Conversie-instellingen voor kolombehoud
Voor documenten met complexe lay-outs met meerdere kolommen die niet netjes worden geconverteerd met automatische instellingen, kunt u overwegen om naar een ander formaat dan Word te converteren. Bij het converteren van de PDF naar een desktop publishing-indeling zoals Adobe InDesign of Affinity Publisher blijven de kolomstructuren getrouwer behouden dan bij Word, omdat deze toepassingen van begin af aan zijn ontworpen voor lay-out met meerdere kolommen. Exporteer het uiteindelijke bewerkte document vanuit de publicatietoepassing terug naar PDF.
Na de eerste conversie slaat u het Word-document op in DOCX-indeling, niet in het oudere DOC-formaat. DOCX verwerkt complexe lay-outs, inclusief kolomstructuren, betrouwbaarder dan DOC. Als de conversietool een keuze uit uitvoerformaten biedt, kies dan altijd DOCX voor documenten met veel kolommen. Het converteren van PDF naar DOC en vervolgens opslaan als DOCX voegt een onnodige formaatconversie toe die lay-outfouten kan veroorzaken.
Als het geconverteerde Word-document elke kolom in een afzonderlijk tekstvak plaatst, wat het standaardgedrag is voor conversie met behoud van de lay-out, kunt u de tekst uit elk tekstvak extraheren en deze in een op kolommen gebaseerde lay-out laten samenvloeien met behulp van de functie voor gekoppelde tekstvakken van Word. Koppel de tekstvakken in leesvolgorde, zodat de tekst er continu doorheen stroomt. Deze aanpak behoudt zowel de kolomindeling als de mogelijkheid om de tekst als een continue stroom te bewerken.
Zoek in de conversie-instellingen naar opties met betrekking tot het behoud van de lay-out. "Doorlopende tekst behouden" probeert de tekst te reconstrueren als bewerkbare Word-paragrafen, wat ideaal is voor documenten die verder moeten worden bewerkt. "Pagina-indeling behouden" plaatst tekst in gepositioneerde tekstvakken die de exacte visuele lay-out behouden, maar moeilijker te bewerken zijn. Voor behoud van kolommen kan "Doorlopende tekst behouden" Als kolomdetectie is ingeschakeld, ontstaat doorgaans de beste balans tussen bewerkbaarheid en structuur. De PDF-naar-Word-converter van WukongPDF bevat een kolomdetectiemodus die lay-outs met meerdere kolommen identificeert en de juiste leesvolgorde reconstrueert, waarbij de tekst van elke kolom in een afzonderlijk Word-gedeelte wordt geplaatst.
Als de converter een OCR-optie biedt voor gescande documenten, schakel deze dan zelfs in voor digitale PDF's. De lay-outanalyse van de OCR-engine is vaak beter in het detecteren van kolommen dan de ruimtelijke analyse van de tekstextractie-engine. OCR verwerkt de pagina als een afbeelding en identificeert tekstgebieden, waardoor kolomdetectie effectiever is dan het rechtstreeks parseren van de PDF-inhoudsstroom. Het nadeel is dat op OCR gebaseerde conversie langzamer is en herkenningsfouten kan veroorzaken in tekst die al digitaal was. Gebruik op OCR gebaseerde conversie voor documenten waarbij kolomgetrouwheid de hoogste prioriteit heeft en de documentlengte beheersbaar is.
Handmatig kolomherstel na conversie
Als automatische conversie een document oplevert waarin tekst uit verschillende kolommen in de verkeerde volgorde is tussengevoegd, kan Word's Zoeken en vervangen met jokertekens helpen de samengevoegde tekst te scheiden. Zoek naar patronen die kolomeinden in de oorspronkelijke lay-out aangeven, zoals een consistent aantal spaties of een specifiek interpunctiepatroon dat aan het einde van de ene kolom en het begin van de volgende verschijnt. Zoeken en vervangen met jokertekens is sneller dan het handmatig knippen en plakken van elke alinea in de juiste kolomvolgorde.
Voor documenten waarbij de kolomvolgorde een semantische betekenis heeft, zoals tweetalige documenten met de originele taal in de linkerkolom en de vertaling in de rechterkolom, is het behouden van de kolomkoppeling essentieel. Controleer na de conversie of elke paragraaf in de linkerkolom overeenkomt met de juiste paragraaf in de rechterkolom. Een enkele verkeerde uitlijning aan het begin van het document loopt door in alle volgende paragrafen. De verificatiestap voor documenten met meerdere kolommen is tijdrovender dan voor standaard lay-outs met meerdere kolommen, maar is noodzakelijk om het document bruikbaar te maken.
Wanneer automatische kolomdetectie een gemengd resultaat oplevert, is handmatig herstel de uitwijkmogelijkheid. Gebruik in Word de functie Kolommen op het tabblad Indeling om het juiste aantal kolommen voor elke sectie van het document in te stellen. Knip en plak vervolgens de tekst uit de door elkaar gegooide conversie in de juiste kolomvolgorde. Dit is de meest tijdrovende aanpak, maar levert een perfect gestructureerd document op. Voor een papier van 10 pagina's met twee kolommen duurt het handmatig herstellen 15 tot 30 minuten, afhankelijk van de complexiteit van de lay-out.
Gebruik de originele PDF als visuele referentie terwijl u kolommen handmatig herstelt. Open de PDF aan de ene kant van het scherm en het Word-document aan de andere kant. Werk pagina voor pagina door het document en controleer of de tekst in elke kolom van het Word-document overeenkomt met de tekst in de overeenkomstige kolom van de PDF. Deze zij-aan-zij vergelijking legt verkeerd geordende paragrafen bloot die anders onopgemerkt zouden blijven. De extra verificatietijd is de moeite waard voor documenten waarbij de kolomstructuur betekenis heeft, zoals vergelijkende analyses waarbij de linker- en rechterkolom contrasterende gezichtspunten presenteren.
Veelgestelde vragen
Is het beter om de hele PDF in één keer of pagina voor pagina te converteren voor documenten met veel kolommen? Door het hele document in één keer te converteren, krijgt het detectiealgoritme meer gegevens om mee te werken. Het kan consistente kolompatronen op pagina's identificeren en deze uniform toepassen. Door pagina voor pagina te converteren wordt het algoritme gedwongen de kolomstructuur voor elke pagina afzonderlijk opnieuw te detecteren, wat inconsistente resultaten kan opleveren, zelfs als de kolomindeling op alle pagina's hetzelfde is.
Kan ik een Word-sjabloon instellen die overeenkomt met mijn gebruikelijke PDF-kolomindelingen, zodat conversies voorspelbaarder zijn? Ja. Maak een Word-sjabloon met het juiste aantal kolommen, marges en lettertype-instellingen. Na het converteren van de PDF naar Word importeert u de geconverteerde tekst in de sjabloon. De sjabloon biedt de kolomstructuur en de geïmporteerde tekst vult deze. Deze aanpak scheidt de lay-outdefinitie van de inhoudsextractie en levert consistentere resultaten op bij meerdere conversies van vergelijkbaar gestructureerde PDF's.
Kan ik een PDF met drie of meer kolommen naar Word converteren en alle kolommen intact laten?
Ja, maar het slagingspercentage neemt af naarmate het aantal kolommen toeneemt. Lay-outs met twee kolommen zijn goed te converteren met moderne tools. Lay-outs met drie kolommen kunnen op acceptabele wijze worden geconverteerd met de beste tools, maar vereisen mogelijk wat opschoning. Lay-outs met vier of meer kolommen, zoals dichte krantenpagina's, vereisen vrijwel altijd handmatig werk na de conversie. De smalle kolommen laten weinig ruimte over voor het detectiealgoritme om witruimten op betrouwbare wijze te identificeren.
Heeft het converteren van een op kolommen gebaseerde PDF naar Word invloed op de afbeeldingen en afbeeldingen tussen kolommen?
Afbeeldingen die meerdere kolommen beslaan, worden doorgaans correct geconverteerd omdat ze worden gedetecteerd als afzonderlijke objecten van de tekst. Afbeeldingen die in een kolom zijn ingesloten, zoals een kleine illustratie die inline met tekst is geplaatst, kunnen de kolomdetectie verstoren omdat de afbeelding de tekststroom verbreekt die het algoritme probeert te volgen. Controleer na de conversie of afbeeldingen nabij de kolomgrenzen correct zijn gepositioneerd en of de tekst eromheen loopt zoals verwacht.
Moet ik een gescand document met meerdere kolommen anders converteren dan een digitaal document?
Gescande documenten moeten OCR doorlopen vóór kolomdetectie, wat een stap toevoegt maar ook een mogelijkheid biedt. OCR-engines die zijn ontworpen voor documentconversie beschikken vaak over een geavanceerdere lay-outanalyse dan tekstextractiemachines, omdat OCR oorspronkelijk precies voor dit gebruik is ontwikkeld. Een hoogwaardige OCR-engine die wordt toegepast op een gescand document met meerdere kolommen kan een betere kolombehoud opleveren dan een tekstextractie-engine die wordt toegepast op de gelijkwaardige digitale PDF.
Probeer PDF naar Word
Geen installatie nodig. Werkt rechtstreeks in uw browser.
