Tips & Tricks

Lege regels verwijderen bij het kopiëren van tekst uit een PDF

Het kopiëren van tekst uit een PDF en plakken in Word of een teksteditor levert vaak een warboel van onderbroken lijnen op. Elke regel uit de PDF wordt een aparte alinea in de geplakte uitvoer, met harde regeleinden die het onmogelijk maken de tekst als doorlopend proza te bewerken. Het verwijderen van deze ongewenste regeleinden na conversie of kopiëren van PDF naar Word is een opmaakopruimingstaak die kan worden geautomatiseerd met zoeken en vervangen en een paar sneltoetsen.

Belangrijkste punten

PDF-tekstextractie plaatst een harde regeleinde aan het einde van elke visuele regel. Wanneer u deze in een teksteditor plakt, wordt elke regel een afzonderlijke alinea. De snelste oplossing is zoeken en vervangen met jokertekens, waarbij enkele regeleinden worden verwijderd terwijl dubbele regeleinden tussen echte alinea's behouden blijven. Met deze enkele handeling wordt de afgebroken tekst binnen enkele seconden omgezet in vloeiende alinea's.

How to Remove Blank Lines When Copying Text From a PDF

Waarom PDF-tekst met zoveel regeleinden wordt gekopieerd

Een PDF slaat tekst op als individuele lijnobjecten, elk gepositioneerd op specifieke coördinaten op de pagina. In tegenstelling tot een tekstverwerkerdocument waarbij tekst continu van de ene regel naar de volgende stroomt, heeft een PDF geen concept van vloeiende tekst. Elke lijn is een afzonderlijk object. Wanneer u tekst kopieert, leest het extractieproces deze regelobjecten op volgorde en wordt na elk regeleinde een regeleinde geplaatst, omdat er geen onderscheid kan worden gemaakt tussen een regeleinde dat een alinea beëindigt en een regeleinde dat slechts een regeleinde binnen een alinea is.

Het probleem is het meest zichtbaar bij PDF's met meerdere kolommen en PDF's die zijn gemaakt van opgemaakte tekstdocumenten. Een alinea die zich over vier visuele lijnen in de PDF uitstrekt, wordt bij het plakken vier afzonderlijke alinea's, die elk eindigen met een alineamarkering. Voor het bewerken van deze tekst moeten de regels handmatig weer aan elkaar worden gekoppeld, wat een tijdrovend klusje is van meer dan een paar alinea's. De zoek-en-vervang-aanpak automatiseert het opnieuw samenvoegen.

WukongPDF

Probeer PDF naar Word

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Enkele regeleinden verwijderen met zoeken en vervangen

Nadat u zoeken en vervangen hebt gebruikt om onderbroken regels met elkaar te verbinden, scant u de tekst op alinea-einden die behouden hadden moeten blijven, maar dat niet waren. Opsommingstekens en genummerde lijsten zijn de meest voorkomende slachtoffers, omdat elk opsommingsteken of nummer op een eigen regel staat. De zoek-en-vervang-methode voegt ze samen in één enkele alinea. Herstel handmatig de regeleinden vóór elk opsommingsteken of nummer. Deze opschoonstap duurt een paar minuten, maar levert een gepolijst einddocument op.

Plak de gekopieerde tekst in Word. Open Zoeken en vervangen met Ctrl+H. In het veld Zoeken naar typt u ^p om de alineamarkeringen te matchen. Typ één spatie in het veld Vervangen door. Klik op Alles vervangen. Elke alineamarkering in het document wordt vervangen door een spatie, waardoor alle tekst in één alinea wordt samengevoegd. Dit is te agressief omdat hierdoor ook de alineamarkeringen tussen echte alinea's worden verwijderd. Om dit op te lossen, beschermt u eerst de dubbele alineamarkeringen die echte alinea's scheiden. Vervang ^p^p eerst door een tijdelijke aanduiding zoals @@PARA@@. Vervang vervolgens de resterende enkele ^p-markeringen door spaties. Vervang ten slotte @@PARA@@ door ^p^p om de alinea-einden te herstellen.

De zoek-en-vervang-aanpak met jokertekens kan worden uitgebreid om complexere opschoonpatronen af te handelen. Een document met sectiekoppen kan worden beveiligd door het koptekstpatroon, zoals een regel die eindigt met een dubbele punt gevolgd door een alineamarkering, te vervangen door een tijdelijke aanduiding voordat de algemene regeleinden worden verwijderd. Nadat u de hoofdtekstregels heeft samengevoegd, herstelt u de kopeinden van de tijdelijke aanduidingen. Hierdoor blijven zowel de alineastructuur als de kopscheiding behouden.

In Word duurt dit driestapsproces ongeveer 30 seconden en werkt het op tekst van elke lengte. De sleutel gebruikt een tijdelijke aanduiding die nergens in de documenttekst voorkomt. Nadat afzonderlijke regeleinden zijn vervangen, loopt de tekst door als doorlopende alinea's. Elk origineel alinea-einde wordt bewaard als een dubbel regeleinde. Het document is nu bewerkbaar als normaal proza. De PDF Format-tools van WukongPDF behouden de alineastructuur tijdens de conversie, waardoor de hoeveelheid handmatige opschoning van regeleinden na het kopiëren wordt verminderd.

Gebruik online tools voor het opschonen van tekst voor snelle oplossingen

Opschonen met één klik bespaart minuten aan handmatige bewerking per regel.

Voor tekst die is gekopieerd uit een gescande PDF die met OCR is verwerkt, wordt het probleem met de regeleinde nog verergerd door OCR-fouten. Elk verkeerd herkend teken voegt ruis toe aan de reeds afgebroken tekst. Voer in dit geval de tekst door een spellingcontrole nadat u de regeleinden hebt verwijderd. De spellingcontrole detecteert OCR-fouten die door het verwijderen van regeleinden niet kunnen worden verholpen. De combinatie van het verwijderen van regeleinden en spellingcontrole produceert de schoonste uitvoer van gescande documenten.

Verschillende gratis online tools zijn gespecialiseerd in het opschonen van tekst die uit PDF's is gekopieerd. Plak de gekopieerde tekst in het hulpmiddel en de afzonderlijke regeleinden worden automatisch verwijderd, terwijl de alinea-einden behouden blijven. Deze tools gebruiken dezelfde logica als de handmatige zoek-en-vervang-methode, maar passen deze met één klik toe. Ze zijn ideaal voor eenmalige tekstopruimingstaken waarbij het instellen van zoeken en vervangen in Word meer moeite kost dan de taak rechtvaardigt.

Wanneer u een online tool voor het opschonen van tekst kiest, moet u er rekening mee houden dat u mogelijk gevoelige tekst op een website van derden plakt. Gebruik voor vertrouwelijke documenten de handmatige zoek-en-vervang-methode in een lokale toepassing in plaats van een online tool. De handmatige methode werkt offline, houdt uw tekst op uw computer en levert identieke resultaten op.

Voorkom problemen met regeleinden in toekomstige kopieën

De kwaliteit van de tekstextractie hangt ook af van de manier waarop de PDF is gemaakt. PDF's die door tekstverwerkers zijn gegenereerd, hebben doorgaans een betere interne tekstvolgorde dan PDF's die zijn gemaakt door scannen en OCR. De tekstvolgorde in een door een tekstverwerker gegenereerde PDF volgt de leesvolgorde van het originele document. De tekstvolgorde in een door OCR gegenereerde PDF volgt de ruimtelijke volgorde waarin de OCR-engine de tekst heeft herkend, wat mogelijk niet overeenkomt met de leesvolgorde in meerkolommen of complexe lay-outs.

Als u regelmatig tekst uit PDF's moet kopiëren, pas dan uw workflow aan om de opruimlast te minimaliseren. Converteer de PDF naar Word voordat u tekst kopieert, in plaats van rechtstreeks vanuit de PDF-viewer te kopiëren. PDF-naar-Word-conversietools zijn ontworpen om het samenvoegen van regeleinden te verwerken en doorlopende tekst te produceren. Het geconverteerde Word-document heeft nog steeds wat opruiming nodig, maar veel minder dan tekst die rechtstreeks uit de PDF-viewer is gekopieerd.

Als u PDF's wilt maken waarvan anderen tekst moeten kopiëren, schakelt u toegankelijkheidstags in tijdens het maken van PDF's. Getagde PDF's bevatten structuurinformatie die tekstextractietools laat weten waar alinea's beginnen en eindigen. Tekst die uit een gecodeerde PDF wordt gekopieerd, is aanzienlijk schoner dan tekst uit een niet-gecodeerde PDF, omdat de extractietool gebruikmaakt van alineastructuurtags in plaats van alineagrenzen te raden op basis van regelposities.

Wanneer u PDF's vanuit Word genereert, schakelt u de optie 'Documentstructuurtags voor toegankelijkheid' in de PDF-exportinstellingen in. Hierdoor wordt structurele informatie in de PDF ingesloten die tekstextractietools gebruiken om alineagrenzen te identificeren. Tekst die uit een getagde PDF wordt geëxtraheerd, heeft aanzienlijk minder valse regeleinden, omdat de extractietool weet waar alinea's beginnen en eindigen op basis van de structuurtags, in plaats van te raden op basis van regelposities.

Veelgestelde vragen

Heeft het lettertype dat in de originele PDF wordt gebruikt invloed op hoe netjes tekst wordt gekopieerd? Ja, aanzienlijk. PDF's die gebruik maken van standaard PostScript- of TrueType-lettertypen met de juiste codering kopiëren schoner dan PDF's die gebruik maken van op maat gecodeerde lettertypen. Sommige aangepaste lettertypen gebruiken niet-standaard tekentoewijzingen waarbij wat wordt weergegeven als de letter A intern wordt opgeslagen als een compleet andere tekencode. Wanneer u tekst uit zo’n PDF kopieert, kan de geëxtraheerde tekst geheel verkeerde tekens bevatten. Er is geen andere oplossing voor problemen met het coderen van lettertypen dan op OCR gebaseerde extractie.

Waarom worden bij geplakte tekst uit een PDF soms willekeurige spaties in het midden van de woorden ingevoegd? Dit wordt tekstfragmentatie genoemd en treedt op wanneer de PDF individuele tekens of kleine groepen tekens opslaat als afzonderlijke tekstobjecten. De PDF-viewer voegt spaties tussen objecten in tijdens het extraheren van tekst. Er is geen automatische oplossing. De enige oplossing is handmatig proeflezen. PDF's die zijn gemaakt met de juiste lettertype-insluiting en tekstcodering vertonen minder kans op fragmentatie.

Is er een manier om tekst uit een PDF te kopiëren zonder dat er regeleinden ontstaan? Sommige PDF-naar-tekst-extractietools produceren door hun ontwerp doorlopende alinea's. Deze hulpmiddelen analyseren de tekstopmaak en verbinden regels die tot dezelfde alinea behoren. De uitvoer is schoner dan kopiëren en plakken, maar vereist het gebruik van de extractietool in plaats van de standaard selectie-en-kopieermethode. Bij frequente tekstextractie bespaart het investeren in een speciale extractietool aanzienlijke opruimtijd.

Waarom bevat geplakte PDF-tekst soms extra spaties in het midden van woorden?

Dit gebeurt wanneer de PDF elk teken of een kleine groep tekens opslaat als afzonderlijke tekstobjecten met kleine tussenruimtes. Bij het tekstextractieproces wordt bij elke opening een spatie ingevoegd. Er is geen geautomatiseerde oplossing hiervoor, omdat de spaties niet te onderscheiden zijn van legitieme woordruimten. Handmatig proeflezen en corrigeren is de enige oplossing. Het maken van PDF's met de juiste lettertype-insluiting vermindert het optreden van tekstfragmentatie op tekenniveau.

Kan ik tekst uit een PDF-tabel kopiëren zonder de kolomuitlijning te vernietigen?

Bij standaard kopiëren en plakken blijft de tabelstructuur niet behouden. De tekst uit alle kolommen wordt in leesvolgorde geëxtraheerd, waardoor een door elkaar gegooide reeks ontstaat. Als u tabelgegevens wilt kopiëren waarbij de kolommen behouden blijven, gebruikt u een PDF-naar-Excel-conversietool die de tabelstructuur detecteert. De Excel-uitvoer behoudt de kolomuitlijning en u kunt vanuit Excel kopiëren met intacte structuur.

Heeft de PDF-viewer invloed op hoe netjes tekst wordt gekopieerd?

Ja. De tekstextractie van Adobe Acrobat is over het algemeen het schoonst. Browsergebaseerde viewers produceren vaak meer regeleinden omdat ze zijn geoptimaliseerd voor weergave en niet voor tekstextractie. Als u regelmatig tekst moet kopiëren, gebruik dan een speciale PDF-lezer voor de extractie in plaats van een browsergebaseerde viewer.

WukongPDF

Probeer PDF naar Word

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →