Het selecteren van tekst in een PDF, het kopiëren ervan en het plakken in Word zou dezelfde tekst moeten opleveren. In plaats daarvan verschijnen regeleinden halverwege de zin. Speciale tekens veranderen in vuilnissymbolen. Lettertypen veranderen. Alinea's die netjes zijn uitgelijnd, worden een grillige puinhoop van harde rendementen en willekeurige spatiëring. De tekst is technisch aanwezig, maar de opmaak is vernietigd.
PDF's zijn zo ontworpen dat ze er overal hetzelfde uitzien. Ze zijn niet ontworpen om bewerkbaar te zijn. Copy-paste legt die afweging bloot.
Als u begrijpt waarom tekst verandert tijdens kopieerbewerkingen van PDF naar Word, kunt u kiezen tussen het corrigeren van de geplakte tekst, het gebruik van een geschikt conversieprogramma of het terugkeren naar het brondocument. De conversietools PDF Format van WukongPDF verwerken de extractie correct, waardoor kopieer- en plakproblemen volledig worden vermeden.

Hoe pdf's tekst opslaan en hoe ze deze weergeven
In een PDF wordt tekst opgeslagen als individuele tekenplaatsingen op een coördinatenraster. Elk personage heeft een X- en Y-positie. Het woord hallo kan uit vijf onafhankelijke tekens bestaan: h at (100.200), e at (108.200), enzovoort. De kijker geeft deze weer als een woord omdat ze naast elkaar op dezelfde Y-coördinaat zitten. Wanneer u kopieert en plakt, reconstrueert de ontvangende toepassing woorden en zinnen vanuit deze afzonderlijke posities.
Reconstructie-algoritmen raden waar woorden en regels beginnen en eindigen op basis van de afstand. Een grotere dan normale woordafstand kan worden geïnterpreteerd als een regeleinde. Uitgevulde alinea's met variabele spatiëring verwarren het algoritme met het willekeurig invoegen van pauzes. Ligaturen, samengevoegde tekens zoals fi en fl, missen mogelijk een Unicode-equivalent, waardoor ontbrekende of vervangende tekens in de geplakte uitvoer ontstaan.
Probeer PDF naar Word
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Waarom regeleinden midden in zinnen verschijnen
Harde regeleinden die halverwege de zin verschijnen, zijn het meest voorkomende copy-paste-artefact. De PDF slaat tekst op in regels die overeenkomen met de pagina-indeling. Een zin die van de ene visuele regel naar de volgende loopt, wordt opgeslagen als twee afzonderlijke sets tekenposities. Het kopieeralgoritme ziet de opening tussen het einde van de ene visuele regel en het begin van de volgende en voegt een alinea-einde in.
Als u deze onderbrekingen handmatig in Word corrigeert, betekent dit dat u elke ongewenste onderbreking verwijdert en een spatie toevoegt. Voor één paragraaf een kleine ergernis. Voor een document van 50 pagina's een uur verspilde tijd. Een PDF-naar-Word-converter die alinea's reconstrueert op basis van tekenposities, verwerkt dit op de juiste manier, door omwikkelde tekst samen te voegen en alleen pauzes in te voegen aan de daadwerkelijke alineagrenzen.
Speciale tekens en problemen met lettertypevervanging
PDF's kunnen lettertypen gebruiken die niet op de kopieercomputer zijn geïnstalleerd. Wanneer de kopieerbewerking een teken tegenkomt uit een niet-beschikbaar lettertype, vervangt het een fallback of laat het teken volledig vallen. Opsommingstekens worden vraagtekens. Em-streepjes worden lege vakjes. Gekrulde aanhalingstekens worden rechte aanhalingstekens of verdwijnen. De tekst is aanwezig in de PDF, maar kan niet worden weergegeven in het plakdoel, omdat de tekencodering niet netjes wordt weergegeven.
Ingebedde lettertypen voorkomen weergaveproblemen, maar kopiëren en plakken brengt het ingebedde lettertype niet over. De doeltoepassing gebruikt zijn eigen lettertypen, die mogelijk geen specifieke tekens bevatten of deze anders coderen. De juiste PDF-naar-Word-conversietools gaan intelligenter om met lettertypetoewijzing dan het systeemklembord, vertalen PDF-lettertypecoderingen naar Unicode en behouden elk teken.
| Kopieer-plakprobleem | Wat de oorzaak is | Hoe te vermijden |
|---|---|---|
| Willekeurige regeleinden | PDF slaat tekst op per visuele lijn, niet per alinea | Gebruik de PDF-naar-Word-converter in plaats van kopiëren en plakken |
| Verminkte speciale tekens | Lettertype niet beschikbaar op systeem, codering komt niet overeen | Zorg ervoor dat de bron-PDF ingesloten lettertypen gebruikt, of gebruik een converter |
| Ontbrekende ligaturen (fi, fl, ff) | Ligatuurglyph heeft geen enkel Unicode-equivalent | Gebruik een converter die ligaturen in afzonderlijke tekens ontleedt |
| Verloren opmaak (vet, cursief) | Opmaak afzonderlijk van tekst opgeslagen in PDF | Accepteer dat bij kopiëren en plakken de opmaak verloren gaat; gebruik omvormer |
| Tekst in verkeerde volgorde | Meerkolommen of een complexe lay-out verwarren de extractie | Gebruik een converter met lay-outdetectie |
Conversie van PDF naar Word gebruiken in plaats van kopiëren en plakken
Een conversietool leest de interne structuur van de PDF en reconstrueert alinea's, tabellen en opmaak op een manier die het klembord niet kan. Het uitgevoerde Word-document behoudt de tekststroom, behoudt de koppen als Word-stijlen en zorgt ervoor dat tabellen bewerkbaar blijven. De conversie vergt hetzelfde aantal klikken als kopiëren en plakken en levert een resultaat op dat een fractie van de opschoning nodig heeft.
De conversietool van WukongPDF verwerkt deze reconstructie automatisch. Upload de PDF, selecteer Word als uitvoerformaat en download een goed gestructureerd document. De paar seconden die de conversie in beslag neemt, betalen zichzelf terug in de bespaarde opruimtijd. Voor elk document dat langer is dan één pagina is de conversie beter dan de totale tijd van kopiëren en plakken van PDF naar bruikbaar Word-bestand.
Omgaan met niet-standaardcoderingen en tekst van rechts naar links
PDF's die zijn gemaakt op basis van oudere systemen of niet-Latijnse scripts bieden extra uitdagingen op het gebied van kopiëren en plakken. Documenten die Arabische, Hebreeuwse, Chinese of Japanse tekst bevatten, gebruiken coderingsschema's die het systeemklembord mogelijk niet correct interpreteert. De visuele tekst wordt correct weergegeven op het scherm omdat de PDF-viewer over de benodigde lettertype- en coderingstabellen beschikt. Het klembord, dat deze tabellen mist, produceert een volledig onleesbare uitvoer.
Conversietools die zijn ontworpen voor meertalige PDF's omvatten coderingsdetectie die het klembord niet heeft. Ze analyseren de lettertypecoderingstabellen van de PDF, wijzen de glyph-indexen toe aan de juiste Unicode-codepunten en voeren correct gecodeerde tekst uit. Voor documenten met gemengde taalinhoud, Engelse hoofdtekst met Arabische voetnoten, Chinese labels op diagrammen, is een meertalige converter essentieel. De klembordbenadering zal mislukken in ten minste één van de talen, en vaak in alle talen.
Wanneer de brontoepassing de betere optie is
Het schoonste Word-document is afkomstig van de applicatie die de PDF heeft gemaakt. Als de PDF uit Word is geëxporteerd, opent u het originele Word-bestand opnieuw. Als het is geëxporteerd vanuit Google Documenten, download het dan als een Word-bestand. De brontoepassing heeft de oorspronkelijke opmaak, stijlen en structuur die in de PDF zijn afgevlakt.
PDF's zijn een distributieformaat, geen bewerkingsformaat. Ze zijn ontworpen om er overal hetzelfde uit te zien en niet om te worden aangepast. Wanneer bewerken nodig is, ga dan terug naar de bron. Als de bron niet beschikbaar is en de PDF het enige is dat u hebt, gebruik dan een geschikt conversieprogramma en niet kopiëren en plakken. De tool is voor deze taak gebouwd. Het klembord was dat niet.
Probeer PDF naar Word
Geen installatie nodig. Werkt rechtstreeks in uw browser.
