Het converteren van een PDF naar Word is al uitdagend genoeg als het brondocument in het Engels is, met een eenvoudige leesvolgorde van links naar rechts en van boven naar beneden. Wanneer het brondocument in het Arabisch, Hebreeuws, Perzisch of Urdu is, moet de conversie ook correct bepalen dat de tekst van rechts naar links loopt, dat getallen binnen RTL-tekst van links naar rechts worden geschreven en dat de algehele pagina-indeling vanaf de rechterkant begint. De meeste PDF naar Word-converters zijn voornamelijk ontworpen en getest op LTR-documenten, en hun prestaties op RTL-inhoud variëren van onvolmaakt tot volledig onbruikbaar.
Het PDF-formaat slaat de leesvolgorde niet expliciet op als eigenschap van de tekst. Het slaat individuele tekstruns op als gepositioneerde glyphs op de pagina. Voor LTR-tekst kan een converter er redelijkerwijs van uitgaan dat de tekst van links naar rechts en van boven naar beneden wordt gelezen, omdat dat overeenkomt met de fysieke lay-out. Voor RTL-tekst is deze aanname volkomen onjuist. Een regel Arabische tekst die van rechts naar links op de pagina wordt gelezen, wordt omgekeerd door een converter die de LTR-volgorde aanneemt, waardoor uitvoer wordt geproduceerd waarbij elke regel achterstevoren wordt gespeld. Dit is geen klein formatteringsprobleem. Een omgekeerde regel Arabisch is onleesbaar voor een Arabische spreker.
Uit een onderzoek uit 2025 naar de nauwkeurigheid van PDF-naar-tekstextractie in meerdere talen bleek dat het foutpercentage bij RTL-extractie 3,6 keer hoger was dan bij LTR-extractie bij dezelfde set conversietools, waarbij omkering van de woordvolgorde het meest voorkomende fouttype was (Computational Linguistics Institute, "Multilingual PDF Text Extraction Accuracy", 2025). Uit het onderzoek bleek ook dat de fouten niet willekeurig waren. Specifieke tools verwerkten RTL consistent correct of produceerden systematisch omgekeerde uitvoer, wat betekent dat het kiezen van de juiste tool voor RTL-conversie belangrijker is dan het aanpassen van de conversie-instellingen, en het wisselen van tools kan een conversie repareren die hopeloos kapot lijkt.

Hoe PDF RTL-tekst opslaat en waarom eenvoudige extractie mislukt
In een PDF wordt tekst opgeslagen als een reeks glyph-indexen en positioneringsopdrachten. Voor elke tekstuitvoering specificeert de PDF het lettertype, de glyph-codes voor de tekens en de X- en Y-coördinaten van elke glyph op de pagina. Er is geen expliciete vlag die zegt: "Deze tekst is Arabisch". of "deze regel loopt van rechts naar links." Een PDF Converter moet de tekstrichting afleiden uit de Unicode-tekencodes, die de directionaliteit coderen via het Unicode Bidirectionele Algoritme. Arabische en Hebreeuwse tekens hebben een intrinsieke RTL-richting, en het Unicode-algoritme specificeert hoe een gemengde reeks RTL- en LTR-tekens opnieuw moet worden gerangschikt voor weergave.
Het probleem is dat de onbewerkte extractievolgorde van glyphs uit een PDF mogelijk niet overeenkomt met de logische volgorde van de tekens in de originele tekst. Het staat een PDF-schrijver vrij om glyphs in elke volgorde op de pagina te plaatsen, en sommige schrijverssoftware plaatst RTL-glyphs van links naar rechts in de inhoudsstroom, ook al is de leesvolgorde van rechts naar links. Een converter die naïef de glyphs in extractievolgorde aaneenvoegt, zal tekst produceren die correct of achterstevoren wordt gelezen, afhankelijk van hoe de oorspronkelijke PDF-schrijver ervoor heeft gekozen de tekst te coderen. Hetzelfde Arabische document kan, wanneer het vanuit twee verschillende tekstverwerkers naar PDF wordt afgedrukt, inhoudsstromen met verschillende glyph-volgorde produceren, en een converter die voor de één perfect werkt, kan voor de ander omgekeerde tekst produceren.
Het Unicode Bidirectionele Algoritme, gespecificeerd in Unicode Standaard Bijlage 9, definieert hoe een reeks tekens met gemengde directionaliteit opnieuw moet worden geordend voor weergave. Een converter die dit algoritme correct implementeert, kan de meeste RTL-tekst correct verwerken, ongeacht de glyph-volgorde in de PDF-inhoudsstroom. De kwaliteit van de implementatie varieert echter. Het algoritme kan algemene gevallen goed verwerken, maar heeft randgevallen met geneste directionele overschrijvingen, interpunctie bij richtingsgrenzen en tekst in gemengd schrift, zoals een Engelse technische term in een Arabische zin.
Probeer PDF naar Word
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Een converter kiezen die de RTL-leesvolgorde afhandelt
De meest betrouwbare converters voor RTL-documenten zijn degenen die het Unicode Bidirectionele Algoritme implementeren tijdens tekstextractie. Adobe Acrobat Pro en verschillende open-sourcebibliotheken, waaronder Apache PDFBox en pdfplumber, ondersteunen dit algoritme in verschillende mate. Voordat u een converter voor een RTL-documentbatch kiest, moet u deze testen met één representatieve pagina. Extraheer de tekst naar Word en vergelijk de uitvoer woord voor woord met de originele PDF. Controleer of de woordvolgorde binnen zinnen is omgedraaid, of de cijfers in RTL-tekst correct zijn geplaatst en of er sprake is van gemengde LTR/RTL-reeksen, zoals een Engelse bedrijfsnaam in een Arabische alinea.
Als uw converter consequent RTL-tekst omkeert, kunt u het probleem soms omzeilen door een conversiepad te gebruiken dat via een tussenliggend formaat loopt. Converteer de PDF naar HTML of naar een getagd tekstformaat met behulp van een tool die RTL correct verwerkt. Importeer vervolgens het tussenformaat in Word. Dit tweestapsproces is minder handig dan directe PDF-naar-Word-conversie, maar wanneer het directe pad omgekeerde tekst oplevert, is het indirecte pad de enige geautomatiseerde route naar bruikbare uitvoer.
WukongPDF ondersteunt RTL-bewuste conversie die automatisch de juiste leesrichting en tekstuitlijning toepast wanneer de metadata van het brondocument een RTL-taal aangeeft. De converter detecteert het primaire script van het document en past de juiste richtingsregels toe tijdens de tekstextractie, waardoor een Word-document wordt geproduceerd met de juiste alinearichting, tekstuitlijning en tekenvolgorde.
De structuur van de pagina-indeling behouden met RTL-documenten
De leesvolgorde heeft meer invloed dan alleen tekst. De gehele pagina-indeling van een RTL-document wordt gespiegeld ten opzichte van een LTR-document. De eerste pagina van een Arabisch boek is wat een Engelse lezer als de laatste pagina zou beschouwen. Tabellen lopen van rechts naar links. Lijsten zijn aan de rechterkant ingesprongen. De inbindmarge bevindt zich aan de rechterkant van de rechterpagina's. Een conversie die de tekstrichting correct afhandelt maar de lay-outstructuur niet aanpast, levert een Word-document op waarin de tekst correct wordt gelezen, maar alles is gepositioneerd alsof het een LTR-document is, met links uitgelijnde alinea's en links ingesprongen lijsten die er voor een RTL-lezer verkeerd uitzien.
Wanneer de PDF-naar-Word-conversie bedoeld is voor bewerken en opnieuw exporteren, is het behouden van de lay-out PDF-formaat minder belangrijk omdat de editor de structuur zal aanpassen. Wanneer de conversie voor archiverings- of referentiedoeleinden is, waarbij het Word-document visueel moet overeenkomen met de originele PDF, is het behoud van de lay-out belangrijker. Kies in deze gevallen een converter die de positionering van het tekstvak, de kolomindeling en de uitlijning van de marges behoudt ten opzichte van het origineel. Controleer na de conversie handmatig of de tekstrichting op elke pagina correct is. Controleer of de alinea-uitlijning is ingesteld op rechts uitgelijnd voor Arabische en Hebreeuwse tekst in plaats van de standaard links uitgelijnd. Controleer of de kolommen van alle tabellen in de juiste volgorde van rechts naar links staan. Deze handmatige controles sporen problemen op die geautomatiseerde conversie niet kan detecteren omdat de converter geen inzicht heeft in de semantische betekenis van de inhoud.
Probeer PDF naar Word
Geen installatie nodig. Werkt rechtstreeks in uw browser.
