Convertire un PDF in Word è già abbastanza impegnativo quando il documento di origine è in inglese, con un semplice ordine di lettura da sinistra a destra e dall'alto verso il basso. Quando il documento di origine è in arabo, ebraico, persiano o urdu, la conversione deve anche determinare correttamente che il testo scorre da destra a sinistra, che i numeri all'interno del testo RTL siano scritti da sinistra a destra e che il layout generale della pagina inizi dal lato destro. La maggior parte dei convertitori da PDF a Word sono progettati e testati principalmente su documenti LTR e le loro prestazioni su contenuti RTL vanno da imperfetti a completamente inutilizzabili.
Il formato PDF non memorizza esplicitamente l'ordine di lettura come proprietà del testo. Memorizza le singole sequenze di testo come glifi posizionati sulla pagina. Per il testo LTR, un convertitore può ragionevolmente presupporre che il testo si legga da sinistra a destra e dall'alto verso il basso perché corrisponde al layout fisico. Per il testo RTL, questo presupposto è esattamente sbagliato. Una riga di testo arabo che si legge da destra a sinistra sulla pagina verrà invertita da un convertitore che assume l'ordine LTR, producendo un output in cui ogni riga è scritta al contrario. Questo non è un problema di formattazione minore. Una riga in arabo invertita è illeggibile per chi parla arabo.
Uno studio del 2025 sull'accuratezza dell'estrazione da PDF a testo in più lingue ha rilevato che i tassi di errore di estrazione RTL erano 3,6 volte superiori ai tassi di errore di estrazione LTR nello stesso set di strumenti di conversione, con l'inversione dell'ordine delle parole che era il tipo di errore più comune (Computational Linguistics Institute, "Multilingual PDF Text Extraction Accuracy", 2025). Lo studio ha inoltre riscontrato che gli errori non erano casuali. Strumenti specifici gestivano costantemente RTL correttamente o producevano sistematicamente un output invertito, il che significa che scegliere lo strumento giusto per la conversione RTL è più importante che modificare le impostazioni di conversione e cambiare strumento può correggere una conversione che sembra irrimediabilmente interrotta.

Come il PDF memorizza il testo RTL e perché l'estrazione semplice non riesce
All'interno di un PDF, il testo viene archiviato come sequenza di indici di glifi e comandi di posizionamento. Per ogni sequenza di testo, il PDF specifica il carattere, i codici dei glifi per i caratteri e le coordinate X e Y di ciascun glifo sulla pagina. Non esiste una bandiera esplicita che dica "questo testo è arabo"; o "questa riga si legge da destra a sinistra". Un Convertitore PDF deve dedurre la direzione del testo dai codici dei caratteri Unicode, che codificano la direzionalità tramite l'algoritmo bidirezionale Unicode. I caratteri arabi ed ebraici hanno una direzione RTL intrinseca e l'algoritmo Unicode specifica come riordinare una sequenza mista di caratteri RTL e LTR per la visualizzazione.
Il problema è che l'ordine di estrazione dei glifi da un PDF potrebbe non corrispondere all'ordine logico dei caratteri nel testo originale. Uno scrittore PDF è libero di posizionare i glifi sulla pagina in qualsiasi ordine e alcuni software di scrittura inseriscono glifi RTL da sinistra a destra nel flusso di contenuto anche se l'ordine di lettura è da destra a sinistra. Un convertitore che concatena ingenuamente i glifi in ordine di estrazione produrrà testo che si legge correttamente o al contrario, a seconda di come l'autore del PDF originale ha scelto di codificare il testo. Lo stesso documento arabo, se stampato in PDF da due diversi elaboratori di testi, può produrre flussi di contenuto con un diverso ordinamento dei glifi e un convertitore che funziona perfettamente per uno può produrre testo invertito per l'altro.
L'algoritmo bidirezionale Unicode, specificato nello standard Unicode allegato 9, definisce come riordinare una sequenza di caratteri con direzionalità mista per la visualizzazione. Un convertitore che implementa correttamente questo algoritmo può gestire correttamente la maggior parte del testo RTL, indipendentemente dall'ordine dei glifi nel flusso di contenuto PDF. Tuttavia, la qualità dell’implementazione varia. L'algoritmo gestisce bene i casi comuni, ma presenta casi limite che coinvolgono sostituzioni direzionali nidificate, punteggiatura ai confini della direzione e testo in caratteri misti come un termine tecnico inglese all'interno di una frase araba.
Prova da PDF a Word
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Scegliere un convertitore che gestisca l'ordine di lettura RTL
I convertitori più affidabili per i documenti RTL sono quelli che implementano l'algoritmo bidirezionale Unicode durante l'estrazione del testo. Adobe Acrobat Pro e diverse librerie open source tra cui Apache PDFBox e pdfplumber supportano questo algoritmo a vari livelli. Prima di affidarti a un convertitore per un batch di documenti RTL, testalo con un'unica pagina rappresentativa. Estrai il testo in Word e confronta il risultato, parola per parola, con il PDF originale. Controlla l'inversione dell'ordine delle parole all'interno delle frasi, il corretto posizionamento dei numeri nel testo RTL e le sequenze miste LTR/RTL come il nome di una società inglese all'interno di un paragrafo arabo.
Se il tuo convertitore inverte costantemente il testo RTL, a volte puoi risolvere il problema utilizzando un percorso di conversione che passa attraverso un formato intermedio. Converti il PDF in HTML o in un formato di testo con tag utilizzando uno strumento che gestisca correttamente RTL. Quindi importa il formato intermedio in Word. Questo processo in due passaggi è meno conveniente della conversione diretta da PDF a Word, ma quando il percorso diretto produce testo invertito, il percorso indiretto è l'unico percorso automatizzato verso un output utilizzabile.
WukongPDF supporta la conversione compatibile con RTL che applica automaticamente la direzione di lettura e l'allineamento del testo corretti quando i metadati del documento di origine indicano una lingua RTL. Il convertitore rileva la scrittura principale del documento e applica le regole direzionali appropriate durante l'estrazione del testo, producendo un documento Word con la direzione del paragrafo, l'allineamento del testo e l'ordinamento dei caratteri corretti.
Preservare la struttura del layout della pagina con documenti RTL
L'ordine di lettura non influisce solo sul testo. L'intero layout di pagina di un documento RTL viene rispecchiato rispetto a un documento LTR. La prima pagina di un libro arabo è quella che un lettore inglese considererebbe l'ultima pagina. Le tabelle vanno da destra a sinistra. Gli elenchi sono rientrati a destra. Il margine di rilegatura si trova sul lato destro delle pagine di destra. Una conversione che gestisce correttamente la direzione del testo ma non modifica la struttura del layout produrrà un documento Word in cui il testo si legge correttamente ma tutto è posizionato come se fosse un documento LTR, con paragrafi allineati a sinistra ed elenchi con rientro a sinistra che appaiono errati a un lettore RTL.
Quando la conversione da PDF a Word è destinata alla modifica e alla riesportazione, preservare il layout Formato PDF è meno critico perché l'editor modificherà la struttura. Quando la conversione è a scopo di archivio o di riferimento, dove il documento Word deve corrispondere visivamente al PDF originale, la conservazione del layout è più importante. In questi casi, scegli un convertitore che preservi il posizionamento della casella di testo, il layout delle colonne e l'allineamento dei margini dell'originale. Dopo la conversione, verifica manualmente che la direzione del testo sia corretta su ogni pagina. Verifica che l'allineamento del paragrafo sia impostato su allineato a destra per il testo arabo ed ebraico anziché su quello predefinito allineato a sinistra. Verificare che tutte le tabelle abbiano le colonne nell'ordine corretto da destra a sinistra. Questi controlli manuali rilevano problemi che la conversione automatizzata non è in grado di rilevare perché il convertitore non comprende il significato semantico del contenuto.
Prova da PDF a Word
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
