Konwersja pliku PDF do programu Word jest wystarczająco trudna, jeśli dokument źródłowy jest w języku angielskim i można go czytać od lewej do prawej, od góry do dołu. Jeśli dokument źródłowy jest w języku arabskim, hebrajskim, perskim lub urdu, podczas konwersji należy również prawidłowo określić, czy tekst przepływa od prawej do lewej, czy liczby w tekście RTL są zapisywane od lewej do prawej, a ogólny układ strony zaczyna się od prawej strony. Większość konwerterów PDF na Word jest projektowanych i testowanych głównie na dokumentach LTR, a ich działanie na treści RTL waha się od niedoskonałego do całkowicie bezużytecznego.
Format PDF nie przechowuje jawnie kolejności czytania jako właściwości tekstu. Przechowuje poszczególne ciągi tekstu jako umieszczone glify na stronie. W przypadku tekstu LTR konwerter może zasadnie założyć, że tekst jest czytany od lewej do prawej i od góry do dołu, ponieważ odpowiada to układowi fizycznemu. W przypadku tekstu RTL to założenie jest całkowicie błędne. Linia tekstu arabskiego czytana od prawej do lewej strony zostanie odwrócona przez konwerter przyjmujący kolejność LTR i generujący dane wyjściowe, w których każda linia będzie pisana od tyłu. To nie jest drobny problem z formatowaniem. Odwrócona linijka w języku arabskim jest nieczytelna dla osoby mówiącej po arabsku.
Badanie przeprowadzone w 2025 r. dotyczące dokładności ekstrakcji plików PDF na tekst w wielu językach wykazało, że współczynniki błędów ekstrakcji RTL były 3,6 razy wyższe niż współczynniki błędów ekstrakcji LTR w tym samym zestawie narzędzi do konwersji, przy czym najczęstszym typem błędu było odwrócenie kolejności słów (Computational Linguistics Institute, „Multilingual PDF Text Extraction Accuracy”, 2025). Badanie wykazało również, że błędy nie były przypadkowe. Określone narzędzia konsekwentnie albo poprawnie obsługiwały RTL, albo generowały systematycznie odwrócone dane wyjściowe, co oznacza, że wybór odpowiedniego narzędzia do konwersji RTL jest ważniejszy niż poprawianie ustawień konwersji, a przełączanie narzędzi może naprawić konwersję, która wydaje się beznadziejnie uszkodzona.

Jak plik PDF przechowuje tekst RTL i dlaczego proste wyodrębnianie kończy się niepowodzeniem
Wewnątrz pliku PDF tekst jest przechowywany jako sekwencja indeksów glifów i poleceń pozycjonowania. Dla każdego tekstu plik PDF określa czcionkę, kody glifów dla znaków oraz współrzędne X i Y każdego glifu na stronie. Nie ma wyraźnej flagi z informacją „ten tekst jest w języku arabskim”. lub „ten wiersz czyta się od prawej do lewej”. Konwerter PDF musi wywnioskować kierunek tekstu z kodów znaków Unicode, które faktycznie kodują kierunkowość za pomocą algorytmu dwukierunkowego Unicode. Znaki arabskie i hebrajskie mają wewnętrzny kierunek RTL, a algorytm Unicode określa, w jaki sposób zmienić kolejność mieszanej sekwencji znaków RTL i LTR do wyświetlenia.
Problem polega na tym, że surowa kolejność wyodrębniania glifów z pliku PDF może nie odpowiadać logicznej kolejności znaków w oryginalnym tekście. Program piszący PDF może umieszczać glify na stronie w dowolnej kolejności, a niektóre programy nagrywające umieszczają w strumieniu treści glify RTL od lewej do prawej, nawet jeśli kolejność czytania jest od prawej do lewej. Konwerter, który naiwnie łączy glify w kolejności wyodrębniania, utworzy tekst, który będzie czytany poprawnie lub od tyłu, w zależności od tego, jak oryginalny program piszący plik PDF zdecydował się zakodować tekst. Ten sam dokument arabski, wydrukowany do formatu PDF z dwóch różnych edytorów tekstu, może generować strumienie treści o różnej kolejności glifów, a konwerter, który doskonale sprawdza się w przypadku jednego, może generować odwrócony tekst w przypadku drugiego.
Algorytm dwukierunkowy Unicode, określony w załączniku 9 do normy Unicode, definiuje sposób zmiany kolejności wyświetlania sekwencji znaków o mieszanej kierunkowości. Konwerter, który poprawnie implementuje ten algorytm, może poprawnie obsłużyć większość tekstu RTL, niezależnie od kolejności glifów w strumieniu zawartości PDF. Jakość wdrożenia jest jednak różna. Algorytm dobrze radzi sobie z typowymi przypadkami, ale zdarzają się przypadki skrajne obejmujące zagnieżdżone nadpisania kierunku, znaki interpunkcyjne na granicach kierunków i tekst o mieszanym piśmie, taki jak angielski termin techniczny w zdaniu arabskim.
Wypróbuj PDF do Worda
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Wybór konwertera obsługującego kolejność odczytu RTL
Najbardziej niezawodne konwertery dokumentów RTL to te, które podczas wyodrębniania tekstu implementują algorytm dwukierunkowy Unicode. Adobe Acrobat Pro i kilka bibliotek open source, w tym Apache PDFBox i pdfplumber, obsługują ten algorytm w różnym stopniu. Zanim zdecydujesz się na konwerter dla partii dokumentów RTL, przetestuj go na jednej reprezentatywnej stronie. Wyodrębnij tekst do programu Word i porównaj wynik słowo po słowie z oryginalnym plikiem PDF. Sprawdź, czy w zdaniach nie występuje odwrócenie kolejności słów, prawidłowe rozmieszczenie liczb w tekście RTL oraz mieszane sekwencje LTR/RTL, takie jak angielska nazwa firmy w arabskim akapicie.
Jeśli konwerter konsekwentnie odwraca tekst RTL, czasami można obejść ten problem, stosując ścieżkę konwersji przechodzącą przez format pośredni. Konwertuj plik PDF na format HTML lub na format tekstu oznaczonego za pomocą narzędzia, które poprawnie obsługuje RTL. Następnie zaimportuj format pośredni do programu Word. Ten dwuetapowy proces jest mniej wygodny niż bezpośrednia konwersja pliku PDF na program Word, ale gdy ścieżka bezpośrednia generuje odwrócony tekst, ścieżka pośrednia jest jedyną zautomatyzowaną drogą do użytecznego wyniku.
WukongPDF obsługuje konwersję obsługującą RTL, która automatycznie stosuje prawidłowy kierunek czytania i wyrównanie tekstu, gdy metadane dokumentu źródłowego wskazują język RTL. Konwerter wykrywa podstawowy skrypt dokumentu i stosuje odpowiednie reguły kierunkowe podczas wyodrębniania tekstu, tworząc dokument programu Word z prawidłowym kierunkiem akapitów, wyrównaniem tekstu i kolejnością znaków.
Zachowywanie struktury układu strony w dokumentach RTL
Kolejność czytania wpływa nie tylko na tekst. Układ całego strony dokumentu RTL jest odzwierciedlony w stosunku do dokumentu LTR. Pierwsza strona książki arabskiej jest tym, co angielski czytelnik uznałby za ostatnią stronę. Tabele biegną od prawej do lewej. Listy są wcięte po prawej stronie. Margines oprawy znajduje się po prawej stronie prawych stron. Konwersja, która poprawnie obsługuje kierunek tekstu, ale nie dostosowuje struktury układu, utworzy dokument Word, w którym tekst będzie czytany poprawnie, ale wszystko będzie ułożone tak, jakby to był dokument LTR, z akapitami wyrównanymi do lewej i listami z wcięciem do lewej, które będą wyglądać źle dla czytnika RTL.
Jeśli konwersja pliku PDF na Word jest przeznaczona do edycji i ponownego eksportu, zachowanie układu Format PDF jest mniej istotne, ponieważ edytor dostosuje strukturę. Gdy konwersja ma charakter archiwalny lub referencyjny, a dokument programu Word powinien wizualnie odpowiadać oryginalnemu plikowi PDF, zachowanie układu ma większe znaczenie. W takich przypadkach wybierz konwerter, który zachowa położenie pól tekstowych, układ kolumn i wyrównanie marginesów z oryginału. Po konwersji ręcznie sprawdź, czy kierunek tekstu na każdej stronie jest prawidłowy. Sprawdź, czy dla tekstu arabskiego i hebrajskiego wyrównanie akapitu jest ustawione na wyrównanie do prawej, a nie domyślne wyrównanie do lewej. Sprawdź, czy kolumny we wszystkich tabelach są we właściwej kolejności od prawej do lewej. Te ręczne kontrole wychwytują problemy, których automatyczna konwersja nie jest w stanie wykryć, ponieważ konwertujący nie rozumie semantycznego znaczenia treści.
Wypróbuj PDF do Worda
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
