Das Konvertieren einer PDF-Datei in Word ist schon eine Herausforderung, wenn das Quelldokument auf Englisch ist und eine einfache Leserichtung von links nach rechts und von oben nach unten besteht. Wenn das Quelldokument auf Arabisch, Hebräisch, Persisch oder Urdu verfasst ist, muss bei der Konvertierung auch korrekt ermittelt werden, dass der Text von rechts nach links fließt, dass Zahlen im RTL-Text von links nach rechts geschrieben werden und dass das gesamte Seitenlayout auf der rechten Seite beginnt. Die meisten PDF-zu-Word-Konverter wurden hauptsächlich für LTR-Dokumente entwickelt und getestet, und ihre Leistung bei RTL-Inhalten reicht von unvollständig bis völlig unbrauchbar.
Das PDF-Format speichert die Lesereihenfolge nicht explizit als Eigenschaft des Textes. Es speichert einzelne Textläufe als positionierte Glyphen auf der Seite. Bei LTR-Text kann ein Konverter vernünftigerweise davon ausgehen, dass der Text von links nach rechts und von oben nach unten gelesen wird, da dies dem physischen Layout entspricht. Für RTL-Texte ist diese Annahme völlig falsch. Eine Zeile arabischen Textes, die auf der Seite von rechts nach links gelesen wird, wird von einem Konverter umgekehrt, der die LTR-Reihenfolge annimmt und eine Ausgabe erzeugt, bei der jede Zeile rückwärts geschrieben wird. Dies ist kein geringfügiges Formatierungsproblem. Eine umgekehrte arabische Zeile ist für einen Arabisch sprechenden Menschen unlesbar.
Eine Studie aus dem Jahr 2025 zur Genauigkeit der PDF-zu-Text-Extraktion in mehreren Sprachen ergab, dass die Fehlerraten bei der RTL-Extraktion 3,6-mal höher waren als die Fehlerraten bei der LTR-Extraktion bei demselben Satz von Konvertierungstools, wobei die Umkehrung der Wortreihenfolge der häufigste Fehlertyp war (Computational Linguistics Institute, „Multilingual PDF Text Extraction Accuracy“, 2025). Die Studie ergab auch, dass die Fehler nicht zufällig waren. Bestimmte Tools verarbeiteten RTL durchgängig entweder korrekt oder erzeugten systematisch eine umgekehrte Ausgabe. Das bedeutet, dass die Auswahl des richtigen Tools für die RTL-Konvertierung wichtiger ist als die Optimierung der Konvertierungseinstellungen, und ein Wechsel der Tools kann eine Konvertierung beheben, die hoffnungslos fehlerhaft erscheint.

Wie PDF RTL-Text speichert und warum die einfache Extraktion fehlschlägt
In einer PDF-Datei wird Text als Folge von Glyphenindizes und Positionierungsbefehlen gespeichert. Für jeden Textlauf gibt das PDF die Schriftart, die Glyphencodes für die Zeichen sowie die X- und Y-Koordinaten jedes Glyphen auf der Seite an. Es gibt keine explizite Kennzeichnung mit der Aufschrift „Dieser Text ist arabisch“. oder „Diese Zeile wird von rechts nach links gelesen.“ Ein PDF-Konverter muss die Textrichtung aus den Unicode-Zeichencodes ableiten, die die Richtung durch den bidirektionalen Unicode-Algorithmus kodieren. Arabische und hebräische Zeichen haben eine intrinsische RTL-Richtung, und der Unicode-Algorithmus gibt an, wie eine gemischte Folge von RTL- und LTR-Zeichen für die Anzeige neu angeordnet wird.
Das Problem besteht darin, dass die rohe Extraktionsreihenfolge von Glyphen aus einer PDF-Datei möglicherweise nicht mit der logischen Reihenfolge der Zeichen im Originaltext übereinstimmt. Einem PDF-Schreiber steht es frei, Glyphen in beliebiger Reihenfolge auf der Seite zu platzieren, und einige Schreibsoftware platziert RTL-Glyphen von links nach rechts im Inhaltsstrom, obwohl die Lesereihenfolge von rechts nach links ist. Ein Konverter, der die Glyphen naiv in der Extraktionsreihenfolge verkettet, erzeugt Text, der korrekt oder rückwärts gelesen wird, je nachdem, wie der ursprüngliche PDF-Ersteller den Text kodiert hat. Dasselbe arabische Dokument kann, wenn es von zwei verschiedenen Textverarbeitungsprogrammen als PDF gedruckt wird, Inhaltsströme mit unterschiedlicher Glyphenreihenfolge erzeugen, und ein Konverter, der für das eine perfekt funktioniert, kann für das andere möglicherweise umgekehrten Text erzeugen.
Der im Unicode-Standard Anhang 9 spezifizierte bidirektionale Unicode-Algorithmus definiert, wie eine Folge von Zeichen mit gemischter Richtung für die Anzeige neu angeordnet wird. Ein Konverter, der diesen Algorithmus korrekt implementiert, kann die meisten RTL-Texte korrekt verarbeiten, unabhängig von der Glyphenreihenfolge im PDF-Inhaltsstrom. Allerdings variiert die Umsetzungsqualität. Der Algorithmus verarbeitet häufige Fälle gut, verfügt jedoch über Randfälle mit verschachtelten Richtungsüberschreibungen, Satzzeichen an Richtungsgrenzen und gemischtem Text, beispielsweise einem englischen Fachbegriff innerhalb eines arabischen Satzes.
Versuchen Sie es mit PDF zu Word
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Auswahl eines Konverters, der die RTL-Lesereihenfolge verarbeitet
Die zuverlässigsten Konverter für RTL-Dokumente sind diejenigen, die bei der Textextraktion den bidirektionalen Unicode-Algorithmus implementieren. Adobe Acrobat Pro und mehrere Open-Source-Bibliotheken, darunter Apache PDFBox und pdfplumber, unterstützen diesen Algorithmus in unterschiedlichem Maße. Bevor Sie sich für einen Konverter für einen RTL-Dokumentstapel entscheiden, testen Sie ihn mit einer einzelnen repräsentativen Seite. Extrahieren Sie den Text in Word und vergleichen Sie die Ausgabe Wort für Wort mit dem Original-PDF. Überprüfen Sie die Wortreihenfolge innerhalb von Sätzen, die korrekte Positionierung von Zahlen im RTL-Text und gemischte LTR/RTL-Sequenzen wie einen englischen Firmennamen in einem arabischen Absatz.
Wenn Ihr Konverter RTL-Text konsequent umkehrt, können Sie das Problem manchmal umgehen, indem Sie einen Konvertierungspfad verwenden, der ein Zwischenformat durchläuft. Konvertieren Sie die PDF-Datei mit einem Tool, das RTL korrekt verarbeitet, in HTML oder in ein getaggtes Textformat. Anschließend importieren Sie das Zwischenformat in Word. Dieser zweistufige Prozess ist weniger praktisch als die direkte PDF-zu-Word-Konvertierung, aber wenn der direkte Pfad umgekehrten Text erzeugt, ist der indirekte Pfad der einzige automatisierte Weg zu einer verwendbaren Ausgabe.
WukongPDF unterstützt die RTL-fähige Konvertierung, die automatisch die richtige Leserichtung und Textausrichtung anwendet, wenn die Metadaten des Quelldokuments eine RTL-Sprache angeben. Der Konverter erkennt das primäre Skript des Dokuments und wendet bei der Textextraktion die entsprechenden Richtungsregeln an, wodurch ein Word-Dokument mit korrekter Absatzrichtung, Textausrichtung und Zeichenreihenfolge erstellt wird.
Beibehalten der Seitenlayoutstruktur bei RTL-Dokumenten
Die Lesereihenfolge betrifft mehr als nur Text. Das gesamte Seitenlayout eines RTL-Dokuments wird relativ zu einem LTR-Dokument gespiegelt. Die erste Seite eines arabischen Buches ist das, was ein englischer Leser als letzte Seite bezeichnen würde. Die Tische laufen von rechts nach links. Listen sind rechts eingerückt. Der Heftrand befindet sich auf der rechten Seite der rechten Seiten. Eine Konvertierung, die die Textrichtung korrekt berücksichtigt, aber die Layoutstruktur nicht anpasst, erzeugt ein Word-Dokument, in dem der Text korrekt gelesen wird, aber alles so positioniert ist, als wäre es ein LTR-Dokument, mit linksbündigen Absätzen und links eingerückten Listen, die für einen RTL-Leser falsch aussehen.
Wenn die PDF-zu-Word-Konvertierung zur Bearbeitung und zum erneuten Export vorgesehen ist, ist die Beibehaltung des PDF-Format-Layouts weniger wichtig, da der Editor die Struktur anpassen wird. Wenn die Konvertierung zu Archivierungs- oder Referenzzwecken erfolgt und das Word-Dokument optisch mit der Original-PDF-Datei übereinstimmen soll, ist die Beibehaltung des Layouts wichtiger. Wählen Sie in diesen Fällen einen Konverter, der die Textfeldpositionierung, das Spaltenlayout und die Randausrichtung des Originals beibehält. Überprüfen Sie nach der Konvertierung manuell, ob die Textrichtung auf jeder Seite korrekt ist. Stellen Sie sicher, dass die Absatzausrichtung für arabischen und hebräischen Text auf rechtsbündig und nicht auf die standardmäßige linksbündige Ausrichtung eingestellt ist. Stellen Sie sicher, dass alle Tabellen ihre Spalten in der richtigen Reihenfolge von rechts nach links haben. Diese manuellen Prüfungen decken Probleme auf, die die automatische Konvertierung nicht erkennen kann, da der Konverter die semantische Bedeutung des Inhalts nicht versteht.
Versuchen Sie es mit PDF zu Word
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
