Wenn Sie eine PDF-Datei über ein Übersetzungstool ausführen, weist das resultierende Dokument häufig Formatierungsprobleme auf, die über einfache Layoutverschiebungen hinausgehen. Sonderzeichen wie mathematische Symbole, Währungszeichen und Buchstaben mit Akzent können durch leere Kästchen, Fragezeichen oder völlig falsche Zeichen ersetzt werden. Eingebettete Schriftarten werden möglicherweise nicht mehr gerendert, sodass ganze Textabschnitte verschwinden oder in einer Standardsystemschriftart angezeigt werden. Wenn Sie verstehen, was mit Symbolen und PDF-Schriftarten während der Übersetzung passiert, können Sie diese Probleme antizipieren und den richtigen Übersetzungsansatz für Dokumente wählen, bei denen es auf Symbolgenauigkeit ankommt.
Wichtige Erkenntnisse
PDF-Übersetzungstools funktionieren, indem sie die Textebene aus dem Dokument extrahieren, sie durch eine maschinelle Übersetzungsmaschine laufen lassen und den übersetzten Text wieder in das ursprüngliche Layout einfügen. Symbole und Sonderzeichen sind in jeder Phase dieser Pipeline gefährdet: Beim Extrahieren wird die Symbolkodierung möglicherweise falsch interpretiert, die Übersetzungsmaschine kann nicht alphabetische Zeichen entfernen oder beschädigen und beim erneuten Einfügen kann es zu Problemen bei der Schriftartersetzung kommen, wenn die Zielsprache Zeichen verwendet, die in den eingebetteten Schriftarten des Originaldokuments nicht vorhanden sind.

Wie die PDF-Übersetzung die Textextraktionsphase handhabt
Bevor eine Übersetzung erfolgen kann, muss das Tool lesbaren Text aus der PDF-Datei extrahieren. Bei einer nativen digitalen PDF-Datei mit eingebettetem Text liest diese Extraktion die Zeichencodes aus den Inhaltsströmen des Dokuments und ordnet sie mithilfe der Kodierungstabelle der eingebetteten Schriftart Unicode-Werten zu. Symbole und Sonderzeichen werden in dieser Phase problematisch, wenn die Codierungstabelle unvollständig oder beschädigt ist oder eine benutzerdefinierte Zuordnung verwendet, die nicht den Unicode-Konventionen entspricht. Eine mit älterer Software erstellte PDF-Datei verwendet möglicherweise eine nicht standardmäßige Codierung, bei der das, was auf dem Bildschirm wie ein Euro-Zeichen aussieht, intern als Zeichencode gespeichert wird, der in Standard-Unicode-Tabellen nichts zuordnen kann.
Wenn die Codierungszuordnung fehlschlägt, erzeugt der Extraktionsprozess Ersatzzeichen, typischerweise das Unicode-Ersatzzeichen oder ein Fragezeichen. Dieser Fehler passiert stillschweigend. Der extrahierte Text sieht auf den ersten Blick normal aus, da die Buchstaben und Zahlen rund um das Symbol in Ordnung sind, aber das Währungszeichen, der mathematische Operator oder der Buchstabe mit Akzent, der für die Bedeutung des Dokuments entscheidend war, ging verloren, bevor die Übersetzung überhaupt begann. Eine Extraktionsphase, die das Euro-Zeichen in einem Finanz-PDF nicht auflösen kann, wird zu „Gesamt: 2.500 Euro“. in „Gesamt: 2.500“ oder „Gesamt: 2.500 ?“ und die übersetzte Ausgabe wird diesen Fehler erben.
Versuchen Sie PDF übersetzen
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Was die Übersetzungsmaschine mit Symbolen und Sonderzeichen macht
Maschinelle Übersetzungsmaschinen sind für Texte in natürlicher Sprache optimiert. Wenn sie auf einen Satz stoßen, der eine Mischung aus Wörtern und Symbolen enthält, beispielsweise eine technische Spezifikation oder einen Finanzbericht, hängt die Symbolbehandlung von der jeweiligen Engine und dem Sprachpaar ab. Die meisten modernen neuronalen maschinellen Übersetzungssysteme verarbeiten Symbole, die sie als nichtsprachlich erkennen, wie etwa Währungszeichen, Prozentzeichen und gängige mathematische Operatoren. Aber weniger gebräuchliche Symbole, wie das in juristischen Dokumenten verwendete Abschnittszeichen, das Gradsymbol in wissenschaftlichen Texten oder eine spezielle Notation aus einer bestimmten Branche, können durch den Textnormalisierungsschritt der Übersetzungsmaschine weggelassen oder ersetzt werden.
Der Normalisierungsschritt, der vor der eigentlichen Übersetzung läuft, wandelt den Eingabetext in eine standardisierte Form um. Es kann Text in Kleinbuchstaben schreiben, Satzzeichen entfernen, die es für unwesentlich hält, und Unicode-Zeichen in ihre kanonischen Formen normalisieren. Für die meisten Dokumente ist dies hilfreich. Dadurch wird verhindert, dass die Übersetzungsmaschine „Hallo“ verarbeitet. und „Hallo“ als verschiedene Wörter. Aber bei Dokumenten, in denen bestimmte Symbole eine Bedeutung haben, kann die Normalisierung Schaden anrichten. Eine chemische Formel, die tiefgestellte Zahlen verwendet, ein Satz von GPS-Koordinaten mit Grad- und Minutensymbolen oder ein juristisches Zitat mit Abschnittsmarkierungen können durch die Normalisierung auf eine Weise verändert werden, die ihre Bedeutung verändert oder sie unleserlich macht.
Schriftartenersetzung: Warum übersetzter Text oft anders aussieht
Die visuelle Wirkung der Schriftartersetzung reicht von subtil bis schwerwiegend. Wenn eine lateinische Schriftart eine andere lateinische Schriftart ersetzt, ändern sich die Zeichenbreiten geringfügig, der Text bleibt jedoch lesbar. Wenn eine lateinische Schriftart ein nicht-lateinisches Schriftsystem ersetzt, ist das Ergebnis normalerweise eine Reihe leerer Rechtecke oder Fragezeichen, da die lateinische Schriftart keines der erforderlichen Zeichen enthält. Aus diesem Grund erfordert die Übersetzung in die Sprachen Arabisch, Chinesisch, Japanisch, Koreanisch oder Kyrillisch bei der Wiedereinfügung besondere Aufmerksamkeit auf die Verfügbarkeit der Schriftarten.
Nach der Übersetzung muss der neue Text wieder in das PDF eingefügt werden. Die eingebetteten Schriftarten des Originaldokuments enthalten nur die Zeichen, die im Originaltext vorhanden waren. Wenn der übersetzte Text Zeichen enthält, die nicht im Original enthalten waren, wie etwa Akzentzeichen in französischen oder spanischen Übersetzungen eines englischen Dokuments, können die ursprünglich eingebetteten Schriftarten diese nicht wiedergeben. Der PDF-Viewer greift auf eine Ersatzschriftart zurück, die mit ziemlicher Sicherheit anders aussieht als der umgebende Text. Das Ergebnis ist ein Dokument, in dem der größte Teil des Textes in der Originalschrift erscheint, aber gelegentlich übersetzte Wörter oder Zeichen mit Akzent in einer sichtbar anderen Schriftart erscheinen, was der Seite ein lückenhaftes, unprofessionelles Aussehen verleiht.
Dieses Problem ist am schwerwiegendsten, wenn in Sprachen übersetzt wird, die völlig unterschiedliche Schriftsysteme verwenden. Für die Übersetzung einer englischen PDF-Datei ins Russische, Arabische, Chinesische oder Japanische sind Zeichen erforderlich, die keine lateinische Schriftart enthält. Der gesamte übersetzte Text muss mit einer Ersatzschriftart wiedergegeben werden und der visuelle Charakter des Dokuments ändert sich vollständig. Die Layoutgeometrie, die für den Originaltext funktioniert hat, mit ihren spezifischen Zeichenbreiten und Zeilenhöhen, passt nicht zum übersetzten Text. Zeilenumbrüche werden verschoben, Absätze werden größer oder kleiner und sorgfältig ausgerichtete Elemente werden falsch ausgerichtet.
Auswahl eines Übersetzungsansatzes basierend auf der Symbolempfindlichkeit
Eine praktische Vorübersetzungsprüfung besteht darin, das PDF zu öffnen und einen Absatz, der Sonderzeichen enthält, in einen Nur-Text-Editor zu kopieren. Wenn die Sonderzeichen den Vorgang des Kopierens und Einfügens unbeschadet überstehen, ist die Textkodierung der PDF-Datei Standard und es ist unwahrscheinlich, dass sie durch die Extraktionsphase der Übersetzung beschädigt werden. Wenn die Zeichen beim Einfügen verstümmelt werden oder verschwinden, verwendet die PDF-Datei eine nicht standardmäßige Kodierung, die zu Problemen bei der Übersetzung führt. Das Korrigieren der Kodierung an der Quelle, beispielsweise durch die Neuerstellung der PDF-Datei mit aktivierter Schriftarteneinbettung, ist effektiver als der Versuch, beschädigte Zeichen nach der Übersetzung wiederherzustellen.
Für Dokumente, bei denen Symbole von entscheidender Bedeutung sind, wie z. B. Finanzberichte, wissenschaftliche Arbeiten, juristische Unterlagen und technische Handbücher, ist die Verwendung von a der sicherste Ansatz
Akzeptieren Sie bei Dokumenten, die in ein anderes Schriftsystem übersetzt werden, dass die Ausgabe anders aussieht als das Original und planen Sie entsprechend. Anstatt eine pixelgenaue Layoutübereinstimmung zu erwarten, konzentrieren Sie sich darauf, ein sauberes, lesbares Dokument in der Zielsprache zu erstellen. Planen Sie nach der Übersetzung Zeit für die manuelle oder halbautomatische Layoutanpassung ein. Passen Sie die Spaltenbreiten an, richten Sie Tabellen neu aus und prüfen Sie, ob alle Sonderzeichen korrekt dargestellt wurden. Die zusätzliche Zeit, die für die Formatierung nach der Übersetzung aufgewendet wird, ist mit den Kosten für die Arbeit mit verschiedenen Schreibsystemen verbunden, und Tools, die eine nahtlose skriptübergreifende Übersetzung ohne jegliche Layoutarbeit versprechen, vereinfachen ein wirklich schwieriges Problem zu sehr. Das Übersetzungstool von WukongPDF behält eingebettete Schriftartdaten während des gesamten Konvertierungsprozesses bei und minimiert so die Symbolbeschädigung, die auftritt, wenn Schriftarten während des erneuten Einfügens von Text ersetzt werden.
Häufig gestellte Fragen
Soll ich ein PDF direkt übersetzen oder es zuerst in ein bearbeitbares Format konvertieren, dieses übersetzen und erneut als PDF exportieren? Der zweistufige Ansatz – Konvertieren in Word, Übersetzen des Word-Dokuments und Zurückexportieren in PDF – führt im Allgemeinen zu einer besseren Symboltreue, da Word Unicode konsistenter verarbeitet als die Rohtextextraktion im PDF-Format. Der Preis besteht darin, dass der Roundtrip durch Word Layoutänderungen mit sich bringt, die manuell korrigiert werden müssen. Bei kurzen Dokumenten lohnt sich der Layout-Aufwand der zweistufigen Methode. Bei sehr langen Dokumenten ist die direkte PDF-Übersetzung mit einem Tool, das die Kodierung beibehält, praktischer.
Kann ich eine PDF-Datei übersetzen, indem ich den Text extrahiere, ihn extern übersetze und ihn manuell wieder in das PDF-Layout einfüge? Ja, diese manuelle Pipeline gibt Ihnen in jeder Phase die vollständige Kontrolle über die Symbolverarbeitung und die Schriftartenauswahl, sie ist jedoch zeitaufwändig und nur für kurze Dokumente praktisch. Bei einem 50-seitigen technischen Handbuch ist ein manuelles erneutes Einfügen nicht möglich. Die Entscheidung zwischen automatisierter und manueller Übersetzung hängt letztendlich davon ab, wie viel Kontrolle Sie über die Ausgabe benötigen und wie viel Zeit Sie investieren können.
Kann ich Symbolverlust verhindern, indem ich das PDF vor der Übersetzung in Word konvertiere?
Durch die Konvertierung in Word erhält das Übersetzungstool zunächst Zugriff auf den Text über die Unicode-Verarbeitung von Microsoft Word, die im Allgemeinen zuverlässiger ist als die Rohtextextraktion im PDF-Format. Dieser zusätzliche Schritt behebt häufig codierungsbedingte Symbolverluste, insbesondere bei Dokumenten, die mit moderner Software erstellt wurden, die bereits die Standard-Unicode-Codierung verwendet. Der Nachteil besteht darin, dass die Word-Konvertierung selbst zu Layoutänderungen führen kann. Bei symbollastigen Dokumenten rechtfertigt die verbesserte Zeichengenauigkeit in der Regel den Aufwand für das Layout.
Warum gehen mathematische Gleichungen bei der PDF-Übersetzung oft kaputt?
Mathematische Gleichungen in PDFs werden normalerweise als eine Mischung aus Textzeichen für Variablen und Zahlen sowie speziellen mathematischen Symbolen aus einer speziellen Mathematikschriftart sowie vektorgezeichneten Bruchstrichen, Wurzelzeichen und anderen Notationselementen gespeichert. Wenn die Übersetzungsmaschine die Textebene verarbeitet, behandelt sie die Gleichung als Satz und ordnet möglicherweise die Symbolsequenz neu oder normalisiert sie. Die vektorgezeichneten Elemente sind überhaupt kein Text und durchlaufen die Übersetzung, ohne berührt zu werden, aber ihre Ausrichtung relativ zum übersetzten Text ist fast immer fehlerhaft. Bei Dokumenten mit umfangreichem Mathematikinhalt besteht der zuverlässigste Ansatz darin, Gleichungen von der Übersetzung auszuschließen und nur die umgebende Prosa zu übersetzen.
Gibt es ein PDF-Format, das die Übersetzung PDF-Format besser handhabt als andere?
PDF/A mit vollständig eingebetteten Unicode-Schriftarten lässt sich zuverlässiger übersetzen als Standard-PDFs mit Teilschriftarten und benutzerdefinierten Kodierungen. Durch die vollständige Einbettung und Unicode-Anforderung in PDF/A werden die beiden häufigsten Ursachen für Symbolbeschädigungen während der Übersetzung beseitigt: fehlende Schriftartenglyphen und nicht standardmäßige Zeichenzuordnungen. Wenn Sie wissen, dass ein Dokument übersetzt werden wird, ist es ein lohnenswerter Schritt, es vor der Übersetzung als PDF/A zu speichern.
Versuchen Sie PDF übersetzen
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
