Eine auf Französisch verfasste Forschungsarbeit enthält Abbildungen mit Bildunterschriften und Tabellen mit Überschriften, die ein englischsprachiger Rezensent verstehen muss. Der Fließtext kann auf Französisch bleiben, da der Prüfer mit einem zweisprachigen Kollegen zusammenarbeitet. Die Übersetzung des gesamten Dokuments ist unnötig und birgt die Gefahr von Fehlern im technischen Inhalt. Durch die Übersetzung nur der Bildunterschriften und Tabellenüberschriften erhält der Prüfer die Informationen, die er zur Interpretation der visuellen Elemente benötigt, ohne den Fließtext zu berühren.
Die selektive PDF-Übersetzung von Bildunterschriften und Überschriften ist eine Präzisionsaufgabe, die ein Tool erfordert, das in der Lage ist, bestimmte Textelemente anhand ihrer Position, Formatierung oder Inhaltsmuster zu identifizieren. Bildunterschriften erscheinen normalerweise in kleinerer Schriftart unter den Abbildungen. Tabellenüberschriften werden in der ersten Zeile einer Tabelle in Fettschrift angezeigt. Diese Formatierungshinweise ermöglichen eine selektive Extraktion und Übersetzung.

Identifizieren von Bildunterschriften und Überschriften für die selektive Übersetzung
Bildunterschriften in akademischen und technischen PDFs folgen vorhersehbaren Formatierungsmustern. Sie erscheinen direkt unter oder neben der Figur. Sie verwenden eine kleinere Schriftgröße als der Fließtext, typischerweise 8 bis 10 Punkt. Sie beginnen oft mit einer Zahl, gefolgt von einer Zahl. Diese Muster ermöglichen die manuelle oder automatisierte Identifizierung von Beschriftungstexten.
Tabellenüberschriften erscheinen in der ersten Zeile einer Tabelle, häufig in Fettschrift mit schattiertem Hintergrund. Die Kopfzeile unterscheidet sich strukturell von den Datenzeilen. Ein Tool zum Extrahieren von PDF-Tabellen kann die Kopfzeile anhand ihrer Position und Formatierung identifizieren, den Kopfzeilentext extrahieren und die Datenzeilen unberührt lassen.
Das PDF-Format speichert Beschriftungen und Überschriften als positionierte Textobjekte, nicht als semantisch markierte Elemente. Um sie zu extrahieren, müssen die Textposition, die Schrifteigenschaften und die Nähe zu Bildern oder Tabellenstrukturen analysiert werden. Ein allgemeines Textextraktionstool kann Bildunterschriften nicht vom Fließtext unterscheiden. Ein spezielles Tool, das das Dokumentlayout versteht.
Versuchen Sie es mit „PDF übersetzen“.
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Selektiver Übersetzungsworkflow
Extrahieren Sie zunächst den Beschriftungs- und Kopfzeilentext aus der PDF-Datei. Identifizieren Sie jede Bildunterschrift anhand ihrer Position relativ zu den Bildern und ihren Schriftarteigenschaften. Identifizieren Sie jeden Tabellenkopf anhand seiner Position in Tabellenstrukturen. Stellen Sie den extrahierten Text in einer Übersetzungsliste mit Positionsreferenzen zusammen.
Zweitens übersetzen Sie den extrahierten Text. Maschinelle Übersetzung eignet sich gut für die einfache Sprache, die in Bildunterschriften und Kopfzeilen verwendet wird. Durch die menschliche Überprüfung der Übersetzungen wird sichergestellt, dass Fachbegriffe korrekt übersetzt werden und die domänenspezifische Terminologie erhalten bleibt.
WukongPDF bietet PDF-zu-Text-Extraktionsfunktionen, mit denen bestimmte Textelemente isoliert werden können. Durch die Extraktion in Kombination mit der Übersetzung werden übersetzte Bildunterschriften und Überschriften erzeugt, während der ursprüngliche Textkörper erhalten bleibt.
Übersetzte Untertitel und Kopfzeilen werden erneut eingefügt
Platzieren Sie den übersetzten Text nach der Übersetzung wieder an den ursprünglichen Positionen im PDF. Die übersetzten Bildunterschriften ersetzen die Originalunterschriften unter jeder Abbildung. Die übersetzten Kopfzeilen ersetzen die ursprünglichen Kopfzeilen in jeder Tabelle. Der Fließtext bleibt unverändert.
Unterschiede in der Übersetzungslänge zwischen den Sprachen erfordern Aufmerksamkeit. Eine französische Bildunterschrift, die in einen längeren englischen Text übersetzt wird, benötigt möglicherweise eine etwas kleinere Schriftgröße oder einen engeren Zeilenabstand, um in den gleichen Raum zu passen. Passen Sie die Textformatierung an die Übersetzung an, ohne das Seitenlayout zu beeinträchtigen.
Wenn selektive Übersetzung der richtige Ansatz ist
Eine selektive Übersetzung ist angebracht, wenn der Leser die visuellen Elemente verstehen muss, den Fließtext jedoch nicht im Detail lesen muss. Von diesem zielgerichteten Ansatz profitieren die wissenschaftliche Zusammenarbeit über Sprachbarrieren hinweg, die technische Begutachtung internationaler Einreichungen und mehrsprachige Publikationsabläufe.
Die Kosten- und Zeiteinsparungen bei der selektiven Übersetzung im Vergleich zur vollständigen Dokumentübersetzung sind proportional zum Verhältnis von Bildunterschriften und Kopfzeilen zum Textkörper. Ein Dokument, das zu 80 Prozent aus Text und zu 20 Prozent aus Bildunterschriften besteht, spart 80 Prozent der Übersetzungskosten ein, wenn nur Bildunterschriften übersetzt werden.
Die Identifizierung von Bildunterschriften und Kopfzeilen für die selektive Übersetzung kann teilweise automatisiert werden, indem ein Dokumentlayout-Analysemodell für das spezifische Dokument- oder Publikationsformat trainiert wird. Ein auf einer Zeitschriftenvorlage trainiertes Modell kann Bildunterschriften und Überschriften in allen Artikeln, die diese Vorlage verwenden, mit hoher Genauigkeit identifizieren.
Translation-Memory-Tools können Übersetzungen wiederkehrender Bildunterschriften in mehreren Dokumenten aus demselben Bereich speichern. Ein Satz wie Abbildung
Der Qualitätssicherungsprozess für selektive Übersetzungen sollte sowohl überprüfen, ob der richtige Text übersetzt wurde, als auch, dass der falsche Text, der Fließtext, nicht übersetzt wurde. Ein Prüfer vergleicht eine Stichprobe übersetzter Untertitel mit den Originalen und überprüft außerdem, ob der Haupttext auf diesen Seiten in der Originalsprache bleibt.
Bei Dokumenten, deren Bildunterschriften numerische Verweise auf den Haupttext enthalten, siehe Abschnitt 3.2 für Einzelheiten. In der Übersetzung müssen diese Querverweise genau enthalten sein. Ein falsch übersetzter Querverweis, der auf einen nicht vorhandenen Abschnitt verweist, führt zu Verwirrung.
Wenn die übersetzten Untertitel wieder in die PDF-Datei eingefügt werden, sollte der neue Text optisch vom Originaltext unterscheidbar sein, vielleicht durch einen subtilen Farbunterschied oder eine Notation am Rand, damit die Leser verstehen, dass sie ein selektiv übersetztes Dokument sehen.
Der selektive Übersetzungsansatz kann auf andere Dokumentelemente ausgeweitet werden, die von einer gezielten Übersetzung profitieren: Zusammenfassungsübersetzung, Schlüsselwortübersetzung für internationale Datenbanken und Abbildungsbeschriftungsübersetzung für mehrsprachige Veröffentlichungen.
Für wissenschaftliche Verlage, die Zeitschriften in mehreren Sprachen produzieren, bietet die selektive Übersetzung von Bildunterschriften und Kopfzeilen einen kostengünstigen Mittelweg zwischen teurer Vollübersetzung und gar keiner Übersetzung.
Die selektive Übersetzung von Bildunterschriften und Kopfzeilen ist ein Präzisionswerkzeug für einen bestimmten Bedarf und kein Ersatz für die vollständige Übersetzung eines Dokuments, wenn das Publikum den gesamten Inhalt verstehen muss.
Die Kosteneffizienz der selektiven Übersetzung macht sie zu einer attraktiven Option für internationale Kooperationen, bei denen eine vollständige Übersetzung unerschwinglich teuer wäre.
Die selektive Übersetzung bietet eine gezielte Lösung für die Zusammenarbeit mehrsprachiger Dokumente.
Abbildungsbeschriftungen in wissenschaftlichen Arbeiten folgen vorhersehbaren Mustern, die automatische Extraktionstools erkennen können: Sie erscheinen unter Abbildungen, verwenden kleinere Schriftarten und beginnen mit „Abbildung“, gefolgt von einer Zahl.
Tabellenüberschriften unterscheiden sich strukturell von Datenzeilen, da sie oben in der Tabelle erscheinen, oft fett gedruckt sind und möglicherweise einen schattierten Hintergrund haben – Merkmale, die Extraktionstools zur Identifizierung verwenden.
Beim Extraktionsprozess sollten die ursprünglichen Formatierungsinformationen erhalten bleiben, sodass übersetzter Text wieder an den richtigen Positionen mit den richtigen Schriftarteigenschaften und Abständen platziert werden kann.
Bei mehrsprachigen Veröffentlichungen kann die selektive Übersetzung systematisch angewendet werden: Bildunterschriften und Kopfzeilen extrahieren, in alle Zielsprachen übersetzen und jede Version als separate PDF-Ebene einfügen.
Die Qualität der maschinellen Übersetzung wissenschaftlicher Bildunterschriften hat sich so weit verbessert, dass die Nachbearbeitung durch den Menschen schneller und kostengünstiger ist als die Übersetzung dieser strukturierten Textelemente von Grund auf.
Der Unterschied in der Schriftgröße zwischen Haupttext und Untertiteln ist das Hauptsignal, das automatisierte Extraktionstools zur Identifizierung von Untertiteltext verwenden. Untertitel sind in der Regel 2 bis 4 Punkt kleiner als der umgebende Haupttext.
Tabellenkopfzeilen sind an ihrer Position als erste Zeile jeder Tabelle, ihrer fetten Textformatierung und häufig einem schattierten Hintergrund zu erkennen, der sie von Datenzeilen unterscheidet.
Die extrahierten Bildunterschriften und Kopfzeilen sollten in einer strukturierten Liste zusammengestellt werden, die die Seitenzahl und Positionskoordinaten beibehält und so eine genaue Wiedereinfügung nach der Übersetzung ermöglicht.
Translation-Memory-Tools können übersetzte Untertitel aus früheren Dokumenten im selben Feld speichern, wodurch die Konsistenz verbessert und die Übersetzungskosten für wiederkehrende Terminologie gesenkt werden.
Beim erneuten Einfügen übersetzter Untertitel müssen Unterschiede in der Textlänge zwischen den Sprachen berücksichtigt und die Schriftgröße oder der Zeilenabstand nach Bedarf angepasst werden, damit der übersetzte Text in den ursprünglichen Untertitelbereich passt.
Zur Qualitätssicherung bei der selektiven Übersetzung gehört die Überprüfung, ob die richtigen Textelemente extrahiert wurden, dass die Übersetzungen korrekt sind und dass der Textkörper nicht versehentlich geändert wurde.
Bei wissenschaftlichen Zeitschriften, die Artikel in mehreren Sprachen veröffentlichen, kann die selektive Übersetzung von Bildunterschriften und Kopfzeilen als Standardschritt in den Produktionsworkflow integriert werden.
Die Kosteneinsparungen bei der selektiven Übersetzung im Vergleich zur Vollübersetzung machen die internationale Zusammenarbeit auch für Projekte und Publikationen mit begrenzten Übersetzungsbudgets zugänglich.
Die Qualität der maschinellen Übersetzung für die strukturierte, formelhafte Sprache, die in wissenschaftlichen Bildunterschriften verwendet wird, ist im Allgemeinen höher als für erzählende Texte, wodurch sich der Nachbearbeitungsaufwand verringert.
Die Möglichkeit, nur bestimmte Dokumentelemente zu übersetzen und gleichzeitig die Originalsprache des Haupttextes beizubehalten, schafft Flexibilität in internationalen Dokumenten-Workflows.
Bei Forschungskooperationen, die mehrere Sprachgemeinschaften umfassen, ermöglicht die selektive Übersetzung jedem Mitarbeiter, auf die visuellen Beweise in seiner bevorzugten Sprache zuzugreifen.
Dieser selektive Ansatz macht die Zusammenarbeit an mehrsprachigen Dokumenten für Teams und Projekte mit begrenzten Übersetzungsressourcen zugänglich.
Die gezielte Übersetzung von Bildunterschriften und Tabellenüberschriften liefert den wesentlichen Kontext, den Leser zur Interpretation visueller Elemente benötigen.
Die selektive Übersetzung von Bildunterschriften und Kopfzeilen ermöglicht es internationalen Lesern, die visuellen Beweise in einem Dokument zu verstehen, ohne dass eine vollständige Übersetzung des Haupttextes erforderlich ist.
Dieser gezielte Ansatz zur Dokumentenübersetzung senkt die Kosten und erhöht gleichzeitig die Zugänglichkeit visueller Informationen über Sprachbarrieren hinweg.
Die Extraktion von Untertiteln basiert auf den Unterschieden zwischen Schriftgröße und -position im Vergleich zum umgebenden Textkörper.
Beschriftungstext in PDF-Dateien wird in der Regel direkt unter oder neben der entsprechenden Abbildung positioniert, wobei eine Schriftgröße verwendet wird, die 2 bis 4 Punkte kleiner ist als der Haupttext, sodass er für automatisierte Extraktionstools, die Textposition und Formatierungsmerkmale analysieren, erkennbar ist.
Durch die selektive Übersetzung von Bildunterschriften und Überschriften erhalten internationale Leser Zugang zu visuellen Informationen.
Diese Fähigkeit macht die internationale Forschungszusammenarbeit zugänglicher und kostengünstiger.
Der selektive Ansatz zur Dokumentenübersetzung geht auf einen bestimmten Bedarf ein, ohne dass die Kosten einer vollständigen Übersetzung anfallen.
| Element | Identifizierungshinweis | Übersetzungspriorität | Hinweis zur Wiedereinfügung |
|---|---|---|---|
| Bildunterschrift | Untenstehende Abbildung; kleinere Schriftart; Abbildung N-Präfix | Hoch | Gleiche Position; Möglicherweise muss die Schriftgröße geändert werden |
| Tabellenkopf | Erste Reihe; deutlich; schattiertes BG | Hoch | Gleiche Zellen; Ausrichtung beibehalten |
| Achsenbeschriftung | Angrenzend an die Diagrammachsen | Medium | Möglicherweise ist eine Rotationsanpassung erforderlich |
| Legendeneintrag | Farbfeld + Text | Niedrig | Oft nicht separat extrahiert |
Versuchen Sie es mit „PDF übersetzen“.
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
