Ein PDF-Übersetzungstool verarbeitet den Textstrom im Dokument und konvertiert Wörter von einer Sprache in eine andere. Es liest die Absätze, die Überschriften und die Bildunterschriften. Der in den Bildern enthaltene Text wird jedoch nicht gelesen. Ein Foto eines Schildes, ein Screenshot einer Benutzeroberfläche in einer anderen Sprache, ein Diagramm mit als Teil des Bildes gerenderten Achsenbeschriftungen – all dies enthält Text, den Standard-Übersetzungstools ignorieren, weil der Text nicht im PDF-Textstrom enthalten ist. Es ist in die Bildpixel eingebettet. Um Text in eingebetteten Bildern zu übersetzen, müssen die Bilder extrahiert, OCR darauf ausgeführt, der erkannte Text übersetzt und dann entweder die übersetzten Bilder erneut eingebettet oder die Übersetzung als Overlay hinzugefügt werden. Der PDF übersetzen-Workflow für in Bilder eingebetteten Text ist aufwändiger als die Standardtextübersetzung, deckt jedoch Inhalte ab, die andernfalls unübersetzt bleiben würden.

Identifizieren von Bildern, die übersetzbaren Text enthalten
Nicht jedes Bild in einer PDF-Datei enthält Text, der es wert ist, übersetzt zu werden. Ein dekoratives Foto, eine Hintergrundtextur und ein Firmenlogo dürfen keinen übersetzbaren Inhalt enthalten. Ein Screenshot einer Softwareanwendung, ein Diagramm mit beschrifteten Komponenten, ein Foto eines Dokuments oder eines Zeichens und ein Diagramm mit eingebetteten Achsenbeschriftungen enthalten allesamt Text, den ein Leser in der Zielsprache verstehen muss. Scannen Sie das PDF und identifizieren Sie jedes Bild, das Text enthält. Markieren Sie diese Bilder für den Übersetzungsworkflow.
Bilder, die Text in der PDF-Datei enthalten, lassen sich in zwei Kategorien einteilen: Bilder, bei denen der Text beabsichtigt Teil des Bildes ist, z. B. ein Screenshot oder ein beschriftetes Diagramm, und Bilder, bei denen der Text im Bild erscheint, weil das Dokument gescannt und nicht digital erstellt wurde. Ein gescanntes PDF besteht aus einem großen Bild pro Seite. Der gesamte Text einer gescannten Seite wird in das Seitenbild eingebettet. Ein digital erstelltes PDF kann einen einzelnen Screenshot auf einer ansonsten textbasierten Seite enthalten. Die PDF-Bilder, die übersetzt werden müssen, sind diejenigen, bei denen Text in den Bildpixeln und nicht im PDF-Textstrom erscheint.
Versuchen Sie es mit „PDF übersetzen“.
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Bilder extrahieren und Text erkennen
Extrahieren Sie die Bilder aus dem PDF mit der höchsten verfügbaren Auflösung. Verwenden Sie ein PDF-Bildextraktionstool, das die ursprüngliche Auflösung beibehält. Speichern Sie jedes extrahierte Bild als PNG-Datei, um Komprimierungsartefakte während des Extraktionsschritts zu vermeiden. Öffnen Sie jedes extrahierte Bild und vergewissern Sie sich, dass der Text lesbar ist. Wenn die Bildauflösung zu niedrig ist, um den Text klar lesen zu können, extrahieren Sie ihn nach Möglichkeit erneut mit einer höheren Auflösung, oder beachten Sie, dass dieses Bild möglicherweise unzuverlässige OCR-Ergebnisse liefert.
Führen Sie OCR für jedes extrahierte Bild aus, um den Text zu erkennen. Die OCR-Engine identifiziert die Textbereiche innerhalb des Bildes und gibt die erkannten Zeichen zusammen mit ihrer Position aus. Speichern Sie die OCR-Ausgabe für jedes Bild, einschließlich des erkannten Texts und der Begrenzungsrahmenkoordinaten jedes Textbereichs. Diese Informationen werden später benötigt, um den übersetzten Text an der richtigen Position im Bild zu platzieren. WukongPDF übernimmt die OCR PDF-Verarbeitung, die Text in eingebetteten Bildern als Teil des Dokumentkonvertierungsworkflows erkennen kann.
Übersetzen des erkannten Textes unter Beibehaltung des Kontexts
Der aus Bildern erkannte Text ist oft fragmentarisch. Ein Diagramm kann Einzelwortbeschriftungen enthalten. Ein Screenshot kann Menüpunkte und Schaltflächenbeschriftungen ohne Satzkontext enthalten. Dieser fragmentierte Text stellt für maschinelle Übersetzungsmaschinen eine Herausforderung dar, da der umgebende sprachliche Kontext fehlt, der die Wortbedeutungen eindeutig macht. Stellen Sie so viel Kontext wie möglich bereit. Wenn eine Beschriftung „Datei“ lautet und auf einem Screenshot eines Softwaremenüs erscheint, beachten Sie in der Übersetzungseingabe, dass es sich um einen Menüpunkt und nicht um ein physisches Objekt handelt.
Behalten Sie bei Bildern mit mehreren Textbereichen die Zuordnung zwischen jedem Bereich und seiner Übersetzung bei. Ein Diagramm mit zehn Beschriftungen erzeugt zehn separate Textzeichenfolgen, die jeweils übersetzt werden müssen. Halten Sie den Originaltext, den übersetzten Text und die Koordinaten des Begrenzungsrahmens in einem strukturierten Format, beispielsweise einer Tabelle, zusammen. Diese Zuordnung wird im letzten Schritt verwendet, um den übersetzten Text auf dem Bild zu platzieren. Damit die Ausgabe von Translate PDF nützlich ist, muss der übersetzte Text an der richtigen Stelle im Bild erscheinen und den Originaltext ersetzen oder begleiten.
Übersetzten Text wieder in die Bilder einfügen
Es gibt zwei Ansätze, übersetzten Text auf Bildern zu platzieren. Beim ersten Ansatz wird der Originaltext durch die Übersetzung ersetzt. Öffnen Sie das Bild in einem Bildeditor. Löschen Sie für jeden Textbereich den Originaltext, indem Sie den Bereich mit der Hintergrundfarbe füllen. Platzieren Sie den übersetzten Text in derselben Region und verwenden Sie eine Schriftart, die dem Stil des Originals so nahe wie möglich kommt. Dieser Ansatz erzeugt ein sauber übersetztes Bild, das wie das Original aussieht, jedoch in einer anderen Sprache.
Beim zweiten Ansatz wird die Übersetzung neben dem Originaltext hinzugefügt. Platzieren Sie den übersetzten Text in einer Kontrastfarbe unter oder neben dem Originaltext. Dieser Ansatz bewahrt das Original für Leser, die beide Sprachen verstehen und die Übersetzung mit der Quelle vergleichen möchten. Das ist schneller als das Löschen und Ersetzen, aber das resultierende Bild ist optisch aufwendiger. Wählen Sie den Ansatz basierend auf den Bedürfnissen des Publikums. Ein Schulungshandbuch für Bediener, die nur die Zielsprache lesen, profitiert von der Ersetzung. Ein zweisprachiges Referenzdokument profitiert von der nebeneinanderliegenden Präsentation.
Übersetzte Bilder erneut in das PDF einbetten
Nachdem die Bilder mit übersetztem Text bearbeitet wurden, müssen sie wieder in das PDF eingefügt werden. Ersetzen Sie jedes Originalbild durch sein übersetztes Gegenstück. Das Ersatzbild muss in denselben Bereich der Seite passen wie das Original. Wenn das übersetzte Bild andere Pixelabmessungen als das Original hat, skalieren Sie es so, dass es dem ursprünglichen Begrenzungsrahmen in der PDF-Datei entspricht. Das PDF-Seitenlayout sollte sich nicht ändern. Der einzige sichtbare Unterschied sollte die Sprache des Textes in den Bildern sein.
Speichern Sie die PDF-Datei mit den übersetzten Bildern als neue Version und behalten Sie die ursprüngliche, nicht übersetzte PDF-Datei als Referenz bei. Überprüfen Sie die übersetzte PDF-Datei, indem Sie sie öffnen und jedes Bild überprüfen. Bestätigen Sie, dass der übersetzte Text lesbar, korrekt positioniert und frei von OCR- oder Übersetzungsfehlern ist. Eine PDF-Übersetzung mit eingebetteter Bildübersetzung ist abgeschlossen, wenn jedes Textelement im Dokument, im Textstrom und in den Bildern für einen Leser in der Zielsprache zugänglich ist.
Wann sollte man die manuelle Übersetzung der automatisierten vorziehen?
Bei Bildern mit kritischem Text, etwa Sicherheitswarnungen, rechtlichen Hinweisen oder technischen Spezifikationen, sollten Sie die manuelle Übersetzung durch einen menschlichen Übersetzer anstelle einer maschinellen Übersetzung in Betracht ziehen. Ein OCR-Fehler in Kombination mit einem maschinellen Übersetzungsfehler kann die Bedeutung einer Sicherheitsanweisung auf eine Weise verändern, die echte Konsequenzen hat. Die Kosten einer menschlichen Übersetzung für eine kleine Anzahl kritischer Bilder sind im Vergleich zu den Kosten einer falschen Übersetzung gering.
Implementieren Sie bei großen Bildmengen, bei denen eine manuelle Übersetzung nicht praktikabel ist, einen Überprüfungsschritt. Lassen Sie nach der maschinellen Übersetzung und erneuten Einbettung einen menschlichen Prüfer, der die Zielsprache liest, ein Beispiel der übersetzten Bilder auf Richtigkeit überprüfen. Wenn die Probe systemische Fehler aufweist, passen Sie die OCR-Einstellungen oder die Parameter der Übersetzungs-Engine an und verarbeiten Sie den Stapel erneut.
Die Übersetzung von Text in eingebettete Bilder ist oft der letzte Schritt, um ein PDF einem internationalen Publikum vollständig zugänglich zu machen. Der Fließtext, die Überschriften und Bildunterschriften wurden übersetzt. Die Bilder bleiben der endgültige unübersetzte Inhalt. Wenn Sie diesen Schritt abschließen, entsteht ein Dokument, in dem jeder Text in jedem Medium in der Zielsprache verfügbar ist.
Überlegen Sie bei häufig aktualisierten Dokumenten mit eingebetteten Bildern, ob der Bildtext während des Dokumenterstellungsprozesses in den PDF-Textstrom verschoben werden kann. Ein Diagramm mit Beschriftungen, die als Textüberlagerungen und nicht als Teil des Bildes gespeichert sind, kann mit Standard-Textübersetzungstools übersetzt werden, wodurch der Workflow „Extrahieren, OCR, Übersetzen und erneut einbetten“ vollständig vermieden wird.
Die Qualität des endgültig übersetzten Bildes hängt von der Qualität jedes einzelnen Schritts in der Pipeline ab. Eine hochauflösende Bildextraktion sorgt für eine klare OCR-Eingabe. Präzise OCR erzeugt korrekten Text für die Übersetzung. Eine gute Übersetzungsmaschine bewahrt die Bedeutung. Durch sorgfältiges Nacheinbetten bleibt die optische Qualität erhalten. Jeder Schritt hängt vom vorherigen ab.
Der Workflow PDF übersetzen für in Bilder eingebetteten Text ist das arbeitsintensivste Übersetzungsszenario, da er Bildverarbeitung, OCR, Übersetzung und erneutes Einbetten in einer einzigen Pipeline kombiniert. Durch die Automatisierung möglichst vieler Schritte wird der manuelle Aufwand reduziert.
Für Bilder, die in mehreren PDFs identisch erscheinen, wie etwa ein Firmenlogo mit Slogan oder ein Standarddiagramm, übersetzen Sie das Bild einmal und verwenden Sie es erneut. Das übersetzte Bild kann in jede PDF-Datei eingefügt werden, in der das Originalbild erscheint.
In diesem Artikel werden die wichtigsten Techniken und Überlegungen für die Arbeit mit PDFs in diesem speziellen Szenario behandelt. Die hier beschriebenen Methoden gelten für verschiedene Tools und Plattformen und geben den Lesern die Flexibilität, den Ansatz zu wählen, der am besten zu ihrem Arbeitsablauf und ihrer technischen Umgebung passt.
Die beschriebenen praktischen Schritte bieten einen klaren Weg von der ersten Herausforderung bis zu einer funktionierenden Lösung. Jede Technik wurde aufgrund ihrer Zuverlässigkeit und Zugänglichkeit ausgewählt, um sicherzustellen, dass Leser unabhängig von ihrer Vorerfahrung mit PDF-Tools konsistente Ergebnisse erzielen können.
WukongPDF und ähnliche Plattformen stellen die OCR- und Dokumentverarbeitungstools bereit, die den in diesem Artikel beschriebenen Workflow für die Bildtextübersetzung unterstützen. Die Kombination dieser Tools ermöglicht eine umfassende Übersetzungsabdeckung.
Versuchen Sie es mit „PDF übersetzen“.
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
