Tips & Tricks

So übersetzen Sie nur den Alt-Text und die Barrierefreiheitsbeschriftungen in einer getaggten PDF-Datei, ohne den sichtbaren Inhalt zu beeinträchtigen

Eine mit Tags versehene PDF-Datei enthält versteckte Metadaten zur Barrierefreiheit, die Bildschirmleser verwenden, um sehbehinderten Benutzern Bilder, Tabellen und Dokumentstrukturen zu beschreiben. Der sichtbare Text auf der Seite kann auf Englisch sein, während die Alternativtextbeschreibungen, Tabellenzusammenfassungen und Strukturbezeichnungen für ein internationales Publikum in mehreren Sprachen verfügbar sein müssen. Um nur diese verborgene Ebene zu übersetzen, ohne den sichtbaren Dokumentinhalt zu berühren, muss direkt mit der Tag-Struktur der PDF-Datei gearbeitet werden, eine Fähigkeit, die den meisten allgemeinen Übersetzungstools fehlt.

Der PDF/UA-Standard (Universal Accessibility, ISO 14289) verlangt, dass getaggte PDFs alternativen Text für alle Nicht-Text-Inhaltselemente bereitstellen. In einer mehrsprachigen Organisation muss für einen auf Französisch verfassten Vertrag möglicherweise der Alternativtext auf Englisch, Deutsch und Niederländisch verfügbar sein, damit die Prüfer für Barrierefreiheit in jedem Land die Einhaltung überprüfen können. Eine Übersetzung des gesamten Dokuments wäre unnötig und teuer. Nur ein paar hundert Wörter Alternativtext und Strukturbezeichnungen erfordern Aufmerksamkeit. Diese Aufgabe fällt in eine enge Kategorie, die zwischen dem vollständigen Dokument PDF übersetzen und der manuellen Bearbeitung der Barrierefreiheit liegt, und nur wenige Organisationen haben einen Standard-Workflow dafür etabliert.

Die Folgen nicht übersetzter Barrierefreiheitsmetadaten sind schwerwiegender, als es den Anschein macht. Ein Screenreader-Benutzer, der auf einen französischsprachigen Vertrag mit ausschließlich englischem Alternativtext zugreift, hört, wie englische Beschreibungen den französischen Inhalt unterbrechen, was zu einer verwirrenden und verwirrenden Erfahrung führt. Für Behörden und öffentlich geförderte Organisationen, die Barrierefreiheitsvorschriften unterliegen, stellt dies eine Compliance-Lücke dar, die rechtliche Konsequenzen haben kann. Die Übersetzung der Barrierefreiheitsebene ist für mehrsprachige Organisationen kein nettes Extra. Dies ist Teil der Erfüllung der Barrierefreiheitsverpflichtungen in allen Sprachen, die die Organisation bedient.

How to Translate Only the Alt Text and Accessibility Labels in a Tagged PDF Without Affecting Visible Content

Die PDF-Tag-Struktur verstehen und wo sich Alt-Text befindet

Ein mit Tags versehenes PDF organisiert seinen Inhalt in einem logischen Strukturbaum mit Elementen wie Dokument, Teil, Abschnitt, P, Tabelle, Abbildung und Formel. Jedes Element kann Attribute haben, und das entscheidende für die Übersetzung ist der /Alt-Eintrag, der die alternative Textbeschreibung speichert. Ein Figure-Element, das ein Diagramm darstellt, könnte über einen /Alt-Eintrag verfügen, der „Balkendiagramm mit vierteljährlichem Umsatzwachstum von Q1 2022 bis Q4 2024 mit einem Anstieg von 12 Prozent gegenüber dem Vorjahr“ enthält. Dieser Text wird niemals auf der sichtbaren Seite angezeigt. Es existiert ausschließlich in der Tag-Struktur für die Verwendung durch Bildschirmleseprogramme.

Der /Alt-Eintrag ist eine Textzeichenfolge, die entweder als PDF-Zeichenfolgenobjekt oder als XML-escaped-Zeichenfolge im markierten Inhalt des Dokuments gespeichert wird. Um es zu extrahieren, zu übersetzen und zurückzuschreiben, ohne die umgebende Tag-Struktur zu stören, ist ein Tool erforderlich, das mit Tags versehene PDF-Inhalte auf Objektebene analysieren kann. Die meisten PDF-Editoren, die einen Tag-Baum in ihrem Barrierefreiheitsfenster anzeigen, können einzelne /Alt-Einträge bearbeiten, aber die manuelle Übersetzung von Dutzenden oder Hunderten davon ist langsam und fehleranfällig, da jeder Eintrag einen separaten Öffnen-Bearbeiten-Speichern-Zyklus erfordert.

Neben /Alt-Einträgen gibt es weitere übersetzbare Barrierefreiheitselemente. Das /Summary-Attribut für Tabellenelemente bietet einen Textüberblick über die Struktur und den Zweck der Tabelle. Der /ActualText-Eintrag für Span-Elemente kann den visuellen Text für Bildschirmleseprogramme überschreiben. Dies ist nützlich, wenn der visuelle Text eine Abkürzung ist, die erweitert werden soll. Formularfeldbeschreibungen, die im /TU-Eintrag (Tooltip) gespeichert sind, müssen ebenfalls übersetzt werden. Eine vollständige Übersetzung zur Barrierefreiheit deckt alle diese Elemente ab. Bei einem 50-seitigen Vertrag mit 30 Abbildungen, 15 Tabellen und 40 Formularfeldern kann der gesamte übersetzbare barrierefreie Text 2.000 bis 3.000 Wörter umfassen, genug, damit ein Übersetzer einen Teil eines Tages damit verbringen kann, aber weit weniger als die Übersetzung des gesamten Dokumenttextes.

WukongPDF

Versuchen Sie PDF übersetzen

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Extrahieren von barrierefreiem Text für die Übersetzung

Der erste Schritt besteht darin, eine Bestandsaufnahme dessen zu machen, was übersetzt werden muss. Verwenden Sie eine PDF-Barrierefreiheitsprüfung oder einen Tag-Viewer, um eine Liste aller /Alt-, /Summary-, /ActualText- und /TU-Einträge im Dokument zu exportieren. Die meisten Tools zur Barrierefreiheitsvalidierung, einschließlich der integrierten Barrierefreiheitsprüfung in Adobe Acrobat Pro, können einen Bericht erstellen, der jedes Tag-Element mit diesen Attributen und seinen aktuellen Textwerten zeigt. Exportieren Sie diese Liste in ein strukturiertes Format wie CSV mit Spalten für den Tag-Typ, die Elementkennung, den Originaltext und eine leere Übersetzungsspalte.

Senden Sie die Originaltextzeichenfolgen an einen Übersetzer oder einen maschinellen Übersetzungsdienst. Das strukturierte Format stellt sicher, dass jede übersetzte Zeichenfolge mit ihrem Quellelement verknüpft bleibt, was für das Zurückschreiben der Übersetzungen an die richtigen Stellen unerlässlich ist. Aus Gründen der PDF-Barrierefreiheit sollten Übersetzungen denselben Qualitätsstandards entsprechen wie der ursprüngliche Alternativtext. Eine gute Alternativtextbeschreibung ist prägnant, in der Regel weniger als 150 Zeichen, und beschreibt den Inhalt und die Funktion des Elements und nicht sein Aussehen. Die Übersetzung sollte diese Prägnanz und Funktionsorientierung bewahren.

WukongPDF unterstützt die Bearbeitung von PDF-Tags und Barrierefreiheitsattributen auf der Ebene einzelner Elemente, wodurch es praktisch ist, Alternativtextübersetzungen zu aktualisieren, ohne den sichtbaren Seiteninhalt zu beeinträchtigen. Der strukturierte Tag-Editor zeigt die vollständige Elementhierarchie mit allen übersetzbaren Attributen an, und mit der Stapelaktualisierungsfunktion können Sie Übersetzungen aus einer CSV-Datei importieren und sie in einem einzigen Vorgang auf die richtigen Elemente anwenden.

Übersetzungen zurück in die Tag-Struktur schreiben

Nach Erhalt der Übersetzungen ist für den Rückschreibschritt ein Tool erforderlich, das durch den PDF-Tag-Baum navigieren und einzelne Attributwerte aktualisieren kann. Öffnen Sie die PDF-Datei in einem Tag-Editor, der den vollständigen Strukturbaum anzeigt. Suchen Sie für jedes übersetzte Element das Element in der Baumstruktur, wählen Sie dessen /Alt- oder ein anderes Attribut aus und fügen Sie den übersetzten Text ein. Speichern Sie die Datei, wenn alle Einträge aktualisiert wurden. Überprüfen Sie das Ergebnis mit einem Screenreader oder einem Tool zur Barrierefreiheitsvalidierung. Navigieren Sie mit aktivem Screenreader durch das Dokument und vergewissern Sie sich, dass jede übersetzte Beschreibung in der erwarteten Sprache gelesen wird.

Überlegen Sie bei Dokumenten, die in mehreren Sprachen verteilt werden, ob das PDF alle Sprachversionen des Alternativtextes in einer einzigen Datei enthalten soll oder ob separate sprachspezifische PDFs erstellt werden sollten. Die PDF-Spezifikation unterstützt Sprachkennzeichnung auf Elementebene, sodass eine einzelne Datei theoretisch englischen Alternativtext in Abbildung 1 und französischen Alternativtext in Abbildung 2 enthalten kann. Allerdings ist die Unterstützung von Bildschirmleseprogrammen für die Sprachumschaltung pro Element bei verschiedenen Bildschirmleseprogrammen inkonsistent. Wenn die Einhaltung der Barrierefreiheit eine Anforderung ist, sind separate PDFs pro Sprache die sicherere und zuverlässiger prüfbare Wahl.

Automatisieren des Workflows für große Dokumentensätze

Für Organisationen, die Metadaten zur Barrierefreiheit in Hunderten oder Tausenden von PDFs lokalisieren müssen, ist der manuelle Rückschreibansatz nicht skalierbar. In diesen Fällen sollten die Extraktion, Übersetzung und das Zurückschreiben per Skript erfolgen. Verwenden Sie eine PDF-Bibliothek, die den Zugriff auf Tag-Strukturen unterstützt, z. B. Apache PDFBox für Java oder pikepdf für Python, um alle übersetzbaren Attribute programmgesteuert zu extrahieren, sie an eine Übersetzungs-API zu senden und die Ergebnisse zurückzuschreiben.

Das Skript sollte jedes von ihm geänderte Attribut protokollieren und einen Vorher-Nachher-Vergleichsbericht erstellen, damit ein menschlicher Prüfer die Übersetzungen stichprobenartig überprüfen kann. Die Automatisierung des Workflows reduziert die Kosten pro Dokument, birgt jedoch das Risiko systemischer Fehler, wie etwa eines falsch übersetzten Begriffs, der in Dutzenden von Alternativtextbeschreibungen vorkommt und erst nach der Verteilung entdeckt wird. Eine Batch-Überprüfung einer Zufallsstichprobe sowie eine gezielte Überprüfung aller Übersetzungen, die von der Übersetzungs-API als wenig vertrauenswürdig eingestuft wurden, sorgen für ein Gleichgewicht zwischen Effizienz und Qualität und sorgen für eine vertretbare Qualitätssicherungsaufzeichnung.

WukongPDF

Versuchen Sie PDF übersetzen

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →