Tips & Tricks

Alleen de alternatieve tekst en toegankelijkheidslabels in een getagde PDF vertalen zonder de zichtbare inhoud te beïnvloeden

Een getagde PDF bevat verborgen metagegevens over toegankelijkheid die schermlezers gebruiken om afbeeldingen, tabellen en documentstructuur te beschrijven voor visueel gehandicapte gebruikers. De zichtbare tekst op de pagina kan in het Engels zijn, terwijl de alternatieve tekstbeschrijvingen, tabelsamenvattingen en structurele labels in meerdere talen beschikbaar moeten zijn voor een internationaal publiek. Om alleen deze verborgen laag te vertalen zonder de zichtbare documentinhoud aan te raken, moet je rechtstreeks met de tagstructuur van de PDF werken, een mogelijkheid die de meeste algemene vertaalhulpmiddelen missen.

De PDF/UA-standaard (Universal Accessibility, ISO 14289) vereist dat getagde PDF's alternatieve tekst bieden voor alle niet-tekstuele inhoudselementen. In een meertalige organisatie kan het nodig zijn dat voor een contract dat in het Frans is geschreven, de alternatieve tekst beschikbaar is in het Engels, Duits en Nederlands, zodat toegankelijkheidsbeoordelaars in elk land de naleving ervan kunnen verifiëren. Het hele document vertalen zou onnodig en duur zijn. Slechts een paar honderd woorden aan alt-tekst en structurele labels behoeven aandacht. Deze taak valt in een beperkte categorie die zich tussen het volledige document Translate PDF en handmatige toegankelijkheidsbewerking bevindt, en weinig organisaties hebben er een standaardworkflow voor ontwikkeld.

De gevolgen van onvertaalde toegankelijkheidsmetagegevens zijn groter dan ze lijken. Een schermlezergebruiker die een Franstalig contract met alleen Engelse alternatieve tekst opent, hoort Engelse beschrijvingen die de Franse inhoud onderbreken, waardoor een verwarrende en desoriënterende ervaring ontstaat. Voor overheidsinstanties en door de overheid gefinancierde organisaties die onderworpen zijn aan toegankelijkheidsregelgeving betekent dit een nalevingskloof die juridische gevolgen kan hebben. Het vertalen van de toegankelijkheidslaag is geen nice-to-have voor meertalige organisaties. Het maakt deel uit van het voldoen aan de toegankelijkheidsverplichtingen in elke taal die de organisatie bedient.

How to Translate Only the Alt Text and Accessibility Labels in a Tagged PDF Without Affecting Visible Content

De PDF-tagstructuur begrijpen en waar alternatieve tekst zich bevindt

Een getagde PDF organiseert de inhoud in een logische boomstructuur, met elementen als Document, Onderdeel, Sectie, P, Tabel, Figuur en Formule. Elk element kan attributen hebben, en het cruciale element voor vertaling is de /Alt-invoer, waarin de alternatieve tekstbeschrijving wordt opgeslagen. Een Figure-element dat een diagram vertegenwoordigt, kan een /Alt-invoer bevatten met de tekst 'Staafdiagram dat de omzetgroei op kwartaalbasis van het eerste kwartaal van 2022 tot het vierde kwartaal van 2024 weergeeft, met een stijging van 12 procent op jaarbasis.' Deze tekst wordt nooit op de zichtbare pagina weergegeven. Het bestaat uitsluitend in de tagstructuur voor gebruik door schermlezers.

Het /Alt-item is een tekstreeks die is opgeslagen als een PDF-tekenreeksobject of een XML-tekenreeks met escapetekens binnen de gemarkeerde inhoud van het document. Om het uit te pakken, te vertalen en terug te schrijven zonder de omringende tagstructuur te verstoren, is een tool nodig die getagde PDF-inhoud op objectniveau kan parseren. De meeste PDF-editors die een tagboom in hun toegankelijkheidspaneel weergeven, kunnen individuele /Alt-items bewerken, maar het handmatig vertalen van tientallen of honderden daarvan is langzaam en foutgevoelig, waarbij voor elk item een afzonderlijke cyclus voor openen, bewerken en opslaan vereist.

Naast /Alt-items zijn er nog andere vertaalbare toegankelijkheidselementen. Het /Summary attribuut voor tabelelementen biedt een tekstoverzicht van de structuur en het doel van de tabel. Het /ActualText-item op Span-elementen kan de visuele tekst voor schermlezers overschrijven, wat handig is als de visuele tekst een afkorting is die moet worden uitgebreid. Formulierveldbeschrijvingen die zijn opgeslagen in de /TU (Tooltip)-invoer hebben ook vertaling nodig. Een volledige toegankelijkheidsvertaling omvat al deze elementen. Voor een contract van 50 pagina's met 30 figuren, 15 tabellen en 40 formuliervelden kan de totale vertaalbare toegankelijkheidstekst 2.000 tot 3.000 woorden bedragen, genoeg voor een vertaler om een deel van een dag aan te besteden, maar veel minder dan het vertalen van de volledige documenttekst.

WukongPDF

Probeer PDF vertalen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Toegankelijkheidstekst extraheren voor vertaling

De eerste stap is het inventariseren van wat vertaald moet worden. Gebruik een PDF-toegankelijkheidscontrole of tagviewer om een lijst met alle /Alt-, /Summary-, /ActualText- en /TU-items in het document te exporteren. De meeste tools voor toegankelijkheidsvalidatie, inclusief de ingebouwde toegankelijkheidscontrole in Adobe Acrobat Pro, kunnen een rapport produceren waarin elk tagelement met deze attributen en hun huidige tekstwaarden wordt weergegeven. Exporteer deze lijst naar een gestructureerd formaat zoals CSV, met kolommen voor het tagtype, element-ID, originele tekst en een lege vertaalkolom.

Stuur de originele tekstreeksen naar een vertaler of een machinevertaalservice. Het gestructureerde formaat zorgt ervoor dat elke vertaalde tekenreeks gekoppeld blijft aan het bronelement, wat essentieel is voor het terugschrijven van de vertalingen naar de juiste locaties. Om te voldoen aan PDF-toegankelijkheid moeten vertalingen aan dezelfde kwaliteitsnormen voldoen als de originele alternatieve tekst. Een goede alt-tekstbeschrijving is beknopt, doorgaans minder dan 150 tekens, en beschrijft de inhoud en functie van het element in plaats van het uiterlijk ervan. De vertaling moet deze beknoptheid en functionele focus behouden.

WukongPDF ondersteunt het bewerken van PDF Tags en toegankelijkheidsattributen op individueel elementniveau, waardoor het praktisch wordt om alternatieve tekstvertalingen bij te werken zonder de zichtbare pagina-inhoud te beïnvloeden. De gestructureerde tag-editor geeft de volledige elementhiërarchie weer met alle vertaalbare attributen, en met de functie voor batchupdates kunt u vertalingen uit een CSV-bestand importeren en deze in één handeling op de juiste elementen toepassen.

Vertalingen terugschrijven in de tagstructuur

Na ontvangst van de vertalingen vereist de terugschrijfstap een tool die door de PDF-tagboom kan navigeren en individuele attribuutwaarden kan bijwerken. Open de PDF in een tag-editor die de volledige boomstructuur toont. Zoek voor elk element dat is vertaald het element in de boomstructuur, selecteer het /Alt of een ander attribuut ervan en plak de vertaalde tekst. Sla het bestand op als alle vermeldingen zijn bijgewerkt. Controleer het resultaat met een schermlezer of een toegankelijkheidsvalidatietool. Navigeer door het document terwijl de schermlezer actief is en bevestig dat elke vertaalde beschrijving in de verwachte taal wordt gelezen.

Voor documenten die in meerdere talen worden verspreid, kunt u overwegen of de pdf alle taalversies van de alternatieve tekst in één bestand moet bevatten of dat er afzonderlijke taalspecifieke pdf's moeten worden gemaakt. De PDF-specificatie ondersteunt taaltagging op elementniveau, dus een enkel bestand kan theoretisch Engelse alternatieve tekst in Figuur 1 en Franse alternatieve tekst in Figuur 2 bevatten. De ondersteuning van schermlezers voor het wisselen van taal per element is echter inconsistent in verschillende schermlezertoepassingen. Als naleving van de toegankelijkheidseisen een vereiste is, zijn afzonderlijke PDF's per taal de veiligere en betrouwbaarder testbare keuze.

De workflow voor grote documentensets automatiseren

Voor organisaties die toegankelijkheidsmetagegevens over honderden of duizenden PDF's moeten lokaliseren, is de handmatige terugschrijfaanpak niet schaalbaar. In deze gevallen moeten de extractie, vertaling en terugschrijving in een script worden uitgevoerd. Gebruik een PDF-bibliotheek die toegang tot de tagstructuur ondersteunt, zoals Apache PDFBox voor Java of pikepdf voor Python, om programmatisch alle vertaalbare attributen te extraheren, deze naar een vertaal-API te sturen en de resultaten terug te schrijven.

Het script moet elk attribuut dat het wijzigt registreren en een voor-en-na-vergelijkingsrapport produceren, zodat een menselijke recensent de vertalingen ter plaatse kan controleren. Het automatiseren van de workflow verlaagt de kosten per document, maar introduceert het risico op systemische fouten, zoals een verkeerd vertaalde term die voorkomt in tientallen alternatieve tekstbeschrijvingen en pas wordt ontdekt na distributie. Een batchbeoordeling van een willekeurige steekproef, plus een gerichte beoordeling van vertalingen die door de vertaal-API als weinig betrouwbaar zijn gemarkeerd, brengt efficiëntie in evenwicht met kwaliteit en biedt een verdedigbare staat van dienst op het gebied van kwaliteitsborging.

WukongPDF

Probeer PDF vertalen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →