Een onderzoekspaper geschreven in het Frans bevat figuren met bijschriften en tabellen met kopteksten die een Engelssprekende recensent moet begrijpen. De hoofdtekst kan in het Frans blijven omdat de reviewer samenwerkt met een tweetalige collega. Het vertalen van het hele document is onnodig en riskeert fouten in de technische inhoud. Door alleen de bijschriften van de figuren en de tabelkoppen te vertalen, krijgt de recensent de informatie die nodig is om de visuele elementen te interpreteren zonder de hoofdtekst aan te raken.
Het selectief Translate PDF van bijschriften en kopteksten is een precisietaak waarvoor een tool nodig is die specifieke tekstelementen kan identificeren op basis van hun positie, opmaak of inhoudspatronen. Bijschriften verschijnen doorgaans onder de cijfers in een kleiner lettertype. Tabelkoppen worden vetgedrukt weergegeven in de eerste rij van een tabel. Deze opmaakaanwijzingen maken selectieve extractie en vertaling mogelijk.

Bijschriften en kopteksten identificeren voor selectieve vertaling
Bijschriften van figuren in academische en technische pdf's volgen voorspelbare opmaakpatronen. Ze verschijnen direct onder of naast de figuur. Ze gebruiken een kleinere lettergrootte dan de hoofdtekst, doorgaans 8 tot 10 punten. Ze beginnen vaak met Figure, gevolgd door een getal. Deze patronen maken handmatige of geautomatiseerde identificatie van ondertitelingstekst mogelijk.
Tabelkoppen verschijnen in de eerste rij van een tabel, vaak in vetgedrukte tekst met een gearceerde achtergrond. De koprij is structureel verschillend van de gegevensrijen. Een tool voor het extraheren van PDF-tabellen kan de koprij identificeren aan de hand van zijn positie en opmaak, de koptekst extraheren en de gegevensrijen onaangeroerd laten.
Het PDF-formaat slaat bijschriften en kopteksten op als gepositioneerde tekstobjecten, niet als semantisch getagde elementen. Om ze te extraheren, is analyse nodig van de tekstpositie, lettertype-eigenschappen en de nabijheid van afbeeldingen of tabelstructuren. Een tekstextractietool voor algemeen gebruik kan geen onderscheid maken tussen bijschriften en hoofdtekst. Een gespecialiseerde tool die de documentlay-out begrijpt, kan dat wel.
Probeer PDF vertalen
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Selectieve vertaalworkflow
Extraheer eerst het bijschrift en de koptekst uit de PDF. Identificeer elk bijschrift aan de hand van de positie ten opzichte van afbeeldingen en de lettertypekenmerken. Identificeer elke tabelkop aan de hand van zijn positie in tabelstructuren. Compileer de geëxtraheerde tekst in een vertaallijst met positiereferenties.
Ten tweede: vertaal de geëxtraheerde tekst. Machinevertaling werkt goed voor de eenvoudige taal die in bijschriften en kopteksten wordt gebruikt. Menselijke beoordeling van de vertalingen zorgt ervoor dat technische termen correct worden vertaald en dat domeinspecifieke terminologie behouden blijft.
WukongPDF biedt extractiemogelijkheden van PDF naar Tekst waarmee specifieke tekstelementen kunnen worden geïsoleerd. De extractie in combinatie met vertaling levert vertaalde bijschriften en kopteksten op, terwijl de originele hoofdtekst behouden blijft.
Vertaalde bijschriften en kopteksten opnieuw invoegen
Plaats de vertaalde tekst na de vertaling terug in de PDF op de oorspronkelijke posities. De vertaalde bijschriften vervangen de originele bijschriften onder elke afbeelding. De vertaalde headers vervangen de originele headers in elke tabel. De hoofdtekst blijft ongewijzigd.
Verschillen in de vertaallengte tussen talen vereisen aandacht. Een Frans bijschrift dat zich vertaalt naar langere Engelse tekst heeft mogelijk een iets kleinere lettergrootte of een kleinere regelafstand nodig om in dezelfde ruimte te passen. Pas de tekstopmaak aan zodat deze geschikt is voor de vertaling, zonder de pagina-indeling te verstoren.
Wanneer selectieve vertaling de juiste aanpak is
Selectieve vertaling is geschikt wanneer de lezer de visuele elementen moet begrijpen, maar de hoofdtekst niet in detail hoeft te lezen. Wetenschappelijke samenwerking over taalbarrières heen, technische beoordeling van internationale inzendingen en meertalige publicatieworkflows profiteren van deze gerichte aanpak.
De kosten- en tijdbesparingen van selectieve vertaling vergeleken met volledige documentvertaling zijn evenredig aan de verhouding tussen bijschriften en kopteksten en de hoofdtekst. Een document dat voor 80 procent uit hoofdtekst en voor 20 procent uit bijschriften bestaat, bespaart 80 procent van de vertaalkosten als alleen de bijschriften worden vertaald.
De identificatie van bijschriften en kopteksten voor selectieve vertaling kan gedeeltelijk worden geautomatiseerd door een analysemodel voor de documentlay-out te trainen op het specifieke document- of publicatieformaat. Een model dat is getraind op een tijdschriftsjabloon kan bijschriften en kopteksten met hoge nauwkeurigheid identificeren in alle artikelen die dat sjabloon gebruiken.
Hulpmiddelen voor vertaalgeheugens kunnen vertalingen van terugkerende bijschriften in meerdere documenten uit hetzelfde veld opslaan. Een zinsnede als Figuur X toont de relatie tussen die in tientallen artikelen voorkomt en profiteert van een consistente vertaling in al deze artikelen.
Het kwaliteitsborgingsproces voor selectieve vertalingen moet verifiëren dat de juiste tekst is vertaald en dat de onjuiste tekst, de hoofdtekst, dat niet is. Een recensent vergelijkt een voorbeeld van de vertaalde bijschriften met de originelen en controleert ook of de hoofdtekst op die pagina's in de originele taal blijft.
Voor documenten waarbij de bijschriften numerieke verwijzingen naar de hoofdtekst bevatten, zie Paragraaf 3.2 voor details. De vertaling moet deze kruisverwijzingen nauwkeurig behouden. Een verkeerd vertaalde kruisverwijzing die naar een niet-bestaand gedeelte verwijst, schept verwarring.
Wanneer de vertaalde bijschriften opnieuw in de PDF worden ingevoegd, moet de nieuwe tekst visueel te onderscheiden zijn van de originele hoofdtekst, misschien door een subtiel kleurverschil of een notatie in de marge, zodat lezers begrijpen dat ze een selectief vertaald document bekijken.
De selectieve vertaalaanpak kan worden uitgebreid naar andere documentelementen die baat hebben bij gerichte vertaling: abstracte vertaling, trefwoordvertaling voor internationale databases en figuurlabelvertaling voor meertalige publicaties.
Voor academische uitgeverijen die tijdschriften in meerdere talen produceren, biedt selectieve vertaling van bijschriften en kopteksten een kosteneffectieve middenweg tussen dure volledige vertalingen en helemaal geen vertaling.
Selectieve vertaling van bijschriften en kopteksten is een precisiehulpmiddel voor een specifieke behoefte, en geen vervanging voor de volledige vertaling van documenten wanneer het publiek de volledige inhoud moet begrijpen.
De kosteneffectiviteit van selectieve vertaling maakt het een aantrekkelijke optie voor internationale samenwerkingen waarbij volledige vertaling onbetaalbaar zou zijn.
Selectieve vertaling biedt een gerichte oplossing voor meertalige samenwerking aan documenten.
Bijschriften van figuren in wetenschappelijke artikelen volgen voorspelbare patronen die geautomatiseerde extractietools kunnen identificeren: ze verschijnen onder cijfers, gebruiken kleinere lettertypen en beginnen met Figure gevolgd door een cijfer.
Tabelkoppen onderscheiden zich structureel van gegevensrijen omdat ze bovenaan de tabel verschijnen, vaak vetgedrukte tekst gebruiken en mogelijk een gearceerde achtergrond hebben, kenmerken die extractietools gebruiken voor identificatie.
Het extractieproces moet de originele opmaakinformatie behouden, zodat vertaalde tekst terug op de juiste posities kan worden geplaatst met de juiste lettertype-eigenschappen en spatiëring.
Voor meertalige publicaties kan selectieve vertaling systematisch worden toegepast: extraheer bijschriften en kopteksten, vertaal naar alle doeltalen en voeg elke versie in als een afzonderlijke PDF-laag.
De kwaliteit van machinevertaling voor wetenschappelijke bijschriften is zodanig verbeterd dat menselijke nabewerking sneller en goedkoper is dan een geheel nieuwe vertaling van deze gestructureerde tekstelementen.
Het verschil in lettergrootte tussen hoofdtekst en bijschriften is het belangrijkste signaal dat geautomatiseerde extractietools gebruiken om bijschrifttekst te identificeren, waarbij bijschriften doorgaans 2 tot 4 punten kleiner zijn dan de omringende hoofdtekst.
Rijen met tabelkopteksten kunnen worden geïdentificeerd aan de hand van hun positie als de eerste rij van elke tabel, hun vetgedrukte tekstopmaak en vaak een gearceerde achtergrond die ze onderscheidt van gegevensrijen.
De geëxtraheerde bijschriften en kopteksten moeten worden samengevoegd in een gestructureerde lijst waarin het paginanummer en de positiecoördinaten behouden blijven, waardoor nauwkeurige herinvoeging na vertaling mogelijk is.
Hulpmiddelen voor vertaalgeheugens kunnen vertaalde bijschriften van eerdere documenten in hetzelfde veld opslaan, waardoor de consistentie wordt verbeterd en de vertaalkosten voor terugkerende terminologie worden verlaagd.
Bij het opnieuw invoegen van vertaalde bijschriften moet rekening worden gehouden met de verschillen in tekstlengte tussen talen, waarbij de lettergrootte of de regelafstand zo nodig moeten worden aangepast om de vertaalde tekst in de oorspronkelijke bijschriftruimte te laten passen.
Kwaliteitsborging voor selectieve vertalingen omvat onder meer het verifiëren dat de juiste tekstelementen zijn geëxtraheerd, dat de vertalingen accuraat zijn en dat geen hoofdtekst per ongeluk is gewijzigd.
Voor wetenschappelijke tijdschriften die artikelen in meerdere talen publiceren, kan selectieve vertaling van bijschriften en headers als standaardstap in de productieworkflow worden opgenomen.
De kostenbesparingen van selectieve vertaling vergeleken met volledige vertaling maken internationale samenwerking toegankelijk voor projecten en publicaties met beperkte vertaalbudgetten.
De kwaliteit van automatische vertalingen voor de gestructureerde, formuletaal die in wetenschappelijke bijschriften wordt gebruikt, is over het algemeen hoger dan voor verhalende tekst, waardoor de lasten na het redigeren afnemen.
De mogelijkheid om alleen specifieke documentelementen te vertalen met behoud van de originele taal van de hoofdtekst creëert flexibiliteit in internationale documentworkflows.
Voor onderzoekssamenwerkingen die meerdere taalgemeenschappen bestrijken, stelt selectieve vertaling elke medewerker in staat toegang te krijgen tot het visuele bewijsmateriaal in de taal van zijn voorkeur.
Deze selectieve aanpak maakt samenwerking aan meertalige documenten toegankelijk voor teams en projecten met beperkte vertaalmiddelen.
De gerichte vertaling van bijschriften en tabelkoppen biedt de essentiële context die lezers nodig hebben om visuele elementen te interpreteren.
Door selectieve vertaling van bijschriften en kopteksten kunnen internationale lezers het visuele bewijsmateriaal in een document begrijpen zonder dat een volledige vertaling van de hoofdtekst nodig is.
Deze gerichte benadering van documentvertaling verlaagt de kosten en vergroot tegelijkertijd de toegankelijkheid van visuele informatie over taalbarrières heen.
De extractie van bijschriften is afhankelijk van de lettergrootte en positieverschillen ten opzichte van de omringende hoofdtekst.
Bijschrifttekst in PDF's wordt doorgaans direct onder of naast de overeenkomstige afbeelding geplaatst, met een lettergrootte die 2 tot 4 punten kleiner is dan de hoofdtekst, waardoor deze herkenbaar is door geautomatiseerde extractietools die de tekstpositie en opmaakkenmerken analyseren.
Selectieve vertaling van bijschriften en kopteksten biedt internationale lezers toegang tot visuele informatie.
Deze mogelijkheid maakt internationale onderzoekssamenwerking toegankelijker en kosteneffectiever.
De selectieve benadering van documentvertaling komt tegemoet aan een specifieke behoefte zonder de kosten van een volledige vertaling.
| Element | Identificatiesignaal | Vertaalprioriteit | Opmerking voor opnieuw invoegen |
|---|---|---|---|
| Figuurbijschrift | Onderstaande figuur; kleiner lettertype; Figuur N-voorvoegsel | Hoog | Zelfde positie; Mogelijk moet het lettertype worden aangepast |
| Tabelkop | Eerste rij; vetgedrukt; gearceerd bg | Hoog | Dezelfde cellen; uitlijning behouden |
| As-label | Grenzend aan diagramassen | Medium | Mogelijk moet de rotatie worden aangepast |
| Legenda-invoer | Kleurstaal + tekst | Laag | Vaak niet afzonderlijk geëxtraheerd |
Probeer PDF vertalen
Geen installatie nodig. Werkt rechtstreeks in uw browser.
