Others

Waarom levert een PDF die door twee verschillende online tools wordt vertaald, merkbaar verschillende resultaten op uit hetzelfde bronbestand?

Upload dezelfde PDF naar twee verschillende online vertaaldiensten en de resultaten zullen verschillen. Dezelfde Franse paragraaf weergegeven op de ene manier door het ene hulpmiddel en op de andere manier door het volgende. De verschillen variëren van woordkeuze en zinsstructuur tot de manier waarop de tool omgaat met opmaak, ingesloten tekst en afbeeldingen met woorden. Deze discrepanties zijn geen fouten in de traditionele zin van het woord. Elke tool produceerde de beste vertaling op basis van de ontwerpkeuzes, de vertaalengine en de pijplijn voor documentverwerking. Als u begrijpt waarom deze verschillen bestaan, kunt u de juiste tool voor een bepaald document kiezen en de resultaten met de juiste verwachtingen interpreteren.

Why Does a PDF Translated by Two Different Online Tools Produce Noticeably Different Results From the Same Source File

Verschillende vertaalmachines produceren verschillende taalkundige output

Online PDF-vertaaltools zijn gebouwd bovenop machinevertaalmachines voor algemene doeleinden, meestal varianten van neurale machinevertaalmodellen die zijn getraind op grote meertalige corpora. De twee dominante benaderingen zijn het Neural Machine Translation-systeem van Google, gebruikt door Google Translate en tools die er licenties voor verlenen, en de convolutionele neurale netwerkbenadering van DeepL. Microsoft Translator en Amazon Translate vertegenwoordigen aanvullende onafhankelijke implementaties. Elk systeem is getraind op verschillende trainingsgegevens, geoptimaliseerd voor verschillende kwaliteitsstatistieken en afgestemd met verschillende prioriteiten voor vloeiendheid versus letterlijke nauwkeurigheid. Dezelfde invoerzin zal op deze systemen verschillende uitvoerzinnen produceren.

Op drie gebieden zijn de verschillen het meest opvallend. Ten eerste: omgaan met dubbelzinnigheid: een Frans woord als 'avocat' kan, afhankelijk van de context, advocaat of avocado betekenen. Verschillende vertaalmachines lossen dergelijke dubbelzinnigheden op met verschillende statistische modellen, en komen niet altijd tot dezelfde conclusie. Ten tweede, register en formaliteit: sommige zoekmachines gebruiken standaard een formeel adres in talen die formeel van informeel onderscheiden, terwijl andere standaard neutraal zijn. Een Duitse vertaling waarin 'Sie' versus 'du' wordt gebruikt, verandert de sociale toon van het hele document. Ten derde, idiomatische uitdrukkingen: een zin die een direct equivalent heeft in de doeltaal kan letterlijk door de ene engine en idiomatisch door een andere worden vertaald, waardoor teksten ontstaan die zowel correct zijn als stilistisch verschillend.

WukongPDF

Probeer PDF vertalen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Het omgaan met documentstructuren leidt tot niet-taalkundige verschillen

Naast de vertaling van individuele woorden en zinnen verschillen online PDF-tools ook in de manier waarop ze omgaan met de documentstructuur rond de tekst. Sommige tools extraheren alle tekst in een lineaire stroom, vertalen deze en plaatsen deze terug op de oorspronkelijke posities, waarbij alinea-einden, kophiërarchie en de relatie tussen hoofdtekst en bijschriften verloren gaan. Anderen proberen de documentstructuur te behouden door de tekst binnen elk lay-outblok afzonderlijk te vertalen. De tweede benadering levert een meer getrouwe lay-out op, maar kan herhaalde tekst, zoals een doorlopende koptekst die op elke pagina verschijnt, elke keer anders vertalen, omdat de tool elke instantie als een onafhankelijke vertaaleenheid behandelt zonder dat de vorige instanties zich ervan bewust zijn.

De tool Translate PDF van WukongPDF verwerkt de tekstlaag van uw document met behoud van de oorspronkelijke lay-out en opmaak. De vertaalmachine geeft elk tekstelement op zijn plaats weer, waarbij de visuele structuur van het document behouden blijft. Bij het vergelijken van vertalingen uit verschillende tools is de structurele betrouwbaarheid van de output vaak net zo belangrijk als de taalkundige kwaliteit. Een vertaling die prettig leest maar alle alinea-einden en kopstijlen kwijt is, vereist een herformattering die langer kan duren dan het verbeteren van een ruwere vertaling waarbij de oorspronkelijke lay-out behouden blijft.

Omgaan met ingesloten tekst in afbeeldingen en gescande inhoud

Een belangrijke bron van verschillen tussen vertaalhulpmiddelen is de manier waarop ze omgaan met tekst die niet als selecteerbare tekens in de PDF is opgeslagen. Een PDF kan afbeeldingen bevatten met ingesloten tekst, zoals diagrammen met labels, foto's van borden of gescande pagina's waarop de tekst alleen in pixels bestaat. Sommige vertaalhulpmiddelen negeren op afbeeldingen gebaseerde tekst volledig, produceren alleen een vertaling van de tekstlaag en laten afbeeldingen onvertaald. Anderen proberen eerst OCR op de afbeeldingen en vertalen vervolgens de herkende tekst, maar de OCR-stap introduceert zijn eigen fouten die de vertaling verergeren. Hetzelfde beeld dat door twee verschillende tools wordt verwerkt, kan verschillende OCR-metingen opleveren voordat de vertaling zelfs maar begint.

De gevolgen voor de documentkwaliteit zijn aanzienlijk. Een vertaalde PDF waarin alleen de tekstlaag is verwerkt, bevat een combinatie van vertaalde hoofdtekst en onvertaalde afbeeldingsbijschriften, diagramlabels en ingesloten tekst. Een lezer die de brontaal niet spreekt, stuit op deze eilanden van onvertaalde inhoud als doodlopende wegen. Bij het vergelijken van vertaalhulpmiddelen voor een document dat ingesloten tekst in afbeeldingen bevat, is het controleren van hoe elk hulpmiddel met die ingesloten inhoud omgaat een cruciaal evaluatiecriterium dat net zo belangrijk is als de taalkundige kwaliteit van de tekstvertaling.

Formaatspecifiek behoud: lettertypen, kleuren en pagina-indeling

Vertaling verandert de tekstlengte. Duitse en Finse vertalingen zijn doorgaans 20 tot 30 procent langer dan de Engelse bron. Chinese en Japanse vertalingen zijn doorgaans 10 tot 20 procent korter. Deze lengteverandering heeft invloed op elk aspect van de documentlay-out. Tekst die in het Engels netjes in een tabelcel past, kan in het Duits overlopen. Kopteksten die op één regel in evenwicht waren, kunnen naar twee regels doorlopen. Opsommingstekens die netjes uitgelijnd zijn, kunnen rafelig worden. Elke vertaaltool gaat anders om met deze gevolgen voor de lay-out.

Sommige tools passen de lettergroottes naar beneden aan, zodat de vertaalde tekst in de oorspronkelijke ruimte past. Hierdoor blijft de paginastructuur behouden, maar kunnen er pagina's ontstaan waarbij de lettergrootte tussen secties zichtbaar varieert, waardoor een inconsistente leeservaring ontstaat. Andere tools behouden de oorspronkelijke lettergroottes en zorgen ervoor dat de tekst opnieuw kan worden geplaatst, waardoor pagina-einden kunnen veranderen en de relatie tussen tekst en aangrenzende afbeeldingen kan veranderen. De beste aanpak hangt af van het documenttype. Een juridisch contract waarbij elk woord op dezelfde pagina moet blijven als in het origineel, profiteert van aanpassing van de lettergrootte. Een marketingbrochure waarbij visuele consistentie belangrijker is, profiteert van het behouden van lettergroottes en het accepteren van reflow.

Een vertaalhulpmiddel voor uw document kiezen en evalueren

Gezien de variatie tussen tools is de meest betrouwbare manier om te kiezen het testen van een representatieve pagina uit uw document in twee of drie kandidaat-tools en de resultaten naast elkaar vergelijken. Kijk naar taalkundige kwaliteit: leest de vertaling natuurlijk in de doeltaal, of klinkt het als een automatische vertaling? Kijk naar de volledigheid: is er tekst gemist, vooral in de kop-, voet- en afbeeldingsbijschriften? Kijk naar de lay-outgetrouwheid: lijkt het vertaalde document op het origineel of moet het opnieuw worden geformatteerd? De antwoorden op deze vragen variëren per talencombinatie, documenttype en de specifieke inhoud van uw document.

Voor documenten waarbij de vertaalkwaliteit juridische of zakelijke consequenties met zich meebrengt, kunt u overwegen een menselijke reviewer de resultaten te laten vergelijken en voor elke sectie de beste vertaling te selecteren. Hulpmiddelen voor automatische vertaling zijn snel en steeds nauwkeuriger, maar ze zijn niet onfeilbaar, en de verschillen tussen de hulpmiddelen zorgen ervoor dat geen enkel hulpmiddel het beste is voor elk document. Het PDF Compare-proces waarbij vertalingen naast elkaar worden beoordeeld, is de kwaliteitsborgingsstap die automatische vertaling van een gok in een beheerd proces verandert.

De rol van nabewerking in vertaalworkflows met meerdere tools

Een groeiende best practice in professionele vertaalworkflows is om het brondocument door twee of drie vertaalmachines te laten lopen, de resultaten te vergelijken en een menselijke redacteur de beste weergave van elke passage te laten selecteren en verfijnen. Deze multi-engine aanpak combineert de sterke punten van verschillende vertaalmodellen. De ene engine kan beter omgaan met technische terminologie, terwijl de andere meer natuurlijk klinkend proza produceert. De menselijke redacteur wordt een curator van de machine-uitvoer in plaats van een vertaler die helemaal opnieuw werkt. Het resultaat is een vertaling die verder gaat dan wat een enkele engine zou kunnen produceren, gemaakt in minder tijd dan een volledig handmatige vertaling nodig zou hebben. Voor documenten die zullen worden gepubliceerd, breed gedistribueerd of gebruikt in contexten waar de vertaalkwaliteit rechtstreeks van invloed is op de geloofwaardigheid, biedt de multi-engine beoordelingsworkflow de hoogste kwaliteit output die beschikbaar is met de huidige technologie.

De verschillen tussen vertaaltools verdwijnen niet. Elke tool vertegenwoordigt een andere reeks technische beslissingen, keuzes voor trainingsgegevens en optimalisatieprioriteiten. Door deze verschillen te begrijpen en ze in uw voordeel te gebruiken, verandert een bron van inconsistentie in een strategie voor kwaliteitsborging. De beste vertaling voor uw document is zelden de output van één enkele tool. Het is het beste samengestelde van wat meerdere tools kunnen produceren, op basis van menselijk oordeel over wat goed klinkt in de doeltaal.

Deze variabiliteit tussen vertaalhulpmiddelen is geen zwakte van de technologie. Het is een weerspiegeling van de echte taalkundige dubbelzinnigheid die vertaling tot een moeilijk probleem maakt. Verschillende tools maken verschillende keuzes wanneer ze met die dubbelzinnigheid worden geconfronteerd. Als u de aard van deze keuzes begrijpt, kunt u voor elk document de juiste tool selecteren en de resultaten interpreteren met een weloverwogen oordeel in plaats van blind vertrouwen. Het doel is niet om het beste vertaalhulpmiddel te vinden, dat bestaat niet, maar om het oordeel te ontwikkelen om te weten welk hulpmiddel het beste resultaat oplevert voor elk specifiek document en talenpaar. De vaardigheid ligt niet in het uitvoeren van de vertaling, maar in het evalueren van de uitvoer en het selecteren van de beste weergave uit de opties die verschillende tools bieden.

De verschillen tussen vertaalhulpmiddelen zijn een kenmerk van het huidige technologische landschap en geen fout. Ze bieden opties die een enkele universele vertaler niet zou bieden. De gebruiker die begrijpt waarom de verschillen bestaan, kan deze gebruiken om een vertaling van hogere kwaliteit te produceren dan welke tool dan ook op zichzelf zou kunnen leveren. Dat inzicht transformeert de vertaling van een klik op een knop in een kwaliteitscontroleproces.

WukongPDF

Probeer PDF vertalen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →