Others

Wat er gebeurt met symbolen en lettertypen tijdens PDF-vertaling

Wanneer u een PDF via een vertaalprogramma uitvoert, heeft het resulterende document vaak opmaakproblemen die verder gaan dan eenvoudige lay-outverschuivingen. Speciale tekens zoals wiskundige symbolen, valutatekens en letters met accenten kunnen worden vervangen door lege vakjes, vraagtekens of volledig verkeerde tekens. Ingesloten lettertypen worden mogelijk niet meer weergegeven, waardoor hele tekstgedeelten verdwijnen of worden weergegeven in een standaardsysteemlettertype. Als u begrijpt wat er tijdens de vertaling met symbolen en PDF-lettertypen gebeurt, kunt u op deze problemen anticiperen en de juiste vertaalaanpak kiezen voor documenten waarbij de nauwkeurigheid van symbolen belangrijk is.

Belangrijkste punten

PDF-vertaalhulpmiddelen werken door de tekstlaag uit het document te extraheren, deze door een machinevertaalmachine te laten lopen en de vertaalde tekst terug in de oorspronkelijke lay-out te plaatsen. Symbolen en speciale tekens lopen gevaar tijdens elke fase van deze pijplijn: extractie kan symboolcodering verkeerd interpreteren, de vertaalmachine kan niet-alfabetische tekens verwijderen of beschadigen, en bij het opnieuw invoegen kunnen er problemen optreden bij het vervangen van lettertypen wanneer de doeltaal tekens gebruikt die niet aanwezig zijn in de ingesloten lettertypen van het originele document.

What Happens to Symbols and Fonts During PDF Translation

Hoe PDF-vertaling omgaat met de fase van tekstextractie

Voordat er een vertaling kan plaatsvinden, moet de tool leesbare tekst uit de PDF extraheren. Voor een native digitale PDF met ingesloten tekst leest deze extractie de tekencodes uit de inhoudsstromen van het document en wijst deze toe aan Unicode-waarden met behulp van de coderingstabel van het ingesloten lettertype. Symbolen en speciale tekens worden in dit stadium problematisch wanneer de coderingstabel onvolledig of beschadigd is of een aangepaste toewijzing gebruikt die niet de Unicode-conventies volgt. Een PDF die met oudere software is gemaakt, gebruikt mogelijk een niet-standaard codering waarbij wat op het scherm lijkt op een euroteken intern wordt opgeslagen als een tekencode die in standaard Unicode-tabellen niets voorstelt.

Wanneer de coderingstoewijzing mislukt, produceert het extractieproces vervangende tekens, meestal het Unicode-vervangende teken of een vraagteken. Deze mislukking gebeurt in stilte. De geëxtraheerde tekst ziet er in één oogopslag normaal uit omdat de letters en cijfers rond het symbool prima zijn, maar het valutateken, de wiskundige operator of de letter met accent die cruciaal was voor de betekenis van het document is verloren gegaan voordat de vertaling zelfs maar begon. Een extractiefase die het euroteken in een financiële pdf niet kan omzetten, levert "Totaal: 2.500 euro" op. in "Totaal: 2.500" of "Totaal: 2.500 ?" en de vertaalde uitvoer zal die fout overnemen.

WukongPDF

Probeer PDF vertalen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Wat de vertaalmachine doet met symbolen en speciale tekens

Machinevertaalmachines zijn geoptimaliseerd voor tekst in natuurlijke taal. Wanneer ze een zin tegenkomen die een combinatie van woorden en symbolen bevat, zoals een technische specificatie of een financieel overzicht, hangt de omgang met symbolen af van de specifieke engine en het talenpaar. De meeste moderne neurale automatische vertaalsystemen passeren symbolen die zij als niet-linguïstisch herkennen, zoals valutatekens, procenttekens en gewone wiskundige operatoren. Maar minder gebruikelijke symbolen, zoals het sectieteken dat in juridische documenten wordt gebruikt, het gradensymbool in wetenschappelijke teksten of gespecialiseerde notaties uit een bepaalde sector, kunnen worden geschrapt of vervangen door de tekstnormalisatiestap van de vertaalmachine.

De normalisatiestap, die vóór de daadwerkelijke vertaling plaatsvindt, zet de invoertekst om in een gestandaardiseerde vorm. Het kan tekst in kleine letters zetten, interpunctie verwijderen die het als niet-essentieel beschouwt, en Unicode-tekens normaliseren naar hun canonieke vormen. Voor de meeste documenten is dit nuttig. Het voorkomt dat de vertaalmachine "Hallo" en "hallo" als verschillende woorden. Maar voor documenten waarin specifieke symbolen betekenis hebben, kan normalisatie schade toebrengen. Een chemische formule die subscriptnummers gebruikt, een reeks GPS-coördinaten met graden- en minutensymbolen, of een juridische citatie met sectiemarkeringen, kunnen allemaal door normalisatie worden gewijzigd op manieren die de betekenis ervan veranderen of ze onleesbaar maken.

Lettertypevervanging: waarom vertaalde tekst er vaak anders uitziet

De visuele impact van lettertypevervanging varieert van subtiel tot ernstig. Wanneer een Latijns lettertype een ander Latijns lettertype vervangt, veranderen de tekenbreedtes enigszins, maar blijft de tekst leesbaar. Wanneer een Latijns lettertype een niet-Latijns schrift vervangt, is het resultaat doorgaans een rij lege rechthoeken of vraagtekens, omdat het Latijnse lettertype geen van de vereiste tekens bevat. Dit is de reden waarom het vertalen naar Arabische, Chinese, Japanse, Koreaanse of Cyrillische talen speciale aandacht vereist voor de beschikbaarheid van lettertypen tijdens de fase van het opnieuw invoegen.

Na vertaling moet de nieuwe tekst terug in de PDF worden geplaatst. De ingesloten lettertypen van het originele document bevatten alleen de tekens die in de originele tekst aanwezig waren. Wanneer de vertaalde tekst tekens bevat die niet in het origineel voorkomen, zoals tekens met accenten in Franse of Spaanse vertalingen van een Engels document, kunnen de originele ingesloten lettertypen deze niet weergeven. De PDF-viewer valt terug op een vervangend lettertype, dat er vrijwel zeker anders uit zal zien dan de omringende tekst. Het resultaat is een document waarin de meeste tekst in het originele lettertype verschijnt, maar af en toe vertaalde woorden of tekens met accenten in een zichtbaar ander lettertype verschijnen, waardoor de pagina een fragmentarisch, onprofessioneel uiterlijk krijgt.

Dit probleem is het ernstigst bij het vertalen naar talen die totaal verschillende schrijfsystemen gebruiken. Voor het vertalen van een Engelse PDF naar het Russisch, Arabisch, Chinees of Japans zijn tekens nodig die geen enkel Latijns schriftlettertype bevat. De gehele vertaalde tekst moet worden weergegeven met een vervangend lettertype en het visuele karakter van het document verandert volledig. De lay-outgeometrie die werkte voor de originele tekst, met zijn specifieke tekenbreedtes en lijnhoogtes, past niet in de vertaalde tekst. Regeleinden verplaatsen zich, alinea's worden groter of kleiner, en elementen die zorgvuldig zijn uitgelijnd, worden niet meer goed uitgelijnd.

Een vertaalaanpak kiezen op basis van symboolgevoeligheid

Een praktische controle vóór de vertaling is het openen van de pdf en het kopiëren van een alinea die speciale tekens bevat naar een gewone teksteditor. Als de speciale tekens de kopieer- en plakbewerking intact overleven, is de tekstcodering van de PDF standaard en is het onwaarschijnlijk dat deze tijdens de extractiefase van de vertaling worden beschadigd. Als de tekens onleesbaar worden of verdwijnen wanneer ze worden geplakt, gebruikt de PDF een niet-standaard codering die problemen tijdens de vertaling zal veroorzaken. Het repareren van de codering bij de bron, bijvoorbeeld door de PDF opnieuw te maken terwijl het insluiten van lettertypen is ingeschakeld, is effectiever dan proberen beschadigde tekens na vertaling te herstellen.

Voor documenten waarin symbolen van cruciaal belang zijn, zoals financiële rapporten, wetenschappelijke artikelen, juridische dossiers en technische handleidingen, is de veiligste aanpak het gebruik van een

Als documenten naar een ander schrijfsysteem worden vertaald, accepteer dan dat de uitvoer er anders uit zal zien dan het origineel en plan dienovereenkomstig. In plaats van een pixel-perfecte lay-out te verwachten, kunt u zich concentreren op het produceren van een helder, leesbaar document in de doeltaal. Reserveer na de vertaling tijd voor handmatige of semi-automatische aanpassing van de lay-out. Pas de kolombreedtes aan, lijn tabellen opnieuw uit en controleer of alle speciale tekens correct worden weergegeven. De extra tijd die wordt besteed aan de opmaak na de vertaling zijn de kosten van het werken met verschillende schrijfsystemen, en tools die een naadloze cross-script vertaling beloven zonder enig lay-outwerk vereenvoudigen een werkelijk moeilijk probleem. De vertaaltool van WukongPDF behoudt de gegevens van ingebedde lettertypen tijdens het hele conversieproces, waardoor de symboolcorruptie die optreedt wanneer lettertypen worden vervangen tijdens het opnieuw invoegen van tekst wordt geminimaliseerd.

Veelgestelde vragen

Moet ik een PDF rechtstreeks vertalen of eerst converteren naar een bewerkbaar formaat, dat vertalen en opnieuw exporteren naar PDF? De aanpak in twee stappen, het converteren naar Word, het vertalen van het Word-document en het terug exporteren naar PDF, levert over het algemeen een betere symboolgetrouwheid op, omdat Word consistenter omgaat met Unicode dan de extractie van onbewerkte PDF-tekst. De kosten zijn dat de heen en terugreis door Word lay-outwijzigingen introduceert die handmatig moeten worden gecorrigeerd. Voor korte documenten is de tweestapsmethode de moeite van de lay-out waard. Voor zeer lange documenten is directe PDF-vertaling met een tool die de codering behoudt praktischer.

Kan ik een PDF vertalen door de tekst te extraheren, extern te vertalen en handmatig terug in de PDF-indeling te plaatsen? Ja, deze handmatige pijplijn geeft u volledige controle over de symboolverwerking en de lettertypeselectie in elke fase, maar het is alleen tijdrovend en praktisch voor korte documenten. Voor een technische handleiding van 50 pagina's is handmatige herinvoeging niet haalbaar. De beslissing tussen geautomatiseerde en handmatige vertaling is uiteindelijk een beslissing over hoeveel controle u nodig heeft over de output en hoeveel tijd u kunt investeren.

Kan ik symboolverlies voorkomen door de PDF naar Word te converteren voordat ik ga vertalen?

Door eerst naar Word te converteren, krijgt het vertaalprogramma toegang tot de tekst via de Unicode-verwerking van Microsoft Word, die over het algemeen betrouwbaarder is dan het extraheren van onbewerkte PDF-tekst. Deze extra stap lost vaak coderingsgerelateerd symboolverlies op, vooral voor documenten die zijn gemaakt met moderne software die al standaard Unicode-codering gebruikt. Het nadeel is dat de Word-conversie zelf wijzigingen in de lay-out kan introduceren. Voor documenten met veel symbolen rechtvaardigt de verbeterde tekennauwkeurigheid meestal het lay-outwerk.

Waarom breken wiskundige vergelijkingen vaak tijdens PDF-vertaling?

Wiskundige vergelijkingen in PDF's worden doorgaans opgeslagen als een mix van teksttekens voor variabelen en getallen, plus speciale wiskundige symbolen uit een speciaal wiskundelettertype, plus vectorgetekende breukstreepjes, radicale tekens en andere notatie-elementen. Wanneer de vertaalmachine de tekstlaag verwerkt, behandelt deze de vergelijking als een zin en kan de symboolreeks opnieuw worden gerangschikt of genormaliseerd. De vectorgetekende elementen zijn helemaal geen tekst en passeren de vertaling zonder te worden aangeraakt, maar hun uitlijning ten opzichte van de vertaalde tekst is bijna altijd verbroken. Voor documenten met een zware wiskundige inhoud is de meest betrouwbare aanpak het uitsluiten van vergelijkingen van de vertaling en het vertalen van alleen het omliggende proza.

Is er een PDF-formaat dat vertalingen verwerkt PDF-formaat beter dan andere?

PDF/A met volledig ingebedde Unicode-lettertypen vertaalt betrouwbaarder dan standaard PDF's met subsetlettertypen en aangepaste coderingen. De volledige insluiting en Unicode-vereiste in PDF/A elimineert de twee meest voorkomende bronnen van symboolcorruptie tijdens vertaling: ontbrekende lettertype-glyphs en niet-standaard karaktertoewijzingen. Als u weet dat een document zal worden vertaald, is het een waardevolle stap om het op te slaan als PDF/A voordat u de vertaling uitvoert.

WukongPDF

Probeer PDF vertalen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →