Tips & Tricks

Alleen de tekst in PDF-tabelcellen vertalen terwijl de cijfers onaangeroerd blijven

Het vertalen van een PDF-tabel biedt een unieke uitdaging die de reguliere documentvertaling niet kent. Tabellen combineren twee fundamenteel verschillende gegevenstypen: tekst die moet worden vertaald en getallen die precies moeten blijven zoals ze zijn. Voor een prijslijst in euro's moeten de productbeschrijvingen van het Frans naar het Engels worden vertaald, maar de prijzen, hoeveelheden en SKU-codes moeten absoluut ongewijzigd blijven. Bij een financieel rapport moet het commentaar worden vertaald, terwijl de omzetcijfers en percentagewaarden vergrendeld blijven. Standaard Translate PDF-tools behandelen alle inhoud vaak op uniforme wijze, waardoor het risico bestaat dat getallen worden gewijzigd door opmaakwijzigingen, conversie van decimale scheidingstekens of onbedoelde tekenvervanging.

Het probleem is niet dat vertaalhulpmiddelen geen onderscheid kunnen maken tussen tekst en cijfers. De meeste moderne vertaalmachines herkennen numerieke patronen en laten deze in hun isolement ongewijzigd. De problemen ontstaan wanneer getallen worden ingebed in tekenreeksen met gemengde inhoud, wanneer het PDF-extractieproces de celgrenzen verkeerd identificeert en wanneer het opnieuw invoegen van vertaalde tekst de tabelindeling verbreekt. Een methodische aanpak waarbij tekst en numerieke inhoud worden gescheiden vóór vertaling, levert consistent nauwkeurige resultaten op.

De PDF Export en vertaalhulpmiddelen van WukongPDF behouden de tabelstructuur tijdens de taalconversie. Voor documenten met veel tabellen levert het voorbewerken van de tabellen om numerieke cellen te isoleren voordat de vertaalengine wordt uitgevoerd de meest nauwkeurige uitvoer op met de minste correcties na de vertaling.

How to Translate Only the Text in PDF Table Cells While Keeping Numbers Untouched

Waarom vertaalhulpmiddelen soms nummers wijzigen

Vertaalmachines verwerken tekstreeksen als taalkundige eenheden. Wanneer een tabelcel 1.500 eenheden bevat, beschouwt de engine dit als een gemengde reeks en moet beslissen of 1.500 een getal is dat met rust moet worden gelaten of een deel van een zin die moet worden vertaald. De meeste zoekmachines die zijn getraind op modellen uit 2024 en later, verwerken dit correct voor gangbare numerieke formaten. De randgevallen die nog steeds problemen veroorzaken, zijn onder meer decimale scheidingstekens, waarbij de Europese notatie van 1.500,00 onnodig kan worden omgezet naar US 1.500,00, en valutasymbolen, waarbij de engine het symbool kan verplaatsen of dupliceren op basis van de conventies van de doeltaal.

Datumformaten zijn een ander vaak voorkomend slachtoffer. Een datum geschreven als 07-03-2025 in een Amerikaans-Engels brondocument betekent 7 maart 2025. Als de vertaalmachine ook de datumopmaak voor een Brits-Engels publiek lokaliseert, kan de weergave worden geconverteerd naar 03-07-2025, waardoor de betekenis volledig verandert. De veiligste aanpak is om datums naast cijfers als beschermde inhoud te behandelen en alleen de omringende tekst te vertalen.

WukongPDF

Probeer PDF vertalen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Methode 1: De tabel voorbewerken in Excel

De meest beheersbare workflow is het extraheren van de PDF-tabel in Excel voordat deze wordt vertaald. Converteer de PDF naar Excel met behulp van een tool die de tabelstructuur behoudt. Scan in het resulterende spreadsheet de kolommen en identificeer welke vertaalbare tekst versus numerieke gegevens bevatten. Voeg een nieuw blad in voor vertaalde inhoud. Kopieer alleen de tekstkolommen naar een vertaalvriendelijk formaat: plak ze rechtstreeks in een vertaalhulpmiddel of exporteer ze als een afzonderlijk bestand.

Na het vertalen van de tekstkolommen plakt u de vertaalde tekst terug in de spreadsheet op de overeenkomstige posities, waarbij u de numerieke kolommen volledig onaangeroerd laat. Controleer de gecombineerde tabel op problemen met de celuitlijning en exporteer vervolgens het voltooide spreadsheet naar PDF. Deze methode garandeert een numerieke wijziging van nul, omdat de getallen nooit door de vertaalmachine gaan. Het nadeel is dat het een handmatige kolom-voor-kolom-workflow vereist, wat praktisch is voor tabellen met 10 tot 50 rijen, maar arbeidsintensief wordt voor documenten met honderden rijen.

Methode 2: Een op Regex gebaseerde aanpak voor het maskeren van inhoud gebruiken

Sommige professionele vertaalhulpmiddelen en CAT-platforms (Computer-Assisted Translation) ondersteunen reguliere expressiepatronen die specifieke tekst als niet-vertaalbaar markeren. Voordat u de vertaling uitvoert, definieert u regex-patronen die overeenkomen met uw numerieke notaties: cijfers met komma's, cijfers met decimalen, getallen met valutavoorvoegsels, percentagewaarden en datumpatronen. Pas deze patronen toe als regels voor beveiligde inhoud. De vertaalmachine slaat vervolgens elk tekstsegment over dat overeenkomt met een beveiligd patroon en vertaalt alleen de resterende tekst.

Deze methode werkt goed voor documenten waarin de meeste numerieke gegevens een voorspelbaar formaat volgen. Een productcatalogus met een consistente prijsopmaak voor alle vermeldingen kan bijvoorbeeld worden beveiligd met een patroon als \$\d{1,3}(,\d{3})*\.\d{2} voor bedragen in dollars. Voor documenten met verschillende numerieke formaten in verschillende secties vereist de regex-aanpak meer patronen en meer testen. Controleer na de vertaling ten minste tien numerieke waarden in verschillende delen van het document om er zeker van te zijn dat er geen opmaakafwijking is opgetreden.

Methode 3: De workflow voor kopiëren, vertalen en plakken

Voor een enkele tabel in een PDF is de eenvoudigste aanpak om de tekstcellen kolom voor kolom te kopiëren, ze door een vertaalhulpmiddel te laten lopen en de resultaten terug te plakken in een duplicaat van de originele tabel. Gebruik een PDF-editor waarmee u tekst uit afzonderlijke tabelcellen kunt selecteren en kopiëren. Plak de tekst van elke kolom in een vertaaltekstvak, kopieer de vertaalde uitvoer en plak deze in de overeenkomstige kolom van een opnieuw opgebouwde tabel in Word, Google Docs of een PDF-editor die het bewerken van tabellen ondersteunt.

Deze methode is lastig voor grote tabellen, maar geeft je controle op pixelniveau over wat er vertaald wordt en wat origineel blijft. Bij de plakstap ontstaan er lay-outproblemen. Vertaalde tekst is vaak langer dan de brontekst, soms wel 20 tot 30 procent voor talen als Duits of Spaans. Voordat u de tabel voltooit, moet u de kolombreedte aanpassen aan de langere vertaalde tekst zonder het tabelraster te verbreken. Als de vertaalde inhoud niet binnen de oorspronkelijke celafmetingen past, kunt u overwegen de lettergrootte met 0,5 tot 1 punt te verkleinen in plaats van de tekst te laten overlopen of af te knippen.

Omgaan met cellen met gemengde inhoud

Sommige tabelcellen combineren daadwerkelijk tekst en cijfers in één enkele string: Bestel 15 eenheden vervangend onderdeel BP-4402 is een voorbeeld waarbij het getal 15 en de onderdeelcode BP-4402 de vertaling onveranderd moeten overleven terwijl de tekst eromheen wordt geconverteerd naar de doeltaal. Verpak voor deze cellen numerieke segmenten en ID's in tijdelijke aanduiding-tokens vóór de vertaling. Vervang 15 door NUM1 en BP-4402 door CODE1. Voer de vertaling uit. Vervang vervolgens de tijdelijke aanduidingen door de oorspronkelijke waarden in de vertaalde uitvoer.

Deze techniek voor tijdelijke aanduidingen werkt betrouwbaar omdat vertaalmachines tijdelijke aanduidingen behandelen als niet-vertaalbare tokens en deze woordelijk bewaren. Na de vertaling worden de tijdelijke aanduidingen met een eenvoudige zoek-en-vervanging teruggezet naar de oorspronkelijke waarden. Voor tabellen met veel cellen met gemengde inhoud kunt u het invoegen en vervangen van tijdelijke aanduidingen automatiseren met een kort script, in plaats van dit handmatig te doen.

AanpakHoe het werktBeperkingen
Volledige vertalingVertaal alles en corrigeer vervolgens handmatig de cijfersTijdrovende correctiestap
Selectief kopiëren-vertalenAlleen tekstcellen kopiëren, extern vertalen, terug plakkenBreekbaar behoud van de lay-out
Regex-patroonbeschermingMarkeer numerieke patronen als beveiligde tekst in de vertaaltoolVereist een tool die regex of beschermde bereiken ondersteunt
Tweelaagse PDF-aanpakGetallen afzonderlijk extraheren, tekst vertalen, opnieuw combinerenComplexe workflow, het beste voor hoogwaardige documenten

Het vertalen van alleen de tekst in de cellen van de PDF-tabel en het ongewijzigd laten van de cijfers is een precisietaak. De Excel-voorverwerkingsmethode is het meest betrouwbaar voor complexe tabellen. Op Regex gebaseerde bescherming werkt voor documenten met voorspelbare numerieke formaten. De handmatige aanpak van kopiëren, vertalen en plakken voorziet in snelle, eenmalige behoeften. Welke methode u ook kiest, een verificatiepas van vijf minuten waarin een aantal numerieke waarden voor en na de vertaling wordt vergeleken, spoort eventuele problemen op voordat het document zijn publiek bereikt.

Checklist voor kwaliteitsverificatie na vertaling

Nadat u de tekst in uw PDF-tabel heeft vertaald, voert u een systematische kwaliteitscontrole uit voordat u het document deelt. Vergelijk eerst het totale aantal rijen in de originele en vertaalde tabellen. Als de tellingen verschillen, is er tijdens de extractie- of invoegstap een rij verwijderd of gedupliceerd. Ten tweede: controleer vijf numerieke waarden in verschillende kolommen ten opzichte van het originele document. Bevestig dat decimalen, komma's, valutasymbolen en mintekens ongewijzigd blijven. Ten derde: controleer of de kolomuitlijning consistent is in alle rijen. Eén verkeerd uitgelijnde kolom verschuift alle gegevens in die kolom ten opzichte van de kopteksten.

Wanneer vertaalde tabellen bestemd zijn voor professioneel of legaal gebruik, laat dan een moedertaalspreker van de doeltaal een voorbeeld van vertaalde cellen beoordelen. Automatische vertaling van tabelinhoud levert soms technisch correcte maar contextueel ongepaste vertalingen op voor branchespecifieke termen. Een menselijke beoordeling van vijf minuten spoort terminologieproblemen op die geautomatiseerde kwaliteitscontroles over het hoofd zien. PDF vertalen-workflows die een menselijke verificatiestap omvatten, produceren consistent betrouwbare resultaten voor bedrijfskritieke documenten.

De extra tijd die wordt besteed aan het isoleren van numerieke inhoud vóór de vertaling, betaalt zich uit in nauwkeurigheid. Een vertaalde prijslijst waarbij elk getal correct is, maar een productnaam enigszins onhandig is, is een bruikbaar document. Een vertaalde prijslijst met perfecte productnamen maar verschoven decimalen is een risico. Geef prioriteit aan numerieke nauwkeurigheid en verifieer met steekproeven.

Numerieke beveiliging automatiseren in terugkerende vertaalworkflows

Voor organisaties die vergelijkbare tabeldocumenten volgens een terugkerend schema vertalen, verwijdert het bouwen van een voorverwerkingsscript dat automatisch numerieke cellen identificeert en beschermt de handmatige inspectiestap uit de workflow. Een Python-script dat reguliere expressies gebruikt, kan een uit de PDF geëxtraheerd CSV-bestand scannen, kolommen die meer dan 80 procent numerieke waarden bevatten, als beschermd markeren en een gemarkeerd bestand uitvoeren waarin de vertaaltool kan zien welke inhoud moet worden overgeslagen. Het script draait in minder dan een seconde voor tabellen met duizenden rijen, en de consistentie elimineert het risico dat een menselijke recensent per ongeluk een getal mist dat beschermd had moeten worden tegen de vertaalmachine. Nadat u een workflow voor numerieke beveiliging hebt geïmplementeerd, voert u eenmaal per kwartaal een vergelijking uit tussen de bron- en vertaalde PDF-tabellen om er zeker van te zijn dat de beveiligingsregels nog steeds elk numeriek patroon in uw zich ontwikkelende documentenset opvangen.

WukongPDF

Probeer PDF vertalen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →