Tips & Tricks

Tekst in ingesloten afbeeldingen in een PDF vertalen

Een PDF-vertaaltool verwerkt de tekststroom in het document en converteert woorden van de ene taal naar de andere. Het leest de paragrafen, de kopjes en de bijschriften. Maar het leest niet de tekst die zich in afbeeldingen bevindt. Een foto van een bord, een screenshot van een gebruikersinterface in een andere taal, een diagram met aslabels weergegeven als onderdeel van de afbeelding, deze bevatten allemaal tekst die standaard vertaalhulpmiddelen negeren omdat de tekst niet in de PDF-tekststroom staat. Het is ingebed in de beeldpixels. Het vertalen van tekst in ingebedde afbeeldingen vereist het extraheren van de afbeeldingen, het uitvoeren van OCR daarop, het vertalen van de herkende tekst en het vervolgens opnieuw insluiten van de vertaalde afbeeldingen of het toevoegen van de vertaling als overlay. De workflow Translate PDF voor in afbeeldingen ingesloten tekst is ingewikkelder dan de standaardtekstvertaling, maar omvat inhoud die anders onvertaald zou blijven.

How to Translate Text Inside Embedded Images in a PDF

Afbeeldingen identificeren die vertaalbare tekst bevatten

Niet elke afbeelding in een PDF bevat tekst die de moeite waard is om te vertalen. Een decoratieve foto, een achtergrondtextuur en een bedrijfslogo mogen geen vertaalbare inhoud bevatten. Een screenshot van een softwaretoepassing, een diagram met gelabelde componenten, een foto van een document of een bord en een diagram met ingebedde aslabels bevatten allemaal tekst die een lezer in de doeltaal moet begrijpen. Scan de PDF en identificeer elke afbeelding die tekst bevat. Markeer deze afbeeldingen voor de vertaalworkflow.

Afbeeldingen die tekst in de PDF bevatten, vallen in twee categorieën: afbeeldingen waarbij de tekst door het ontwerp deel uitmaakt van de afbeelding, zoals een schermafbeelding of een gelabeld diagram, en afbeeldingen waarbij de tekst in de afbeelding verschijnt omdat het document is gescand in plaats van digitaal gemaakt. Een gescande PDF is één grote afbeelding per pagina. Alle tekst op een gescande pagina is ingesloten in de paginaafbeelding. Een digitaal gemaakte PDF kan een enkele schermafbeelding hebben op een anderszins op tekst gebaseerde pagina. De PDF Afbeeldingen die moeten worden vertaald, zijn de bestanden waarbij tekst in de afbeeldingspixels verschijnt en niet in de PDF-tekststroom.

WukongPDF

Probeer PDF vertalen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Afbeeldingen extraheren en de tekst herkennen

Extraheer de afbeeldingen uit de PDF met de hoogst beschikbare resolutie. Gebruik een tool voor het extraheren van PDF-afbeeldingen die de oorspronkelijke resolutie behoudt. Sla elke geëxtraheerde afbeelding op als een PNG-bestand om compressieartefacten tijdens de extractiestap te voorkomen. Open elke geëxtraheerde afbeelding en controleer of de tekst leesbaar is. Als de afbeeldingsresolutie te laag is om de tekst duidelijk te kunnen lezen, extraheer dan indien mogelijk opnieuw met een hogere resolutie, of houd er rekening mee dat deze afbeelding onbetrouwbare OCR-resultaten kan opleveren.

Voer OCR uit op elke geëxtraheerde afbeelding om de tekst te herkennen. De OCR-engine identificeert de tekstgebieden in de afbeelding en voert de herkende tekens uit, samen met hun posities. Sla de OCR-uitvoer voor elke afbeelding op, inclusief de herkende tekst en de coördinaten van het selectiekader van elk tekstgebied. Deze informatie is later nodig om de vertaalde tekst op de juiste positie op de afbeelding te plaatsen. WukongPDF verzorgt de verwerking van OCR PDF, waarbij tekst in ingesloten afbeeldingen kan worden herkend als onderdeel van de documentconversieworkflow.

De herkende tekst vertalen met behoud van de context

De tekst die uit afbeeldingen wordt herkend, is vaak fragmentarisch. Een diagram kan labels van één woord bevatten. Een screenshot kan menu-items en knoplabels bevatten zonder zinscontext. Deze gefragmenteerde tekst is een uitdaging voor automatische vertaalmachines, omdat de omringende taalkundige context die de betekenis van woorden ondubbelzinnig maakt, ontbreekt. Geef zoveel mogelijk context. Als een label Bestand leest en op een screenshot van een softwaremenu verschijnt, noteer dan in de vertalinginvoer dat dit een menu-item is en geen fysiek object.

Voor afbeeldingen met meerdere tekstgebieden moet u de toewijzing tussen elk gebied en de vertaling ervan behouden. Een diagram met tien labels levert tien afzonderlijke tekstreeksen op, die elk een vertaling nodig hebben. Bewaar de originele tekst, de vertaalde tekst en de coördinaten van het selectiekader bij elkaar in een gestructureerd formaat, zoals een spreadsheet. Deze mapping wordt in de laatste stap gebruikt om de vertaalde tekst op de afbeelding te plaatsen. Om de uitvoer van Translate PDF bruikbaar te maken, moet de vertaalde tekst op de juiste locatie op de afbeelding verschijnen en de originele tekst vervangen of begeleiden.

Vertaalde tekst terug op de afbeeldingen plaatsen

Er bestaan twee benaderingen voor het plaatsen van vertaalde tekst op afbeeldingen. De eerste benadering vervangt de originele tekst door de vertaling. Open de afbeelding in een afbeeldingseditor. Wis voor elk tekstgebied de originele tekst door het gebied met de achtergrondkleur te vullen. Plaats de vertaalde tekst in dezelfde regio en gebruik een lettertype dat zo goed mogelijk overeenkomt met de stijl van het origineel. Deze aanpak levert een zuiver vertaalde afbeelding op die lijkt op het origineel, maar in een andere taal.

Bij de tweede benadering wordt de vertaling naast de originele tekst toegevoegd. Plaats de vertaalde tekst in een contrasterende kleur onder of naast de originele tekst. Deze aanpak behoudt het origineel voor lezers die beide talen begrijpen en de vertaling willen vergelijken met de bron. Het is sneller dan wissen en vervangen, maar het resulterende beeld is visueel drukker. Kies de aanpak op basis van de behoeften van het publiek. Een trainingshandleiding voor operators die alleen de doeltaal lezen, heeft baat bij vervanging. Een tweetalig referentiedocument profiteert van een zij-aan-zij-presentatie.

Vertaalde afbeeldingen opnieuw insluiten in de PDF

Nadat de afbeeldingen met vertaalde tekst zijn verwerkt, moeten ze terug in de PDF worden geplaatst. Vervang elke originele afbeelding door de vertaalde tegenhanger. De vervangende afbeelding moet in dezelfde ruimte op de pagina passen als het origineel. Als de vertaalde afbeelding andere pixelafmetingen heeft dan het origineel, schaalt u deze zodat deze overeenkomt met het originele selectiekader in de PDF. De lay-out van de PDF-pagina mag niet veranderen. Het enige zichtbare verschil zou de taal van de tekst in de afbeeldingen moeten zijn.

Sla de PDF met de vertaalde afbeeldingen op als een nieuwe versie, waarbij u de originele, onvertaalde PDF als referentie behoudt. Controleer de vertaalde PDF door deze te openen en elke afbeelding te controleren. Bevestig dat de vertaalde tekst leesbaar is, correct gepositioneerd is en vrij is van OCR- of vertaalfouten. Een Translate PDF met ingebouwde beeldvertaling is voltooid wanneer elk tekstelement in het document, in de tekststroom en in de afbeeldingen, toegankelijk is voor een lezer in de doeltaal.

Wanneer moet u handmatige vertaling verkiezen boven geautomatiseerde?

Voor afbeeldingen die kritische tekst bevatten, zoals veiligheidswaarschuwingen, juridische mededelingen of technische specificaties, kunt u handmatige vertaling door een menselijke vertaler overwegen in plaats van automatische vertaling. Een OCR-fout in combinatie met een machinevertaalfout kan de betekenis van een veiligheidsinstructie veranderen op een manier die reële gevolgen heeft. De kosten van menselijke vertaling voor een klein aantal kritische afbeeldingen zijn klein vergeleken met de kosten van een onjuiste vertaling.

Voor grote hoeveelheden afbeeldingen waarbij handmatige vertaling niet praktisch is, implementeert u een beoordelingsstap. Laat na de automatische vertaling en het opnieuw insluiten een menselijke recensent die de doeltaal leest een voorbeeld van de vertaalde afbeeldingen controleren op juistheid. Als het monster systemische fouten aan het licht brengt, past u de OCR-instellingen of de parameters van de vertaalmachine aan en verwerkt u de batch opnieuw.

De vertaling van tekst in ingesloten afbeeldingen is vaak de laatste stap in het volledig toegankelijk maken van een PDF voor een internationaal publiek. De hoofdtekst, kopjes en bijschriften zijn vertaald. De afbeeldingen blijven de uiteindelijke onvertaalde inhoud. Als u deze stap voltooit, ontstaat er een document waarin elk stukje tekst, op elk medium, beschikbaar is in de doeltaal.

Voor regelmatig bijgewerkte documenten met ingesloten afbeeldingen kunt u overwegen of de afbeeldingstekst tijdens het maken van het document naar de PDF-tekststroom kan worden verplaatst. Een diagram met labels die zijn opgeslagen als tekstoverlays in plaats van als onderdeel van de afbeelding, kan worden vertaald met behulp van standaard tekstvertaaltools, waardoor de workflow uitpakken, OCR, vertalen en opnieuw insluiten volledig wordt vermeden.

De kwaliteit van het uiteindelijke vertaalde beeld hangt af van de kwaliteit van elke stap in de pijplijn. Een beeldextractie met hoge resolutie produceert duidelijke OCR-invoer. Nauwkeurige OCR produceert correcte tekst voor vertaling. Een goede vertaalmachine behoudt de betekenis. Zorgvuldige herinbedding behoudt de visuele kwaliteit. Elke stap is afhankelijk van de vorige.

De workflow Translate PDF voor in afbeeldingen ingebedde tekst is het meest arbeidsintensieve vertaalscenario omdat het beeldverwerking, OCR, vertaling en opnieuw insluiten combineert in één pijplijn. Door zoveel mogelijk stappen te automatiseren, wordt de handmatige inspanning verminderd.

Voor afbeeldingen die identiek in meerdere PDF's voorkomen, zoals een bedrijfslogo met een slogan of een standaarddiagram, vertaalt u de afbeelding één keer en gebruikt u deze opnieuw. De vertaalde afbeelding kan worden vervangen in elke PDF waarin de originele afbeelding verschijnt.

Dit artikel behandelt de belangrijkste technieken en overwegingen voor het werken met PDF's in dit specifieke scenario. De hier beschreven methoden zijn van toepassing op verschillende tools en platforms, waardoor lezers de flexibiliteit hebben om de aanpak te kiezen die het beste bij hun workflow en technische omgeving past.

De geschetste praktische stappen bieden een duidelijk pad van de initiële uitdaging naar een werkende oplossing. Elke techniek is geselecteerd vanwege zijn betrouwbaarheid en toegankelijkheid, zodat lezers consistente resultaten kunnen bereiken, ongeacht hun eerdere ervaring met PDF-tools.

WukongPDF en soortgelijke platforms bieden de OCR- en documentverwerkingstools die de in dit artikel beschreven workflow voor het vertalen van afbeeldingsteksten ondersteunen. De combinatie van deze tools maakt een uitgebreide vertaaldekking mogelijk.

WukongPDF

Probeer PDF vertalen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →