Het ontvangen van een Gescande PDF, geschreven in een taal die u niet spreekt, is gebruikelijker dan ooit in het mondiale zakenleven, in academisch onderzoek en in de beoordeling van juridische documenten. U moet de tekst eruit halen, vertalen en begrijpen wat het document zegt. De uitdaging is niet alleen het uitvoeren van OCR op het bestand. Er wordt OCR uitgevoerd met de juiste taalinstellingen, zodat de geëxtraheerde tekst nauwkeurig genoeg is om te vertalen. Het selecteren van de verkeerde taal tijdens de verwerking van OCR PDF levert verminkte uitvoer op die geen enkele vertaalmachine kan redden.
OCR-engines zien geen letters. Ze zien vormen en matchen die vormen met karakterpatronen voor een specifieke taal. Als u de OCR-engine vertelt dat het document in het Engels is, maar dat het feitelijk in het Russisch is, wijst de engine Cyrillische vormen toe aan de dichtstbijzijnde Latijnse tekens die hij kent. Het resultaat is een reeks willekeurig ogende letters die geen enkele relatie hebben met de originele tekst. Het correct instellen van de taal, of het gebruiken van automatische detectie waar beschikbaar, is de allerbelangrijkste beslissing in de gehele OCR-naar-vertaling-pijplijn.
De PDF-naar-tekst- en OCR-tools van WukongPDF extraheren tekst uit gescande documenten voor vertaling en analyse. Door de juiste OCR-taalselectie te koppelen aan een betrouwbare vertaalservice, wordt een onleesbare scan in een vreemde taal in minder dan vijf minuten omgezet in een begrijpelijk document.

Stap 1: Identificeer de documenttaal
Voordat u OCR-software aanraakt, moet u met zekerheid de taal van het document identificeren. Als de metagegevens van het document of de bestandsnaam naar de taal verwijzen, begin dan daar. Als dit niet het geval is, opent u de pdf en bekijkt u enkele pagina's. Zelfs zonder de tekst te lezen, beperken visuele aanwijzingen de mogelijkheden aanzienlijk. Scriptfamilies zijn onderscheidend: het Latijnse schrift bedient de meeste Europese talen. Cyrillisch wordt gebruikt voor Russisch, Oekraïens, Bulgaars en Servisch. Arabisch schrift omvat Arabisch, Perzisch en Urdu. CJK omvat Chinees, Japans en Koreaans. Devanagari beslaat Hindi, Marathi en Nepalees.
Als u zelfs de scriptfamilie niet visueel kunt identificeren, maak dan een screenshot van een representatieve alinea en upload deze naar de beeldvertaalfunctie van Google Translate of een omgekeerde zoekfunctie voor afbeeldingen. Deze tools identificeren in de meeste gevallen zowel het script als de specifieke taal. Wetende dat het document Thais is in plaats van Laotiaans, of Koreaans in plaats van Japans, maakt het verschil tussen nauwkeurige OCR-uitvoer en nutteloze karakterruis.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Stap 2: Selecteer een OCR-tool die de doeltaal ondersteunt
Niet alle OCR-tools ondersteunen alle talen. Adobe Acrobat Pro wordt geleverd met OCR-engines voor ongeveer 40 talen. De tool Tekst herkennen bevat een vervolgkeuzelijst voor taalselectie in het instellingendialoogvenster. Tesseract, de gratis open-source OCR-engine die wordt onderhouden door Google, ondersteunt meer dan 100 talen via downloadbare taalgegevensbestanden. De Google Cloud Vision API heeft de grootste taaldekking met meer dan 200 talen en bevat automatische taaldetectie als optionele functie.
Voor een document in een enkele taal die u kunt identificeren, werken al deze tools zolang u de juiste taal opgeeft voordat u OCR uitvoert. Voor een document dat meerdere talen bevat, zoals een tweetalig contract met clausules in zowel het Engels als het Frans, hebt u een tool nodig die meerdere gelijktijdige talen ondersteunt of automatisch per alinea kan detecteren. Google Cloud Vision en Tesseract met de juiste taaldatapakketten verwerken beide meertalige documenten, hoewel de nauwkeurigheid van de grenzen van taalwisseling nooit perfect is.
Stap 3: Configureer en voer de OCR uit met de juiste taal
Open in Adobe Acrobat Pro de gescande PDF, ga naar Extra, vervolgens naar Scannen en OCR, selecteer Tekst herkennen en vervolgens In dit bestand. Klik op de knop Bewerken naast de taalkiezer. Kies in het dialoogvenster Tekst herkennen de juiste primaire taal uit de vervolgkeuzelijst. Als het document een tweede taal bevat, klikt u op de knop Taal toevoegen en selecteert u deze ook. Acrobat verwerkt beide talen tegelijkertijd. Klik op OK en vervolgens op Tekst herkennen. Acrobat voert de OCR-pas uit en sluit de herkende tekst in als een onzichtbare laag achter de gescande afbeelding. Het document is nu doorzoekbaar.
In Tesseract specificeert de opdrachtregelaanroep de taal met de vlag -l: tesseract input.pdf output -l rus voor Russisch, tesseract input.pdf output -l jpn voor Japans, of tesseract input.pdf output -l fra+eng voor een tweetalig Frans-Engels document. Installeer eerst de vereiste taalgegevensbestanden; Tesseract wordt standaard alleen met Engels verzonden. Voor Google Cloud Vision bevat de API-aanroep een taalHints-parameter die een reeks BCP-47-taalcodes accepteert. Cloud Vision biedt ook een automatische taaldetectiemodus waarvoor helemaal geen taalhint nodig is, waardoor dit de eenvoudigste optie is als u de taal van het document echt niet kent.
Stap 4: Kopieer de geëxtraheerde tekst en vertaal
Nadat de OCR is voltooid, controleert u de tekstkwaliteit voordat u deze ter vertaling verzendt. Open in Acrobat het gereedschap Zoeken en zoek naar een veelvoorkomend woord dat u in het document herkent. Als de zoekopdracht overeenkomsten oplevert, werkte de OCR. Selecteer een alinea van de geëxtraheerde tekst, kopieer deze en plak deze in een teksteditor. Scan op duidelijke OCR-fouten: herhaalde symbolen, woorden die in het midden breken of grote blokken met niet-herkende tekens. Als meer dan 5 procent van de tekst beschadigd lijkt, voer de OCR dan opnieuw uit met een andere taalinstelling of een hogere resolutie-instelling.
Zodra de geëxtraheerde tekst een visuele controle heeft doorstaan, kopieert u de volledige tekst en plakt u deze in een vertaalhulpmiddel. Google Translate, DeepL of Microsoft Translator accepteren allemaal platte tekstinvoer. Voor langere documenten ondersteunen DeepL en Google Translate het direct uploaden van bestanden van doorzoekbare PDF's, waarbij de handmatige kopieerstap wordt overgeslagen. De vertaaluitvoer is goed genoeg voor begrip, onderzoek en intern zakelijk gebruik. Voor juridische, medische of publicatiekwaliteit kunt u de doorzoekbare PDF naar een professionele menselijke vertaler sturen, die de OCR-laag als uitgangspunt zal gebruiken en de automatische vertaling zal corrigeren aan de hand van de origineel gescande pagina's.
Omgaan met documenten met gemengde scripts of niet-standaardlettertypen
Documenten waarin scripts worden gecombineerd, zoals een Arabisch onderzoeksartikel waarin Engelse technische termen in het Latijnse schrift zijn opgenomen, verwarren OCR-engines die één enkel script verwachten. Configureer eerst de OCR voor het dominante script en voer vervolgens een tweede passage uit die gericht is op het minderheidsscript in hetzelfde document. Voeg de resultaten samen door beide OCR-lagen te exporteren en ze te combineren in een teksteditor. De nauwkeurigheid van de minderheidsscriptpassages zal lager zijn omdat de engine is geoptimaliseerd voor het primaire script.
Niet-standaard lettertypen, waaronder decoratieve lettertypen, oude typemachinelettertypen en handgeschreven-achtige cursieve lettertypen, verminderen de nauwkeurigheid van de OCR, zelfs als de juiste taal is geselecteerd. Verwerk deze documenten vooraf door de PDF-pagina's te converteren naar afbeeldingen met een hoge resolutie van 400 DPI of hoger, een verscherpingsfilter toe te passen en het contrast te verhogen voordat ze in de OCR-engine worden ingevoerd. De ingebouwde voorverwerking van Tesseract, ingeschakeld met --psm 3 voor automatische paginasegmentatie, verwerkt gematigde lettertypevariaties. Voor ernstig gedegradeerde of gestileerde tekst presteert de Google Cloud Vision API doorgaans beter dan lokale OCR-engines, omdat de modellen zijn getraind op een groter corpus van real-world lettertypevoorbeelden.
| OCR-tool | Meertalige ondersteuning | Autodetectie | Beste voor |
|---|---|---|---|
| Adobe Acrobat Pro | 40+ talen | Handmatige selectie | Professionele documenten, hoge nauwkeurigheid |
| Tesseract (open source) | 100+ talen | Handmatige selectie vereist | Batchverwerking, scripting, gratis |
| Google Cloudvisie | 200+ talen | Automatische detectie beschikbaar | API-integratie, gemengde scripts |
| Online OCR-diensten | 10-50 talen | Handmatige selectie | Snelle OCR van één document |
Nauwkeurigheid verifiëren voordat actie wordt ondernomen op basis van vertaalde inhoud
OCR gevolgd door automatische vertaling introduceert twee lagen van potentiële fouten: OCR-foutherkenning en dubbelzinnigheid bij vertalingen. Voor cruciale documenten kunt u de uitvoer ter plekke controleren door een tweetalige collega of een professionele vertaler te vragen een willekeurig geselecteerde paragraaf van de vertaling te vergelijken met de originele pdf. Een verificatie van vijf minuten spoort catastrofale fouten op, zoals een verkeerde taalinstelling die plausibel ogende maar volkomen onjuiste tekst opleverde.
Als u regelmatig in een vreemde taal gescande PDF's verwerkt, stel dan een checklist op: identificeer de taal, selecteer de overeenkomende OCR-engine, voer OCR uit met de juiste taalparameter, controleer de geëxtraheerde tekst op tekennauwkeurigheid, vertaal en verifieer een voorbeeldparagraaf. Na twee of drie documenten wordt de workflow routine en duurt het minder dan vijf minuten vanaf het openen van het bestand tot het lezen van het vertaalde resultaat.
Als het gaat om documentverwerking, voor veiligheidsgevoelige documenten, vermijdt offline OCR blootstelling aan de cloud volledig. Tesseract draait lokaal zonder netwerkverzoeken nadat u de taalgegevensbestanden één keer hebt gedownload. Adobe Acrobat Pro voert OCR ook lokaal uit via de functie Tekst herkennen, zonder dat u zich hoeft aan te melden bij Document Cloud. Voor vertrouwelijk materiaal in een vreemde taal, zoals juridische ontdekkingen of gevoelige zakelijke correspondentie, zorgt lokale OCR in combinatie met offline tekstcontrole ervoor dat de originele documentinhoud binnen uw gecontroleerde omgeving blijft.
Als OCR alleen niet genoeg is: ondersteunde transcriptiediensten
Voor documenten waarbij de OCR-nauwkeurigheid onbruikbaar laag is vanwege extreme verslechtering van het lettertype, handgeschreven tekst of sterk gemengde scripts, bieden ondersteunde transcriptieservices door mensen geverifieerde uitvoer. Deze services combineren een initiële machine-OCR-pas met menselijke beoordeling en correctie, waarbij doorgaans per pagina wordt gerekend. De doorlooptijd varieert van enkele uren tot enkele dagen. Voor een enkel cruciaal document waarvan over de nauwkeurigheid niet kan worden onderhandeld, zoals een geboorteakte in een vreemde taal of een octrooiaanvraag, worden de kosten van menselijke transcriptie gerechtvaardigd door het risico dat wordt gehandeld op basis van verkeerd herkende tekst. Voer eerst machine-OCR uit om de kwaliteit te beoordelen. Als meer dan 15 procent van de woorden niet wordt herkend of duidelijk onjuist is, kunt u overgaan tot ondersteunde transcriptie in plaats van urenlang handmatig de machine-uitvoer te corrigeren.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
