U scant een tweetalig contract. De linkerkolom is in het Engels. De rechterkolom is in het Spaans. Beide talen moeten doorzoekbaar zijn, maar een standaard OCR-run die voor de ene taal is geconfigureerd, zal de andere verminken. Engelse OCR toegepast op Spaanse tekst levert onzin op omdat de herkenningsengine verschillende letterfrequenties en woordpatronen verwacht. Spaanse OCR toegepast op Engels levert vergelijkbare verminkte resultaten op. Je hebt OCR nodig die beide talen tegelijkertijd begrijpt.
Meertalige OCR PDF is een functie van moderne herkenningsengines die binnen één document tussen taalmodellen kunnen schakelen. De engine detecteert in welke taal elk tekstblok is geschreven en past het juiste herkenningsmodel toe. Het resultaat is nauwkeurige tekstherkenning in alle talen van het document.

Hoe OCR-engines meerdere talen verwerken
OCR-engines herkennen tekst door tekenvormen te vergelijken met getrainde modellen van hoe letters er in elke taal uitzien. Een Engels model weet dat de letter "e" is de meest voorkomende, dat "de" vaak samen voorkomt, en dat bepaalde tekencombinaties zoals "qx" vrijwel nooit voorkomen. Een Spaans model weet dat karakters met accenten zoals "a" met accent, "n" met tilde, en omgekeerde vraagtekens komen vaak voor. Een Frans model verwacht klinkers met frequente accenten en specifieke digraphs.
Wanneer u meerdere talen opgeeft voor een OCR-taak, laadt de engine de tekenmodellen voor alle opgegeven talen. Terwijl het elk tekstblok op de pagina verwerkt, evalueert het welk taalmodel het beste overeenkomt met de waargenomen tekenpatronen en past het dat model toe. De taaldetectie gebeurt automatisch op tekstblokniveau, zodat een pagina met Engelse hoofdtekst en Franse voetnoten correct wordt afgehandeld zonder handmatige taalcodering.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Meertalige OCR instellen
In de taalselectie van de OCR-tool zijn meerdere talen mogelijk. Selecteer alle talen die in het document verschijnen. Voor een tweetalig Engels-Spaans contract selecteert u zowel Engels als Spaans. Voor een document van de Europese Unie dat Engels, Frans en Duits bevat, selecteert u ze alle drie. Voor een wetenschappelijk werk met Engelse tekst en Oudgriekse citaten selecteert u Engels en Grieks. De motor laadt alle benodigde modellen.
Er is een wisselwerking tussen taaldekking en nauwkeurigheid. Elke extra taal voegt meer karaktermodellen toe aan het herkenningsproces, waardoor de kans op verwarring tussen vergelijkbare karakters uit verschillende talen groter wordt. De Cyrillische letter "a" lijkt identiek aan de Latijnse letter "a" maar vertegenwoordigt een ander geluid en verschijnt in verschillende contexten. Het toevoegen van onnodige talen vergroot het risico dat de engine tekstblokken verkeerd classificeert en het verkeerde taalmodel toepast. Selecteer alleen de talen die daadwerkelijk in het document voorkomen, niet elke taal waarvan u denkt dat deze nuttig kan zijn.
Veel voorkomende meertalige OCR-scenario's en hoe hiermee om te gaan
Het meest voorkomende meertalige scenario is een document dat voornamelijk in de ene taal is opgesteld, met korte passages, citaten of voetnoten in een andere taal. Een wetenschappelijk artikel in het Engels met Franse citaten in de voetnoten. Een handleiding in het Duits met Engelse technische termen. Een juridisch contract in het Spaans met in het Engels gedefinieerde termen. Voor deze documenten bevat de primaire taal het grootste deel van de tekst, en verschijnt de secundaire taal in korte, voorspelbare contexten.
De herkenningsengine kan deze gemengde documenten goed verwerken, omdat de taalwisseling is gelokaliseerd voor specifieke tekstblokken. De Engelse hoofdtekst wordt herkend met het Engelse model. Het Franse citaat wordt herkend bij het Franse model. Omdat de twee talen in afzonderlijke tekstblokken verschijnen, identificeert de taaldetectie van de engine correct welk model voor elk blok moet worden gebruikt.
Een uitdagender scenario is een document waarin talen op dezelfde regel worden doorvlochten, zoals een taalboek waarin een zin in het Engels wordt weergegeven, gevolgd door de vertaling ervan in het Spaans op dezelfde regel. De OCR-engine kan de hele regel als één tekstblok behandelen en één taalmodel op alles toepassen, waardoor fouten optreden in de helft van de regel die in de andere taal is. Voor deze documenten is de meest nauwkeurige aanpak om het document twee keer te OCRen, één keer in elke taal, en de resultaten handmatig samen te voegen. Dit is arbeidsintensief en alleen praktisch voor korte documenten waarbij nauwkeurigheid van cruciaal belang is.
Meertalige OCR-resultaten verifiëren
Nadat u meertalige OCR hebt uitgevoerd, controleert u de resultaten door de tekst in elke taal te controleren. Zoek naar een woord waarvan u weet dat het in elke taal voorkomt. Bevestig dat de zoekopdracht het vindt. Selecteer tekst in elke taal en kopieer deze om te bevestigen dat de tekens correct zijn. Besteed speciale aandacht aan tekens met accenten en speciale symbolen. De herkenning van Gescande PDF mislukt hoogstwaarschijnlijk bij tekens die niet voorkomen in het dominante taalmodel, omdat de engine mogelijk standaard het dichtstbijzijnde Latijnse equivalent gebruikt.
Veel voorkomende OCR-fouten in meertalige documenten zijn onder meer tekens met accenten die zijn vervangen door hun niet-geaccentueerde equivalenten, e met accent wordt e, n met tilde wordt n, speciale interpunctie zoals omgekeerde vraagtekens in het Spaans vervangen door standaardvraagtekens, en niet-Latijnse schriften zoals Cyrillisch of Grieks die ten onrechte worden herkend als visueel vergelijkbare Latijnse karakters. Deze fouten zijn meestal geconcentreerd in de passages in de secundaire taal. Als de inhoud in de secundaire taal van cruciaal belang is, verifieert u deze passages handmatig aan de hand van het originele document. De OCR-tool van WukongPDF geeft een betrouwbaarheidsscore voor elk herkend tekstblok, waarbij lagere scores de blokken aangeven waar de herkenningsengine minder zeker was.
Voor documenten waarin talen van het Latijnse alfabet worden gecombineerd met niet-Latijnse schriften, zoals een Engels document met Chinese of Arabische citaten, is de OCR-uitdaging in meerdere talen groter omdat de tekenvormen fundamenteel verschillend zijn. De herkenningsengine moet onderscheid maken tussen volledig afzonderlijke schrijfsystemen. Selecteer de specifieke talen voor elke scriptfamilie die in het document verschijnt. De verwerking van PDF-formaat van WukongPDF ondersteunt het mixen van Latijnse, Cyrillische, Arabische, CJK- en Indische scripts in één enkele OCR-taak, hoewel de nauwkeurigheid varieert afhankelijk van het script en de scankwaliteit.
Een praktische techniek voor het verbeteren van meertalige OCR op documenten met verschillende taalsecties: scheid het document vooraf op taal voordat u OCR uitvoert. Als een contract van 20 pagina's de eerste 10 pagina's in het Engels en de laatste 10 pagina's in het Spaans bevat, splitst u het document in twee bestanden, voert u Engelse OCR uit op de eerste en Spaanse OCR op de tweede, en voegt u vervolgens opnieuw samen. Hierdoor wordt de overhead van het meertalige model volledig vermeden en ontstaat er een iets hogere nauwkeurigheid omdat elke OCR-taak gebruik maakt van een enkel taalmodel dat is geoptimaliseerd voor de exacte tekst die wordt verwerkt. De workflow voor het splitsen, afzonderlijk OCR en opnieuw samenvoegen neemt enkele minuten in beslag, maar levert op betrouwbare wijze de beste nauwkeurigheid op voor documenten met duidelijke taalgrenzen. Reserveer de meertalige OCR-aanpak voor documenten waarbij talen daadwerkelijk op dezelfde pagina zijn doorvlochten en scheiding onpraktisch is.
Nog een laatste tip voor meertalige OCR: als het document van rechts naar links geschreven scripts bevat, zoals Arabisch, Hebreeuws of Perzisch, naast links naar rechts-scripts zoals Engels of Frans, zorgt de tekstrichting voor extra complexiteit. OCR-engines moeten niet alleen detecteren in welke taal elk tekstblok zich bevindt, maar ook in welke richting de tekst loopt. Een blok Arabische tekst moet van rechts naar links worden herkend, terwijl het Engelse onderschrift eronder van links naar rechts moet worden herkend. De meeste moderne OCR-engines kunnen redelijk goed omgaan met documenten in gemengde richtingen als u beide taalfamilies opgeeft in de instellingen. Controleer na OCR de tekstrichting door een passage uit het Arabisch te kopiëren en in een teksteditor te plakken. De karakters moeten in de juiste leesvolgorde verschijnen, en niet in omgekeerde volgorde.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
