U scant een tweetalig menu. De namen van de gerechten zijn in het Italiaans. De beschrijvingen zijn in het Engels. De prijzen zijn getallen die taalonafhankelijk zijn. U hoeft alleen de Italiaanse tekst te extraheren om een Italiaanstalige woordenlijst te maken, of alleen de Engelse tekst om naar een vertaler voor een ander talenpaar te sturen. Het uitvoeren van OCR op het hele document levert een mix van beide talen op, wat prima is voor de doorzoekbaarheid, maar niet voor selectieve extractie.
Voor het extraheren van tekst in slechts één taal uit een meertalig OCR PDF-document is een OCR-engine vereist die kan identificeren in welke taal elk tekstblok is geschreven en alleen de blokken kan extraheren die overeenkomen met uw doeltaal. Dit is een selectievere bewerking dan standaard OCR, die alle tekst herkent, ongeacht de taal.

Hoe taalselectieve OCR werkt
OCR-engines met meertalige ondersteuning kunnen worden geconfigureerd om tekst in meerdere talen tegelijkertijd te herkennen. Wanneer u "Italiaans en Engels" Net als de OCR-talen herkent de engine tekst in beide talen. Het tagt ook elk herkend tekstblok met de taal waarin het werd herkend. Een blok Italiaanse tekst wordt getagd als Italiaans. Een blok Engelse tekst wordt getagd als Engels. De taaltagging maakt selectieve extractie mogelijk.
Na OCR kunt u de herkende tekst filteren op taaltag. Exporteer alleen de blokken die zijn getagd als Italiaans. De uitvoer is een document dat alleen de Italiaanse tekst uit het menu bevat. De Engelse beschrijvingen, herkend maar uitgefilterd, verschijnen niet in de uitvoer. Deze selectieve extractie is handig voor vertaalworkflows, taalleermateriaal en inhoudsanalyse waarbij u tekst in een specifieke taal nodig heeft, geïsoleerd van de omringende tekst in andere talen.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Stap voor stap: tekst extraheren in een specifieke taal
Upload de gescande PDF naar de OCR-tool van WukongPDF. Selecteer de talen die in het document aanwezig zijn. Voor het menu Italiaans-Engels selecteert u zowel Italiaans als Engels. Voer de OCR uit. De tool herkent alle tekst en tags per blok per taal. Nadat de OCR is voltooid, gebruikt u het taalfilter om Italiaans te selecteren. Exporteer de gefilterde tekst als een gewoon tekstbestand, een Word-document of een nieuwe PDF die alleen de Italiaanse blokken bevat.
De nauwkeurigheid van taaldetectie hangt af van het onderscheidend vermogen van de talen. Italiaans en Engels gebruiken hetzelfde alfabet, maar hebben verschillende woordpatronen. De OCR-engine onderscheidt ze door woordfrequenties te analyseren. Italiaans heeft veel woorden die eindigen op klinkers. Engels heeft veel woorden die eindigen op medeklinkers. Hoe duidelijker de talen, hoe nauwkeuriger de taalcodering. Twee nauw verwante talen, zoals Spaans en Portugees, kunnen door de engine in korte tekstblokken door elkaar worden gehaald.
Omgaan met tekst in verschillende talen op dezelfde lijn
Sommige documenten combineren talen binnen één regel, zoals een taalboek waarin een zin in het Frans wordt gecombineerd met de vertaling in het Engels op dezelfde regel. De OCR-engine kan de hele regel classificeren als de dominante taal, waardoor de woorden in de minderheidstalen verkeerd worden getagd. Voor deze documenten is taalselectieve extractie op blokniveau niet nauwkeurig genoeg. Je hebt een andere aanpak nodig.
Het alternatief is om OCR twee keer uit te voeren, één keer met elke taal als enige herkenningstaal. De OCR-pas voor alleen Italië herkent Italiaanse tekst goed, maar verminkt Engelse tekst. De alleen-Engelse pas herkent Engels goed, maar verminkt Italiaans. Vergelijk de twee uitgangen en selecteer handmatig de juiste versie voor elk tekstsegment. Deze dual-pass-aanpak kost meer tijd, maar levert de meest nauwkeurige taalspecifieke extractie op voor documenten waarin talen op zinsniveau worden doorschoten.
De geëxtraheerde tekst verifiëren en opschonen
Controleer na het extraheren van tekst in de doeltaal of de taalfiltering correct was. Scan de geëxtraheerde tekst op woorden die duidelijk in de verkeerde taal zijn gesteld. Een Italiaanse tekstextractie uit een menu mag geen Engelse woorden bevatten, zoals "grilled" of "geserveerd met" tenzij het menu deze woorden opzettelijk in de Italiaanse beschrijvingen heeft gebruikt. Gefilterde tekst die onverwachte vreemde woorden bevat, duidt op taaltagfouten die handmatige correctie vereisen.
Voer een spellingcontrole uit in de doeltaal. De Italiaanse spellingcontrole markeert Engelse woorden die onjuist zijn opgenomen in de Italiaanse extractie. De spellingcontrolevlaggen zijn een efficiënte manier om taaltaggingfouten op te sporen zonder elk geëxtraheerd woord te lezen. De Extract PDF Data die op taal is gefilterd en op spelling is gecontroleerd, is klaar voor vertaling, analyse of archivering. WukongPDF's Gescande PDF OCR met taalfiltering produceert schonere extracten in één taal dan nabewerking van OCR-uitvoer in gemengde talen om de ongewenste taal te verwijderen.
Een praktische toepassing voor taalselectieve OCR: tweetalige woordenlijsten maken van vertaalde documenten. Extraheer alle termen in de brontaal en alle termen in de doeltaal afzonderlijk. Lijn ze uit op hun positie op de pagina, aangezien elke bronterm een corresponderende doelterm heeft op ongeveer dezelfde verticale positie op de pagina of in een aangrenzende kolom. De afgestemde uitvoer wordt een termenlijst die vertalers kunnen gebruiken om consistentie in toekomstige vertalingen te garanderen. Deze techniek voor het opbouwen van een woordenlijst wordt veel gebruikt bij technische vertalingen waarbij consistente terminologie van cruciaal belang is.
Voor documenten waarin talen in afzonderlijke kolommen staan, zoals een tweetalig contract met twee kolommen, wordt taalselectieve extractie een kolomselectietaak. De linkerkolom is één taal, de rechterkolom is een andere. In plaats van te vertrouwen op taaldetectie, die vergelijkbare talen kan verwarren, kunt u de PDF bijsnijden om elke kolom afzonderlijk te extraheren. Voer eentalige OCR uit op elke kolom. Deze benadering van het bijsnijden van kolommen is betrouwbaarder dan taalfiltering voor documenten met een duidelijke taalscheiding in kolommen.
Voor archiefprojecten waarbij historische meertalige documenten betrokken zijn, creëert taalselectieve OCR in combinatie met metadatatagging een doorzoekbaar archief waarin onderzoekers inhoud in een specifieke taal in duizenden documenten kunnen vinden. De OCR-uitvoer van elk document wordt getagd met de gedetecteerde talen. Een onderzoeker die naar Franse documenten uit de 18e eeuw zoekt, kan binnen een meertalige collectie alleen op Franstalige tekst filteren. Deze selectieve aanpak transformeert archief-OCR van een bot hulpmiddel dat talen mengt in een precisie-instrument voor taalkundig onderzoek.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
