Others

Wat is het verschil tussen OCR-tekst en ingesloten tekst in een PDF

Open een gescande PDF en u kunt de tekst selecteren, kopiëren en doorzoeken alsof het een origineel digitaal document is. Die tekst kwam niet van de originele scan. De scanner produceerde een afbeelding van de pagina, een raster van pixels zonder tekstgegevens. De tekst die u selecteert en zoekt, is OCR-tekst, gegenereerd door optische tekenherkenningssoftware die de paginaafbeelding analyseert en pixelpatronen omzet in tekens. Maar niet alle selecteerbare tekst in een PDF is OCR-tekst. Sommige PDF's bevatten ingesloten tekst die digitaal is gemaakt en nooit door een scanner of herkenningsengine is gegaan. Het begrijpen van het verschil tussen OCR-tekst en ingesloten tekst verklaart waarom sommige PDF's perfect zoeken, terwijl andere onleesbare resultaten opleveren.

What Is the Difference Between OCR Text and Embedded Text in a PDF

Wat OCR-tekst is en hoe deze in een PDF terechtkomt

OCR-tekst wordt door een machine gegenereerd. Een OCR PDF-engine onderzoekt elke tekenvorm in een gescande paginaafbeelding, vergelijkt deze met een database met bekende tekenpatronen en voert het meest waarschijnlijk overeenkomende teken uit, samen met de positie ervan op de pagina. De herkende tekst wordt vervolgens in de PDF ingesloten als een onzichtbare laag die precies over de originele afbeeldingstekens wordt geplaatst. Wanneer u tekst uit een gescande PDF selecteert en kopieert, kopieert u vanuit deze onzichtbare OCR-laag en niet vanuit de zichtbare afbeelding. Als de OCR-engine een teken verkeerd heeft gelezen, bevat de gekopieerde tekst die fout, ook al ziet de zichtbare afbeelding er correct uit.

De kwaliteit van OCR-tekst is afhankelijk van verschillende factoren: de resolutie en helderheid van de originele scan, het lettertype dat in het originele document wordt gebruikt, de taal van de tekst en de verfijning van de OCR-engine. Een schone 300 DPI-scan van een lasergedrukt Engels document, verwerkt door een moderne OCR-engine, produceert vrijwel perfecte tekst. Een 150 DPI-scan van een dot-matrix-gedrukt document in een taal met complexe karaktervormen, verwerkt door een eenvoudige OCR-engine, produceert tekst vol fouten. De OCR-tekst is slechts zo nauwkeurig als de herkenningsengine en de scankwaliteit toelaten.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Wat ingesloten tekst is en hoe deze in een PDF terechtkomt

Ingesloten tekst is geschreven, maar niet herkend. Wanneer een tekstverwerker, een desktop publishing-toepassing of een bibliotheek voor het maken van PDF's een PDF genereert, wordt de tekst rechtstreeks in de PDF-inhoudsstroom geschreven. Elk teken wordt opgeslagen als een specifieke code die wordt toegewezen aan een glyph in een lettertype. Er is geen herkenningsstap omdat de tekst nooit een afbeelding was. De applicatie die de PDF maakte, wist precies welke karakters er werden geschreven en legde deze nauwkeurig vast. Wanneer u tekst selecteert en kopieert uit een digitaal gemaakte PDF, kopieert u exact de tekens die de auteur heeft getypt.

Ingesloten tekst bevat opmaakinformatie die bij OCR-tekst doorgaans ontbreekt. Lettertypenamen, vetgedrukte en cursieve stijl en tekenafstand blijven behouden in ingesloten tekst omdat ze door de auteur in het brondocument zijn gespecificeerd. OCR-tekst kan een deel van deze opmaak reconstrueren, maar wordt afgeleid uit de visuele weergave van de tekens en niet opgeslagen als expliciete metagegevens. Een PDF-formaat-vergelijking tussen een gescande en vervolgens OCRed-pagina en een native digitale pagina onthult dit verschil. De OCR-versie staat mogelijk tekstselectie toe, maar rapporteert elk teken als hetzelfde lettertype met hetzelfde gewicht. De digitale versie behoudt het lettertype-onderscheid dat de auteur bedoelde.

Hoe u kunt bepalen of tekst in een PDF OCR of ingesloten is

De meest betrouwbare manier om te bepalen of tekst in een PDF OCR-gegenereerd of ingesloten is, is door de documenteigenschappen te controleren, met name de lettertypelijst. Open de PDF in een viewer die lettertype-informatie kan weergeven. Adobe Acrobat toont de lettertypelijst onder Bestand, Documenteigenschappen, Lettertypen. Als de lijst met lettertypen lettertypen bevat met namen waarin OCR is opgenomen of als de lettertypen worden weergegeven als onbekend of als een algemeen type zonder specifieke naam, is de tekst waarschijnlijk door OCR gegenereerd. Als de lijst met lettertypen specifieke lettertypen met een naam bevat, zoals Arial, Times New Roman of Calibri met subtypen als Vet of Cursief, is de tekst vrijwel zeker ingesloten vanuit een digitale bron.

Een andere praktische test is het zoeken naar een veelvoorkomend OCR-foutpatroon. Zoek in de PDF naar veelvoorkomende OCR-vervangingsfouten, zoals de lettercombinatie rn, die door OCR-engines vaak verkeerd wordt geïnterpreteerd als de enkele letter m. Als de zoekopdracht gevallen aantreft waarbij schuur bam wordt of maïs com wordt, wordt de tekst door OCR gegenereerd. Ingesloten tekst bevat deze vervangingsfouten niet, omdat de karakters nooit visueel dubbelzinnig waren. De PDF Doorzoekbaar kwaliteit van een document hangt af van de vraag of de onderliggende tekst, OCR of ingesloten, de zichtbare inhoud accuraat weergeeft.

Wanneer OCR-tekst en ingesloten tekst naast elkaar bestaan in dezelfde PDF

Eén PDF kan zowel OCR-tekst als ingesloten tekst op verschillende pagina's of zelfs op dezelfde pagina bevatten. Een contractpakket kan de digitaal geschreven contracttekst bevatten, die ingesloten tekst bevat, en een gescande en met OCR verwerkte handtekeningpagina, die OCR-tekst bevat. Een onderzoeksrapport kan digitaal gemaakte tekstpagina's combineren met gescande en met OCR verwerkte foto's van historische krantenknipsels. De tekst op pagina drie is pixel-perfect ingebedde tekst. De tekst op pagina zeven is OCR-tekst die herkenningsfouten kan bevatten.

Dit scenario met gemengde inhoud creëert een subtiele valstrik voor iedereen die tekst uit de PDF zoekt of extraheert. De zoekresultaten van de ingesloten tekstpagina's zullen accuraat zijn. De zoekresultaten van de OCR-tekstpagina's kunnen voorkomen dat de OCR-engine een woord verkeerd heeft gelezen, of kunnen valse overeenkomsten opleveren als de OCR-engine een soortgelijk woord heeft vervangen. Wanneer u met PDF's met gemengde inhoud werkt, verifieer dan alle tekst die uit de OCR-pagina's is gehaald voordat u erop vertrouwt. De veiligste aanpak is om de bijbehorende paginaafbeelding visueel te controleren wanneer geëxtraheerde tekst van een OCR-pagina voor een kritisch doel wordt gebruikt.

Verbetering van de OCR-tekstkwaliteit achteraf

Wanneer een PDF OCR-tekst van slechte kwaliteit bevat, worden de mogelijkheden om deze te verbeteren beperkt door het feit dat de originele scan en het OCR-proces al zijn voltooid. U kunt de scankwaliteit niet met terugwerkende kracht verbeteren. Wat u kunt doen, is de PDF opnieuw OCRen met een betere engine. Extraheer de pagina-afbeeldingen uit de PDF met de hoogst beschikbare resolutie en voer ze door een moderne OCR-engine die mogelijk nauwkeurigere resultaten oplevert dan de originele OCR-pas. Vervang de oude OCR-tekstlaag door de nieuwe.

Met sommige PDF-editors kunt u OCR-fouten handmatig rechtstreeks in de tekstlaag corrigeren. Open de PDF in een bewerkingsmodus waarin de onzichtbare OCR-tekst zichtbaar wordt. Klik op een verkeerd herkend woord en typ de correctie. Dit handmatige correctieproces is praktisch voor een handvol fouten op een paar pagina's. Het is niet praktisch voor een document van 200 pagina's waarin elke alinea herkenningsfouten bevat. Voor grootschalige OCR-kwaliteitsproblemen is het opnieuw OCRen van het hele document met een betere engine de efficiëntere aanpak.

Kiezen tussen OCR en ingesloten tekst voor het maken van documenten

Bij het maken van een PDF die wordt doorzocht, geïndexeerd of gearchiveerd, heeft de keuze tussen scannen en OCR versus het genereren van een native digitale PDF gevolgen op de lange termijn. Een native digitale PDF met ingesloten tekst is kleiner, zoekt sneller en behoudt de tekstnauwkeurigheid perfect. Een gescande en met OCR verwerkte PDF behoudt het uiterlijk van het originele papieren document, maar introduceert de mogelijkheid van herkenningsfouten die in de loop van de tijd toenemen als de PDF wordt gekopieerd, geciteerd en ernaar wordt verwezen.

Voor archiefprojecten is het het beste om beide formaten te behouden. Bewaar de scan met hoge resolutie als archiefmaster voor visuele betrouwbaarheid. Genereer een native digitale versie, door opnieuw te typen of door uiterst nauwkeurige OCR met handmatige correctie toe te passen, voor het zoeken en analyseren van tekst. Deze benadering met twee formaten garandeert de authenticiteit van de originele scan en de bruikbaarheid van doorzoekbare tekst. WukongPDF ondersteunt OCR PDF-verwerking voor het converteren van gescande documenten naar doorzoekbare PDF's, en de resulterende OCR-tekstlaag biedt de zoek- en kopieerfunctionaliteit die gescande documenten bruikbaar maakt in digitale workflows.

De betrouwbaarheidskloof op lange termijn tussen OCR en ingebedde tekst

OCR-ed PDF's verouderen anders dan digitaal geschreven PDF's. Een digitaal geschreven PDF die twintig jaar na de creatie wordt geopend, geeft de tekst perfect weer, omdat de tekencodes ondubbelzinnig zijn en de lettertypen zijn ingesloten. Een OCR-pdf die twintig jaar na creatie wordt geopend, is afhankelijk van de kwaliteit van de originele scan en de nauwkeurigheid van de op dat moment beschikbare OCR-engine. Herkenningsfouten die nauwelijks merkbaar waren toen het document nog vers was, worden belangrijke obstakels wanneer het originele papieren document niet langer beschikbaar is voor verificatie.

Voor documenten die bedoeld zijn voor langdurige bewaring heeft ingebedde tekst uit een digitale bron altijd de voorkeur boven OCR-tekst. Als een document alleen op papier bestaat en moet worden gescand, investeer dan in de hoogste kwaliteit scan- en OCR-verwerking die op dat moment beschikbaar is, en bewaar het originele papieren document zo lang als praktisch mogelijk is. Het papieren origineel is de ultieme back-up tegen OCR-fouten die pas jaren later zichtbaar worden.

Een praktische test om OCR PDF-tekst te onderscheiden van ingesloten tekst: zoom in tot 300 procent of hoger op een alinea en kijk naar de tekenranden. OCR-tekst vertoont vaak een kleine verkeerde uitlijning tussen de zichtbare tekenafbeelding en de onzichtbare tekstlaag. Ingesloten tekst wordt perfect uitgelijnd weergegeven omdat de tekenvormen en -posities uit hetzelfde lettertypeprogramma komen.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →