
Waarom OCR worstelt met overlappende voetnoottekst en marge-inhoud
Optische tekenherkenningssystemen werken het beste wanneer tekst in schone, voorspelbare blokken staat met consistente regelafstand en duidelijke scheiding tussen inhoudsgebieden. Een OCR PDF-bewerking op een standaard zakelijke brief of een nieuwe pagina levert doorgaans nauwkeurige resultaten op omdat de tekst in overzichtelijke paragrafen met ruime marges aan alle kanten loopt. Academische artikelen vormen een fundamenteel moeilijker probleem omdat hun lay-out opzettelijk meerdere afzonderlijke tekststromen dicht bij elkaar plaatst, waarbij voetnoten, citaten in de kantlijn en hoofdtekst elkaar vaak raken of overlappen aan de grenzen ervan.
De kernuitdaging is segmentatie, de stap waarbij de OCR-engine de paginaafbeelding in tekstgebieden verdeelt voordat tekenherkenning wordt geprobeerd. Wanneer een voetnootreferentienummer in superscript in de hoofdtekst direct boven een voetnootscheidingslijn staat, en die regel direct boven de voetnoottekst zelf staat met een kleinere lettergrootte, moet het segmentatiealgoritme beslissen waar het ene tekstgebied eindigt en het volgende begint. Een verkeerde segmentatiebeslissing leidt hier tot herkenningsfouten, omdat karakters uit twee verschillende tekststromen in de herkenningsengine worden ingevoerd alsof ze één enkele doorlopende regel zijn. De uitvoer leest als wartaal waarbij hoofdtekstwoorden worden gemengd met voetnootfragmenten.
Margecitaten voegen een derde tekststroom toe aan het probleem. In geesteswetenschappelijke artikelen die de Chicago-stijl volgen of juridische documenten die het Bluebook-formaat gebruiken, lopen kanttekeningen, regelnummers of parallelle citaten verticaal of horizontaal naast de hoofdtekstkolom. Deze marge-elementen worden vaak afgedrukt met een kleinere puntgrootte, soms 7 of 8 punten, en kunnen cursieve of verkorte lettertypen gebruiken waar OCR-engines bij normale formaten al moeite mee hebben. Wanneer de margetekst de hoofdtekst fysiek raakt, wat vaak gebeurt in strak opgemaakte tijdschriften met smalle tussenruimte, wordt de segmentatie-uitdaging drieledig in plaats van tweeledig.
De papierkwaliteit van de Gescande PDF-bron vergroot ook de OCR-problemen. Veel academische artikelen worden gescand vanuit gebonden delen waarbij de paginakromming nabij de rug ervoor zorgt dat de tekst verbuigt en vervormt. Voetnoten onderaan de pagina zijn de secties die het meest worden beïnvloed door kromming van de rug, omdat ze het dichtst bij de binding zitten. De combinatie van fysieke vervorming door de gebogen pagina, kleine lettergrootte en de nabijheid van de hoofdtekst erboven zorgt voor een perfecte storm van ongunstige omstandigheden voor OCR-nauwkeurigheid.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
De gescande pagina voorbewerken om overlappende tekstgebieden te scheiden
De meest effectieve manier om de OCR-nauwkeurigheid op academische pagina's met overlappende tekstelementen te verbeteren, is door de paginaafbeelding voor te verwerken voordat deze ooit de OCR-engine bereikt. Deze voorverwerking scheidt de verschillende tekststromen, zodat de engine nooit dubbelzinnige segmentatiebeslissingen hoeft te nemen.
Begin met het rechtzetten van de gescande pagina om ervoor te zorgen dat alle tekstregels perfect horizontaal lopen. Zelfs een kanteling van één graad in de originele scan kan ertoe leiden dat voetnoottekst in het hoofdtekstgebied aan de paginaranden terechtkomt, waardoor valse overlappingen ontstaan die op een goed uitgelijnde pagina niet zouden bestaan. De meeste software voor het scannen van documenten bevat automatisch rechtzetten, maar voor academische artikelen die zijn gescand vanuit ingebonden volumes levert handmatig rechtzetten met een referentielijn langs de basislijn van de hoofdtekst nauwkeurigere resultaten op dan automatische correctie.
Na het rechtzetten is de volgende stap het maskeren van regio's. Gebruik een afbeeldingseditor of een speciale OCR-voorbewerkingstool om een horizontale scheidingslijn te tekenen tussen het hoofdtekstgebied en het voetnootgebied. Deze regel vertelt de stroomafwaartse OCR-engine om alles erboven als één tekstgebied te behandelen en alles daaronder als een afzonderlijk tekstgebied. Op pagina's waar voetnoten aanwezig zijn, moet het scheidingsteken net boven de voetnootregel staan, de korte horizontale lijn die traditioneel de hoofdtekst scheidt van voetnoten in gedrukte academische werken. Op pagina's zonder voetnoten is geen scheidingsteken nodig.
Voor kantlijncitaten en regelnummers is verticale maskering de equivalente aanpak. Teken een verticaal scheidingsteken tussen de margetekst en de hoofdtekstkolom. Op pagina's met zowel regelnummers in de linkermarge als citaten in de rechtermarge hebben beide zijden verticale scheidingstekens nodig. Het doel is om de pagina in rechthoekige gebieden te verdelen, waarbij elk gebied precies één tekststroom bevat. De OCR-engine verwerkt vervolgens elk gebied afzonderlijk en produceert afzonderlijk herkende tekstuitvoer die u, nadat de herkenning is voltooid, weer in de juiste leesvolgorde kunt samenstellen.
OCR-instellingen configureren voor academische pagina's met meerdere streams
De meeste professionele OCR-engines bieden instellingen die helpen bij pagina-indelingen met meerdere kolommen en meerdere streams. Het inschakelen van automatische lay-outanalyse is het uitgangspunt, maar voor academische pagina's met korte tekststromen levert handmatige zoneconfiguratie betere resultaten op dan volledig automatische analyse.
Definieer afzonderlijke herkenningszones voor de hoofdtekst, het voetnootgebied en elk margetekstgebied. Stel binnen elke zone de juiste taal, het verwachte tekengroottebereik en de tekstrichting in. In lichaamstekstzones moet tekst van 10 tot 12 punten in horizontale richting van links naar rechts worden verwacht. Voetnootzones zouden tekst van 8 tot 10 punten moeten verwachten, nog steeds horizontaal, maar met het besef dat voetnoottekst vaak URL's, DOI's en citatiereeksen bevat die taalmodellen kunnen verwarren die natuurlijk proza verwachten.
Schakel specifiek voor de hoofdtekstzone de instelling in die superscript- en subscripttekst negeert met het oog op lijnsegmentatie. Voetnootreferentienummers en wiskundige exponenten in superscript zijn doorgaans kleiner en hoger dan de basislijn, wat berekeningsfouten voor de regelhoogte veroorzaakt als de engine ze als onderdeel van de normale tekstregel behandelt. Door de positionering in superscript te negeren voor segmentatiedoeleinden blijven de hoofdtekstregels intact, terwijl de voetnootmarkeringen worden herkend als afzonderlijke kleine elementen die geen invloed hebben op de lijngrenzen.
De uitvoerkwaliteit van PDF naar Tekst verbetert aanzienlijk wanneer het herkenningsresultaat van elke zone wordt opgeslagen in een afzonderlijk tekstbestand of een afzonderlijk gemarkeerd gedeelte binnen een gecombineerde uitvoer. Deze door zones gescheiden uitvoer maakt het gemakkelijk om te verifiëren dat de hoofdtekst niet in de voetnoottekst is overgegaan en dat citaten in de marge in hun eigen, duidelijk gelabelde uitvoersectie verschijnen in plaats van tussen de hoofdinhoud te staan.
Opschoning na herkenning voor academische OCR-uitvoer
Zelfs met zorgvuldige voorverwerking en zoneconfiguratie zijn sommige herkenningsfouten onvermijdelijk op dicht opeengepakte academische pagina's. Een gestructureerd opschoonproces na herkenning spoort deze resterende fouten op en corrigeert ze voordat de tekst in het definitieve document terechtkomt.
Voer alleen een spellingscontrole uit op de uitvoer van de hoofdtekst, waarbij het woordenboek voor de spellingcontrole is ingesteld op de primaire taal van het document. Woorden die in de hoofdtekst als verkeerd gespeld zijn gemarkeerd en die correct gespelde voetnootinhoud blijken te zijn, zijn een duidelijk teken dat de grens tussen de hoofdtekstzone en de vastgelegde voetnoottekst te genereus was. Pas de zonegrens voor die pagina's aan en voer de herkenning opnieuw uit in plaats van de voetnootfragmenten handmatig te bewerken.
Voor de uitvoer van voetnoottekst controleert u of elke voetnoot begint met het verwachte referentienummer en of de voetnoottekst continu doorloopt zonder dat er fragmenten van de hoofdtekst tussen staan. Een veelvoorkomend foutpatroon na herkenning is dat er tekstregels in het midden van de voetnoottekst verschijnen, waarbij de kolom met de hoofdtekst zich lager op de pagina uitstrekte dan de verwachte zonegrens. Als u de originele pagina-afbeelding naast de herkende voetnoottekst bekijkt, worden deze inbreuken snel opgemerkt, omdat het onderwerp van de zin abrupt verschuift van het academische onderwerp naar een niet-gerelateerd alinea-onderwerp.
De OCR-tool van WukongPDF ondersteunt zonegebaseerde herkenning voor complexe paginalay-outs, waaronder academische papers met meerdere kolommen, voetnoten en marge-inhoud. Het definiëren van instellingen per zone voor taal, lettergrootte en tekstoriëntatie voordat de herkenningspas wordt gestart, levert nauwkeurigere OCR PDF-uitvoer op dan verwerking in één zone op dezelfde pagina's, en het gescheiden uitvoerformaat maakt verificatie na herkenning eenvoudig.
Omgaan met speciale gevallen: wiskundige notatie, niet-Latijnse scripts en gemengde talen
Academische artikelen op STEM-gebieden voegen wiskundige notatie toe aan de uitdaging van overlappende tekst. Vergelijkingen en formules afgewisseld met hoofdtekst zorgen voor extra complexiteit van de segmentatie, omdat bij de wiskundige notatie gebruik wordt gemaakt van symbolen, Griekse letters en tweedimensionale opmaak, zoals breuken en superscript, die niet dezelfde opmaakregels volgen als prozatekst. OCR-engines die zijn ontworpen voor documenttekst presteren slecht op wiskundige notatie, en motoren die zijn ontworpen voor wiskunde presteren slecht op documenttekst.
De meest praktische aanpak voor pagina's met gemengde wiskunde en proza is een OCR-strategie met twee doorgangen. De eerste doorgang maakt gebruik van een voor documenten geoptimaliseerde engine om alle prozatekstgebieden te herkennen, inclusief hoofdtekst, voetnoten en citaten in de marge. De tweede doorgang maakt gebruik van een wiskundebewuste herkenningsengine op de specifieke paginagebieden die vergelijkingen bevatten. Het samenvoegen van de twee resultaten in een gecombineerd document dat zowel de prozanauwkeurigheid van de documentengine als de formulenauwkeurigheid van de wiskundige engine behoudt, levert het meest betrouwbare algehele resultaat op.
Voor artikelen waarin Latijnse en niet-Latijnse schriften worden gecombineerd, zoals Engelstalige artikelen met Arabische, Chinese of Cyrillische citaten in voetnoten, configureert u elke herkenningszone met het juiste primaire schrift. De hoofdtekstzone gebruikt de primaire taal van het document. Voetnootzones die niet-Latijnse schriftpassages bevatten, hebben mogelijk een configuratie voor herkenning van meerdere scripts nodig, waarmee tussen scripts binnen één tekstgebied kan worden geschakeld.
De onderstaande tabel geeft een overzicht van de aanbevolen OCR-zoneconfiguraties voor verschillende paginaregio's in academische artikelen.
| Paginaregio | Verwachte lettergrootte | Oriëntatie | Speciale instellingen |
|---|---|---|---|
| Lichaamstekst | 10-12 pnt | Horizontaal | Negeer superscript voor lijnsegmentatie |
| Voetnoten | 8-10 pnt | Horizontaal | Multi-script als citaten niet-Latijnse tekst bevatten |
| Linkermarge (regelnummers) | 7-9 pnt | Horizontaal of verticaal | Uitpakken als afzonderlijke uitvoer; niet samensmelten met het lichaam |
| Rechtermarge (citaten) | 7-9 pnt | Horizontaal | Uitpakken als afzonderlijke uitvoer |
| Vergelijkingen/formules | Variabel | Horizontaal met 2D-indeling | Gebruik een wiskundebewuste engine bij de tweede doorgang |
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
