Tips & Tricks

Hoe u een gescand document kunt OCReren waarbij de pagina's binnen één gebonden volume afwisselend staand en liggend staan

Het scannen van een ingebonden boekdeel, zoals een boek, een scriptie, een tijdschrift of een grootboek, levert een PDF op waarin de pagina's afwisselend staand en liggend zijn afgedrukt. De linkerpagina's van het open boek worden in de ene richting gescand en de rechterpagina's in een andere richting, of het hele boek wordt gescand met afwisselende paginarotaties omdat de scanneroperator het boek voor elke gespreide pagina omdraaide zonder de gescande afbeelding te draaien. Het resultaat is een PDF waarbij elke andere pagina 90 of 180 graden gedraaid lijkt wanneer deze op het scherm wordt bekeken. Als u OCR op dit document uitvoert zonder eerst de paginarichting te normaliseren, ontstaat tekst die afwisselend correct georiënteerd en geroteerd is, waardoor de herkende tekst onbruikbaar wordt voor zoeken of extraheren. De oplossing vereist een voorverwerkingsstap die de richting van elke pagina detecteert en corrigeert voordat OCR deze verwerkt.

How to OCR a Scanned Document Where Pages Alternate Between Portrait and Landscape Orientation Within a Single Bound Volume

Waarom scannen met gebonden volumes afwisselende paginarichtingen oplevert

Bij het scannen van een ingebonden boekdeel worden per uitgespreide pagina twee pagina's met de bedrukte zijde naar beneden op het scannerbed gelegd. De linkerpagina van het boek verschijnt aan de rechterkant van het scannerbed en de rechterpagina aan de linkerkant, 180 graden gedraaid ten opzichte van elkaar. Als de scanneroperator deze rotatie niet voor elke afzonderlijke pagina corrigeert, bevat de gescande PDF pagina's waarbij elke andere pagina ondersteboven ligt. Een boek van 200 pagina's produceert een PDF met 200 pagina's waarvan 100 in de juiste richting staan en 100 180 graden zijn gedraaid. Het patroon is regelmatig en voorspelbaar: alle oneven pagina's zijn mogelijk correct georiënteerd en alle even pagina's zijn gedraaid, of omgekeerd.

Sommige ingebonden delen worden gescand door het open boek op de scanner te plaatsen terwijl de tekst horizontaal loopt, waardoor één afbeelding ontstaat die zowel de linker- als de rechterpagina bevat. Deze afbeelding wordt vervolgens in twee afzonderlijke pagina's gesplitst, maar tijdens het splitsingsproces wordt de rechterpagina niet altijd geroteerd zodat deze overeenkomt met de richting van de linkerpagina. Het resultaat is een PDF waarbij de linkerpagina's in de juiste richting zijn geplaatst en de rechterpagina's 90 graden zijn gedraaid, of omgekeerd. De OCR-engine, die verwacht dat tekst horizontaal van links naar rechts over de pagina loopt, kan de tekst op de geroteerde pagina's niet herkennen omdat de tekst verticaal of ondersteboven loopt.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Paginarichting detecteren vóór OCR-verwerking

Voordat u OCR uitvoert, inspecteert u de paginaminiaturen in de PDF-viewer. De afwisselende oriëntatie is onmiddellijk zichtbaar in het miniaturenpaneel, waar elke andere miniatuur geroteerd lijkt. Tel het oriëntatiepatroon: oneven pagina's correct en even pagina's geroteerd is het meest voorkomende patroon, maar het omgekeerde is ook mogelijk. Als het patroon consistent is, kan een batchrotatiebewerking alle betrokken pagina's in één enkele opdracht corrigeren. Bij de meeste PDF-viewers is het mogelijk om meerdere pagina's in het miniaturenpaneel te selecteren en tegelijkertijd een rotatie op alle geselecteerde pagina's toe te passen. Selecteer alle even genummerde pagina's, draai ze indien nodig 180 graden of 90 graden en sla het document op. Het miniaturenpaneel toont nu alle pagina's in de juiste richting.

De tool OCR PDF van WukongPDF verwerkt elke pagina afzonderlijk, maar gaat ervan uit dat de tekst horizontaal is georiënteerd. Als de pagina wordt geroteerd, herkent de OCR-engine geen enkele tekst of produceert een onleesbare uitvoer omdat verticale of omgekeerde tekst wordt gelezen alsof deze horizontaal is. Het corrigeren van de paginarichting vóór OCR is een vereiste voorbewerkingsstap. Nadat u de betreffende pagina's hebt geroteerd en het document hebt opgeslagen, voert u OCR uit op de genormaliseerde PDF. De herkenningsnauwkeurigheid zal op alle pagina's consistent zijn, omdat elke pagina nu tekst presenteert in de richting die de OCR-engine verwacht.

Omgaan met inconsistente oriëntatiepatronen in het hele document

Niet alle gebonden volumes produceren een schoon afwisselend patroon. Een boek dat door twee verschillende operators is gescand, een set met meerdere volumes die op verschillende tijdstippen is gescand, of een document dat na de eerste scan gedeeltelijk opnieuw is gescand, kan onregelmatige oriëntatiepatronen vertonen. Pagina's 1 tot en met 50 volgen mogelijk het afwisselende patroon, pagina's 51 tot en met 80 zijn mogelijk allemaal in de juiste richting omdat ze opnieuw zijn gescand met de juiste rotatie, en pagina's 81 tot en met 200 kunnen terugkeren naar het afwisselende patroon. De detectie en correctie moeten sectie voor sectie worden uitgevoerd in plaats van met een enkele batchbewerking.

Voor onregelmatige oriëntatiepatronen is de handmatige benadering van het scrollen door miniaturen en het roteren van individuele pagina's of paginabereiken de meest betrouwbare methode. Begin op pagina één en blader door de miniaturen. Wanneer u een geroteerde pagina tegenkomt, bepaal dan hoeveel opeenvolgende pagina's deze richting delen. Selecteer het bereik en pas de rotatie toe. Ga door het document totdat elke pagina in de juiste richting staat. Het proces duurt één tot twee seconden per pagina, dus een document van 200 pagina's heeft ongeveer vijf minuten nodig. Deze tijd wordt goed besteed omdat de OCR-nauwkeurigheid op correct georiënteerde pagina's aanzienlijk hoger is dan op geroteerde pagina's.

Oriëntatiedetectie automatiseren voor grote projecten met een gebonden volume

Voor digitaliseringsprojecten met honderden of duizenden pagina's wordt het handmatig per pagina controleren van de oriëntatie onpraktisch. Geautomatiseerde oriëntatiedetectietools kunnen geroteerde pagina's identificeren door de tekstrichting te analyseren. Deze tools nemen voorbeelden van teksttekens op de pagina en bepalen de dominante oriëntatie door te herkennen welke rotatie geldige woorden oplevert in de verwachte taal. Een pagina waar tekstherkenning lukt bij 0 graden, maar mislukt bij 90, 180 en 270 graden, is correct georiënteerd. Een pagina waarbij de herkenning lukt bij 180 graden, maar mislukt bij 0, staat ondersteboven en moet worden gedraaid. Geautomatiseerde detectie verwerkt grote documentensets snel, en een handmatige controle van de resultaten bevestigt dat de automatisering correct heeft gewerkt voordat de OCR begint.

OCR-uitvoer verifiëren in wisselende richtingen

Nadat u de paginarichting hebt gecorrigeerd en OCR hebt uitgevoerd, controleert u of de herkenningskwaliteit consistent is in het hele document. Zoeken naar tekst die zowel op oorspronkelijk correcte als op oorspronkelijk geroteerde pagina's verschijnt. De zoekopdracht moet op beide typen pagina's exemplaren met gelijke betrouwbaarheid vinden. Als er geen tekst op oorspronkelijk geroteerde pagina's wordt gevonden, is de rotatiecorrectie mogelijk niet correct toegepast of heeft de OCR-engine mogelijk enkele pagina's verwerkt voordat de rotatie werd opgeslagen. Open het document opnieuw, controleer of alle paginarichtingen correct zijn in het miniaturenpaneel en voer de OCR indien nodig opnieuw uit.

Voor gebonden volumes waarbij de originele scankwaliteit per pagina varieert, zoals een boek waarbij sommige pagina's plat tegen de glasplaat zijn gedrukt en andere een kromming hebben nabij de rug, zal de OCR-nauwkeurigheid dienovereenkomstig variëren. De oriëntatiecorrectie lost het rotatieprobleem op, maar compenseert niet voor andere problemen met de scankwaliteit. Pagina's met een aanzienlijke kromming moeten mogelijk opnieuw worden gescand of voorbewerkt met een correctiefilter voordat OCR een aanvaardbare nauwkeurigheid kan bereiken. De pijplijn Gescande PDF naar doorzoekbare tekst werkt het beste wanneer de bronafbeeldingen zo schoon en uniform mogelijk georiënteerd zijn. Oriëntatiecorrectie is de eerste en meest impactvolle stap. Ontwarren, contrastaanpassing en ontspikkelen zijn de vervolgstappen die de herkenningsnauwkeurigheid bij uitdagende scans met gebonden volumes verder verbeteren.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →