Een gescande PDF die uit gemengde bronnen is samengesteld, bevat vaak pagina's in zowel staande als liggende richting. Financiële spreadsheets worden weergegeven als liggende pagina's. Begeleidende tekstdocumenten verschijnen als staande pagina's. Het uitvoeren van OCR op een dergelijk document zonder rekening te houden met gemengde richtingen levert herkende tekst op waarbij woorden op liggende pagina's vervormd, geroteerd of geheel gemist worden omdat de OCR-engine die pagina's in de verkeerde richting verwerkte.
OCR PDF-engines analyseren tekstregels om tekenposities en leesvolgorde te bepalen. Wanneer een pagina 90 graden wordt gedraaid ten opzichte van wat de engine verwacht, lopen de tekstregels verticaal in plaats van horizontaal. De engine herkent de tekst niet volledig of probeert verticaal te lezen, wat onzinuitvoer produceert. Voor documenten met gemengde richting is detectie van de richting per pagina vereist vóór OCR-verwerking.
De Gescande PDF OCR-tools van WukongPDF verwerken gemengde paginaoriëntaties met automatische rotatiedetectie voor elke pagina tijdens het herkenningsproces.
Waarom paginarichting belangrijk is voor OCR-nauwkeurigheid
OCR-engines werken door rijen met tekens te detecteren en de vormen binnen elke rij te analyseren. Een pagina in staande richting heeft tekstregels die horizontaal lopen, wat de engine op natuurlijke wijze verwerkt. Een pagina in liggende stand heeft, wanneer bekeken zonder rotatiecorrectie, tekstregels die verticaal lopen vanuit het perspectief van de OCR-engine. De engine verwacht horizontale tekst en kan geen verticale tekst lezen.
De oplossing is om de afdrukstand van elke pagina vóór OCR te detecteren en liggende pagina's naar staande afdrukstand te draaien voordat ze worden verwerkt. Na OCR kunnen de pagina's worden teruggedraaid naar hun oorspronkelijke richting, waarbij de herkende tekstlaag correct is gepositioneerd. De rotatie tijdens de verwerking verandert het document niet permanent; het verandert alleen hoe de OCR-engine de pagina ziet.
De meeste geautomatiseerde OCR-tools gaan ervan uit dat alle pagina's dezelfde richting hebben, omdat dit gebruikelijk is bij documenten die door één enkele scanner in één sessie worden geproduceerd. Documenten met een gemengde richting, vaak gemaakt door het combineren van scans uit verschillende bronnen, vereisen een expliciete configuratie om de variatie per pagina correct te verwerken.
Methode 1: Acrobat Pro met detectie van rotatie per pagina
De OCR-functie van Acrobat Pro kan documenten met gemengde richtingen verwerken als deze op de juiste manier is geconfigureerd. Open de gescande PDF in Acrobat Pro en ga naar Extra, Scannen en OCR, Tekst herkennen, In dit bestand. Zorg ervoor dat in het dialoogvenster Tekst herkennen de juiste OCR-taal is geselecteerd voor de primaire taal van het document. Schakel in het gedeelte Instellingen de optie Rechtzetten en rechtzetten in, waarmee Acrobat paginarotatie kan detecteren.
Acrobat verwerkt elke pagina afzonderlijk en probeert de dominante tekstrichting te detecteren. Voor pagina's waarbij de detectie correct is, is de OCR-uitvoer nauwkeurig en leesbaar. Voor pagina's waarop de detectie mislukt, zoals pagina's met minimale tekst of complexe visuele achtergronden, kan de OCR-uitvoer vervormd zijn of helemaal ontbreken. Controleer na de OCR-verwerking vooral de liggende pagina's. Zoek naar tekst die u visueel op die pagina's kunt zien. Als de zoekopdracht niets oplevert, heeft Acrobat de richting waarschijnlijk verkeerd geïdentificeerd.
Voor pagina's die ten onrechte zijn geïdentificeerd, kunt u deze handmatig roteren in de tool Pagina's organiseren en de OCR opnieuw uitvoeren op alleen die pagina's. De handmatige tussenkomst duurt slechts een moment per betrokken pagina en zorgt ervoor dat elke pagina nauwkeurig herkende tekst bijdraagt aan de doorzoekbare documentuitvoer.
Methode 2: Voorverwerking met OCRmyPDF
OCRmyPDF, een open source opdrachtregelprogramma gebouwd op Tesseract OCR, verwerkt pagina's met gemengde richting via de ingebouwde functie voor rechtzetten. De opdracht ocrmypdf --deskew input.pdf output.pdf detecteert de tekstrichting op elke pagina, roteert pagina's indien nodig, voert OCR uit met Tesseract en voert een doorzoekbare PDF uit. De scheefstandmarkering is de essentiële parameter voor documentverwerking met gemengde richting.
OCRmyPDF verwerkt pagina's opeenvolgend en past automatische oriëntatiecorrectie per pagina toe. Voor documenten met extreme rotatie of pagina's die zowel horizontale als verticale tekst bevatten, oriënteert het scheefstandalgoritme de pagina op basis van de dominante tekstrichting, wat de beste OCR-resultaten oplevert voor het merendeel van de pagina-inhoud. De minderheidstekstrichting kan een enigszins verminderde nauwkeurigheid hebben, maar wordt over het algemeen nog steeds herkend.
In documentworkflows, voor batchverwerking van grote volumes van documenten met gemengde richting, biedt OCRmyPDF in combinatie met een shellscript dat alle PDF's in een map verwerkt, volledig geautomatiseerde OCR zonder handmatige configuratie per document. De automatisering zorgt voor de routinematige verwerking en alleen uitzonderingsgevallen vereisen menselijke beoordeling.
OCR-uitvoer specifiek verifiëren op liggende pagina's
Na de OCR-verwerking verifieert u de uitvoer op liggende pagina's als een afzonderlijke gerichte controle. Selecteer tekst op een liggende pagina in de uitvoer-PDF en kopieer deze naar een teksteditor. De gekopieerde tekst moet in de juiste volgorde worden gelezen, waarbij de inhoud van de visuele pagina van boven naar beneden en van links naar rechts overeenkomt. Als woorden vervormd zijn, in de verkeerde volgorde staan of in onzinnige volgorde verschijnen, mislukt de oriëntatiedetectie voor die pagina.
Zoek naar specifieke bekende termen die op liggende pagina's voorkomen. Een financiële tabel op een liggende pagina kan specifieke rekeningcodes, afdelingsnamen of numerieke waarden bevatten waarnaar u kunt zoeken in de OCR-uitvoer. Als de zoekopdracht geen overeenkomsten vindt op liggende pagina's, maar wel overeenkomsten op staande pagina's uit hetzelfde document, heeft de OCR-engine de liggende inhoud waarschijnlijk geheel gemist. Deze pagina's moeten opnieuw worden verwerkt, waarbij de handmatige afdrukstand is opgegeven.
In documentworkflows is de verificatiestap, voor documenten die als doorzoekbare archieven zullen dienen, een kwaliteitspoort die oriëntatiegerelateerde OCR-problemen opmerkt voordat het document de permanente collectie binnengaat. Een niet-geverifieerde OCR-uitvoer die stilletjes hele pagina's met inhoud mist, ondermijnt het doel van het maken van een doorzoekbaar archief.
Batchverwerking Gescande collecties in gemengde richting
Voor grote verzamelingen gescande documenten met gemengde richtingen is handmatige verificatie per pagina onpraktisch. Automatiseer het proces met OCRmyPDF en de scheefstandmarkering en voer vervolgens een verificatiescript uit dat elke uitvoerpagina controleert op de aanwezigheid van doorzoekbare tekst. Pagina's met nul herkende teksttekens of heel weinig tekens worden gemarkeerd voor handmatige beoordeling en mogelijke herverwerking.
Het verificatiescript leest elke OCR-verwerkte PDF, extraheert de tekstlaag pagina voor pagina en telt het aantal herkende tekens op elke pagina. Elke pagina onder een minimale tekendrempel, zoals tien tekens, wordt gemarkeerd als mogelijk onverwerkt of verkeerd georiënteerd. De gemarkeerde pagina's worden samengevoegd in een rapport dat de handmatige beoordeling alleen richt op de pagina's die daadwerkelijk menselijke aandacht nodig hebben, in plaats van dat elke pagina moet worden beoordeeld.
Wat betreft workflows: voor lopende digitaliseringsprojecten waarbij regelmatig nieuwe gescande documenten binnenkomen, wordt de workflow voor batchverwerking en verificatie een standaardprocedure. Nieuwe documenten komen in de pijplijn terecht, worden automatisch verwerkt via OCR met oriëntatiedetectie, en alleen uitzonderingen vereisen menselijke tussenkomst. De automatisering regelt de routine. De menselijke recensent handelt de uitzonderingen af.
OCR verbeteren op pagina's met interne rotatie
Sommige gescande documenten bevatten pagina's waarop de inhoud binnen de pagina wordt geroteerd in plaats van dat de pagina zelf wordt geroteerd. Een liggende financiële tabel kan in een staand document worden ingevoegd door de tabelinhoud 90 graden te draaien terwijl de paginaafmetingen staand blijven. Deze pagina's vormen de grootste uitdaging voor richtingdetectie, omdat de paginaafmetingen geen indicatie geven dat rotatie nodig is.
Bij documentverwerking is handmatige voorverwerking voor pagina's met interne rotatie de meest betrouwbare aanpak. Gebruik in Acrobat Pro de tool PDF bewerken om het geroteerde inhoudsgebied te selecteren, naar de juiste horizontale richting te draaien en het op de juiste manier op de pagina te plaatsen. Nadat u de interne rotatie hebt gecorrigeerd, voert u OCR uit op de gecorrigeerde pagina. De handmatige voorverwerkingsstap duurt ongeveer een minuut per betrokken pagina, maar levert schone en nauwkeurige OCR-uitvoer op.
Voor het identificeren van pagina's met interne rotatie is visuele inspectie vereist. Scan het document en zoek naar pagina's waarop de tekst in een onverwachte richting lijkt te lopen ten opzichte van de paginaranden. Pagina's met interne rotatie zijn relatief zeldzaam in de meeste documentverzamelingen, maar hebben een onevenredige invloed op de OCR-kwaliteit wanneer ze voorkomen.
De juiste OCR-engine kiezen voor documenten met gemengde richting
Verschillende OCR-engines verwerken oriëntatiedetectie met variërende nauwkeurigheid. Tesseract met de preprocessor voor scheefstanden kan goed omgaan met gematigde rotatie, maar kan moeite hebben met pagina's die precies 90 of 180 graden zijn gedraaid. Google Cloud Vision OCR bevat ingebouwde oriëntatiedetectie die alle rotatiehoeken betrouwbaar verwerkt. Voor kritische documenten met gemengde oriëntatie waarbij nauwkeurigheid essentieel is, presteren cloudgebaseerde OCR-services over het algemeen beter dan lokale motoren wat betreft oriëntatieverwerking.
Test de gekozen OCR-engine op een klein aantal pagina's met gemengde richting voordat u een grote batch gaat gebruiken. Een test van tien pagina's met bekende oriëntatiepatronen laat zien hoe de engine omgaat met de specifieke rotatietypen in uw documenten. De test duurt minuten en voorkomt urenlang opnieuw verwerken als de detectie van de motorrichting onvoldoende blijkt voor uw specifieke documenttypen.
OCR-tekst exporteren uit documenten met gemengde richting voor verificatie
Na de OCR-verwerking exporteert u de herkende tekst om de volledigheid op alle pagina's te verifiëren. Ga in Acrobat Pro naar Extra, PDF exporteren en kies Tekst als uitvoerformaat. Het geëxporteerde tekstbestand moet inhoud van elke pagina in de juiste leesvolgorde bevatten. Open het tekstbestand en zoek naar termen waarvan u weet dat ze op specifieke liggende pagina's voorkomen. Als deze termen ontbreken in de export, zijn deze pagina's waarschijnlijk verkeerd georiënteerd tijdens de OCR en moeten ze opnieuw worden verwerkt.
Wat de documentverwerking betreft, dient de geëxporteerde tekst voor documenten die bestemd zijn voor doorzoekbare archieven als een onafhankelijke verificatie dat elke pagina zijn inhoud heeft bijgedragen aan de doorzoekbare laag. Een tekstexport met gaten of ontbrekende secties duidt op OCR-fouten die aandacht vereisen voordat het document het permanente archief binnengaat. De exportstap functioneert als een kwaliteitspoort die oriëntatiegerelateerde OCR-problemen opmerkt voordat deze permanente archiefgebreken worden.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
