Tips & Tricks

Geroteerde pagina's batchgewijs rechtzetten in een gescande PDF

Een Gescande PDF geproduceerd door een scanner met velleninvoer heeft vaak pagina's die enigszins zijn gedraaid, meestal één tot vijf graden. Elke pagina die onder een iets andere hoek door de scanner wordt gevoerd, levert een document op waarbij elke pagina anders wordt gedraaid. Het lezen van zo’n document is vervelend. Door de lichte kanteling is het moeilijker om tekst te scannen, en bij het afdrukken van dergelijke pagina's wordt papier met scheve inhoud verspild. Batch rechtzetten corrigeert de rotatie van elke pagina in één enkele handeling, waardoor alle pagina's in een uniforme richting worden rechtgetrokken.

Rechtzetten analyseert de inhoud op elke pagina, meestal door de dominante hoek van tekstregels te detecteren, en roteert de pagina in de tegenovergestelde richting om de tekst horizontaal te brengen. Het proces is geautomatiseerd, paginaspecifiek en niet-destructief. De pagina wordt niet bijgesneden of vergroot of verkleind. Het past alleen de rotatiecorrectie toe die elke afzonderlijke pagina nodig heeft. Een tool Crop PDF in combinatie met rechtzetten produceert gescande documenten die eruit zien alsof elke pagina perfect recht door de scanner is gevoerd.

De PDF Kwaliteit-verbeteringshulpmiddelen van WukongPDF omvatten het rechtzetten van de pagina's en het rechttrekken van pagina's voor gescande documenten. Voor batchverwerking van grote gescande PDF's bieden de hieronder beschreven speciale tools gespecialiseerde mogelijkheden voor rechtzetten.

How to Batch-Deskew Rotated Pages in a Scanned PDF

Hoe correctie-algoritmen paginarotatie detecteren

Een correctie-algoritme werkt door het geprojecteerde histogram van pixelintensiteiten bij verschillende kandidaat-rotatiehoeken te analyseren. Het projecteert de paginaafbeelding op de horizontale as onder elke kandidaathoek en meet hoe scherp de tekstlijnen zijn uitgelijnd. Onder de juiste hoek, waarbij de tekstregels perfect horizontaal zijn, produceert de projectie scherpe pieken op de verticale posities van elke tekstregel. Bij onjuiste hoeken worden de pieken over meerdere projectierijen uitgesmeerd. Het algoritme evalueert hoeken binnen het verwachte scheefstandbereik, meestal negatief 10 tot positief 10 graden, en selecteert de hoek die de scherpste projectiepieken produceert.

Het algoritme houdt ook rekening met het inhoudstype. Een pagina met pure tekst met een duidelijke lijnstructuur produceert een sterk correctiesignaal. Een pagina die wordt gedomineerd door een foto of afbeelding zonder duidelijke horizontale tekstlijnen produceert een zwak signaal, en het algoritme kan standaard een nulcorrectie gebruiken om roteren op basis van onbetrouwbare gegevens te voorkomen. Goede tools voor rechtzetten rapporteren de berekende hoek voor elke pagina, zodat u pagina's kunt bekijken waarop de correctie onjuist lijkt.

WukongPDF

Probeer PDF bijsnijden

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Methode 1: Gescande pagina's van Acrobat Pro optimaliseren

Adobe Acrobat Pro bevat een functie voor het rechtzetten van batches in de tools voor het verbeteren van gescande pagina's. Open de gescande PDF en ga naar Extra, Scannen en OCR, vervolgens Verbeteren en selecteer Gescande pagina's optimaliseren. Vink in het optimalisatiedialoogvenster de optie Rechttrekken en rechtzetten aan. Stel de uitvoer in op de gewenste resolutie, doorgaans 300 DPI voor documenten die opnieuw worden afgedrukt en 150 DPI voor weergave op het scherm. Acrobat verwerkt elke pagina, corrigeert deze afzonderlijk en produceert een geoptimaliseerde PDF.

Het rechtzetten van Acrobat is conservatief. Het corrigeert pagina's met duidelijke scheeftrekkingen van meer dan ongeveer één graad, maar kan zeer subtiele scheeftrekkingen, minder dan een halve graad, ongecorrigeerd laten. Voor de meeste documenten is dit conservatieve gedrag passend. Een valse scheefstandcorrectie waarbij een correct georiënteerde pagina wordt geroteerd, is verstorender dan het onaangeroerd laten van een nauwelijks waarneembare scheefstand. Na de optimalisatie bladert u door het document met zoomaanpassing aan de breedte en controleert u visueel of de tekstlijnen horizontaal lijken. Pagina's die niet zijn gecorrigeerd, moeten nog steeds leesbaar zijn.

Methode 2: ScanTailor voor professionele batch-deskewing

ScanTailor is een open-source naverwerkingstool die speciaal is ontworpen voor gescande documenten. Het verwerkt een batch gescande pagina's in meerdere fasen, waaronder rechtzetten, inhouddetectie, bijsnijden van marges en uitvoeropmaak. Importeer de gescande PDF in ScanTailor door eerst de afzonderlijke pagina-afbeeldingen te extraheren met een tool als pdfimages of de functie Alle afbeeldingen exporteren van Acrobat Pro.

ScanTailor presenteert elke pagina met de gedetecteerde schuine hoek eroverheen. U kunt de hoek handmatig aanpassen voor elke pagina waarop de automatische detectie onjuist was voordat u de correctie algemeen toepast. Na het rechtzetten gaat u verder met de inhoudsselectiefase om het tekstgebied te identificeren en lege marges weg te snijden, en vervolgens te exporteren naar PDF. De verwerking van ScanTailor is grondiger dan die van Acrobat Pro en produceert schonere uitvoer voor documenten waarbij zowel rechtzetten als marges moeten worden bijgesneden.

ToolBatch-geschikt?Nauwkeurigheid
Adobe Acrobat Pro (gescande pagina's optimaliseren)Ja, het filter is van toepassing op alle pagina'sGoed voor lichte tot matige scheefheid
ScanTailor (open source)Ja, ontworpen voor batchverwerkingUitstekende detectie van inhoud per pagina
ImageMagick + scheefstand-CLIJa, volledig scriptbaarGoed, gebruikt de dominante tekstlijnhoek

Methode 3: Rechtzetten van opdrachtregels met ImageMagick

Voor gescripte batchworkflows bevat de convert-opdracht van ImageMagick een scheefstandoperator. Het commando convert input.png -deskew 40% output.png analyseert de afbeelding en past de gedetecteerde rotatiecorrectie toe. De percentageparameter, in dit voorbeeld 40 procent, stelt de drempelwaarde in voor hoeveel van de afbeelding wordt bedekt door de scheefstandbewerking.

Als het gaat om documentworkflows, kunt u voor het verwerken van een volledige PDF via ImageMagick de PDF opsplitsen in afzonderlijke pagina-afbeeldingen met behulp van pdfimages of een soortgelijke tool. Voer de opdracht scheefstand uit op elke pagina-afbeelding met behulp van een shell-lus. Combineer vervolgens de rechtgetrokken afbeeldingen opnieuw in een PDF met behulp van de convert-opdracht van ImageMagick, waarbij de pagina-afbeeldingen in volgorde worden weergegeven. De opdrachtregelaanpak is volledig geautomatiseerd en gratis, waardoor deze geschikt is voor batchverwerking van grote volumes waarbij de GUI-tools te veel handmatige interactie vereisen. De uitvoerkwaliteit van ImageMagick's scheefstandcorrectie is vergelijkbaar met die van Acrobat Pro voor documenten met een duidelijke tekstregelstructuur.

Batch rechtzetten transformeert een scheef gescande PDF binnen enkele minuten in een professioneel rechtgetrokken document. De geautomatiseerde correctie wordt afzonderlijk op elke pagina toegepast, waarbij de variatie per pagina wordt afgehandeld, waardoor handmatig rechttrekken onpraktisch is voor documenten met meer dan een handvol pagina's.

Het combineren van rechtzetten met andere correcties voor gescande pagina's

Rechtzetten is het meest effectief in combinatie met andere gescande paginacorrecties in één verwerkingspijplijn. Pas na het rechtzetten inhoudsdetectie toe om het tekstgebied te identificeren en lege marges weg te snijden. Pas vervolgens een drempelfilter toe om grijswaardenpagina's om te zetten in schoon zwart-wit, wat de OCR-nauwkeurigheid verbetert en de bestandsgrootte verkleint. Voer ten slotte OCR uit op de rechtgetrokken, bijgesneden en drempelpagina's om een doorzoekbaar document te produceren.

Tools als ScanTailor en OCRmyPDF combineren al deze stappen in één geautomatiseerde pijplijn. OCRmyPDF, een op Python gebaseerd opdrachtregelprogramma, accepteert een gescande PDF, maakt elke pagina recht, past adaptieve drempelwaarden toe, voert OCR uit met Tesseract en voert een doorzoekbare PDF uit waarin de OCR-tekstlaag is ingesloten. Het enkele commando ocrmypdf --deskew input.pdf output.pdf verwerkt in één keer rechtzetten, drempelwaarden en OCR. Voor projecten voor de digitalisering van gescande documenten met een hoog volume worden de documenten in de gecombineerde pijplijn van begin tot eind verwerkt zonder handmatige tussenkomst in elk stadium.

De gevoeligheid voor scheefstandcorrectie kalibreren voor pagina's met gemengde inhoud

Pagina's met een combinatie van tekst en foto's, zoals geïllustreerde boeken of scans van tijdschriften, vormen een uitdaging bij het rechtzetten. Bij foto's ontbreekt een duidelijke oriëntatie van de tekstregels, en het algoritme voor het rechtzetten van de regels kan worden misleid door afbeeldingsranden in plaats van door tekst. Met de meeste tools kan een betrouwbaarheidsdrempel worden ingesteld die correctie verhindert wanneer de gedetecteerde hoek onzeker is.

Voor pagina's met gemengde inhoud stelt u de scheefstandgevoeligheid conservatief in. Een scheefheid van 0,3 graden is nauwelijks waarneembaar. Een valse correctie die een goede pagina 0,5 graden draait, is verstorender dan het onaangeroerd laten van de kleine scheefheid. Na het batch-rechtzetten bladert u door het document en identificeert u de pagina's die scheef zijn geworden. Zet die pagina's handmatig terug naar hun oorspronkelijke richting.

Batch rechtzetten transformeert een scheef gescand document in een professioneel uitgelijnd bestand in de tijd die nodig is om een enkele opdracht uit te voeren of door een optimalisatiedialoog te klikken. De geautomatiseerde correctie verwerkt de variatie per pagina, waardoor handmatig rechttrekken onpraktisch is. Gecombineerd met bijsnijden, drempelwaarden en OCR is rechtzetten één stap in een verwerkingspijplijn die onbewerkte scans omzet in schone, doorzoekbare, professioneel gepresenteerde digitale documenten.

Rechte pagina's zijn het eerste kwaliteitssignaal dat een lezer opmerkt in een gescand document. Voordat ze een woord lezen, voordat ze de inhoud beoordelen, vertelt de paginarichting hen of het document met zorg is opgesteld. Batch rechtzetten zorgt ervoor dat elke pagina in het document het juiste signaal uitzendt.

Batch rechtzetten is een enkele stap in de verwerkingspijplijn van gescande documenten, maar het is de stap die bepaalt of het document er professioneel voorbereid uitziet of onzorgvuldig gescand is. Rechte pagina's geven kwaliteit aan de lezer door voordat ze ook maar één woord lezen. In combinatie met bijsnijden, drempelwaarden en OCR transformeert rechtzetten ruwe scans in gepolijste digitale documenten.

WukongPDF

Probeer PDF bijsnijden

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →