Tips & Tricks

Come eseguire l'OCR di un documento scansionato in cui le pagine si alternano tra orientamento verticale e orizzontale all'interno di un singolo volume rilegato

La scansione di un volume rilegato come un libro, una tesi, un diario o un libro mastro produce un PDF in cui le pagine si alternano tra orientamento verticale e orizzontale. Le pagine di sinistra del libro aperto vengono scansionate in un orientamento e le pagine di destra in un altro, oppure l'intero libro viene scansionato con rotazioni di pagina alternate perché l'operatore dello scanner ha girato il libro per ogni pagina aperta senza ruotare l'immagine scansionata. Il risultato è un PDF in cui ogni altra pagina appare ruotata di 90 o 180 gradi quando visualizzata sullo schermo. L'esecuzione dell'OCR su questo documento senza prima normalizzare l'orientamento della pagina produce testo che si alterna tra orientato correttamente e ruotato, rendendo il testo riconosciuto inutilizzabile per la ricerca o l'estrazione. La soluzione richiede una fase di preelaborazione che rileva e corregge l'orientamento di ciascuna pagina prima che l'OCR la elabori.

How to OCR a Scanned Document Where Pages Alternate Between Portrait and Landscape Orientation Within a Single Bound Volume

Perché la scansione di volumi rilegati produce orientamenti di pagina alternati

Quando si esegue la scansione di un volume rilegato, ogni pagina aperta posiziona due pagine a faccia in giù sul piano dello scanner. La pagina sinistra del libro viene visualizzata sul lato destro del piano dello scanner, mentre la pagina destra viene visualizzata sul lato sinistro, ruotata di 180 gradi l'una rispetto all'altra. Se l'operatore dello scanner non corregge questa rotazione per ogni singola pagina, il PDF scansionato conterrà pagine in cui ogni altra pagina è capovolta. Un libro di 200 pagine produce un PDF con 200 pagine di cui 100 sono orientate correttamente e 100 sono ruotate di 180 gradi. Lo schema è regolare e prevedibile: tutte le pagine dispari potrebbero essere orientate correttamente e tutte le pagine pari ruotate, o viceversa.

Alcuni volumi rilegati vengono scansionati posizionando il libro aperto sullo scanner con il testo che scorre orizzontalmente, producendo un'unica immagine che contiene sia la pagina sinistra che quella destra. Questa immagine viene quindi divisa in due pagine separate, ma il processo di divisione non sempre ruota la pagina destra per adattarla all'orientamento della pagina sinistra. Il risultato è un PDF in cui le pagine di sinistra sono orientate correttamente e le pagine di destra sono ruotate di 90 gradi o viceversa. Il motore OCR, che prevede che il testo venga eseguito orizzontalmente da sinistra a destra nella pagina, non è in grado di riconoscere il testo sulle pagine ruotate perché il testo scorre verticalmente o capovolto.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Rilevamento dell'orientamento della pagina prima dell'elaborazione OCR

Prima di eseguire l'OCR, ispeziona le miniature delle pagine nel visualizzatore PDF. L'orientamento alternato è immediatamente visibile nel pannello delle miniature, dove ogni altra miniatura appare ruotata. Contare lo schema di orientamento: le pagine dispari corrette e le pagine pari ruotate è lo schema più comune, ma è possibile anche il contrario. Se il modello è coerente, un'operazione di rotazione batch può correggere tutte le pagine interessate in un unico comando. La maggior parte dei visualizzatori PDF consente di selezionare più pagine nel pannello delle miniature e di applicare una rotazione a tutte le pagine selezionate contemporaneamente. Seleziona tutte le pagine con numeri pari, ruotale di 180 gradi o 90 gradi secondo necessità e salva il documento. Il pannello delle miniature ora mostra tutte le pagine nell'orientamento corretto.

Lo strumento OCR PDF di WukongPDF elabora ogni pagina in modo indipendente, ma presuppone che il testo sia orientato orizzontalmente. Se la pagina viene ruotata, il motore OCR non riesce a riconoscere il testo o produce un output confuso perché tenta di leggere il testo verticale o capovolto come se fosse orizzontale. La correzione dell'orientamento della pagina prima dell'OCR è un passaggio di preelaborazione obbligatorio. Dopo aver ruotato le pagine interessate e salvato il documento, esegui l'OCR sul PDF normalizzato. La precisione del riconoscimento sarà coerente su tutte le pagine perché ogni pagina ora presenta il testo nell'orientamento previsto dal motore OCR.

Gestione di modelli di orientamento incoerenti nel documento

Non tutti i volumi rilegati producono uno schema alternato pulito. Un libro scansionato da due operatori diversi, un set multivolume scansionato in momenti diversi o un documento parzialmente scansionato dopo la scansione iniziale potrebbero presentare modelli di orientamento irregolari. Le pagine da 1 a 50 potrebbero seguire lo schema alternato, le pagine da 51 a 80 potrebbero essere tutte orientate correttamente perché sono state scansionate nuovamente con la rotazione corretta e le pagine da 81 a 200 potrebbero tornare allo schema alternato. Il rilevamento e la correzione devono essere eseguiti sezione per sezione anziché con un'unica operazione batch.

Per i modelli di orientamento irregolare, l'approccio manuale consistente nello scorrimento delle miniature e nella rotazione di singole pagine o intervalli di pagine è il metodo più affidabile. Inizia dalla prima pagina e scorri le miniature. Quando incontri una pagina ruotata, determina quante pagine consecutive condividono quell'orientamento. Seleziona l'intervallo e applica la rotazione. Continua nel documento finché ogni pagina non è orientata correttamente. Il processo richiede da uno a due secondi per pagina, quindi un documento di 200 pagine richiede circa cinque minuti. Il tempo è ben speso perché la precisione dell'OCR sulle pagine orientate correttamente è notevolmente superiore rispetto alle pagine ruotate.

Automazione del rilevamento dell'orientamento per progetti di grandi volumi

Per i progetti di digitalizzazione che coinvolgono centinaia o migliaia di pagine, il controllo manuale dell'orientamento pagina per pagina diventa poco pratico. Gli strumenti di rilevamento automatico dell'orientamento possono identificare le pagine ruotate analizzando la direzione del testo. Questi strumenti campionano i caratteri di testo sulla pagina e determinano l'orientamento dominante riconoscendo quale rotazione produce parole valide nella lingua prevista. Una pagina in cui il riconoscimento del testo riesce a 0 gradi ma fallisce a 90, 180 e 270 gradi è orientata correttamente. Una pagina in cui il riconoscimento riesce a 180 gradi ma fallisce a 0 è capovolta e necessita di rotazione. Il rilevamento automatizzato elabora rapidamente set di documenti di grandi dimensioni e un controllo manuale a campione dei risultati conferma che l'automazione ha funzionato correttamente prima dell'avvio dell'OCR.

Verifica dell'output OCR attraverso orientamenti alternati

Dopo aver corretto gli orientamenti della pagina ed eseguito l'OCR, verificare che la qualità del riconoscimento sia coerente nell'intero documento. Cerca il testo che appare sia sulle pagine originariamente corrette che su quelle originariamente ruotate. La ricerca dovrebbe trovare istanze su entrambi i tipi di pagine con uguale affidabilità. Se il testo sulle pagine originariamente ruotate non viene trovato, la correzione della rotazione potrebbe non essere stata applicata correttamente oppure il motore OCR potrebbe aver elaborato alcune pagine prima che la rotazione fosse salvata. Riaprire il documento, verificare che tutti gli orientamenti della pagina siano corretti nel pannello delle miniature ed eseguire nuovamente l'OCR se necessario.

Per i volumi rilegati in cui la qualità della scansione originale varia tra le pagine, come un libro in cui alcune pagine sono state premute contro il vetro dello scanner e altre presentano una curvatura vicino al dorso, la precisione dell'OCR varierà di conseguenza. La correzione dell'orientamento risolve il problema della rotazione ma non compensa altri problemi di qualità della scansione. Potrebbe essere necessario eseguire nuovamente la scansione o la preelaborazione delle pagine con una curvatura significativa con un filtro anti-deformazione prima che l'OCR possa raggiungere una precisione accettabile. La pipeline PDF scansionato per testo ricercabile funziona meglio quando le immagini di origine sono il più pulite e orientate uniformemente possibile. La correzione dell’orientamento è il primo e più efficace passo. La rimozione della deformazione, la regolazione del contrasto e la rimozione dei puntini sono le fasi successive che migliorano ulteriormente la precisione del riconoscimento su scansioni impegnative di volumi delimitati.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →