Un PDF scansionato assemblato da fonti miste spesso contiene pagine con orientamento sia verticale che orizzontale. I fogli di calcolo finanziari vengono visualizzati come pagine orizzontali. I documenti di testo allegati vengono visualizzati come pagine con orientamento verticale. L'esecuzione dell'OCR su un documento di questo tipo senza tenere conto degli orientamenti misti produce un testo riconosciuto in cui le parole sulle pagine orizzontali vengono confuse, ruotate o completamente perse perché il motore OCR ha elaborato quelle pagine nell'orientamento sbagliato.
I motori OCR PDF analizzano le righe di testo per determinare la posizione dei caratteri e l'ordine di lettura. Quando una pagina viene ruotata di 90 gradi rispetto a quanto previsto dal motore, le righe di testo vengono eseguite verticalmente anziché orizzontalmente. Il motore non riesce a riconoscere interamente il testo oppure tenta di leggerlo verticalmente, producendo output senza senso. I documenti con orientamento misto richiedono il rilevamento dell'orientamento per pagina prima dell'elaborazione OCR.
Gli strumenti OCR PDF scansionato di WukongPDF gestiscono orientamenti misti delle pagine con rilevamento automatico della rotazione per ciascuna pagina durante il processo di riconoscimento.
Perché l'orientamento della pagina è importante per la precisione dell'OCR
I motori OCR funzionano rilevando righe di caratteri e analizzando le forme all'interno di ciascuna riga. Una pagina con orientamento verticale ha linee di testo che corrono orizzontalmente, che il motore elabora in modo naturale. Una pagina con orientamento orizzontale, se visualizzata senza correzione della rotazione, presenta righe di testo che corrono verticalmente dalla prospettiva del motore OCR. Il motore prevede testo orizzontale e non può leggere testo verticale.
La soluzione consiste nel rilevare l'orientamento di ciascuna pagina prima dell'OCR e ruotare le pagine da orizzontale a verticale prima dell'elaborazione. Dopo l'OCR, le pagine possono essere ruotate nuovamente al loro orientamento originale con lo strato di testo riconosciuto posizionato correttamente. La rotazione durante l'elaborazione non modifica in modo permanente il documento; cambia solo il modo in cui il motore OCR vede la pagina.
La maggior parte degli strumenti OCR automatizzati presuppone che tutte le pagine condividano lo stesso orientamento perché questo è il caso comune per i documenti prodotti da un singolo scanner in un'unica sessione. I documenti con orientamento misto, spesso creati combinando scansioni provenienti da fonti diverse, richiedono una configurazione esplicita per gestire correttamente la variazione per pagina.
Metodo 1: Acrobat Pro con rilevamento della rotazione per pagina
La funzionalità OCR di Acrobat Pro può elaborare documenti con orientamento misto se configurata in modo appropriato. Apri il PDF scansionato in Acrobat Pro e vai su Strumenti, Scansione e OCR, Riconosci testo, In questo file. Nella finestra di dialogo Impostazioni riconoscimento testo, assicurati che sia selezionata la lingua OCR corretta come lingua principale del documento. Nella sezione Impostazioni, abilita l'opzione Raddrizza e Raddrizza, che aiuta Acrobat a rilevare la rotazione della pagina.
Acrobat elabora ogni pagina individualmente e tenta di rilevare l'orientamento dominante del testo. Per le pagine in cui il rilevamento è corretto, l'output OCR è accurato e leggibile. Per le pagine in cui il rilevamento non riesce, come quelle con testo minimo o sfondi visivi complessi, l'output OCR potrebbe essere criptato o del tutto assente. Dopo l'elaborazione OCR, rivedere in modo specifico le pagine orizzontali. Cerca il testo che puoi vedere visivamente su quelle pagine. Se la ricerca non trova nulla, è probabile che Acrobat abbia identificato erroneamente l'orientamento.
Per le pagine identificate erroneamente, ruotale manualmente nello strumento Organizza pagine ed esegui nuovamente l'OCR solo su quelle pagine. L'intervento manuale richiede solo un attimo per pagina interessata e garantisce che ogni pagina fornisca testo riconosciuto accurato all'output del documento ricercabile.
Metodo 2: pre-elaborazione con OCRmyPDF
OCRmyPDF, uno strumento da riga di comando open source basato su Tesseract OCR, gestisce pagine con orientamento misto attraverso la sua funzione di raddrizzamento integrata. Il comando ocrmypdf --deskew input.pdf output.pdf rileva l'orientamento del testo su ogni pagina, ruota le pagine secondo necessità, esegue l'OCR con Tesseract e genera un PDF ricercabile. Il flag di raddrizzamento è il parametro essenziale per l'elaborazione di documenti con orientamento misto.
OCRmyPDF elabora le pagine in sequenza e applica automaticamente la correzione dell'orientamento per pagina. Per documenti con rotazione estrema o pagine contenenti testo sia orizzontale che verticale, l'algoritmo di raddrizzamento orienta la pagina in base alla direzione dominante del testo, che fornisce i migliori risultati OCR per la maggior parte del contenuto della pagina. La direzione minoritaria del testo potrebbe avere una precisione leggermente ridotta, ma generalmente è ancora riconosciuta.
Nei flussi di lavoro dei documenti, per l'elaborazione batch di volumi elevati di documenti con orientamento misto, OCRmyPDF combinato con uno script shell che elabora tutti i PDF in una cartella fornisce OCR completamente automatizzato senza configurazione manuale per documento. L'automazione gestisce l'elaborazione di routine e solo i casi eccezionali richiedono la revisione umana.
Verifica specifica dell'output OCR sulle pagine orizzontali
Dopo l'elaborazione OCR, verificare l'output sulle pagine orizzontali come controllo mirato separato. Seleziona il testo su una pagina orizzontale nel PDF di output e copialo in un editor di testo semplice. Il testo copiato dovrebbe essere letto nell'ordine corretto, corrispondendo al contenuto visivo della pagina dall'alto al basso e da sinistra a destra. Se le parole sono confuse, fuori ordine o appaiono in sequenze senza senso, il rilevamento dell'orientamento per quella pagina non è riuscito.
Cerca termini noti specifici che appaiono nelle pagine orizzontali. Una tabella finanziaria su una pagina orizzontale potrebbe contenere codici conto, nomi di reparto o valori numerici specifici che è possibile cercare nell'output OCR. Se la ricerca non trova corrispondenze sulle pagine orizzontali ma trova corrispondenze sulle pagine verticali dello stesso documento, è probabile che il motore OCR abbia mancato completamente il contenuto orizzontale. Queste pagine necessitano di rielaborazione con l'orientamento manuale specificato.
Nei flussi di lavoro dei documenti, per i documenti che fungeranno da archivi ricercabili, la fase di verifica è un controllo di qualità che rileva i problemi OCR relativi all'orientamento prima che il documento entri nella raccolta permanente. Un output OCR non verificato che ignora silenziosamente intere pagine di contenuto compromette lo scopo di creare un archivio ricercabile.
Elaborazione batch raccolte digitalizzate con orientamento misto
Per grandi raccolte di documenti scansionati con orientamenti misti, la verifica manuale per pagina non è pratica. Automatizza il processo con OCRmyPDF e il flag deskew, quindi esegui uno script di verifica che controlli la presenza di testo ricercabile in ogni pagina di output. Le pagine con zero caratteri di testo riconosciuti o con pochissimi caratteri vengono contrassegnate per la revisione manuale e la potenziale rielaborazione.
Lo script di verifica legge ogni PDF elaborato dall'OCR, estrae il livello di testo pagina per pagina e conta il numero di caratteri riconosciuti su ciascuna pagina. Qualsiasi pagina al di sotto della soglia minima di caratteri, ad esempio dieci caratteri, viene contrassegnata come potenzialmente non elaborata o orientata in modo errato. Le pagine contrassegnate vengono compilate in un report che indirizza l'attività di revisione manuale solo alle pagine che effettivamente necessitano di attenzione umana, anziché richiedere la revisione di ogni pagina.
Per quanto riguarda i flussi di lavoro, per i progetti di digitalizzazione in corso in cui arrivano regolarmente nuovi documenti scansionati, il flusso di lavoro di elaborazione e verifica in batch diventa una procedura operativa standard. I nuovi documenti entrano in fase di elaborazione, vengono elaborati automaticamente tramite OCR con rilevamento dell'orientamento e solo le eccezioni richiedono l'intervento umano. L'automazione gestisce la routine. Il revisore umano gestisce le eccezioni.
Miglioramento dell'OCR sulle pagine con rotazione interna
Alcuni documenti scansionati contengono pagine in cui il contenuto viene ruotato all'interno della pagina anziché la pagina stessa che viene ruotata. Una tabella finanziaria orizzontale può essere inserita in un documento verticale ruotando il contenuto della tabella di 90 gradi mantenendo le dimensioni della pagina verticale. Queste pagine sono le più difficili per il rilevamento dell'orientamento perché le dimensioni della pagina non forniscono alcuna indicazione sulla necessità di rotazione.
Con l'elaborazione dei documenti, per le pagine con rotazione interna, la preelaborazione manuale è l'approccio più affidabile. In Acrobat Pro, utilizza lo strumento Modifica PDF per selezionare l'area del contenuto ruotato, ruotarla nell'orientamento orizzontale corretto e posizionarla correttamente sulla pagina. Dopo aver corretto la rotazione interna, eseguire l'OCR sulla pagina corretta. La fase di preelaborazione manuale richiede circa un minuto per pagina interessata, ma produce un output OCR pulito e accurato.
L'identificazione delle pagine con rotazione interna richiede un'ispezione visiva. Esegui la scansione del documento e cerca le pagine in cui il testo sembra scorrere in una direzione inaspettata rispetto ai bordi della pagina. Le pagine con rotazione interna sono relativamente rare nella maggior parte delle raccolte di documenti, ma quando si verificano influiscono in modo sproporzionato sulla qualità dell'OCR.
Scegliere il motore OCR giusto per documenti con orientamento misto
Diversi motori OCR gestiscono il rilevamento dell'orientamento con precisione variabile. Tesseract con il preprocessore di raddrizzamento gestisce bene la rotazione moderata ma potrebbe avere difficoltà con le pagine ruotate esattamente di 90 o 180 gradi. L'OCR di Google Cloud Vision include il rilevamento dell'orientamento integrato che gestisce tutti gli angoli di rotazione in modo affidabile. Per i documenti critici con orientamento misto in cui la precisione è essenziale, i servizi OCR basati su cloud generalmente superano i motori locali nella gestione dell'orientamento.
Testa il motore OCR scelto su un piccolo campione di pagine con orientamento misto prima di impegnarti in un batch di grandi dimensioni. Un test di dieci pagine con modelli di orientamento noti rivela come il motore gestisce i tipi di rotazione specifici nei tuoi documenti. Il test richiede pochi minuti ed evita ore di rielaborazione se il rilevamento dell'orientamento del motore si rivela inadeguato per particolari tipi di documenti.
Esportazione di testo OCR da documenti con orientamento misto per verifica
Dopo l'elaborazione OCR, esportare il testo riconosciuto per verificarne la completezza su tutte le pagine. In Acrobat Pro, vai su Strumenti, Esporta PDF e scegli Testo come formato di output. Il file di testo esportato deve contenere il contenuto di ogni pagina nell'ordine di lettura corretto. Apri il file di testo e cerca i termini che sai apparire su pagine orizzontali specifiche. Se tali termini mancano dall'esportazione, è probabile che le pagine siano state orientate in modo errato durante l'OCR e necessitino di rielaborazione.
Per quanto riguarda la gestione dei documenti, per i documenti destinati agli archivi ricercabili, il testo esportato serve come verifica indipendente che ogni pagina abbia contribuito con il proprio contenuto al livello ricercabile. Un'esportazione di testo che presenta lacune o sezioni mancanti indica errori OCR che richiedono attenzione prima che il documento entri nell'archivio permanente. La fase di esportazione funziona come un controllo di qualità che rileva i problemi di OCR legati all'orientamento prima che diventino carenze permanenti dell'archivio.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
