A digitalização de um volume encadernado, como um livro, uma tese, um diário ou um livro-razão, produz um PDF onde as páginas alternam entre a orientação retrato e paisagem. As páginas da esquerda do livro aberto são digitalizadas em uma orientação e as páginas da direita em outra, ou o livro inteiro é digitalizado com rotações alternadas de páginas porque o operador do scanner virou o livro para cada página aberta sem girar a imagem digitalizada. O resultado é um PDF onde todas as outras páginas aparecem giradas em 90 ou 180 graus quando visualizadas na tela. Executar o OCR neste documento sem primeiro normalizar as orientações da página produz um texto que alterna entre orientado corretamente e girado, tornando o texto reconhecido inutilizável para pesquisa ou extração. A solução requer uma etapa de pré-processamento que detecta e corrige a orientação de cada página antes que o OCR a processe.

Por que a digitalização de volume encadernado produz orientações de página alternadas
Ao digitalizar um volume encadernado, cada página aberta coloca duas páginas voltadas para baixo na mesa do scanner. A página esquerda do livro aparece no lado direito da mesa do scanner e a página direita aparece no lado esquerdo, girada 180 graus uma em relação à outra. Se o operador do scanner não corrigir essa rotação para cada página individual, o PDF digitalizado conterá páginas onde todas as outras páginas estarão de cabeça para baixo. Um livro de 200 páginas produz um PDF com 200 páginas, onde 100 estão orientadas corretamente e 100 giradas 180 graus. O padrão é regular e previsível: todas as páginas ímpares podem ser orientadas corretamente e todas as páginas pares giradas, ou vice-versa.
Alguns volumes encadernados são digitalizados colocando o livro aberto no scanner com o texto correndo horizontalmente, produzindo uma única imagem que contém as páginas esquerda e direita. Esta imagem é então dividida em duas páginas separadas, mas o processo de divisão nem sempre gira a página direita para corresponder à orientação da página esquerda. O resultado é um PDF onde as páginas da esquerda estão orientadas corretamente e as páginas da direita são giradas 90 graus ou vice-versa. O mecanismo de OCR, que espera que o texto seja executado horizontalmente da esquerda para a direita na página, não consegue reconhecer o texto nas páginas giradas porque o texto está sendo executado verticalmente ou de cabeça para baixo.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
Detecção da orientação da página antes do processamento de OCR
Antes de executar o OCR, inspecione as miniaturas das páginas no visualizador de PDF. A orientação alternada é imediatamente visível no painel de miniaturas, onde todas as outras miniaturas aparecem giradas. Conte o padrão de orientação: páginas ímpares corretas e páginas pares giradas é o padrão mais comum, mas o inverso também é possível. Se o padrão for consistente, uma operação de rotação em lote poderá corrigir todas as páginas afetadas em um único comando. A maioria dos visualizadores de PDF permite selecionar múltiplas páginas no painel de miniaturas e aplicar uma rotação a todas as páginas selecionadas simultaneamente. Selecione todas as páginas pares, gire-as 180 graus ou 90 graus conforme necessário e salve o documento. O painel de miniaturas agora mostra todas as páginas na orientação correta.
A ferramenta OCR PDF de WukongPDF processa cada página de forma independente, mas assume que o texto está orientado horizontalmente. Se a página for girada, o mecanismo de OCR não consegue reconhecer nenhum texto ou produz uma saída distorcida porque está tentando ler o texto vertical ou invertido como se fosse horizontal. A correção da orientação da página antes do OCR é uma etapa de pré-processamento necessária. Depois de girar as páginas afetadas e salvar o documento, execute o OCR no PDF normalizado. A precisão do reconhecimento será consistente em todas as páginas porque cada página agora apresenta texto na orientação esperada pelo mecanismo de OCR.
Tratamento de padrões de orientação inconsistentes no documento
Nem todos os volumes vinculados produzem um padrão alternado limpo. Um livro digitalizado por dois operadores diferentes, um conjunto de vários volumes digitalizado em momentos diferentes ou um documento que foi parcialmente digitalizado novamente após a digitalização inicial pode apresentar padrões de orientação irregulares. As páginas de 1 a 50 podem seguir o padrão alternado, as páginas de 51 a 80 podem estar todas orientadas corretamente porque foram digitalizadas novamente com rotação adequada e as páginas de 81 a 200 podem retornar ao padrão alternado. A detecção e correção devem ser feitas seção por seção, e não com uma única operação em lote.
Para padrões de orientação irregulares, a abordagem manual de percorrer miniaturas e girar páginas individuais ou intervalos de páginas é o método mais confiável. Comece na página um e examine as miniaturas. Ao encontrar uma página girada, determine quantas páginas consecutivas compartilham essa orientação. Selecione o intervalo e aplique a rotação. Continue pelo documento até que todas as páginas estejam orientadas corretamente. O processo leva de um a dois segundos por página, portanto, um documento de 200 páginas leva cerca de cinco minutos. O tempo é bem gasto porque a precisão do OCR em páginas orientadas corretamente é dramaticamente maior do que em páginas giradas.
Automatizando a detecção de orientação para projetos de grande volume limitado
Para projetos de digitalização que envolvem centenas ou milhares de páginas, a verificação manual da orientação página por página torna-se impraticável. Ferramentas automatizadas de detecção de orientação podem identificar páginas giradas analisando a direção do texto. Essas ferramentas coletam amostras de caracteres de texto na página e determinam a orientação dominante, reconhecendo qual rotação produz palavras válidas no idioma esperado. Uma página onde o reconhecimento de texto é bem-sucedido em 0 graus, mas falha em 90, 180 e 270 graus, está orientada corretamente. Uma página onde o reconhecimento é bem-sucedido em 180 graus, mas falha em 0, está de cabeça para baixo e precisa ser girado. A detecção automatizada processa rapidamente grandes conjuntos de documentos e uma verificação manual dos resultados confirma que a automação funcionou corretamente antes do início do OCR.
Verificando a saída de OCR em orientações alternadas
Depois de corrigir as orientações das páginas e executar o OCR, verifique se a qualidade do reconhecimento é consistente em todo o documento. Pesquise o texto que aparece nas páginas originalmente corretas e originalmente giradas. A pesquisa deve encontrar instâncias em ambos os tipos de páginas com igual confiabilidade. Se o texto nas páginas giradas originalmente não for encontrado, a correção de rotação pode não ter sido aplicada corretamente ou o mecanismo de OCR pode ter processado algumas páginas antes de a rotação ser salva. Abra novamente o documento, confirme se todas as orientações da página estão corretas no painel de miniaturas e execute novamente o OCR, se necessário.
Para volumes encadernados onde a qualidade da digitalização original varia entre as páginas, como um livro onde algumas páginas foram pressionadas contra o vidro do scanner e outras têm curvatura perto da lombada, a precisão do OCR irá variar de acordo. A correção de orientação resolve o problema de rotação, mas não compensa outros problemas de qualidade de digitalização. Páginas com curvatura significativa podem precisar ser digitalizadas novamente ou pré-processadas com um filtro de correção de distorções antes que o OCR possa atingir uma precisão aceitável. O pipeline de PDF digitalizado para texto pesquisável funciona melhor quando as imagens de origem são tão limpas e orientadas uniformemente quanto possível. A correção da orientação é a primeira e mais impactante etapa. Dewarping, ajuste de contraste e remoção de manchas são as etapas de acompanhamento que melhoram ainda mais a precisão do reconhecimento em digitalizações desafiadoras de volume limitado.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
