Tips & Tricks

Como fazer OCR de um PDF com páginas mistas de paisagem e retrato

Um PDF digitalizado montado a partir de fontes mistas geralmente contém páginas nas orientações retrato e paisagem. As planilhas financeiras aparecem como páginas em formato paisagem. Os documentos de texto que os acompanham aparecem como páginas retrato. A execução do OCR em tal documento sem levar em conta as orientações mistas produz texto reconhecido onde as palavras nas páginas paisagem são embaralhadas, giradas ou totalmente perdidas porque o mecanismo de OCR processou essas páginas na orientação errada.

Os mecanismos OCR PDF analisam as linhas de texto para determinar as posições dos caracteres e a ordem de leitura. Quando uma página é girada 90 graus em relação ao esperado pelo mecanismo, as linhas de texto são executadas verticalmente em vez de horizontalmente. O mecanismo não consegue reconhecer o texto inteiramente ou tenta ler verticalmente, produzindo resultados sem sentido. Documentos com orientação mista exigem detecção de orientação por página antes do processamento de OCR.

As ferramentas de OCR PDF digitalizado da WukongPDF lidam com orientações de páginas mistas com detecção automática de rotação para cada página durante o processo de reconhecimento.

Por que a orientação da página é importante para a precisão do OCR

Os mecanismos de OCR funcionam detectando linhas de caracteres e analisando as formas dentro de cada linha. Uma página na orientação retrato possui linhas de texto horizontalmente, que o mecanismo processa naturalmente. Uma página na orientação paisagem, quando visualizada sem correção de rotação, apresenta linhas de texto verticais na perspectiva do mecanismo de OCR. O mecanismo espera texto horizontal e não consegue ler texto vertical.

A solução é detectar a orientação de cada página antes do OCR e girar as páginas paisagem para orientação retrato antes do processamento. Após o OCR, as páginas podem ser giradas de volta à orientação original com a camada de texto reconhecida posicionada corretamente. A rotação durante o processamento não altera permanentemente o documento; isso apenas altera a forma como o mecanismo de OCR vê a página.

A maioria das ferramentas automatizadas de OCR assume que todas as páginas compartilham a mesma orientação, porque esse é o caso comum para documentos produzidos por um único scanner em uma única sessão. Documentos de orientação mista, muitas vezes criados pela combinação de digitalizações de diferentes fontes, exigem configuração explícita para lidar corretamente com a variação por página.

Método 1: Acrobat Pro com detecção de rotação por página

O recurso OCR do Acrobat Pro pode processar documentos com orientações mistas quando configurado adequadamente. Abra o PDF digitalizado no Acrobat Pro e vá para Ferramentas, Digitalizar e OCR, Reconhecer Texto, Neste Arquivo. Na caixa de diálogo de configurações Reconhecer texto, certifique-se de que o idioma de OCR correto esteja selecionado para o idioma principal do documento. Na seção Configurações, ative a opção Deskew and Straighten, que ajuda o Acrobat a detectar a rotação da página.

O Acrobat processa cada página individualmente e tenta detectar a orientação dominante do texto. Para páginas onde a detecção está correta, a saída do OCR é precisa e legível. Para páginas onde a detecção falha, como aquelas com texto mínimo ou fundos visuais complexos, a saída do OCR pode ficar embaralhada ou totalmente ausente. Após o processamento de OCR, revise especificamente as páginas em paisagem. Pesquise o texto que você pode ver visualmente nessas páginas. Se a pesquisa não encontrar nada, o Acrobat provavelmente identificou incorretamente a orientação.

Para páginas que foram identificadas incorretamente, gire-as manualmente na ferramenta Organizar páginas e execute novamente o OCR apenas nessas páginas. A intervenção manual leva apenas um momento por página afetada e garante que cada página contribua com texto reconhecido e preciso para a saída do documento pesquisável.

Método 2: Pré-processamento com OCRmyPDF

OCRmyPDF, uma ferramenta de linha de comando de código aberto construída no Tesseract OCR, lida com páginas de orientação mista por meio de seu recurso de enquadramento integrado. O comando ocrmypdf --deskew input.pdf output.pdf detecta a orientação do texto em cada página, gira as páginas conforme necessário, executa OCR com Tesseract e gera um PDF pesquisável. O sinalizador de inclinação é o parâmetro essencial para o processamento de documentos com orientação mista.

OCRmyPDF processa páginas sequencialmente e aplica correção de orientação por página automaticamente. Para documentos com rotação extrema ou páginas contendo texto horizontal e vertical, o algoritmo de enquadramento orienta a página com base na direção dominante do texto, o que fornece os melhores resultados de OCR para a maior parte do conteúdo da página. A direção minoritária do texto pode ter uma precisão ligeiramente reduzida, mas geralmente ainda é reconhecida.

Em fluxos de trabalho de documentos, para processamento em lote de alto volume de documentos de orientação mista, o OCRmyPDF combinado com um script de shell que processa todos os PDFs em uma pasta fornece OCR totalmente automatizado sem configuração manual por documento. A automação cuida do processamento de rotina e apenas casos de exceção requerem revisão humana.

Verificando especificamente a saída de OCR em páginas de paisagem

Após o processamento de OCR, verifique a saída nas páginas paisagem como uma verificação focada separada. Selecione o texto em uma página paisagem no PDF de saída e copie-o para um editor de texto simples. O texto copiado deve ser lido na ordem correta, correspondendo ao conteúdo visual da página de cima para baixo e da esquerda para a direita. Se as palavras estiverem embaralhadas, fora de ordem ou aparecerem em sequências sem sentido, a detecção de orientação falhou para aquela página.

Pesquise termos conhecidos específicos que aparecem nas páginas em paisagem. Uma tabela financeira em uma página paisagem pode conter códigos de conta específicos, nomes de departamentos ou valores numéricos que você pode pesquisar na saída do OCR. Se a pesquisa não encontrar correspondências nas páginas paisagem, mas encontrar correspondências nas páginas retrato do mesmo documento, o mecanismo de OCR provavelmente perdeu totalmente o conteúdo paisagem. Estas páginas precisam ser reprocessadas com orientação manual especificada.

Nos fluxos de trabalho de documentos, para documentos que servirão como arquivos pesquisáveis, a etapa de verificação é uma porta de qualidade que detecta problemas de OCR relacionados à orientação antes que o documento entre na coleção permanente. Uma saída de OCR não verificada que perde silenciosamente páginas inteiras de conteúdo prejudica o propósito de criar um arquivo pesquisável.

Processamento em lote de coleções digitalizadas de orientação mista

Para grandes coleções de documentos digitalizados com orientações mistas, a verificação manual por página é impraticável. Automatize o processo com OCRmyPDF e o sinalizador de enquadramento e, em seguida, execute um script de verificação que verifica cada página de saída quanto à presença de texto pesquisável. Páginas com zero caracteres de texto reconhecidos ou com poucos caracteres são sinalizadas para revisão manual e possível reprocessamento.

O script de verificação lê cada PDF processado por OCR, extrai a camada de texto página por página e conta o número de caracteres reconhecidos em cada página. Qualquer página abaixo de um limite mínimo de caracteres, como dez caracteres, é sinalizada como potencialmente não processada ou mal orientada. As páginas sinalizadas são compiladas em um relatório que orienta o esforço de revisão manual apenas para as páginas que realmente precisam de atenção humana, em vez de exigir a revisão de todas as páginas.

Em relação aos fluxos de trabalho, para projetos de digitalização em andamento, onde novos documentos digitalizados chegam regularmente, o processamento em lote e o fluxo de trabalho de verificação tornam-se um procedimento operacional padrão. Novos documentos entram no pipeline, são processados automaticamente através de OCR com detecção de orientação e apenas exceções requerem intervenção humana. A automação cuida da rotina. O revisor humano lida com as exceções.

Melhorando o OCR em páginas com rotação interna

Alguns documentos digitalizados contêm páginas onde o conteúdo é girado dentro da página, em vez de a própria página ser girada. Uma tabela financeira em paisagem pode ser inserida em um documento em retrato girando o conteúdo da tabela em 90 graus, mantendo as dimensões da página em retrato. Essas páginas são as mais desafiadoras para a detecção de orientação porque as dimensões da página não fornecem nenhuma indicação de que a rotação é necessária.

No processamento de documentos, para páginas com rotação interna, o pré-processamento manual é a abordagem mais confiável. No Acrobat Pro, use a ferramenta Editar PDF para selecionar a área de conteúdo girada, girá-la para a orientação horizontal correta e posicioná-la corretamente na página. Após corrigir a rotação interna, execute o OCR na página corrigida. A etapa de pré-processamento manual leva cerca de um minuto por página afetada, mas produz uma saída de OCR limpa e precisa.

A identificação de páginas com rotação interna requer inspeção visual. Digitalize o documento e procure páginas onde o texto parece correr em uma direção inesperada em relação às bordas da página. Páginas com rotação interna são relativamente raras na maioria das coleções de documentos, mas afetam desproporcionalmente a qualidade do OCR quando ocorrem.

Escolhendo o mecanismo de OCR correto para documentos de orientação mista

Diferentes mecanismos de OCR lidam com a detecção de orientação com precisão variável. O Tesseract com o pré-processador de enquadramento lida bem com a rotação moderada, mas pode ter problemas com páginas giradas exatamente 90 ou 180 graus. O OCR do Google Cloud Vision inclui detecção de orientação integrada que lida com todos os ângulos de rotação de maneira confiável. Para documentos críticos de orientação mista, onde a precisão é essencial, os serviços de OCR baseados em nuvem geralmente superam os mecanismos locais no tratamento da orientação.

Teste o mecanismo de OCR escolhido em uma pequena amostra de páginas de orientação mista antes de comprar um lote grande. Um teste de dez páginas com padrões de orientação conhecidos revela como o mecanismo lida com os tipos específicos de rotação em seus documentos. O teste leva minutos e evita horas de reprocessamento se a detecção da orientação do mecanismo for inadequada para seus tipos de documentos específicos.

Exportando texto OCR de documentos de orientação mista para verificação

Após o processamento de OCR, exporte o texto reconhecido para verificar se todas as páginas estão completas. No Acrobat Pro, vá para Ferramentas, Exportar PDF e escolha Texto como formato de saída. O arquivo de texto exportado deve conter o conteúdo de todas as páginas na ordem de leitura correta. Abra o arquivo de texto e pesquise os termos que você sabe que aparecem em páginas específicas de paisagem. Se esses termos estiverem faltando na exportação, é provável que essas páginas tenham sido mal orientadas durante o OCR e precisem ser reprocessadas.

No que diz respeito ao tratamento de documentos, para documentos destinados a arquivos pesquisáveis, o texto exportado serve como uma verificação independente de que cada página contribuiu com o seu conteúdo para a camada pesquisável. Uma exportação de texto com lacunas ou seções ausentes indica falhas de OCR que requerem atenção antes de o documento entrar no arquivo permanente. A etapa de exportação funciona como um portão de qualidade que detecta problemas de OCR relacionados à orientação antes que se tornem deficiências permanentes de arquivo.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →