Tips & Tricks

Como fazer o OCR de um artigo acadêmico digitalizado onde o texto da nota de rodapé e as citações nas margens se sobrepõem fisicamente à coluna de texto do corpo principal

How to OCR a Scanned Academic Paper Where Footnote Text and Margin Citations Physically Overlap With the Main Body Text Column

Por que o OCR tem dificuldade com a sobreposição de texto de nota de rodapé e conteúdo de margem

Os mecanismos de reconhecimento óptico de caracteres funcionam melhor quando o texto fica em blocos limpos e previsíveis, com espaçamento de linha consistente e separação clara entre regiões de conteúdo. Uma operação OCR PDF em uma carta comercial padrão ou em uma página nova normalmente produz resultados precisos porque o texto flui em parágrafos ordenados com margens largas em todos os lados. Artigos acadêmicos apresentam um problema fundamentalmente mais difícil porque seu layout agrupa deliberadamente múltiplos fluxos de texto distintos em estreita proximidade física, com notas de rodapé, citações de margem e corpo de texto muitas vezes tocando ou se sobrepondo em seus limites.

O principal desafio é a segmentação, a etapa em que o mecanismo de OCR divide a imagem da página em regiões de texto antes de tentar o reconhecimento de caracteres. Quando um número de referência de nota de rodapé sobrescrito no corpo do texto fica diretamente acima de uma linha separadora de nota de rodapé, e essa linha fica diretamente acima do próprio texto da nota de rodapé em um tamanho de fonte menor, o algoritmo de segmentação deve decidir onde termina uma região de texto e começa a próxima. Uma decisão errada de segmentação aqui se transforma em erros de reconhecimento porque caracteres de dois fluxos de texto diferentes são alimentados no mecanismo de reconhecimento como se fossem uma única linha contínua. A saída parece algo sem sentido, misturando palavras do corpo do texto com fragmentos de notas de rodapé.

As citações nas margens adicionam um terceiro fluxo de texto ao problema. Em artigos de humanidades que seguem o estilo Chicago ou documentos jurídicos que usam o formato Bluebook, notas de margem, números de linha ou citações paralelas são executadas verticalmente ou horizontalmente ao longo da coluna de texto principal. Esses elementos de margem geralmente são impressos em um tamanho de ponto menor, às vezes 7 ou 8 pontos, e podem usar fontes em itálico ou condensadas, com as quais os mecanismos de OCR já têm dificuldade em tamanhos normais. Quando o texto da margem toca fisicamente o corpo do texto, o que acontece frequentemente em periódicos bem formatados e com margens estreitas, o desafio da segmentação torna-se tripartido em vez de bidirecional.

A qualidade do papel da fonte PDF digitalizado também agrava a dificuldade de OCR. Muitos trabalhos acadêmicos são digitalizados a partir de volumes encadernados, onde a curvatura da página perto da lombada faz com que o texto fique dobrado e distorcido. As notas de rodapé na parte inferior da página são a seção mais afetada pela curvatura da lombada porque ficam mais próximas da encadernação. A combinação de distorção física da página curva, tamanho de fonte pequeno e proximidade do corpo do texto acima cria uma tempestade perfeita de condições adversas para a precisão do OCR.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Pré-processamento da página digitalizada para separar regiões de texto sobrepostas

A maneira mais eficaz de melhorar a precisão do OCR em páginas acadêmicas com elementos de texto sobrepostos é pré-processar a imagem da página antes que ela chegue ao mecanismo de OCR. Esse pré-processamento separa os diferentes fluxos de texto para que o mecanismo nunca precise tomar decisões ambíguas de segmentação.

Comece nivelando a página digitalizada para garantir que todas as linhas de texto fiquem perfeitamente horizontais. Mesmo uma inclinação de um grau na digitalização original pode fazer com que o texto da nota de rodapé se desloque para a região do corpo do texto nas bordas da página, criando falsas sobreposições que não existiriam em uma página devidamente alinhada. A maioria dos softwares de digitalização de documentos inclui enquadramento automático, mas para trabalhos acadêmicos digitalizados a partir de volumes encadernados, o enquadramento manual com uma linha de referência desenhada ao longo da linha de base do corpo do texto produz resultados mais precisos do que a correção automática.

Após o alinhamento, o próximo passo é o mascaramento da região. Usando um editor de imagens ou uma ferramenta dedicada de pré-processamento de OCR, desenhe uma linha separadora horizontal entre a área do corpo do texto e a área da nota de rodapé. Esta linha diz ao mecanismo de OCR downstream para tratar tudo acima dela como uma região de texto e tudo abaixo dela como uma região de texto separada. Nas páginas onde há notas de rodapé, o separador deve ficar logo acima da regra da nota de rodapé, a curta linha horizontal que tradicionalmente separa o corpo do texto das notas de rodapé em trabalhos acadêmicos impressos. Nas páginas sem notas de rodapé não é necessário nenhum separador.

Para citações de margem e números de linha, o mascaramento vertical é a abordagem equivalente. Desenhe um separador vertical entre o texto da margem e a coluna do texto principal. Em páginas com números de linha na margem esquerda e citações na margem direita, ambos os lados precisam de separadores verticais. O objetivo é particionar a página em regiões retangulares onde cada região contém exatamente um fluxo de texto. O mecanismo de OCR processa cada região de forma independente e produz saídas de texto reconhecidas separadas que você pode remontar na ordem de leitura correta após a conclusão do reconhecimento.

Definindo configurações de OCR para páginas acadêmicas multi-stream

A maioria dos mecanismos de OCR profissionais fornece configurações que ajudam com layouts de páginas com várias colunas e vários fluxos. A ativação da análise automática de layout é o ponto de partida, mas para páginas acadêmicas com fluxos de texto próximos, a configuração manual da zona produz melhores resultados do que a análise totalmente automática.

Defina zonas de reconhecimento separadas para o corpo do texto, a área de notas de rodapé e cada região de texto de margem. Dentro de cada zona, defina o idioma apropriado, o intervalo de tamanho de fonte esperado e a orientação do texto. As zonas de corpo de texto devem esperar texto de 10 a 12 pontos na orientação horizontal da esquerda para a direita. As zonas de notas de rodapé devem esperar texto de 8 a 10 pontos, ainda horizontal, mas com a consciência de que o texto da nota de rodapé geralmente inclui URLs, DOIs e sequências de citações que podem confundir os modelos de linguagem que esperam uma prosa natural.

Especificamente para a zona do corpo de texto, habilite a configuração que ignora texto sobrescrito e subscrito para fins de segmentação de linha. Os números de referência de notas de rodapé sobrescritos e os expoentes matemáticos são normalmente menores e elevados acima da linha de base, o que causa erros de cálculo de altura de linha se o mecanismo os tratar como parte da linha de texto normal. Ignorar o posicionamento sobrescrito para fins de segmentação mantém as linhas do corpo do texto intactas, enquanto os marcadores de notas de rodapé são reconhecidos como pequenos elementos separados que não afetam os limites das linhas.

A qualidade de saída PDF para Texto melhora significativamente quando o resultado do reconhecimento de cada zona é salvo em um arquivo de texto separado ou em uma seção marcada separada dentro de uma saída combinada. Essa saída separada por zonas facilita a verificação de que o corpo do texto não se transformou no texto da nota de rodapé e que as citações nas margens aparecem em sua própria seção de saída claramente identificada, em vez de intercaladas com o conteúdo principal.

Limpeza pós-reconhecimento para saída de OCR acadêmico

Mesmo com pré-processamento cuidadoso e configuração de zona, alguns erros de reconhecimento são inevitáveis em páginas acadêmicas compactadas. Um processo estruturado de limpeza pós-reconhecimento detecta e corrige esses erros residuais antes que o texto entre no documento final.

Execute uma verificação ortográfica apenas na saída do corpo do texto, com o dicionário de verificação ortográfica definido para o idioma principal do documento. Palavras sinalizadas como incorretas no corpo do texto que acabam sendo escritas corretamente no conteúdo da nota de rodapé são um sinal claro de que o limite da zona do corpo do texto era muito generoso e capturou o texto da nota de rodapé. Ajuste o limite da zona para essas páginas e execute novamente o reconhecimento em vez de editar manualmente os fragmentos das notas de rodapé.

Para saída de texto de nota de rodapé, verifique se cada nota de rodapé começa com o número de referência esperado e se o texto da nota de rodapé flui continuamente sem fragmentos do corpo do texto intercalados. Um padrão comum de erro pós-reconhecimento são as linhas do corpo do texto que aparecem no meio do texto da nota de rodapé, onde a coluna do corpo do texto se estende mais abaixo na página do que o limite da zona previsto. A revisão da imagem da página original junto com o texto da nota de rodapé reconhecida detecta essas intrusões rapidamente porque o tópico da frase muda abruptamente do assunto acadêmico para um tópico de parágrafo do corpo não relacionado.

A ferramenta OCR de WukongPDF suporta reconhecimento baseado em zona para layouts de páginas complexos, incluindo artigos acadêmicos de múltiplas colunas com notas de rodapé e conteúdo de margem. Definir configurações por zona para idioma, faixa de tamanho de fonte e orientação do texto antes de iniciar a passagem de reconhecimento produz uma saída OCR PDF mais precisa do que o processamento de zona única nas mesmas páginas, e o formato de saída separado torna a verificação pós-reconhecimento simples.

Tratamento de casos especiais: notação matemática, escrita não latina e idiomas mistos

Artigos acadêmicos nas áreas STEM adicionam notação matemática ao desafio de textos sobrepostos. Equações e fórmulas intercaladas com o corpo do texto criam complexidade adicional de segmentação porque a notação matemática usa símbolos, letras gregas e formatação bidimensional como frações e sobrescritos que não seguem as mesmas regras de layout do texto em prosa. Os mecanismos de OCR projetados para texto de documentos apresentam desempenho insatisfatório em notação matemática, e os mecanismos projetados para matemática apresentam desempenho insatisfatório em texto de documentos.

A abordagem mais prática para páginas com matemática e prosa mistas é uma estratégia de OCR de duas passagens. A primeira passagem usa um mecanismo otimizado para documentos para reconhecer todas as regiões do texto em prosa, incluindo corpo do texto, notas de rodapé e citações de margem. A segunda passagem usa um mecanismo de reconhecimento com reconhecimento matemático nas regiões específicas da página que contêm equações. Mesclar as duas saídas em um documento combinado que preserva a precisão da prosa do mecanismo de documento e a precisão da fórmula do mecanismo matemático produz o resultado geral mais confiável.

Para artigos que misturam escritas latinas e não latinas, como artigos em inglês com citações em árabe, chinês ou cirílico em notas de rodapé, configure cada zona de reconhecimento com a escrita primária correta. A zona do corpo de texto utiliza o idioma principal do documento. As zonas de notas de rodapé que contêm passagens de escrita não latina podem precisar de uma configuração de reconhecimento de vários scripts que possa alternar entre scripts dentro de uma única região de texto.

A tabela abaixo resume as configurações recomendadas de zona de OCR para diferentes regiões de páginas em trabalhos acadêmicos.

Região da páginaTamanho de fonte esperadoOrientaçãoConfigurações Especiais
Corpo do texto10-12 pontosHorizontalIgnorar sobrescrito para segmentação de linha
Notas de rodapé8-10 pontosHorizontalMulti-script se as citações incluírem texto não latino
Margem Esquerda (Números de Linha)7-9 pontosHorizontal ou VerticalExtraia como saída separada; não se funda com o corpo
Margem direita (citações)7-9 pontosHorizontalExtraia como saída separada
Equações/FórmulasVariávelHorizontal com layout 2DUse mecanismo com reconhecimento matemático na segunda passagem
WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →