Tips & Tricks

Como fazer OCR de um PDF com direção de texto vertical ou da direita para a esquerda

Os mecanismos de OCR padrão são construídos com base em uma suposição fundamental: o texto é executado horizontalmente, da esquerda para a direita, na página. Essa suposição funciona para inglês, espanhol, francês, alemão e para a maioria dos idiomas europeus. Ele falha completamente para texto japonês colocado verticalmente em colunas tradicionais, para sinais chineses onde os caracteres são empilhados de cima para baixo e para documentos árabes e hebraicos onde o texto flui da direita para a esquerda. A execução do OCR padrão nesses documentos produz resultados em que os caracteres são reconhecidos individualmente, mas montados na ordem errada, tornando o resultado inútil.

A capacidade dos mecanismos OCR PDF de lidar com direções de texto não padrão melhorou significativamente com a última geração de sistemas de reconhecimento alimentados por IA. Esses mecanismos detectam a orientação do texto antes de tentar o reconhecimento, identificam a direção da leitura e reconstroem a ordem lógica de leitura, independentemente do layout visual. Para documentos com direções de texto mistas, como um artigo em japonês que inclui citações horizontais em inglês, o mecanismo alterna os modos no meio da página.

How to OCR a PDF With Vertical or Right-to-Left Text Direction

Como os mecanismos de OCR detectam e tratam a direção do texto

Os mecanismos modernos de OCR começam com uma etapa de análise de layout que identifica regiões de texto, determina sua orientação e as classifica pela direção de leitura. Para texto horizontal, o mecanismo detecta a linha de base e agrupa os caracteres ao longo dela. Para texto vertical, o mecanismo detecta o eixo vertical e agrupa caracteres em colunas. Para texto da direita para a esquerda, o mecanismo identifica o conjunto de caracteres dominante e inverte a ordem padrão das palavras da esquerda para a direita.

A detecção da direção do texto depende de vários sinais. A presença de intervalos específicos de caracteres Unicode indica idiomas prováveis e suas direções de texto típicas. A disposição espacial dos caracteres detectados, quer eles formem linhas horizontais ou colunas verticais, fornece evidência de layout. A proporção das caixas delimitadoras de caracteres fornece um terceiro sinal: os caracteres latinos são normalmente mais largos do que altos, enquanto os caracteres CJK são aproximadamente quadrados e os caracteres árabes se conectam horizontalmente de maneiras que revelam a direção da leitura.

Os mecanismos de OCR mais confiáveis combinam todos os três tipos de sinal. Um documento contendo escrita árabe, que implica leitura da direita para a esquerda, e escrita latina, que implica leitura da esquerda para a direita, exige que o mecanismo analise cada região do texto de forma independente. Um pipeline Extract PDF Data configurado corretamente para documentos multilíngues inclui detecção de direção por região em vez de aplicar uma única direção à página inteira.

Cada sistema de escrita exige uma configuração de OCR fundamentalmente diferente.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Configurações de OCR para texto vertical em japonês, chinês e coreano

O texto vertical japonês, chamado tategaki, é o sistema de escrita vertical mais comum em uso moderno. Aparece em romances, jornais, documentos tradicionais e correspondência formal. No japonês vertical, os caracteres são lidos de cima para baixo, com colunas progredindo da direita para a esquerda na página. Números e palavras em escrita latina incorporadas no texto vertical em japonês podem ser giradas ou definidas horizontalmente dentro do fluxo vertical.

Para fazer OCR de texto vertical em japonês, selecione um mecanismo de reconhecimento que suporte explicitamente tategaki. Mecanismos de OCR de uso geral podem detectar os caracteres corretamente, mas produzi-los na ordem horizontal da esquerda para a direita, produzindo lixo. Os mecanismos de OCR específicos para o japonês entendem a ordem de leitura baseada em colunas e o texto de saída que pode ser lido naturalmente. Tesseract, o mecanismo de OCR de código aberto, adicionou suporte vertical japonês aprimorado na versão 5, e vários mecanismos comerciais agora o oferecem.

Para o texto vertical chinês, que aparece em publicações tradicionais, caligrafia e alguns documentos formais, o desafio de reconhecimento é semelhante, mas o conjunto de caracteres é maior. O chinês simplificado usa aproximadamente 7.000 caracteres de uso comum, enquanto o chinês tradicional usa mais de 13.000. O mecanismo de OCR deve não apenas detectar o layout vertical, mas também distinguir entre caracteres visualmente semelhantes que diferem apenas nos detalhes do traço.

O texto vertical coreano é raro em documentos modernos, mas aparece em textos históricos e em algumas publicações tradicionais. O alfabeto coreano, Hangul, reúne letras individuais em blocos de sílabas e, na escrita vertical, esses blocos são empilhados de cima para baixo. Os mecanismos de OCR que lidam com texto vertical coreano devem reconhecer a estrutura do bloco de sílabas, bem como os componentes individuais das letras dentro de cada bloco.

Configurações de OCR para texto da direita para a esquerda em árabe, hebraico e persa

O OCR árabe apresenta desafios únicos que vão além da direção do texto. O árabe é uma escrita cursiva onde a maioria das letras se conecta às vizinhas, e o formato da letra muda dependendo de sua posição na palavra: inicial, medial, final ou isolada. O mecanismo de OCR deve reconhecer essas formas contextuais e mapeá-las para o caractere abstrato correto. Conexões perdidas ou conexões falsas entre letras produzem erros de reconhecimento específicos de escritas cursivas.

Ao selecionar o OCR hebraico, a escrita não é cursiva, mas inclui pontos vocálicos, chamados niqqud, que aparecem como pontos e traços acima, abaixo ou dentro das letras. Essas marcas vocálicas são pequenas, normalmente de 2 a 4 pixels em uma imagem digitalizada, e são facilmente perdidas durante a binarização. Um mecanismo de OCR que não lida explicitamente com niqqud reconhecerá as consoantes corretamente, mas eliminará as marcas vocálicas, produzindo um texto que um leitor humano pode entender, mas que é tecnicamente incompleto.

O persa e o urdu usam versões estendidas da escrita árabe com caracteres adicionais. Um mecanismo de OCR treinado apenas em árabe perderá esses caracteres adicionais ou os reconhecerá erroneamente como letras árabes semelhantes. Ao selecionar um mecanismo de OCR para esses idiomas, verifique se ele lista especificamente o suporte para o idioma exato e a variante de script que seu documento usa, e não apenas para a escrita árabe em geral.

Tratamento de documentos de direção mista

Muitos documentos do mundo real misturam diversas direções de texto na mesma página. Um artigo técnico japonês pode ter texto vertical em japonês, legendas horizontais de figuras em inglês e equações matemáticas que seguem suas próprias regras de layout. Uma carta comercial em árabe pode incluir o nome de uma empresa em inglês e um bloco de endereço no formato da esquerda para a direita acima do texto da direita para a esquerda.

Para documentos de direção mista, a etapa de pré-processamento de OCR é crítica. O documento deve ser segmentado em regiões de texto e cada região deve ser classificada independentemente quanto à direção do texto antes do início do reconhecimento. A seleção manual de regiões geralmente produz melhores resultados do que a segmentação automática para layouts complexos. Desenhe caixas delimitadoras ao redor de cada região de texto e atribua o idioma e a direção corretos a cada caixa.

Após o OCR, verifique a saída verificando o texto que ultrapassa os limites de direção. Um erro comum no OCR de direção mista é errar o limite entre duas regiões de texto, de modo que a última palavra de uma região da esquerda para a direita seja anexada ao início de uma região da direita para a esquerda ou vice-versa. A verificação pontual dessas áreas limite detecta erros de segmentação de layout que, de outra forma, produziriam resultados confusos.

Processamento pós-OCR para direções de texto fora do padrão

Após a conclusão do OCR, o texto reconhecido poderá precisar ser reordenado para produzir uma ordem de leitura natural. Alguns mecanismos de OCR geram texto vertical em japonês na ordem em que foram reconhecidos, de cima para baixo em cada coluna, coluna por coluna, da esquerda para a direita. Esta ordem não corresponde à ordem de leitura original, que é coluna por coluna, da direita para a esquerda. Uma etapa de pós-processamento que reordena as colunas produz a sequência de leitura correta.

Para documentos com conteúdo PDF digitalizado que inclua texto bidirecional, árabe com termos em inglês incorporados, o algoritmo bidirecional Unicode especifica como determinar a ordem de exibição. A saída do OCR deve incluir caracteres de controle bidirecionais Unicode ou seguir o algoritmo para que o texto seja exibido corretamente quando colado em aplicativos que suportam texto bidirecional.

WukongPDF fornece processamento de OCR por meio do navegador para PDFs digitalizados, com opções de seleção de idioma que incluem suporte para os principais sistemas de escrita vertical e da direita para a esquerda. Testar o OCR em uma página de amostra antes de processar o documento completo permite verificar se a direção do texto está sendo tratada corretamente.

Para documentos que contêm texto vertical e horizontal na mesma página, como o layout de uma revista japonesa em que o artigo principal é vertical, mas as legendas e as barras laterais são horizontais, o zoneamento manual produz resultados de OCR mais precisos. Desenhe zonas de reconhecimento separadas para as regiões verticais e horizontais, atribua a direção correta do texto a cada uma e execute o OCR no documento zoneado. O tempo extra gasto no zoneamento compensa na precisão do reconhecimento.

Ao processar documentos históricos com layouts de texto fora do padrão, esteja preparado para que a precisão do OCR seja menor do que a dos documentos impressos modernos. Fontes históricas, impressão irregular, papel envelhecido com descoloração e variantes de caracteres fora do padrão reduzem a confiança no reconhecimento. Para trabalhos acadêmicos ou de arquivo, trate o resultado do OCR como um ponto de partida para a transcrição manual, e não como um produto acabado.

Alguns mecanismos de OCR suportam um modo de treinamento onde você fornece exemplos da fonte específica ou do estilo de escrita manual usado em seu documento. Treinar o mecanismo em algumas páginas representativas melhora a precisão do reconhecimento em todo o documento. Esta abordagem é particularmente útil para documentos impressos em fontes incomuns ou para coleções de documentos do mesmo editor onde a tipografia é consistente em vários volumes.

Depois que o OCR for concluído em um documento da direita para a esquerda, verifique se a direção do texto está correta, copiando algumas frases da saída e colando-as em um aplicativo que suporte texto bidirecional, como o Microsoft Word ou o Google Docs. Se o texto aparecer na ordem inversa, o mecanismo de OCR não aplicou corretamente a direção da direita para a esquerda e a saída precisa ser reprocessada com configurações de direção corrigidas.

O tempo investido na configuração de parâmetros corretos de OCR para direções de texto não padrão compensa imediatamente em precisão de reconhecimento. Um documento que requer 30 minutos de correção manual após um OCR ruim pode precisar de apenas 5 minutos de limpeza após um OCR configurado corretamente.

Sistema de EscritaDireçãoRequisito do mecanismo OCRDesafio Principal
Japonês (tategaki)Colunas de cima para baixo, da direita para a esquerdaMotor com suporte explícito a tategakiInglês horizontal misto em fluxo vertical
Chinês (tradicional)Colunas verticais, da direita para a esquerdaGrande conjunto de caracteres (mais de 13.000)Personagens visualmente semelhantes
árabeConexão cursiva da direita para a esquerdaMecanismo de script árabe com formas posicionaisFormas de letras contextuais; diacríticos
hebraicoDa direita para a esquerda, com niqqudMecanismo de script hebraico com suporte a vogaisPequenas marcas vocálicas perdidas na binarização
Persa / UrduDa direita para a esquerda, árabe estendidoMecanismo específico do idiomaCaracteres adicionais além do conjunto árabe
WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →