Você digitaliza um contrato bilíngue. A coluna da esquerda está em inglês. A coluna da direita está em espanhol. Ambos os idiomas precisam ser pesquisáveis, mas uma execução de OCR padrão configurada para um idioma prejudicará o outro. O OCR em inglês aplicado ao texto em espanhol produz absurdo porque o mecanismo de reconhecimento espera diferentes frequências de letras e padrões de palavras. O OCR espanhol aplicado ao inglês produz resultados igualmente distorcidos. Você precisa de um OCR que compreenda os dois idiomas simultaneamente.
OCR PDF multilíngue é um recurso de mecanismos de reconhecimento modernos que podem alternar entre modelos de idioma em um único documento. O mecanismo detecta em qual idioma cada bloco de texto está escrito e aplica o modelo de reconhecimento apropriado. O resultado é um reconhecimento preciso de texto em todos os idiomas do documento.

Como os mecanismos de OCR lidam com vários idiomas
Os mecanismos de OCR reconhecem o texto comparando as formas dos caracteres com modelos treinados da aparência das letras em cada idioma. Um modelo inglês sabe que a letra "e" é o mais comum, aquele "th" freqüentemente aparecem juntos e que certas combinações de caracteres como "qx" quase nunca ocorrem. Uma modelo espanhola sabe que caracteres acentuados como "a" com acento, "n" com til e pontos de interrogação invertidos são comuns. Um modelo francês espera vogais acentuadas frequentes e dígrafos específicos.
Ao especificar vários idiomas para um trabalho de OCR, o mecanismo carrega os modelos de caracteres para todos os idiomas especificados. À medida que processa cada bloco de texto na página, avalia qual modelo de linguagem melhor corresponde aos padrões de caracteres observados e aplica esse modelo. A detecção do idioma acontece automaticamente no nível do bloco de texto, portanto, uma página com corpo de texto em inglês e notas de rodapé em francês é tratada corretamente sem marcação manual de idioma.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
Configurando OCR multilíngue
Na seleção de idioma da ferramenta OCR permite vários idiomas. Selecione todos os idiomas que aparecem no documento. Para um contrato bilíngue inglês-espanhol, selecione inglês e espanhol. Para um documento da União Europeia que contenha inglês, francês e alemão, selecione todos os três. Para um trabalho acadêmico com texto em inglês e citações em grego antigo, selecione Inglês e Grego. O motor carrega todos os modelos necessários.
Existe um compromisso entre a cobertura linguística e a precisão. Cada idioma adicional adiciona mais modelos de caracteres ao processo de reconhecimento, o que aumenta a chance de confusão entre caracteres semelhantes de idiomas diferentes. A letra cirílica "a" parece idêntico à letra latina "a" mas representa um som diferente e aparece em contextos diferentes. Adicionar idiomas desnecessários aumenta o risco de o mecanismo classificar incorretamente os blocos de texto e aplicar o modelo de idioma errado. Selecione apenas os idiomas que realmente aparecem no documento, e não todos os idiomas que você acha que podem ser úteis.
Cenários comuns de OCR multilíngue e como lidar com eles
O cenário multilíngue mais comum é um documento que está principalmente em um idioma com passagens curtas, citações ou notas de rodapé em outro. Artigo acadêmico em inglês com citações em francês nas notas de rodapé. Um manual de instruções em alemão com termos técnicos em inglês. Um contrato legal em espanhol com termos definidos em inglês. Para estes documentos, o idioma principal contém a maior parte do texto e o idioma secundário aparece em contextos curtos e previsíveis.
O mecanismo de reconhecimento lida bem com esses documentos de idiomas mistos porque a alternância de idiomas é localizada em blocos de texto específicos. O corpo do texto em inglês é reconhecido com o modelo em inglês. A cotação francesa é reconhecida com o modelo francês. Como os dois idiomas aparecem em blocos de texto separados, a detecção de idioma do mecanismo identifica corretamente qual modelo usar para cada bloco.
Um cenário mais desafiador é um documento onde os idiomas são intercalados na mesma linha, como um livro didático de idiomas que mostra uma frase em inglês seguida de sua tradução em espanhol na mesma linha. O mecanismo de OCR pode tratar a linha inteira como um bloco de texto e aplicar um modelo de idioma a tudo isso, produzindo erros na metade da linha que está no outro idioma. Para esses documentos, a abordagem mais precisa é fazer o OCR do documento duas vezes, uma vez em cada idioma, e mesclar manualmente os resultados. Isto é trabalhoso e prático apenas para documentos curtos onde a precisão é crítica.
Verificação de resultados de OCR multilíngue
Depois de executar o OCR multilíngue, verifique os resultados verificando o texto em cada idioma. Pesquise uma palavra que você conhece que aparece em cada idioma. Confirme se a pesquisa o encontra. Selecione o texto em cada idioma e copie-o para confirmar se os caracteres estão corretos. Preste atenção especial aos caracteres acentuados e símbolos especiais. O reconhecimento PDF digitalizado tem maior probabilidade de falhar em caracteres que não existem no modelo de idioma dominante porque o mecanismo pode usar como padrão o equivalente latino mais próximo.
Erros comuns de OCR em documentos multilíngues incluem caracteres acentuados substituídos por seus equivalentes não acentuados, e com acento torna-se e, n com til torna-se n, pontuação especial como pontos de interrogação invertidos em espanhol substituídos por pontos de interrogação padrão e escritas não latinas como cirílico ou grego reconhecidos erroneamente como caracteres latinos visualmente semelhantes. Esses erros geralmente estão concentrados nas passagens do idioma secundário. Se o conteúdo do idioma secundário for crítico, compare manualmente essas passagens com o documento original. A ferramenta OCR de WukongPDF fornece uma pontuação de confiança para cada bloco de texto reconhecido, com pontuações mais baixas indicando blocos onde o mecanismo de reconhecimento era menos certo.
Para documentos que misturam idiomas do alfabeto latino com escritas não latinas, como um documento em inglês com citações em chinês ou árabe, o desafio do OCR multilíngue é mais significativo porque os formatos dos caracteres são fundamentalmente diferentes. O mecanismo de reconhecimento deve distinguir entre sistemas de escrita totalmente separados. Selecione os idiomas específicos para cada família de scripts que aparece no documento. O manuseio PDF do WukongPDF suporta a mistura de scripts latinos, cirílicos, árabes, CJK e índicos em um único trabalho de OCR, embora a precisão varie de acordo com o script e a qualidade da digitalização.
Uma técnica prática para melhorar o OCR multilíngue em documentos com seções de idiomas distintos: pré-separe o documento por idioma antes de executar o OCR. Se um contrato de 20 páginas tiver as primeiras 10 páginas em inglês e as últimas 10 páginas em espanhol, divida o documento em dois arquivos, execute o OCR em inglês no primeiro e o OCR em espanhol no segundo e depois mescle novamente. Isso evita totalmente a sobrecarga do modelo multilíngue e produz uma precisão um pouco maior porque cada trabalho de OCR usa um modelo de idioma único otimizado para o texto exato que está processando. O fluxo de trabalho de divisão, OCR separadamente e re-mesclagem leva alguns minutos extras, mas produz de forma confiável a melhor precisão para documentos com limites de idioma claros. Reserve a abordagem de OCR multilíngue para documentos onde os idiomas estão genuinamente intercalados na mesma página e a separação é impraticável.
Uma dica final para OCR multilíngue: se o documento contiver escritas da direita para a esquerda, como árabe, hebraico ou persa, além de escritas da esquerda para a direita, como inglês ou francês, a direção do texto adiciona complexidade. Os mecanismos de OCR devem detectar não apenas em qual idioma cada bloco de texto está, mas também em que direção o texto flui. Um bloco de texto em árabe deve ser reconhecido da direita para a esquerda, enquanto a legenda em inglês abaixo dele deve ser reconhecida da esquerda para a direita. A maioria dos mecanismos de OCR modernos lidam razoavelmente bem com documentos de direções mistas quando você especifica ambas as famílias de idiomas nas configurações. Após o OCR, verifique a direção do texto copiando uma passagem em árabe e colando-a em um editor de texto. Os caracteres devem aparecer na ordem de leitura correta e não invertida.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
