Os mecanismos OCR PDF são construídos em torno do fluxo de texto da esquerda para a direita. Quando você os alimenta com um documento escrito em uma escrita da direita para a esquerda, como árabe, hebraico, persa ou urdu, o mecanismo deve detectar a direção do script, reconhecer os caracteres na ordem visual e lógica correta e gerar um texto que possa ser lido naturalmente no idioma de destino. Errar em uma dessas etapas produz um texto que é tecnicamente reconhecido, mas funcionalmente inutilizável: palavras escritas ao contrário, frases que começam no final e números que aparecem no lado errado do texto ao redor.
O OCR correto para idiomas da direita para a esquerda requer a seleção de um mecanismo de OCR que suporte explicitamente o script de destino, configurando-o com o parâmetro de idioma correto e verificando a saída por meio de ferramentas bidirecionais com reconhecimento de texto. O processo não é materialmente mais difícil do que o OCR para idiomas com escrita da esquerda para a direita, mas a etapa de configuração que muitos usuários ignoram, informando ao mecanismo qual idioma esperar, não é opcional para scripts da direita para a esquerda. Um mecanismo deixado com suas configurações padrão, geralmente em inglês, produzirá uma saída sem sentido a partir de um documento em árabe ou hebraico.
As ferramentas de OCR PDF digitalizado da WukongPDF suportam vários idiomas, incluindo scripts da direita para a esquerda. Selecionar o idioma correto antes de executar o OCR é a diferença entre extrair texto utilizável e gerar ruído de caracteres.

Por que o OCR da direita para a esquerda falha sem configuração explícita
Os mecanismos de OCR analisam formas e as mapeiam para caracteres no conjunto de caracteres do idioma especificado. Quando o mecanismo espera o inglês, ele interpreta as formas como letras latinas. A letra árabe para B é um pouco semelhante à letra latina B em muitas fontes, mas a letra árabe para Ayn não tem equivalente em latim. Um mecanismo no modo inglês que encontra Ayn gera um sinal de pontuação aleatório ou ignora completamente o caractere. Em um documento completo, esse reconhecimento incorreto caractere por caractere produz resultados sem relação com o texto original.
Mesmo quando o roteiro correto é selecionado, a direção do texto introduz uma segunda camada de complexidade. Os mecanismos de OCR processam imagens da esquerda para a direita por padrão, movendo-se em cada linha de pixels da borda esquerda para a direita. Um documento da direita para a esquerda deve ser processado da direita para a esquerda para que o mecanismo leia os caracteres na ordem em que foram escritos. Se o mecanismo não inverter a direção de processamento para scripts da direita para a esquerda, os caracteres reconhecidos estarão na ordem inversa dentro de cada palavra. Alguns motores controlam a inversão de direção automaticamente quando o parâmetro de idioma é definido. Outros exigem um sinalizador de direção de texto explícito.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
Configurando o Tesseract para OCR da direita para a esquerda
Tesseract, o mecanismo de OCR de código aberto, oferece suporte a árabe, hebraico, persa, urdu e vários outros scripts da direita para a esquerda por meio de arquivos de dados específicos do idioma. Instale os dados de idioma do script de destino. No Linux, o pacote normalmente é denominado tesseract-ocr-ara para árabe ou tesseract-ocr-heb para hebraico. No Windows, baixe o arquivo de dados treinados do repositório Tesseract GitHub e coloque-o no diretório tessdata.
Execute o Tesseract com o sinalizador de idioma definido para o script correto: tesseract input.pdf output -l ara para árabe, -l heb para hebraico ou -l ara+eng para um documento bilíngue árabe-inglês. O Tesseract trata a direção do texto automaticamente quando o parâmetro de idioma especifica um script da direita para a esquerda. A saída de texto reconhecida preserva a ordem de leitura correta. Para verificar, abra o arquivo de texto de saída e confirme se as palavras são lidas na direção esperada e se as frases fluem da direita para a esquerda.
Para documentos com escrita mista, como um artigo de pesquisa em árabe que contém termos técnicos em inglês, especifique os dois idiomas separados por um sinal de mais: -l ara+eng. O Tesseract alterna entre os modelos de idioma por palavra, aplicando o modelo árabe às palavras da escrita árabe e o modelo inglês às palavras da escrita latina. A alternância por palavra não é perfeita, especialmente em palavras curtas que podem pertencer a qualquer escrita, mas lida adequadamente com a maioria dos documentos de escrita mista.
Usando o Google Cloud Vision para detecção automática
Os recursos de OCR do Google Cloud Vision incluem detecção automática de idioma, o que é particularmente útil para scripts da direita para a esquerda quando você não tem certeza do idioma exato ou quando o documento contém vários idiomas da direita para a esquerda. A API aceita uma imagem de documento e retorna texto reconhecido com caixas delimitadoras para cada palavra, o idioma detectado para cada bloco de texto e a direção do texto. Para scripts da direita para a esquerda, o texto retornado já está na ordem de leitura correta.
A qualidade de reconhecimento de árabe e hebraico do Cloud Vision é geralmente superior à do Tesseract porque os modelos subjacentes foram treinados em conjuntos de dados maiores e mais diversos. A desvantagem é que a imagem do documento deve ser carregada nos servidores do Google para processamento, o que pode não ser aceitável para documentos confidenciais. Para documentos disponíveis publicamente ou documentos internos onde o processamento em nuvem é aprovado, o Cloud Vision fornece o OCR da direita para a esquerda mais preciso disponível sem a compra de software especializado de OCR para desktop.
| Idioma | Suporte ao mecanismo OCR | Notas de Precisão |
|---|---|---|
| árabe | Tesseract, Google Cloud Vision, ABBYY | Os sinais diacríticos podem ser eliminados, o manuseio da ligadura varia |
| hebraico | Tesseract, Google Cloud Vision, ABBYY | Pontos vocálicos Nikud frequentemente perdidos durante o OCR |
| Persa/Urdu | Tesseract, Google Cloud Vision | Variantes de script Nastaliq desafiam a maioria dos motores |
Verificando a saída de OCR para texto da direita para a esquerda
Após o OCR, abra o texto reconhecido em um editor de texto que ofereça suporte à renderização de texto bidirecional, como o Notepad++ com o plug-in bidirecional habilitado ou o Visual Studio Code com um pacote de idiomas RTL instalado. Editores de texto padrão que assumem texto da esquerda para a direita podem exibir texto da direita para a esquerda corretamente se o algoritmo bidirecional Unicode for implementado, mas os sinais de pontuação no final das linhas e a ordem relativa dos números no texto são pontos de falha comuns. Um editor de texto com suporte bidirecional explícito mostra o texto como um falante nativo esperaria lê-lo.
Verifique a saída em relação ao documento digitalizado original em três níveis: palavras individuais, especialmente aquelas que contêm marcas diacríticas ou ligaduras; frases completas, confirmando que a ordem das palavras é lida naturalmente no idioma alvo; e números e datas, confirmando que aparecem no lado correto do texto ao redor. Um documento onde todas as palavras são reconhecidas corretamente, mas a ordem das palavras é invertida em cada frase, é tão inutilizável para tradução ou pesquisa quanto um documento onde nenhuma palavra é reconhecida.
OCR para idiomas da direita para a esquerda é um problema técnico resolvido quando o parâmetro de idioma correto é definido. A etapa mais importante é dizer ao mecanismo qual script esperar. Tudo a jusante dessa decisão, desde a precisão do reconhecimento até a ordem de leitura e o manuseio de scripts mistos, depende de acertar a configuração do idioma. Com o parâmetro de idioma configurado e um editor de texto bidirecional aberto para verificação, o OCR para um documento em idioma escrito da direita para a esquerda não exige mais tempo ou esforço do que o OCR para qualquer outro idioma.
Tradução pós-OCR de texto de idioma da direita para a esquerda
Depois que o texto for reconhecido com precisão, a tradução do conteúdo do idioma da direita para a esquerda requer um mecanismo de tradução que lide corretamente com o texto bidirecional. O Google Translate e o DeepL suportam árabe, hebraico e persa. Cole o texto reconhecido na interface de tradução e confirme se o idioma de origem está identificado corretamente. O mecanismo de tradução detecta a direção do script e a preserva na saída. Para documentos cuja tradução será revisada por um falante nativo, exporte o texto original reconhecido e o texto traduzido lado a lado em uma tabela de duas colunas para uma comparação eficiente.
A tradução automática de línguas da direita para a esquerda é geralmente menos precisa do que a tradução entre línguas europeias da esquerda para a direita porque os dados de treino para muitos pares de línguas da direita para a esquerda são mais pequenos. Para documentos críticos, peça a um falante nativo que revise a tradução antes de agir de acordo com seu conteúdo. A etapa de OCR produz texto fonte preciso. A etapa de tradução adiciona uma camada de interpretação. Trate o resultado do OCR como uma verdade absoluta sobre o que o documento diz, e a tradução automática como um guia do que significa, sujeito a verificação.
Processamento em lote de PDFs em idiomas da direita para a esquerda
Quando você tem uma pasta de PDFs no idioma da direita para a esquerda para OCR, a interface de linha de comando do Tesseract aceita entrada em lote. Um único comando shell processa cada PDF: for f in *.pdf; faça tesseract $f ${f%.pdf} -l ara; feito. O comando percorre todos os PDFs, executa OCR com o modelo árabe e salva o texto reconhecido junto com cada PDF com nomes de arquivo básicos correspondentes.
Para lotes de idiomas mistos, use uma etapa de detecção de idioma antes do OCR. Um script Python com a biblioteca langdetect faz uma amostra da primeira página de texto para prever o idioma. Com base na previsão, o script seleciona o parâmetro de idioma Tesseract apropriado e executa o OCR. A detecção automatizada de idioma elimina a classificação manual de PDFs por idioma antes do processamento em lote. O OCR em lote para idiomas da direita para a esquerda transforma um tedioso processo por documento em um único comando que é concluído em minutos, independentemente de quantos documentos estão na pasta de entrada.
OCR para idiomas da direita para a esquerda não é um caso especial que requer ferramentas exóticas. Requer as mesmas ferramentas do OCR da esquerda para a direita, configuradas com o parâmetro de idioma correto. A etapa de configuração que muitos usuários ignoram porque presumem que os padrões de OCR funcionarão é toda a diferença entre o texto extraído utilizável e o ruído completo dos caracteres. Defina o sinalizador de idioma, execute o OCR, verifique a saída em um editor de texto bidirecional e o processo estará concluído. O OCR para scripts da direita para a esquerda recompensa o usuário que dedica tempo para configurar o parâmetro de idioma corretamente e verifica a saída em um editor de texto bidirecional, produzindo texto preciso e utilizável a partir de documentos que, de outra forma, permaneceriam inacessíveis para qualquer pessoa que não leia o idioma de origem.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
