Tips & Tricks

Como fazer OCR de um documento PDF escrito em um idioma que você não fala

Receber um PDF digitalizado escrito em um idioma que você não fala é mais comum do que nunca em negócios globais, pesquisas acadêmicas e revisão de documentos jurídicos. Você precisa extrair o texto, traduzi-lo e entender o que diz o documento. O desafio não é apenas executar o OCR no arquivo. Ele está executando o OCR com as configurações de idioma corretas para que o texto extraído seja preciso o suficiente para ser traduzido. Selecionar o idioma errado durante o processamento OCR PDF produz resultados distorcidos que nenhum mecanismo de tradução pode recuperar.

Os mecanismos de OCR não veem letras. Eles veem formas e comparam essas formas com padrões de caracteres de um idioma específico. Se você informar ao mecanismo de OCR que o documento está em inglês, mas na verdade está em russo, o mecanismo mapeia as formas cirílicas para os caracteres latinos mais próximos que conhece. O resultado é uma sequência de letras de aparência aleatória que não tem nenhuma relação com o texto original. Acertar a configuração do idioma ou usar a detecção automática quando disponível é a decisão mais importante em todo o pipeline de OCR para tradução.

As ferramentas PDF to Text e OCR do WukongPDF extraem texto de documentos digitalizados para tradução e análise. Combinar a seleção correta do idioma de OCR com um serviço de tradução confiável transforma uma digitalização ilegível em um idioma estrangeiro em um documento compreensível em menos de cinco minutos.

How to OCR a PDF Document Written in a Language You Don't Speak

Etapa 1: Identificar o idioma do documento

Antes de tocar em qualquer software de OCR, identifique com certeza o idioma do documento. Se os metadados do documento ou o nome do arquivo sugerirem o idioma, comece por aí. Caso contrário, abra o PDF e veja algumas páginas. Mesmo sem ler o texto, as dicas visuais restringem significativamente as possibilidades. As famílias de escrita são distintas: a escrita latina serve a maioria das línguas europeias. O cirílico é usado para russo, ucraniano, búlgaro e sérvio. A escrita árabe abrange árabe, persa e urdu. CJK cobre chinês, japonês e coreano. Devanagari abrange Hindi, Marathi e Nepalês.

Se você não conseguir identificar visualmente nem mesmo a família de scripts, faça uma captura de tela de um parágrafo representativo e carregue-o no recurso de tradução de imagens do Google Tradutor ou em uma pesquisa reversa de imagens. Essas ferramentas identificam tanto o script quanto o idioma específico na maioria dos casos. Saber que o documento é tailandês em vez de laosiano, ou coreano em vez de japonês, faz a diferença entre uma saída de OCR precisa e ruído de caracteres inútil.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Etapa 2: Selecione uma ferramenta de OCR compatível com o idioma de destino

Nem todas as ferramentas de OCR suportam todos os idiomas. O Adobe Acrobat Pro vem com mecanismos de OCR para cerca de 40 idiomas. Sua ferramenta Reconhecer Texto inclui um menu suspenso de seleção de idioma na caixa de diálogo de configurações. Tesseract, o mecanismo de OCR de código aberto gratuito mantido pelo Google, oferece suporte a mais de 100 idiomas por meio de arquivos de dados de idiomas para download. A API Google Cloud Vision tem a mais ampla cobertura de idiomas em mais de 200 idiomas e inclui detecção automática de idioma como um recurso opcional.

Para um documento em um único idioma que você possa identificar, qualquer uma dessas ferramentas funciona, desde que você especifique o idioma correto antes de executar o OCR. Para um documento que contém vários idiomas, como um contrato bilíngue com cláusulas em inglês e francês, você precisa de uma ferramenta que suporte vários idiomas simultâneos ou que possa detectar automaticamente por parágrafo. O Google Cloud Vision e o Tesseract com os pacotes de dados de idioma apropriados lidam com documentos multilíngues, embora a precisão nos limites da mudança de idioma nunca seja perfeita.

Etapa 3: Configurar e executar o OCR com o idioma correto

No Adobe Acrobat Pro, abra o PDF digitalizado, vá para Ferramentas, Digitalizar e OCR e selecione Reconhecer texto e Neste arquivo. Clique no botão Editar próximo ao seletor de idioma. Na caixa de diálogo Reconhecer texto, escolha o idioma principal correto no menu suspenso. Se o documento contiver um segundo idioma, clique no botão Adicionar idioma e selecione-o também. O Acrobat processa os dois idiomas simultaneamente. Clique em OK e em Reconhecer texto. O Acrobat executa a passagem de OCR e incorpora o texto reconhecido como uma camada invisível atrás da imagem digitalizada. O documento agora pode ser pesquisado.

No Tesseract, a invocação da linha de comando especifica o idioma com o sinalizador -l: tesseract input.pdf output -l rus para russo, tesseract input.pdf output -l jpn para japonês ou tesseract input.pdf output -l fra+eng para um documento bilíngue francês-inglês. Instale primeiro os arquivos de dados de idioma necessários; O Tesseract é fornecido apenas com inglês por padrão. Para o Google Cloud Vision, a chamada de API inclui um parâmetro languageHints que aceita uma matriz de códigos de idioma BCP-47. O Cloud Vision também oferece um modo de detecção automática de idioma que não requer nenhuma dica de idioma, tornando-o a opção mais simples quando você realmente não conhece o idioma do documento.

Etapa 4: Copie o texto extraído e traduza

Após a conclusão do OCR, verifique a qualidade do texto antes de enviá-lo para tradução. No Acrobat, abra a ferramenta Localizar e pesquise uma palavra comum que você reconheça no documento. Se a pesquisa encontrar correspondências, o OCR funcionou. Selecione um parágrafo do texto extraído, copie-o e cole-o em um editor de texto simples. Procure erros óbvios de OCR: símbolos repetidos, palavras quebradas no meio ou grandes blocos de caracteres não reconhecidos. Se mais de 5% do texto parecer corrompido, execute novamente o OCR com uma configuração de idioma diferente ou com uma configuração de resolução mais alta.

Depois que o texto extraído passar por uma verificação de integridade visual, copie o texto inteiro e cole-o em uma ferramenta de tradução. Google Translate, DeepL ou Microsoft Translator aceitam entrada de texto simples. Para documentos mais longos, o DeepL e o Google Translate suportam o upload direto de arquivos de PDFs pesquisáveis, o que ignora a etapa de cópia manual. O resultado da tradução é bom o suficiente para compreensão, pesquisa e uso comercial interno. Para precisão jurídica, médica ou de publicação, envie o PDF pesquisável para um tradutor humano profissional, que usará a camada de OCR como ponto de partida e corrigirá a tradução automática em relação às páginas digitalizadas originais.

Tratamento de documentos com scripts mistos ou fontes fora do padrão

Documentos que misturam escritas, como um artigo de pesquisa em árabe que inclui termos técnicos em inglês em escrita latina, confundem mecanismos de OCR que esperam uma única escrita. Configure primeiro o OCR para o script dominante e, em seguida, execute uma segunda passagem visando o script minoritário no mesmo documento. Mescle os resultados exportando ambas as camadas de OCR e combinando-as em um editor de texto. A precisão nas passagens do script minoritário será menor porque o mecanismo é otimizado para o script primário.

Fontes não padrão, incluindo fontes decorativas, fontes antigas de máquinas de escrever e fontes cursivas semelhantes a escritas à mão, reduzem a precisão do OCR mesmo com o idioma correto selecionado. Pré-processe esses documentos convertendo as páginas PDF em imagens de alta resolução a 400 DPI ou superior, aplicando um filtro de nitidez e aumentando o contraste antes de alimentá-los no mecanismo de OCR. O pré-processamento integrado do Tesseract, habilitado com --psm 3 para segmentação automática de páginas, lida com variações moderadas de fonte. Para texto muito degradado ou estilizado, a API Google Cloud Vision geralmente supera os mecanismos de OCR locais porque seus modelos foram treinados em um corpus maior de amostras de fontes do mundo real.

Ferramenta OCRSuporte multilíngueDetecção automáticaMelhor para
Adobe Acrobat ProMais de 40 idiomasSeleção manualDocumentos profissionais, alta precisão
Tesseract (código aberto)Mais de 100 idiomasSeleção manual necessáriaProcessamento em lote, script, gratuito
Visão da nuvem do GoogleMais de 200 idiomasDetecção automática disponívelIntegração de API, scripts mistos
Serviços de OCR on-line10-50 idiomasSeleção manualOCR rápido de documento único

Verificar a precisão antes de agir no conteúdo traduzido

OCR seguido de tradução automática introduz duas camadas de erros potenciais: reconhecimento incorreto de OCR e ambiguidade de tradução. Para documentos críticos, verifique o resultado pedindo a um colega bilíngue ou a um tradutor profissional para comparar um parágrafo da tradução selecionado aleatoriamente com o PDF original. Uma verificação de cinco minutos detecta falhas catastróficas, como uma configuração de idioma errada que produziu um texto de aparência plausível, mas totalmente incorreto.

Se você lida regularmente com PDFs digitalizados em idiomas estrangeiros, crie uma lista de verificação: identifique o idioma, selecione o mecanismo de OCR correspondente, execute o OCR com o parâmetro de idioma correto, verifique o texto extraído quanto à precisão dos caracteres, traduza e verifique um exemplo de parágrafo. Depois de dois ou três documentos, o fluxo de trabalho se torna rotineiro e leva menos de cinco minutos desde a abertura do arquivo até a leitura do resultado traduzido.

Quando se trata de processamento de documentos, para documentos sensíveis à segurança, o OCR off-line evita totalmente a exposição na nuvem. O Tesseract é executado localmente sem solicitações de rede após o download dos arquivos de dados de idioma uma vez. O Adobe Acrobat Pro também executa OCR localmente por meio do recurso Reconhecer texto, sem fazer login na Document Cloud. Para materiais confidenciais em idiomas estrangeiros, como descobertas jurídicas ou correspondência comercial confidencial, o OCR local combinado com a revisão de texto off-line mantém o conteúdo original do documento em seu ambiente controlado.

Quando o OCR por si só não é suficiente: serviços de transcrição assistida

Para documentos onde a precisão do OCR é inutilizável devido à extrema degradação da fonte, texto manuscrito ou scripts muito mistos, os serviços de transcrição assistida fornecem resultados verificados por humanos. Esses serviços combinam uma passagem inicial de OCR por máquina com revisão e correção humana, normalmente cobrando por página. O retorno varia de algumas horas a alguns dias. Para um único documento crítico cuja precisão não é negociável, como uma certidão de nascimento em língua estrangeira ou um pedido de patente, o custo da transcrição humana é justificado pelo risco de agir sobre um texto reconhecido incorretamente. Execute o OCR da máquina primeiro para avaliar a qualidade. Se mais de 15% das palavras não forem reconhecidas ou estiverem obviamente erradas, passe para a transcrição assistida em vez de gastar horas corrigindo manualmente os resultados da máquina.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →