Você digitaliza um menu bilíngue. Os nomes dos pratos estão em italiano. As descrições estão em inglês. Os preços são números independentes do idioma. Você precisa extrair apenas o texto em italiano para criar uma lista de palavras em italiano ou apenas o texto em inglês para enviar a um tradutor para outro par de idiomas. A execução do OCR em todo o documento produz uma mistura dos dois idiomas, o que é adequado para pesquisa, mas não para extração seletiva.
Extrair texto em apenas um idioma de um documento OCR PDF multilíngue requer um mecanismo de OCR que possa identificar em qual idioma cada bloco de texto está escrito e extrair apenas os blocos que correspondem ao seu idioma de destino. Esta é uma operação mais seletiva do que o OCR padrão, que reconhece todo o texto, independentemente do idioma.

Como funciona o OCR seletivo de idioma
Os mecanismos de OCR com suporte a vários idiomas podem ser configurados para reconhecer texto em vários idiomas simultaneamente. Quando você especifica "italiano e inglês" como os idiomas OCR, o mecanismo reconhece texto em ambos. Ele também marca cada bloco de texto reconhecido com o idioma em que foi reconhecido. Um bloco de texto em italiano é marcado como italiano. Um bloco de texto em inglês é marcado como inglês. A marcação de idioma permite a extração seletiva.
Após o OCR, você pode filtrar o texto reconhecido por tag de idioma. Exporte apenas os blocos marcados como italianos. A saída é um documento contendo apenas o texto em italiano do menu. As descrições em inglês, reconhecidas mas filtradas, não aparecem na saída. Essa extração seletiva é útil para fluxos de trabalho de tradução, materiais de aprendizagem de idiomas e análise de conteúdo onde você precisa de texto em um idioma específico isolado do texto adjacente em outros idiomas.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
Passo a passo: extraindo texto em um idioma específico
Carregue o PDF digitalizado para a ferramenta OCR de WukongPDF. Selecione os idiomas presentes no documento. Para o menu Italiano-Inglês, selecione Italiano e Inglês. Execute o OCR. A ferramenta reconhece todo o texto e marca cada bloco por idioma. Após a conclusão do OCR, use o filtro de idioma para selecionar italiano. Exporte o texto filtrado como um arquivo de texto simples, um documento do Word ou um novo PDF contendo apenas os blocos italianos.
A precisão da detecção de idiomas depende da distinção dos idiomas. Italiano e inglês usam o mesmo alfabeto, mas têm padrões de palavras diferentes. O mecanismo de OCR os distingue analisando as frequências das palavras. O italiano tem muitas palavras terminadas em vogais. O inglês tem muitas palavras terminadas em consoantes. Quanto mais distintos os idiomas, mais precisa será a marcação do idioma. Dois idiomas intimamente relacionados, como espanhol e português, podem ser confundidos pelo mecanismo em blocos de texto curtos.
Tratamento de texto em idiomas mistos na mesma linha
Alguns documentos misturam idiomas em uma única linha, como um livro didático de idiomas que combina uma frase em francês com sua tradução em inglês na mesma linha. O mecanismo de OCR pode classificar a linha inteira como o idioma dominante, marcando incorretamente as palavras do idioma minoritário. Para estes documentos, a extração seletiva de idioma no nível do bloco não é suficientemente precisa. Você precisa de uma abordagem diferente.
A alternativa é executar o OCR duas vezes, uma vez com cada idioma como único idioma de reconhecimento. O passe OCR somente em italiano reconhece bem o texto em italiano, mas confunde o texto em inglês. O passe somente em inglês reconhece bem o inglês, mas confunde o italiano. Compare as duas saídas e selecione manualmente a versão correta para cada segmento de texto. Essa abordagem de passagem dupla leva mais tempo, mas produz a extração específica do idioma mais precisa para documentos onde os idiomas são intercalados no nível da frase.
Verificando e limpando o texto extraído
Após extrair o texto no idioma de destino, verifique se a filtragem do idioma foi precisa. Digitalize o texto extraído em busca de palavras que estejam claramente no idioma errado. Uma extração de texto em italiano de um menu não deve conter palavras em inglês como "grilled" ou "servido com" a menos que o menu tenha usado intencionalmente essas palavras nas descrições italianas. O texto filtrado que contém palavras estrangeiras inesperadas indica erros de marcação de idioma que precisam de correção manual.
Execute uma verificação ortográfica no idioma de destino. A verificação ortográfica do italiano sinalizará palavras em inglês que foram incluídas incorretamente na extração do italiano. Os sinalizadores de verificação ortográfica são uma maneira eficiente de encontrar erros de marcação de idioma sem ler cada palavra extraída. Os Extrair dados PDF que foram filtrados por idioma e verificados ortograficamente estão prontos para tradução, análise ou arquivamento. O PDF digitalizado OCR de WukongPDF com filtragem de idioma produz extratos de idioma único mais limpos do que a saída de OCR de idioma misto pós-processamento para remover o idioma indesejado.
Uma aplicação prática para OCR seletivo de idioma: criação de glossários bilíngues a partir de documentos traduzidos. Extraia todos os termos do idioma de origem e todos os termos do idioma de destino separadamente. Alinhe-os por suas posições na página, pois cada termo de origem possui um termo de destino correspondente aproximadamente na mesma posição vertical na página ou em uma coluna adjacente. O resultado alinhado torna-se uma lista de termos que os tradutores podem usar para garantir consistência em traduções futuras. Esta técnica de construção de glossário é amplamente utilizada na tradução técnica, onde a terminologia consistente é crítica.
Para documentos onde os idiomas estão em colunas separadas, como um contrato bilíngue de duas colunas, a extração seletiva de idioma torna-se uma tarefa de seleção de colunas. A coluna da esquerda é um idioma, a coluna da direita é outro. Em vez de confiar na detecção de idioma, que pode confundir idiomas semelhantes, corte o PDF para extrair cada coluna separadamente. Execute OCR de idioma único em cada coluna. Essa abordagem de corte de colunas é mais confiável do que a filtragem de idioma para documentos com separação clara de idiomas em colunas.
Para projetos de arquivo que envolvem documentos históricos multilíngues, o OCR seletivo de idioma combinado com a marcação de metadados cria um arquivo pesquisável onde os pesquisadores podem encontrar conteúdo em um idioma específico em milhares de documentos. A saída de OCR de cada documento é marcada com os idiomas detectados. Um pesquisador que procura documentos franceses do século XVIII pode filtrar apenas textos em francês em uma coleção multilíngue. Esta abordagem seletiva transforma o OCR de arquivo de uma ferramenta contundente que mistura idiomas em um instrumento de precisão para pesquisa linguística.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
