Tips & Tricks

Como traduzir texto dentro de imagens incorporadas em um PDF

Uma ferramenta de tradução de PDF processa o fluxo de texto do documento, convertendo palavras de um idioma para outro. Ele lê os parágrafos, os títulos e as legendas. Mas não lê o texto que está dentro das imagens. Uma fotografia de um sinal, uma captura de tela de uma interface de usuário em um idioma diferente, um gráfico com rótulos de eixo renderizados como parte da imagem, todos eles contêm texto que as ferramentas de tradução padrão ignoram porque o texto não está no fluxo de texto do PDF. Ele está incorporado nos pixels da imagem. A tradução de texto dentro de imagens incorporadas requer a extração das imagens, a execução de OCR nelas, a tradução do texto reconhecido e, em seguida, a reincorporação das imagens traduzidas ou a adição da tradução como uma sobreposição. O fluxo de trabalho Translate PDF para texto incorporado em imagens é mais complexo do que a tradução de texto padrão, mas abrange conteúdo que, de outra forma, permaneceria sem tradução.

How to Translate Text Inside Embedded Images in a PDF

Identificando imagens que contêm texto traduzível

Nem todas as imagens em um PDF contêm texto que vale a pena traduzir. Uma fotografia decorativa, uma textura de fundo e um logotipo de empresa não podem conter conteúdo traduzível. Uma captura de tela de um aplicativo de software, um diagrama com componentes rotulados, uma fotografia de um documento ou sinal e um gráfico com rótulos de eixo incorporados contêm texto que um leitor no idioma de destino precisa entender. Digitalize o PDF e identifique cada imagem que contém texto. Sinalize essas imagens para o fluxo de trabalho de tradução.

As imagens que contêm texto no PDF se enquadram em duas categorias: aquelas em que o texto faz parte da imagem por design, como uma captura de tela ou um diagrama rotulado, e aquelas em que o texto aparece na imagem porque o documento foi digitalizado em vez de criado digitalmente. Um PDF digitalizado é uma imagem grande por página. Todo o texto de uma página digitalizada é incorporado à imagem da página. Um PDF criado digitalmente pode ter uma única captura de tela em uma página baseada em texto. As Imagens PDF que precisam de tradução são aquelas onde o texto aparece nos pixels da imagem e não no fluxo de texto do PDF.

WukongPDF

Experimente Traduzir PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Extraindo imagens e reconhecendo o texto

Extraia as imagens do PDF na maior resolução disponível. Use uma ferramenta de extração de imagens PDF que preserve a resolução original. Salve cada imagem extraída como um arquivo PNG para evitar a introdução de artefatos de compactação durante a etapa de extração. Abra cada imagem extraída e confirme se o texto está legível. Se a resolução da imagem for muito baixa para que o texto seja lido com clareza, extraia novamente com uma resolução mais alta, se possível, ou observe que esta imagem pode produzir resultados de OCR não confiáveis.

Execute o OCR em cada imagem extraída para reconhecer o texto. O mecanismo de OCR identifica as regiões de texto na imagem e exibe os caracteres reconhecidos junto com suas posições. Salve a saída do OCR para cada imagem, incluindo o texto reconhecido e as coordenadas da caixa delimitadora de cada região de texto. Esta informação será necessária posteriormente para colocar o texto traduzido na posição correta na imagem. WukongPDF lida com o processamento OCR PDF que pode reconhecer texto em imagens incorporadas como parte do fluxo de trabalho de conversão de documentos.

Traduzindo o texto reconhecido preservando o contexto

O texto reconhecido a partir de imagens é muitas vezes fragmentário. Um diagrama pode conter rótulos de uma única palavra. Uma captura de tela pode conter itens de menu e rótulos de botões sem contexto de frase. Este texto fragmentado é um desafio para os motores de tradução automática porque o contexto linguístico envolvente que elimina a ambiguidade do significado das palavras está ausente. Forneça o máximo de contexto possível. Se um rótulo for Arquivo e aparecer em uma captura de tela de um menu de software, observe na entrada de tradução que este é um item de menu, não um objeto físico.

Para imagens com múltiplas regiões de texto, mantenha o mapeamento entre cada região e sua tradução. Um diagrama com dez rótulos produz dez cadeias de texto separadas, cada uma necessitando de uma tradução. Mantenha o texto original, o texto traduzido e as coordenadas da caixa delimitadora juntos em um formato estruturado, como uma planilha. Este mapeamento é usado na etapa final para colocar o texto traduzido na imagem. Para que a saída Translate PDF seja útil, o texto traduzido deve aparecer no local correto da imagem, substituindo ou acompanhando o texto original.

Colocando o texto traduzido de volta nas imagens

Existem duas abordagens para colocar texto traduzido em imagens. A primeira abordagem substitui o texto original pela tradução. Abra a imagem em um editor de imagens. Para cada região de texto, apague o texto original preenchendo a região com a cor de fundo. Coloque o texto traduzido na mesma região usando uma fonte que corresponda o máximo possível ao estilo do original. Essa abordagem produz uma imagem traduzida limpa que se parece com o original, mas em um idioma diferente.

A segunda abordagem adiciona a tradução ao lado do texto original. Coloque o texto traduzido em cor contrastante abaixo ou ao lado do texto original. Esta abordagem preserva o original para leitores que entendem os dois idiomas e desejam comparar a tradução com a fonte. É mais rápido do que apagar e substituir, mas a imagem resultante é visualmente mais ocupada. Escolha a abordagem com base nas necessidades do público. Um manual de treinamento para operadores que apenas leem o idioma alvo se beneficia da substituição. Um documento de referência bilíngue se beneficia da apresentação lado a lado.

Reincorporando imagens traduzidas no PDF

Após as imagens terem sido processadas com texto traduzido, elas devem ser colocadas novamente no PDF. Substitua cada imagem original pela sua contraparte traduzida. A imagem de substituição deve caber no mesmo espaço da página que a original. Se a imagem traduzida tiver dimensões de pixels diferentes da original, dimensione-a para corresponder à caixa delimitadora original no PDF. O layout da página PDF não deve mudar. A única diferença visível deve ser o idioma do texto nas imagens.

Salve o PDF com as imagens traduzidas como uma nova versão, mantendo o PDF original não traduzido como referência. Verifique o PDF traduzido abrindo-o e verificando cada imagem. Confirme se o texto traduzido está legível, posicionado corretamente e livre de erros de OCR ou de tradução. Um Translate PDF com tradução de imagem incorporada estará completo quando cada elemento de texto no documento, no fluxo de texto e nas imagens, estiver acessível a um leitor no idioma de destino.

Quando escolher a tradução manual em vez da automatizada

Para imagens que contenham textos críticos, como avisos de segurança, avisos legais ou especificações técnicas, considere a tradução manual por um tradutor humano em vez da tradução automática. Um erro de OCR combinado com um erro de tradução automática pode alterar o significado de uma instrução de segurança de maneiras que têm consequências reais. O custo da tradução humana para um pequeno número de imagens críticas é pequeno comparado ao custo de uma tradução incorreta.

Para grandes lotes de imagens onde a tradução manual não é prática, implemente uma etapa de revisão. Após a tradução automática e a reincorporação, peça a um revisor humano que leia o idioma de destino para verificar a precisão de uma amostra das imagens traduzidas. Se a amostra revelar erros sistêmicos, ajuste as configurações de OCR ou os parâmetros do mecanismo de tradução e processe novamente o lote.

A tradução de texto em imagens incorporadas é muitas vezes o último passo para tornar um PDF totalmente acessível a um público internacional. O corpo do texto, títulos e legendas foram traduzidos. As imagens permanecem como o conteúdo final não traduzido. A conclusão desta etapa produz um documento onde cada trecho de texto, em todos os meios, está disponível no idioma de destino.

Para documentos atualizados frequentemente com imagens incorporadas, considere se o texto da imagem pode ser movido para o fluxo de texto PDF durante o processo de criação do documento. Um diagrama com rótulos armazenados como sobreposições de texto, em vez de como parte da imagem, pode ser traduzido usando ferramentas de tradução de texto padrão, evitando totalmente o fluxo de trabalho extrair-OCR-traduzir-reembutir.

A qualidade da imagem traduzida final depende da qualidade de cada etapa do pipeline. Uma extração de imagem de alta resolução produz uma entrada de OCR nítida. OCR preciso produz texto correto para tradução. Um bom mecanismo de tradução preserva o significado. A reincorporação cuidadosa mantém a qualidade visual. Cada etapa depende da anterior.

O fluxo de trabalho Translate PDF para texto incorporado em imagem é o cenário de tradução mais trabalhoso porque combina processamento de imagem, OCR, tradução e reintegração em um único pipeline. Automatizar o máximo de etapas possível reduz o esforço manual.

Para imagens que aparecem de forma idêntica em vários PDFs, como o logotipo de uma empresa com um slogan ou um diagrama padrão, traduza a imagem uma vez e reutilize-a. A imagem traduzida pode ser substituída em qualquer PDF onde a imagem original apareça.

Este artigo aborda as principais técnicas e considerações para trabalhar com PDFs neste cenário específico. Os métodos descritos aqui se aplicam a diferentes ferramentas e plataformas, dando aos leitores a flexibilidade de escolher a abordagem que melhor se adapta ao seu fluxo de trabalho e ambiente técnico.

As etapas práticas descritas fornecem um caminho claro desde o desafio inicial até uma solução funcional. Cada técnica foi selecionada por sua confiabilidade e acessibilidade, garantindo que os leitores possam obter resultados consistentes, independentemente de sua experiência anterior com ferramentas PDF.

WukongPDF e plataformas semelhantes fornecem ferramentas de OCR e processamento de documentos que suportam o fluxo de trabalho de tradução de texto de imagem descrito neste artigo. A combinação dessas ferramentas permite uma cobertura abrangente da tradução.

WukongPDF

Experimente Traduzir PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →