Others

O que acontece com símbolos e fontes durante a tradução de PDF

Quando você executa um PDF por meio de uma ferramenta de tradução, o documento resultante geralmente apresenta problemas de formatação que vão além de simples mudanças de layout. Caracteres especiais como símbolos matemáticos, símbolos de moeda e letras acentuadas podem ser substituídos por caixas vazias, pontos de interrogação ou caracteres completamente errados. As fontes incorporadas podem parar de renderizar, fazendo com que seções inteiras do texto desapareçam ou sejam exibidas em uma fonte padrão do sistema. Compreender o que acontece com os símbolos e Fontes PDF durante a tradução ajuda você a antecipar esses problemas e a escolher a abordagem de tradução correta para documentos onde a precisão dos símbolos é importante.

Principais conclusões

As ferramentas de tradução de PDF funcionam extraindo a camada de texto do documento, executando-o através de um mecanismo de tradução automática e colocando o texto traduzido de volta no layout original. Símbolos e caracteres especiais estão em risco durante todas as etapas deste pipeline: a extração pode interpretar mal a codificação de símbolos, o mecanismo de tradução pode remover ou corromper caracteres não alfabéticos e a reinserção pode encontrar problemas de substituição de fontes quando o idioma de destino usa caracteres não presentes nas fontes incorporadas do documento original.

What Happens to Symbols and Fonts During PDF Translation

Como a tradução de PDF lida com a etapa de extração de texto

Antes que qualquer tradução possa acontecer, a ferramenta deve extrair o texto legível do PDF. Para um PDF digital nativo com texto incorporado, esta extração lê os códigos de caracteres dos fluxos de conteúdo do documento e os mapeia para valores Unicode usando a tabela de codificação da fonte incorporada. Símbolos e caracteres especiais tornam-se problemáticos neste estágio quando a tabela de codificação está incompleta, danificada ou usa um mapeamento personalizado que não segue as convenções Unicode. Um PDF criado por software mais antigo pode usar uma codificação não padrão, onde o que parece ser um sinal de euro na tela é armazenado internamente como um código de caracteres que não corresponde a nada nas tabelas Unicode padrão.

Quando o mapeamento de codificação falha, o processo de extração produz caracteres de substituição, normalmente o caractere de substituição Unicode ou um ponto de interrogação. Essa falha acontece silenciosamente. O texto extraído parece normal à primeira vista porque as letras e números ao redor do símbolo estão corretos, mas o símbolo da moeda, o operador matemático ou a letra acentuada que era fundamental para o significado do documento foi perdido antes mesmo de a tradução começar. Uma fase de extração que não consiga resolver o sinal do euro num PDF financeiro transforma "Total: 2.500 euros" em "Total: 2.500" ou "Total: 2.500 ?" e a saída traduzida herdará esse erro.

WukongPDF

Experimente Traduzir PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

O que o mecanismo de tradução faz com símbolos e caracteres especiais

Os mecanismos de tradução automática são otimizados para texto em linguagem natural. Quando encontram uma frase contendo uma mistura de palavras e símbolos, como uma especificação técnica ou uma demonstração financeira, o tratamento do símbolo depende do mecanismo específico e do par de idiomas. A maioria dos sistemas modernos de tradução automática neural passará por símbolos que eles reconhecem como não linguísticos, como sinais de moeda, pontos percentuais e operadores matemáticos comuns. Mas símbolos menos comuns, como o sinal de seção usado em documentos legais, o símbolo de grau em textos científicos ou notação especializada de um determinado setor, podem ser eliminados ou substituídos pela etapa de normalização de texto do mecanismo de tradução.

A etapa de normalização, que ocorre antes da tradução propriamente dita, converte o texto de entrada em um formato padronizado. Ele pode colocar o texto em minúsculas, retirar a pontuação que considera não essencial e normalizar os caracteres Unicode para suas formas canônicas. Para a maioria dos documentos, isso é útil. Impede que o mecanismo de tradução trate "Olá" e "olá" como palavras diferentes. Mas para documentos onde símbolos específicos têm significado, a normalização pode ser prejudicial. Uma fórmula química que utiliza números subscritos, um conjunto de coordenadas GPS com símbolos de graus e minutos ou uma citação legal com marcas de seção podem ser alterados pela normalização de maneiras que alteram seu significado ou os tornam ilegíveis.

Substituição de fonte: por que o texto traduzido geralmente parece diferente

O impacto visual da substituição de fontes varia de sutil a severo. Quando uma fonte latina substitui outra fonte latina, a largura dos caracteres muda ligeiramente, mas o texto permanece legível. Quando uma fonte latina substitui um sistema de escrita não latino, o resultado normalmente é uma linha de retângulos vazios ou pontos de interrogação porque a fonte latina não contém nenhum dos caracteres necessários. É por isso que a tradução para os idiomas árabe, chinês, japonês, coreano ou cirílico requer atenção especial à disponibilidade de fontes durante a fase de reinserção.

Após a tradução, o novo texto deve ser colocado novamente no PDF. As fontes incorporadas do documento original contêm apenas os caracteres que estavam presentes no texto original. Quando o texto traduzido contém caracteres que não estavam no original, como caracteres acentuados em traduções em francês ou espanhol de um documento em inglês, as fontes incorporadas originais não podem renderizá-los. O visualizador de PDF recorre a uma fonte de substituição, que quase certamente terá uma aparência diferente do texto ao redor. O resultado é um documento onde a maior parte do texto aparece na fonte original, mas ocasionalmente palavras traduzidas ou caracteres acentuados aparecem em uma fonte visivelmente diferente, dando à página uma aparência irregular e pouco profissional.

Este problema é mais grave ao traduzir para idiomas que utilizam sistemas de escrita totalmente diferentes. A tradução de um PDF em inglês para russo, árabe, chinês ou japonês requer caracteres que nenhuma fonte de escrita latina contém. Todo o texto traduzido deve ser renderizado com uma fonte de substituição, e o caráter visual do documento muda completamente. A geometria do layout que funcionou para o texto original, com suas larguras de caracteres e alturas de linha específicas, não caberá no texto traduzido. As quebras de linha se movem, os parágrafos aumentam ou diminuem e os elementos que foram cuidadosamente alinhados ficam desalinhados.

Escolhendo uma abordagem de tradução com base na sensibilidade do símbolo

Uma verificação prática antes da tradução é abrir o PDF e copiar um parágrafo que contenha caracteres especiais em um editor de texto simples. Se os caracteres especiais sobreviverem intactos à operação de copiar e colar, a codificação do texto do PDF será padrão e é improvável que o estágio de extração da tradução os corrompa. Se os caracteres ficarem ilegíveis ou desaparecerem ao serem colados, o PDF usará uma codificação não padrão que causará problemas durante a tradução. Corrigir a codificação na origem, como recriar o PDF com a incorporação de fontes habilitada, é mais eficaz do que tentar recuperar caracteres corrompidos após a tradução.

Para documentos onde os símbolos são críticos, como relatórios financeiros, artigos científicos, registros legais e manuais técnicos, a abordagem mais segura é usar um

Para documentos que estão sendo traduzidos para um sistema de escrita diferente, aceite que o resultado será diferente do original e planeje adequadamente. Em vez de esperar uma correspondência de layout perfeita, concentre-se na produção de um documento limpo e legível no idioma de destino. Após a tradução, orçamento de tempo para ajuste de layout manual ou semiautomático. Ajuste as larguras das colunas, realinhe as tabelas e verifique se todos os caracteres especiais foram renderizados corretamente. O tempo extra gasto na formatação pós-tradução é o custo de trabalhar em sistemas de escrita, e ferramentas que prometem tradução perfeita entre scripts, sem qualquer trabalho de layout, estão simplificando demais um problema genuinamente difícil. A ferramenta de tradução WukongPDF preserva os dados das fontes incorporadas durante todo o processo de conversão, minimizando a corrupção de símbolos que ocorre quando as fontes são substituídas durante a reinserção do texto.

Perguntas Frequentes

Devo traduzir um PDF diretamente ou primeiro convertê-lo para um formato editável, traduzi-lo e reexportá-lo para PDF? A abordagem em duas etapas, converter para Word, traduzir o documento do Word e exportar de volta para PDF, geralmente produz melhor fidelidade de símbolos porque o Word lida com Unicode de forma mais consistente do que a extração de texto PDF bruto. O custo é que a viagem de ida e volta pelo Word introduz alterações de layout que devem ser corrigidas manualmente. Para documentos curtos, o método de duas etapas compensa o esforço de layout. Para documentos muito longos, a tradução direta de PDF com uma ferramenta que preserva a codificação é mais prática.

Posso traduzir um PDF extraindo o texto, traduzindo-o externamente e colocando-o manualmente de volta no layout do PDF? Sim, esse pipeline manual oferece controle total sobre o manuseio de símbolos e seleção de fontes em todas as etapas, mas é demorado e prático apenas para documentos curtos. Para um manual técnico de 50 páginas, a reinserção manual não é viável. A decisão entre tradução automática e manual é, em última análise, uma decisão sobre quanto controle você precisa sobre o resultado e quanto tempo pode investir.

Posso evitar a perda de símbolos convertendo o PDF para Word antes de traduzir?

A conversão para Word primeiro dá à ferramenta de tradução acesso ao texto por meio do tratamento Unicode do Microsoft Word, que geralmente é mais confiável do que a extração de texto bruto em PDF. Essa etapa extra geralmente resolve a perda de símbolos relacionada à codificação, especialmente para documentos criados por software moderno que já usa a codificação Unicode padrão. A desvantagem é que a própria conversão do Word pode introduzir alterações de layout. Para documentos com muitos símbolos, a precisão aprimorada dos caracteres geralmente justifica o trabalho de layout.

Por que as equações matemáticas frequentemente quebram durante a tradução de PDF?

As equações matemáticas em PDFs são normalmente armazenadas como uma mistura de caracteres de texto para variáveis e números, além de símbolos matemáticos especiais de uma fonte matemática dedicada, além de barras de frações desenhadas por vetores, sinais radicais e outros elementos de notação. Quando o mecanismo de tradução processa a camada de texto, ele trata a equação como uma frase e pode reorganizar ou normalizar a sequência de símbolos. Os elementos desenhados por vetores não são texto e passam pela tradução sem serem tocados, mas seu alinhamento em relação ao texto traduzido é quase sempre quebrado. Para documentos com conteúdo matemático pesado, a abordagem mais confiável é excluir equações da tradução e traduzir apenas a prosa circundante.

Existe algum formato PDF que processe a tradução Formato PDF melhor que outros?

PDF/A com fontes Unicode totalmente incorporadas traduz de forma mais confiável do que PDFs padrão com fontes de subconjunto e codificações personalizadas. A incorporação completa e o requisito Unicode no PDF/A eliminam as duas fontes mais comuns de corrupção de símbolos durante a tradução: glifos de fonte ausentes e mapeamentos de caracteres não padrão. Se você sabe que um documento será traduzido, salvá-lo como PDF/A antes de executar a tradução é uma etapa que vale a pena.

WukongPDF

Experimente Traduzir PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →