Um PDF marcado contém metadados de acessibilidade ocultos que os leitores de tela usam para descrever imagens, tabelas e estrutura de documentos para usuários com deficiência visual. O texto visível na página pode estar em inglês, enquanto as descrições do texto alternativo, resumos de tabelas e rótulos estruturais precisam estar disponíveis em vários idiomas para um público internacional. Traduzir apenas essa camada oculta sem tocar no conteúdo visível do documento requer trabalhar diretamente com a estrutura de tags do PDF, um recurso que falta à maioria das ferramentas de tradução de uso geral.
O padrão PDF/UA (Acessibilidade Universal, ISO 14289) exige que os PDFs marcados forneçam texto alternativo para todos os elementos de conteúdo não textual. Numa organização multilingue, um contrato escrito em francês pode necessitar do seu texto alternativo disponível em inglês, alemão e holandês para que os revisores de acessibilidade em cada país possam verificar a conformidade. Traduzir todo o documento seria desnecessário e caro. Apenas algumas centenas de palavras de texto alternativo e rótulos estruturais precisam de atenção. Esta tarefa se enquadra em uma categoria restrita que fica entre o documento completo Traduzir PDF e a edição manual de acessibilidade, e poucas organizações estabeleceram um fluxo de trabalho padrão para isso.
As consequências dos metadados de acessibilidade não traduzidos são mais significativas do que podem parecer. Um usuário de leitor de tela que acessa um contrato em francês apenas com texto alternativo em inglês ouvirá descrições em inglês interrompendo o conteúdo em francês, criando uma experiência confusa e desorientadora. Para agências governamentais e organizações com financiamento público sujeitas a regulamentos de acessibilidade, isto representa uma lacuna de conformidade que pode ter consequências jurídicas. Traduzir a camada de acessibilidade não é algo interessante para organizações multilíngues. Faz parte do cumprimento das obrigações de acessibilidade em todos os idiomas que a organização atende.

Compreendendo a estrutura da tag PDF e onde reside o texto alternativo
Um PDF marcado organiza seu conteúdo em uma estrutura lógica em árvore, com elementos como Documento, Parte, Seita, P, Tabela, Figura e Fórmula. Cada elemento pode ter atributos, e o elemento crítico para tradução é a entrada /Alt, que armazena a descrição do texto alternativo. Um elemento Figura que representa um gráfico pode ter uma entrada /Alt contendo “Gráfico de barras mostrando o crescimento da receita trimestral do primeiro trimestre de 2022 ao quarto trimestre de 2024, com aumento de 12% ano a ano”. Este texto nunca é exibido na página visível. Ele existe apenas na estrutura de tags para consumo do leitor de tela.
A entrada /Alt é uma string de texto armazenada como um objeto de string PDF ou uma string com escape XML dentro do conteúdo marcado do documento. Extraí-lo, traduzi-lo e gravá-lo sem perturbar a estrutura de tags circundante requer uma ferramenta que possa analisar o conteúdo PDF marcado no nível do objeto. A maioria dos editores de PDF que exibem uma árvore de tags em seu painel de acessibilidade pode editar entradas /Alt individuais, mas traduzir dezenas ou centenas delas manualmente é lento e sujeito a erros, com cada entrada exigindo um ciclo separado de abrir, editar e salvar.
Além das entradas /Alt, existem outros elementos de acessibilidade traduzíveis. O atributo /Summary nos elementos Table fornece uma visão geral do texto da estrutura e da finalidade da tabela. A entrada /ActualText nos elementos Span pode substituir o texto visual para leitores de tela, útil quando o texto visual é uma abreviatura que deve ser expandida. As descrições dos campos do formulário armazenadas na entrada /TU (dica) também precisam de tradução. Uma tradução completa de acessibilidade abrange todos esses elementos. Para um contrato de 50 páginas com 30 figuras, 15 tabelas e 40 campos de formulário, o texto total de acessibilidade traduzível pode ser de 2.000 a 3.000 palavras, o suficiente para um tradutor passar parte de um dia, mas muito menos do que traduzir o texto completo do documento.
Experimente Traduzir PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
Extração de texto de acessibilidade para tradução
O primeiro passo é inventariar o que precisa de tradução. Use um verificador de acessibilidade de PDF ou visualizador de tags para exportar uma lista de todas as entradas /Alt, /Summary, /ActualText e /TU no documento. A maioria das ferramentas de validação de acessibilidade, incluindo o verificador de acessibilidade integrado no Adobe Acrobat Pro, pode produzir um relatório mostrando cada elemento de tag com esses atributos e seus valores de texto atuais. Exporte esta lista para um formato estruturado como CSV, com colunas para tipo de tag, identificador de elemento, texto original e uma coluna de tradução em branco.
Envie as sequências de texto originais para um tradutor ou serviço de tradução automática. O formato estruturado garante que cada string traduzida permaneça associada ao seu elemento de origem, o que é essencial para gravar as traduções nos locais corretos. Para conformidade com PDF Accessibility, as traduções devem atender aos mesmos padrões de qualidade do texto alternativo original. Uma boa descrição de texto alternativo é concisa, normalmente com menos de 150 caracteres, e descreve o conteúdo e a função do elemento, e não sua aparência. A tradução deve preservar esta concisão e foco funcional.
WukongPDF suporta a edição de Tags de PDF e atributos de acessibilidade no nível de elemento individual, tornando prático atualizar traduções de texto alternativo sem afetar o conteúdo visível da página. O editor de tags estruturadas exibe a hierarquia completa dos elementos com todos os atributos traduzíveis, e o recurso de atualização em lote permite importar traduções de um arquivo CSV e aplicá-las aos elementos corretos em uma única operação.
Escrevendo as traduções de volta na estrutura da tag
Depois de receber as traduções, a etapa de write-back requer uma ferramenta que possa navegar na árvore de tags do PDF e atualizar valores de atributos individuais. Abra o PDF em um editor de tags que mostre a árvore completa da estrutura. Para cada elemento que foi traduzido, localize o elemento na árvore, selecione seu /Alt ou outro atributo e cole o texto traduzido. Salve o arquivo quando todas as entradas forem atualizadas. Verifique o resultado usando um leitor de tela ou uma ferramenta de validação de acessibilidade. Navegue pelo documento com o leitor de tela ativo e confirme se cada descrição traduzida é lida no idioma esperado.
Para documentos que serão distribuídos em vários idiomas, considere se o PDF deve conter todas as versões de idioma do texto alternativo em um único arquivo ou se PDFs separados para cada idioma devem ser criados. A especificação PDF oferece suporte à marcação de idioma no nível do elemento, portanto, um único arquivo pode, teoricamente, conter texto alternativo em inglês na Figura 1 e texto alternativo em francês na Figura 2. No entanto, o suporte do leitor de tela para troca de idioma por elemento é inconsistente em diferentes aplicativos de leitor de tela. Se a conformidade com a acessibilidade for um requisito, PDFs separados por idioma são a escolha mais segura e testável de forma mais confiável.
Automatizando o fluxo de trabalho para grandes conjuntos de documentos
Para organizações que precisam localizar metadados de acessibilidade em centenas ou milhares de PDFs, a abordagem de write-back manual não é escalonável. Nestes casos, a extração, a tradução e o write-back devem ser programados. Use uma biblioteca PDF que suporte acesso à estrutura de tags, como Apache PDFBox para Java ou pikepdf para Python, para extrair programaticamente todos os atributos traduzíveis, enviá-los para uma API de tradução e gravar os resultados de volta.
O script deve registrar cada atributo que modifica e produzir um relatório de comparação antes e depois para que um revisor humano possa verificar as traduções. Automatizar o fluxo de trabalho reduz o custo por documento, mas introduz o risco de erros sistêmicos, como um termo mal traduzido que aparece em dezenas de descrições de texto alternativo e só é descoberto após a distribuição. Uma revisão em lote de uma amostra aleatória, além de uma revisão direcionada de quaisquer traduções sinalizadas como de baixa confiança pela API de tradução, equilibra eficiência com qualidade e fornece um registro de garantia de qualidade defensável.
Experimente Traduzir PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
