Un PDF etiquetado contiene metadatos de accesibilidad ocultos que los lectores de pantalla utilizan para describir imágenes, tablas y estructuras de documentos a usuarios con discapacidad visual. El texto visible en la página puede estar en inglés, mientras que las descripciones de texto alternativo, los resúmenes de las tablas y las etiquetas estructurales deben estar disponibles en varios idiomas para una audiencia internacional. Traducir sólo esta capa oculta sin tocar el contenido visible del documento requiere trabajar directamente con la estructura de etiquetas del PDF, una capacidad de la que carecen la mayoría de las herramientas de traducción de uso general.
El estándar PDF/UA (Accesibilidad universal, ISO 14289) requiere que los PDF etiquetados proporcionen texto alternativo para todos los elementos de contenido que no sean texto. En una organización multilingüe, es posible que un contrato escrito en francés necesite que su texto alternativo esté disponible en inglés, alemán y holandés para que los revisores de accesibilidad de cada país puedan verificar el cumplimiento. Traducir todo el documento sería innecesario y costoso. Sólo unos pocos cientos de palabras de texto alternativo y etiquetas estructurales necesitan atención. Esta tarea cae en una categoría estrecha que se ubica entre el documento completo Traducir PDF y la edición manual de accesibilidad, y pocas organizaciones han establecido un flujo de trabajo estándar para ello.
Las consecuencias de los metadatos de accesibilidad no traducidos son más importantes de lo que parecen. Un usuario de lector de pantalla que acceda a un contrato en francés con solo texto alternativo en inglés escuchará descripciones en inglés que interrumpen el contenido en francés, creando una experiencia confusa y desorientadora. Para las agencias gubernamentales y organizaciones financiadas con fondos públicos sujetas a regulaciones de accesibilidad, esto representa una brecha de cumplimiento que puede tener consecuencias legales. Traducir la capa de accesibilidad no es algo bueno para las organizaciones multilingües. Es parte del cumplimiento de las obligaciones de accesibilidad en todos los idiomas en los que trabaja la organización.

Comprender la estructura de etiquetas de PDF y dónde reside el texto alternativo
Un PDF etiquetado organiza su contenido en una estructura de árbol lógica, con elementos como Documento, Parte, Sección, P, Tabla, Figura y Fórmula. Cada elemento puede tener atributos, y el crítico para la traducción es la entrada /Alt, que almacena la descripción de texto alternativa. Un elemento de Figura que representa un gráfico puede tener una entrada /Alt que contenga un "Gráfico de barras que muestra el crecimiento de los ingresos trimestrales desde el primer trimestre de 2022 hasta el cuarto trimestre de 2024 con un aumento interanual del 12 por ciento". Este texto nunca se muestra en la página visible. Existe únicamente en la estructura de etiquetas para el consumo de lectores de pantalla.
La entrada /Alt es una cadena de texto almacenada como un objeto de cadena PDF o una cadena con escape XML dentro del contenido marcado del documento. Extraerlo, traducirlo y volver a escribirlo sin alterar la estructura de etiquetas circundante requiere una herramienta que pueda analizar el contenido PDF etiquetado a nivel de objeto. La mayoría de los editores de PDF que muestran un árbol de etiquetas en su panel de accesibilidad pueden editar entradas individuales/Alt, pero traducir docenas o cientos de ellas manualmente es lento y propenso a errores, y cada entrada requiere un ciclo separado de abrir, editar y guardar.
Más allá de las entradas /Alt, existen otros elementos de accesibilidad traducibles. El atributo /Summary en los elementos de la tabla proporciona una descripción general en texto de la estructura y el propósito de la tabla. La entrada /ActualText en elementos Span puede anular el texto visual para lectores de pantalla, lo que resulta útil cuando el texto visual es una abreviatura que debe expandirse. Las descripciones de los campos de formulario almacenadas en la entrada /TU (información sobre herramientas) también necesitan traducción. Una traducción completa y accesible cubre todos estos elementos. Para un contrato de 50 páginas con 30 figuras, 15 tablas y 40 campos de formulario, el texto de accesibilidad traducible total podría ser de 2000 a 3000 palabras, suficiente para que un traductor dedique parte de un día, pero mucho menos que traducir el texto completo del documento.
Pruebe traducir PDF
No se necesita instalación. Funciona directamente en su navegador.
Extracción de texto de accesibilidad para traducción
El primer paso es hacer un inventario de lo que necesita traducción. Utilice un verificador de accesibilidad de PDF o un visor de etiquetas para exportar una lista de todas las entradas /Alt, /Summary, /ActualText y /TU del documento. La mayoría de las herramientas de validación de accesibilidad, incluido el verificador de accesibilidad integrado en Adobe Acrobat Pro, pueden generar un informe que muestra cada elemento de etiqueta con estos atributos y sus valores de texto actuales. Exporte esta lista a un formato estructurado como CSV, con columnas para el tipo de etiqueta, identificador de elemento, texto original y una columna de traducción en blanco.
Envíe las cadenas de texto originales a un traductor o a un servicio de traducción automática. El formato estructurado garantiza que cada cadena traducida permanezca asociada con su elemento fuente, lo cual es esencial para escribir las traducciones en las ubicaciones correctas. Para cumplir con Accesibilidad de PDF, las traducciones deben cumplir con los mismos estándares de calidad que el texto alternativo original. Una buena descripción de texto alternativo es concisa, normalmente tiene menos de 150 caracteres, y describe el contenido y la función del elemento en lugar de su apariencia. La traducción debe preservar esta concisión y enfoque funcional.
WukongPDF admite la edición de Etiquetas PDF y atributos de accesibilidad a nivel de elemento individual, lo que hace que sea práctico actualizar las traducciones de texto alternativo sin afectar el contenido visible de la página. El editor de etiquetas estructuradas muestra la jerarquía de elementos completa con todos los atributos traducibles y la función de actualización por lotes le permite importar traducciones desde un archivo CSV y aplicarlas a los elementos correctos en una sola operación.
Reescribir traducciones en la estructura de etiquetas
Después de recibir las traducciones, el paso de reescritura requiere una herramienta que pueda navegar por el árbol de etiquetas PDF y actualizar los valores de atributos individuales. Abra el PDF en un editor de etiquetas que muestre el árbol de estructura completo. Para cada elemento traducido, ubique el elemento en el árbol, seleccione su /Alt u otro atributo y pegue el texto traducido. Guarde el archivo cuando se hayan actualizado todas las entradas. Verifique el resultado utilizando un lector de pantalla o una herramienta de validación de accesibilidad. Navegue por el documento con el lector de pantalla activo y confirme que cada descripción traducida se lea en el idioma esperado.
Para documentos que se distribuirán en varios idiomas, considere si el PDF debe contener todas las versiones de idioma del texto alternativo en un solo archivo o si se deben crear archivos PDF separados para idiomas específicos. La especificación PDF admite el etiquetado de idioma a nivel de elemento, por lo que, en teoría, un solo archivo puede contener texto alternativo en inglés en la Figura 1 y texto alternativo en francés en la Figura 2. Sin embargo, la compatibilidad del lector de pantalla para el cambio de idioma por elemento es inconsistente entre diferentes aplicaciones de lector de pantalla. Si el cumplimiento de la accesibilidad es un requisito, los archivos PDF separados por idioma son la opción más segura y comprobable de manera más confiable.
Automatización del flujo de trabajo para conjuntos de documentos grandes
Para las organizaciones que necesitan localizar metadatos de accesibilidad en cientos o miles de archivos PDF, el enfoque de reescritura manual no es escalable. En estos casos, la extracción, traducción y reescritura deben programarse. Utilice una biblioteca de PDF que admita el acceso a la estructura de etiquetas, como Apache PDFBox para Java o pikepdf para Python, para extraer mediante programación todos los atributos traducibles, enviarlos a una API de traducción y escribir los resultados.
El script debe registrar cada atributo que modifica y producir un informe de comparación del antes y el después para que un revisor humano pueda verificar las traducciones. La automatización del flujo de trabajo reduce el costo por documento, pero introduce el riesgo de errores sistémicos, como un término mal traducido que aparece en docenas de descripciones de texto alternativo y solo se descubre después de la distribución. Una revisión por lotes de una muestra aleatoria, además de una revisión específica de cualquier traducción marcada como de baja confianza por la API de traducción, equilibra la eficiencia con la calidad y proporciona un historial de garantía de calidad defendible.
Pruebe traducir PDF
No se necesita instalación. Funciona directamente en su navegador.
