Cuando ejecuta un PDF a través de una herramienta de traducción, el documento resultante a menudo tiene problemas de formato que van más allá de simples cambios de diseño. Los caracteres especiales como símbolos matemáticos, signos de moneda y letras acentuadas pueden reemplazarse con cuadros vacíos, signos de interrogación o caracteres completamente incorrectos. Las fuentes incrustadas pueden dejar de renderizarse, lo que hace que secciones enteras de texto desaparezcan o se muestren en una fuente predeterminada del sistema. Comprender lo que sucede con los símbolos y las Fuentes PDF durante la traducción le ayuda a anticipar estos problemas y elegir el enfoque de traducción adecuado para documentos donde la precisión de los símbolos es importante.
Conclusiones clave
Las herramientas de traducción de PDF funcionan extrayendo la capa de texto del documento, ejecutándola a través de un motor de traducción automática y colocando el texto traducido nuevamente en el diseño original. Los símbolos y caracteres especiales están en riesgo durante cada etapa de este proceso: la extracción puede malinterpretar la codificación de símbolos, el motor de traducción puede eliminar o corromper caracteres no alfabéticos y la reinserción puede encontrar problemas de sustitución de fuentes cuando el idioma de destino usa caracteres que no están presentes en las fuentes incrustadas del documento original.

Cómo la traducción de PDF maneja la etapa de extracción de texto
Antes de que pueda realizarse cualquier traducción, la herramienta debe extraer texto legible del PDF. Para un PDF digital nativo con texto incrustado, esta extracción lee los códigos de caracteres de los flujos de contenido del documento y los asigna a valores Unicode utilizando la tabla de codificación de la fuente incrustada. Los símbolos y caracteres especiales se vuelven problemáticos en esta etapa cuando la tabla de codificación está incompleta, dañada o utiliza una asignación personalizada que no sigue las convenciones Unicode. Un PDF creado con software antiguo puede utilizar una codificación no estándar en la que lo que parece un signo de euro en la pantalla se almacena internamente como un código de carácter que no se asigna a nada en las tablas Unicode estándar.
Cuando falla la asignación de codificación, el proceso de extracción produce caracteres de reemplazo, generalmente el carácter de reemplazo Unicode o un signo de interrogación. Este fracaso ocurre silenciosamente. El texto extraído parece normal a primera vista porque las letras y los números alrededor del símbolo están bien, pero el signo de moneda, el operador matemático o la letra acentuada que eran fundamentales para el significado del documento se perdieron incluso antes de que comenzara la traducción. Una etapa de extracción que no logra resolver el signo del euro en un PDF financiero gira en torno al "Total: 2.500 euros" en "Total: 2500" o "Total: 2500 ?" y la salida traducida heredará ese error.
Pruebe traducir PDF
No se necesita instalación. Funciona directamente en su navegador.
Qué hace el motor de traducción con los símbolos y caracteres especiales
Los motores de traducción automática están optimizados para texto en lenguaje natural. Cuando encuentran una oración que contiene una combinación de palabras y símbolos, como una especificación técnica o un estado financiero, el manejo de los símbolos depende del motor específico y del par de idiomas. La mayoría de los sistemas de traducción automática neuronal modernos pasarán por símbolos que reconocen como no lingüísticos, como signos de moneda, marcas de porcentaje y operadores matemáticos comunes. Pero los símbolos menos comunes, como el signo de sección utilizado en documentos legales, el símbolo de grado en textos científicos o la notación especializada de una industria en particular, pueden eliminarse o reemplazarse mediante el paso de normalización de texto del motor de traducción.
El paso de normalización, que se ejecuta antes de la traducción real, convierte el texto de entrada a un formato estandarizado. Puede poner texto en minúsculas, eliminar la puntuación que considere no esencial y normalizar los caracteres Unicode a sus formas canónicas. Para la mayoría de los documentos esto es útil. Evita que el motor de traducción trate "Hola" como respuesta. y "hola" como palabras diferentes. Pero en el caso de documentos en los que símbolos específicos tienen significado, la normalización puede resultar perjudicial. Una fórmula química que utiliza números de subíndice, un conjunto de coordenadas GPS con símbolos de grados y minutos, o una cita legal con marcas de sección pueden verse alteradas mediante la normalización de manera que cambien su significado o las hagan ilegibles.
Sustitución de fuentes: por qué el texto traducido a menudo se ve diferente
El impacto visual de la sustitución de fuentes varía de sutil a grave. Cuando una fuente latina sustituye a otra fuente latina, el ancho de los caracteres cambia ligeramente pero el texto sigue siendo legible. Cuando una fuente latina sustituye a un sistema de escritura no latino, el resultado suele ser una fila de rectángulos vacíos o signos de interrogación porque la fuente latina no contiene ninguno de los caracteres requeridos. Es por eso que traducir al árabe, chino, japonés, coreano o cirílico requiere atención especial a la disponibilidad de fuentes durante la etapa de reinserción.
Después de la traducción, el nuevo texto debe volver a colocarse en el PDF. Las fuentes incrustadas del documento original contienen sólo los caracteres que estaban presentes en el texto original. Cuando el texto traducido contiene caracteres que no estaban en el original, como caracteres acentuados en las traducciones al francés o al español de un documento en inglés, las fuentes incrustadas originales no pueden representarlos. El visor de PDF recurre a una fuente de sustitución, que casi con seguridad tendrá un aspecto diferente al del texto circundante. El resultado es un documento en el que la mayor parte del texto aparece en el tipo de letra original, pero ocasionalmente las palabras traducidas o los caracteres acentuados aparecen en una fuente visiblemente diferente, lo que le da a la página una apariencia irregular y poco profesional.
Este problema es más grave cuando se traduce a idiomas que utilizan sistemas de escritura completamente diferentes. Para traducir un PDF en inglés al ruso, árabe, chino o japonés se necesitan caracteres que no contienen ninguna fuente de escritura latina. Todo el texto traducido debe representarse con una fuente de sustitución y el carácter visual del documento cambia por completo. La geometría de diseño que funcionó para el texto original, con sus anchos de caracteres y alturas de línea específicos, no se ajustará al texto traducido. Los saltos de línea se mueven, los párrafos crecen o se reducen y los elementos que estaban cuidadosamente alineados se desalinean.
Elección de un método de traducción basado en la sensibilidad de los símbolos
Una comprobación práctica previa a la traducción es abrir el PDF y copiar un párrafo que contenga caracteres especiales en un editor de texto sin formato. Si los caracteres especiales sobreviven intactos a la operación de copiar y pegar, la codificación del texto del PDF es estándar y es poco probable que la etapa de extracción de la traducción los corrompa. Si los caracteres se vuelven confusos o desaparecen al pegarlos, el PDF utiliza una codificación no estándar que causará problemas durante la traducción. Corregir la codificación en el origen, por ejemplo recreando el PDF con la incrustación de fuentes habilitada, es más efectivo que intentar recuperar caracteres corruptos después de la traducción.
Para documentos donde los símbolos son críticos, como informes financieros, artículos científicos, archivos legales y manuales técnicos, el enfoque más seguro es utilizar un
Para los documentos que se traducen a un sistema de escritura diferente, acepte que el resultado tendrá un aspecto diferente del original y planifique en consecuencia. En lugar de esperar un diseño perfecto en píxeles, concéntrese en producir un documento limpio y legible en el idioma de destino. Después de la traducción, reserve tiempo para el ajuste del diseño manual o semiautomático. Ajuste el ancho de las columnas, realinee las tablas y verifique que todos los caracteres especiales se hayan representado correctamente. El tiempo adicional dedicado al formateo posterior a la traducción es el costo de trabajar en distintos sistemas de escritura, y las herramientas que prometen una traducción fluida entre guiones sin ningún trabajo de diseño están simplificando demasiado un problema genuinamente difícil. La herramienta de traducción de WukongPDF conserva los datos de fuentes incrustados durante todo el proceso de conversión, minimizando la corrupción de símbolos que ocurre cuando las fuentes se sustituyen durante la reinserción de texto.
Preguntas frecuentes
¿Debo traducir un PDF directamente o convertirlo primero a un formato editable, traducirlo y volver a exportarlo a PDF? El enfoque de dos pasos, convertir a Word, traducir el documento de Word y exportar nuevamente a PDF, generalmente produce una mejor fidelidad de los símbolos porque Word maneja Unicode de manera más consistente que la extracción de texto PDF sin formato. El costo es que el viaje de ida y vuelta a través de Word introduce cambios de diseño que deben corregirse manualmente. Para documentos cortos, el método de dos pasos vale la pena el esfuerzo de diseño. Para documentos muy largos, es más práctica la traducción directa de PDF con una herramienta que conserve la codificación.
¿Puedo traducir un PDF extrayendo el texto, traduciéndolo externamente y colocándolo manualmente nuevamente en el diseño del PDF? Sí, este proceso manual le brinda un control total sobre el manejo de símbolos y la selección de fuentes en cada etapa, pero requiere mucho tiempo y es práctico solo para documentos cortos. Para un manual técnico de 50 páginas, la reinserción manual no es factible. La decisión entre traducción automática y manual es, en última instancia, una decisión sobre cuánto control necesita sobre el resultado y cuánto tiempo puede invertir.
¿Puedo evitar la pérdida de símbolos convirtiendo el PDF a Word antes de traducirlo?
La conversión a Word primero le da a la herramienta de traducción acceso al texto a través del manejo Unicode de Microsoft Word, que generalmente es más confiable que la extracción de texto PDF sin formato. Este paso adicional a menudo resuelve la pérdida de símbolos relacionada con la codificación, especialmente en documentos creados con software moderno que ya utiliza codificación Unicode estándar. La desventaja es que la propia conversión de Word puede introducir cambios en el diseño. Para documentos con muchos símbolos, la precisión mejorada de los caracteres generalmente justifica el trabajo de diseño.
¿Por qué las ecuaciones matemáticas a menudo fallan durante la traducción de un PDF?
Las ecuaciones matemáticas en archivos PDF generalmente se almacenan como una combinación de caracteres de texto para variables y números, además de símbolos matemáticos especiales de una fuente matemática dedicada, además de barras de fracciones dibujadas con vectores, signos radicales y otros elementos de notación. Cuando el motor de traducción procesa la capa de texto, trata la ecuación como una oración y puede reorganizar o normalizar la secuencia de símbolos. Los elementos dibujados por vectores no son texto en absoluto y pasan por la traducción sin ser tocados, pero su alineación con respecto al texto traducido casi siempre está rota. Para documentos con mucho contenido matemático, el enfoque más confiable es excluir las ecuaciones de la traducción y traducir solo la prosa circundante.
¿Existe algún formato PDF que maneje la traducción Formato PDF mejor que otros?
PDF/A con fuentes Unicode totalmente integradas se traduce de manera más confiable que los archivos PDF estándar con subconjuntos de fuentes y codificaciones personalizadas. El requisito de incrustación completa y Unicode en PDF/A elimina las dos fuentes más comunes de corrupción de símbolos durante la traducción: falta de glifos de fuente y asignaciones de caracteres no estándar. Si sabe que un documento se traducirá, vale la pena guardarlo como PDF/A antes de ejecutar la traducción.
Pruebe traducir PDF
No se necesita instalación. Funciona directamente en su navegador.
