Una herramienta de traducción de PDF procesa el flujo de texto del documento y convierte palabras de un idioma a otro. Lee los párrafos, los títulos y los pies de foto. Pero no lee el texto que hay dentro de las imágenes. Una fotografía de un letrero, una captura de pantalla de una interfaz de usuario en un idioma diferente, un gráfico con etiquetas de eje representadas como parte de la imagen, todos ellos contienen texto que las herramientas de traducción estándar ignoran porque el texto no está en el flujo de texto PDF. Está incrustado en los píxeles de la imagen. Traducir texto dentro de imágenes incrustadas requiere extraer las imágenes, ejecutar OCR en ellas, traducir el texto reconocido y luego volver a incrustar las imágenes traducidas o agregar la traducción como una superposición. El flujo de trabajo Translate PDF para texto con imágenes incrustadas es más complicado que la traducción de texto estándar, pero cubre contenido que de otro modo permanecería sin traducir.

Identificación de imágenes que contienen texto traducible
No todas las imágenes de un PDF contienen texto que valga la pena traducir. Una fotografía decorativa, una textura de fondo y el logotipo de una empresa pueden no contener contenido traducible. Una captura de pantalla de una aplicación de software, un diagrama con componentes etiquetados, una fotografía de un documento o un letrero y un gráfico con etiquetas de ejes incrustadas contienen texto que un lector en el idioma de destino debe comprender. Escanee el PDF e identifique cada imagen que contenga texto. Marque estas imágenes para el flujo de trabajo de traducción.
Las imágenes que contienen texto en el PDF se dividen en dos categorías: aquellas en las que el texto es parte de la imagen por diseño, como una captura de pantalla o un diagrama etiquetado, y aquellas en las que el texto aparece en la imagen porque el documento fue escaneado en lugar de creado digitalmente. Un PDF escaneado es una imagen grande por página. Todo el texto de una página escaneada está incrustado en la imagen de la página. Un PDF creado digitalmente puede tener una única captura de pantalla en una página que de otro modo estaría basada en texto. Las Imágenes PDF que necesitan traducción son aquellas en las que el texto aparece en los píxeles de la imagen y no en el flujo de texto del PDF.
Pruebe traducir PDF
No se necesita instalación. Funciona directamente en su navegador.
Extraer imágenes y reconocer el texto
Extraiga las imágenes del PDF con la resolución más alta disponible. Utilice una herramienta de extracción de imágenes PDF que conserve la resolución original. Guarde cada imagen extraída como un archivo PNG para evitar introducir artefactos de compresión durante el paso de extracción. Abra cada imagen extraída y confirme que el texto sea legible. Si la resolución de la imagen es demasiado baja para que el texto se lea claramente, vuelva a extraerla con una resolución más alta si es posible, o tenga en cuenta que esta imagen puede producir resultados de OCR no confiables.
Ejecute OCR en cada imagen extraída para reconocer el texto. El motor de OCR identifica las regiones de texto dentro de la imagen y genera los caracteres reconocidos junto con sus posiciones. Guarde la salida de OCR para cada imagen, incluido el texto reconocido y las coordenadas del cuadro delimitador de cada región de texto. Esta información es necesaria posteriormente para colocar el texto traducido en la posición correcta de la imagen. WukongPDF maneja el procesamiento OCR PDF que puede reconocer texto en imágenes incrustadas como parte del flujo de trabajo de conversión de documentos.
Traducir el texto reconocido preservando el contexto
El texto reconocido a partir de imágenes suele ser fragmentario. Un diagrama puede contener etiquetas de una sola palabra. Una captura de pantalla puede contener elementos de menú y etiquetas de botones sin contexto de oración. Este texto fragmentado supone un desafío para los motores de traducción automática porque no existe el contexto lingüístico circundante que elimina la ambigüedad del significado de las palabras. Proporcione el mayor contexto posible. Si una etiqueta dice Archivo y aparece en una captura de pantalla de un menú de software, tenga en cuenta en la entrada de traducción que se trata de un elemento de menú, no de un objeto físico.
Para imágenes con múltiples regiones de texto, mantenga el mapeo entre cada región y su traducción. Un diagrama con diez etiquetas produce diez cadenas de texto separadas, cada una de las cuales necesita una traducción. Mantenga el texto original, el texto traducido y las coordenadas del cuadro delimitador juntos en un formato estructurado, como una hoja de cálculo. Este mapeo se utiliza en el paso final para colocar el texto traducido en la imagen. Para que la salida Translate PDF sea útil, el texto traducido debe aparecer en la ubicación correcta de la imagen, reemplazando o acompañando al texto original.
Colocar el texto traducido nuevamente en las imágenes
Existen dos enfoques para colocar texto traducido en imágenes. El primer enfoque reemplaza el texto original con la traducción. Abra la imagen en un editor de imágenes. Para cada región de texto, borre el texto original rellenando la región con el color de fondo. Coloque el texto traducido en la misma región utilizando una fuente que coincida lo más posible con el estilo del original. Este enfoque produce una imagen traducida limpia que se parece al original, pero en un idioma diferente.
El segundo enfoque agrega la traducción junto con el texto original. Coloque el texto traducido en un color que contraste debajo o al lado del texto original. Este enfoque preserva el original para los lectores que entienden ambos idiomas y desean comparar la traducción con la fuente. Es más rápido que borrar y reemplazar, pero la imagen resultante es visualmente más ocupada. Elija el enfoque según las necesidades de la audiencia. Un manual de formación para operadores que sólo leen el idioma de destino se beneficia de la sustitución. Un documento de referencia bilingüe se beneficia de la presentación lado a lado.
Volver a incrustar imágenes traducidas en el PDF
Una vez procesadas las imágenes con el texto traducido, se deben volver a colocar en el PDF. Reemplace cada imagen original con su contraparte traducida. La imagen de reemplazo debe caber en el mismo espacio de la página que la original. Si la imagen traducida tiene dimensiones en píxeles diferentes a las del original, escale para que coincida con el cuadro delimitador original en el PDF. El diseño de la página PDF no debería cambiar. La única diferencia visible debería ser el idioma del texto dentro de las imágenes.
Guarde el PDF con las imágenes traducidas como una nueva versión, manteniendo el PDF original sin traducir como referencia. Verifique el PDF traducido abriéndolo y revisando cada imagen. Confirme que el texto traducido sea legible, esté colocado correctamente y no tenga OCR ni errores de traducción. Una Traducir PDF con traducción de imágenes incrustadas está completa cuando cada elemento de texto en el documento, en el flujo de texto y en las imágenes, es accesible para un lector en el idioma de destino.
Cuándo elegir la traducción manual en lugar de la automática
Para imágenes que contienen texto crítico, como advertencias de seguridad, avisos legales o especificaciones técnicas, considere la posibilidad de traducirlas manualmente por un traductor humano en lugar de la traducción automática. Un error de OCR combinado con un error de traducción automática puede cambiar el significado de una instrucción de seguridad de manera que tenga consecuencias reales. El coste de la traducción humana de un pequeño número de imágenes críticas es pequeño en comparación con el coste de una traducción incorrecta.
Para lotes grandes de imágenes donde la traducción manual no es práctica, implemente un paso de revisión. Después de la traducción automática y la reincrustación, haga que un revisor humano que lea el idioma de destino verifique la precisión de una muestra de las imágenes traducidas. Si la muestra revela errores sistémicos, ajuste la configuración de OCR o los parámetros del motor de traducción y vuelva a procesar el lote.
La traducción de texto en imágenes incrustadas suele ser el último paso para hacer que un PDF sea totalmente accesible para una audiencia internacional. Se han traducido el cuerpo del texto, los títulos y los pies de foto. Las imágenes quedan como contenido final sin traducir. Al completar este paso se produce un documento en el que cada fragmento de texto, en todos los medios, está disponible en el idioma de destino.
Para documentos que se actualizan con frecuencia con imágenes incrustadas, considere si el texto de la imagen se puede mover al flujo de texto PDF durante el proceso de creación del documento. Un diagrama con etiquetas almacenadas como superposiciones de texto en lugar de como parte de la imagen se puede traducir utilizando herramientas de traducción de texto estándar, evitando por completo el flujo de trabajo de extracción, OCR, traducción y reintegración.
La calidad de la imagen traducida final depende de la calidad de cada paso del proceso. Una extracción de imágenes de alta resolución produce una entrada OCR clara. El OCR preciso produce texto correcto para traducir. Un buen motor de traducción preserva el significado. Una cuidadosa reincrustación mantiene la calidad visual. Cada paso depende del anterior.
El flujo de trabajo Translate PDF para texto con imágenes incrustadas es el escenario de traducción que requiere más mano de obra porque combina procesamiento de imágenes, OCR, traducción y reintegración en un solo proceso. Automatizar tantos pasos como sea posible reduce el esfuerzo manual.
Para imágenes que aparecen idénticas en varios archivos PDF, como el logotipo de una empresa con un eslogan o un diagrama estándar, traduzca la imagen una vez y reutilícela. La imagen traducida se puede sustituir en cada PDF donde aparezca la imagen original.
Este artículo cubre las técnicas y consideraciones clave para trabajar con archivos PDF en este escenario específico. Los métodos descritos aquí se aplican en diferentes herramientas y plataformas, brindando a los lectores la flexibilidad de elegir el enfoque que mejor se adapte a su flujo de trabajo y entorno técnico.
Los pasos prácticos descritos proporcionan un camino claro desde el desafío inicial hasta una solución funcional. Cada técnica ha sido seleccionada por su confiabilidad y accesibilidad, lo que garantiza que los lectores puedan lograr resultados consistentes independientemente de su experiencia previa con herramientas PDF.
WukongPDF y plataformas similares proporcionan herramientas de procesamiento de documentos y OCR que respaldan el flujo de trabajo de traducción de texto de imágenes descrito en este artículo. La combinación de estas herramientas permite una cobertura de traducción integral.
Pruebe traducir PDF
No se necesita instalación. Funciona directamente en su navegador.
