Tips & Tricks

Cómo realizar OCR en un documento PDF escrito en un idioma que no habla

Recibir un PDF escaneado escrito en un idioma que no habla es más común que nunca en los negocios globales, la investigación académica y la revisión de documentos legales. Necesita extraer el texto, traducirlo y comprender lo que dice el documento. El desafío no es sólo ejecutar OCR en el archivo. Ejecuta OCR con la configuración de idioma correcta para que el texto extraído sea lo suficientemente preciso como para traducirlo. Seleccionar el idioma incorrecto durante el procesamiento de OCR PDF produce resultados confusos que ningún motor de traducción puede recuperar.

Los motores OCR no ven letras. Ven formas y las comparan con patrones de caracteres de un idioma específico. Si le dice al motor de OCR que el documento está en inglés pero en realidad está en ruso, el motor asigna formas cirílicas a los caracteres latinos más cercanos que conoce. El resultado es una cadena de letras de apariencia aleatoria que no guarda relación con el texto original. Obtener la configuración de idioma correcta o utilizar la detección automática cuando esté disponible es la decisión más importante en todo el proceso de OCR a traducción.

Las herramientas PDF a texto y OCR de WukongPDF extraen texto de documentos escaneados para traducirlos y analizarlos. Combinar la selección correcta del idioma OCR con un servicio de traducción confiable convierte un escaneo ilegible en un idioma extranjero en un documento comprensible en menos de cinco minutos.

How to OCR a PDF Document Written in a Language You Don't Speak

Paso 1: Identificar el idioma del documento

Antes de tocar cualquier software de OCR, identifique con certeza el idioma del documento. Si los metadatos del documento o el nombre del archivo indican el idioma, comience allí. Si no, abra el PDF y mire algunas páginas. Incluso sin leer el texto, las señales visuales reducen significativamente las posibilidades. Las familias de escritura son distintivas: la escritura latina sirve para la mayoría de los idiomas europeos. El cirílico se utiliza para el ruso, el ucraniano, el búlgaro y el serbio. La escritura árabe cubre árabe, persa y urdu. CJK cubre chino, japonés y coreano. Devanagari cubre hindi, marathi y nepalí.

Si no puede identificar visualmente ni siquiera la familia de guiones, tome una captura de pantalla de un párrafo representativo y cárguela en la función de traducción de imágenes de Google Translate o en una búsqueda inversa de imágenes. Estas herramientas identifican tanto la escritura como el idioma específico en la mayoría de los casos. Saber que el documento es tailandés en lugar de laosiano, o coreano en lugar de japonés, marca la diferencia entre una salida OCR precisa y un ruido de caracteres inútil.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →

Paso 2: Seleccione una herramienta de OCR que admita el idioma de destino

No todas las herramientas de OCR son compatibles con todos los idiomas. Adobe Acrobat Pro viene con motores OCR para unos 40 idiomas. Su herramienta Reconocer texto incluye un menú desplegable de selección de idioma en el cuadro de diálogo de configuración. Tesseract, el motor OCR gratuito de código abierto mantenido por Google, admite más de 100 idiomas a través de archivos de datos de idiomas descargables. La API de Google Cloud Vision tiene la cobertura de idiomas más amplia con más de 200 idiomas e incluye la detección automática de idioma como característica opcional.

Para un documento en un solo idioma que pueda identificar, cualquiera de estas herramientas funciona siempre que especifique el idioma correcto antes de ejecutar OCR. Para un documento que contiene varios idiomas, como un contrato bilingüe con cláusulas en inglés y francés, necesita una herramienta que admita varios idiomas simultáneos o que pueda detectar automáticamente cada párrafo. Google Cloud Vision y Tesseract, con los paquetes de datos de idioma adecuados, manejan documentos en varios idiomas, aunque la precisión en los límites del cambio de idioma nunca es perfecta.

Paso 3: Configurar y ejecutar el OCR con el idioma correcto

En Adobe Acrobat Pro, abra el PDF escaneado, vaya a Herramientas, luego Escanear y OCR, seleccione Reconocer texto y luego En este archivo. Haga clic en el botón Editar junto al selector de idioma. En el cuadro de diálogo Reconocer texto, elija el idioma principal correcto en el menú desplegable. Si el documento contiene un segundo idioma, haga clic en el botón Agregar idioma y selecciónelo también. Acrobat procesa ambos idiomas simultáneamente. Haga clic en Aceptar y luego en Reconocer texto. Acrobat ejecuta el pase de OCR e incrusta el texto reconocido como una capa invisible detrás de la imagen escaneada. El documento ahora se puede buscar.

En Tesseract, la invocación de la línea de comandos especifica el idioma con el indicador -l: tesseract input.pdf salida -l rus para ruso, tesseract input.pdf salida -l jpn para japonés o tesseract input.pdf salida -l fra+eng para un documento bilingüe francés-inglés. Primero instale los archivos de datos de idioma requeridos; Tesseract se envía solo en inglés de forma predeterminada. Para Google Cloud Vision, la llamada API incluye un parámetro languageHints que acepta una variedad de códigos de idioma BCP-47. Cloud Vision también ofrece un modo de detección automática de idioma que no requiere ninguna pista de idioma, lo que la convierte en la opción más sencilla cuando realmente no conoces el idioma del documento.

Paso 4: Copiar el texto extraído y traducir

Una vez que se complete el OCR, verifique la calidad del texto antes de enviarlo a traducción. En Acrobat, abra la herramienta Buscar y busque una palabra común que reconozca en el documento. Si la búsqueda encuentra coincidencias, el OCR funcionó. Seleccione un párrafo del texto extraído, cópielo y péguelo en un editor de texto sin formato. Busque errores obvios de OCR: símbolos repetidos, palabras que se dividen por la mitad o bloques grandes de caracteres no reconocidos. Si más del 5 por ciento del texto parece dañado, vuelva a ejecutar el OCR con una configuración de idioma diferente o una configuración de resolución más alta.

Una vez que el texto extraído pase una verificación de integridad visual, copie el texto completo y péguelo en una herramienta de traducción. Google Translate, DeepL o Microsoft Translator aceptan la entrada de texto sin formato. Para documentos más largos, DeepL y Google Translate admiten la carga directa de archivos PDF con capacidad de búsqueda, lo que omite el paso de copia manual. El resultado de la traducción es lo suficientemente bueno para la comprensión, la investigación y el uso comercial interno. Para obtener precisión legal, médica o de publicación, envíe el PDF con capacidad de búsqueda a un traductor humano profesional, quien utilizará la capa OCR como punto de partida y corregirá la traducción automática con respecto a las páginas escaneadas originales.

Manejo de documentos con secuencias de comandos mixtas o fuentes no estándar

Los documentos que mezclan escrituras, como un trabajo de investigación en árabe que incluye términos técnicos en inglés en escritura latina, confunden a los motores de OCR que esperan una sola escritura. Primero configure el OCR para la secuencia de comandos dominante y luego ejecute una segunda pasada dirigida a la secuencia de comandos minoritaria en el mismo documento. Combine los resultados exportando ambas capas de OCR y combinándolas en un editor de texto. La precisión en los pasajes del guión minoritario será menor porque el motor está optimizado para el guión principal.

Las fuentes no estándar, incluidas las decorativas, las antiguas máquinas de escribir y las cursivas manuscritas, reducen la precisión del OCR incluso con el idioma correcto seleccionado. Preprocese estos documentos convirtiendo las páginas PDF en imágenes de alta resolución a 400 DPI o más, aplicando un filtro de nitidez y aumentando el contraste antes de introducirlos en el motor de OCR. El preprocesamiento integrado de Tesseract, habilitado con --psm 3 para la segmentación automática de páginas, maneja una variación de fuente moderada. Para texto muy degradado o estilizado, la API de Google Cloud Vision generalmente supera a los motores de OCR locales porque sus modelos han sido entrenados en un corpus más grande de muestras de fuentes del mundo real.

Herramienta OCRSoporte multilingüeAutodetecciónMejor para
Adobe Acrobat ProMás de 40 idiomasselección manualDocumentos profesionales, alta precisión.
Teseracto (código abierto)Más de 100 idiomasSe requiere selección manualProcesamiento por lotes, secuencias de comandos, gratis
Visión de la nube de GoogleMás de 200 idiomasDetección automática disponibleIntegración API, scripts mixtos
Servicios de OCR en línea10-50 idiomasselección manualOCR rápido de un solo documento

Verificar la precisión antes de actuar sobre el contenido traducido

El OCR seguido de la traducción automática introduce dos capas de errores potenciales: reconocimiento erróneo del OCR y ambigüedad en la traducción. Para documentos críticos, verifique el resultado pidiéndole a un colega bilingüe o a un traductor profesional que compare un párrafo de la traducción seleccionado al azar con el PDF original. Una verificación de cinco minutos detecta fallas catastróficas, como una configuración de idioma incorrecta que produjo un texto aparentemente plausible pero completamente incorrecto.

Si maneja regularmente archivos PDF escaneados en idiomas extranjeros, cree una lista de verificación: identifique el idioma, seleccione el motor de OCR correspondiente, ejecute OCR con el parámetro de idioma correcto, verifique la exactitud de los caracteres del texto extraído, traduzca y verifique un párrafo de muestra. Después de dos o tres documentos, el flujo de trabajo se vuelve rutinario y tarda menos de cinco minutos desde que se abre el archivo hasta que se lee el resultado traducido.

Cuando se trata de procesamiento de documentos, para documentos sensibles a la seguridad, el OCR fuera de línea evita por completo la exposición a la nube. Tesseract se ejecuta localmente sin solicitudes de red después de descargar los archivos de datos de idioma una vez. Adobe Acrobat Pro también realiza OCR localmente a través de la función Reconocer texto sin iniciar sesión en Document Cloud. Para materiales confidenciales en idiomas extranjeros, como descubrimientos legales o correspondencia comercial confidencial, el OCR local junto con la revisión de texto fuera de línea mantiene el contenido del documento original dentro de su entorno controlado.

Cuando el OCR por sí solo no es suficiente: servicios de transcripción asistida

Para documentos donde la precisión del OCR es inutilizable debido a una degradación extrema de la fuente, texto escrito a mano o escrituras muy mezcladas, los servicios de transcripción asistida brindan resultados verificados por humanos. Estos servicios combinan un pase inicial de OCR automático con revisión y corrección humana, normalmente cobrando por página. El tiempo de respuesta varía desde unas pocas horas hasta unos pocos días. Para un único documento crítico donde la precisión no es negociable, como un certificado de nacimiento en un idioma extranjero o una solicitud de patente, el costo de la transcripción humana se justifica por el riesgo de actuar sobre un texto reconocido incorrectamente. Primero ejecute el OCR de la máquina para evaluar la calidad. Si más del 15 por ciento de las palabras no se reconocen o son obviamente incorrectas, pase a la transcripción asistida en lugar de pasar horas corrigiendo manualmente la salida de la máquina.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →