Escaneas un contrato bilingüe. La columna de la izquierda está en inglés. La columna de la derecha está en español. Es necesario poder realizar búsquedas en ambos idiomas, pero una ejecución de OCR estándar configurada para un idioma destruirá el otro. El OCR en inglés aplicado al texto en español no tiene sentido porque el motor de reconocimiento espera diferentes frecuencias de letras y patrones de palabras. El OCR en español aplicado al inglés produce resultados igualmente confusos. Necesita OCR que comprenda ambos idiomas simultáneamente.
Multilingüe OCR PDF es una característica de los motores de reconocimiento modernos que pueden cambiar entre modelos de idioma dentro de un solo documento. El motor detecta en qué idioma está escrito cada bloque de texto y aplica el modelo de reconocimiento adecuado. El resultado es un reconocimiento de texto preciso en todos los idiomas del documento.

Cómo los motores OCR manejan varios idiomas
Los motores de OCR reconocen el texto comparando las formas de los caracteres con modelos entrenados de cómo se ven las letras en cada idioma. Un modelo inglés sabe que la letra "e" es el más común, ese "th" aparecen juntos con frecuencia y que ciertas combinaciones de caracteres como "qx" casi nunca ocurre. Una modelo española sabe que los caracteres acentuados como "a" con acento, "n" con tilde y signos de interrogación invertidos son comunes. Un modelo francés espera vocales acentuadas frecuentes y dígrafos específicos.
Cuando especifica varios idiomas para un trabajo de OCR, el motor carga los modelos de caracteres para todos los idiomas especificados. A medida que procesa cada bloque de texto de la página, evalúa qué modelo de lenguaje coincide mejor con los patrones de caracteres observados y aplica ese modelo. La detección de idioma ocurre automáticamente en el nivel del bloque de texto, por lo que una página con texto del cuerpo en inglés y notas al pie en francés se maneja correctamente sin etiquetado manual de idioma.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
Configurar OCR multilingüe
En la selección de idioma de la herramienta OCR se permiten varios idiomas. Seleccione todos los idiomas que aparecen en el documento. Para un contrato bilingüe inglés-español, seleccione tanto inglés como español. Para un documento de la Unión Europea que contenga inglés, francés y alemán, seleccione los tres. Para un trabajo académico con texto en inglés y citas en griego antiguo, seleccione Inglés y griego. El motor carga todos los modelos necesarios.
Existe un equilibrio entre la cobertura del idioma y la precisión. Cada idioma adicional agrega más modelos de caracteres al proceso de reconocimiento, lo que aumenta la posibilidad de confusión entre caracteres similares de diferentes idiomas. La letra cirílica "a" parece idéntico a la letra latina "a" pero representa un sonido diferente y aparece en diferentes contextos. Agregar idiomas innecesarios aumenta el riesgo de que el motor clasifique erróneamente bloques de texto y aplique el modelo de idioma incorrecto. Seleccione sólo los idiomas que realmente aparecen en el documento, no todos los idiomas que crea que podrían ser útiles.
Escenarios comunes de OCR en varios idiomas y cómo manejarlos
El escenario multilingüe más común es un documento que está principalmente en un idioma con pasajes breves, citas o notas a pie de página en otro. Un artículo académico en inglés con citas en francés en las notas a pie de página. Un manual de instrucciones en alemán con términos técnicos en inglés. Un contrato legal en español con términos definidos en inglés. En estos documentos, el idioma principal contiene la mayor parte del texto y el idioma secundario aparece en contextos breves y predecibles.
El motor de reconocimiento maneja bien estos documentos de idiomas mixtos porque el cambio de idioma se localiza en bloques de texto específicos. El cuerpo del texto en inglés se reconoce con el modelo en inglés. La cotización francesa se reconoce con el modelo francés. Debido a que los dos idiomas aparecen en bloques de texto separados, la detección de idioma del motor identifica correctamente qué modelo usar para cada bloque.
Un escenario más desafiante es un documento donde los idiomas están intercalados en la misma línea, como un libro de texto de idiomas que muestra una oración en inglés seguida de su traducción en español en la misma línea. El motor de OCR puede tratar la línea completa como un bloque de texto y aplicar un modelo de idioma a toda ella, produciendo errores en la mitad de la línea que está en el otro idioma. Para estos documentos, el enfoque más preciso es realizar OCR del documento dos veces, una vez en cada idioma, y fusionar manualmente los resultados. Esto requiere mucha mano de obra y es práctico sólo para documentos cortos donde la precisión es crítica.
Verificación de resultados de OCR en varios idiomas
Después de ejecutar OCR en varios idiomas, verifique los resultados revisando el texto en cada idioma. Busque una palabra que sepa que aparece en cada idioma. Confirma que la búsqueda lo encuentra. Seleccione el texto en cada idioma y cópielo para confirmar que los caracteres sean correctos. Preste especial atención a los caracteres acentuados y a los símbolos especiales. Es más probable que el reconocimiento de PDF escaneado falle en caracteres que no existen en el modelo de idioma dominante porque el motor puede utilizar de manera predeterminada el equivalente latino más cercano.
Los errores comunes de OCR en documentos multilingües incluyen caracteres acentuados reemplazados por sus equivalentes sin acentos, e con acento se convierte en e, n con tilde se convierte en n, puntuación especial como signos de interrogación invertidos en español reemplazados por signos de interrogación estándar y escrituras no latinas como el cirílico o el griego que se reconocen erróneamente como caracteres latinos visualmente similares. Estos errores suelen concentrarse en los pasajes del idioma secundario. Si el contenido del idioma secundario es crítico, verifique manualmente esos pasajes con el documento original. La herramienta OCR de WukongPDF proporciona una puntuación de confianza para cada bloque de texto reconocido, y las puntuaciones más bajas indican bloques en los que el motor de reconocimiento era menos seguro.
Para documentos que mezclan idiomas con alfabeto latino y escrituras no latinas, como un documento en inglés con citas en chino o árabe, el desafío del OCR en varios idiomas es más significativo porque las formas de los caracteres son fundamentalmente diferentes. El motor de reconocimiento debe distinguir entre sistemas de escritura completamente separados. Seleccione los idiomas específicos para cada familia de escritura que aparece en el documento. El manejo del PDF Format de WukongPDF admite la mezcla de escrituras latinas, cirílicas, árabes, CJK e índicas en un solo trabajo de OCR, aunque la precisión varía según la escritura y la calidad del escaneo.
Una técnica práctica para mejorar el OCR multilingüe en documentos con distintas secciones de idioma: separe previamente el documento por idioma antes de ejecutar el OCR. Si un contrato de 20 páginas tiene las primeras 10 páginas en inglés y las últimas 10 páginas en español, divida el documento en dos archivos, ejecute OCR en inglés en el primero y OCR en español en el segundo, luego vuelva a fusionarlos. Esto evita por completo la sobrecarga del modelo multilingüe y produce una precisión ligeramente mayor porque cada trabajo de OCR utiliza un modelo de lenguaje único optimizado para el texto exacto que está procesando. El flujo de trabajo de división, OCR por separado y refusión lleva unos minutos adicionales, pero produce de manera confiable la mejor precisión para documentos con límites de idioma claros. Reserve el enfoque de OCR en varios idiomas para documentos en los que los idiomas estén realmente intercalados en la misma página y la separación no sea práctica.
Un último consejo para el OCR en varios idiomas: si el documento contiene escrituras de derecha a izquierda como árabe, hebreo o persa junto con escrituras de izquierda a derecha como inglés o francés, la dirección del texto añade complejidad. Los motores de OCR deben detectar no sólo en qué idioma se encuentra cada bloque de texto, sino también en qué dirección fluye el texto. Un bloque de texto árabe debe reconocerse de derecha a izquierda, mientras que el título en inglés debajo debe reconocerse de izquierda a derecha. La mayoría de los motores de OCR modernos manejan razonablemente bien documentos con direcciones mixtas cuando se especifican ambas familias de idiomas en la configuración. Después del OCR, verifique la dirección del texto copiando un pasaje en árabe y pegándolo en un editor de texto. Los caracteres deben aparecer en el orden de lectura correcto, no al revés.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
