Los motores OCR PDF se basan en un flujo de texto de izquierda a derecha. Cuando les proporciona un documento escrito en una escritura de derecha a izquierda, como árabe, hebreo, persa o urdu, el motor debe detectar la dirección de la escritura, reconocer los caracteres en el orden visual y lógico correcto y generar un texto que se lea naturalmente en el idioma de destino. Hacer mal uno de estos pasos produce un texto técnicamente reconocido pero funcionalmente inutilizable: palabras escritas al revés, oraciones que comienzan al final y números que aparecen en el lado equivocado del texto circundante.
El OCR correcto para idiomas de derecha a izquierda requiere seleccionar un motor de OCR que admita explícitamente el script de destino, configurarlo con el parámetro de idioma correcto y verificar la salida a través de herramientas bidireccionales con reconocimiento de texto. El proceso no es materialmente más difícil que el OCR para lenguajes de izquierda a derecha, pero el paso de configuración que muchos usuarios se saltan, diciéndole al motor qué idioma esperar, no es opcional para scripts de derecha a izquierda. Un motor que se deja en su configuración predeterminada, generalmente inglés, producirá resultados sin sentido a partir de un documento árabe o hebreo.
Las herramientas de OCR PDF escaneado de WukongPDF admiten varios idiomas, incluidas escrituras de derecha a izquierda. Seleccionar el idioma correcto antes de ejecutar OCR es la diferencia entre extraer texto utilizable y generar ruido de caracteres.

Por qué falla el OCR de derecha a izquierda sin una configuración explícita
Los motores de OCR analizan formas y las asignan a caracteres en el conjunto de caracteres del idioma especificado. Cuando el motor espera inglés, interpreta las formas como letras latinas. La letra árabe de B se parece algo a la letra latina B en muchas fuentes, pero la letra árabe de Ayn no tiene equivalente latino. Un motor en modo inglés que encuentra a Ayn genera un signo de puntuación aleatorio o se salta el carácter por completo. En un documento completo, este error de reconocimiento carácter por carácter produce resultados sin relación con el texto original.
Incluso cuando se selecciona la escritura correcta, la dirección del texto introduce una segunda capa de complejidad. Los motores de OCR procesan imágenes de izquierda a derecha de forma predeterminada, moviéndose a través de cada fila de píxeles desde el borde izquierdo al derecho. Un documento de derecha a izquierda debe procesarse de derecha a izquierda para que el motor lea los caracteres en el orden en que fueron escritos. Si el motor no invierte su dirección de procesamiento para escrituras de derecha a izquierda, los caracteres reconocidos estarán en orden inverso dentro de cada palabra. Algunos motores manejan la inversión de dirección automáticamente cuando se establece el parámetro de idioma. Otros requieren una marca de dirección de texto explícita.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
Configuración de Tesseract para OCR de derecha a izquierda
Tesseract, el motor de OCR de código abierto, admite árabe, hebreo, persa, urdu y varios otros scripts de derecha a izquierda a través de archivos de datos específicos del idioma. Instale los datos de idioma para el script de destino. En Linux, el paquete suele denominarse tesseract-ocr-ara en árabe o tesseract-ocr-heb en hebreo. En Windows, descargue el archivo de datos entrenado del repositorio de Tesseract GitHub y colóquelo en el directorio tessdata.
Ejecute Tesseract con el indicador de idioma configurado en la secuencia de comandos correcta: tesseract input.pdf salida -l ara para árabe, -l heb para hebreo o -l ara+eng para un documento bilingüe árabe-inglés. Tesseract maneja la dirección del texto automáticamente cuando el parámetro de idioma especifica una escritura de derecha a izquierda. La salida de texto reconocida conserva el orden de lectura correcto. Para verificar, abra el archivo de texto de salida y confirme que las palabras se lean en la dirección esperada y que las oraciones fluyan de derecha a izquierda.
Para documentos con escrituras mixtas, como un trabajo de investigación en árabe que contiene términos técnicos en inglés, especifique ambos idiomas separados por un signo más: -l ara+eng. Tesseract cambia entre los modelos de idioma por palabra, aplicando el modelo árabe a palabras en escritura árabe y el modelo inglés a palabras en escritura latina. El cambio por palabra no es perfecto, especialmente en palabras cortas que podrían pertenecer a cualquiera de las dos escrituras, pero maneja adecuadamente la mayoría de los documentos con escritura mixta.
Uso de Google Cloud Vision para la detección automática
Las capacidades de OCR de Google Cloud Vision incluyen la detección automática de idioma, lo cual es particularmente útil para escrituras de derecha a izquierda cuando no está seguro del idioma exacto o cuando el documento contiene varios idiomas de derecha a izquierda. La API acepta una imagen de documento y devuelve texto reconocido con cuadros delimitadores para cada palabra, el idioma detectado para cada bloque de texto y la dirección del texto. Para escrituras de derecha a izquierda, el texto devuelto ya está en el orden de lectura correcto.
La calidad de reconocimiento de árabe y hebreo de Cloud Vision es generalmente mayor que la de Tesseract porque los modelos subyacentes se han entrenado en conjuntos de datos más grandes y diversos. La desventaja es que la imagen del documento debe cargarse en los servidores de Google para su procesamiento, lo que puede no ser aceptable para documentos sensibles o confidenciales. Para documentos disponibles públicamente o documentos internos donde se aprueba el procesamiento en la nube, Cloud Vision proporciona el OCR de derecha a izquierda más preciso disponible sin necesidad de comprar software de OCR de escritorio especializado.
| Idioma | Soporte del motor OCR | Notas de precisión |
|---|---|---|
| árabe | Teseracto, Google Cloud Vision, ABBYY | Es posible que se omitan los signos diacríticos, el manejo de la ligadura varía |
| hebreo | Teseracto, Google Cloud Vision, ABBYY | Los puntos vocales Nikud a menudo se pierden durante el OCR |
| persa/urdu | Tesseract, visión de la nube de Google | Las variantes del script Nastaliq desafían a la mayoría de los motores |
Verificación de la salida OCR para texto de derecha a izquierda
Después del OCR, abra el texto reconocido en un editor de texto que admita la representación de texto bidireccional, como Notepad++ con el complemento bidireccional habilitado o Visual Studio Code con un paquete de idioma RTL instalado. Los editores de texto estándar que asumen texto de izquierda a derecha pueden mostrar texto de derecha a izquierda correctamente si se implementa el algoritmo bidireccional Unicode, pero los signos de puntuación al final de las líneas y el orden relativo de los números dentro del texto son puntos de falla comunes. Un editor de texto con soporte bidireccional explícito muestra el texto como un hablante nativo esperaría leerlo.
Compare el resultado con el documento escaneado original en tres niveles: palabras individuales, en particular aquellas que contienen signos diacríticos o ligaduras; oraciones completas, confirmando que el orden de las palabras se lee naturalmente en el idioma de destino; y números y fechas, confirmando que aparecen en el lado correcto del texto circundante. Un documento donde cada palabra se reconoce correctamente pero el orden de las palabras está invertido dentro de cada oración es tan inutilizable para traducción o búsqueda como un documento donde no se reconoce ninguna palabra.
El OCR para idiomas de derecha a izquierda es un problema técnico resuelto cuando se establece el parámetro de idioma correcto. El paso más importante es decirle al motor qué script esperar. Todo lo posterior a esa decisión, desde la precisión del reconocimiento hasta el orden de lectura y el manejo de secuencias de comandos mixtas, depende de lograr la configuración correcta del idioma. Con el parámetro de idioma configurado y un editor de texto bidireccional abierto para verificación, el OCR para un documento en idioma de derecha a izquierda no requiere más tiempo ni esfuerzo que el OCR para cualquier otro idioma.
Traducción post-OCR de texto en lenguaje de derecha a izquierda
Una vez que el texto se reconoce con precisión, traducir contenido lingüístico de derecha a izquierda requiere un motor de traducción que maneje el texto bidireccional correctamente. Google Translate y DeepL admiten árabe, hebreo y persa. Pegue el texto reconocido en la interfaz de traducción y confirme que el idioma de origen esté identificado correctamente. El motor de traducción detecta la dirección del guión y la conserva en el resultado. Para documentos cuya traducción será revisada por un hablante nativo, exporte tanto el texto original reconocido como el texto traducido uno al lado del otro en una tabla de dos columnas para una comparación eficiente.
La traducción automática de idiomas de derecha a izquierda es generalmente menos precisa que la traducción entre idiomas europeos de izquierda a derecha porque los datos de entrenamiento para muchos pares de idiomas de derecha a izquierda son más pequeños. Para documentos críticos, haga que un hablante nativo revise la traducción antes de actuar sobre su contenido. El paso OCR produce texto fuente preciso. El paso de traducción agrega una capa de interpretación. Trate el resultado del OCR como verdad sobre lo que dice el documento y la traducción automática como una guía de lo que significa, sujeta a verificación.
Procesamiento por lotes de archivos PDF en idioma de derecha a izquierda
Cuando tiene una carpeta de archivos PDF en idioma de derecha a izquierda para OCR, la interfaz de línea de comandos de Tesseract acepta entradas por lotes. Un único comando de shell procesa cada PDF: for f en *.pdf; hacer tesseract $f ${f%.pdf} -l ara; hecho. El comando recorre todos los archivos PDF, ejecuta OCR con el modelo árabe y guarda el texto reconocido junto con cada PDF con nombres de archivo base coincidentes.
Para lotes de idiomas mixtos, utilice un paso de detección de idioma antes del OCR. Un script de Python con la biblioteca langdetect muestra la primera página de texto para predecir el idioma. Según la predicción, el script selecciona el parámetro de lenguaje Tesseract apropiado y ejecuta OCR. La detección de idioma automatizada elimina la clasificación manual de archivos PDF por idioma antes del procesamiento por lotes. El OCR por lotes para idiomas de derecha a izquierda transforma un tedioso proceso por documento en un único comando que se completa en minutos, independientemente de cuántos documentos haya en la carpeta de entrada.
El OCR para idiomas de derecha a izquierda no es un caso especial que requiera herramientas exóticas. Requiere las mismas herramientas que el OCR de izquierda a derecha, configuradas con el parámetro de idioma correcto. El paso de configuración que muchos usuarios omiten porque suponen que los valores predeterminados de OCR funcionarán es la diferencia total entre texto extraído utilizable y ruido de caracteres completo. Configure la bandera de idioma, ejecute el OCR, verifique la salida en un editor de texto bidireccional y el proceso estará completo. El OCR para secuencias de comandos de derecha a izquierda recompensa al usuario que se toma el tiempo para configurar el parámetro de idioma correctamente y verifica la salida en un editor de texto bidireccional, produciendo texto preciso y utilizable a partir de documentos que de otro modo permanecerían inaccesibles para cualquiera que no lea el idioma de origen.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
