Tips & Tricks

Cómo realizar OCR en un PDF con dirección de texto vertical o de derecha a izquierda

Los motores de OCR estándar se basan en una suposición fundamental: el texto se extiende horizontalmente de izquierda a derecha en la página. Esta suposición funciona para inglés, español, francés, alemán y la mayoría de los idiomas europeos. Falla completamente para el texto japonés colocado verticalmente en columnas tradicionales, para los signos chinos donde los caracteres se apilan de arriba a abajo y para los documentos árabes y hebreos donde el texto fluye de derecha a izquierda. La ejecución de OCR estándar en estos documentos produce resultados en los que los caracteres se reconocen individualmente pero se ensamblan en el orden incorrecto, lo que hace que el resultado sea inútil.

La capacidad de los motores OCR PDF para manejar direcciones de texto no estándar ha mejorado significativamente con la última generación de sistemas de reconocimiento basados en IA. Estos motores detectan la orientación del texto antes de intentar el reconocimiento, identifican la dirección de lectura y reconstruyen el orden lógico de lectura independientemente del diseño visual. Para documentos con direcciones de texto mixtas, como un artículo japonés que incluye citas horizontales en inglés, el motor cambia de modo a mitad de página.

How to OCR a PDF With Vertical or Right-to-Left Text Direction

Cómo los motores OCR detectan y manejan la dirección del texto

Los motores de OCR modernos comienzan con un paso de análisis de diseño que identifica regiones de texto, determina su orientación y las clasifica según la dirección de lectura. Para texto horizontal, el motor detecta la línea base y agrupa caracteres a lo largo de ella. Para texto vertical, el motor detecta el eje vertical y agrupa los caracteres en columnas. Para el texto de derecha a izquierda, el motor identifica el conjunto de caracteres dominante e invierte el orden predeterminado de las palabras de izquierda a derecha.

La detección de la dirección del texto se basa en varias señales. La presencia de rangos de caracteres Unicode específicos indica idiomas probables y sus direcciones de texto típicas. La disposición espacial de los caracteres detectados, ya sea que formen líneas horizontales o columnas verticales, proporciona evidencia de diseño. La relación de aspecto de los cuadros delimitadores de caracteres proporciona una tercera señal: los caracteres latinos suelen ser más anchos que altos, mientras que los caracteres CJK son aproximadamente cuadrados y los caracteres árabes se conectan horizontalmente de manera que revelan la dirección de lectura.

Los motores OCR más fiables combinan los tres tipos de señales. Un documento que contiene escritura árabe, que implica lectura de derecha a izquierda, y escritura latina, que implica lectura de izquierda a derecha, requiere que el motor analice cada región del texto de forma independiente. Una canalización Extract PDF Data correctamente configurada para documentos multilingües incluye detección de dirección por región en lugar de aplicar una única dirección a toda la página.

Cada sistema de escritura exige una configuración de OCR fundamentalmente diferente.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →

Configuración de OCR para texto vertical en japonés, chino y coreano

El texto vertical japonés, llamado tategaki, es el sistema de escritura vertical más común en el uso moderno. Aparece en novelas, periódicos, documentos tradicionales y correspondencia formal. En japonés vertical, los caracteres se leen de arriba a abajo y las columnas avanzan de derecha a izquierda a lo largo de la página. Los números y palabras en escritura latina incrustados en texto japonés vertical se pueden rotar o establecer horizontalmente dentro del flujo vertical.

Para realizar OCR en texto japonés vertical, seleccione un motor de reconocimiento que admita explícitamente tategaki. Los motores de OCR de uso general pueden detectar los caracteres correctamente pero generarlos en orden horizontal de izquierda a derecha, lo que produce basura. Los motores de OCR específicos para japonés comprenden el orden de lectura basado en columnas y generan texto que se puede leer de forma natural. Tesseract, el motor OCR de código abierto, agregó soporte vertical japonés mejorado en la versión 5, y varios motores comerciales ahora lo ofrecen.

Para el texto vertical chino, que aparece en publicaciones tradicionales, caligrafía y algunos documentos formales, el desafío de reconocimiento es similar pero el conjunto de caracteres es mayor. El chino simplificado utiliza aproximadamente 7.000 caracteres de uso común, mientras que el chino tradicional utiliza más de 13.000. El motor de OCR no sólo debe detectar el diseño vertical sino también distinguir entre caracteres visualmente similares que difieren sólo en el detalle de los trazos.

El texto vertical coreano es poco común en los documentos modernos, pero aparece en textos históricos y algunas publicaciones tradicionales. El alfabeto coreano, Hangul, reúne letras individuales en bloques de sílabas y, en la escritura vertical, estos bloques se apilan de arriba a abajo. Los motores de OCR que manejan texto vertical coreano deben reconocer la estructura del bloque de sílabas, así como los componentes de letras individuales dentro de cada bloque.

Configuración de OCR para texto de derecha a izquierda en árabe, hebreo y persa

El OCR árabe presenta desafíos únicos más allá de la dirección del texto. El árabe es una escritura cursiva en la que la mayoría de las letras se conectan con sus vecinas y la forma de la letra cambia según su posición en la palabra: inicial, medial, final o aislada. El motor de OCR debe reconocer estas formas contextuales y asignarlas al carácter abstracto correcto. Las conexiones perdidas o falsas entre letras producen errores de reconocimiento que son específicos de las escrituras cursivas.

Al seleccionar OCR hebreo, la escritura no es cursiva pero incluye puntos vocales, llamados niqqud, que aparecen como puntos y guiones encima, debajo o dentro de las letras. Estas marcas vocales son pequeñas, normalmente de 2 a 4 píxeles en una imagen escaneada, y se pierden fácilmente durante la binarización. Un motor de OCR que no maneje explícitamente niqqud reconocerá las consonantes correctamente pero eliminará las vocales, produciendo un texto que un lector humano puede entender pero que es técnicamente incompleto.

El persa y el urdu utilizan versiones ampliadas de la escritura árabe con caracteres adicionales. Un motor de OCR entrenado únicamente en árabe omitirá estos caracteres adicionales o los reconocerá erróneamente como letras árabes similares. Al seleccionar un motor de OCR para estos idiomas, verifique que incluya específicamente soporte para el idioma exacto y la variante de escritura que utiliza su documento, no solo la escritura árabe en general.

Manejo de documentos en direcciones mixtas

Muchos documentos del mundo real combinan varias direcciones de texto en la misma página. Un artículo técnico japonés puede tener un cuerpo de texto vertical en japonés, leyendas de figuras horizontales en inglés y ecuaciones matemáticas que siguen sus propias reglas de diseño. Una carta comercial en árabe puede incluir el nombre de la empresa en inglés y un bloque de dirección en formato de izquierda a derecha encima del texto del cuerpo de derecha a izquierda.

Para documentos de direcciones mixtas, el paso de preprocesamiento de OCR es fundamental. El documento debe segmentarse en regiones de texto y cada región debe clasificarse de forma independiente según la dirección del texto antes de que comience el reconocimiento. La selección manual de regiones suele producir mejores resultados que la segmentación automática para diseños complejos. Dibuje cuadros delimitadores alrededor de cada región de texto y asigne el idioma y la dirección correctos a cada cuadro.

Después del OCR, verifique el resultado comprobando el texto que cruza los límites de dirección. Un error común en el OCR de dirección mixta es equivocarse en el límite entre dos regiones de texto, de modo que la última palabra de una región de izquierda a derecha se agregue al comienzo de una región de derecha a izquierda, o viceversa. La verificación puntual de estas áreas límite detecta errores de segmentación del diseño que, de otro modo, producirían resultados confusos.

Procesamiento posterior al OCR para instrucciones de texto no estándar

Una vez finalizado el OCR, es posible que sea necesario reordenar el texto reconocido para producir un orden de lectura natural. Algunos motores de OCR generan texto japonés vertical en el orden en que fue reconocido, de arriba a abajo dentro de cada columna, columna por columna de izquierda a derecha. Este orden no coincide con el orden de lectura original, que es columna por columna de derecha a izquierda. Un paso de posprocesamiento que reordena las columnas produce la secuencia de lectura correcta.

Para documentos con contenido PDF escaneado que incluye texto bidireccional, árabe con términos en inglés integrados, el algoritmo bidireccional Unicode especifica cómo determinar el orden de visualización. La salida de OCR debe incluir caracteres de control bidireccional Unicode o seguir el algoritmo para que el texto se muestre correctamente cuando se pegue en aplicaciones que admitan texto bidireccional.

WukongPDF proporciona procesamiento OCR a través del navegador para archivos PDF escaneados, con opciones de selección de idioma que incluyen soporte para los principales sistemas de escritura vertical y de derecha a izquierda. Probar el OCR en una página de muestra antes de procesar el documento completo le permite verificar que la dirección del texto se maneja correctamente.

Para documentos que contienen texto vertical y horizontal en la misma página, como el diseño de una revista japonesa donde el artículo principal es vertical pero los títulos y las barras laterales son horizontales, la zonificación manual produce los resultados de OCR más precisos. Dibuje zonas de reconocimiento separadas para las regiones vertical y horizontal, asigne la dirección del texto correcta a cada una y ejecute OCR en el documento zonificado. El tiempo extra dedicado a la zonificación se traduce en precisión en el reconocimiento.

Al procesar documentos históricos con diseños de texto no estándar, prepárese para que la precisión del OCR sea menor que la de los documentos impresos modernos. Las fuentes históricas, la impresión desigual, el papel envejecido con decoloración y las variantes de caracteres no estándar reducen la confianza en el reconocimiento. Para trabajos académicos o de archivo, trate la salida de OCR como un punto de partida para la transcripción manual en lugar de como un producto terminado.

Algunos motores de OCR admiten un modo de formación en el que se proporcionan ejemplos de la fuente o el estilo de escritura específicos utilizados en el documento. Entrenar el motor en algunas páginas representativas mejora la precisión del reconocimiento en todo el documento. Este enfoque es particularmente útil para documentos impresos con tipos de letra inusuales o para colecciones de documentos del mismo editor donde la tipografía es consistente en varios volúmenes.

Una vez que se complete el OCR en un documento de derecha a izquierda, verifique que la dirección del texto sea correcta copiando algunas oraciones del resultado y pegándolas en una aplicación que admita texto bidireccional, como Microsoft Word o Google Docs. Si el texto aparece en orden inverso, el motor de OCR no aplicó correctamente la dirección de derecha a izquierda y la salida debe reprocesarse con la configuración de dirección corregida.

El tiempo invertido en configurar los parámetros correctos de OCR para instrucciones de texto no estándar se amortiza inmediatamente en precisión de reconocimiento. Un documento que requiere 30 minutos de corrección manual después de un OCR deficiente puede necesitar solo 5 minutos de limpieza después de configurar el OCR correctamente.

Sistema de escrituraDirecciónRequisito del motor OCRDesafío clave
Japonés (tategaki)Columnas de arriba a abajo y de derecha a izquierdaMotor con soporte explícito para tategaki.Inglés horizontal mixto en flujo vertical.
Chino (tradicional)Columnas verticales, de derecha a izquierdaConjunto de caracteres grande (más de 13.000)Personajes visualmente similares
árabeConexión cursiva de derecha a izquierdaMotor de escritura árabe con formas posicionales.Formas de letras contextuales; signos diacríticos
hebreoDe derecha a izquierda, con niqqudMotor de escritura hebrea con soporte vocalLas vocales pequeñas se pierden en la binarización
Persa / UrduÁrabe extendido de derecha a izquierdaMotor específico del idiomaCaracteres adicionales más allá del conjunto árabe
WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →