Tips & Tricks

Cómo realizar OCR en un documento escaneado donde las páginas alternan entre orientación vertical y horizontal dentro de un único volumen encuadernado

Al escanear un volumen encuadernado, como un libro, una tesis, una revista o un libro de contabilidad, se genera un PDF donde las páginas alternan entre orientación vertical y horizontal. Las páginas de la izquierda del libro abierto se escanean en una orientación y las páginas de la derecha en otra, o el libro completo se escanea con rotaciones de páginas alternas porque el operador del escáner volteó el libro para cada página sin rotar la imagen escaneada. El resultado es un PDF en el que cada dos páginas aparecen giradas 90 o 180 grados cuando se ven en la pantalla. Al ejecutar OCR en este documento sin normalizar primero las orientaciones de la página, se produce un texto que alterna entre la orientación correcta y la rotación, lo que hace que el texto reconocido no se pueda utilizar para la búsqueda o extracción. La solución requiere un paso de preprocesamiento que detecta y corrige la orientación de cada página antes de que el OCR la procese.

How to OCR a Scanned Document Where Pages Alternate Between Portrait and Landscape Orientation Within a Single Bound Volume

Por qué el escaneo de volumen encuadernado produce orientaciones de página alternas

Al escanear un volumen encuadernado, cada página extendida coloca dos páginas boca abajo en la plataforma del escáner. La página izquierda del libro aparece en el lado derecho de la plataforma del escáner y la página derecha aparece en el lado izquierdo, giradas 180 grados entre sí. Si el operador del escáner no corrige esta rotación para cada página individual, el PDF escaneado contiene páginas en las que una de cada dos páginas está al revés. Un libro de 200 páginas produce un PDF con 200 páginas donde 100 están orientadas correctamente y 100 giradas 180 grados. El patrón es regular y predecible: todas las páginas impares pueden estar correctamente orientadas y todas las pares rotadas, o viceversa.

Algunos volúmenes encuadernados se escanean colocando el libro abierto en el escáner con el texto horizontal, produciendo una única imagen que contiene las páginas izquierda y derecha. Luego, esta imagen se divide en dos páginas separadas, pero el proceso de división no siempre gira la página de la derecha para que coincida con la orientación de la página de la izquierda. El resultado es un PDF donde las páginas de la izquierda están orientadas correctamente y las páginas de la derecha están giradas 90 grados, o viceversa. El motor de OCR, que espera que el texto se extienda horizontalmente de izquierda a derecha a lo largo de la página, no puede reconocer el texto en las páginas rotadas porque el texto se ejecuta verticalmente o al revés.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →

Detección de la orientación de la página antes del procesamiento OCR

Antes de ejecutar OCR, inspeccione las miniaturas de las páginas en el visor de PDF. La orientación alterna es visible inmediatamente en el panel de miniaturas, donde cada dos miniaturas aparecen giradas. Cuente el patrón de orientación: las páginas impares correctas y las páginas pares rotadas es el patrón más común, pero también es posible lo contrario. Si el patrón es consistente, una operación de rotación por lotes puede corregir todas las páginas afectadas con un solo comando. La mayoría de los visores de PDF permiten seleccionar varias páginas en el panel de miniaturas y aplicar una rotación a todas las páginas seleccionadas simultáneamente. Seleccione todas las páginas pares, gírelas 180 grados o 90 grados según sea necesario y guarde el documento. El panel de miniaturas ahora muestra todas las páginas en la orientación correcta.

La herramienta OCR PDF de WukongPDF procesa cada página de forma independiente, pero asume que el texto está orientado horizontalmente. Si se gira la página, el motor de OCR no reconoce ningún texto o produce resultados confusos porque intenta leer texto vertical o al revés como si fuera horizontal. Corregir la orientación de la página antes del OCR es un paso de preprocesamiento obligatorio. Después de rotar las páginas afectadas y guardar el documento, ejecute OCR en el PDF normalizado. La precisión del reconocimiento será constante en todas las páginas porque ahora cada página presenta el texto en la orientación que espera el motor de OCR.

Manejo de patrones de orientación inconsistentes en todo el documento

No todos los volúmenes encuadernados producen un patrón alterno limpio. Un libro escaneado por dos operadores diferentes, un conjunto de varios volúmenes escaneados en diferentes momentos o un documento que se volvió a escanear parcialmente después del escaneo inicial pueden tener patrones de orientación irregulares. Las páginas 1 a 50 pueden seguir el patrón alterno, las páginas 51 a 80 pueden estar orientadas correctamente porque se volvieron a escanear con la rotación adecuada y las páginas 81 a 200 pueden volver al patrón alterno. La detección y corrección deben realizarse sección por sección y no con una sola operación por lotes.

Para patrones de orientación irregulares, el método más confiable es el método manual de desplazarse por las miniaturas y rotar páginas individuales o rangos de páginas. Comience en la página uno y explore las miniaturas. Cuando encuentre una página rotada, determine cuántas páginas consecutivas comparten esa orientación. Seleccione el rango y aplique la rotación. Continúe a través del documento hasta que cada página esté orientada correctamente. El proceso tarda entre uno y dos segundos por página, por lo que un documento de 200 páginas requiere aproximadamente cinco minutos. El tiempo está bien invertido porque la precisión del OCR en páginas orientadas correctamente es dramáticamente mayor que en páginas rotadas.

Automatización de la detección de orientación para proyectos de gran volumen encuadernado

Para proyectos de digitalización que involucran cientos o miles de páginas, la verificación manual de la orientación página por página resulta poco práctica. Las herramientas automatizadas de detección de orientación pueden identificar páginas rotadas analizando la dirección del texto. Estas herramientas toman muestras de caracteres de texto en la página y determinan la orientación dominante al reconocer qué rotación produce palabras válidas en el idioma esperado. Una página en la que el reconocimiento de texto tiene éxito en 0 grados pero falla en 90, 180 y 270 grados está orientada correctamente. Una página donde el reconocimiento se realiza correctamente en 180 grados pero falla en 0 está al revés y necesita rotación. La detección automatizada procesa rápidamente grandes conjuntos de documentos y una verificación manual de los resultados confirma que la automatización funcionó correctamente antes de que comience el OCR.

Verificación de la salida de OCR en orientaciones alternas

Después de corregir las orientaciones de las páginas y ejecutar OCR, verifique que la calidad del reconocimiento sea consistente en todo el documento. Busque texto que aparezca tanto en las páginas originalmente correctas como en las rotadas originalmente. La búsqueda debería encontrar instancias en ambos tipos de páginas con la misma confiabilidad. Si no se encuentra el texto en las páginas giradas originalmente, es posible que la corrección de rotación no se haya aplicado correctamente o que el motor de OCR haya procesado algunas páginas antes de guardar la rotación. Vuelva a abrir el documento, confirme que todas las orientaciones de las páginas sean correctas en el panel de miniaturas y vuelva a ejecutar OCR si es necesario.

Para volúmenes encuadernados donde la calidad del escaneo original varía entre páginas, como un libro donde algunas páginas se presionaron planas contra el cristal del escáner y otras tienen curvatura cerca del lomo, la precisión del OCR variará en consecuencia. La corrección de orientación resuelve el problema de rotación pero no compensa otros problemas de calidad del escaneo. Es posible que sea necesario volver a escanear o preprocesar las páginas con una curvatura significativa con un filtro de corrección de distorsión antes de que el OCR pueda alcanzar una precisión aceptable. La canalización de PDF escaneado a texto con capacidad de búsqueda funciona mejor cuando las imágenes de origen están lo más limpias y uniformemente orientadas posible. La corrección de la orientación es el primer paso y el más impactante. La corrección de distorsión, el ajuste del contraste y la eliminación de manchas son los pasos siguientes que mejoran aún más la precisión del reconocimiento en escaneos desafiantes de volumen encuadernado.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →