Un PDF escaneado elaborado a partir de fuentes mixtas suele contener páginas tanto en orientación vertical como horizontal. Las hojas de cálculo financieras aparecen como páginas horizontales. Los documentos de texto que los acompañan aparecen como páginas verticales. La ejecución de OCR en un documento de este tipo sin tener en cuenta las orientaciones mixtas produce texto reconocido donde las palabras de las páginas horizontales están revueltas, giradas o omitidas por completo porque el motor de OCR procesó esas páginas en la orientación incorrecta.
Los motores OCR PDF analizan líneas de texto para determinar las posiciones de los caracteres y el orden de lectura. Cuando una página se gira 90 grados en relación con lo que espera el motor, las líneas de texto se ejecutan verticalmente en lugar de horizontalmente. El motor no reconoce el texto por completo o intenta leerlo verticalmente, lo que genera resultados sin sentido. Los documentos con orientación mixta requieren una detección de orientación por página antes del procesamiento OCR.
Las herramientas OCR PDF escaneado de WukongPDF manejan orientaciones de página mixtas con detección automática de rotación para cada página durante el proceso de reconocimiento.
Por qué es importante la orientación de la página para la precisión del OCR
Los motores de OCR funcionan detectando filas de caracteres y analizando las formas dentro de cada fila. Una página en orientación vertical tiene líneas de texto que corren horizontalmente, que el motor procesa de forma natural. Una página en orientación horizontal, cuando se ve sin corrección de rotación, tiene líneas de texto que se extienden verticalmente desde la perspectiva del motor de OCR. El motor espera texto horizontal y no puede leer texto vertical.
La solución es detectar la orientación de cada página antes del OCR y rotar las páginas horizontales a orientación vertical antes de procesarlas. Después del OCR, las páginas se pueden girar a su orientación original con la capa de texto reconocida correctamente colocada. La rotación durante el procesamiento no cambia permanentemente el documento; solo cambia la forma en que el motor de OCR ve la página.
La mayoría de las herramientas de OCR automatizadas asumen que todas las páginas comparten la misma orientación porque ese es el caso común de los documentos producidos por un solo escáner en una sola sesión. Los documentos de orientación mixta, a menudo creados combinando escaneos de diferentes fuentes, requieren una configuración explícita para manejar correctamente la variación por página.
Método 1: Acrobat Pro con detección de rotación por página
La función OCR de Acrobat Pro puede procesar documentos con orientación mixta cuando se configura adecuadamente. Abra el PDF escaneado en Acrobat Pro y vaya a Herramientas, Escanear y OCR, Reconocer texto, En este archivo. En el cuadro de diálogo de configuración de Reconocer texto, asegúrese de que esté seleccionado el idioma de OCR correcto para el idioma principal del documento. En la sección Configuración, habilite la opción Alinear y Enderezar, que ayuda a Acrobat a detectar la rotación de la página.
Acrobat procesa cada página individualmente e intenta detectar la orientación dominante del texto. Para las páginas donde la detección es correcta, la salida de OCR es precisa y legible. Para las páginas en las que falla la detección, como aquellas con texto mínimo o fondos visuales complejos, la salida de OCR puede estar codificada o completamente ausente. Después del procesamiento de OCR, revise específicamente las páginas horizontales. Busque texto que pueda ver visualmente en esas páginas. Si la búsqueda no encuentra nada, es probable que Acrobat haya identificado erróneamente la orientación.
Para las páginas que se identificaron erróneamente, gírelas manualmente en la herramienta Organizar páginas y vuelva a ejecutar OCR solo en esas páginas. La intervención manual toma solo un momento por página afectada y garantiza que cada página aporte texto reconocido preciso a la salida del documento con capacidad de búsqueda.
Método 2: Preprocesamiento con OCRmyPDF
OCRmyPDF, una herramienta de línea de comandos de código abierto construida sobre Tesseract OCR, maneja páginas de orientación mixta a través de su función de alineación incorporada. El comando ocrmypdf --deskew input.pdf output.pdf detecta la orientación del texto en cada página, rota las páginas según sea necesario, ejecuta OCR con Tesseract y genera un PDF con capacidad de búsqueda. El indicador de alineación es el parámetro esencial para el procesamiento de documentos de orientación mixta.
OCRmyPDF procesa páginas secuencialmente y aplica automáticamente la corrección de orientación por página. Para documentos con rotación extrema o páginas que contienen texto horizontal y vertical, el algoritmo de alineación orienta la página según la dirección dominante del texto, lo que proporciona los mejores resultados de OCR para la mayor parte del contenido de la página. La dirección del texto minoritario puede tener una precisión ligeramente reducida, pero en general todavía se reconoce.
En los flujos de trabajo de documentos, para el procesamiento por lotes de gran volumen de documentos de orientación mixta, OCRmyPDF combinado con un script de shell que procesa todos los archivos PDF en una carpeta proporciona OCR totalmente automatizado sin configuración manual por documento. La automatización maneja el procesamiento de rutina y solo los casos excepcionales requieren revisión humana.
Verificación específica de la salida de OCR en páginas horizontales
Después del procesamiento de OCR, verifique la salida en páginas horizontales como una verificación enfocada separada. Seleccione texto en una página horizontal en el PDF de salida y cópielo en un editor de texto sin formato. El texto copiado debe leerse en el orden correcto, coincidiendo con el contenido visual de la página de arriba a abajo y de izquierda a derecha. Si las palabras están desordenadas, desordenadas o aparecen en secuencias sin sentido, la detección de orientación falló para esa página.
Busque términos conocidos específicos que aparecen en páginas horizontales. Una tabla financiera en una página horizontal puede contener códigos de cuenta específicos, nombres de departamentos o valores numéricos que puede buscar en la salida de OCR. Si la búsqueda no encuentra coincidencias en páginas horizontales pero sí en páginas verticales del mismo documento, es probable que el motor de OCR haya omitido por completo el contenido horizontal. Estas páginas necesitan ser reprocesadas con la orientación manual especificada.
En los flujos de trabajo de documentos, para los documentos que servirán como archivos con capacidad de búsqueda, el paso de verificación es una puerta de calidad que detecta problemas de OCR relacionados con la orientación antes de que el documento ingrese a la colección permanente. Una salida de OCR no verificada que silenciosamente omite páginas enteras de contenido socava el propósito de crear un archivo con capacidad de búsqueda.
Procesamiento por lotes de colecciones escaneadas con orientación mixta
Para grandes colecciones de documentos escaneados con orientaciones mixtas, la verificación manual por página no es práctica. Automatice el proceso con OCRmyPDF y el indicador de alineación, luego ejecute un script de verificación que verifique cada página de salida para detectar la presencia de texto con capacidad de búsqueda. Las páginas sin caracteres de texto reconocidos o con muy pocos caracteres se marcan para revisión manual y posible reprocesamiento.
El script de verificación lee cada PDF procesado por OCR, extrae la capa de texto página por página y cuenta el número de caracteres reconocidos en cada página. Cualquier página por debajo de un umbral mínimo de caracteres, como diez caracteres, se marca como potencialmente sin procesar o mal orientada. Las páginas marcadas se compilan en un informe que guía el esfuerzo de revisión manual solo hacia las páginas que realmente necesitan atención humana, en lugar de requerir la revisión de cada página.
En cuanto a los flujos de trabajo, para los proyectos de digitalización en curso en los que llegan periódicamente nuevos documentos escaneados, el flujo de trabajo de verificación y procesamiento por lotes se convierte en un procedimiento operativo estándar. Los nuevos documentos entran en proceso, se procesan automáticamente a través de OCR con detección de orientación y solo excepciones requieren intervención humana. La automatización se encarga de la rutina. El revisor humano maneja las excepciones.
Mejora del OCR en páginas con rotación interna
Algunos documentos escaneados contienen páginas cuyo contenido se gira dentro de la página en lugar de girar la página misma. Se puede insertar una tabla financiera horizontal en un documento vertical girando el contenido de la tabla 90 grados manteniendo las dimensiones de la página en vertical. Estas páginas son las más difíciles para la detección de orientación porque las dimensiones de la página no proporcionan ninguna indicación de que sea necesaria la rotación.
En el procesamiento de documentos, para páginas con rotación interna, el preprocesamiento manual es el enfoque más confiable. En Acrobat Pro, utilice la herramienta Editar PDF para seleccionar el área de contenido rotada, gírela hasta la orientación horizontal correcta y colóquela correctamente en la página. Después de corregir la rotación interna, ejecute OCR en la página corregida. El paso de preprocesamiento manual dura aproximadamente un minuto por página afectada, pero produce resultados de OCR limpios y precisos.
La identificación de páginas con rotación interna requiere una inspección visual. Escanee el documento y busque páginas donde el texto parezca correr en una dirección inesperada en relación con los bordes de la página. Las páginas con rotación interna son relativamente raras en la mayoría de las colecciones de documentos, pero cuando aparecen afectan desproporcionadamente la calidad del OCR.
Elegir el motor de OCR adecuado para documentos con orientación mixta
Los diferentes motores de OCR manejan la detección de orientación con diferente precisión. Tesseract con el preprocesador de alineación maneja bien la rotación moderada, pero puede tener problemas con las páginas giradas exactamente 90 o 180 grados. Google Cloud Vision OCR incluye detección de orientación incorporada que maneja todos los ángulos de rotación de manera confiable. Para documentos críticos de orientación mixta donde la precisión es esencial, los servicios de OCR basados en la nube generalmente superan a los motores locales en el manejo de la orientación.
Pruebe el motor de OCR elegido en una pequeña muestra de páginas de orientación mixta antes de comprometerse con un lote grande. Una prueba de diez páginas con patrones de orientación conocidos revela cómo el motor maneja los tipos de rotación específicos en sus documentos. La prueba dura unos minutos y evita horas de reprocesamiento si la detección de orientación del motor resulta inadecuada para sus tipos de documentos particulares.
Exportación de texto OCR de documentos de orientación mixta para verificación
Después del procesamiento de OCR, exporte el texto reconocido para verificar que esté completo en todas las páginas. En Acrobat Pro, vaya a Herramientas, Exportar PDF y elija Texto como formato de salida. El archivo de texto exportado debe contener contenido de cada página en el orden de lectura correcto. Abra el archivo de texto y busque términos que sepa que aparecen en páginas horizontales específicas. Si esos términos faltan en la exportación, es probable que esas páginas estuvieran mal orientadas durante el OCR y deban volver a procesarse.
En cuanto al manejo de documentos, para los documentos destinados a archivos con capacidad de búsqueda, el texto exportado sirve como una verificación independiente de que cada página contribuyó con su contenido a la capa con capacidad de búsqueda. Una exportación de texto que tiene espacios o secciones faltantes indica fallas de OCR que requieren atención antes de que el documento ingrese al archivo permanente. El paso de exportación funciona como una puerta de calidad que detecta problemas de OCR relacionados con la orientación antes de que se conviertan en deficiencias permanentes del archivo.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
