Tips & Tricks

Cómo realizar OCR en un trabajo académico escaneado donde el texto de las notas al pie y las citas de los márgenes se superponen físicamente con la columna de texto del cuerpo principal

How to OCR a Scanned Academic Paper Where Footnote Text and Margin Citations Physically Overlap With the Main Body Text Column

Por qué el OCR tiene problemas con la superposición del texto de las notas al pie y el contenido de los márgenes

Los motores de reconocimiento óptico de caracteres funcionan mejor cuando el texto se ubica en bloques limpios y predecibles con un interlineado constante y una separación clara entre las regiones de contenido. Una operación OCR PDF en una carta comercial estándar o en una página novedosa normalmente produce resultados precisos porque el texto fluye en párrafos ordenados con amplios márgenes en todos los lados. Los artículos académicos presentan un problema fundamentalmente más difícil porque su diseño empaqueta deliberadamente múltiples flujos de texto distintos en una estrecha proximidad física, con notas a pie de página, citas al margen y texto del cuerpo a menudo tocándose o superponiéndose en sus límites.

El desafío principal es la segmentación, el paso en el que el motor de OCR divide la imagen de la página en regiones de texto antes de intentar el reconocimiento de caracteres. Cuando un número de referencia de nota al pie en superíndice en el cuerpo del texto se encuentra directamente encima de una línea separadora de notas al pie, y esa línea se encuentra directamente encima del texto de la nota al pie con un tamaño de fuente más pequeño, el algoritmo de segmentación debe decidir dónde termina una región de texto y comienza la siguiente. Una decisión de segmentación incorrecta aquí deriva en errores de reconocimiento porque los caracteres de dos flujos de texto diferentes se introducen en el motor de reconocimiento como si fueran una sola línea continua. El resultado se lee como un galimatías que mezcla palabras del cuerpo del texto con fragmentos de notas al pie.

Las citas al margen añaden un tercer flujo de texto al problema. En artículos de humanidades que siguen el estilo de Chicago o documentos legales que utilizan el formato Bluebook, las notas al margen, los números de línea o las citas paralelas se encuentran vertical u horizontalmente a lo largo de la columna de texto principal. Estos elementos de margen suelen imprimirse en un tamaño de puntos más pequeño, a veces de 7 u 8 puntos, y pueden utilizar fuentes en cursiva o condensadas con las que los motores de OCR ya tienen problemas en tamaños normales. Cuando el texto del margen toca físicamente el texto del cuerpo, lo que ocurre con frecuencia en revistas con formato estricto y márgenes estrechos, el desafío de la segmentación se vuelve triple en lugar de bidireccional.

La calidad del papel de la fuente PDF escaneado también agrava la dificultad del OCR. Muchos artículos académicos se escanean a partir de volúmenes encuadernados donde la curvatura de la página cerca del lomo hace que el texto se doble y distorsione. Las notas a pie de página en la parte inferior de la página son la sección más afectada por la curvatura del lomo porque se encuentran más cerca de la encuadernación. La combinación de distorsión física de la página curva, tamaño de fuente pequeño y proximidad al cuerpo del texto de arriba crea una tormenta perfecta de condiciones adversas para la precisión del OCR.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →

Preprocesamiento de la página escaneada para separar regiones de texto superpuestas

La forma más eficaz de mejorar la precisión del OCR en páginas académicas con elementos de texto superpuestos es preprocesar la imagen de la página antes de que llegue al motor de OCR. Este preprocesamiento separa los diferentes flujos de texto para que el motor nunca tenga que tomar decisiones de segmentación ambiguas.

Comience por enderezar la página escaneada para asegurarse de que todas las líneas de texto queden perfectamente horizontales. Incluso una inclinación de un grado en el escaneo original puede hacer que el texto de las notas al pie se desplace hacia la región del cuerpo del texto en los bordes de la página, creando superposiciones falsas que no existirían en una página correctamente alineada. La mayoría del software de escaneo de documentos incluye corrección automática, pero para los trabajos académicos escaneados a partir de volúmenes encuadernados, la corrección manual con una línea de referencia dibujada a lo largo de la línea base del cuerpo del texto produce resultados más precisos que la corrección automática.

Después de enderezar, el siguiente paso es el enmascaramiento de regiones. Utilizando un editor de imágenes o una herramienta de preprocesamiento de OCR dedicada, dibuje una línea separadora horizontal entre el área del cuerpo del texto y el área de las notas al pie. Esta línea le indica al motor de OCR posterior que trate todo lo que está encima como una región de texto y todo lo que está debajo como una región de texto separada. En las páginas donde hay notas al pie, el separador debe ubicarse justo encima de la regla de las notas al pie, la línea horizontal corta que tradicionalmente separa el texto del cuerpo de las notas al pie en los trabajos académicos impresos. En páginas sin notas a pie de página no se necesita ningún separador.

Para citas al margen y números de línea, el enmascaramiento vertical es el enfoque equivalente. Dibuja un separador vertical entre el texto del margen y la columna de texto principal. En páginas con números de línea en el margen izquierdo y citas en el margen derecho, ambos lados necesitan separadores verticales. El objetivo es dividir la página en regiones rectangulares donde cada región contiene exactamente un flujo de texto. Luego, el motor de OCR procesa cada región de forma independiente y produce resultados de texto reconocidos por separado que puede volver a ensamblar en el orden de lectura correcto una vez finalizado el reconocimiento.

Configuración de ajustes de OCR para páginas académicas de transmisión múltiple

La mayoría de los motores de OCR profesionales proporcionan configuraciones que ayudan con diseños de páginas de varias columnas y secuencias. Habilitar el análisis de diseño automático es el punto de partida, pero para páginas académicas con flujos de texto cercanos, la configuración manual de zonas produce mejores resultados que el análisis completamente automático.

Defina zonas de reconocimiento separadas para el cuerpo del texto, el área de notas al pie y cada región de texto de margen. Dentro de cada zona, establezca el idioma apropiado, el rango de tamaño de fuente esperado y la orientación del texto. Las zonas del cuerpo del texto deben contener texto de 10 a 12 puntos en orientación horizontal de izquierda a derecha. Las zonas de notas al pie deben esperar texto de 8 a 10 puntos, aún en posición horizontal, pero teniendo en cuenta que el texto de las notas al pie a menudo incluye URL, DOI y cadenas de citas que pueden confundir a los modelos lingüísticos que esperan una prosa natural.

Específicamente para la zona del cuerpo del texto, habilite la configuración que ignora el texto en superíndice y subíndice para fines de segmentación de líneas. Los números de referencia de las notas al pie en superíndice y los exponentes matemáticos suelen ser más pequeños y elevados por encima de la línea base, lo que provoca errores en el cálculo de la altura de la línea si el motor los trata como parte de la línea de texto normal. Ignorar la posición del superíndice con fines de segmentación mantiene intactas las líneas del cuerpo del texto, mientras que los marcadores de las notas al pie se reconocen como pequeños elementos separados que no afectan los límites de las líneas.

La calidad de salida de PDF a Texto mejora significativamente cuando el resultado del reconocimiento de cada zona se guarda en un archivo de texto separado o en una sección marcada separada dentro de una salida combinada. Esta salida separada por zonas facilita la verificación de que el texto del cuerpo no se haya fusionado con el texto de las notas al pie y que las citas al margen aparezcan en su propia sección de salida claramente etiquetada en lugar de intercalarse con el contenido principal.

Limpieza posterior al reconocimiento para resultados de OCR académico

Incluso con un preprocesamiento cuidadoso y una configuración de zonas, algunos errores de reconocimiento son inevitables en páginas académicas muy apretadas. Un proceso estructurado de limpieza posterior al reconocimiento detecta y corrige estos errores residuales antes de que el texto ingrese al documento final.

Ejecute una revisión ortográfica únicamente en la salida del texto del cuerpo, con el diccionario de revisión ortográfica configurado en el idioma principal del documento. Las palabras marcadas como mal escritas en el cuerpo del texto que resultan ser contenido de nota al pie correctamente escrito son una señal clara de que el límite de la zona del cuerpo del texto era demasiado generoso y capturaba el texto de la nota al pie. Ajuste el límite de zona para esas páginas y vuelva a ejecutar el reconocimiento en lugar de editar manualmente los fragmentos de notas al pie.

Para la salida de texto de nota al pie, verifique que cada nota al pie comience con su número de referencia esperado y que el texto de la nota al pie fluya continuamente sin fragmentos de texto del cuerpo intercalados. Un patrón de error común posterior al reconocimiento son las líneas del texto del cuerpo que aparecen en el medio del texto de la nota al pie donde la columna del texto del cuerpo se extiende más abajo en la página que el límite de la zona anticipado. Al revisar la imagen de la página original junto con el texto de la nota al pie reconocida se detectan rápidamente estas intrusiones porque el tema de la oración cambia abruptamente del tema académico a un tema del párrafo del cuerpo no relacionado.

La herramienta OCR de WukongPDF admite el reconocimiento basado en zonas para diseños de página complejos, incluidos artículos académicos de varias columnas con notas a pie de página y contenido al margen. La definición de configuraciones por zona para el idioma, el rango de tamaño de fuente y la orientación del texto antes de iniciar el pase de reconocimiento produce resultados OCR PDF más precisos que el procesamiento de zona única en las mismas páginas, y el formato de salida separado hace que la verificación posterior al reconocimiento sea sencilla.

Manejo de casos especiales: notación matemática, escrituras no latinas y lenguajes mixtos

Los artículos académicos en campos STEM añaden notación matemática al desafío de la superposición de textos. Las ecuaciones y fórmulas intercaladas con el cuerpo del texto crean una complejidad de segmentación adicional porque la notación matemática utiliza símbolos, letras griegas y formatos bidimensionales como fracciones y superíndices que no siguen las mismas reglas de diseño que el texto en prosa. Los motores de OCR diseñados para texto de documentos funcionan mal en notación matemática y los motores diseñados para matemáticas funcionan mal en texto de documentos.

El enfoque más práctico para páginas que combinan matemáticas y prosa es una estrategia de OCR de dos pasos. La primera pasada utiliza un motor optimizado para documentos para reconocer todas las regiones del texto en prosa, incluido el texto del cuerpo, las notas al pie y las citas al margen. El segundo paso utiliza un motor de reconocimiento matemático en las regiones de página específicas que contienen ecuaciones. Fusionar las dos salidas en un documento combinado que preserve tanto la precisión de la prosa del motor de documentos como la precisión de las fórmulas del motor matemático produce el resultado general más confiable.

Para artículos que combinan escrituras latinas y no latinas, como artículos en inglés con citas en árabe, chino o cirílico en las notas a pie de página, configure cada zona de reconocimiento con la escritura principal correcta. La zona del cuerpo del texto utiliza el idioma principal del documento. Las zonas de notas al pie que contienen pasajes en escritura no latina pueden necesitar una configuración de reconocimiento de escritura múltiple que pueda cambiar entre escrituras dentro de una sola región de texto.

La siguiente tabla resume las configuraciones de zonas de OCR recomendadas para diferentes regiones de páginas en artículos académicos.

Región de páginaTamaño de fuente esperadoOrientaciónConfiguraciones especiales
Texto del cuerpo10-12 puntosHorizontalIgnorar superíndice para segmentación de líneas
Notas a pie de página8-10 puntosHorizontalEscritura múltiple si las citas incluyen texto no latino
Margen izquierdo (números de línea)7-9 puntoshorizontales o verticalesExtraer como salida separada; no te fusiones con el cuerpo
Margen derecho (citas)7-9 puntosHorizontalExtraer como salida separada
Ecuaciones/FórmulasVariableHorizontal con diseño 2DUtilice un motor con reconocimiento matemático en la segunda pasada
WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →