Others

¿Cuál es la diferencia entre texto OCR y texto incrustado en un PDF?

Abra un PDF escaneado y podrá seleccionar, copiar y buscar el texto como si fuera un documento digital nativo. Ese texto no proviene del escaneo original. El escáner produjo una imagen de la página, una cuadrícula de píxeles sin ningún dato de texto. El texto que está seleccionando y buscando es texto OCR, generado por un software de reconocimiento óptico de caracteres que analizó la imagen de la página y convirtió patrones de píxeles en caracteres. Pero no todo el texto seleccionable en un PDF es texto OCR. Algunos archivos PDF contienen texto incrustado que se creó digitalmente, sin pasar nunca por un escáner o un motor de reconocimiento. Comprender la diferencia entre texto OCR y texto incrustado explica por qué algunos archivos PDF buscan perfectamente mientras que otros producen resultados confusos.

What Is the Difference Between OCR Text and Embedded Text in a PDF

Qué es el texto OCR y cómo se incorpora a un PDF

El texto OCR se genera automáticamente. Un motor OCR PDF examina cada forma de carácter en una imagen de página escaneada, la compara con una base de datos de patrones de caracteres conocidos y genera el carácter que más probablemente coincida junto con su posición en la página. Luego, el texto reconocido se incrusta en el PDF como una capa invisible colocada precisamente sobre los caracteres de la imagen original. Cuando selecciona y copia texto de un PDF escaneado, está copiando desde esta capa invisible de OCR, no desde la imagen visible. Si el motor de OCR leyó mal un carácter, el texto copiado contendrá ese error aunque la imagen visible parezca correcta.

La calidad del texto OCR depende de varios factores: la resolución y claridad del escaneo original, la fuente utilizada en el documento original, el idioma del texto y la sofisticación del motor de OCR. Un escaneo limpio de 300 DPI de un documento en inglés impreso con láser y procesado por un moderno motor OCR produce un texto casi perfecto. Un escaneo de 150 DPI de un documento impreso con matriz de puntos en un lenguaje con formas de caracteres complejas procesado por un motor OCR básico produce un texto plagado de errores. El texto OCR es tan preciso como lo permiten el motor de reconocimiento y la calidad del escaneo.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →

Qué es el texto incrustado y cómo se incorpora a un PDF

El texto incrustado es de autor, no reconocido. Cuando un procesador de textos, una aplicación de autoedición o una biblioteca de creación de PDF genera un PDF, escribe el texto directamente en el flujo de contenido del PDF. Cada carácter se almacena como un código específico que se asigna a un glifo en una fuente. No hay paso de reconocimiento porque el texto nunca fue una imagen. La aplicación que creó el PDF sabía exactamente qué caracteres se escribían y los registró con precisión. Cuando selecciona y copia texto de un PDF creado digitalmente, copia los caracteres exactos que escribió el autor.

El texto incrustado contiene información de formato de la que normalmente carece el texto OCR. Los nombres de fuentes, el estilo en negrita y cursiva y el espaciado entre caracteres se conservan en el texto incrustado porque fueron especificados por el autor en el documento fuente. El texto OCR puede reconstruir parte de este formato, pero se infiere de la apariencia visual de los caracteres en lugar de almacenarse como metadatos explícitos. Una comparación de Formato PDF entre una página escaneada y luego OCRed y una página digital nativa revela esta diferencia. La versión OCR puede permitir la selección de texto, pero informa que cada carácter tiene la misma fuente y el mismo peso. La versión digital conserva las distinciones tipográficas que pretendía el autor.

Cómo saber si el texto de un PDF es OCR o está incrustado

La forma más confiable de determinar si el texto en un PDF está generado por OCR o incrustado es verificar las propiedades del documento, específicamente la lista de fuentes. Abra el PDF en un visor que pueda mostrar información de fuentes. Adobe Acrobat muestra la lista de fuentes en Archivo, Propiedades del documento, Fuentes. Si la lista de fuentes muestra fuentes con nombres que incluyen OCR o si las fuentes aparecen como desconocidas o como un tipo genérico sin un nombre específico, es probable que el texto se haya generado mediante OCR. Si la lista de fuentes muestra fuentes específicas con nombre, como Arial, Times New Roman o Calibri con subtipos como Negrita o Cursiva, es casi seguro que el texto proviene de una fuente digital.

Otra prueba práctica es buscar un patrón de error de OCR común. Busque en el PDF errores comunes de sustitución de OCR, como la combinación de letras rn, que los motores de OCR con frecuencia interpretan erróneamente como una sola letra m. Si la búsqueda encuentra casos en los que el granero se convierte en bam o el maíz se convierte en com, el texto se genera mediante OCR. El texto incrustado no contiene estos errores de sustitución porque los caracteres nunca fueron visualmente ambiguos. La calidad PDF Searchable de un documento depende de si el texto subyacente, OCR o incrustado, representa con precisión el contenido visible.

Cuando el texto OCR y el texto incrustado coexisten en el mismo PDF

Un único PDF puede contener tanto texto OCR como texto incrustado en diferentes páginas o incluso en la misma página. Un paquete de contrato puede incluir el cuerpo del contrato creado digitalmente, que contiene texto incrustado, y una página de firma escaneada y procesada con OCR, que contiene texto OCR. Un informe de investigación puede combinar páginas de texto creadas digitalmente con fotografías escaneadas y procesadas con OCR de recortes de periódicos históricos. El texto de la página tres es texto incrustado con píxeles perfectos. El texto de la página siete es texto OCR que puede contener errores de reconocimiento.

Este escenario de contenido mixto crea una trampa sutil para cualquiera que busque o extraiga texto del PDF. Los resultados de la búsqueda de las páginas de texto incrustadas serán precisos. Los resultados de búsqueda de las páginas de texto de OCR pueden omitir ocurrencias en las que el motor de OCR leyó mal una palabra o pueden devolver coincidencias falsas cuando el motor de OCR sustituyó una palabra similar. Cuando trabaje con archivos PDF de contenido mixto, verifique cualquier texto extraído de las páginas de OCR antes de confiar en él. El método más seguro es comprobar visualmente la imagen de la página correspondiente siempre que se utilice texto extraído de una página OCR para un propósito crítico.

Mejora de la calidad del texto OCR después del hecho

Cuando un PDF contiene texto OCR de mala calidad, las opciones para mejorarlo están limitadas por el hecho de que el escaneo original y el proceso de OCR ya se han completado. No puede mejorar retroactivamente la calidad del escaneo. Lo que puedes hacer es volver a OCR el PDF con un motor mejor. Extraiga las imágenes de la página del PDF con la resolución más alta disponible y ejecútelas a través de un motor de OCR moderno que puede producir resultados más precisos que el pase de OCR original. Reemplace la antigua capa de texto OCR por la nueva.

Algunos editores de PDF le permiten corregir manualmente los errores de OCR directamente en la capa de texto. Abra el PDF en un modo de edición que revele el texto OCR invisible. Haga clic en una palabra no reconocida y escriba la corrección. Este proceso de corrección manual es práctico para un puñado de errores en unas pocas páginas. No es práctico para un documento de 200 páginas donde cada párrafo contiene errores de reconocimiento. Para problemas de calidad de OCR a gran escala, volver a OCR todo el documento con un mejor motor es el enfoque más eficiente.

Elegir entre OCR y texto incrustado para la creación de documentos

Al crear un PDF que se buscará, indexará o archivará, la elección entre escanear y OCR frente a generar un PDF digital nativo tiene consecuencias a largo plazo. Un PDF digital nativo con texto incrustado es más pequeño, busca más rápido y conserva perfectamente la precisión del texto. Un PDF escaneado y procesado por OCR conserva la apariencia del documento original en papel, pero introduce la posibilidad de errores de reconocimiento que se agravan con el tiempo a medida que se copia, cita y hace referencia al PDF.

Para proyectos de archivo, la mejor práctica es preservar ambos formatos. Mantenga el escaneo de alta resolución como archivo maestro para lograr fidelidad visual. Genere una versión digital nativa, ya sea volviendo a escribir o aplicando OCR de alta precisión con corrección manual, para búsqueda y análisis de texto. Este enfoque de formato dual proporciona la autenticidad del escaneo original y la facilidad de uso del texto con capacidad de búsqueda. WukongPDF admite el procesamiento OCR PDF para convertir documentos escaneados en archivos PDF con capacidad de búsqueda, y la capa de texto OCR resultante proporciona la funcionalidad de búsqueda y copia que hace que los documentos escaneados se puedan utilizar en flujos de trabajo digitales.

La brecha de confiabilidad a largo plazo entre OCR y texto incrustado

Los PDF con OCR envejecen de forma diferente a los PDF creados digitalmente. Un PDF creado digitalmente y abierto veinte años después de su creación muestra su texto perfectamente, porque los códigos de caracteres no son ambiguos y las fuentes están incrustadas. Un PDF con OCR abierto veinte años después de su creación depende de la calidad del escaneo original y de la precisión del motor de OCR disponible en ese momento. Los errores de reconocimiento que eran apenas perceptibles cuando el documento estaba nuevo se convierten en obstáculos importantes cuando el documento original en papel ya no está disponible para su verificación.

Para documentos destinados a una conservación a largo plazo, siempre es preferible el texto incrustado de una fuente digital al texto OCR. Si un documento existe solo en papel y debe escanearse, invierta en escaneo y procesamiento OCR de la más alta calidad disponible en ese momento, y conserve el documento original en papel tanto tiempo como sea posible. El original en papel es la mejor copia de seguridad contra errores de OCR que pueden aparecer años después.

Una prueba práctica para distinguir el texto OCR PDF del texto incrustado: amplíe un párrafo al 300 por ciento o más y observe los bordes de los caracteres. El texto OCR a menudo muestra una ligera desalineación entre la imagen del carácter visible y la capa de texto invisible. El texto incrustado se representa con una alineación perfecta porque las formas y posiciones de los caracteres provienen del mismo programa de fuentes.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →