Tips & Tricks

Cómo exportar resultados de OCR de un PDF a JSON

La ejecución de OCR PDF en un documento escaneado produce texto reconocido, pero la mayoría de las herramientas de OCR generan ese texto como un archivo de texto plano o lo incrustan nuevamente en el PDF. La exportación de resultados de OCR directamente a JSON le proporciona datos estructurados y legibles por máquina que pueden introducirse en bases de datos, índices de búsqueda, sistemas de gestión de contenidos y flujos de trabajo automatizados. Una encuesta de 2025 realizada por AIIM International encontró que el 43 por ciento de las organizaciones ahora prefieren formatos de datos estructurados como JSON para el texto derivado de documentos porque se integran más fácilmente con las aplicaciones modernas en la nube y los procesos de IA (AIIM, "State of Intelligent Information Management", 2025).

Conclusiones clave

Exportar resultados de OCR a JSON preserva la estructura del texto reconocido, incluidos los números de página, las coordenadas de palabras y las puntuaciones de confianza, que se pierde al exportar a texto sin formato. La mayoría de los motores de OCR modernos admiten la salida JSON de forma nativa, pero es posible que sea necesario habilitar la función en la configuración o seleccionarla en un menú de formato de exportación. El archivo JSON resultante se puede utilizar para búsquedas de texto completo, procesos de extracción de datos y entrenamiento de modelos de aprendizaje automático sobre el contenido de documentos.

Para los desarrolladores que integran OCR JSON en aplicaciones, la mayoría de los formatos de salida JSON incluyen un campo de versión que identifica la versión del esquema. Siempre verifique este campo antes de analizar para evitar cambios importantes cuando el motor de OCR actualice su formato de salida. Una protección de versión simple al comienzo del código de análisis evita errores crípticos cuando la estructura JSON cambia entre versiones del motor.

How to Export OCR Results From a PDF to JSON

Por qué la salida JSON es mejor que el texto sin formato para resultados de OCR

La salida de texto sin formato del OCR descarta todo excepto los propios caracteres. Obtiene las palabras pero pierde el número de página donde apareció cada palabra, las coordenadas del cuadro delimitador que le indican en qué parte de la página se encuentra el texto, la puntuación de confianza que indica qué tan seguro es el motor de OCR sobre cada carácter y cualquier información estructural como saltos de párrafo y diseños de columnas. JSON conserva todo esto. Un archivo de salida OCR JSON PDF escaneado normalmente contiene una serie de objetos de página, cada uno con una serie de objetos de bloque de texto, cada uno de los cuales contiene el texto reconocido más su posición, tamaño y metadatos de confianza.

Esta estructura permite una automatización posterior que es imposible con texto sin formato. Un script puede leer el archivo JSON y extraer solo texto de una región específica de cada página, como el área del encabezado o una columna de la barra lateral. Puede filtrar resultados de OCR de baja confianza para evitar contaminar un índice de búsqueda con texto confuso. Puede reconstruir el orden de lectura de un diseño de varias columnas ordenando bloques de texto por sus coordenadas Y y X. Ninguna de estas operaciones es posible con un archivo de texto plano de OCR.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →

Paso a paso: Exportar resultados de OCR a JSON

Antes de ejecutar OCR, verifique la resolución de la imagen del PDF escaneado. La mayoría de los motores de OCR funcionan mejor cuando las imágenes de la página de entrada tienen una resolución de 300 DPI. Por debajo de 200 DPI, la precisión del reconocimiento cae notablemente. Por encima de 400 DPI, el tiempo de procesamiento aumenta sin una mejora significativa en la precisión. Si su PDF escaneado tiene imágenes de página de baja resolución, considere aumentarlas a 300 DPI antes de ejecutar OCR con salida JSON. El paso de preprocesamiento adicional mejora notablemente la calidad de los datos JSON.

Abra su PDF escaneado en una herramienta OCR que admita salida estructurada. Tesseract, el motor OCR de código abierto más utilizado, admite salida JSON a través de su interfaz de línea de comandos y a través de la mayoría de las aplicaciones que lo incluyen. En Tesseract, agregar el indicador de formato de salida produce un archivo JSON junto al texto reconocido. Las API comerciales de OCR de Google Cloud Vision, Amazon Textract y Microsoft Azure Form Recognizer devuelven JSON de forma predeterminada, con el texto reconocido organizado por página, bloque, párrafo, línea y palabra.

Después de ejecutar OCR con la salida JSON habilitada, abra el archivo resultante en un editor de texto para comprender su estructura. El JSON contendrá matrices de objetos de página. Cada objeto de página contiene las dimensiones de la página y las matrices de objetos de bloque. Cada bloque contiene el texto reconocido, una puntuación de confianza normalmente entre 0 y 100 y las coordenadas del cuadro delimitador que describen la posición del bloque en la página. La familiaridad con esta estructura le permite escribir scripts simples para extraer exactamente los datos que necesita. La herramienta OCR de WukongPDF incluye una opción de exportación JSON que organiza el texto reconocido con números de página, puntuaciones de confianza y datos posicionales, por lo que no es necesario configurar un motor OCR independiente para obtener resultados estructurados.

Estructuras JSON comunes para salida OCR

La mayoría de las salidas de OCR JSON PDF escaneado también incluyen una sección de metadatos globales en la parte superior del archivo que registra el nombre del motor de OCR, la versión, la fecha de procesamiento y el idioma o idiomas detectados en el documento. Estos metadatos son valiosos para pistas de auditoría y para depurar problemas de calidad de OCR. Si está procesando documentos de múltiples fuentes, los metadatos le indican qué motor produjo cada resultado y si la versión del motor ha cambiado entre lotes, lo que puede explicar las diferencias en la calidad del reconocimiento.

CampoDescripciónValor de ejemplo
páginaNúmero de página en el documento original.3
textoContenido de texto reconocido"Factura #4521"
confianzaConfianza de OCR 0 a 10094,7
caja bCuadro delimitador [x, y, ancho, alto] en píxeles[120, 340, 400, 28]
tipo_bloqueTipo de bloque de contenido"párrafo" o "mesa" o "línea"
idiomaIdioma detectado del texto."es"

Usar datos OCR JSON en flujos de trabajo automatizados

Vale la pena planificar el manejo de errores por adelantado. Una ejecución de OCR en una página con muy mala calidad de imagen puede producir una puntuación de confianza inferior al 50 por ciento para la mayoría de las palabras reconocidas. Su flujo de trabajo debe definir un umbral de confianza mínimo por debajo del cual los resultados se marcan para revisión humana en lugar de incorporarse automáticamente a una base de datos o índice de búsqueda. Enviar resultados de OCR PDF escaneados de baja confianza directamente a un sistema de producción contamina los datos con errores que son mucho más costosos de limpiar más tarde que marcarlos para su revisión en el punto de extracción.

Una vez que los resultados del OCR están en JSON, las posibilidades de automatización se expanden significativamente. Un patrón común es escribir un script que observe una carpeta en busca de nuevos archivos PDF escaneados, ejecute OCR con salida JSON, analice el JSON para extraer campos específicos como números de factura o fechas de posiciones conocidas en la página e inserte esos valores en una base de datos u hoja de cálculo. Debido a que JSON incluye coordenadas posicionales, el script de extracción puede apuntar a texto en regiones específicas de la página independientemente del contenido general del documento.

Para aplicaciones de búsqueda, la salida JSON se puede introducir en un índice de búsqueda como Elasticsearch o Algolia. Cada página se convierte en un documento con capacidad de búsqueda con el número de página como campo de metadatos. Las puntuaciones de confianza le permiten ajustar la relevancia de la búsqueda al otorgar mayor peso al texto OCR de alta confianza. Los usuarios que buscan un término ven resultados clasificados según la certeza del motor de OCR de que el término realmente aparece en la página, lo que reduce las coincidencias falsas de caracteres no reconocidos.

Para canales de inteligencia artificial y aprendizaje automático, la salida estructurada PDF escaneado OCR en JSON es el formato de entrada estándar. Los grandes modelos de lenguaje y los sistemas de comprensión de documentos consumen representaciones JSON de

Preguntas frecuentes

¿Cómo debo almacenar archivos OCR JSON junto con los archivos PDF originales para acceder a ellos a largo plazo? Guarde los archivos JSON en la misma carpeta que los archivos PDF con nombres de archivo coincidentes. Por ejemplo, report-2025.pdf y report-2025.ocr.json. Esta convención de nomenclatura hace que sea trivial para los scripts encontrar la salida OCR PDF escaneado para un PDF determinado. Para archivos grandes, considere almacenar el JSON en una base de datos de documentos que admita la búsqueda de texto completo en lugar de archivos planos.

¿La salida JSON del OCR aumenta el tamaño del archivo en comparación con el texto sin formato?

Sí, normalmente por un factor de 3 a 5 veces. Un documento escaneado de 10 páginas que produce 15 KB de texto sin formato puede generar un archivo JSON de 50 a 75 KB. El tamaño adicional proviene de los metadatos estructurales: números de página, cuadros delimitadores y puntuaciones de confianza para cada palabra reconocida. Para la mayoría de las aplicaciones, este aumento de tamaño es insignificante. Sólo a una escala muy grande, como millones de páginas, se convierte en una consideración de almacenamiento que vale la pena planificar.

¿Puedo convertir el texto sin formato existente PDF escaneado Salida OCR a JSON?

No de manera significativa. Una vez que los resultados del OCR se han reducido a texto plano, los datos posicionales y las puntuaciones de confianza se pierden y no se pueden reconstruir a partir del texto únicamente. Si necesita datos OCR estructurados de documentos procesados previamente, el enfoque más confiable es volver a ejecutar OCR en los archivos PDF escaneados originales con la salida JSON habilitada.

¿Qué motores OCR producen la salida JSON más útil?

Los servicios de OCR basados en la nube de Google, Amazon y Microsoft generalmente producen la salida JSON más detallada, con cuadros delimitadores a nivel de palabra y puntuaciones de confianza. Tesseract produce JSON sólido a nivel de línea y palabra. La mejor opción depende de su volumen, presupuesto y de si los requisitos de privacidad permiten enviar documentos a un servicio en la nube.

¿Puedo convertir la salida OCR JSON nuevamente en un PDF con capacidad de búsqueda? Sí, aunque el proceso requiere una biblioteca de generación de PDF que pueda colocar objetos de texto en coordenadas específicas. Los datos del cuadro delimitador en la salida JSON le indican exactamente dónde pertenece cada palabra en la página. Este es el proceso inverso al proceso de extracción y es útil cuando necesita crear un PDF con capacidad de búsqueda a partir de texto OCR corregido después de corregir errores de reconocimiento en los datos JSON.

WukongPDF

Pruebe el OCR de PDF

No se necesita instalación. Funciona directamente en su navegador.

Empezar ahora →