La ejecución de OCR PDF en una carpeta de documentos escaneados debería producir archivos PDF con capacidad de búsqueda con nombres que coincidan con los originales. Cuando las herramientas de OCR por lotes cambian el nombre de los archivos de salida de forma genérica, como salida1.pdf, salida2.pdf, se pierde la conexión entre la versión original y la versión con capacidad de búsqueda. Preservar los nombres de archivos a través del proceso OCR mantiene los documentos escaneados organizados y rastreables.
La preservación del nombre de archivo es un detalle de configuración, no una limitación de funciones. La mayoría de las herramientas de OCR generan de forma predeterminada nombres de archivos de salida en función de los nombres de archivos de entrada o permiten especificar un patrón de nomenclatura de salida. La clave es encontrar la configuración correcta o el indicador de línea de comando antes de ejecutar el lote, no después de descubrir que se ha cambiado el nombre de 200 archivos.
Las herramientas de OCR PDF escaneado de WukongPDF procesan documentos individualmente y por lotes manteniendo los nombres de archivos originales.

OCR por lotes con el asistente de acción de Acrobat Pro
El Asistente de acción de Acrobat Pro automatiza el procesamiento de PDF de varios pasos en una carpeta. Vaya a Herramientas, Asistente de acciones, Nueva acción. Agregue el paso Reconocer texto a la acción, seleccionando el idioma de OCR y la configuración de salida correctos. Agregue un paso Guardar que guarde los archivos en una carpeta de salida especificada y, opcionalmente, agregue un sufijo como _OCR para distinguir los archivos que se pueden buscar de los originales.
Ejecute la acción en la carpeta de entrada. Acrobat abre cada archivo, ejecuta OCR, guarda el resultado con el sufijo añadido al nombre del archivo original y pasa al siguiente archivo. La carpeta de salida contiene archivos PDF con capacidad de búsqueda con nombres como report_OCR.pdf correspondiente al report.pdf original. El enfoque del sufijo conserva el nombre del archivo original al tiempo que indica claramente qué archivos se han procesado con OCR.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
OCR por lotes de línea de comando con Tesseract
Tesseract procesa un archivo de imagen a la vez. Para el OCR por lotes de una carpeta de archivos PDF escaneados, primero convierta cada página PDF en una imagen, ejecute Tesseract y luego vuelva a combinarla en un PDF con capacidad de búsqueda. Un script de shell maneja la canalización. Para cada PDF en la carpeta, el script extrae el nombre del archivo base, convierte páginas a imágenes TIFF, ejecuta Tesseract con el indicador de idioma apropiado y genera un PDF con capacidad de búsqueda con el nombre de archivo base original.
El script utiliza la expansión de parámetros para eliminar la extensión del archivo: base=${f%.pdf} proporciona el nombre del archivo sin .pdf. La salida de Tesseract se denomina $base y el PDF con capacidad de búsqueda resultante se guarda como ${base}_searchable.pdf. El nombre del archivo original se conserva en el nombre de salida. Un bucle de una línea procesa una carpeta completa: for f en *.pdf; hacer tesseract $f ${f%.pdf} -l eng PDF; hecho.
OCR por lotes optimizado con OCRmyPDF
OCRmyPDF es una herramienta de línea de comandos basada en Python que agrega una capa de texto OCR a los archivos PDF existentes. Maneja la extracción de imágenes, OCR y reensamblaje de PDF internamente. Un solo comando procesa un PDF: ocrmypdf entrada.pdf salida.pdf. El resultado conserva las imágenes de la página y agrega texto reconocido detrás de ellas como una capa invisible.
Para el procesamiento por lotes, OCRmyPDF acepta una ruta de carpeta con el indicador --batch o se puede realizar en bucle en un script de shell. La ventaja clave sobre Tesseract para el procesamiento de PDF es que OCRmyPDF funciona directamente con la entrada y salida de PDF. No se necesita conversión de imagen intermedia. El nombre del archivo de salida se puede especificar por archivo, preservando la convención de nomenclatura original. Para la digitalización de documentos escaneados de gran volumen, OCRmyPDF combinado con un bucle de shell proporciona la ruta más eficiente desde escaneos sin procesar hasta archivos con capacidad de búsqueda.
| Herramienta | Método por lotes | Manejo de nombres de archivos |
|---|---|---|
| Asistente de acción de Acrobat Pro | Crear acción, aplicar a la carpeta | Conserva el nombre de archivo original, agrega sufijo |
| CLI de Teseracto | Carpeta de bucle for de Shell | La salida coincide con el nombre del archivo de entrada |
| OCRmyPDF | Comando único por archivo o lote | Sobrescribe o crea un nuevo archivo según la configuración |
Verificación de la salida de OCR por lotes
Después del procesamiento por lotes, verifique una muestra de los archivos de salida antes de archivar los originales. Abra de tres a cinco archivos PDF de salida de diferentes partes de la lista de archivos ordenados alfabéticamente. Busque una palabra visible en la imagen escaneada. Si la búsqueda encuentra la palabra, el OCR se realizó correctamente para ese archivo. Verifique la primera página, la página intermedia y la última página de cada archivo de muestra. La calidad del OCR puede variar dentro de un documento si las páginas tienen una calidad de escaneo diferente.
Cuando se trata de flujos de trabajo de documentos, para los documentos en los que falló el OCR, indicado por un PDF donde la búsqueda no encuentra nada, vuelva a ejecutar el OCR con la configuración ajustada. Aumente la resolución de la imagen a 400 DPI si el escaneo original es de baja calidad. Pruebe con un motor de OCR diferente si Tesseract produjo malos resultados. Procese los archivos problemáticos individualmente en lugar de volver a ejecutar todo el lote.
El OCR por lotes con preservación de nombre de archivo transforma una carpeta de documentos escaneados inaccesibles en un archivo con capacidad de búsqueda donde se puede rastrear cada archivo hasta su original. El nombre del archivo es el vínculo entre el escaneo original y la versión mejorada con OCR.
Almacenamiento a largo plazo de archivos PDF escaneados con OCR mejorado
Una vez configurado, después del procesamiento OCR por lotes, almacene los archivos PDF con capacidad de búsqueda en una ubicación que conserve tanto las imágenes de la página como la capa de texto OCR. El formato PDF/A con una capa de texto incrustado es el estándar de archivo. Convierta la salida OCR a PDF/A usando Acrobat Pro o Ghostscript con la configuración de salida PDF/A.
En la práctica, la capa de texto OCR añade una sobrecarga mínima de tamaño de archivo, normalmente entre un 5 y un 15 por ciento. La compensación de archivos un poco más grandes por la capacidad de búsqueda casi siempre vale la pena. Un documento escaneado que no se puede buscar es significativamente menos útil que uno que sí se puede buscar.
En la práctica, la estructura de directorios para la salida de OCR por lotes debe reflejar la estructura de entrada al procesar carpetas anidadas. Un script por lotes recursivo que conserva la estructura de ruta relativa garantiza que los archivos mejorados con OCR mantengan la misma jerarquía organizativa que los originales.
Cuando se trata de flujos de trabajo de documentos, para proyectos de OCR por lotes extremadamente grandes con miles de documentos, considere dividir la carga de trabajo en varias sesiones o máquinas. El OCR requiere una gran cantidad de computación y un lote de diez mil páginas puede tardar varias horas en una sola máquina.
Una vez configurado, después de completar un proyecto de OCR por lotes, genere un manifiesto de procesamiento que enumere cada archivo de entrada, su archivo de salida, el motor de OCR y la configuración utilizada, y la fecha de procesamiento. El manifiesto sirve como documentación y registro de los expedientes tramitados.
Desde un punto de vista práctico, en la práctica, la transición de archivos escaneados que no se pueden buscar a colecciones mejoradas con OCR con capacidad de búsqueda es una de las actividades de digitalización de mayor impacto. La capacidad de buscar documentos que antes eran inaccesibles los transforma de registros estáticos en recursos de información activos.
La velocidad de procesamiento de OCR varía según la complejidad del documento. Las páginas de sólo texto se procesan rápidamente. Las páginas con tablas, fuentes mixtas o elementos decorativos tardan más. Un lote de páginas de texto uniforme se completa más rápido que un lote de contenido variado.
En la mayoría de las herramientas, la configuración del idioma de OCR afecta el tiempo y la precisión del procesamiento por lotes. Seleccionar solo los idiomas realmente presentes en los documentos evita gastos innecesarios de procesamiento y reduce el reconocimiento de caracteres falsos de modelos de idiomas no utilizados.
Para documentos que contienen texto y fotografías, el motor OCR puede intentar reconocer texto en áreas de fotografías, lo que produce caracteres de ruido. El filtrado posterior al OCR elimina estos artefactos analizando la distribución espacial del texto reconocido.
Normalmente, la configuración de DPI para las imágenes de entrada de OCR equilibra la velocidad de procesamiento con la precisión. 300 DPI es la recomendación estándar. 400 DPI mejora la precisión del texto pequeño. 200 DPI procesa más rápido pero es posible que se pierdan caracteres finos.
Después del OCR por lotes, ejecute una prueba de búsqueda de palabras clave en los archivos procesados utilizando términos que se sabe que aparecen en los originales. Los archivos en los que no se encuentra la palabra clave deben volver a procesarse con configuraciones ajustadas o revisión manual.
Los archivos de salida de OCR deben almacenarse en una estructura de carpetas que separe los archivos procesados de los originales. Esto evita el reprocesamiento accidental de archivos que ya cuentan con OCR mejorado y mantiene el archivo organizado.
En este contexto, en la práctica, la capa de texto OCR se puede extraer y almacenar por separado como un archivo de texto sin formato para cada documento. Los archivos de texto separados admiten la búsqueda de texto completo en el archivo sin abrir cada PDF individualmente.
Con el procesamiento de documentos, para archivos escaneados de alto valor, considere ejecutar OCR con dos motores diferentes y comparar el resultado. Las discrepancias entre motores resaltan un reconocimiento incierto que necesita verificación manual.
Batch OCR es el puente entre los archivos en papel y la búsqueda digital. Un archivador de documentos en papel, una vez escaneados y procesados con OCR, se convierte en una base de conocimientos con capacidad de búsqueda. La transición de lo físico a lo digital con capacidad de búsqueda es una de las transformaciones de gestión de la información de mayor impacto que puede realizar una organización.
OCR por lotes con preservación de nombre de archivo es el puente entre una carpeta de documentos escaneados inaccesibles y un archivo digital con capacidad de búsqueda. El procesamiento está automatizado. Los nombres de archivos proporcionan trazabilidad. La capa de texto OCR hace que todos los documentos sean reconocibles. La combinación transforma una colección estática en un recurso de información activo.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
