
Qué hace el OCR en un PDF escaneado
El reconocimiento óptico de caracteres transforma un PDF escaneado, que es una colección de imágenes de páginas, en un documento con capacidad de búsqueda.
El proceso OCR PDF analiza cada imagen de página, identifica las formas de los caracteres y crea una capa de texto invisible detrás de la imagen de la página. Después del OCR, puede buscar palabras en el documento, seleccionar y copiar texto y usar lectores de pantalla para leer el documento en voz alta.
OCR transforma una imagen pasiva de texto en un documento activo con capacidad de búsqueda que admite selección de texto y lectores de pantalla.
La precisión del OCR depende directamente de la calidad del escaneo original; los escaneos limpios de 300 ppp producen los mejores resultados.
Un PDF escaneado sin OCR es como un álbum de fotos con texto. Puedes mirar las palabras pero no puedes interactuar con ellas. No se puede buscar un término específico. No se puede copiar un párrafo para citarlo. No puedes utilizar un lector de pantalla. OCR agrega capacidades interactivas que hacen que los documentos digitales sean útiles más allá de la simple visualización.
La precisión del OCR depende de la calidad del escaneo original. Un escaneo limpio y de alta resolución a 300 DPI con iluminación uniforme y enfoque nítido produce una precisión de OCR superior al 99 por ciento para texto impreso estándar. Un escaneo de baja resolución, una fotografía de un documento tomada en ángulo o un escaneo de un original arrugado o manchado producen una precisión menor. La calidad del escaneo determina directamente la calidad de la salida OCR.
La capa de texto PDF Searchable agregada por OCR está separada de la imagen de la página. La apariencia visual del PDF no cambia después del OCR. La página todavía parece una imagen escaneada. Detrás de esa imagen, el texto reconocido existe como datos de caracteres invisibles a los que pueden acceder los motores de búsqueda, lectores de pantalla y herramientas de selección de texto.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
Cómo ejecutar OCR en un PDF escaneado en diferentes dispositivos
En Windows, Adobe Acrobat Pro puede ejecutar OCR en archivos PDF escaneados. Abra el PDF, seleccione la herramienta Escanear y OCR y elija Reconocer texto. Acrobat procesa cada página, reconoce el texto y agrega la capa de texto con capacidad de búsqueda. Guarde el archivo. El PDF ahora admite búsqueda y selección de texto. Acrobat Pro proporciona el OCR más preciso en Windows.
En Mac, la aplicación de vista previa integrada no incluye OCR. Varias herramientas PDF de Mac de terceros ofrecen capacidad de OCR. PDF Expert y PDFpen incluyen motores OCR que procesan archivos PDF escaneados y agregan capas de texto con capacidad de búsqueda. La calidad del OCR es comparable a la de las herramientas de Windows para documentos estándar.
La herramienta OCR basada en navegador de WukongPDF funciona en cualquier sistema operativo. Cargue el PDF escaneado, seleccione el idioma del documento para el motor OCR y ejecute el reconocimiento. Descargue el PDF con capacidad de búsqueda cuando se complete el procesamiento. El enfoque basado en navegador hace que el OCR sea accesible sin instalar software.
Para iPhone y Android, las aplicaciones de escáner que incluyen OCR procesan el escaneo durante la captura. Adobe Scan, Microsoft Lens y el escáner integrado en la aplicación Notas del iPhone realizan OCR automáticamente al escanear documentos. El PDF resultante se puede buscar inmediatamente después del escaneo, sin un paso de procesamiento OCR por separado.
Mejora de la precisión del OCR para documentos desafiantes
Seleccione el idioma correcto del documento antes de ejecutar OCR. El motor de OCR utiliza diccionarios específicos del idioma y datos de frecuencia de caracteres para resolver caracteres ambiguos. La ejecución de OCR en un documento francés con la configuración de idioma francés produce mejores resultados que usar la configuración de inglés. Para documentos multilingües, seleccione el idioma principal y corrija manualmente los errores en los pasajes del idioma secundario.
Enderece las páginas escaneadas antes del OCR. Las páginas escaneadas que están ligeramente giradas, incluso uno o dos grados, reducen la precisión del OCR porque el motor de OCR espera que las líneas de texto sean horizontales. La mayoría del software de escaneo incluye una función de alineamiento automático. Si el escaneo no se enderezó durante la captura, enderece las páginas PDF antes de ejecutar OCR.
Aumente la resolución de escaneo para documentos con texto pequeño o diseños complejos. El texto de menos de 10 puntos requiere una resolución de escaneo más alta para un OCR preciso. Un escaneo a 300 DPI es suficiente para la mayoría de los documentos. Para documentos con texto de 8 puntos o menos, escanee a 400 o 600 DPI para darle al motor de OCR suficientes datos de píxeles para distinguir caracteres individuales.
Para documentos con tipos de contenido mixto, como páginas que combinan texto con fotografías o ilustraciones, el motor de OCR debe configurarse para reconocer únicamente zonas de texto. Intentar reconocer texto de áreas de imagen produce caracteres basura. La mayoría de las herramientas de OCR incluyen una función de selección de zonas que le permite especificar qué áreas de la página contienen texto.
Verificación y corrección de la salida OCR
Una vez que se complete el OCR, verifique el resultado buscando algunas palabras que pueda ver en la página. Si la búsqueda los encuentra, el OCR fue exitoso. Si la búsqueda omite palabras obvias, la precisión del OCR puede ser insuficiente para la fuente, el diseño o la calidad de imagen específicos de esa página.
Para documentos en los que la precisión del OCR es fundamental, como registros médicos o legales en los que se debe poder realizar búsquedas completas, revise manualmente el texto reconocido. Algunas herramientas de PDF le permiten ver y editar la capa de texto oculta. Corrija los errores de reconocimiento, particularmente en nombres propios, números y términos técnicos que es más probable que el motor de OCR reconozca mal.
Los errores de OCR más comunes implican confusión de caracteres. La letra l y el número 1 se parecen en muchas fuentes. Las letras rn juntas pueden parecerse a la letra m.
Las letras cl pueden parecerse a la letra d. Estas confusiones de caracteres producen palabras que son visualmente similares al original pero textualmente incorrectas. La revisión manual de las secciones críticas detecta estos errores.
Después de verificar la salida de OCR, guarde el documento con un nombre de archivo que indique que ha sido procesado con OCR. Un nombre de archivo como Report-OCR.pdf o Report-Searchable.pdf distingue la versión con capacidad de búsqueda del escaneo original de solo imagen.
El beneficio práctico de un PDF escaneado con capacidad de búsqueda se hace evidente la primera vez que necesita encontrar una información específica en un documento grande. Un contrato escaneado de 200 páginas sin OCR requiere leer manualmente cada página para encontrar una cláusula específica. Una versión con capacidad de búsqueda encuentra la cláusula en segundos. Para cualquier documento al que espere hacer referencia más de una vez, la inversión en OCR se amortiza sola.
Los lectores de pantalla también pueden acceder a los archivos PDF procesados por OCR, lo que los hace utilizables por personas con discapacidad visual que dependen de la tecnología de asistencia para leer documentos. Un PDF escaneado sin OCR es completamente inaccesible para los lectores de pantalla porque no hay texto para leer en voz alta. Agregar OCR hace que el documento sea accesible, lo cual es requerido por los estándares de accesibilidad, incluida la Sección 508 y WCAG.
Para documentos en idiomas distintos del inglés, seleccione el idioma de OCR correcto antes de procesarlos. Los motores de OCR utilizan modelos de reconocimiento de caracteres específicos del idioma. Un documento en japonés reconocido con el modelo japonés produce resultados mucho mejores que el mismo documento reconocido con un modelo inglés.
OCR también permite la extracción de texto para su reutilización en otros documentos. Cuando necesite citar un pasaje de un documento escaneado en su propio informe, el OCR hace que el texto se pueda copiar. Sin OCR, tendrías que volver a escribir el pasaje manualmente. El tiempo ahorrado al poder copiar y pegar documentos procesados por OCR aumenta significativamente.
Para los documentos escaneados que se archivarán, el OCR es un paso de preservación esencial. Un PDF escaneado de sólo imágenes archivado hoy no ofrece capacidad de búsqueda para futuros investigadores. Un PDF con capacidad de búsqueda brinda acceso al contenido del documento a través de una búsqueda de texto, lo que aumenta drásticamente la utilidad del documento para futuros usuarios.
El tamaño del archivo PDF no cambia significativamente después del OCR. Los datos de OCR agregan una pequeña cantidad de datos de texto a cada página, normalmente unos pocos kilobytes por página. Las imágenes de la página original permanecen sin cambios. El aumento del tamaño del archivo es insignificante para la mejora funcional que proporciona la capa de texto con capacidad de búsqueda.
La capa de texto con capacidad de búsqueda agregada por OCR está separada de la imagen visual de la página. Cuando busca una palabra en un PDF procesado por OCR, la búsqueda coincide con la capa de texto, no con la imagen. El resultado de la búsqueda resalta el área de la imagen de la página donde se encontró el texto.
Los archivos PDF procesados por OCR admiten la lectura de texto a voz, lo que los hace accesibles para personas con discapacidad visual y para cualquiera que prefiera escuchar documentos en lugar de leerlos. Esta característica de accesibilidad es un beneficio significativo del OCR más allá de la simple capacidad de búsqueda.
Para proyectos grandes de OCR que involucran cientos o miles de páginas escaneadas, el procesamiento de OCR por lotes ahorra mucho tiempo. Configure los ajustes de OCR una vez y aplíquelos a todo el lote de documentos. Revise una muestra de páginas para verificar la precisión en lugar de revisar cada página.
La capa de texto OCR se puede exportar como un archivo de texto sin formato, lo que permite utilizar el contenido del documento en otras aplicaciones. Exporte el texto reconocido, ábralo en un editor de texto o procesador de textos y utilícelo como base para un nuevo documento.
El valor a largo plazo de un PDF procesado con OCR se materializa cada vez que necesita encontrar información en el documento. Un PDF con capacidad de búsqueda de un contrato, un manual o un documento de referencia se convierte en un recurso que puede consultar en lugar de un archivo estático que debe leer manualmente.
La implementación de OCR como paso estándar en su flujo de trabajo de escaneo de documentos garantiza que cada documento que digitalice se pueda buscar desde el momento en que ingresa a su biblioteca digital. Los pocos segundos adicionales de procesamiento OCR durante el escaneo rinden frutos cada vez que necesita encontrar información en cualquier documento que haya escaneado.
Para cualquiera que administre una biblioteca de documentos digitales, OCR es el paso de procesamiento más impactante que puede aplicar a los archivos PDF escaneados. Transforma archivos de imágenes pasivos en documentos activos, accesibles y con capacidad de búsqueda.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
