Realiza el OCR de un PDF y el texto reconocido aparece en un cuadro de texto dentro de su editor de PDF. Puedes leerlo. Puedes copiarlo y pegarlo. Pero lo que realmente desea es el texto en un archivo Markdown, con encabezados formateados como hashes, listas como asteriscos, enlaces como pares de corchetes y paréntesis y párrafos separados por líneas en blanco. Markdown es la lengua franca de desarrolladores, escritores técnicos, blogueros y cualquiera que necesite texto limpio y portátil que pueda colocarse en un generador de sitios estáticos, una aplicación para tomar notas o un repositorio de código.
Pasar de un PDF escaneado a un archivo Markdown es un proceso de dos pasos: OCR reconoce el texto y luego, un paso de formato convierte ese texto reconocido a la sintaxis de Markdown. Cada paso tiene opciones de herramientas que afectan la calidad del resultado final.

Paso 1: OCR del PDF para extraer texto reconocido
El paso de OCR es el mismo que hacer que se pueda realizar búsquedas en cualquier PDF. Utilice una herramienta OCR PDF para procesar las páginas escaneadas. La herramienta agrega una capa de texto a cada página. Para la exportación de Markdown, desea que la salida OCR esté en un formato que conserve la mayor cantidad de información estructural posible: qué texto es un encabezado, qué texto es el cuerpo, qué texto es parte de una lista o tabla. Los motores OCR estándar generan texto sin formato, que pierde toda la información estructural. Un título y un párrafo del cuerpo se convierten en bloques de texto indistinguibles separados por saltos de línea.
Para obtener mejores resultados, utilice un motor de OCR que admita la extracción de texto según el diseño. Estos motores analizan la disposición espacial del texto en la página y pueden distinguir entre títulos, texto del cuerpo, subtítulos y notas al pie según el tamaño de fuente, la posición y la proximidad a otros elementos. Cuanta más información estructural capture el motor de OCR, más limpia será la conversión de Markdown. La función Exportar a de Adobe Acrobat Pro incluye una opción "Texto con formato". opción que preserva algunas señales estructurales. El motor de OCR conserva los metadatos de posición y tamaño de fuente que las herramientas de conversión posteriores pueden utilizar para inferir niveles de encabezado y saltos de párrafo.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
Paso 2: Convertir el texto reconocido a Markdown
Una vez que el PDF tiene una capa de texto, la conversión a Markdown puede realizarse a través de varias rutas. La más sencilla es una exportación directa desde un editor de PDF que admita Markdown como formato de salida. Las opciones de exportación de WukongPDF incluyen Markdown como formato de destino cuando el PDF ha sido procesado con OCR. Seleccione Markdown como formato de salida y la herramienta generará un archivo .md con el texto reconocido formateado de acuerdo con las convenciones de Markdown: las líneas que comienzan con fuentes más grandes se convierten en encabezados con prefijo hash, las líneas sangradas se convierten en elementos de lista y los párrafos normales se separan por líneas en blanco.
Si una exportación directa de Markdown no está disponible, el proceso es: exportar el texto reconocido a un formato de texto enriquecido que conserve el formato, como RTF o HTML, y luego convertir ese formato intermedio a Markdown usando una herramienta de conversión. Pandoc, el conversor universal de documentos, maneja bien este proceso. Exporte el texto del PDF como HTML, luego ejecute: pandoc input.html -f html -t markdown -o output.md. Pandoc traduce etiquetas de encabezado HTML a hashes de Markdown, etiquetas de lista HTML a marcadores de lista de Markdown y etiquetas de enlace HTML a sintaxis de enlace de Markdown. La calidad de la salida depende de la calidad de la exportación HTML desde el PDF. Si la exportación de PDF produce HTML limpio y bien estructurado, Pandoc produce Markdown limpio. Si la exportación produce HTML desordenado con estilos en línea y etiquetas no semánticas, el Markdown será correspondientemente desordenado.
Limpiar errores de OCR en la salida de Markdown
Los errores de OCR en el texto reconocido pasan a la salida de Markdown sin cambios. Los errores comunes incluyen caracteres confusos como "cl" reconocido como "d" "rn" reconocido como "m", y "1" reconocido como "l", especialmente en tamaños de fuente más pequeños o escaneos de menor calidad. Una revisión del archivo Markdown para detectar estos errores es esencial si el texto se va a publicar o compartir.
La mayoría de los editores de código y editores de Markdown incluyen una función de revisión ortográfica que resalta palabras no reconocidas, lo que hace que los errores de OCR sean fáciles de detectar. Analice las palabras resaltadas y corríjalas con el PDF original. Preste especial atención a los nombres propios, los términos técnicos y los números, que son los que tienen más probabilidades de ser reconocidos incorrectamente y también los más dañinos si se publican incorrectamente. Un informe financiero donde la OCR reconoció "$123,000" como "$128,000" contiene un error material que el corrector ortográfico automático no detectará porque ambos son formatos de números válidos. La verificación manual de los valores críticos con respecto al documento fuente es la única protección confiable.
Conservar imágenes y tablas en la conversión Markdown
Markdown maneja imágenes haciendo referencia a archivos externos: . Al convertir un PDF a Markdown, las imágenes del PDF deben extraerse y guardarse como archivos separados, y los enlaces de referencia deben insertarse en el texto de Markdown en las posiciones correctas. La PDF Export de WukongPDF a Markdown incluye la extracción de imágenes como parte de la conversión. Cada imagen del PDF se guarda como un archivo PNG o JPEG en una carpeta junto al archivo Markdown, y el texto de Markdown contiene las etiquetas de referencia de imagen apropiadas.
Las tablas son más desafiantes. Las tablas Markdown utilizan una sintaxis de barras y guiones que es fácil de leer para los humanos pero difícil de generar para los convertidores automatizados a partir de datos de tablas PDF porque los PDF no almacenan tablas como datos estructurados. Almacenan personajes en posiciones. El convertidor debe realizar ingeniería inversa en la cuadrícula de la tabla a partir de las posiciones de los caracteres, lo que produce resultados imperfectos para tablas complejas con celdas fusionadas, contenido de celdas de varias líneas o anchos de columnas desiguales. Las tablas de cuadrícula simples con columnas uniformes y contenido de celdas de una sola línea se convierten de manera confiable. Es posible que las tablas complejas necesiten una reestructuración manual en la salida de Markdown. Si una tabla se convierte mal, considere exportarla como una imagen separada en lugar de como sintaxis de tabla Markdown. Una imagen claramente legible de una tabla compleja es más útil que Markdown confuso que se representa como columnas desalineadas.
Cómo utilizar el archivo Markdown
El archivo Markdown resultante se abre en cualquier editor de texto, aplicación para tomar notas como Obsidian o Notion, generador de sitios estáticos como Hugo o Jekyll, o editor de código como VS Code. Desde Markdown, puede generar HTML para un sitio web, PDF para distribución, DOCX para procesamiento de textos o simplemente mantener el texto en un formato de texto sin formato con capacidad de búsqueda y control de versión que será legible durante décadas.
El valor de este canal es más evidente con el material de archivo. Los informes escaneados antiguos, los documentos históricos y las publicaciones agotadas se vuelven no sólo susceptibles de búsqueda sino también transformables. Un informe escaneado de 2005 se convierte en un archivo Markdown que puede editarse en un editor moderno, convertirse en un sitio web, citarse en una publicación de blog o analizarse mediante programación. El Formato PDF que encerraba el texto dentro de una imagen durante 20 años ya no limita cómo se puede utilizar el contenido.
Pruebe el OCR de PDF
No se necesita instalación. Funciona directamente en su navegador.
