Esegui l'OCR di un PDF e il testo riconosciuto viene visualizzato in una casella di testo all'interno dell'editor PDF. Puoi leggerlo. Puoi copiarlo e incollarlo. Ma ciò che realmente desideri è il testo in un file Markdown, con titoli formattati come hash, elenchi come asterischi, collegamenti come coppie di parentesi quadre e paragrafi separati da righe vuote. Markdown è la lingua franca di sviluppatori, scrittori tecnici, blogger e chiunque abbia bisogno di testo pulito e portatile che possa essere inserito in un generatore di siti statici, un'app per prendere appunti o un repository di codice.
Il passaggio da un PDF scansionato a un file Markdown avviene in due passaggi: l'OCR riconosce il testo, quindi un passaggio di formattazione converte il testo riconosciuto nella sintassi Markdown. Ogni passaggio prevede scelte di strumenti che influiscono sulla qualità dell'output finale.

Passaggio 1: eseguire l'OCR del PDF per estrarre il testo riconosciuto
Il passaggio OCR equivale a rendere ricercabile qualsiasi PDF. Utilizzare uno strumento OCR PDF per elaborare le pagine scansionate. Lo strumento aggiunge un livello di testo a ogni pagina. Per l'esportazione Markdown, desideri che l'output OCR sia in un formato che preservi quante più informazioni strutturali possibili: quale testo è un'intestazione, quale testo è il corpo, quale testo fa parte di un elenco o di una tabella. I motori OCR standard producono testo semplice, che perde tutte le informazioni strutturali. Un'intestazione e un paragrafo del corpo diventano blocchi di testo indistinguibili separati da interruzioni di riga.
Per ottenere risultati ottimali, utilizza un motore OCR che supporti l'estrazione del testo in base al layout. Questi motori analizzano la disposizione spaziale del testo sulla pagina e possono distinguere tra intestazioni, corpo del testo, didascalie e note a piè di pagina in base alla dimensione del carattere, alla posizione e alla vicinanza ad altri elementi. Maggiore è il numero di informazioni strutturali acquisite dal motore OCR, più pulita risulterà la conversione Markdown. La funzione Esporta in di Adobe Acrobat Pro include un'opzione "Testo con formattazione" opzione che preserva alcuni spunti strutturali. Il motore OCR preserva la dimensione del carattere e i metadati di posizione che gli strumenti di conversione downstream possono utilizzare per dedurre i livelli di intestazione e le interruzioni di paragrafo.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Passaggio 2: converti il testo riconosciuto in Markdown
Una volta che il PDF ha un livello di testo, la conversione in Markdown può procedere attraverso diversi percorsi. La più semplice è un'esportazione diretta da un editor PDF che supporta Markdown come formato di output. Le opzioni di esportazione di WukongPDF includono Markdown come formato di destinazione quando il PDF è stato elaborato tramite OCR. Seleziona Markdown come formato di output e lo strumento genererà un file .md con il testo riconosciuto formattato secondo le convenzioni Markdown: le righe che iniziano con caratteri più grandi diventano intestazioni con prefisso hash, le righe rientrate diventano voci di elenco e i paragrafi regolari sono separati da righe vuote.
Se un'esportazione Markdown diretta non è disponibile, la pipeline è: esportare il testo riconosciuto in un formato rich text che preservi la formattazione, come RTF o HTML, quindi convertire quel formato intermedio in Markdown utilizzando uno strumento di conversione. Pandoc, il convertitore di documenti universale, gestisce bene questa pipeline. Esporta il testo dal PDF come HTML, quindi esegui: pandoc input.html -f html -t markdown -o output.md. Pandoc traduce i tag di intestazione HTML in hash Markdown, i tag di elenco HTML in marcatori di elenco Markdown e i tag di collegamento HTML nella sintassi di collegamento Markdown. La qualità dell'output dipende dalla qualità dell'esportazione HTML dal PDF. Se l'esportazione PDF produce HTML pulito e ben strutturato, Pandoc produce Markdown pulito. Se l'esportazione produce HTML disordinato con stili incorporati e tag non semantici, il Markdown sarà altrettanto disordinato.
Eliminare gli errori OCR nell'output Markdown
Gli errori OCR nel testo riconosciuto passano invariati all'output Markdown. Gli errori comuni includono caratteri confusi come "cl" riconosciuto come "d", "rn" riconosciuto come "m", e "1" riconosciuto come "l", soprattutto con caratteri di dimensioni più piccole o scansioni di qualità inferiore. Un passaggio di revisione attraverso il file Markdown per individuare questi errori è essenziale se il testo verrà pubblicato o condiviso.
La maggior parte degli editor di codice e degli editor Markdown includono funzionalità di controllo ortografico che evidenziano le parole non riconosciute, rendendo facile individuare gli errori OCR. Lavora sulle parole evidenziate e correggile rispetto al PDF originale. Presta particolare attenzione ai nomi propri, ai termini tecnici e ai numeri, che hanno maggiori probabilità di essere riconosciuti in modo errato e anche i più dannosi se pubblicati in modo errato. Un rapporto finanziario in cui l'OCR ha riconosciuto "$123.000" come "$ 128.000" contiene un errore materiale che il controllo ortografico automatico non rileva perché entrambi sono formati numerici validi. La verifica manuale dei valori critici rispetto al documento di origine è l'unica salvaguardia affidabile.
Conservazione di immagini e tabelle nella conversione Markdown
Markdown gestisce le immagini facendo riferimento a file esterni: . Quando si converte un PDF in Markdown, le immagini nel PDF devono essere estratte e salvate come file separati e i collegamenti di riferimento inseriti nel testo Markdown nelle posizioni corrette. Esportazione PDF in Markdown di WukongPDF include l'estrazione delle immagini come parte della conversione. Ogni immagine nel PDF viene salvata come file PNG o JPEG in una cartella insieme al file Markdown e il testo Markdown contiene i tag di riferimento dell'immagine appropriati.
Le tabelle sono più impegnative. Le tabelle Markdown utilizzano una sintassi pipe-and-dash facile da leggere per gli esseri umani ma difficile da generare per i convertitori automatizzati dai dati delle tabelle PDF perché i PDF non memorizzano le tabelle come dati strutturati. Memorizzano i caratteri nelle posizioni. Il convertitore deve eseguire il reverse engineering della griglia della tabella dalle posizioni dei caratteri, il che produce risultati imperfetti per tabelle complesse con celle unite, contenuto di celle su più righe o larghezze di colonna non uguali. Semplici tabelle a griglia con colonne uniformi e contenuto di celle a riga singola vengono convertiti in modo affidabile. Le tabelle complesse potrebbero richiedere una ristrutturazione manuale nell'output Markdown. Se una tabella viene convertita male, valuta la possibilità di esportarla come immagine separata anziché come sintassi della tabella Markdown. Un'immagine chiaramente leggibile di una tabella complessa è più utile di un Markdown confuso che viene visualizzato come colonne disallineate.
Utilizzo del file Markdown
Il file Markdown risultante si apre in qualsiasi editor di testo, app per prendere appunti come Obsidian o Notion, generatore di siti statici come Hugo o Jekyll o editor di codice come VS Code. Da Markdown puoi generare HTML per un sito Web, PDF per la distribuzione, DOCX per l'elaborazione di testi o semplicemente mantenere il testo in un formato di testo semplice ricercabile e controllabile dalla versione che sarà leggibile per decenni.
Il valore di questa pipeline è più evidente nel materiale d'archivio. Vecchi rapporti scansionati, documenti storici, pubblicazioni fuori stampa, tutto diventa non solo ricercabile ma trasformabile. Un report scansionato del 2005 diventa un file Markdown che può essere modificato in un editor moderno, convertito in un sito Web, citato in un post di blog o analizzato a livello di codice. Il Formato PDF che ha bloccato il testo all'interno di un'immagine per 20 anni non vincola più la fruizione del contenuto.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
