Un PDF arriva via e-mail. Aprendolo si rivela quello che sembra un documento stampato. Il testo c'è, la formattazione è corretta. Ma il testo si può selezionare con il cursore, oppure il cursore ci passa sopra come se fosse una fotografia? La risposta determina se il PDF è stato creato mediante scansione di carta o generato da una fonte digitale e determina tutto su come puoi lavorare con il file.
Facendo clic sul testo e osservando se il cursore lo seleziona o lo ignora, si risponde alla domanda in un secondo.
Determinare se un PDF è stato scansionato o creato digitalmente implica controllare il testo selezionabile, esaminare la struttura del file e cercare artefatti visivi rivelatori della scansione. Gli strumenti OCR PDF di WukongPDF possono rendere ricercabili i documenti scansionati e i passaggi di identificazione di PDF scansionato riportati di seguito ti dicono se hai bisogno dell'OCR in primo luogo.

Il test di selezione del testo
Apri il PDF e prova a selezionare una parola di testo con lo strumento di selezione testo. Se il cursore evidenzia la parola carattere per carattere, il PDF contiene testo selezionabile ed è stato creato digitalmente o è già stato sottoposto a OCR. Se il cursore disegna un rettangolo di selezione sull'intera area senza evidenziare i singoli caratteri, la pagina è un'immagine e il PDF è stato creato tramite scansione.
Il test di selezione del testo è veloce e definitivo per le verifiche su singola pagina. Per i documenti composti da più pagine, prova alcune pagine dall'inizio, dalla parte centrale e dalla fine. Alcuni PDF combinano pagine digitali e scansionate, in genere una lettera di accompagnamento creata digitalmente seguita da allegati scansionati. Il test di selezione del testo su ciascuna pagina rivela quali pagine sono quali.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Controllare la dimensione del file e il conteggio delle pagine per trovare indizi
I PDF scansionati sono in genere più grandi dei PDF digitali con lo stesso numero di pagine perché ogni pagina è un'immagine a pagina intera. Un PDF scansionato di 10 pagine a 300 DPI occupa spesso 5-15 MB. Un PDF digitale di 10 pagine con lo stesso contenuto potrebbe essere di 100-500 KB. La differenza nella dimensione del file è un rapido indizio prima ancora di aprire il file.
I PDF scansionati tendono anche ad avere meno funzionalità interne. Nessun segnalibro, nessun collegamento ipertestuale, nessun carattere incorporato, nessun metadato oltre alle proprietà di base del file. Apri Proprietà del documento e controlla la scheda Caratteri. Un PDF scansionato non ha caratteri elencati perché tutto il contenuto è costituito da immagini. Un PDF digitale elenca i caratteri utilizzati nel documento.
Verifica delle proprietà del file per il metodo di creazione
Le proprietà del documento spesso includono l'applicazione che ha creato il PDF. Un PDF creato da Adobe Acrobat da Microsoft Word era probabilmente digitale. È stato scansionato un PDF creato da Canon Scanner Driver o HP Scan. Un PDF creato da un'applicazione OCR può essere un documento scansionato che è stato elaborato per la ricercabilità.
Il campo produttore in Proprietà documento viene impostato dall'applicazione creatrice e non è sempre affidabile perché può essere modificato o falsificato. Combina le informazioni del produttore con il test di selezione del testo e il controllo del carattere per una determinazione sicura. Tre test indipendenti che portano alla stessa conclusione sono affidabili.
| Test | Risultato PDF digitale | Risultato PDF scansionato |
|---|---|---|
| Selezione del testo | Il cursore evidenzia i singoli caratteri | Il cursore disegna un rettangolo di selezione sull'immagine |
| Dimensione file (10 pagine) | 100-500KB | 5-15MB |
| Scheda Caratteri in Proprietà | Elenca i caratteri incorporati | Vuoto, senza caratteri |
| Campo del produttore | Word, Acrobata, Chrome | Driver dello scanner, software di imaging |
Ricerca di artefatti visivi della scansione
Ingrandisci fino al 400% su un'area di testo. I PDF scansionati mostrano gli artefatti caratteristici dell'acquisizione delle immagini: leggera sfocatura ai bordi dei caratteri, oscurità irregolare sulla pagina dovuta all'illuminazione dello scanner e granelli di polvere o segni di capelli sul vetro dello scanner che appaiono come linee o punti deboli. I PDF digitali mostrano bordi dei caratteri nitidi a qualsiasi livello di zoom.
I PDF scansionati di pagine fronte-retro potrebbero mostrare testo invertito e sbiadito che fuoriesce dall'altro lato del foglio. Questo è un segno definitivo di scansione perché i PDF digitali non hanno il concetto di opacità della carta. L'effetto fantasma appare come un'ombra grigia del testo dietro il testo principale, più visibile nelle aree in cui il testo principale è scarso.
Utilizzo dei campi metadati PDF per ulteriori indizi
I campi dei metadati PDF, accessibili tramite Proprietà del documento, possono rivelare l'origine del documento. Un campo Titolo contenente il nome file del documento originale, come Annual-Report-2025-Final.docx, indica che il PDF è stato creato da quel file Word. Un campo Titolo vuoto o un Titolo che corrisponde al nome del file PDF è neutro. Un campo Creatore che elenca Microsoft Word o Google Docs indica l'origine digitale.
I campi Data di creazione e Data di modifica possono fornire indizi sulla sequenza temporale. Un PDF creato e modificato nella stessa data a pochi minuti l'uno dall'altro suggerisce un'esportazione digitale diretta. Un PDF con una data di modifica anni successiva alla data di creazione potrebbe essere stato sottoposto a OCR o elaborato. I metadati raccontano la storia del documento e la storia rivela se è stata coinvolta la scansione.
Cosa fare una volta conosciuto il tipo PDF
Per i PDF scansionati che devono essere ricercabili, esegui l'OCR per aggiungere un livello di testo. Il processo OCR riconosce il testo nelle immagini della pagina e aggiunge dietro di esse testo selezionabile e ricercabile. L'aspetto visivo non cambia. Il PDF acquisisce funzionalità di ricerca e copia-incolla.
Per i PDF digitali che devono apparire scansionati, in genere per riproduzioni di documenti dall'aspetto ufficiale, la conversione in immagine e viceversa non è necessaria e riduce la qualità. Il PDF digitale è già nella sua forma ottimale. Qualsiasi elaborazione che converta il testo in immagini riduce la qualità senza aggiungere valore.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
