Due PDF si trovano fianco a fianco in una cartella. Entrambi hanno lo stesso numero di pagine. Entrambi sono stati creati nello stesso anno. Digiti lo stesso termine di ricerca in entrambi. Si restituiscono risultati quasi istantaneamente. L'altro fa una pausa, mostra un indicatore di avanzamento che ruota e impiega diversi secondi per segnalare che il termine è stato trovato a pagina dodici. La differenza nella velocità di ricerca tra questi due PDF non è casuale. È determinato dal modo in cui è stato creato il PDF, se il testo è incorporato o generato tramite OCR, come sono codificati i caratteri e se la struttura del documento include funzionalità di ottimizzazione della ricerca. Capire perché alcuni documenti PDF ricercabili sono più veloci da cercare rispetto ad altri ti aiuta a creare PDF che eseguono ricerche in modo efficiente e diagnosticano i documenti dalla ricerca lenta che richiedono attenzione.

Come funziona effettivamente la ricerca PDF
Quando esegui una ricerca in un PDF, il visualizzatore non esegue la scansione delle immagini della pagina visibile alla ricerca delle forme dei caratteri. Interroga i flussi di contenuto di testo incorporati nel file PDF. Ogni pagina contiene uno o più flussi di contenuto che elencano i caratteri sulla pagina, le loro posizioni e i caratteri utilizzati per visualizzarli. La funzione di ricerca legge questi flussi di contenuto in sequenza, carattere per carattere, cercando corrispondenze con il termine di ricerca. La velocità di questa scansione sequenziale dipende da come sono organizzati i dati di testo.
È possibile effettuare ricerche in un PDF con flussi di contenuto ben strutturati, in cui il testo appare in ordine di lettura logico con codifica coerente, alla stessa velocità con cui l'utente riesce a leggere i dati dal disco. Un PDF con flussi di contenuto frammentati, in cui il testo di un singolo paragrafo è sparso su più oggetti flusso in ordine non sequenziale, costringe la funzione di ricerca a saltare tra diverse parti del file, riassemblando il testo in memoria prima che possa essere cercato. Il fattore determinante della velocità di ricerca è la struttura Formato PDF dei flussi di contenuto.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Testo incorporato e testo OCR nelle prestazioni di ricerca
Il testo incorporato, ovvero il testo creato in un elaboratore di testi o in un'applicazione di layout e scritto direttamente nel PDF, viene archiviato come sequenza di codici di carattere. Ogni personaggio occupa una posizione nota nel flusso di contenuti. La funzione di ricerca legge il flusso in modo lineare e trova le corrispondenze in modo efficiente. Il testo OCR PDF, il testo generato dal riconoscimento ottico dei caratteri da un'immagine di pagina scansionata, viene memorizzato in modo diverso. Il motore OCR colloca ciascuna parola riconosciuta nella sua posizione approssimativa sulla pagina, ma le parole potrebbero non essere in rigoroso ordine di lettura nel flusso di contenuti.
Il testo OCR può contenere anche errori di riconoscimento. Un carattere interpretato erroneamente dal motore OCR come carattere diverso non corrisponderà al termine di ricerca anche se il carattere visibile sulla pagina sembra corretto. Una ricerca per contratto non troverà c0ntract, anche se il motore OCR ha restituito il riconoscimento errato e lo ha inserito nel flusso di contenuto. La funzione di ricerca non vede l'immagine della pagina. Vede solo il testo OCR. Gli errori in quel testo si traducono direttamente in errori di ricerca.
Codifica dei caratteri e relativi effetti sulla ricerca
I caratteri nei PDF possono essere codificati in diversi modi e la codifica influisce sulla velocità di ricerca. Un font con una codifica standard, come WinAnsiEncoding o MacRomanEncoding, mappa i codici dei caratteri direttamente sui glifi standard. La funzione di ricerca può elaborare rapidamente questo testo perché la mappatura è semplice. Un font con una codifica personalizzata, in cui i codici dei caratteri vengono assegnati arbitrariamente dal progettista del font, richiede che la funzione di ricerca cerchi ciascun codice nella tabella di codifica dei font per determinare quale carattere rappresenta. Questa ricerca aggiunge un sovraccarico a ogni confronto di caratteri.
I caratteri CID, utilizzati per i set di caratteri dell'Asia orientale, utilizzano una codifica a due livelli che associa i codici dei caratteri ai valori CID e quindi associa i valori CID a Unicode. La ricerca di testo in un carattere con codifica CID richiede la risoluzione di questa mappatura a due livelli per ogni carattere. Un PDF contenente testo cinese, giapponese o coreano in un font con codifica CID verrà ricercato più lentamente di un PDF contenente testo inglese in un font con codifica standard, semplicemente a causa del passaggio aggiuntivo di risoluzione della codifica. La scelta della codifica dei caratteri PDF effettuata al momento della creazione del PDF influisce sulle prestazioni di ricerca per l'intera durata del documento.
Il ruolo dell'albero della struttura della pagina nella ricerca
Un PDF con tag include una struttura ad albero che organizza il contenuto del documento in elementi logici come sezioni, paragrafi e figure. La struttura ad albero fornisce alla funzione di ricerca una roadmap del documento. Invece di scansionare i flussi di contenuto in modo lineare dall'inizio del file, la funzione di ricerca può navigare nella struttura ad albero per individuare il testo all'interno di sezioni specifiche del documento. Una ricerca all'interno di un PDF con tag può essere più veloce perché la struttura ad albero fornisce l'indicizzazione che manca a un flusso di contenuto piatto.
I PDF senza tag, che costituiscono la maggior parte dei PDF in circolazione, non hanno questa struttura ad albero. La funzione di ricerca non ha altra scelta che scansionare i flussi di contenuto in sequenza. Per i documenti brevi, la differenza è trascurabile. Per documenti di centinaia o migliaia di pagine, la presenza o l'assenza di una struttura ad albero può fare la differenza tra risultati di ricerca quasi istantanei e un notevole ritardo. La creazione di PDF contrassegnati è una procedura consigliata per l'accessibilità che apporta vantaggi anche alle prestazioni di PDF ricercabile.
Indici di ricerca incorporati nei PDF
Alcuni strumenti di creazione PDF possono incorporare un indice di ricerca direttamente nel file PDF. Questo indice è una tabella di ricerca predefinita che mappa le parole alle pagine in cui appaiono. È possibile effettuare ricerche in un PDF con un indice incorporato quasi istantaneamente, poiché la funzione di ricerca interroga l'indice anziché scansionare i flussi di contenuto. La ricerca nell'indice restituisce i numeri di pagina in cui appare la parola e lo spettatore passa direttamente a quelle pagine.
Gli indici incorporati non sono comuni nei PDF generici perché aumentano le dimensioni del file e il tempo di creazione dell'indice. Si trovano più comunemente in PDF di riferimento di grandi dimensioni, manuali tecnici e raccolte di documenti in cui la velocità di ricerca è una priorità. La maggior parte dei flussi di lavoro per la creazione di PDF non include la generazione di indici per impostazione predefinita. L'assenza di un indice incorporato è la norma. Quando incontri un PDF che esegue ricerche notevolmente più velocemente di altri di dimensioni simili, probabilmente il motivo è un indice incorporato.
Cosa puoi fare per migliorare la velocità di ricerca
Se crei PDF che verranno cercati frequentemente, generali come PDF contrassegnati con codifiche di caratteri standard. Evitare codifiche di caratteri personalizzate a meno che i requisiti di progettazione non possano essere soddisfatti altrimenti. Se il PDF conterrà testo non latino, testa le prestazioni di ricerca su un campione prima di impegnarti nell'approccio di codifica per l'intero documento. Un piccolo investimento nelle impostazioni di creazione ripaga in una ricerca più rapida per ogni persona che utilizza il documento.
Per i PDF esistenti che eseguono ricerche lentamente, prendi in considerazione la possibilità di ripetere l'OCR del testo generato dall'OCR con un motore moderno che produce flussi di contenuti più puliti. Esegui il PDF tramite uno strumento di analisi della struttura che può aggiungere tag se il documento è attualmente privo di tag. WukongPDF supporta la rielaborazione OCR PDF e l'etichettatura dei documenti che possono migliorare le prestazioni di ricerca nei PDF esistenti senza ricrearli dai documenti di origine.
La data di creazione del PDF e la versione del software utilizzato per crearlo possono spiegare le differenze nella velocità di ricerca. È probabile che un PDF creato da una versione 2024 di una moderna libreria PDF abbia flussi di contenuti più puliti e una codifica del testo più efficiente rispetto a un PDF creato da una versione 2008 di uno strumento legacy. Il formato PDF si è evoluto e gli strumenti di creazione più recenti producono file meglio strutturati.
Per i PDF che vengono cercati frequentemente come parte di un flusso di lavoro di gestione dei documenti, prendi in considerazione l'estrazione del testo e la creazione di un indice di ricerca esterno. Un sistema di gestione dei documenti con un indice di ricerca full-text interroga l'indice, non i flussi di contenuto PDF. La velocità di ricerca diventa indipendente dalla struttura interna del PDF.
Il numero di caratteri utilizzati in un PDF influisce sulla velocità di ricerca poiché ogni modifica del carattere richiede che la funzione di ricerca carichi una nuova tabella di codifica. Un PDF che utilizza due caratteri esegue la ricerca più velocemente di un PDF che utilizza venti caratteri, a parità di tutti gli altri fattori.
Le prestazioni PDF ricercabile di un documento sono determinate al momento della creazione dalle scelte relative alla codifica dei caratteri, all'organizzazione del flusso di contenuti, all'etichettatura dei documenti e all'incorporamento dell'indice. Queste scelte sono invisibili all'autore del documento ma immediatamente evidenti a chiunque esegua la ricerca nel documento.
Per le raccolte di documenti che verranno cercate frequentemente, l'investimento nella creazione di PDF ben strutturati e contrassegnati con codifiche di caratteri standard ripaga ogni volta che un utente digita una query e riceve risultati quasi istantanei.
Questo articolo illustra le tecniche e le considerazioni chiave per lavorare con i PDF in questo scenario specifico. I metodi qui descritti si applicano a diversi strumenti e piattaforme, offrendo ai lettori la flessibilità di scegliere l'approccio che meglio si adatta al loro flusso di lavoro e al loro ambiente tecnico.
I passaggi pratici delineati forniscono un percorso chiaro dalla sfida iniziale a una soluzione operativa. Ciascuna tecnica è stata selezionata per la sua affidabilità e accessibilità, garantendo che i lettori possano ottenere risultati coerenti indipendentemente dalla loro precedente esperienza con gli strumenti PDF.
Le differenze di velocità di ricerca descritte in questo articolo sono il risultato diretto delle scelte effettuate durante la creazione del PDF. La comprensione di questi fattori consente ai creatori di documenti di produrre PDF che offrono una migliore esperienza di ricerca.
Gli strumenti e le tecniche descritti in questo articolo forniscono un percorso pratico dalla domanda iniziale a una soluzione operativa che può essere applicata a una vasta gamma di documenti e scenari.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
