Others

Puoi rimuovere tutte le immagini da un PDF ed esportare una versione di solo testo

Un PDF ricco di fotografie, grafici, loghi e immagini decorative ad alta risoluzione può essere poco pratico per i flussi di lavoro incentrati sul testo. Quando hai bisogno solo delle parole, rimuovendo tutte le Immagini PDF ed esportando una versione di solo testo si produce un file notevolmente più piccolo contenente solo il contenuto testuale del documento. La domanda è se l'output risultante di solo testo è completo e utilizzabile per lo scopo previsto.

La risposta breve è sì per i PDF basati su testo in cui il testo esiste come caratteri selezionabili. Per i PDF scansionati in cui il testo fa parte dell'immagine, l'eliminazione delle immagini rimuove tutto, compreso il testo. La distinzione fondamentale è tra PDF con testo nativo, in cui testo e immagini sono livelli separati, e PDF basati su immagini, in cui l'intera pagina è un'immagine senza livello di testo.

L'estrazione PDF in testo rimuove le immagini preservando il contenuto del testo. Per i documenti in cui il testo ha il significato principale e le immagini sono supplementari, l'output di solo testo è perfettamente utilizzabile. Per i documenti in cui le immagini trasmettono informazioni essenziali, come scansioni mediche o disegni architettonici, l'output di solo testo perde contenuto critico.

Gli strumenti di elaborazione PDF di WukongPDF includono funzionalità di eliminazione delle immagini e di estrazione del testo.

Can You Strip All Images From a PDF and Export a Text-Only Version

La differenza tra testo nativo e PDF basati su immagini

Un PDF di testo nativo memorizza il testo come codici di carattere posizionati sulla pagina. Le immagini sono oggetti separati sovrapposti o posizionati tra blocchi di testo. Quando rimuovi le immagini da un PDF con testo nativo, il testo rimane intatto e completamente leggibile. La struttura del documento come intestazioni, paragrafi e interruzioni di pagina viene preservata. Scompaiono solo le immagini decorative e illustrative.

Un PDF basato su immagini memorizza l'intera pagina come immagine raster, in genere da uno scanner o da uno screenshot. Non ci sono caratteri di testo da preservare. L'eliminazione delle immagini da un PDF basato su immagini rimuove tutto, producendo un documento vuoto. Per i PDF scansionati che sono stati elaborati tramite OCR, dietro l'immagine è presente uno strato di testo invisibile. L'eliminazione delle immagini rimuove la pagina scansionata visibile ma preserva il testo OCR, che potrebbe contenere errori di riconoscimento.

Per determinare quale tipo di PDF hai, aprilo in qualsiasi lettore PDF e prova a selezionare una parola di testo. Se puoi selezionare singoli caratteri, il PDF è testo nativo e l'eliminazione dell'immagine conserverà il testo. Se facendo clic si seleziona un'intera pagina come un unico grande blocco immagine, il PDF è basato su immagini e l'eliminazione delle immagini non lascerà nulla o solo il livello di testo OCR.

WukongPDF

Prova a comprimere PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Metodo 1: eliminazione delle immagini con l'ottimizzatore PDF di Acrobat Pro

Apri il PDF in Acrobat Pro e vai su File, Salva come altro, PDF ottimizzato. Nella finestra di dialogo Ottimizzatore PDF, fare clic su Elimina oggetti nel pannello di sinistra. Seleziona la casella Elimina tutte le immagini. In Pulizia, seleziona Rimuovi oggetti inutilizzati. Fare clic su OK e salvare il file ottimizzato con un nuovo nome. Acrobat elabora il file e rimuove tutti gli oggetti immagine raster.

In pratica, la conseguente riduzione delle dimensioni del file può essere notevole. Un PDF da 20 MB con fotografie ad alta risoluzione potrebbe ridursi a meno di 100 KB se il documento è composto principalmente da testo con immagini incorporate. Apri il file ottimizzato e scorri ogni pagina per verificare che tutto il contenuto testuale sia presente e leggibile. Controlla le aree della pagina in cui le immagini sono state rimosse. Il layout potrebbe spostarsi leggermente perché lo spazio precedentemente occupato dalle immagini è ora vuoto.

Se insieme alle immagini sono stati rimossi contenuti essenziali, ad esempio grafici archiviati come immagini anziché come grafica vettoriale, annullare l'operazione e utilizzare un approccio più selettivo. Invece di eliminare tutte le immagini, comprimile pesantemente o sostituiscile con un testo segnaposto che descriva ciò che è stato rimosso.

Metodo 2: estrazione programmatica del testo

Le librerie Python come PyMuPDF e pdfplumber estraggono il testo ignorando le immagini in modo nativo. L'estrazione legge solo il livello di testo, producendo un flusso di testo pulito senza dati di immagine. Il testo estratto può essere salvato come file .txt per la modifica o inserito in un nuovo PDF di solo testo. L'approccio programmatico è programmabile, ripetibile e gestisce l'elaborazione batch di più file.

Per i PDF scansionati che dispongono di un livello di testo OCR, l'estrazione programmatica legge il testo OCR. La qualità dipende interamente dalla precisione dell'OCR. Un documento scansionato in modo pulito con il moderno OCR può produrre un testo accurato al 99%. Un documento scansionato in modo inadeguato con il vecchio OCR può produrre testo che richiede una sostanziale correzione manuale. L'estrazione includerà eventuali errori OCR presenti nel livello testo.

Verifica della qualità post-estrazione

Dopo aver rimosso le immagini o estratto il testo, verifica la qualità dell'output prima di utilizzarlo. Confronta il conteggio delle parole del testo estratto con una stima manuale del documento originale. Una discrepanza significativa suggerisce che il contenuto sia andato perso. Cerca termini noti che compaiono nell'originale per confermare che siano presenti nell'output. Esamina il primo e l'ultimo paragrafo di ciascuna sezione principale per verificarne la completezza.

Quando si tratta di flussi di lavoro documentali, per i documenti in cui l'accuratezza del testo è fondamentale, come documenti legali o rapporti finanziari, chiedi a un secondo revisore di controllare a campione il testo estratto rispetto al PDF originale. Anche un'estrazione accurata al 99% significa un errore ogni cento parole, il che potrebbe essere inaccettabile per i documenti di precisione. Il passaggio di verifica rileva gli errori di estrazione che i controlli di qualità automatizzati non rilevano.

Tipo documentoSvestimento sicuro?Alternativa
Breve legaleSì, il testo è primarioNessuno necessario
Report con graficiNo, i grafici contengono datiComprimere anziché rimuovere
Documento scansionatoNo, scansiona il contenutoPrima l'OCR, quindi estrai il testo

L'eliminazione delle immagini da un PDF è appropriata quando il contenuto del testo è il valore principale e le immagini sono accessorie. Il file di solo testo risultante è notevolmente più piccolo, completamente ricercabile e pronto per l'analisi del testo, la traduzione o il riutilizzo dei contenuti. La decisione di eliminare le immagini dovrebbe essere presa dopo aver verificato che il testo da solo trasmetta il significato essenziale del documento.

Quando si tratta di flussi di lavoro documentali, per i documenti in cui immagini e testo lavorano insieme, conserva il PDF completo e ottimizzalo tramite la compressione anziché la rimozione. Un PDF compresso preserva la relazione visiva tra testo e immagini riducendo le dimensioni del file per la distribuzione.

Cosa succede al layout del PDF dopo l'eliminazione dell'immagine

Durante i flussi di lavoro tipici, quando le immagini vengono rimosse, lo spazio che occupavano sulla pagina diventa vuoto. Il testo avvolto attorno alle immagini potrebbe rifluire nello spazio vuoto. Le tabelle che includevano celle immagine avranno celle vuote. I layout di pagina progettati attorno a posizionamenti di immagini specifici possono sembrare scomodi. Il PDF rimosso è ottimizzato per il contenuto, non per il design visivo.

Per i documenti in cui l'integrità del layout è importante, valuta la possibilità di sostituire le immagini con testo segnaposto anziché rimuoverle completamente. Al posto di ciascuna immagine è possibile inserire una didascalia del tipo Immagine rimossa: fotografia del prodotto. Il segnaposto preserva la struttura del layout riconoscendo che il contenuto visivo è stato intenzionalmente rimosso.

Utilizzo dell'OCR per creare un livello di testo prima dell'eliminazione dell'immagine

Con l'elaborazione dei documenti, per i PDF scansionati privi di un livello di testo, l'esecuzione dell'OCR prima dell'eliminazione dell'immagine crea i dati di testo che il processo di eliminazione conserva. OCRmyPDF può aggiungere un livello di testo ai PDF scansionati con un unico comando. Dopo l'elaborazione OCR, il PDF contiene sia l'immagine scansionata visibile che un livello di testo invisibile. L'eliminazione delle immagini rimuove quindi la pagina scansionata preservando il testo riconosciuto.

In pratica, la qualità dell'OCR determina direttamente l'utilizzabilità dell'output rimosso. Un documento con una precisione OCR del 99% produce testo utilizzabile con errori occasionali. Un documento con una precisione dell'80% produce testo che richiede una sostanziale correzione manuale. Prima di impegnarsi nell'eliminazione delle immagini dai documenti scansionati, eseguire l'OCR e valutare la qualità del testo su una pagina campione.

Compressione delle immagini come alternativa allo stripping

Rispetto ai documenti in cui la rimozione completa delle immagini farebbe perdere contenuto prezioso, la compressione aggressiva delle immagini fornisce una via di mezzo. Il ridimensionamento delle immagini a 72 DPI con compressione JPEG elevata può ridurre un PDF da 20 MB a 2 o 3 MB mantenendo le immagini riconoscibili. Le immagini compresse sono di bassa qualità ma trasmettono comunque le informazioni visive.

La combinazione della compressione con la rimozione selettiva dell'immagine offre la massima flessibilità. Mantieni le immagini nelle pagine in cui sono essenziali, come diagrammi e fotografie al centro del contenuto, ed elimina le immagini decorative dalle pagine in cui non hanno alcuno scopo informativo. L’approccio ibrido richiede più lavoro manuale ma produce il miglior equilibrio tra qualità e dimensioni.

L'esportazione di PDF di solo testo serve a casi d'uso specifici: inserimento di contenuti in pipeline di analisi del testo, creazione di versioni leggere per la lettura mobile e preparazione di documenti per la traduzione in cui le immagini aumenterebbero i costi senza aggiungere valore. Per ciascuno di questi casi d'uso, il testo è il prodotto e le immagini sono un imballaggio che può essere scartato.

La decisione di rimuovere le immagini dovrebbe essere documentata in modo che i futuri lettori della versione di solo testo comprendano che il contenuto visivo è stato rimosso intenzionalmente. Una breve nota nelle proprietà del documento o sulla copertina evita confusione quando qualcuno confronta la versione di solo testo con l'originale.

Nella maggior parte degli strumenti, l'esportazione PDF di solo testo è uno strumento specializzato per esigenze specifiche. Non è un'ottimizzazione generica. Per la maggior parte dei documenti, la compressione è un primo passo migliore rispetto alla rimozione delle immagini. Riserva l'eliminazione delle immagini ai casi in cui il testo è l'unico contenuto di valore e lo scopo del documento è servito solo dal testo.

Comprendere le capacità e i limiti dell'eliminazione delle immagini garantisce che venga applicata ai documenti giusti per le ragioni giuste, producendo un output che soddisfi lo scopo previsto senza perdita involontaria di contenuti. Il PDF di solo testo serve bene a scopi specifici e deve essere applicato in modo selettivo in base al tipo di documento e all'uso previsto.

WukongPDF

Prova a comprimere PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →