
Perché un PDF che assomiglia a testo potrebbe non essere modificabile
Apri un PDF, vedi le parole sullo schermo e presumi di poterle modificare. Quando fai clic sul testo e non succede nulla, o quando provi a digitare e il cursore non appare, scopri che il PDF che sembra un documento di testo in realtà non è affatto un documento modificabile. Questa esperienza è frustrantemente comune perché i PDF possono contenere testo in forme fondamentalmente diverse, solo alcune delle quali sono modificabili.
L'esecuzione dell'OCR su un PDF scansionato aggiunge uno strato di testo ricercabile e modificabile dietro ogni immagine di pagina nel documento.
La conversione da PDF a un formato modificabile e viceversa è un ripiego affidabile quando la modifica diretta non è possibile.
Un editor PDF può modificare il testo esistente come oggetti di testo effettivi nel PDF, con ciascun carattere rappresentato come un codice carattere selezionabile e modificabile. Questo è chiamato testo nativo o live. Un formato PDF può contenere anche testo che esiste solo come immagine, ad esempio un documento scansionato in cui il testo fa parte della fotografia della pagina. Il testo basato su immagini non può essere selezionato, cercato o modificato perché il PDF non contiene dati sui caratteri, solo pixel che formano le forme delle lettere. Prima di poter sapere se un PDF è modificabile, devi sapere quale tipo di testo contiene.
Il test più rapido è provare a selezionare il testo nel PDF. Fare clic e trascinare su una parola. Se il testo viene evidenziato mentre trascini, si tratta di testo nativo e potenzialmente può essere modificato. Se non viene evidenziato nulla e il cursore non cambia, il testo è basato su un'immagine e non può essere modificato direttamente. Se il testo viene evidenziato ma l'evidenziazione è discontinua, selezionando alcune parole ma saltandone altre, il PDF presenta un mix di testo nativo e testo che esiste solo come elementi visivi, una situazione comune nei PDF creati da software meno recenti o combinando più documenti di origine.
Prova Modifica PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Motivi comuni che il testo del PDF non può essere modificato
Il motivo più comune è che il PDF è un documento scansionato. Un PDF creato scansionando pagine di carta con uno scanner piano o un'app per fotocamera del telefono contiene immagini di testo, non caratteri di testo reali. Anche se è possibile leggere le parole sullo schermo, il file PDF non contiene dati di testo modificabili. Per rendere modificabile un PDF scansionato, devi prima eseguire l'OCR per riconoscere il testo nelle immagini e creare uno strato di testo invisibile dietro ogni immagine della pagina. Dopo l'OCR, il testo diventa ricercabile e, in molti editor PDF, modificabile come se fosse testo nativo.
Le restrizioni relative a password o autorizzazioni rappresentano un altro ostacolo comune alla modifica. Un PDF protetto con una password di autorizzazione può essere aperto e visualizzato, ma le autorizzazioni potrebbero bloccare la modifica, la copia o la stampa. Se riesci ad aprire il PDF e vedere il testo ma gli strumenti di modifica sono disattivati o producono un messaggio di errore, controlla le impostazioni di sicurezza del documento. Nella maggior parte dei visualizzatori PDF, il pannello Proprietà documento o Sicurezza mostra quali autorizzazioni sono limitate. Se la modifica è limitata e disponi della password delle autorizzazioni, puoi rimuovere le restrizioni e abilitare la modifica.
Il PDF può contenere testo convertito in contorni o curve durante la creazione. I grafici a volte convertono il testo in contorni in applicazioni come Adobe Illustrator prima di creare un PDF per garantire che i caratteri vengano visualizzati correttamente indipendentemente dal fatto che il destinatario li abbia installati o meno. Il testo convertito in contorni appare visivamente identico al testo nativo ma è costituito da forme vettoriali anziché da dati di caratteri. Lo strumento No Modifica PDF] può modificare il testo con contorni come testo perché le informazioni sui caratteri sono state scartate durante la conversione in contorni.
I problemi di codifica dei caratteri possono rendere il testo non modificabile anche quando il PDF contiene caratteri di testo nativi. Alcuni PDF utilizzano codifiche di caratteri personalizzate che associano i codici dei caratteri ai glifi in modi non standard. Lo strumento di modifica vede i codici dei caratteri ma non può determinare quali caratteri rappresentano, quindi si rifiuta di modificarli per evitare di corrompere il testo. Questo problema è più comune nei PDF generati da software specializzato, sistemi legacy o documenti che utilizzano script non latini con gestione dei caratteri personalizzata. Riesportare il PDF dall'applicazione originale con l'incorporamento dei caratteri abilitato spesso risolve il problema di codifica.
Come rendere modificabile un PDF scansionato utilizzando l'OCR
Il riconoscimento ottico dei caratteri è il processo che converte le immagini di testo in testo modificabile effettivo. La moderna tecnologia OCR è estremamente accurata per scansioni pulite e ben illuminate di testo stampato con caratteri comuni e dimensioni tipiche. L'esecuzione dell'OCR su un PDF scansionato aggiunge uno strato di testo nascosto dietro ogni immagine della pagina che contiene i caratteri riconosciuti. Una volta completato l'OCR, puoi cercare il testo nel documento e, nella maggior parte degli editor PDF, modificare il testo riconosciuto come se fosse originariamente nativo.
La qualità dell'output OCR dipende dalla qualità delle immagini scansionate. Una scansione ad alta risoluzione a 300 DPI con illuminazione uniforme, pagine piatte e messa a fuoco nitida produce una precisione OCR superiore al 99% per il testo stampato standard. Una scansione a bassa risoluzione a 150 DPI con ombre, pagine curve di un libro rilegato o aree fuori fuoco produce una precisione inferiore e richiede una maggiore correzione manuale dopo l'OCR. La scansione di documenti pensando all'OCR, ovvero pagine piatte, buona illuminazione e risoluzione adeguata, rende il processo di modifica notevolmente più fluido.
La maggior parte degli editor PDF che supportano l'OCR includono la selezione della lingua come parte delle impostazioni di riconoscimento. La selezione della lingua corretta migliora la precisione perché il motore OCR utilizza dizionari specifici della lingua e dati sulla frequenza dei caratteri per risolvere i caratteri ambigui. Un documento in francese riconosciuto con l'impostazione della lingua francese produce risultati migliori rispetto allo stesso documento riconosciuto con l'impostazione della lingua inglese. Per i documenti multilingue, seleziona la lingua primaria e correggi manualmente eventuali errori nei passaggi della lingua secondaria.
Lo strumento OCR PDF di WukongPDF elabora i documenti scansionati nel browser e restituisce un PDF con un livello di testo ricercabile e modificabile. Il motore OCR supporta più lingue e gestisce tipi di documenti comuni tra cui lettere, moduli, ricevute e articoli. Dopo l'OCR, il PDF scansionato precedentemente non modificabile diventa modificabile, con il testo riconosciuto disponibile per la selezione, la ricerca e la modifica.
Approcci alternativi quando la modifica diretta dei PDF non è possibile
Quando un PDF non può essere reso direttamente modificabile, perché si tratta di un documento scansionato senza accesso all'OCR o perché presenta restrizioni di sicurezza che non è possibile rimuovere, flussi di lavoro alternativi consentono di ottenere lo stesso risultato attraverso un percorso diverso. Converti il PDF in un formato modificabile come Word o Google Docs, apporta le modifiche in quel formato e riconverti il documento modificato in PDF. Il viaggio di andata e ritorno attraverso un formato modificabile richiede più tempo rispetto alla modifica diretta, ma funziona con qualsiasi PDF che possa essere aperto e visualizzato.
Per i documenti che necessitano solo di piccole correzioni, come correggere un errore di battitura in un singolo paragrafo, utilizzare gli strumenti di annotazione del PDF per coprire il testo errato con un rettangolo bianco e digitare sopra il testo corretto è una soluzione pragmatica. Questo metodo non modifica realmente il testo sottostante e la struttura del documento, quindi la correzione basata sulle annotazioni è invisibile agli strumenti di ricerca e di accessibilità, ma per correzioni visive rapide su un documento che verrà stampato o visualizzato come immagine, produce risultati accettabili.
Per i documenti che richiedono modifiche estese e che non possono essere modificati direttamente, l'approccio più affidabile consiste nel tornare al documento di origine originale, se disponibile.
Il documento Word, Google Doc o il file InDesign utilizzato per creare il PDF contiene testo modificabile che può essere modificato e riesportato in un nuovo PDF. Rivolgersi al creatore del documento per ottenere il file di origine o individuare il file di origine nei propri record è spesso più veloce che lottare per modificare un PDF non collaborativo.
Alcuni PDF che sembrano contenere testo nativo in realtà hanno il testo memorizzato in modo che gli strumenti di modifica non possano modificarlo, anche se il testo è ricercabile e selezionabile. Questa situazione si verifica quando un PDF ha un livello di testo corretto, che consente la ricerca e la selezione, ma la codifica dei caratteri sottostante impedisce allo strumento di modifica di associare i caratteri modificati ai glifi visivi corretti. Lo strumento di modifica può leggere il testo ma non può riscrivere le modifiche nel documento senza danneggiare potenzialmente la mappatura dei caratteri. Questa difesa contro la modifica è talvolta intenzionale da parte dell'autore del documento.
La proliferazione di strumenti di modifica dei PDF ha reso più semplice che mai la modifica dei PDF, ma ha anche creato confusione su ciò che costituisce modifica. Aggiungere un'annotazione di testo sopra una pagina PDF non equivale a modificare il testo sottostante. Sostituire un'immagine su una pagina PDF non equivale a modificare il testo che descrive l'immagine. Comprendere la differenza tra le modifiche basate sulle annotazioni, che sovrappongono il nuovo contenuto alla pagina esistente, e la vera modifica del testo, che modifica il contenuto del testo effettivo all'interno della struttura del PDF, ti aiuta a scegliere lo strumento giusto e l'approccio giusto per ogni attività di modifica.
Per i documenti che resistono a tutti i tentativi di modifica e contengono informazioni fondamentali da aggiornare, l'opzione nucleare è ricreare il documento da zero. Utilizza il PDF come riferimento visivo e ridigita il contenuto in un elaboratore di testi o in un'applicazione di progettazione, apportando le modifiche durante il processo di ricreazione. Questo approccio richiede molto lavoro ma produce un documento pulito e completamente modificabile senza problemi di formattazione residui, problemi di carattere o artefatti di conversione. Ricreare un documento da un PDF richiede un tempo proporzionale alla lunghezza e alla complessità del documento e, per documenti brevi che necessitano di modifiche significative, può effettivamente essere più veloce che lottare con strumenti di modifica PDF poco collaborativi.
Prova Modifica PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
