Copiare testo da un PDF e incollarlo in Word o in un editor di testo spesso produce un caos di linee spezzate. Ogni riga del PDF diventa un paragrafo separato nell'output incollato, con interruzioni di riga che rendono impossibile modificare il testo come una prosa continua. La rimozione di queste interruzioni di riga indesiderate dopo la conversione o la copia da PDF a Word è un'attività di pulizia della formattazione che può essere automatizzata con la funzione Trova e sostituisci e alcune scorciatoie da tastiera.
Concetti chiave
L'estrazione del testo PDF inserisce un'interruzione di riga alla fine di ogni riga visiva. Quando incollata in un editor di testo, ogni riga diventa un paragrafo separato. La soluzione più rapida è la ricerca e sostituzione con caratteri jolly che rimuove le interruzioni di riga singole preservando le interruzioni di riga doppie tra i paragrafi autentici. Questa singola operazione converte il testo spezzato in paragrafi scorrevoli in pochi secondi.

Perché il testo PDF viene copiato con così tante interruzioni di riga
Un PDF memorizza il testo come singoli oggetti linea, ciascuno posizionato in coordinate specifiche sulla pagina. A differenza di un documento di un elaboratore di testi in cui il testo scorre continuamente da una riga a quella successiva, un PDF non ha il concetto di testo scorrevole. Ogni linea è un oggetto separato. Quando copi del testo, il processo di estrazione legge questi oggetti riga in ordine e inserisce un'interruzione di riga dopo ognuno di essi poiché non è in grado di distinguere tra un'interruzione di riga che termina un paragrafo e un'interruzione di riga che è semplicemente un ritorno a capo all'interno di un paragrafo.
Il problema è più visibile con i PDF a più colonne e con i PDF creati da documenti di testo formattato. Un paragrafo che si estende su quattro righe visive nel PDF diventa quattro paragrafi separati quando viene incollato, ciascuno dei quali termina con un segno di paragrafo. La modifica di questo testo richiede l'unione manuale delle righe, il che è noioso per più di pochi paragrafi. L'approccio di ricerca e sostituzione automatizza il ricongiungimento.
Prova da PDF a Word
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Rimuovi interruzioni di riga singole con Trova e sostituisci
Dopo aver utilizzato la funzione Trova e sostituisci per unire le righe spezzate, scansiona il testo per individuare le interruzioni di paragrafo che avrebbero dovuto essere preservate ma non lo erano. I punti elenco e gli elenchi numerati sono le vittime più comuni perché ogni punto elenco o numero si trova su una riga separata. Il metodo trova e sostituisci li unisce in un unico paragrafo. Ripristina manualmente le interruzioni di riga prima di ogni punto elenco o numero. Questa fase di pulizia richiede alcuni minuti ma produce un documento finale raffinato.
Incolla il testo copiato in Word. Apri Trova e sostituisci con Ctrl+H. Nel campo Trova, digita ^p per abbinare i segni di paragrafo. Nel campo Sostituisci con digitare un singolo spazio. Fare clic su Sostituisci tutto. Ogni segno di paragrafo nel documento viene sostituito con uno spazio, unendo tutto il testo in un unico paragrafo. Questo è troppo aggressivo perché rimuove anche i segni di paragrafo tra i paragrafi autentici. Per risolvere questo problema, proteggi prima i doppi segni di paragrafo che separano i paragrafi reali. Sostituisci prima ^p^p con un segnaposto come @@PARA@@. Quindi sostituire i restanti segni ^p singoli con spazi. Infine, sostituisci @@PARA@@ con ^p^p per ripristinare le interruzioni di paragrafo.
L'approccio di ricerca e sostituzione dei caratteri jolly può essere esteso per gestire modelli di pulizia più complessi. Un documento con intestazioni di sezione può essere protetto sostituendo il modello di testo dell'intestazione, ad esempio una riga che termina con due punti seguiti da un segno di paragrafo, con un segnaposto prima della rimozione generale dell'interruzione di riga. Dopo aver unito le righe del corpo del testo, ripristina le interruzioni di intestazione dai segnaposto. Ciò preserva sia la struttura del paragrafo che la separazione dei titoli.
In Word, questo processo in tre passaggi richiede circa 30 secondi e funziona su testo di qualsiasi lunghezza. La chiave sta nell'utilizzare un segnaposto che non appare da nessuna parte nel testo del documento. Dopo aver sostituito le interruzioni di riga singole, il testo scorre come paragrafi continui. Ogni interruzione di paragrafo originale viene conservata come interruzione di doppia riga. Il documento è ora modificabile come una normale prosa. Gli strumenti Formato PDF di WukongPDF preservano la struttura del paragrafo durante la conversione, riducendo la quantità di pulizia manuale delle interruzioni di riga necessaria dopo la copia.
Utilizzare gli strumenti di pulizia del testo online per soluzioni rapide
La pulizia con un clic consente di risparmiare minuti di modifica manuale riga per riga.
Per il testo copiato da un PDF scansionato ed elaborato tramite OCR, il problema delle interruzioni di riga è aggravato dagli errori OCR. Ogni carattere riconosciuto erroneamente aggiunge rumore al testo già spezzato. In questo caso, esegui il controllo ortografico del testo dopo aver rimosso le interruzioni di riga. Il controllo ortografico rileva gli errori OCR che la rimozione delle interruzioni di riga non è in grado di risolvere. La combinazione della rimozione delle interruzioni di riga e del controllo ortografico produce l'output più pulito dai documenti scansionati.
Diversi strumenti online gratuiti sono specializzati nella pulizia del testo copiato dai PDF. Incolla il testo copiato nello strumento e rimuoverà automaticamente le interruzioni di riga singole preservando le interruzioni di paragrafo. Questi strumenti utilizzano la stessa logica del metodo di ricerca e sostituzione manuale, ma lo applicano con un clic. Sono ideali per attività una tantum di pulizia del testo in cui l'impostazione della ricerca e sostituzione in Word richiede uno sforzo maggiore di quanto l'attività giustifichi.
Quando scegli uno strumento di pulizia del testo online, tieni presente che stai incollando testo potenzialmente sensibile in un sito Web di terze parti. Per i documenti riservati, utilizzare il metodo di ricerca e sostituzione manuale in un'applicazione locale anziché in uno strumento online. Il metodo manuale funziona offline, mantiene il testo sul tuo computer e produce risultati identici.
Prevenire problemi di interruzione di riga nelle copie future
La qualità dell'estrazione del testo dipende anche da come è stato creato il PDF. I PDF generati dagli elaboratori di testo in genere hanno un migliore ordinamento interno del testo rispetto ai PDF creati tramite scansione e OCR. L'ordinamento del testo in un PDF generato da un elaboratore di testi segue l'ordine di lettura del documento originale. L'ordinamento del testo in un PDF generato dall'OCR segue l'ordine spaziale in cui il motore OCR ha riconosciuto il testo, che potrebbe non corrispondere all'ordine di lettura nei layout a più colonne o complessi.
Se devi copiare regolarmente testo da PDF, modifica il tuo flusso di lavoro per ridurre al minimo il carico di pulizia. Converti il PDF in Word prima di copiare il testo anziché copiare direttamente dal visualizzatore PDF. Gli strumenti di conversione da PDF a Word sono progettati per gestire l'unione delle interruzioni di riga e produrre testo scorrevole. Il documento Word convertito avrà ancora bisogno di qualche ripulitura, ma molto meno del testo copiato direttamente dal visualizzatore PDF.
Per creare PDF da cui altri dovranno copiare il testo, abilitare i tag di accessibilità durante la creazione del PDF. I PDF contrassegnati includono informazioni sulla struttura che indicano agli strumenti di estrazione del testo dove iniziano e finiscono i paragrafi. Il testo copiato da un PDF con tag è notevolmente più pulito rispetto al testo di un PDF senza tag perché lo strumento di estrazione utilizza i tag della struttura del paragrafo invece di indovinare i limiti del paragrafo dalle posizioni delle righe.
Quando generi PDF da Word, abilita l'opzione "Tag della struttura del documento per l'accessibilità" nelle impostazioni di esportazione del PDF. Ciò incorpora informazioni strutturali nel PDF che gli strumenti di estrazione del testo utilizzano per identificare i limiti del paragrafo. Il testo estratto da un PDF con tag presenta un numero significativamente inferiore di interruzioni di riga spurie perché lo strumento di estrazione sa dove iniziano e finiscono i paragrafi dai tag della struttura anziché indovinare dalle posizioni delle righe.
Domande frequenti
Il carattere utilizzato nel PDF originale influisce sulla pulizia del testo? Sì, in modo significativo. I PDF che utilizzano caratteri PostScript o TrueType standard con codifica corretta vengono copiati in modo più pulito rispetto ai PDF che utilizzano caratteri con codifica personalizzata. Alcuni caratteri personalizzati utilizzano mappature dei caratteri non standard in cui ciò che viene visualizzato come lettera A viene memorizzato internamente come un codice carattere completamente diverso. Quando copi del testo da un PDF di questo tipo, il testo estratto potrebbe contenere caratteri completamente errati. Non esiste alcuna soluzione per i problemi di codifica dei caratteri diversa dall'estrazione basata su OCR.
Perché a volte il testo incollato da un PDF contiene spazi casuali inseriti in mezzo alle parole? Questa situazione è chiamata frammentazione del testo e si verifica quando il PDF memorizza singoli caratteri o piccoli gruppi di caratteri come oggetti di testo separati. Il visualizzatore PDF inserisce spazi tra gli oggetti durante l'estrazione del testo. Non esiste una soluzione automatica. L’unica soluzione è la correzione di bozze manuale. I PDF creati con l'incorporamento dei caratteri e la codifica del testo corretti hanno meno probabilità di presentare frammentazione.
Esiste un modo per copiare testo da un PDF senza ottenere interruzioni di riga? Alcuni strumenti di estrazione da PDF a testo producono paragrafi continui in base alla progettazione. Questi strumenti analizzano la disposizione del testo e uniscono le righe che appartengono allo stesso paragrafo. L'output è più pulito del copia-incolla ma richiede l'utilizzo dello strumento di estrazione invece del metodo standard di selezione e copia. Per l'estrazione frequente di testo, investire in uno strumento di estrazione dedicato consente di risparmiare notevolmente tempo di pulizia.
Perché a volte il testo del PDF incollato contiene spazi aggiuntivi in mezzo alle parole?
Ciò accade quando il PDF memorizza ciascun carattere o un piccolo gruppo di caratteri come oggetti di testo separati con piccoli spazi tra loro. Il processo di estrazione del testo inserisce uno spazio in ogni spazio vuoto. Non esiste una soluzione automatica a questo problema perché gli spazi sono indistinguibili dagli spazi di parole legittimi. La correzione e la correzione manuale sono l’unica soluzione. La creazione di PDF con il corretto incorporamento dei caratteri riduce il verificarsi della frammentazione del testo a livello di carattere.
Posso copiare testo da una tabella PDF senza distruggere l'allineamento delle colonne?
Il copia-incolla standard non preserva la struttura della tabella. Il testo di tutte le colonne viene estratto in ordine di lettura, producendo una sequenza confusa. Per copiare i dati della tabella mantenendo le colonne, utilizza uno strumento di conversione da PDF a Excel che rileva la struttura della tabella. L'output di Excel conserva l'allineamento delle colonne ed è possibile copiare da Excel mantenendo la struttura intatta.
Il visualizzatore PDF influisce sulla precisione delle copie del testo?
SÌ. L'estrazione del testo di Adobe Acrobat è generalmente la più pulita. I visualizzatori basati su browser spesso producono più interruzioni di riga perché sono ottimizzati per la visualizzazione, non per l'estrazione del testo. Se devi copiare frequentemente il testo, utilizza un lettore PDF dedicato per l'estrazione anziché un visualizzatore basato su browser.
Prova da PDF a Word
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
