Tips & Tricks

Comment supprimer les lignes vides lors de la copie de texte à partir d'un PDF

Copier du texte à partir d'un PDF et le coller dans Word ou dans un éditeur de texte produit souvent un désordre de lignes brisées. Chaque ligne du PDF devient un paragraphe distinct dans la sortie collée, avec des sauts de ligne durs qui rendent le texte impossible à modifier en prose continue. La suppression de ces sauts de ligne indésirables après la conversion ou la copie de PDF vers Word est une tâche de nettoyage de formatage qui peut être automatisée avec la recherche et le remplacement et quelques raccourcis clavier.

Points clés à retenir

L'extraction de texte PDF place un saut de ligne définitif à la fin de chaque ligne visuelle. Lorsqu'elle est collée dans un éditeur de texte, chaque ligne devient un paragraphe distinct. La solution la plus rapide consiste à rechercher et remplacer avec des caractères génériques qui suppriment les sauts de ligne simples tout en préservant les sauts de ligne doubles entre les paragraphes authentiques. Cette opération unique convertit le texte interrompu en paragraphes fluides en quelques secondes.

How to Remove Blank Lines When Copying Text From a PDF

Pourquoi des copies de texte PDF avec autant de sauts de ligne

Un PDF stocke le texte sous forme d'objets ligne individuels, chacun positionné à des coordonnées spécifiques sur la page. Contrairement à un document de traitement de texte où le texte passe continuellement d'une ligne à l'autre, un PDF n'a aucune notion de texte fluide. Chaque ligne est un objet distinct. Lorsque vous copiez du texte, le processus d'extraction lit ces objets ligne dans l'ordre et place un saut de ligne après chacun d'eux, car il ne peut pas faire la distinction entre un saut de ligne qui termine un paragraphe et un saut de ligne qui n'est qu'un retour à la ligne dans un paragraphe.

Le problème est plus visible avec les PDF multicolonnes et les PDF créés à partir de documents texte formatés. Un paragraphe qui s'étend sur quatre lignes visuelles dans le PDF devient quatre paragraphes distincts une fois collé, chacun se terminant par une marque de paragraphe. La modification de ce texte nécessite de relier manuellement les lignes, ce qui est fastidieux pendant plus de quelques paragraphes. L'approche de recherche et de remplacement automatise la réintégration.

WukongPDF

Essayez PDF vers Word

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Supprimer les sauts de ligne simples avec Rechercher et remplacer

Après avoir utilisé la recherche et le remplacement pour joindre des lignes brisées, recherchez dans le texte les sauts de paragraphe qui auraient dû être conservés mais qui ne l'ont pas été. Les puces et les listes numérotées sont les victimes les plus courantes car chaque puce ou numéro se trouve sur sa propre ligne. La méthode Rechercher et remplacer les regroupe en un seul paragraphe. Restaurez manuellement les sauts de ligne avant chaque puce ou numéro. Cette étape de nettoyage prend quelques minutes mais produit un document final soigné.

Collez le texte copié dans Word. Ouvrez Rechercher et remplacer avec Ctrl+H. Dans le champ Rechercher, tapez ^p pour faire correspondre les marques de paragraphe. Dans le champ Remplacer par, saisissez un seul espace. Cliquez sur Remplacer tout. Chaque marque de paragraphe dans le document est remplacée par un espace, réunissant tout le texte en un seul paragraphe. C'est trop agressif car cela supprime également les marques de paragraphe entre les véritables paragraphes. Pour résoudre ce problème, protégez d’abord les doubles marques de paragraphe qui séparent les vrais paragraphes. Remplacez ^p^p par un espace réservé comme @@PARA@@ en premier. Remplacez ensuite les marques ^p restantes par des espaces. Enfin, remplacez @@PARA@@ par ^p^p pour restaurer les sauts de paragraphe.

L’approche de recherche et de remplacement générique peut être étendue pour gérer des modèles de nettoyage plus complexes. Un document comportant des titres de section peut être protégé en remplaçant le modèle de texte du titre, tel qu'une ligne se terminant par deux points suivi d'une marque de paragraphe, par un espace réservé avant la suppression générale du saut de ligne. Après avoir joint les lignes du corps du texte, restaurez les sauts de titre à partir des espaces réservés. Cela préserve à la fois la structure des paragraphes et la séparation des titres.

Dans Word, ce processus en trois étapes prend environ 30 secondes et fonctionne sur du texte de n'importe quelle longueur. La clé consiste à utiliser un espace réservé qui n'apparaît nulle part dans le texte du document. Après avoir remplacé les sauts de ligne simples, le texte se déroule sous forme de paragraphes continus. Chaque saut de paragraphe original est conservé sous forme de double saut de ligne. Le document est désormais modifiable comme une prose normale. Les outils PDF Format de WukongPDF préservent la structure des paragraphes pendant la conversion, réduisant ainsi la quantité de nettoyage manuel des sauts de ligne nécessaire après la copie.

Utiliser les outils de nettoyage de texte en ligne pour des solutions rapides

Le nettoyage en un clic permet d'économiser des minutes d'édition manuelle ligne par ligne.

Pour le texte copié à partir d'un PDF numérisé traité par OCR, le problème de saut de ligne est aggravé par les erreurs OCR. Chaque caractère mal reconnu ajoute du bruit au texte déjà interrompu. Dans ce cas, passez le texte via un correcteur orthographique après avoir supprimé les sauts de ligne. Le correcteur orthographique détecte les erreurs OCR que la suppression des sauts de ligne ne peut pas résoudre. La combinaison de la suppression des sauts de ligne et de la vérification orthographique produit le résultat le plus propre des documents numérisés.

Plusieurs outils en ligne gratuits sont spécialisés dans le nettoyage du texte copié à partir de PDF. Collez le texte copié dans l'outil et il supprimera automatiquement les sauts de ligne tout en préservant les sauts de paragraphe. Ces outils utilisent la même logique que la méthode de recherche et de remplacement manuelle mais l'appliquent en un seul clic. Ils sont idéaux pour les tâches ponctuelles de nettoyage de texte où la configuration de la recherche et du remplacement dans Word demande plus d'efforts que la tâche ne le justifie.

Lorsque vous choisissez un outil de nettoyage de texte en ligne, sachez que vous collez du texte potentiellement sensible sur un site Web tiers. Pour les documents confidentiels, utilisez la méthode de recherche et de remplacement manuelle dans une application locale plutôt que dans un outil en ligne. La méthode manuelle fonctionne hors ligne, conserve votre texte sur votre ordinateur et produit des résultats identiques.

Prévenir les problèmes de saut de ligne dans les copies futures

La qualité de l'extraction du texte dépend également de la manière dont le PDF a été créé. Les PDF générés par des traitements de texte ont généralement un meilleur ordre interne du texte que les PDF créés par numérisation et OCR. L'ordre du texte dans un PDF généré par traitement de texte suit l'ordre de lecture du document original. L'ordre du texte dans un PDF généré par OCR suit l'ordre spatial dans lequel le moteur OCR a reconnu le texte, qui peut ne pas correspondre à l'ordre de lecture dans les mises en page multi-colonnes ou complexes.

Si vous devez régulièrement copier du texte à partir de PDF, ajustez votre flux de travail pour minimiser la charge de nettoyage. Convertissez le PDF en Word avant de copier le texte plutôt que de le copier directement à partir de la visionneuse PDF. Les outils de conversion PDF vers Word sont conçus pour gérer les sauts de ligne et produire un texte fluide. Le document Word converti aura encore besoin d'un certain nettoyage, mais bien moins que le texte copié directement à partir de la visionneuse PDF.

Pour créer des PDF à partir desquels d'autres personnes devront copier du texte, activez le balisage d'accessibilité lors de la création du PDF. Les PDF balisés incluent des informations de structure qui indiquent aux outils d'extraction de texte où commencent et se terminent les paragraphes. Le texte copié à partir d'un PDF balisé est nettement plus propre que le texte d'un PDF non balisé, car l'outil d'extraction utilise les balises de structure de paragraphe au lieu de deviner les limites des paragraphes à partir des positions des lignes.

Lors de la génération de PDF à partir de Word, activez l'option « Balises de structure du document pour l'accessibilité » dans les paramètres d'exportation PDF. Cela intègre des informations structurelles dans le PDF que les outils d'extraction de texte utilisent pour identifier les limites des paragraphes. Le texte extrait d'un PDF balisé comporte beaucoup moins de sauts de ligne parasites, car l'outil d'extraction sait où commencent et se terminent les paragraphes à partir des balises de structure plutôt que de deviner à partir des positions de ligne.

Foire aux questions

La police utilisée dans le PDF original affecte-t-elle la propreté des copies de texte ? Oui, de manière significative. Les PDF utilisant des polices PostScript ou TrueType standard avec un encodage approprié se copient plus proprement que les PDF utilisant des polices encodées personnalisées. Certaines polices personnalisées utilisent des mappages de caractères non standard dans lesquels ce qui s'affiche sous la forme de la lettre A est stocké en interne sous la forme d'un code de caractère complètement différent. Lorsque vous copiez du texte à partir d'un tel PDF, le texte extrait peut contenir des caractères complètement erronés. Il n’existe aucune solution aux problèmes d’encodage des polices autre que l’extraction basée sur l’OCR.

Pourquoi le texte collé à partir d'un PDF comporte-t-il parfois des espaces aléatoires insérés au milieu des mots ? C'est ce qu'on appelle la fragmentation du texte et se produit lorsque le PDF stocke des caractères individuels ou de petits groupes de caractères en tant qu'objets texte distincts. La visionneuse PDF insère des espaces entre les objets lors de l'extraction de texte. Il n’existe pas de correctif automatisé. La seule solution est la relecture manuelle. Les PDF créés avec une intégration de polices et un encodage de texte appropriés sont moins susceptibles de présenter une fragmentation.

Existe-t-il un moyen de copier du texte à partir d’un PDF sans aucun saut de ligne ? Certains outils d'extraction de PDF en texte produisent dès leur conception des paragraphes continus. Ces outils analysent la mise en page du texte et joignent les lignes appartenant au même paragraphe. Le résultat est plus propre que le copier-coller mais nécessite l'utilisation de l'outil d'extraction au lieu de la méthode standard de sélection et de copie. Pour les extractions de texte fréquentes, investir dans un outil d’extraction dédié permet de gagner un temps de nettoyage important.

Pourquoi le texte PDF collé comporte-t-il parfois des espaces supplémentaires au milieu des mots ?

Cela se produit lorsque le PDF stocke chaque caractère ou petit groupe de caractères sous forme d'objets texte distincts avec de petits espaces entre eux. Le processus d'extraction de texte insère un espace à chaque espace. Il n'existe pas de solution automatisée à ce problème, car les espaces ne peuvent pas être distingués des espaces de mots légitimes. La relecture et la correction manuelles sont la seule solution. La création de PDF avec une intégration appropriée des polices réduit l'apparition de fragmentation du texte au niveau des caractères.

Puis-je copier le texte d'un tableau PDF sans détruire l'alignement des colonnes ?

Le copier-coller standard ne préserve pas la structure du tableau. Le texte de toutes les colonnes est extrait dans l'ordre de lecture, produisant une séquence confuse. Pour copier les données d'un tableau avec les colonnes conservées, utilisez un outil de conversion PDF vers Excel qui détecte la structure du tableau. La sortie Excel préserve l'alignement des colonnes et vous pouvez copier à partir d'Excel avec la structure intacte.

La visionneuse PDF affecte-t-elle la propreté des copies de texte ?

Oui. L'extraction de texte d'Adobe Acrobat est généralement la plus propre. Les visionneuses basées sur un navigateur produisent souvent davantage de sauts de ligne car elles sont optimisées pour l'affichage et non pour l'extraction de texte. Si vous devez copier du texte fréquemment, utilisez un lecteur PDF dédié pour l'extraction plutôt qu'une visionneuse basée sur un navigateur.

WukongPDF

Essayez PDF vers Word

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →