Tips & Tricks

So entfernen Sie Leerzeilen beim Kopieren von Text aus einer PDF-Datei

Das Kopieren von Text aus einer PDF-Datei und das Einfügen in Word oder einen Texteditor führt häufig zu einem Durcheinander unterbrochener Zeilen. Jede Zeile aus der PDF-Datei wird in der eingefügten Ausgabe zu einem separaten Absatz mit harten Zeilenumbrüchen, die es unmöglich machen, den Text als fortlaufende Prosa zu bearbeiten. Das Entfernen dieser unerwünschten Zeilenumbrüche nach der Konvertierung oder dem Kopieren von PDF in Word ist eine Formatierungsbereinigungsaufgabe, die mit Suchen und Ersetzen und einigen Tastenkombinationen automatisiert werden kann.

Wichtige Erkenntnisse

Bei der PDF-Textextraktion wird am Ende jeder visuellen Zeile ein harter Zeilenumbruch eingefügt. Beim Einfügen in einen Texteditor wird jede Zeile zu einem separaten Absatz. Die schnellste Lösung ist das Suchen und Ersetzen mit Platzhaltern, das einzelne Zeilenumbrüche entfernt und doppelte Zeilenumbrüche zwischen echten Absätzen beibehält. Dieser einzelne Vorgang wandelt den gebrochenen Text in Sekundenschnelle in fließende Absätze um.

How to Remove Blank Lines When Copying Text From a PDF

Warum PDF-Text mit so vielen Zeilenumbrüchen kopiert wird

Ein PDF speichert Text als einzelne Linienobjekte, die jeweils an bestimmten Koordinaten auf der Seite positioniert sind. Im Gegensatz zu einem Textverarbeitungsdokument, bei dem der Text kontinuierlich von einer Zeile zur nächsten fließt, gibt es in einer PDF-Datei kein Konzept für fließenden Text. Jede Zeile ist ein separates Objekt. Wenn Sie Text kopieren, liest der Extraktionsprozess diese Zeilenobjekte der Reihe nach und fügt nach jedem einen Zeilenumbruch ein, da er nicht zwischen einem Zeilenumbruch, der einen Absatz beendet, und einem Zeilenumbruch, der nur ein Zeilenumbruch innerhalb eines Absatzes ist, unterscheiden kann.

Das Problem tritt am deutlichsten bei mehrspaltigen PDFs und PDFs auf, die aus formatierten Textdokumenten erstellt wurden. Ein Absatz, der sich über vier visuelle Linien in der PDF-Datei erstreckt, wird beim Einfügen zu vier separaten Absätzen, die jeweils mit einer Absatzmarke enden. Um diesen Text zu bearbeiten, müssen die Zeilen manuell wieder zusammengefügt werden, was für mehr als ein paar Absätze mühsam ist. Der Suchen-und-Ersetzen-Ansatz automatisiert das erneute Zusammenfügen.

WukongPDF

Versuchen Sie es mit PDF zu Word

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Einzelne Zeilenumbrüche mit Suchen und Ersetzen entfernen

Nachdem Sie unterbrochene Zeilen mithilfe der Funktion „Suchen und Ersetzen“ verbunden haben, durchsuchen Sie den Text nach Absatzumbrüchen, die hätten beibehalten werden sollen, dies aber nicht der Fall war. Aufzählungszeichen und nummerierte Listen sind die häufigsten Opfer, da sich jede Aufzählungszeichen oder Nummer in einer eigenen Zeile befindet. Die Suchen-und-Ersetzen-Methode fügt sie in einem einzigen Absatz zusammen. Stellen Sie die Zeilenumbrüche vor jedem Aufzählungszeichen oder jeder Zahl manuell wieder her. Dieser Bereinigungsschritt dauert einige Minuten, führt jedoch zu einem ausgefeilten Enddokument.

Fügen Sie den kopierten Text in Word ein. Öffnen Sie „Suchen und Ersetzen“ mit Strg+H. Geben Sie im Feld „Suchen nach“ ^p ein, um die Absatzmarken abzugleichen. Geben Sie im Feld „Ersetzen durch“ ein einzelnes Leerzeichen ein. Klicken Sie auf Alle ersetzen. Jede Absatzmarke im Dokument wird durch ein Leerzeichen ersetzt, wodurch der gesamte Text zu einem einzigen Absatz zusammengefügt wird. Dies ist zu aggressiv, da dadurch auch die Absatzmarken zwischen echten Absätzen entfernt werden. Um dies zu beheben, schützen Sie zunächst die doppelten Absatzmarken, die echte Absätze trennen. Ersetzen Sie zuerst ^p^p durch einen Platzhalter wie @@PARA@@. Ersetzen Sie dann die verbleibenden einzelnen ^p-Markierungen durch Leerzeichen. Ersetzen Sie abschließend @@PARA@@ durch ^p^p, um die Absatzumbrüche wiederherzustellen.

Der Platzhalter-Such- und Ersetzungsansatz kann erweitert werden, um komplexere Bereinigungsmuster zu verarbeiten. Ein Dokument mit Abschnittsüberschriften kann geschützt werden, indem das Textmuster der Überschrift, z. B. eine Zeile, die mit einem Doppelpunkt gefolgt von einer Absatzmarke endet, durch einen Platzhalter ersetzt wird, bevor der allgemeine Zeilenumbruch entfernt wird. Stellen Sie nach dem Zusammenfügen der Textzeilen die Überschriftenumbrüche der Platzhalter wieder her. Dadurch bleiben sowohl die Absatzstruktur als auch die Überschriftentrennung erhalten.

In Word dauert dieser dreistufige Vorgang etwa 30 Sekunden und funktioniert bei Texten beliebiger Länge. Der Schlüssel liegt in der Verwendung eines Platzhalters, der nirgendwo im Dokumenttext erscheint. Nach dem Ersetzen einzelner Zeilenumbrüche fließt der Text als fortlaufende Absätze. Jeder ursprüngliche Absatzumbruch bleibt als doppelter Zeilenumbruch erhalten. Das Dokument kann jetzt als normale Prosa bearbeitet werden. WukongPDFs PDF-Format-Tools bewahren die Absatzstruktur während der Konvertierung und reduzieren so den Aufwand für die manuelle Bereinigung von Zeilenumbrüchen nach dem Kopieren.

Verwenden Sie Online-Textbereinigungstools für schnelle Korrekturen

Die Bereinigung mit einem Klick erspart Minuten der manuellen Zeile-für-Zeile-Bearbeitung.

Bei Text, der aus einer gescannten PDF-Datei kopiert wurde, die OCR-verarbeitet wurde, wird das Zeilenumbruchproblem durch OCR-Fehler verschärft. Jedes falsch erkannte Zeichen fügt dem bereits unterbrochenen Text Rauschen hinzu. Führen Sie in diesem Fall den Text durch eine Rechtschreibprüfung, nachdem Sie die Zeilenumbrüche entfernt haben. Die Rechtschreibprüfung erkennt OCR-Fehler, die durch die Zeilenumbruchentfernung nicht behoben werden können. Die Kombination aus Zeilenumbruchentfernung und Rechtschreibprüfung sorgt für die sauberste Ausgabe gescannter Dokumente.

Mehrere kostenlose Online-Tools sind darauf spezialisiert, aus PDFs kopierten Text zu bereinigen. Fügen Sie den kopierten Text in das Tool ein. Einzelne Zeilenumbrüche werden automatisch entfernt, die Absatzumbrüche bleiben jedoch erhalten. Diese Tools verwenden dieselbe Logik wie die manuelle Suchen-und-Ersetzen-Methode, wenden sie jedoch mit einem Klick an. Sie eignen sich ideal für einmalige Textbereinigungsaufgaben, bei denen das Einrichten von Suchen und Ersetzen in Word mehr Aufwand bedeutet, als die Aufgabe rechtfertigt.

Bedenken Sie bei der Auswahl eines Online-Textbereinigungstools, dass Sie potenziell sensiblen Text in die Website eines Drittanbieters einfügen. Verwenden Sie für vertrauliche Dokumente die manuelle Such- und Ersetzungsmethode in einer lokalen Anwendung anstelle eines Online-Tools. Die manuelle Methode funktioniert offline, behält Ihren Text auf Ihrem Computer und liefert identische Ergebnisse.

Zeilenumbruchprobleme in zukünftigen Kopien verhindern

Die Qualität der Textextraktion hängt auch davon ab, wie das PDF erstellt wurde. Von Textverarbeitungsprogrammen erstellte PDFs weisen in der Regel eine bessere interne Textreihenfolge auf als durch Scannen und OCR erstellte PDFs. Die Textreihenfolge in einem mit einem Textverarbeitungsprogramm generierten PDF folgt der Lesereihenfolge des Originaldokuments. Die Textreihenfolge in einem OCR-generierten PDF folgt der räumlichen Reihenfolge, in der die OCR-Engine den Text erkannt hat, was bei mehrspaltigen oder komplexen Layouts möglicherweise nicht mit der Lesereihenfolge übereinstimmt.

Wenn Sie regelmäßig Text aus PDFs kopieren müssen, passen Sie Ihren Arbeitsablauf an, um den Reinigungsaufwand zu minimieren. Konvertieren Sie die PDF-Datei in Word, bevor Sie den Text kopieren, anstatt ihn direkt aus dem PDF-Viewer zu kopieren. PDF-zu-Word-Konvertierungstools sind darauf ausgelegt, das Zusammenfügen von Zeilenumbrüchen zu bewältigen und fließenden Text zu erzeugen. Das konvertierte Word-Dokument muss noch etwas bereinigt werden, aber weitaus weniger als der direkt aus dem PDF-Viewer kopierte Text.

Um PDFs zu erstellen, aus denen andere Text kopieren müssen, aktivieren Sie bei der PDF-Erstellung die Markierung der Barrierefreiheit. Mit Tags versehene PDFs enthalten Strukturinformationen, die Textextraktionstools mitteilen, wo Absätze beginnen und enden. Aus einer PDF-Datei mit Tags kopierter Text ist deutlich sauberer als Text aus einer PDF-Datei ohne Tags, da das Extraktionstool die Absatzstruktur-Tags verwendet, anstatt die Absatzgrenzen anhand der Zeilenpositionen zu erraten.

Aktivieren Sie beim Generieren von PDFs aus Word die Option „Dokumentstruktur-Tags für Barrierefreiheit“ in den PDF-Exporteinstellungen. Dadurch werden Strukturinformationen in die PDF-Datei eingebettet, die von Textextraktionstools zur Identifizierung von Absatzgrenzen verwendet werden. Text, der aus einer getaggten PDF-Datei extrahiert wird, weist deutlich weniger falsche Zeilenumbrüche auf, da das Extraktionstool anhand der Struktur-Tags weiß, wo Absätze beginnen und enden, anstatt anhand der Zeilenpositionen zu raten.

Häufig gestellte Fragen

Beeinflusst die im Original-PDF verwendete Schriftart die Sauberkeit der Textkopien? Ja, deutlich. PDFs, die standardmäßige PostScript- oder TrueType-Schriftarten mit der richtigen Kodierung verwenden, werden sauberer kopiert als PDFs, die benutzerdefinierte kodierte Schriftarten verwenden. Einige benutzerdefinierte Schriftarten verwenden nicht standardmäßige Zeichenzuordnungen, bei denen der Buchstabe A intern als völlig anderer Zeichencode gespeichert wird. Wenn Sie Text aus einem solchen PDF kopieren, kann der extrahierte Text völlig falsche Zeichen enthalten. Es gibt keine andere Lösung für Schriftartenkodierungsprobleme als die OCR-basierte Extraktion.

Warum werden bei eingefügtem Text aus einer PDF-Datei manchmal zufällige Leerzeichen in der Mitte von Wörtern eingefügt? Dies wird als Textfragmentierung bezeichnet und tritt auf, wenn das PDF einzelne Zeichen oder kleine Zeichengruppen als separate Textobjekte speichert. Der PDF-Viewer fügt beim Extrahieren von Text Leerzeichen zwischen Objekten ein. Es gibt keine automatische Lösung. Die einzige Lösung ist das manuelle Korrekturlesen. Bei PDFs, die mit der richtigen Schriftarteneinbettung und Textkodierung erstellt wurden, ist die Wahrscheinlichkeit einer Fragmentierung geringer.

Gibt es eine Möglichkeit, Text aus einer PDF-Datei zu kopieren, ohne überhaupt Zeilenumbrüche zu erhalten? Einige PDF-zu-Text-Extraktionstools erzeugen absichtlich fortlaufende Absätze. Diese Tools analysieren das Textlayout und verbinden Zeilen, die zum selben Absatz gehören. Die Ausgabe ist sauberer als beim Kopieren und Einfügen, erfordert jedoch die Verwendung des Extraktionstools anstelle der Standardmethode „Auswählen und Kopieren“. Bei häufiger Textextraktion spart die Investition in ein spezielles Extraktionstool erheblich Zeit bei der Bereinigung.

Warum enthält eingefügter PDF-Text manchmal zusätzliche Leerzeichen in der Mitte von Wörtern?

Dies geschieht, wenn die PDF-Datei jedes Zeichen oder jede kleine Gruppe von Zeichen als separate Textobjekte mit kleinen Lücken dazwischen speichert. Der Textextraktionsprozess fügt an jeder Lücke ein Leerzeichen ein. Hierfür gibt es keine automatische Lösung, da die Leerzeichen nicht von legitimen Wortleerzeichen zu unterscheiden sind. Manuelles Korrekturlesen und Korrigieren ist die einzige Lösung. Durch das Erstellen von PDFs mit der richtigen Schriftarteneinbettung wird das Auftreten von Textfragmentierung auf Zeichenebene verringert.

Kann ich Text aus einer PDF-Tabelle kopieren, ohne die Spaltenausrichtung zu zerstören?

Beim Standard-Kopieren und Einfügen bleibt die Tabellenstruktur nicht erhalten. Der Text aus allen Spalten wird in Lesereihenfolge extrahiert, wodurch eine durcheinandergebrachte Reihenfolge entsteht. Um Tabellendaten unter Beibehaltung der Spalten zu kopieren, verwenden Sie ein PDF-zu-Excel-Konvertierungstool, das die Tabellenstruktur erkennt. Die Excel-Ausgabe behält die Spaltenausrichtung bei und Sie können aus Excel mit intakter Struktur kopieren.

Beeinflusst der PDF-Viewer die Sauberkeit der Textkopien?

Ja. Die Textextraktion von Adobe Acrobat ist im Allgemeinen die sauberste. Browserbasierte Viewer erzeugen häufig mehr Zeilenumbrüche, da sie für die Anzeige und nicht für die Textextraktion optimiert sind. Wenn Sie häufig Text kopieren müssen, verwenden Sie zum Extrahieren einen speziellen PDF-Reader und nicht einen browserbasierten Viewer.

WukongPDF

Versuchen Sie es mit PDF zu Word

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →