Tips & Tricks

So entfernen Sie doppelte Zeilen oder wiederholte Einträge in einem PDF-Dokument

Eine aus einer Datenbank exportierte PDF-Tabelle enthält 500 Zeilen. Beim Öffnen der Datei werden jede Zeile zweimal oder bestimmte Einträge angezeigt, die sich in einem Muster aus einer Quellabfrage wiederholen, die Duplikate zurückgegeben hat. Das PDF selbst ist nicht beschädigt. Die darin enthaltenen Daten weisen doppelten Inhalt auf. Um diese Duplikate zu entfernen, müssen Sie entweder die PDF-Datei direkt bearbeiten, was die meisten Tools für Vorgänge auf Zeilenebene nicht unterstützen, oder sie extrahieren, extern deduplizieren und eine saubere Version neu erstellen.

PDFs sind keine Tabellenkalkulationen. Sie können nicht auf eine Schaltfläche klicken, um doppelte Zeilen zu entfernen. Aber Sie können die Daten herausholen, bereinigen und wieder zurückgeben.

Um doppelte Zeilen aus einem PDF-Editor-Dokument zu entfernen, muss der PDF-Inhalt in ein bearbeitbares Format konvertiert, dort dedupliziert und optional das PDF neu erstellt werden. WukongPDFs Fix PDF und Konvertierungstools übernehmen die Extraktion, und der folgende Workflow deckt die gesamte Deduplizierungspipeline ab.

How to Remove Duplicate Lines or Repeated Entries Inside a PDF Document

Extrahieren des Inhalts in ein bearbeitbares Format

Der erste entscheidende Schritt besteht darin, den Text aus der PDF-Datei in ein deduplizierungsfreundliches Format umzuwandeln. Exportieren Sie nach Excel, wenn der Inhalt tabellarisch mit konsistenten Spalten ist. Exportieren Sie nach Word, wenn der Inhalt Fließtext mit Absätzen ist. Exportieren Sie in einfachen Text, wenn die Struktur einfach ist. Die Auswahl des Exportformats richtet sich nach der Inhaltsstruktur.

Tabellendaten gehören aufgrund der integrierten Deduplizierungstools zu Excel. Wählen Sie den Datenbereich aus, gehen Sie zur Registerkarte „Daten“ und klicken Sie auf „Duplikate entfernen“. Wählen Sie die Spalten aus, die definieren, was als Duplikat gilt, normalerweise alle Spalten für eine exakte Zeilenübereinstimmung. Excel entfernt jedes Duplikat bis auf das erste Vorkommen und verarbeitet Tausende von Zeilen in Sekunden.

WukongPDF

Versuchen Sie es mit „PDF bearbeiten“.

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Deduplizieren in Excel nach der PDF-zu-Excel-Konvertierung

Excels Funktion „Duplikate entfernen“ funktioniert bei exakten Übereinstimmungen in ausgewählten Spalten. Nahezu doppelte Zeilen, gleiche Daten, aber unterschiedliche Formatierung oder Leerzeichen, müssen zuerst bereinigt werden. Schneiden Sie zusätzliche Leerzeichen mit TRIM ab. Standardisieren Sie die Groß-/Kleinschreibung mit UPPER oder LOWER. Entfernen Sie nicht druckbare Zeichen mit CLEAN. Sauberere Daten vor der Deduplizierung bedeuten, dass mehr Duplikate gefunden werden.

Markieren Sie Duplikate, bevor Sie sie entfernen, wenn eine Überprüfung erforderlich ist. Bedingte Formatierung, Regeln zum Hervorheben von Zellen, doppelte Werte, zeigt an, welche Zeilen Duplikate sind, ohne etwas zu löschen. Überprüfen Sie die hervorgehobenen Zeilen, stellen Sie sicher, dass es sich um echte Duplikate handelt, und entfernen Sie sie dann. Diese Überprüfung erfasst Fälle, in denen zwei Zeilen ähnlich aussehen, es sich jedoch um wirklich unterschiedliche Transaktionen handelt, die zufällig denselben Dollarbetrag aufweisen.

Deduplizieren in Word für textbasierte PDFs

Zum Ausführen von Text mit doppelten Absätzen ist die Funktion „Suchen und Ersetzen“ von Word in Kombination mit Platzhaltermustern erforderlich. Ein Absatz, der zweimal hintereinander erscheint, kann gefunden und auf eine einzige Instanz reduziert werden. Dies behandelt exakte Duplikate, jedoch keine Beinahe-Duplikate, die sich um ein oder zwei Wörter unterscheiden.

Die manuelle Überprüfung ist bei narrativen Texten zuverlässiger als die Automatisierung. Suchen Sie nach wiederholten Absätzen. Ein Absatz, der sowohl in der Einleitung als auch im Schluss erscheint, kann eine absichtliche Wiederholung aus rhetorischen Gründen und kein Duplizierungsfehler sein. Automatisierte Tools können absichtliche und versehentliche Wiederholungen nicht unterscheiden. Für die Textdeduplizierung ist menschliches Urteilsvermögen erforderlich, wenn der Kontext bestimmt, ob die Wiederholung korrekt ist.

InhaltstypExportieren nachDedup-MethodeAchtung
Tabellarische Daten mit SpaltenExcelDaten > Duplikate entfernenÜberprüfen Sie, ob alle zum Abgleich ausgewählten Spalten korrekt sind
Einfache Liste, ein Element pro ZeileEinfacher Text oder ExcelSortieren und entfernen Sie Duplikate oder führen Sie eine Excel-Deduplizierung durchBeim Sortieren kann die ursprüngliche Reihenfolge verloren gehen. Fügen Sie zuerst die Indexspalte hinzu
Fließtext, AbsätzeWortManuelle Überprüfung oder Suchen von Wildcard-DuplikatenAbsichtliche Wiederholungen können versehentlich entfernt werden
Gemischter InhaltExcel für Tabellen, Word für TextAufgeteilt nach Inhaltstyp, jeweils separat dedupliziertDie Reihenfolge beim Zusammenbau muss eingehalten werden

Erneutes Erstellen des sauberen PDFs nach der Deduplizierung

Nachdem Sie Duplikate in Excel oder Word entfernt haben, speichern Sie die saubere Datei als neues PDF über „Als PDF speichern“ oder einen Online-Konverter. Das resultierende PDF enthält saubere Daten ohne Duplikate. Vergleichen Sie die Seitenzahlen des Originals und der bereinigten PDF-Datei. Wenn das Original 500 Zeilen hätte und 50 davon Duplikate wären, sollte das bereinigte PDF etwa 10 % weniger Seiten haben. Die Reduzierung der Seitenanzahl bestätigt, dass die Deduplizierung funktioniert hat.

Behalten Sie das Original-PDF als unverändertes Backup bei, bis die bereinigte Version überprüft ist. Eine zu aggressive Deduplizierung, bei der neben Duplikaten auch eindeutige Zeilen entfernt wurden, kann nicht rückgängig gemacht werden, wenn das Original gelöscht wird. Bewahren Sie das Original auf, bis die Überprüfung bestätigt, dass die gereinigte Version korrekt und vollständig ist.

Verwenden der skriptbasierten Deduplizierung für große oder wiederholte Aufgaben

Die Pandas-Bibliothek von Python handhabt die Deduplizierung großer Datensätze flexibler als das integrierte Tool von Excel. Ein Skript, das die exportierten Daten liest, Deduplizierungslogik mit konfigurierbaren Übereinstimmungskriterien anwendet und die saubere Datei ausgibt, wird unabhängig von der Zeilenanzahl in Sekunden ausgeführt. Das Skript behandelt Grenzfälle, was als Duplikat gilt, welches Vorkommen beibehalten werden soll und ob entfernte Zeilen protokolliert werden sollen, mit Code, der die genaue angewendete Logik dokumentiert.

Für wiederkehrende Deduplizierungsaufträge ist das Skript eine dauerhafte Ressource. Derselbe PDF-Bericht, der wöchentlich mit demselben Duplizierungsmuster erstellt wird, wird jede Woche von demselben Skript bereinigt. Die anfängliche Skripting-Investition von 30 Minuten spart im Laufe des Jahres Stunden manueller Deduplizierung ein. Kontrollieren Sie die Version des Skripts, damit zukünftige Betreuer die Deduplizierungslogik sehen und anpassen können, wenn sich das Quelldatenformat ändert.

Duplicate Content an der Quelle verhindern

Doppelter Inhalt in PDFs entsteht normalerweise im Vorfeld der Datenbankabfrage, des Berichtsgenerators oder des Zusammenführungsprozesses, der die PDF-Datei erstellt hat. Korrigieren Sie die Quellabfrage, um SELECT DISTINCT zu verwenden oder JOIN-Bedingungen zu korrigieren. Korrigieren Sie den Zusammenführungsprozess, um nach überlappenden Seitenbereichen zu suchen. Jedes an der Quelle entfernte Duplikat verhindert eine nachgelagerte PDF-Deduplizierungssitzung.

Der PDF-Deduplizierungs-Workflow behandelt Symptome. Das Heilmittel existiert in dem System, das den doppelten Inhalt erzeugt hat. Dokumentieren Sie, woher die Duplikate stammen, und beheben Sie den Vorgang. Eine erste Rettungsaktion ist verständlich. Ein zweites Vorkommen aus derselben Quelle mit denselben Duplikaten weist auf einen Prozessfehler hin, der dauerhaft behoben werden muss.

WukongPDF

Versuchen Sie es mit „PDF bearbeiten“.

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →