Tips & Tricks

Jak usunąć zduplikowane linie lub powtarzające się wpisy w dokumencie PDF

Tabela PDF wyeksportowana z bazy danych zawiera 500 wierszy. Otwarcie pliku powoduje wyświetlenie każdego wiersza dwukrotnie lub niektórych wpisów powtarzających się według wzorca z zapytania źródłowego, które zwróciło duplikaty. Sam plik PDF nie jest uszkodzony. Dane wewnątrz zawierają zduplikowaną treść i usunięcie tych duplikatów oznacza albo bezpośrednią edycję pliku PDF, czego większość narzędzi nie obsługuje w przypadku operacji na poziomie wiersza, albo wyodrębnienie, zewnętrzną deduplikację i odtworzenie czystej wersji.

Pliki PDF nie są arkuszami kalkulacyjnymi. Nie można kliknąć przycisku, aby usunąć zduplikowane wiersze. Możesz jednak pobrać dane, wyczyścić je i umieścić z powrotem.

Usunięcie zduplikowanych linii z dokumentu Edytor PDF wymaga konwersji zawartości PDF do formatu edytowalnego, deduplikacji i opcjonalnie odtworzenia pliku PDF. WukongPDF Fix PDF i narzędzia do konwersji obsługują wyodrębnianie, a poniższy przepływ pracy obejmuje pełny proces deduplikacji.

How to Remove Duplicate Lines or Repeated Entries Inside a PDF Document

Wyodrębnianie treści do formatu edytowalnego

Najważniejszym pierwszym krokiem jest pobranie tekstu z pliku PDF do formatu umożliwiającego deduplikację. Eksportuj do Excela, jeśli treść jest tabelaryczna ze spójnymi kolumnami. Eksportuj do programu Word, jeśli treść zawiera tekst z akapitami. Eksportuj do zwykłego tekstu, jeśli struktura jest prosta. Wybór formatu eksportu jest zgodny ze strukturą treści.

Dane tabelaryczne należą do programu Excel ze względu na wbudowane narzędzia deduplikacji. Wybierz zakres danych, przejdź do zakładki Dane i kliknij Usuń duplikaty. Wybierz kolumny definiujące, co liczy się jako duplikat — zazwyczaj są to wszystkie kolumny w celu dokładnego dopasowania wierszy. Excel usuwa każdy duplikat z wyjątkiem pierwszego wystąpienia, przetwarzając tysiące wierszy w ciągu kilku sekund.

WukongPDF

Wypróbuj opcję Edytuj plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Deduplikacja w Excelu po konwersji z pliku PDF na Excel

Funkcja Usuń duplikaty programu Excel działa na dokładnych dopasowaniach w wybranych kolumnach. Prawie zduplikowane wiersze, te same dane, ale inne formatowanie lub białe znaki wymagają najpierw oczyszczenia. Przytnij dodatkowe przestrzenie za pomocą TRIM. Standaryzuj wielkość liter za pomocą GÓRNEJ lub DOLNEJ. Usuń znaki niedrukowalne za pomocą CLEAN. Czystsze dane przed deduplikacją oznaczają więcej znalezionych duplikatów.

Jeśli konieczne jest sprawdzenie, zaznacz duplikaty przed ich usunięciem. Formatowanie warunkowe, Reguły wyróżniania komórek, Zduplikowane wartości, pokazują, które wiersze są duplikatami, bez usuwania czegokolwiek. Przejrzyj podświetlone wiersze, potwierdź, że są to prawdziwe duplikaty, a następnie usuń. W tym przeglądzie wykryto przypadki, w których dwa wiersze wyglądają podobnie, ale w rzeczywistości stanowią różne transakcje, które mają tę samą kwotę w dolarach.

Deduplikacja w programie Word dla tekstowych plików PDF

Uruchamianie tekstu zawierającego zduplikowane akapity wymaga funkcji Znajdź i zamień programu Word w połączeniu ze wzorami symboli wieloznacznych. Akapit pojawiający się dwa razy pod rząd można znaleźć i zredukować do pojedynczego wystąpienia. Obsługuje to dokładne duplikaty, ale nie prawie duplikaty różniące się jednym lub dwoma słowami.

Ręczna recenzja jest bardziej niezawodna niż automatyzacja tekstu narracyjnego. Skanuj w poszukiwaniu powtarzających się akapitów. Akapit pojawiający się zarówno we wstępie, jak i w zakończeniu może być celowym powtórzeniem dla efektu retorycznego, a nie błędem powielania. Zautomatyzowane narzędzia nie potrafią odróżnić zamierzonego od przypadkowego powtórzenia. W przypadku deduplikacji tekstu, gdy kontekst określa, czy powtórzenie jest prawidłowe, wymagana jest ludzka ocena.

Typ treściEksportuj doMetoda deduplikacjiUwaga
Dane tabelaryczne z kolumnamiPrzewyższaćDane > Usuń duplikatySprawdź, czy wszystkie kolumny wybrane do dopasowania są poprawne
Prosta lista, jeden element w wierszuZwykły tekst lub ExcelSortuj i usuwaj duplikaty lub deduplikację programu ExcelSortowanie może spowodować utratę pierwotnego porządku; najpierw dodaj kolumnę indeksu
Uruchamiany tekst, akapitySłowoRęczna recenzja lub Znajdź duplikaty symboli wieloznacznychCelowe powtórzenie może zostać przypadkowo usunięte
Mieszana zawartośćExcel dla tabel, Word dla tekstuPodziel według typu zawartości, deduplikuj każdy osobnoNależy zachować kolejność ponownego montażu

Odtwarzanie czystego pliku PDF po deduplikacji

Po usunięciu duplikatów w programie Excel lub Word zapisz czysty plik jako nowy plik PDF za pomocą opcji Zapisz jako PDF lub konwertera online. Wynikowy plik PDF zawiera czyste dane bez duplikatów. Porównaj liczbę stron oryginalnego i oczyszczonego pliku PDF. Jeśli oryginał miał 500 wierszy, a 50 było duplikatami, wyczyszczony plik PDF powinien mieć około 10% mniej stron. Zmniejszenie liczby stron potwierdza, że deduplikacja zadziałała.

Zachowaj oryginalny plik PDF jako niezmodyfikowaną kopię zapasową do czasu sprawdzenia oczyszczonej wersji. Deduplikacji, która była zbyt agresywna i spowodowała usunięcie unikalnych wierszy obok duplikatów, nie można cofnąć, jeśli oryginał zostanie usunięty. Zachowaj oryginał do czasu, aż weryfikacja potwierdzi, że oczyszczona wersja jest poprawna i kompletna.

Korzystanie z deduplikacji skryptowej w przypadku dużych lub powtarzających się zadań

Biblioteka pandas języka Python obsługuje deduplikację dużych zbiorów danych z większą elastycznością niż wbudowane narzędzie programu Excel. Skrypt odczytujący wyeksportowane dane, stosujący logikę deduplikacji z konfigurowalnymi kryteriami dopasowywania i wysyłający czysty plik działa w ciągu kilku sekund, niezależnie od liczby wierszy. Skrypt obsługuje przypadki Edge, co liczy się jako duplikat, które wystąpienie zachować, czy rejestrować usunięte wiersze, za pomocą kodu dokumentującego dokładną zastosowaną logikę.

W przypadku powtarzających się zadań deduplikacji skrypt jest trwałym zasobem. Ten sam raport PDF generowany co tydzień z tym samym wzorcem powielania jest co tydzień czyszczony przez ten sam skrypt. Początkowa inwestycja w skrypt wynosząca 30 minut pozwala zaoszczędzić godziny ręcznego deduplikacji w ciągu roku. Kontroluj wersję skryptu, aby przyszli opiekunowie mogli zobaczyć logikę deduplikacji i dostosować ją w miarę zmiany formatu danych źródłowych.

Zapobieganie powielaniu treści u źródła

Zduplikowana treść w plikach PDF zwykle ma swój początek w zapytaniu bazy danych, generatorze raportów lub procesie scalania, w wyniku którego utworzono plik PDF. Napraw zapytanie źródłowe, aby użyć SELECT DISTINCT lub popraw warunki JOIN. Napraw proces scalania, aby sprawdzić nakładające się zakresy stron. Każdy duplikat usunięty u źródła uniemożliwia następną sesję deduplikacji pliku PDF.

Przepływ pracy deduplikacji plików PDF leczy objawy. Lekarstwo działa w dowolnym systemie, który wygenerował zduplikowaną treść. Udokumentuj, skąd pochodzą duplikaty i napraw proces. Pierwsza akcja ratownicza jest zrozumiała. Drugie wystąpienie z tego samego źródła z tymi samymi duplikatami sygnalizuje awarię procesu wymagającą trwałej korekty.

WukongPDF

Wypróbuj opcję Edytuj plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →