Tabela PDF wyeksportowana z bazy danych zawiera 500 wierszy. Otwarcie pliku powoduje wyświetlenie każdego wiersza dwukrotnie lub niektórych wpisów powtarzających się według wzorca z zapytania źródłowego, które zwróciło duplikaty. Sam plik PDF nie jest uszkodzony. Dane wewnątrz zawierają zduplikowaną treść i usunięcie tych duplikatów oznacza albo bezpośrednią edycję pliku PDF, czego większość narzędzi nie obsługuje w przypadku operacji na poziomie wiersza, albo wyodrębnienie, zewnętrzną deduplikację i odtworzenie czystej wersji.
Pliki PDF nie są arkuszami kalkulacyjnymi. Nie można kliknąć przycisku, aby usunąć zduplikowane wiersze. Możesz jednak pobrać dane, wyczyścić je i umieścić z powrotem.
Usunięcie zduplikowanych linii z dokumentu Edytor PDF wymaga konwersji zawartości PDF do formatu edytowalnego, deduplikacji i opcjonalnie odtworzenia pliku PDF. WukongPDF Fix PDF i narzędzia do konwersji obsługują wyodrębnianie, a poniższy przepływ pracy obejmuje pełny proces deduplikacji.

Wyodrębnianie treści do formatu edytowalnego
Najważniejszym pierwszym krokiem jest pobranie tekstu z pliku PDF do formatu umożliwiającego deduplikację. Eksportuj do Excela, jeśli treść jest tabelaryczna ze spójnymi kolumnami. Eksportuj do programu Word, jeśli treść zawiera tekst z akapitami. Eksportuj do zwykłego tekstu, jeśli struktura jest prosta. Wybór formatu eksportu jest zgodny ze strukturą treści.
Dane tabelaryczne należą do programu Excel ze względu na wbudowane narzędzia deduplikacji. Wybierz zakres danych, przejdź do zakładki Dane i kliknij Usuń duplikaty. Wybierz kolumny definiujące, co liczy się jako duplikat — zazwyczaj są to wszystkie kolumny w celu dokładnego dopasowania wierszy. Excel usuwa każdy duplikat z wyjątkiem pierwszego wystąpienia, przetwarzając tysiące wierszy w ciągu kilku sekund.
Wypróbuj opcję Edytuj plik PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Deduplikacja w Excelu po konwersji z pliku PDF na Excel
Funkcja Usuń duplikaty programu Excel działa na dokładnych dopasowaniach w wybranych kolumnach. Prawie zduplikowane wiersze, te same dane, ale inne formatowanie lub białe znaki wymagają najpierw oczyszczenia. Przytnij dodatkowe przestrzenie za pomocą TRIM. Standaryzuj wielkość liter za pomocą GÓRNEJ lub DOLNEJ. Usuń znaki niedrukowalne za pomocą CLEAN. Czystsze dane przed deduplikacją oznaczają więcej znalezionych duplikatów.
Jeśli konieczne jest sprawdzenie, zaznacz duplikaty przed ich usunięciem. Formatowanie warunkowe, Reguły wyróżniania komórek, Zduplikowane wartości, pokazują, które wiersze są duplikatami, bez usuwania czegokolwiek. Przejrzyj podświetlone wiersze, potwierdź, że są to prawdziwe duplikaty, a następnie usuń. W tym przeglądzie wykryto przypadki, w których dwa wiersze wyglądają podobnie, ale w rzeczywistości stanowią różne transakcje, które mają tę samą kwotę w dolarach.
Deduplikacja w programie Word dla tekstowych plików PDF
Uruchamianie tekstu zawierającego zduplikowane akapity wymaga funkcji Znajdź i zamień programu Word w połączeniu ze wzorami symboli wieloznacznych. Akapit pojawiający się dwa razy pod rząd można znaleźć i zredukować do pojedynczego wystąpienia. Obsługuje to dokładne duplikaty, ale nie prawie duplikaty różniące się jednym lub dwoma słowami.
Ręczna recenzja jest bardziej niezawodna niż automatyzacja tekstu narracyjnego. Skanuj w poszukiwaniu powtarzających się akapitów. Akapit pojawiający się zarówno we wstępie, jak i w zakończeniu może być celowym powtórzeniem dla efektu retorycznego, a nie błędem powielania. Zautomatyzowane narzędzia nie potrafią odróżnić zamierzonego od przypadkowego powtórzenia. W przypadku deduplikacji tekstu, gdy kontekst określa, czy powtórzenie jest prawidłowe, wymagana jest ludzka ocena.
| Typ treści | Eksportuj do | Metoda deduplikacji | Uwaga |
|---|---|---|---|
| Dane tabelaryczne z kolumnami | Przewyższać | Dane > Usuń duplikaty | Sprawdź, czy wszystkie kolumny wybrane do dopasowania są poprawne |
| Prosta lista, jeden element w wierszu | Zwykły tekst lub Excel | Sortuj i usuwaj duplikaty lub deduplikację programu Excel | Sortowanie może spowodować utratę pierwotnego porządku; najpierw dodaj kolumnę indeksu |
| Uruchamiany tekst, akapity | Słowo | Ręczna recenzja lub Znajdź duplikaty symboli wieloznacznych | Celowe powtórzenie może zostać przypadkowo usunięte |
| Mieszana zawartość | Excel dla tabel, Word dla tekstu | Podziel według typu zawartości, deduplikuj każdy osobno | Należy zachować kolejność ponownego montażu |
Odtwarzanie czystego pliku PDF po deduplikacji
Po usunięciu duplikatów w programie Excel lub Word zapisz czysty plik jako nowy plik PDF za pomocą opcji Zapisz jako PDF lub konwertera online. Wynikowy plik PDF zawiera czyste dane bez duplikatów. Porównaj liczbę stron oryginalnego i oczyszczonego pliku PDF. Jeśli oryginał miał 500 wierszy, a 50 było duplikatami, wyczyszczony plik PDF powinien mieć około 10% mniej stron. Zmniejszenie liczby stron potwierdza, że deduplikacja zadziałała.
Zachowaj oryginalny plik PDF jako niezmodyfikowaną kopię zapasową do czasu sprawdzenia oczyszczonej wersji. Deduplikacji, która była zbyt agresywna i spowodowała usunięcie unikalnych wierszy obok duplikatów, nie można cofnąć, jeśli oryginał zostanie usunięty. Zachowaj oryginał do czasu, aż weryfikacja potwierdzi, że oczyszczona wersja jest poprawna i kompletna.
Korzystanie z deduplikacji skryptowej w przypadku dużych lub powtarzających się zadań
Biblioteka pandas języka Python obsługuje deduplikację dużych zbiorów danych z większą elastycznością niż wbudowane narzędzie programu Excel. Skrypt odczytujący wyeksportowane dane, stosujący logikę deduplikacji z konfigurowalnymi kryteriami dopasowywania i wysyłający czysty plik działa w ciągu kilku sekund, niezależnie od liczby wierszy. Skrypt obsługuje przypadki Edge, co liczy się jako duplikat, które wystąpienie zachować, czy rejestrować usunięte wiersze, za pomocą kodu dokumentującego dokładną zastosowaną logikę.
W przypadku powtarzających się zadań deduplikacji skrypt jest trwałym zasobem. Ten sam raport PDF generowany co tydzień z tym samym wzorcem powielania jest co tydzień czyszczony przez ten sam skrypt. Początkowa inwestycja w skrypt wynosząca 30 minut pozwala zaoszczędzić godziny ręcznego deduplikacji w ciągu roku. Kontroluj wersję skryptu, aby przyszli opiekunowie mogli zobaczyć logikę deduplikacji i dostosować ją w miarę zmiany formatu danych źródłowych.
Zapobieganie powielaniu treści u źródła
Zduplikowana treść w plikach PDF zwykle ma swój początek w zapytaniu bazy danych, generatorze raportów lub procesie scalania, w wyniku którego utworzono plik PDF. Napraw zapytanie źródłowe, aby użyć SELECT DISTINCT lub popraw warunki JOIN. Napraw proces scalania, aby sprawdzić nakładające się zakresy stron. Każdy duplikat usunięty u źródła uniemożliwia następną sesję deduplikacji pliku PDF.
Przepływ pracy deduplikacji plików PDF leczy objawy. Lekarstwo działa w dowolnym systemie, który wygenerował zduplikowaną treść. Udokumentuj, skąd pochodzą duplikaty i napraw proces. Pierwsza akcja ratownicza jest zrozumiała. Drugie wystąpienie z tego samego źródła z tymi samymi duplikatami sygnalizuje awarię procesu wymagającą trwałej korekty.
Wypróbuj opcję Edytuj plik PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
