Po wyodrębnieniu danych tabeli z pliku PDF do programu Excel wiersze pojawiają się w kolejności, w jakiej pojawiają się na stronie. Jeśli chcesz posortować te wiersze w oddzielnych arkuszach według kategorii, np. rekordy sprzedaży pogrupowane według regionów lub faktury pogrupowane według dostawców, metoda ręcznego wycinania i wklejania działa w przypadku dziesięciu wierszy, ale staje się niepraktyczna w przypadku setek. Pytanie brzmi, czy narzędzia do konwersji PDF do Excel mogą automatycznie sortować i kategoryzować dane podczas procesu wyodrębniania, czy też trzeba zająć się sortowaniem po dotarciu danych do Excela.
Najważniejsze wnioski
Standardowa konwersja plików PDF do programu Excel nie sortuje ani nie kategoryzuje danych. Wyodrębnia wiersze w kolejności stron i umieszcza je w jednym arkuszu. Zautomatyzowana kategoryzacja w oddzielnych arkuszach według wartości kategorii wymaga makra programu Excel po konwersji, transformacji dodatku Power Query lub zaawansowanego narzędzia do ekstrakcji z wbudowaną logiką kategoryzacji. Najlepsze podejście zależy od tego, czy kategoryzacja jest zadaniem jednorazowym, czy powtarzającym się przepływem pracy.

Co może, a czego nie może wykonać standardowa konwersja plików PDF do Excela
Standardowe narzędzie do konwersji odczytuje układ wizualny strony PDF, identyfikuje struktury tabel poprzez wykrywanie linii siatki i dopasowanych bloków tekstu oraz mapuje wykryte komórki na komórki Excela. Dane wyjściowe zachowują kolejność wierszy i strukturę kolumn oryginalnej tabeli. Jest to wierna reprodukcja pliku PDF, ale nie stanowi przetwarzania danych. Narzędzie nie czyta zawartości komórek, aby zrozumieć, co oznaczają dane. Wiersz zawierający „Zachód” w kolumnie Region i wierszu zawierającym słowo „Wschód”; są wydobywane identycznie. Narzędzie nie posiada mechanizmu wykrywającego, że wiersze te należą do różnych kategorii.
Niektóre zaawansowane narzędzia Wyodrębnij dane PDF wykraczają poza ekstrakcję wizualną i stosują rozpoznawanie wzorców w celu identyfikacji pola kategorii w tabeli. Narzędzia te można skonfigurować za pomocą reguły, która w efekcie mówi: „przeskanuj kolumnę C wyodrębnionych danych, zidentyfikuj unikalne wartości w tej kolumnie i utwórz osobne dane wyjściowe dla każdej unikalnej wartości”. To nie jest standardowa konwersja plików PDF. Jest to wyspecjalizowana funkcja ekstrakcji danych, która stanowi połączenie OCR, rozpoznawania tabel i transformacji danych. Jeśli Twój przepływ pracy tego wymaga, poszukaj narzędzi, które wyraźnie reklamują kategoryzację lub grupowanie danych na swojej liście funkcji.
Wypróbuj PDF do Excela
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Sortowanie po konwersji za pomocą makr Excela i Power Query
W przypadku użytkowników, którzy wolą całkowicie unikać makr i dodatku Power Query, wbudowane w programie Excel funkcje filtrowania i sortowania w połączeniu z ręcznym tworzeniem arkuszy są dobrym rozwiązaniem w przypadku zestawów danych o średniej wielkości. Zastosuj filtry do kolumny kategorii, zaznaczaj pojedynczo wartości kategorii, kopiuj przefiltrowane wiersze i wklejaj je do nowego arkusza. W przypadku zestawu danych zawierającego pięć kategorii i 200 wierszy to ręczne podejście zajmuje około pięciu minut i nie wymaga żadnej konfiguracji ani wiedzy technicznej poza podstawową nawigacją w programie Excel.
Najbardziej powszechnie stosowaną metodą jest konwersja całej tabeli PDF na pojedynczy arkusz programu Excel, a następnie użycie wbudowanych narzędzi programu Excel do sortowania i dzielenia danych. Proste makro VBA może odczytać unikalne wartości w określonej kolumnie, utworzyć nowy arkusz dla każdej unikalnej wartości i skopiować pasujące wiersze do odpowiedniego arkusza. Uruchomienie makra na zbiorach danych zawierających tysiące wierszy zajmuje mniej niż minutę i wykonuje kategoryzację dokładnie zgodnie z określonymi ustawieniami, bez dwuznaczności wynikającej z automatycznego rozpoznawania wzorców.
Power Query oferuje niezależną od makr alternatywę dla użytkowników znających narzędzia do przekształcania danych programu Excel. Załaduj przekonwertowane dane do dodatku Power Query za pomocą karty Dane. Użyj funkcji Grupuj według, aby agregować wiersze według kategorii lub filtrować dane dla każdej wartości kategorii i ładować każdy przefiltrowany wynik do osobnego arkusza. Transformacje dodatku Power Query są powtarzalne: zapisz zapytanie, a przy następnej konwersji pliku PDF o podobnej strukturze odśwież zapytanie, aby zastosować tę samą logikę sortowania do nowych danych. W przypadku powtarzających się przepływów pracy dodatek Power Query jest łatwiejszy w utrzymaniu niż makro VBA, ponieważ kroki transformacji są widoczne w edytorze zapytań i można je dostosowywać bez czytania kodu.
Konfigurowanie automatycznej kategoryzacji dla cyklicznych importów plików PDF
Podczas tworzenia transformacji Power Query na potrzeby cyklicznego importu plików PDF użyj nazwy pliku PDF jako parametru zapytania, aby to samo zapytanie działało w przypadku nowych plików bez modyfikacji. W edytorze Power Query utwórz parametr o nazwie FilePath i odwołuj się do niego w kroku źródła danych. Za każdym razem, gdy otrzymasz nowy plik PDF, zaktualizuj parametr FilePath, aby wskazywał nowy plik i odśwież. Cała transformacja, łącznie z sortowaniem według kategorii i podziałem arkusza, przebiega automatycznie na nowych danych.
Jeśli regularnie otrzymujesz tabele PDF o podobnej strukturze, takie jak cotygodniowe raporty sprzedaży lub miesięczne partie faktur, poświęć czas na skonfigurowanie powtarzalnego przepływu pracy. Zacznij od konwersji jednego reprezentatywnego pliku PDF do programu Excel. Otwórz Power Query i zarejestruj transformację, która filtruje, sortuje i dzieli dane dokładnie tak, jak ich potrzebujesz. Zapisz zapytanie. W przypadku kolejnych plików PDF przekonwertuj je do formatu Excel, otwórz skoroszyt i odśwież zapytanie. Cały proces, od przesłania pliku PDF do skategoryzowanych danych w formacie Excel, zajmuje mniej niż dwie minuty po złożeniu zapytania.
W przypadku dużych przepływów pracy obejmujących dziesiątki plików PDF dziennie warto rozważyć dedykowaną platformę do ekstrakcji danych, która łączy konwersję plików PDF z danymi wyjściowymi w arkuszach kalkulacyjnych za pośrednictwem interfejsu API. Platformy te umożliwiają definiowanie szablonów wyodrębniania, które określają, które kolumny zawierają dane kategorii i w jaki sposób należy podzielić dane wyjściowe. Szablon jest konfigurowany raz i automatycznie stosowany do każdego przychodzącego pliku PDF. Platformy posiadające tę funkcję obejmują usługi przetwarzania dokumentów dla przedsiębiorstw i niektórych dostawców API PDF w chmurze. Konwersja pliku PDF do formatu Excel w WukongPDF generuje przejrzyste, ustrukturyzowane dane wyjściowe w formie tabeli, gotowe do przekształceń w Power Query, ze spójnym mapowaniem kolumn, które sprawia, że automatyczna kategoryzacja jest niezawodna w przypadku partii podobnych dokumentów.
Kiedy kategoryzacja ręczna jest nadal najlepszym wyborem
Hybrydowe przepływy pracy mogą być skuteczne, gdy automatyzacja obsługuje rutynowe przypadki, a ręczny przegląd obsługuje przypadki brzegowe. Skonfiguruj Power Query, aby automatycznie sortować wiersze, w których kolumna kategorii zawiera wartości standardowe, w wyznaczonych arkuszach. Wszelkie wiersze zawierające niestandardowe lub puste wartości kategorii są kierowane do arkusza recenzji, w którym osoba może określić prawidłową kategoryzację. Takie podejście maksymalizuje zasięg automatyzacji bez zmuszania systemu do zgadywania niejednoznacznych danych.
Automatyzacja nie zawsze jest właściwą odpowiedzią. Jeśli otrzymasz niewielką liczbę plików PDF z tabelami o różnej strukturze w zależności od dokumentu, czas poświęcony na konfigurowanie makra lub dodatku Power Query może przekroczyć czas potrzebny na ręczne sortowanie danych. W przypadku jednorazowego zadania zawierającego mniej niż 50 wierszy wybranie wierszy dla każdej kategorii oraz wycięcie i wklejenie ich do nowych arkuszy zajmuje kilka minut i nie wymaga konfiguracji. Próg rentowności zwykle przypada na trzy wystąpienia tej samej struktury dokumentu. Jeśli wykonasz tę samą kategoryzację na tym samym typie pliku PDF trzy lub więcej razy, automatyzacja się zwróci.
Kategoryzacja ręczna ma również sens, gdy logika kategorii wymaga ludzkiego osądu. Kolumna Region z wartościami takimi jak „Zachód”; „Wschód” i „Centralny” jest proste w przypadku automatycznego podziału. Kolumna Notatki, w której kategoria wynika z treści opisu tekstowego, na przykład rozróżnienia pozycji pilnych od niepilnych na podstawie sformułowań, a nie ustandaryzowanego kodu, wymaga czytnika będącego człowiekiem. Żadne zautomatyzowane narzędzie nie jest w stanie wiarygodnie kategoryzować danych na podstawie dopracowanego, nieustrukturyzowanego tekstu. W takich przypadkach wyodrębnij wszystkie dane do jednego arkusza i kategoryzuj je ręcznie.
Często zadawane pytania
Co powinienem zrobić, jeśli tabela PDF obejmuje wiele stron z powtarzającymi się wierszami nagłówków? Większość konwerterów plików PDF na Excel traktuje wiersze nagłówka jako dane, jeśli powtarzają się na każdej stronie. Po konwersji tekst nagłówka przeplata się z wierszami danych przy każdym podziale strony. Użyj filtra programu Excel, aby zaznaczyć i usunąć wszystkie wiersze, w których pierwsza kolumna zawiera tekst nagłówka. Ten krok czyszczenia jest niezbędny przed uruchomieniem jakiegokolwiek sortowania lub kategoryzacji, ponieważ wiersze nagłówka zostałyby błędnie sklasyfikowane jako dane.
Czy mogę podzielić dane z tabeli PDF na osobne pliki Excel zamiast osobnych arkuszy?
Tak. Zarówno makra VBA, jak i dodatek Power Query mogą zapisywać dane każdej kategorii w oddzielnym skoroszycie programu Excel zamiast w oddzielnym arkuszu w tym samym skoroszycie. W VBA użyj metod Workbooks.Add i SaveAs. W Power Query załaduj każdy przefiltrowany wynik do osobnego połączenia i wyeksportuj każde połączenie do własnego pliku. Wybór między arkuszami a skoroszytami zależy od sposobu dystrybucji danych. Jeśli dane każdej kategorii trafiają do innej osoby, oddzielne skoroszyty są czystsze.
Co się stanie, jeśli tabela PDF zawiera komórki obejmujące wiele kategorii?
Połączone komórki są znanym problemem w przypadku automatycznej kategoryzacji. Tabela PDF, w której kolumna Region wykorzystuje scalone komórki do oznaczenia wielu wierszy jako „Zachód”; zostanie wyodrębniony z etykietą pojawiającą się tylko w pierwszym wierszu grupy. Przed sortowaniem wypełnij kolumnę kategorii, tak aby każdy wiersz miał wartość kategorii. W Excelu wybierz kolumnę, naciśnij Ctrl+G, kliknij Specjalne, wybierz Puste, wpisz = i naciśnij strzałkę w górę, a następnie naciśnij Ctrl+Enter. Spowoduje to wypełnienie wszystkich pustych komórek wartością z komórki powyżej.
Czy dokładność OCR wpływa na sortowanie według kategorii?
Tak, znacząco. Jeśli OCR błędnie odczyta „Zachód” jako „W est” lub „VVest”; wartości te staną się oddzielnymi kategoriami w posortowanych wynikach. Zawsze sprawdzaj unikalne wartości w kolumnie kategorii po konwersji i przed sortowaniem. Szybkie skanowanie tabeli przestawnej kolumny kategorii natychmiast ujawnia błędy OCR. Przed uruchomieniem kategoryzacji popraw błędy ręcznie lub za pomocą funkcji Znajdź i zamień.
Wypróbuj PDF do Excela
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
