Tips & Tricks

Jak przekonwertować wielostronicową tabelę PDF na pojedynczą ciągłą tabelę programu Excel bez artefaktów podziału strony i powtarzających się wierszy nagłówków

How to Convert a Multi-Page PDF Table Into a Single Continuous Excel Table With No Page-Break Artifacts or Repeated Header Rows

Dlaczego wielostronicowe tabele PDF rozpadają się na fragmenty podczas konwersji do formatu Excel

Konwersja tabeli PDF obejmującej wiele stron do arkusza kalkulacyjnego Excel wydaje się zadaniem, które należy zautomatyzować. Wybierz strony, uruchom konwersję i uzyskaj pojedynczą ciągłą tabelę. Rzeczywistość jest inna, ponieważ silnik konwersji PDF do Excel postrzega każdą stronę jako niezależne płótno i dla każdej strony tworzy oddzielną tabelę lub oddzielny arkusz. Rezultatem jest fragmentaryczny arkusz kalkulacyjny, w którym ten sam wiersz nagłówka tabeli pojawia się na każdym arkuszu, wiersze dzielą dane w połowie strony na granicach stron, a skonsolidowanie dziesiątek tabel na poziomie strony w jeden ciągły zbiór danych wymaga godzin ręcznego kopiowania i wklejania.

Funkcja wykrywania między stronami obsługuje to automatycznie.

To podejście sprawdza się w przypadku większości dokumentów finansowych.

Podstawową przyczyną jest sposób, w jaki pliki PDF reprezentują zawartość strony. Strona PDF to samodzielna powierzchnia rysunkowa bez nieodłącznej koncepcji treści przepływającej przez granice strony. Tabela rozpoczynająca się na dole strony 12 i kończąca się na górze strony 13 jest reprezentowana w pliku PDF jako dwa niezależne zestawy linii wektorowych i obiektów tekstowych. Silnik konwersji nie otrzymuje sygnału strukturalnego informującego, że te dwie tabele na poziomie strony są w rzeczywistości jedną ciągłą tabelą. O ile silnik nie przeprowadzi analizy zawartości między stronami, co większość podstawowych konwerterów pomija na rzecz szybkości, dane wyjściowe wiernie odtwarzają fragmentację na poziomie strony istniejącą w źródłowym pliku PDF.

Powtarzające się wiersze nagłówka pogłębiają problem fragmentacji. W większości tabel wielostronicowych powtarza się wiersz nagłówka kolumny u góry każdej nowej strony, aby zapewnić czytelność w wersji drukowanej lub w formacie PDF. Kiedy każda strona jest konwertowana na oddzielny arkusz lub oddzielny zakres tabeli, powtarzający się wiersz nagłówka pojawia się jako wiersz danych w każdym segmencie wyjściowym. Konsolidacja 20 stron przekonwertowanych wyników oznacza ręczne zidentyfikowanie i usunięcie 19 kopii powtarzającego się wiersza nagłówka, zanim dane będą mogły zostać scalone w jedną ciągłą tabelę.

WukongPDF

Wypróbuj PDF do Excela

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Przygotowanie tabeli PDF do czystej konwersji

Jakość wyniku Wyodrębnij dane PDF zależy w dużej mierze od struktury tabeli PDF przed rozpoczęciem konwersji. Tabele utworzone jako rzeczywiste obiekty tabel PDF z określonymi granicami komórek i komórkami danych są konwertowane w bardziej przejrzysty sposób niż tabele utworzone jako wizualne układy linii i pól tekstowych, które dla ludzkiego czytelnika tylko wyglądają jak tabele. Jeśli masz kontrolę nad procesem tworzenia pliku PDF, wygenerowanie tabeli przy użyciu biblioteki PDF obsługującej semantyczne struktury tabel daje znacznie lepsze wyniki konwersji niż drukowanie wizualnego układu tabeli z edytora tekstu lub arkusza kalkulacyjnego.

Przed uruchomieniem konwersji sprawdź strukturę tabeli PDF za pomocą narzędzia do sprawdzania plików PDF, które może określić, czy zawartość tabeli jest przechowywana jako oznaczone elementy tabeli, czy jako niepowiązane obiekty tekstowe. Oznaczone tabele zawierają metadane strukturalne, które informują silniki konwersji, który tekst należy do której komórki i które komórki należą do którego wiersza. Silniki konwersji, które potrafią odczytywać znaczniki PDF, generują ustrukturyzowane dane wyjściowe w programie Excel z prawidłowym mapowaniem komórek. Nieoznakowane tabele wizualne wymagają, aby silnik konwersji wywnioskował strukturę tabeli na podstawie pozycji tekstu i grafiki liniowej, co z natury jest mniej niezawodne.

Jeśli tabela nie jest oznakowana, przebieg wstępnego przetwarzania, który dodaje znaczniki tabeli do pliku PDF przed konwersją, radykalnie poprawia jakość wydruku. Profesjonalni edytorzy plików PDF mogą automatycznie wykrywać obszary tabel i stosować znaczniki tabel do wykrytej struktury. Chociaż automatyczne tagowanie nie jest doskonałe, zwłaszcza w przypadku tabel ze scalonymi komórkami lub rzędami o nieregularnej wysokości, zapewnia ono strukturalną podstawę, z którą może współpracować silnik konwersji, i generuje dane wyjściowe, które wymagają znacznie mniej ręcznego czyszczenia niż konwersja całkowicie nieoznaczonego oryginału.

Uruchamianie konwersji z włączonym wykrywaniem tabel międzystronicowych

Nie wszystkie konwertery plików PDF na Excel obsługują wykrywanie tabel międzystronicowych, a wśród tych, które to umożliwiają, funkcja ta może nie być domyślnie włączona. Przed uruchomieniem konwersji sprawdź w ustawieniach konwertera opcje „Wykryj tabele wielostronicowe”, „Scal tabele na stronach”, „Ciągłe wykrywanie tabel” lub podobną terminologię. Włączenie tego ustawienia powoduje, że silnik analizuje strukturę tabeli na sąsiednich stronach i łączy wykryte kontynuacje w jedną tabelę wyjściową.

Wykrywanie krzyżowania stron polega na porównaniu struktury kolumnowej tabel znalezionych na kolejnych stronach. Jeśli strona 8 kończy się tabelą zawierającą pięć kolumn o określonych względnych szerokościach, a strona 9 zaczyna się tabelą o tej samej pięciokolumnowej strukturze i pasujących szerokościach kolumn, silnik z dużym prawdopodobieństwem identyfikuje kontynuację między stronami i łączy oba segmenty. Porównanie toleruje niewielkie różnice w bezwzględnych pozycjach kolumn, ponieważ nagłówki i stopki na różnych stronach mogą zmieniać pozycję tabeli na stronie, mimo że szerokość kolumn pozostaje stała.

Wykrywanie staje się mniej niezawodne, gdy podziały stron występują w środku wiersza tabeli, a nie pomiędzy wierszami. Wiersz podzielony wzdłuż krawędzi strony ma swoją górną połowę renderowaną na jednej stronie, a dolną połowę na następnej, przy czym margines strony lub stopka zajmują przestrzeń pomiędzy obiema połówkami. Algorytmy wykrywania tabeli, które szukają pełnych wierszy, mogą nie rozpoznać podzielonego wiersza jako należącego do tej samej tabeli. Wybór układu tabeli w aplikacji źródłowej, który pozwala uniknąć dzielenia wierszy wzdłuż granic strony przed eksportem do pliku PDF, całkowicie eliminuje ten tryb błędu wykrywania.

Czyszczenie skonwertowanego wyjścia w celu usunięcia artefaktów podziału strony

Nawet po włączeniu wykrywania między stronami niektóre artefakty konwersji zazwyczaj pozostają w wynikach programu Excel i wymagają ręcznego lub skryptowego czyszczenia. Najczęstszym artefaktem jest zduplikowany wiersz nagłówka wstawiany przez silnik konwersji w każdym punkcie przejścia strony. Jeśli silnik wykrył kontynuację między stronami, ale nie rozpoznał powtarzającego się nagłówka jako nagłówka, tekst nagłówka pojawi się jako wiersz danych. Szybkie skanowanie pierwszej kolumny tabeli wyjściowej w poszukiwaniu wartości pasujących do znanego tekstu nagłówka pozwala zidentyfikować te zduplikowane wiersze nagłówka do usunięcia.

Puste wiersze w punktach przejścia stron to drugi najczęstszy artefakt. Jeśli strona PDF miała margines, stopkę lub biały znak między końcem tabeli a dołem strony, silnik konwersji może wstawić w tym miejscu jeden lub więcej pustych wierszy. Przejście filtrowania i usuwania całkowicie pustych wierszy czyści te artefakty w ciągu kilku sekund.

W przypadku dużych, wielostronicowych tabel czyszczenie za pomocą skryptu jest bardziej wydajne niż ręczna inspekcja wiersz po wierszu. Krótkie makro programu Excel lub skrypt w języku Python, które odczytuje przekonwertowany skoroszyt, usuwa wiersze, w których pierwsza komórka odpowiada znanemu tekstowi nagłówka, usuwa całkowicie puste wiersze i konsoliduje dane z wielu arkuszy w jeden arkusz, może przetworzyć setki stron przekonwertowanej tabeli w czasie krótszym niż minuta.

Konwerter PDF na Excel WukongPDF obejmuje wykrywanie tabel międzystronicowych, które identyfikuje tabele ciągłe poza granicami stron i generuje skonsolidowane dane wyjściowe z deduplikacją nagłówków. W przypadku tabel utworzonych jako struktury PDF ze znacznikami konwersja zachowuje wyrównanie formatowania komórek, formatowanie liczb i styl tekstu w wynikach programu Excel, skracając czas czyszczenia po konwersji z godzin do minut w przypadku dużych, wielostronicowych dokumentów tabelarycznych.

Obsługa złożonych struktur tabel poprzez podziały stron

Tabele ze scalonymi komórkami, zagnieżdżonymi nagłówkami lub nieregularną liczbą kolumn stanowią dodatkowe wyzwanie w przypadku konwersji między stronami. Tabela ze scalonym wierszem tytułu obejmującym wszystkie kolumny u góry tabeli nie powinna mieć tego scalonego tytułu powtarzanego na stronach kontynuacji, ale niektóre narzędzia do generowania plików PDF i tak powtarzają go w ramach konfiguracji wiersza nagłówka. Silnik konwersji widzi powtarzający się scalony tytuł na każdej stronie i traktuje go jako zwykły wiersz danych w wynikach.

W przypadku tabel z zagnieżdżonymi nagłówkami kolumn, gdzie nagłówek zajmuje dwa lub trzy wiersze, a kategorie nadrzędne obejmują wiele podkolumn, wykrywanie krzyżowania stron musi pasować do złożonej struktury nagłówków na stronach.

Jeśli struktura nagłówka na stronie 7 jest zgodna ze strukturą na stronie 8, uwzględniając ten sam wzór scalania i etykiety nagłówków podrzędnych, silnik może bez problemu scalić dwie tabele na poziomie strony. Jeśli struktura nagłówka jest inna, ponieważ struktura tabeli zmienia się w połowie dokumentu lub ponieważ generowanie pliku PDF wprowadziło zmiany w formatowaniu, silnik traktuje je jako osobne tabele, nawet jeśli logicznie do siebie pasują.

Najbardziej niezawodnym podejściem w przypadku złożonych tabel wielostronicowych jest konwersja całej tabeli w jednej operacji po potwierdzeniu, że struktura pliku PDF obsługuje rozpoznawanie między stronami. W przypadku danych krytycznych, dla których najważniejsza jest dokładność, wyrywkowe sprawdzenie liczby wierszy w wynikach względem znanej liczby wierszy z oryginalnego źródła danych pozwala szybko sprawdzić, czy w procesie konwersji nie zostały utracone ani zduplikowane żadne wiersze.

Podczas konwertowania sprawozdań finansowych, rejestrów faktur lub dzienników transakcji obejmujących dziesiątki stron skumulowany efekt drobnych błędów konwersji może obniżyć wartość analityczną danych. Pojedynczy brakujący wiersz w dzienniku transakcji oznacza, że sumy finansowe obliczone na podstawie przekonwertowanych danych nie będą zgodne z sumami w oryginalnym dokumencie. Pojedynczy zduplikowany wiersz nagłówka błędnie zidentyfikowany jako wiersz danych może wprowadzić fałszywą transakcję, która zakłóca uzgodnienia kontrolne. Weryfikacja liczby wierszy względem oryginalnego dokumentu strona po stronie, przynajmniej w przypadku pierwszej konwersji nowego typu dokumentu, daje pewność co do dokładności konwersji, zanim dane trafią do analitycznych przepływów pracy.

W przypadku konwersji cyklicznych, w przypadku których ten sam typ dokumentu jest przetwarzany okresowo, np. miesięcznych wyciągów bankowych lub cotygodniowych raportów sprzedaży, utwórz szablon konwersji, który zapamiętuje ustawienia wykrywania, mapowania kolumn i reguły czyszczenia, które działały w przypadku poprzednich konwersji tego samego typu dokumentu. Szablon rejestruje wiedzę zdobytą podczas rozwiązywania problemów z pierwszą konwersją i automatycznie stosuje ją do kolejnych konwersji, redukując czas czyszczenia każdej konwersji z godzin do niemal zera w przypadku znanych formatów dokumentów.

WukongPDF

Wypróbuj PDF do Excela

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →