Others

Dlaczego tabele PDF zamieniają wiersze i kolumny podczas konwersji programu Excel

Wyodrębnienie danych tabeli z pliku PDF do programu Excel powinno spowodować utworzenie arkusza kalkulacyjnego, w którym wiersze i kolumny odpowiadają oryginalnej tabeli. Ale czasami wyjście jest transponowane. Wiersze stają się kolumnami, kolumny stają się wierszami, a dane są pomieszane. To nie jest przypadkowy błąd. Ma to specyficzne przyczyny związane ze sposobem, w jaki silnik konwersji PDF na Excel interpretuje wizualny układ tabeli. Zrozumienie, dlaczego zachodzi transpozycja, pomoże Ci wybrać ustawienia konwersji, które pozwolą uzyskać prawidłowo zorientowany wynik.

Najważniejsze wnioski

Transpozycja pliku PDF do programu Excel ma miejsce, gdy silnik konwersji błędnie określa kierunek czytania tabeli, zwykle z powodu scalonych komórek, niespójnych szerokości kolumn lub tekstu wizualnie wyrównanego w wierszach, ale zapisanego w pliku PDF w kolejności kolumn. Rozwiązanie zależy od przyczyny. Dostosowywanie ustawień konwersji, wstępne przetwarzanie pliku PDF w celu wyjaśnienia struktury tabeli lub końcowe przetwarzanie danych wyjściowych w programie Excel w celu przywrócenia danych do właściwej orientacji – wszystko to rozwiązuje różne podstawowe przyczyny.

Why Do PDF Tables Swap Rows and Columns During Excel Conversion

Dlaczego dane tabeli PDF są transponowane podczas wyodrębniania

Transpozycja tabel, w których zastosowano kropki wiodące lub inne wizualne łączniki między kolumnami, np. spis treści z kropkami łączącymi tytuły rozdziałów z numerami stron, jest niemal gwarantowana, ponieważ kropki wiodące tworzą ciągłą wizualną linię, którą algorytm wykrywania interpretuje jako separator wierszy. Usuń kropki wiodące z dokumentu źródłowego przed utworzeniem pliku PDF, jeśli tabela zostanie później przekonwertowana z powrotem do formatu Excel.

Wewnętrzna struktura pliku PDF ma takie samo znaczenie jak układ wizualny. Tabela, która na ekranie wygląda idealnie wyrównana, może być przechowywana jako obiekty tekstowe w kolejności niezgodnej z kolejnością czytania wizualnego. Oprogramowanie do tworzenia plików PDF określa kolejność obiektów tekstowych. Niektóre aplikacje zapisują obiekty tekstowe w kolejności, w jakiej zostały dodane do dokumentu, może to być kolumna po kolumnie, a nie wiersz po wierszu. Właśnie dlatego dwa identyczne pliki PDF mogą dawać różne wyniki konwersji: ich wewnętrzna kolejność obiektów tekstowych jest inna.

Tabela PDF nie jest przechowywana jako tabela w pliku. Jest przechowywany jako pojedyncze obiekty tekstowe umieszczone na stronie pod określonymi współrzędnymi. Silnik konwersji musi sprawdzić te współrzędne i wywnioskować, które obiekty tekstowe należą do poszczególnych wierszy i kolumn. Algorytm wnioskowania wykorzystuje poziome i pionowe wyrównanie tekstu do grupowania go w wiersze i kolumny. Gdy wyrównanie jest niejednoznaczne, algorytm może najpierw pogrupować tekst według wyrównania w pionie, tworząc kolumny, które powinny być wierszami.

Połączone komórki są najczęstszym wyzwalaczem transpozycji. Tabela z wierszem nagłówka obejmującym wiele kolumn tworzy wizualną strukturę, w której górny wiersz nie jest wyrównany z granicami kolumn poniżej. Silnik konwersji postrzega połączony nagłówek i poszczególne kolumny pod nim jako dwa różne wzorce wyrównania. Może interpretować połączony nagłówek jako wiersz wielokolumnowy lub może interpretować kolumny poniżej jako dane wielowierszowe, a niejednoznaczność prowadzi do transpozycji. Tabele, w których pierwsza kolumna zawiera scalone komórki obejmujące wiele wierszy, są równie problematyczne, ponieważ scalanie w pionie zakłóca wyrównanie wierszy używane przez silnik do poziomego grupowania danych.

WukongPDF

Wypróbuj PDF do Excela

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Dostosuj ustawienia konwersji, aby zapobiec transpozycji

Jeżeli tabela PDF została wygenerowana ze strony internetowej przy użyciu funkcji drukowania przeglądarki, struktura tabeli w pliku PDF może być mniej ustrukturyzowana niż tabela z dedykowanej aplikacji raportującej. Pliki PDF generowane przez przeglądarkę często mają luźniejsze wyrównanie między elementami tekstowymi, co znacznie utrudnia wykrywanie tabel. Jeśli to możliwe, eksportuj tabele do formatu PDF z oryginalnej aplikacji, zamiast drukować z przeglądarki, aby uzyskać najbardziej wiarygodne wyniki konwersji.

W niektórych tabelach PDF naprzemienne kolory wierszy stanowią pomoc wizualną dla czytelników. Te naprzemienne kolory mogą zmylić algorytm wykrywania tabeli, ponieważ postrzega on wiersze o różnych kolorach jako należące do różnych sekcji tabeli. Usunięcie kolorów tła z pliku PDF przed konwersją lub najpierw konwersja do skali szarości eliminuje to źródło nieporozumień i poprawia spójność wykrywania struktury tabeli.

Jeśli narzędzie do konwersji zawiera tryb wykrywania tabeli, włącz go. Wykrywanie tabeli nakazuje silnikowi szukać linii siatki, cieniowania tła i spójnych wzorców wyrównania tekstu, które wskazują strukturę tabeli. W tym trybie stosowana jest dodatkowa analiza wykraczająca poza domyślną ekstrakcję tekstu i jest bardziej prawdopodobne, że prawidłowo zidentyfikuje orientację wierszy i kolumn. Niektóre narzędzia oferują także funkcję „Transponuj dane wyjściowe”. pole wyboru specjalnie do obsługi przypadków, w których domyślna ekstrakcja generuje transponowane dane. Jeśli dane wyjściowe są transponowane, a narzędzie ma tę opcję, sprawdzenie ich przy drugiej próbie konwersji zapewni prawidłową orientację.

W przypadku Wyodrębnij dane PDF ze zeskanowanych tabel, uruchom OCR specjalnie w trybie tabelarycznym. Silniki OCR przeznaczone do ogólnego rozpoznawania tekstu mogą nie zachować relacji przestrzennych pomiędzy blokami tekstu. Silnik OCR w trybie tabelarycznym zachowuje strukturę wierszy i kolumn w rozpoznanych wynikach. Konwerter plików PDF do programu Excel w WukongPDF zawiera automatyczne wykrywanie struktury tabeli, które identyfikuje relacje między wierszami i kolumnami w oparciu zarówno o wyrównanie wizualne, jak i wzorce treści, zmniejszając prawdopodobieństwo transpozycji w porównaniu z ekstrakcją tekstu ogólnego.

Poprawka po konwersji: Transpozycja danych Excel z powrotem

Po transpozycji sprawdź typy danych w każdej kolumnie. Program Excel mógł zinterpretować kolumnę liczb jako tekst po transpozycji, ponieważ transponowane dane zawierały etykietę nagłówka w tej samej kolumnie. Wybierz każdą kolumnę i sprawdź, czy typ danych odpowiada treści. Liczby sformatowane jako tekst nie będą obliczane poprawnie, a daty sformatowane jako tekst nie będą sortowane chronologicznie. Napraw typy danych po transpozycji, aby mieć pewność, że arkusz kalkulacyjny będzie w pełni funkcjonalny.

Jeśli dane wyjściowe zostaną transponowane i ponowna konwersja nie jest możliwa, Excel może dokonać transpozycji danych kilkoma kliknięciami. Wybierz transponowany zakres danych, skopiuj go, kliknij prawym przyciskiem myszy nową lokalizację i w obszarze Opcje wklejania wybierz opcję „Transponuj”. Wiersze i kolumny zostaną zamienione miejscami, przywracając pierwotną orientację. Działa to doskonale w przypadku prostych tabel, w których jedynym problemem jest odwrócenie wiersza/kolumny. W przypadku złożonych tabel ze scalonymi komórkami transpozycja w programie Excel nie obsługuje prawidłowo scalonych komórek i może spowodować utworzenie układu różniącego się od oryginału w gorszy sposób.

Przed transpozycją porównaj oryginalną tabelę PDF z wynikami programu Excel, aby potwierdzić, że transpozycja jest jedynym problemem. Jeśli dane wyjściowe również zawierają źle wyrównane komórki, brakuje danych lub nieprawidłowo scalone komórki, transpozycja nie rozwiąże tych problemów. W takich przypadkach konieczna jest ręczna rekonstrukcja lub ponowna konwersja danych przy innych ustawieniach. Poprawka transpozycji to rozwiązanie dostępne za pomocą jednego kliknięcia w konkretnym przypadku, gdy dane są kompletne i prawidłowo wyrównane, ale są źle zorientowane.

Wstępne przetwarzanie pliku PDF w celu wyodrębnienia tabeli w trybie Cleaner

Jeśli tabela PDF została utworzona przez konkretną aplikację, taką jak SAP, Oracle Reports lub starszy system mainframe, wyszukaj w Internecie znane problemy z konwersją danych wyjściowych PDF tej konkretnej aplikacji. Systemy raportowania w przedsiębiorstwach często generują pliki PDF z przewidywalnymi nieprawidłowościami w strukturze tabeli, a inni użytkownicy mogli udokumentować optymalne ustawienia konwersji dla tego konkretnego źródła. Ukierunkowane wyszukiwanie oszczędza prób i błędów testowania wielu podejść do konwersji.

Jeśli konkretny plik PDF konsekwentnie generuje transponowane dane wyjściowe przy wielu próbach konwersji, należy wstępnie przetworzyć plik PDF przed konwersją. Użyj edytora PDF, aby usunąć cieniowanie tła, linie siatki lub elementy dekoracyjne, które mogłyby zmylić algorytm wykrywania tabeli. Czysta tabela z czarnym tekstem na białym tle i cienkimi, spójnymi liniami siatki konwertuje bardziej niezawodnie niż tabela z naprzemiennymi kolorami wierszy, grubymi krawędziami i osadzonymi ikonami. Usunięcie szumu wizualnego przed konwersją poprawia zdolność silnika konwersji do prawidłowej identyfikacji struktury tabeli.

W przypadku zeskanowanych tabel dostosuj skan tak, aby był idealnie prosty. Tabela skanowana pod kątem nawet jednego stopnia powoduje, że każdy wiersz jest lekko nachylony, a silnik konwersji może zinterpretować to nachylenie jako wyrównanie kolumn. Większość oprogramowania do skanowania zawiera opcję prostowania, która automatycznie prostuje stronę. Włącz tę opcję przed skanowaniem lub użyj narzędzia prostowania zeskanowanego pliku PDF przed konwersją. Proste rzędy są niezbędne do prawidłowego wykrywania wierszy i kolumn.

Często zadawane pytania

Czy konwersja tabeli PDF do formatu CSV zamiast do Excela pozwala uniknąć problemu transpozycji? Konwersja CSV wykorzystuje ten sam algorytm wykrywania tabeli, co konwersja Excel. Jeśli algorytm transponuje dane, dane wyjściowe CSV również zostaną transponowane. Format wyjściowy nie ma wpływu na logikę wykrywania. CSV ma tę zaletę, że łatwiej go sprawdzić w edytorze tekstu, co sprawia, że transpozycja jest natychmiast widoczna, gdy otworzysz plik i zobaczysz, że oczekiwane 5 kolumn zmieniło się w 20.

Czy transpozycja występuje częściej w przypadku niektórych typów tabel PDF?

Tak. Tabele ze scalonymi komórkami nagłówka, tabele z niespójną liczbą kolumn w wierszu oraz tabele, w których pierwsza kolumna ma pionową orientację tekstu, najprawdopodobniej zostaną transponowane. Tabele o prostych, jednolitych strukturach siatki rzadko się transponują. Im bardziej regularna tabela, tym bardziej niezawodna konwersja.

Czy mogę zautomatyzować wykrywanie i korekcję transponowanych danych wyjściowych Excel?

Sprawdzanie liczby kolumn w wynikach programu Excel względem oczekiwanej liczby z oryginalnej tabeli jest prostą, automatyczną kontrolą. Jeśli tabela PDF ma 5 kolumn i 20 wierszy, ale dane wyjściowe programu Excel mają 20 kolumn i 5 wierszy, dane zostaną transponowane. Skrypt może wykryć tę niezgodność i albo dokonać transpozycji danych, albo oznaczyć plik do ręcznego przeglądu. Ta zautomatyzowana kontrola jakości wychwytuje transpozycję, zanim dane trafią do dalszych przepływów pracy.

Dlaczego ta sama tabela PDF jest poprawnie konwertowana przy jednej próbie i transponowana przy drugiej?

Dzieje się tak zazwyczaj z powodu użycia nieco innych ustawień konwersji podczas obu prób lub użycia przez narzędzie do konwersji innej ścieżki przetwarzania wewnętrznego w zależności od rozmiaru pliku lub progów złożoności. Jeśli napotkasz niespójne wyniki, udokumentuj dokładne ustawienia, które dają prawidłowe dane wyjściowe i użyj tych ustawień we wszystkich przyszłych konwersjach podobnych tabel.

WukongPDF

Wypróbuj PDF do Excela

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →