Others

Dlaczego konwersja tabeli PDF do programu Excel czasami powoduje połączenie sąsiadujących kolumn numerycznych w jedną komórkę?

Konwertujesz czysto sformatowaną tabelę PDF do programu Excel, otwierasz dane wyjściowe i okazuje się, że to, co w pliku PDF było dwiema oddzielnymi kolumnami liczb, stało się pojedynczą kolumną z wartościami takimi jak „1 2503 780”. w każdej komórce. Dwie wartości liczbowe z sąsiednich kolumn zostały połączone w jeden ciąg tekstowy i dane są teraz bezużyteczne do obliczeń. Jest to najczęstsza skarga dotycząca konwersji PDF do Excel, a dzieje się tak dlatego, że konwerter błędnie ocenił, gdzie kończy się jedna kolumna, a zaczyna następna.

Wykrywanie granic kolumn w tabelach PDF jest zasadniczo trudnym problemem, ponieważ pliki PDF nie zawierają struktury tabeli. Tabela PDF to po prostu tekst umieszczony pod określonymi współrzędnymi, z poziomymi i pionowymi liniami narysowanymi w pobliżu tekstu. Konwerter musi wywnioskować granice kolumn na podstawie odstępów między blokami tekstu, wyrównania tekstu w wierszach lub położenia narysowanych linii. Gdy kolumny liczbowe są wąskie, a liczby w sąsiednich kolumnach są blisko siebie, konwerter może połączyć je w jedną szerszą kolumnę, odczytując obie liczby jako jeden ciąg tekstowy. Konwerter widzi ciągły poziomy ciąg liczb i nie jest w stanie określić, gdzie w oryginalnym układzie znajdowało się przerwanie kolumny.

Why Does Converting a PDF Table to Excel Sometimes Merge Adjacent Numeric Columns Into a Single Cell

Dlaczego sąsiednie kolumny liczbowe są szczególnie podatne na łączenie

Kolumny numeryczne w tabelach PDF są zwykle wąskie, ponieważ liczby są krótkie. Kolumna wartości walut może zawierać wpisy takie jak „1250,00”; lub „42,50”; rzadko przekracza 12 znaków. Dwie wąskie kolumny liczbowe umieszczone obok siebie, np. „Cena jednostkowa” oraz „Cena rozszerzona”; często między nimi jest tylko kilka punktów białej przestrzeni. Jeśli algorytm dzielenia kolumn konwertera używa minimalnego progu przerwy, który jest większy niż rzeczywista przerwa między kolumnami, postrzega dwie kolumny jako jedną i łączy ich wartości.

Problem pogłębiają liczby wyrównane do prawej strony. W dobrze sformatowanej tabeli PDF kolumny liczbowe są wyrównane do prawej strony, więc liczby w każdym wierszu kończą się w tej samej pozycji poziomej. Odstęp między końcem liczby wyrównanej do prawej w kolumnie A a początkiem liczby wyrównanej do lewej w kolumnie B może wynosić zaledwie kilka punktów. Wizualna kontrola pliku PDF pokazuje wyraźną lukę, ale algorytm konwertera może wymagać większej przerwy, aby pewnie zidentyfikować granicę kolumny, traktując wąską przestrzeń jako normalny odstęp między wyrazami, a nie jako separator kolumn.

Powiązany problem występuje w przypadku liczb ujemnych i notacji w nawiasach. Wartość wyświetlana jako „(1250,00)”. zawiera zarówno nawias, jak i przecinek, które konwerter może zinterpretować jako wiele oddzielnych tokenów. Nawias otwierający zostaje powiązany z poprzednią kolumną, część liczbowa zostaje umieszczona w bieżącej kolumnie, a nawias zamykający zostaje usunięty lub dołączony do następnej kolumny. Rezultatem jest komórka zawierająca częściowe dane, które wymagają obszernego ręcznego czyszczenia. Tabele korzystające z europejskiego formatowania liczb, gdzie przecinek jest separatorem dziesiętnym, a kropka jest separatorem tysięcy, jeszcze bardziej dezorientują konwertery, które zakładają amerykańskie formatowanie liczb.

WukongPDF

Wypróbuj PDF do Excela

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Jak rozpoznać tabele problemów przed konwersją

Przed konwersją otwórz plik PDF i powiększ obszar tabeli. Poszukaj kolumn, w których odstęp między skrajnym prawym znakiem jednej kolumny a skrajnym lewym znakiem następnej kolumny jest wizualnie mały i ma mniej niż szerokość jednego znaku. Są to kolumny, które najprawdopodobniej zostaną scalone podczas konwersji. Jeśli widzisz tabele z tak małymi odstępami między kolumnami, zaplanuj ręczną korektę po konwersji lub rozważ alternatywną metodę wyodrębniania.

Sprawdź także tabele, które używają kropek wiodących lub wierszy kropek łączących nazwę przedmiotu wyrównaną do lewej z ceną wyrównaną do prawej. Kropki wiodące znajdują się w przestrzeni pomiędzy kolumnami i często są błędnie odczytywane jako dane, a nie jako formatowanie wizualne. Konwerter, który traktuje kropki wiodące jako treść, utworzy kolumnę zawierającą same kropki lub niepoprawnie podzieli tabelę, ponieważ nie będzie w stanie odróżnić kropek wiodących od danych. Tabele ze scalonymi komórkami nagłówkowymi obejmującymi wiele kolumn to kolejny problem. Konwerter widzi szeroki blok tekstu w wierszu nagłówka i może nieprawidłowo zmapować go do węższych kolumn danych poniżej.

W przypadku danych krytycznych, dla których liczy się dokładność, ekstrakcja Wyodrębnij dane PDF przy użyciu specjalistycznego oprogramowania do rozpoznawania tabel jest bardziej niezawodna niż uniwersalna konwersja plików PDF do programu Excel. Oprogramowanie do ekstrakcji danych zaprojektowane specjalnie dla tabel wykorzystuje wiele sygnałów, położenie tekstu, metryki czcionek, położenie linii i spójność wyrównania w wierszach, aby zbudować dokładniejszy model kolumn. Dodatkowy koszt specjalistycznego oprogramowania do ekstrakcji jest uzasadniony, gdy alternatywą są godziny ręcznego czyszczenia w Excelu każdej przekonwertowanej tabeli.

Strategie ręcznej korekty scalonych kolumn

Gdy nie da się uniknąć łączenia kolumn, najszybszym narzędziem do korekcji jest funkcja Excela „Text to Columns”. Wybierz scaloną kolumnę, otwórz Dane, Tekst w kolumnach i wybierz opcję Rozdzielone. Jeśli scalone wartości są konsekwentnie oddzielone spacją, jako ogranicznik wybierz Spację. Jeśli są oddzielone zmienną liczbą spacji, wybierz opcję Stała szerokość i ręcznie umieść linię podziału kolumny pomiędzy dwiema wartościami. Program Excel wyświetla podgląd podziału przed jego zastosowaniem, dzięki czemu można dostosować położenie podziału, aż podział będzie prawidłowy dla wszystkich wierszy.

W przypadku wartości, które zostały połączone bez żadnych ograniczników, np. „12503780” gdzie podział powinien wynosić pomiędzy „1250” oraz „3780”; Tekst do kolumn nie może pomóc, ponieważ nie ma separatora, na którym można by podzielić. Musisz znać oczekiwaną szerokość każdej kolumny. Jeśli pierwsza kolumna zawsze zawiera cztery cyfry, a druga zawsze zawiera cztery cyfry, użyj funkcji LEWO i PRAWO programu Excel ze znaną liczbą znaków, aby wyodrębnić wartości w oddzielnych kolumnach. To podejście działa tylko wtedy, gdy szerokości kolumn są stałe i spójne, co jest powszechne w tabelach eksportowanych z systemów baz danych o stałych szerokościach pól.

WukongPDF konwertuje tabele PDF do formatu Excel z funkcją wykrywania kolumn, która analizuje wyrównanie tekstu, odstępy i położenie linii w celu zidentyfikowania granic kolumn nawet w tabelach liczbowych o małych odstępach. Konwersja zachowuje formatowanie liczbowe, dzięki czemu wyodrębnione wartości można natychmiast wykorzystać do obliczeń bez ręcznego czyszczenia. W przypadku złożonych tabel, które są odporne na automatyczne wykrywanie kolumn, należy rozważyć zastosowanie podejścia opartego na OCR jako alternatywnej ścieżki. Zrób zrzut ekranu tabeli PDF, uruchom go za pomocą narzędzia OCR z funkcją rozpoznawania tabeli i wyeksportuj rozpoznaną tabelę do programu Excel. Nowoczesne silniki OCR, które obejmują wykrywanie struktury tabeli, są często bardziej niezawodne przy separacji kolumn niż tradycyjne konwertery plików PDF na Excel, ponieważ bezpośrednio analizują układ wizualny.

WukongPDF

Wypróbuj PDF do Excela

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →