Konwertujesz tabelę PDF do formatu Excel, otwierasz wynik i patrzysz na arkusz kalkulacyjny z pustymi komórkami, w których powinny znajdować się liczby. Oryginalny plik PDF wyraźnie zawierał dane w tych pozycjach. Można to zobaczyć na ekranie. Jednak plik Excel zawierał luki, brakujące wartości lub całe wiersze zredukowane do pustych białych znaków. Jest to jeden z najbardziej frustrujących wyników konwersji plików PDF na Excel, ponieważ nie jest jasne, co poszło nie tak i jak to naprawić.
Główną przyczyną zwykle nie jest samo narzędzie do konwersji. Jest to rozbieżność pomiędzy sposobem, w jaki plik PDF przechowuje dane w tabeli, a tym, co spodziewa się znaleźć silnik konwersji. Zrozumienie konkretnych przyczyn pustych komórek sprawia, że problem jest możliwy do rozwiązania, a nie tajemniczy.

Plik PDF zawiera obraz tabeli, a nie rzeczywiste dane tabeli
Jest to najczęstszy powód pustych komórek po konwersji pliku PDF na Excel. Jeśli plik PDF został utworzony na podstawie skanu, zrzutu ekranu lub wydruku do pliku PDF z aplikacji, która rasteryzowała jego dane wyjściowe, tabela widoczna na stronie jest obrazem płaskim. Nie ma podstawowych komórek danych, struktur wierszy i kolumn ani strumieni tekstu, które narzędzie do konwersji mogłoby przeanalizować.
Gdy narzędzie do konwersji napotka tabelę opartą na obrazie, ma dwie możliwości: uruchomić OCR, aby spróbować rozpoznać tekst i zrekonstruować strukturę tabeli, lub całkowicie pominąć obraz, ponieważ nie może go przeanalizować. Wiele podstawowych konwerterów PDF na Excel wybiera drugą ścieżkę. Wydobywają prawdziwe dane, jakie mogą znaleźć, i pomijają treści oparte na obrazach. Rezultatem jest arkusz kalkulacyjny z pustymi komórkami, w których znajdował się obraz tabeli. Rozwiązaniem jest użycie Konwertera PDF, który zawiera OCR, np. WukongPDF, który rozpoznaje tekst w obrazach i rekonstruuje siatkę tabeli. Konwersja nie będzie idealna pod względem pikseli, ale dane pojawią się w komórkach, a nie znikną w pustej przestrzeni.
Wypróbuj PDF do Excela
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Układ tabeli wykorzystuje złożone połączone lub zagnieżdżone komórki
Nawet jeśli tabela składa się z prawdziwych danych tekstowych, struktura oryginalnej aplikacji może pokonać silnik konwersji. Aplikacje takie jak Microsoft Excel, Arkusze Google i oprogramowanie do raportowania często tworzą tabele ze scalonymi komórkami, w których pojedynczy nagłówek obejmuje wiele kolumn, tabele zagnieżdżone, w których komórka zawiera inną minitabelę, lub nagłówki wielopoziomowe z grupami kolumn nadrzędnych i podrzędnych.
Plik PDF nie został zaprojektowany do reprezentowania struktur tabel. Został zaprojektowany do umieszczania znaków w określonych współrzędnych x, y na stronie. Plik PDF przechowuje tabelę w postaci tysięcy niezależnych poleceń pozycjonowania znaków. Silnik konwersji musi dokonać inżynierii wstecznej struktury tabeli, analizując rozmieszczenie przestrzenne tych znaków. Połączone komórki ogromnie komplikują tę analizę. To, co dla ludzkiego czytelnika wygląda jak jedna logiczna komórka, w silniku konwersji wygląda jak tekst rozciągający się na niejednoznaczny obszar, który może obejmować jedną szeroką komórkę lub kilka wąskich komórek. Gdy silnik zgadnie źle, dane trafiają do niewłaściwych kolumn, są dzielone między komórki lub pomijane, ponieważ silnik nie mógł rozwiązać niejednoznaczności.
Nie ma idealnego, uniwersalnego rozwiązania tego problemu, ponieważ oryginalna struktura tabeli została utracona podczas konwersji dokumentu do formatu PDF. Jeśli masz dostęp do oryginalnego pliku, eksport bezpośrednio z Excela lub Arkuszy Google do formatu .xlsx zamiast konwersji z pliku PDF na Excel doskonale zachowuje strukturę tabeli. Jeśli plik PDF jest Twoją jedyną kopią, największe szanse na czyste odzyskanie danych daje narzędzie do konwersji z zaawansowanym wykrywaniem tabel, które umożliwia ręczne definiowanie granic kolumn lub dostosowywanie wykrytych obszarów tabeli.
Niespójne lub brakujące informacje o ograniczniku
Silniki konwersji wykrywają granice kolumn, analizując poziome odstępy między grupami znaków. Jeśli dwie kolumny są bardzo blisko siebie, silnik może połączyć je w jedną. Jeśli kolumna zawiera komórki o bardzo różnej ilości tekstu, silnik może podzielić kolumnę na wiele kolumn w wąskich punktach. Obydwa błędy powodują powstanie pustych komórek, albo dlatego, że dane, które powinny wypełnić dwie oddzielne kolumny, zostały upchnięte w jednej, pozostawiając drugą kolumnę pustą, albo dlatego, że kolumna fantomowa rozbija utworzone komórki, w których nie ma danych.
Tabele z pustymi komórkami w oryginalnym dokumencie stanowią szczególnie trudną odmianę tego problemu. Jeśli oryginalna tabela zawiera celowo puste komórki, silnik konwersji widzi większe luki i może przesunąć wykrywanie granic kolumn, powodując nieprawidłowe wyrównanie każdego wiersza poniżej luki. Pojedyncza pusta komórka w wierszu 3 może wyrzucić mapowanie całego kolumny dla wierszy od 4 do 50, tworząc kaskadę źle wyrównanych danych, która wygląda na błąd konwersji, ale w rzeczywistości jest niejednoznacznością strukturalną w dokumencie źródłowym.
Jak zminimalizować puste komórki przy następnej konwersji
Kilka praktycznych dostosowań znacznie poprawia współczynnik powodzenia konwersji. Po pierwsze, zawsze używaj narzędzia obsługującego wykrywanie struktury tabeli, a nie ogólnego konwertera plików PDF na tekst. Narzędzia zaprojektowane specjalnie dla Wyodrębnij dane PDF korzystają z algorytmów wyszkolonych na układach tabel i dają znacznie lepsze wyniki niż ekstrakcja tekstu ogólnego przeznaczenia. Konwersja plików PDF do programu Excel w WukongPDF obejmuje wykrywanie struktury tabeli, która obsługuje typowe układy, w tym scalone komórki, wielopoziomowe nagłówki i tabele z mieszanymi typami danych.
Po drugie, sprawdź plik PDF przed konwersją. Jeśli możesz zaznaczyć i skopiować pojedyncze komórki lub kolumny tekstu z tabeli za pomocą przeglądarki plików PDF, tabela zostanie utworzona z prawdziwych danych tekstowych i zostanie dość dobrze przekonwertowana. Jeśli klikniesz na tabelę i całość podświetli się jako pojedynczy blok lub jeśli zaznaczanie tekstu w ogóle nie zadziała, tabela jest obrazem i wymaga konwersji w oparciu o OCR.
Po trzecie, przygotuj się na oczyszczenie wydruku. Nawet najlepsze narzędzia do konwersji tworzą arkusze kalkulacyjne, które wymagają ręcznej korekty. Sprawdź kilka pierwszych wierszy każdej kolumny, aby sprawdzić, czy wartości znalazły się w odpowiednich kolumnach. Poszukaj kolumn, które są całkowicie puste, jeśli w tym miejscu widzisz dane w oryginalnym pliku PDF. Są to oznaki, że narzędzie błędnie zidentyfikowało granice kolumn. Naprawienie mapowania kolumn w pierwszych kilku wierszach często powoduje kaskadowanie poprawek w pozostałej części arkusza kalkulacyjnego.
Co zrobić, gdy podczas konwersji nadal powstają puste komórki
Jeśli wypróbowałeś wiele narzędzi i po konwersji stale powstają puste komórki w określonych pozycjach, problem prawdopodobnie dotyczy samego pliku PDF, a nie narzędzi. Dane tabeli mogą być przechowywane w postaci grafiki wektorowej, w której liczby są rysowane w postaci kształtów, a nie kodowane jako znaki tekstowe. Dzieje się tak najczęściej w przypadku plików PDF generowanych przez starsze oprogramowanie CAD, specjalistyczne narzędzia do raportowania lub niektóre systemy planowania zasobów przedsiębiorstwa, które renderują dane wyjściowe do formatu PDF za pomocą poleceń rysowania graficznego, a nie umieszczania tekstu. W takich przypadkach jedyną opcją jest OCR i należy spodziewać się ręcznego przejrzenia i skorygowania wyników, ponieważ rozpoznawanie OCR danych tabelarycznych rysowanych wektorowo jest z natury podatne na błędy.
Najbardziej produktywnym rozwiązaniem w przypadku powtarzających się niepowodzeń automatycznej konwersji jest wykonanie zrzutu ekranu tabeli w wysokiej rozdzielczości, uruchomienie go za pomocą dedykowanego narzędzia OCR specjalizującego się w rozpoznawaniu tabel i wyeksportowanie do programu Excel. Ten dwuetapowy proces, obejmujący zrzut ekranu, a następnie OCR, całkowicie pomija wewnętrzną reprezentację danych pliku PDF i traktuje tabelę jako czysty obraz, co, jak na ironię, może być bardziej niezawodne w przypadku niektórych typów zniekształconych plików PDF niż próba przeanalizowania uszkodzonych lub niestandardowych danych tekstowych.
Wypróbuj PDF do Excela
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
