Tips & Tricks

Jak OCR zeskanowanej tabeli i wyeksportować tylko liczby

Zeskanowana tabela w pliku PDF to siatka liczb uwięziona w obrazie. Ludzkie oko widzi wiersze i kolumny. Oprogramowanie OCR widzi obraz strony i próbuje wyodrębnić dowolny znaleziony tekst. Rezultatem jest często chaos, w wyniku którego zatracają się relacje między liczbami. Wartość z kolumny trzeciej trafia do kolumny drugiej. Nagłówek wiersza jest dołączony do nieprawidłowych danych. Uruchamianie OCR na zeskanowanej tabeli i eksportowanie tylko danych liczbowych, wyraźnie odwzorowanych na wiersze i kolumny, wymaga ustawień OCR, które zachowują strukturę tabeli, oraz etapu eksportu, który izoluje liczby od otaczającego tekstu. Proces wyodrębniania tabeli OCR PDF jest bardziej wymagający niż ogólny proces OCR tekstu.

How to OCR a Scanned Table and Export Only the Numbers

Dlaczego ogólny OCR zawodzi w tabelach

Ogólne OCR przetwarza obraz strony jako ciągły strumień tekstu. Rozpoznaje znaki i wyświetla je w kolejności, w jakiej pojawiają się na stronie, zazwyczaj od lewej do prawej, od góry do dołu. Stół zakłóca ten przepływ. Silnik OCR napotyka krótkie fragmenty tekstu oddzielone dużymi przerwami. Musi zdecydować, czy te fragmenty są częścią tego samego akapitu, oddzielnymi wierszami, czy też elementami tabeli. Ogólne Silniki OCR nie są zaprojektowane do dokonywania tego rozróżnienia.

Liczba w komórce tabeli jest odizolowana od sąsiadów białym znakiem. Nagłówek kolumny znajdujący się nad nim można rozpoznać jako odrębny blok tekstowy. Etykietę wiersza po jego lewej stronie można rozpoznać jako kolejny oddzielny blok. Dane wyjściowe OCR przedstawiają te trzy fragmenty jako niepołączony tekst. Utracono relację między nagłówkiem kolumny, etykietą wiersza i wartością danych. Tabela Skanowany plik PDF staje się stosem liczb bez żadnego znaczenia strukturalnego.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Korzystanie z silników OCR obsługujących tabele

Specjalistyczne silniki OCR obejmują wykrywanie tabel jako podstawową funkcję. Silniki te analizują obraz strony i identyfikują struktury tabel, wykrywając linie siatki, wyrównanie kolumn i spójne odstępy między wierszami. Przetwarzają tabelę jak obiekt strukturalny, rozpoznając każdą komórkę z osobna i rejestrując jej położenie w wierszu i kolumnie. Dane wyjściowe mają postać ustrukturyzowanego formatu, takiego jak arkusz kalkulacyjny lub plik CSV, w którym zachowana jest struktura tabeli.

Adobe Acrobat Pro zawiera funkcję OCR rozpoznającą tabele. Podczas uruchamiania OCR na zeskanowanym dokumencie włącz opcję Rozpoznaj tekst i upewnij się, że ustawienie Rozpoznaj tabele jest aktywne. Silnik OCR identyfikuje tabele na stronie i wyodrębnia je jako dane strukturalne. Oparte na przeglądarce platformy OCR PDF, w tym WukongPDF, obsługują również rozpoznawanie tabel, zwracając wyodrębnione dane w formacie arkusza kalkulacyjnego.

Eksportowanie tylko danych liczbowych

Gdy OCR rozpozna strukturę tabeli, dane wyjściowe zazwyczaj zawierają cały tekst w tabeli: etykiety wierszy, nagłówki kolumn i wartości danych. Aby wyeksportować tylko liczby, przefiltruj dane wyjściowe. W arkuszu kalkulacyjnym usuń kolumny tekstowe i zachowaj kolumny liczbowe. Lub w ustawieniach eksportu OCR określ, że mają być wyodrębniane tylko dane liczbowe. Niektóre narzędzia OCR potrafią zidentyfikować typ danych w każdej komórce i umożliwić selektywny eksport komórek numerycznych.

Eksport liczbowy jest przydatny, gdy dane tabelaryczne będą wprowadzane do innego systemu. Model finansowy wymagający kwartalnych przychodów nie potrzebuje etykiet wierszy. Analiza statystyczna wymagająca wartości pomiarowych nie potrzebuje nagłówków kolumn. Krok Wyodrębnij dane PDF tworzy czysty zestaw danych liczbowych, gotowy do importu. Etykiety tekstowe można wyeksportować osobno i wykorzystać jako odniesienie, aby zrozumieć, co reprezentują liczby.

Czyszczenie i sprawdzanie wyodrębnionych liczb

OCR nigdy nie jest doskonały. Liczby są szczególnie podatne na błędy, ponieważ wiele znaków wygląda podobnie. Zero można rozpoznać jako literę O. Jedynkę można rozpoznać jako małą literę L. Przecinek można rozpoznać jako kropkę. Po wyodrębnieniu danych liczbowych przeskanuj dane wyjściowe pod kątem błędów OCR. Poszukaj numerów, które są poza zakresem w porównaniu do numerów sąsiadujących. Kwartalny dochód w wysokości czterdziestu pięciu tysięcy dolarów w kolumnie o wartości około czterystu pięćdziesięciu tysięcy dolarów to czerwona flaga.

Porównaj wyodrębnione sumy z dowolnymi sumarycznymi danymi w oryginalnym dokumencie. Jeśli oryginalna tabela zawiera na dole wiersz sum, zsumuj wyodrębnione liczby i porównaj sumę z oryginałem. Rozbieżność wskazuje na błąd OCR w jednej lub większej liczbie komórek. Oryginał Skanowany plik PDF jest źródłem prawdy. Wynik OCR jest przybliżeniem wymagającym sprawdzenia.

Obsługa zeskanowanych tabel o słabej jakości obrazu

Tabela wydrukowana na drukarce igłowej, dwukrotnie skopiowana i zeskanowana w niskiej rozdzielczości stanowi poważne wyzwanie w zakresie OCR. Linie siatki mogą być uszkodzone lub ich brak. Liczby mogą być słabe lub częściowo zasłonięte. Silnik OCR może w ogóle nie wykryć struktury tabeli, powracając do ogólnego rozpoznawania tekstu. Wstępnie przetwórz zeskanowany obraz przed OCR. Zwiększ kontrast, aby przyciemnić słabe liczby. Zastosuj filtr usuwający plamki, aby usunąć przypadkowe kropki, które silnik OCR może zinterpretować jako kropki dziesiętne lub przecinki.

Jeśli jakość obrazu tabeli jest zbyt niska, aby można było przeprowadzić automatyczne rozpoznawanie OCR, jedyną opcją może być ręczna transkrypcja. Wpisz liczby ręcznie do arkusza kalkulacyjnego, odczytując je ze zeskanowanego obrazu. Jest to powolne, ale zapewnia całkowicie dokładne dane. Kompromis czasowy między ręczną transkrypcją a korektą OCR zależy od rozmiaru tabeli i dokładności OCR. Ręczna transkrypcja małej tabeli ze słabą dokładnością OCR jest szybsza. Duża tabela z dobrą dokładnością OCR pozwala szybciej skorygować wynik OCR.

Wyodrębnianie czystych danych liczbowych ze zeskanowanej tabeli to wieloetapowy proces, który nagradza staranną konfigurację OCR i dokładną weryfikację. Wyodrębnione liczby mogą następnie zostać przekazane do systemów analiz, modelowania lub raportowania, tak jakby zostały utworzone cyfrowo.

WukongPDF zapewnia narzędzia potrzebne do tego przepływu pracy za pośrednictwem platformy opartej na przeglądarce, która działa na wszystkich systemach operacyjnych i urządzeniach.

Techniki opisane w tym artykule można wdrożyć przy użyciu narzędzi PDF dostępnych na większości platform, w tym usług opartych na przeglądarce, aplikacji komputerowych i aplikacji mobilnych.

Przy właściwym podejściu i odpowiedniej konfiguracji to zadanie PDF staje się rutynową operacją, która zapewnia spójne i wiarygodne wyniki dla każdego dokumentu.

Zrozumienie tych pojęć i zastosowanie opisanych tutaj metod pomoże Ci efektywnie obsługiwać ten scenariusz PDF i mieć pewność co do jakości wydruku.

Przepływy pracy i najlepsze praktyki omówione w tym artykule stanowią solidną podstawę do pracy z plikami PDF w tym konkretnym kontekście, zarówno do użytku osobistego, zawodowego, jak i organizacyjnego.

W tym artykule omówiono podstawowe pojęcia i praktyczne kroki potrzebne do skutecznej obsługi tego zadania związanego z plikiem PDF, od początkowej konfiguracji po końcową weryfikację danych wyjściowych.

Podobnie jak w przypadku wielu operacji na dokumentach, jakość wyniku zależy od staranności podjętej podczas konfiguracji i dokładności etapu weryfikacji przed dystrybucją lub archiwizacją ostatecznego dokumentu.

Możliwość niezawodnego wykonania tej operacji jest cennym dodatkiem do każdego obiegu dokumentów, oszczędzając czas i zapewniając profesjonalne wyniki, które dobrze odzwierciedlają osobę i organizację.

Niezależnie od tego, czy wykonujesz tę operację po raz pierwszy, czy udoskonalasz ustalony przepływ pracy, zasady i metody opisane tutaj stanowią jasny i praktyczny przewodnik.

Ekosystem plików PDF stale ewoluuje dzięki regularnie pojawiającym się nowym narzędziom i możliwościom. Bycie na bieżąco z dostępnymi opcjami gwarantuje, że obieg dokumentów pozostanie efektywny.

Czas zainwestowany w opanowanie technik PDF zwraca się wielokrotnie dzięki szybszemu przetwarzaniu dokumentów, mniejszej liczbie błędów i bardziej profesjonalnym wynikom spełniającym potrzeby odbiorców.

W tym artykule przedstawiono kompleksowy przegląd tematu, obejmujący zarówno podstawowe pojęcia, jak i praktyczne techniki potrzebne do osiągnięcia pożądanych rezultatów.

Dzięki tej wiedzy czytelnicy mogą śmiało podejść do zadania i stworzyć dokumenty spełniające profesjonalne standardy jakości i niezawodności.

Metody i podejścia opisane w tym artykule reprezentują aktualne najlepsze praktyki dotyczące obsługi tego aspektu zarządzania dokumentami PDF.

Postępując zgodnie z podanymi tutaj wskazówkami, czytelnicy mogą osiągnąć spójne, wysokiej jakości wyniki, unikając jednocześnie typowych pułapek prowadzących do frustracji i zmarnowanego wysiłku.

Format PDF pozostaje standardem w wymianie dokumentów między branżami i platformami. Opanowanie tych technik zwiększa zarówno produktywność osobistą, jak i możliwości organizacyjne.

Czytelnicy stosujący te techniki przekonają się, że zadania, które kiedyś wydawały się złożone, stają się proste i wykonalne dzięki praktyce i odpowiedniej konfiguracji narzędzi.

Inwestycja w naukę prawidłowej obsługi plików PDF procentuje w niezliczonych zadaniach związanych z dokumentami, czyniąc ją jedną z najbardziej praktycznych umiejętności w nowoczesnym cyfrowym miejscu pracy.

W praktyce operacje na plikach PDF stają się drugą naturą, umożliwiając specjalistom zajmującym się dokumentami skupienie się na treści, zamiast zmagać się z wyzwaniami związanymi z formatem pliku.

Wskazówki zawarte w tym artykule wyposażają czytelników w kompetentne i pewne podejście do tego aspektu pracy z plikami PDF.

Opanowanie umiejętności obsługi plików PDF to inwestycja, która zwraca się z każdym przetworzonym dokumentem i usprawnieniem przepływu pracy.

Dokładna ekstrakcja danych numerycznych ze zeskanowanych tabel przekształca zapisy papierowe w użyteczną informację cyfrową.

Umiejętność ta, gdy zostanie rozwinięta, staje się trwałą i cenną częścią każdego profesjonalnego zestawu narzędzi do tworzenia dokumentów.

Zdobyta tutaj wiedza ma zastosowanie do różnych narzędzi, platform i typów dokumentów, dzięki czemu jest uniwersalnie przydatna dla każdego, kto pracuje z plikami PDF.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →