Uruchomienie OCR PDF na zeskanowanym dokumencie powoduje wygenerowanie rozpoznanego tekstu. Dla większości użytkowników celem jest plik PDF z możliwością przeszukiwania. Kiedy jednak rozpoznany tekst musi zostać zaimportowany do bazy danych, zindeksowany przez wyszukiwarkę lub przeszukany w aplikacji, standardowe formaty wyjściowe OCR nie są idealne. Eksportowanie wyników OCR do ustrukturyzowanego formatu zoptymalizowanego pod kątem importowania i indeksowania baz danych zmienia zeskanowane archiwum dokumentów w dane, które można przeszukiwać i integrować z systemami biznesowymi.
Najważniejsze wnioski
Formaty wyjściowe OCR gotowe do obsługi baz danych obejmują CSV dla danych tabelarycznych, JSON dla ustrukturyzowanej zawartości dokumentu i XML dla dokumentów, które muszą zachować strukturę hierarchiczną. Kluczowa różnica w porównaniu ze standardowymi wynikami OCR polega na tym, że formaty zorientowane na bazę danych obejmują spójne mapowanie pól, wskaźniki typów danych i obsługę błędów w przypadku wyników rozpoznawania o niskiej pewności. Przygotowanie pliku PDF przed OCR, obejmujące prostowanie, zwiększanie kontrastu i dostosowywanie rozdzielczości, znacznie poprawia jakość eksportowanych danych.

Wybierz odpowiedni format wyjściowy dla swojej bazy danych
Dane wyjściowe w formacie CSV są idealne w przypadku zeskanowanych formularzy i tabel, gdzie każdy dokument odpowiada jednemu wierszowi w bazie danych. Każde pole formularza staje się kolumną, a każdy zeskanowany dokument staje się wierszem. Import plików CSV bezpośrednio do arkuszy kalkulacyjnych i relacyjnych baz danych bez konwersji. Ograniczeniem jest to, że CSV nie może reprezentować danych hierarchicznych. Jeśli zeskanowany dokument ma zagnieżdżone struktury, np. fakturę z wieloma pozycjami, plik CSV wymusza spłaszczenie struktury lub podzielenie wyników na wiele plików.
Dane wyjściowe JSON w naturalny sposób obsługują struktury zagnieżdżone i zmienne. Faktura zawierająca sekcję nagłówka i wiele pozycji jest reprezentowana jako obiekt JSON z tablicą nagłówków i tablicą pozycji. Import JSON do baz danych dokumentów, takich jak MongoDB, indeksów wyszukiwania, takich jak Elasticsearch, i większości nowoczesnych platform aplikacji. Potok Wyodrębnij dane PDF z OCR do JSON do bazy danych to najpopularniejsza architektura aplikacji do rozumienia dokumentów w 2025 r. Struktura JSON zachowuje również wskaźniki pewności OCR, co pozwala zapytaniu bazy danych automatycznie odfiltrować wyniki o niskim poziomie pewności.
Dane wyjściowe w formacie XML są preferowane, gdy zeskanowane dokumenty muszą być zgodne ze schematem będącym standardem branżowym. Przetwarzanie dokumentów prawnych, medycznych i rządowych często wymaga danych wyjściowych XML, które sprawdzają poprawność określonej definicji typu dokumentu. Format XML obsługuje zarówno strukturę, jak i metadane w jednym pliku i jest wymaganym formatem wejściowym w wielu korporacyjnych systemach zarządzania treścią. Narzędzie OCR WukongPDF obsługuje formaty wyjściowe CSV, JSON i XML, dzięki czemu możesz wybrać format pasujący do potoku importu bazy danych bez przetwarzania końcowego.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Przetwarzaj wstępnie zeskanowane pliki PDF w celu uzyskania lepszej dokładności OCR
W przypadku dokumentów, które pierwotnie zostały wydrukowane na kolorowym papierze lub pożółkły ze starości, konwersja skanu na czysto czarno-biały przed OCR może znacząco poprawić dokładność rozpoznawania. Silnik OCR ma trudności z oddzieleniem tekstu od kolorowego lub teksturowanego tła. Konwersja do czerni i bieli z progiem, który zachowuje tekst przy usuwaniu tła, zapewnia silnikowi OCR czysty sygnał wejściowy. Większość oprogramowania do skanowania i edytorów obrazów umożliwia konwersję obrazu czarno-białego z regulowanym progiem. Przetestuj kilka stron przy różnych progach, aby znaleźć ustawienie zapewniające najczystszy tekst.
Import bazy danych wzmacnia błędy OCR. Błędnie odczytany znak w przeszukiwalnym pliku PDF to niewielka niedogodność. Ten sam błąd w polu bazy danych może spowodować, że rekord będzie niemożliwy do znalezienia, błędnie sklasyfikowany lub dopasowany do niewłaściwej jednostki. Inwestowanie czasu w wstępne przetwarzanie zeskanowanych dokumentów przed OCR znacznie zmniejsza poziom błędów. Trzy najbardziej wpływowe etapy przetwarzania wstępnego to prostowanie stron obróconych nawet o kilka stopni, zwiększanie kontrastu, dzięki czemu tekst wyraźnie wyróżnia się na tle, oraz zapewnienie rozdzielczości skanowania wynoszącej co najmniej 300 DPI.
Prostowanie koryguje strony zeskanowane pod niewielkim kątem. Nawet obrót o dwa stopnie może spowodować, że silniki OCR błędnie odczytają znaki na krawędziach linii. Większość narzędzi OCR obejmuje funkcję automatycznego prostowania, jednak warto sprawdzić, czy została ona poprawnie aktywowana w dokumentach. Otwórz kilka stron przetworzonych przez OCR i sprawdź, czy rozpoznane pola tekstowe są wyrównane z widocznym tekstem. Niedopasowane pola wskazują na awarię prostowania, która spowoduje wygenerowanie zbędnych danych w bazie danych. Zwiększenie kontrastu jest szczególnie ważne w przypadku dokumentów skanowanych ze starego lub pożółkłego papieru. Zwiększenie kontrastu między tekstem a tłem przed OCR może poprawić dokładność rozpoznawania o 10 do 20 procent w przypadku trudnych skanów.
Mapuj pola wyjściowe OCR do kolumn bazy danych
W przypadku dokumentów, w których położenie pól znacznie się różni na poszczególnych stronach, kotwice słów kluczowych są bardziej niezawodne niż stałe współrzędne. Zdefiniuj reguły wyodrębniania na podstawie tekstu poprzedzającego dane docelowe lub następującego po nich, a nie na podstawie ich położenia. Reguła typu „wyodrębnij liczbę po etykiecie Suma faktury” działa niezależnie od tego, gdzie ta etykieta pojawia się na stronie. Ekstrakcja oparta na słowach kluczowych wymaga, aby dane wyjściowe OCR zawierały pełny rozpoznany tekst w jego oryginalnym porządku przestrzennym, który jest zachowywany w wynikach JSON, a zwykle nie w wynikach CSV.
Luką pomiędzy danymi wyjściowymi OCR a importem bazy danych jest mapowanie pól. OCR generuje tekst uporządkowany według pozycji strony. Baza danych oczekuje tekstu zorganizowanego według nazwy pola. Wypełnienie tej luki wymaga zdefiniowania mapowania, które w rzeczywistości oznacza, że tekst w prawym górnym rogu pierwszej strony jest numerem faktury i trafia do kolumny numer_faktury. W przypadku formularzy strukturalnych, których układ jest spójny we wszystkich dokumentach, zdefiniuj mapowanie jednorazowo, używając współrzędnych pozycyjnych lub kotwic słów kluczowych.
W przypadku dokumentów częściowo ustrukturyzowanych, których układ jest zmienny, zamiast mapowania pozycyjnego należy używać mapowania opartego na słowach kluczowych. Zdefiniuj reguły, takie jak „liczba następująca po tekście Nr faktury to numer faktury, niezależnie od jej pozycji na stronie”. Mapowanie oparte na słowach kluczowych jest bardziej niezawodne w przypadku różnych odmian układu, ale wymaga, aby dane wyjściowe OCR zawierały rozpoznany tekst z metadanymi pozycyjnymi. Jest to kolejny powód, aby w przypadku dokumentów o zmiennym układzie wybierać dane wyjściowe w formacie JSON lub XML zamiast CSV. Metadane pozycyjne w formatach JSON i XML umożliwiają wyodrębnianie pól w oparciu o słowa kluczowe. W przypadku dużych projektów importu baz danych, potok Skanowany plik PDF WukongPDF OCR zawiera konfigurowalne mapowanie pól, które generuje plik CSV lub JSON o spójnej strukturze, gotowy do bezpośredniego wykorzystania w bazie danych.
Obsługuj wskaźniki zaufania OCR podczas importu baz danych
W przypadku aplikacji bazodanowych, w których dokładność ma kluczowe znaczenie, należy wdrożyć dwuprzebiegowy przepływ pracy OCR. Podczas pierwszego przebiegu wszystkie dokumenty są przetwarzane przy standardowych ustawieniach. Dokumenty z wynikiem zaufania poniżej progu są oznaczane i ponownie przetwarzane przy użyciu ulepszonych ustawień, takich jak wyższa rozdzielczość, prostowanie i regulacja kontrastu. Podejście dwuprzebiegowe skupia dodatkowy czas przetwarzania na dokumentach, które go potrzebują, zamiast spowalniać całą partię.
Każdy wynik OCR ma wskaźnik pewności, zazwyczaj liczbę od 0 do 100, wskazującą pewność silnika, że rozpoznany tekst odpowiada treści znajdującej się na stronie. Importując wyniki OCR do bazy danych, określ próg ufności. Wyniki powyżej progu są importowane automatycznie. Wyniki poniżej progu są oznaczane do sprawdzenia przez człowieka. Próg zależy od kosztu błędów w Twojej aplikacji. Indeks wyszukiwania może tolerować niższy próg, ponieważ użytkownicy mogą przeglądać wyniki i ignorować nieprawidłowe dopasowania. Finansowa baza danych, w której liczby są bezpośrednio uwzględniane w obliczeniach, wymaga wysokiego progu, zwykle 95 lub więcej.
Przechowuj wynik zaufania wraz z rozpoznanym tekstem w bazie danych. Pole takie jak faktura_total o wartości 250,00 i poziomie ufności 98 jest godne zaufania. Tę samą wartość z pewnością 62 należy traktować jako tymczasową. Aplikacje wysyłające zapytania do bazy danych mogą używać wyniku zaufania do wyświetlania wartości o niskim poziomie zaufania za pomocą wskaźnika wizualnego, takiego jak żółte podświetlenie lub ikona ostrzeżenia, ostrzegającego użytkowników o konieczności sprawdzenia danych przed skorzystaniem z nich. Wynik pewności dodaje wymiar jakości danych, którego nie jest w stanie zapewnić druk tekstowy.
Często zadawane pytania
Jak powinienem postępować z plikami PDF, które zawierają zeskanowane strony z natywnymi stronami cyfrowymi podczas przygotowywania do importu bazy danych? Przetwórz zeskanowane strony osobno za pomocą OCR, a strony cyfrowe za pomocą ekstrakcji tekstu, a następnie połącz wyniki. Strony cyfrowe nie wymagają OCR, a uruchomienie na nich OCR może w rzeczywistości pogorszyć jakość tekstu, wprowadzając błędy rozpoznawania tam, gdzie oryginalny tekst cyfrowy był idealnie dokładny. Większość narzędzi do przetwarzania wsadowego potrafi wykryć, które strony są skanowane, a które cyfrowe, i automatycznie kieruje je do odpowiedniej ścieżki przetwarzania.
Ile zeskanowanych stron mogę przetworzyć w ramach importu bazy danych w jednej partii?
Nowoczesne silniki OCR mogą przetwarzać tysiące stron na godzinę na standardowym sprzęcie. Praktycznym ograniczeniem nie jest prędkość OCR, ale czas walidacji. Zaplanuj czas na sprawdzenie próbki wyników przed zaimportowaniem pełnej partii do produkcyjnej bazy danych. 5-procentowy losowy przegląd próbek wyłapuje systematyczne błędy OCR, które mogłyby mieć wpływ na całą partię.
Czy powinienem przechowywać oryginalny zeskanowany plik PDF wraz z wyodrębnionymi danymi w bazie danych?
Tak, jeśli baza danych to obsługuje. Przechowywanie źródłowego pliku PDF połączonego z wyodrębnionymi danymi zapewnia ścieżkę audytu. Gdy pojawia się pytanie dotyczące jakości danych, użytkownicy mogą otworzyć oryginalny skan i zweryfikować wyodrębnioną wartość z dokumentem źródłowym. To powiązanie między wyodrębnionymi danymi a dokumentem źródłowym jest wymagane w celu zapewnienia zgodności w wielu regulowanych branżach.
Czy OCR obsługuje tekst pisany odręcznie przy imporcie bazy danych?
Rozpoznawanie pisma ręcznego uległo znacznej poprawie, ale pozostaje mniej dokładne niż rozpoznawanie tekstu drukowanego. W przypadku importu bazy danych pola napisane odręcznie powinny być kierowane do weryfikacji ręcznej, a nie importowane automatycznie, chyba że charakter pisma jest ograniczony, np. liczby wpisane w poszczególnych polach formularza. Pismo odręczne w dowolnym formacie na dokumentach nieustrukturyzowanych nie jest wystarczająco niezawodne, aby w większości aplikacji można było zautomatyzować import bazy danych.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
