Tips & Tricks

Jak wyeksportować wyniki OCR z pliku PDF do JSON

Uruchomienie OCR PDF na zeskanowanym dokumencie powoduje utworzenie rozpoznanego tekstu, ale większość narzędzi OCR generuje ten tekst w postaci płaskiego pliku tekstowego lub osadza go z powrotem w pliku PDF. Eksportowanie wyników OCR bezpośrednio do formatu JSON zapewnia uporządkowane dane nadające się do odczytu maszynowego, które można wprowadzić do baz danych, indeksów wyszukiwania, systemów zarządzania treścią i zautomatyzowanych przepływów pracy. Badanie przeprowadzone w 2025 r. przez AIIM International wykazało, że 43 procent organizacji preferuje obecnie formaty danych strukturalnych, takie jak JSON, w przypadku tekstu pochodzącego z dokumentów, ponieważ łatwiej integrują się one z nowoczesnymi aplikacjami w chmurze i potokami sztucznej inteligencji (AIIM, „State of Intelligent Information Management”, 2025).

Najważniejsze wnioski

Eksportowanie wyników OCR do formatu JSON pozwala zachować strukturę rozpoznanego tekstu, w tym numery stron, współrzędne słów i wskaźniki pewności, która jest tracona podczas eksportowania do zwykłego tekstu. Większość nowoczesnych silników OCR natywnie obsługuje dane wyjściowe JSON, ale może być konieczne włączenie tej funkcji w ustawieniach lub wybranie jej z menu formatu eksportu. Wynikowy plik JSON może służyć do wyszukiwania pełnotekstowego, potoków wyodrębniania danych i uczenia modeli uczenia maszynowego w zakresie zawartości dokumentu.

W przypadku programistów integrujących OCR JSON z aplikacjami większość formatów wyjściowych JSON zawiera pole wersji, które identyfikuje wersję schematu. Zawsze zaznacz to pole przed analizą, aby uniknąć przerwania zmian, gdy silnik OCR aktualizuje swój format wyjściowy. Prosta ochrona wersji na początku kodu analizującego zapobiega tajemniczym błędom, gdy struktura JSON zmienia się między wersjami silnika.

How to Export OCR Results From a PDF to JSON

Dlaczego dane wyjściowe JSON są lepsze niż zwykły tekst w wynikach OCR

Zwykły tekst wyjściowy z OCR odrzuca wszystko oprócz samych znaków. Dostajesz słowa, ale tracisz numer strony, na której pojawiło się każde słowo, współrzędne ramki ograniczającej, które informują, gdzie na stronie znajduje się tekst, poziom pewności, który wskazuje, na ile pewny jest silnik OCR w odniesieniu do każdego znaku, oraz wszelkie informacje strukturalne, takie jak podziały akapitów i układy kolumn. JSON zachowuje to wszystko. Plik wyjściowy JSON Skanowany PDF OCR zazwyczaj zawiera tablicę obiektów strony, każdy z tablicą obiektów bloków tekstu, z których każdy zawiera rozpoznany tekst oraz jego położenie, rozmiar i metadane dotyczące pewności.

Struktura ta umożliwia dalszą automatyzację, która jest niemożliwa w przypadku zwykłego tekstu. Skrypt może odczytać plik JSON i wyodrębnić tylko tekst z określonego obszaru każdej strony, takiego jak obszar nagłówka lub kolumna na pasku bocznym. Może odfiltrować wyniki OCR o niskiej pewności, aby uniknąć zanieczyszczania indeksu wyszukiwania zniekształconym tekstem. Może zrekonstruować kolejność czytania układu wielokolumnowego, sortując bloki tekstu według ich współrzędnych Y i X. Żadna z tych operacji nie jest możliwa w przypadku płaskiego pliku tekstowego z OCR.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Krok po kroku: Eksportuj wyniki OCR do JSON

Przed uruchomieniem OCR sprawdź rozdzielczość obrazu zeskanowanego pliku PDF. Większość silników OCR działa najlepiej, gdy obrazy stron wejściowych mają rozdzielczość 300 DPI. Poniżej 200 DPI dokładność rozpoznawania spada zauważalnie. Powyżej 400 DPI czas przetwarzania wzrasta bez znaczącej poprawy dokładności. Jeśli zeskanowany plik PDF zawiera obrazy stron o niskiej rozdzielczości, rozważ zwiększenie ich rozdzielczości do 300 DPI przed uruchomieniem OCR z wyjściem JSON. Dodatkowy etap wstępnego przetwarzania zauważalnie poprawia jakość danych JSON.

Otwórz zeskanowany plik PDF w narzędziu OCR obsługującym ustrukturyzowane dane wyjściowe. Tesseract, najpopularniejszy silnik OCR typu open source, obsługuje dane wyjściowe w formacie JSON za pośrednictwem interfejsu wiersza poleceń i większości aplikacji, które go łączą. W Tesseract dodanie flagi formatu wyjściowego powoduje utworzenie pliku JSON wraz z rozpoznanym tekstem. Komercyjne interfejsy API OCR z Google Cloud Vision, Amazon Texttract i Microsoft Azure Form Recognizer domyślnie zwracają format JSON z rozpoznanym tekstem zorganizowanym według strony, bloku, akapitu, wiersza i słowa.

Po uruchomieniu OCR z włączonym wyjściem JSON otwórz wynikowy plik w edytorze tekstu, aby zrozumieć jego strukturę. JSON będzie zawierał tablice obiektów strony. Każdy obiekt strony zawiera wymiary strony i tablice obiektów blokowych. Każdy blok zawiera rozpoznany tekst, współczynnik pewności zwykle od 0 do 100 oraz współrzędne ramki ograniczającej opisujące położenie bloku na stronie. Znajomość tej struktury pozwala na pisanie prostych skryptów wydobywających dokładnie takie dane, jakich potrzebujesz. Narzędzie OCR WukongPDF zawiera opcję eksportu JSON, która organizuje rozpoznany tekst z numerami stron, wskaźnikami zaufania i danymi pozycyjnymi, więc nie ma potrzeby konfigurowania oddzielnego silnika OCR, aby uzyskać uporządkowane dane wyjściowe.

Wspólne struktury JSON dla danych wyjściowych OCR

Większość wyników OCR w formacie JSON Skanowany plik PDF zawiera także globalną sekcję metadanych u góry pliku, która rejestruje nazwę silnika OCR, wersję, datę przetwarzania oraz język lub języki wykryte w dokumencie. Te metadane są cenne dla ścieżek audytu i debugowania problemów z jakością OCR. Jeśli przetwarzasz dokumenty z wielu źródeł, metadane informują, który silnik wygenerował poszczególne wyniki i czy wersja silnika zmieniła się pomiędzy partiami, co może wyjaśniać różnice w jakości rozpoznawania.

PoleOpisPrzykładowa wartość
stronaNumer strony w dokumencie oryginalnym3
tekstRozpoznana treść tekstowa„Faktura nr 4521”
zaufaniePewność OCR od 0 do 10094,7
bboxObwiednia [x, y, szerokość, wysokość] w pikselach[120, 340, 400, 28]
typ_blokuTyp bloku treści„akapit” lub „stół” lub „linia”
językWykryty język tekstu„pl”

Korzystanie z danych OCR JSON w zautomatyzowanych przepływach pracy

Obsługa błędów warto zaplanować z góry. Przeprowadzenie OCR na stronie o bardzo słabej jakości obrazu może dać wynik zaufania poniżej 50 procent dla większości rozpoznawalnych słów. Twój przepływ pracy powinien definiować minimalny próg ufności, poniżej którego wyniki są oznaczane do przeglądu ręcznego, a nie automatycznie wprowadzane do bazy danych lub indeksu wyszukiwania. Wysyłanie danych wyjściowych o niskim poziomie zaufania zeskanowanego pliku PDF OCR bezpośrednio do systemu produkcyjnego zanieczyszcza dane błędami, których późniejsze usunięcie jest znacznie droższe niż oznaczenie do przeglądu w miejscu wyodrębnienia.

Gdy wyniki OCR zostaną zapisane w formacie JSON, możliwości automatyzacji znacznie się rozszerzają. Typowym wzorcem jest napisanie skryptu, który wyszukuje w folderze nowe zeskanowane pliki PDF, uruchamia OCR z danymi wyjściowymi JSON, analizuje JSON w celu wyodrębnienia określonych pól, takich jak numery faktur lub daty, ze znanych pozycji na stronie, a następnie wstawia te wartości do bazy danych lub arkusza kalkulacyjnego. Ponieważ kod JSON zawiera współrzędne położenia, skrypt wyodrębniania może kierować tekst w określonych regionach strony, niezależnie od ogólnej zawartości dokumentu.

W przypadku aplikacji wyszukujących dane wyjściowe JSON można wprowadzić do indeksu wyszukiwania, takiego jak Elasticsearch lub Algolia. Każda strona staje się dokumentem z możliwością przeszukiwania, a numerem strony jest pole metadanych. Wyniki zaufania pozwalają dostosować trafność wyszukiwania, nadając większą wagę tekstowi OCR o wysokim stopniu pewności. Użytkownicy wyszukujący hasło widzą wyniki uszeregowane według pewności mechanizmu OCR, że dane hasło faktycznie pojawia się na stronie, co pozwala ograniczyć liczbę fałszywych dopasowań spowodowanych błędnie rozpoznanymi znakami.

W przypadku potoków sztucznej inteligencji i uczenia maszynowego standardowym formatem wejściowym jest ustrukturyzowany zeskanowany plik PDF wynik OCR w formacie JSON. Duże modele językowe i systemy rozumienia dokumentów korzystają z reprezentacji JSON

Często zadawane pytania

Jak przechowywać pliki OCR JSON obok oryginalnych plików PDF, aby zapewnić długoterminowy dostęp? Przechowuj pliki JSON w tym samym folderze, co pliki PDF z pasującymi nazwami plików. Na przykład raport-2025.pdf i raport-2025.ocr.json. Ta konwencja nazewnictwa sprawia, że znalezienie wyniku OCR zeskanowanego pliku PDF dla danego pliku PDF jest dla skryptów banalne. W przypadku dużych archiwów rozważ przechowywanie pliku JSON w bazie danych dokumentów obsługującej wyszukiwanie pełnotekstowe, a nie w postaci plików płaskich.

Czy dane wyjściowe JSON z OCR zwiększają rozmiar pliku w porównaniu ze zwykłym tekstem?

Tak, zwykle 3 do 5 razy. W przypadku 10-stronicowego zeskanowanego dokumentu zawierającego 15 KB zwykłego tekstu można utworzyć plik JSON o rozmiarze od 50 do 75 KB. Dodatkowy rozmiar wynika z metadanych strukturalnych: numerów stron, ramek ograniczających i wskaźników pewności dla każdego rozpoznanego słowa. W większości zastosowań ten wzrost rozmiaru jest nieistotny. Tylko w przypadku bardzo dużej skali, takiej jak miliony stron, warto zaplanować przechowywanie danych.

Czy mogę przekonwertować istniejący zwykły tekst zeskanowany plik PDF wynik OCR do formatu JSON?

Nie sensownie. Po spłaszczeniu wyników OCR do zwykłego tekstu dane dotyczące pozycji i wskaźniki pewności zostaną utracone i nie będzie można ich odtworzyć na podstawie samego tekstu. Jeśli potrzebujesz uporządkowanych danych OCR z wcześniej przetworzonych dokumentów, najbardziej niezawodnym podejściem jest ponowne uruchomienie OCR na oryginalnych zeskanowanych plikach PDF z włączoną funkcją wyjścia JSON.

Które silniki OCR generują najbardziej przydatne dane wyjściowe JSON?

Oparte na chmurze usługi OCR oferowane przez Google, Amazon i Microsoft zazwyczaj generują najbardziej szczegółowe dane wyjściowe w formacie JSON z ramkami ograniczającymi na poziomie słów i wskaźnikami zaufania. Tesseract tworzy solidny JSON na poziomie linii i słowa. Najlepszy wybór zależy od ilości danych, budżetu i tego, czy wymagania dotyczące prywatności umożliwiają wysyłanie dokumentów do usługi w chmurze.

Czy mogę przekonwertować dane wyjściowe OCR JSON z powrotem na plik PDF z możliwością przeszukiwania? Tak, chociaż proces ten wymaga biblioteki generowania plików PDF, która może umieszczać obiekty tekstowe pod określonymi współrzędnymi. Dane ramki ograniczającej w wynikach JSON dokładnie informują, gdzie na stronie znajduje się każde słowo. Jest to odwrotność procesu wyodrębniania i jest przydatna, gdy trzeba utworzyć plik PDF z możliwością przeszukiwania na podstawie poprawionego tekstu OCR po naprawieniu błędów rozpoznawania w danych JSON.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →