
Dlaczego OCR ma problemy z nakładającym się tekstem przypisów i zawartością marginesów
Mechanizmy optycznego rozpoznawania znaków działają najlepiej, gdy tekst jest umieszczony w czystych, przewidywalnych blokach ze stałymi odstępami między wierszami i wyraźnym oddzieleniem obszarów zawartości. Operacja OCR PDF na standardowym liście biznesowym lub nowej stronie zwykle daje dokładne wyniki, ponieważ tekst składa się z uporządkowanych akapitów z szerokimi marginesami ze wszystkich stron. Artykuły akademickie stanowią zasadniczo trudniejszy problem, ponieważ ich układ celowo upakuje wiele odrębnych strumieni tekstu w bliskiej odległości fizycznej, przy czym przypisy, cytaty na marginesach i tekst główny często stykają się lub nakładają na swoich granicach.
Głównym wyzwaniem jest segmentacja, czyli etap, w którym silnik OCR dzieli obraz strony na obszary tekstowe przed podjęciem próby rozpoznania znaków. Kiedy numer referencyjny przypisu w indeksie górnym w tekście głównym znajduje się bezpośrednio nad linią oddzielającą przypis, a linia ta znajduje się bezpośrednio nad samym tekstem przypisu i jest pisana mniejszą czcionką, algorytm segmentacji musi zdecydować, gdzie kończy się jeden obszar tekstu, a zaczyna następny. Błędna decyzja dotycząca segmentacji skutkuje w tym przypadku błędami rozpoznawania, ponieważ znaki z dwóch różnych strumieni tekstu są wprowadzane do mechanizmu rozpoznawania tak, jakby były pojedynczą ciągłą linią. Wynik brzmi jak bełkot mieszający słowa z tekstu podstawowego z fragmentami przypisów.
Cytaty na marginesie dodają trzeci strumień tekstu do problemu. W artykułach humanistycznych sporządzonych w stylu chicagowskim lub w dokumentach prawnych w formacie Bluebook notatki na marginesach, numery wierszy lub równoległe cytaty są umieszczane pionowo lub poziomo wzdłuż głównej kolumny tekstu. Te elementy marginesów są często drukowane z mniejszą czcionką, czasami 7 lub 8 punktów, i mogą zawierać kursywę lub czcionki zagęszczone, z którymi silniki OCR już mają problemy przy normalnych rozmiarach. Kiedy tekst na marginesie fizycznie styka się z tekstem zasadniczym, co zdarza się często w przypadku ściśle sformatowanych czasopism z wąskimi odstępami, wyzwanie związane z segmentacją staje się trójstronne, a nie dwukierunkowe.
Jakość papieru źródła Skanowany plik PDF również zwiększa trudność OCR. Wiele prac akademickich jest skanowanych z oprawionych tomów, gdzie krzywizna strony w pobliżu grzbietu powoduje wygięcie i zniekształcenie tekstu. Przypisy na dole strony są częścią najbardziej dotkniętą skrzywieniem grzbietu, ponieważ znajdują się najbliżej oprawy. Połączenie fizycznego zniekształcenia spowodowanego zakrzywioną stroną, małego rozmiaru czcionki i bliskości powyższego tekstu tworzy idealną burzę niekorzystnych warunków dla dokładności OCR.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Wstępne przetwarzanie zeskanowanej strony w celu oddzielenia nakładających się obszarów tekstowych
Najskuteczniejszym sposobem na poprawę dokładności OCR na stronach akademickich z nakładającymi się elementami tekstowymi jest wstępne przetworzenie obrazu strony, zanim dotrze on do silnika OCR. To wstępne przetwarzanie oddziela różne strumienie tekstu, dzięki czemu silnik nigdy nie musi podejmować niejednoznacznych decyzji dotyczących segmentacji.
Zacznij od wyprostowania zeskanowanej strony, aby upewnić się, że wszystkie linie tekstu układają się idealnie poziomo. Nawet nachylenie oryginalnego skanu o jeden stopień może spowodować, że tekst przypisu dolnego przesunie się do obszaru tekstu podstawowego na krawędziach strony, tworząc fałszywe nakładki, których nie byłoby na prawidłowo wyrównanej stronie. Większość programów do skanowania dokumentów umożliwia automatyczne prostowanie, ale w przypadku prac akademickich skanowanych z oprawionych woluminów ręczne prostowanie z linią referencyjną narysowaną wzdłuż linii bazowej tekstu podstawowego daje dokładniejsze wyniki niż korekcja automatyczna.
Po prostowaniu następnym krokiem jest maskowanie regionu. Używając edytora obrazów lub dedykowanego narzędzia do wstępnego przetwarzania OCR, narysuj poziomą linię oddzielającą pomiędzy obszarem tekstu podstawowego a obszarem przypisów. Ta linia informuje dalszy silnik OCR, aby traktował wszystko powyżej jako jeden obszar tekstowy, a wszystko poniżej jako oddzielny obszar tekstowy. Na stronach, na których znajdują się przypisy, separator powinien znajdować się tuż nad regułą przypisu, krótką poziomą linią, która tradycyjnie oddziela tekst podstawowy od przypisów w drukowanych pracach akademickich. Na stronach bez przypisów nie jest potrzebny żaden separator.
W przypadku cytatów na marginesach i numerów wierszy równoważnym podejściem jest maskowanie pionowe. Narysuj pionowy separator między tekstem na marginesie a główną kolumną tekstu. Na stronach zawierających zarówno numery wierszy na lewym marginesie, jak i cytaty na prawym marginesie, obie strony wymagają pionowych separatorów. Celem jest podzielenie strony na prostokątne obszary, z których każdy zawiera dokładnie jeden strumień tekstu. Następnie silnik OCR przetwarza każdy region niezależnie i generuje osobne rozpoznane dane wyjściowe, które po zakończeniu rozpoznawania można ponownie złożyć we właściwej kolejności czytania.
Konfigurowanie ustawień OCR dla wielostrumieniowych stron akademickich
Większość profesjonalnych silników OCR udostępnia ustawienia, które pomagają w układach stron z wieloma kolumnami i wieloma strumieniami. Włączenie automatycznej analizy układu jest punktem wyjścia, ale w przypadku stron akademickich zawierających strumienie tekstu z bliskiej odległości ręczna konfiguracja stref daje lepsze wyniki niż w pełni automatyczna analiza.
Zdefiniuj oddzielne strefy rozpoznawania dla tekstu podstawowego, obszaru przypisów i każdego obszaru tekstu na marginesie. W każdej strefie ustaw odpowiedni język, oczekiwany zakres wielkości czcionki i orientację tekstu. W strefach tekstu podstawowego należy spodziewać się tekstu o długości od 10 do 12 punktów w orientacji poziomej od lewej do prawej. W strefach przypisów należy spodziewać się tekstu o długości od 8 do 10 punktów, nadal poziomego, ale ze świadomością, że tekst przypisów często zawiera adresy URL, DOI i ciągi cytatów, które mogą dezorientować modele językowe oczekujące naturalnej prozy.
W szczególności dla strefy tekstu podstawowego włącz ustawienie ignorujące indeks górny i dolny na potrzeby segmentacji linii. Numery referencyjne przypisów w indeksie górnym i wykładniki matematyczne są zazwyczaj mniejsze i podwyższone powyżej linii bazowej, co powoduje błędy w obliczeniach wysokości linii, jeśli silnik traktuje je jako część normalnej linii tekstu. Ignorowanie położenia indeksu górnego na potrzeby segmentacji powoduje, że linie tekstu głównego pozostają nienaruszone, natomiast znaczniki przypisów dolnych są rozpoznawane jako oddzielne, małe elementy, które nie wpływają na granice linii.
Jakość wydruku z PDF do Tekst znacznie się poprawia, gdy wynik rozpoznawania każdej strefy jest zapisywany w oddzielnym pliku tekstowym lub w oddzielnej zaznaczonej sekcji w połączonym wyniku. Dzięki temu wynikowi oddzielonemu strefami można łatwo sprawdzić, czy tekst podstawowy nie wszedł w tekst przypisu i czy cytaty na marginesach pojawiają się w osobnej, wyraźnie oznaczonej sekcji wyjściowej, a nie przeplatane z główną treścią.
Czyszczenie po rozpoznaniu w celu akademickiego wyniku OCR
Nawet przy starannym przetwarzaniu wstępnym i konfiguracji stref niektóre błędy rozpoznawania są nieuniknione na gęsto upakowanych stronach akademickich. Ustrukturyzowany proces czyszczenia po rozpoznaniu wychwytuje i koryguje te resztkowe błędy, zanim tekst trafi do ostatecznego dokumentu.
Uruchom sprawdzanie pisowni tylko w tekście wyjściowym, ze słownikiem sprawdzania pisowni ustawionym na podstawowy język dokumentu. Wyrazy oznaczone jako błędnie zapisane w tekście głównym, które okazują się być poprawnie napisane w treści przypisu, są wyraźnym sygnałem, że granica strefy tekstu podstawowego była zbyt obszerna i przechwyciła tekst przypisu. Dostosuj granicę strefy dla tych stron i ponownie uruchom rozpoznawanie, zamiast ręcznie edytować fragmenty przypisów.
W przypadku tekstu przypisu dolnego sprawdź, czy każdy przypis zaczyna się od oczekiwanego numeru referencyjnego i czy tekst przypisu przepływa w sposób ciągły, bez przeplatanych fragmentów tekstu podstawowego. Typowym wzorcem błędu po rozpoznaniu są linie tekstu głównego pojawiające się pośrodku tekstu przypisu, w których kolumna tekstu głównego sięga niżej na stronie niż przewidywana granica strefy. Przeglądanie oryginalnego obrazu strony wraz z rozpoznanym tekstem przypisu pozwala szybko wykryć te wtargnięcia, ponieważ temat zdania nagle zmienia się z tematu akademickiego na niepowiązany temat akapitu głównego.
Narzędzie OCR WukongPDF obsługuje oparte na strefach rozpoznawanie złożonych układów stron, w tym wielokolumnowych artykułów akademickich z przypisami i zawartością marginesów. Zdefiniowanie ustawień języka, zakresu rozmiaru czcionki i orientacji tekstu dla każdej strefy przed rozpoczęciem przebiegu rozpoznawania zapewnia dokładniejsze wyniki OCR PDF niż przetwarzanie w jednej strefie na tych samych stronach, a oddzielony format wyjściowy ułatwia weryfikację po rozpoznaniu.
Obsługa przypadków specjalnych: notacja matematyczna, pisma inne niż łacińskie i języki mieszane
Prace akademickie z dziedzin STEM dodają notację matematyczną do wyzwania związanego z nakładaniem się tekstu. Równania i formuły przeplatane tekstem podstawowym powodują dodatkową złożoność segmentacji, ponieważ notacja matematyczna wykorzystuje symbole, litery greckie i formatowanie dwuwymiarowe, takie jak ułamki zwykłe i indeksy górne, które nie podlegają tym samym zasadom układu co tekst prozatorski. Silniki OCR przeznaczone do tekstu dokumentu słabo radzą sobie z zapisem matematycznym, a silniki zaprojektowane do matematyki słabo radzą sobie z tekstem dokumentu.
Najbardziej praktycznym podejściem do stron z mieszaną matematyką i prozą jest strategia dwuprzebiegowego OCR. W pierwszym przebiegu używany jest silnik zoptymalizowany pod kątem dokumentu, który rozpoznaje wszystkie obszary tekstu prozatorskiego, w tym tekst podstawowy, przypisy i cytaty na marginesach. Drugi przebieg wykorzystuje silnik rozpoznawania matematycznego w określonych obszarach strony zawierających równania. Połączenie dwóch wyników w połączony dokument, który zachowuje zarówno dokładność pisowni mechanizmu dokumentu, jak i dokładność formuł silnika matematycznego, daje najbardziej wiarygodny wynik ogólny.
W przypadku artykułów zawierających kombinację alfabetu łacińskiego i innego niż łaciński, takich jak artykuły w języku angielskim z cytatami w przypisach w języku arabskim, chińskim lub cyrylicą, skonfiguruj każdą strefę rozpoznawania za pomocą prawidłowego pisma podstawowego. W strefie tekstu podstawowego używany jest podstawowy język dokumentu. Strefy przypisów, które zawierają fragmenty pisma innego niż łacińskie, mogą wymagać konfiguracji rozpoznawania wielu pism, która umożliwia przełączanie między pismami w obrębie jednego obszaru tekstu.
Poniższa tabela podsumowuje zalecane konfiguracje stref OCR dla różnych regionów stron w artykułach akademickich.
| Region strony | Oczekiwany rozmiar czcionki | Orientacja | Ustawienia specjalne |
|---|---|---|---|
| Tekst treści | 10-12 pkt | Poziomy | Ignoruj indeks górny przy segmentacji linii |
| Przypisy | 8-10 pkt | Poziomy | Wiele skryptów, jeśli cytaty zawierają tekst inny niż łaciński |
| Lewy margines (numery linii) | 7-9 pkt | Poziomo lub pionowo | Wyodrębnij jako osobne wyjście; nie łącz się z ciałem |
| Prawy margines (cytowania) | 7-9 pkt | Poziomy | Wyodrębnij jako osobne wyjście |
| Równania/wzory | Zmienny | Poziomy z układem 2D | Użyj silnika obsługującego matematykę w drugim przebiegu |
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
