Tips & Tricks

Jak OCR pliku PDF z kierunkiem tekstu w pionie lub od prawej do lewej

Standardowe silniki OCR opierają się na podstawowym założeniu: tekst przebiega poziomo od lewej do prawej strony. To założenie sprawdza się w przypadku języka angielskiego, hiszpańskiego, francuskiego, niemieckiego i większości języków europejskich. Całkowicie się to nie sprawdza w przypadku tekstu japońskiego ustawionego pionowo w tradycyjnych kolumnach, w przypadku chińskich znaków, w których znaki układają się od góry do dołu, oraz w przypadku dokumentów arabskich i hebrajskich, w których tekst przepływa od prawej do lewej. Uruchomienie standardowego OCR na tych dokumentach daje wynik, w którym znaki są rozpoznawane indywidualnie, ale złożone w niewłaściwej kolejności, co czyni wynik bezużytecznym.

Zdolność silników OCR PDF do obsługi niestandardowych wskazówek tekstowych znacznie się poprawiła dzięki najnowszej generacji systemów rozpoznawania opartych na sztucznej inteligencji. Silniki te wykrywają orientację tekstu przed próbą rozpoznania, identyfikują kierunek czytania i rekonstruują logiczną kolejność czytania niezależnie od układu wizualnego. W przypadku dokumentów zawierających mieszane wskazówki tekstowe, takich jak artykuł w języku japońskim zawierający poziome cytaty w języku angielskim, mechanizm przełącza tryby w połowie strony.

How to OCR a PDF With Vertical or Right-to-Left Text Direction

Jak silniki OCR wykrywają i obsługują kierunek tekstu

Nowoczesne silniki OCR rozpoczynają się od etapu analizy układu, który identyfikuje obszary tekstu, określa ich orientację i klasyfikuje je według kierunku czytania. W przypadku tekstu poziomego silnik wykrywa linię bazową i grupuje znaki wzdłuż niej. W przypadku tekstu pionowego silnik wykrywa oś pionową i grupuje znaki w kolumnach. W przypadku tekstu pisanego od prawej do lewej silnik identyfikuje dominujący zestaw znaków i odwraca domyślną kolejność słów od lewej do prawej.

Wykrywanie kierunku tekstu opiera się na kilku sygnałach. Obecność określonych zakresów znaków Unicode wskazuje prawdopodobne języki i ich typowe kierunki tekstu. Dowodem układu jest układ przestrzenny wykrytych znaków, niezależnie od tego, czy tworzą one poziome linie, czy pionowe kolumny. Współczynnik proporcji obwiedni znaków zapewnia trzeci sygnał: znaki łacińskie są zazwyczaj szersze niż wysokie, podczas gdy znaki CJK są w przybliżeniu kwadratowe, a znaki arabskie łączą się poziomo w sposób ujawniający kierunek czytania.

Najbardziej niezawodne silniki OCR łączą wszystkie trzy typy sygnałów. Dokument zawierający zarówno alfabet arabski, co oznacza czytanie od prawej do lewej, jak i alfabet łaciński, co oznacza czytanie od lewej do prawej, wymaga, aby silnik analizował każdy obszar tekstu niezależnie. Prawidłowo skonfigurowany potok Wyodrębnij dane PDF dla dokumentów wielojęzycznych obejmuje wykrywanie kierunku w poszczególnych regionach, a nie stosowanie jednego kierunku do całej strony.

Każdy system zapisu wymaga zasadniczo innej konfiguracji OCR.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Ustawienia OCR dla tekstu pionowego w języku japońskim, chińskim i koreańskim

Japoński tekst pionowy, zwany tategaki, jest najpopularniejszym we współczesnym systemie pisma pionowego. Pojawia się w powieściach, gazetach, tradycyjnych dokumentach i oficjalnej korespondencji. W języku japońskim pionowym znaki czytane są od góry do dołu, a kolumny przesuwają się po stronie od prawej do lewej. Liczby i słowa zapisane w alfabecie łacińskim osadzone w pionowym tekście japońskim można obracać lub ustawiać poziomo w obrębie przepływu pionowego.

Aby uzyskać pionowy tekst japoński w trybie OCR, wybierz silnik rozpoznawania, który wyraźnie obsługuje tategaki. Silniki OCR ogólnego przeznaczenia mogą poprawnie wykrywać znaki, ale wyświetlają je w kolejności poziomej od lewej do prawej, co powoduje powstawanie śmieci. Specyficzne dla Japonii silniki OCR rozpoznają kolejność odczytu opartą na kolumnach i tekst wyjściowy, który można odczytać w sposób naturalny. Tesseract, silnik OCR typu open source, dodał ulepszoną pionową obsługę języka japońskiego w wersji 5 i obecnie oferuje ją kilka komercyjnych silników.

W przypadku chińskiego tekstu pionowego, który pojawia się w tradycyjnych publikacjach, kaligrafii i niektórych formalnych dokumentach, wyzwanie związane z rozpoznawaniem jest podobne, ale zestaw znaków jest większy. W języku chińskim uproszczonym powszechnie używanych jest około 7 000 znaków, podczas gdy w języku chińskim tradycyjnym ponad 13 000. Silnik OCR musi nie tylko wykryć układ pionowy, ale także rozróżnić wizualnie podobne znaki, które różnią się jedynie szczegółami obrysu.

Koreański tekst pionowy jest rzadkością we współczesnych dokumentach, ale pojawia się w tekstach historycznych i niektórych tradycyjnych publikacjach. Alfabet koreański, Hangul, składa pojedyncze litery w bloki sylab, a przy pisaniu pionowym bloki te są ułożone od góry do dołu. Silniki OCR obsługujące koreański tekst pionowy muszą rozpoznawać strukturę bloków sylab, a także poszczególne elementy literowe w każdym bloku.

Ustawienia OCR dla tekstu pisanego od prawej do lewej w języku arabskim, hebrajskim i perskim

Arabski OCR stwarza wyjątkowe wyzwania wykraczające poza kierunek tekstu. Arabski jest pismem kursywnym, w którym większość liter łączy się z sąsiadami, a kształt litery zmienia się w zależności od jej pozycji w słowie: początkowy, środkowy, końcowy lub izolowany. Silnik OCR musi rozpoznać te formy kontekstowe i przypisać je do prawidłowego abstrakcyjnego znaku. Brakujące połączenia lub fałszywe połączenia między literami powodują błędy rozpoznawania, które są charakterystyczne dla pisma kursywnego.

W przypadku wybrania hebrajskiego OCR skrypt nie jest pisany kursywą, ale zawiera punkty samogłoskowe zwane niqqud, które pojawiają się w postaci kropek i kresek powyżej, poniżej lub wewnątrz liter. Te znaczniki samogłosek są małe, zwykle mają od 2 do 4 pikseli na zeskanowanym obrazie i łatwo je zgubić podczas binaryzacji. Silnik OCR, który nie obsługuje bezpośrednio niqqud, rozpozna spółgłoski poprawnie, ale pominie znaki samogłosek, tworząc tekst zrozumiały dla ludzkiego czytelnika, ale technicznie niekompletny.

W języku perskim i urdu używane są rozszerzone wersje pisma arabskiego z dodatkowymi znakami. Silnik OCR przeszkolony wyłącznie w języku arabskim pominie te dodatkowe znaki lub błędnie rozpozna je jako podobne litery arabskie. Wybierając silnik OCR dla tych języków, sprawdź, czy zawiera on konkretną listę obsługi dokładnego języka i wariantu pisma używanego w dokumencie, a nie tylko ogólnego pisma arabskiego.

Obsługa dokumentów mieszanych

W wielu dokumentach z prawdziwego świata na tej samej stronie znajduje się wiele kierunków tekstu. Japoński artykuł techniczny może zawierać pionowy japoński tekst, poziome podpisy pod rysunkami w języku angielskim i równania matematyczne, które podlegają własnym zasadom układu. Arabski list biznesowy może zawierać angielską nazwę firmy i blok adresowy w formacie od lewej do prawej, nad tekstem pisanym od prawej do lewej.

W przypadku dokumentów mieszanych etap wstępnego przetwarzania OCR ma kluczowe znaczenie. Dokument należy podzielić na obszary tekstowe, a każdy region musi zostać niezależnie sklasyfikowany pod kątem kierunku tekstu przed rozpoczęciem rozpoznawania. Ręczny wybór regionu często daje lepsze wyniki niż automatyczna segmentacja w przypadku złożonych układów. Narysuj ramki ograniczające wokół każdego obszaru tekstowego i przypisz do nich właściwy język i kierunek.

Po OCR sprawdź wynik, sprawdzając tekst przekraczający granice kierunków. Częstym błędem w OCR o mieszanym kierunku jest nieprawidłowe określenie granicy między dwoma obszarami tekstowymi, w wyniku czego ostatnie słowo obszaru pisanego od lewej do prawej zostaje dodane do początku obszaru pisanego od prawej do lewej i odwrotnie. Wyrywkowe sprawdzanie tych obszarów granicznych wychwytuje błędy segmentacji układu, które w przeciwnym razie generowałyby mylące wyniki.

Przetwarzanie po OCR dla niestandardowych kierunków tekstu

Po zakończeniu rozpoznawania OCR rozpoznany tekst może wymagać zmiany kolejności w celu uzyskania naturalnej kolejności czytania. Niektóre silniki OCR generują pionowy tekst japoński w kolejności, w jakiej został rozpoznany, od góry do dołu w każdej kolumnie, kolumna po kolumnie od lewej do prawej. Kolejność ta nie jest zgodna z pierwotną kolejnością czytania, czyli kolumna po kolumnie od prawej do lewej. Etap przetwarzania końcowego, który zmienia kolejność kolumn, tworzy prawidłową sekwencję odczytu.

W przypadku dokumentów zawierających treść zeskanowanego pliku PDF zawierającą tekst dwukierunkowy, język arabski z osadzonymi terminami w języku angielskim, algorytm dwukierunkowy Unicode określa sposób ustalania kolejności wyświetlania. Dane wyjściowe OCR powinny zawierać dwukierunkowe znaki sterujące Unicode lub być zgodne z algorytmem, aby tekst był wyświetlany poprawnie po wklejeniu do aplikacji obsługujących tekst dwukierunkowy.

WukongPDF zapewnia przetwarzanie OCR w przeglądarce dla zeskanowanych plików PDF, z opcjami wyboru języka, które obejmują obsługę głównych systemów pisma od prawej do lewej i pionowej. Testowanie OCR na przykładowej stronie przed przetworzeniem całego dokumentu pozwala sprawdzić, czy kierunek tekstu jest obsługiwany prawidłowo.

W przypadku dokumentów zawierających tekst zarówno w pionie, jak i w poziomie na tej samej stronie, np. w przypadku układu japońskiego magazynu, w którym główny artykuł jest pionowy, ale podpisy i paski boczne są poziome, najdokładniejsze wyniki OCR zapewnia ręczne wyznaczanie stref. Narysuj oddzielne strefy rozpoznawania dla obszarów pionowych i poziomych, przypisz do każdego z nich prawidłowy kierunek tekstu i uruchom OCR na dokumencie podzielonym na strefy. Dodatkowy czas poświęcony na podział na strefy procentuje dokładnością rozpoznawania.

Podczas przetwarzania dokumentów historycznych o niestandardowych układach tekstu należy przygotować się na niższą dokładność OCR niż w przypadku nowoczesnych dokumentów drukowanych. Historyczne czcionki, nierówny druk, postarzały papier z przebarwieniami i niestandardowe warianty znaków zmniejszają pewność rozpoznawania. W przypadku pracy naukowej lub archiwalnej wynik OCR należy traktować jako punkt wyjścia do ręcznej transkrypcji, a nie jako gotowy produkt.

Niektóre silniki OCR obsługują tryb szkoleniowy, w którym podajesz przykłady określonej czcionki lub stylu pisma ręcznego użytego w dokumencie. Uczenie silnika na kilku reprezentatywnych stronach poprawia dokładność rozpoznawania w całym dokumencie. To podejście jest szczególnie przydatne w przypadku dokumentów wydrukowanych nietypowymi krojami pisma lub w przypadku zbiorów dokumentów od tego samego wydawcy, gdzie typografia jest spójna w wielu tomach.

Po zakończeniu OCR dokumentu pisanego od prawej do lewej sprawdź, czy kierunek tekstu jest prawidłowy, kopiując kilka zdań z wyniku i wklejając je do aplikacji obsługującej tekst dwukierunkowy, takiej jak Microsoft Word lub Dokumenty Google. Jeśli tekst pojawia się w odwrotnej kolejności, oznacza to, że silnik OCR nie zastosował prawidłowo kierunku od prawej do lewej i dane wyjściowe wymagają ponownego przetworzenia z poprawionymi ustawieniami kierunku.

Czas poświęcony na ustawienie prawidłowych parametrów OCR dla niestandardowych kierunków tekstowych zwraca się natychmiast w postaci dokładności rozpoznawania. Dokument wymagający 30 minut ręcznej korekty po słabym OCR może wymagać tylko 5 minut czyszczenia po prawidłowo skonfigurowanym OCR.

System pismaKierunekWymagania dotyczące silnika OCRKluczowe wyzwanie
japoński (tategaki)Kolumny od góry do dołu, od prawej do lewejSilnik z wyraźną obsługą tategakiMieszany poziomy angielski w przepływie pionowym
Chiński (tradycyjny)Kolumny pionowe, od prawej do lewejDuży zestaw znaków (ponad 13 000)Wizualnie podobne postacie
arabskiPołączenie od prawej do lewej, kursywąSilnik skryptów arabskich z formularzami pozycyjnymiKontekstowe kształty liter; znaki diakrytyczne
hebrajskiOd prawej do lewej, z niqqudSilnik skryptu hebrajskiego z obsługą samogłosekMałe znaki samogłoskowe utracone w binaryzacji
perski/urduOd prawej do lewej, rozszerzony język arabskiSilnik dostosowany do językaDodatkowe znaki poza zestawem arabskim
WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →