Tips & Tricks

Jak OCR pliku PDF zawierającego wiele języków lub tekst w języku innym niż angielski

Skanujesz umowę dwujęzyczną. Lewa kolumna jest w języku angielskim. Prawa kolumna jest w języku hiszpańskim. Obydwa języki muszą umożliwiać wyszukiwanie, ale standardowe uruchomienie OCR skonfigurowane dla jednego języka spowoduje zniekształcenie drugiego. Angielski OCR zastosowany do tekstu hiszpańskiego daje nonsens, ponieważ silnik rozpoznawania oczekuje różnych częstotliwości liter i wzorów słów. Hiszpański OCR zastosowany do języka angielskiego daje podobnie zniekształcone wyniki. Potrzebujesz OCR, który rozumie oba języki jednocześnie.

Wielojęzyczny OCR PDF to funkcja nowoczesnych silników rozpoznawania, które umożliwiają przełączanie pomiędzy modelami językowymi w ramach jednego dokumentu. Silnik wykrywa, w jakim języku napisany jest każdy blok tekstu i stosuje odpowiedni model rozpoznawania. Rezultatem jest dokładne rozpoznawanie tekstu we wszystkich językach dokumentu.

How to OCR a PDF That Contains Multiple Languages or Non-English Text

Jak silniki OCR obsługują wiele języków

Silniki OCR rozpoznają tekst, porównując kształty znaków z wytrenowanymi modelami wyglądu liter w każdym języku. Model angielski wie, że litera „e” jest najczęstsze, że „th” często występuje razem oraz że pewne kombinacje znaków, takie jak „qx”; prawie nigdy nie występują. Hiszpańska modelka wie, że znaki akcentowane, takie jak „a”, z akcentem, „n” z tyldą i odwróconymi znakami zapytania są powszechne. Model francuski oczekuje częstych samogłosek akcentowanych i określonych dwuznaków.

Jeśli określisz wiele języków dla zadania OCR, silnik ładuje modele znaków dla wszystkich określonych języków. Przetwarzając każdy blok tekstu na stronie, ocenia, który model języka najlepiej pasuje do zaobserwowanych wzorców znaków, i stosuje ten model. Wykrywanie języka odbywa się automatycznie na poziomie bloku tekstu, więc strona z tekstem w języku angielskim i przypisami w języku francuskim jest obsługiwana poprawnie, bez konieczności ręcznego oznaczania języka.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Konfiguracja wielojęzycznego OCR

W narzędziu OCR wybór języka umożliwia wybór wielu języków. Wybierz wszystkie języki, które pojawiają się w dokumencie. W przypadku umowy dwujęzycznej angielsko-hiszpańskiej wybierz zarówno język angielski, jak i hiszpański. W przypadku dokumentu Unii Europejskiej zawierającego języki angielski, francuski i niemiecki wybierz wszystkie trzy. W przypadku pracy naukowej zawierającej tekst w języku angielskim i cytaty ze starożytnej Grecji wybierz język angielski i grecki. Silnik ładuje wszystkie niezbędne modele.

Istnieje kompromis pomiędzy zasięgiem językowym a dokładnością. Każdy dodatkowy język dodaje do procesu rozpoznawania więcej modeli znaków, co zwiększa ryzyko pomylenia podobnych znaków z różnych języków. Litera cyrylicy „a” wygląda identycznie jak łacińska litera „a” ale reprezentuje inny dźwięk i pojawia się w różnych kontekstach. Dodanie niepotrzebnych języków zwiększa ryzyko błędnej klasyfikacji bloków tekstu przez silnik i zastosowania niewłaściwego modelu językowego. Wybierz tylko te języki, które faktycznie pojawiają się w dokumencie, a nie każdy język, który Twoim zdaniem może być przydatny.

Typowe wielojęzyczne scenariusze OCR i sposoby postępowania z nimi

Najczęstszym scenariuszem wielojęzycznym jest dokument sporządzony głównie w jednym języku z krótkimi fragmentami, cytatami lub przypisami w innym. Artykuł naukowy w języku angielskim z cytatami w języku francuskim w przypisach. Instrukcja obsługi w języku niemieckim z angielskimi terminami technicznymi. Umowa prawna w języku hiszpańskim z warunkami zdefiniowanymi w języku angielskim. W przypadku tych dokumentów większość tekstu znajduje się w języku podstawowym, a język dodatkowy pojawia się w krótkich, przewidywalnych kontekstach.

Mechanizm rozpoznawania dobrze radzi sobie z dokumentami w różnych językach, ponieważ przełączanie języków jest zlokalizowane w określonych blokach tekstu. Angielski tekst podstawowy jest rozpoznawany w modelu angielskim. Cytat francuski jest rozpoznawany na wzór francuski. Ponieważ te dwa języki pojawiają się w oddzielnych blokach tekstu, wykrywanie języka przez silnik prawidłowo identyfikuje model, którego należy użyć dla każdego bloku.

Bardziej wymagającym scenariuszem jest dokument, w którym języki są przeplatane w tym samym wierszu, np. podręcznik językowy, który przedstawia zdanie w języku angielskim, po którym następuje jego tłumaczenie na język hiszpański w tym samym wierszu. Silnik OCR może potraktować całą linię jako jeden blok tekstu i zastosować do całości jeden model językowy, powodując błędy w połowie linii, która jest w innym języku. W przypadku takich dokumentów najdokładniejsze podejście polega na dwukrotnym OCR dokumentu, po jednym w każdym języku, i ręcznym połączeniu wyników. Jest to pracochłonne i praktyczne tylko w przypadku krótkich dokumentów, w których dokładność ma kluczowe znaczenie.

Weryfikacja wyników wielojęzycznego OCR

Po uruchomieniu wielojęzycznego OCR sprawdź wyniki, sprawdzając tekst w każdym języku. Wyszukaj słowo, które znasz, pojawia się w każdym języku. Potwierdź, że wyszukiwanie go znalazło. Wybierz tekst w każdym języku i skopiuj go, aby potwierdzić, że znaki są prawidłowe. Zwróć szczególną uwagę na znaki akcentowane i symbole specjalne. Rozpoznawanie zeskanowanego pliku PDF najprawdopodobniej nie powiedzie się w przypadku znaków, które nie istnieją w dominującym modelu języka, ponieważ silnik może domyślnie używać najbliższego łacińskiego odpowiednika.

Typowe błędy OCR w dokumentach wielojęzycznych obejmują znaki akcentowane zastępowane ich odpowiednikami bez akcentu, e z akcentem na e, n z tyldą na n, specjalne znaki interpunkcyjne, takie jak odwrócone znaki zapytania w języku hiszpańskim zastępowane standardowymi znakami zapytania oraz pisma inne niż łacińskie, takie jak cyrylica lub greka, błędnie rozpoznawane jako wizualnie podobne znaki łacińskie. Błędy te koncentrują się zwykle we fragmentach języka dodatkowego. Jeśli treść w języku dodatkowym jest krytyczna, ręcznie sprawdź te fragmenty w stosunku do oryginalnego dokumentu. Narzędzie OCR WukongPDF zapewnia poziom pewności dla każdego rozpoznanego bloku tekstu, przy czym niższe wyniki wskazują bloki, w przypadku których silnik rozpoznawania był mniej pewny.

W przypadku dokumentów, które łączą języki alfabetu łacińskiego z alfabetem innym niż łaciński, np. dokument w języku angielskim z cytatami chińskimi lub arabskimi, wielojęzyczne wyzwanie OCR jest bardziej znaczące, ponieważ kształty znaków są zasadniczo różne. Silnik rozpoznawania musi rozróżniać całkowicie oddzielne systemy pisma. Wybierz określone języki dla każdej rodziny pism pojawiającej się w dokumencie. Obsługa PDFFormat w WukongPDF umożliwia mieszanie skryptów łacińskich, cyrylicy, arabskich, CJK i indyjskich w jednym zadaniu OCR, chociaż dokładność różni się w zależności od pisma i jakości skanu.

Praktyczna technika ulepszania wielojęzycznego OCR w dokumentach z odrębnymi sekcjami językowymi: przed uruchomieniem OCR należy wstępnie oddzielić dokument według języka. Jeśli 20-stronicowa umowa ma pierwsze 10 stron w języku angielskim i ostatnie 10 stron w języku hiszpańskim, podziel dokument na dwa pliki, uruchom OCR w języku angielskim na pierwszym i OCR w języku hiszpańskim na drugim, a następnie połącz ponownie. Pozwala to całkowicie uniknąć narzutu związanego z modelem wielojęzycznym i zapewnia nieco większą dokładność, ponieważ każde zadanie OCR wykorzystuje model jednego języka zoptymalizowany pod kątem dokładnego przetwarzanego tekstu. Proces podziału, OCR oddzielnie i ponownego łączenia zajmuje kilka dodatkowych minut, ale niezawodnie zapewnia najlepszą dokładność w przypadku dokumentów z wyraźnymi granicami językowymi. Zarezerwuj wielojęzyczne podejście OCR do dokumentów, w których języki są rzeczywiście przeplatane na tej samej stronie, a oddzielanie jest niepraktyczne.

Ostatnia wskazówka dotycząca wielojęzycznego OCR: jeśli dokument zawiera pisma pisane od prawej do lewej, takie jak arabski, hebrajski lub perski, obok pism pisanych od lewej do prawej, takich jak angielski lub francuski, kierunek tekstu zwiększa złożoność. Silniki OCR muszą wykrywać nie tylko język, w jakim znajduje się każdy blok tekstu, ale także kierunek przepływu tekstu. Blok tekstu arabskiego powinien być rozpoznawany od prawej do lewej, natomiast znajdujący się pod nim podpis w języku angielskim powinien być rozpoznawany od lewej do prawej. Większość nowoczesnych silników OCR dość dobrze radzi sobie z dokumentami mieszanymi, jeśli w ustawieniach określisz obie rodziny języków. Po OCR sprawdź kierunek tekstu, kopiując fragment w języku arabskim i wklejając go do edytora tekstu. Znaki powinny pojawiać się we właściwej kolejności czytania, a nie odwrócone.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →