Skanujesz dwujęzyczne menu. Nazwy dań są w języku włoskim. Opisy są w języku angielskim. Ceny są liczbami niezależnymi od języka. Aby utworzyć listę słów w języku włoskim, należy wyodrębnić tylko tekst w języku włoskim lub tylko tekst w języku angielskim, aby wysłać go do tłumacza w przypadku innej pary językowej. Uruchomienie OCR na całym dokumencie daje mieszankę obu języków, co jest dobre w przypadku możliwości wyszukiwania, ale nie w przypadku selektywnej ekstrakcji.
Wyodrębnianie tekstu tylko w jednym języku z wielojęzycznego dokumentu OCR PDF wymaga silnika OCR, który potrafi określić, w jakim języku napisany jest każdy blok tekstu i wyodrębnić tylko bloki pasujące do języka docelowego. Jest to operacja bardziej selektywna niż standardowy OCR, który rozpoznaje cały tekst niezależnie od języka.

Jak działa OCR z wyborem języka
Silniki OCR obsługujące wiele języków można skonfigurować tak, aby rozpoznawały tekst w wielu językach jednocześnie. Jeśli określisz „włoski i angielski” podobnie jak języki OCR, silnik rozpoznaje tekst w obu. Oznacza także każdy rozpoznany blok tekstu językiem, w którym został rozpoznany. Blok tekstu w języku włoskim jest oznaczany jako włoski. Blok tekstu w języku angielskim jest oznaczony jako angielski. Znakowanie języka umożliwia selektywne wyodrębnianie.
Po OCR możesz filtrować rozpoznany tekst według znacznika języka. Eksportuj tylko bloki oznaczone jako włoskie. Wynikiem jest dokument zawierający wyłącznie tekst w języku włoskim z menu. Opisy w języku angielskim, rozpoznane, ale odfiltrowane, nie pojawiają się w wynikach. Ta selektywna ekstrakcja jest przydatna w przypadku tłumaczeń, materiałów do nauki języków i analizy treści, gdzie potrzebny jest tekst w określonym języku, odizolowany od otaczającego tekstu w innych językach.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Krok po kroku: wyodrębnianie tekstu w określonym języku
Prześlij zeskanowany plik PDF do narzędzia OCR WukongPDF. Wybierz języki obecne w dokumencie. W przypadku menu włosko-angielskiego wybierz opcję włoską i angielską. Uruchom OCR. Narzędzie rozpoznaje cały tekst i oznacza każdy blok według języka. Po zakończeniu OCR użyj filtra języka, aby wybrać włoski. Eksportuj przefiltrowany tekst jako zwykły plik tekstowy, dokument programu Word lub nowy plik PDF zawierający tylko włoskie bloki.
Dokładność wykrywania języka zależy od odrębności języków. Włoski i angielski używają tego samego alfabetu, ale mają różne układy słów. Silnik OCR rozróżnia je poprzez analizę częstotliwości występowania słów. W języku włoskim wiele słów kończy się samogłoskami. W języku angielskim wiele słów kończy się na spółgłoski. Im bardziej różne są języki, tym dokładniejsze jest ich tagowanie. Silnik w przypadku krótkich bloków tekstu może pomylić dwa blisko spokrewnione języki, takie jak hiszpański i portugalski.
Obsługa tekstu w różnych językach w tej samej linii
W niektórych dokumentach w jednym wierszu mieszają się języki, np. podręcznik językowy, w którym zdanie w języku francuskim łączy się z tłumaczeniem na język angielski w tym samym wierszu. Silnik OCR może zaklasyfikować całą linię jako język dominujący, błędnie oznaczając słowa w językach mniejszości. W przypadku tych dokumentów ekstrakcja selektywna językowo na poziomie bloku nie jest wystarczająco precyzyjna. Potrzebujesz innego podejścia.
Alternatywą jest dwukrotne uruchomienie OCR, po jednym dla każdego języka jako pojedynczego języka rozpoznawania. Karnet OCR przeznaczony wyłącznie dla języka włoskiego dobrze rozpoznaje tekst w języku włoskim, ale zniekształca tekst w języku angielskim. Karnet wyłącznie w języku angielskim dobrze rozpoznaje język angielski, ale zniekształca język włoski. Porównaj oba wyniki i ręcznie wybierz poprawną wersję dla każdego segmentu tekstu. To podejście dwuprzebiegowe zajmuje więcej czasu, ale zapewnia najdokładniejszą ekstrakcję specyficzną dla języka w przypadku dokumentów, w których języki są przeplatane na poziomie zdania.
Weryfikacja i czyszczenie wyodrębnionego tekstu
Po wyodrębnieniu tekstu w języku docelowym sprawdź, czy filtrowanie języka było dokładne. Zeskanuj wyodrębniony tekst w poszukiwaniu słów, które wyraźnie są w niewłaściwym języku. Włoski tekst wyodrębniony z menu nie powinien zawierać angielskich słów, takich jak „grilled”; lub „podawane z” chyba że w menu celowo użyto tych słów we włoskich opisach. Odfiltrowany tekst zawierający nieoczekiwane obce słowa wskazuje na błędy w tagowaniu języka, które wymagają ręcznej korekty.
Uruchom sprawdzanie pisowni w języku docelowym. Sprawdzanie pisowni włoskiej oznaczy angielskie słowa, które zostały błędnie uwzględnione w ekstrakcji włoskiej. Flagi sprawdzania pisowni to skuteczny sposób znajdowania błędów w znacznikach językowych bez konieczności czytania każdego wyodrębnionego słowa. Wyodrębnij dane PDF, które zostały przefiltrowane pod kątem języka i sprawdzone pod kątem pisowni, są gotowe do tłumaczenia, analizy lub archiwizacji. WukongPDF Zeskanowany plik PDF OCR z filtrowaniem języka tworzy czystsze ekstrakty w jednym języku niż wyniki przetwarzania OCR w różnych językach w celu usunięcia niepożądanego języka.
Praktyczne zastosowanie OCR selektywnego językowo: tworzenie dwujęzycznych glosariuszy z przetłumaczonych dokumentów. Wyodrębnij osobno wszystkie terminy w języku źródłowym i wszystkie terminy w języku docelowym. Dopasuj je według ich pozycji na stronie, ponieważ każdemu terminowi źródłowemu odpowiada termin docelowy mniej więcej w tej samej pozycji pionowej na stronie lub w sąsiedniej kolumnie. Dopasowany wynik staje się listą terminów, której tłumacze mogą używać, aby zapewnić spójność w przyszłych tłumaczeniach. Ta technika tworzenia glosariuszy jest szeroko stosowana w tłumaczeniach technicznych, gdzie spójna terminologia ma kluczowe znaczenie.
W przypadku dokumentów, w których języki znajdują się w oddzielnych kolumnach, np. dwukolumnowej umowy dwujęzycznej, wyodrębnianie selektywnego języka staje się zadaniem wyboru kolumny. Lewa kolumna to jeden język, prawa kolumna to inny. Zamiast polegać na wykrywaniu języka, co może mylić podobne języki, przytnij plik PDF, aby wyodrębnić każdą kolumnę osobno. Uruchom jednojęzyczny OCR w każdej kolumnie. To podejście polegające na przycinaniu kolumn jest bardziej niezawodne niż filtrowanie języka w przypadku dokumentów z wyraźną separacją języków kolumnowych.
W przypadku projektów archiwalnych obejmujących historyczne dokumenty wielojęzyczne, selektywny język OCR w połączeniu ze znacznikami metadanych tworzy archiwum z możliwością przeszukiwania, w którym badacze mogą znaleźć treść w określonym języku w tysiącach dokumentów. Wyniki OCR każdego dokumentu są oznaczone wykrytymi językami. Badacz poszukujący dokumentów francuskich z XVIII wieku może filtrować wyłącznie teksty w języku francuskim w zbiorach wielojęzycznych. To selektywne podejście przekształca archiwalne OCR z tępego narzędzia służącego do mieszania języków w precyzyjne narzędzie do badań lingwistycznych.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
