Otrzymywanie zeskanowanego pliku PDF napisanego w języku, którego nie znasz, jest częstsze niż kiedykolwiek w globalnym biznesie, badaniach akademickich i przeglądach dokumentów prawnych. Musisz wyodrębnić tekst, przetłumaczyć go i zrozumieć, co mówi dokument. Wyzwaniem nie jest tylko uruchomienie OCR na pliku. Działa OCR z prawidłowymi ustawieniami języka, więc wyodrębniony tekst jest wystarczająco dokładny, aby można go było przetłumaczyć. Wybranie niewłaściwego języka podczas przetwarzania OCR PDF powoduje zniekształcenie danych wyjściowych, których żaden silnik tłumaczący nie jest w stanie uratować.
Silniki OCR nie widzą liter. Widzą kształty i dopasowują je do wzorców znaków dla określonego języka. Jeśli powiesz silnikowi OCR, że dokument jest w języku angielskim, ale w rzeczywistości jest w języku rosyjskim, silnik odwzorowuje kształty cyrylicy na najbliższe znane mu znaki łacińskie. Rezultatem jest ciąg losowo wyglądających liter, który nie ma żadnego związku z oryginalnym tekstem. Właściwe ustawienie języka lub skorzystanie z automatycznego wykrywania, jeśli jest to możliwe, to najważniejsza decyzja w całym procesie OCR do tłumaczenia.
Narzędzia WukongPDF do formatu PDF na tekst i OCR wyodrębniają tekst ze zeskanowanych dokumentów w celu tłumaczenia i analizy. Połączenie prawidłowego wyboru języka OCR z niezawodną usługą tłumaczeniową zamienia nieczytelny skan w języku obcym w zrozumiały dokument w mniej niż pięć minut.

Krok 1: Określ język dokumentu
Zanim dotkniesz jakiegokolwiek oprogramowania OCR, upewnij się, że znasz język dokumentu. Jeśli metadane dokumentu lub nazwa pliku wskazują na język, zacznij od tego. Jeśli nie, otwórz plik PDF i przejrzyj kilka stron. Nawet bez czytania tekstu wskazówki wizualne znacznie zawężają możliwości. Rodziny pism są charakterystyczne: alfabet łaciński obsługuje większość języków europejskich. Cyrylica jest używana w języku rosyjskim, ukraińskim, bułgarskim i serbskim. Pismo arabskie obejmuje język arabski, perski i urdu. CJK obejmuje język chiński, japoński i koreański. Devanagari obejmuje język hindi, marathi i nepalski.
Jeśli nie możesz wizualnie zidentyfikować nawet rodziny skryptów, zrób zrzut ekranu reprezentatywnego akapitu i prześlij go do funkcji tłumaczenia obrazów w Tłumaczu Google lub do wyszukiwania obrazów odwrotnych. Narzędzia te w większości przypadków identyfikują zarówno pismo, jak i konkretny język. Świadomość, że dokument jest w języku tajskim, a nie laotańskim, lub koreańskim, a nie japońskim, robi różnicę pomiędzy dokładnym wynikiem OCR a bezużytecznym szumem znaków.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Krok 2: Wybierz narzędzie OCR obsługujące język docelowy
Nie wszystkie narzędzia OCR obsługują wszystkie języki. Adobe Acrobat Pro jest dostarczany z silnikami OCR dla około 40 języków. Narzędzie Rozpoznaj tekst zawiera menu wyboru języka w oknie dialogowym ustawień. Tesseract, bezpłatny silnik OCR typu open source obsługiwany przez Google, obsługuje ponad 100 języków dzięki plikom danych językowych do pobrania. Google Cloud Vision API ma najszerszy zakres języków w ponad 200 językach i obejmuje automatyczne wykrywanie języka jako funkcję opcjonalną.
W przypadku dokumentu napisanego w jednym języku, który możesz zidentyfikować, każde z tych narzędzi będzie działać, pod warunkiem, że przed uruchomieniem OCR określisz właściwy język. W przypadku dokumentu zawierającego wiele języków, na przykład dwujęzycznej umowy z klauzulami w języku angielskim i francuskim, potrzebujesz narzędzia, które albo obsługuje wiele języków jednocześnie, albo może automatycznie wykrywać poszczególne akapity. Zarówno Google Cloud Vision, jak i Tesseract z odpowiednimi pakietami danych językowych obsługują dokumenty wielojęzyczne, chociaż dokładność w zakresie granic zmiany języka nigdy nie jest idealna.
Krok 3: Skonfiguruj i uruchom OCR w odpowiednim języku
W programie Adobe Acrobat Pro otwórz zeskanowany plik PDF, przejdź do opcji Narzędzia, następnie Skanuj i OCR i wybierz opcję Rozpoznaj tekst, a następnie W tym pliku. Kliknij przycisk Edytuj obok selektora języka. W oknie dialogowym Rozpoznaj tekst wybierz z listy rozwijanej właściwy język podstawowy. Jeśli dokument zawiera drugi język, kliknij przycisk Dodaj język i również go wybierz. Acrobat przetwarza oba języki jednocześnie. Kliknij OK, a następnie Rozpoznaj tekst. Acrobat uruchamia przebieg OCR i osadza rozpoznany tekst jako niewidoczną warstwę za zeskanowanym obrazem. Dokument można teraz przeszukiwać.
W Tesseract wywołanie wiersza poleceń określa język za pomocą flagi -l: tesseract input.pdf wynik -l rus dla języka rosyjskiego, tesseract input.pdf wynik -l jpn dla języka japońskiego lub tesseract input.pdf wynik -l fra+eng dla dwujęzycznego dokumentu francusko-angielskiego. Najpierw zainstaluj wymagane pliki danych językowych; Tesseract jest domyślnie dostarczany tylko w języku angielskim. W przypadku Google Cloud Vision wywołanie interfejsu API zawiera parametr LanguageHints, który akceptuje tablicę kodów języków BCP-47. Cloud Vision oferuje także tryb automatycznego wykrywania języka, który nie wymaga podpowiedzi dotyczących języka, co czyni go najprostszą opcją, gdy naprawdę nie znasz języka dokumentu.
Krok 4: Skopiuj wyodrębniony tekst i przetłumacz
Po zakończeniu OCR sprawdź jakość tekstu przed wysłaniem go do tłumaczenia. W programie Acrobat otwórz narzędzie Znajdź i wyszukaj popularne słowo, które rozpoznajesz w dokumencie. Jeśli wyszukiwanie znajdzie dopasowania, funkcja OCR zadziałała. Wybierz akapit wyodrębnionego tekstu, skopiuj go i wklej do edytora zwykłego tekstu. Skanuj w poszukiwaniu oczywistych błędów OCR: powtarzających się symboli, słów przerywanych w środku lub dużych bloków nierozpoznanych znaków. Jeśli więcej niż 5 procent tekstu wydaje się uszkodzone, uruchom ponownie OCR z innym ustawieniem języka lub wyższą rozdzielczością.
Gdy wyodrębniony tekst przejdzie kontrolę wizualną, skopiuj cały tekst i wklej go do narzędzia do tłumaczenia. Tłumacze Google, DeepL i Microsoft Translator akceptują wprowadzanie zwykłego tekstu. W przypadku dłuższych dokumentów DeepL i Tłumacz Google obsługują bezpośrednie przesyłanie plików PDF z możliwością przeszukiwania, co pomija etap ręcznego kopiowania. Wynik tłumaczenia jest wystarczająco dobry do zrozumienia, badań i wewnętrznego użytku biznesowego. Aby uzyskać dokładność na poziomie prawnym, medycznym lub publikacyjnym, wyślij plik PDF z możliwością przeszukiwania do profesjonalnego tłumacza, który użyje warstwy OCR jako punktu wyjścia i skoryguje tłumaczenie maszynowe w stosunku do oryginalnie zeskanowanych stron.
Obsługa dokumentów zawierających mieszane czcionki lub niestandardowe czcionki
Dokumenty zawierające kombinację pism, takie jak arabska publikacja naukowa zawierająca angielskie terminy techniczne zapisane w alfabecie łacińskim, dezorientują silniki OCR oczekujące pojedynczego pisma. Najpierw skonfiguruj OCR dla skryptu dominującego, a następnie uruchom drugi przebieg, którego celem jest skrypt mniejszościowy w tym samym dokumencie. Połącz wyniki, eksportując obie warstwy OCR i łącząc je w edytorze tekstu. Dokładność fragmentów skryptu mniejszościowego będzie niższa, ponieważ silnik jest zoptymalizowany pod kątem skryptu głównego.
Niestandardowe czcionki, w tym ozdobne kroje pisma, stare czcionki maszyn do pisania i czcionki kursywne przypominające pismo odręczne, zmniejszają dokładność rozpoznawania OCR nawet przy wybranym prawidłowym języku. Wstępnie przetwórz te dokumenty, konwertując strony PDF na obrazy o wysokiej rozdzielczości 400 DPI lub wyższej, stosując filtr wyostrzający i zwiększając kontrast przed wprowadzeniem ich do silnika OCR. Wbudowane przetwarzanie wstępne Tesseract, włączane za pomocą opcji --psm 3 do automatycznej segmentacji strony, obsługuje umiarkowane zróżnicowanie czcionek. W przypadku tekstu poważnie zdegradowanego lub stylizowanego interfejs Google Cloud Vision API generalnie przewyższa lokalne silniki OCR, ponieważ jego modele zostały przeszkolone na większym zbiorze próbek czcionek ze świata rzeczywistego.
| Narzędzie OCR | Obsługa wielu języków | Automatyczne wykrywanie | Najlepsze dla |
|---|---|---|---|
| Adobe Acrobat Pro | Ponad 40 języków | Wybór ręczny | Profesjonalne dokumenty, wysoka dokładność |
| Tesserakt (otwarte oprogramowanie) | Ponad 100 języków | Wymagany wybór ręczny | Przetwarzanie wsadowe, skrypty, bezpłatnie |
| Wizja chmury Google | Ponad 200 języków | Dostępne automatyczne wykrywanie | Integracja API, skrypty mieszane |
| Usługi OCR online | 10-50 języków | Wybór ręczny | Szybki OCR pojedynczego dokumentu |
Weryfikacja dokładności przed podjęciem działań w związku z przetłumaczoną treścią
OCR, po którym następuje tłumaczenie maszynowe, wprowadza dwie warstwy potencjalnych błędów: błędne rozpoznanie OCR i niejednoznaczność tłumaczenia. W przypadku dokumentów krytycznych sprawdź wynik, prosząc dwujęzycznego kolegę lub profesjonalnego tłumacza o porównanie losowo wybranego akapitu tłumaczenia z oryginalnym plikiem PDF. Pięciominutowa weryfikacja wychwytuje katastrofalne błędy, takie jak nieprawidłowe ustawienie języka, w wyniku którego powstał wiarygodnie wyglądający, ale całkowicie niepoprawny tekst.
Jeśli regularnie obsługujesz zeskanowane pliki PDF w językach obcych, utwórz listę kontrolną: zidentyfikuj język, wybierz pasujący silnik OCR, uruchom OCR z odpowiednim parametrem języka, sprawdź wyodrębniony tekst pod kątem dokładności znaków, przetłumacz i zweryfikuj przykładowy akapit. Po dwóch lub trzech dokumentach obieg pracy staje się rutynowy i od otwarcia pliku do odczytania przetłumaczonego wyniku zajmuje mniej niż pięć minut.
Jeśli chodzi o przetwarzanie dokumentów, w przypadku dokumentów wrażliwych na bezpieczeństwo funkcja OCR offline całkowicie pozwala uniknąć narażenia na działanie chmury. Tesseract działa lokalnie, bez żądań sieciowych, po jednokrotnym pobraniu plików danych językowych. Program Adobe Acrobat Pro wykonuje również lokalnie OCR za pomocą funkcji Rozpoznaj tekst bez konieczności logowania się do Document Cloud. W przypadku poufnych materiałów obcojęzycznych, takich jak odkrycia prawne lub wrażliwa korespondencja biznesowa, lokalny OCR w połączeniu z przeglądaniem tekstu w trybie offline pozwala zachować oryginalną treść dokumentu w kontrolowanym środowisku.
Kiedy sam OCR nie wystarczy: usługi transkrypcji wspomaganej
W przypadku dokumentów, których dokładność rozpoznawania OCR jest bezużytecznie niska ze względu na ekstremalną degradację czcionki, tekst pisany odręcznie lub mocno mieszane skrypty, usługi transkrypcji wspomaganej zapewniają dane wyjściowe zweryfikowane przez człowieka. Usługi te łączą wstępną maszynową przepustkę OCR z przeglądem ręcznym i korektą, zazwyczaj naliczając opłatę za stronę. Czas realizacji waha się od kilku godzin do kilku dni. W przypadku pojedynczego dokumentu o kluczowym znaczeniu, którego dokładność nie podlega negocjacjom, takiego jak akt urodzenia w języku obcym lub zgłoszenie patentowe, koszt transkrypcji wykonywanej przez człowieka jest uzasadniony ryzykiem zastosowania błędnie rozpoznanego tekstu. Najpierw uruchom komputerowy OCR, aby ocenić jakość. Jeśli ponad 15 procent słów jest nierozpoznanych lub w sposób oczywisty jest błędnych, przejdź do transkrypcji wspomaganej, zamiast spędzać godziny na ręcznym poprawianiu danych wyjściowych maszyny.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
