Narzędzie do tłumaczenia plików PDF przetwarza strumień tekstu w dokumencie, konwertując słowa z jednego języka na inny. Czyta akapity, nagłówki i podpisy. Ale nie czyta tekstu znajdującego się w obrazach. Zdjęcie znaku, zrzut ekranu interfejsu użytkownika w innym języku, wykres z etykietami osi renderowanymi jako część obrazu – wszystko to zawiera tekst, który standardowe narzędzia tłumaczeniowe ignorują, ponieważ tekstu nie ma w strumieniu tekstu PDF. Jest osadzony w pikselach obrazu. Tłumaczenie tekstu zawartego w osadzonych obrazach wymaga wyodrębnienia obrazów, uruchomienia na nich OCR, przetłumaczenia rozpoznanego tekstu, a następnie ponownego osadzenia przetłumaczonych obrazów lub dodania tłumaczenia jako nakładki. Obieg pracy Translate PDF dla tekstu osadzonego w obrazie jest bardziej skomplikowany niż standardowe tłumaczenie tekstu, ale obejmuje treści, które w innym przypadku pozostałyby nieprzetłumaczone.

Identyfikowanie obrazów zawierających tekst do przetłumaczenia
Nie każdy obraz w pliku PDF zawiera tekst wart przetłumaczenia. Zdjęcie dekoracyjne, tekstura tła i logo firmy nie mogą zawierać treści możliwych do przetłumaczenia. Zrzut ekranu aplikacji, diagram z oznaczonymi komponentami, fotografia dokumentu lub znaku oraz wykres z osadzonymi etykietami osi zawierają tekst, który czytelnik w języku docelowym musi zrozumieć. Zeskanuj plik PDF i zidentyfikuj każdy obraz zawierający tekst. Oznacz te obrazy do celów tłumaczenia.
Obrazy zawierające tekst w pliku PDF można podzielić na dwie kategorie: te, w których tekst zgodnie z projektem stanowi część obrazu, np. zrzut ekranu lub diagram z etykietą, oraz te, w których tekst pojawia się na obrazie, ponieważ dokument został zeskanowany, a nie utworzony cyfrowo. Zeskanowany plik PDF to jeden duży obraz na stronę. Cały tekst na zeskanowanej stronie jest osadzony w obrazie strony. Cyfrowo utworzony plik PDF może zawierać pojedynczy zrzut ekranu na stronie tekstowej. Obrazy PDF wymagające tłumaczenia to te, w których tekst pojawia się w pikselach obrazu, a nie w strumieniu tekstu PDF.
Wypróbuj Tłumacz PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Wyodrębnianie obrazów i rozpoznawanie tekstu
Wyodrębnij obrazy z pliku PDF w najwyższej dostępnej rozdzielczości. Użyj narzędzia do wyodrębniania obrazów PDF, które zachowuje oryginalną rozdzielczość. Zapisz każdy wyodrębniony obraz jako plik PNG, aby uniknąć wprowadzenia artefaktów kompresji na etapie wyodrębniania. Otwórz każdy wyodrębniony obraz i potwierdź, że tekst jest czytelny. Jeśli rozdzielczość obrazu jest zbyt niska, aby tekst był wyraźnie czytelny, wyodrębnij ponownie w wyższej rozdzielczości, jeśli to możliwe, lub pamiętaj, że ten obraz może dawać niewiarygodne wyniki OCR.
Uruchom OCR na każdym wyodrębnionym obrazie, aby rozpoznać tekst. Silnik OCR identyfikuje obszary tekstowe w obrazie i wyświetla rozpoznane znaki wraz z ich położeniem. Zapisz wynik OCR dla każdego obrazu, łącznie z rozpoznanym tekstem i współrzędnymi obwiedni każdego obszaru tekstowego. Informacje te są potrzebne później, aby umieścić przetłumaczony tekst we właściwej pozycji na obrazie. WukongPDF obsługuje przetwarzanie OCR PDF, które rozpoznaje tekst w osadzonych obrazach w ramach procesu konwersji dokumentu.
Tłumaczenie rozpoznanego tekstu z zachowaniem kontekstu
Tekst rozpoznawany z obrazów jest często fragmentaryczny. Diagram może zawierać etykiety składające się z pojedynczych słów. Zrzut ekranu może zawierać elementy menu i etykiety przycisków bez kontekstu zdania. Ten fragmentaryczny tekst stanowi wyzwanie dla silników tłumaczenia maszynowego, ponieważ nie ma otaczającego go kontekstu językowego, który ujednoznacznia znaczenie słów. Podaj jak najwięcej kontekstu. Jeśli etykieta brzmi Plik i pojawia się na zrzucie ekranu menu oprogramowania, w tekście wejściowym tłumaczenia zwróć uwagę, że jest to element menu, a nie obiekt fizyczny.
W przypadku obrazów zawierających wiele obszarów tekstowych zachowaj mapowanie pomiędzy każdym regionem i jego tłumaczeniem. Diagram z dziesięcioma etykietami tworzy dziesięć oddzielnych ciągów tekstowych, z których każdy wymaga tłumaczenia. Zachowaj oryginalny tekst, przetłumaczony tekst i współrzędne ramki ograniczającej w uporządkowanym formacie, takim jak arkusz kalkulacyjny. To mapowanie jest używane w ostatnim kroku, aby umieścić przetłumaczony tekst na obrazie. Aby wynik Przetłumacz PDF był użyteczny, przetłumaczony tekst musi pojawić się we właściwym miejscu obrazu, zastępując lub towarzysząc tekstowi oryginalnemu.
Umieszczanie przetłumaczonego tekstu z powrotem na obrazach
Istnieją dwa podejścia do umieszczania przetłumaczonego tekstu na obrazach. W pierwszym podejściu tekst oryginalny zastępuje się tłumaczeniem. Otwórz obraz w edytorze obrazów. Dla każdego obszaru tekstowego usuń oryginalny tekst, wypełniając obszar kolorem tła. Umieść przetłumaczony tekst w tym samym regionie, używając czcionki możliwie najbardziej odpowiadającej stylowi oryginału. Dzięki takiemu podejściu uzyskuje się czysty przetłumaczony obraz, który wygląda jak oryginał, ale w innym języku.
Drugie podejście dodaje tłumaczenie do tekstu oryginalnego. Umieść przetłumaczony tekst w kontrastowym kolorze poniżej lub obok tekstu oryginalnego. Takie podejście pozwala zachować oryginał dla czytelników, którzy rozumieją oba języki i chcą porównać tłumaczenie ze źródłem. Jest to szybsze niż usuwanie i zastępowanie, ale wynikowy obraz jest wizualnie bardziej zajęty. Wybierz podejście w oparciu o potrzeby odbiorców. Podręcznik szkoleniowy dla operatorów, którzy czytają tylko w języku docelowym, zyskuje dzięki wymianie. Dwujęzyczny dokument referencyjny jest korzystniejszy dzięki prezentacji obok siebie.
Ponowne osadzanie przetłumaczonych obrazów w pliku PDF
Po przetworzeniu obrazów z przetłumaczonym tekstem należy je ponownie umieścić w pliku PDF. Zastąp każdy oryginalny obraz jego przetłumaczonym odpowiednikiem. Obraz zastępczy musi mieścić się w tym samym miejscu na stronie, co oryginał. Jeśli przetłumaczony obraz ma inne wymiary w pikselach niż oryginał, przeskaluj go, aby dopasować go do oryginalnej ramki ograniczającej w pliku PDF. Układ strony PDF nie powinien się zmieniać. Jedyną widoczną różnicą powinien być język tekstu na obrazach.
Zapisz plik PDF z przetłumaczonymi obrazami jako nową wersję, zachowując oryginalny nieprzetłumaczony plik PDF jako odniesienie. Sprawdź przetłumaczony plik PDF, otwierając go i sprawdzając każdy obraz. Upewnij się, że przetłumaczony tekst jest czytelny, prawidłowo umieszczony i wolny od błędów OCR lub tłumaczenia. Tłumacz PDF z osadzonym tłumaczeniem obrazu jest kompletny, gdy każdy element tekstowy w dokumencie, w strumieniu tekstu i na obrazach jest dostępny dla czytelnika w języku docelowym.
Kiedy wybrać tłumaczenie ręczne zamiast automatycznego
W przypadku obrazów zawierających tekst krytyczny, taki jak ostrzeżenia dotyczące bezpieczeństwa, informacje prawne lub specyfikacje techniczne, rozważ ręczne tłumaczenie przez tłumacza zamiast tłumaczenia maszynowego. Błąd OCR w połączeniu z błędem tłumaczenia maszynowego może zmienić znaczenie instrukcji bezpieczeństwa w sposób, który ma realne konsekwencje. Koszt tłumaczenia przez człowieka niewielkiej liczby krytycznych obrazów jest niewielki w porównaniu z kosztem nieprawidłowego tłumaczenia.
W przypadku dużych partii obrazów, w przypadku których ręczne tłumaczenie nie jest praktyczne, należy wdrożyć etap przeglądu. Po tłumaczeniu maszynowym i ponownym osadzeniu poproś weryfikatora, który czyta język docelowy, o sprawdzenie próbki przetłumaczonych obrazów pod kątem dokładności. Jeśli próbka wykryje błędy systemowe, dostosuj ustawienia OCR lub parametry silnika tłumaczeniowego i przetwórz ponownie partię.
Tłumaczenie tekstu w osadzonych obrazach jest często ostatnim krokiem w uczynieniu pliku PDF w pełni dostępnym dla międzynarodowej publiczności. Treść, nagłówki i podpisy zostały przetłumaczone. Obrazy pozostają ostateczną nieprzetłumaczoną treścią. Po wykonaniu tego kroku powstaje dokument, w którym każdy fragment tekstu na każdym nośniku będzie dostępny w języku docelowym.
W przypadku często aktualizowanych dokumentów z osadzonymi obrazami należy rozważyć, czy tekst obrazu można przenieść do strumienia tekstu PDF podczas procesu tworzenia dokumentu. Diagram z etykietami przechowywanymi jako nakładki tekstowe, a nie jako część obrazu, można przetłumaczyć przy użyciu standardowych narzędzi do tłumaczenia tekstu, całkowicie unikając procedury wyodrębniania-OCR-tłumaczenia-ponownego osadzania.
Jakość ostatecznego przetłumaczonego obrazu zależy od jakości każdego etapu procesu. Ekstrakcja obrazu w wysokiej rozdzielczości zapewnia wyraźny sygnał wejściowy OCR. Dokładny OCR generuje poprawny tekst do tłumaczenia. Dobry silnik tłumaczący zachowuje znaczenie. Staranne ponowne osadzanie utrzymuje jakość wizualną. Każdy krok zależy od poprzedniego.
Przepływ pracy Translate PDF dla tekstu z osadzonym obrazem jest najbardziej pracochłonnym scenariuszem tłumaczenia, ponieważ łączy przetwarzanie obrazu, OCR, tłumaczenie i ponowne osadzanie w jednym potoku. Automatyzacja jak największej liczby kroków zmniejsza wysiłek ręczny.
W przypadku obrazów, które wyglądają identycznie w wielu plikach PDF, np. logo firmy ze sloganem lub standardowym diagramem, przetłumacz obraz raz i użyj go ponownie. Przetłumaczony obraz można zastąpić w każdym pliku PDF, w którym pojawia się oryginalny obraz.
W tym artykule omówiono kluczowe techniki i zagadnienia dotyczące pracy z plikami PDF w tym konkretnym scenariuszu. Opisane tutaj metody mają zastosowanie w przypadku różnych narzędzi i platform, dając czytelnikom elastyczność w wyborze podejścia, które najlepiej pasuje do ich przepływu pracy i środowiska technicznego.
Opisane praktyczne kroki zapewniają jasną ścieżkę od początkowego wyzwania do działającego rozwiązania. Każda technika została wybrana ze względu na jej niezawodność i dostępność, dzięki czemu czytelnicy mogą osiągnąć spójne wyniki niezależnie od ich wcześniejszego doświadczenia z narzędziami PDF.
WukongPDF i podobne platformy udostępniają narzędzia OCR i przetwarzania dokumentów, które wspierają proces tłumaczenia tekstu obrazowego opisany w tym artykule. Połączenie tych narzędzi umożliwia kompleksową obsługę tłumaczeń.
Wypróbuj Tłumacz PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
