Kiedy plik PDF jest uruchamiany za pomocą narzędzia do tłumaczenia, w powstałym dokumencie często występują problemy z formatowaniem wykraczające poza proste zmiany układu. Znaki specjalne, takie jak symbole matematyczne, znaki walut i litery akcentowane, można zastąpić pustymi polami, znakami zapytania lub całkowicie błędnymi znakami. Osadzone czcionki mogą przestać się renderować, powodując zniknięcie całych sekcji tekstu lub wyświetlenie ich przy użyciu domyślnej czcionki systemowej. Zrozumienie, co dzieje się z symbolami i czcionkami PDF podczas tłumaczenia, pomaga przewidzieć te problemy i wybrać odpowiednie podejście do tłumaczenia dokumentów, w których liczy się dokładność symboli.
Najważniejsze wnioski
Narzędzia do tłumaczenia plików PDF działają na zasadzie wyodrębniania warstwy tekstowej z dokumentu, przepuszczania jej przez silnik tłumaczenia maszynowego i umieszczania przetłumaczonego tekstu z powrotem w oryginalnym układzie. Symbole i znaki specjalne są zagrożone na każdym etapie tego potoku: ekstrakcja może błędnie zinterpretować kodowanie symboli, silnik tłumaczenia może usunąć lub uszkodzić znaki inne niż alfabetyczne, a ponowne wstawienie może napotkać problemy z zastępowaniem czcionek, gdy język docelowy używa znaków, których nie ma w osadzonych czcionkach oryginalnego dokumentu.

Jak tłumaczenie PDF obsługuje etap wyodrębniania tekstu
Zanim nastąpi jakiekolwiek tłumaczenie, narzędzie musi wyodrębnić czytelny tekst z pliku PDF. W przypadku natywnego cyfrowego pliku PDF z osadzonym tekstem ta ekstrakcja odczytuje kody znaków ze strumieni treści dokumentu i mapuje je na wartości Unicode przy użyciu tabeli kodowania osadzonej czcionki. Symbole i znaki specjalne stają się problematyczne na tym etapie, gdy tabela kodowania jest niekompletna, uszkodzona lub używa niestandardowego mapowania, które nie jest zgodne z konwencjami Unicode. Plik PDF utworzony za pomocą starszego oprogramowania może wykorzystywać niestandardowe kodowanie, w którym coś, co na ekranie wygląda jak znak euro, jest przechowywane wewnętrznie jako kod znaku, który nie jest odwzorowany na nic w standardowych tabelach Unicode.
Gdy mapowanie kodowania nie powiedzie się, proces wyodrębniania generuje znaki zastępcze, zwykle znak zastępczy Unicode lub znak zapytania. Ta awaria następuje po cichu. Wyodrębniony tekst na pierwszy rzut oka wygląda normalnie, ponieważ litery i cyfry wokół symbolu są w porządku, ale znak waluty, operator matematyczny lub litera akcentowana, które miały kluczowe znaczenie dla znaczenia dokumentu, zostały utracone jeszcze przed rozpoczęciem tłumaczenia. Etap wyodrębniania, podczas którego nie można rozpoznać znaku euro w finansowym pliku PDF, zmienia się na „Łącznie: 2500 euro” na „Łącznie: 2500” lub „Łącznie: 2500?” a przetłumaczone dane wyjściowe odziedziczą ten błąd.
Wypróbuj Tłumacz PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Co silnik tłumaczenia robi z symbolami i znakami specjalnymi
Silniki tłumaczenia maszynowego są zoptymalizowane pod kątem tekstu w języku naturalnym. Kiedy natkną się na zdanie zawierające mieszankę słów i symboli, takie jak specyfikacja techniczna lub sprawozdanie finansowe, obsługa symboli zależy od konkretnego silnika i pary językowej. Większość nowoczesnych neuronowych systemów tłumaczenia maszynowego przepuszcza symbole, które uznają za niejęzykowe, takie jak znaki walut, znaki procentowe i popularne operatory matematyczne. Jednak mniej popularne symbole, takie jak znak sekcji używany w dokumentach prawnych, symbol stopnia w tekście naukowym lub specjalistyczny zapis z określonej branży, mogą zostać usunięte lub zastąpione w etapie normalizacji tekstu w silniku tłumaczącym.
Etap normalizacji, który przebiega przed właściwym tłumaczeniem, konwertuje tekst wejściowy do ustandaryzowanej formy. Może pisać małymi literami, usuwać znaki interpunkcyjne, które uważa za nieistotne, i normalizować znaki Unicode do ich form kanonicznych. W przypadku większości dokumentów jest to pomocne. Uniemożliwia to silnikowi tłumaczenia traktowanie komunikatu „Witam”; i „cześć” jak różne słowa. Jednak w przypadku dokumentów, w których określone symbole mają znaczenie, normalizacja może wyrządzić szkodę. Wzór chemiczny wykorzystujący liczby z indeksem dolnym, zestaw współrzędnych GPS z symbolami stopni i minut lub cytat prawniczy ze znakami sekcji mogą zostać zmienione w drodze normalizacji w sposób zmieniający ich znaczenie lub uniemożliwiający ich odczytanie.
Zastępowanie czcionek: dlaczego przetłumaczony tekst często wygląda inaczej
Wizualny wpływ zamiany czcionek waha się od subtelnego do poważnego. Kiedy czcionka łacińska zastępuje inną czcionkę łacińską, szerokość znaków zmienia się nieznacznie, ale tekst pozostaje czytelny. Kiedy czcionka łacińska zastępuje system pisma innego niż łaciński, efektem jest zwykle rząd pustych prostokątów lub znaków zapytania, ponieważ czcionka łacińska nie zawiera żadnego z wymaganych znaków. Dlatego też tłumaczenie na języki arabski, chiński, japoński, koreański lub cyrylicę wymaga szczególnej uwagi na dostępność czcionek na etapie ponownego wstawiania.
Po przetłumaczeniu nowy tekst należy ponownie umieścić w pliku PDF. Czcionki osadzone w oryginalnym dokumencie zawierają tylko te znaki, które były obecne w oryginalnym tekście. Jeśli przetłumaczony tekst zawiera znaki, których nie było w oryginale, na przykład znaki akcentowane w francuskich lub hiszpańskich tłumaczeniach dokumentu angielskiego, oryginalne osadzone czcionki nie mogą ich renderować. Przeglądarka plików PDF powraca do czcionki zastępczej, która prawie na pewno będzie wyglądać inaczej niż otaczający tekst. Rezultatem jest dokument, w którym większość tekstu jest pisana oryginalnym krojem pisma, ale czasami przetłumaczone słowa lub znaki akcentowane pojawiają się wyraźnie inną czcionką, co nadaje stronie niejednolity, nieprofesjonalny wygląd.
Problem ten jest najpoważniejszy w przypadku tłumaczeń na języki, w których stosuje się zupełnie inne systemy pisma. Tłumaczenie angielskiego pliku PDF na rosyjski, arabski, chiński lub japoński wymaga znaków, których nie zawiera żadna czcionka alfabetu łacińskiego. Cały przetłumaczony tekst musi zostać wyrenderowany czcionką zastępczą, a wizualny charakter dokumentu ulega całkowitej zmianie. Geometria układu, która działała w przypadku tekstu oryginalnego, z określonymi szerokościami znaków i wysokościami linii, nie będzie pasować do przetłumaczonego tekstu. Podziały wierszy przesuwają się, akapity powiększają się lub kurczą, a starannie wyrównane elementy stają się niewyrównane.
Wybór metody tłumaczenia w oparciu o czułość symboli
Praktyczną kontrolą przed tłumaczeniem jest otwarcie pliku PDF i skopiowanie akapitu zawierającego znaki specjalne do edytora zwykłego tekstu. Jeśli znaki specjalne przetrwają operację kopiowania i wklejania w nienaruszonym stanie, kodowanie tekstu w pliku PDF jest standardowe i jest mało prawdopodobne, aby etap wyodrębniania tłumaczenia je uszkodził. Jeśli po wklejeniu znaki zostaną zniekształcone lub znikną, w pliku PDF zostanie zastosowane niestandardowe kodowanie, które spowoduje problemy podczas tłumaczenia. Naprawienie kodowania u źródła, na przykład poprzez ponowne utworzenie pliku PDF z włączoną funkcją osadzania czcionek, jest skuteczniejsze niż próba odzyskania uszkodzonych znaków po tłumaczeniu.
W przypadku dokumentów, w których symbole mają kluczowe znaczenie, takich jak raporty finansowe, artykuły naukowe, zgłoszenia prawne i podręczniki techniczne, najbezpieczniejszym podejściem jest użycie
W przypadku dokumentów tłumaczonych na inny system pisma należy zaakceptować fakt, że wydruk będzie wyglądał inaczej niż oryginał i odpowiednio zaplanować. Zamiast oczekiwać idealnego dopasowania układu, skup się na stworzeniu czystego i czytelnego dokumentu w języku docelowym. Po tłumaczeniu czas budżetowy na ręczną lub półautomatyczną korektę układu. Dostosuj szerokość kolumn, ponownie wyrównaj tabele i sprawdź, czy wszystkie znaki specjalne zostały poprawnie wyrenderowane. Dodatkowy czas poświęcony na formatowanie po tłumaczeniu to koszt pracy w różnych systemach pisma, a narzędzia zapewniające płynne tłumaczenie międzyskryptowe bez konieczności pracy nad układem nadmiernie upraszczają naprawdę trudny problem. Narzędzie do tłumaczenia WukongPDF zachowuje osadzone dane czcionek przez cały proces konwersji, minimalizując zniekształcenie symboli występujące w przypadku zamiany czcionek podczas ponownego wstawiania tekstu.
Często zadawane pytania
Czy powinienem przetłumaczyć plik PDF bezpośrednio, czy najpierw przekonwertować go na format edytowalny, przetłumaczyć i ponownie wyeksportować do formatu PDF? Dwuetapowe podejście, polegające na konwersji do formatu Word, tłumaczeniu dokumentu Word i eksportowaniu z powrotem do formatu PDF, generalnie zapewnia lepszą wierność symboli, ponieważ Word obsługuje Unicode bardziej spójnie niż ekstrakcja surowego tekstu PDF. Kosztem jest to, że podróż w obie strony przez program Word powoduje wprowadzenie zmian w układzie, które należy poprawić ręcznie. W przypadku krótkich dokumentów warto zastosować metodę dwuetapową. W przypadku bardzo długich dokumentów bardziej praktyczne jest bezpośrednie tłumaczenie pliku PDF za pomocą narzędzia zachowującego kodowanie.
Czy mogę przetłumaczyć plik PDF, wyodrębniając tekst, tłumacząc go na zewnątrz i ręcznie umieszczając go z powrotem w układzie pliku PDF? Tak, ten ręczny potok zapewnia pełną kontrolę nad obsługą symboli i wyborem czcionki na każdym etapie, ale jest czasochłonny i praktyczny tylko w przypadku krótkich dokumentów. W przypadku 50-stronicowej instrukcji technicznej ręczne ponowne włożenie nie jest możliwe. Decyzja pomiędzy tłumaczeniem automatycznym a ręcznym ostatecznie decyduje o tym, ile kontroli potrzebujesz nad wynikami i ile czasu możesz zainwestować.
Czy mogę zapobiec utracie symboli, konwertując plik PDF do formatu Word przed tłumaczeniem?
Konwersja do programu Word daje najpierw narzędziu do tłumaczenia dostęp do tekstu poprzez obsługę Unicode programu Microsoft Word, która jest generalnie bardziej niezawodna niż ekstrakcja surowego tekstu PDF. Ten dodatkowy krok często rozwiązuje problem utraty symboli związanej z kodowaniem, szczególnie w przypadku dokumentów utworzonych za pomocą nowoczesnego oprogramowania, które już wykorzystuje standardowe kodowanie Unicode. Kompromis polega na tym, że sama konwersja programu Word może wprowadzić zmiany w układzie. W przypadku dokumentów zawierających duże ilości symboli, większa dokładność znaków zwykle uzasadnia pracę nad układem.
Dlaczego równania matematyczne często psują się podczas tłumaczenia plików PDF?
Równania matematyczne w plikach PDF są zwykle przechowywane jako mieszanina znaków tekstowych dla zmiennych i liczb, a także specjalne symbole matematyczne z dedykowanej czcionki matematycznej, a także kreski ułamkowe rysowane wektorowo, znaki pierwiastkowe i inne elementy notacji. Kiedy silnik tłumaczenia przetwarza warstwę tekstową, traktuje równanie jak zdanie i może zmienić lub znormalizować sekwencję symboli. Elementy rysowane wektorowo nie są w ogóle tekstem i przechodzą przez tłumaczenie bez dotykania, ale ich wyrównanie względem przetłumaczonego tekstu prawie zawsze jest zepsute. W przypadku dokumentów zawierających dużą ilość treści matematycznych najbardziej niezawodnym podejściem jest wykluczenie równań z tłumaczenia i przetłumaczenie jedynie otaczającej je prozy.
Czy istnieje format PDF obsługujący tłumaczenie Format PDF lepiej niż inne?
Pliki PDF/A z całkowicie osadzonymi czcionkami Unicode są tłumaczone bardziej niezawodnie niż standardowe pliki PDF z podzestawami czcionek i niestandardowym kodowaniem. Pełne osadzanie i wymagania Unicode w formacie PDF/A eliminują dwa najczęstsze źródła zniekształcenia symboli podczas tłumaczenia: brakujące glify czcionek i niestandardowe mapowania znaków. Jeśli wiesz, że dokument zostanie przetłumaczony, warto zapisać go w formacie PDF/A przed uruchomieniem tłumaczenia.
Wypróbuj Tłumacz PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
