Others

Dlaczego tłumaczenie pliku PDF czasami powoduje przepełnienie tekstu lub zniknięcie z oryginalnego układu?

Uruchamiasz plik PDF za pomocą narzędzia do tłumaczenia, aby przekonwertować tekst z angielskiego na niemiecki. Tłumaczenie jest dokładne, ale wynik jest bałaganem. Tekst w języku niemieckim, który jest zwykle o trzydzieści procent dłuższy niż w języku angielskim, wydostał się z pól tekstowych i rozprzestrzenił się na sąsiednie obszary. Na niektórych stronach przepełniony tekst zniknął całkowicie i został przycięty przez krawędzie oryginalnej ramki tekstowej. Tłumaczenie przechwyciło słowa, ale utraciło układ, a dokument ze zniekształconym formatowaniem jest prawie tak samo bezużyteczny jak dokument ze zniekształconym tłumaczeniem.

Przepełnienie tekstu podczas operacji Translate PDF to najczęstszy problem z jakością tłumaczenia plików PDF. Dzieje się tak, ponieważ oryginalny plik PDF został zaprojektowany dla tekstu o określonej długości, a tekst przetłumaczony na język docelowy prawie nigdy nie ma dokładnie tej samej długości. Gdy narzędzia tłumaczeniowe zastępują oryginalny tekst przetłumaczonym tekstem bez zmiany otaczającego układu, niedopasowanie między długością tekstu a rozmiarem ramki tekstowej powoduje przepełnienie, obcięcie lub jedno i drugie.

Why Does Translating a PDF Sometimes Cause Text to Overflow or Disappear From the Original Layout

Dlaczego przetłumaczony tekst prawie nigdy nie jest tej samej długości co oryginał

Różne języki wyrażają tę samą ideę, używając różnej liczby znaków i słów. Zdanie składające się z piętnastu słów po angielsku może zająć dwanaście słów po chińsku, ale dwadzieścia słów po niemiecku. Liczba znaków różni się jeszcze bardziej dramatycznie. Pięcioznakowe angielskie słowo staje się pojedynczym chińskim znakiem, ale może stać się piętnastoznakowym niemieckim rzeczownikiem złożonym.

Wskaźniki ekspansji i kurczenia się języka są dobrze udokumentowane w branży tłumaczeniowej. Z angielskiego na niemiecki zazwyczaj wzrasta o dwadzieścia do trzydziestu pięciu procent. Z angielskiego na hiszpański wzrósł o piętnaście do dwudziestu pięciu procent. Z angielskiego na francuski wzrósł o dziesięć do dwudziestu procent. Umowy z języka angielskiego na chińskie zwiększają liczbę znaków od trzydziestu do pięćdziesięciu procent. Te współczynniki oznaczają, że ramka tekstowa przeznaczona dla tekstu w języku angielskim będzie za mała dla tekstu niemieckiego i za duża dla języka chińskiego.

Format PDF komplikuje proces tłumaczenia, ponieważ tekst jest zapisywany jako znaki pozycjonowane, a nie jako ciągłe akapity. Każdy znak ma określone współrzędne x i y na stronie. Przetłumaczony tekst o różnych szerokościach znaków nie może być umieszczany w tych samych współrzędnych bez nakładania się lub tworzenia przerw. Narzędzie do tłumaczenia musi albo dostosować pozycje znaków, co może spowodować uszkodzenie układu, albo zachować te pozycje i zaakceptować przepełnienie.

Różnice w czcionkach między językami dodają kolejny wymiar niedopasowaniu długości. Tłumaczenie na język niemiecki może wymagać znaków z umlautami, których nie ma w oryginalnej angielskiej czcionce. Tłumaczenie francuskie wymaga znaków akcentowanych. Polskie tłumaczenie wymaga znaków ze znakami diakrytycznymi. Jeżeli oryginalna czcionka nie zawiera tych znaków, narzędzie do tłumaczenia musi zastąpić inną czcionkę, a zastąpiona czcionka może mieć inną szerokość znaków nawet przy tej samej wielkości punktowej.

WukongPDF

Wypróbuj Tłumacz PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Dlaczego tekst znika zamiast się przepełniać

Ramki tekstowe PDF mają obwiednie przycinające. Gdy tekst przekracza wymiary ramki, nadmiar jest ukrywany. Przycinanie jest domyślnym zachowaniem podczas renderowania plików PDF, ponieważ zachowuje układ wizualny kosztem widoczności treści. Ramka tekstowa przeznaczona dla trzywierszowego adresu w języku angielskim przycina czwartą linię tłumaczenia niemieckiego, które rozwija się do czterech linii.

Gorzej niż przycięcie ma miejsce, gdy narzędzie do tłumaczenia rozpoznaje przepełnienie i przycina tekst, aby go dopasować. Obcięty tekst kończy się w połowie zdania, a czytelnik nigdy nie widzi brakującej treści. Obcięcie bez ostrzeżenia to problem utraty danych, a nie tylko problem z formatowaniem. Czytelnik zakłada, że ma cały przetłumaczony dokument, ale jego części zostały po cichu usunięte, aby zachować układ.

Niektóre narzędzia tłumaczeniowe próbują dopasować tekst, zmniejszając rozmiar czcionki. Przetłumaczony tekst jest nadal obecny i kompletny, ale może być nieczytelnie mały. Czcionka ośmiopunktowa zmniejszona do pięciu punktów, aby zmieścić tłumaczenie niemieckie w ramce tekstowej wielkości angielskiej, jest technicznie kompletna, ale praktycznie nieczytelna. Eksport PDF z takiego tłumaczenia przechodzi kontrolę kompletności, ale nie przechodzi kontroli użyteczności.

Jak zapobiegać problemom z układem podczas tłumaczenia plików PDF

Najskuteczniejszą metodą zapobiegania jest zaprojektowanie oryginalnego pliku PDF z myślą o tłumaczeniu. Dodaj dodatkowe białe znaki w ramkach tekstowych, aby uwzględnić ekspansję językową. Używaj dużych odstępów między wierszami i unikaj ciasno upakowanych układów. Dokument przeznaczony do tłumaczenia wygląda na nieco luźny w swoim oryginalnym języku, ale pozwala na trzydziestoprocentowe rozszerzenie tekstu bez pękania.

Zlecając tłumaczenie pliku PDF, poproś projektanta o dostarczenie pliku źródłowego w formacie edytowalnym, a nie tylko pliku PDF. Tłumacze mogą pracować bezpośrednio w pliku źródłowym, dostosowując ramki tekstowe w zależności od potrzeb dla każdego języka. Przetłumaczony plik źródłowy jest następnie eksportowany do formatu PDF z układem odpowiednim dla tego języka. Ten przepływ pracy zapewnia profesjonalne rezultaty, ale wymaga dostępu do oryginalnych plików projektu.

WukongPDF zapewnia narzędzia do tłumaczenia za pośrednictwem przeglądarki, które mogą przetwarzać tekst PDF i generować przetłumaczone dane wyjściowe. Platforma obsługuje wyodrębnianie i ponowne wstawianie tekstu, zachowując jednocześnie jak najwięcej oryginalnego układu.

Poprawki układu po tłumaczeniu

Po tłumaczeniu przejrzyj każdą stronę pod kątem problemów z przepełnieniem, obcięciem i zastąpieniem czcionek. Recenzję powinna przeprowadzić osoba, która zna oba języki na tyle dobrze, że potrafi zidentyfikować miejsca, w których przetłumaczony tekst został ucięty. Jednojęzyczny recenzent może wykryć problemy wizualne, ale nie może zweryfikować, czy brakujący tekst był ważny.

W przypadku stron, których problemy z układem uniemożliwiają tłumaczenie, należy je zrekonstruować ręcznie. Użyj przetłumaczonego tekstu z pliku PDF i umieść go w nowym dokumencie z ramkami tekstowymi o odpowiedniej wielkości. Ten ręczny krok jest czasochłonny, ale zapewnia najwyższą jakość dokumentów, w przypadku których integralność układu ma kluczowe znaczenie.

W przypadku powtarzających się potrzeb w zakresie tłumaczeń, takich jak dokumentacja produktu publikowana w wielu językach, zainwestuj w proces tłumaczenia, który oddziela treść od układu. Twórz treści w ustrukturyzowanym formacie, takim jak XML lub Markdown. Przetłumacz pliki zawartości. Zastosuj szablony układu dla każdego języka. Generuj pliki PDF specyficzne dla języka na podstawie przetłumaczonej treści i szablonów układów. To oddzielenie zawartości i układu całkowicie eliminuje problem przepełnienia.

Języki pisane od prawej do lewej, takie jak arabski i hebrajski, stanowią wyzwanie kierunkowe w stosunku do wyzwania związanego z długością tekstu. Cały przepływ tekstu odwraca kierunek, a elementy interfejsu użytkownika, które zostały ustawione do czytania od lewej do prawej, mogą wymagać przeniesienia na przeciwną stronę strony. Narzędzia do tłumaczenia, które jedynie zamieniają tekst bez zmiany kierunku, tworzą dokumenty, w których tekst czyta się od prawej do lewej, ale układ zakłada od lewej do prawej, co powoduje dezorientację podczas czytania.

Języki korzystające z alfabetu innego niż łaciński, takie jak chiński, japoński, koreański, cyrylica i arabski, mogą wymagać czcionek, które nie są osadzone w oryginalnym pliku PDF. Narzędzie do tłumaczenia musi zastąpić skrypt docelowy odpowiednią czcionką. Jeśli zastąpiona czcionka ma inne parametry niż oryginalna, zmienia się położenie tekstu. Linia chińskiego tekstu czcionką SimSun zajmuje inną przestrzeń w poziomie niż te same znaki w Microsoft YaHei.

Tłumaczenie formularzy PDF stwarza dodatkowe wyzwania, ponieważ pola formularzy mają stałe wymiary. Pole nazwy o rozmiarze dostosowanym do nazw angielskich może być za krótkie w przypadku nazw niemieckich lub hiszpańskich, które zwykle są dłuższe. Pole numeru telefonu sformatowane dla numerów w Ameryce Północnej (XXX) XXX-XXXX nie może zawierać numerów międzynarodowych w innych formatach.

W przypadku dokumentów tłumaczonych do celów regulacyjnych lub prawnych tłumaczenie musi być poświadczone jako kompletne i dokładne. Tekst, który się przepełnił i został przycięty, nie jest kompletny. Tekst, który został przycięty w celu dopasowania, nie jest dokładny. Tłumacz lub służba tłumaczeniowa musi sprawdzić, czy w przetłumaczonym wyniku znajdują się wszystkie znaki tekstu źródłowego.

Jakość tłumaczenia maszynowego znacznie się poprawiła dzięki neuronowemu tłumaczeniu maszynowemu, ale obsługa układu nie poprawiła się w tym samym tempie. Tłumaczenie może być płynne i dokładne, nawet jeśli układ jest zepsuty. Redakcja końcowa tłumaczenia maszynowego przez człowieka powinna obejmować przegląd układu, a nie tylko ocenę językową.

Najbardziej niezawodnym podejściem do dokumentów, które muszą być opublikowane w wielu językach, jest utrzymanie oddzielnych szablonów układów dla każdego języka, z ramkami tekstowymi o rozmiarze dostosowanym do oczekiwanej długości tekstu w tym języku. Tłumaczenie jest przekazywane do odpowiedniego szablonu, a problemy z układem są wychwytywane przez projekt szablonu, a nie przez porządkowanie po tłumaczeniu.

Narzędzia pamięci tłumaczeniowej używane przez profesjonalnych tłumaczy przechowują wcześniej przetłumaczone segmenty. Jeśli plik PDF zawiera tekst podobny do wcześniej przetłumaczonej treści, tłumacz ponownie wykorzystuje zapisane tłumaczenie. Ponownie użyte tłumaczenie mogło zostać sformatowane dla innego dokumentu o innych wymiarach ramki tekstowej. Tłumacz musi dostosować formatowanie do bieżącego kontekstu dokumentu.

Koszt naprawy układu po tłumaczeniu powinien być uwzględniony w budżecie projektu tłumaczeniowego. Naprawa układu zwykle zwiększa koszt tłumaczenia dokumentów o złożonym formatowaniu o 20–40 procent. Wycena tłumaczenia bez naprawy układu generuje nierealistyczny budżet, który prowadzi do obcinania rogów.

Najbardziej niezawodny proces tłumaczenia plików PDF dzieli wyodrębnianie tekstu, tłumaczenie i rekonstrukcję układu na odrębne etapy z weryfikacjami ręcznymi w każdym punkcie przejścia, tworząc przetłumaczone dokumenty, w których każdy znak źródła jest obecny i prawidłowo umiejscowiony.

Profesjonalne usługi tłumaczeniowe specjalizujące się w tłumaczeniu dokumentów rozumieją wzorce rozszerzania i kurczenia tekstu dla każdej pary językowej i odpowiednio dostosowują ramki tekstowe przed wygenerowaniem przetłumaczonego pliku PDF.

Osadzanie czcionek w przetłumaczonym pliku PDF jest niezbędne do spójnego wyświetlania w różnych systemach i jest szczególnie ważne w przypadku skryptów innych niż łacińskie, gdzie system odbiorcy może nie mieć żadnych czcionek obsługujących znaki języka docelowego.

Para językowaRozszerzanie/kurczenieWpływ na układ
Angielski na niemiecki+20-35%Przepełnienie ramek tekstowych; konieczne zmniejszenie rozmiaru czcionki
Angielski na hiszpański+15-25%Umiarkowany przelew; hojne marże pomagają
Angielski na chiński-30-50% znakówNadmiar białych znaków; tekst wydaje się rzadki
Angielski na arabski+15-25% + RTLOdwrócenie kierunku tekstu; Przesunięcie elementów interfejsu użytkownika
WukongPDF

Wypróbuj Tłumacz PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →