Others

Czy podczas tłumaczenia pliku PDF można zachować oryginalną warstwę tekstową?

Tłumaczenie pliku PDF zazwyczaj zastępuje oryginalny tekst przetłumaczoną wersją. Tekst w języku źródłowym zniknął z danych wyjściowych. W niektórych przypadkach cenne jest zachowanie oryginalnego tekstu jako ukrytej warstwy obok tłumaczenia. Czytelnik dwujęzyczny może zweryfikować tłumaczenie z oryginałem. Przyszły tłumacz może zobaczyć, jaki był tekst źródłowy, bez konieczności lokalizowania oryginalnego dokumentu. Wyszukiwarka może indeksować oba języki, dzięki czemu dokument będzie można znaleźć w każdym z nich. Pytanie brzmi, czy narzędzia Translate PDF mogą zachować oryginalną warstwę tekstową podczas tłumaczenia i pod jakimi warunkami jest to możliwe.

Najważniejsze wnioski

Większość narzędzi do tłumaczenia plików PDF zastępuje oryginalny tekst przetłumaczoną wersją. Zachowywanie oryginalnego tekstu jako warstwy ukrytej wymaga narzędzia obsługującego wydruk dwujęzyczny lub równoległy, w którym oryginalny tekst jest przechowywany jako niewidoczna warstwa pod przetłumaczonym tekstem. Ta funkcja jest dostępna w niektórych profesjonalnych narzędziach do tłumaczenia, ale nie jest standardem w przypadku konsumenckich tłumaczy plików PDF. Alternatywnym podejściem jest przetłumaczenie kopii pliku PDF i zachowanie oryginału jako osobnego dokumentu referencyjnego.

Can You Keep the Original Text Layer When Translating a PDF

Jak działają warstwy tekstowe PDF podczas tłumaczenia

Na etapie wyodrębniania tekstu leży najwięcej złożoności. Narzędzie do tłumaczenia musi nie tylko wyodrębnić widoczny tekst, ale także zapisać jego dokładne położenie, właściwości czcionki i kodowanie każdego znaku. Podczas ponownego umieszczania przetłumaczonego tekstu narzędzie potrzebuje danych o położeniu oryginalnego tekstu, aby poprawnie wyrównać nowy tekst. Narzędzie zachowujące oryginalny tekst jako warstwę ukrytą musi przechowywać dwa kompletne zestawy danych tekstowych i zarządzać ich układaniem. To z grubsza podwaja obciążenie związane z przetwarzaniem tekstu i dlatego wiele narzędzi nie oferuje tej funkcji. Możliwości techniczne znajdują się w specyfikacji PDF. Ograniczenie dotyczy implementacji narzędzia, a nie formatu.

Plik PDF przechowuje tekst jako kody znaków w strumieniach treści. Gdy narzędzie do tłumaczenia przetwarza plik PDF, wyodrębnia te kody znaków, mapuje je na czytelny tekst, wysyła tekst do silnika tłumaczenia i umieszcza przetłumaczony tekst z powrotem w dokumencie. Standardowy przepływ pracy zastępuje oryginalne kody znaków przetłumaczonymi. Oryginalny tekst zniknął z pliku. Nie ma możliwości cofnięcia. Aby zachować oryginalny tekst, narzędzie do tłumaczenia musi utworzyć drugą warstwę tekstową zawierającą język źródłowy, oznaczyć ją jako ukrytą lub niedrukowaną i umieścić przetłumaczony tekst w widocznej warstwie. Jest to technicznie możliwe, ale wymaga narzędzia tłumaczeniowego do zarządzania podwójnymi warstwami tekstu w całym procesie.

Specyfikacja PDF obsługuje opcjonalne grupy treści, powszechnie zwane Warstwy PDF, które można niezależnie wyświetlać lub ukrywać. Narzędzie do tłumaczenia może umieścić oryginalny tekst na jednej warstwie, a przetłumaczony tekst na drugiej, przy czym oryginalna warstwa jest domyślnie ustawiona na ukrytą. Czytelnicy, którzy chcą zobaczyć oryginalny tekst, mogą przełączać widoczność warstw w przeglądarce plików PDF. Takie podejście zachowuje oba języki w jednym pliku i daje czytelnikowi kontrolę nad tym, który język jest widoczny. Możliwości techniczne dostępne są w formacie PDF. Pytaniem jest, czy dane narzędzie tłumaczeniowe to implementuje.

WukongPDF

Wypróbuj Tłumacz PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Narzędzia tłumaczeniowe umożliwiające zachowanie oryginalnego tekstu

Profesjonalne platformy tłumaczeniowe używane przez agencje lokalizacyjne często obsługują dwujęzyczne pliki PDF. Narzędzia te są przeznaczone do procesów, w których recenzent musi porównać tłumaczenie z tekstem źródłowym. Wyjściowy plik PDF zawiera obie warstwy językowe, a recenzent może przełączać się między nimi lub przeglądać je obok siebie w specjalistycznym interfejsie recenzji. Narzędzia te są zazwyczaj oparte na subskrypcji i przeznaczone do dużych tłumaczeń komercyjnych, a nie do sporadycznego tłumaczenia dokumentów.

W przypadku użytkowników indywidualnych i małych firm opcje są bardziej ograniczone. Niektóre internetowe usługi tłumaczenia plików PDF oferują format wyjściowy side-by-side, w którym tekst oryginalny i przetłumaczony pojawiają się naprzemiennie w akapitach lub w układzie dwóch kolumn. Dzięki temu oba języki są widoczne, a nie ukrywane jako warstwa. Dokument jest dłuższy, ale oba języki są dostępne bez przełączania warstw. Narzędzie do tłumaczenia WukongPDF obsługuje tryb wyjściowy obok siebie, który umieszcza oryginalny i przetłumaczony akapit obok siebie, zachowując oba języki w jednym czytelnym dokumencie.

Alternatywa: Zachowaj oryginalny plik PDF jako odniesienie

W przypadku zespołów, które muszą utrzymywać dwujęzyczne wersje dokumentów w wielu cyklach sprawdzania, podejście do zarządzania dokumentami sprawdza się lepiej niż podejście oparte na jednym pliku. Przechowuj oryginalne i przetłumaczone pliki PDF w repozytorium z kontrolą wersji, stosując konwencję nazewnictwa, która je łączy. Kiedy oryginalny dokument jest aktualizowany, konwencja nazewnictwa jasno określa, które tłumaczenie należy zaktualizować, aby było zgodne. Ten przepływ pracy jest bardziej niezawodny niż pojedynczy dwujęzyczny plik PDF w przypadku dokumentów zmieniających się z biegiem czasu.

Jeśli narzędzie do tłumaczenia nie obsługuje wyników dwujęzycznych, najprostszym sposobem działania jest przetłumaczenie kopii pliku PDF i zachowanie oryginału jako osobnego pliku referencyjnego. Nazwij pliki spójnie, aby związek między nimi był jasny. Konwencja nazewnictwa, taka jak report-2025-en.pdf w przypadku tłumaczenia na język angielski i report-2025-fr-original.pdf w przypadku francuskiego oryginału, sprawia, że powiązanie jest oczywiste dla każdego przeglądającego folder. Zapisz oba pliki w tej samej lokalizacji i odwołuj się do oryginalnej nazwy pliku w metadanych przetłumaczonego dokumentu lub w notatce na stronie tytułowej.

Dla celów archiwalnych najbardziej wiarygodną metodą jest często para oryginał-tłumaczenie. Każdy plik jest standardowym plikiem PDF, który może otworzyć dowolny czytnik. Nie ma zależności od ustawień widoczności warstw ani specjalistycznych narzędzi przeglądania. Para plików dokumentuje zarówno tekst źródłowy, jak i tłumaczenie w formacie, który pozostanie dostępny przez dziesięciolecia. To podejście może nie być tak eleganckie jak pojedynczy dwujęzyczny plik PDF, ale w dłuższej perspektywie jest bardziej niezawodne.

Sprawdzanie, czy oryginalna warstwa tekstowa jest nienaruszona

Uruchom test wyodrębniania tekstu z dwujęzycznego pliku PDF. Wyodrębnij cały tekst z dokumentu i wyszukaj charakterystyczne słowo lub frazę z języka oryginalnego. Jeśli pojawia się w wyodrębnionym tekście, oryginalna warstwa jest obecna i poprawnie zakodowana. Jeśli wyodrębniony tekst zawiera tylko przetłumaczony język, brakuje oryginalnej warstwy lub nie została ona zakodowana jako tekst wyodrębnialny. Ten test wychwytuje błędy kodowania, które mogłyby zostać przeoczone podczas kontroli wzrokowej panelu warstw.

Jeśli Twoje narzędzie do tłumaczenia twierdzi, że zachowuje oryginalny tekst jako ukrytą warstwę, sprawdź to, zanim na nim zaczniesz polegać. Otwórz przetłumaczony plik PDF w przeglądarce obsługującej przełączanie widoczności warstw, takiej jak Adobe Acrobat Pro. Poszukaj panelu warstw w panelu nawigacji. Jeśli narzędzie poprawnie utworzyło oryginalną warstwę tekstową, pojawi się ona jako nazwana warstwa z przełącznikiem widoczności. Włączaj i wyłączaj warstwę, aby potwierdzić, że oryginalny tekst pojawia się i znika zgodnie z oczekiwaniami. Uruchom wyszukiwanie tekstowe pod kątem słowa, o którym wiesz, że pojawia się w oryginale, ale zostało zmienione w tłumaczeniu. Jeśli wyszukiwanie znajdzie oryginalne słowo, warstwa będzie obecna i będzie można ją przeszukiwać.

Sprawdź także rozmiar pliku dwujęzycznego pliku PDF w porównaniu z rozmiarem standardowej wersji przetłumaczonej. W zależności od ilości tekstu plik PDF z dwiema warstwami tekstowymi będzie o około 10–30 procent większy niż wersja jednojęzyczna. Dwujęzyczny plik PDF o tym samym rozmiarze co standardowe tłumaczenie prawdopodobnie nie zawiera oryginalnej warstwy tekstowej, niezależnie od tego, co twierdzi dokumentacja narzędzia. Różnica w rozmiarze pliku to szybka i niezawodna kontrola.

Często zadawane pytania

Czy ukryta oryginalna warstwa tekstowa znacząco zwiększy rozmiar pliku? Wzrost jest proporcjonalny do ilości tekstu i zwykle wynosi od 15 do 30 procent w przypadku dokumentów zawierających dużo tekstu. W przypadku dokumentów zawierających dużo obrazów, w których tekst stanowi niewielki ułamek całkowitego rozmiaru pliku, wzrost jest nieistotny. Podejście dwuwarstwowe dodaje drugą kopię danych tekstowych i metadanych zarządzania warstwami, ale nie powiela obrazów, czcionek ani struktury strony. W przypadku zastosowań archiwalnych umiarkowane zwiększenie rozmiaru pliku jest rozsądnym kompromisem w zakresie dostępności dwujęzycznej.

Czy zachowanie oryginalnej warstwy tekstowej wpływa na możliwość przeszukiwania pliku PDF?

Tak, pozytywnie. W przypadku obecności obu warstw językowych plik PDF można przeszukiwać w obu językach. Użytkownik wyszukujący hasło w języku oryginalnym znajdzie je w warstwie ukrytej, natomiast użytkownik wyszukujący w języku przetłumaczonym znajdzie je w warstwie widocznej. Ta podwójna możliwość wyszukiwania jest jedną z głównych zalet zachowania oryginalnego tekstu.

Czy mogę wyodrębnić oryginalny tekst z dwujęzycznego pliku PDF w celu odzyskania dokumentu źródłowego?

Jeśli oryginalna warstwa tekstowa jest obecna i prawidłowo zakodowana, wyodrębnienie jej przywraca tekst źródłowy z wysoką wiernością. Jakość ekstrakcji zależy od sposobu, w jaki narzędzie do tłumaczenia zapisało oryginalny tekst. Narzędzia, które przechowują go w postaci kompletnego, nieuszkodzonego strumienia tekstowego, generują dane wyjściowe, które można wyodrębnić. Narzędzia przechowujące je jako pofragmentowane obiekty tekstowe mogą generować możliwe do wyodrębnienia dane wyjściowe z uszkodzonymi zdaniami, które wymagają ręcznego oczyszczenia.

Czy dwujęzyczny plik PDF jest większy niż przechowywanie dwóch oddzielnych plików?

Zwykle nie. Dwujęzyczny plik PDF zawierający obie warstwy językowe jest zazwyczaj mniejszy niż łączny rozmiar dwóch oddzielnych jednojęzycznych plików PDF, ponieważ obrazy, czcionki i struktura strony są współdzielone pomiędzy warstwami. Warstwa tekstowa dodaje tylko niewielką ilość danych. W środowiskach o ograniczonej przestrzeni dyskowej dwujęzyczny plik PDF jest bardziej wydajny niż utrzymywanie dwóch oddzielnych plików.

WukongPDF

Wypróbuj Tłumacz PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →