Others

Dlaczego tekst zmienia się lub jest zniekształcony podczas kopiowania z pliku PDF do programu Word

Zaznaczenie tekstu w pliku PDF, skopiowanie go i wklejenie do programu Word powinno dać ten sam tekst. Zamiast tego podziały wierszy pojawiają się w połowie zdania. Znaki specjalne zamieniają się w symbole śmieci. Czcionki się zmieniają. Akapity, które zostały starannie wyrównane, stają się postrzępionym bałaganem twardych zwrotów i losowych odstępów. Technicznie rzecz biorąc, tekst istnieje, ale formatowanie jest zniszczone.

Pliki PDF zaprojektowano tak, aby wszędzie wyglądały tak samo. Nie zostały zaprojektowane tak, aby można je było edytować. Kopiuj-wklej ujawnia ten kompromis.

Zrozumienie, dlaczego tekst zmienia się podczas operacji kopiowania z PDF na Word, pomoże Ci wybrać pomiędzy poprawieniem wklejonego tekstu, użyciem odpowiedniego narzędzia do konwersji lub powrotem do dokumentu źródłowego. Narzędzia do konwersji PDF Format WukongPDF obsługują wyodrębnianie prawidłowo, całkowicie unikając problemów z kopiowaniem i wklejaniem.

Why Does Text Change or Garbled When Copying From a PDF to Word

Jak pliki PDF przechowują tekst i jak go wyświetlają

Wewnątrz pliku PDF tekst jest przechowywany w postaci pojedynczych znaków umieszczonych w siatce współrzędnych. Każdy znak ma pozycję X i Y. Słowo hello może składać się z pięciu niezależnych znaków: h at (100 200), e at (108 200) i tak dalej. Widz renderuje je jako słowo, ponieważ znajdują się obok siebie na tej samej współrzędnej Y. Podczas kopiowania i wklejania aplikacja odbierająca rekonstruuje słowa i zdania z poszczególnych pozycji.

Algorytmy rekonstrukcji zgadują, gdzie zaczynają się i kończą słowa i linie, na podstawie odstępów. Większe niż normalne odstępy między wyrazami mogą zostać zinterpretowane jako podział wiersza. Wyjustowane akapity ze zmiennymi odstępami mylą algorytm z losowym wstawianiem przerw. Ligatury, połączone znaki, takie jak fi i fl, mogą nie mieć odpowiednika w Unicode, powodując brakujące lub zastąpione znaki w wklejanym wyniku.

WukongPDF

Wypróbuj PDF do Worda

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Dlaczego w środku zdania pojawiają się podziały wierszy

Twarde podziały linii pojawiające się w połowie zdania są najczęstszym artefaktem kopiowania i wklejania. Plik PDF przechowuje tekst w wierszach pasujących do układu strony. Zawijanie zdania od jednej linii wizualnej do następnej jest przechowywane jako dwa oddzielne zestawy pozycji znaków. Algorytm kopiowania widzi przerwę między końcem jednej wizualnej linii a początkiem następnej i wstawia podział akapitu.

Ręczne naprawianie tych przerw w programie Word oznacza usunięcie każdej niechcianej przerwy i dodanie spacji. W jednym akapicie mała irytacja. W przypadku 50-stronicowego dokumentu godzina straconego czasu. Konwerter plików PDF na Word, który rekonstruuje akapity z pozycji znaków, radzi sobie z tym poprawnie, łącząc zawinięty tekst i wstawiając przerwy tylko na rzeczywistych granicach akapitów.

Znaki specjalne i problemy z zastępowaniem czcionek

W plikach PDF można używać czcionek niezainstalowanych na komputerze kopiującym. Kiedy operacja kopiowania napotka znak z niedostępnej czcionki, zastępuje go zastępczym lub całkowicie usuwa. Punktory stają się znakami zapytania. Kreski Em stają się pustymi polami. Kręcone cytaty stają się prostymi cytatami lub znikają. Tekst jest obecny w pliku PDF, ale nie można go przedstawić w miejscu docelowym wklejania, ponieważ kodowanie znaków nie jest prawidłowo odwzorowane.

Osadzone czcionki zapobiegają problemom z wyświetlaniem, ale kopiowanie i wklejanie nie powoduje przeniesienia osadzonej czcionki. Aplikacja docelowa używa własnych czcionek, którym może brakować określonych znaków lub które mogą być kodowane w inny sposób. Odpowiednie narzędzia do konwersji plików PDF na Word obsługują mapowanie czcionek inteligentniej niż schowek systemowy, tłumacząc kodowanie czcionek PDF na Unicode i zachowując każdy znak.

Problem z kopiowaniem i wklejaniemCo jest tego przyczynąJak unikać
Losowe przerwy w liniiPlik PDF przechowuje tekst według linii wizualnej, a nie akapituUżyj konwertera plików PDF na Word zamiast kopiowania i wklejania
Zniekształcone znaki specjalneCzcionka niedostępna w systemie, nieprawidłowe kodowanieUpewnij się, że źródłowy plik PDF korzysta z osadzonych czcionek lub użyj konwertera
Brakujące ligatury (fi, fl, ff)Glif ligatury nie ma jednego odpowiednika w UnicodeUżyj konwertera, który rozkłada ligatury na osobne znaki
Utracone formatowanie (pogrubienie, kursywa)Formatowanie przechowywane oddzielnie od tekstu w formacie PDFZaakceptuj fakt, że kopiowanie i wklejanie powoduje utratę formatowania; użyj konwertera
Tekst w złej kolejnościUkład wielokolumnowy lub złożony powoduje dezorientację ekstrakcjiUżyj konwertera z wykrywaniem układu

Korzystanie z konwersji plików PDF na Word zamiast kopiowania i wklejania

Narzędzie do konwersji odczytuje wewnętrzną strukturę pliku PDF i rekonstruuje akapity, tabele i formatowanie w sposób niedostępny dla schowka. Wynikowy dokument programu Word zachowuje przepływ tekstu, zachowuje nagłówki w stylach programu Word i zapewnia możliwość edycji tabel. Konwersja wymaga takiej samej liczby kliknięć jak kopiowanie i wklejanie, a wynik wymaga ułamka czyszczenia.

Narzędzie do konwersji WukongPDF automatycznie obsługuje tę rekonstrukcję. Prześlij plik PDF, wybierz Word jako format wyjściowy i pobierz dokument o odpowiedniej strukturze. Kilka sekund potrzebnych na konwersję zwraca się w postaci zaoszczędzonego czasu czyszczenia. W przypadku każdego dokumentu dłuższego niż jedna strona konwersja przewyższa całkowity czas kopiowania i wklejania z pliku PDF do użytecznego pliku Word.

Obsługa niestandardowego kodowania i tekstu pisanego od prawej do lewej

Pliki PDF utworzone na podstawie starszych systemów lub skryptów innych niż łacińskie stwarzają dodatkowe wyzwania związane z kopiowaniem i wklejaniem. Dokumenty zawierające tekst w języku arabskim, hebrajskim, chińskim lub japońskim korzystają ze schematów kodowania, których schowek systemowy może nieprawidłowo zinterpretować. Tekst wizualny jest wyświetlany poprawnie na ekranie, ponieważ przeglądarka plików PDF zawiera niezbędne tabele czcionek i kodowania. Schowek pozbawiony tych tabel generuje całkowicie zniekształcone dane wyjściowe.

Narzędzia do konwersji przeznaczone dla wielojęzycznych plików PDF obejmują wykrywanie kodowania, którego brakuje w schowku. Analizują tabele kodowania czcionek w formacie PDF, mapują indeksy glifów na właściwe punkty kodowe Unicode i generują prawidłowo zakodowany tekst. W przypadku dokumentów zawierających różne języki, tekst w języku angielskim z przypisami w języku arabskim, chińskie etykiety na diagramach niezbędny jest konwerter obsługujący wiele języków. Metoda schowka nie sprawdzi się w co najmniej jednym języku, a często we wszystkich.

Kiedy aplikacja źródłowa jest lepszą opcją

Najczystszy dokument Word pochodzi z aplikacji, która utworzyła plik PDF. Jeśli plik PDF został wyeksportowany z programu Word, otwórz ponownie oryginalny plik programu Word. Jeśli został wyeksportowany z Dokumentów Google, pobierz zamiast tego jako plik Word. Aplikacja źródłowa ma oryginalne formatowanie, style i strukturę spłaszczone w pliku PDF.

Pliki PDF są formatem dystrybucji, a nie formatem edycji. Zostały zaprojektowane tak, aby wszędzie wyglądały identycznie i nie można ich modyfikować. Jeśli konieczna jest edycja, wróć do źródła. Jeśli źródło jest niedostępne i wystarczy Ci plik PDF, użyj odpowiedniego narzędzia do konwersji, a nie kopiuj i wklejaj. Narzędzie zostało zbudowane do tego zadania. Schowek nie był.

WukongPDF

Wypróbuj PDF do Worda

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →