Tips & Tricks

Jak przekonwertować plik PDF na Word i zachować strukturę kolumn

Konwersja wielokolumnowego układu pliku PDF do programu Word często powoduje powstanie dokumentu, w którym tekst z różnych kolumn jest mieszany w jednym przepływie. Dwukolumnowy artykuł naukowy staje się jednym długim, pomieszanym akapitem. Newsletter z trzema kolumnami staje się nieczytelny. Zachowanie struktury kolumn podczas konwersji PDF na Word wymaga ustawień konwersji, które rozpoznają i zachowują oryginalną geometrię układu, traktując każdą kolumnę jako niezależny przepływ tekstu, a nie łącząc je w jeden.

Najważniejsze wnioski

Narzędzia do konwersji plików PDF na Word obsługują układy wielokolumnowe, analizując przestrzenny układ tekstu na każdej stronie. Narzędzia wspierające wykrywanie kolumn identyfikują luki pomiędzy blokami tekstu i rekonstruują kolejność czytania kolumn. Jakość zachowania kolumn różni się znacznie w zależności od narzędzi do konwersji. Dokumenty o prostych układach dwukolumnowych można dobrze konwertować za pomocą większości narzędzi. Dokumenty o skomplikowanym układzie przypominającym magazyn, z nakładającym się tekstem i obrazami, mogą wymagać ręcznego oczyszczenia po konwersji.

How to Convert PDF to Word and Keep the Column Structure

Jak działa wykrywanie kolumn podczas konwersji PDF

Rozmiar czcionki i odstępy między wierszami w oryginalnym pliku PDF wpływają na dokładność wykrywania kolumn. Dokumenty zawierające bardzo mały tekst, takie jak 8-punktowe tabele finansowe, stanowią wyzwanie dla algorytmu wykrywania, ponieważ odstępy między kolumnami są proporcjonalnie mniejsze. Jeśli pozwala na to oryginalny dokument, zwiększenie rozmiaru czcionki lub odstępu między kolumnami przed utworzeniem pliku PDF poprawia wyniki konwersji. W przypadku istniejących plików PDF, dla których dokument źródłowy nie jest dostępny, zaakceptuj fakt, że wielokolumnowe układy zawierające mały tekst będą wymagały więcej ręcznego czyszczenia.

Konwerter PDF obsługujący wykrywanie kolumn analizuje poziome położenie bloków tekstu na każdej stronie. Bloki tekstu, które mają tę samą lewą krawędź i mają stałą szerokość, są grupowane w kolumnę. Konwerter następnie odczytuje każdą kolumnę od góry do dołu przed przejściem do następnej kolumny. Spowoduje to utworzenie dokumentu programu Word, w którym tekst z każdej kolumny znajduje się w oddzielnym przepływie tekstu, który program Word przedstawia albo jako połączone pola tekstowe, albo jako tabelę z jedną kolumną na kolumnę pliku PDF.

Algorytm wykrywania opiera się na stałych szerokościach kolumn i wyraźnych odstępach między kolumnami. Dokument z 2-milimetrową przerwą między kolumnami stanowi wyzwanie dla algorytmu, ponieważ tak wąska przerwa może być interpretowana jako normalny odstęp między wyrazami, a nie jako granica kolumny. Dokumenty z kolumnami o różnej szerokości, np. szeroką kolumną główną i wąskim paskiem bocznym, również stanowią wyzwanie dla algorytmu, ponieważ musi on rozróżniać kolumnę od akapitu z wcięciem. Wykrywanie kolumn działa najlepiej w dokumentach o standardowym układzie: kolumny o równej szerokości oddzielone odstępem co najmniej 5 milimetrów.

WukongPDF

Wypróbuj PDF do Worda

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Ustawienia konwersji dla zachowania kolumny

W przypadku dokumentów o skomplikowanych układach wielokolumnowych, których konwersja nie jest płynna przy użyciu jakichkolwiek ustawień automatycznych, rozważ konwersję do formatu innego niż Word. Konwertowanie pliku PDF na format DTP, taki jak Adobe InDesign lub Affinity Publisher, pozwala zachować struktury kolumn wierniej niż w programie Word, ponieważ te aplikacje są od podstaw zaprojektowane do układu wielokolumnowego. Wyeksportuj ostatecznie edytowany dokument z powrotem do formatu PDF z aplikacji do publikowania.

Po wstępnej konwersji zapisz dokument Worda w formacie DOCX, a nie starszym formacie DOC. DOCX obsługuje złożone układy, w tym struktury kolumnowe, bardziej niezawodnie niż DOC. Jeśli narzędzie do konwersji oferuje wybór formatu wyjściowego, w przypadku dokumentów zawierających duże kolumny zawsze wybieraj DOCX. Konwersja z formatu PDF do DOC, a następnie zapisanie w formacie DOCX powoduje niepotrzebną konwersję formatu, która może wprowadzić błędy w układzie.

Jeśli przekonwertowany dokument programu Word umieszcza każdą kolumnę w oddzielnym polu tekstowym, co jest domyślnym zachowaniem w przypadku konwersji z zachowaniem układu, można wyodrębnić tekst z każdego pola tekstowego i umieścić go w układzie opartym na jednej kolumnie, korzystając z funkcji połączonych pól tekstowych programu Word. Połącz pola tekstowe w kolejności czytania, a tekst będzie przez nie przepływał w sposób ciągły. Takie podejście pozwala zachować zarówno układ kolumn, jak i możliwość edycji tekstu w sposób ciągły.

W ustawieniach konwersji poszukaj opcji związanych z zachowaniem układu. „Zachowaj płynny tekst” próbuje zrekonstruować tekst jako edytowalne akapity programu Word, co jest idealne w przypadku dokumentów wymagających dalszej edycji. „Zachowaj układ strony” umieszcza tekst w pozycjonowanych polach tekstowych, które zachowują dokładny układ wizualny, ale są trudniejsze do edycji. Aby zachować kolumnę, wybierz opcję „Zachowaj płynny tekst”; z włączonym wykrywaniem kolumn zwykle zapewnia najlepszą równowagę możliwości edycji i struktury. Konwerter plików PDF na Word w WukongPDF zawiera tryb wykrywania kolumn, który identyfikuje układy wielokolumnowe i rekonstruuje prawidłową kolejność czytania, umieszczając tekst każdej kolumny w osobnej sekcji programu Word.

Jeśli konwerter oferuje opcję OCR dla zeskanowanych dokumentów, włącz ją nawet w przypadku cyfrowych plików PDF. Analiza układu silnika OCR często lepiej wykrywa kolumny niż analiza przestrzenna silnika wyodrębniania tekstu. OCR przetwarza stronę jako obraz i identyfikuje obszary tekstowe, co sprawia, że wykrywanie kolumn jest skuteczniejsze niż bezpośrednie analizowanie strumienia treści PDF. Wadą jest to, że konwersja oparta na OCR jest wolniejsza i może powodować błędy rozpoznawania tekstu, który był już cyfrowy. Użyj konwersji opartej na OCR w przypadku dokumentów, w których wierność kolumn jest najwyższym priorytetem, a długość dokumentu jest możliwa do kontrolowania.

Ręczne przywracanie kolumny po konwersji

Jeśli podczas automatycznej konwersji powstaje dokument, w którym tekst z różnych kolumn jest przeplatany w niewłaściwej kolejności, funkcja Znajdź i zamień za pomocą symboli wieloznacznych programu Word może pomóc w rozdzieleniu scalonego tekstu. Szukaj wzorców wskazujących podziały kolumn w oryginalnym układzie, takich jak stała liczba spacji lub określony wzór interpunkcyjny pojawiający się na końcu jednej kolumny i na początku następnej. Wyszukiwanie i zastępowanie symboli wieloznacznych jest szybsze niż ręczne wycinanie i wklejanie każdego akapitu z powrotem we właściwej kolejności kolumn.

W przypadku dokumentów, w których kolejność kolumn ma znaczenie semantyczne, takich jak dokumenty dwujęzyczne, w których język oryginału znajduje się w lewej kolumnie, a tłumaczenie w prawej, zachowanie parowania kolumn jest niezbędne. Po konwersji sprawdź, czy każdy akapit w lewej kolumnie odpowiada właściwemu akapitowi w prawej kolumnie. Pojedyncza nieprawidłowość na początku dokumentu wpływa kaskadą na wszystkie kolejne akapity. Etap weryfikacji w przypadku dokumentów dwukolumnowych jest bardziej czasochłonny niż w przypadku standardowych układów wielokolumnowych, ale jest niezbędny, aby dokument nadawał się do użytku.

Gdy automatyczne wykrywanie kolumn daje pomieszane wyniki, rozwiązaniem jest ręczne przywrócenie danych. W programie Word użyj funkcji Kolumny na karcie Układ, aby ustawić prawidłową liczbę kolumn w każdej sekcji dokumentu. Następnie wytnij i wklej tekst z pomieszanej konwersji we właściwej kolejności kolumn. Jest to najbardziej czasochłonne podejście, ale pozwala uzyskać dokument o doskonałej strukturze. W przypadku 10-stronicowego artykułu w dwóch kolumnach ręczne przywracanie zajmuje od 15 do 30 minut, w zależności od złożoności układu.

Użyj oryginalnego pliku PDF jako wizualnego odniesienia podczas ręcznego przywracania kolumn. Otwórz plik PDF po jednej stronie ekranu i dokument Word po drugiej. Przeglądaj dokument strona po stronie, sprawdzając, czy tekst w każdej kolumnie dokumentu Word odpowiada tekstowi w odpowiedniej kolumnie pliku PDF. To bezpośrednie porównanie wyłapuje źle uporządkowane akapity, które w przeciwnym razie pozostałyby niezauważone. Dodatkowy czas weryfikacji jest przydatny w przypadku dokumentów, w których struktura kolumn ma znaczenie, np. analiz porównawczych, w których lewa i prawa kolumna przedstawiają kontrastujące punkty widzenia.

Często zadawane pytania

Czy lepiej jest konwertować cały plik PDF na raz, czy strona po stronie w przypadku dokumentów zawierających duże kolumny? Konwersja całego dokumentu na raz zapewnia algorytmowi wykrywania więcej danych do wykorzystania. Potrafi zidentyfikować spójne wzorce kolumn na stronach i zastosować je równomiernie. Konwersja strona po stronie zmusza algorytm do ponownego wykrycia struktury kolumn dla każdej strony z osobna, co może dawać niespójne wyniki, nawet jeśli układ kolumn jest taki sam na wszystkich stronach.

Czy mogę skonfigurować szablon programu Word pasujący do moich typowych układów kolumn w formacie PDF, aby konwersje były bardziej przewidywalne? Tak. Utwórz szablon programu Word z odpowiednią liczbą kolumn, marginesów i ustawieniami czcionki. Po przekonwertowaniu pliku PDF na Word zaimportuj przekonwertowany tekst do szablonu. Szablon zapewnia strukturę kolumny, a zaimportowany tekst ją wypełnia. Takie podejście oddziela definicję układu od wyodrębniania zawartości i zapewnia bardziej spójne wyniki w przypadku wielokrotnych konwersji plików PDF o podobnej strukturze.

Czy mogę przekonwertować plik PDF zawierający trzy lub więcej kolumn do formatu Word i zachować wszystkie kolumny nienaruszone?

Tak, ale wskaźnik sukcesu maleje wraz ze wzrostem liczby kolumn. Układy dwukolumnowe dobrze konwertują się przy użyciu nowoczesnych narzędzi. Układy trzykolumnowe można konwertować w zadowalający sposób przy użyciu najlepszych narzędzi, ale mogą wymagać pewnych porządków. Układy z czterema lub większą liczbą kolumn, takie jak gęste strony gazet, prawie zawsze wymagają ręcznej pracy po konwersji. Wąskie kolumny pozostawiają niewiele miejsca na algorytm wykrywania, który może niezawodnie identyfikować białe znaki.

Czy konwersja pliku PDF opartego na kolumnach do programu Word wpływa na obrazy i grafikę pomiędzy kolumnami?

Obrazy obejmujące wiele kolumn są zwykle konwertowane poprawnie, ponieważ są wykrywane jako obiekty odrębne od tekstu. Obrazy osadzone w kolumnie, takie jak mała ilustracja umieszczona w tekście, mogą zakłócać wykrywanie kolumny, ponieważ obraz przerywa przepływ tekstu, który próbuje podążać algorytm. Po konwersji sprawdź, czy obrazy w pobliżu granic kolumn są prawidłowo ustawione i czy tekst przepływa wokół nich zgodnie z oczekiwaniami.

Czy zeskanowany dokument wielokolumnowy powinienem przekonwertować inaczej niż dokument cyfrowy?

Zeskanowane dokumenty muszą przejść przez OCR przed wykryciem kolumny, co dodaje krok, ale także zapewnia szansę. Silniki OCR przeznaczone do konwersji dokumentów często mają bardziej zaawansowaną analizę układu niż silniki wyodrębniania tekstu, ponieważ OCR został pierwotnie opracowany dla dokładnie tego przypadku użycia. Wysokiej jakości silnik OCR zastosowany do zeskanowanego dokumentu wielokolumnowego może zapewnić lepsze zachowanie kolumn niż silnik wyodrębniania tekstu zastosowany do równoważnego cyfrowego pliku PDF.

WukongPDF

Wypróbuj PDF do Worda

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →