Tips & Tricks

Jak usunąć puste linie podczas kopiowania tekstu z pliku PDF

Kopiowanie tekstu z pliku PDF i wklejanie go do programu Word lub edytora tekstu często powoduje powstanie bałaganu przerywanych linii. Każda linia pliku PDF staje się oddzielnym akapitem w wklejonym pliku wyjściowym, z twardymi podziałami linii, które uniemożliwiają edycję tekstu w formie ciągłej. Usunięcie niechcianych podziałów wierszy po konwersji lub kopiowaniu PDF do Word to zadanie czyszczenia formatowania, które można zautomatyzować za pomocą funkcji Znajdź i zamień oraz kilku skrótów klawiaturowych.

Najważniejsze wnioski

Ekstrakcja tekstu PDF umieszcza twardą linię podziału na końcu każdej wizualnej linii. Po wklejeniu do edytora tekstu każda linia staje się oddzielnym akapitem. Najszybszym rozwiązaniem jest funkcja Znajdź i zamień za pomocą symboli wieloznacznych, która usuwa podziały pojedynczymi wierszami, zachowując jednocześnie podziały podwójnych wierszy między prawdziwymi akapitami. Ta pojedyncza operacja w ciągu kilku sekund przekształca uszkodzony tekst w płynne akapity.

How to Remove Blank Lines When Copying Text From a PDF

Dlaczego tekst PDF jest kopiowany z tak dużą liczbą podziałów wierszy

Plik PDF przechowuje tekst jako pojedyncze obiekty liniowe, każdy umieszczony na stronie pod określonymi współrzędnymi. W przeciwieństwie do dokumentu edytora tekstu, w którym tekst przepływa w sposób ciągły z jednej linii do drugiej, w formacie PDF nie ma koncepcji płynącego tekstu. Każda linia jest osobnym obiektem. Kiedy kopiujesz tekst, proces wyodrębniania odczytuje te obiekty liniowe w kolejności i umieszcza podział wiersza po każdym z nich, ponieważ nie jest w stanie odróżnić podziału wiersza kończącego akapit od podziału wiersza będącego po prostu zawijaniem wiersza w akapicie.

Problem jest najbardziej widoczny w przypadku wielokolumnowych plików PDF i plików PDF utworzonych ze sformatowanych dokumentów tekstowych. Akapit zawijający się w pliku PDF wzdłuż czterech linii staje się po wklejeniu czterema oddzielnymi akapitami, każdy kończący się znakiem akapitu. Edycja tego tekstu wymaga ręcznego łączenia wierszy, co jest żmudne w przypadku więcej niż kilku akapitów. Metoda znajdź i zamień automatyzuje ponowne łączenie.

WukongPDF

Wypróbuj PDF do Worda

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Usuń podziały pojedynczych wierszy za pomocą funkcji Znajdź i zamień

Po użyciu funkcji Znajdź i zamień w celu połączenia linii przerywanych przeskanuj tekst pod kątem podziałów akapitów, które powinny były zostać zachowane, ale tak nie było. Najczęstszymi ofiarami są wypunktowania i listy numerowane, ponieważ każdy punktor lub numer znajduje się w osobnej linii. Metoda znajdź i zamień łączy je w jeden akapit. Ręcznie przywróć podziały wierszy przed każdym punktorem lub numerem. Ten etap czyszczenia zajmuje kilka minut, ale pozwala uzyskać dopracowany dokument końcowy.

Wklej skopiowany tekst do programu Word. Otwórz opcję Znajdź i zamień za pomocą Ctrl+H. W polu Znajdź wpisz ^p, aby dopasować znaki akapitu. W polu Zamień na wpisz pojedynczą spację. Kliknij Zamień wszystko. Każdy znak akapitu w dokumencie jest zastępowany spacją, łącząc cały tekst w jeden akapit. Jest to zbyt agresywne, ponieważ usuwa również znaki akapitów między autentycznymi akapitami. Aby to naprawić, najpierw chroń podwójne znaki akapitu oddzielające prawdziwe akapity. Zastąp najpierw ^p^p symbolem zastępczym, takim jak @@PARA@@. Następnie zastąp pozostałe pojedyncze znaki ^p spacjami. Na koniec zamień @@PARA@@ na ^p^p, aby przywrócić podziały akapitów.

Podejście polegające na znajdowaniu i zastępowaniu symboli wieloznacznych można rozszerzyć, aby obsługiwało bardziej złożone wzorce czyszczenia. Dokument zawierający nagłówki sekcji można zabezpieczyć, zastępując wzór tekstu nagłówka, taki jak wiersz kończący się dwukropkiem, po którym następuje znak akapitu, symbolem zastępczym przed ogólnym usunięciem podziału wiersza. Po połączeniu linii tekstu podstawowego przywróć podziały nagłówków z symboli zastępczych. Zachowuje to zarówno strukturę akapitów, jak i separację nagłówków.

W programie Word ten trzyetapowy proces zajmuje około 30 sekund i działa na tekście o dowolnej długości. Kluczem jest użycie symbolu zastępczego, który nie pojawia się nigdzie w tekście dokumentu. Po zastąpieniu podziałów pojedynczych wierszy tekst płynie w postaci ciągłych akapitów. Każdy oryginalny podział akapitu jest zachowywany jako podział podwójnej linii. Dokument można teraz edytować jak zwykłą prozę. Narzędzia PDF Format WukongPDF zachowują strukturę akapitu podczas konwersji, redukując ilość ręcznego czyszczenia podziału wierszy potrzebnego po kopiowaniu.

Użyj narzędzi do czyszczenia tekstu online w celu szybkich poprawek

Czyszczenie jednym kliknięciem oszczędza minuty ręcznej edycji linia po linii.

W przypadku tekstu skopiowanego z zeskanowanego pliku PDF i przetworzonego za pomocą OCR problem łamania wierszy jest spotęgowany przez błędy OCR. Każdy źle rozpoznany znak dodaje szumu do już uszkodzonego tekstu. W takim przypadku przeprowadź tekst przez moduł sprawdzania pisowni po usunięciu podziałów wierszy. Moduł sprawdzania pisowni wychwytuje błędy OCR, których nie można rozwiązać poprzez usunięcie podziału wiersza. Połączenie usuwania łamania wierszy i sprawdzania pisowni zapewnia najczystszy wydruk zeskanowanych dokumentów.

Kilka bezpłatnych narzędzi online specjalizuje się w czyszczeniu tekstu skopiowanego z plików PDF. Wklej skopiowany tekst do narzędzia, a ono automatycznie usunie podziały pojedynczych wierszy, zachowując podziały akapitów. Narzędzia te wykorzystują tę samą logikę, co ręczna metoda znajdowania i zamieniania, ale można ją zastosować jednym kliknięciem. Nadają się idealnie do jednorazowych zadań czyszczenia tekstu, gdzie skonfigurowanie funkcji Znajdź i zamień w programie Word wymaga więcej wysiłku, niż uzasadnia to zadanie.

Wybierając narzędzie do czyszczenia tekstu online, należy pamiętać, że wklejasz potencjalnie poufny tekst do witryny internetowej strony trzeciej. W przypadku dokumentów poufnych użyj ręcznej metody wyszukiwania i zamiany w aplikacji lokalnej, a nie w narzędziu internetowym. Metoda ręczna działa w trybie offline, przechowuje tekst na komputerze i daje identyczne wyniki.

Zapobiegaj problemom z łamaniem wierszy w przyszłych kopiach

Jakość wyodrębnienia tekstu zależy również od sposobu utworzenia pliku PDF. Pliki PDF generowane przez edytory tekstu mają zazwyczaj lepszą wewnętrzną kolejność tekstu niż pliki PDF utworzone w wyniku skanowania i OCR. Kolejność tekstu w pliku PDF wygenerowanym w edytorze tekstu jest zgodna z kolejnością czytania oryginalnego dokumentu. Kolejność tekstu w pliku PDF wygenerowanym przez OCR jest zgodna z porządkiem przestrzennym, w jakim silnik OCR rozpoznał tekst, który może nie odpowiadać kolejności czytania w układach wielokolumnowych lub złożonych.

Jeśli regularnie kopiujesz tekst z plików PDF, dostosuj swój przepływ pracy, aby zminimalizować obciążenie związane z czyszczeniem. Konwertuj plik PDF na Word przed skopiowaniem tekstu, zamiast kopiować bezpośrednio z przeglądarki plików PDF. Narzędzia do konwersji plików PDF na Word zostały zaprojektowane z myślą o obsłudze łączenia wierszy i tworzeniu płynnego tekstu. Przekonwertowany dokument programu Word nadal będzie wymagał oczyszczenia, ale znacznie mniej niż tekst skopiowany bezpośrednio z przeglądarki plików PDF.

Aby utworzyć pliki PDF, z których inni będą musieli kopiować tekst, włącz znaczniki dostępności podczas tworzenia pliku PDF. Oznaczone pliki PDF zawierają informacje o strukturze, które informują narzędzia do wyodrębniania tekstu, gdzie zaczynają się i kończą akapity. Tekst skopiowany z oznaczonego pliku PDF jest znacznie czystszy niż tekst z nieoznaczonego pliku PDF, ponieważ narzędzie do wyodrębniania używa znaczników struktury akapitów zamiast zgadywać granice akapitów na podstawie pozycji wierszy.

Podczas generowania plików PDF z programu Word włącz opcję „Tagi struktury dokumentu zwiększające dostępność” w ustawieniach eksportu PDF. Spowoduje to osadzenie informacji strukturalnych w pliku PDF, których narzędzia do wyodrębniania tekstu używają do identyfikowania granic akapitów. Tekst wyodrębniony ze oznaczonego pliku PDF ma znacznie mniej fałszywych podziałów wierszy, ponieważ narzędzie do wyodrębniania wie, gdzie zaczynają się i kończą akapity, na podstawie znaczników struktury, a nie zgaduje na podstawie pozycji wierszy.

Często zadawane pytania

Czy czcionka użyta w oryginalnym pliku PDF wpływa na czystość kopiowanego tekstu? Tak, znacznie. Pliki PDF korzystające ze standardowych czcionek PostScript lub TrueType z odpowiednim kodowaniem kopiują się bardziej czysto niż pliki PDF wykorzystujące czcionki niestandardowo zakodowane. Niektóre czcionki niestandardowe wykorzystują niestandardowe mapowania znaków, w których to, co wyświetla się jako litera A, jest przechowywane wewnętrznie jako zupełnie inny kod znaku. Podczas kopiowania tekstu z takiego pliku PDF wyodrębniony tekst może zawierać całkowicie błędne znaki. Nie ma innego rozwiązania problemów z kodowaniem czcionek niż ekstrakcja oparta na OCR.

Dlaczego wklejony tekst z pliku PDF czasami zawiera przypadkowe spacje w środku słów? Nazywa się to fragmentacją tekstu i ma miejsce, gdy plik PDF przechowuje pojedyncze znaki lub małe grupy znaków jako oddzielne obiekty tekstowe. Przeglądarka plików PDF wstawia spacje pomiędzy obiektami podczas wyodrębniania tekstu. Nie ma automatycznej poprawki. Jedynym rozwiązaniem jest ręczna korekta. Pliki PDF utworzone z właściwym osadzeniem czcionek i kodowaniem tekstu są mniej podatne na fragmentację.

Czy istnieje sposób na skopiowanie tekstu z pliku PDF bez łamania wierszy? Niektóre narzędzia do wyodrębniania plików PDF na tekst zgodnie z projektem tworzą ciągłe akapity. Narzędzia te analizują układ tekstu i łączą linie należące do tego samego akapitu. Dane wyjściowe są czystsze niż kopiowanie i wklejanie, ale wymagają użycia narzędzia do wyodrębniania zamiast standardowej metody zaznaczania i kopiowania. W przypadku częstego wyodrębniania tekstu inwestycja w dedykowane narzędzie do wyodrębniania pozwala zaoszczędzić znaczną ilość czasu na czyszczenie.

Dlaczego wklejony tekst PDF czasami zawiera dodatkowe spacje w środku wyrazów?

Dzieje się tak, gdy plik PDF przechowuje każdy znak lub małą grupę znaków jako osobne obiekty tekstowe z małymi przerwami między nimi. W procesie wyodrębniania tekstu wstawiana jest spacja w każdej luce. Nie ma automatycznego rozwiązania tego problemu, ponieważ spacje są nie do odróżnienia od prawidłowych spacji słów. Jedynym rozwiązaniem jest ręczna korekta i korekta. Tworzenie plików PDF z właściwym osadzeniem czcionek ogranicza występowanie fragmentacji tekstu na poziomie znaków.

Czy mogę skopiować tekst z tabeli PDF bez niszczenia wyrównania kolumn?

Standardowe kopiowanie i wklejanie nie zachowuje struktury tabeli. Tekst ze wszystkich kolumn jest wyodrębniany w kolejności czytania, tworząc pomieszaną sekwencję. Aby skopiować dane tabeli z zachowaniem kolumn, użyj narzędzia do konwersji plików PDF na Excel, które wykrywa strukturę tabeli. Dane wyjściowe programu Excel zachowują wyrównanie kolumn i można je kopiować z programu Excel z nienaruszoną strukturą.

Czy przeglądarka plików PDF wpływa na jakość kopiowania tekstu?

Tak. Ekstrakcja tekstu w programie Adobe Acrobat jest generalnie najczystsza. Przeglądarki oparte na przeglądarce często tworzą więcej podziałów wierszy, ponieważ są zoptymalizowane pod kątem wyświetlania, a nie ekstrakcji tekstu. Jeśli często kopiujesz tekst, użyj dedykowanego czytnika plików PDF do wyodrębnienia, a nie przeglądarki opartej na przeglądarce.

WukongPDF

Wypróbuj PDF do Worda

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →