Folder plików HTML z wyeksportowanej witryny internetowej, zestawu dokumentacji lub zarchiwizowanej zawartości internetowej reprezentuje cenne informacje zamknięte w formacie zrozumiałym dla przeglądarek, ale nie dla systemów dokumentów. Konwersja tych plików na jeden połączony dokument PDF Batch pozwala zachować zawartość w formacie przenośnym, nadającym się do wydruku i archiwizacji. Proces konwersji nawiguje po plikach HTML, renderuje ich zawartość i składa wszystko w jeden plik PDF.
Zbiorcza konwersja plików HTML na pojedynczy plik PDF obejmuje dwa etapy: indywidualne renderowanie każdego pliku HTML na stronę lub sekcję PDF, a następnie łączenie tych pojedynczych wyników w jeden połączony dokument. Etap renderowania obsługuje formatowanie tekstu, osadzanie obrazów i zachowanie hiperłączy. Etap łączenia reguluje kolejność stron, spójne formatowanie i strukturę dokumentu.
Narzędzia do konwersji Web do PDF i Eksport PDF WukongPDF obsługują wsadową konwersję HTML do formatu PDF w celu przechowywania treści internetowych i archiwizacji dokumentacji.

Metoda 1: Drukowanie do pliku PDF z przeglądarki przy ręcznym składaniu
W przypadku niewielkiej liczby plików HTML, zwykle mniejszej niż 20, metoda drukowania do pliku PDF w przeglądarce w połączeniu z ręcznym składaniem działa odpowiednio. Otwórz każdy plik HTML w przeglądarce. Użyj Ctrl+P lub Cmd+P, aby otworzyć okno dialogowe drukowania. Ustaw miejsce docelowe na Zapisz jako PDF. Skonfiguruj ustawienia strony: wybierz właściwy rozmiar papieru, ustaw minimalne marginesy dla treści internetowych i włącz grafikę tła, aby zachować styl strony.
Zapisz każdy plik jako osobny plik PDF z opisową nazwą pliku zawierającą kolejność stron. Po zapisaniu wszystkich plików użyj narzędzia do scalania plików PDF, aby połączyć je w jeden dokument. W programie Acrobat Pro użyj narzędzia Połącz pliki. W przeglądarce skorzystaj z usługi scalania plików PDF online. Przed połączeniem uporządkuj pliki we właściwej kolejności.
Metoda przeglądarki zapewnia kontrolę nad renderowaniem każdej strony. Możesz dostosować ustawienia drukowania dla każdego pliku, aby obsługiwać strony o różnych układach, szerokościach lub wymaganiach dotyczących tła. Kompromisem jest ręczne otwieranie i zapisywanie każdego pliku z osobna, co staje się niepraktyczne w przypadku plików większych niż około 20.
Wypróbuj program Word do formatu PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Metoda 2: Konwersja z wiersza poleceń przy użyciu bezgłowego Chrome
W obiegach dokumentów, w przypadku wsadowej konwersji wielu plików HTML, przeglądarka bezgłowa zapewnia automatyzację. Headless Chrome działa bez widocznego interfejsu i może renderować HTML do formatu PDF za pomocą instrukcji wiersza poleceń. Polecenie chrome --headless --disable-gpu --print-to-pdf=output.pdf input.html renderuje pojedynczy plik HTML do formatu PDF.
Zawiń polecenie w skrypt powłoki, który przegląda wszystkie pliki HTML w folderze, renderuje każdy z nich do formatu PDF i nazywa pliki wyjściowe, aby zachować prawidłową kolejność stron. Pętla bash przetwarza cały folder: for f w *.html; wykonaj chrome --headless --print-to-pdf="${f%.html}.pdf” „$f”; zrobione. Po wyrenderowaniu wszystkich plików połącz poszczególne pliki PDF w jeden połączony dokument.
Headless Chrome zapewnia dokładne renderowanie odpowiadające temu, co zobaczy użytkownik otwierający plik HTML w zwykłym oknie przeglądarki. Styl CSS, treść wygenerowana przez JavaScript i czcionki internetowe renderują się poprawnie, ponieważ silnik renderujący jest identyczny ze standardową przeglądarką Chrome.
Metoda 3: Dedykowane narzędzia do konwersji HTML na PDF
Kilka narzędzi specjalizuje się w konwersji HTML na PDF z funkcjami przeznaczonymi do przetwarzania wsadowego. wkhtmltopdf to narzędzie wiersza poleceń typu open source, które konwertuje kod HTML do formatu PDF przy użyciu silnika renderującego WebKit. Obsługuje konwersję wsadową za pomocą skryptów powłoki i udostępnia opcje dotyczące rozmiaru strony, marginesów, zawartości nagłówka i stopki oraz generowania spisu treści.
Prince XML to komercyjne narzędzie, które generuje wysokiej jakości pliki PDF w formacie HTML i CSS. Jest używany w profesjonalnych procesach wydawniczych, w których liczy się jakość typograficzna. Prince obsługuje złożone układy CSS, w tym tekst wielokolumnowy, przypisy i stylizację specyficzną dla strony, tworząc wyniki odpowiednie do produkcji drukowanej.
Usługi konwersji online akceptują pliki ZIP zawierające treść HTML i zwracają połączone dane wyjściowe w formacie PDF. Usługi te są wygodne do okazjonalnego użytku i nie wymagają instalacji oprogramowania. Kompromis polega na tym, że pliki HTML są przesyłane na zdalny serwer w celu przetworzenia, co może nie być akceptowane w przypadku treści poufnych.
Zachowywanie hiperłączy podczas konwersji HTML na PDF
Wewnętrzne hiperłącza między plikami HTML, takie jak łącza nawigacyjne między stronami, należy zachować w połączonym pliku PDF jako wewnętrzne łącza do stron. Narzędzie do konwersji musi mapować odniesienia do oryginalnego pliku HTML na odpowiednie numery stron w pliku wyjściowym PDF. Nie wszystkie narzędzia do konwersji obsługują to mapowanie automatycznie.
wkhtmltopdf zachowuje linki wewnętrzne, jeśli jest skonfigurowany z flagą Enable-Local-File-access. Prince XML domyślnie zachowuje hiperłącza. Funkcja drukowania do formatu PDF w przeglądarce Headless Chrome nie konwertuje automatycznie wewnętrznych łączy HTML na wewnętrzne łącza PDF. Po konwersji ręcznie dodaj adnotacje do łączy w pliku PDF za pomocą narzędzia Link programu Acrobat Pro w przypadku kluczowych ścieżek nawigacji.
Zewnętrzne hiperłącza do innych stron internetowych są zachowywane przez większość narzędzi do konwersji jako klikalne łącza PDF. Przetestuj próbkę linków zewnętrznych w wyjściowym pliku PDF, aby upewnić się, że poprawnie przetrwały proces konwersji.
Zarządzanie numeracją stron i strukturą dokumentu
W praktyce połączony plik PDF z wielu plików HTML wymaga spójnej numeracji stron i logicznej struktury dokumentu. Po połączeniu dodaj numery stron za pomocą narzędzia Nagłówek i stopka programu Acrobat Pro. Utwórz stronę ze spisem treści, zawierającą listę głównych sekcji i numerów stron początkowych. Dodaj zakładki PDF dla każdej głównej sekcji, aby umożliwić nawigację na pasku bocznym.
Patrząc na to szerzej, w obiegach dokumentów, w przypadku zestawów dokumentacji HTML z jasną hierarchią, należy zachować tę hierarchię w strukturze PDF. Główna strona indeksu staje się okładką lub wprowadzeniem pliku PDF. Podstrony stają się sekcjami z odpowiadającymi im zakładkami. Struktura dokumentu pomaga czytelnikom nawigować po przekonwertowanej treści z taką samą łatwością, z jaką poruszali się po oryginalnej witrynie HTML.
Obsługa plików HTML z innym kodowaniem znaków
Pliki HTML wsadowe mogą używać innego kodowania znaków. Starsza strona korzystająca z ISO-8859-1 zmieszana z nowszymi stronami korzystającymi z UTF-8 powoduje zniekształcenie znaków w pliku PDF. Przed konwersją standaryzuj wszystkie pliki HTML do kodowania UTF-8. Użyj edytora tekstu lub narzędzia wiersza poleceń, takiego jak iconv, aby przekonwertować pliki inne niż UTF-8.
Po standaryzacji kodowania sprawdź, czy znaki specjalne są poprawnie renderowane w pliku PDF. Znaki z alfabetu innego niż łaciński, symbole matematyczne i cudzysłowy typograficzne są częstymi punktami awarii. Przed sfinalizowaniem połączonego pliku PDF sprawdź strony zawierające te znaki.
Optymalizacja obsługi obrazu podczas konwersji HTML na PDF
Pliki HTML mogą odwoływać się do obrazów przy użyciu ścieżek względnych, które ulegają uszkodzeniu podczas konwersji wsadowej. Przed konwersją zaktualizuj odniesienia do obrazów, podając ścieżki bezwzględne lub upewnij się, że narzędzie do konwersji potrafi rozpoznać ścieżki względne względem prawidłowego katalogu podstawowego. Brakujące obrazy w pliku PDF pojawiają się jako puste prostokąty z uszkodzonymi ikonami obrazów.
W przypadku plików HTML zawierających duże obrazy plik wyjściowy w formacie PDF może być nieoczekiwanie duży. Skonfiguruj narzędzie do konwersji, aby zmniejszać próbkowanie obrazów do rozdzielczości odpowiedniej do zamierzonego użycia pliku PDF. W plikach PDF do przeglądania ekranu można używać obrazów w rozdzielczości 150 DPI. Pliki PDF o jakości do druku wymagają obrazów w rozdzielczości 300 DPI.
Tworzenie spisu treści z tytułów stron HTML
Każda strona HTML ma znacznik tytułowy, który może służyć jako etykieta zakładki PDF. Po połączeniu plików PDF poszczególnych stron użyj tytułów stron, aby utworzyć zakładki PDF. W programie Acrobat Pro zakładki można tworzyć ręcznie lub za pomocą skryptu, który odczytuje znaczniki tytułu HTML i generuje odpowiednie wpisy zakładek.
Dobrze dodany do zakładek połączony plik PDF zapewnia nawigację równoważną nawigacji w oryginalnej witrynie HTML. Czytelnicy mogą rozwinąć drzewo zakładek, aby szybko zobaczyć strukturę dokumentu i kliknąć bezpośrednio do dowolnej sekcji. Hierarchia zakładek zachowuje strukturę organizacyjną oryginalnej treści HTML.
Weryfikacja połączonego wyniku PDF
Po utworzeniu połączonego pliku PDF sprawdź jego poprawność względem oryginalnej zawartości HTML. Sprawdź, czy wszystkie oczekiwane strony znajdują się we właściwej kolejności. Sprawdź, czy treść tekstowa jest poprawnie renderowana, bez obcięcia lub nakładania się. Sprawdź, czy obrazy pojawiają się i są prawidłowo umieszczone. Sprawdź, czy hiperłącza działają i wskazują właściwe miejsca docelowe.
Jeśli chodzi o przepływ pracy, w przypadku dużych zestawów dokumentów HTML należy zautomatyzować weryfikację za pomocą skryptu, który porównuje liczbę stron, sprawdza, czy nie ma uszkodzonych obrazów i sprawdza cele łączy. Automatyczna weryfikacja wychwytuje błędy konwersji, których nie udałoby się uzyskać przy ręcznym przeglądaniu setek stron. Weryfikacja stanowi bramę jakościową, zanim połączony plik PDF trafi do archiwum dokumentów.
Zachowanie metadanych podczas konwersji HTML na PDF
Pliki HTML często zawierają metadane, takie jak informacje o autorze, daty utworzenia i opisy w metatagach. Większość konwerterów HTML na PDF nie przesyła automatycznie tych metadanych do pliku PDF. Po konwersji dodaj ręcznie metadane dokumentu w programie Acrobat Pro poprzez opcję Plik, Właściwości, Opis. Wypełnij pola Tytuł, Autor, Temat i Słowa kluczowe z oryginalnych metadanych HTML.
Metadane są niezbędne dla systemów zarządzania dokumentami i wyszukiwarek. Można znaleźć połączony plik PDF z dokładnymi metadanymi. Połączony plik PDF bez metadanych to plik anonimowy, który można rozpoznać jedynie po nazwie. Poświęć kilka minut na uzupełnienie metadanych po konwersji.
Wsadowa konwersja HTML na PDF pozwala zachować treść internetową w formacie odpowiednim do drukowania, archiwizowania i dystrybucji offline. Opisane tutaj metody obejmują ręczną konwersję kilku plików w przeglądarce po w pełni zautomatyzowane przetwarzanie całych repozytoriów dokumentów z wiersza poleceń. Przekonwertowany plik PDF wydłuża żywotność treści HTML, umieszczając ją w formacie zaprojektowanym z myślą o długotrwałym przechowywaniu i powszechnej dostępności.
Rozpatrując to szeroko, w praktyce możliwość konwersji treści HTML do formatu PDF na żądanie gwarantuje, że cenne informacje internetowe pozostaną dostępne niezależnie od zmian w oryginalnej platformie hostingowej, aktualizacji kompatybilności przeglądarki lub ostatecznego zniknięcia oryginalnych źródeł internetowych. Inwestycja w konwersję zapewnia stały dostęp do treści, które w przeciwnym razie byłyby podatne na nietrwałość platform hostingowych i platform do zarządzania treścią online.
Wypróbuj program Word do formatu PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
