エクスポートされた Web サイト、ドキュメント セット、またはアーカイブされた Web コンテンツからの HTML ファイルのフォルダーは、ブラウザーには理解できるがドキュメント システムには理解できない形式でロックされた貴重な情報を表します。これらのファイルを 1 つの結合された PDF Batch ドキュメントに変換すると、コンテンツが移植可能、印刷可能、アーカイブ可能な形式で保存されます。変換プロセスでは、HTML ファイルをナビゲートし、そのコンテンツをレンダリングし、すべてを 1 つの PDF に組み立てます。
HTML ファイルを 1 つの PDF にバッチ変換するには、各 HTML ファイルを PDF ページまたはセクションに個別にレンダリングし、次にそれらの個別の出力を 1 つの結合ドキュメントに結合する 2 つの段階が必要です。レンダリング段階では、テキストの書式設定、画像の埋め込み、ハイパーリンクの保存が処理されます。結合ステージでは、ページの順序付け、一貫した書式設定、および文書構造が処理されます。
WukongPDF の Web to PDF および PDF Export 変換ツールは、Web コンテンツの保存とドキュメントのアーカイブのための HTML から PDF へのバッチ変換を処理します。

方法 1: 手動アセンブリを使用したブラウザーから PDF への印刷
HTML ファイルの数が少ない場合 (通常は 20 未満)、ブラウザで PDF に出力する方法と手動アセンブリを組み合わせた方法が適切に機能します。各 HTML ファイルをブラウザで開きます。 Ctrl+P または Cmd+P を使用して、印刷ダイアログを開きます。保存先を「PDFとして保存」に設定します。ページ設定を構成します。正しい用紙サイズを選択し、Web コンテンツの余白を最小限に設定し、背景グラフィックを有効にしてページのスタイルを保持します。
各ファイルを、ページ順序を含むわかりやすいファイル名を付けて個別の PDF として保存します。すべてのファイルを保存した後、PDF 結合ツールを使用してそれらを 1 つのドキュメントに結合します。 Acrobat Pro では、「ファイルの結合」ツールを使用します。ブラウザーで、オンライン PDF 結合サービスを使用します。マージする前に、ファイルを正しい順序に並べてください。
ブラウザー方式を使用すると、各ページのレンダリングを制御できます。ファイルごとに印刷設定を調整して、さまざまなレイアウト、幅、または背景要件を持つページを処理できます。その代償として、各ファイルを個別に開いて保存するという手動の作業が必要になり、約 20 ファイルを超えると現実的ではなくなります。
Word から PDF への変換を試してみる
インストールは必要ありません。ブラウザで直接動作します。
方法 2: ヘッドレス Chrome を使用したコマンドライン変換
ドキュメント ワークフローでは、多くの HTML ファイルをバッチ変換するために、ヘッドレス ブラウザーが自動化を提供します。ヘッドレス Chrome は、目に見えるインターフェイスなしで実行され、コマンドライン命令を通じて HTML を PDF にレンダリングできます。コマンド chrome --headless --disable-gpu --print-to-pdf=output.pdf input.html は、単一の HTML ファイルを PDF にレンダリングします。
このコマンドをシェル スクリプトでラップします。シェル スクリプトは、フォルダー内のすべての HTML ファイルを反復処理し、それぞれを PDF にレンダリングし、正しいページ順序を維持するために出力ファイルに名前を付けます。 bash ループはフォルダー全体を処理します。 chrome --headless --print-to-pdf="${f%.html}.pdf" を実行します。 "$f";終わり。すべてのファイルがレンダリングされたら、個々の PDF を 1 つの結合ドキュメントに結合します。
ヘッドレス Chrome は、ユーザーが通常のブラウザ ウィンドウで HTML ファイルを開いたときに表示されるものと一致する正確なレンダリングを提供します。レンダリング エンジンが標準の Chrome ブラウザと同一であるため、CSS スタイル、JavaScript で生成されたコンテンツ、および Web フォントはすべて正しくレンダリングされます。
方法 3: 専用の HTML から PDF への変換ツール
バッチ処理用に設計された機能を備えた、HTML から PDF への変換に特化したツールがいくつかあります。 wkhtmltopdf は、WebKit レンダリング エンジンを使用して HTML を PDF に変換するオープンソースのコマンドライン ツールです。シェル スクリプトによるバッチ変換をサポートし、ページ サイズ、余白、ヘッダーとフッターの内容、目次の生成のオプションを提供します。
Prince XML は、HTML と CSS から高品質の PDF 出力を生成する商用ツールです。これは、活版印刷の品質が重要なプロフェッショナルな出版ワークフローに使用されます。 Prince は、複数列のテキスト、脚注、ページ固有のスタイルなどの複雑な CSS レイアウトを処理し、印刷物制作に適した出力を生成します。
オンライン変換サービスは、HTML コンテンツの ZIP ファイルを受け入れ、結合された PDF 出力を返します。これらのサービスは時々使用するのに便利で、ソフトウェアのインストールは必要ありません。トレードオフとして、HTML ファイルは処理のためにリモート サーバーにアップロードされるため、機密コンテンツには受け入れられない可能性があります。
HTML から PDF への変換中のハイパーリンクの保持
ページ間のナビゲーション リンクなど、HTML ファイル間の内部ハイパーリンクは、結合された PDF に内部ページ リンクとして保存される必要があります。変換ツールは、元の HTML ファイル参照を PDF 出力内の対応するページ番号にマップする必要があります。すべての変換ツールがこのマッピングを自動的にサポートするわけではありません。
wkhtmltopdf は、enable-local-file-access フラグを使用して構成されている場合、内部リンクを保持します。 Prince XML はデフォルトでハイパーリンクを保持します。 Headless Chrome の print-to-pdf では、内部 HTML リンクが PDF 内部リンクに自動的に変換されません。変換後、重要なナビゲーション パスに対して Acrobat Pro のリンク ツールを使用して、PDF にリンク注釈を手動で追加します。
他の Web サイトへの外部ハイパーリンクは、ほとんどの変換ツールでクリック可能な PDF リンクとして保存されます。出力 PDF 内の外部リンクのサンプルをテストして、それらが変換プロセスで正しく存続することを確認します。
ページ番号と文書構造の管理
実際には、複数の HTML ファイルから結合された PDF には、一貫したページ番号と論理的な文書構造が必要です。結合後に Acrobat Pro のヘッダーおよびフッターツールを使用してページ番号を追加します。主要なセクションとその開始ページ番号をリストした目次ページを作成します。各主要セクションに PDF ブックマークを追加して、サイドバー ナビゲーションを有効にします。
これを広く見ると、ドキュメント ワークフローでは、明確な階層を持つ HTML ドキュメント セットの場合、その階層を PDF 構造内に保持します。メインのインデックスページはPDFの表紙または紹介文になります。サブページは、対応するブックマークを含むセクションになります。このドキュメント構造により、読者は元の HTML サイトをナビゲートするのと同じように、変換されたコンテンツを簡単にナビゲートできます。
異なる文字エンコーディングを持つ HTML ファイルの処理
バッチ内の HTML ファイルでは、異なる文字エンコーディングが使用される場合があります。 ISO-8859-1 を使用する古いページと UTF-8 を使用する新しいページが混在すると、PDF 出力で文字化けが発生します。変換する前に、すべての HTML ファイルを UTF-8 エンコーディングに標準化します。非 UTF-8 ファイルを変換するには、テキスト エディターまたは iconv などのコマンド ライン ツールを使用します。
エンコードを標準化した後、PDF 出力で特殊文字が正しく表示されることを確認します。非ラテン文字の文字、数学記号、印刷上の引用符は、一般的な障害点です。結合された PDF を完成させる前に、これらの文字を含むページを抜き取りチェックします。
HTML から PDF への変換中の画像処理の最適化
HTML ファイルでは、バッチ変換中に壊れる相対パスを使用して画像を参照する場合があります。変換する前に、イメージ参照を絶対パスに更新するか、変換ツールが正しいベース ディレクトリに対して相対パスを解決できることを確認してください。 PDF 出力で画像が欠落していると、画像アイコンが壊れた空の四角形として表示されます。
大きな画像を含む HTML ファイルの場合、PDF 出力が予想外に大きくなる可能性があります。 PDF の用途に適した解像度に画像をダウンサンプリングするように変換ツールを構成します。画面表示 PDF では 150 DPI の画像を使用できます。印刷品質の PDF には 300 DPI の画像が必要です。
HTML ページ タイトルから目次を作成する
各 HTML ページには、PDF ブックマーク ラベルとして機能するタイトル タグがあります。個々のページ PDF を結合した後、ページ タイトルを使用して PDF ブックマークを作成します。 Acrobat Pro では、ブックマークは手動で作成することも、HTML タイトルタグを読み取って対応するブックマークエントリを生成するスクリプトを通じて作成することもできます。
適切にブックマークされた結合 PDF は、元の HTML サイト ナビゲーションと同等のナビゲーションを提供します。読者はブックマーク ツリーを展開して文書構造を一目で確認し、任意のセクションに直接クリックできます。ブックマーク階層は、元の HTML コンテンツの組織構造を保持します。
結合された PDF 出力の検証
結合された PDF を作成した後、元の HTML コンテンツと比較して検証します。予期されるすべてのページが正しい順序で存在していることを確認してください。テキスト コンテンツが切り詰められたり重複したりすることなく正しくレンダリングされていることを確認します。画像が表示され、正しく配置されていることを確認します。ハイパーリンクが機能し、正しいリンク先を指していることを確認します。
ワークフローに関しては、大規模な HTML ドキュメント セットの場合、ページ数の比較、壊れた画像のチェック、リンク ターゲットの検証を行うスクリプトを使用して検証を自動化します。自動検証により、何百ページもの手動レビューでは見逃される変換エラーが検出されます。検証は、結合された PDF がドキュメント アーカイブに入る前の品質ゲートです。
HTML から PDF への変換中のメタデータの保持
HTML ファイルには、作成者情報、作成日、メタ タグ内の説明などのメタデータが含まれることがよくあります。ほとんどの HTML から PDF へのコンバーターは、このメタデータを PDF に自動的に転送しません。変換後、Acrobat Pro で「ファイル」、「プロパティ」、「説明」を使用してドキュメントのメタデータを手動で追加します。元の HTML メタデータからタイトル、作成者、件名、およびキーワードのフィールドを入力します。
メタデータは文書管理システムや検索エンジンにとって不可欠です。正確なメタデータを含む結合された PDF を検出できます。メタデータのない結合 PDF は、ファイル名によってのみ識別できる匿名ファイルです。変換後にメタデータを入力するには数分を費やしてください。
HTML から PDF へのバッチ変換により、Web コンテンツが印刷、アーカイブ、オフライン配布に適した形式で保存されます。ここで説明する方法は、いくつかのファイルの手動のブラウザベースの変換から、ドキュメント リポジトリ全体の完全に自動化されたコマンド ライン処理まで拡張できます。変換された PDF は、長期保存とユニバーサル アクセシビリティを考慮して設計された形式で HTML コンテンツを配置することで、HTML コンテンツの耐用年数を延ばします。
これを広く考えると、実際には、オンデマンドで HTML コンテンツを PDF に変換する機能により、元のホスティング プラットフォームの変更、ブラウザーの互換性の更新、または元の Web ソースの最終的な消滅に関係なく、貴重な Web ベースの情報にアクセスし続けることが保証されます。変換への投資により、Web ホスティングやオンライン コンテンツ管理プラットフォームの永続性の影響で脆弱になってしまうコンテンツへの継続的なアクセスが保証されます。
Word から PDF への変換を試してみる
インストールは必要ありません。ブラウザで直接動作します。
