PDF 製品マニュアルは、自己完結型の文書です。相互リンクされた HTML ページのセットは、ナビゲート可能な Web サイトです。前者を後者に変換すると、コンテンツは検索エンジンを通じて検索可能になり、ブラウザを備えたどのデバイスでもアクセスできるようになり、ドキュメント全体を再生成することなく簡単に更新できるようになります。 PDF Export から HTML への変換では、静的 PDF では提供できない Web ネイティブ ナビゲーションを追加しながら、コンテンツを保持します。
変換には、PDF を HTML として保存するだけではありません。各章または主要なセクションは、独自の HTML ページになります。内部相互参照はページ間のハイパーリンクになります。目次はナビゲーションのサイドバーまたはメニューになります。ページ番号は名前付きアンカーに置き換えられます。その結果、PDF マニュアルとして誕生したドキュメント Web サイトが誕生しました。
WukongPDF の Web to PDF ツールは双方向に動作し、Web コンテンツからの PDF 生成と PDF からの Web 対応エクスポートの両方をサポートします。

PDF からの HTML 構造の計画
変換する前に、PDF 構造を Web 構造にマッピングします。各 HTML ページの開始位置と終了位置を特定します。 10 章からなる 100 ページの PDF マニュアルは、序文、各章、付録が別ページとなり、約 10 ~ 12 ページの HTML ページになります。マッピングにより、変換により PDF ページごとに 1 つの HTML ファイルではなく、論理的な Web ナビゲーション構造が生成されます。
PDF 内のハイパーリンクとなる内部相互参照を特定します。 PDF 内の詳細については第 5 章を参照してくださいという文は、第 5 章の HTML ページへのクリック可能なリンクになります。目次のエントリはナビゲーション リンクになります。インデックス エントリは、参照されているセクションへのリンクになります。変換中にこの相互参照構造を保持すると、ドキュメントの使いやすさが維持されます。
PDF を Word に変換してみる
インストールは必要ありません。ブラウザで直接動作します。
方法 1: Microsoft Word 経由で HTML にエクスポート
Acrobat Pro の Word へのエクスポート機能またはオンラインコンバータを使用して、PDF を Word 形式に変換します。作成された DOCX を Microsoft Word で開きます。 Word の見出しスタイルを使用して、文書全体で一貫した見出し階層を確保します。各見出し 1 は、潜在的な HTML ページのブレークポイントになります。
Word で、[ファイル]、[名前を付けて保存] の順に移動し、形式ドロップダウンから [Web ページ]、[フィルター済み] を選択します。フィルター処理された HTML オプションは、標準の Web ページ オプションを肥大化させる Office 固有のマークアップを含まない、よりクリーンな HTML を生成します。 Word では、文書が画像が埋め込まれた単一の HTML ファイルとして保存されます。複数ページの出力の場合は、Word 文書を章ごとに個別のファイルに分割し、それぞれを HTML として保存します。
方法 2: 専用の PDF-to-HTML コンバータ
PDF を構造化 HTML に変換することに特化したツールがいくつかあります。 Adobe Acrobat Pro の「ファイル」、「エクスポート」の下にある「HTML にエクスポート」オプションを使用すると、単純なレイアウトで適切な結果が得られます。出力では、テキストの書式設定、画像の配置、および基本的なテーブル構造が保持されます。 PDF 内のリンクは HTML ハイパーリンクに変換されます。
より複雑な PDF の場合は、専門の変換サービスや pdf2htmlEX などのオープンソース ツールを使用して、より忠実度の高い出力を生成します。 pdf2htmlEX は、各 PDF ページを、正確に配置されたテキストと画像を含む HTML ページに変換し、正確な視覚的なレイアウトを保持します。その代償として、HTML は意味論的な構造化ではなくレイアウトに重点が置かれているため、構造化されたコンテンツから構築された HTML よりも編集と保守が難しくなります。
方法 3: 最高の品質を得るために手動で HTML を再構築する
ドキュメントのワークフローに関して言えば、品質と保守性が重要なマニュアルの場合、コンテンツを抽出して HTML で再構築することが最良の結果をもたらします。クリーンな段落抽出に関する章で説明されている手法を使用して、PDF からすべてのテキストを抽出します。すべての画像を最大解像度で抽出します。静的サイト ジェネレーターまたは単純な HTML テンプレートを使用してページを組み立てます。
実際には、手動で再構築するアプローチは最初は時間がかかりますが、クリーンでセマンティックで更新が簡単な HTML が生成されます。製品が変更され、マニュアルの改訂が必要になった場合、PDF 全体を再エクスポートして再変換するよりも、適切に構造化された HTML ページを編集する方が高速です。クリーンな HTML への初期投資は、その後の更新サイクルごとに回収されます。
ページ間のインターナビゲーションの作成
各セクションを独自の HTML ページに変換した後、ページ間のナビゲーションを構築します。各ページの上部と下部に「前」と「次」のリンクを追加します。目次エントリからナビゲーション サイドバーを構築します。ドキュメント階層内の現在のページ位置を示すブレッドクラム ナビゲーションを追加します。
これを実際に見てみると、実際には、インターナビゲーションはスタンドアロンの HTML ページのコレクションを結合した Web ドキュメントに変換します。検索エンジンの結果からページにアクセスした読者は、検索結果に戻ることなく、隣接するページに移動できます。ナビゲーション構造は、コンテンツ内の読者の移動を尊重します。
変換された HTML の長期的な維持
変換された HTML ページは、ソース PDF が変更されたときに更新される必要がある生きたドキュメントです。更新を同期するプロセスを確立します。 PDF マニュアルが改訂された場合は、変更されたセクションを特定し、サイト全体を再生成するのではなく、それらの HTML ページのみを更新します。
HTML ソースを PDF ソースと一緒にバージョン管理に保存します。いずれかの形式の各リビジョンが追跡され、PDF セクションと HTML ページの関係が文書化されます。バージョン管理リポジトリは、マニュアルの PDF バージョンと HTML バージョンの両方の信頼できる唯一の情報源として機能します。
PDF マニュアルを相互リンクされた HTML ページに変換すると、ドキュメントのリーチが Web 検索、モバイル デバイス、ブラウザベースでの閲覧を好むユーザーにまで広がります。変換は 1 回限りの投資であり、以前はダウンロード可能なファイルとしてのみ存在していたコンテンツが継続的に Web 上に存在するようになります。
| 変換アプローチ | 努力 | 出力品質 |
|---|---|---|
| Word経由でHTMLにエクスポート | 低い | クリーンですが、複雑な書式が失われる可能性があります |
| 専用の PDF から HTML へのツール | 中くらい | 良好なレイアウト保存 |
| HTML での手動再構築 | 高い | 最高の品質、最大限のコントロール |
製品ドキュメント チームにとってドキュメント ワークフローに関して言えば、PDF から HTML への変換は、印刷物指向のオーサリング ワークフローと現代のユーザーが期待する Web ベースの配信との間のギャップを埋めます。 PDF は引き続き正式な印刷版です。 HTML は、アクセス可能、検索可能、リンク可能な Web バージョンを提供します。
変換された HTML をモバイル デバイス向けにレスポンシブにする
ほとんどのツールでは、PDF 変換による最初の HTML 出力では、通常、PDF ページの寸法に一致する固定幅レイアウトが使用されます。これは携帯電話やタブレットではうまく機能しません。変換後、さまざまな画面幅に合わせてコンテンツをリフローするレスポンシブ CSS を追加します。最大幅と柔軟な画像を備えたシンプルな応答性の高いラッパーは、変換されたコンテンツをモバイル画面に適応させます。
レスポンシブ デザインは、コンテンツ配信において PDF に比べて HTML が持つ主な利点の 1 つです。携帯電話で PDF を閲覧するには、ピンチしてズームする必要があります。レスポンシブ デザインの HTML ページでは、テキストが読みやすいサイズに自動的に再フォーマットされます。応答性の高い変換ステップは、基本的な形式の変換を超える価値を追加します。
検索エンジンのメタデータにより、変換された HTML ページの見つけやすさが向上します。
通常、変換された HTML ページは、PDF では不要だったメタデータの恩恵を受けます。タイトル タグ、メタ ディスクリプション、Open Graph タグを各ページに追加します。 HTML タイトルはセクションの見出しと一致する必要があります。メタディスクリプションでは、セクションの内容を 150 ~ 160 文字で要約する必要があります。これらの追加により、変換されたコンテンツが検索エンジンを通じて見つけられるようになります。
複数ページのドキュメント セットの場合は、すべての HTML ページをリストする sitemap.xml ファイルを追加します。サイトマップを検索エンジンに送信します。ページ間の内部リンクには、関連するキーワードを含む説明的なアンカー テキストを使用する必要があります。 SEO の追加機能により、変換された HTML が静的なドキュメント ダンプから検索に最適化された Web リソースに変換されます。
HTML変換中の画像とグラフィックの処理
PDF に埋め込まれた画像は、抽出して HTML ページ用の別の画像ファイルとして保存する必要があります。 Acrobat Pro HTML へのエクスポートでは、画像が自動的に抽出され、サブフォルダーに配置されます。 HTML は相対パスを使用して画像を参照します。 Web サーバーにアップロードするときに、画像フォルダーが HTML ファイルと一緒に移動することを確認してください。
ドキュメント処理の場合、図、スクリーンショット、または写真を含むマニュアルの場合、PDF 抽出からの画質は通常、Web 表示には十分です。通常、PDF 画像は印刷解像度であり、画面に必要な解像度よりも高くなります。 HTML エクスポートでは、画像が自動的にダウンサンプリングされる場合があります。出力画像の解像度を確認し、画像がピクセル化している場合や過度に大きい場合は、エクスポート設定を調整します。
一般に、PDF マニュアルの相互リンクされた HTML バージョンは、PDF だけでは到達できない読者にサービスを提供します。クエリを通じて特定のセクションを見つける検索エンジン ユーザー。レスポンシブなテキストを必要とするモバイル読者。 PDF よりも HTML の方が適切に機能する支援テクノロジーを使用しているユーザー。 HTML バージョンは、権威ある印刷版として PDF を置き換えることなく、ドキュメントの範囲を拡張します。
印刷物と Web の両方の視聴者にサービスを提供するドキュメントに関しては、PDF をマスターとして維持し、配布形式として HTML を生成することで、両方の長所が得られます。 PDF では印刷の忠実性が維持されます。 HTML は Web アクセシビリティを提供します。どちらも同じ権威あるコンテンツから派生したものです。
ドキュメント ワークフローに関しては、ほとんどのドキュメントについて、ここで説明する PDF から HTML への変換ワークフローは、人間の読者と検索エンジンの両方にサービスを提供する出力を生成します。 HTML バージョンは、PDF のオリジナルとは異なる方法で、検索可能、ナビゲート可能、およびアクセス可能です。 2 つの形式は相互に補完しており、PDF が正式なバージョンとして機能し、HTML がアクセス可能な配布形式として機能します。
ドキュメント チームに関しては、PDF と HTML の両方の形式でコンテンツを提供することで、ダウンロードして印刷したいユーザー、オンラインで読んだり検索したいユーザーなど、すべてのユーザーのニーズを満たします。デュアルフォーマットのアプローチにより、印刷して注釈を付ける必要がある人からオンラインで検索して読む人まで、あらゆる視聴者の好みにわたってドキュメントコンテンツのアクセシビリティと到達範囲が最大化されます。
PDF を Word に変換してみる
インストールは必要ありません。ブラウザで直接動作します。
