Tips & Tricks

Как преобразовать руководство в формате PDF в набор связанных HTML-страниц

Руководство по продукту в формате PDF является самостоятельным документом. Связанный набор HTML-страниц представляет собой веб-сайт с возможностью навигации. Преобразование первого во второе делает контент доступным для поиска через поисковые системы, доступным на любом устройстве с браузером и легко обновляемым без повторного создания всего документа. Преобразование PDF Export в HTML сохраняет содержимое, добавляя при этом встроенную веб-навигацию, которую не может обеспечить статический PDF-файл.

Преобразование включает в себя нечто большее, чем просто сохранение PDF-файла в формате HTML. Каждая глава или основной раздел становится отдельной HTML-страницей. Внутренние перекрестные ссылки становятся гиперссылками между страницами. Оглавление становится боковой панелью навигации или меню. Номера страниц заменяются именованными привязками. Результатом стал веб-сайт документации, который изначально представлял собой руководство в формате PDF.

Инструменты Web для PDF WukongPDF работают в двух направлениях, поддерживая как создание PDF-файлов из веб-контента, так и готовый к использованию экспорт из PDF-файлов.

How to Convert a PDF Manual Into a Set of Interlinked HTML Pages

Планирование структуры HTML из PDF

Перед преобразованием сопоставьте структуру PDF с веб-структурой. Определите, где будет начинаться и заканчиваться каждая HTML-страница. 100-страничное руководство в формате PDF с 10 главами превращается примерно в 10–12 страниц HTML, где введение, каждая глава и приложения представляют собой отдельные страницы. Сопоставление гарантирует, что преобразование создает логическую структуру веб-навигации, а не один HTML-файл на страницу PDF.

Определите внутренние перекрестные ссылки в PDF-файле, которые станут гиперссылками. Чтение предложения (подробнее см. в главе 5 в PDF-файле) становится кликабельной ссылкой на HTML-страницу главы 5. Записи оглавления становятся навигационными ссылками. Записи указателя становятся ссылками на разделы, на которые они ссылаются. Сохранение этой структуры перекрестных ссылок во время преобразования обеспечивает удобство использования документа.

WukongPDF

Попробуйте PDF в Word

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Метод 1: Экспорт в HTML через Microsoft Word

Преобразуйте формат PDF в Word с помощью функции «Экспорт в Word» Acrobat Pro или онлайн-конвертера. Откройте полученный DOCX в Microsoft Word. Используйте стили заголовков Word, чтобы обеспечить единообразную иерархию заголовков во всем документе. Каждый заголовок 1 становится потенциальной точкой разрыва HTML-страницы.

В Word перейдите в «Файл», «Сохранить как» и выберите «Веб-страница», «Отфильтровано» в раскрывающемся списке форматов. Параметр «Фильтрованный HTML» создает более чистый HTML-код без разметки, специфичной для Office, которая раздувает стандартный параметр «Веб-страница». Word сохраняет документ как один HTML-файл со встроенными изображениями. Для многостраничного вывода разделите документ Word на отдельные файлы по главам и сохраните каждый в формате HTML.

Метод 2: специальные преобразователи PDF в HTML

Несколько инструментов специализируются на преобразовании PDF-файлов в структурированный HTML. Параметр «Экспорт в HTML» в Adobe Acrobat Pro в разделе «Файл» и «Экспорт» дает достойные результаты для простых макетов. В выводе сохраняется форматирование текста, размещение изображений и базовые структуры таблиц. Ссылки внутри PDF-файла преобразуются в гиперссылки HTML.

Для более сложных PDF-файлов специализированные службы преобразования и инструменты с открытым исходным кодом, такие как pdf2htmlEX, обеспечивают более высокое качество вывода. pdf2htmlEX преобразует каждую страницу PDF в страницу HTML с точно расположенным текстом и изображениями, сохраняя точный визуальный макет. Компромисс заключается в том, что HTML ориентирован на макет, а не на семантическую структуру, что затрудняет его редактирование и поддержку, чем HTML, построенный на основе структурированного контента.

Метод 3: Ручная перестройка HTML для наилучшего качества

Когда дело доходит до рабочих процессов с документами, для руководства, где качество и удобство обслуживания имеют значение, извлечение содержимого и его перестройка в HTML дает наилучший результат. Извлеките весь текст из PDF-файла, используя методы, описанные в главе «Чистое извлечение абзацев». Извлеките все изображения в полном разрешении. Используйте генератор статических сайтов или простой HTML-шаблон для сборки страниц.

На практике метод ручной перестройки изначально требует больше времени, но создает чистый, семантический и легко обновляемый HTML. Когда продукт меняется и руководство требует пересмотра, редактирование хорошо структурированной HTML-страницы происходит быстрее, чем повторный экспорт и повторное преобразование всего PDF-файла. Первоначальные инвестиции в чистый HTML окупаются при каждом последующем цикле обновления.

Создание внутренней навигации между страницами

После преобразования каждого раздела в отдельную HTML-страницу создайте навигацию между страницами. Добавьте ссылки «Предыдущая» и «Далее» вверху и внизу каждой страницы. Создайте боковую панель навигации из записей оглавления. Добавьте навигационную цепочку, показывающую текущую позицию страницы в иерархии документа.

Если посмотреть на это практически, то на практике межнавигация преобразует набор отдельных HTML-страниц в единый веб-документ. Читатель, попадающий на страницу из результатов поисковой системы, может перейти на соседние страницы, не возвращаясь к результатам поиска. Структура навигации учитывает путешествие читателя по контенту.

Сохранение преобразованного HTML в течение длительного времени

Преобразованные HTML-страницы представляют собой живые документы, которые следует обновлять при изменении исходного PDF-файла. Наладьте процесс синхронизации обновлений. При пересмотре руководства в формате PDF определите, какие разделы были изменены, и обновите только эти HTML-страницы, а не перегенерируйте весь сайт.

Сохраните исходный код HTML в системе контроля версий вместе с исходным кодом PDF. Каждая редакция любого формата отслеживается, а взаимосвязь между разделами PDF и страницами HTML документируется. Репозиторий контроля версий служит единым источником достоверной информации как для PDF-, так и для HTML-версий руководства.

Преобразование руководства в формате PDF в связанные между собой HTML-страницы расширяет доступ к документу для веб-поиска, мобильных устройств и пользователей, предпочитающих чтение в браузере. Преобразование — это разовая инвестиция, обеспечивающая постоянное присутствие в Интернете контента, который ранее существовал только в виде загружаемого файла.

Подход к преобразованиюУсилиеКачество вывода
Экспорт в HTML через WordНизкийЧисто, но может потеряться сложное форматирование.
Специальный инструмент преобразования PDF в HTMLСерединаХорошая сохранность макета
Ручная перестройка в HTMLВысокийЛучшее качество, максимальный контроль

Когда дело доходит до рабочих процессов с документами, для групп по документации продуктов преобразование PDF в HTML устраняет разрыв между рабочими процессами создания документов, ориентированными на печать, и доставкой через Интернет, которую ожидают современные пользователи. PDF остается авторитетной печатной версией. HTML обеспечивает доступную веб-версию с возможностью поиска и ссылками.

Как сделать конвертированный HTML адаптивным для мобильных устройств

В большинстве инструментов первоначальный вывод HTML в результате преобразования PDF обычно использует макеты фиксированной ширины, соответствующие размерам страницы PDF. Это не очень хорошо работает на телефонах и планшетах. После преобразования добавьте адаптивный CSS, который перекомпонует содержимое для экрана разной ширины. Простая адаптивная оболочка максимальной ширины и гибких изображений адаптирует конвертированный контент к экранам мобильных устройств.

Адаптивный дизайн — одно из основных преимуществ HTML перед PDF для доставки контента. PDF-файл, просматриваемый на телефоне, требует для чтения масштабирования. HTML-страница с адаптивным дизайном автоматически форматирует текст до читаемого размера. Шаг адаптивного преобразования добавляет ценность помимо преобразования базового формата.

Метаданные поисковых систем улучшают обнаружение конвертированных HTML-страниц:

Обычно преобразованные HTML-страницы используют метаданные, которые не нужны в PDF. Добавьте теги заголовков, метаописания и теги Open Graph на каждую страницу. HTML-заголовок должен соответствовать заголовку раздела. Метаописание должно суммировать содержание раздела и содержать от 150 до 160 символов. Эти дополнения делают преобразованный контент доступным для поиска через поисковые системы.

Для многостраничных наборов документации добавьте файл sitemap.xml со списком всех HTML-страниц. Отправьте карту сайта в поисковые системы. Внутренние ссылки между страницами должны использовать описательный якорный текст, включающий соответствующие ключевые слова. Дополнения SEO преобразуют преобразованный HTML из статического дампа документа в веб-ресурс, оптимизированный для поиска.

Обработка изображений и графики во время преобразования HTML

Изображения, встроенные в PDF-файл, необходимо извлечь и сохранить как отдельные файлы изображений для страниц HTML. Acrobat Pro Export to HTML автоматически извлекает изображения и помещает их в подпапку. HTML ссылается на изображения по относительным путям. Убедитесь, что папка с изображениями перемещается вместе с файлами HTML при загрузке на веб-сервер.

При обработке документов, например, для руководств с диаграммами, снимками экрана или фотографиями, качество изображения из PDF-файла обычно достаточно для отображения в Интернете. Изображения PDF обычно имеют разрешение печати, которое выше, чем необходимо для экранов. Экспорт HTML может автоматически уменьшать разрешение изображений. Проверьте разрешение выходного изображения и отрегулируйте настройки экспорта, если изображения кажутся пикселизированными или слишком большими.

Как правило, связанная HTML-версия руководства в формате PDF предназначена для тех аудиторий, которых не может охватить сам PDF-файл. Пользователи поисковых систем, которые находят определенный раздел по запросу. Мобильные читатели, которым нужен адаптивный текст. Пользователи со вспомогательными технологиями, которые лучше работают с HTML, чем с PDF. Версия HTML расширяет возможности документа, не заменяя PDF как авторитетную версию для печати.

Что касается документации, предназначенной как для печатной, так и для веб-аудитории, поддержка PDF в качестве основного и создание HTML в качестве формата распространения обеспечивают лучшее из обоих миров. PDF сохраняет точность печати. HTML обеспечивает доступность через Интернет. Оба основаны на одном и том же авторитетном содержании.

Что касается рабочих процессов с документами, то для большинства документов описанный здесь рабочий процесс преобразования PDF в HTML создает выходные данные, которые подходят как читателям, так и поисковым системам. HTML-версия доступна для обнаружения, навигации и доступа так, как оригинал PDF не может сравниться. Эти два формата дополняют друг друга: PDF служит авторитетной версией, а HTML — доступным форматом распространения.

Что касается групп документации, то предложение контента в форматах PDF и HTML отвечает потребностям всех пользователей: тех, кто предпочитает загружать и распечатывать, и тех, кто предпочитает читать и искать в Интернете. Двухформатный подход максимизирует доступность и охват содержимого документации для всех предпочтений аудитории: от тех, кому нужно распечатывать и комментировать, до тех, кто ищет и читает в Интернете.

WukongPDF

Попробуйте PDF в Word

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →