Tips & Tricks

Как перевести только замещающий текст и метки доступности в PDF-файле с тегами, не затрагивая видимый контент

PDF-файл с тегами содержит скрытые метаданные специальных возможностей, которые программы чтения с экрана используют для описания изображений, таблиц и структуры документа для пользователей с ослабленным зрением. Видимый текст на странице может быть на английском языке, тогда как описания альтернативного текста, сводки таблиц и структурные метки должны быть доступны на нескольких языках для международной аудитории. Для перевода только этого скрытого слоя, не затрагивая видимое содержимое документа, требуется работа напрямую со структурой тегов PDF-файла, а это возможность, которой не хватает большинству инструментов перевода общего назначения.

Стандарт PDF/UA (универсальная доступность, ISO 14289) требует, чтобы PDF-файлы с тегами предоставляли альтернативный текст для всех элементов нетекстового содержимого. В многоязычной организации для контракта, написанного на французском языке, может потребоваться, чтобы его альтернативный текст был доступен на английском, немецком и голландском языках, чтобы специалисты по проверке доступности в каждой стране могли проверить соответствие. Перевод всего документа был бы ненужным и дорогостоящим. Внимания требуют лишь несколько сотен слов замещающего текста и структурных меток. Эта задача попадает в узкую категорию, которая находится между полным документом Translate PDF и ручным редактированием специальных возможностей, и немногие организации установили для нее стандартный рабочий процесс.

Последствия непереведенных метаданных о доступности более значительны, чем могут показаться. Пользователь программы чтения с экрана, получающий доступ к контракту на французском языке с замещающим текстом только на английском языке, услышит описания на английском языке, прерывающие содержание на французском языке, создавая сбивающее с толку и дезориентирующее впечатление. Для государственных учреждений и финансируемых государством организаций, на которых распространяются правила доступности, это представляет собой пробел в соблюдении требований, который может иметь юридические последствия. Перевод уровня доступности нежелателен для многоязычных организаций. Это часть выполнения обязательств по обеспечению доступности на всех языках, которые обслуживает организация.

How to Translate Only the Alt Text and Accessibility Labels in a Tagged PDF Without Affecting Visible Content

Понимание структуры тегов PDF и местонахождения замещающего текста

PDF-файл с тегами организует свое содержимое в виде дерева логической структуры с такими элементами, как «Документ», «Часть», «Раздел», «P», «Таблица», «Рисунок» и «Формула». Каждый элемент может иметь атрибуты, и критически важным для перевода является запись /Alt, в которой хранится альтернативное текстовое описание. Элемент «Рисунок», представляющий диаграмму, может иметь запись /Alt, содержащую «Гистограмму, показывающую квартальный рост доходов с 1 квартала 2022 года по 4 квартал 2024 года с увеличением на 12 процентов по сравнению с аналогичным периодом прошлого года». Этот текст никогда не отображается на видимой странице. Он существует исключительно в структуре тегов для использования программой чтения с экрана.

Запись /Alt представляет собой текстовую строку, хранящуюся либо в виде строкового объекта PDF, либо в виде строки с экранированием XML в помеченном содержимом документа. Для его извлечения, перевода и обратной записи без нарушения окружающей структуры тегов требуется инструмент, который может анализировать размеченное содержимое PDF-файла на уровне объекта. Большинство редакторов PDF, отображающих дерево тегов на панели специальных возможностей, могут редактировать отдельные записи /Alt, но перевод десятков или сотен из них вручную выполняется медленно и подвержено ошибкам, причем каждая запись требует отдельного цикла открытия-редактирования-сохранения.

Помимо записей /Alt, существуют и другие переводимые элементы специальных возможностей. Атрибут /Summary элементов Table предоставляет текстовый обзор структуры и назначения таблицы. Запись /ActualText в элементах Span может переопределить визуальный текст для программ чтения с экрана, что полезно, когда визуальный текст представляет собой сокращение, которое необходимо расширить. Описания полей формы, хранящиеся в записи /TU (подсказка), также требуют перевода. Полный перевод для обеспечения доступности охватывает все эти элементы. Для 50-страничного контракта с 30 рисунками, 15 таблицами и 40 полями форм общий объем переводимого текста специальных возможностей может составлять от 2000 до 3000 слов, что достаточно для того, чтобы переводчик потратил на него часть дня, но гораздо меньше, чем на перевод всего текста документа.

WukongPDF

Попробуйте перевести PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Извлечение текста специальных возможностей для перевода

Первым шагом является инвентаризация того, что нуждается в переводе. Используйте средство проверки доступности PDF-файлов или средство просмотра тегов, чтобы экспортировать список всех записей /Alt, /Summary, /ActualText и /TU в документе. Большинство инструментов проверки доступности, включая встроенную программу проверки доступности в Adobe Acrobat Pro, могут создавать отчет, показывающий каждый элемент тега с этими атрибутами и их текущими текстовыми значениями. Экспортируйте этот список в структурированный формат, например CSV, со столбцами для типа тега, идентификатора элемента, исходного текста и пустого столбца перевода.

Отправьте исходные текстовые строки переводчику или в службу машинного перевода. Структурированный формат гарантирует, что каждая переведенная строка остается связанной со своим исходным элементом, что важно для записи переводов обратно в правильные места. Чтобы обеспечить соответствие PDF Accessibility, переводы должны соответствовать тем же стандартам качества, что и исходный замещающий текст. Хорошее альтернативное текстовое описание должно быть кратким, обычно не более 150 символов, и описывает содержимое и функцию элемента, а не его внешний вид. Перевод должен сохранить эту краткость и функциональную направленность.

WukongPDF поддерживает редактирование тегов PDF и атрибутов доступности на уровне отдельных элементов, что делает удобным обновление переводов замещающего текста, не затрагивая видимое содержимое страницы. Редактор структурированных тегов отображает полную иерархию элементов со всеми переводимыми атрибутами, а функция пакетного обновления позволяет импортировать переводы из файла CSV и применять их к нужным элементам за одну операцию.

Запись переводов обратно в структуру тегов

После получения переводов для этапа обратной записи требуется инструмент, который может перемещаться по дереву тегов PDF и обновлять значения отдельных атрибутов. Откройте PDF-файл в редакторе тегов, который показывает полное дерево структуры. Для каждого переведенного элемента найдите элемент в дереве, выберите его /Alt или другой атрибут и вставьте переведенный текст. Сохраните файл, когда все записи будут обновлены. Проверьте результат с помощью программы чтения с экрана или инструмента проверки специальных возможностей. Перемещайтесь по документу с активной программой чтения с экрана и убедитесь, что каждое переведенное описание читается на ожидаемом языке.

Для документов, которые будут распространяться на нескольких языках, подумайте, должен ли PDF-файл содержать все языковые версии замещающего текста в одном файле или следует создавать отдельные PDF-файлы для конкретного языка. Спецификация PDF поддерживает теги языка на уровне элемента, поэтому один файл теоретически может содержать замещающий текст на английском языке (рис. 1) и замещающий текст на французском языке (рис. 2). Однако поддержка программы чтения с экрана для переключения языка для каждого элемента непоследовательна в разных приложениях для чтения с экрана. Если соблюдение специальных возможностей является требованием, отдельные PDF-файлы для каждого языка являются более безопасным и надежным выбором для тестирования.

Автоматизация рабочего процесса для больших наборов документов

Для организаций, которым необходимо локализовать метаданные доступности в сотнях или тысячах PDF-файлов, метод обратной записи вручную не масштабируется. В этих случаях извлечение, перевод и обратная запись должны быть запрограммированы. Используйте библиотеку PDF, поддерживающую доступ к структуре тегов, например Apache PDFBox для Java или pikepdf для Python, чтобы программно извлекать все переводимые атрибуты, отправлять их в API перевода и записывать результаты обратно.

Сценарий должен регистрировать каждый атрибут, который он изменяет, и создавать отчет о сравнении до и после, чтобы человек-рецензент мог выборочно проверить переводы. Автоматизация рабочего процесса снижает стоимость каждого документа, но повышает риск системных ошибок, таких как неправильно переведенный термин, который появляется в десятках описаний замещающего текста и обнаруживается только после распространения. Пакетная проверка случайной выборки, а также целевая проверка любых переводов, помеченных API перевода как низкодостоверные, обеспечивают баланс между эффективностью и качеством и обеспечивают обоснованную гарантию качества.

WukongPDF

Попробуйте перевести PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →