Когда вы запускаете PDF-файл с помощью инструмента перевода, в полученном документе часто возникают проблемы с форматированием, выходящие за рамки простых изменений макета. Специальные символы, такие как математические символы, знаки валют и буквы с диакритическими знаками, могут быть заменены пустыми квадратами, вопросительными знаками или совершенно неправильными символами. Встроенные шрифты могут перестать отображаться, в результате чего целые разделы текста исчезнут или будут отображаться системным шрифтом по умолчанию. Понимание того, что происходит с символами и шрифтами PDF во время перевода, поможет вам предвидеть эти проблемы и выбрать правильный подход к переводу для документов, где точность символов имеет значение.
Основные выводы
Инструменты перевода PDF извлекают текстовый слой из документа, пропускают его через механизм машинного перевода и помещают переведенный текст обратно в исходный макет. Символы и специальные символы подвергаются риску на каждом этапе этого конвейера: извлечение может неправильно интерпретировать кодировку символов, механизм перевода может удалить или повредить неалфавитные символы, а при повторной вставке могут возникнуть проблемы с заменой шрифта, когда целевой язык использует символы, отсутствующие во встроенных шрифтах исходного документа.

Как PDF-перевод обрабатывает этап извлечения текста
Прежде чем осуществить какой-либо перевод, инструмент должен извлечь читаемый текст из PDF-файла. Для собственного цифрового PDF-файла со встроенным текстом это извлечение считывает коды символов из потоков содержимого документа и сопоставляет их со значениями Юникода, используя таблицу кодировки встроенного шрифта. Символы и специальные символы становятся проблематичными на этом этапе, когда таблица кодировки неполна, повреждена или использует пользовательское сопоставление, не соответствующее соглашениям Unicode. PDF-файл, созданный с помощью более старого программного обеспечения, может использовать нестандартную кодировку, при которой то, что выглядит как знак евро на экране, хранится внутри как код символа, который ничем не отображается в стандартных таблицах Unicode.
Если сопоставление кодировки завершается неудачей, процесс извлечения создает символы замены, обычно символ замены Юникода или вопросительный знак. Эта неудача происходит молча. Извлеченный текст на первый взгляд выглядит нормально, поскольку буквы и цифры вокруг символа в порядке, но знак валюты, математический оператор или буква с диакритическим знаком, которые имели решающее значение для значения документа, были потеряны еще до начала перевода. Этап извлечения, на котором не удается разрешить знак евро в финансовом PDF-файле, превращается в «Всего: 2500 евро». в «Всего: 2500»; или «Всего: 2500?» и переведенный вывод унаследует эту ошибку.
Попробуйте перевести PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
Что механизм перевода делает с символами и специальными символами
Механизмы машинного перевода оптимизированы для текста на естественном языке. Когда они сталкиваются с предложением, содержащим смесь слов и символов, например технической спецификацией или финансовым отчетом, обработка символов зависит от конкретной пары языка и движка. Большинство современных систем нейронного машинного перевода пропускают символы, которые они распознают как неязыковые, такие как знаки валют, процентные знаки и распространенные математические операторы. Но менее распространенные символы, такие как знак раздела, используемый в юридических документах, символ степени в научном тексте или специальные обозначения из определенной отрасли, могут быть удалены или заменены на этапе нормализации текста механизма перевода.
Шаг нормализации, который выполняется перед фактическим переводом, преобразует входной текст в стандартизированную форму. Он может писать строчными буквами, удалять знаки препинания, которые считает несущественными, и нормализовать символы Юникода до их канонических форм. Для большинства документов это полезно. Это не позволяет механизму перевода обрабатывать фразу «Hello»; и «привет»; как разные слова. Но для документов, в которых определенные символы имеют значение, нормализация может нанести вред. Химическая формула, в которой используются индексные числа, набор координат GPS с символами градусов и минут или юридическая цитата с пометками разделов, могут быть изменены путем нормализации таким образом, что изменят их значение или сделают их нечитаемыми.
Подмена шрифта: почему переведенный текст часто выглядит по-другому
Визуальное воздействие замены шрифта варьируется от незначительного до серьезного. Когда латинский шрифт заменяет другой латинский шрифт, ширина символов немного меняется, но текст остается читаемым. Когда латинский шрифт заменяет нелатинскую систему письма, результатом обычно является ряд пустых прямоугольников или вопросительных знаков, поскольку латинский шрифт не содержит ни одного из обязательных символов. Вот почему при переводе на арабский, китайский, японский, корейский или кириллицу необходимо уделять особое внимание доступности шрифтов на этапе повторной вставки.
После перевода новый текст необходимо поместить обратно в PDF. Встроенные шрифты исходного документа содержат только символы, которые присутствовали в исходном тексте. Если переведенный текст содержит символы, отсутствующие в оригинале, например символы с диакритическими знаками во французском или испанском переводе английского документа, исходные встроенные шрифты не могут их отобразить. Программа просмотра PDF возвращается к использованию замещающего шрифта, который почти наверняка будет отличаться от окружающего текста. В результате получается документ, в котором большая часть текста отображается исходным шрифтом, но отдельные переведенные слова или символы с диакритическими знаками появляются явно другим шрифтом, что придает странице неоднородный и непрофессиональный вид.
Эта проблема наиболее серьезна при переводе на языки, использующие совершенно разные системы письма. Для перевода PDF-файла с английского на русский, арабский, китайский или японский языки требуются символы, которых нет в шрифтах латинского алфавита. Весь переведенный текст должен быть отображен подстановочным шрифтом, при этом визуальный характер документа полностью изменится. Геометрия макета, которая работала для исходного текста, с ее конкретной шириной символов и высотой строк, не будет соответствовать переведенному тексту. Разрывы строк перемещаются, абзацы увеличиваются или уменьшаются, а элементы, которые были тщательно выровнены, становятся невыровненными.
Выбор метода перевода на основе чувствительности символов
Практическая проверка перед переводом — открыть PDF-файл и скопировать абзац, содержащий специальные символы, в текстовый редактор. Если специальные символы сохраняются после операции копирования и вставки, кодировка текста PDF-файла является стандартной, и этап извлечения перевода вряд ли повредит их. Если символы искажаются или исчезают при вставке, в PDF-файле используется нестандартная кодировка, что может вызвать проблемы при переводе. Исправление кодировки в источнике, например, путем повторного создания PDF-файла с включенным встраиванием шрифтов, более эффективно, чем попытка восстановить поврежденные символы после перевода.
Для документов, в которых символы имеют решающее значение, таких как финансовые отчеты, научные статьи, юридические документы и технические руководства, самым безопасным подходом является использование
Если документы переводятся на другую систему письменности, примите тот факт, что результат будет отличаться от оригинала, и спланируйте это соответствующим образом. Вместо того, чтобы ожидать идеального соответствия макета до пикселя, сосредоточьтесь на создании чистого, читаемого документа на целевом языке. После перевода запланируйте время на ручную или полуавтоматическую корректировку макета. Отрегулируйте ширину столбцов, выровняйте таблицы и проверьте правильность отображения всех специальных символов. Дополнительное время, затрачиваемое на форматирование после перевода, — это затраты на работу с разными системами письма, а инструменты, которые обещают плавный межскриптовый перевод без какой-либо работы с версткой, слишком упрощают действительно сложную проблему. Инструмент перевода WukongPDF сохраняет данные встроенных шрифтов на протяжении всего процесса преобразования, сводя к минимуму повреждение символов, которое происходит при замене шрифтов во время повторной вставки текста.
Часто задаваемые вопросы
Должен ли я перевести PDF напрямую или сначала преобразовать его в редактируемый формат, перевести его и повторно экспортировать в PDF? Двухэтапный подход: преобразование в Word, перевод документа Word и экспорт обратно в PDF обычно обеспечивает более высокую точность символов, поскольку Word обрабатывает Unicode более последовательно, чем извлечение необработанного текста PDF. Платой за это является то, что при использовании Word туда и обратно вносятся изменения в макете, которые необходимо исправлять вручную. Для коротких документов двухэтапный метод стоит усилий по верстке. Для очень длинных документов более практичным является прямой перевод PDF с помощью инструмента, сохраняющего кодировку.
Могу ли я перевести PDF-файл, выделив текст, переведя его на внешнем носителе и вручную поместив обратно в макет PDF? Да, этот ручной конвейер дает вам полный контроль над обработкой символов и выбором шрифта на каждом этапе, но он требует много времени и практичен только для коротких документов. Для технического руководства объемом 50 страниц повторная установка вручную невозможна. Выбор между автоматическим и ручным переводом — это, в конечном счете, решение о том, какой уровень контроля вам нужен над результатом и сколько времени вы можете потратить на него.
Можно ли предотвратить потерю символов, преобразовав PDF-файл в Word перед переводом?
Преобразование в Word сначала дает инструменту перевода доступ к тексту посредством обработки Unicode Microsoft Word, что, как правило, более надежно, чем извлечение необработанного текста PDF. Этот дополнительный шаг часто устраняет потерю символов, связанную с кодировкой, особенно для документов, созданных современным программным обеспечением, которое уже использует стандартную кодировку Unicode. Компромисс заключается в том, что само преобразование Word может привести к изменениям макета. Для документов с большим количеством символов повышенная точность символов обычно оправдывает работу по верстке.
Почему математические уравнения часто ломаются при переводе PDF?
Математические уравнения в PDF-файлах обычно хранятся в виде сочетания текстовых символов для переменных и чисел, а также специальных математических символов из специального математического шрифта, а также векторных черточек дробей, радикальных знаков и других элементов обозначений. Когда механизм перевода обрабатывает текстовый слой, он рассматривает уравнение как предложение и может переупорядочить или нормализовать последовательность символов. Векторно-рисованные элементы вообще не являются текстом и проходят перевод без прикосновения, но их выравнивание относительно переведенного текста почти всегда нарушается. Для документов с большим математическим содержанием наиболее надежным подходом является исключение уравнений из перевода и перевод только окружающего текста.
Существует ли формат PDF, который обрабатывает перевод Формат PDF лучше других?
PDF/A с полностью встроенными шрифтами Unicode преобразуется более надежно, чем стандартные PDF-файлы с подмножеством шрифтов и пользовательскими кодировками. Требование к полному внедрению и использованию Юникода в PDF/A устраняет два наиболее распространенных источника повреждения символов во время перевода: отсутствие глифов шрифта и нестандартное сопоставление символов. Если вы знаете, что документ будет переведен, стоит сохранить его в формате PDF/A перед запуском перевода.
Попробуйте перевести PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
