Инструмент перевода PDF обрабатывает текстовый поток в документе, преобразуя слова с одного языка на другой. Он читает абзацы, заголовки и подписи. Но он не читает текст внутри изображений. Фотография знака, снимок экрана пользовательского интерфейса на другом языке, диаграмма с метками осей, отображаемая как часть изображения, — все это содержит текст, который игнорируется стандартными инструментами перевода, поскольку этот текст отсутствует в текстовом потоке PDF. Он встроен в пиксели изображения. Для перевода текста внутри встроенных изображений необходимо извлечь изображения, выполнить на них распознавание текста, перевести распознанный текст, а затем либо повторно встроить переведенные изображения, либо добавить перевод в качестве наложения. Рабочий процесс Translate PDF для текста со встроенным изображением более сложен, чем стандартный перевод текста, но он охватывает контент, который в противном случае остался бы непереведенным.

Определение изображений, содержащих переводимый текст
Не каждое изображение в PDF-файле содержит текст, который стоит перевести. Декоративная фотография, фоновая текстура и логотип компании не могут содержать переводимого контента. Снимок экрана программного приложения, диаграмма с помеченными компонентами, фотография документа или знака, а также диаграмма со встроенными метками осей — все они содержат текст, который должен понять читатель на целевом языке. Просканируйте PDF-файл и найдите каждое изображение, содержащее текст. Отметьте эти изображения для рабочего процесса перевода.
Изображения, содержащие текст в формате PDF, делятся на две категории: те, в которых текст является частью изображения по дизайну, например, снимок экрана или диаграмма с метками, и те, где текст появляется на изображении, потому что документ был отсканирован, а не создан в цифровом виде. Отсканированный PDF-файл представляет собой одно большое изображение на странице. Весь текст на отсканированной странице встроен в изображение страницы. PDF-файл, созданный в цифровом формате, может содержать один снимок экрана на текстовой странице. PDF Images, требующие перевода, — это те изображения, в которых текст появляется в пикселях изображения, а не в текстовом потоке PDF.
Попробуйте перевести PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
Извлечение изображений и распознавание текста
Извлеките изображения из PDF-файла в самом высоком разрешении. Используйте инструмент извлечения изображений PDF, который сохраняет исходное разрешение. Сохраните каждое извлеченное изображение в формате PNG, чтобы избежать появления артефактов сжатия на этапе извлечения. Откройте каждое извлеченное изображение и убедитесь, что текст разборчив. Если разрешение изображения слишком низкое для четкого чтения текста, по возможности повторно извлеките его с более высоким разрешением или учтите, что это изображение может давать ненадежные результаты распознавания.
Запустите OCR для каждого извлеченного изображения, чтобы распознать текст. Механизм OCR идентифицирует текстовые области внутри изображения и выводит распознанные символы вместе с их позициями. Сохраните выходные данные OCR для каждого изображения, включая распознанный текст и координаты ограничивающей рамки каждой текстовой области. Эта информация понадобится позже, чтобы разместить переведенный текст в правильном положении на изображении. WukongPDF обрабатывает OCR PDF, позволяющую распознавать текст во встроенных изображениях в рамках рабочего процесса преобразования документов.
Перевод распознанного текста с сохранением контекста
Текст, распознанный по изображениям, часто бывает фрагментарным. Диаграмма может содержать метки из одного слова. Снимок экрана может содержать пункты меню и метки кнопок без контекста предложения. Этот фрагментированный текст представляет трудность для систем машинного перевода, поскольку отсутствует окружающий лингвистический контекст, который устраняет неоднозначность значений слов. Предоставьте как можно больше контекста. Если метка читается как «Файл» и появляется на снимке экрана меню программного обеспечения, обратите внимание во входных данных перевода, что это пункт меню, а не физический объект.
Для изображений с несколькими текстовыми областями сохраняйте сопоставление между каждой областью и ее переводом. Диаграмма с десятью метками создает десять отдельных текстовых строк, каждая из которых требует перевода. Сохраняйте исходный текст, переведенный текст и координаты ограничительной рамки вместе в структурированном формате, например в электронной таблице. Это сопоставление используется на последнем этапе для размещения переведенного текста на изображении. Чтобы вывод Translate PDF был полезным, переведенный текст должен появиться в правильном месте на изображении, заменяя или сопровождая исходный текст.
Размещение переведенного текста обратно на изображения
Существует два подхода к размещению переведенного текста на изображениях. Первый подход заменяет исходный текст переводом. Откройте изображение в графическом редакторе. Для каждой текстовой области сотрите исходный текст, заполнив ее цветом фона. Разместите переведенный текст в том же регионе, используя шрифт, максимально соответствующий стилю оригинала. Этот подход позволяет получить чисто переведенное изображение, похожее на оригинал, но на другом языке.
Второй подход добавляет перевод к исходному тексту. Разместите переведенный текст контрастным цветом ниже или рядом с исходным текстом. Такой подход сохраняет оригинал для читателей, которые понимают оба языка и хотят сравнить перевод с оригиналом. Это быстрее, чем стирание и замена, но полученное изображение визуально более загружено. Выбирайте подход, исходя из потребностей аудитории. Учебное пособие для операторов, которые читают только на целевом языке, выиграет от замены. Двуязычный справочный документ выигрывает от параллельного представления.
Повторное встраивание переведенных изображений в PDF
После обработки изображений с переведенным текстом их необходимо поместить обратно в PDF-файл. Замените каждое исходное изображение его переведенным аналогом. Заменяющее изображение должно занимать то же место на странице, что и исходное. Если переведенное изображение имеет размеры в пикселях, отличные от оригинала, масштабируйте его так, чтобы оно соответствовало исходной ограничивающей рамке в PDF-файле. Макет страницы PDF не должен меняться. Единственным видимым отличием должен быть язык текста на изображениях.
Сохраните PDF-файл с переведенными изображениями как новую версию, сохранив исходный непереведенный PDF-файл в качестве справочного материала. Проверьте переведенный PDF-файл, открыв его и проверив каждое изображение. Убедитесь, что переведенный текст разборчив, правильно расположен и не содержит ошибок распознавания или перевода. Translate PDF со встроенным переводом изображений считается завершенным, когда каждый текстовый элемент в документе, в текстовом потоке и в изображениях доступен читателю на целевом языке.
Когда лучше выбирать ручной перевод, а не автоматический
Для изображений, содержащих критический текст, например предупреждения о безопасности, юридические уведомления или технические спецификации, рассмотрите возможность перевода вручную переводчиком-человеком, а не машинным переводом. Ошибка оптического распознавания символов в сочетании с ошибкой машинного перевода может изменить смысл инструкции по безопасности таким образом, что это будет иметь реальные последствия. Стоимость человеческого перевода небольшого количества критических изображений невелика по сравнению со стоимостью неправильного перевода.
Для больших пакетов изображений, где ручной перевод нецелесообразен, выполните этап проверки. После машинного перевода и повторного внедрения попросите рецензента, читающего целевой язык, проверить образец переведенных изображений на точность. Если в образце обнаружены системные ошибки, настройте параметры оптического распознавания символов или параметры механизма перевода и обработайте пакет повторно.
Перевод текста во встроенных изображениях часто является последним шагом на пути к тому, чтобы сделать PDF-файл полностью доступным для международной аудитории. Основной текст, заголовки и подписи переведены. Изображения остаются окончательным непереведенным контентом. В результате этого шага создается документ, в котором каждый фрагмент текста на любом носителе доступен на целевом языке.
Для часто обновляемых документов со встроенными изображениями подумайте, можно ли переместить текст изображения в текстовый поток PDF в процессе создания документа. Диаграмму с метками, хранящимися в виде наложения текста, а не как часть изображения, можно перевести с помощью стандартных инструментов перевода текста, полностью избегая рабочего процесса «извлечение-распознавание текста-перевод-повторное встраивание».
Качество окончательного переведенного изображения зависит от качества каждого этапа конвейера. Извлечение изображений с высоким разрешением обеспечивает четкий входной сигнал OCR. Точное распознавание текста создает правильный текст для перевода. Хороший механизм перевода сохраняет смысл. Тщательное повторное встраивание сохраняет визуальное качество. Каждый шаг зависит от предыдущего.
Рабочий процесс Translate PDF для текста со встроенным изображением является наиболее трудоемким сценарием перевода, поскольку он сочетает в себе обработку изображений, распознавание символов, перевод и повторное встраивание в один конвейер. Автоматизация как можно большего количества шагов сокращает ручные усилия.
Если изображения одинаково отображаются в нескольких PDF-файлах, например логотип компании со слоганом или стандартная диаграмма, переведите изображение один раз и используйте его повторно. Переведенное изображение можно заменить в каждом PDF-файле, где присутствует исходное изображение.
В этой статье рассматриваются ключевые методы и рекомендации по работе с PDF-файлами в этом конкретном сценарии. Описанные здесь методы применимы к различным инструментам и платформам, предоставляя читателям возможность выбора подхода, который лучше всего соответствует их рабочему процессу и технической среде.
Описанные практические шаги прокладывают четкий путь от первоначальной проблемы к рабочему решению. Каждый метод был выбран за его надежность и доступность, гарантируя, что читатели смогут достичь стабильных результатов независимо от своего предыдущего опыта работы с инструментами PDF.
WukongPDF и аналогичные платформы предоставляют инструменты оптического распознавания символов и обработки документов, которые поддерживают рабочий процесс перевода текста изображения, описанный в этой статье. Сочетание этих инструментов обеспечивает комплексный перевод.
Попробуйте перевести PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
