Others

Можете ли вы преобразовать PDF-файл в Word и сохранить исходный порядок чтения для языков с письмом справа налево?

Преобразование PDF в Word является достаточно сложной задачей, если исходный документ написан на английском языке с простым порядком чтения слева направо и сверху вниз. Если исходный документ написан на арабском, иврите, персидском языке или урду, преобразование также должно правильно определить, что текст движется справа налево, что числа в тексте с письмом справа налево пишутся слева направо и что общий макет страницы начинается с правой стороны. Большинство преобразователей PDF в Word разработаны и протестированы в основном для документов LTR, и их производительность при работе с содержимым RTL варьируется от несовершенной до совершенно непригодной для использования.

Формат PDF не сохраняет порядок чтения явным образом как свойство текста. Он сохраняет отдельные фрагменты текста в виде глифов на странице. Для текста LTR преобразователь может разумно предположить, что текст читается слева направо и сверху вниз, поскольку это соответствует физическому макету. Для текста с письмом справа налево это предположение совершенно неверно. Строка арабского текста, которая читается на странице справа налево, будет перевернута преобразователем, который принимает порядок LTR, создавая выходные данные, в которых каждая строка пишется наоборот. Это не является незначительной проблемой форматирования. Перевернутая строка на арабском языке не читается носителем арабского языка.

Исследование точности извлечения текста из PDF-файла в текст на нескольких языках, проведенное в 2025 году, показало, что частота ошибок при извлечении RTL была в 3,6 раза выше, чем частота ошибок при извлечении LTR для одного и того же набора инструментов преобразования, причем изменение порядка слов является наиболее распространенным типом ошибок (Институт компьютерной лингвистики, «Точность извлечения многоязычного текста в PDF», 2025). Исследование также показало, что ошибки не были случайными. Конкретные инструменты либо правильно обрабатывали RTL, либо систематически выдавали обратный вывод, а это означает, что выбор правильного инструмента для преобразования RTL более важен, чем настройка параметров преобразования, а инструменты переключения могут исправить преобразование, которое кажется безнадежно сломанным.

Can You Convert a PDF to Word and Preserve the Original Reading Order for Right-to-Left Languages

Как PDF хранит текст с письмом справа налево и почему простое извлечение не удается

Внутри PDF-файла текст хранится в виде последовательности индексов глифов и команд позиционирования. Для каждого запуска текста в PDF-файле указываются шрифт, коды символов для символов и координаты X и Y каждого глифа на странице. Нет явного флага, говорящего: «Этот текст на арабском языке». или «эта строка читается справа налево». PDF Converter должен определять направление текста на основе кодов символов Юникода, которые кодируют направленность с помощью двунаправленного алгоритма Юникода. Символы арабского языка и иврита имеют внутреннее направление RTL, а алгоритм Unicode определяет, как изменить порядок отображения смешанной последовательности символов RTL и LTR.

Проблема в том, что необработанный порядок извлечения глифов из PDF-файла может не соответствовать логическому порядку символов в исходном тексте. Программа записи PDF-файлов может свободно размещать глифы на странице в любом порядке, а некоторые программы записи размещают глифы RTL слева направо в потоке контента, даже если порядок чтения — справа налево. Конвертер, который наивно объединяет глифы в порядке извлечения, создаст текст, который читается правильно или наоборот, в зависимости от того, как автор исходного PDF-файла решил закодировать текст. Один и тот же документ на арабском языке при печати в формате PDF из двух разных текстовых процессоров может создавать потоки контента с разным порядком глифов, а конвертер, который идеально работает для одного, может создавать перевернутый текст для другого.

Двунаправленный алгоритм Unicode, указанный в Приложении 9 к стандарту Unicode, определяет, как изменить порядок отображения последовательности символов со смешанной направленностью. Конвертер, правильно реализующий этот алгоритм, может правильно обрабатывать большую часть текста с письмом справа налево, независимо от порядка глифов в потоке содержимого PDF. Однако качество реализации варьируется. Алгоритм хорошо обрабатывает распространенные случаи, но есть крайние случаи, включающие вложенные переопределения направления, знаки препинания на границах направлений и текст со смешанным алфавитом, например английский технический термин в арабском предложении.

WukongPDF

Попробуйте PDF в Word

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Выбор преобразователя, поддерживающего порядок чтения RTL

Наиболее надежными преобразователями документов RTL являются те, которые реализуют двунаправленный алгоритм Unicode при извлечении текста. Adobe Acrobat Pro и несколько библиотек с открытым исходным кодом, включая Apache PDFBox и pdfplumber, в разной степени поддерживают этот алгоритм. Прежде чем использовать конвертер для пакета документов RTL, протестируйте его на одной репрезентативной странице. Извлеките текст в Word и сравните результат, слово за словом, с исходным PDF-файлом. Проверьте обратный порядок слов в предложениях, правильное расположение чисел в тексте с письмом справа налево, а также наличие смешанных последовательностей LTR/RTL, таких как название английской компании в арабском абзаце.

Если ваш преобразователь постоянно меняет направление текста с направлением RTL, иногда вы можете обойти эту проблему, используя путь преобразования, который проходит через промежуточный формат. Преобразуйте PDF-файл в HTML или в текстовый формат с тегами, используя инструмент, который правильно обрабатывает RTL. Затем импортируйте промежуточный формат в Word. Этот двухэтапный процесс менее удобен, чем прямое преобразование PDF в Word, но когда прямой путь создает перевернутый текст, косвенный путь является единственным автоматизированным путем к полезному выводу.

WukongPDF поддерживает преобразование с учетом RTL, которое автоматически применяет правильное направление чтения и выравнивание текста, когда метаданные исходного документа указывают язык RTL. Конвертер определяет основной сценарий документа и применяет соответствующие правила направления во время извлечения текста, создавая документ Word с правильным направлением абзацев, выравниванием текста и порядком символов.

Сохранение структуры макета страницы с документами RTL

Порядок чтения влияет не только на текст. Весь макет страницы документа RTL зеркально отображается относительно документа LTR. Первая страница арабской книги — это то, что английский читатель посчитал бы последней страницей. Столы располагаются справа налево. Списки имеют отступ справа. Поле переплета находится на правой стороне правых страниц. Преобразование, которое правильно обрабатывает направление текста, но не изменяет структуру макета, создаст документ Word, в котором текст читается правильно, но все позиционируется так, как если бы это был документ LTR, с абзацами, выровненными по левому краю, и списками с отступом влево, которые выглядят неправильно для читателя RTL.

Если преобразование PDF в Word предназначено для редактирования и повторного экспорта, сохранение макета PDF Format менее критично, поскольку редактор будет корректировать структуру. Когда преобразование предназначено для архивных или справочных целей, когда документ Word должен визуально соответствовать исходному PDF-файлу, сохранение макета имеет большее значение. В таких случаях выберите конвертер, который сохраняет расположение текстового поля, макет столбцов и выравнивание полей по сравнению с оригиналом. После преобразования вручную проверьте правильность направления текста на каждой странице. Убедитесь, что для текста на арабском языке и иврите установлено выравнивание абзаца по правому краю, а не по левому краю по умолчанию. Убедитесь, что во всех таблицах столбцы расположены в правильном порядке справа налево. Эти ручные проверки выявляют проблемы, которые автоматическое преобразование не может обнаружить, поскольку преобразователь не понимает семантического значения контента.

WukongPDF

Попробуйте PDF в Word

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →