Others

Почему текст изменяется или искажается при копировании из PDF в Word

При выборе текста в PDF-файле, его копировании и вставке в Word должен получиться тот же текст. Вместо этого разрывы строк появляются в середине предложения. Специальные символы превращаются в мусорные символы. Шрифты меняются. Аккуратно выровненные абзацы превращаются в неровную мешанину жестких возвратов и случайных интервалов. Текст технически есть, но форматирование уничтожено.

PDF-файлы были разработаны так, чтобы везде выглядеть одинаково. Они не предназначены для редактирования. Копипаст раскрывает этот компромисс.

Понимание того, почему текст изменяется во время операций копирования PDF в Word, поможет вам выбрать между исправлением вставленного текста, использованием подходящего инструмента преобразования или возвратом к исходному документу. Инструменты преобразования формата PDF WukongPDF правильно обрабатывают извлечение, полностью избегая проблем копирования и вставки.

Why Does Text Change or Garbled When Copying From a PDF to Word

Как PDF-файлы хранят текст и как они его отображают

Внутри PDF-файла текст хранится в виде отдельных символов в координатной сетке. У каждого символа есть позиция X и Y. Слово «привет» может состоять из пяти независимых символов: h в (100 200), e в (108 200) и так далее. Зритель визуализирует их как слова, потому что они расположены рядом друг с другом по одной и той же координате Y. При копировании и вставке принимающее приложение восстанавливает слова и предложения по этим отдельным позициям.

Алгоритмы реконструкции угадывают, где начинаются и заканчиваются слова и строки, на основе интервалов. Расстояние между словами, превышающее обычное, может быть интерпретировано как разрыв строки. Выровненные по ширине абзацы с переменным интервалом запутывают алгоритм, заставляя его вставлять разрывы случайным образом. Лигатуры, соединенные символы, такие как fi и fl, могут не иметь эквивалента в Юникоде, что приводит к отсутствию или замене символов во вставленном выводе.

WukongPDF

Попробуйте PDF в Word

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Почему разрывы строк появляются в середине предложений

Жёсткие разрывы строк, появляющиеся в середине предложения, являются наиболее распространенным артефактом копирования. PDF-файл хранит текст в строках, соответствующих макету страницы. Перенос предложения от одной визуальной строки к другой сохраняется как два отдельных набора позиций символов. Алгоритм копирования видит разрыв между концом одной визуальной строки и началом следующей и вставляет разрыв абзаца.

Исправление этих разрывов вручную в Word означает удаление каждого нежелательного разрыва и добавление пробела. За один абзац небольшое раздражение. Для 50-страничного документа — час потерянного времени. Конвертер PDF в Word, который восстанавливает абзацы по позициям символов, обрабатывает это правильно, соединяя обернутый текст и вставляя разрывы только на фактических границах абзацев.

Специальные символы и проблемы с заменой шрифтов

PDF-файлы могут использовать шрифты, не установленные на копирующем компьютере. Когда операция копирования встречает символ из недоступного шрифта, она заменяет запасной вариант или полностью удаляет этот символ. Пункты списка становятся вопросительными знаками. Длинные тире превращаются в пустые коробки. Фигурные кавычки становятся прямыми кавычками или исчезают. Текст присутствует в PDF-файле, но не может быть представлен в целевом объекте вставки, поскольку кодировка символов не отображается четко.

Встроенные шрифты предотвращают проблемы с отображением, но копирование и вставка не переносят встроенный шрифт. Целевое приложение использует собственные шрифты, в которых могут отсутствовать определенные символы или они могут кодироваться по-другому. Правильные инструменты преобразования PDF в Word обрабатывают сопоставление шрифтов более разумно, чем системный буфер обмена, переводя кодировки шрифтов PDF в Unicode и сохраняя каждый символ.

Проблема копирования-вставкиЧто является причинойКак избежать
Случайные разрывы строкPDF хранит текст по визуальной строке, а не по абзацам.Используйте конвертер PDF в Word вместо копирования и вставки
Искаженные специальные символыШрифт недоступен в системе, несоответствие кодировкиУбедитесь, что в исходном PDF-файле используются встроенные шрифты, или используйте конвертер.
Отсутствуют лигатуры (fi, fl, ff)Лигатурный глиф не имеет единого эквивалента в Юникоде.Используйте конвертер, разлагающий лигатуры на отдельные символы.
Потеряно форматирование (жирный, курсив)Форматирование хранится отдельно от текста в PDF.Примите тот факт, что копипаста теряет форматирование; использовать конвертер
Текст в неправильном порядкеМногоколоночный или сложный макет затрудняет извлечение.Использовать конвертер с определением макета

Использование преобразования PDF в Word вместо копирования и вставки

Инструмент преобразования считывает внутреннюю структуру PDF-файла и восстанавливает абзацы, таблицы и форматирование так, как не может буфер обмена. Выходной документ Word сохраняет последовательность текста, поддерживает заголовки в виде стилей Word и позволяет редактировать таблицы. Преобразование требует того же количества кликов, что и копирование, и дает результат, требующий лишь небольшой очистки.

Инструмент преобразования WukongPDF автоматически выполняет эту реконструкцию. Загрузите PDF-файл, выберите Word в качестве выходного формата и загрузите правильно структурированный документ. Несколько секунд, затраченные на преобразование, окупаются экономией времени на очистку. Для любого документа длиной более одной страницы преобразование из PDF в пригодный для использования файл Word по общему времени превосходит копирование.

Обработка нестандартных кодировок и текста с письмом справа налево

PDF-файлы, созданные с использованием устаревших систем или нелатинских скриптов, создают дополнительные проблемы с копированием. В документах, содержащих текст на арабском, иврите, китайском или японском языках, используются схемы кодировки, которые системный буфер обмена может неправильно интерпретировать. Визуальный текст правильно отображается на экране, поскольку программа просмотра PDF имеет необходимые таблицы шрифтов и кодировок. Буфер обмена, в котором отсутствуют эти таблицы, выдает полностью искаженный результат.

Инструменты преобразования, предназначенные для многоязычных PDF-файлов, включают обнаружение кодировки, которой нет в буфере обмена. Они анализируют таблицы кодировки шрифтов PDF-файла, сопоставляют индексы глифов с правильными кодовыми точками Unicode и выводят правильно закодированный текст. Для документов со смешанным языковым содержанием, основным текстом на английском языке с арабскими сносками, подписями на диаграммах на китайском языке необходим многоязычный конвертер. Подход с буфером обмена не сработает по крайней мере на одном из языков, а часто и на всех.

Когда исходное приложение является лучшим вариантом

Самый чистый документ Word создается в приложении, создавшем PDF-файл. Если PDF-файл был экспортирован из Word, снова откройте исходный файл Word. Если он был экспортирован из Документов Google, вместо этого загрузите его как файл Word. Исходное приложение имеет исходное форматирование, стили и структуру, сведенные в PDF-файл.

PDF-файлы — это формат распространения, а не формат редактирования. Они были разработаны так, чтобы везде выглядеть одинаково, и их нельзя было модифицировать. Если потребуется редактирование, вернитесь к источнику. Если исходный код недоступен, а PDF — это все, что у вас есть, используйте подходящий инструмент преобразования, а не копипаст. Инструмент был создан для этой задачи. Буфера обмена не было.

WukongPDF

Попробуйте PDF в Word

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →