Tips & Tricks

Как удалить пустые строки при копировании текста из PDF-файла

Копирование текста из PDF-файла и вставка его в Word или текстовый редактор часто приводит к появлению ломаных линий. Каждая строка из PDF-файла становится отдельным абзацем во вставленном выводе с жесткими разрывами строк, которые делают невозможным редактирование текста как непрерывной прозы. Удаление нежелательных разрывов строк после преобразования или копирования PDF в Word — это задача очистки форматирования, которую можно автоматизировать с помощью функции поиска и замены и нескольких сочетаний клавиш.

Основные выводы

Извлечение текста PDF помещает жесткий разрыв строки в конце каждой визуальной строки. При вставке в текстовый редактор каждая строка становится отдельным абзацем. Самое быстрое решение — это поиск и замена с помощью подстановочных знаков, который удаляет одиночные разрывы строк, сохраняя при этом двойные разрывы строк между подлинными абзацами. Эта единственная операция за считанные секунды преобразует разорванный текст в плавные абзацы.

How to Remove Blank Lines When Copying Text From a PDF

Почему PDF-текст копируется с таким количеством разрывов строк

PDF-файл хранит текст в виде отдельных линейных объектов, каждый из которых расположен в определенных координатах на странице. В отличие от документа текстового процессора, где текст непрерывно перетекает от одной строки к другой, в PDF-файле нет концепции плавного текста. Каждая строка представляет собой отдельный объект. Когда вы копируете текст, процесс извлечения считывает эти объекты строки по порядку и помещает разрыв строки после каждого из них, поскольку он не может отличить разрыв строки, завершающий абзац, от разрыва строки, который представляет собой просто перенос строки внутри абзаца.

Проблема наиболее заметна в PDF-файлах с несколькими столбцами и PDF-файлах, созданных на основе форматированных текстовых документов. Абзац, охватывающий четыре визуальные строки в PDF-файле, при вставке становится четырьмя отдельными абзацами, каждый из которых заканчивается знаком абзаца. Редактирование этого текста требует ручного соединения строк, что утомительно для нескольких абзацев. Подход «найти и заменить» автоматизирует повторное соединение.

WukongPDF

Попробуйте PDF в Word

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Удаление разрывов одной строки с помощью функции поиска и замены

После использования функции поиска и замены для соединения ломаных строк просмотрите текст на предмет разрывов абзацев, которые должны были сохраниться, но не сохранились. Маркированные списки и нумерованные списки являются наиболее частыми жертвами, поскольку каждый маркер или номер находится на отдельной строке. Метод поиска и замены объединяет их в один абзац. Вручную восстанавливайте разрывы строк перед каждым маркером или номером. Этот этап очистки занимает несколько минут, но в результате получается отполированный окончательный документ.

Вставьте скопированный текст в Word. Откройте «Найти и заменить», нажав Ctrl+H. В поле Найти введите ^p, чтобы соответствовать меткам абзаца. В поле Заменить на введите один пробел. Нажмите «Заменить все». Каждый знак абзаца в документе заменяется пробелом, объединяя весь текст в один абзац. Это слишком агрессивно, поскольку при этом также удаляются знаки абзацев между настоящими абзацами. Чтобы это исправить, сначала защитите двойные знаки абзаца, разделяющие настоящие абзацы. Сначала замените ^p^p заполнителем, например @@PARA@@. Затем замените оставшиеся одиночные знаки ^p пробелами. Наконец, замените @@PARA@@ на ^p^p, чтобы восстановить разрывы абзацев.

Подход с использованием подстановочных знаков можно расширить для обработки более сложных шаблонов очистки. Документ с заголовками разделов можно защитить, заменив образец текста заголовка, например строку, заканчивающуюся двоеточием, за которым следует знак абзаца, на заполнитель перед общим удалением разрыва строки. После соединения строк основного текста восстановите разрывы заголовков из заполнителей. При этом сохраняется структура абзацев и разделение заголовков.

В Word этот трехэтапный процесс занимает около 30 секунд и работает с текстом любой длины. Ключевым моментом является использование заполнителя, который не появляется нигде в тексте документа. После замены одиночных разрывов строк текст превращается в непрерывные абзацы. Каждый исходный разрыв абзаца сохраняется как двойной разрыв строки. Теперь документ можно редактировать как обычную прозу. Инструменты PDF Format WukongPDF сохраняют структуру абзаца во время преобразования, уменьшая объем ручной очистки разрывов строк, необходимой после копирования.

Используйте онлайн-инструменты очистки текста для быстрых исправлений

Очистка одним щелчком мыши экономит минуты ручного построчного редактирования.

Для текста, скопированного из отсканированного PDF-файла, обработанного с помощью оптического распознавания символов, проблема разрыва строки усугубляется ошибками оптического распознавания символов. Каждый неправильно распознанный символ добавляет шум к уже испорченному тексту. В этом случае пропустите текст через проверку орфографии, удалив разрывы строк. Средство проверки орфографии выявляет ошибки оптического распознавания символов, которые невозможно устранить с помощью удаления разрыва строки. Комбинация удаления разрывов строк и проверки орфографии обеспечивает максимально чистый вывод отсканированных документов.

Несколько бесплатных онлайн-инструментов специализируются на очистке текста, скопированного из PDF-файлов. Вставьте скопированный текст в инструмент, и он автоматически удалит одиночные разрывы строк, сохраняя при этом разрывы абзацев. Эти инструменты используют ту же логику, что и метод ручного поиска и замены, но применяют ее одним щелчком мыши. Они идеально подходят для разовых задач по очистке текста, когда настройка поиска и замены в Word требует больше усилий, чем оправдывает задача.

Выбирая онлайн-инструмент для очистки текста, имейте в виду, что вы вставляете потенциально конфиденциальный текст на сторонний веб-сайт. Для конфиденциальных документов используйте метод ручного поиска и замены в локальном приложении, а не в онлайн-инструменте. Ручной метод работает в автономном режиме, сохраняет текст на компьютере и дает идентичные результаты.

Предотвратить проблемы разрыва строки в будущих копиях

Качество извлечения текста также зависит от того, как был создан PDF-файл. PDF-файлы, созданные текстовыми процессорами, обычно имеют лучший внутренний порядок текста, чем PDF-файлы, созданные путем сканирования и оптического распознавания символов. Порядок текста в PDF-файле, созданном текстовым процессором, соответствует порядку чтения исходного документа. Порядок текста в PDF-файле, созданном с помощью OCR, соответствует пространственному порядку, в котором механизм OCR распознал текст, который может не совпадать с порядком чтения в многоколоночных или сложных макетах.

Если вам регулярно приходится копировать текст из PDF-файлов, настройте свой рабочий процесс, чтобы свести к минимуму нагрузку на очистку. Преобразуйте PDF-файл в Word перед копированием текста, а не копируйте непосредственно из средства просмотра PDF-файлов. Инструменты преобразования PDF в Word предназначены для объединения разрывов строк и создания плавного текста. Преобразованный документ Word все равно потребует некоторой очистки, но гораздо меньше, чем текст, скопированный непосредственно из программы просмотра PDF.

Чтобы создавать PDF-файлы, из которых другим нужно будет копировать текст, включите теги специальных возможностей во время создания PDF-файла. PDF-файлы с тегами содержат информацию о структуре, которая сообщает инструментам извлечения текста, где начинаются и заканчиваются абзацы. Текст, скопированный из PDF-файла с тегами, значительно чище, чем текст из PDF-файла без тегов, поскольку инструмент извлечения использует теги структуры абзаца вместо того, чтобы угадывать границы абзаца по позициям строк.

При создании PDF-файлов из Word включите опцию «Теги структуры документа для специальных возможностей» в настройках экспорта PDF. Это встраивает в PDF-файл структурную информацию, которую инструменты извлечения текста используют для определения границ абзацев. Текст, извлеченный из PDF-файла с тегами, имеет значительно меньше ложных разрывов строк, поскольку инструмент извлечения знает, где начинаются и заканчиваются абзацы, по структурным тегам, а не угадывает по позициям строк.

Часто задаваемые вопросы

Влияет ли шрифт, используемый в исходном PDF-файле, на чистоту копирования текста? Да, существенно. PDF-файлы, использующие стандартные шрифты PostScript или TrueType с правильной кодировкой, копируются более аккуратно, чем PDF-файлы, использующие пользовательские шрифты. В некоторых пользовательских шрифтах используются нестандартные сопоставления символов, где то, что отображается как буква A, хранится внутри как совершенно другой код символа. Когда вы копируете текст из такого PDF-файла, извлеченный текст может содержать совершенно неправильные символы. Не существует другого решения проблем с кодировкой шрифтов, кроме извлечения на основе OCR.

Почему вставленный текст из PDF-файла иногда содержит случайные пробелы в середине слов? Это называется фрагментацией текста и происходит, когда в PDF-файле отдельные символы или небольшие группы символов сохраняются как отдельные текстовые объекты. Средство просмотра PDF-файлов вставляет пробелы между объектами во время извлечения текста. Автоматического исправления не существует. Единственное решение — ручная корректура. PDF-файлы, созданные с правильным внедрением шрифтов и кодировкой текста, с меньшей вероятностью будут подвержены фрагментации.

Есть ли способ скопировать текст из PDF-файла вообще без разрывов строк? Некоторые инструменты преобразования PDF в текст специально создают непрерывные абзацы. Эти инструменты анализируют расположение текста и объединяют строки, принадлежащие одному абзацу. Вывод получается чище, чем при копипасте, но требует использования инструмента извлечения вместо стандартного метода выбора и копирования. При частом извлечении текста приобретение специального инструмента для извлечения значительно экономит время очистки.

Почему вставленный текст PDF иногда имеет лишние пробелы в середине слов?

Это происходит, когда PDF-файл хранит каждый символ или небольшую группу символов как отдельные текстовые объекты с небольшими промежутками между ними. Процесс извлечения текста вставляет пробел в каждый пробел. Автоматического решения этой проблемы не существует, поскольку пробелы неотличимы от обычных пространств слов. Единственным решением является ручная корректура и исправление. Создание PDF-файлов с правильным внедрением шрифтов снижает вероятность фрагментации текста на уровне символов.

Можно ли скопировать текст из таблицы PDF, не нарушая выравнивание столбцов?

Стандартная копипаста не сохраняет структуру таблицы. Текст из всех столбцов извлекается в порядке чтения, создавая беспорядочную последовательность. Чтобы скопировать данные таблицы с сохранением столбцов, используйте инструмент преобразования PDF в Excel, который определяет структуру таблицы. Вывод Excel сохраняет выравнивание столбцов, и вы можете копировать данные из Excel, сохранив структуру.

Влияет ли программа просмотра PDF на качество копирования текста?

Да. Извлечение текста в Adobe Acrobat, как правило, самое чистое. Программы просмотра на основе браузера часто создают больше разрывов строк, поскольку они оптимизированы для отображения, а не для извлечения текста. Если вам нужно часто копировать текст, используйте для извлечения специальную программу для чтения PDF-файлов, а не программу просмотра в браузере.

WukongPDF

Попробуйте PDF в Word

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →