Преобразование макета PDF с несколькими столбцами в Word часто приводит к созданию документа, в котором текст из разных столбцов смешивается в одном потоке. Исследовательская статья в две колонки превращается в один длинный, беспорядочный абзац. Информационный бюллетень с тремя колонками становится нечитабельным. Для сохранения структуры столбцов во время преобразования PDF в Word требуются настройки преобразования, которые распознают и поддерживают исходную геометрию макета, обрабатывая каждый столбец как независимый текстовый поток, а не объединяя их в один.
Основные выводы
Инструменты преобразования PDF в Word обрабатывают макеты с несколькими столбцами, анализируя пространственное расположение текста на каждой странице. Инструменты, поддерживающие обнаружение столбцов, выявляют пробелы между текстовыми блоками и восстанавливают порядок чтения столбцов. Качество сохранения столбцов значительно различается в зависимости от инструмента преобразования. Документы с простым макетом в две колонки хорошо конвертируются с помощью большинства инструментов. Документы со сложным макетом в журнальном стиле с перекрывающимся текстом и изображениями могут потребовать ручной очистки после преобразования.

Как работает обнаружение столбцов во время преобразования PDF
Размер шрифта и межстрочный интервал в исходном PDF-файле влияют на точность определения столбцов. Документы с очень мелким текстом, такие как финансовые таблицы из 8 пунктов, бросают вызов алгоритму обнаружения, поскольку пробелы между столбцами пропорционально меньше. Если исходный документ позволяет это, увеличение размера шрифта или интервала между столбцами перед созданием PDF-файла улучшит результаты преобразования. Для существующих PDF-файлов, исходный документ которых недоступен, примите во внимание, что макеты с небольшим текстом и несколькими столбцами потребуют дополнительной очистки вручную.
PDF Converter, поддерживающий обнаружение столбцов, анализирует горизонтальное положение текстовых блоков на каждой странице. Текстовые блоки, которые имеют один и тот же левый край и имеют одинаковую ширину, группируются в столбец. Затем преобразователь считывает каждый столбец сверху вниз, прежде чем перейти к следующему столбцу. В результате создается документ Word, в котором текст из каждого столбца находится в отдельном текстовом потоке, который Word представляет либо в виде связанных текстовых полей, либо в виде таблицы с одним столбцом на каждый столбец PDF.
Алгоритм обнаружения основан на одинаковой ширине столбцов и четких промежутках между столбцами. Документ с зазором между столбцами в 2 миллиметра бросает вызов алгоритму, поскольку такой узкий промежуток может быть интерпретирован как обычный интервал между словами, а не как граница столбца. Документы со столбцами неравной ширины, например широкий основной столбец и узкая боковая панель, также усложняют работу алгоритма, поскольку он должен различать столбец и абзац с отступом. Обнаружение столбцов лучше всего работает в документах со стандартным макетом: столбцы одинаковой ширины, разделенные пробелами не менее 5 миллиметров.
Попробуйте PDF в Word
Никакой установки не требуется. Работает прямо в вашем браузере.
Настройки преобразования для сохранения столбцов
Для документов со сложным макетом из нескольких столбцов, которые невозможно корректно преобразовать с помощью каких-либо автоматических настроек, рассмотрите возможность преобразования в формат, отличный от Word. Преобразование PDF-файла в формат настольной публикации, такой как Adobe InDesign или Affinity Publisher, сохраняет структуру столбцов более точно, чем Word, поскольку эти приложения с самого начала разработаны для макетирования с несколькими столбцами. Экспортируйте окончательно отредактированный документ обратно в PDF из приложения публикации.
После первоначального преобразования сохраните документ Word в формате DOCX, а не в более старом формате DOC. DOCX обрабатывает сложные макеты, включая структуры столбцов, более надежно, чем DOC. Если инструмент преобразования предлагает выбор выходного формата, всегда выбирайте DOCX для документов с большим количеством столбцов. Преобразование из PDF в DOC и последующее сохранение в формате DOCX добавляет ненужное преобразование формата, которое может привести к ошибкам макета.
Если преобразованный документ Word помещает каждый столбец в отдельное текстовое поле (что является поведением по умолчанию для преобразования с сохранением макета), вы можете извлечь текст из каждого текстового поля и объединить его в макет на основе одного столбца, используя функцию связанных текстовых полей Word. Соедините текстовые поля в порядке чтения, и текст будет непрерывно проходить через них. Этот подход сохраняет как расположение столбцов, так и возможность непрерывного редактирования текста.
В настройках конвертации найдите опции, связанные с сохранением макета. «Сохранить плавный текст»; пытается восстановить текст в виде редактируемых абзацев Word, что идеально подходит для документов, требующих дальнейшего редактирования. «Сохранить макет страницы»; помещает текст в позиционированные текстовые поля, которые сохраняют точный визуальный макет, но их сложнее редактировать. Для сохранения столбца выберите «Сохранить плавный текст». при включенном обнаружении столбцов обычно достигается наилучший баланс редактируемости и структуры. Конвертер PDF-файла в Word WukongPDF включает режим обнаружения столбцов, который определяет макеты с несколькими столбцами и восстанавливает правильный порядок чтения, помещая текст каждого столбца в отдельный раздел Word.
Если конвертер предлагает опцию OCR для отсканированных документов, включите ее даже для цифровых PDF-файлов. Анализ макета механизма OCR часто лучше обнаруживает столбцы, чем пространственный анализ механизма извлечения текста. OCR обрабатывает страницу как изображение и идентифицирует текстовые области, что делает обнаружение столбцов более эффективным, чем прямой анализ потока содержимого PDF. Компромисс заключается в том, что преобразование на основе оптического распознавания символов происходит медленнее и может привести к ошибкам распознавания текста, который уже был цифровым. Используйте преобразование на основе OCR для документов, в которых точность столбцов имеет наивысший приоритет, а длина документа является управляемой.
Восстановление колонки вручную после преобразования
Если в результате автоматического преобразования создается документ, в котором текст из разных столбцов чередуется в неправильном порядке, функция «Найти и заменить» Word с подстановочными знаками может помочь разделить объединенный текст. Найдите шаблоны, обозначающие разрывы столбцов в исходном макете, например постоянное количество пробелов или определенный образец пунктуации, который появляется в конце одного столбца и начале следующего. Поиск и замена по подстановочным знакам выполняется быстрее, чем вручную вырезать и вставлять каждый абзац обратно в правильный порядок столбцов.
Для документов, в которых порядок столбцов имеет семантическое значение, таких как двуязычные документы с языком оригинала в левом столбце и переводом в правом, сохранение пары столбцов имеет важное значение. После преобразования проверьте, что каждый абзац в левом столбце соответствует правильному абзацу в правом столбце. Единственное несовпадение в начале документа распространяется на все последующие абзацы. Этап проверки для документов с парными столбцами занимает больше времени, чем для стандартных макетов с несколькими столбцами, но он необходим для того, чтобы документ можно было использовать.
Если автоматическое обнаружение столбцов дает беспорядочный результат, резервным вариантом является ручное восстановление. В Word используйте функцию «Столбцы» на вкладке «Макет», чтобы настроить правильное количество столбцов для каждого раздела документа. Затем вырежьте и вставьте текст из беспорядочного преобразования в правильном порядке столбцов. Это наиболее трудоемкий подход, но позволяет получить идеально структурированный документ. Для 10-страничного двухколоночного документа ручная реставрация занимает от 15 до 30 минут в зависимости от сложности макета.
Используйте исходный PDF-файл в качестве визуального ориентира при восстановлении столбцов вручную. Откройте PDF-файл на одной стороне экрана и документ Word на другой. Просматривайте документ страницу за страницей, проверяя, что текст в каждом столбце документа Word соответствует тексту в соответствующем столбце PDF-файла. Это параллельное сравнение выявляет неправильно упорядоченные абзацы, которые в противном случае остались бы незамеченными. Дополнительное время на проверку оправдано для документов, структура столбцов которых имеет смысл, например, для сравнительного анализа, где в левом и правом столбцах представлены противоположные точки зрения.
Часто задаваемые вопросы
Что лучше: конвертировать весь PDF-файл сразу или постранично для документов с большим количеством столбцов? Одновременное преобразование всего документа дает алгоритму обнаружения больше данных для работы. Он может определять согласованные шаблоны столбцов на страницах и применять их единообразно. Постраничное преобразование заставляет алгоритм повторно определять структуру столбцов для каждой страницы индивидуально, что может привести к противоречивым результатам, даже если расположение столбцов одинаково на всех страницах.
Могу ли я настроить шаблон Word, соответствующий моим обычным макетам столбцов PDF, чтобы преобразования были более предсказуемыми? Да. Создайте шаблон Word с правильным количеством столбцов, полей и настройками шрифта. После преобразования PDF в Word импортируйте преобразованный текст в шаблон. Шаблон предоставляет структуру столбцов, и импортированный текст заполняет ее. Этот подход отделяет определение макета от извлечения контента и дает более согласованные результаты при многократном преобразовании PDF-файлов с одинаковой структурой.
Можно ли преобразовать PDF-файл с тремя или более столбцами в Word, сохранив при этом все столбцы?
Да, но вероятность успеха снижается по мере увеличения количества столбцов. Макеты с двумя колонками хорошо конвертируются с помощью современных инструментов. Макеты с тремя столбцами приемлемо конвертируются с помощью лучших инструментов, но могут потребовать некоторой очистки. Макеты с четырьмя или более столбцами, например плотные газетные страницы, почти всегда требуют ручной обработки после преобразования. Узкие столбцы оставляют мало места алгоритму обнаружения для надежного определения пробелов.
Влияет ли преобразование PDF-файла на основе столбцов в Word на изображения и графику между столбцами?
Изображения, занимающие несколько столбцов, обычно преобразуются правильно, поскольку они распознаются как отдельные объекты от текста. Изображения, встроенные в столбец, например небольшая иллюстрация, размещенная рядом с текстом, могут нарушить обнаружение столбца, поскольку изображение нарушает поток текста, которому пытается следовать алгоритм. После преобразования убедитесь, что изображения возле границ столбцов расположены правильно и текст обтекает их должным образом.
Должен ли я конвертировать отсканированный документ с несколькими столбцами иначе, чем цифровой?
Отсканированные документы должны пройти процедуру оптического распознавания символов перед обнаружением столбцов, что добавляет дополнительный шаг, но также предоставляет новые возможности. Механизмы OCR, предназначенные для преобразования документов, часто имеют более сложный анализ макета, чем механизмы извлечения текста, поскольку OCR изначально разрабатывался именно для этого варианта использования. Высококачественный механизм оптического распознавания символов, примененный к отсканированному документу с несколькими столбцами, может обеспечить лучшее сохранение столбцов, чем механизм извлечения текста, примененный к эквивалентному цифровому PDF-файлу.
Попробуйте PDF в Word
Никакой установки не требуется. Работает прямо в вашем браузере.
