Tips & Tricks

Как удалить повторяющиеся строки или повторяющиеся записи внутри PDF-документа

Таблица PDF, экспортированная из базы данных, содержит 500 строк. При открытии файла дважды обнаруживается каждая строка или определенные записи, повторяющиеся по шаблону из исходного запроса, который вернул дубликаты. Сам PDF-файл не поврежден. Данные внутри содержат дублированный контент, и удаление этих дубликатов означает либо непосредственное редактирование PDF-файла, что большинство инструментов не поддерживает для операций на уровне строки, либо извлечение, внешнюю дедупликацию и воссоздание чистой версии.

PDF-файлы не являются электронными таблицами. Вы не можете нажать кнопку, чтобы удалить повторяющиеся строки. Но вы можете извлечь данные, очистить их и вернуть обратно.

Удаление повторяющихся строк из документа PDF Editor требует преобразования содержимого PDF в редактируемый формат, его дедупликации и, при необходимости, воссоздания PDF-файла. Fix PDF и инструменты преобразования WukongPDF выполняют извлечение, а приведенный ниже рабочий процесс охватывает весь конвейер дедупликации.

How to Remove Duplicate Lines or Repeated Entries Inside a PDF Document

Извлечение содержимого в редактируемый формат

Извлечение текста из PDF-файла в формат, удобный для дедупликации, — это важнейший первый шаг. Экспортируйте в Excel, если содержимое представляет собой таблицу с согласованными столбцами. Экспортируйте в Word, если содержимое содержит текст с абзацами. Экспортируйте в обычный текст, если структура проста. Выбор формата экспорта соответствует структуре контента.

Табличные данные принадлежат Excel благодаря встроенным инструментам дедупликации. Выберите диапазон данных, перейдите на вкладку «Данные» и нажмите «Удалить дубликаты». Выберите столбцы, определяющие, что считается дубликатом (обычно все столбцы для точного сопоставления строк). Excel удаляет все дубликаты, кроме первого, обрабатывая тысячи строк за секунды.

WukongPDF

Попробуйте редактировать PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Дедупликация в Excel после преобразования PDF в Excel

Функция удаления дубликатов в Excel работает с точными совпадениями в выбранных столбцах. Почти повторяющиеся строки, одинаковые данные, но разное форматирование или пробелы, требуют предварительной очистки. Обрежьте лишние пробелы с помощью TRIM. Стандартизируйте регистр с помощью UPPER или LOWER. Удалите непечатаемые символы с помощью CLEAN. Более чистые данные перед дедупликацией означают, что будет найдено больше дубликатов.

Выделите дубликаты перед их удалением, если требуется проверка. Условное форматирование, Правила выделения ячеек, Повторяющиеся значения — показывает, какие строки являются повторяющимися, ничего не удаляя. Просмотрите выделенные строки, убедитесь, что они действительно повторяются, а затем удалите их. В этом обзоре рассматриваются случаи, когда две строки выглядят одинаково, но на самом деле представляют собой разные транзакции, в которых используется одна и та же сумма в долларах.

Дедупликация в Word текстовых PDF-файлов

Для запуска текста с повторяющимися абзацами необходимо использовать функцию поиска и замены Word в сочетании с шаблонами подстановочных знаков. Абзац, появляющийся дважды подряд, можно найти и свести к одному экземпляру. Это обрабатывает точные дубликаты, но не почти дубликаты, отличающиеся одним или двумя словами.

Проверка повествовательного текста вручную более надежна, чем автоматизация. Сканируйте повторяющиеся абзацы. Абзац, появляющийся как во введении, так и в заключении, может быть преднамеренным повторением ради риторического эффекта, а не ошибкой дублирования. Автоматизированные инструменты не могут отличить намеренное повторение от случайного. Для дедупликации текста требуется человеческое суждение, когда контекст определяет правильность повторения.

Тип контентаЭкспорт вМетод дедупликацииОсторожно
Табличные данные со столбцамиЭксельДанные > Удалить дубликатыУбедитесь, что все столбцы, выбранные для сопоставления, верны.
Простой список, по одному элементу в строкеОбычный текст или ExcelСортировка и удаление дубликатов или дедупликация ExcelПри сортировке может потеряться первоначальный порядок; сначала добавьте индексный столбец
Бегущий текст, абзацыСловоРучная проверка или поиск дубликатов с подстановочными знакамиПреднамеренное повторение может быть случайно удалено.
Смешанный контентExcel для таблиц, Word для текстаРазделение по типу контента, дедупликация каждого отдельноПорядок сборки должен быть сохранен.

Воссоздание чистого PDF-файла после дедупликации

После удаления дубликатов в Excel или Word сохраните чистый файл как новый PDF-файл с помощью «Сохранить как PDF» или онлайн-конвертера. Полученный PDF-файл содержит чистые данные без дубликатов. Сравните количество страниц исходного и очищенного PDF-файла. Если в оригинале было 500 строк и 50 из них были дубликатами, в очищенном PDF-файле страниц должно быть примерно на 10 % меньше. Уменьшение количества страниц подтверждает, что дедупликация сработала.

Сохраняйте исходный PDF-файл в качестве неизмененной резервной копии до тех пор, пока не будет проверена очищенная версия. Дедупликация, которая была слишком агрессивной и удалила уникальные строки вместе с дубликатами, не может быть отменена, если оригинал удален. Сохраняйте оригинал до тех пор, пока проверка не подтвердит, что очищенная версия правильна и полна.

Использование дедупликации по сценарию для больших или повторяющихся заданий

Библиотека Python pandas обеспечивает дедупликацию больших наборов данных с большей гибкостью, чем встроенный инструмент Excel. Сценарий, читающий экспортированные данные, применяющий логику дедупликации с настраиваемыми критериями соответствия и выводящий чистый файл, выполняется за секунды, независимо от количества строк. Сценарий обрабатывает крайние случаи, определяет, что считается дубликатом, какое вхождение сохранить, следует ли регистрировать удаленные строки, с помощью кода, документирующего точную применяемую логику.

Для повторяющихся заданий дедупликации сценарий является постоянным активом. Один и тот же отчет в формате PDF, создаваемый еженедельно с одним и тем же шаблоном дублирования, каждую неделю очищается одним и тем же сценарием. Первоначальные 30-минутные инвестиции в создание сценариев позволяют сэкономить часы ручной дедупликации в течение года. Контролируйте версии сценария, чтобы будущие сопровождающие могли видеть логику дедупликации и корректировать ее по мере изменения формата исходных данных.

Предотвращение дублирования контента в источнике

Дублирующийся контент в PDF-файлах обычно возникает в запросе к базе данных, генераторе отчетов или процессе слияния, в результате которого был создан PDF-файл. Исправьте исходный запрос, чтобы он использовал SELECT DISTINCT, или исправьте условия JOIN. Исправьте процесс слияния, чтобы проверить перекрывающиеся диапазоны страниц. Каждый дубликат, удаленный в источнике, предотвращает дальнейший сеанс дедупликации PDF.

Рабочий процесс дедупликации PDF устраняет симптомы. Лекарство существует в любой системе, создавшей дублированный контент. Задокументируйте, откуда появились дубликаты, и исправьте процесс. Первая спасательная операция понятна. Второе появление из того же источника с теми же дубликатами сигнализирует о сбое процесса, который требует постоянного исправления.

WukongPDF

Попробуйте редактировать PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →