Tips & Tricks

PDF 문서 내에서 중복된 줄이나 반복되는 항목을 제거하는 방법

데이터베이스에서 내보낸 PDF 테이블에는 500개의 행이 포함되어 있습니다. 파일을 열면 모든 행이 두 번 표시되거나, 중복 항목을 반환한 소스 쿼리의 패턴으로 반복되는 특정 항목이 표시됩니다. PDF 자체는 손상되지 않았습니다. 내부 데이터에는 중복된 콘텐츠가 있으며 이러한 중복된 콘텐츠를 제거한다는 것은 대부분의 도구가 라인 수준 작업을 지원하지 않는 PDF를 직접 편집하거나 외부에서 추출, 중복 제거 및 깨끗한 버전을 다시 만드는 것을 의미합니다.

PDF는 스프레드시트가 아닙니다. 중복 행을 제거하기 위해 버튼을 클릭할 수 없습니다. 하지만 데이터를 꺼내서 정리하고 다시 넣을 수는 있습니다.

PDF Editor 문서에서 중복된 줄을 제거하려면 PDF 내용을 편집 가능한 형식으로 변환하고 거기서 중복을 제거한 후 선택적으로 PDF를 다시 만들어야 합니다. WukongPDF의 Fix PDF 및 변환 도구가 추출을 처리하며 아래 워크플로우는 전체 중복 제거 파이프라인을 다룹니다.

How to Remove Duplicate Lines or Repeated Entries Inside a PDF Document

편집 가능한 형식으로 콘텐츠 추출

PDF에서 텍스트를 중복 제거에 적합한 형식으로 가져오는 것이 중요한 첫 번째 단계입니다. 콘텐츠가 일관된 열로 구성된 표 형식인 경우 Excel로 내보냅니다. 콘텐츠가 단락이 있는 텍스트로 실행되는 경우 Word로 내보냅니다. 구조가 간단한 경우 일반 텍스트로 내보냅니다. 내보내기 형식 선택은 콘텐츠 구조를 따릅니다.

표 형식 데이터는 기본 제공 중복 제거 도구로 인해 Excel에 속합니다. 데이터 범위를 선택하고 데이터 탭으로 이동한 다음 중복 제거를 클릭합니다. 중복으로 간주되는 항목을 정의하는 열(일반적으로 정확한 행 일치를 위한 모든 열)을 선택합니다. Excel은 첫 번째 항목을 제외한 모든 중복 항목을 제거하여 수천 개의 행을 몇 초 만에 처리합니다.

WukongPDF

PDF 편집을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

PDF를 Excel로 변환한 후 Excel에서 중복 제거

Excel의 중복 제거는 선택한 열 전체에서 정확히 일치하는 항목에 대해 작동합니다. 거의 중복된 행, 동일한 데이터이지만 서식이나 공백이 다른 경우 먼저 정리가 필요합니다. TRIM을 사용하여 추가 공간을 자릅니다. UPPER 또는 LOWER로 케이스를 표준화합니다. CLEAN을 사용하여 인쇄되지 않는 문자를 제거합니다. 중복 제거 전 데이터가 깨끗해지면 중복 항목이 더 많이 발견됩니다.

검토가 필요한 경우 중복 항목을 제거하기 전에 강조 표시하세요. 조건부 서식, 셀 강조 규칙, 중복 값은 아무것도 삭제하지 않고 중복된 행을 보여줍니다. 강조표시된 행을 검토하고 실제로 중복되었는지 확인한 후 제거하세요. 이 검토에서는 두 행이 비슷해 보이지만 동일한 금액을 공유하는 실제로는 다른 거래인 경우를 포착합니다.

텍스트 기반 PDF에 대해 Word에서 중복 제거

중복된 단락이 있는 텍스트를 실행하려면 와일드카드 패턴과 결합된 Word의 찾기 및 바꾸기가 필요합니다. 연속해서 두 번 나타나는 단락을 찾아 단일 인스턴스로 줄일 수 있습니다. 이는 정확한 중복을 처리하지만 단어 한두 개가 다른 거의 중복은 처리하지 않습니다.

서술형 텍스트의 경우 수동 검토가 자동화보다 더 안정적입니다. 반복되는 단락을 검색하세요. 서론과 결론 모두에 나타나는 문단은 중복 오류가 아니라 수사적 효과를 위해 의도적인 반복일 수 있습니다. 자동화된 도구는 의도적인 반복과 우발적인 반복을 구별할 수 없습니다. 맥락에 따라 반복이 올바른지 여부가 결정되는 텍스트 중복 제거에는 사람의 판단이 필요합니다.

콘텐츠 유형수출 대상중복 제거 방법주의
열이 포함된 테이블 형식 데이터뛰어나다데이터 > 중복 제거일치를 위해 선택한 모든 열이 올바른지 확인하세요.
간단한 목록, 한 줄에 하나의 항목일반 텍스트 또는 Excel중복 항목 정렬 및 제거 또는 Excel 중복 제거정렬하면 원래 순서가 손실될 수 있습니다. 먼저 인덱스 열을 추가하세요.
텍스트, 단락 실행단어수동 검토 또는 와일드카드 중복 찾기의도적인 반복은 실수로 삭제될 수 있습니다.
혼합 콘텐츠표는 Excel, 텍스트는 Word콘텐츠 유형별로 분할하고 각각 별도로 중복 제거재조립 순서를 유지해야 합니다.

중복 제거 후 깨끗한 PDF 다시 만들기

Excel이나 Word에서 중복 항목을 제거한 후 PDF로 저장 또는 온라인 변환기를 통해 깨끗한 파일을 새 PDF로 저장하세요. 결과 PDF에는 중복되지 않은 깨끗한 데이터가 포함됩니다. 원본과 정리된 PDF 페이지 수를 비교합니다. 원본에 500개의 행이 있고 50개가 중복된 행인 경우 정리된 PDF의 페이지 수는 대략 10% 더 적어야 합니다. 페이지 수 감소를 통해 중복 제거가 제대로 이루어졌음을 확인합니다.

정리된 버전이 확인될 때까지 원본 PDF를 수정되지 않은 백업으로 유지하십시오. 너무 공격적이어서 중복 항목과 함께 고유 행을 제거한 중복 제거는 원본이 삭제되면 실행 취소할 수 없습니다. 정리된 버전이 정확하고 완전하다는 확인이 이루어질 때까지 원본을 보관하십시오.

대규모 또는 반복 작업에 스크립트형 중복 제거 사용

Python의 pandas 라이브러리는 Excel에 내장된 도구보다 더 유연하게 대규모 데이터 세트의 중복 제거를 처리합니다. 내보낸 데이터를 읽고, 구성 가능한 일치 기준으로 중복 제거 논리를 적용하고, 정리된 파일을 출력하는 스크립트는 행 수에 관계없이 몇 초 만에 실행됩니다. 스크립트는 적용된 정확한 논리를 문서화하는 코드를 사용하여 중복으로 간주되는 항목, 유지할 항목, 제거된 행을 기록할지 여부 등 극단적인 사례를 처리합니다.

반복되는 중복 제거 작업의 경우 스크립트는 영구 자산입니다. 동일한 복제 패턴으로 매주 생성된 동일한 PDF 보고서는 매주 동일한 스크립트로 정리됩니다. 30분의 초기 스크립팅 투자로 일년 내내 수동으로 제거해야 하는 시간을 절약할 수 있습니다. 향후 관리자가 중복 제거 논리를 확인하고 소스 데이터 형식이 변경됨에 따라 조정할 수 있도록 스크립트 버전을 제어합니다.

소스에서 중복 콘텐츠 방지

PDF의 중복 콘텐츠는 일반적으로 PDF를 생성한 데이터베이스 쿼리, 보고서 생성기 또는 병합 프로세스의 업스트림에서 발생합니다. SELECT DISTINCT를 사용하거나 JOIN 조건을 수정하도록 소스 쿼리를 수정하세요. 페이지 범위가 겹치는지 확인하도록 병합 프로세스를 수정합니다. 소스에서 제거된 각 복제본은 다운스트림 PDF 중복 제거 세션을 방지합니다.

PDF 중복 제거 작업 흐름은 증상을 처리합니다. 치료법은 복제 콘텐츠를 생성한 시스템에 관계없이 존재합니다. 중복이 발생한 위치를 문서화하고 프로세스를 수정하세요. 첫 번째 구조 작업은 이해할 수 있습니다. 동일한 중복 항목이 동일한 소스에서 두 번째로 발생하면 영구적인 수정이 필요한 프로세스 오류가 발생했음을 나타냅니다.

WukongPDF

PDF 편집을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →