PDF의 테이블 데이터를 Excel로 추출하면 행은 페이지에 나타나는 순서대로 도착합니다. 지역별로 그룹화된 판매 기록이나 공급업체별로 그룹화된 송장과 같이 해당 행을 범주별로 별도의 워크시트로 정렬해야 하는 경우 수동 잘라내기 및 붙여넣기 방식은 10개 행에 대해서는 작동하지만 수백 개 행에 대해서는 실용적이지 않습니다. 문제는 PDF에서 Excel으로의 변환 도구가 추출 프로세스 중에 데이터를 자동으로 정렬하고 분류할 수 있는지 아니면 데이터가 Excel에 도착한 후 정렬을 처리해야 하는지 여부입니다.
주요 내용
표준 PDF-Excel 변환은 데이터를 정렬하거나 분류하지 않습니다. 페이지 순서대로 행을 추출하여 단일 워크시트에 배치합니다. 범주 값별로 별도의 워크시트로 자동 분류하려면 변환 후 Excel 매크로, 파워 쿼리 변환 또는 기본 제공 분류 논리가 있는 고급 추출 도구가 필요합니다. 최선의 접근 방식은 분류가 일회성 작업인지 아니면 반복적인 워크플로인지에 따라 달라집니다.

표준 PDF에서 Excel로의 변환이 가능한 것과 불가능한 것
표준 변환 도구는 PDF 페이지의 시각적 레이아웃을 읽고, 눈금선과 정렬된 텍스트 블록을 감지하여 테이블 구조를 식별하고, 감지된 셀을 Excel 셀에 매핑합니다. 출력에서는 원본 테이블의 행 순서와 열 구조를 유지합니다. 이는 PDF를 충실히 재현한 것이지만 데이터 처리는 아닙니다. 이 도구는 데이터의 의미를 이해하기 위해 셀의 내용을 읽지 않습니다. "West"가 포함된 행 Region 열과 "East"가 포함된 행에 동일하게 추출됩니다. 도구에는 이러한 행이 다른 카테고리에 속하는지 감지하는 메커니즘이 없습니다.
일부 고급 PDF 데이터 추출 도구는 시각적 추출을 넘어 패턴 인식을 적용하여 테이블 내의 범주 필드를 식별합니다. 이러한 도구는 실제로 "추출된 데이터의 C열을 스캔하고, 해당 열의 고유 값을 식별하고, 각 고유 값에 대해 별도의 출력을 생성합니다."라는 규칙을 사용하여 구성할 수 있습니다. 이것은 표준 PDF 변환이 아닙니다. 이는 OCR, 테이블 인식 및 데이터 변환의 교차점에 있는 특수 데이터 추출 기능입니다. 워크플로에 이것이 필요한 경우 기능 목록에서 데이터 분류 또는 데이터 그룹화를 명시적으로 광고하는 도구를 찾으세요.
PDF를 Excel로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
Excel 매크로 및 파워 쿼리를 사용한 변환 후 정렬
매크로와 파워 쿼리를 완전히 사용하지 않으려는 사용자의 경우 수동 워크시트 생성과 결합된 Excel의 기본 제공 필터 및 정렬 기능은 중간 규모의 데이터 세트에 유효한 접근 방식입니다. 범주 열에 필터를 적용하고 한 번에 하나의 범주 값을 선택한 다음 필터링된 행을 복사하여 새 워크시트에 붙여넣습니다. 5개 범주와 200개 행이 있는 데이터 세트의 경우 이 수동 접근 방식은 약 5분 정도 소요되며 기본 Excel 탐색 이상의 설정이나 기술 지식이 필요하지 않습니다.
가장 널리 적용할 수 있는 접근 방식은 전체 PDF 표를 단일 Excel 시트로 변환한 다음 Excel에 내장된 도구를 사용하여 데이터를 정렬하고 분할하는 것입니다. 간단한 VBA 매크로는 지정된 열의 고유 값을 읽고, 각 고유 값에 대해 새 워크시트를 만들고, 일치하는 행을 적절한 시트에 복사할 수 있습니다. 매크로는 수천 개의 행이 있는 데이터 세트에서 실행하는 데 1분 미만이 걸리며 자동화된 패턴 인식의 모호함 없이 지정된 대로 정확하게 분류를 수행합니다.
파워 쿼리는 Excel의 데이터 변환 도구에 익숙한 사용자를 위해 매크로가 없는 대안을 제공합니다. 데이터 탭을 통해 변환된 데이터를 파워 쿼리에 로드합니다. 그룹화 기능을 사용하여 범주별로 행을 집계하거나 각 범주 값에 대한 데이터를 필터링하고 필터링된 각 결과를 별도의 워크시트에 로드합니다. 파워 쿼리 변환은 반복 가능합니다. 쿼리를 저장하고 다음에 유사한 구조의 PDF를 변환할 때 쿼리를 새로 고쳐 새 데이터에 동일한 정렬 논리를 적용합니다. 반복 워크플로의 경우 변환 단계가 쿼리 편집기에 표시되고 코드를 읽지 않고도 조정할 수 있으므로 파워 쿼리는 VBA 매크로보다 유지 관리가 더 쉽습니다.
반복 PDF 가져오기에 대한 자동 분류 설정
반복되는 PDF 가져오기를 위한 파워 쿼리 변환을 작성할 때 PDF 파일 이름을 쿼리 매개 변수로 사용하면 동일한 쿼리가 수정 없이 새 파일에 대해 작동합니다. 파워 쿼리 편집기에서 FilePath라는 매개 변수를 만들고 데이터 원본 단계에서 참조합니다. 새 PDF를 받을 때마다 FilePath 매개변수를 업데이트하여 새 파일을 가리키고 새로 고치세요. 범주 기반 정렬 및 워크시트 분할을 포함한 전체 변환은 새 데이터에 대해 자동으로 실행됩니다.
주간 판매 보고서나 월간 송장 배치와 같이 유사한 구조의 PDF 테이블을 정기적으로 받는 경우 반복 가능한 워크플로를 설정하는 데 시간을 투자하십시오. 하나의 대표 PDF를 Excel로 변환하는 것부터 시작하세요. 파워 쿼리를 열고 필요한 대로 정확하게 데이터를 필터링, 정렬 및 분할하는 변환을 기록합니다. 쿼리를 저장합니다. 후속 PDF의 경우 Excel로 변환하고 통합 문서를 열고 쿼리를 새로 고치세요. PDF 도착부터 분류된 Excel 데이터까지 전체 프로세스는 쿼리가 완료되면 2분 미만이 소요됩니다.
하루에 수십 개의 PDF가 포함된 대용량 워크플로우의 경우 API를 통해 PDF 변환을 스프레드시트 출력에 연결하는 전용 데이터 추출 플랫폼을 고려하십시오. 이러한 플랫폼을 사용하면 범주 데이터가 포함된 열과 출력 분할 방법을 지정하는 추출 템플릿을 정의할 수 있습니다. 템플릿은 한 번 구성되고 들어오는 모든 PDF에 자동으로 적용됩니다. 이 기능을 갖춘 플랫폼에는 기업 문서 처리 서비스와 일부 클라우드 기반 PDF API 제공업체가 포함됩니다. WukongPDF의 PDF-Excel 변환은 유사한 문서 배치 전체에서 자동화된 분류를 안정적으로 만드는 일관된 열 매핑을 통해 파워 쿼리 변환에 준비된 깔끔하고 구조화된 테이블 출력을 생성합니다.
수동 분류가 여전히 최선의 선택인 경우
자동화가 일상적인 사례를 처리하고 수동 검토가 극단적인 사례를 처리할 때 하이브리드 워크플로가 효과적일 수 있습니다. 범주 열에 표준 값이 포함된 행을 지정된 워크시트로 자동 정렬하도록 파워 쿼리를 설정합니다. 비표준 또는 빈 범주 값이 있는 행은 사용자가 올바른 범주를 결정할 수 있는 검토 워크시트로 라우팅됩니다. 이 접근 방식은 시스템이 모호한 데이터에 대해 추측하도록 강요하지 않고 자동화 적용 범위를 최대화합니다.
자동화가 항상 정답은 아닙니다. 문서마다 구조가 다른 테이블이 포함된 PDF를 소량 받은 경우 매크로 또는 파워 쿼리를 구성하는 데 소요되는 시간이 데이터를 수동으로 정렬하는 데 소요되는 시간을 초과할 수 있습니다. 행이 50개 미만인 일회성 작업의 경우 각 범주에 대한 행을 선택하고 잘라내어 새 시트에 붙여넣는 데 몇 분이 걸리며 설정이 필요하지 않습니다. 손익분기점은 일반적으로 동일한 문서 구조가 세 번 발생하는 시점입니다. 동일한 유형의 PDF에 대해 동일한 분류를 세 번 이상 수행하는 경우 자동화를 통해 비용을 지불할 수 있습니다.
수동 분류는 범주 논리에 사람의 판단이 필요한 경우에도 적합합니다. "서부" "동쪽," 및 "중앙" 자동 분할이 간단합니다. 표준화된 코드가 아닌 구문을 기반으로 긴급 항목과 긴급하지 않은 항목을 구별하는 등 텍스트 설명 내용에 의해 범주가 암시되는 메모 열에는 사람이 판독해야 합니다. 자동화된 도구는 미묘하고 구조화되지 않은 텍스트를 기반으로 데이터를 안정적으로 분류할 수 없습니다. 이러한 경우 모든 데이터를 하나의 시트로 추출하고 수동으로 분류하세요.
자주 묻는 질문
PDF 테이블이 머리글 행이 반복되는 여러 페이지에 걸쳐 있는 경우 어떻게 해야 합니까? 대부분의 PDF-Excel 변환기는 각 페이지에서 반복될 때 머리글 행을 데이터로 처리합니다. 변환 후에는 각 페이지 나누기에서 데이터 행과 함께 헤더 텍스트가 산재되어 있는 것을 볼 수 있습니다. Excel의 필터를 사용하여 첫 번째 열에 헤더 텍스트가 포함된 모든 행을 선택하고 삭제합니다. 머리글 행이 데이터로 잘못 분류될 수 있으므로 정렬이나 분류를 실행하기 전에 이 정리 단계가 필요합니다.
PDF 테이블 데이터를 별도의 워크시트가 아닌 별도의 Excel 파일로 분할할 수 있습니까?
예. VBA 매크로와 파워 쿼리는 모두 동일한 통합 문서 내의 별도 워크시트가 아닌 별도의 Excel 통합 문서에 각 범주의 데이터를 저장할 수 있습니다. VBA에서는 Workbooks.Add 및 SaveAs 메서드를 사용합니다. 파워 쿼리에서 필터링된 각 결과를 별도의 연결에 로드하고 각 연결을 자체 파일로 내보냅니다. 워크시트와 통합 문서 사이의 선택은 데이터 배포 방식에 따라 달라집니다. 각 범주의 데이터가 다른 사람에게 전달되는 경우 별도의 통합 문서가 더 깔끔합니다.
PDF 테이블에 여러 범주에 걸쳐 있는 셀이 병합되어 있으면 어떻게 됩니까?
병합된 셀은 자동 분류에서 알려진 문제입니다. 지역 열이 병합된 셀을 사용하여 여러 행에 "서부"라는 레이블을 지정하는 PDF 테이블 그룹의 첫 번째 행에만 나타나는 레이블로 추출됩니다. 정렬하기 전에 모든 행에 카테고리 값이 있도록 카테고리 열을 채우세요. Excel에서 열을 선택하고 Ctrl+G를 누른 다음 특수를 클릭하고 공백을 선택한 다음 =를 입력하고 위쪽 화살표를 누른 다음 Ctrl+Enter를 누릅니다. 그러면 모든 빈 셀이 위 셀의 값으로 채워집니다.
OCR 정확도가 카테고리 기반 정렬에 영향을 미치나요?
네, 상당히 그렇습니다. OCR이 "West"를 잘못 읽는 경우 "West"로 또는 "VVest", 해당 값은 정렬된 출력에서 별도의 범주가 됩니다. 변환 후 및 정렬 전에 항상 범주 열의 고유 값을 검토하세요. 카테고리 열의 피벗 테이블을 빠르게 스캔하면 OCR 오류가 즉시 드러납니다. 분류를 실행하기 전에 오류를 수동으로 수정하거나 찾기 및 바꾸기 단계를 통해 수정하세요.
PDF를 Excel로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
