
여러 페이지로 구성된 PDF 테이블이 Excel로 변환될 때 조각으로 나뉘는 이유
여러 페이지에 걸쳐 있는 PDF 테이블을 Excel 스프레드시트로 변환하는 것은 자동화해야 하는 작업처럼 보입니다. 페이지를 선택하고 변환을 실행하면 단일 연속 테이블이 수신됩니다. PDF에서 Excel으로의 변환 엔진은 각 페이지를 독립된 캔버스로 보고 각 페이지에 대해 별도의 테이블이나 별도의 시트를 생성하기 때문에 현실은 다릅니다. 그 결과 모든 시트에 동일한 테이블 헤더 행이 나타나고, 행이 페이지 경계에서 중간 데이터를 나누고, 수십 개의 페이지 수준 테이블을 하나의 연속 데이터 세트로 통합하려면 몇 시간의 수동 복사 및 붙여넣기가 필요한 조각난 스프레드시트가 생성되었습니다.
교차 페이지 감지는 이를 자동으로 처리합니다.
이 접근 방식은 대부분의 재무 문서에 적용됩니다.
근본 원인은 PDF가 페이지 콘텐츠를 나타내는 방식에 있습니다. PDF 페이지는 페이지 경계를 넘어 흐르는 내용에 대한 고유한 개념이 없는 독립적인 그리기 화면입니다. 12페이지 하단에서 시작하여 13페이지 상단까지 계속되는 표는 PDF에서 벡터 선과 텍스트 개체로 구성된 두 개의 독립적인 세트로 표시됩니다. 변환 엔진에는 이러한 두 페이지 수준 테이블이 실제로 하나의 연속 테이블임을 알려주는 구조적 신호가 없습니다. 엔진이 속도를 위해 대부분의 기본 변환기가 건너뛰는 페이지 간 콘텐츠 분석을 수행하지 않는 한, 출력은 소스 PDF에 존재하는 페이지 수준 조각화를 충실하게 재현합니다.
반복되는 헤더 행은 조각화 문제를 더욱 악화시킵니다. 대부분의 다중 페이지 테이블은 인쇄된 버전이나 PDF 버전에서 가독성을 높이기 위해 각 새 페이지 상단에 열 머리글 행을 반복합니다. 각 페이지가 별도의 시트나 별도의 테이블 범위로 변환되면 반복되는 머리글 행이 모든 출력 세그먼트에 데이터 행으로 나타납니다. 20페이지의 변환된 출력을 통합한다는 것은 데이터가 단일 연속 테이블에 병합되기 전에 반복되는 머리글 행의 19개 복사본을 수동으로 식별하고 삭제하는 것을 의미합니다.
PDF를 Excel로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
클린 변환을 위한 PDF 테이블 준비
PDF 데이터 추출 출력의 품질은 변환이 시작되기 전 PDF 테이블의 구조에 따라 크게 달라집니다. 정의된 셀 경계와 데이터 셀이 있는 실제 PDF 테이블 개체로 생성된 표는 사람이 보기에는 표처럼 보이는 선과 텍스트 상자의 시각적 배열로 생성된 표보다 더 깔끔하게 변환됩니다. PDF 생성 프로세스를 제어할 수 있는 경우 의미 테이블 구조를 지원하는 PDF 라이브러리를 사용하여 테이블을 생성하면 워드 프로세서나 스프레드시트 응용 프로그램에서 시각적 테이블 레이아웃을 인쇄하는 것보다 훨씬 더 나은 변환 결과를 얻을 수 있습니다.
변환을 실행하기 전에 테이블 내용이 태그가 있는 테이블 요소로 저장되어 있는지 또는 연결되지 않은 텍스트 개체로 저장되어 있는지 식별할 수 있는 PDF 검사 도구를 사용하여 PDF 테이블 구조를 검사하세요. 태그가 지정된 테이블에는 어떤 텍스트가 어떤 셀에 속하고 어떤 셀이 어떤 행에 속하는지 변환 엔진에 알려주는 구조적 메타데이터가 포함되어 있습니다. PDF 태그를 읽을 수 있는 변환 엔진은 올바른 셀 간 매핑을 통해 구조화된 Excel 출력을 생성합니다. 태그가 지정되지 않은 시각적 테이블에는 텍스트 위치와 라인 아트에서 테이블 구조를 추론하는 변환 엔진이 필요하며 이는 본질적으로 신뢰성이 낮습니다.
표에 태그가 지정되지 않은 경우 변환 전에 PDF에 표 태그를 추가하는 전처리 과정을 통해 출력 품질이 크게 향상됩니다. 전문 PDF 편집자는 표 영역을 자동으로 감지하고 감지된 구조에 표 태그를 적용할 수 있습니다. 자동 태그 지정은 완벽하지는 않지만, 특히 병합된 셀이 있거나 불규칙한 행 높이가 있는 테이블에서는 변환 엔진이 작동할 수 있는 구조적 기반을 제공하고 태그가 완전히 지정되지 않은 원본을 변환하는 것보다 수동 정리가 훨씬 덜 필요한 출력을 생성합니다.
교차 페이지 표 감지가 활성화된 상태에서 변환 실행
모든 PDF-Excel 변환기가 교차 페이지 표 감지를 지원하는 것은 아니며, 지원하는 변환기 중에서 해당 기능은 기본적으로 활성화되지 않을 수 있습니다. 변환을 실행하기 전에 '여러 페이지 테이블 검색', '페이지 간 테이블 병합', '연속 테이블 검색' 또는 유사한 용어로 표시된 옵션에 대한 변환기 설정을 확인하세요. 이 설정을 활성화하면 엔진이 인접한 페이지의 테이블 구조를 분석하고 감지된 연속 항목을 단일 출력 테이블로 병합하도록 지시합니다.
교차 페이지 감지는 연속 페이지에 있는 테이블의 열 구조를 비교하여 작동합니다. 8페이지가 특정 상대 너비를 가진 5개 열이 있는 테이블로 끝나고 9페이지가 열 너비가 일치하는 동일한 5열 구조를 가진 테이블로 시작하는 경우 엔진은 가능성이 높은 페이지 간 연속을 식별하고 두 세그먼트를 병합합니다. 열 너비가 일관되게 유지되더라도 서로 다른 페이지의 머리글과 바닥글이 페이지의 테이블 위치를 이동할 수 있으므로 비교 시 절대 열 위치의 작은 차이가 허용됩니다.
행 사이가 아닌 테이블 행 중간에서 페이지 나누기가 발생하면 검색의 신뢰성이 떨어집니다. 페이지 경계를 가로질러 분할된 행의 상단 절반은 한 페이지에 렌더링되고 하단 절반은 다음 페이지에 렌더링되며 페이지 여백 또는 바닥글은 두 절반 사이의 공간을 차지합니다. 전체 행을 찾는 테이블 감지 알고리즘은 분할 행을 동일한 테이블에 속하는 것으로 인식하지 못할 수 있습니다. PDF로 내보내기 전에 페이지 경계를 넘어 행 분할을 방지하는 소스 애플리케이션의 테이블 레이아웃을 선택하면 이러한 감지 실패 모드가 완전히 제거됩니다.
변환된 출력을 정리하여 페이지 나누기 아티팩트 제거
교차 페이지 감지가 활성화된 경우에도 일부 변환 아티팩트는 일반적으로 Excel 출력에 남아 있으며 수동 또는 스크립트 정리가 필요합니다. 가장 일반적인 아티팩트는 각 페이지 전환 지점에서 변환 엔진에 의해 삽입된 중복 헤더 행입니다. 엔진이 페이지 간 연속을 감지했지만 반복된 헤더를 헤더로 인식하지 못한 경우 헤더 텍스트가 데이터 행으로 나타납니다. 알려진 헤더 텍스트와 일치하는 값을 찾기 위해 출력 테이블의 첫 번째 열을 빠르게 검색하면 삭제할 중복 헤더 행이 식별됩니다.
페이지 전환 지점의 빈 행은 두 번째로 가장 일반적인 아티팩트입니다. PDF 페이지에 표 본문 끝과 페이지 아래쪽 사이에 여백, 바닥글 또는 공백이 있는 경우 변환 엔진은 해당 위치에 하나 이상의 빈 행을 삽입할 수 있습니다. 완전히 빈 행에 대한 필터 및 삭제 전달은 이러한 아티팩트를 몇 초 안에 정리합니다.
여러 페이지로 구성된 대규모 테이블의 경우 스크립트로 정리하는 것이 행별로 수동으로 검사하는 것보다 더 효율적입니다. 변환된 통합 문서를 읽고, 첫 번째 셀이 알려진 머리글 텍스트와 일치하는 행을 제거하고, 완전히 빈 행을 삭제하고, 여러 시트의 데이터를 단일 시트로 통합하는 짧은 Excel 매크로 또는 Python 스크립트는 수백 페이지의 변환된 테이블 출력을 1분 이내에 처리할 수 있습니다.
WukongPDF의 PDF-Excel 변환기에는 페이지 경계를 넘어 연속 테이블을 식별하고 헤더 중복 제거를 통해 통합 출력을 생성하는 교차 페이지 테이블 감지 기능이 포함되어 있습니다. 태그가 지정된 PDF 구조로 생성된 테이블의 경우 변환을 통해 Excel 출력의 셀 형식 정렬, 숫자 형식 및 텍스트 스타일이 유지되므로 여러 페이지로 구성된 대규모 테이블 문서의 변환 후 정리 시간이 몇 시간에서 몇 분으로 단축됩니다.
페이지 나누기 전반에 걸쳐 복잡한 테이블 구조 처리
병합된 셀, 중첩된 헤더 또는 불규칙한 열 개수가 있는 테이블은 페이지 간 변환에 추가적인 문제를 제시합니다. 테이블 상단의 모든 열에 걸쳐 병합된 제목 행이 있는 테이블은 연속 페이지에서 병합된 제목이 반복되어서는 안 되지만, 일부 PDF 생성 도구는 머리글 행 구성의 일부로 이를 반복합니다. 변환 엔진은 각 페이지에서 반복적으로 병합된 제목을 확인하고 이를 출력에서 일반 데이터 행으로 처리합니다.
헤더가 여러 하위 열에 걸쳐 있는 상위 범주와 함께 2~3개의 행을 차지하는 중첩된 열 헤더가 있는 테이블의 경우 교차 페이지 감지는 페이지 전체의 복잡한 헤더 구조와 일치해야 합니다.
동일한 병합 패턴 및 하위 헤더 레이블을 포함하여 7페이지의 헤더 구조가 8페이지의 구조와 일치하는 경우 엔진은 두 개의 페이지 수준 테이블을 확실하게 병합할 수 있습니다. 문서 중간에 테이블 구조가 변경되거나 PDF 생성에서 형식 변형이 도입되어 머리글 구조가 다른 경우 엔진은 논리적으로 함께 속하더라도 이를 별도의 테이블로 처리합니다.
복잡한 다중 페이지 표에 대한 가장 신뢰할 수 있는 접근 방식은 PDF 구조가 페이지 간 인식을 지원하는지 확인한 후 단일 작업으로 전체 표를 변환하는 것입니다. 정확성이 가장 중요한 중요한 데이터의 경우 원본 데이터 원본의 알려진 행 수와 출력의 행 수를 무작위로 검사하면 변환 프로세스 중에 행이 손실되거나 중복되지 않았는지 빠르게 확인할 수 있습니다.
수십 페이지에 걸쳐 있는 재무제표, 송장 기록부 또는 거래 로그를 변환할 때 작은 변환 오류가 누적되면 데이터의 분석 가치가 손상될 수 있습니다. 트랜잭션 로그에 누락된 행이 하나 있다는 것은 변환된 데이터에서 계산된 재무 합계가 원본 문서 합계와 일치하지 않음을 의미합니다. 데이터 행으로 잘못 식별된 단일 중복 헤더 행은 감사 조정을 방해하는 가짜 트랜잭션을 유발할 수 있습니다. 적어도 새 문서 유형의 첫 번째 변환에 대해 페이지별로 원본 문서에 대한 행 수를 확인하면 데이터가 분석 워크플로우에 들어가기 전에 변환 정확도에 대한 신뢰도가 높아집니다.
월별 은행 명세서 또는 주간 판매 보고서와 같이 동일한 문서 유형이 주기적으로 처리되는 반복 변환의 경우 동일한 문서 유형의 이전 변환에 작동했던 감지 설정, 열 매핑 및 정리 규칙을 기억하는 변환 템플릿을 구축하십시오. 템플릿은 첫 번째 변환 문제를 해결하면서 얻은 지식을 캡처하고 후속 변환에 자동으로 적용하여 알려진 문서 형식에 대해 변환당 정리 시간을 몇 시간에서 거의 0으로 줄입니다.
PDF를 Excel로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
