Others

PDF를 Excel로 변환하면 데이터가 있어야 할 곳에 빈 셀이 생성되는 이유는 무엇입니까?

PDF 테이블을 Excel로 변환하고 결과를 열고 숫자가 있어야 할 빈 셀이 있는 스프레드시트를 살펴봅니다. 원본 PDF에는 분명히 해당 위치에 데이터가 있었습니다. 화면에서 보실 수 있습니다. 그러나 Excel 파일에는 공백, 누락된 값 또는 전체 행이 빈 공백으로 축소된 상태로 표시되었습니다. 이는 무엇이 잘못되었는지, 어떻게 수정하는지 명확하지 않기 때문에 PDF에서 Excel로 변환할 때 가장 실망스러운 결과 중 하나입니다.

근본 원인은 일반적으로 변환 도구 자체가 아닙니다. 이는 PDF가 테이블 데이터를 저장하는 방식과 변환 엔진이 기대하는 데이터가 일치하지 않는 것입니다. 빈 셀이 나타나는 구체적인 이유를 이해하면 문제가 신비해지기보다는 해결 가능해집니다.

Why Does Converting a PDF to Excel Sometimes Produce Blank Cells Where Data Should Be

PDF에 실제 테이블 데이터가 아닌 테이블 이미지가 포함되어 있습니다

이는 PDF를 Excel로 변환한 후 빈 셀이 나타나는 가장 일반적인 이유입니다. 출력을 래스터화한 응용 프로그램의 스캔, 스크린샷 또는 PDF로 인쇄를 통해 PDF가 생성된 경우 페이지에 표시되는 표는 평면 이미지입니다. 변환 도구가 구문 분석할 수 있는 기본 데이터 셀, 행 및 열 구조, 텍스트 스트림이 없습니다.

변환 도구가 이미지 기반 테이블을 발견하면 OCR을 실행하여 텍스트를 인식하고 테이블 구조를 재구성하거나 구문 분석할 수 없기 때문에 이미지를 완전히 건너뛰는 두 가지 선택이 있습니다. 많은 기본 PDF에서 Excel로의 변환기는 두 번째 경로를 사용합니다. 그들은 찾을 수 있는 실제 데이터를 추출하고 이미지 기반 콘텐츠는 제외합니다. 결과는 테이블 이미지가 있었던 빈 셀이 있는 스프레드시트입니다. 해결 방법은 이미지의 텍스트를 인식하고 테이블 그리드를 재구성하는 WukongPDF와 같은 OCR이 포함된 PDF 변환기를 사용하는 것입니다. 변환은 픽셀 단위로 완벽하지는 않지만 데이터는 빈 공간으로 사라지지 않고 셀에 나타납니다.

WukongPDF

PDF를 Excel로 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

테이블 레이아웃이 복잡한 병합 또는 중첩 셀을 사용함

테이블이 실제 텍스트 데이터로 구성된 경우에도 원래 애플리케이션의 구조로 인해 변환 엔진이 작동하지 않을 수 있습니다. Microsoft Excel, Google Sheets 및 보고 소프트웨어와 같은 애플리케이션은 단일 헤더가 여러 열에 걸쳐 있는 병합된 셀, 셀 내부에 다른 미니 테이블이 포함된 중첩 테이블, 상위 및 하위 열 그룹이 있는 다중 수준 헤더가 있는 테이블을 만드는 경우가 많습니다.

PDF는 테이블 구조를 나타내도록 설계되지 않았습니다. 페이지의 특정 x, y 좌표에 문자를 배치하도록 설계되었습니다. PDF는 수천 개의 독립적인 문자 위치 지정 명령으로 테이블을 저장합니다. 변환 엔진은 해당 문자의 공간 배열을 분석하여 테이블 구조를 리버스 엔지니어링해야 합니다. 병합된 셀은 이 분석을 엄청나게 복잡하게 만듭니다. 인간 독자에게는 하나의 논리적 셀처럼 보이는 것이 변환 엔진에서는 하나의 넓은 셀 또는 여러 개의 좁은 셀이 될 수 있는 모호한 영역에 걸쳐 있는 텍스트처럼 보입니다. 엔진이 잘못 추측하면 데이터가 잘못된 열에 들어가거나, 셀 전체에 걸쳐 분할되거나, 엔진이 모호성을 해결할 수 없기 때문에 생략됩니다.

문서가 PDF로 변환될 때 원래 테이블 구조가 손실되었기 때문에 이에 대한 완벽한 보편적인 수정은 없습니다. 원본 파일에 액세스할 수 있는 경우 PDF에서 Excel로 변환하는 대신 Excel 또는 Google 스프레드시트에서 .xlsx 형식으로 직접 내보내면 테이블 구조가 완벽하게 유지됩니다. PDF가 유일한 복사본인 경우 열 경계를 수동으로 정의하거나 감지된 테이블 영역을 조정할 수 있는 고급 테이블 감지 기능이 있는 변환 도구를 사용하면 데이터를 깔끔하게 복구할 수 있는 최고의 기회를 얻을 수 있습니다.

구분자 정보가 일치하지 않거나 누락됨

변환 엔진은 문자 그룹 간의 수평 간격을 분석하여 열 경계를 감지합니다. 두 열이 서로 매우 가까운 경우 엔진은 두 열을 하나로 병합할 수 있습니다. 열에 텍스트 양이 매우 다양한 셀이 포함되어 있는 경우 엔진은 열을 좁은 지점에서 여러 열로 분할할 수 있습니다. 두 개의 개별 열을 채워야 하는 데이터가 하나로 채워져 다른 열이 비어 있거나 가상 열이 데이터가 없는 생성된 셀을 깨뜨리기 때문에 두 오류 모두 빈 셀을 생성합니다.

원본 문서에 빈 셀이 있는 표는 이 문제의 특히 까다로운 변형을 만듭니다. 원본 테이블에 의도적으로 빈 셀이 있는 경우 변환 엔진은 더 큰 간격을 확인하고 열 경계 감지를 이동하여 간격 아래의 모든 행을 잘못 정렬할 수 있습니다. 3행의 단일 빈 셀은 4~50행에 대한 전체 열 매핑을 삭제하여 변환 실패처럼 보이지만 실제로는 소스 문서에서 구조적 모호함을 나타내는 잘못 정렬된 데이터를 생성할 수 있습니다.

다음 변환 시 빈 셀을 최소화하는 방법

몇 가지 실질적인 조정을 통해 전환 성공률이 크게 향상됩니다. 첫째, 항상 일반적인 PDF-텍스트 변환기보다는 테이블 구조 감지를 지원하는 도구를 사용하십시오. PDF 데이터 추출용으로 특별히 설계된 도구는 테이블 레이아웃에 대해 훈련된 알고리즘을 사용하고 범용 텍스트 추출보다 훨씬 더 나은 결과를 생성합니다. WukongPDF의 PDF-Excel 변환에는 병합된 셀, 다중 레벨 헤더 및 혼합 데이터 유형이 있는 테이블을 포함한 일반적인 레이아웃을 처리하는 테이블 구조 감지가 포함됩니다.

둘째, 변환하기 전에 PDF를 확인하십시오. PDF 뷰어를 사용하여 표에서 개별 셀이나 텍스트 열을 선택하고 복사할 수 있는 경우 표는 실제 텍스트 데이터로 구성되어 있으므로 합리적으로 잘 변환됩니다. 표를 클릭했는데 전체가 단일 블록으로 강조 표시되거나 텍스트 선택이 전혀 작동하지 않는 경우 표는 이미지이므로 OCR 기반 변환이 필요합니다.

셋째, 출력물을 청소할 준비를 하십시오. 최고의 변환 도구라도 수동 조정이 필요한 스프레드시트를 생성합니다. 각 열의 처음 몇 행을 확인하여 올바른 열에 값이 입력되었는지 확인하세요. 해당 위치에서 원본 PDF의 데이터를 볼 수 있을 때 완전히 비어 있는 열을 찾으십시오. 이는 도구가 열 경계를 잘못 식별했다는 신호입니다. 처음 몇 행의 열 매핑을 수정하면 스프레드시트의 나머지 부분에 걸쳐 수정 사항이 계단식으로 적용되는 경우가 많습니다.

변환 시 빈 셀이 계속 생성되는 경우 대처 방법

여러 도구를 사용해 보았으나 변환 시 특정 위치에 빈 셀이 지속적으로 생성되는 경우 도구가 아닌 PDF 자체에 문제가 있을 가능성이 높습니다. 테이블 데이터는 벡터 그래픽으로 저장될 수 있으며, 여기서 숫자는 텍스트 문자로 인코딩되지 않고 모양으로 그려집니다. 이는 텍스트 배치가 아닌 그래픽 그리기 명령을 통해 출력을 PDF로 렌더링하는 이전 CAD 소프트웨어, 전문 보고 도구 또는 일부 전사적 자원 관리 시스템에서 생성된 PDF에서 가장 자주 발생합니다. 이러한 경우 OCR이 유일한 옵션이며, 벡터로 그린 표 형식 데이터의 OCR은 본질적으로 오류가 발생하기 쉬우므로 출력을 수동으로 검토하고 수정해야 합니다.

자동 변환이 반복적으로 실패할 때 가장 생산적인 대체 방법은 고해상도로 테이블의 스크린샷을 찍어 테이블 인식을 전문으로 하는 전용 OCR 도구를 통해 실행하고 Excel로 내보내는 것입니다. 스크린샷과 OCR로 구성된 이 2단계 프로세스는 PDF의 내부 데이터 표현을 완전히 우회하고 테이블을 순수한 이미지로 처리합니다. 이는 아이러니하게도 손상되었거나 비표준 텍스트 데이터를 구문 분석하는 것보다 특정 유형의 잘못된 PDF에 대해 더 신뢰할 수 있습니다.

WukongPDF

PDF를 Excel로 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →