깔끔하게 포맷된 PDF 표를 Excel로 변환하고 출력을 열면 PDF에서 두 개의 개별 숫자 열이 "1,2503,780"과 같은 값을 포함하는 단일 열이 된 것을 발견합니다. 각 셀에. 인접한 열의 두 숫자 값이 하나의 텍스트 문자열로 연결되었으며 이제 해당 데이터는 계산에 쓸모가 없습니다. 이는 PDF에서 Excel으로의 변환에 대한 가장 일반적인 불만 사항이며 변환기가 한 열이 끝나고 다음 열이 시작되는 위치를 잘못 판단했기 때문에 발생합니다.
PDF 테이블의 열 경계 감지는 PDF에 테이블 구조가 포함되어 있지 않기 때문에 근본적으로 어려운 문제입니다. PDF 표는 특정 좌표에 위치한 텍스트이며, 텍스트 근처에 가로선과 세로선이 그려져 있습니다. 변환기는 텍스트 블록 사이의 간격, 행 전체의 텍스트 정렬 또는 그려진 선의 위치에서 열 경계를 유추해야 합니다. 숫자 열이 좁고 인접한 열의 숫자가 서로 가까운 경우 변환기는 두 숫자를 하나의 텍스트 문자열로 읽어서 더 넓은 단일 열로 병합할 수 있습니다. 변환기는 숫자의 연속적인 수평 실행을 보고 원래 레이아웃에서 열 나누기가 어디에 있었는지 알 수 없습니다.

인접 숫자 열이 병합에 특히 취약한 이유
PDF 테이블의 숫자 열은 숫자가 짧기 때문에 좁은 경향이 있습니다. 통화 값 열에는 "1,250.00" 또는 "42시 50분", 12자를 초과하는 경우는 거의 없습니다. "단가"와 같이 두 개의 좁은 숫자 열이 나란히 표시됩니다. 및 "추가 가격", 종종 그들 사이에 몇 개의 공백이 있습니다. 변환기의 열 분할 알고리즘이 열 사이의 실제 간격보다 큰 최소 간격 임계값을 사용하는 경우 두 열을 하나로 보고 해당 값을 연결합니다.
문제는 오른쪽 정렬된 숫자로 인해 더욱 복잡해집니다. 형식이 올바른 PDF 표에서는 숫자 열이 오른쪽 정렬되므로 각 행의 숫자는 동일한 가로 위치에서 끝납니다. A열의 오른쪽 정렬 숫자 끝과 B열의 왼쪽 정렬 숫자 시작 사이의 간격은 몇 포인트 정도일 수 있습니다. PDF를 육안으로 검사하면 명확한 간격이 표시되지만 변환기의 알고리즘은 열 경계를 확실히 식별하기 위해 더 큰 간격이 필요할 수 있으며, 좁은 공간을 열 구분 기호가 아닌 일반 단어 간격으로 처리합니다.
음수 및 괄호 표기와 관련된 문제가 발생합니다. "(1,250.00)"으로 표시되는 값은 다음과 같습니다. 괄호와 쉼표가 모두 포함되어 있으며 변환기는 이를 여러 개의 개별 토큰으로 해석할 수 있습니다. 여는 괄호는 이전 열과 연결되고, 숫자 부분은 현재 열에 배치되며, 닫는 괄호는 삭제되거나 다음 열에 연결됩니다. 결과적으로 광범위한 수동 정리가 필요한 부분 데이터가 포함된 셀이 생성됩니다. 쉼표가 소수 구분 기호이고 마침표가 천 단위 구분 기호인 유럽 숫자 형식을 사용하는 테이블은 미국 숫자 형식을 가정하는 변환기를 더욱 혼란스럽게 합니다.
PDF를 Excel로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
변환 전 문제 테이블을 식별하는 방법
변환하기 전에 PDF를 열고 표 영역을 확대하세요. 한 열의 가장 오른쪽 문자와 다음 열의 가장 왼쪽 문자 사이의 공간이 시각적으로 작아서 문자 너비가 약 1자 미만인 열을 찾습니다. 변환 중에 병합될 가능성이 가장 높은 열입니다. 열 간격이 이렇게 좁은 테이블이 있으면 변환 후 수동 수정을 계획하거나 대체 추출 방법을 고려하세요.
또한 왼쪽 정렬된 항목 이름을 오른쪽 정렬된 가격에 연결하는 마침표 행인 리더 점을 사용하는 테이블을 확인하세요. 지시선 점은 열 사이의 공간에 위치하며 시각적 서식이 아닌 데이터로 잘못 판독되는 경우가 많습니다. 리더 점을 콘텐츠로 처리하는 변환기는 마침표만 포함하는 열을 생성하거나 데이터와 리더 점을 구별할 수 없기 때문에 테이블을 잘못 분할합니다. 여러 열에 걸쳐 병합된 머리글 셀이 있는 테이블은 또 다른 문제 지점입니다. 변환기는 머리글 행에서 넓은 텍스트 블록을 확인하고 이를 아래의 더 좁은 데이터 열에 올바르게 매핑하지 못할 수 있습니다.
정확성이 중요한 중요한 데이터의 경우 특수 테이블 인식 소프트웨어를 사용한 PDF 데이터 추출 추출이 범용 PDF-Excel 변환보다 더 안정적입니다. 테이블용으로 특별히 설계된 데이터 추출 소프트웨어는 여러 신호, 텍스트 위치, 글꼴 메트릭, 줄 위치 및 행 전체의 정렬 일관성을 사용하여 보다 정확한 열 모델을 구축합니다. 변환된 각 테이블에 대해 수동으로 Excel을 정리하는 데 몇 시간이 소요되는 경우 전문 추출 소프트웨어의 추가 비용이 정당화됩니다.
병합된 열의 수동 수정 전략
열 병합이 불가피한 경우 Excel의 텍스트를 열로 변환 기능이 가장 빠른 수정 도구입니다. 병합된 열을 선택하고 데이터, 텍스트를 열로 열고 구분을 선택합니다. 병합된 값이 공백으로 일관되게 구분되는 경우 공백을 구분 기호로 선택합니다. 가변 개수의 공백으로 구분된 경우 고정 너비를 선택하고 두 값 사이에 열 구분선을 수동으로 배치합니다. Excel에서는 분할을 적용하기 전에 미리 볼 수 있으므로 모든 행에 대해 분할이 정확해질 때까지 나누기 위치를 조정할 수 있습니다.
"12503780"과 같이 구분 기호 없이 병합된 값의 경우 여기서 분할은 "1250"과 "1250" 사이여야 합니다. 및 "3780" 분할할 구분 기호가 없기 때문에 텍스트를 열로 변환하는 것은 도움이 될 수 없습니다. 각 열의 예상 너비를 알아야 합니다. 첫 번째 열에 항상 4자리 숫자가 포함되고 두 번째 열에 항상 4자리 숫자가 포함된 경우 알려진 문자 수와 함께 Excel의 LEFT 및 RIGHT 함수를 사용하여 값을 별도의 열로 추출합니다. 이 접근 방식은 열 너비가 고정되고 일관된 경우에만 작동합니다. 이는 고정 필드 너비가 있는 데이터베이스 시스템에서 내보낸 테이블에서 일반적입니다.
WukongPDF는 텍스트 정렬, 간격 및 줄 위치를 분석하여 간격이 좁은 숫자 테이블에서도 열 경계를 식별하는 열 감지 기능을 통해 PDF 테이블을 Excel로 변환합니다. 변환에서는 추출된 값을 수동 정리 없이 계산에 즉시 사용할 수 있도록 숫자 형식이 유지됩니다. 자동화된 열 감지가 어려운 복잡한 테이블의 경우 OCR 기반 접근 방식을 대체 경로로 사용하는 것이 좋습니다. PDF 테이블의 스크린샷을 캡처하고, 테이블 인식 기능이 있는 OCR 도구를 통해 실행하고, 인식된 테이블을 Excel로 내보냅니다. 테이블 구조 감지 기능을 포함하는 최신 OCR 엔진은 시각적 레이아웃을 직접 분석하기 때문에 기존 PDF-Excel 변환기보다 열 분리 시 더 안정적인 경우가 많습니다.
PDF를 Excel로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
