Others

Excel 변환 중에 PDF 테이블이 행과 열을 바꾸는 이유

PDF에서 Excel로 테이블 데이터를 추출하면 행과 열이 원본 테이블과 일치하는 스프레드시트가 생성됩니다. 그러나 때로는 출력이 바뀌는 경우도 있습니다. 행은 열이 되고, 열은 행이 되며, 데이터가 뒤섞여 있습니다. 이것은 무작위 오류가 아닙니다. 이는 PDF에서 Excel으로의 변환 엔진이 테이블의 시각적 레이아웃을 해석하는 방식과 관련된 구체적인 원인이 있습니다. 전위가 발생하는 이유를 이해하면 올바른 방향의 출력을 생성하는 변환 설정을 선택하는 데 도움이 됩니다.

주요 내용

PDF에서 Excel로의 전치는 일반적으로 병합된 셀, 일관되지 않은 열 너비 또는 시각적으로 행에 정렬되어 있지만 PDF에 열 순서로 저장되는 텍스트로 인해 변환 엔진이 테이블의 읽기 방향을 잘못 식별할 때 발생합니다. 해결 방법은 원인에 따라 다릅니다. 변환 설정 조정, 테이블 구조를 명확하게 하기 위한 PDF 전처리, 데이터를 올바른 방향으로 다시 바꾸기 위한 Excel 출력 후처리 등은 모두 서로 다른 근본 원인을 해결합니다.

Why Do PDF Tables Swap Rows and Columns During Excel Conversion

추출 중에 PDF 테이블 데이터가 전치되는 이유

장 제목을 페이지 번호에 연결하는 점이 있는 목차와 같이 열 사이에 리더 점이나 기타 시각적 연결자를 사용하는 테이블은 리더 점이 감지 알고리즘이 행 구분 기호로 해석하는 연속적인 시각적 선을 생성하기 때문에 거의 전치가 보장됩니다. 테이블이 나중에 Excel로 다시 변환되는 경우 PDF를 만들기 전에 원본 문서에서 지시선 점을 제거하십시오.

PDF의 내부 구조는 시각적 레이아웃만큼 중요합니다. 화면에서 완벽하게 정렬되어 보이는 표는 시각적으로 읽는 순서와 일치하지 않는 순서로 텍스트 개체로 저장될 수 있습니다. PDF 작성자 소프트웨어는 텍스트 개체 순서를 결정합니다. 일부 응용 프로그램은 문서에 추가된 순서대로 텍스트 개체를 작성합니다. 이는 행 단위가 아닌 열 단위일 수 있습니다. 이것이 동일해 보이는 두 PDF가 서로 다른 변환 결과를 생성할 수 있는 이유입니다. 즉, 내부 텍스트 개체 순서가 다릅니다.

PDF 테이블은 파일에 테이블로 저장되지 않습니다. 페이지의 특정 좌표에 위치한 개별 텍스트 개체로 저장됩니다. 변환 엔진은 이러한 좌표를 확인하고 어떤 텍스트 개체가 어떤 행과 열에 속하는지 추론해야 합니다. 추론 알고리즘은 텍스트의 가로 및 세로 정렬을 사용하여 텍스트를 행과 열로 그룹화합니다. 정렬이 모호한 경우 알고리즘은 먼저 수직 정렬을 기준으로 텍스트를 그룹화하여 행이어야 하는 열을 생성할 수 있습니다.

병합된 셀은 전치의 가장 일반적인 트리거입니다. 여러 열에 걸쳐 있는 머리글 행이 있는 테이블은 맨 위 행이 아래 열 경계와 정렬되지 않는 시각적 구조를 만듭니다. 변환 엔진은 병합된 헤더와 그 아래의 개별 열을 두 가지 다른 정렬 패턴으로 간주합니다. 병합된 헤더를 다중 열 행으로 해석하거나 아래 열을 다중 행 데이터로 해석할 수 있으며 모호함으로 인해 전치가 발생합니다. 첫 번째 열에 여러 행에 걸쳐 병합된 셀이 포함된 테이블도 마찬가지로 문제가 있습니다. 수직 병합은 엔진이 데이터를 수평으로 그룹화하는 데 사용하는 행 정렬을 방해하기 때문입니다.

WukongPDF

PDF를 Excel로 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

변환을 방지하기 위해 변환 설정 조정

PDF 테이블이 브라우저 인쇄 기능을 사용하여 웹 페이지에서 생성된 경우 PDF의 테이블 구조는 전용 보고 응용 프로그램의 테이블보다 덜 구조적일 수 있습니다. 브라우저에서 생성된 PDF는 종종 텍스트 요소 간의 정렬이 느슨해 테이블 감지가 훨씬 더 어려워집니다. 가능한 경우 가장 안정적인 변환 결과를 얻으려면 브라우저에서 인쇄하는 대신 원래 응용 프로그램에서 테이블을 PDF로 내보내십시오.

일부 PDF 테이블은 독자를 위한 시각적 보조 수단으로 교대로 행 색상을 사용합니다. 이러한 교대 색상은 서로 다른 색상의 행을 서로 다른 테이블 섹션에 속하는 것으로 보기 때문에 테이블 감지 알고리즘을 혼란스럽게 할 수 있습니다. 변환하기 전에 PDF에서 배경색을 제거하거나 먼저 회색조로 변환하면 이러한 혼란의 원인이 제거되고 테이블 구조 감지의 일관성이 향상됩니다.

변환 도구에 테이블 검색 모드가 포함되어 있으면 이를 활성화하세요. 테이블 감지는 엔진에 테이블 구조를 나타내는 눈금선, 배경 음영 및 일관된 텍스트 정렬 패턴을 찾도록 지시합니다. 이 모드는 기본 텍스트 추출 이상의 추가 분석을 적용하며 행 및 열 방향을 정확하게 식별할 가능성이 더 높습니다. 일부 도구는 "전치 출력"도 제공합니다. 기본 추출이 전치된 데이터를 생성하는 경우를 처리하기 위한 확인란입니다. 출력이 전치되고 도구에 이 옵션이 있는 경우 두 번째 변환 시도에서 이를 확인하면 올바른 방향이 생성됩니다.

스캔한 테이블에서 PDF 데이터 추출의 경우 특별히 테이블 모드에서 OCR을 실행하세요. 일반 텍스트 인식을 위해 설계된 OCR 엔진은 텍스트 블록 간의 공간 관계를 유지하지 못할 수 있습니다. 테이블 모드의 OCR 엔진은 인식된 출력에서 행 및 열 구조를 유지합니다. WukongPDF의 PDF-Excel 변환기에는 시각적 정렬과 콘텐츠 패턴을 기반으로 행과 열 관계를 식별하는 자동 테이블 구조 감지 기능이 포함되어 있어 일반 텍스트 추출에 비해 전위 가능성이 줄어듭니다.

변환 후 수정: Excel 데이터를 다시 전치

전치 후 각 열의 데이터 유형을 확인하십시오. 전치된 데이터에 동일한 열의 머리글 레이블이 포함되어 있으므로 Excel에서 전치 후 숫자 열을 텍스트로 해석했을 수 있습니다. 각 열을 선택하고 데이터 유형이 내용과 일치하는지 확인합니다. 텍스트 형식의 숫자는 올바르게 계산되지 않으며, 텍스트 형식의 날짜는 시간순으로 정렬되지 않습니다. 스프레드시트가 완벽하게 작동하도록 전치 후 데이터 유형을 수정하세요.

출력이 바뀌었고 다시 변환하는 것이 실용적이지 않은 경우 Excel에서는 몇 번의 클릭만으로 데이터를 바꿀 수 있습니다. 전치된 데이터 범위를 선택하고 복사한 후 새 위치를 마우스 오른쪽 버튼으로 클릭하고 붙여넣기 옵션에서 "전치"를 선택하세요. 행과 열이 바뀌어 원래 방향으로 복원됩니다. 이는 유일한 문제가 행/열 반전인 간단한 테이블에 완벽하게 작동합니다. 병합된 셀이 있는 복잡한 표의 경우 Excel의 전위는 병합된 셀을 올바르게 처리하지 못하며 더 나쁜 방식으로 원본과 다른 레이아웃을 생성할 수 있습니다.

전치하기 전에 원본 PDF 테이블을 Excel 출력과 비교하여 전치에만 문제가 있는지 확인하십시오. 출력에 잘못 정렬된 셀, 누락된 데이터 또는 잘못 병합된 셀도 있는 경우 전치로는 해당 문제가 해결되지 않습니다. 이러한 경우에는 수동으로 데이터를 재구성하거나 다른 설정으로 다시 변환해야 합니다. 전치 수정은 데이터가 완전하고 올바르게 정렬되었지만 방향이 잘못된 특정 사례에 대한 원클릭 솔루션입니다.

클리어 테이블 추출을 위해 PDF 전처리

PDF 테이블이 SAP, Oracle Reports 또는 레거시 메인프레임 시스템과 같은 특정 응용 프로그램에서 생성된 경우 해당 특정 응용 프로그램의 PDF 출력과 관련된 알려진 변환 문제를 온라인으로 검색하십시오. 기업 보고 시스템은 예측 가능한 테이블 구조의 특이성을 지닌 PDF를 생성하는 경우가 많으며, 다른 사용자는 해당 특정 소스에 대한 최적의 변환 설정을 문서화했을 수도 있습니다. 타겟 검색은 여러 전환 접근 방식을 테스트하는 시행착오를 줄여줍니다.

특정 PDF가 여러 번의 변환 시도에 걸쳐 일관되게 전치된 출력을 생성하는 경우 변환하기 전에 PDF를 사전 처리하십시오. PDF 편집기를 사용하여 테이블 감지 알고리즘을 혼란스럽게 할 수 있는 배경 음영, 격자선 또는 장식 요소를 제거하십시오. 흰색 배경에 검은색 텍스트가 있고 얇고 일관된 눈금선이 있는 깔끔한 표는 행 색상이 번갈아 표시되고 테두리가 두껍고 아이콘이 포함된 표보다 더 안정적으로 변환됩니다. 변환 전에 시각적 노이즈를 제거하면 테이블 구조를 올바르게 식별하는 변환 엔진의 기능이 향상됩니다.

스캔한 테이블의 경우 스캔을 완벽하게 직선으로 조정합니다. 1도 각도로 스캔된 테이블에서는 모든 행이 약간 기울어지며 변환 엔진은 기울기를 열 정렬로 해석할 수 있습니다. 대부분의 스캐닝 소프트웨어에는 페이지를 자동으로 똑바르게 하는 기울기 보정 옵션이 포함되어 있습니다. 스캔하기 전에 이 옵션을 활성화하거나 변환하기 전에 스캔한 PDF에서 기울기 조정 도구를 사용하십시오. 올바른 행 및 열 감지를 위해서는 직선 행이 필수적입니다.

자주 묻는 질문

PDF 테이블을 Excel 대신 CSV로 변환하면 전치 문제가 방지됩니까? CSV 변환은 Excel 변환과 동일한 테이블 감지 알고리즘을 사용합니다. 알고리즘이 데이터를 바꾸면 CSV 출력도 바뀌게 됩니다. 출력 형식은 감지 논리에 영향을 주지 않습니다. CSV에는 텍스트 편집기에서 검사하기가 더 쉽다는 장점이 있습니다. 이를 통해 파일을 열 때 전치가 즉시 표시되고 예상되는 5개 열이 20개가 된 것을 확인할 수 있습니다.

특정 유형의 PDF 테이블에서 전치가 더 많이 발생합니까?

예. 병합된 머리글 셀이 있는 테이블, 행당 열 수가 일관되지 않은 테이블, 첫 번째 열이 세로 텍스트 방향을 사용하는 테이블은 바뀔 가능성이 가장 높습니다. 단순하고 균일한 그리드 구조를 가진 테이블은 전치되는 경우가 거의 없습니다. 테이블이 규칙적일수록 변환의 신뢰성이 높아집니다.

전치된 Excel 출력의 감지 및 수정을 자동화할 수 있습니까?

원래 테이블의 예상 수와 비교하여 Excel 출력의 열 수를 확인하는 것은 간단한 자동 확인입니다. PDF 테이블에는 5개의 열과 20개의 행이 있지만 Excel 출력에는 20개의 열과 5개의 행이 있는 경우 데이터가 바뀐다. 스크립트는 이러한 불일치를 감지하고 데이터를 바꾸거나 수동 검토를 위해 파일에 플래그를 지정할 수 있습니다. 이 자동화된 품질 검사는 데이터가 다운스트림 워크플로우에 들어가기 전에 전치를 포착합니다.

동일한 PDF 테이블이 한 번 시도에서는 올바르게 변환되고 다른 시도에서는 왜 바뀌나요?

이는 일반적으로 두 번의 시도에서 약간 다른 변환 설정이 사용되거나 파일 크기 또는 복잡성 임계값을 기반으로 다른 내부 처리 경로를 사용하는 변환 도구로 인해 발생합니다. 일관되지 않은 결과가 발생하는 경우 올바른 출력을 생성하는 정확한 설정을 문서화하고 향후 유사한 테이블의 모든 변환에 해당 설정을 사용하십시오.

WukongPDF

PDF를 Excel로 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →