Tips & Tricks

PDF를 Word로 변환하고 열 구조를 유지하는 방법

다중 열 PDF 레이아웃을 Word로 변환하면 여러 열의 텍스트가 단일 흐름에서 함께 혼합되는 문서가 생성되는 경우가 많습니다. 2열로 된 연구 논문은 길고 뒤죽박죽된 문단이 됩니다. 세 개의 열로 구성된 뉴스레터를 읽을 수 없게 됩니다. PDF를 Word로 변환하는 동안 열 구조를 유지하려면 원래 레이아웃 형상을 인식하고 유지하는 변환 설정이 필요하며, 각 열을 하나로 병합하는 대신 독립적인 텍스트 흐름으로 처리해야 합니다.

주요 내용

PDF-Word 변환 도구는 각 페이지의 텍스트 공간 배열을 분석하여 다중 열 레이아웃을 처리합니다. 열 감지를 지원하는 도구는 텍스트 블록 사이의 간격을 식별하고 열 읽기 순서를 재구성합니다. 컬럼 보존 품질은 변환 도구마다 크게 다릅니다. 간단한 2열 레이아웃의 문서는 대부분의 도구에서 잘 변환됩니다. 텍스트와 이미지가 겹치는 복잡한 잡지 스타일 레이아웃이 있는 문서는 변환 후 수동 정리가 필요할 수 있습니다.

How to Convert PDF to Word and Keep the Column Structure

PDF 변환 중 열 감지 작동 방식

원본 PDF의 글꼴 크기와 줄 간격은 열 감지 정확도에 영향을 미칩니다. 8포인트 재무 표와 같이 매우 작은 텍스트가 포함된 문서는 열 사이의 공백이 비례적으로 더 작기 때문에 감지 알고리즘에 문제가 됩니다. 원본 문서에서 허용하는 경우 PDF를 만들기 전에 글꼴 크기나 열 간격을 늘리면 변환 결과가 향상됩니다. 원본 문서를 사용할 수 없는 기존 PDF의 경우 작은 텍스트 여러 열 레이아웃에는 수동 정리가 더 많이 필요하다는 점을 인정하세요.

열 감지를 지원하는 PDF 변환기는 각 페이지에 있는 텍스트 블록의 가로 위치를 분석합니다. 동일한 왼쪽 가장자리를 공유하고 일관된 너비 내에 속하는 텍스트 블록은 열로 그룹화됩니다. 그런 다음 변환기는 다음 열로 이동하기 전에 위에서 아래로 각 열을 읽습니다. 이렇게 하면 각 열의 텍스트가 별도의 텍스트 흐름에 있는 Word 문서가 생성됩니다. Word는 연결된 텍스트 상자 또는 PDF 열당 하나의 열이 있는 테이블로 표시됩니다.

감지 알고리즘은 일관된 열 너비와 명확한 열 사이의 간격에 의존합니다. 열 사이에 2mm 간격이 있는 문서는 이러한 좁은 간격이 열 경계가 아닌 일반적인 단어 간격으로 해석될 수 있기 때문에 알고리즘에 문제가 됩니다. 넓은 기본 열과 좁은 사이드바와 같이 너비가 다른 열이 있는 문서도 열과 들여쓰기된 단락을 구별해야 하기 때문에 알고리즘에 문제가 됩니다. 열 감지는 표준 레이아웃(최소 5밀리미터의 공백으로 구분된 동일한 너비의 열)이 있는 문서에서 가장 잘 작동합니다.

WukongPDF

PDF를 Word로 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

열 보존을 위한 변환 설정

자동 설정으로 깔끔하게 변환되지 않는 복잡한 다중 열 레이아웃이 있는 문서의 경우 Word가 아닌 다른 형식으로 변환하는 것을 고려해 보십시오. PDF를 Adobe InDesign 또는 Affinity Publisher와 같은 데스크탑 출판 형식으로 변환하면 Word보다 열 구조가 더 충실하게 유지됩니다. 이러한 응용 프로그램은 처음부터 다중 열 레이아웃용으로 설계되었기 때문입니다. 최종 편집된 문서를 게시 응용 프로그램에서 다시 PDF로 내보냅니다.

초기 변환 후 Word 문서를 이전 DOC 형식이 아닌 DOCX 형식으로 저장하십시오. DOCX는 열 구조를 포함한 복잡한 레이아웃을 DOC보다 더 안정적으로 처리합니다. 변환 도구가 출력 형식을 선택할 수 있는 경우 열이 많은 문서에는 항상 DOCX를 선택하세요. PDF에서 DOC로 변환한 다음 DOCX로 저장하면 레이아웃 오류가 발생할 수 있는 불필요한 형식 변환이 추가됩니다.

변환된 Word 문서가 레이아웃 유지 변환의 기본 동작인 별도의 텍스트 상자에 각 열을 배치하는 경우 Word의 연결된 텍스트 상자 기능을 사용하여 각 텍스트 상자에서 텍스트를 추출하고 단일 열 기반 레이아웃으로 연결할 수 있습니다. 읽기 순서대로 텍스트 상자를 연결하면 텍스트가 계속해서 텍스트 상자를 통해 흐릅니다. 이 접근 방식은 열 레이아웃과 텍스트를 연속적인 흐름으로 편집하는 기능을 모두 유지합니다.

변환 설정에서 레이아웃 보존과 관련된 옵션을 찾으세요. "자동 스크롤 텍스트 유지" 추가 편집이 필요한 문서에 이상적인 편집 가능한 Word 단락으로 텍스트를 재구성하려고 시도합니다. "페이지 레이아웃 유지" 정확한 시각적 레이아웃을 유지하지만 편집하기 어려운 위치 지정된 텍스트 상자에 텍스트를 배치합니다. 열 보존을 위해 "자동 흐름 텍스트 유지" 열 감지를 활성화하면 일반적으로 편집 가능성과 구조의 균형이 가장 잘 맞습니다. WukongPDF의 PDF-Word 변환기에는 다중 열 레이아웃을 식별하고 올바른 읽기 순서를 재구성하여 각 열의 텍스트를 별도의 Word 섹션에 배치하는 열 감지 모드가 포함되어 있습니다.

변환기가 스캔한 문서에 대해 OCR 옵션을 제공하는 경우 디지털 PDF에 대해서도 활성화하십시오. OCR 엔진의 레이아웃 분석은 텍스트 추출 엔진의 공간 분석보다 열 검색에 더 나은 경우가 많습니다. OCR은 페이지를 이미지로 처리하고 텍스트 영역을 식별하므로 PDF 콘텐츠 스트림을 직접 구문 분석하는 것보다 열 감지가 더 효과적입니다. 단점은 OCR 기반 변환이 느리고 이미 디지털이었던 텍스트에 대한 인식 오류가 발생할 수 있다는 것입니다. 열 충실도가 가장 중요하고 문서 길이를 관리할 수 있는 문서에는 OCR 기반 변환을 사용하세요.

변환 후 수동 열 복원

자동 변환으로 인해 서로 다른 열의 텍스트가 잘못된 순서로 인터리브되는 문서가 생성되는 경우 Word의 와일드카드 찾기 및 바꾸기 기능을 사용하면 병합된 텍스트를 분리하는 데 도움이 될 수 있습니다. 일정한 수의 공백이나 한 열의 끝과 다음 열의 시작 부분에 나타나는 특정 구두점 패턴 등 원래 레이아웃의 열 나누기를 나타내는 패턴을 검색합니다. 와일드카드 검색 및 바꾸기는 각 단락을 수동으로 자르고 올바른 열 순서로 다시 붙여넣는 것보다 빠릅니다.

왼쪽 열에 원래 언어가 있고 오른쪽에 번역이 있는 이중 언어 문서와 같이 열 순서가 의미론적 의미를 전달하는 문서의 경우 열 쌍을 유지하는 것이 필수적입니다. 변환 후 왼쪽 열의 각 단락이 오른쪽 열의 올바른 단락과 일치하는지 확인하세요. 문서 초기에 하나의 잘못된 정렬이 모든 후속 단락에 걸쳐 이어집니다. 쌍으로 구성된 문서의 확인 단계는 표준 다중 열 레이아웃보다 시간이 더 많이 걸리지만 문서를 사용하려면 필요합니다.

자동 열 감지로 인해 뒤죽박죽된 결과가 생성되는 경우 대체 방법은 수동 복원입니다. Word에서는 레이아웃 탭 아래의 열 기능을 사용하여 문서의 각 섹션에 대해 올바른 열 수를 설정합니다. 그런 다음 뒤죽박죽된 변환의 텍스트를 잘라내어 올바른 열 순서에 붙여넣습니다. 이는 가장 시간이 많이 소요되는 접근 방식이지만 완벽하게 구조화된 문서를 생성합니다. 10페이지 분량의 2단 논문의 경우 레이아웃의 복잡성에 따라 수동 복원에 15~30분이 소요됩니다.

열을 수동으로 복원하는 동안 원본 PDF를 시각적 참조로 사용하세요. 화면 한쪽에서는 PDF를 열고 다른 쪽에서는 Word 문서를 엽니다. 문서를 페이지별로 진행하면서 Word 문서의 각 열에 있는 텍스트가 PDF의 해당 열에 있는 텍스트와 일치하는지 확인합니다. 이 나란히 비교하면 눈에 띄지 않을 수도 있는 잘못된 순서의 단락을 찾아냅니다. 왼쪽 열과 오른쪽 열이 대조되는 관점을 나타내는 비교 분석과 같이 열 구조가 의미를 전달하는 문서에는 추가 확인 시간이 가치가 있습니다.

자주 묻는 질문

열이 많은 문서의 경우 전체 PDF를 한 번에 변환하는 것이 더 낫습니까, 아니면 페이지별로 변환하는 것이 더 낫습니까? 전체 문서를 한 번에 변환하면 감지 알고리즘에 더 많은 데이터를 사용할 수 있습니다. 페이지 전체에서 일관된 열 패턴을 식별하고 이를 균일하게 적용할 수 있습니다. 페이지별로 변환하면 알고리즘이 각 페이지의 열 구조를 개별적으로 다시 검색하게 되므로 열 레이아웃이 모든 페이지에서 동일한 경우에도 일관되지 않은 결과가 발생할 수 있습니다.

일반적인 PDF 열 레이아웃과 일치하는 Word 템플릿을 설정하여 변환을 보다 쉽게 예측할 수 있습니까? 예. 올바른 열 수, 여백 및 글꼴 설정을 사용하여 Word 템플릿을 만듭니다. PDF를 Word로 변환한 후 변환된 텍스트를 템플릿으로 가져옵니다. 템플릿은 열 구조를 제공하고 가져온 텍스트가 이를 채웁니다. 이 접근 방식은 레이아웃 정의를 콘텐츠 추출에서 분리하고 유사한 구조의 PDF를 여러 번 변환할 때 보다 일관된 결과를 생성합니다.

열이 3개 이상인 PDF를 Word로 변환하고 모든 열을 그대로 유지할 수 있습니까?

예, 하지만 열 수가 증가하면 성공률이 감소합니다. 2열 레이아웃은 최신 도구를 사용하면 잘 변환됩니다. 3열 레이아웃은 최상의 도구를 사용하여 적절하게 변환되지만 약간의 정리가 필요할 수 있습니다. 조밀한 신문 페이지와 같이 4개 이상의 열이 있는 레이아웃에는 거의 항상 수동 변환 후 작업이 필요합니다. 열이 좁으면 감지 알고리즘이 공백 간격을 안정적으로 식별할 여지가 거의 없습니다.

열 기반 PDF를 Word로 변환하면 열 사이의 이미지와 그래픽에 영향이 있습니까?

여러 열에 걸쳐 있는 이미지는 텍스트와 별도의 개체로 감지되므로 일반적으로 올바르게 변환됩니다. 텍스트와 함께 인라인으로 배치된 작은 그림과 같이 열 내에 포함된 이미지는 알고리즘이 따르려는 텍스트 흐름을 깨뜨리기 때문에 열 감지를 방해할 수 있습니다. 변환 후 열 경계 근처의 이미지가 올바르게 배치되었는지, 텍스트가 예상대로 그 주위로 흐르는지 확인하세요.

스캔된 여러 열 문서를 디지털 문서와 다르게 변환해야 합니까?

스캔한 문서는 열 감지 전에 OCR을 거쳐야 합니다. 이는 단계를 추가하는 동시에 기회도 제공합니다. 문서 변환용으로 설계된 OCR 엔진은 원래 OCR이 정확히 이 사용 사례를 위해 개발되었기 때문에 텍스트 추출 엔진보다 더 정교한 레이아웃 분석을 수행하는 경우가 많습니다. 스캔한 다중 열 문서에 적용된 고품질 OCR 엔진은 동등한 디지털 PDF에 적용된 텍스트 추출 엔진보다 더 나은 열 보존을 생성할 수 있습니다.

WukongPDF

PDF를 Word로 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →