Tips & Tricks

분할 경계에서 내용이 연속 페이지에 걸쳐 있는 PDF를 분할하는 방법

PDF를 페이지 수로 분할하는 것은 쉽습니다. 10페이지마다 또는 50페이지마다 분할하도록 도구에 지시하면 정확히 그렇게 됩니다. 문제는 분리해야 하는 콘텐츠가 페이지 경계와 일치하지 않을 때 시작됩니다. 7페이지에서 시작해서 9페이지로 끝나는 세 페이지짜리 테이블은 8페이지 이후 분할로는 깔끔하게 분리할 수 없습니다. 한 페이지의 마지막 세 줄과 다음 페이지의 처음 20줄에 걸쳐 있는 계약서는 페이지 나누기에서 파일을 나누면 두 개의 조각으로 찢어집니다. 이러한 상황에서는 PDF 내부 콘텐츠 스트림을 읽고 페이지 나누기 위치에 관계없이 논리적 섹션이 실제로 시작하고 끝나는 위치를 식별하는 다른 분할 전략이 필요합니다.

내용 인식 분할은 대부분의 기본 PDF 도구의 표준 기능은 아니지만 텍스트 추출, 패턴 일치, 페이지 수 기준이 아닌 내용 표시자별 분할을 지원하는 도구의 조합을 통해 달성할 수 있습니다. WukongPDF는 페이지 번호에만 의존하지 않고 텍스트 패턴, 책갈피 또는 섹션 제목을 기반으로 분할 지점을 정의할 수 있는 내용 인식 분할을 제공합니다. 이것이 어떻게 작동하는지 이해하면 페이지 수 분할로 인해 사용할 수 없는 출력이 생성되고 수동 개입이 신뢰할 수 있는 유일한 솔루션인 시나리오를 제어할 수 있습니다.

How to Split a PDF Where Content Spans Across Consecutive Pages at the Split Boundary

구조화된 문서에서 페이지 수 분할이 실패하는 이유

문서 관리 전문가를 대상으로 한 2025년 설문 조사에 따르면 응답자의 34%가 테이블, 차트, 계약 조항과 같은 핵심 콘텐츠 요소가 소스 PDF의 페이지 경계에 걸쳐 분할되어 있는 문서를 접한 것으로 나타났습니다(AIIM, "State of the Document Industry", 2025). 콘텐츠가 여러 페이지에 걸쳐 있는 경우 페이지 수 분할로 인해 콘텐츠가 분리되어 주변 컨텍스트 없이는 의미 없는 조각만 남게 됩니다. 재무 테이블의 절반이 포함된 분할 파일의 수신자는 누락된 열을 재구성할 수 없으며, 다음 페이지의 서명 블록이 누락된 분할 계약의 수신자는 계약을 실행할 수 없습니다.

근본적인 문제는 PDF 페이지 모델이 콘텐츠 모델이 아니라는 것입니다. PDF 페이지는 텍스트, 이미지, 벡터 그래픽이 임의의 위치에 그려지는 캔버스입니다. 콘텐츠의 논리적 구조와 물리적 페이지 경계 사이에는 필수 관계가 없습니다. 단락은 12페이지 하단 근처에서 시작하여 13페이지 상단에서 계속될 수 있으며, PDF 형식은 이를 두 페이지 사이에 명시적인 연결이 없는 별도의 두 페이지에 있는 두 개의 별도 텍스트 개체로 표시합니다. 이들이 함께 속해 있는지 알 수 있는 유일한 방법은 텍스트를 읽고 의미 흐름을 이해하는 것입니다. 자동화 도구는 내용 분석을 통해서만 대략적으로 접근할 수 있습니다.

WukongPDF

PDF 분할을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

내용 인식 PDF 분할에 대한 세 가지 접근 방식

첫 번째 접근 방식이자 구현하기 가장 간단한 방법은 북마크별로 분할하는 것입니다. PDF에 적절하게 구성된 책갈피 트리가 있는 경우 각 책갈피는 논리적 섹션 경계를 표시합니다. 책갈피 계층 구조를 분할 지점으로 사용하여 PDF 분할을 수행하여 장당 또는 섹션당 하나의 출력 파일을 생성할 수 있습니다. 이 방법은 책갈피가 있는 경우 빠르고 안정적이지만 많은 PDF에는 책갈피가 완전히 없거나 논리적인 내용 경계가 아닌 페이지 레이블에서 자동 생성된 책갈피가 있습니다. 북마크 기반 분할은 텍스트 분석이 필요하지 않고 잘 구성된 문서에서 즉시 작동하기 때문에 시도하는 첫 번째 접근 방식입니다.

두 번째 접근 방식은 텍스트 패턴으로 분할하는 것입니다. PDF의 전체 텍스트를 추출하고 장 제목, 법적 조항 번호, 송장 번호 등 섹션 경계를 표시하는 반복 패턴을 검색합니다. 어떤 페이지에 어떤 섹션이 포함되어 있는지 알고 나면 분할 도구에 해당 페이지 번호를 자르도록 지시할 수 있습니다. 제한 사항은 섹션 제목이 섹션의 첫 번째 페이지에 없을 수 있고 실제 섹션 콘텐츠가 이전 페이지에서 시작될 수 있지만 대부분의 비즈니스 문서의 경우 제목과 콘텐츠가 충분히 유사하다는 것입니다.

가장 정확한 접근 방식인 구조별 분할에는 PDF 태그가 지정된 콘텐츠 구조를 읽거나 각 페이지의 텍스트 위치 데이터에서 읽기 순서를 재구성할 수 있는 도구가 필요합니다. 도구에서 7페이지의 텍스트 블록 A가 논리적으로 8페이지의 텍스트 블록보다 앞에 있고 8페이지의 해당 텍스트 블록 C가 새 섹션을 시작한다고 판단할 수 있는 경우 페이지 7과 8 사이가 아닌 블록 B와 C 사이에 분할 지점을 배치할 수 있습니다. 이 접근 방식은 확장 콘텐츠를 올바르게 처리하지만 이를 지원하는 소비자급 도구는 거의 없습니다. 엔터프라이즈 문서 처리 플랫폼과 전문 PDF SDK가 이 기능을 제공할 가능성이 더 높습니다.

스패닝 콘텐츠 분할을 위한 실용적인 작업 흐름

페이지별 텍스트 출력을 생성하는 도구를 사용하여 전체 PDF의 텍스트를 추출하는 것부터 시작하십시오. 추출된 텍스트에서 논리적 섹션이 변경되는 지점을 검색합니다. 보고서의 경우 최상위 제목을 찾으세요. 계약서의 경우 기사 또는 섹션 번호를 찾으십시오. 일괄 청구서의 경우 청구서 번호 또는 고객 이름을 찾으십시오. 각 섹션이 시작되는 페이지 번호를 표시하세요. 스프레드시트를 사용하여 각 섹션 제목, 시작 페이지, 이전 페이지 경계에 걸쳐 있는 콘텐츠에 대한 메모를 추적하세요.

콘텐츠가 페이지 나누기에 걸쳐 있는 것처럼 보이는 각 경계에 대해 N 페이지의 최종 텍스트가 완전한 문장인지 아니면 명백한 연속인지 확인하세요. 페이지가 구두점 없이 단어 중간 또는 문장 중간에서 끝나면 다음 페이지에서 식별한 섹션 경계가 정확할 가능성이 높으며 텍스트가 페이지를 가로질러 흐르더라도 페이지 나누기에서 분할이 발생해야 합니다. 확장 텍스트는 이전 섹션의 일부이며 동일한 출력 파일에 속합니다. 이러한 판단은 자동화된 도구가 실수를 저지르는 경우가 많기 때문에 경계 페이지를 수동으로 검토하는 것이 가치 있는 이유입니다.

페이지가 완전한 단락으로 끝나고 새 섹션이 다음 페이지 중간에 시작되는 경우 페이지 내에서 분할할 수 있는 도구가 필요합니다. 일부 전문적인 PDF 페이지 추출 도구를 사용하면 "1-7페이지와 8페이지 상단 절반부터 부록 A 제목까지"와 같이 페이지 범위와 콘텐츠 표시자를 지정하여 분할할 수 있습니다. 이는 가장 정확한 접근 방식이지만 페이지별 콘텐츠 영역 선택 도구가 필요합니다. 페이지 내 분할을 사용할 수 없는 경우 페이지 경계에서 분할하고 새 섹션의 첫 번째 부분이 이전 파일과 함께 유지되도록 허용하는 것이 일반적으로 가장 덜 나쁜 옵션입니다.

특이한 사례 처리: 테이블, 이미지 및 다중 열 레이아웃

페이지에 걸쳐 있는 테이블은 분할하기 가장 어려운 문제입니다. 한 페이지의 하단 근처에서 시작하여 다음 페이지의 상단까지 계속되는 테이블 행은 깔끔하게 나눌 수 없습니다. 최선의 전략은 분할 출력의 용도에 따라 달라집니다. 분할 PDF의 각 섹션을 독립적으로 읽는 경우 각 파일이 완전하고 읽을 수 있는 테이블을 갖도록 이전 및 다음 출력 파일 모두에 확장 테이블 헤더 행을 복제합니다. 분할 후 수동 편집이 필요하지만 사용 가능한 출력이 생성됩니다.

스캔한 문서에서 두 페이지 사이의 여백에 걸쳐 있는 이미지는 또 다른 극단적인 경우입니다. 책이나 잡지에서 두 페이지에 걸쳐 인쇄된 지도, 다이어그램 또는 사진은 페이지 수준 분할에 의해 가운데로 분할됩니다. 이 문제를 해결하려면 두 부분을 자르고 단일 이미지로 재조립한 다음 재조립된 이미지를 출력 파일의 새 페이지에 배치해야 합니다. 이는 PDF 작업이 아닌 이미지 편집 작업이며 일반적으로 별도의 그래픽 응용 프로그램에서 수행됩니다.

다중 열 레이아웃에는 다른 문제가 발생합니다. 열 전체의 텍스트 읽기 순서가 추출 순서와 일치하지 않을 수 있습니다. 위에서 아래로 한 줄씩 텍스트를 추출하는 도구는 왼쪽과 오른쪽 열의 텍스트를 인터리브하므로 텍스트 패턴 분석만으로는 섹션이 시작하고 끝나는 위치를 결정할 수 없습니다. 여러 열로 구성된 PDF의 경우 각 열을 별도의 텍스트 스트림으로 읽고 의도한 읽기 순서를 유지하는 열 인식 텍스트 추출을 지원하는 도구가 필요합니다. 이 기능은 일부 OCR 엔진 및 고급 텍스트 추출 라이브러리에서 사용할 수 있지만 기본 설정 이상의 구성이 필요합니다.

분할 출력 확인: 전송 전 확인 사항

분할 후 각 출력 파일을 열고 세 가지를 확인합니다. 먼저 첫 번째 페이지와 마지막 페이지에 완전하고 읽을 수 있는 콘텐츠가 포함되어 있는지 확인하세요. 파일 끝 부분의 중간 단어에서 벗어나는 문장이나 파일 시작 부분에 본문 없이 나타나는 제목은 내용을 나누는 분할 지점을 나타냅니다. 둘째, 섹션 내의 내부 상호 참조가 여전히 작동하는지 확인하십시오. "15페이지의 그림 3 참조"에 대한 참조 그림 3이 다른 출력 파일로 분할된 경우에는 의미가 없습니다.

셋째, 파일 관리자에서 올바르게 정렬되는 번호 매기기 체계를 사용하여 원래 순서를 유지하는 방식으로 출력 파일의 이름이 지정되었는지 확인하십시오. "Report_Section_01_Introduction.pdf"와 같은 명명 규칙은 다음과 같습니다. "Introduction.pdf", "Methods.pdf", "Results.pdf"는 정렬 가능한 목록을 생성하는 반면, "Introduction.pdf", "Methods.pdf", "Results.pdf"는 정렬 가능한 목록을 생성합니다. 의도한 읽기 순서를 유지하지 않습니다. 중요한 비즈니스 문서의 경우 분할된 출력물을 배포하기 전에 두 번째 사람이 즉석 점검을 하도록 하십시오. 새로운 시각은 분할을 수행한 사람이 문서를 오랫동안 본 후에 간과할 수 있는 콘텐츠 연속성 문제를 포착합니다.

WukongPDF

PDF 분할을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →