각 파일이 빈 페이지나 번호가 매겨진 장 제목으로 시작되면 큰 PDF를 개별 문서로 분할하는 것이 간단합니다. PDF 내의 문서가 회사 로고가 있는 표지, 더 큰 글꼴의 제목 시트 또는 사람은 즉시 찾을 수 있지만 자동화된 도구는 감지하기 어려운 고유한 헤더 블록 등 시각적 단서로만 분리되면 문제가 완전히 달라집니다. 이 기사에서는 소수의 문서에 적합한 수동 접근 방식부터 수백 페이지로 확장되는 반자동 기술에 이르기까지 표지와 제목 시트를 인식하여 PDF를 분할하는 실용적인 방법을 다룹니다.

문서 배치에서 표준 페이지 수 분할이 실패하는 이유
대답은 문서가 어떻게 달라지는지에 있습니다.
대부분의 PDF 분할 도구는 간단한 원칙에 따라 작동합니다. 즉, N 페이지마다 또는 입력한 특정 페이지 번호에서 파일을 분할합니다. 이는 일괄 처리의 모든 문서에 동일한 페이지 수가 있을 때 작동합니다. 단일 페이지 송장 더미가 모든 페이지 경계에서 깔끔하게 분할됩니다. 3페이지로 구성된 계약서 모음은 세 번째 페이지마다 균등하게 나뉩니다. 그러나 거의 모든 실제 보고서, 응용 프로그램 또는 서신 배치의 경우와 같이 문서의 길이가 다를 경우 페이지 수 분할은 문서를 절반으로 자르거나 한 문서의 끝 부분을 다음 문서의 머리 부분과 병합합니다.
표지와 제목 시트는 병합된 PDF 문서 간의 자연스러운 경계이지만 구조적 경계가 아닌 시각적 경계입니다. PDF는 다른 페이지와 동일한 종류의 페이지 개체로 저장합니다. 이 페이지가 표지이거나 이 단락이 제목임을 나타내는 메타데이터 플래그가 없습니다. 분할 소프트웨어는 무엇을 찾아야 하는지 알려주어야 하며, 지침은 소프트웨어가 큰 제목이나 로고가 포함된 일반 콘텐츠 페이지와 표지를 구별할 수 있을 만큼 충분히 구체적이어야 합니다.
잘못된 분할로 인한 결과는 불편한 것 이상입니다. 여러 페이지로 구성된 문서를 반으로 자르면 두 개의 불완전한 파일이 생성되며 둘 다 그 자체로는 의미가 없습니다. 두 문서를 병합하는 분할은 예상되는 내용이 끝난 후 독자가 즉시 다른 사람의 정보를 볼 수 있는 파일을 생성합니다. 법률, 의료 또는 금융 문서의 경우 두 번째 시나리오는 기밀 위반입니다. 유용성과 규정 준수 모두에 대한 올바른 분할을 얻는 것이 중요합니다.
PDF 분할을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
수동 방법: 눈으로 표지 찾기
최대 약 20개의 문서 배치의 경우 수동 분할이 자동화된 솔루션을 구성하는 것보다 빠른 경우가 많습니다. 병합된 PDF를 열고 사이드바에서 페이지 축소판을 스크롤합니다. 표지와 제목 시트는 일반적으로 뒤에 오는 콘텐츠 페이지보다 더 많은 공백, 더 큰 텍스트, 로고 또는 다른 레이아웃 밀도를 갖기 때문에 시각적으로 돋보입니다. 각 문서의 첫 번째 페이지를 클릭하고 마지막 페이지를 Shift 키를 누른 채 클릭한 다음 선택 항목을 새 파일로 추출합니다.
WukongPDF의 PDF 분할 도구는 수동 분할을 효율적으로 만드는 시각적 페이지 선택기를 제공합니다. 모든 페이지를 축소판으로 보고 클릭하여 각 표지의 분할 지점을 표시하면 도구가 각 세그먼트를 별도의 적절한 이름이 붙은 PDF로 추출합니다. 다양한 길이의 문서 15개가 포함된 100페이지 파일의 경우 전체 프로세스는 2분 미만이 소요됩니다. 시각적 인터페이스를 통해 페이지 번호를 추측할 필요가 없으며 추출을 시작하기 전에 각 분할 지점을 확인할 수 있습니다.
수동 분할의 유용한 습관: 각 문서의 페이지 범위를 식별할 때 표지의 제목이나 참조 번호를 기록해 두십시오. 이를 출력 파일 이름으로 사용하십시오. 분할-1.pdf, 분할-2.pdf라는 파일로 가득 찬 폴더는 원본 병합 파일보다 약간만 더 유용합니다. Smith-Application.pdf, Jones-Contract.pdf라는 파일을 즉시 사용할 수 있습니다.
반자동 분할: 텍스트 패턴 감지
수동 작업이 불가능한 곳에서 자동화가 확장됩니다.
수동으로 분할하기에는 배치가 너무 큰 경우 다음 단계는 텍스트 기반 감지입니다. 일괄 분할 기능이 있는 대부분의 PDF 도구는 특정 텍스트 문자열을 검색하고 해당 텍스트가 나타날 때마다 파일을 분할할 수 있습니다. 모든 표지에 '지원서', '기밀', '1페이지' 또는 예측 가능한 형식의 계좌 번호와 같은 일관된 문구가 포함되어 있는 경우 해당 문구가 분할 트리거가 됩니다. 도구는 각 페이지의 텍스트 레이어를 스캔하고 대상 문자열을 찾으면 해당 페이지 앞에 분할 지점을 삽입합니다.
텍스트 기반 분할의 신뢰성은 두 가지 요소에 따라 달라집니다. 첫째, 트리거 텍스트는 모든 표지에 나타나야 하며 콘텐츠 페이지에는 나타나지 않아야 합니다. '페이지 1'과 같은 문구는 문서의 6페이지에 '자세한 내용은 1페이지 참조'라는 텍스트가 포함될 때까지 좋은 트리거처럼 보입니다. 둘째, PDF에는 텍스트 레이어가 있어야 합니다. OCR 없이 스캔한 PDF는 표지 텍스트가 검색 가능한 문자가 아닌 픽셀로만 존재하기 때문에 텍스트 기반 분할을 완전히 무효화합니다. 분할하기 전에 병합된 파일에 대해 OCR을 실행하면 이 문제가 해결되어 단계가 추가되지만 자동화는 유지됩니다.
구조적 탐지: 글꼴 크기 및 페이지 밀도 사용
보다 발전된 접근 방식은 특정 텍스트를 검색하는 대신 각 페이지의 시각적 구조를 분석합니다. 표지 페이지와 제목 시트는 콘텐츠 페이지와 눈에 띄게 다른 특성을 갖는 경향이 있습니다. 제목 주위의 공백으로 인해 텍스트 밀도가 더 낮습니다. 제목 때문에 평균 글꼴 크기가 더 큽니다. 페이지에는 로고와 같은 이미지가 포함될 수 있으며 콘텐츠 페이지는 텍스트로만 구성됩니다. 이러한 속성을 측정할 수 있는 소프트웨어는 어떤 단어가 나타나는지 알 필요 없이 표지 페이지에 플래그를 지정할 수 있습니다.
이 방법은 표지 페이지의 표현은 다양하지만 레이아웃은 일관적인 경우를 처리합니다. 각 표지에 '[고객 이름]을 위해 준비됨'이라고 표시된 일련의 고객 보고서에는 모든 표지에 서로 다른 텍스트가 있습니다. 검색할 공통 문자열이 없기 때문에 텍스트 기반 분할이 실패합니다. 모든 표지가 동일한 글꼴 크기와 동일한 로고 배치를 가진 동일한 템플릿을 사용하기 때문에 구조 기반 분할이 성공합니다. 일관성은 단어가 아니라 디자인에 있으며, 구조적 탐지는 텍스트 검색에서 놓친 부분을 포착합니다.
최상의 결과를 위해 분할하기 전에 파일 준비
분할 전 몇 가지 준비 단계는 모든 방법의 성공률을 극적으로 향상시킵니다. 먼저, 병합된 PDF가 스캐너에서 나온 경우 OCR을 실행하여 검색 가능한 텍스트 레이어를 만듭니다. 수동으로 분할하려는 경우에도 검색 가능한 텍스트를 사용하면 축소판을 스크롤하는 대신 이름이나 참조 번호를 검색하여 특정 페이지로 이동할 수 있습니다. 둘째, 병합된 파일에 별도의 문서로 분할하면 안 되는 페이지가 포함되어 있는지 확인하세요. 팩스 표지, 회람 쪽지 및 문서 사이의 빈 구분 페이지는 분할하기 전에 제거해야 하며 자체 한 페이지 출력 파일로 전환해서는 안 됩니다.
셋째, 낮은 확대/축소로 문서를 스캔하여 모든 표지가 동일한 방향을 사용하는지 확인합니다. 세로 방향 문서 묶음의 단일 가로 표지로 인해 분할 도구가 잘못 정렬될 수 있습니다. 특히 페이지 크기를 기반으로 한 구조 감지를 사용하는 경우 더욱 그렇습니다. 분할하기 전에 페이지 방향을 표준화하십시오. 이러한 단계를 수행하면 프로세스에 몇 분이 추가되지만 분할이 완료되고 원본 병합 파일이 삭제된 후 잘못 절단된 문서를 발견하는 불편함을 방지할 수 있습니다. PDF 페이지 준비 작업은 수동 정리가 필요 없는 깨끗하고 정확한 출력 파일로 성과를 거두었습니다.
분할 중에 체계적으로 출력 파일 이름 지정
병합된 PDF를 분할하는 것의 가치는 페이지를 분리하는 것뿐만 아니라 즉시 식별할 수 있는 출력 파일을 생성하는 것에서도 나옵니다. 분할 중에 적용되는 잘 계획된 명명 규칙은 수신자가 내용을 찾기 위해 각 파일을 열 필요가 없도록 해줍니다. 표지에 송장 번호, 고객 이름 또는 문서 참조 코드와 같은 일관된 요소가 포함되어 있는 경우 분할 프로세스 중에 해당 데이터를 추출하여 파일 이름으로 사용하십시오. 텍스트 기반 감지를 지원하는 대부분의 분할 도구는 감지된 텍스트를 출력 파일 이름으로 사용하여 일반 분할 파일 배치를 적절하게 레이블이 지정된 문서 세트로 전환하는 기능도 지원합니다.
표지가 공통 텍스트 패턴을 공유하지 않는 배치의 경우 분할을 시작하기 전에 명명 규칙을 설정하십시오. 모든 출력 파일에 일관되게 적용되는 ClientName-DocumentType-Date.pdf와 같은 형식은 이전에 불투명한 병합 파일이었던 항목에서 정렬 및 검색 가능한 문서 라이브러리를 만듭니다. 이름 지정 단계는 파일당 몇 초만 소요되며 지속적인 조직 가치를 추가합니다. 이름이 잘 지정된 개별 PDF 폴더는 사용 가능한 문서 아카이브입니다. 순차적으로 번호가 매겨진 분할 파일의 폴더는 나중에 누군가가 풀어야 할 퍼즐입니다. PDF 배치 분할 프로세스는 모든 출력 파일의 이름이 올바르게 지정되고 구성되었을 때만 완료됩니다.
표지 감지를 통해 PDF를 분할하는 방법을 배우는 데 투자한 시간은 초기 사용 사례를 넘어 다양한 문서 유형에 걸쳐 성과를 거두었습니다. 법률 문서 묶음, 송장 배치, 학생 기록 수집, 의료 기록 편집, 계약 세트는 모두 식별 가능한 첫 페이지로 구분된 혼합 문서의 동일한 패턴을 따릅니다. 한 문서 유형에 대해 신뢰할 수 있는 분할 워크플로우를 구축한 후 이를 다른 문서 유형에 적용하려면 새 표지의 고유한 특성을 식별하기만 하면 됩니다. 기술은 한 문서 유형에서 다른 문서 유형으로 빠르게 이전되며 각각의 새로운 배치가 성공적으로 처리될 때마다 효율성이 향상됩니다.
PDF 분할을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
