Tips & Tricks

PDF를 분할하고 각 페이지를 다른 사용자 정의 파일 이름으로 저장하는 방법

50페이지 PDF를 개별 페이지로 분할하면 page-1.pdf부터 page-50.pdf라는 이름의 50개 파일이 생성됩니다. 이름은 실제 페이지 위치에 따라 기술적으로 정확하며 내용에 따라 전혀 쓸모가 없습니다. 7페이지에는 서명 및 지불 조건이 포함된 Smith 계약이 포함될 수 있습니다. 23페이지는 개별 항목과 총액이 포함된 Jones 송장일 수 있습니다. 포함된 내용을 찾기 위해 각 파일을 개별적으로 열어서 50개 파일 모두의 이름을 바꾼 다음 설명적인 파일 이름을 입력하는 것은 처음에 PDF를 분할하는 것만큼 시간이 걸리고 나중에 파일을 찾을 수 없게 만드는 명명 오류가 발생할 위험이 있습니다.

실제 분할 작업에는 몇 초가 걸립니다. 이어지는 이름 바꾸기 작업은 파일 수와 콘텐츠에서 이름을 파생하는 방법이 있는지 여부에 따라 몇 분 또는 몇 시간이 걸립니다. 명명 단계를 자동화하면 지루한 작업에서 PDF 분할을 실제로 효율적인 작업 흐름으로 변환할 수 있습니다.

분할 PDF을 분할하고 의미 있는 사용자 정의 이름으로 각 파일을 저장한다는 것은 분할 전에 책갈피와 같은 문서 구조에서 이름을 파생하는 명명 패턴을 설정하거나 분할 후 각 파일에서 텍스트를 읽고 내용에서 설명적인 이름을 생성하는 일괄 이름 바꾸기 도구를 사용하는 것을 의미합니다. WukongPDF의 PDF Pages 분할 도구는 책갈피 텍스트를 기반으로 한 사용자 정의 이름 지정을 지원하며 아래 방법은 구조화된 분할 전 접근 방식과 분할 후 콘텐츠 추출 접근 방식을 모두 다룹니다.

How to Split a PDF and Save Each Page With a Different Custom File Name

분할 전 문서 구조에서 파일 이름 파생

PDF에 각 최상위 책갈피가 설명 제목이 있는 논리적 섹션에 해당하는 잘 구성된 책갈피 계층 구조가 있는 경우 책갈피 기반 분할은 책갈피 텍스트를 파일 이름으로 자동 상속하는 출력 파일을 생성합니다. 각 최상위 책갈피가 클라이언트 이름인 월별 클라이언트 보고서의 PDF는 각 클라이언트의 이름을 딴 파일인 Smith-Corp.pdf, Jones-LLC.pdf, Acme-Inc.pdf로 분할되며 수동으로 이름을 바꿀 필요가 없습니다. 책갈피 텍스트는 파일 시스템에 안전해야 합니다. 즉, 운영 체제에서 파일 이름에 금지하는 콜론, 슬래시, 백슬래시, 별표, 물음표 등의 문자를 포함할 수 없습니다.

북마크가 있지만 해당 텍스트가 파일 이름으로 적합하지 않거나, 너무 길거나, 잘못된 문자를 포함하거나, 일관되지 않은 형식을 사용하는 경우 분할하기 전에 북마크 텍스트를 편집하세요. Adobe Acrobat에서 책갈피 패널을 열고 각 책갈피를 마우스 오른쪽 버튼으로 클릭한 다음 이름 바꾸기를 선택하고 원하는 파일 이름을 입력합니다. 수십 개의 섹션이 있는 문서의 경우 북마크 편집 단계는 몇 분 정도 걸리지만 분할 작업을 통해 추가 개입 없이 완벽하게 이름이 지정된 파일이 생성되면 깨끗한 북마크에 투자한 시간이 즉시 회수됩니다.

WukongPDF

PDF 분할을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

일반 이름으로 분할한 후 콘텐츠 기반 이름 추출

PDF에 책갈피가 전혀 없거나 책갈피 텍스트가 의미 있는 콘텐츠 식별자를 캡처하지 않아 책갈피 기반 이름 지정을 사용할 수 없는 경우 먼저 문서를 일반적인 연속 이름으로 분할한 다음 해당 콘텐츠에서 추출된 텍스트를 기반으로 각 출력 파일의 이름을 바꿉니다. 일괄 이름 바꾸기 도구 또는 Python 스크립트는 각 분할 파일의 첫 번째 페이지에서 텍스트의 처음 몇 줄을 읽고, Client: 레이블 뒤에 나타나는 클라이언트 이름이나 Invoice # 다음에 나오는 송장 번호와 같은 알려진 패턴을 검색하고, 일치하는 텍스트를 새 파일 이름으로 사용합니다.

콘텐츠 추출 접근 방식은 각 분할 섹션이 예측 가능한 위치에서 텍스트를 식별하는 일관된 형식을 공유하는 구조화된 문서에 가장 적합합니다. 각 페이지의 첫 번째 줄에 Invoice #와 숫자, 두 번째 줄에 Client:라는 이름이 있는 월별 청구서 폴더는 두 필드를 모두 추출하고 Invoice-1234-Acme-Corp.pdf와 같은 파일 이름을 구성하는 스크립트를 통해 일괄 이름을 바꿀 수 있습니다. 스크립트는 배치의 모든 파일에 동일한 추출 및 명명 논리를 적용하여 수동 이름 변경에 따른 시간과 오류율을 모두 제거합니다.

반복 작업에 대한 분할 및 이름 워크플로 스크립팅

일정에 따라 반복되는 분할 및 이름 작업, 동일한 월별 보고서 구조가 매월 동일한 배포 목록에 대해 동일한 이름의 섹션으로 분할되므로 매 주기마다 수동 프로세스를 반복하는 대신 영구 스크립트를 구축하는 것이 정당화됩니다. 페이지 범위와 해당 출력 파일 이름을 구성 파일에 한 번 씁니다. 스크립트는 구성을 읽고, 지정된 범위에 따라 PDF를 분할하고, 지정된 이름으로 각 출력 파일의 이름을 지정합니다. 매달 구성에서 입력 PDF 파일 이름만 업데이트합니다. 스크립트는 각 주기마다 다른 모든 것을 동일하게 처리합니다.

스크립트와 구성 파일 모두의 버전을 제어합니다. 보고서 구조가 변경되거나 섹션이 추가, 제거 또는 재구성되면 이에 맞게 구성을 업데이트하세요. 스크립트 논리는 일정하게 유지됩니다. 스크립트에 캡처된 처리 논리와 구성에 캡처된 문서별 데이터를 분리하면 시간이 지나도 워크플로를 유지 관리할 수 있습니다. 월별 분할을 실행하는 사람은 스크립트를 이해하거나 수정할 필요가 없습니다. 간단한 구성 파일을 편집하고 스크립트를 실행합니다.

명명 방법전제조건콘텐츠 인식?에 가장 적합
북마크 기반 분할깔끔한 텍스트로 구성된 잘 구성된 북마크예, 문서 구조에서 파생된 이름입니다.제목 계층 구조가 있는 문서
컨텐츠 추출 스크립트각 섹션의 일관된 텍스트 패턴예, 문서 내용에서 파생된 이름입니다.구조화된 양식, 송장, 보고서
스크립트된 분할 및 이름범위와 이름이 포함된 구성 파일예, 완전히 맞춤설정 가능동일한 구조의 반복되는 작업

파일 이름 충돌 및 잘못된 문자 처리

동일한 추출된 이름을 생성하는 두 개의 분할 페이지 또는 섹션, 식별 번호가 없는 동일한 클라이언트의 두 송장으로 인해 해당 이름의 파일이 이미 존재하기 때문에 두 번째 파일을 저장할 수 없는 파일 이름 충돌이 발생합니다. 구별 접미사, 일련 번호, 날짜 또는 두 문서를 구별하는 모든 필드를 추가하여 충돌을 해결합니다. Invoice-1234-Acme-Corp.pdf와 Invoice-1235-Acme-Corp.pdf는 송장 번호로 구분됩니다. 구분 필드를 사용할 수 없는 경우 시퀀스 카운터(Acme-Corp-1.pdf 및 Acme-Corp-2.pdf)를 추가합니다.

파일 이름으로 사용되는 추출된 텍스트는 운영 체제에서 금지하는 문자를 삭제해야 합니다. 콜론, 슬래시, 백슬래시, 별표, 물음표, 꺾쇠 괄호, 파이프 문자를 제거하거나 하이픈이나 밑줄로 바꿉니다. 선행 및 후행 공백과 마침표를 자릅니다. 청소 단계는 평범하지만 필수적입니다. 잘못된 문자가 포함된 정리되지 않은 파일 이름으로 인해 운영 체제 오류로 인해 이름 바꾸기 작업이 실패하고, 50개 파일 중 어떤 파일이 실패를 유발했는지 진단하는 것은 모든 파일 이름을 사전에 정리하는 것보다 훨씬 더 많은 시간이 소요됩니다.

WukongPDF

PDF 분할을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →