Tips & Tricks

여러 PDF 파일의 총 단어 또는 페이지 수를 계산하는 방법

하나의 PDF에 몇 페이지가 있는지 알아내는 것은 쉽지 않습니다. 뷰어에 페이지 수가 표시됩니다. 한 폴더에 있는 50개의 PDF에 걸쳐 몇 페이지가 있는지 또는 전체에 몇 개의 단어가 결합되어 있는지 알아내는 것은 불가능합니다. 수동으로 각 파일을 열고 개수를 기록하고 숫자를 합산하는 작업은 PDF를 만든 실제 작업보다 오래 걸립니다.

파일 전체를 수동으로 계산하는 것은 컴퓨터가 발명한 작업입니다. 그러나 대부분의 PDF 도구는 다중 파일 수를 제공하지 않습니다.

여러 PDF 배치 파일에서 단어와 페이지 수를 계산하려면 배치 통계를 지원하는 도구나 각 파일에서 정보를 추출하여 합산하는 스크립트가 필요합니다. WukongPDF의 PDF Pages 도구는 개별 파일 통계에 도움이 될 수 있으며 아래 방법은 다중 파일 집계를 처리합니다.

How to Count the Total Number of Words or Pages Across Multiple PDF Files

PDF 도구에 내장된 일괄 통계 사용

Adobe Acrobat Pro에는 배치 페이지 또는 단어 개수 기능이 포함되어 있지 않습니다. 일부 타사 PDF 관리 도구가 그렇습니다. PDF Architect 및 Nitro Pro에는 선택한 파일 세트의 페이지 수를 보고할 수 있는 일괄 처리 모듈이 포함되어 있습니다. 출력은 일반적으로 각 파일 이름과 해당 페이지 수를 나열하는 CSV 파일이며 하단에 총계가 표시됩니다.

상태 비저장 요청 모델은 파일 업로드 전반에 걸쳐 정보를 유지하지 않기 때문에 브라우저 기반 PDF 도구는 일반적으로 다중 파일 통계를 제공하지 않습니다. 각 파일은 별도의 세션입니다. 통계를 집계하려면 여러 파일에 걸쳐 있는 영구 세션이 필요하며 이는 데스크톱 및 서버 기반 도구에서 더 일반적입니다.

WukongPDF

PDF 병합을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

페이지 수 추정을 위해 파일 탐색기 사용

Windows 파일 탐색기 및 macOS Finder는 파일 메타데이터 열에 PDF 페이지 수를 표시합니다. 파일 탐색기의 세부 정보 보기에서 페이지 열을 활성화하면 각 PDF의 페이지 수가 목록에 나타납니다. 모든 파일을 선택하면 운영 체제 버전 및 구성에 따라 상태 표시줄에 합계가 표시될 수 있습니다.

파일 탐색기는 전체 파일을 여는 대신 각 PDF의 작은 메타데이터 필드를 읽기 때문에 페이지 수 읽기가 빠릅니다. 수백 개의 PDF 폴더의 경우 페이지 수가 몇 초 안에 채워집니다. 그러나 파일 탐색기는 단어 수를 제공하지 않으며 메타데이터가 실제 페이지 수와 일치하지 않는 비표준 내부 구조가 있는 PDF의 경우 페이지 수 읽기가 정확하지 않을 수 있습니다.

PDF 전체의 단어 및 페이지 수 스크립팅

PyPDF2 또는 pdfplumber와 같은 PDF 라이브러리가 있는 Python은 폴더의 모든 PDF에서 페이지 수와 단어 수를 추출하여 합산할 수 있습니다. 스크립트는 각 PDF를 열고, 문서 메타데이터에서 페이지 수를 읽고, 각 페이지에서 텍스트를 추출하고, 단어 수를 세고, 합계를 누적합니다. 출력은 전체 폴더의 결합된 페이지 수와 단어 수입니다.

스크립트는 원하는 수의 파일을 처리합니다. 500개의 PDF로 구성된 폴더는 파일 크기와 텍스트 추출 속도에 따라 몇 분 안에 처리됩니다. 스크립트는 모든 파일에 동일한 계산 논리를 적용하므로 일관된 결과를 생성합니다. 수동 계산은 피로와 산만함으로 인해 차이가 발생합니다. 스크립트 계산은 반복 가능하고 감사 가능합니다.

방법속도정확도단어 수 제공?
파일 탐색기 메타데이터보통(메타데이터만)아니요
일괄 PDF 도구높은일부 도구
파이썬 스크립트분(파일 수에 따라 다름)높음(실제 텍스트 추출)
수동 열기 및 계산시간낮음(피로)예, 수동으로

단어 수에 따라 스캔한 PDF 처리

스캔한 PDF에는 텍스트가 아닌 이미지가 포함되어 있습니다. 텍스트 추출을 기반으로 한 단어 수는 추출할 텍스트가 없기 때문에 스캔한 문서에 대해 0단어를 반환합니다. 스캔한 PDF를 단어 수에 포함하려면 먼저 OCR을 실행하여 텍스트 레이어를 만듭니다. 그러면 단어 개수 스크립트가 OCR 텍스트의 개수를 셉니다. OCR에서는 인식 오류가 발생하므로 OCR 단어 수는 대략적인 것입니다.

디지털 PDF와 스캔한 PDF가 모두 포함된 혼합 폴더의 경우 스크립트는 별도의 합계(기본 텍스트가 있는 디지털 PDF의 단어, OCR 후 스캔한 PDF의 단어)를 보고해야 합니다. 소스를 구별하지 않고 이를 하나의 총계로 결합하면 스캔한 문서 단어 수의 정확성이 과장되고 총계의 일부가 정확하지 않고 OCR 추정치라는 사실이 모호해집니다.

섹션 또는 장별 단어 수 내보내기

총 단어 수 외에도 각 PDF 내 섹션당 단어 수를 추출하면 편집, 번역 또는 청구를 위한 세부적인 데이터가 제공됩니다. PDF 책갈피 또는 제목 감지를 사용하여 텍스트를 분할하고 세그먼트당 단어 수를 계산하는 스크립트는 자세한 보고서를 생성합니다. 출력의 각 행에는 해당 섹션의 파일 이름, 섹션 이름 및 단어 수가 표시됩니다.

섹션 수준 개수는 서로 다른 섹션이 서로 다른 번역가에게 할당되는 번역 프로젝트에 유용합니다. 프로젝트 관리자는 이 수치를 사용하여 작업을 균등하게 분배하고 완료 시간을 추정합니다. 동일한 개수는 콘텐츠 복잡성에 따라 가격이 달라지는 섹션별 청구를 지원합니다. 총 단어 수는 프로젝트의 규모를 알려줍니다. 섹션별 단어 수를 나누는 방법을 알려줍니다.

청구 및 견적에 대한 카운트 사용

페이지 또는 단어로 청구하는 프리랜서 및 대행사는 일괄 계산을 사용하여 송장을 생성합니다. 파일 이름, 페이지 수, 단어 수의 CSV를 생성하는 스크립트는 청구 가능한 보고서를 제공합니다. 클라이언트는 개수를 독립적으로 확인할 수 있습니다. 보고서는 데이터가 포함된 송장을 지원합니다.

프로젝트 견적에는 배치 계산의 이점도 있습니다. 단어당 가격이 책정되는 번역 프로젝트에는 모든 문서에 대한 정확한 소스 단어 수가 필요합니다. 페이지당 가격이 책정되는 인쇄 프로젝트에는 총 페이지 수가 필요합니다. 견적을 내기 전에 계산을 실행하면 견적이 견적이 아닌 실제 문서 양을 기반으로 하도록 보장됩니다. 계산에 소요된 시간은 정확한 가격 책정으로 그 자체로 가치가 있습니다.

WukongPDF

PDF 병합을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →