자동 문서 공급 장치가 있는 문서 스캐너에 50장의 송장 더미를 놓습니다. 스캐너는 50페이지가 모두 순서대로 포함된 단일 PDF를 생성합니다. 이제 각 송장을 송장 번호별로 이름이 지정된 별도의 PDF 파일로 필요합니다. 50페이지짜리 PDF를 50개의 개별 파일로 수동으로 분할하고 각 파일을 열고 올바른 이름으로 저장하는 데는 한 시간 정도의 지루한 작업이 필요합니다. 문서 경계를 감지하고 출력 파일의 이름을 지정하는 일괄 분할 도구는 동일한 작업을 몇 초 만에 자동으로 수행합니다.
스캔된 배치에 대한 분할 PDF 과제는 스캐너가 개별 문서가 아닌 개별 페이지를 본다는 것입니다. 10페이지짜리 청구서는 스캐너에서 10개의 별도의 1페이지 청구서와 똑같아 보입니다. 분할 도구는 페이지 내용을 분석하여 한 문서가 끝나고 다음 문서가 시작되는 위치를 결정해야 합니다. 이 분석에서는 페이지 콘텐츠 패턴, 빈 구분 페이지, 바코드 또는 일관된 페이지 수를 사용하여 문서 경계를 식별합니다.

배치 스캐너가 다중 문서 PDF를 생성하는 방법
자동 문서 공급 장치는 페이지를 순차적으로 처리합니다. 각 페이지는 스캐너를 통과하여 단일 출력 PDF에 추가됩니다. 스캐너는 1~3페이지가 송장 A, 4~5페이지가 송장 B, 6~8페이지가 송장 C라는 사실을 인식하거나 신경 쓰지 않습니다. 단일 파일에서 1~8페이지만 생성합니다.
일부 스캐너는 스캐너에 새 PDF를 시작하라는 신호를 보내는 문서 사이에 삽입된 빈 페이지인 구분 시트를 지원합니다. 그러나 대부분의 스캔 작업 흐름에서는 스캔 프로세스 속도가 느려지므로 구분 시트를 건너뜁니다. 그 결과는 여러 문서가 함께 연결된 단일 PDF 배치 파일입니다.
이 방법을 사용하면 몇 시간의 수동 작업이 몇 초의 자동화된 처리로 전환됩니다.
양면 스캐닝으로 인해 문제가 더욱 복잡해집니다. 10페이지짜리 문서를 양면으로 스캔하면 20개의 PDF 페이지가 생성되며 각 실제 페이지는 2개의 PDF 페이지가 됩니다. 분할 도구는 페이지 1과 2가 별도의 PDF 페이지로 표시되더라도 동일한 문서에 속한다는 것을 이해해야 합니다.
PDF 분할을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
스캔된 배치에서 문서 경계를 감지하는 방법
페이지 수 일관성은 가장 간단한 탐지 방법입니다. 일괄 처리에 포함된 모든 문서의 페이지 수가 동일한 경우 분할 도구는 총 페이지 수를 문서 페이지 수로 나누고 해당 경계에서 분할합니다. 동일한 공급업체의 송장 페이지 수가 일관된 경우가 많습니다. 이 방법에는 내용 분석이 필요하지 않습니다.
빈 페이지 감지는 문서 사이에 의도적으로 삽입된 구분 페이지를 식별합니다. 스캔한 배치의 빈 페이지는 문서 경계를 나타냅니다. 분할 도구는 빈 구분 페이지를 제거하고 나머지 페이지를 빈 페이지 위치에서 개별 문서로 분할합니다.
콘텐츠 패턴 탐지는 가장 정교한 방법입니다. 분할 도구는 새 문서의 시작을 나타내는 반복 패턴을 찾습니다. 송장은 일반적으로 공급업체 로고, 주소 및 송장 번호로 시작됩니다. 양식은 제목과 날짜 필드로 시작됩니다. 보고서는 표지로 시작됩니다. 도구는 이러한 패턴을 식별하고 각 발생을 문서 경계로 표시합니다.
바코드 감지는 인쇄된 바코드가 있는 구분 페이지를 식별합니다. 각 문서의 첫 번째 페이지 상단에 있는 바코드는 문서 ID를 인코딩합니다. 분할 도구는 바코드를 읽고, 인코딩된 값으로 출력 파일의 이름을 지정하고, 바코드가 나타날 때마다 분할합니다. 이 방법은 의료, 법률 및 금융 문서 처리에 널리 사용됩니다.
문서 감지 기능이 있는 분할 도구 사용
WukongPDF는 여러 문서를 스캔한 배치를 개별 파일로 분할하는 기능을 포함하여 브라우저를 통한 스캔된 PDF 처리를 제공합니다. 분할 도구는 콘텐츠 패턴이나 지정된 페이지 수를 사용하여 문서 경계를 감지할 수 있습니다.
분할하기 전에 배치를 미리 보고 페이지 순서와 방향을 확인하세요. 거꾸로 스캔되었거나 순서가 잘못된 페이지는 잘못 정렬된 출력 파일을 생성합니다. 대부분의 분할 도구에는 분할하기 전에 스캔 오류를 수정하기 위한 페이지 미리보기 및 재정렬 기능이 포함되어 있습니다.
감지된 콘텐츠를 기반으로 출력 파일 이름 지정을 구성합니다. 분할 도구가 각 문서의 첫 번째 페이지에서 송장 번호 또는 문서 ID를 읽을 수 있는 경우 해당 값을 출력 파일 이름으로 사용합니다. 내용 기반 이름 지정을 사용할 수 없는 경우 설명이 포함된 접두어가 포함된 일련 번호 지정을 사용하십시오.
분할 정확도 확인
분할 후 처음 몇 개와 마지막 몇 개의 출력 파일을 확인합니다. 첫 번째 출력 파일을 열고 올바른 페이지가 포함되어 있는지 확인합니다. 마지막 출력 파일을 열고 배치의 마지막 페이지가 포함되어 있는지 확인합니다. 배치 중간에서 파일을 즉시 검사합니다. 이러한 검사는 파일이 배포되기 전에 경계 감지 오류를 포착합니다.
모든 출력 파일의 총 페이지 수를 원래 배치 페이지 수와 비교합니다. 합계가 일치하면 모든 페이지가 출력 파일에 할당된 것입니다. 합계가 더 낮으면 분할 중에 페이지가 손실된 것입니다. 합계가 더 높으면 페이지가 중복된 것입니다.
문서 경계가 모호한 배치에서는 더 강력한 경계 증거가 필요한 보수적인 설정으로 분할을 실행합니다. 보수적인 분할을 사용하면 단일 문서를 여러 파일로 잘못 분할하는 대신 일부 문서가 결합된 상태로 남을 수 있습니다. 결합된 문서는 단일 문서의 조각보다 위험이 낮으며 수동으로 분할할 수 있습니다.
분할 및 이름 워크플로 자동화
반복되는 일괄 검색 및 분할의 경우 워크플로를 자동화하세요. 분할 설정, 경계 감지 방법 및 출력 명명 규칙을 프로필로 저장합니다. 각 후속 배치는 동일한 프로필로 처리되어 일관된 출력을 생성합니다. 두 번째 배치 이후에는 초기 설정 시간이 복구됩니다.
시스템 예상 형식과 일치하도록 출력 이름 지정을 구성하여 분할 출력을 문서 관리 시스템과 통합합니다. 문서 관리 시스템 명명 규칙과 일치하는 분할 중에 추출된 문서 ID를 사용하면 수동으로 이름을 바꾸지 않고도 자동 수집이 가능합니다.
스캔된 배치의 문서 분리는 대량의 종이 문서를 처리하는 산업(예: 의료 프로세스 환자 기록, 법률 프로세스 케이스 파일, 회계 프로세스 송장 및 정부 프로세스 애플리케이션)에서 일반적으로 필요합니다. 각 산업에는 고유한 문서 유형, 페이지 수 및 경계 패턴이 있습니다.
바코드 분리 시트는 대용량 스캐닝 작업에 가장 신뢰할 수 있는 방법입니다. 문서 관리 시스템에서 바코드 시트를 인쇄하여 스캔하기 전에 각 문서 위에 올려 놓으면 분할 도구가 바코드를 읽어 문서 경계를 식별하고 출력 파일 이름을 지정합니다. 바코드는 문서의 시작 위치와 끝 위치에 대한 모호성을 제거합니다.
광학 마크 인식은 문서 유형이나 우선 순위를 나타내는 각 문서의 첫 번째 페이지에 있는 확인란이나 채워진 원을 식별할 수 있습니다. 분할 도구는 이러한 표시를 읽고 인식된 유형에 따라 문서를 다른 출력 폴더로 라우팅합니다.
자동화된 문서 분리의 정확성을 측정하고 모니터링해야 합니다. 99% 분리 정확도를 갖춘 500개의 문서 배치는 여전히 수동 수정이 필요한 잘못 분할된 문서 5개를 생성합니다. 시간 경과에 따른 오류율을 추적하여 오류율이 더 높은 문서 유형이나 스캔 조건을 식별합니다.
문서 경계가 일치하지 않는 배치의 경우 스캔과 분할 사이의 사람이 검토하는 단계를 통해 자동 감지에서 놓친 경계 오류를 찾아냅니다. 검토자는 페이지 뷰어에서 배치를 스캔하고 감지된 경계를 확인하거나 조정한 다음 자동 분할을 트리거합니다.
분할 후 출력 파일 형식에는 보관용 PDF/A, 배포용 압축 PDF 또는 추가 이미지 처리용 TIFF가 포함될 수 있습니다. 분리된 문서의 다운스트림 사용을 기반으로 출력 형식을 구성합니다.
분할 워크플로우를 문서 관리 시스템과 통합하면 종이 문서에서 검색 가능한 아카이브에 이르기까지 원활한 파이프라인이 생성됩니다. 스캐너는 일괄 PDF를 생성하고, 분할기는 이를 개별 문서로 분리하고, OCR은 해당 문서를 검색 가능하게 만들고, 문서 관리 시스템은 검색을 위해 해당 문서를 색인화합니다.
클라우드 기반 분할 서비스는 모든 장치에서 액세스할 수 있다는 장점과 함께 데스크톱 도구와 동일한 기능을 제공합니다. 스캔한 배치 PDF가 업로드 및 처리되고 개별 문서가 별도의 파일로 반환됩니다. 민감한 문서에 클라우드 서비스를 사용할 때는 데이터 개인 정보 보호 고려 사항이 적용됩니다.
분할 출력 파일의 명명 규칙은 일관되고 정렬 가능해야 합니다. YYYY-MM-DD_DocumentType_SequentialNumber와 같은 형식은 시간순으로 정렬되고 문서 유형별로 그룹화된 파일 이름을 생성합니다. 일관된 이름 지정을 통해 다운스트림 시스템에서 자동 처리가 가능합니다.
혼합된 문서 유형이 포함된 배치를 분할할 때 분할 도구는 콘텐츠 인식을 기반으로 다양한 문서 유형을 다양한 출력 폴더로 라우팅할 수 있습니다. 송장은 회계 폴더로, 계약서는 법률 폴더로, 서신은 레코드 폴더로 이동합니다.
분할된 문서에서 OCR이 실행되는 경우 스캔한 페이지의 해상도는 OCR 정확도에 영향을 미칩니다. 분할 후 OCR 처리될 문서를 최소 300DPI로 스캔하세요.
일부 분할 도구는 분할 출력과 함께 매니페스트 파일을 생성할 수 있습니다. 매니페스트에는 각 출력 파일 이름, 소스 페이지 범위 및 분할 중에 추출된 모든 메타데이터가 나열됩니다. 매니페스트는 품질 보증 및 문서 추적을 지원합니다.
수동 분할에 비해 자동 배치 분할로 절약되는 시간은 배치 크기에 비례합니다. 50개 문서를 수동으로 분할하려면 약 50분 정도의 반복 작업이 필요합니다. 동일한 배치를 자동으로 분할하려면 약 30초의 구성 및 처리 시간이 필요합니다.
스캔 해상도는 분할 정확도와 출력 문서 품질 모두에 영향을 미칩니다. 스캔 해상도가 높을수록 더 선명한 텍스트가 생성되어 콘텐츠 기반 경계 감지 기능이 향상됩니다. 단점은 처리 중에 파일 크기가 더 커진다는 것입니다. 분할 목적의 경우 정확한 경계 감지에는 일반적으로 200DPI이면 충분합니다.
| 탐지 방법 | 작동 방식 | 에 가장 적합 | 정확도 |
|---|---|---|---|
| 페이지 수 일관성 | 총 페이지를 알려진 문서 길이로 나누기 | 동일한 소스의 통일된 문서 | 알려진 페이지 수에 비해 높음 |
| 빈 페이지 감지 | 빈 구분 페이지 식별 | 구분 기호가 있는 스캔된 배치 | 빈 페이지가 실제로 비어 있는 경우 높음 |
| 콘텐츠 패턴 | 반복되는 헤더 패턴 인식 | 송장, 양식, 보고서 | 중간-높음; 패턴 일관성에 따라 다름 |
| 바코드 인식 | 각 문서의 첫 페이지에 있는 바코드를 읽습니다. | 의료, 법률, 금융 문서 | 매우 높음; 바코드가 확실하다 |
PDF 분할을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
