Tips & Tricks

바코드 구분 페이지를 감지하여 PDF를 분할하는 방법

대량 문서 스캔을 통해 수백 개의 개별 문서가 포함된 하나의 대용량 PDF가 생성되며 각 문서는 바코드 페이지만으로 다음 문서와 구분됩니다. 일반적으로 빈 시트에 인쇄된 코드 39 또는 코드 128 기호인 바코드는 자동화 시스템에 문서 하나가 끝나고 다음 문서가 시작되는 위치를 알려주는 기계 판독 구분선 역할을 합니다. 이러한 바코드 구분 페이지를 감지하여 PDF를 분할하려면 바코드 인식 기능이 있는 PDF 분할 도구가 필요합니다. 이 도구는 각 페이지를 읽고 바코드가 포함된 페이지를 식별하고 해당 페이지를 분할 지점으로 사용하여 문서를 구성 파일로 분리합니다.

How to Split a PDF by Detecting Barcode Separator Pages

문서 스캔에서 바코드 구분 페이지가 작동하는 방식

대량의 종이 문서를 스캔하기 전에 바코드 구분 시트가 스택의 각 개별 문서 위에 배치됩니다. 스캐너는 단일 연속 작업으로 전체 스택을 공급하여 수천 페이지 길이가 될 수 있는 하나의 PDF를 생성합니다. 바코드 시트는 모든 원본 문서 쌍 사이의 경계에서 PDF 전체에 배포됩니다. 각 바코드는 문서 유형 코드, 사건 번호, 직원 ID 또는 파일 참조 등 뒤에 오는 내용을 식별하는 정보를 인코딩합니다.

바코드는 사람에게 시각적으로 의미가 있을 필요는 없습니다. 다양한 너비의 수직 막대 패턴으로 인쇄된 기계 판독 가능 데이터 매체입니다. PDF 배치 처리 도구는 바코드 값을 읽고 이를 사용하여 분할 지점과 선택적으로 추출된 문서의 파일 이름을 결정합니다. INV-2026-0047 값을 인코딩하는 구분 페이지 바코드는 분할기에 이 페이지에서 새 문서를 시작하고 출력 파일 이름을 INV-2026-0047.pdf로 지정하도록 지시합니다.

WukongPDF

PDF 분할을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

바코드 기반 분할을 위한 PDF 준비

분할을 실행하기 전에 PDF의 모든 구분 페이지에 선명하게 인쇄되고 손상되지 않은 바코드가 포함되어 있는지 확인하십시오. 얼룩이 지거나, 스테이플 구멍에 의해 부분적으로 가려지거나, 비스듬히 인쇄된 바코드는 올바르게 인식되지 않아 스플리터가 분할 지점을 놓치거나 잘못된 값을 읽을 수 있습니다. PDF를 빠르게 스크롤하여 임의의 구분 페이지 샘플을 확인하세요. 바코드는 깨끗한 흰색 종이에 진한 검정색 잉크로 인쇄해야 하며 모든 면에 최소 1/4인치의 공백이 있어야 합니다.

바코드 페이지가 이전 문서의 마지막 페이지가 아닌 각 문서의 첫 번째 페이지인지 확인하세요. 이 규칙은 바코드 값이 다음 문서를 설명한다는 의미이므로 문서 스캔에서 거의 보편적입니다. PDF의 바코드 페이지가 각 문서의 마지막 페이지로 배치된 경우 대부분의 바코드 분할 도구에는 이를 조정하는 설정이 있지만 기본 가정은 바코드가 각 새 문서의 첫 번째 페이지에 있다는 것입니다.

바코드 인식을 지원하는 도구 선택

페이지 수 또는 책갈피로 나누는 표준 PDF 분할기는 바코드를 감지할 수 없습니다. 바코드 인식에는 페이지 이미지의 광학적 분석이 필요하기 때문입니다. 바코드 기반 분리를 기능으로 명시적으로 나열하는 문서 캡처 또는 기업 콘텐츠 관리 도구를 찾으십시오. Adobe Acrobat Pro에는 문서 처리를 위한 작업 마법사에 바코드 인식 기능이 포함되어 있습니다. 바코드 감지 기능이 있는 브라우저 기반 분할 PDF 플랫폼은 인식 서버 측을 처리하고 분할 파일을 다운로드 가능한 아카이브로 반환합니다.

바코드로 구분된 PDF를 정기적으로 처리하는 조직의 경우 Kofax, Ephesoft 또는 Abbyy FlexiCapture와 같은 전용 문서 캡처 소프트웨어가 가장 안정적인 바코드 인식을 제공합니다. 이러한 도구는 대용량 문서 분리를 위해 특별히 설계되었으며 바코드 유효성 검사 규칙, 읽을 수 없는 바코드에 대한 예외 처리, 문서 관리 시스템과의 통합과 같은 기능을 포함합니다. WukongPDF 및 유사한 플랫폼은 엔터프라이즈 소프트웨어를 설치하지 않고도 액세스할 수 있는 브라우저 기반 분할을 제공합니다.

바코드 인식 설정 구성

대부분의 바코드 분할 도구에서는 처리하기 전에 바코드 유형을 지정해야 합니다. 문서 스캐닝에서 가장 일반적인 두 가지 유형은 영숫자 문자를 인코딩하고 법률 및 의료 기록에 널리 사용되는 코드 39와 전체 ASCII 문자 세트를 인코딩하고 동일한 데이터에 대해 더 컴팩트한 바코드를 생성하는 코드 128입니다. 도구 설정에서 올바른 바코드 유형을 선택하세요. 잘못된 유형을 선택하면 모든 바코드가 인식되지 않고 도구에서 분할 지점을 찾을 수 없다고 보고합니다.

일부 도구는 바코드 방향 설정을 제공합니다. 구분 페이지의 바코드는 일반적으로 가로로 인쇄되지만 페이지가 가로 방향으로 스캐너를 통해 공급되거나 바코드가 페이지 가장자리를 따라 세로로 인쇄된 경우 인식 엔진은 스캔할 방향을 알아야 합니다. 가능한 경우 방향을 자동으로 설정합니다. 그러면 엔진이 각 페이지에 대해 가능한 네 가지 회전을 모두 확인합니다.

바코드 값을 사용하여 출력 파일 이름 지정

각 구분 페이지의 바코드 값은 분할 트리거와 출력 파일 이름 모두로 이중 역할을 할 수 있습니다. 구분 기호 뒤에 오는 문서의 파일 이름으로 바코드 값을 사용하도록 분할 도구를 구성합니다. 바코드 값 CASE-0042-HARRIS가 있는 구분 기호는 해당 구분 기호부터 다음 구분 페이지를 포함하지 않고 해당 구분 기호까지의 모든 페이지를 포함하는 CASE-0042-HARRIS.pdf라는 출력 파일을 생성합니다.

바코드 값이 공백, 특수 문자 또는 파일 이름에 허용되지 않는 문자를 포함하는 등 파일 이름 지정에 안전한 형식을 따르지 않는 경우 값을 삭제하도록 도구를 구성하십시오. 대부분의 도구는 공백을 Windows 또는 macOS 파일 시스템에서 허용하지 않는 밑줄, 하이픈 및 스트립 문자로 자동으로 바꿉니다. 첫 번째 분할 작업 후 출력 파일 이름을 확인하여 원래 의미를 더 이상 전달하지 않는 제거된 문자 문자열 대신 읽기 쉽고 유용한 이름이 생성되었는지 확인합니다.

읽을 수 없거나 누락된 바코드 처리

바코드 인식 프로세스는 완벽하지 않습니다. 얼룩진 바코드, 기울어져 급지된 페이지, 스캔 중에 실수로 누락된 구분 시트 등은 모두 분할 오류를 발생시킵니다. 누락된 분할 지점의 양쪽에 있는 문서를 자동으로 병합하는 대신 인식할 수 없는 페이지에 플래그를 지정하도록 도구 예외 처리를 구성합니다. 이 도구는 페이지 번호 및 가능한 경우 페이지 이미지의 축소판과 함께 바코드가 예상되었지만 찾을 수 없는 모든 페이지를 나열하는 예외 보고서를 생성해야 합니다.

자동 분할이 완료된 후 예외 보고서를 검토하고 도구가 자동으로 분리할 수 없는 문서를 수동으로 분할합니다. 원본 PDF를 열고, 플래그가 지정된 페이지 번호로 이동하고, 분할이 발생해야 하는 위치를 결정하고, PDF 페이지 추출 도구를 사용하여 수동으로 페이지를 추출합니다. 수동 예외 처리 단계는 배치의 모든 문서를 수동으로 분할하는 데 몇 시간이 소요되는 것과 비교하여 소수의 누락된 분할에 대해 몇 분이 걸립니다.

향후 스캐닝 프로젝트를 위해 고대비 바코드 인쇄를 사용하고, 스캐너 그림자로 인해 가릴 수 있는 페이지 가장자리에서 떨어진 곳에 바코드를 배치하고, 문서 스택에 삽입되기 전에 구분 페이지에서 사전 스캔 품질 검사를 실행하여 바코드 가독성을 향상시킵니다.

원본 문서 인벤토리에 대한 분할 결과 검증

자동화된 바코드 분할이 완료된 후 출력 파일 수를 예상 문서 수와 비교하십시오. 원본 스캐닝 프로젝트에서 스캔 중인 문서 247개를 기록한 경우 분할하면 정확히 247개의 출력 파일이 생성됩니다. 불일치는 두 문서가 하나의 출력 파일로 병합된 분할 지점이 누락되었거나 페이지 중 하나의 내용이 바코드로 잘못되어 단일 문서가 분할된 잘못된 분할 지점을 나타냅니다.

법적 자료 제출이나 의료 기록 마이그레이션 등 위험도가 높은 분할 프로젝트의 경우 페이지 수 조정을 수행하세요. 모든 출력 파일의 총 페이지 수는 원본 PDF의 페이지 수에서 구분 페이지를 뺀 값과 같아야 합니다. 한 페이지라도 불일치하면 분할이 완벽하지 않으며 출력을 수동으로 검토해야 함을 의미합니다.

구분 페이지를 버리지 말고 별도의 PDF로 저장하세요. 해당 페이지의 바코드 값은 각 출력 파일을 스캔된 배치의 원래 위치에 연결하는 감사 추적을 제공합니다. 몇 달 후 특정 문서에 대한 질문이 발생하면 구분 페이지 아카이브를 통해 해당 문서의 출처를 정확히 확인할 수 있습니다.

다기능 프린터에서 스캔한 문서를 야간 처리하는 등 일정에 따라 실행되는 PDF Batch 분할 작업의 경우 스캔부터 분할, 보관까지 전체 작업 흐름을 자동화합니다. 감시 폴더는 새 PDF를 모니터링합니다. PDF가 도착하면 바코드 분할기가 이를 자동으로 처리하고 분할된 파일을 바코드 값에 따라 분류된 폴더에 저장합니다. 자동화는 수동 분할 작업을 사람의 주의가 필요 없는 백그라운드 프로세스로 전환합니다.

새 문서 스캐닝 프로젝트에 대한 바코드 유형을 선택할 때 바코드 값에 문자와 숫자가 모두 포함되는 경우 코드 39 대신 코드 128을 선택하십시오. 코드 128은 영숫자 데이터에 대해 보다 컴팩트한 바코드를 생성합니다. 즉, 스캔 가능성을 잃지 않고 구분 페이지에 바코드 기호를 더 작게 인쇄할 수 있습니다.

장기 PDF 배치 프로젝트의 경우 스캔한 문서와 함께 저장된 프로젝트 파일에 바코드 사양 및 분할 구성을 문서화합니다. 몇 달 또는 몇 년 후에 프로젝트를 다시 방문하면 문서는 어떤 바코드 유형이 사용되었는지, 바코드 값이 무엇을 나타내는지, 분할이 어떻게 구성되었는지에 대한 질문에 답합니다.

바코드 기반 PDF Batch 교체를 바코드 품질 문제로 인해 수동 분리로 분할해야 하는 경우 소요 시간이 크게 늘어납니다. 몇 분 안에 자동으로 분할되는 배치를 수동으로 분리하는 데 몇 시간이 걸릴 수 있습니다.

WukongPDF

PDF 분할을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →