스캔한 문서에서 OCR PDF을 실행하면 인식된 텍스트가 생성됩니다. 대부분의 사용자의 목표는 검색 가능한 PDF입니다. 그러나 인식된 텍스트를 데이터베이스로 가져오거나, 검색 엔진에서 색인을 생성하거나, 응용 프로그램에서 쿼리해야 하는 경우 표준 OCR 출력 형식은 적합하지 않습니다. 데이터베이스 가져오기 및 색인화에 최적화된 구조화된 형식으로 OCR 결과를 내보내면 스캔한 문서 아카이브가 비즈니스 시스템과 통합되는 쿼리 가능한 데이터로 변환됩니다.
주요 내용
데이터베이스 지원 OCR 출력 형식에는 표 형식 데이터용 CSV, 구조화된 문서 콘텐츠용 JSON, 계층 구조를 보존해야 하는 문서용 XML이 포함됩니다. 표준 OCR 출력과의 주요 차이점은 데이터베이스 지향 형식에는 일관된 필드 매핑, 데이터 유형 표시기 및 신뢰도가 낮은 인식 결과에 대한 오류 처리가 포함된다는 것입니다. 기울기 보정, 대비 향상, 해상도 조정 등 OCR 전에 PDF를 준비하면 내보낸 데이터의 품질이 크게 향상됩니다.

데이터베이스에 적합한 출력 형식 선택
CSV 출력은 각 문서가 데이터베이스의 한 행에 해당하는 스캔된 양식 및 테이블에 이상적입니다. 각 양식 필드는 열이 되고, 스캔한 각 문서는 행이 됩니다. CSV는 변환 없이 스프레드시트 애플리케이션과 관계형 데이터베이스로 직접 가져옵니다. 한계는 CSV가 계층적 데이터를 나타낼 수 없다는 것입니다. 스캔한 문서에 여러 품목이 포함된 송장과 같이 중첩된 구조가 있는 경우 CSV를 사용하면 구조를 평면화하거나 출력을 여러 파일로 분할해야 합니다.
JSON 출력은 중첩 및 가변 구조를 자연스럽게 처리합니다. 헤더 섹션과 여러 품목이 있는 송장은 헤더 배열과 품목 배열이 있는 JSON 개체로 표시됩니다. JSON은 MongoDB와 같은 문서 데이터베이스, Elasticsearch와 같은 검색 인덱스 및 대부분의 최신 애플리케이션 플랫폼으로 가져옵니다. Extract PDF Data OCR에서 JSON, 데이터베이스로의 파이프라인은 2025년 문서 이해 애플리케이션을 위한 가장 일반적인 아키텍처입니다. 또한 JSON 구조는 OCR 신뢰도 점수를 유지하므로 데이터베이스 쿼리가 신뢰도가 낮은 결과를 자동으로 필터링할 수 있습니다.
스캔한 문서가 업계 표준 스키마를 준수해야 하는 경우 XML 출력이 선호됩니다. 법률, 의료 및 정부 문서를 처리하려면 특정 문서 유형 정의에 대해 유효성을 검사하는 XML 출력이 필요한 경우가 많습니다. XML 형식은 단일 파일의 구조와 메타데이터를 모두 지원하며 많은 기업 콘텐츠 관리 시스템에 필요한 입력 형식입니다. WukongPDF의 OCR 도구는 CSV, JSON 및 XML 출력 형식을 지원하므로 사후 처리 없이 데이터베이스 가져오기 파이프라인과 일치하는 형식을 선택할 수 있습니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
더 나은 OCR 정확도를 위해 스캔한 PDF 전처리
원래 색종이에 인쇄되었거나 오래되어 누렇게 변색된 문서의 경우 OCR 이전에 스캔을 순수한 흑백으로 변환하면 인식 정확도가 크게 향상될 수 있습니다. OCR 엔진은 색상이나 질감이 있는 배경에서 텍스트를 분리하는 데 어려움을 겪습니다. 배경을 제거하면서 텍스트를 유지하는 임계값을 사용하여 흑백으로 변환하면 OCR 엔진에 깔끔한 입력이 제공됩니다. 대부분의 스캐닝 소프트웨어 및 이미지 편집기에는 조정 가능한 임계값이 있는 흑백 변환 기능이 포함되어 있습니다. 가장 깨끗한 텍스트를 생성하는 설정을 찾으려면 다양한 임계값에서 몇 페이지를 테스트하십시오.
데이터베이스 가져오기는 OCR 오류를 증폭시킵니다. 검색 가능한 PDF에서 잘못 읽은 문자는 사소한 불편입니다. 데이터베이스 필드의 동일한 오류로 인해 레코드를 찾을 수 없거나 잘못 분류되거나 잘못된 엔터티와 일치할 수 있습니다. OCR 이전에 스캔한 문서를 전처리하는 데 시간을 투자하면 오류율이 크게 줄어듭니다. 가장 영향력 있는 세 가지 전처리 단계는 몇 도만 회전한 페이지 기울기를 조정하고, 대비를 높여 텍스트가 배경과 뚜렷하게 돋보이게 하며, 스캔 해상도를 최소 300DPI로 보장하는 것입니다.
기울기를 조정하면 약간 기울어진 상태로 스캔된 페이지가 수정됩니다. 2도 회전만 해도 OCR 엔진이 줄 가장자리의 문자를 잘못 읽을 수 있습니다. 대부분의 OCR 도구에는 자동 기울기 보정이 포함되어 있지만 문서에서 올바르게 활성화되었는지 확인하는 것이 좋습니다. OCR 처리된 페이지 몇 개를 열고 인식된 텍스트 상자가 보이는 텍스트와 정렬되어 있는지 확인하세요. 잘못 정렬된 상자는 데이터베이스에 가비지 데이터를 생성하는 기울기 조정 실패를 나타냅니다. 대비 향상은 오래되거나 누렇게 변한 종이에서 스캔한 문서의 경우 특히 중요합니다. OCR 이전에 텍스트와 배경 사이의 대비를 높이면 까다로운 스캔에서 인식 정확도를 10~20% 향상할 수 있습니다.
OCR 출력 필드를 데이터베이스 열에 매핑
필드 위치가 페이지마다 크게 달라지는 문서의 경우 키워드 앵커가 고정 좌표보다 더 안정적입니다. 대상 데이터의 위치가 아닌, 대상 데이터의 앞이나 뒤에 오는 텍스트를 기준으로 추출 규칙을 정의합니다. '송장 합계 라벨 뒤의 숫자 추출'과 같은 규칙은 해당 라벨이 페이지에 나타나는 위치에 관계없이 작동합니다. 키워드 기반 추출을 위해서는 OCR 출력에 원본 공간 순서와 함께 인식된 전체 텍스트가 포함되어야 합니다. 이는 JSON 출력에서는 유지되지만 CSV 출력에서는 일반적으로 유지되지 않습니다.
OCR 출력과 데이터베이스 가져오기 간의 차이는 필드 매핑입니다. OCR은 페이지 위치별로 구성된 텍스트를 생성합니다. 데이터베이스는 필드 이름으로 구성된 텍스트를 기대합니다. 이 격차를 해소하려면 실제로 1페이지의 오른쪽 상단 모서리에 있는 텍스트가 송장 번호이고 송장_번호 열에 포함된다는 매핑을 정의해야 합니다. 모든 문서에서 레이아웃이 일관되는 구조화된 양식의 경우 위치 좌표 또는 키워드 앵커를 사용하여 매핑을 한 번 정의합니다.
레이아웃이 다양한 반구조화된 문서의 경우 위치 매핑 대신 키워드 기반 매핑을 사용하세요. "인보이스 번호 텍스트 뒤에 오는 숫자는 페이지에서의 위치에 관계없이 인보이스 번호입니다."와 같은 규칙을 정의합니다. 키워드 기반 매핑은 레이아웃 변화에 따라 더 안정적이지만 위치 메타데이터와 함께 인식된 텍스트를 포함하려면 OCR 출력이 필요합니다. 이는 가변 레이아웃 문서에 대해 CSV 대신 JSON 또는 XML 출력을 선택하는 또 다른 이유입니다. JSON 및 XML의 위치 메타데이터를 사용하면 키워드 기반 필드 추출이 가능합니다. 대규모 데이터베이스 가져오기 프로젝트의 경우 WukongPDF의 스캔 PDF OCR 파이프라인에는 직접 데이터베이스 수집이 가능한 일관되게 구조화된 CSV 또는 JSON 파일을 출력하는 구성 가능한 필드 매핑이 포함되어 있습니다.
데이터베이스 가져오기에서 OCR 신뢰도 점수 처리
정확성이 중요한 데이터베이스 애플리케이션의 경우 2단계 OCR 워크플로를 구현하세요. 첫 번째 단계에서는 모든 문서를 표준 설정으로 처리합니다. 신뢰도 점수가 임계값보다 낮은 문서에는 플래그가 지정되고 더 높은 해상도, 기울기 조정, 대비 조정과 같은 향상된 설정으로 다시 처리됩니다. 2단계 접근 방식은 전체 배치 속도를 늦추는 대신 필요한 문서에 추가 처리 시간을 집중시킵니다.
모든 OCR 결과에는 인식된 텍스트가 페이지에 있는 내용과 일치한다는 엔진의 확실성을 나타내는 일반적으로 0에서 100 사이의 숫자인 신뢰도 점수가 포함됩니다. OCR 결과를 데이터베이스로 가져올 때 신뢰도 임계값을 결정하십시오. 임계값을 초과하는 결과는 자동으로 가져옵니다. 임계값 미만의 결과는 사람의 검토를 위해 플래그가 지정됩니다. 임계값은 애플리케이션의 오류 비용에 따라 달라집니다. 사용자가 결과를 훑어보고 잘못된 일치 항목을 무시할 수 있으므로 검색 인덱스는 더 낮은 임계값을 허용할 수 있습니다. 숫자가 계산에 직접 반영되는 금융 데이터베이스에는 일반적으로 95 이상의 높은 임계값이 필요합니다.
데이터베이스에 인식된 텍스트와 함께 신뢰도 점수를 저장합니다. 값이 250.00이고 신뢰도가 98인voice_total과 같은 필드는 신뢰할 수 있습니다. 신뢰도가 62인 동일한 값은 잠정적인 값으로 처리되어야 합니다. 데이터베이스를 쿼리하는 애플리케이션은 신뢰도 점수를 사용하여 노란색 강조 표시 또는 경고 아이콘과 같은 시각적 표시기로 신뢰도가 낮은 값을 표시하여 사용자에게 데이터를 사용하기 전에 데이터를 확인하도록 경고할 수 있습니다. 신뢰도 점수는 일반 텍스트 출력이 제공할 수 없는 데이터 품질 차원을 추가합니다.
자주 묻는 질문
데이터베이스 가져오기를 준비할 때 스캔한 페이지와 기본 디지털 페이지가 혼합된 PDF를 어떻게 처리해야 합니까? OCR을 통해 스캔한 페이지와 텍스트 추출을 통해 디지털 페이지를 별도로 처리한 후 결과를 결합합니다. 디지털 페이지에는 OCR이 필요하지 않으며 OCR을 실행하면 원본 디지털 텍스트가 완벽하게 정확한 경우 인식 오류가 발생하여 실제로 텍스트 품질이 저하될 수 있습니다. 대부분의 일괄 처리 도구는 스캔된 페이지와 디지털 페이지를 감지하여 자동으로 적절한 처리 경로로 라우팅할 수 있습니다.
한 번에 데이터베이스 가져오기를 위해 스캔한 페이지 수는 몇 개나 처리할 수 있습니까?
최신 OCR 엔진은 표준 하드웨어에서 시간당 수천 페이지를 처리할 수 있습니다. 실질적인 한계는 OCR 속도가 아니라 검증 시간입니다. 전체 배치를 프로덕션 데이터베이스로 가져오기 전에 출력 샘플을 검토하는 데 시간을 투자하십시오. 5%의 무작위 샘플 검토는 전체 배치에 영향을 미칠 수 있는 체계적인 OCR 오류를 포착합니다.
스캔한 원본 PDF를 추출된 데이터와 함께 데이터베이스에 저장해야 합니까?
예, 데이터베이스가 지원할 때마다 가능합니다. 추출된 데이터에 연결된 원본 PDF를 저장하면 감사 추적이 제공됩니다. 데이터 품질 문제가 발생하면 사용자는 원본 스캔을 열고 원본 문서에 대해 추출된 값을 확인할 수 있습니다. 추출된 데이터와 원본 문서 간의 이러한 연결은 많은 규제 산업에서 규정을 준수하는 데 필요합니다.
OCR에서 데이터베이스 가져오기를 위해 손으로 쓴 텍스트를 처리할 수 있습니까?
필기 인식이 크게 향상되었지만 인쇄된 텍스트 인식보다 정확도가 떨어집니다. 데이터베이스 가져오기의 경우 양식의 개별 상자에 기록된 숫자와 같이 필기가 제한되지 않는 한 필기 필드는 자동으로 가져오기보다는 사람의 검토를 거쳐야 합니다. 구조화되지 않은 문서의 자유 형식 필기는 대부분의 응용 프로그램에서 자동화된 데이터베이스 가져오기에 충분히 안정적이지 않습니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
