광학 문자 인식은 밝은 배경에서 어두운 모양을 감지하고 해당 모양을 알려진 문자 패턴과 일치시키는 방식으로 작동합니다. 배경이 균일한 밝은 색상이 아니라 패턴, 질감 또는 워터마크를 포함하는 경우 인식 엔진은 근본적으로 더 어려운 문제에 직면합니다. 페이지의 모든 패턴 요소는 OCR이 실제 텍스트와 구별해야 하는 잠재적인 거짓 긍정입니다. 워터마크가 있는 용지, 질감이 있는 편지지, 체크무늬 보안 인쇄 및 장식 테두리는 모두 시각적 노이즈를 추가하여 OCR 정확도를 떨어뜨립니다. 문제는 OCR이 이러한 배경을 전혀 처리할 수 있는지 여부가 아니라 어떤 조건에서 성공하고 정확도가 유용성 이하로 떨어지는 경우입니다.

배경 패턴이 문자 인식을 방해하는 방식
OCR 엔진은 먼저 임계값 지정이라는 프로세스를 통해 페이지를 이진 흑백 이미지로 변환하여 페이지를 처리합니다. 컷오프 값보다 어두운 모든 픽셀은 검정색이 됩니다. 모든 픽셀이 밝아지면 흰색이 됩니다. 어두운 텍스트가 있는 깨끗한 흰색 페이지에서 임계값 지정은 각 문자가 선명하게 눈에 띄는 선명한 이미지를 생성합니다. 패턴이 있는 배경에서는 임계값보다 더 어두운 패턴 요소가 텍스트와 혼합된 검은색 픽셀이 됩니다. 그런 다음 OCR 엔진은 이러한 패턴 조각을 문자의 일부로 해석하려고 시도합니다. 'e' 중간을 통과하는 워터마크 선으로 인해 엔진에 잘못된 표시가 있는 'c'가 표시될 수 있습니다. 작은 점이 있는 질감 있는 배경으로 인해 엔진이 존재하지 않는 기간을 볼 수 있습니다.
특정 유형의 배경 패턴에 따라 OCR 오류의 성격이 결정됩니다. 보안 용지나 빈티지 타자기 용지와 같은 미세한 도트 패턴은 OCR 엔진이 문자의 구두점이나 악센트로 해석할 수 있는 얼룩 노이즈를 생성합니다. 괘선 노트 용지나 그래프 용지와 같은 선 패턴은 문자 획과 병합될 수 있는 지속적인 간섭을 만들어 선이 어센더와 정렬되면 'l'을 'b'로 바꿉니다. 큰 텍스트나 로고가 있는 워터마크는 배경의 어두움이 이동하는 영역을 생성하여 임계값 지정으로 인해 어두운 워터마크 영역에서 텍스트가 손실되거나 밝은 영역에서 워터마크 조각이 텍스트로 삽입됩니다.
텍스트 밀도에 비해 패턴의 밀도가 매우 중요합니다. 대부분의 전문 워터마크가 설계된 것처럼 텍스트보다 훨씬 밝은 워터마크는 눈에 보이는 아티팩트를 남기지 않고 임계값을 통과할 수 있습니다. OCR 엔진의 기본 임계값은 일반적으로 흰색 종이에서 검정색 텍스트를 분리하도록 설정되며, 10~15% 회색만 등록하는 워터마크는 해당 임계값 아래로 완전히 떨어질 수 있습니다. 문제는 텍스트 어두움의 40~60%에 접근하는 패턴에서 가장 심각합니다. 여기서 임계값 지정은 강도 범위가 겹치기 때문에 패턴과 텍스트를 명확하게 분리할 수 없습니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
패턴이 있는 배경에서 OCR 정확도를 향상시키는 전처리 기술
여러 이미지 전처리 기술을 사용하면 OCR 엔진이 페이지를 처리하기 전에 배경 패턴을 줄이거나 제거할 수 있습니다. 가장 광범위하게 효과적인 기술은 단일 전역 차단을 사용하는 대신 페이지의 각 영역에 대해 서로 다른 밝기 차단을 계산하는 적응형 임계값 지정입니다. 배경이 패턴화된 영역에서는 적응형 임계값이 조정되어 평균 패턴 밝기를 배경 수준으로 처리하여 패턴을 억제하면서 텍스트를 보존합니다. 대부분의 최신 OCR 소프트웨어에는 적응형 임계값 옵션이 포함되어 있지만 기본적으로 활성화되어 있지 않을 수 있습니다.
두 번째 기술은 푸리에 변환 또는 유사한 수학적 도구를 사용한 주파수 필터링입니다. 배경 패턴은 규칙적이고 주기적인 경향이 있습니다. 즉, 배경 패턴은 이미지에서 특정 주파수를 차지합니다. 대조적으로 텍스트는 불규칙하고 광범위한 주파수를 차지합니다. 주파수 영역 필터는 텍스트의 광대역 신호를 보존하면서 배경 패턴과 관련된 좁은 주파수 대역을 식별하고 억제할 수 있습니다. 이 기술은 강력하지만 전문적인 이미지 처리 소프트웨어가 필요하며 일반적으로 개별 문서보다는 대규모 디지털화 프로젝트에 사용됩니다.
WukongPDF의 OCR PDF 도구에는 일반적인 배경 변형을 처리하는 이미지 전처리 기능이 포함되어 있습니다. 약간에서 중간 정도의 배경 패턴이 있는 문서의 경우 내장된 전처리만으로 추가 수동 단계 없이 사용 가능한 텍스트 인식을 생성하기에 충분할 수 있습니다. 핵심은 전체 문서 처리를 시작하기 전에 대표 페이지에서 인식을 테스트하는 것입니다. 테스트 페이지의 정확도가 만족스러우면 배치를 진행하세요. 테스트 페이지에 심각한 오류가 표시되면 OCR 전에 이미지에 외부 전처리가 필요할 수 있습니다.
패턴이 심한 문서에서 수동 전사가 OCR을 능가하는 경우
OCR 출력에 너무 많은 수동 수정이 필요하므로 처음부터 텍스트를 입력하는 것이 더 빠른 품질 임계값이 있습니다. 두꺼운 배경 패턴, 촘촘한 워터마크 또는 전체 페이지를 덮는 보안 인쇄가 있는 문서의 경우 OCR은 문자의 20% 이상이 잘못된 텍스트를 생성할 수 있습니다. 여러 페이지로 구성된 문서에서 문자 5개 중 하나를 수정하는 것은 내용을 새로 입력하는 것보다 시간이 더 오래 걸립니다. 특히 배경 점이 잘못 읽힌 곳에 마침표가 삽입되어 교정 중에 쉽게 발견되지 않고 문장의 의미가 바뀌는 등 오류가 명확하지 않은 경우에는 더욱 그렇습니다.
경제적 결정은 문서의 길이와 필요한 정확성에 따라 달라집니다. 워터마크가 있는 편지지의 단일 페이지 편지를 몇 분 안에 수동으로 전사할 수 있습니다. 질감이 있는 종이에 인쇄된 200페이지 분량의 책은 몇 주간의 수작업을 의미하며, 텍스트의 85%를 정확하게 캡처하는 불완전한 OCR이라도 상당한 유리한 출발을 제공합니다. 대규모 프로젝트의 경우 최적의 워크플로는 공격적인 전처리를 통해 OCR을 수행한 다음, 출력을 사람이 검토하고 검토 단계에서 패턴으로 인한 오류를 식별하고 수정한다는 점을 인정하는 경우가 많습니다. 검색 가능한 텍스트 파이프라인에 대한 스캔 PDF은 정확성에 대한 기대치가 소스 자료의 난이도에 맞게 조정될 때 가장 잘 작동합니다.
배경 간섭을 최소화하기 위한 올바른 스캔 설정 선택
스캔 프로세스를 제어할 때 이미지가 OCR 엔진에 도달하기 전에 여러 설정으로 배경 패턴 가시성을 줄일 수 있습니다. 컬러가 아닌 회색조로 스캔하면 대비 변화를 생성할 수 있는 착색된 워터마크 또는 컬러 보안 실과 같은 색상 기반 패턴이 제거됩니다. 스캐너 밝기를 일반보다 약간 높게 설정하면 밝은 배경 패턴이 감지 임계값 아래로 내려가고 어두운 텍스트는 유지됩니다. 10~15%의 밝기 증가만으로도 텍스트 가독성에 영향을 주지 않고 워터마크를 제거하기에 충분합니다.
일부 스캐너에는 컬러 또는 무늬가 있는 용지의 문서용으로 특별히 설계된 배경 제거 또는 배경 다듬기 기능이 포함되어 있습니다. 이 기능은 페이지를 분석하고 주요 배경색이나 패턴을 식별한 다음 전경 내용을 유지하면서 흰색으로 정규화합니다. 가능한 경우 OCR을 수행할 모든 문서에 대해 이 설정을 활성화해야 합니다. 깨끗한 원본 이미지의 인식 정확도 향상은 스캔 후 이미지 처리를 통해 달성할 수 있는 것보다 훨씬 뛰어납니다.
패턴화된 문서의 OCR 정확도 평가: 허용할 항목과 다시 입력할 항목
허용 가능한 OCR 정확도에 대한 실제 임계값은 추출된 텍스트가 사용되는 방식에 따라 다릅니다. 문서 아카이브 전체에 대한 전체 텍스트 검색의 경우 80%의 정확도이면 충분할 수 있습니다. 특정 이름이나 계좌 번호를 검색하면 주변 텍스트의 20%에 오류가 있어도 문서를 찾을 수 있습니다. 다시 출판되거나 인용되거나 추가 분석에 사용될 텍스트를 추출하는 경우 95%의 정확도가 더 적절한 최소값입니다. 해당 수준 아래에서는 OCR 오류를 수정하는 데 소요되는 시간이 문서를 수동으로 기록하는 데 걸리는 시간에 가까워집니다. OCR 출력을 허용할지 아니면 처음부터 다시 입력할지에 대한 결정은 몇 페이지를 훑어본 결과가 아니라 측정된 정확도 평가를 기반으로 해야 합니다.
OCR 정확도를 측정하려면 인식된 텍스트 샘플을 원본 문서와 비교해야 합니다. 3~5개의 대표 페이지를 선택하고, 원본의 총 문자 수를 계산하고, 대체, 삽입 및 삭제를 포함한 OCR 출력의 문자 오류 수를 계산하고 오류율을 계산합니다. 이 측정에는 10~15분이 소요되며 자동 수정, 수동 검토 또는 전체 다시 입력을 진행할지 여부를 결정하기 위한 객관적인 기반을 제공합니다. 또한 측정을 통해 가장 일반적인 오류 유형을 식별하여 수정 전략 선택을 안내합니다. 오류가 특정 패턴 유형에 집중되어 있는 경우 대상 전처리를 통해 오류를 해결할 수 있습니다. 오류가 무작위로 분포된 경우 OCR 정확도는 수정 가능한 특정 문제보다는 원본 이미지의 기본 품질에 의해 제한됩니다.
종이의 배경 패턴은 결코 OCR을 염두에 두고 디자인되지 않았습니다. 브랜드 아이덴티티부터 위조 방지, 단순한 장식적 매력까지 목적을 달성합니다. 이러한 문서에서 캡처된 PDF 이미지는 패턴을 디지털 영역으로 전달하여 텍스트 추출에 장애물이 됩니다. 전처리를 통해 완화할 수 있는 패턴과 수동 작업이 필요한 패턴을 이해하면 모든 스캔에 동일한 OCR 워크플로우를 적용하고 최상의 결과를 기대하는 대신 각 문서에 대해 정보에 입각한 결정을 내릴 수 있습니다. 문서의 특정 배경 문제를 이해하는 데 투자한 시간은 정확성을 높이고 수동 수정을 줄이며 원본 콘텐츠를 충실하게 표현하는 디지털 텍스트 출력으로 보답합니다.
패턴이 있는 배경의 OCR은 스캐닝 기술, 이미지 처리 및 문서 작업 흐름 설계의 교차점에 있습니다. 단일 기술로 모든 패턴 배경 문제를 해결할 수는 없지만 적절한 스캐닝 설정, 적응형 전처리 및 현실적인 정확도 기대치를 조합하면 대부분의 문서에 유용한 결과를 얻을 수 있습니다. 도구가 존재하고 기술이 잘 확립되어 있습니다. 이를 체계적으로 적용하면 실망스러운 OCR 실패를 관리 가능한 품질 관리 프로세스로 전환할 수 있습니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
