Others

OCR이 배경색이 있는 문서에서 읽을 수 없는 출력을 생성하는 이유는 무엇입니까?

은은한 파란색 배경, 컬러 양식 또는 착색된 종이에 인쇄된 인증서가 있는 문서를 스캔합니다. 스캔이 눈에 괜찮아 보입니다. 텍스트가 배경보다 확실히 더 어둡습니다. 검색 가능한 텍스트를 기대하면서 OCR을 실행하면 출력이 횡설수설됩니다. 임의의 문자, 서로 붙어 있는 단어, 인식할 수 있는 언어를 형성하지 않는 문자. 눈으로 쉽게 걸러내는 배경색은 스캔을 볼 때 명확하지 않은 방식으로 OCR 엔진을 혼란스럽게 합니다.

OCR 엔진은 전경과 배경 사이의 대비를 감지하여 작동합니다. 배경에 색상이 있는 경우(밝은 색조라도) 유효 대비가 감소하고 이진화 프로세스에 노이즈가 발생합니다. 이는 OCR 엔진이 어떤 픽셀이 텍스트이고 어떤 픽셀이 배경인지 결정하는 중요한 첫 번째 단계입니다. 네바다 대학의 2025년 벤치마크에서는 배경이 컬러인 문서의 OCR 정확도가 백서의 동일한 문서에 비해 평균 23% 포인트 감소한 것으로 나타났습니다(UNLV, "ISRI OCR Accuracy Metrics", 2025). 이러한 정확도 하락은 직접적으로 더 많은 수동 수정, 더 많은 검색어 누락, 사용 가능한 디지털 텍스트의 감소로 이어집니다.

Why Does OCR Produce Unreadable Output on Documents With Colored Backgrounds

이진화 문제: OCR이 먼저 잘못된 부분

OCR PDF 엔진이 문자를 인식하려면 먼저 이진화라는 프로세스를 통해 컬러 또는 회색조 이미지를 순수한 흑백 표현으로 변환해야 합니다. 스캔한 이미지의 모든 픽셀은 전경(텍스트, 검정색으로 설정) 또는 배경(흰색으로 설정)으로 분류됩니다. 그런 다음 엔진은 흑백 픽셀의 패턴을 살펴보고 개별 문자를 식별합니다. 이진화 단계에서 실수가 발생하면 이후의 모든 작업은 해당 실수를 기반으로 이루어지며 아무리 영리한 문자 인식으로도 근본적으로 손상된 입력을 복구할 수 없습니다.

문서에 컬러 배경이 있는 경우 이진화 알고리즘은 어려운 임계값 결정에 직면합니다. 흰색 페이지에서 텍스트 픽셀의 값은 0~255 명암 비율에서 0~80이고 배경 픽셀의 값은 200~255입니다. 텍스트와 배경의 간격이 넓어 신뢰도가 높은 임계값 설정이 쉽습니다. 푸른색 페이지에서 텍스트 픽셀은 0-100이고 배경 픽셀은 140-180일 수 있습니다. 간격은 더 좁아지고 알고리즘은 더 세밀하게 구분해야 합니다. 거의 모든 인쇄된 색상 배경에서와 같이 배경 색상이 약간 다른 영역에서는 임계값이 교차하여 배경 픽셀을 텍스트로 분류하기 시작하여 유령 문자를 생성하고 실제 문자를 병합할 수 있습니다.

전체 이미지에 단일 차단 값을 적용하는 전역 임계값 지정 방법은 특히 컬러 배경에 취약합니다. 이러한 방법은 이미지의 전체 밝기 히스토그램을 분석하고 텍스트와 배경을 나타내는 두 개의 주요 피크를 분리하는 임계값을 선택하는 방식으로 작동합니다. 색상이 있는 배경은 히스토그램에 세 번째 피크를 도입하여 알고리즘을 혼란스럽게 하고 종종 임계값이 너무 공격적이어서 세리프 및 크로스바와 같은 문자의 얇은 부분을 삭제하거나 너무 보수적이어서 인식 단계에서 텍스트로 해석하려고 하는 배경 노이즈를 남깁니다.

이진화 실패의 실질적인 결과는 OCR 엔진이 손상된 입력을 수신한다는 것입니다. 흰색 배경에 깔끔한 검정색 모양이어야 하는 문자가 대신 깨지거나 병합되거나 노이즈로 둘러싸여 있습니다. 인식 단계에서는 이러한 저하된 입력을 사용하여 부분 모양을 문자 모델과 일치시키는 데 최선을 다하지만 이진화 품질이 저하됨에 따라 오류율이 급격히 높아집니다. 사용자가 횡설수설한 출력으로 보는 것은 첫 번째 처리 단계에서 도입되고 모든 후속 단계를 통해 증폭되는 오류의 누적 효과입니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

특정 배경색과 이것이 가장 문제를 일으키는 이유

모든 배경색이 OCR에 동일하게 영향을 미치는 것은 아닙니다. 노란색 배경은 특히 오래되거나 단순한 OCR 엔진에서 가장 많은 문제를 야기합니다. 그 이유는 노란색이 휘도가 높아서 카메라나 스캐너에 밝게 보이지만 회색조 변환에서는 예상보다 흰색에 더 가깝기 때문입니다. 노란색 배경의 텍스트는 색상이 선명해 보이지만 회색조 변환 후에는 거의 보이지 않습니다. 이는 대부분의 OCR 엔진이 이미지를 처음 처리하는 방법입니다. 인간의 시각 시스템은 노란색 색조를 필터링하는 데 탁월한 기능을 수행하지만 컴퓨터 비전 알고리즘은 이러한 생물학적 이점을 공유하지 않습니다.

인간의 눈은 배경색을 쉽게 걸러내지만 소프트웨어는 그렇지 않습니다.

파란색과 녹색 배경은 관련되어 있지만 뚜렷한 문제를 야기합니다. 이러한 색상은 휘도 측면에서 검은색 텍스트와 잘 구분되지만 스캐너와 카메라가 사용하는 개별 빨간색, 녹색 및 파란색 센서 채널에서는 구분되지 않습니다. 스캐너의 파란색 채널은 파란색 배경을 강하게 캡처하여 해당 채널에 있는 검정색 텍스트의 대비를 줄입니다. 단일 채널이나 특정 가중치가 적용된 채널 조합에서 작동하는 경우가 많은 OCR 엔진은 예상보다 낮은 대비 이미지를 얻을 수 있습니다.

OCR이 필요한 스캔 PDF 문서의 경우 전처리 품질에 따라 최종 결과가 결정됩니다. WukongPDF는 OCR 처리 중에 단일 전역 임계값을 사용하는 대신 페이지의 각 작은 영역 특성을 기반으로 임계값을 로컬로 조정하는 적응형 이진화를 적용합니다. 이 접근 방식은 기존의 고정 임계값 방법보다 컬러 배경을 더 안정적으로 처리합니다.

빨간색과 분홍색 배경은 또 다른 도전 과제를 제시합니다. 빨간색은 노란색보다 휘도가 낮으므로 회색조에서는 더 어두운 회색으로 변환됩니다. 결과적으로 빨간색 배경은 회색조 이미지에서 텍스트와 배경 사이의 분리를 덜 만듭니다. 빨간색 형식 문서를 처리하는 OCR 엔진은 더 어두운 영역에서 배경을 전경으로 처리하여 텍스트 인식 단계에서 왜곡된 문자로 해석하려고 시도하는 이진화된 출력에 어두운 얼룩을 생성할 수 있습니다. 정부 양식, 의료 접수 서류, 교육 증명서에는 색종이나 착색된 배경을 사용하는 경우가 많기 때문에 이는 의료, 교육, 공공 행정 전반에 걸쳐 실질적인 문제가 됩니다.

그라데이션 배경 및 무늬가 있는 종이

페이지 전체에서 색상 강도가 변경되는 그라데이션 배경은 단색 배경보다 훨씬 더 까다롭습니다. 위쪽이 어두워졌다가 아래쪽이 밝아지는 영수증, 안쪽으로 점차 희미해지는 장식 테두리가 있는 인증서 또는 흰색으로 전환되는 색상 헤더가 있는 양식은 모두 최적의 이진화 임계값이 다른 영역을 만듭니다. 단일 전역 임계값을 사용하는 OCR 엔진은 페이지의 한 부분을 올바르게 이진화하고 다른 부분에서는 실패하여 동일한 페이지에서 깨끗한 텍스트와 횡설수설을 번갈아 표시하는 출력을 생성합니다.

수표의 보안 패턴, 워터마크가 있는 종이 질감 또는 일부 정부 양식의 도트 매트릭스 패턴과 같은 패턴이 있는 배경은 OCR에 대한 최악의 시나리오를 나타냅니다. 패턴은 OCR 엔진이 텍스트 요소로 착각할 수 있는 규칙적이고 반복되는 텍스처를 만듭니다. 엔진은 패턴 도트를 마침표로 인식하거나 패턴 선을 문자로 인식하려고 시도할 수 있습니다. 출력은 실제 텍스트와 패턴 아티팩트를 혼합하여 실제 단어에 임의의 구두점과 단어인 것처럼 보이지만 그렇지 않은 짧은 문자 시퀀스가 산재되어 있는 일종의 출력을 생성합니다.

또한 배경 패턴은 특정 문서에 대한 테스트 없이는 예측하기 어려운 교활한 방식으로 텍스트와 상호 작용합니다. 텍스트 뒤의 대각선 패턴은 이진화된 이미지의 인접한 문자를 연결하여 OCR 엔진이 두세 글자를 단일 문자로 볼 수 있습니다. 도트 패턴은 o, e, a와 같은 문자의 카운터를 채워서 단단한 얼룩과 구별할 수 없게 만듭니다. 이러한 상호 작용은 패턴 빈도, 텍스트 크기 및 글꼴 디자인의 특정 조합에 따라 달라지며, 이는 유사한 배경을 가진 두 문서가 극적으로 다른 OCR 결과를 생성할 수 있는 이유입니다.

컬러 배경 OCR을 수정하는 전처리 기술

여러 전처리 단계를 통해 컬러 배경의 OCR에 대한 PDF 품질을 크게 향상시킬 수 있습니다. 가장 효과적인 방법은 전체 페이지에 하나의 임계값을 적용하는 대신 픽셀의 작은 이웃 각각에 대해 서로 다른 이진화 임계값을 계산하는 적응형 임계값 지정입니다. 적응형 방법은 동일한 이미지 내에서 어두운 배경 영역의 텍스트 대비를 유지하면서 밝은 영역의 배경을 올바르게 제거할 수 있습니다.

색상 채널 선택은 또 다른 강력한 기술입니다. 개별 빨간색, 녹색 및 파란색 채널에서 스캔한 이미지를 검사하면 텍스트와 배경 간의 대비가 풀 컬러 이미지나 회색조 변환보다 훨씬 높은 채널을 찾을 수 있습니다. 파란색 배경의 경우 파란색 배경이 빨간색 채널에서 어둡게 나타나 검은색 텍스트와의 분리가 증가하므로 일반적으로 빨간색 채널이 가장 좋은 대비를 나타냅니다. 이 기술은 시도하는 데 비용이 들지 않으며 극적인 개선을 가져올 수 있습니다.

세 번째 기술인 배경 빼기는 텍스트 없이 배경이 어떻게 보일지 추정한 다음 이를 이미지에서 빼고 균일한 흰색 배경에 텍스트만 남기는 시도입니다. 이 접근 방식은 착색된 종이나 밝은 색상의 양식과 같이 배경이 점진적으로만 변하는 균일한 색상인 문서에 적합합니다. 배경이 복잡하거나 빠르게 변화하는 문서의 경우 배경 제거는 덜 효과적이며 자체적인 아티팩트가 발생할 수 있습니다.

최신 AI 기반 전처리는 OCR 품질 개선의 최전선을 나타냅니다. 수백만 개의 문서 이미지로 훈련된 신경망은 알고리즘 접근 방식이 일치할 수 없는 방식으로 복잡한 배경에서 텍스트를 분리하는 방법을 학습할 수 있습니다. 이러한 AI 전처리기는 모든 범위의 배경색, 패턴 및 그라데이션을 처리할 수 있어 기존 방법을 사용할 수 없는 문서에서도 깨끗한 이진화된 출력을 생성할 수 있습니다. 2025년 현재 AI 전처리는 여러 상용 OCR 플랫폼에서 사용할 수 있으며 프리미엄 추가 기능이 아닌 표준 기능이 되고 있습니다.

OCR을 포기하고 대체 접근 방식을 사용해야 하는 경우

배경이 컬러인 일부 문서는 전처리를 얼마나 적용하더라도 OCR이 제대로 이루어지지 않습니다. 밝은 텍스트가 포함된 어두운 용지에 인쇄된 문서, 금속성 또는 반사 잉크가 포함된 문서, 텍스트 자체에 검정색이 아닌 컬러 잉크가 사용된 문서는 자동화된 텍스트 인식에 특히 취약합니다. 이러한 경우 수동 기록 또는 하이브리드 접근 방식(가능한 것은 OCR하고 나머지는 입력하는 것)이 OCR 파이프라인을 계속 최적화하는 것보다 더 시간 효율적인 경우가 많습니다.

정확하게 디지털화해야 하는 중요한 문서의 경우 원본 디지털 소스 파일이 어딘가에 존재하는지 고려하세요. Word 문서에서 생성된 PDF는 시각적 렌더링에 색상이 있는 배경이 있더라도 원본 텍스트 데이터를 유지합니다. 인쇄된 버전을 스캔하는 대신 원본 파일을 얻을 수 있으면 OCR 문제를 완전히 우회할 수 있습니다. 특히 레거시 문서의 경우 이는 항상 가능한 것은 아니지만 OCR 최적화에 시간을 투자하기 전에 조사해 볼 가치가 있습니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →