신문 용지, 얇은 사전 용지 또는 품질이 낮은 사무 용지를 스캔하면 심각한 문제가 있는 PDF가 생성됩니다. 페이지 뒷면의 텍스트가 실제로 읽고 싶은 텍스트 뒤에 희미한 유령 이미지로 번집니다. 비쳐짐 또는 블리드스루라고 하는 이 현상은 전경 텍스트와 배경 소음을 구별할 수 없기 때문에 OCR 엔진을 혼란스럽게 합니다. OCR 출력은 의도한 텍스트와 페이지 반대편의 반전된 텍스트 조각이 혼합되어 왜곡되어 사용할 수 없는 출력이 됩니다.
비쳐 보이는 것은 어둡거나 고르지 못한 배경과 근본적으로 다릅니다. 단순한 임계값 조정으로 제거할 수 있는 균일한 노이즈는 아닙니다. 구조화된 텍스트로, 거꾸로 인쇄되고 희미하지만 여전히 구조적입니다. 표준 OCR 엔진은 페이지의 어두운 표시를 잠재적인 텍스트로 처리하며 뒷면의 고스트 문자는 잘못된 문자 인식을 트리거할 만큼 충분한 대비를 갖습니다. 이 문제를 해결하려면 스캔한 이미지를 전처리하여 OCR 엔진이 보기 전에 블리드 스루를 억제해야 합니다. 신문용지의 경우 전처리 단계는 선택 사항이 아닙니다. 원본 사진보다 조금 더 유용한 것은 검색 가능한 문서와 디지털 파일의 차이입니다.
디지털 보존 연합(Digital Preservation Coalition)의 2025년 연구에 따르면 전처리 없이 신문 용지 스캔의 OCR 정확도는 평균 67%인 반면 깨끗한 레이저 인쇄 페이지의 OCR 정확도는 98%입니다. 최적화된 전처리를 통해 동일한 신문 용지 스캔은 94%의 정확도를 달성했습니다(Digital Preservation Coalition, "OCR Performance on Degraded Paper Media", 2025). 원시 신문 OCR과 전처리된 신문 OCR 사이의 27% 포인트 차이는 검색 가능한 문서와 텍스트 쿼리에 효과적으로 사용할 수 없는 문서 간의 차이를 나타냅니다.

신문 및 얇은 종이에서 표준 OCR이 실패하는 이유
OCR PDF 프로세스는 픽셀 값이 배경과 임계값 이상 차이가 나는 이미지 영역을 감지하는 방식으로 작동합니다. 어두운 텍스트가 있는 깨끗한 흰색 종이에서는 임계값을 쉽게 설정할 수 있습니다. 50% 회색보다 어두운 것은 텍스트이고 더 밝은 것은 배경입니다. 신문용지에서는 종이 자체가 회색이고, 뒷면에서 비치는 부분도 회색이며, 앞면의 전경 텍스트보다 약간 더 밝은 경우가 많습니다. 단일 전역 임계값은 이 둘을 분리할 수 없습니다. 비쳐짐을 제외할 만큼 임계값을 충분히 높게 설정하면 전경 텍스트에서 가는 획과 세리프도 손실됩니다. 모든 전경 텍스트를 캡처할 수 있을 만큼 낮게 설정하면 비쳐 보이는 부분도 캡처됩니다.
신문은 소개 이상의 추가 과제를 소개합니다. 종이는 시간이 지나면서 누렇게 변하는 경우가 많아 한 페이지 전체에 걸쳐 베이지색에서 갈색으로 변하는 불균일한 배경을 만듭니다. 텍스트는 일반적으로 6~8포인트의 작은 글꼴 크기로 좁은 열에 인쇄됩니다. 수십 년에 걸쳐 번진 잉크로 인해 문자가 서로 흐려지고 "e"와 같은 문자의 간격이 좁아집니다. 그리고 "a." 그리고 종이 표면 자체에는 고해상도 스캔에서 OCR 엔진이 구두점으로 잘못 읽는 미세한 입자로 나타나는 제조 공정의 질감이 있을 수 있습니다. 이러한 각 문제는 다른 문제를 복잡하게 하며, 그 중 하나만 처리하는 전처리 파이프라인은 나머지 문제를 남겨 OCR 정확도를 저하시킵니다.
WukongPDF는 OCR을 실행하기 전에 비침을 자동으로 감지하고 적절한 배경 억제를 적용하는 적응형 전처리를 통해 스캔된 PDF 처리를 처리합니다. 이 접근 방식은 표준 OCR 엔진을 혼동시킬 수 있는 스캔에서 검색 가능한 텍스트를 생성하며 깨끗한 사무실 용지부터 누렇게 변한 신문 용지까지 모든 종류의 용지에 적용됩니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
비침을 억제하는 전처리 기술
Show-Through를 위한 가장 효과적인 단일 전처리 단계는 배경 추정 및 빼기입니다. 이 기술은 페이지 이미지를 스캔하여 텍스트가 급격하게 변하는 반면 배경은 페이지 전체에서 천천히 변한다는 가정을 기반으로 각 픽셀에서 로컬 배경색이 어떠해야 하는지에 대한 모델을 구축합니다. 그런 다음 원본 이미지에서 배경 모델을 빼서 전경 텍스트를 유지하면서 비쳐 보이는 부분을 효과적으로 제거합니다. ScanTailor와 같은 도구와 사전 처리 모듈이 내장된 오픈 소스 Tesseract OCR 엔진은 이 기술의 변형을 구현합니다.
관련된 접근 방식은 가장자리를 유지하면서 이미지를 매끄럽게 만드는 양방향 필터를 사용하는 것입니다. 필터는 주변 배경과의 평균을 계산하여 희미한 비침을 줄이지만 전경 텍스트의 선명한 가장자리는 유지합니다. 그 결과 OCR 엔진이 균일한 배경에 대해 명확한 텍스트를 볼 수 있는 더욱 깨끗한 이미지가 생성됩니다. 양방향 필터링은 단순 임계값 지정보다 계산 비용이 더 많이 들고 일반적으로 페이지당 몇 초가 걸리지만 신문 스캔의 품질 향상은 지속적인 가치가 있는 모든 문서의 처리 시간만큼 가치가 있습니다.
비침이 특히 심한 스캔의 경우 웨이블릿 분해라는 기술을 사용하여 이미지를 여러 주파수 대역으로 분리할 수 있습니다. 희미하고 대비가 낮은 쇼스루는 일반적으로 고주파수 대역의 낮은 진폭 구성 요소를 차지합니다. 이러한 구성 요소를 억제하고 나머지 밴드에서 이미지를 재구성하면 대부분의 텍스트 세부 정보를 유지하면서 비침 현상을 제거할 수 있습니다. 이 기술을 사용하려면 전문적인 이미지 처리 소프트웨어가 필요하지만, 특히 뒷면 텍스트가 전경 텍스트만큼 어두운 페이지에서 더 간단한 방법으로는 비교할 수 없는 결과를 생성합니다.
단계: 비침을 최소화하기 위한 스캔 설정
비쳐짐을 처리하는 가장 좋은 방법은 스캔 시간에 이를 줄이는 것입니다. 스캔할 페이지 뒤에 검정색 종이 한 장을 놓습니다. 검정색 뒷면은 얇은 종이를 통과한 빛을 흡수하고 스캐너 덮개에서 반사되어 뒷면 텍스트를 비춥니다. 이 간단한 단계를 통해 용지 두께에 따라 비침을 50~80%까지 줄일 수 있습니다. 항공 우편 문구나 성경 용지와 같이 매우 얇은 용지의 경우 스캔을 위해 검정색 뒷면 시트가 필수입니다.
스캐너가 지원하는 가장 높은 광학 해상도(문서 스캐너의 경우 일반적으로 300~600DPI)로 스캔합니다. 해상도가 높을수록 투명도에 비해 전경 텍스트의 더 자세한 내용이 캡처되고, 추가 픽셀은 전처리 알고리즘에 더 많은 작업 데이터를 제공합니다. 흑백보다는 컬러나 회색조로 스캔하십시오. 흑백 스캔은 스캔 시 실행 취소할 수 없는 엄격한 임계값을 적용하며 해당 임계값이 페이지의 일부에 대해 잘못된 경우 정보는 영원히 손실됩니다. 컬러 또는 회색조 스캔은 전체 색조 범위를 유지하고 스캔 후 다양한 전처리 설정을 시험해 볼 수 있도록 해줍니다. 이는 페이지 전체에 걸쳐 최적의 임계값이 달라지는 페이지에 필수적입니다.
대규모 PDF Archive 프로젝트의 경우 적절한 스캐닝 기술에 대한 투자는 후처리 노력을 줄여 그 자체로 여러 배의 가치를 발휘합니다. OCR에 사용하기 위해 많은 전처리가 필요한 스캔에는 표시, 인쇄 및 더 나은 OCR 기술을 사용한 향후 재처리를 포함하여 향후 파일을 사용할 때마다 많은 처리가 필요합니다. 처음부터 스캔을 올바르게 수행하는 것은 모든 디지털화 프로젝트에서 가장 비용 효과적인 단계입니다.
OCR 후 수정 및 검증
전처리된 스캔에서 OCR을 실행한 후에도 출력의 까다로운 페이지에는 여전히 오류가 포함됩니다. 인식된 텍스트에 대해 맞춤법 검사기를 실행하여 OCR 오류 가능성이 있는 플래그를 표시합니다. 맞춤법 검사기에서 맞춤법이 틀린 것으로 표시한 단어는 수동 수정 대상입니다. 중요한 문서의 경우 사람이 임의로 페이지 샘플을 검토하게 하고 OCR 텍스트를 원본 스캔과 비교하여 오류율을 추정합니다. 95%의 정확도는 20개의 단어 중 약 1개의 단어가 틀렸다는 것을 의미합니다. 이는 검색 목적으로는 허용될 수 있지만 충실한 디지털 전사본을 작성하는 데에는 적합하지 않습니다.
중요한 PDF 검색 가능 프로젝트의 경우 동일한 사전 처리된 스캔에 두 개의 서로 다른 OCR 엔진을 사용하고 해당 출력을 비교하는 것을 고려하십시오. 두 엔진이 단어에 동의하면 거의 정확합니다. 동의하지 않는 경우 두 버전 모두 수동 검토 대상이 됩니다. 이 이중 엔진 접근 방식은 검토자가 수백 페이지에 달하는 문서의 모든 페이지를 읽도록 요구하는 대신 실제로 모호한 텍스트만 표시함으로써 수동 수정 작업량을 줄입니다.
스캔한 문서가 장기적인 가치를 가질 때 적절한 전처리 및 검증 노력이 정당화됩니다. 한 번 디지털화되고 신중하게 사전 처리되어 정확성이 검증된 1950년 신문 기사는 수십 년 동안 검색 및 인용이 가능합니다. 기본 설정으로 디지털화되고 전처리 없이 동일한 기사는 OCR 출력이 너무 왜곡되어 검색에서 사실상 손실될 수 있습니다. 사람이 여전히 원본 스캔 이미지를 완벽하게 읽을 수 있더라도 마찬가지입니다.
대규모 역사 신문 컬렉션을 관리하는 기관의 경우, 표준화된 전처리 파이프라인을 개발하는 것은 미래의 모든 디지털화 프로젝트와 연구원이 컬렉션에 대해 실행하는 모든 미래의 검색 쿼리에 걸쳐 배당금을 지불하는 투자입니다. 새로운 직원이 시행착오 없이 결과를 재현할 수 있도록 파이프라인은 각 스캐너 모델 및 용지 유형에 대한 특정 설정으로 문서화되어야 합니다. 잘 문서화된 파이프라인을 사용하면 OCR 기술이 향상될 때 컬렉션을 다시 처리할 수 있으며, 업데이트된 인식 엔진으로 동일한 전처리를 적용하여 원본 실제 문서로 돌아가지 않고도 동일한 원시 스캔에서 더 나은 텍스트를 추출할 수 있습니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
