누군가가 직접 작성한 종이 양식을 스캔합니다. 양식에 인쇄된 텍스트가 깨끗합니다. 상자에 손으로 쓴 답변은 지저분하지만 사람이 읽을 수 있습니다. 양식을 검색할 수 있고 손으로 쓴 답변을 텍스트로 추출할 수 있기를 바라면서 스캔에서 OCR을 실행합니다. 인쇄된 텍스트의 OCR 결과는 거의 완벽합니다. 필기에 대한 OCR 결과가 횡설수설입니다. 인쇄된 글꼴을 대상으로 훈련된 인식 엔진은 인간의 손글씨의 가변적이고 불규칙한 모양을 이해할 수 없습니다.
타이핑된 텍스트와 손으로 쓴 텍스트가 모두 포함된 문서는 OCR PDF 엔진에 이중 과제를 제시합니다. 인쇄된 텍스트에는 제대로 작동하는 표준 OCR이 필요합니다. 필기에는 전문적인 필기 인식이 필요하지만 정확도가 낮고 다른 설정이 필요합니다. 단일 문서에서 두 가지를 모두 처리하려면 각 콘텐츠 유형을 적절하게 처리하는 전략이 필요합니다.

OCR 엔진에서 필기가 훨씬 어려운 이유
인쇄된 텍스트 OCR은 문자 모양을 알려진 글꼴 패턴과 일치시키는 방식으로 작동합니다. 문자 "a" 12포인트 타임스에서 뉴로마는 나타날 때마다 거의 동일하게 보입니다. OCR 엔진은 Times New Roman 문자의 모양에 대한 모델을 저장하고 해당 모델과 일치시킵니다. 필기에는 그러한 모델이 없습니다. 모든 사람의 'a'는 달라 보인다. 같은 사람이라도 "a" 주변 문자, 쓰기 속도, 펜 각도 및 피로도에 따라 발생 시마다 다릅니다. 일치시킬 고정된 패턴이 없습니다.
필기 인식은 수천 또는 수백만 개의 필기 샘플을 대상으로 훈련된 기계 학습 모델을 사용합니다. 이러한 모델은 손으로 쓴 글자가 어떻게 달라지는지에 대한 통계적 패턴을 학습하고 단일 템플릿에서 크게 벗어나는 경우에도 문자를 인식할 수 있습니다. 딥러닝을 통해 필기 인식의 정확도가 획기적으로 향상되었지만 인쇄된 텍스트 인식에 비해 여전히 상당한 차이가 있습니다. PDF 협회의 2025년 벤치마크에서는 깨끗한 스캔에서 인쇄된 텍스트 OCR 정확도가 97% 이상인 것으로 나타났습니다. 동일한 벤치마크에서 필기 인식 정확도는 대략 80%~85%였으며 이는 필기 단어 5~6개 중 약 1개에 오류가 있음을 의미합니다(PDF Association, "OCR Accuracy Benchmark Report", 2025).
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
혼합 유형 및 필기 문서에 대한 OCR 전략
가장 효과적인 전략은 문서를 입력된 영역과 필기 영역으로 분리하고 각각을 적절한 인식 엔진으로 처리하는 것입니다. 이러한 분리는 문서를 섹션으로 자르거나 마스킹하여 수동으로 수행할 수도 있고, 영역별로 콘텐츠 유형을 감지하는 인식 엔진을 통해 자동으로 수행할 수도 있습니다.
WukongPDF의 OCR 도구는 페이지의 각 텍스트 영역이 인쇄되었는지 아니면 손으로 쓴 것인지 감지하고 적절한 인식 모델을 적용합니다. 인쇄된 라벨과 손으로 쓴 답변이 있는 양식에서 라벨은 인쇄된 텍스트 모델을 통해 높은 정확도로 인식됩니다. 필기 답변은 필기 품질이 허용하는 정확도에 따라 필기 모델을 사용하여 처리됩니다. 출력은 두 인식 결과를 결합한 단일 텍스트 레이어입니다.
더 나은 스캔을 통해 필기 OCR 정확도 향상
스캔 품질은 인쇄된 텍스트 인식보다 필기 인식에 더 큰 영향을 미칩니다. 최소 300DPI로 스캔하세요. 해상도가 높을수록 인식 엔진이 분석할 문자당 더 많은 픽셀을 제공합니다. 순수한 흑백보다는 회색조 또는 컬러 모드를 사용하십시오. 손으로 쓴 획의 미묘한 회색 변화는 순수한 흑백 임계값이 무시되는 문자 모양에 대한 정보를 전달합니다. 손으로 쓴 "e" 루프가 부분적으로 채워진 경우 회색조에서는 인식할 수 있지만 흑백으로 임계값을 지정하면 구별할 수 없는 얼룩이 됩니다.
손글씨는 최대한 어둡고 일관되게 작성하세요. 연필 손글씨는 흑연이 더 희미하고 가변적인 선을 생성하기 때문에 펜보다 인식하기가 더 어렵습니다. 흰색 용지에 파란색 또는 검정색 잉크가 가장 잘 대비됩니다. 빨간색 잉크, 녹색 잉크 또는 컬러 용지는 대비와 정확도를 떨어뜨립니다. 양식 작성 프로세스를 제어하는 경우 최상의 OCR 결과를 얻으려면 양식을 검정 잉크로 작성하도록 지정하십시오. 양식 자체에 대한 이 작은 명령은 다운스트림 데이터 추출 정확도를 10~15% 포인트 향상시킬 수 있습니다.
필기 OCR 출력 검토 및 수정
OCR 이후에는 스캔 PDF 텍스트 레이어의 필기 영역에 오류가 집중되어 있습니다. 인쇄된 텍스트는 거의 완벽할 것입니다. 손으로 쓴 답변을 중심으로 검토하세요. PDF를 열고 일반적인 필기 OCR 오류를 검색하세요. 숫자 1은 종종 문자 l로 인식됩니다. 숫자 0은 문자 O로 인식되는 경우가 많습니다. 문자 조합 "th"는 문자 O로 인식됩니다. 종종 "+h"로 인식됩니다. 왜냐하면 t의 크로스바가 h에 섞이기 때문입니다.
데이터베이스나 스프레드시트로 추출해야 하는 양식 데이터의 경우 필기 필드를 수동으로 검토하는 것이 필수적입니다. 인식 엔진은 최선의 추측을 제공합니다. 사람은 원본 손글씨와 대조하여 추측을 검증해야 합니다. 이 검증 단계에서는 OCR의 시간 절약이 인간의 품질 관리에 대한 필요성으로 인해 부분적으로 상쇄됩니다. 순 절감액은 볼륨에 따라 다릅니다. 10개 양식의 경우 수동 데이터 입력이 OCR + 검토보다 더 빠를 수 있습니다. 500개 양식의 경우 검토 단계가 OCR 신뢰도가 낮은 필드로 제한되므로 OCR + 검토가 훨씬 더 빨라집니다. WukongPDF의 OCR 출력에는 인식된 각 텍스트 블록에 대한 신뢰도 점수가 포함되어 있으므로 신뢰도로 정렬하고 신뢰도가 낮은 결과만 검토할 수 있습니다.
의료 접수 양식, 보험 청구 또는 정부 신청과 같이 대량으로 처리되는 양식의 경우 양식 디자인 자체로 필기 OCR 정확도를 향상시킬 수 있습니다. 이름이나 주소를 한 줄로 길게 표시하는 대신 문자당 하나의 상자로 별도의 문자 상자를 사용하여 양식을 디자인합니다. 개별 문자 상자는 작성자가 문자를 분리하도록 강제하므로 OCR 엔진이 인식을 시도하기 전에 각 문자를 분리할 수 있기 때문에 인식 정확도가 크게 향상됩니다. 이는 전 세계 세금 신고서 및 이민 서류에서 사용되는 것과 동일한 원칙입니다. 상자는 양식을 작성하는 사람에게 약간 불편하지만 대규모 양식 처리에 필요한 절충안인 대규모 자동 데이터 추출을 가능하게 합니다.
혼합 문서에 대한 OCR 이후의 실용적인 품질 체크포인트: 엔진이 인쇄된 텍스트와 손글씨를 혼동했음을 나타내는 일반적인 OCR 오류 패턴을 검색합니다. "cl"을 검색하세요. 그리고 그것이 "d"가 아니었는지 확인하세요. "0"을 검색하세요. 그리고 각 인스턴스가 실제로 대문자 O가 아닌 0인지 확인합니다. "1"을 검색하세요. 소문자 L이나 대문자 I가 아닌 1인지 확인합니다. 이 세 가지 검색은 인쇄 및 필기 인식 모두에서 문자 수준 OCR 오류의 대부분을 포착합니다. 발견된 오류를 수정한 다음 문서 목적에 중요한 특정 이름, 숫자 또는 날짜에 대해 한 번 더 검색을 실행하십시오. 인쇄된 지침에 오타가 있는 양식은 짜증납니다. 손으로 쓴 약의 복용량이 잘못된 형태는 위험합니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
