스캔한 PDF를 열면 마치 기본 디지털 문서인 것처럼 텍스트를 선택, 복사 및 검색할 수 있습니다. 해당 텍스트는 원본 스캔에서 나온 것이 아닙니다. 스캐너는 텍스트 데이터가 전혀 없는 픽셀 그리드인 페이지 이미지를 생성했습니다. 선택하고 검색하는 텍스트는 페이지 이미지를 분석하고 픽셀 패턴을 문자로 변환하는 광학 문자 인식 소프트웨어에 의해 생성된 OCR 텍스트입니다. 그러나 PDF에서 선택 가능한 모든 텍스트가 OCR 텍스트는 아닙니다. 일부 PDF에는 스캐너나 인식 엔진을 통과하지 않고 디지털 방식으로 생성된 텍스트가 포함되어 있습니다. OCR 텍스트와 포함된 텍스트의 차이점을 이해하면 일부 PDF는 완벽하게 검색되는 반면 다른 PDF는 왜곡된 결과를 생성하는 이유를 설명합니다.

OCR 텍스트란 무엇이며 PDF에 들어가는 방법
OCR 텍스트는 기계로 생성됩니다. OCR PDF 엔진은 스캔한 페이지 이미지의 각 문자 모양을 검사하고 이를 알려진 문자 패턴 데이터베이스와 비교한 다음 페이지에서의 위치와 함께 가장 일치하는 문자를 출력합니다. 인식된 텍스트는 원본 이미지 문자 위에 정확하게 위치하는 보이지 않는 레이어로 PDF에 포함됩니다. 스캔한 PDF에서 텍스트를 선택하고 복사하면 보이는 이미지가 아닌 보이지 않는 OCR 레이어에서 복사하게 됩니다. OCR 엔진이 문자를 잘못 읽은 경우 보이는 이미지가 정확해 보이더라도 복사된 텍스트에는 해당 오류가 포함됩니다.
OCR 텍스트의 품질은 원본 스캔의 해상도와 선명도, 원본 문서에 사용된 글꼴, 텍스트 언어, OCR 엔진의 정교함 등 여러 요소에 따라 달라집니다. 최신 OCR 엔진으로 처리된 레이저 인쇄 영어 문서의 깨끗한 300DPI 스캔은 거의 완벽한 텍스트를 생성합니다. 기본 OCR 엔진으로 처리된 복잡한 문자 모양의 언어로 된 도트 매트릭스 인쇄 문서를 150DPI로 스캔하면 오류가 가득한 텍스트가 생성됩니다. OCR 텍스트는 인식 엔진과 스캔 품질이 허용하는 만큼만 정확합니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
포함된 텍스트의 정의 및 PDF에 포함되는 방법
포함된 텍스트는 작성되었으나 인식되지 않습니다. 워드 프로세서, 전자 출판 응용 프로그램 또는 PDF 작성 라이브러리가 PDF를 생성할 때 텍스트를 PDF 콘텐츠 스트림에 직접 씁니다. 각 문자는 글꼴의 문자 모양에 매핑되는 특정 코드로 저장됩니다. 텍스트가 이미지가 아니기 때문에 인식 단계가 없습니다. PDF를 생성한 응용 프로그램은 어떤 문자가 쓰여지고 있는지 정확히 알고 이를 정확하게 기록했습니다. 디지털로 생성된 PDF에서 텍스트를 선택하고 복사하면 작성자가 입력한 문자가 그대로 복사됩니다.
포함된 텍스트는 OCR 텍스트에 일반적으로 부족한 서식 정보를 전달합니다. 글꼴 이름, 굵게 및 기울임꼴 스타일, 문자 간격은 소스 문서에서 작성자가 지정했기 때문에 포함된 텍스트에 보존됩니다. OCR 텍스트는 이 형식 중 일부를 재구성할 수 있지만 이는 명시적인 메타데이터로 저장되지 않고 문자의 시각적 모양에서 유추됩니다. 스캔한 후 OCR된 페이지와 기본 디지털 페이지 간의 PDF 형식 비교를 보면 이러한 차이가 드러납니다. OCR 버전에서는 텍스트 선택이 가능하지만 모든 문자를 동일한 두께의 동일한 글꼴로 보고합니다. 디지털 버전은 작성자가 의도한 글꼴 구별을 유지합니다.
PDF의 텍스트가 OCR인지 아니면 포함되었는지 확인하는 방법
PDF의 텍스트가 OCR로 생성되었는지 또는 포함되었는지 확인하는 가장 신뢰할 수 있는 방법은 문서 속성, 특히 글꼴 목록을 확인하는 것입니다. 글꼴 정보를 표시할 수 있는 뷰어에서 PDF를 엽니다. Adobe Acrobat은 파일, 문서 속성, 글꼴 아래에 글꼴 목록을 표시합니다. 글꼴 목록에 OCR이 포함된 이름의 글꼴이 표시되거나 글꼴이 알 수 없음 또는 특정 이름이 없는 일반 유형으로 나열되는 경우 텍스트는 OCR에서 생성되었을 가능성이 높습니다. 글꼴 목록에 Arial, Times New Roman 또는 Calibri와 같이 Bold 또는 Italic과 같은 하위 유형이 포함된 특정 이름의 글꼴이 표시되면 텍스트가 디지털 소스에서 포함된 것이 거의 확실합니다.
또 다른 실제 테스트는 일반적인 OCR 오류 패턴을 검색하는 것입니다. OCR 엔진이 종종 단일 문자 m으로 잘못 읽는 문자 조합 rn과 같은 일반적인 OCR 대체 오류에 대해 PDF를 검색하십시오. 검색에서 barn이 bam이 되거나 corn이 com이 되는 인스턴스가 발견되면 텍스트가 OCR로 생성됩니다. 포함된 텍스트에는 문자가 시각적으로 모호하지 않기 때문에 이러한 대체 오류가 포함되지 않습니다. 문서의 PDF 검색 가능 품질은 기본 텍스트(OCR 또는 포함)가 눈에 보이는 콘텐츠를 정확하게 나타내는지 여부에 따라 달라집니다.
OCR 텍스트와 포함된 텍스트가 동일한 PDF에 공존하는 경우
단일 PDF에는 다른 페이지 또는 동일한 페이지에 OCR 텍스트와 포함된 텍스트가 모두 포함될 수 있습니다. 계약 패키지에는 내장된 텍스트가 포함된 디지털로 작성된 계약서 본문과 OCR 텍스트가 포함된 스캔 및 OCR 처리된 서명 페이지가 포함될 수 있습니다. 연구 보고서는 디지털 방식으로 생성된 텍스트 페이지와 역사적인 신문 스크랩을 스캔하고 OCR 처리한 사진을 결합할 수 있습니다. 3페이지의 텍스트는 픽셀 단위로 완벽하게 포함된 텍스트입니다. 7페이지의 텍스트는 인식 오류가 있을 수 있는 OCR 텍스트입니다.
이 혼합 콘텐츠 시나리오는 PDF에서 텍스트를 검색하거나 추출하는 모든 사람에게 미묘한 함정을 만듭니다. 포함된 텍스트 페이지의 검색 결과는 정확합니다. OCR 텍스트 페이지의 검색 결과에서는 OCR 엔진이 단어를 잘못 읽은 경우가 누락되거나 OCR 엔진이 유사한 단어로 대체한 경우 잘못된 일치 항목이 반환될 수 있습니다. 혼합 콘텐츠 PDF로 작업할 때 OCR 페이지에서 추출된 텍스트를 사용하기 전에 확인하십시오. 가장 안전한 접근 방식은 OCR 페이지에서 추출된 텍스트가 중요한 목적으로 사용될 때마다 해당 페이지 이미지를 시각적으로 확인하는 것입니다.
사후 OCR 텍스트 품질 개선
PDF에 품질이 낮은 OCR 텍스트가 포함되어 있는 경우 원본 스캔 및 OCR 프로세스가 이미 완료되었기 때문에 이를 개선할 수 있는 옵션이 제한됩니다. 스캔 품질을 소급하여 향상시킬 수는 없습니다. 당신이 할 수 있는 일은 더 나은 엔진으로 PDF를 다시 OCR하는 것입니다. 사용 가능한 최고 해상도로 PDF에서 페이지 이미지를 추출하고 원본 OCR 패스보다 더 정확한 결과를 생성할 수 있는 최신 OCR 엔진을 통해 실행합니다. 이전 OCR 텍스트 레이어를 새 레이어로 교체합니다.
일부 PDF 편집기에서는 텍스트 레이어에서 직접 OCR 오류를 수동으로 수정할 수 있습니다. 보이지 않는 OCR 텍스트를 표시하는 편집 모드에서 PDF를 엽니다. 잘못 인식된 단어를 클릭하고 수정 사항을 입력하세요. 이 수동 수정 프로세스는 몇 페이지에 있는 몇 가지 오류에 대해 실용적입니다. 모든 문단에 인식 오류가 있는 200페이지 문서에는 실용적이지 않습니다. 대규모 OCR 품질 문제의 경우 더 나은 엔진으로 전체 문서를 다시 OCR하는 것이 더 효율적인 접근 방식입니다.
문서 생성을 위해 OCR과 포함된 텍스트 중에서 선택
검색, 색인화 또는 보관할 PDF를 만들 때 스캔과 OCR 중 하나를 선택하는 것과 기본 디지털 PDF를 생성하는 것 중 하나를 선택하는 것은 장기적인 결과를 가져옵니다. 텍스트가 포함된 기본 디지털 PDF는 더 작고 검색 속도가 빠르며 텍스트 정확성을 완벽하게 유지합니다. 스캔하고 OCR 처리한 PDF는 원본 종이 문서 모양을 유지하지만 시간이 지남에 따라 PDF가 복사, 인용 및 참조될 때 인식 오류가 발생할 가능성이 있습니다.
보관 프로젝트의 경우 가장 좋은 방법은 두 형식을 모두 보존하는 것입니다. 시각적 충실도를 위해 고해상도 스캔을 보관 마스터로 유지하세요. 텍스트 검색 및 분석을 위해 다시 입력하거나 수동 수정 기능이 있는 고정밀 OCR을 적용하여 기본 디지털 버전을 생성합니다. 이 이중 형식 접근 방식은 원본 스캔의 신뢰성과 검색 가능한 텍스트의 유용성을 제공합니다. WukongPDF는 스캔한 문서를 검색 가능한 PDF로 변환하기 위한 OCR PDF 처리를 지원하며 결과 OCR 텍스트 레이어는 스캔한 문서를 디지털 작업 흐름에서 사용할 수 있도록 하는 검색 및 복사 기능을 제공합니다.
OCR과 포함된 텍스트 간의 장기적인 신뢰성 격차
OCR로 작성된 PDF는 디지털로 작성된 PDF와 노화 방식이 다릅니다. 디지털로 작성된 PDF를 만든 지 20년 후에 열면 문자 코드가 명확하고 글꼴이 포함되어 있기 때문에 텍스트가 완벽하게 표시됩니다. 생성된 지 20년 후에 열리는 OCR PDF는 원본 스캔의 품질과 당시 사용 가능한 OCR 엔진의 정확성에 따라 달라집니다. 문서가 최신이었을 때는 거의 눈에 띄지 않았던 인식 오류가 원본 종이 문서를 더 이상 확인할 수 없게 되면 심각한 장애물이 됩니다.
장기간 보존할 문서의 경우 OCR 텍스트보다 디지털 소스에 포함된 텍스트를 사용하는 것이 항상 더 좋습니다. 문서가 종이에만 존재하고 스캔해야 하는 경우, 당시 사용 가능한 최고 품질의 스캔 및 OCR 처리에 투자하고 가능한 한 원본 종이 문서를 보존하십시오. 종이 원본은 몇 년 후에야 명백해질 수 있는 OCR 오류에 대한 궁극적인 백업입니다.
OCR PDF 텍스트와 포함된 텍스트를 구별하기 위한 실제 테스트: 단락을 300% 이상 확대하고 문자 가장자리를 확인합니다. OCR 텍스트는 보이는 문자 이미지와 보이지 않는 텍스트 레이어 사이에 약간의 정렬 오류가 나타나는 경우가 많습니다. 문자 모양과 위치가 동일한 글꼴 프로그램에서 나오므로 포함된 텍스트가 완벽하게 정렬되어 렌더링됩니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
