
스캔된 PDF란 무엇이며 기본 PDF와 어떻게 다른가요
스캔 PDF은 스캐너나 휴대폰 카메라를 사용하여 실제 종이 페이지의 이미지를 캡처하여 생성됩니다. PDF의 각 페이지는 원본 문서의 사진입니다. 페이지에 표시되는 텍스트는 이미지의 픽셀로만 존재합니다. PDF 파일에는 실제 텍스트 문자가 저장되어 있지 않습니다. 스캔한 PDF는 기본적으로 각 사진에 텍스트가 포함된 사진 앨범입니다.
스캔한 PDF를 식별하는 가장 빠른 방법은 커서로 페이지의 텍스트를 선택하는 것입니다.
OCR 기술은 검색 가능한 텍스트 레이어를 추가하여 스캔한 PDF와 기본 PDF 사이의 격차를 해소합니다.
디지털 PDF 또는 디지털 PDF라고도 하는 기본 PDF는 소프트웨어 응용 프로그램에서 직접 생성됩니다. Word 문서를 PDF로 내보내거나 스프레드시트를 PDF로 저장하거나 디자인 응용 프로그램에서 PDF를 만들면 결과 파일에는 벡터 그래픽 및 포함된 글꼴과 함께 선택 및 검색 가능한 실제 텍스트 문자가 포함됩니다.
텍스트는 픽셀이 아닌 데이터로 존재합니다. 기본 PDF는 페이지 이미지 모음이 아닌 구조화된 문서입니다.
PDF 형식은 동일한 파일 내에서 두 가지 유형의 콘텐츠를 모두 지원합니다. PDF에는 스캔된 이미지로 구성된 페이지와 기본 디지털 텍스트로 구성된 페이지가 있을 수 있습니다. 이러한 혼합 콘텐츠 시나리오는 디지털 방식으로 생성된 텍스트 페이지와 인쇄된 소스에서 스캔한 부록을 결합한 보고서와 같이 여러 소스에서 문서를 조합할 때 흔히 발생합니다.
스캔한 PDF와 기본 PDF의 실질적인 차이는 문서로 수행할 수 있는 모든 작업에 영향을 미칩니다. 텍스트가 검색 가능한 문자 데이터로 존재하므로 기본 PDF에서 단어를 검색할 수 있습니다. 이미지의 텍스트를 인식하고 보이지 않는 검색 가능한 텍스트 레이어를 추가하는 OCR PDF 기술로 처리되지 않으면 스캔한 PDF를 검색할 수 없습니다. 기본 PDF에서 텍스트를 선택하고 복사할 수 있습니다. 스캔한 PDF에서는 텍스트를 선택할 수 없습니다. PDF 편집기를 사용하여 기본 PDF의 텍스트를 편집할 수 있습니다. 편집할 텍스트 문자가 없기 때문에 스캔한 PDF의 텍스트를 편집할 수 없습니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
PDF가 스캔되었는지 또는 원본인지 확인하는 방법
가장 빠른 테스트는 PDF에서 텍스트를 선택해 보는 것입니다. PDF를 열고 마우스나 손가락으로 단어를 클릭하고 드래그하세요. 드래그할 때 텍스트가 강조 표시되면 PDF에 선택 가능한 기본 텍스트가 포함되어 있는 것입니다. 텍스트를 선택하려고 할 때 아무 일도 일어나지 않으면 페이지가 스캔된 이미지일 가능성이 높습니다. 일부 단어는 강조 표시되지만 다른 단어는 강조 표시되지 않는 경우 PDF에 부분적이거나 손상된 텍스트 레이어가 있을 수 있습니다.
확대/축소 테스트는 또 다른 빠른 확인을 제공합니다. 텍스트 섹션을 300% 또는 400%로 확대합니다. 높은 배율에서도 텍스트가 또렷하고 또렷하게 유지된다면 어떤 크기로든 원활하게 크기가 조정되는 기본 벡터 텍스트일 가능성이 높습니다. 높은 배율에서 텍스트가 픽셀화되고 가장자리가 들쭉날쭉하게 표시되면 스캔된 이미지입니다. 이 시각적 테스트는 벡터 텍스트가 모든 확대/축소 수준에서 부드럽게 렌더링되는 반면, 이미지 기반 텍스트는 확대 시 픽셀 구조를 나타내기 때문에 효과적입니다.
PDF 뷰어 도구는 문서에 텍스트가 포함되어 있는지 여부도 보고할 수 있습니다. Adobe Acrobat의 문서 속성 패널에는 페이지 수와 파일에 검색 가능한 텍스트가 포함되어 있는지 여부가 표시됩니다. 일부 뷰어에는 텍스트 레이어 표시기가 표시됩니다. 문서 분석 도구는 PDF를 스캔하고 기본 텍스트와 이미지 전용 콘텐츠가 포함된 페이지의 비율을 보고할 수 있습니다.
파일 크기는 단서를 제공할 수 있지만 결정적이지는 않습니다. 페이지 이미지로 구성된 스캔한 PDF는 이미지가 텍스트보다 더 많은 저장 공간을 필요로 하기 때문에 일반적으로 동일한 페이지 수의 기본 텍스트 PDF보다 큽니다. 10페이지 분량의 기본 텍스트 PDF는 100~500KB일 수 있습니다. 10페이지 스캔 PDF의 크기는 2~10MB일 수 있습니다. 그러나 고해상도 이미지가 포함된 기본 PDF도 용량이 클 수 있으므로 파일 크기만으로는 신뢰할 수 있는 지표가 아닙니다.
일상 PDF 작업에서 구별이 중요한 이유
검색은 스캔과 기본 구별의 영향을 받는 가장 일반적인 작업입니다. 50페이지 분량의 PDF를 받고 특정 용어에 대한 모든 언급을 찾아야 하는 경우 기본 PDF가 검색 기능을 통해 몇 초 안에 답변을 제공합니다. 스캔한 PDF를 사용하려면 각 페이지를 시각적으로 수동으로 스캔해야 하는데, 이 작업에는 몇 분이 걸리고 누락될 수도 있습니다. 문서 검색 기능은 문서와 상호 작용하는 방식을 변화시킵니다.
다른 문서에서 재사용하기 위한 텍스트 추출에는 기본 텍스트가 필요합니다. 자신의 보고서에서 PDF의 단락을 인용해야 하는 경우 기본 PDF를 사용하면 텍스트를 직접 복사하여 붙여넣을 수 있습니다. 스캔한 PDF를 추출하려면 텍스트를 다시 입력하거나 OCR을 실행해야 합니다. 자주 참조하는 문서의 경우 즉시 복사하여 붙여넣는 것과 수동으로 다시 입력하는 것의 차이는 상당합니다.
시각 장애인이 사용하는 화면 판독기를 포함한 접근성 도구에는 기본 텍스트가 필요합니다. 화면 판독기는 텍스트 문자에 액세스할 수 있으므로 기본 PDF를 소리내어 읽을 수 있습니다. 액세스할 텍스트 문자가 없기 때문에 화면 판독기가 스캔한 PDF를 읽을 수 없습니다. 스캔한 PDF를 액세스 가능하게 만들려면 화면 판독기가 해석할 수 있는 텍스트 레이어를 추가하기 위한 OCR 처리가 필요합니다.
스캔 PDF 형식은 문서를 원본 이미지로만 보면 되는 보관 목적에 완벽하게 적합합니다. 서명된 계약서의 스캔 사본은 서명된 문서의 시각적 기록 역할을 합니다. 텍스트와의 상호 작용, 검색, 복사, 편집 또는 접근성이 필요한 모든 목적을 위해서는 기본 PDF 또는 OCR이 포함된 스캔 PDF가 필요합니다.
스캔한 PDF를 검색 가능한 기본 형식의 PDF로 변환하는 방법
광학 문자 인식은 스캔한 페이지 이미지를 텍스트 레이어가 포함된 검색 가능한 문서로 변환하는 기술입니다. OCR 처리를 지원하는 PDF 도구를 사용하여 스캔한 PDF에서 OCR을 실행합니다. 이 도구는 각 페이지 이미지를 분석하고 텍스트 문자를 인식하며 페이지 이미지 뒤에 보이지 않는 텍스트 레이어를 추가합니다. OCR 후 PDF는 시각적으로 동일해 보이지만 이제 검색이 가능하며 인식된 텍스트를 선택하고 복사할 수 있습니다.
OCR 정확도는 원본 스캔 품질에 따라 달라집니다. 균일한 조명, 평평한 페이지 및 선명한 초점을 갖춘 300DPI의 깨끗한 스캔은 99% 이상의 OCR 정확도를 생성합니다.
그림자, 구부러진 페이지 또는 흐릿한 텍스트가 있는 150DPI의 저해상도 스캔은 정확도가 95% 미만일 수 있으므로 수동 수정이 필요할 수 있습니다. 스캔 품질에 따라 OCR 출력 품질이 결정됩니다.
OCR을 실행한 후 페이지에 표시되는 몇 단어를 검색하여 결과를 확인하세요. 검색 결과가 발견되면 OCR이 성공한 것입니다. 검색에서 명확한 단어가 누락된 경우 OCR이 해당 페이지의 특정 글꼴, 레이아웃 또는 이미지 품질에 어려움을 겪었을 수 있습니다. 설정을 조정하거나 가능한 경우 고품질 스캔으로 OCR을 다시 실행하십시오.
WukongPDF의 OCR PDF 도구는 브라우저에서 스캔한 문서를 처리하고 검색 가능한 텍스트 레이어가 포함된 PDF를 반환합니다. 스캔한 PDF를 업로드하고, OCR을 실행하고, 검색, 텍스트 선택 및 화면 리더 액세스를 지원하는 문서를 다운로드하세요. OCR 프로세스는 문서를 대화형으로 만드는 텍스트 레이어를 추가하는 동시에 원래의 시각적 모양을 유지합니다.
스캔한 PDF와 기본 PDF 간의 파일 크기 차이는 대규모 문서 컬렉션을 처리할 때 특히 중요합니다. PDF로 스캔한 종이 문서를 보관하는 캐비닛은 각 페이지가 전체 이미지인 수만 개의 스캔된 PDF 페이지를 생성할 수 있습니다. 일반적인 300 DPI 회색조 스캔의 경우 페이지당 500KB에서 10,000페이지는 5GB의 저장 공간을 소비합니다. 스캔한 PDF에 OCR을 실행해도 페이지 이미지가 남아 있기 때문에 파일 크기는 줄어들지 않지만 컬렉션을 실제로 사용할 수 있게 만드는 검색 가능한 텍스트 레이어가 추가됩니다.
장기간 보관이 필요한 문서의 경우 PDF/A 형식이 보관 표준입니다. 스캔한 PDF와 기본 PDF 모두 PDF/A로 변환할 수 있습니다. 스캔한 PDF를 PDF/A로 변환하면 보관 메타데이터가 추가되어 이미지 기반 문서로 유지됩니다. PDF/A로 변환된 기본 PDF는 텍스트와 구조적 속성을 유지합니다. PDF/A는 문서의 스캔 성격과 원본 성격을 바꾸지 않습니다. 표준화된 메타데이터를 추가하고 장기 보존성을 향상시키는 구조적 요구 사항을 적용합니다.
스캔한 페이지와 기본 페이지가 혼합된 PDF의 경우 기본 페이지는 그대로 두고 스캔한 페이지에 OCR을 적용합니다. 대부분의 OCR 도구는 특정 페이지 범위를 처리할 수 있으므로 필요한 페이지에서만 OCR을 실행할 수 있습니다. 처리 후 PDF는 원본 페이지의 기본 텍스트를 유지하고 이전의 이미지 전용 페이지에 검색 가능한 텍스트 레이어를 포함하여 전체 문서에서 일관된 검색 가능성을 제공합니다.
인쇄하여 손으로 작성하는 문서의 경우 원본 양식을 스캔한 PDF가 완벽하게 적합합니다. 수신자는 PDF를 인쇄하고 펜으로 빈칸을 채운 다음 실제 사본을 반환하거나 디지털로 다시 스캔합니다. 디지털 방식으로 작성해야 하는 문서의 경우 수신자가 필드에 직접 입력할 수 있으므로 양식 필드가 있는 기본 PDF가 훨씬 우수합니다.
문서를 PDF로 스캔하는 것과 원본 소스 파일에서 기본 PDF를 만드는 것 사이의 선택은 즉각적인 필요성뿐만 아니라 문서의 전체 수명 주기를 고려해야 합니다. 스캔한 계약서 PDF는 검토를 위해 상대방에게 이메일로 보내는 데 적합합니다. 나중에 분쟁 중에 특정 조항을 찾기 위해 해당 계약서를 검색해야 하는 경우 스캔한 PDF의 검색 가능성 부족은 상당한 책임이 됩니다. 문서 생성 시 기본 PDF를 생성하면 스캔에서 유지되지 않는 옵션이 유지됩니다.
최신 스캐닝 소프트웨어에는 자동 OCR 처리가 포함되어 실제 사용 시 스캔한 PDF와 기본 PDF 간의 구분이 모호해지는 경우가 많습니다. 캡처 후 즉시 OCR을 수행하는 휴대폰 앱으로 스캔한 문서는 기술적으로는 스캔한 이미지이지만 기능적으로는 기본 PDF처럼 검색 가능한 PDF를 생성합니다. 이 하이브리드 접근 방식은 스캔의 편리함과 기본 텍스트의 검색 가능성을 결합합니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
