PDF가 이메일로 도착합니다. 열어보면 인쇄된 문서처럼 보이는 것이 보입니다. 텍스트가 있고 형식이 정확합니다. 하지만 커서로 텍스트를 선택할 수 있나요? 아니면 커서가 마치 사진인 것처럼 텍스트 위로 지나갈 수 있나요? 답변에 따라 PDF가 종이를 스캔하여 생성되었는지 아니면 디지털 소스에서 생성되었는지가 결정되며, 파일 작업 방법에 대한 모든 것이 결정됩니다.
텍스트를 클릭하고 커서가 텍스트를 선택하는지 아니면 무시하는지 관찰하면 1초 안에 질문에 대한 답을 얻을 수 있습니다.
PDF가 스캔되었는지 또는 디지털 방식으로 생성되었는지 확인하려면 선택 가능한 텍스트를 확인하고, 파일 구조를 검사하고, 스캔의 숨길 수 없는 시각적 아티팩트를 찾는 것이 포함됩니다. WukongPDF의 OCR PDF 도구는 스캔한 문서를 검색 가능하게 만들 수 있으며 아래의 스캔 PDF 식별 단계는 우선 OCR이 필요한지 여부를 알려줍니다.

텍스트 선택 테스트
PDF를 열고 텍스트 선택 도구를 사용하여 텍스트 단어를 선택해 보십시오. 커서가 단어를 문자별로 강조 표시하면 PDF에 선택 가능한 텍스트가 포함되어 있고 디지털로 생성되었거나 이미 OCR된 것입니다. 커서가 개별 문자를 강조 표시하지 않고 전체 영역에 선택 직사각형을 그리는 경우 페이지는 이미지이고 PDF는 스캔을 통해 생성된 것입니다.
텍스트 선택 테스트는 단일 페이지 검사에 대해 빠르고 확실합니다. 여러 페이지로 구성된 문서의 경우 처음, 중간, 끝에서 몇 페이지를 테스트해 보세요. 일부 PDF에는 디지털 페이지와 스캔된 페이지가 혼합되어 있습니다. 일반적으로 디지털로 작성된 자기 소개서와 스캔한 첨부 파일이 있습니다. 각 페이지의 텍스트 선택 테스트를 통해 어떤 페이지가 어떤 페이지인지 알 수 있습니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
단서의 파일 크기 및 페이지 수 확인
각 페이지가 전체 페이지 이미지이기 때문에 스캔한 PDF는 일반적으로 페이지 수가 동일한 디지털 PDF보다 큽니다. 300DPI로 스캔한 10페이지 PDF의 크기는 5~15MB인 경우가 많습니다. 동일한 내용을 담은 10페이지 디지털 PDF의 크기는 100-500KB일 수 있습니다. 파일 크기 차이는 파일을 열기 전에도 빠르게 알 수 있습니다.
스캔한 PDF에는 내부 기능도 적은 경향이 있습니다. 북마크, 하이퍼링크, 내장 글꼴, 기본 파일 속성 이외의 메타데이터는 없습니다. 문서 속성을 열고 글꼴 탭을 확인하세요. 모든 내용이 이미지이므로 스캔한 PDF에는 글꼴이 나열되지 않습니다. 디지털 PDF에는 문서에 사용된 글꼴이 나열되어 있습니다.
생성 방법에 대한 파일 속성 확인
문서 속성에는 PDF를 만든 응용 프로그램이 포함되는 경우가 많습니다. Microsoft Word에서 Adobe Acrobat으로 만든 PDF는 디지털일 가능성이 높습니다. Canon 스캐너 드라이버 또는 HP Scan으로 생성된 PDF가 스캔되었습니다. OCR 응용 프로그램으로 생성된 PDF는 검색이 가능하도록 처리된 스캔 문서일 수 있습니다.
문서 속성의 생산자 필드는 생성 응용 프로그램에 의해 설정되며 변경되거나 스푸핑될 수 있으므로 항상 신뢰할 수 있는 것은 아닙니다. 생산자 정보와 텍스트 선택 테스트 및 글꼴 확인을 결합하여 자신감 있는 결정을 내리세요. 동일한 결론을 가리키는 세 가지 독립적인 테스트는 신뢰할 수 있습니다.
| 테스트 | 디지털 PDF 결과 | 스캔된 PDF 결과 |
|---|---|---|
| 텍스트 선택 | 커서는 개별 문자를 강조 표시합니다. | 커서가 이미지 위에 선택 직사각형을 그립니다. |
| 파일 크기(10페이지) | 100~500KB | 5~15MB |
| 속성의 글꼴 탭 | 포함된 글꼴을 나열합니다. | 비어 있음, 글꼴 없음 |
| 생산자 분야 | 워드, 아크로뱃, 크롬 | 스캐너 드라이버, 이미징 소프트웨어 |
스캔의 시각적 결함 찾기
텍스트 영역을 400%로 확대합니다. 스캔한 PDF에는 이미지 캡처의 특징적인 아티팩트가 표시됩니다. 즉, 문자 가장자리가 약간 흐려지고, 스캐너 조명으로 인해 페이지 전체가 고르지 않게 어두워지고, 스캐너 유리에 희미한 선이나 반점으로 나타나는 먼지 얼룩이나 머리카락 자국이 나타납니다. 디지털 PDF는 모든 확대/축소 수준에서 선명한 문자 가장자리를 표시합니다.
양면 페이지로 스캔한 PDF에는 용지 반대편에서 희미하게 반전된 텍스트가 번져 나오는 잔상이 나타날 수 있습니다. 디지털 PDF에는 용지 불투명도에 대한 개념이 없기 때문에 이는 스캔의 확실한 신호입니다. 고스팅은 기본 텍스트 뒤에 텍스트의 회색 그림자로 나타나며, 기본 텍스트가 드문드문 있는 영역에서 가장 잘 보입니다.
추가 단서를 위해 PDF 메타데이터 필드 사용
문서 속성을 통해 액세스할 수 있는 PDF 메타데이터 필드를 통해 문서의 원본을 확인할 수 있습니다. Annual-Report-2025-Final.docx와 같은 원본 문서 파일 이름이 포함된 제목 필드는 PDF가 해당 Word 파일에서 생성되었음을 나타냅니다. 빈 제목 필드 또는 PDF 파일 이름과 일치하는 제목은 중립입니다. Microsoft Word 또는 Google Docs가 나열된 작성자 필드는 디지털 출처를 나타냅니다.
생성 날짜 및 수정 날짜 필드는 타임라인 단서를 제공할 수 있습니다. 같은 날짜에 생성되고 수정된 PDF는 몇 분 안에 서로 직접 디지털 내보내기를 제안합니다. 생성 날짜로부터 몇 년 후 수정 날짜가 있는 PDF는 OCR 처리되었거나 처리되었을 수 있습니다. 메타데이터는 문서의 기록을 말하며 해당 기록은 스캔이 관련되었는지 여부를 보여줍니다.
PDF 유형을 알고 나면 해야 할 일
검색 가능해야 하는 스캔한 PDF의 경우 OCR을 실행하여 텍스트 레이어를 추가하세요. OCR 프로세스는 페이지 이미지의 텍스트를 인식하고 그 뒤에 선택 및 검색 가능한 텍스트를 추가합니다. 시각적인 모습은 변하지 않습니다. PDF에는 검색 기능과 복사-붙여넣기 기능이 추가되었습니다.
스캔한 것처럼 보여야 하는 디지털 PDF(일반적으로 공식적인 문서 복제를 위해)의 경우 이미지로 변환하거나 다시 복원할 필요가 없으며 품질이 저하됩니다. 디지털 PDF는 이미 최적의 형식을 갖추고 있습니다. 텍스트를 이미지로 변환하는 처리는 가치를 추가하지 않고 품질을 저하시킵니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
