고해상도 사진, 차트, 로고 및 장식 이미지로 가득 찬 PDF는 텍스트 중심 작업 흐름에 적합하지 않을 수 있습니다. 단어만 필요한 경우 모든 PDF 이미지을 제거하고 텍스트 전용 버전을 내보내면 문서의 텍스트 내용만 포함된 매우 작은 파일이 생성됩니다. 문제는 결과 텍스트 전용 출력이 완전하고 의도한 목적에 사용할 수 있는지 여부입니다.
짧은 대답은 텍스트가 선택 가능한 문자로 존재하는 텍스트 기반 PDF의 경우 '예'입니다. 텍스트가 이미지의 일부인 스캔한 PDF의 경우 이미지를 제거하면 텍스트를 포함한 모든 것이 제거됩니다. 주요 차이점은 텍스트와 이미지가 별도의 레이어인 기본 텍스트 PDF와 전체 페이지가 텍스트 레이어가 없는 그림인 이미지 기반 PDF 사이에 있습니다.
PDF를 텍스트로 추출하면 텍스트 내용을 유지하면서 이미지가 제거됩니다. 텍스트가 기본 의미를 전달하고 이미지가 보충적인 문서의 경우 텍스트 전용 출력을 완벽하게 사용할 수 있습니다. 의료 스캔이나 건축 도면 등 이미지가 필수 정보를 전달하는 문서의 경우 텍스트만 출력하면 중요한 콘텐츠가 손실됩니다.
WukongPDF의 PDF 처리 도구에는 이미지 스트리핑 및 텍스트 추출 기능이 포함되어 있습니다.

기본 텍스트와 이미지 기반 PDF의 차이점
기본 텍스트 PDF는 텍스트를 페이지에 위치한 문자 코드로 저장합니다. 이미지는 텍스트 블록 사이에 겹쳐지거나 배치되는 별도의 개체입니다. 기본 텍스트 PDF에서 이미지를 제거하면 텍스트는 그대로 유지되고 완전히 읽을 수 있습니다. 제목, 단락, 페이지 나누기와 같은 문서 구조는 유지됩니다. 장식적이고 설명적인 이미지만 사라집니다.
이미지 기반 PDF는 전체 페이지를 일반적으로 스캐너나 스크린샷의 래스터 이미지로 저장합니다. 보존할 텍스트 문자가 없습니다. 이미지 기반 PDF에서 이미지를 제거하면 모든 내용이 제거되어 빈 문서가 생성됩니다. OCR 처리된 스캔 PDF의 경우 이미지 뒤에 보이지 않는 텍스트 레이어가 있습니다. 이미지 스트리핑은 눈에 보이는 스캔 페이지를 제거하지만 인식 오류가 포함될 수 있는 OCR 텍스트를 보존합니다.
보유하고 있는 PDF 유형을 확인하려면 PDF 리더에서 PDF를 열고 텍스트 단어를 선택해 보십시오. 개별 문자를 선택할 수 있는 경우 PDF는 기본 텍스트이며 이미지 제거를 통해 텍스트가 유지됩니다. 클릭하여 전체 페이지를 하나의 큰 이미지 블록으로 선택하는 경우 PDF는 이미지 기반이며 이미지를 제거하면 아무 것도 남지 않거나 OCR 텍스트 레이어만 남습니다.
PDF 압축을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
방법 1: Acrobat Pro PDF Optimizer를 사용하여 이미지 제거
Acrobat Pro에서 PDF를 열고 파일, 다른 이름으로 저장, 최적화된 PDF로 이동합니다. PDF 최적화 대화 상자의 왼쪽 패널에서 개체 버리기를 클릭합니다. 모든 이미지 삭제라고 표시된 상자를 선택하십시오. 정리에서 사용하지 않는 개체 제거를 선택합니다. 확인을 클릭하고 최적화된 파일을 새 이름으로 저장합니다. Acrobat은 파일을 처리하고 모든 래스터 이미지 개체를 제거합니다.
실제로 결과적으로 파일 크기가 크게 줄어들 수 있습니다. 문서가 주로 이미지가 포함된 텍스트인 경우 고해상도 사진이 포함된 20MB PDF는 100KB 미만으로 줄어들 수 있습니다. 최적화된 파일을 열고 모든 페이지를 스크롤하여 모든 텍스트 콘텐츠가 존재하고 읽을 수 있는지 확인하세요. 이미지가 삭제된 페이지 영역을 확인하세요. 이전에 이미지가 차지했던 공간이 이제 비어 있기 때문에 레이아웃이 약간 바뀔 수 있습니다.
벡터 그래픽이 아닌 이미지로 저장된 차트 등 필수 콘텐츠가 이미지와 함께 제거된 경우 작업을 취소하고 보다 선택적인 접근 방식을 사용하세요. 모든 이미지를 삭제하는 대신 이미지를 크게 압축하거나 제거된 내용을 설명하는 자리 표시자 텍스트로 바꾸세요.
방법 2: 프로그래밍 방식의 텍스트 추출
PyMuPDF 및 pdfplumber와 같은 Python 라이브러리는 기본적으로 이미지를 무시하면서 텍스트를 추출합니다. 추출에서는 텍스트 레이어만 읽어서 이미지 데이터 없이 깨끗한 텍스트 스트림을 생성합니다. 추출된 텍스트는 편집을 위해 .txt 파일로 저장하거나 새로운 텍스트 전용 PDF로 제공할 수 있습니다. 프로그래밍 방식의 접근 방식은 스크립트 가능하고 반복 가능하며 여러 파일의 일괄 처리를 처리합니다.
OCR 텍스트 레이어가 있는 스캔한 PDF의 경우 프로그래밍 방식 추출은 OCR 텍스트를 읽습니다. 품질은 전적으로 OCR 정확도에 따라 달라집니다. 최신 OCR을 사용하여 깔끔하게 스캔한 문서는 99% 정확한 텍스트를 생성할 수 있습니다. 오래된 OCR을 사용하여 제대로 스캔되지 않은 문서는 상당한 수동 수정이 필요한 텍스트를 생성할 수 있습니다. 추출에는 텍스트 레이어에 있는 모든 OCR 오류가 포함됩니다.
추출 후 품질 검증
이미지를 제거하거나 텍스트를 추출한 후 사용하기 전에 출력 품질을 확인하세요. 추출된 텍스트의 단어 수를 원본 문서의 수동 추정치와 비교합니다. 심각한 불일치는 콘텐츠가 손실되었음을 의미합니다. 원본에 나타나는 알려진 용어를 검색하여 해당 용어가 출력에 있는지 확인합니다. 각 주요 섹션의 첫 번째 문단과 마지막 문단을 검토하여 완전성을 확인하세요.
문서 워크플로의 경우 법적 서류나 재무 보고서와 같이 텍스트 정확성이 중요한 문서의 경우 두 번째 검토자가 추출된 텍스트를 원본 PDF와 비교하여 무작위로 검사하도록 합니다. 99% 정확한 추출이라도 100단어당 1개의 오류를 의미하므로 정밀한 문서에서는 허용되지 않을 수 있습니다. 검증 패스는 자동화된 품질 검사에서 놓친 추출 오류를 포착합니다.
| 문서 유형 | 탈거해도 안전합니까? | 대체 |
|---|---|---|
| 법적 개요 | 예, 텍스트가 기본입니다 | 필요 없음 |
| 차트로 보고 | 아니요, 차트에는 데이터가 포함되어 있습니다. | 스트립 대신 압축 |
| 스캔한 문서 | 아니요, 콘텐츠를 스캔합니다. | 먼저 OCR을 수행한 다음 텍스트를 추출합니다. |
PDF에서 이미지를 제거하는 것은 텍스트 내용이 주요 가치이고 이미지가 부수적인 경우에 적합합니다. 결과 텍스트 전용 파일은 훨씬 더 작고, 완전히 검색 가능하며, 텍스트 분석, 번역 또는 컨텐츠 용도 변경이 가능합니다. 이미지 제거 결정은 텍스트만으로 문서의 본질적인 의미를 전달하는지 확인한 후에 이루어져야 합니다.
문서 작업 흐름의 경우, 이미지와 텍스트가 함께 작동하는 문서의 경우 전체 PDF를 유지하고 제거보다는 압축을 통해 최적화하세요. 압축된 PDF는 배포용 파일 크기를 줄이면서 텍스트와 이미지 간의 시각적 관계를 유지합니다.
이미지 스트리핑 후 PDF 레이아웃은 어떻게 되나요?
일반적인 작업 과정에서 이미지가 제거되면 페이지에서 해당 이미지가 차지했던 공간이 비어 있게 됩니다. 이미지를 감싸는 텍스트가 빈 공간으로 리플로우될 수 있습니다. 이미지 셀이 포함된 테이블에는 빈 셀이 있습니다. 특정 이미지 배치를 중심으로 디자인된 페이지 레이아웃은 어색해 보일 수 있습니다. 제거된 PDF는 시각적 디자인이 아닌 콘텐츠에 최적화되어 있습니다.
레이아웃 무결성이 중요한 문서의 경우 이미지를 완전히 제거하는 대신 자리 표시자 텍스트로 바꾸는 것이 좋습니다. 이미지 제거 등의 캡션: 각 이미지 대신 제품 사진을 삽입할 수 있습니다. 자리 표시자는 시각적 콘텐츠가 의도적으로 제거되었음을 인식하면서 레이아웃 구조를 유지합니다.
이미지 스트리핑 전 OCR을 사용하여 텍스트 레이어 생성
문서 처리 시 텍스트 레이어가 없는 스캔한 PDF의 경우 이미지 제거 전에 OCR을 실행하면 제거 프로세스에서 보존되는 텍스트 데이터가 생성됩니다. OCRmyPDF는 단일 명령으로 스캔한 PDF에 텍스트 레이어를 추가할 수 있습니다. OCR 처리 후 PDF에는 보이는 스캔 이미지와 보이지 않는 텍스트 레이어가 모두 포함됩니다. 이미지를 제거하면 인식된 텍스트는 유지하면서 스캔한 페이지가 제거됩니다.
실제로 OCR 품질은 제거된 출력의 유용성을 직접적으로 결정합니다. OCR 정확도가 99%인 문서는 가끔 오류가 있지만 사용 가능한 텍스트를 생성합니다. 정확도가 80%인 문서는 상당한 수동 수정이 필요한 텍스트를 생성합니다. 스캔한 문서에서 이미지 제거를 시작하기 전에 OCR을 실행하고 샘플 페이지의 텍스트 품질을 평가하십시오.
스트리핑 대신 이미지 압축
이미지를 완전히 제거하면 귀중한 콘텐츠가 손실되는 문서의 경우 공격적인 이미지 압축이 중간 지점을 제공합니다. 높은 JPEG 압축을 사용하여 이미지 크기를 72 DPI로 축소하면 이미지 인식을 유지하면서 20MB PDF를 2~3MB로 줄일 수 있습니다. 압축된 이미지는 품질이 낮지만 여전히 시각적 정보를 전달합니다.
압축과 선택적 이미지 제거를 결합하면 유연성이 극대화됩니다. 콘텐츠의 중심이 되는 다이어그램, 사진 등 필수적인 페이지에는 이미지를 유지하고, 정보 제공 목적이 아닌 페이지에서는 장식 이미지를 제거합니다. 하이브리드 접근 방식은 더 많은 수동 작업이 필요하지만 품질과 크기의 균형이 가장 잘 맞습니다.
텍스트 전용 PDF 내보내기는 콘텐츠를 텍스트 분석 파이프라인에 공급하고, 모바일 읽기를 위한 경량 버전을 만들고, 이미지가 가치를 추가하지 않고도 비용을 증가시키는 번역용 문서를 준비하는 등 특정 사용 사례에 적합합니다. 이러한 각 사용 사례에서 텍스트는 제품이고 이미지는 폐기할 수 있는 포장입니다.
텍스트 전용 버전을 읽는 미래의 독자가 시각적 콘텐츠가 의도적으로 제거되었음을 이해할 수 있도록 이미지 제거 결정을 문서화해야 합니다. 문서 속성이나 표지에 간략한 메모를 남겨두면 텍스트 버전과 원본을 비교할 때 혼란을 피할 수 있습니다.
대부분의 도구에서 텍스트 전용 PDF 내보내기는 특정 요구에 맞는 특수 도구입니다. 이는 범용 최적화가 아닙니다. 대부분의 문서에서는 이미지 제거보다 압축이 더 나은 첫 번째 단계입니다. 텍스트가 유일하게 중요한 콘텐츠이고 문서 목적이 텍스트로만 제공되는 경우 이미지 제거를 예약하세요.
이미지 스트리핑의 기능과 한계를 이해하면 올바른 이유로 올바른 문서에 적용되어 의도하지 않은 콘텐츠 손실 없이 의도한 목적에 맞는 출력을 생성할 수 있습니다. 텍스트 전용 PDF는 특정 용도에 적합하므로 문서 유형 및 용도에 따라 선택적으로 적용해야 합니다.
PDF 압축을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
