스캔한 PDF를 압축하면 파일 크기가 15MB에서 2MB로 줄어듭니다. 숫자가 좋아 보이네요. 그런 다음 압축된 파일을 열면 원본에서는 또렷하고 선명했던 텍스트가 이제는 부드럽고 흐릿하며 약간 초점이 맞지 않게 보입니다. 압축은 효과가 있었지만 텍스트에 너무 공격적으로 작동하여 이전보다 문서를 읽기가 더 어려워졌습니다.
이는 가장 일반적인 압축 불만 사항이며 대부분의 압축 도구가 전체 페이지를 단일 이미지로 처리하기 때문에 발생합니다. 선명하게 유지해야 하는 텍스트와 더 높은 압축을 견딜 수 있는 배경이나 사진을 구별할 수 없습니다. 압축 중에 텍스트 선명도를 유지하려면 어떤 설정이 텍스트 가독성에 영향을 미치는지 이해하고 사람들이 실제로 읽어야 하는 문서 부분의 우선 순위를 지정하는 압축 접근 방식을 선택해야 합니다.

압축으로 인해 애초에 텍스트가 흐리게 나타나는 이유
PDF 압축은 파일에 포함된 이미지의 해상도를 줄이는 방식으로 작동합니다. 스캔한 PDF의 경우 모든 페이지는 텍스트를 포함한 이미지입니다. 압축 엔진이 해당 페이지 이미지를 300DPI에서 150DPI로 리샘플링하면 각 차원의 픽셀 절반을 버리고 4개 픽셀 중 1개 픽셀만 유지합니다. 글자체의 미세한 가장자리, 소문자 "t"의 가는 가로 획, "c"를 구별하는 미묘한 곡선 "e,"에서; 모두 선명하게 보이도록 버려진 픽셀에 의존합니다. 150DPI에서는 원래 스캔에서 높이가 50픽셀이었던 12포인트 문자의 높이가 이제 25픽셀입니다. 100DPI에서는 높이가 약 17픽셀입니다. 72 DPI에서는 높이가 약 12픽셀로 문자를 인식할 수 있을 만큼 거의 픽셀이 아닙니다.
다운샘플링 알고리즘의 유형도 중요합니다. 주변 픽셀의 평균을 계산하여 새로운 픽셀 값을 계산하는 바이큐빅 다운샘플링은 사진의 부드러운 그라데이션을 유지하지만 글자체의 딱딱한 가장자리를 부드럽게 합니다. 각 블록에서 하나의 픽셀을 선택하고 나머지는 삭제하는 서브샘플링은 가장자리 선명도를 더 잘 유지하지만 들쭉날쭉한 아티팩트가 발생할 수 있습니다. 텍스트가 많은 문서의 경우 너무 낮은 해상도의 바이큐빅 다운샘플링은 사람들이 불평하는 부드럽고 흐릿한 텍스트를 생성하는 조합입니다. 더 나은 접근 방식은 더 높은 대상 해상도(텍스트의 경우 최소 150DPI)를 선택하거나 텍스트와 이미지를 다르게 처리할 수 있는 압축 방법을 사용하는 것입니다.
PDF 압축을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
텍스트가 많은 문서에 적합한 압축 설정 선택
텍스트 가독성이 가장 중요한 스캔 문서의 PDF 압축의 경우 몇 가지 특정 설정을 사용하면 일관되게 좋은 결과를 얻을 수 있습니다. 대상 해상도를 150DPI로 설정합니다. 이는 10포인트 텍스트가 선명하게 유지될 수 있도록 충분한 픽셀 밀도를 유지하는 동시에 파일 크기를 50%~70% 감소시킵니다. 화면에서 읽을 문서의 경우 150DPI 이하로 낮추지 마십시오. 100DPI에서는 10포인트 텍스트가 눈에 띄게 부드러워집니다. 72 DPI에서는 12포인트 텍스트도 품질이 저하되기 시작합니다.
흑백 텍스트 페이지에는 JBIG2 압축을 선택합니다. JBIG2는 흑백 문서 이미지용으로 특별히 설계되었으며 문자 선명도를 유지하면서 텍스트에서 JPEG보다 훨씬 더 나은 압축률을 달성합니다. 반복되는 패턴을 식별하여 작동하며 문자 "e"의 각 인스턴스는 다음과 같습니다. 거의 동일해 보이며 각 패턴을 한 번 저장합니다. 이는 인쇄된 문서에 이상적입니다. 텍스트와 사진 또는 색상 요소가 혼합된 페이지의 경우 중간에서 고품질 설정으로 JPEG2000을 사용하십시오. JPEG2000은 표준 JPEG보다 혼합 콘텐츠를 더 잘 처리하고 동일한 압축 비율에서 눈에 보이는 아티팩트가 더 적습니다.
도구가 지원하는 경우 MRC(혼합 래스터 콘텐츠) 압축을 활성화합니다. MRC는 각 페이지를 레이어로 분리합니다. 즉, 선명도를 위해 고해상도로 유지되는 텍스트 레이어, 보다 적극적으로 압축된 이미지 레이어, 배경 레이어입니다. 압축 엔진에서 사용되는 이 레이어 기반 접근 방식은 텍스트 선명도를 유지하면서 전체 크기를 크게 줄입니다. 텍스트는 무손실 또는 거의 무손실 방식으로 압축되므로 선명한 상태를 유지하며, 배경과 이미지는 압축의 대부분을 흡수합니다.
커밋 전 압축 결과 테스트
압축 후 압축된 파일을 열고 원본과 나란히 비교해 보세요. 100%로 확대하고 동일한 텍스트 단락을 비교해 보세요. 소문자 "e,"를 보세요. "아," 그리고 "s," 가장 세밀한 부분을 가지고 있고 가장 먼저 품질이 저하되는 것입니다. 이러한 문자가 선명해 보이고 내부 모양이 명확하게 정의되어 있으면 압축 설정이 적절합니다. 문자 내부의 닫힌 공간인 카운터가 채워지기 시작하거나 문자 가장자리가 부드러워 보인다면 압축이 너무 공격적이었던 것입니다.
문서가 인쇄될 경우 테스트 페이지를 인쇄하십시오. 프린터는 대부분의 화면보다 높은 300~600 DPI로 렌더링하기 때문에 화면에서는 보이지 않는 압축 아티팩트가 종이에서는 뚜렷하게 나타날 수 있습니다. 150DPI의 모니터에서는 괜찮아 보이는 문서가 300DPI로 인쇄되면 프린터가 누락된 세부 사항을 드러내기 때문에 부드러워 보일 수 있습니다. WukongPDF의 PDF 크기 줄이기 도구는 다양한 압축 수준에서 인쇄된 출력물을 시뮬레이션하는 미리 보기 모드를 제공하므로 압축 설정을 마무리하기 전에 텍스트 가독성을 확인할 수 있습니다.
압축으로 인해 이미 텍스트가 흐려진 경우 수행할 작업
PDF를 압축했는데 텍스트가 흐릿해지고 압축되지 않은 원본 파일이 더 이상 없는 경우 상황은 어렵지만 항상 절망적인 것은 아닙니다. 원래 별도의 텍스트 레이어가 있었던 PDF에 압축이 적용된 경우 압축된 파일에 OCR을 실행하면 검색 가능성이 복원될 수 있지만 원본 텍스트의 시각적 선명도는 복원할 수 없습니다. OCR은 흐릿한 이미지 뒤에 텍스트 레이어를 추가합니다. 이미지가 흐릿하게 남아 있습니다. 별도의 텍스트 레이어가 없는 스캔한 PDF의 경우 유일한 복구 경로는 원본 스캔을 찾거나 실제 문서를 더 높은 해상도로 다시 스캔하여 동일한 압축 실수를 반복하지 않는 것입니다.
이것이 압축되지 않은 원본 파일을 유지하는 것이 가장 중요한 압축 습관인 이유입니다. 압축은 항상 복사본을 생성해야 하며 원본을 덮어쓰지 않아야 합니다. 저장 비용이 저렴합니다. 원본을 삭제하여 절약된 몇 메가바이트의 가치는 흐릿한 압축 사본에서 문서를 다시 만드는 데 필요한 시간보다 훨씬 적습니다. 압축 도구는 업로드된 원본을 그대로 유지하면서 항상 새 파일을 생성합니다. 이 디자인 선택은 원본이 사라진 후에야 압축 설정이 잘못되었음을 깨닫는 매우 일반적인 시나리오를 방지합니다.
이미지 손실 없이 컬러 문서 압축
텍스트와 컬러 이미지가 혼합된 문서에는 두 가지 문제가 있습니다. 텍스트는 가독성을 위해 높은 해상도가 필요하고, 이미지에는 색상 충실도가 필요합니다. 해결책은 동일한 페이지의 다양한 콘텐츠 유형에 다양한 설정을 적용하는 압축 도구를 사용하는 것입니다. WukongPDF는 각 페이지 내의 텍스트 영역과 이미지 영역을 자동으로 감지하고 각각에 적절한 압축을 적용합니다. 텍스트 영역은 더 높은 유효 해상도에서 무손실 또는 거의 무손실 압축을 받습니다. 이미지 영역은 더 낮은 해상도에서 JPEG 또는 JPEG2000 압축을 받습니다. 그 결과 텍스트와 이미지가 모두 보기 좋게 보이는 PDF 품질 출력이 생성되었으며 파일 크기는 압축되지 않은 원본보다 훨씬 작습니다.
중요한 점은 압축 후 텍스트가 흐려지는 것이 불가피한 절충안이 아니라는 것입니다. 문서 내용에 최적화되지 않은 압축 설정으로 인해 발생하는 문제입니다. 텍스트가 많은 스캔에는 사진 앨범과 다른 설정이 필요합니다. 문서에 대한 올바른 설정을 선택하고 항상 원본을 유지하면 문서를 유용하게 만드는 가독성을 희생하지 않고도 압축을 통해 파일 크기를 줄일 수 있습니다.
많은 사람들이 간과하는 마지막 고려 사항 중 하나는 압축 형식이 향후 편집에 미치는 영향입니다. 압축된 PDF에 나중에 OCR, 추가 압축 또는 형식 변환이 필요한 경우 무손실 텍스트 인코딩을 사용하는 150DPI의 적당히 압축된 파일은 손실이 있는 JPEG를 사용하는 72DPI의 심하게 압축된 파일보다 후속 작업에서 훨씬 더 잘 유지됩니다. 손실이 있는 파일을 재압축할 때마다 품질 손실이 가중됩니다. 첫 번째 압축은 거의 눈에 띄지 않을 수 있습니다. 두 번째 방법은 이미 압축된 파일에 적용되어 텍스트를 읽을 수 없을 정도로 저하시킵니다. PDF를 압축할 때 현재 파일 크기뿐만 아니라 향후 파일 작업에 대해 남아 있는 품질 여유 공간에 대해서도 결정하게 됩니다. 오늘 적당한 압축이 이루어지면 내일을 위한 여지가 남습니다. 공격적인 압축은 한 단계로 해당 공간을 소진시킵니다.
PDF 압축을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
