누군가가 펜으로 표시한 인쇄물 더미가 있고 Google Docs에서 직접 작성한 여러 페이지도 있습니다. 모든 것을 전문적이고 일관성 있게 보이는 하나의 PDF 파일로 결합해야 합니다. 스캔한 페이지는 평평한 종이 사진입니다. 디지털 페이지에는 라이브 텍스트가 포함되어 있습니다. 근본적으로 다른 두 가지 유형의 PDF 콘텐츠가 하나의 문서에 함께 존재할 수 있습니까? 짧은 대답은 '그렇다'입니다. 그러나 얼마나 잘 공존하는지는 병합에 접근하는 방법에 따라 다릅니다.
이는 특이한 시나리오가 아닙니다. 정보 및 이미지 관리 협회(Association for Information and Image Management)의 2024년 조사에 따르면 조직의 42%가 여전히 일상 업무 흐름에서 스캔한 문서와 디지털로 생성된 문서를 혼합하여 정기적으로 처리하는 것으로 나타났습니다(AIIM, "State of Intelligent Information Management", 2024). 스캔한 이미지 페이지와 디지털로 탄생한 텍스트 페이지를 모두 포함하는 문서인 하이브리드 PDF는 법률 사무소, 회계 회사, 부동산 중개소 및 학과에서 흔히 볼 수 있는 현실입니다.

PDF 내에서 스캔된 페이지와 디지털 페이지의 차이점
스캔한 페이지와 디지털 페이지를 병합하는 데 주의가 필요한 이유를 이해하려면 파일 수준에서 각 페이지 유형에 실제로 포함된 내용을 아는 것이 도움이 됩니다. 디지털 페이지에는 정확한 위치, 글꼴 참조 및 유니코드 값이 포함된 개별 텍스트 문자가 저장됩니다. 검색 기능은 이러한 문자를 직접 읽을 수 있습니다. 스캔한 페이지는 페이지 크기와 동일한 직사각형 영역을 차지하는 JPEG 또는 JPEG2000 형식의 단일 압축 이미지를 저장합니다. 파일은 해당 이미지가 무엇을 묘사하는지에 대해 아무것도 모릅니다. 텍스트, 사진, 그림일 수 있으며 PDF는 구분되지 않습니다.
이 차이는 실질적인 결과를 가져옵니다. 병합된 하이브리드 PDF에서 일부 페이지는 검색 가능하고 일부 페이지는 검색 가능하지 않습니다. 일부 페이지에는 선택 가능한 텍스트가 있고 일부 페이지는 사진처럼 작동합니다. 페이지당 파일 크기도 크게 다릅니다. 디지털 방식으로 생성된 일반 텍스트 페이지는 30~50KB를 차지할 수 있습니다. 동일한 콘텐츠의 풀 컬러 300DPI 스캔은 500KB~2MB를 차지할 수 있습니다. 20페이지짜리 하이브리드 문서의 범위는 대부분 디지털 파일의 경우 2MB부터 대부분 스캔 파일의 경우 30MB까지 다양합니다. 이러한 변형은 문서를 이메일로 보내거나 파일 크기가 제한된 포털에 업로드할 때 중요합니다.
PDF 병합을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
모든 것을 정리하면서 스캔한 페이지와 디지털 페이지를 병합하는 방법
스캔한 페이지와 디지털 PDF 페이지를 결합하는 실제 프로세스는 다른 PDF 파일 세트를 병합하는 것과 다르지 않습니다. 모든 Merge PDF 도구가 작업을 처리할 수 있습니다. WukongPDF의 병합 도구를 사용하면 순서에 관계없이 파일을 업로드하고, 드래그하여 페이지를 재정렬하고, 결합된 단일 PDF를 다운로드할 수 있습니다. 이 도구는 각 소스 페이지의 원본이 스캐너인지 워드 프로세서인지 상관하지 않습니다. 모든 입력 페이지를 동일하게 처리하고 지정한 순서대로 결합합니다.
더 중요한 고려 사항은 병합 후에 어떤 일이 발생하는지입니다. 최종 문서를 완전히 검색할 수 있으려면 병합 전이나 후에 스캔한 페이지가 OCR 단계를 거쳐야 합니다. 병합하기 전에 OCR을 실행하면 스캔한 각 파일의 텍스트 품질을 개별적으로 확인할 수 있으므로 더 효과적으로 제어할 수 있습니다. 병합 후 OCR을 실행하면 전체 문서를 한 번에 처리하므로 더 편리합니다. 두 가지 접근 방식 모두 작동합니다. 선택은 소스 문서마다 OCR 설정을 다르게 미세 조정해야 하는지 여부에 따라 달라집니다.
페이지 크기 일관성은 모니터링할 가치가 있는 또 다른 세부 사항입니다. 스캔한 페이지는 대개 스캐너 베드에 있는 용지의 물리적 크기(일반적으로 US Letter(8.5 x 11인치))로 기본 설정됩니다. 디지털 페이지는 A4(8.27 x 11.69인치) 또는 원래 응용 프로그램에서 사용한 사용자 정의 크기로 생성되었을 수 있습니다. 크기가 약간 다른 페이지가 동일한 PDF에 나타나면 대부분의 뷰어는 보기 창에 맞게 각 페이지의 크기를 조정하여 변형을 우아하게 처리합니다. 그러나 약간 다른 페이지 크기 사이의 시각적 전환은 스크롤할 때 불편할 수 있습니다. 사용 사례에서 일관성이 중요한 경우 병합 프로세스 중에 모든 페이지를 단일 크기로 표준화하는 것이 좋습니다.
하이브리드 PDF가 의미 있는 경우와 그렇지 않은 경우
하이브리드 PDF는 여러 일반적인 상황에서 실용적인 솔루션입니다. 법률 전문가는 정기적으로 디지털 초안 계약서를 스캔한 증거물 및 증거 문서와 결합합니다. 부동산 중개인은 디지털 방식으로 생성된 제안을 스캔한 검사 보고서 및 공개 양식과 병합합니다. 회계사는 컴퓨터로 생성된 재무제표를 스캔한 영수증 및 송장과 함께 묶습니다. 이러한 각 경우에 하이브리드 PDF는 목적을 달성합니다. 즉, 누군가가 열고 스크롤하고 처음부터 끝까지 검토할 수 있는 하나의 체계적인 파일을 생성하는 것입니다.
그러나 하이브리드 PDF가 부족한 상황이 있습니다. 수신자가 전체 문서에서 텍스트를 검색해야 하는 경우 스캔된 페이지는 OCR 처리되지 않는 한 검색 기능에 표시되지 않습니다. 수신자가 페이지의 텍스트를 복사하여 붙여넣어야 하는 경우 스캔한 페이지는 해당 테스트에 실패합니다. 문서가 법원 전자 제출 시스템이나 문서 관리 플랫폼과 같이 자동화된 텍스트 추출이나 전체 텍스트 색인화를 수행하는 시스템에 제출되는 경우 스캔되지 않은 페이지는 해당 시스템에서 비어 있거나 오류로 가득 찬 결과를 생성합니다.
이러한 위험이 높은 시나리오의 경우 병합하기 전에 스캔한 모든 페이지에서 OCR을 실행하는 것은 선택 사항이 아니라 필수입니다. 완전히 검색 가능한 하이브리드 PDF는 완전한 디지털 PDF와 거의 구별되지 않습니다. 남은 유일한 차이점은 스캔한 페이지는 확대할 때 텍스트가 리플로우되지 않지만 디지털 페이지는 생성 방법에 따라 리플로우될 수 있다는 것입니다. 가장 실용적인 목적을 위해 스캔한 모든 페이지에 OCR이 포함된 잘 실행된 하이브리드 PDF는 순수 디지털 문서와 동일한 사용자 경험을 제공합니다.
스캔 콘텐츠와 디지털 콘텐츠를 혼합할 때 파일 크기 관리
파일 크기는 하이브리드 PDF에 대해 사람들이 가장 먼저 알아차리는 요소이지만 긍정적인 측면은 아닙니다. 3페이지가 300 DPI 컬러 스캔이고 7페이지가 일반 디지털 텍스트인 10페이지 문서는 10MB를 쉽게 초과할 수 있습니다. 해당 문서를 이메일로 보내야 하는 경우 많은 이메일 서버는 25MB의 첨부 파일 제한을 적용하며, 모바일 데이터 연결을 사용하는 수신자는 크기의 일부일 수 있는 콘텐츠에 비해 큰 파일을 다운로드하는 것을 좋아하지 않을 것입니다.
여러 기술을 사용하여 하이브리드 PDF의 파일 크기를 제어할 수 있습니다. 컬러 대신 흑백 또는 회색조로 스캔하면 텍스트가 많은 문서의 경우 페이지당 파일 크기가 약 60% ~ 80% 줄어듭니다. 스캔 해상도를 300DPI에서 200DPI로 줄이면 파일 크기가 약 절반으로 줄어들면서 여전히 읽기 쉬운 텍스트와 허용 가능한 OCR 결과에 대한 충분한 세부 정보를 제공합니다. 병합된 PDF에 마지막 단계로 압축을 적용하면 전체 크기를 더욱 줄일 수 있습니다. 스캔된 PDF 페이지는 스캔한 이미지에 화면 보기 또는 인쇄에 필요한 것보다 훨씬 더 많은 픽셀 데이터가 포함되어 있는 경우가 많기 때문에 특히 압축의 이점을 누릴 수 있습니다. WukongPDF의 압축 도구는 눈에 띄는 품질 손실 없이 하이브리드 PDF를 50%에서 70%까지 줄일 수 있어 이메일 서버에서 반송되는 파일과 통과하는 파일의 차이를 만듭니다.
단계: 깔끔한 하이브리드 PDF 만들기
하이브리드 PDF를 작성하는 일관된 접근 방식은 매번 즉석에서 작업하는 것보다 더 나은 결과를 생성합니다. 색상이 특별히 필요한 경우를 제외하고 모든 실제 페이지를 회색조로 300DPI로 스캔하는 것부터 시작하세요. 단일 결합 스캔이 아닌 개별 PDF 파일로 저장하십시오. 그런 다음, 스캔한 각 파일을 열고 페이지가 똑바로 되어 있고 읽을 수 있는지 확인하세요. 최종 문서를 검색하려면 스캔한 파일에 OCR을 실행하세요.
디지털 페이지를 수집하세요. 여러 파일에 분산되어 있는 경우 먼저 병합하세요. 이제 스캔한 PDF 배치 하나와 디지털 PDF 배치 하나, 이렇게 두 개의 깔끔한 세트가 있어야 합니다. 병합 도구를 사용하여 올바른 순서로 결합하세요. 브라우저 기반 병합 인터페이스는 업로드된 모든 페이지를 드래그할 수 있는 썸네일로 표시하므로 스캔한 페이지와 디지털 페이지를 순서대로 빠르고 시각적으로 정렬할 수 있습니다.
병합 후 빠른 품질 검사를 수행합니다. 모든 페이지를 스크롤합니다. 회전된 것으로 나타나는 페이지, 스캔으로 인해 내용의 일부가 잘린 페이지, 텍스트가 너무 희미해서 읽기 어려운 페이지를 찾으십시오. 소스에서 문제를 수정하고 필요한 경우 다시 병합하세요. 스캔한 페이지에 나타나는 몇 가지 알고 있는 단어에 대해 Ctrl+F 검색 테스트를 실행하세요. 검색 결과가 발견되면 OCR이 올바르게 작동하는 것입니다. 그렇지 않은 경우 문서를 공유할 준비가 되기 전에 스캔한 페이지에 OCR을 다시 통과해야 합니다.
마지막으로 파일 크기를 확인하세요. 문서가 이메일로 전송될 예정이라면 10MB 미만으로 유지하는 것이 좋습니다. 이를 초과하는 경우 압축 단계를 거쳐 다시 확인하십시오. 이러한 확인 단계에 소요되는 몇 분의 추가 시간은 고객, 동료 또는 법원 서기가 귀하가 보낸 문서를 사용할 수 없다고 말하는 것보다 훨씬 덜 고통스럽습니다.
PDF 병합을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
