두 개의 PDF가 폴더에 나란히 있습니다. 둘 다 동일한 페이지 수입니다. 둘 다 같은 해에 만들어졌습니다. 두 검색어 모두에 동일한 검색어를 입력합니다. 하나는 거의 즉시 결과를 반환합니다. 다른 하나는 일시 중지되고 회전하는 진행률 표시기를 표시하며 해당 용어가 12페이지에서 발견되었음을 보고하는 데 몇 초가 걸립니다. 이 두 PDF 간의 검색 속도 차이는 무작위가 아닙니다. 이는 PDF 생성 방법, 텍스트 포함 또는 OCR 생성 여부, 글꼴 인코딩 방법, 문서 구조에 검색 최적화 기능이 포함되어 있는지 여부에 따라 결정됩니다. 일부 PDF 검색 가능 문서가 다른 문서보다 검색 속도가 더 빠른 이유를 이해하면 효율적으로 검색하는 PDF를 만들고 주의가 필요한 검색 속도가 느린 문서를 진단하는 데 도움이 됩니다.

PDF 검색이 실제로 작동하는 방식
PDF를 검색할 때 뷰어는 문자 모양을 찾기 위해 보이는 페이지 이미지를 스캔하지 않습니다. PDF 파일에 포함된 텍스트 콘텐츠 스트림을 쿼리합니다. 각 페이지에는 페이지의 문자, 해당 위치 및 문자를 표시하는 데 사용되는 글꼴을 나열하는 하나 이상의 콘텐츠 스트림이 포함되어 있습니다. 검색 기능은 이러한 콘텐츠 스트림을 문자별로 순차적으로 읽어 검색어와 일치하는 항목을 찾습니다. 이 순차 스캔의 속도는 텍스트 데이터가 어떻게 구성되어 있는지에 따라 다릅니다.
텍스트가 일관된 인코딩과 논리적 읽기 순서로 표시되는 잘 구조화된 콘텐츠 스트림이 포함된 PDF는 뷰어가 디스크에서 데이터를 읽을 수 있는 것만큼 빠르게 검색할 수 있습니다. 단일 단락의 텍스트가 비순차적 순서로 여러 스트림 개체에 분산되어 있는 조각난 콘텐츠 스트림이 있는 PDF는 검색 기능이 파일의 여러 부분 사이를 이동하도록 강제하여 검색되기 전에 메모리에서 텍스트를 재조립합니다. 콘텐츠 스트림의 PDF 형식 구조는 검색 속도를 결정하는 주요 요소입니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
검색 성능에 포함된 텍스트와 OCR 텍스트 비교
포함된 텍스트, 즉 워드 프로세서나 레이아웃 응용 프로그램에서 작성하여 PDF에 직접 작성한 텍스트는 일련의 문자 코드로 저장됩니다. 각 문자는 콘텐츠 스트림에서 알려진 위치를 차지합니다. 검색 기능은 스트림을 선형적으로 읽고 일치하는 항목을 효율적으로 찾습니다. OCR PDF 텍스트(스캔한 페이지 이미지에서 광학 문자 인식을 통해 생성된 텍스트)는 다르게 저장됩니다. OCR 엔진은 인식된 각 단어를 페이지의 대략적인 위치에 배치하지만, 콘텐츠 스트림에서는 단어가 엄격한 읽기 순서로 되어 있지 않을 수 있습니다.
OCR 텍스트에는 인식 오류가 포함될 수도 있습니다. OCR 엔진이 다른 문자로 잘못 읽은 문자는 페이지에 보이는 문자가 정확해 보이더라도 검색어와 일치하지 않습니다. OCR 엔진이 잘못된 인식을 출력하여 콘텐츠 스트림에 배치하더라도 계약 검색에서는 c0ntract를 찾지 못합니다. 검색 기능에서는 페이지 이미지가 보이지 않습니다. OCR 텍스트만 보입니다. 해당 텍스트의 오류는 검색 실패로 직접 변환됩니다.
글꼴 인코딩과 검색에 미치는 영향
PDF의 글꼴은 여러 가지 방법으로 인코딩될 수 있으며 인코딩은 검색 속도에 영향을 미칩니다. WinAnsiEncoding 또는 MacRomanEncoding과 같은 표준 인코딩을 사용하는 글꼴은 문자 코드를 표준 글리프에 직접 매핑합니다. 검색 기능은 매핑이 간단하기 때문에 이 텍스트를 빠르게 처리할 수 있습니다. 글꼴 디자이너가 문자 코드를 임의로 할당하는 사용자 정의 인코딩이 있는 글꼴에서는 글꼴 인코딩 테이블의 각 코드를 검색하여 해당 코드가 나타내는 문자를 확인하는 검색 기능이 필요합니다. 이 조회는 모든 문자 비교에 오버헤드를 추가합니다.
동아시아 문자 집합에 사용되는 CID 글꼴은 문자 코드를 CID 값에 매핑한 다음 CID 값을 유니코드에 매핑하는 2단계 인코딩을 사용합니다. CID 인코딩 글꼴의 텍스트를 검색하려면 모든 문자에 대해 이 2단계 매핑을 해결해야 합니다. CID 인코딩 글꼴의 중국어, 일본어 또는 한국어 텍스트가 포함된 PDF는 순전히 추가 인코딩 해상도 단계로 인해 표준 인코딩 글꼴의 영어 텍스트가 포함된 PDF보다 검색 속도가 느립니다. PDF가 생성될 때 선택한 PDF 글꼴 인코딩은 문서의 전체 수명 동안 검색 성능에 영향을 미칩니다.
검색에서 페이지 구조 트리의 역할
태그가 있는 PDF에는 문서 내용을 섹션, 단락, 그림과 같은 논리적 요소로 구성하는 구조 트리가 포함되어 있습니다. 구조 트리는 문서의 로드맵과 함께 검색 기능을 제공합니다. 파일 시작 부분부터 콘텐츠 스트림을 선형적으로 검색하는 대신 검색 기능은 구조 트리를 탐색하여 특정 문서 섹션 내에서 텍스트를 찾을 수 있습니다. 구조 트리는 일반 콘텐츠 스트림에 없는 색인을 제공하므로 태그가 있는 PDF 내 검색이 더 빨라질 수 있습니다.
유통 중인 PDF의 대부분을 구성하는 태그가 없는 PDF에는 이 구조 트리가 없습니다. 검색 기능은 콘텐츠 스트림을 순차적으로 검색하는 것 외에는 선택의 여지가 없습니다. 짧은 문서의 경우 차이가 미미합니다. 수백 또는 수천 페이지에 달하는 문서의 경우 구조 트리의 유무에 따라 거의 즉각적인 검색 결과와 눈에 띄는 지연 사이의 차이가 발생할 수 있습니다. 태그가 있는 PDF를 만드는 것은 PDF 검색 가능 성능에도 도움이 되는 접근성 모범 사례입니다.
PDF에 포함된 검색 색인
일부 PDF 생성 도구는 검색 색인을 PDF 파일에 직접 포함할 수 있습니다. 이 색인은 단어가 나타나는 페이지에 단어를 매핑하는 미리 작성된 조회 테이블입니다. 색인이 포함된 PDF는 검색 기능이 콘텐츠 스트림을 스캔하는 대신 색인을 쿼리하기 때문에 거의 즉시 검색할 수 있습니다. 색인 조회는 단어가 나타나는 페이지 번호를 반환하고 뷰어는 해당 페이지로 직접 이동합니다.
포함된 색인은 파일 크기와 색인 생성 시간을 늘리기 때문에 범용 PDF에서는 일반적이지 않습니다. 검색 속도가 우선시되는 대규모 참조 PDF, 기술 매뉴얼 및 문서 컬렉션에서 가장 일반적으로 발견됩니다. 대부분의 PDF 생성 작업 과정에는 기본적으로 색인 생성이 포함되어 있지 않습니다. 내장된 인덱스가 없는 것이 일반적입니다. 비슷한 크기의 다른 PDF보다 검색 속도가 눈에 띄게 빠른 PDF를 발견하면 내장된 색인이 그 이유일 가능성이 높습니다.
검색 속도를 향상시키기 위해 할 수 있는 일
자주 검색되는 PDF를 생성하는 경우 표준 글꼴 인코딩을 사용하여 태그가 지정된 PDF로 생성하세요. 디자인 요구 사항을 달리 충족할 수 없는 경우가 아니면 사용자 정의 글꼴 인코딩을 피하십시오. PDF에 라틴어가 아닌 텍스트가 포함되어 있는 경우 전체 문서에 대한 인코딩 접근 방식을 적용하기 전에 샘플에서 검색 성능을 테스트하십시오. 작성 설정에 약간의 투자를 하면 문서를 사용하는 모든 사람이 더 빠르게 검색할 수 있습니다.
검색 속도가 느린 기존 PDF의 경우 더 깨끗한 콘텐츠 스트림을 생성하는 최신 엔진을 사용하여 OCR로 생성된 텍스트를 다시 OCR하는 것이 좋습니다. 문서에 현재 태그가 지정되지 않은 경우 태그를 추가할 수 있는 구조 분석 도구를 통해 PDF를 실행합니다. WukongPDF는 소스 문서에서 PDF를 다시 만들지 않고도 기존 PDF의 검색 성능을 향상시킬 수 있는 OCR PDF 재처리 및 문서 태그 지정을 지원합니다.
PDF 생성 날짜와 PDF 생성에 사용된 소프트웨어 버전으로 인해 검색 속도 차이를 설명할 수 있습니다. 최신 PDF 라이브러리의 2024 버전으로 생성된 PDF는 2008 버전의 레거시 도구로 생성된 PDF보다 더 깔끔한 콘텐츠 스트림과 더 효율적인 텍스트 인코딩을 가질 가능성이 높습니다. PDF 형식이 발전했으며 최신 작성 도구가 더 나은 구조의 파일을 생성합니다.
문서 관리 작업 흐름의 일부로 자주 검색되는 PDF의 경우 텍스트를 추출하고 외부 검색 색인을 구축하는 것이 좋습니다. 전체 텍스트 검색 색인이 있는 문서 관리 시스템은 PDF 콘텐츠 스트림이 아닌 색인을 쿼리합니다. 검색 속도는 PDF 내부 구조와 독립적입니다.
PDF에 사용된 글꼴 수는 검색 속도에 영향을 미칩니다. 글꼴이 변경될 때마다 검색 기능에서 새 인코딩 테이블을 로드해야 하기 때문입니다. 두 가지 글꼴을 사용하는 PDF는 20가지 글꼴을 사용하는 PDF보다 검색 속도가 더 빠릅니다. 다른 모든 요소는 동일합니다.
문서의 PDF 검색 가능 성능은 생성 시 글꼴 인코딩, 콘텐츠 스트림 구성, 문서 태그 지정 및 인덱스 포함에 대한 선택에 따라 결정됩니다. 이러한 선택 사항은 문서 작성자에게는 보이지 않지만 문서를 검색하는 사람에게는 즉시 드러납니다.
자주 검색되는 문서 컬렉션의 경우 표준 글꼴 인코딩을 사용하여 잘 구조화되고 태그가 지정된 PDF를 만드는 데 투자하면 사용자가 쿼리를 입력하고 거의 즉각적인 결과를 받을 때마다 이익을 얻을 수 있습니다.
이 문서에서는 이 특정 시나리오에서 PDF 작업을 위한 주요 기술과 고려 사항을 다룹니다. 여기에 설명된 방법은 다양한 도구와 플랫폼에 적용되므로 독자가 자신의 작업 흐름과 기술 환경에 가장 적합한 접근 방식을 선택할 수 있는 유연성을 제공합니다.
설명된 실제 단계는 초기 문제부터 실제 솔루션까지 명확한 경로를 제공합니다. 각 기술은 신뢰성과 접근성을 고려하여 선택되었으며, 독자가 PDF 도구에 대한 이전 경험에 관계없이 일관된 결과를 얻을 수 있도록 보장합니다.
이 문서에 설명된 검색 속도 차이는 PDF 작성 중에 선택한 사항에 따른 직접적인 결과입니다. 이러한 요소를 이해하면 문서 작성자가 더 나은 검색 경험을 제공하는 PDF를 생성할 수 있습니다.
이 문서에 설명된 도구와 기술은 초기 질문부터 다양한 문서와 시나리오에 적용할 수 있는 작업 솔루션에 이르는 실용적인 경로를 제공합니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
