Tips & Tricks

PDF를 OCR하고 원본 페이지 레이아웃을 그대로 유지하는 방법

스캔한 문서에서 OCR PDF을 실행하면 텍스트가 추출되지만, 원본을 읽을 수 있게 만든 시각적 구조가 출력에서 제거되는 경우가 많습니다. 제목은 일반 단락이 되고, 열은 단일 텍스트 스트림으로 축소되며, 표는 뒤죽박죽된 조각으로 분해됩니다. OCR 후 원본 페이지 레이아웃을 그대로 유지한다는 것은 인식된 텍스트가 해당 위치에 유지되어 읽기 순서, 열 구조 및 문서에 의미를 부여하는 공간 관계를 유지한다는 의미입니다. 이를 위해서는 처리 후가 아니라 처리 전에 올바른 OCR 설정과 출력 형식을 선택해야 합니다.

How to OCR a PDF and Keep the Original Page Layout Intact

OCR 레이아웃 보존 작동 방식

OCR 엔진은 스캔한 페이지를 두 가지 단계로 처리합니다. 첫 번째 단계에서는 페이지 이미지를 분석하여 영역, 텍스트 열, 이미지, 표, 헤더와 같은 콘텐츠 블록을 식별합니다. 두 번째 단계에서는 각 영역 내에서 문자 인식을 실행합니다. 레이아웃 보존 OCR 접근 방식은 인식된 모든 단어의 공간 좌표를 유지하여 텍스트 내용뿐만 아니라 페이지에서 텍스트가 나타나는 위치도 기록합니다. 이러한 좌표는 문서의 읽기 순서와 시각적 계층 구조를 정의합니다.

레이아웃 보존이 활성화되면 OCR 출력은 PDF 내의 원본 스캔 이미지 위에 보이지 않는 텍스트 레이어를 직접 포함합니다. 인식된 각 단어는 스캔에서 소스 문자의 정확한 픽셀 위치에 위치합니다. 이는 문서를 볼 때 원본과 동일하게 보이지만 그 아래의 텍스트는 화면 판독기에서 선택, 검색 및 액세스할 수 있음을 의미합니다. 스캔된 PDF은 원본 스캔의 시각적 충실도와 디지털로 생성된 파일의 텍스트 기능을 갖춘 하이브리드 문서가 됩니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

올바른 OCR 출력 모드 선택

대부분의 OCR 도구는 최소한 세 가지 출력 모드를 제공하며, 이들 중 하나를 선택하면 레이아웃이 유지되는지 여부가 결정됩니다. 검색 가능한 이미지 모드는 스캔한 원본 페이지를 보이는 레이어로 유지하고 그 아래에 보이지 않는 텍스트 레이어를 추가합니다. 시각적 페이지가 변경되지 않기 때문에 레이아웃이 완벽하게 유지됩니다. 텍스트 및 이미지 모드는 인식된 텍스트와 추출된 이미지가 원래 레이아웃에 가깝게 재배치된 새 페이지를 만듭니다. 이 모드는 레이아웃을 부분적으로 유지하고 간단한 단일 열 문서에 적합하지만 복잡한 다중 열 페이지는 약간 이동할 수 있습니다.

텍스트 전용 모드는 모든 이미지와 서식을 삭제하고 레이아웃 정보가 없는 일반 텍스트 스트림을 생성합니다. 레이아웃이 중요한 경우에는 이 모드를 완전히 피해야 합니다. PDF 품질과 레이아웃 충실도가 모두 중요한 문서의 경우 검색 가능한 이미지 모드가 최상의 균형을 제공합니다. 원본 이미지 데이터가 남아 있기 때문에 파일 크기는 텍스트 전용 내보내기보다 커지지만 원본 시각적 형식으로 읽거나 공유하거나 보관할 문서의 경우에는 절충할 가치가 있습니다.

다중 열 및 복잡한 레이아웃 처리

여러 열로 구성된 문서는 페이지 전체에서 읽기 순서가 지그재그로 되어 있기 때문에 OCR 레이아웃 보존에 있어 가장 어려운 과제를 제시합니다. 2열로 구성된 학술 논문에서는 오른쪽 열의 맨 위로 다시 점프하기 전에 왼쪽 열 아래까지 끝까지 읽으려면 OCR 엔진이 필요합니다. 적절한 영역 감지가 없으면 OCR 출력은 두 열의 줄을 인터리브하여 다른 모든 줄이 다른 열에 속하는 의미 없는 텍스트를 생성할 수 있습니다.

최신 OCR 엔진은 텍스트 블록 사이의 간격을 분석하여 열 경계를 식별하는 영역 감지 알고리즘을 사용합니다. 여러 열로 구성된 문서에서 OCR을 실행하기 전에 도구가 열 감지 또는 자동 영역 설정을 제공하는지 확인하세요. 도구가 열 경계를 잘못 식별하는 경우 대부분의 데스크톱 OCR 응용 프로그램에서는 페이지에 영역 직사각형을 수동으로 그려 인식 순서를 안내할 수 있습니다. 그리기 영역은 사전에 더 많은 시간이 걸리지만 출력에서 올바른 읽기 순서를 보장합니다.

테이블 및 수치 데이터 보존

테이블은 일반 OCR이 해석하기 어려운 방식으로 레이아웃과 데이터를 결합합니다. 사람의 눈으로 테이블을 읽을 수 있도록 하는 그리드 구조에서는 일관된 열 너비와 정렬로 행을 교대로 사용하려면 OCR 엔진이 셀 경계와 동일한 행이나 열에 있는 셀 간의 관계를 모두 인식해야 합니다. 레이아웃 보존이 올바르게 작동하는 경우 원본 문서의 테이블은 해당 셀에 각 값이 포함된 OCR 출력 테이블을 생성합니다.

아래 표에서는 다양한 OCR 출력 모드가 테이블 보존을 처리하는 방식을 비교합니다.

OCR 출력 모드테이블 구조셀 정렬
검색 가능한 이미지원본 이미지가 보존됨정확함, 소스에 내장됨
텍스트와 이미지텍스트 테이블로 재구성대략적, 표류할 수 있음
텍스트만완전히 잃다정렬이 유지되지 않습니다.

레이아웃 품질에 영향을 미치는 OCR 설정

출력 모드 이외의 여러 설정은 원본 레이아웃이 인식되는 정도에 영향을 미칩니다. 입력 이미지의 DPI 설정이 가장 중요합니다. 300DPI로 스캔하면 OCR 엔진이 문자 모양을 구별하고 레이아웃 영역을 정확하게 감지할 수 있을 만큼 충분한 픽셀 밀도를 제공합니다. 150 DPI 이하로 스캔하면 인식 엔진과 영역 감지 알고리즘을 모두 혼동시키는 흐릿한 문자 가장자리가 생성됩니다. 600 DPI로 스캔하면 정확도가 약간 향상되지만 대부분의 문서에 비례하는 이점 없이 처리 시간과 파일 크기가 늘어납니다.

기울기 교정은 약간 기울어진 상태로 스캔된 페이지를 곧게 만듭니다. 2도 기울어져도 영역 감지가 열 경계를 대각선 구분선으로 잘못 해석할 수 있습니다. OCR 전에 자동 기울기 보정을 활성화하면 거의 모든 경우에 레이아웃 보존이 향상됩니다. 마찬가지로 얼룩 제거 필터는 영역 감지기가 인식된 영역을 조각화하고 읽기 순서를 깨뜨릴 수 있는 작은 텍스트 블록으로 해석할 수 있는 흩어진 점과 스캐너 노이즈를 제거합니다. WukongPDF와 같은 도구는 이러한 전처리 수정 사항을 자동으로 적용하여 다양한 문서 유형에 걸쳐 더욱 깔끔한 구역 지도와 보다 정확한 레이아웃 보존을 생성합니다.

OCR 후 레이아웃 정확성 확인

레이아웃 보존을 활성화한 상태에서 OCR을 실행한 후 문서를 보관하거나 배포하기 전에 결과를 확인하세요. 출력 PDF를 열고 텍스트 선택 도구를 활성화합니다. 각 열의 단락 위로 커서를 끌고 인접한 열로 이동하지 않고 선택 항목이 올바른 읽기 순서를 따르는지 확인합니다. 표에 나타나는 단어를 검색하고 검색 결과에 올바른 셀 위치가 강조 표시되는지 확인합니다. 중간 열의 단락을 복사하여 텍스트 편집기에 붙여넣어 줄이 올바른 순서로 나타나는지 확인합니다.

레이아웃 오류로 인해 혼란이 발생할 수 있는 중요한 문서의 경우 원본 스캔과 OCR 출력을 페이지별로 비교하는 것이 가장 신뢰할 수 있는 확인 방법입니다. 두 파일을 나란히 열고 각 단락의 첫 번째 문장, 모든 표 머리글, 머리글이나 바닥글에 나타나는 텍스트를 무작위로 확인하세요. 이 단계에서 영역 감지 오류를 포착하는 데는 페이지당 몇 초가 걸립니다. 몇 달 후 누군가가 문서를 검색하려고 시도하여 왜곡된 결과를 얻었을 때 이를 발견하는 것은 훨씬 더 많은 비용이 듭니다.

레이아웃이 많은 문서에 적합한 OCR 엔진 선택

다양한 OCR 엔진은 다양한 수준의 정교함으로 레이아웃 보존을 처리합니다. Google에서 유지 관리하는 오픈 소스 엔진인 Tesseract는 단순한 단일 열 문서에서는 잘 작동하지만 추가 전처리 없이 다중 열로 구성된 학술 논문이나 잡지 레이아웃에서는 어려움을 겪을 수 있습니다. 상업용 엔진인 ABBYY FineReader는 문자 인식을 실행하기 전에 전체 페이지 구조를 분석하고 텍스트 블록 간의 공간 관계를 유지하는 영역 맵을 구축하기 때문에 레이아웃 유지에 대한 독립적인 벤치마크에서 지속적으로 가장 높은 순위를 차지합니다.

레이아웃 보존이 중요한 문서의 경우 전체 문서를 처리하기 전에 대표 샘플 페이지에서 서로 다른 두 OCR 엔진을 테스트하는 데 시간을 투자하세요. 각 엔진으로 하나의 복잡한 페이지를 OCR하고 출력을 나란히 비교합니다. 두 결과 모두에서 읽기 순서, 열 구분 및 테이블 구조를 살펴보세요. 문서에서 가장 까다로운 페이지를 처리하는 엔진은 나머지 페이지도 적절하게 처리할 것입니다. 15분의 테스트 투자로 나중에 몇 시간 동안 수동으로 레이아웃을 수정해야 하는 일을 방지할 수 있습니다.

WukongPDF에는 페이지 레이아웃과 읽기 순서를 유지하는 OCR 기능이 포함되어 있어 데스크톱 OCR 소프트웨어를 설치하지 않고도 정확한 검색 가능한 PDF가 필요한 사용자에게 실용적인 선택이 됩니다. 클라우드 기반 처리는 여러 페이지의 문서를 효율적으로 처리하여 원래의 시각적 모양을 그대로 유지하면서 검색 가능한 PDF를 반환합니다.

레이아웃 보존에서 종종 간과되는 요소 중 하나는 원본 스캔의 품질과 상태입니다. 기울어지거나 주름지거나 대비가 낮은 원본 페이지로 인해 OCR 엔진은 레이아웃 구조를 매핑하는 대신 이미지 결함을 수정하는 데 분석 리소스를 소비하게 됩니다. OCR을 실행하기 전에 각 페이지를 육안으로 검사하십시오. 스캔 결과 기울어진 텍스트 블록, 제본된 책 등을 따라 어두운 그림자 또는 배경과 병합되는 희미한 텍스트가 표시되는 경우 이미지를 전처리하세요.

레이아웃이 유지된 OCR 출력과 레이아웃이 제거된 OCR 출력 간의 파일 크기 차이는 상당할 수 있습니다. 검색 가능한 이미지 PDF는 스캔한 원본 페이지를 보이지 않는 텍스트 오버레이가 있는 전체 해상도 이미지 레이어로 유지하므로 파일 크기가 텍스트 전용 출력보다 몇 배 더 커집니다. 저장 공간이 제한되지 않는 보관 목적의 경우 파일 크기가 클수록 레이아웃 충실도를 희생할 가치가 있습니다.

역사적 문서와 관련된 보관 프로젝트의 경우 원본 문서의 물리적 외관이 역사적, 증거적 가치를 지니고 있기 때문에 레이아웃 보존이 더욱 중요해집니다. 모든 단어를 올바르게 인식하지만 이를 단일 열 텍스트 블록으로 재배열하는 OCR 출력은 원본의 시각적 맥락을 파괴했습니다. 이러한 프로젝트에서는 검색 가능한 이미지 접근 방식이 필수이며 텍스트로만 구성된 출력은 원본 문서를 대체하는 것이 아니라 찾기 도구로 취급되어야 합니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →