Tips & Tricks

가로 및 세로 페이지가 혼합된 PDF를 OCR하는 방법

혼합 소스로 구성된 스캔한 PDF에는 세로 방향과 가로 방향의 페이지가 모두 포함되어 있는 경우가 많습니다. 재무 스프레드시트는 가로 페이지로 표시됩니다. 동반 텍스트 문서는 세로 페이지로 나타납니다. 혼합 방향을 고려하지 않고 이러한 문서에 대해 OCR을 실행하면 OCR 엔진이 해당 페이지를 잘못된 방향으로 처리했기 때문에 가로 페이지의 단어가 뒤섞이거나 회전하거나 완전히 누락되는 인식된 텍스트가 생성됩니다.

OCR PDF 엔진은 텍스트 줄을 분석하여 문자 위치와 읽기 순서를 결정합니다. 엔진이 예상하는 것과 관련하여 페이지가 90도 회전하면 텍스트 줄이 수평이 아닌 수직으로 실행됩니다. 엔진은 텍스트를 완전히 인식하지 못하거나 수직으로 읽으려고 시도하여 말도 안되는 출력을 생성합니다. 혼합 방향 문서에서는 OCR 처리 전에 페이지별 방향 감지가 필요합니다.

WukongPDF의 스캔 PDF OCR 도구는 인식 프로세스 중 각 페이지에 대한 자동 회전 감지를 통해 혼합 페이지 방향을 처리합니다.

OCR 정확도에 페이지 방향이 중요한 이유

OCR 엔진은 문자 행을 감지하고 각 행 내의 모양을 분석하여 작동합니다. 세로 방향의 페이지에는 엔진이 자연스럽게 처리하는 가로 방향의 텍스트 줄이 있습니다. 회전 수정 없이 가로 방향 페이지를 보면 OCR 엔진의 관점에서 텍스트 줄이 세로로 늘어서 있습니다. 엔진은 가로 텍스트를 예상하지만 세로 텍스트는 읽을 수 없습니다.

해결책은 OCR 전에 각 페이지의 방향을 감지하고 처리하기 전에 가로 페이지를 세로 방향으로 회전시키는 것입니다. OCR 후에는 인식된 텍스트 레이어가 올바르게 배치된 상태에서 페이지를 원래 방향으로 다시 회전할 수 있습니다. 처리 중 회전으로 인해 문서가 영구적으로 변경되지는 않습니다. OCR 엔진이 페이지를 보는 방식만 변경됩니다.

대부분의 자동화된 OCR 도구는 모든 페이지가 동일한 방향을 공유한다고 가정합니다. 이는 단일 세션에서 단일 스캐너로 생성된 문서의 일반적인 경우이기 때문입니다. 다양한 소스의 스캔을 결합하여 생성되는 혼합 방향 문서는 페이지별 변형을 올바르게 처리하기 위해 명시적인 구성이 필요합니다.

방법 1: 페이지별 회전 감지 기능이 있는 Acrobat Pro

Acrobat Pro의 OCR 기능은 적절하게 구성되면 방향이 혼합된 문서를 처리할 수 있습니다. Acrobat Pro에서 스캔한 PDF를 열고 도구, 스캔 및 OCR, 텍스트 인식, 이 파일로 이동합니다. 텍스트 인식 설정 대화 상자에서 문서의 기본 언어로 올바른 OCR 언어가 선택되었는지 확인하세요. 설정 섹션에서 Acrobat이 페이지 회전을 감지하는 데 도움이 되는 기울기 조정 및 직선화 옵션을 활성화합니다.

Acrobat은 각 페이지를 개별적으로 처리하고 주요 텍스트 방향을 감지하려고 시도합니다. 감지가 올바른 페이지의 경우 OCR 출력은 정확하고 읽기 쉽습니다. 최소한의 텍스트나 복잡한 시각적 배경이 있는 페이지와 같이 감지에 실패한 페이지의 경우 OCR 출력이 뒤섞이거나 완전히 없을 수 있습니다. OCR 처리 후 가로 페이지를 구체적으로 검토하세요. 해당 페이지에서 시각적으로 볼 수 있는 텍스트를 검색하세요. 검색 결과 아무것도 발견되지 않으면 Acrobat이 방향을 잘못 식별했을 가능성이 있습니다.

잘못 식별된 페이지의 경우 페이지 구성 도구에서 페이지를 수동으로 회전하고 해당 페이지에서만 OCR을 다시 실행하세요. 수동 개입은 영향을 받는 페이지당 단 몇 분만 소요되며 모든 페이지가 검색 가능한 문서 출력에 정확하게 인식된 텍스트를 제공하도록 보장합니다.

방법 2: OCRmyPDF를 사용한 전처리

Tesseract OCR을 기반으로 구축된 오픈 소스 명령줄 도구인 OCRmyPDF는 내장된 기울기 보정 기능을 통해 혼합 방향 페이지를 처리합니다. ocrmypdf --deskew input.pdf output.pdf 명령은 각 페이지의 텍스트 방향을 감지하고, 필요에 따라 페이지를 회전하고, Tesseract로 OCR을 실행하고, 검색 가능한 PDF를 출력합니다. 왜곡 보정 플래그는 혼합 방향 문서 처리에 필수적인 매개변수입니다.

OCRmyPDF는 페이지를 순차적으로 처리하고 페이지별 방향 수정을 자동으로 적용합니다. 극단적인 회전이 있는 문서나 가로 및 세로 텍스트가 모두 포함된 페이지의 경우 기울어짐 보정 알고리즘은 주요 텍스트 방향을 기준으로 페이지 방향을 지정하여 대부분의 페이지 콘텐츠에 대해 최상의 OCR 결과를 제공합니다. 소수 텍스트 방향은 정확도가 약간 떨어질 수 있지만 일반적으로 여전히 인식됩니다.

문서 워크플로우에서 혼합 방향 문서의 대용량 일괄 처리를 위해 폴더의 모든 PDF를 처리하는 셸 스크립트와 결합된 OCRmyPDF는 문서별 수동 구성 없이 완전히 자동화된 OCR을 제공합니다. 자동화는 일상적인 처리를 처리하며 예외적인 경우에만 사람의 검토가 필요합니다.

가로 페이지의 OCR 출력 확인

OCR 처리 후 별도의 집중 검사로 가로 페이지의 출력을 확인합니다. 출력 PDF의 가로 페이지에서 텍스트를 선택하고 일반 텍스트 편집기에 복사합니다. 복사된 텍스트는 시각적 페이지 내용과 일치하여 위에서 아래로, 왼쪽에서 오른쪽으로 올바른 순서로 읽어야 합니다. 단어가 뒤섞여 있거나 순서가 어긋나거나 무의미한 순서로 나타나는 경우 해당 페이지에 대한 방향 감지가 실패한 것입니다.

가로 페이지에 나타나는 특정 알려진 용어를 검색합니다. 가로 페이지의 재무 테이블에는 OCR 출력에서 검색할 수 있는 특정 계정 코드, 부서 이름 또는 숫자 값이 포함될 수 있습니다. 검색 결과 가로 페이지에서는 일치하는 항목이 없지만 동일한 문서의 세로 페이지에서는 일치하는 항목이 발견되면 OCR 엔진이 가로 콘텐츠를 완전히 놓쳤을 가능성이 높습니다. 이러한 페이지는 지정된 수동 방향으로 다시 처리해야 합니다.

문서 워크플로우에서 검색 가능한 아카이브 역할을 할 문서의 경우 확인 단계는 문서가 영구 컬렉션에 들어가기 전에 방향 관련 OCR 문제를 포착하는 품질 게이트입니다. 콘텐츠의 전체 페이지를 조용히 놓치는 확인되지 않은 OCR 출력은 검색 가능한 아카이브를 만드는 목적을 약화시킵니다.

혼합 방향 스캔 컬렉션 일괄 처리

방향이 혼합된 대규모 스캔 문서 모음의 경우 페이지별로 수동으로 확인하는 것은 비현실적입니다. OCRmyPDF 및 왜곡 보정 플래그를 사용하여 프로세스를 자동화한 다음 각 출력 페이지에서 검색 가능한 텍스트가 있는지 확인하는 확인 스크립트를 실행합니다. 인식된 텍스트 문자가 없거나 문자 수가 거의 없는 페이지는 수동 검토 및 잠재적인 재처리를 위해 플래그가 지정됩니다.

확인 스크립트는 OCR 처리된 각 PDF를 읽고, 페이지별로 텍스트 레이어를 추출하고, 각 페이지에서 인식된 문자 수를 계산합니다. 최소 문자 기준(예: 10자) 미만의 페이지는 잠재적으로 처리되지 않았거나 방향이 잘못된 것으로 플래그가 지정됩니다. 플래그가 지정된 페이지는 모든 페이지를 검토해야 하는 것이 아니라 실제로 사람의 주의가 필요한 페이지에 대해서만 수동 검토 노력을 안내하는 보고서로 컴파일됩니다.

워크플로와 관련하여, 새로 스캔한 문서가 정기적으로 도착하는 진행 중인 디지털화 프로젝트의 경우 일괄 처리 및 검증 워크플로가 표준 운영 절차가 됩니다. 새 문서가 파이프라인에 들어오고 방향 감지 기능이 있는 OCR을 통해 자동으로 처리되며 예외적인 경우에만 사람의 개입이 필요합니다. 자동화가 루틴을 처리합니다. 인간 검토자가 예외를 처리합니다.

내부 회전이 있는 페이지의 OCR 개선

일부 스캔한 문서에는 페이지 자체가 회전되지 않고 페이지 내에서 콘텐츠가 회전되는 페이지가 포함되어 있습니다. 페이지 크기를 세로로 유지하면서 테이블 내용을 90도 회전하여 가로형 재무 테이블을 세로형 문서에 삽입할 수 있습니다. 이러한 페이지는 페이지 크기가 회전이 필요하다는 표시를 제공하지 않기 때문에 방향 감지가 가장 까다롭습니다.

문서 처리 시 내부 회전이 있는 페이지의 경우 수동 전처리가 가장 안정적인 접근 방식입니다. Acrobat Pro에서는 PDF 편집 도구를 사용하여 회전된 콘텐츠 영역을 선택하고 올바른 가로 방향으로 회전한 후 페이지에 올바르게 배치합니다. 내부 회전을 수정한 후 수정된 페이지에서 OCR을 실행하세요. 수동 전처리 단계는 영향을 받은 페이지당 약 1분 정도 걸리지만 깨끗하고 정확한 OCR 출력을 생성합니다.

내부 회전이 있는 페이지를 식별하려면 육안 검사가 필요합니다. 문서를 훑어보고 텍스트가 페이지 가장자리를 기준으로 예상치 못한 방향으로 이어지는 것처럼 보이는 페이지를 찾습니다. 내부 회전이 있는 페이지는 대부분의 문서 컬렉션에서 상대적으로 드물지만 발생하면 OCR 품질에 불균형적으로 영향을 미칩니다.

혼합 방향 문서에 적합한 OCR 엔진 선택

다양한 OCR 엔진이 다양한 정확도로 방향 감지를 처리합니다. 기울기 보정 전처리기가 있는 Tesseract는 적당한 회전을 잘 처리하지만 정확히 90도 또는 180도 회전된 페이지에서는 어려움을 겪을 수 있습니다. Google Cloud Vision OCR에는 모든 회전 각도를 안정적으로 처리하는 방향 감지 기능이 내장되어 있습니다. 정확성이 필수적인 중요한 혼합 방향 문서의 경우 클라우드 기반 OCR 서비스는 일반적으로 방향 처리 측면에서 로컬 엔진보다 성능이 뛰어납니다.

대규모 배치를 커밋하기 전에 혼합 방향 페이지의 작은 샘플에서 선택한 OCR 엔진을 테스트합니다. 알려진 방향 패턴을 사용한 10페이지 테스트는 엔진이 문서의 특정 회전 유형을 처리하는 방법을 보여줍니다. 테스트에는 몇 분이 걸리며 엔진 방향 감지가 특정 문서 유형에 적합하지 않은 것으로 판명되면 몇 시간의 재처리가 필요하지 않습니다.

확인을 위해 혼합 방향 문서에서 OCR 텍스트 내보내기

OCR 처리 후 인식된 텍스트를 내보내 모든 페이지의 완전성을 확인합니다. Acrobat Pro에서 도구, PDF 내보내기로 이동하고 출력 형식으로 텍스트를 선택합니다. 내보낸 텍스트 파일에는 모든 페이지의 콘텐츠가 올바른 읽기 순서로 포함되어야 합니다. 텍스트 파일을 열고 특정 가로 페이지에 나타나는 용어를 검색하세요. 해당 용어가 내보내기에서 누락된 경우 해당 페이지는 OCR 중에 방향이 잘못되었을 수 있으므로 재처리가 필요합니다.

문서 처리와 관련하여 검색 가능한 아카이브로 지정된 문서의 경우 내보낸 텍스트는 모든 페이지가 해당 콘텐츠를 검색 가능한 레이어에 제공했다는 독립적인 확인 역할을 합니다. 공백이 있거나 섹션이 누락된 텍스트 내보내기는 문서가 영구 아카이브에 들어가기 전에 주의가 필요한 OCR 실패를 나타냅니다. 내보내기 단계는 방향 관련 OCR 문제가 영구적인 아카이브 결함이 되기 전에 이를 포착하는 품질 게이트 역할을 합니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →