Tips & Tricks

OCR 결과를 PDF에서 JSON으로 내보내는 방법

스캔한 문서에서 OCR PDF을 실행하면 인식된 텍스트가 생성되지만 대부분의 OCR 도구는 해당 텍스트를 일반 텍스트 파일로 출력하거나 PDF에 다시 포함합니다. OCR 결과를 JSON으로 직접 내보내면 데이터베이스, 검색 색인, 콘텐츠 관리 시스템 및 자동화된 워크플로에 입력할 수 있는 구조화되고 기계가 읽을 수 있는 데이터가 제공됩니다. AIIM International의 2025년 조사에 따르면 조직의 43%가 이제 문서 파생 텍스트에 JSON과 같은 구조화된 데이터 형식을 선호하는 것으로 나타났습니다. JSON이 최신 클라우드 애플리케이션 및 AI 파이프라인과 더 쉽게 통합되기 때문입니다(AIIM, "State of Intelligent Information Management", 2025).

주요 내용

OCR 결과를 JSON으로 내보내면 일반 텍스트로 내보낼 때 손실되는 페이지 번호, 단어 좌표, 신뢰도 점수 등 인식된 텍스트의 구조가 보존됩니다. 대부분의 최신 OCR 엔진은 기본적으로 JSON 출력을 지원하지만 이 기능을 설정에서 활성화하거나 내보내기 형식 메뉴에서 선택해야 할 수도 있습니다. 결과 JSON 파일은 전체 텍스트 검색, 데이터 추출 파이프라인 및 문서 콘텐츠에 대한 기계 학습 모델 교육에 사용될 수 있습니다.

OCR JSON을 애플리케이션에 통합하는 개발자의 경우 대부분의 JSON 출력 형식에는 스키마 버전을 식별하는 버전 필드가 포함됩니다. OCR 엔진이 출력 형식을 업데이트할 때 변경 사항이 손상되지 않도록 구문 분석하기 전에 항상 이 필드를 확인하십시오. 구문 분석 코드 시작 부분의 간단한 버전 가드는 JSON 구조가 엔진 버전 간에 변경될 때 알 수 없는 오류를 방지합니다.

How to Export OCR Results From a PDF to JSON

OCR 결과에서 JSON 출력이 일반 텍스트보다 나은 이유

OCR의 일반 텍스트 출력은 문자 자체를 제외한 모든 것을 삭제합니다. 단어를 얻었지만 각 단어가 나타난 페이지 번호, 페이지에서 텍스트가 있는 위치를 알려주는 경계 상자 좌표, OCR 엔진이 각 문자에 대해 얼마나 확실한지를 나타내는 신뢰도 점수, 단락 나누기 및 열 레이아웃과 같은 구조적 정보는 손실됩니다. JSON은 이 모든 것을 보존합니다. JSON 스캔 PDF OCR 출력 파일에는 일반적으로 페이지 개체 배열이 포함되어 있으며, 각 개체에는 인식된 텍스트와 위치, 크기 및 신뢰도 메타데이터가 포함된 텍스트 블록 개체 배열이 있습니다.

이 구조는 일반 텍스트로는 불가능한 다운스트림 자동화를 가능하게 합니다. 스크립트는 JSON 파일을 읽고 헤더 영역이나 사이드바 열과 같은 각 페이지의 특정 영역에서 텍스트만 추출할 수 있습니다. 잘못된 텍스트로 검색 색인을 오염시키는 것을 방지하기 위해 신뢰도가 낮은 OCR 결과를 필터링할 수 있습니다. Y 및 X 좌표를 기준으로 텍스트 블록을 정렬하여 다중 열 레이아웃의 읽기 순서를 재구성할 수 있습니다. OCR의 일반 텍스트 파일에서는 이러한 작업이 불가능합니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

단계: OCR 결과를 JSON으로 내보내기

OCR을 실행하기 전에 스캔한 PDF의 이미지 해상도를 확인하세요. 대부분의 OCR 엔진은 입력 페이지 이미지가 300DPI일 때 가장 잘 작동합니다. 200DPI 이하에서는 인식 정확도가 눈에 띄게 떨어집니다. 400DPI 이상에서는 의미 있는 정확도 향상 없이 처리 시간이 늘어납니다. 스캔한 PDF에 저해상도 페이지 이미지가 있는 경우 JSON 출력으로 OCR을 실행하기 전에 해당 이미지를 300DPI로 확대하는 것이 좋습니다. 추가 전처리 단계는 JSON 데이터의 품질을 눈에 띄게 향상시킵니다.

구조화된 출력을 지원하는 OCR 도구에서 스캔한 PDF를 엽니다. 가장 널리 사용되는 오픈 소스 OCR 엔진인 Tesseract는 명령줄 인터페이스와 이를 번들로 제공하는 대부분의 애플리케이션을 통해 JSON 출력을 지원합니다. Tesseract에서 출력 형식 플래그를 추가하면 인식된 텍스트와 함께 JSON 파일이 생성됩니다. Google Cloud Vision, Amazon Textract 및 Microsoft Azure Form Recognizer의 상용 OCR API는 모두 기본적으로 페이지, 블록, 단락, 행 및 단어별로 구성된 인식된 텍스트와 함께 JSON을 반환합니다.

JSON 출력이 활성화된 상태에서 OCR을 실행한 후 텍스트 편집기에서 결과 파일을 열어 구조를 이해합니다. JSON에는 페이지 개체 배열이 포함됩니다. 각 페이지 개체에는 페이지 크기와 블록 개체 배열이 포함되어 있습니다. 각 블록에는 인식된 텍스트, 일반적으로 0에서 100 사이의 신뢰도 점수, 페이지에서 블록의 위치를 설명하는 경계 상자 좌표가 포함됩니다. 이 구조에 익숙하면 간단한 스크립트를 작성하여 필요한 데이터를 정확하게 추출할 수 있습니다. WukongPDF의 OCR 도구에는 인식된 텍스트를 페이지 번호, 신뢰도 점수 및 위치 데이터로 구성하는 JSON 내보내기 옵션이 포함되어 있으므로 구조화된 출력을 얻기 위해 별도의 OCR 엔진을 구성할 필요가 없습니다.

OCR 출력을 위한 일반적인 JSON 구조

대부분의 JSON 스캔 PDF OCR 출력에는 파일 상단에 OCR 엔진 이름, 버전, 처리 날짜 및 문서에서 감지된 언어를 기록하는 전역 메타데이터 섹션도 포함됩니다. 이 메타데이터는 감사 추적 및 OCR 품질 문제 디버깅에 유용합니다. 여러 소스의 문서를 처리하는 경우 메타데이터는 각 결과를 생성한 엔진과 배치 간에 엔진 버전이 변경되었는지 여부를 알려주므로 인식 품질의 차이를 설명할 수 있습니다.

필드설명값 예시
페이지원본 문서의 페이지 번호3
텍스트인식된 텍스트 콘텐츠"송장 #4521"
신뢰OCR 신뢰도 0~10094.7
비박스경계 상자 [x, y, 너비, 높이](픽셀)[120, 340, 400, 28]
블록 유형콘텐츠 블록 유형"단락" 또는 "테이블" 또는 "라인"
언어감지된 텍스트 언어"엔"

자동화된 워크플로에서 OCR JSON 데이터 사용

오류 처리는 미리 계획할 가치가 있습니다. 이미지 품질이 매우 낮은 페이지에서 OCR을 실행하면 인식되는 대부분의 단어에 대해 신뢰도 점수가 50% 미만이 될 수 있습니다. 워크플로는 데이터베이스나 검색 색인에 자동으로 수집되는 대신 사람이 검토할 수 있도록 결과를 플래그 지정하는 최소 신뢰도 임계값을 정의해야 합니다. 신뢰도가 낮은 스캔된 PDF OCR 출력을 프로덕션 시스템으로 직접 보내는 것은 추출 시점에 검토를 위해 플래그를 지정하는 것보다 나중에 정리하는 데 훨씬 더 많은 비용이 드는 오류로 데이터를 오염시킵니다.

OCR 결과가 JSON에 있으면 자동화 가능성이 크게 확장됩니다. 일반적인 패턴은 폴더에서 새로 스캔한 PDF를 감시하고, JSON 출력으로 OCR을 실행하고, JSON을 구문 분석하여 페이지의 알려진 위치에서 송장 번호나 날짜와 같은 특정 필드를 추출하고 해당 값을 데이터베이스나 스프레드시트에 삽입하는 스크립트를 작성하는 것입니다. JSON에는 위치 좌표가 포함되어 있으므로 추출 스크립트는 문서의 전체 콘텐츠에 관계없이 페이지의 특정 영역에 있는 텍스트를 대상으로 지정할 수 있습니다.

검색 애플리케이션의 경우 JSON 출력을 Elasticsearch 또는 Algolia와 같은 검색 인덱스에 공급할 수 있습니다. 각 페이지는 페이지 번호를 메타데이터 필드로 사용하여 검색 가능한 문서가 됩니다. 신뢰도 점수를 사용하면 신뢰도가 높은 OCR 텍스트에 더 높은 가중치를 부여하여 검색 관련성을 조정할 수 있습니다. 용어를 검색하는 사용자는 해당 용어가 실제로 페이지에 나타나는지에 대한 OCR 엔진의 확실성에 따라 순위가 매겨진 결과를 확인하므로 잘못 인식된 문자로 인한 잘못된 일치가 줄어듭니다.

AI 및 기계 학습 파이프라인의 경우 JSON의 구조화된 스캔 PDF OCR 출력이 표준 입력 형식입니다. 대규모 언어 모델 및 문서 이해 시스템은 JSON 표현을 사용합니다.

자주 묻는 질문

장기간 액세스할 수 있도록 원본 PDF와 함께 OCR JSON 파일을 어떻게 저장해야 합니까? 파일 이름이 일치하는 PDF와 동일한 폴더에 JSON 파일을 저장합니다. 예를 들어, 보고서-2025.pdf 및 보고서-2025.ocr.json입니다. 이 명명 규칙을 사용하면 스크립트가 특정 PDF에 대한 스캔 PDF OCR 출력을 찾는 것이 쉽습니다. 대규모 아카이브의 경우 플랫 파일이 아닌 전체 텍스트 검색을 지원하는 문서 데이터베이스에 JSON을 저장하는 것이 좋습니다.

OCR의 JSON 출력은 일반 텍스트에 비해 파일 크기를 늘리나요?

예, 일반적으로 3~5배 정도입니다. 15KB의 일반 텍스트를 생성하는 10페이지 스캔 문서는 50~75KB JSON 파일을 생성할 수 있습니다. 추가 크기는 구조적 메타데이터(페이지 번호, 경계 상자, 인식된 모든 단어에 대한 신뢰도 점수)에서 비롯됩니다. 대부분의 애플리케이션에서 이러한 크기 증가는 무시할 수 있습니다. 수백만 페이지와 같은 매우 큰 규모에서만 계획할 가치가 있는 스토리지 고려 사항이 됩니다.

기존 일반 텍스트 스캔 PDF OCR 출력을 JSON으로 변환할 수 있습니까?

의미가 없습니다. OCR 결과가 일반 텍스트로 평면화되면 위치 데이터와 신뢰도 점수가 손실되며 텍스트만으로는 재구성할 수 없습니다. 이전에 처리된 문서에서 구조화된 OCR 데이터가 필요한 경우 가장 안정적인 접근 방식은 JSON 출력을 활성화하여 스캔한 원본 PDF에서 OCR을 다시 실행하는 것입니다.

가장 유용한 JSON 출력을 생성하는 OCR 엔진은 무엇입니까?

Google, Amazon 및 Microsoft의 클라우드 기반 OCR 서비스는 일반적으로 단어 수준 경계 상자 및 신뢰도 점수를 사용하여 가장 상세한 JSON 출력을 생성합니다. Tesseract는 줄과 단어 수준에서 견고한 JSON을 생성합니다. 최선의 선택은 볼륨, 예산, 개인 정보 보호 요구 사항에 따라 클라우드 서비스로 문서 전송이 허용되는지 여부에 따라 달라집니다.

OCR JSON 출력을 검색 가능한 PDF로 다시 변환할 수 있습니까? 예, 하지만 프로세스에는 특정 좌표에 텍스트 개체를 배치할 수 있는 PDF 생성 라이브러리가 필요합니다. JSON 출력의 경계 상자 데이터는 각 단어가 페이지에서 어디에 속하는지 정확하게 알려줍니다. 이는 추출 과정의 역순이며, JSON 데이터의 인식 오류를 수정한 후 수정된 OCR 텍스트에서 검색 가능한 PDF를 생성해야 할 때 유용합니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →