Tips & Tricks

스캔한 테이블을 OCR하고 숫자만 내보내는 방법

PDF에서 스캔한 표는 이미지에 갇힌 숫자 격자입니다. 인간의 눈은 행과 열을 봅니다. OCR 소프트웨어는 페이지 그림을 보고 찾을 수 있는 텍스트를 추출하려고 시도합니다. 그 결과 숫자 간의 관계가 상실되어 뒤죽박죽이 되는 경우가 많습니다. 3열의 값은 2열로 끝납니다. 행 머리글이 잘못된 데이터에 연결됩니다. 스캔한 테이블에서 OCR을 실행하고 행과 열에 명확하게 매핑된 숫자 데이터만 내보내려면 테이블 구조를 유지하는 OCR 설정과 주변 텍스트에서 숫자를 분리하는 내보내기 단계가 필요합니다. 테이블 추출을 위한 OCR PDF 프로세스는 일반 텍스트 OCR보다 까다롭습니다.

How to OCR a Scanned Table and Export Only the Numbers

테이블에서 일반 OCR이 실패하는 이유

일반 OCR은 페이지 이미지를 연속적인 텍스트 스트림으로 처리합니다. 문자를 인식하여 페이지에 나타나는 순서대로(일반적으로 왼쪽에서 오른쪽, 위에서 아래로) 출력합니다. 테이블이 이 흐름을 방해합니다. OCR 엔진은 큰 간격으로 분리된 짧은 텍스트 조각을 발견합니다. 이러한 조각이 동일한 단락의 일부인지, 별도의 줄인지, 표의 요소인지 결정해야 합니다. 일반 OCR 엔진은 이러한 구별을 위해 설계되지 않았습니다.

테이블 셀의 숫자는 공백으로 인해 인접한 숫자와 격리됩니다. 그 위의 열 헤더는 별도의 텍스트 블록으로 인식될 수 있습니다. 왼쪽의 행 레이블은 또 다른 별도의 블록으로 인식될 수 있습니다. OCR 출력은 이 세 부분을 연결이 끊긴 텍스트로 표시합니다. 열 머리글, 행 레이블 및 데이터 값 간의 관계가 손실됩니다. 스캔된 PDF 테이블은 구조적 의미가 없는 숫자 더미가 됩니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

테이블 인식 OCR 엔진 사용

특수 OCR 엔진에는 테이블 감지가 핵심 기능으로 포함되어 있습니다. 이러한 엔진은 페이지 이미지를 분석하고 격자선, 열 정렬 및 일관된 행 간격을 감지하여 테이블 구조를 식별합니다. 테이블을 구조화된 개체로 처리하여 각 셀을 개별적으로 인식하고 행과 열 위치를 기록합니다. 출력은 테이블 구조가 유지되는 스프레드시트 또는 CSV 파일과 같은 구조화된 형식입니다.

Adobe Acrobat Pro에는 테이블 인식 OCR이 포함되어 있습니다. 스캔한 문서에서 OCR을 실행할 때 텍스트 인식 옵션을 활성화하고 테이블 인식 설정이 활성화되어 있는지 확인하세요. OCR 엔진은 페이지의 테이블을 식별하고 이를 구조화된 데이터로 추출합니다. WukongPDF를 포함한 브라우저 기반 OCR PDF 플랫폼도 테이블 인식을 지원하여 추출된 데이터를 스프레드시트 형식으로 반환합니다.

숫자 데이터만 내보내기

OCR이 테이블 구조를 인식한 후 출력에는 일반적으로 행 레이블, 열 머리글 및 데이터 값 등 테이블의 모든 텍스트가 포함됩니다. 숫자만 내보내려면 출력을 필터링하세요. 스프레드시트에서 텍스트 열을 삭제하고 숫자 열을 유지합니다. 또는 OCR 내보내기 설정에서 숫자 데이터만 추출되도록 지정하세요. 일부 OCR 도구는 각 셀의 데이터 유형을 식별하고 숫자 셀을 선택적으로 내보낼 수 있습니다.

숫자 내보내기는 테이블 데이터가 다른 시스템에 공급될 때 유용합니다. 분기별 수익 수치가 필요한 재무 모델에는 행 레이블이 필요하지 않습니다. 측정값이 필요한 통계 분석에는 열 헤더가 필요하지 않습니다. PDF 데이터 추출 단계에서는 가져올 준비가 된 깨끗한 숫자 데이터 세트를 생성합니다. The text labels can be exported separately and used as a reference to understand what the numbers represent.

추출된 숫자 정리 및 유효성 검사

OCR은 결코 완벽하지 않습니다. 숫자는 많은 문자가 비슷해 보이기 때문에 특히 오류가 발생하기 쉽습니다. 0은 문자 O로 인식될 수 있습니다. 1은 소문자 L로 인식될 수 있습니다. 쉼표는 마침표로 인식될 수 있습니다. 숫자 데이터를 추출한 후 출력에서 OCR 오류를 스캔합니다. 이웃과 비교하여 범위를 벗어난 숫자를 찾으십시오. 약 45만 달러 가치의 열에서 분기별 수익 4만 5천 달러는 위험 신호입니다.

추출된 총계를 원본 문서의 요약 수치와 비교합니다. 원본 테이블의 하단에 총계 행이 포함된 경우 추출된 숫자의 합계를 구하고 총계를 원본과 비교합니다. 불일치는 하나 이상의 셀에 OCR 오류가 있음을 나타냅니다. 스캔된 PDF 원본이 진실의 원천입니다. OCR 출력은 검증이 필요한 근사치입니다.

이미지 품질이 좋지 않은 스캔된 테이블 처리

도트 매트릭스 프린터로 인쇄하고 두 번 복사한 후 저해상도로 스캔한 테이블은 심각한 OCR 문제를 나타냅니다. 그리드 선이 끊어지거나 누락되었을 수 있습니다. 숫자가 희미하거나 부분적으로 가려질 수 있습니다. OCR 엔진은 테이블 구조를 전혀 감지하지 못하고 일반 텍스트 인식으로 돌아갈 수 있습니다. OCR 전에 스캔한 이미지를 전처리합니다. 희미한 숫자를 더 어둡게 만들려면 대비를 높이세요. 얼룩 제거 필터를 적용하여 OCR 엔진이 소수점이나 쉼표로 해석할 수 있는 흩어진 점을 제거합니다.

테이블 이미지 품질이 자동 OCR에 비해 너무 낮은 경우 수동 전사가 유일한 옵션일 수 있습니다. 스프레드시트에 숫자를 손으로 입력하고 스캔한 이미지에서 읽습니다. 이는 느리지만 완벽하게 정확한 데이터를 생성합니다. 수동 전사와 OCR 수정 간의 시간 균형은 테이블 크기와 OCR 정확도에 따라 달라집니다. OCR 정확도가 낮은 작은 테이블은 수동으로 기록하는 것이 더 빠릅니다. OCR 정확도가 좋은 대형 테이블은 OCR 출력을 수정하는 속도가 더 빠릅니다.

스캔한 테이블에서 깨끗한 숫자 데이터를 추출하는 것은 신중한 OCR 구성과 철저한 검증을 보상하는 다단계 프로세스입니다. 추출된 숫자는 마치 디지털 방식으로 생성된 것처럼 분석, 모델링 또는 보고 시스템으로 유입될 수 있습니다.

WukongPDF는 모든 운영 체제 및 장치에서 작동하는 브라우저 기반 플랫폼을 통해 이 워크플로에 필요한 도구를 제공합니다.

이 문서에 설명된 기술은 브라우저 기반 서비스, 데스크톱 응용 프로그램 및 모바일 앱을 포함한 대부분의 플랫폼에서 사용할 수 있는 PDF 도구를 사용하여 구현할 수 있습니다.

올바른 접근 방식과 적절한 구성을 사용하면 이 PDF 작업은 모든 문서에 대해 일관되고 안정적인 결과를 생성하는 일상적인 작업이 됩니다.

이러한 개념을 이해하고 여기에 설명된 방법을 적용하면 이 PDF 시나리오를 효율적으로 처리하고 출력 품질에 대한 확신을 갖는 데 도움이 됩니다.

이 문서에서 다루는 작업 흐름과 모범 사례는 개인용, 직업적 또는 조직적 사용 여부에 관계없이 이러한 특정 상황에서 PDF 작업을 위한 견고한 기반을 제공합니다.

이 기사에서는 초기 설정부터 출력의 최종 검증까지 이 PDF 작업을 효과적으로 처리하는 데 필요한 필수 개념과 실제 단계를 다루었습니다.

많은 문서 작업과 마찬가지로 결과의 품질은 설정 중에 주의를 기울이고 최종 문서를 배포하거나 보관하기 전 확인 단계의 철저함에 따라 달라집니다.

이 작업을 안정적으로 수행하는 능력은 모든 문서 작업 흐름에 귀중한 추가 요소이며, 시간을 절약하고 개인과 조직에 잘 반영되는 전문적인 결과를 생성합니다.

이 작업을 처음 수행하는 경우든 기존 워크플로를 개선하는 경우든 여기에 설명된 원칙과 방법은 명확하고 실용적인 지침을 제공합니다.

PDF 생태계는 정기적으로 등장하는 새로운 도구와 기능을 통해 계속 발전하고 있습니다. 사용 가능한 옵션에 대한 정보를 지속적으로 얻으면 문서 작업 흐름의 효율성을 유지할 수 있습니다.

이러한 PDF 기술을 익히는 데 투자한 시간은 보다 빠른 문서 처리, 오류 감소, 수신자의 요구 사항을 충족하는 보다 전문적인 출력을 통해 여러 번 보상됩니다.

이 기사에서는 원하는 결과를 달성하는 데 필요한 기본 개념과 실제 기술을 모두 다루면서 주제에 대한 포괄적인 개요를 제공했습니다.

이러한 지식을 바탕으로 독자는 자신 있게 작업에 접근하고 품질과 신뢰성에 대한 전문 표준을 충족하는 문서를 생성할 수 있습니다.

이 문서에 설명된 방법과 접근 방식은 PDF 문서 관리의 이러한 측면을 처리하기 위한 현재 모범 사례를 나타냅니다.

여기에 제공된 지침을 따르면 독자는 좌절과 노력 낭비로 이어지는 일반적인 함정을 피하면서 일관된 고품질 결과를 얻을 수 있습니다.

PDF 형식은 산업과 플랫폼 전반에 걸친 문서 교환의 표준으로 남아 있습니다. 이러한 기술을 익히면 개인 생산성과 조직 역량이 모두 향상됩니다.

이러한 기술을 적용한 독자는 한때 복잡해 보였던 작업이 연습과 올바른 도구 구성을 통해 간단하고 관리 가능해진다는 것을 알게 될 것입니다.

적절한 PDF 처리를 배우는 데 투자하면 수많은 문서 작업 전반에 걸쳐 배당금을 지불할 수 있으므로 현대 디지털 작업 공간에서 가장 실용적인 기술 중 하나가 됩니다.

연습을 통해 이러한 PDF 작업은 제2의 천성이 되어 문서 전문가가 파일 형식 문제로 씨름하는 대신 콘텐츠에 집중할 수 있습니다.

이 기사에서 제공하는 지침은 독자가 PDF 작업의 이러한 측면을 역량과 확신을 가지고 처리할 수 있도록 준비시킵니다.

이 PDF 기술을 익히는 것은 모든 문서를 처리하고 모든 작업 흐름을 간소화하여 지속적으로 가치를 반환하는 투자입니다.

스캔한 테이블에서 정확한 숫자 데이터를 추출하여 종이 기록을 사용 가능한 디지털 정보로 변환합니다.

이 기술은 일단 개발되면 모든 문서 전문 툴킷의 영구적이고 귀중한 부분이 됩니다.

여기에서 얻은 지식은 도구, 플랫폼 및 문서 유형 전반에 적용되므로 PDF로 작업하는 모든 사람에게 보편적으로 유용합니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →