
OCR이 각주 텍스트와 여백 내용이 겹치는 문제로 어려움을 겪는 이유
광학 문자 인식 엔진은 텍스트가 일관적인 줄 간격과 콘텐츠 영역 간의 명확한 구분이 있는 깔끔하고 예측 가능한 블록에 있을 때 가장 잘 작동합니다. 표준 비즈니스 서신이나 새로운 페이지에 대한 OCR PDF 작업은 일반적으로 텍스트가 모든 면에 넓은 여백을 두고 질서정연한 단락으로 흐르기 때문에 정확한 결과를 생성합니다. 학술 논문의 레이아웃은 각주, 여백 인용 및 본문 텍스트가 종종 경계에 닿거나 겹치는 등 여러 개의 개별 텍스트 스트림을 물리적으로 가까운 곳에 의도적으로 압축하기 때문에 근본적으로 더 어려운 문제를 제시합니다.
핵심 과제는 문자 인식을 시도하기 전에 OCR 엔진이 페이지 이미지를 텍스트 영역으로 나누는 단계인 분할입니다. 본문 텍스트의 위 첨자 각주 참조 번호가 각주 구분선 바로 위에 있고 해당 줄이 더 작은 글꼴 크기로 각주 텍스트 자체 바로 위에 있는 경우 분할 알고리즘은 텍스트 영역 하나가 끝나고 다음 영역이 시작되는 위치를 결정해야 합니다. 여기서 잘못된 분할 결정은 두 개의 서로 다른 텍스트 스트림의 문자가 마치 단일 연속 선인 것처럼 인식 엔진에 공급되기 때문에 인식 오류로 이어집니다. 출력은 본문 텍스트 단어와 각주 조각이 혼합된 횡설수설로 읽혀집니다.
여백 인용은 문제에 세 번째 텍스트 스트림을 추가합니다. 시카고 스타일을 따르는 인문학 논문이나 Bluebook 형식을 사용하는 법률 문서에서는 여백 메모, 줄 번호 또는 병렬 인용이 본문 열을 따라 수직 또는 수평으로 배치됩니다. 이러한 여백 요소는 종종 더 작은 포인트 크기(때로는 7 또는 8포인트)로 인쇄되며 OCR 엔진이 이미 일반 크기에서 어려움을 겪고 있는 기울임꼴 또는 압축 글꼴을 사용할 수 있습니다. 여백 텍스트가 본문 텍스트에 물리적으로 닿으면 홈통이 좁고 형식이 빡빡한 저널에서 자주 발생하며 분할 문제는 양방향이 아닌 3방향이 됩니다.
스캔된 PDF 소스의 종이 품질도 OCR 문제를 악화시킵니다. 많은 학술 논문은 책등 근처의 페이지 곡률로 인해 텍스트가 구부러지고 왜곡되는 제본된 볼륨에서 스캔됩니다. 페이지 하단의 각주는 제본에 가장 가깝기 때문에 등뼈 곡률의 영향을 가장 많이 받는 부분입니다. 구부러진 페이지의 물리적 왜곡, 작은 글꼴 크기, 위의 본문 텍스트와의 근접성이 결합되어 OCR 정확도에 대한 완벽한 불리한 조건이 만들어집니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
겹치는 텍스트 영역을 분리하기 위해 스캔한 페이지 전처리
텍스트 요소가 겹치는 학술 페이지에서 OCR 정확도를 높이는 가장 효과적인 방법은 페이지 이미지가 OCR 엔진에 도달하기 전에 사전 처리하는 것입니다. 이 전처리는 서로 다른 텍스트 스트림을 분리하므로 엔진이 모호한 분할 결정을 내릴 필요가 없습니다.
모든 텍스트 줄이 완벽하게 수평으로 실행되도록 스캔한 페이지의 기울기를 조정하는 것부터 시작하세요. 원본 스캔이 1도 기울어져도 각주 텍스트가 페이지 가장자리의 본문 텍스트 영역으로 이동하여 제대로 정렬된 페이지에 존재하지 않는 잘못된 중복이 생성될 수 있습니다. 대부분의 문서 스캐닝 소프트웨어에는 자동 기울기 조정이 포함되어 있지만 제본된 볼륨에서 스캔한 학술 논문의 경우 본문 텍스트 기준선을 따라 참조선을 그린 수동 기울기 조정이 자동 수정보다 더 정확한 결과를 생성합니다.
기울기 조정 후 다음 단계는 영역 마스킹입니다. 이미지 편집기나 전용 OCR 전처리 도구를 사용하여 본문 텍스트 영역과 각주 영역 사이에 가로 구분선을 그립니다. 이 줄은 다운스트림 OCR 엔진에게 그 위의 모든 것을 하나의 텍스트 영역으로 처리하고 그 아래의 모든 것을 별도의 텍스트 영역으로 처리하도록 지시합니다. 각주가 있는 페이지에서 구분선은 각주 규칙 바로 위에 위치해야 합니다. 이는 전통적으로 인쇄된 학술 저작물에서 본문 텍스트와 각주를 구분하는 짧은 수평선입니다. 각주가 없는 페이지에는 구분 기호가 필요하지 않습니다.
여백 인용 및 줄 번호의 경우 수직 마스킹이 동일한 접근 방식입니다. 여백 텍스트와 기본 텍스트 열 사이에 세로 구분선을 그립니다. 왼쪽 여백 줄 번호와 오른쪽 여백 인용이 모두 있는 페이지에서는 양쪽에 세로 구분 기호가 필요합니다. 목표는 각 영역이 정확히 하나의 텍스트 스트림을 포함하는 직사각형 영역으로 페이지를 분할하는 것입니다. 그런 다음 OCR 엔진은 각 영역을 독립적으로 처리하고 인식이 완료된 후 올바른 읽기 순서로 다시 조립할 수 있는 별도의 인식된 텍스트 출력을 생성합니다.
멀티 스트림 학술 페이지에 대한 OCR 설정 구성
대부분의 전문 OCR 엔진은 다중 열 및 다중 스트림 페이지 레이아웃에 도움이 되는 설정을 제공합니다. 자동 레이아웃 분석을 활성화하는 것이 출발점이지만 근접한 텍스트 스트림이 있는 학술 페이지의 경우 수동 영역 구성이 완전 자동 분석보다 더 나은 결과를 생성합니다.
본문 텍스트, 각주 영역, 여백 텍스트 영역별로 별도의 인식 영역을 정의합니다. 각 영역 내에서 적절한 언어, 예상 글꼴 크기 범위 및 텍스트 방향을 설정합니다. 본문 텍스트 영역에는 가로 왼쪽에서 오른쪽 방향으로 10~12포인트 텍스트가 있어야 합니다. 각주 영역은 8~10포인트 텍스트를 예상해야 하며 여전히 수평이지만 각주 텍스트에는 자연스러운 산문을 기대하는 언어 모델을 혼동시킬 수 있는 URL, DOI 및 인용 문자열이 자주 포함된다는 점을 인식해야 합니다.
특히 본문 텍스트 영역의 경우 줄 분할을 위해 위 첨자 및 아래 첨자를 무시하는 설정을 활성화합니다. 위 첨자 각주 참조 번호와 수학 지수는 일반적으로 더 작고 기준선 위로 올라가므로 엔진이 이를 일반 텍스트 줄의 일부로 처리하면 줄 높이 계산 오류가 발생합니다. 분할을 위해 위 첨자 위치 지정을 무시하면 본문 텍스트 줄은 그대로 유지되는 반면 각주 표시는 줄 경계에 영향을 주지 않는 별도의 작은 요소로 인식됩니다.
PDF에서 텍스트로의 출력 품질은 각 영역의 인식 결과가 별도의 텍스트 파일이나 결합된 출력 내 별도의 표시된 섹션에 저장될 때 크게 향상됩니다. 이 영역으로 구분된 출력을 사용하면 본문 텍스트가 각주 텍스트로 번지지 않았는지, 여백 인용이 주요 콘텐츠와 인터리브되지 않고 명확하게 레이블이 지정된 출력 섹션에 나타나는지 쉽게 확인할 수 있습니다.
학술 OCR 출력에 대한 인식 후 정리
세심한 전처리와 구역 구성에도 불구하고 빽빽하게 들어찬 학술 페이지에서는 일부 인식 오류가 불가피합니다. 구조화된 인식 후 정리 프로세스는 텍스트가 최종 문서에 입력되기 전에 이러한 잔여 오류를 포착하고 수정합니다.
문서의 기본 언어로 설정된 맞춤법 검사 사전을 사용하여 본문 텍스트 출력에 대해서만 맞춤법 검사 패스를 실행합니다. 본문에서 철자가 틀린 것으로 표시된 단어가 각주 내용의 철자가 올바른 것으로 판명되는 것은 본문 텍스트 영역 경계가 너무 관대하고 각주 텍스트가 캡처되었음을 나타내는 명확한 신호입니다. 각주 조각을 수동으로 편집하는 대신 해당 페이지의 영역 경계를 조정하고 인식을 다시 실행하십시오.
각주 텍스트 출력의 경우 각 각주가 예상 참조 번호로 시작하는지, 각주 텍스트가 본문 텍스트 조각 없이 연속적으로 흐르는지 확인합니다. 일반적인 사후 인식 오류 패턴은 본문 텍스트 열이 예상된 영역 경계보다 페이지 아래쪽으로 확장된 각주 텍스트 중간에 본문 텍스트 줄이 나타나는 것입니다. 인식된 각주 텍스트와 함께 원본 페이지 이미지를 검토하면 문장 주제가 학문적 주제에서 관련 없는 본문 단락 주제로 갑자기 이동하기 때문에 이러한 침입을 빠르게 포착할 수 있습니다.
WukongPDF의 OCR 도구는 각주와 여백 내용이 포함된 다중 열 학술 논문을 포함하여 복잡한 페이지 레이아웃에 대한 영역 기반 인식을 지원합니다. 인식 패스를 시작하기 전에 언어, 글꼴 크기 범위 및 텍스트 방향에 대한 영역별 설정을 정의하면 동일한 페이지에서 단일 영역 처리보다 더 정확한 OCR PDF 출력이 생성되고, 분리된 출력 형식으로 인해 사후 인식 확인이 간단해집니다.
특수 사례 처리: 수학 표기법, 비라틴어 스크립트 및 혼합 언어
STEM 분야의 학술 논문은 텍스트 중복 문제에 수학적 표기법을 추가합니다. 본문 텍스트에 산재된 방정식과 수식은 수학 표기법이 기호, 그리스 문자, 그리고 산문 텍스트와 동일한 레이아웃 규칙을 따르지 않는 분수 및 위 첨자와 같은 2차원 형식을 사용하기 때문에 추가적인 분할 복잡성을 만듭니다. 문서 텍스트용으로 설계된 OCR 엔진은 수학 표기법에서 제대로 작동하지 않으며, 수학용으로 설계된 엔진은 문서 텍스트에서 제대로 작동하지 않습니다.
수학과 산문이 혼합된 페이지에 대한 가장 실용적인 접근 방식은 2단계 OCR 전략입니다. 첫 번째 패스에서는 문서에 최적화된 엔진을 사용하여 본문, 각주, 여백 인용을 포함한 모든 산문 텍스트 영역을 인식합니다. 두 번째 패스에서는 방정식이 포함된 특정 페이지 영역에서 수학 인식 엔진을 사용합니다. 두 출력을 문서 엔진의 산문 정확도와 수학 엔진의 수식 정확도를 모두 유지하는 결합된 문서로 병합하면 가장 신뢰할 수 있는 전체 결과가 생성됩니다.
각주에 아랍어, 중국어 또는 키릴 문자 인용문이 있는 영어 논문과 같이 라틴어와 비라틴어 스크립트가 혼합된 논문의 경우 각 인식 영역을 올바른 기본 스크립트로 구성하십시오. 본문 텍스트 영역은 문서의 기본 언어를 사용합니다. 라틴어가 아닌 스크립트 구절이 포함된 각주 영역에는 단일 텍스트 영역 내에서 스크립트 간에 전환할 수 있는 다중 스크립트 인식 구성이 필요할 수 있습니다.
아래 표에는 학술 논문의 다양한 페이지 영역에 권장되는 OCR 영역 구성이 요약되어 있습니다.
| 페이지 영역 | 예상 글꼴 크기 | 오리엔테이션 | 특수 설정 |
|---|---|---|---|
| 본문 텍스트 | 10-12포인트 | 수평의 | 선 분할 시 위 첨자 무시 |
| 각주 | 8-10포인트 | 수평의 | 인용에 라틴어가 아닌 텍스트가 포함된 경우 다중 스크립트 |
| 왼쪽 여백(줄 번호) | 7-9포인트 | 수평 또는 수직 | 별도의 출력으로 추출합니다. 몸과 합치지 마라 |
| 오른쪽 여백(인용) | 7-9포인트 | 수평의 | 별도의 출력으로 추출 |
| 방정식/공식 | 변하기 쉬운 | 2D 레이아웃의 수평 | 두 번째 패스에서 수학 인식 엔진 사용 |
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
