표준 OCR 엔진은 텍스트가 페이지 전체에서 왼쪽에서 오른쪽으로 수평으로 실행된다는 기본적인 가정을 바탕으로 구축되었습니다. 이 가정은 영어, 스페인어, 프랑스어, 독일어 및 대부분의 유럽 언어에 적용됩니다. 전통적인 열에 수직으로 설정된 일본어 텍스트, 문자가 위에서 아래로 쌓이는 중국어 기호, 텍스트가 오른쪽에서 왼쪽으로 흐르는 아랍어 및 히브리어 문서의 경우 완전히 실패합니다. 이러한 문서에 대해 표준 OCR을 실행하면 문자가 개별적으로 인식되지만 잘못된 순서로 조합되어 결과가 쓸모 없게 되는 출력이 생성됩니다.
비표준 텍스트 방향을 처리하는 OCR PDF 엔진의 기능은 최신 AI 기반 인식 시스템을 통해 크게 향상되었습니다. 이러한 엔진은 인식을 시도하기 전에 텍스트 방향을 감지하고, 읽는 방향을 식별하고, 시각적 레이아웃에 관계없이 논리적인 읽기 순서를 재구성합니다. 영어 가로 인용문이 포함된 일본어 기사와 같이 텍스트 방향이 혼합된 문서의 경우 엔진은 페이지 중간에 모드를 전환합니다.

OCR 엔진이 텍스트 방향을 감지하고 처리하는 방법
최신 OCR 엔진은 텍스트 영역을 식별하고 방향을 결정하며 읽기 방향에 따라 분류하는 레이아웃 분석 단계로 시작됩니다. 가로 텍스트의 경우 엔진은 기준선을 감지하고 그에 따라 문자를 그룹화합니다. 세로 텍스트의 경우 엔진은 세로 축을 감지하고 열의 문자를 그룹화합니다. 오른쪽에서 왼쪽으로 쓰는 텍스트의 경우 엔진은 주요 문자 집합을 식별하고 기본 왼쪽에서 오른쪽 단어 순서를 반대로 바꿉니다.
텍스트 방향 감지는 여러 신호에 의존합니다. 특정 유니코드 문자 범위가 존재한다는 것은 가능한 언어와 일반적인 텍스트 방향을 나타냅니다. 가로줄이든 세로줄이든 감지된 문자의 공간적 배열은 레이아웃 증거를 제공합니다. 문자 경계 상자의 가로 세로 비율은 세 번째 신호를 제공합니다. 라틴 문자는 일반적으로 키보다 폭이 넓고 CJK 문자는 대략 정사각형이며 아랍어 문자는 읽는 방향을 나타내는 방식으로 가로로 연결됩니다.
가장 안정적인 OCR 엔진은 세 가지 신호 유형을 모두 결합합니다. 오른쪽에서 왼쪽으로 읽기를 의미하는 아랍어 스크립트와 왼쪽에서 오른쪽으로 읽기를 의미하는 라틴어 스크립트를 모두 포함하는 문서에서는 엔진이 각 텍스트 영역을 독립적으로 분석해야 합니다. 다국어 문서에 대해 올바르게 구성된 PDF 데이터 추출 파이프라인에는 전체 페이지에 단일 방향을 적용하는 대신 영역별 방향 감지가 포함됩니다.
각 쓰기 시스템에는 근본적으로 다른 OCR 구성이 필요합니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
일본어, 중국어, 한국어의 세로 텍스트에 대한 OCR 설정
다테가키(tategaki)라고 불리는 일본어 세로 쓰기 텍스트는 현대에서 사용되는 가장 일반적인 세로 쓰기 시스템입니다. 소설, 신문, 전통 문서, 공식 서신에 나타납니다. 세로 방향 일본어에서는 문자를 위에서 아래로 읽으며 열은 페이지 전체에서 오른쪽에서 왼쪽으로 진행됩니다. 세로 일본어 텍스트에 포함된 숫자 및 라틴 스크립트 단어는 세로 흐름 내에서 회전되거나 가로로 설정될 수 있습니다.
세로 일본어 텍스트를 OCR하려면 다테가키를 명시적으로 지원하는 인식 엔진을 선택하세요. 범용 OCR 엔진은 문자를 올바르게 감지할 수 있지만 왼쪽에서 오른쪽 가로 순서로 출력하므로 가비지가 생성됩니다. 일본어 전용 OCR 엔진은 열 기반의 읽기 순서를 이해하여 자연스럽게 읽을 수 있는 텍스트를 출력합니다. 오픈 소스 OCR 엔진인 Tesseract는 버전 5에서 향상된 수직 일본어 지원을 추가했으며 현재 여러 상용 엔진에서 이를 제공하고 있습니다.
전통적인 출판물, 서예 및 일부 공식 문서에 나타나는 중국어 세로 텍스트의 경우 인식 문제는 비슷하지만 문자 집합이 더 큽니다. 중국어 간체는 일반적으로 약 7,000자를 사용하는 반면, 중국어 번체는 13,000자 이상을 사용합니다. OCR 엔진은 세로 레이아웃을 감지할 뿐만 아니라 획 세부 사항만 다른 시각적으로 유사한 문자도 구별해야 합니다.
한글의 세로글은 현대문서에서는 드물지만, 역사서와 일부 전통출판물에는 등장한다. 한국어 알파벳인 한글은 개별 문자를 음절 블록으로 조합하고 세로 쓰기에서는 이러한 블록이 위에서 아래로 쌓입니다. 한국어 세로 텍스트를 처리하는 OCR 엔진은 음절 블록 구조는 물론 각 블록 내의 개별 문자 구성 요소도 인식해야 합니다.
아랍어, 히브리어, 페르시아어의 오른쪽에서 왼쪽 텍스트에 대한 OCR 설정
아랍어 OCR은 텍스트 방향 이상의 독특한 과제를 제시합니다. 아랍어는 대부분의 문자가 이웃 문자와 연결되는 필기체이며 문자의 모양은 단어의 위치(초기, 중간, 끝 또는 고립)에 따라 달라집니다. OCR 엔진은 이러한 문맥 형식을 인식하고 이를 올바른 추상 문자에 매핑해야 합니다. 문자 간의 연결이 누락되거나 잘못된 연결로 인해 필기체 스크립트에 특정한 인식 오류가 발생합니다.
히브리어 OCR을 선택하면 스크립트는 필기체가 아니지만 문자 위, 아래 또는 내부에 점과 대시로 표시되는 niqqud라는 모음 점이 포함됩니다. 이러한 모음 표시는 스캔된 이미지에서 일반적으로 2~4픽셀로 작으며 이진화 중에 쉽게 손실됩니다. niqqud를 명시적으로 처리하지 않는 OCR 엔진은 자음을 올바르게 인식하지만 모음 표시를 삭제하여 사람이 이해할 수는 있지만 기술적으로 불완전한 텍스트를 생성합니다.
페르시아어와 우르두어는 추가 문자가 포함된 아랍어 스크립트의 확장 버전을 사용합니다. 아랍어로만 훈련된 OCR 엔진은 이러한 추가 문자를 놓치거나 유사한 아랍어 문자로 잘못 인식합니다. 이러한 언어에 대한 OCR 엔진을 선택할 때 일반적인 아랍어 스크립트뿐만 아니라 문서에서 사용하는 정확한 언어 및 스크립트 변형에 대한 지원이 구체적으로 나열되어 있는지 확인하십시오.
혼합 방향 문서 처리
많은 실제 문서에서는 동일한 페이지에 여러 텍스트 방향이 혼합되어 있습니다. 일본어 기술 문서에는 세로 일본어 본문 텍스트, 가로 영어 그림 캡션 및 자체 레이아웃 규칙을 따르는 수학 방정식이 있을 수 있습니다. 아랍어 비즈니스 서신에는 오른쪽에서 왼쪽으로 본문 텍스트 위에 왼쪽에서 오른쪽 형식으로 영어 회사 이름과 주소 블록이 포함될 수 있습니다.
방향이 혼합된 문서의 경우 OCR 전처리 단계가 중요합니다. 문서는 텍스트 영역으로 분할되어야 하며, 각 영역은 텍스트 방향에 대해 독립적으로 분류되어야 인식이 시작됩니다. 복잡한 레이아웃의 경우 수동 영역 선택이 자동 분할보다 더 나은 결과를 생성하는 경우가 많습니다. 각 텍스트 영역 주위에 경계 상자를 그리고 각 상자에 올바른 언어와 방향을 할당합니다.
OCR 후 방향 경계를 넘는 텍스트를 확인하여 출력을 확인합니다. 혼합 방향 OCR의 일반적인 오류는 두 텍스트 영역 사이의 경계가 잘못되어 왼쪽에서 오른쪽 영역의 마지막 단어가 오른쪽에서 왼쪽 영역의 시작 부분에 추가되거나 그 반대의 경우입니다. 이러한 경계 영역을 즉시 검사하면 혼란스러운 출력을 생성할 수 있는 레이아웃 분할 오류를 포착할 수 있습니다.
비표준 텍스트 방향에 대한 사후 OCR 처리
OCR이 완료된 후 자연스러운 읽기 순서를 생성하기 위해 인식된 텍스트를 다시 정렬해야 할 수도 있습니다. 일부 OCR 엔진은 인식된 순서대로 각 열 내에서 위에서 아래로, 왼쪽에서 오른쪽으로 열별로 세로 일본어 텍스트를 출력합니다. 이 순서는 오른쪽에서 왼쪽으로 한 열씩 읽는 원래 읽기 순서와 일치하지 않습니다. 열을 다시 정렬하는 후처리 단계를 통해 올바른 읽기 순서가 생성됩니다.
양방향 텍스트, 영어 용어가 포함된 아랍어를 포함하는 스캔 PDF 콘텐츠가 있는 문서의 경우 유니코드 양방향 알고리즘은 표시 순서를 결정하는 방법을 지정합니다. OCR 출력에는 유니코드 양방향 제어 문자가 포함되거나 알고리즘을 따라야 양방향 텍스트를 지원하는 응용 프로그램에 붙여넣을 때 텍스트가 올바르게 표시됩니다.
WukongPDF는 주요 오른쪽에서 왼쪽 및 세로 쓰기 시스템에 대한 지원을 포함하는 언어 선택 옵션과 함께 브라우저를 통해 스캔한 PDF에 대한 OCR 처리를 제공합니다. 전체 문서를 처리하기 전에 샘플 페이지에서 OCR을 테스트하면 텍스트 방향이 올바르게 처리되고 있는지 확인할 수 있습니다.
주요 기사는 세로이지만 캡션과 사이드바는 가로인 일본 잡지 레이아웃과 같이 같은 페이지에 세로 및 가로 텍스트가 모두 포함된 문서의 경우 수동 영역 지정이 가장 정확한 OCR 결과를 생성합니다. 수직 및 수평 영역에 대해 별도의 인식 영역을 그리고 각각에 올바른 텍스트 방향을 할당한 다음 영역이 지정된 문서에서 OCR을 실행합니다. 구역 지정에 소요되는 추가 시간은 인식 정확도로 보상됩니다.
비표준 텍스트 레이아웃이 있는 과거 문서를 처리할 때는 최신 인쇄 문서보다 OCR 정확도가 낮다는 점에 유의하세요. 오래된 글꼴, 고르지 못한 인쇄, 변색된 오래된 용지, 비표준 문자 변형 등은 모두 인식 신뢰도를 떨어뜨립니다. 학술 또는 보관 작업의 경우 OCR 출력을 완제품이 아닌 수동 전사의 시작점으로 취급하십시오.
일부 OCR 엔진은 문서에 사용된 특정 글꼴이나 필기 스타일의 예를 제공하는 교육 모드를 지원합니다. 몇 가지 대표 페이지에서 엔진을 훈련하면 전체 문서의 인식 정확도가 향상됩니다. 이 접근 방식은 특이한 서체로 인쇄된 문서나 여러 권에 걸쳐 타이포그래피가 일관적인 동일한 출판사의 문서 모음에 특히 유용합니다.
오른쪽에서 왼쪽으로 작성된 문서에서 OCR이 완료된 후 출력에서 몇 문장을 복사하여 Microsoft Word 또는 Google Docs와 같은 양방향 텍스트를 지원하는 애플리케이션에 붙여넣어 텍스트 방향이 올바른지 확인합니다. 텍스트가 역순으로 나타나는 경우 OCR 엔진이 오른쪽에서 왼쪽 방향을 올바르게 적용하지 않은 것이므로 올바른 방향 설정으로 출력을 다시 처리해야 합니다.
비표준 텍스트 방향에 대한 올바른 OCR 매개변수를 설정하는 데 투자한 시간은 인식 정확도로 즉시 보상됩니다. OCR이 불량한 후 30분의 수동 수정이 필요한 문서는 OCR을 올바르게 구성한 후 정리하는 데 5분만 필요할 수 있습니다.
| 라이팅 시스템 | 방향 | OCR 엔진 요구 사항 | 주요 과제 |
|---|---|---|---|
| Japanese (tategaki) | 위에서 아래로, 오른쪽에서 왼쪽으로 열 | 명시적인 tategaki 지원 엔진 | 수직 흐름에 수평 영어가 혼합되어 있음 |
| 중국어(번체) | 수직 열, 오른쪽에서 왼쪽 | 큰 문자 세트(13,000+) | 시각적으로 유사한 캐릭터 |
| 아라비아 말 | 오른쪽에서 왼쪽으로 필기체 연결 | 위치 형식을 갖춘 아랍어 스크립트 엔진 | 상황별 문자 모양; 발음 구별 부호 |
| 헤브라이 사람 | niqqud를 사용하여 오른쪽에서 왼쪽으로 | 모음을 지원하는 히브리어 스크립트 엔진 | 이진화 시 작은 모음 표시가 손실됨 |
| 페르시아어/우르두어 | 오른쪽에서 왼쪽, 확장 아랍어 | 언어별 엔진 | 아랍어 세트 이외의 추가 문자 |
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
