이중 언어 계약서를 스캔합니다. 왼쪽 열은 영어입니다. 오른쪽 열은 스페인어입니다. 두 언어 모두 검색 가능해야 하지만 한 언어에 대해 구성된 표준 OCR 실행으로 인해 다른 언어가 손상됩니다. 스페인어 텍스트에 적용된 영어 OCR은 인식 엔진이 다른 문자 빈도와 단어 패턴을 예상하기 때문에 말도 안되는 결과를 생성합니다. 영어에 스페인어 OCR을 적용하면 비슷하게 잘못된 결과가 나타납니다. 두 언어를 동시에 이해하는 OCR이 필요합니다.
다중 언어 OCR PDF은 단일 문서 내에서 언어 모델 간에 전환할 수 있는 최신 인식 엔진의 기능입니다. 엔진은 각 텍스트 블록이 어떤 언어로 작성되었는지 감지하고 적절한 인식 모델을 적용합니다. 그 결과 문서의 모든 언어에서 텍스트가 정확하게 인식됩니다.

OCR 엔진이 다중 언어를 처리하는 방법
OCR 엔진은 각 언어에서 문자가 어떻게 보이는지에 대한 훈련된 모델과 문자 모양을 비교하여 텍스트를 인식합니다. 영어 모델은 문자 "e"가 문자임을 알고 있습니다. 가장 일반적인 것은 "th"입니다. 자주 함께 나타나며 "qx"와 같은 특정 문자 조합은 거의 발생하지 않습니다. 스페인 모델은 "a"와 같은 악센트 문자가 있다는 것을 알고 있습니다. 악센트가 있는 "n" 물결표와 반전된 물음표가 일반적입니다. 프랑스 모델은 빈번한 악센트 모음과 특정 이중 문자를 기대합니다.
OCR 작업에 대해 여러 언어를 지정하면 엔진은 지정된 모든 언어에 대한 문자 모델을 로드합니다. 페이지의 각 텍스트 블록을 처리하면서 관찰된 문자 패턴과 가장 잘 일치하는 언어 모델을 평가하고 해당 모델을 적용합니다. 언어 감지는 텍스트 블록 수준에서 자동으로 발생하므로 영어 본문 텍스트와 프랑스어 각주가 있는 페이지는 수동 언어 태그 없이 올바르게 처리됩니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
다국어 OCR 설정
OCR 도구의 언어 선택에서는 여러 언어가 허용됩니다. 문서에 나타나는 언어를 모두 선택하세요. 영어-스페인어 이중 언어 계약의 경우 영어와 스페인어를 모두 선택하세요. 영어, 프랑스어, 독일어가 포함된 유럽 연합 문서의 경우 세 가지를 모두 선택하세요. 영어 텍스트와 고대 그리스어 인용문이 포함된 학술 저작물의 경우 영어와 그리스어를 선택하세요. 엔진은 필요한 모든 모델을 로드합니다.
언어 적용 범위와 정확성 사이에는 상충 관계가 있습니다. 언어가 추가될 때마다 인식 프로세스에 더 많은 문자 모델이 추가되므로 다른 언어의 유사한 문자 간에 혼동이 발생할 가능성이 높아집니다. 키릴 문자 "a" 라틴 문자 "a"와 동일하게 보입니다. 그러나 다른 소리를 나타내고 다른 맥락에서 나타납니다. 불필요한 언어를 추가하면 엔진이 텍스트 블록을 잘못 분류하고 잘못된 언어 모델을 적용할 위험이 커집니다. 유용할 수 있다고 생각되는 모든 언어가 아닌 문서에 실제로 나타나는 언어만 선택하십시오.
일반적인 다국어 OCR 시나리오 및 처리 방법
가장 일반적인 다중 언어 시나리오는 주로 한 언어로 작성되고 다른 언어로 짧은 구절, 인용문 또는 각주가 포함된 문서입니다. 각주에 프랑스어 인용문이 포함된 영어 학술 논문입니다. 영어 기술 용어가 포함된 독일어 사용 설명서입니다. 영어로 정의된 용어를 사용하는 스페인어로 된 법적 계약입니다. 이러한 문서의 경우 기본 언어는 대부분의 텍스트를 전달하고 보조 언어는 짧고 예측 가능한 컨텍스트로 나타납니다.
언어 전환이 특정 텍스트 블록에 국한되어 있기 때문에 인식 엔진은 이러한 혼합 언어 문서를 잘 처리합니다. 영문 본문 텍스트는 영문 모델로 인식됩니다. 프랑스어 인용은 프랑스어 모델로 인식됩니다. 두 언어가 별도의 텍스트 블록에 나타나기 때문에 엔진의 언어 감지는 각 블록에 사용할 모델을 올바르게 식별합니다.
더 어려운 시나리오는 영어로 된 문장을 보여주고 같은 줄에 스페인어로 번역한 내용을 보여주는 언어 교과서와 같이 언어가 같은 줄에 인터리브되는 문서입니다. OCR 엔진은 전체 줄을 하나의 텍스트 블록으로 처리하고 모든 줄에 하나의 언어 모델을 적용하여 다른 언어로 된 줄의 절반에 오류를 생성할 수 있습니다. 이러한 문서의 경우 가장 정확한 접근 방식은 각 언어별로 한 번씩 문서를 두 번 OCR하고 결과를 수동으로 병합하는 것입니다. 이는 노동 집약적이며 정확성이 중요한 짧은 문서에만 실용적입니다.
다국어 OCR 결과 확인
다국어 OCR을 실행한 후 각 언어의 텍스트를 확인하여 결과를 확인합니다. 알고 있는 단어를 검색하면 각 언어에 표시됩니다. 검색으로 찾은 것을 확인합니다. 각 언어의 텍스트를 선택하고 복사하여 문자가 올바른지 확인하세요. 악센트가 있는 문자와 특수 기호에 특별한 주의를 기울이십시오. 스캔된 PDF 인식은 엔진이 기본적으로 가장 가까운 라틴어 해당 항목을 사용할 수 있기 때문에 주요 언어 모델에 존재하지 않는 문자에 대해 실패할 가능성이 높습니다.
다국어 문서의 일반적인 OCR 오류에는 악센트가 있는 문자가 악센트가 없는 문자로 대체되고, 악센트가 있는 e가 e가 되고, 물결표가 있는 n이 n이 되고, 스페인어의 반전된 물음표와 같은 특수 구두점이 표준 물음표로 대체되고, 키릴 자모나 그리스어와 같은 비라틴어 스크립트가 시각적으로 유사한 라틴 문자로 잘못 인식되는 경우가 있습니다. 이러한 오류는 일반적으로 보조 언어 구절에 집중되어 있습니다. 보조 언어 콘텐츠가 중요한 경우 해당 구절을 원본 문서와 비교하여 수동으로 확인하세요. WukongPDF의 OCR 도구는 인식된 각 텍스트 블록에 대한 신뢰도 점수를 제공하며, 점수가 낮을수록 인식 엔진이 덜 확실한 블록을 나타냅니다.
중국어 또는 아랍어 인용문이 포함된 영어 문서와 같이 라틴어 알파벳 언어와 비라틴어 스크립트가 혼합된 문서의 경우 문자 모양이 근본적으로 다르기 때문에 다중 언어 OCR 문제가 더 중요합니다. 인식 엔진은 완전히 별개의 쓰기 시스템을 구별해야 합니다. 문서에 나타나는 각 스크립트 모음에 대한 특정 언어를 선택합니다. WukongPDF의 PDF 형식 처리는 단일 OCR 작업에서 라틴어, 키릴 문자, 아랍어, CJK 및 인도어 스크립트의 혼합을 지원하지만 정확도는 스크립트 및 스캔 품질에 따라 다릅니다.
서로 다른 언어 섹션이 있는 문서의 다국어 OCR을 개선하기 위한 실용적인 기술: OCR을 실행하기 전에 문서를 언어별로 미리 분리합니다. 20페이지 계약서의 처음 10페이지가 영어이고 마지막 10페이지가 스페인어인 경우 문서를 두 개의 파일로 분할하고 첫 번째 파일에 영어 OCR을 실행하고 두 번째 파일에 스페인어 OCR을 실행한 후 다시 병합합니다. 이는 다중 언어 모델 오버헤드를 완전히 방지하고 각 OCR 작업이 처리 중인 정확한 텍스트에 최적화된 단일 언어 모델을 사용하기 때문에 약간 더 높은 정확도를 제공합니다. 분할, OCR 개별, 재병합 워크플로는 몇 분 더 걸리지만 명확한 언어 경계가 있는 문서에 대해 최고의 정확성을 안정적으로 생성합니다. 언어가 실제로 동일한 페이지에 인터리브되어 있고 분리가 비현실적인 문서에는 다중 언어 OCR 접근 방식을 예약하세요.
다국어 OCR을 위한 마지막 팁: 문서에 영어나 프랑스어와 같은 왼쪽에서 오른쪽 스크립트와 함께 아랍어, 히브리어 또는 페르시아어와 같은 오른쪽에서 왼쪽으로 쓰는 스크립트가 포함되어 있는 경우 텍스트 방향이 복잡해집니다. OCR 엔진은 각 텍스트 블록이 어떤 언어로 되어 있는지뿐만 아니라 텍스트 흐름 방향도 감지해야 합니다. 아랍어 텍스트 블록은 오른쪽에서 왼쪽으로 인식되어야 하며, 그 아래의 영어 캡션은 왼쪽에서 오른쪽으로 인식되어야 합니다. 대부분의 최신 OCR 엔진은 설정에서 두 언어군을 모두 지정하면 혼합 방향 문서를 합리적으로 잘 처리합니다. OCR 후 아랍어 한 구절을 복사하여 텍스트 편집기에 붙여넣어 텍스트 방향을 확인합니다. 문자는 역순이 아닌 올바른 읽기 순서로 표시되어야 합니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
