Tips & Tricks

여러 언어가 있는 경우 스캔한 PDF에서 하나의 특정 언어로만 텍스트를 추출하는 방법

이중 언어 메뉴를 스캔합니다. 요리 이름은 이탈리아어로 되어 있습니다. 설명은 영어로 되어 있습니다. 가격은 언어와 무관한 숫자입니다. 이탈리아어 단어 목록을 만들려면 이탈리아어 텍스트만 추출해야 하고, 다른 언어 쌍의 번역자에게 보내려면 영어 텍스트만 추출하면 됩니다. 전체 문서에 대해 OCR을 실행하면 두 언어가 혼합되어 검색 가능성에는 적합하지만 선택적 추출에는 적합하지 않습니다.

다중 언어 OCR PDF 문서에서 한 가지 언어로만 텍스트를 추출하려면 각 텍스트 블록이 어떤 언어로 작성되었는지 식별하고 대상 언어와 일치하는 블록만 추출할 수 있는 OCR 엔진이 필요합니다. 이는 언어에 관계없이 모든 텍스트를 인식하는 표준 OCR보다 더 선택적인 작업입니다.

How to Extract Text From a Scanned PDF in Only One Specific Language When Multiple Languages Are Present

언어 선택적 OCR 작동 방식

다중 언어를 지원하는 OCR 엔진은 여러 언어의 텍스트를 동시에 인식하도록 구성할 수 있습니다. "이탈리아어 및 영어"를 지정하면 OCR 언어로서 엔진은 두 언어 모두에서 텍스트를 인식합니다. 또한 인식된 각 텍스트 블록에 인식된 언어로 태그가 지정됩니다. 이탈리아어 텍스트 블록에는 이탈리아어로 태그가 지정됩니다. 영어 텍스트 블록은 영어로 태그가 지정됩니다. 언어 태깅을 통해 선택적 추출이 가능합니다.

OCR 후 인식된 텍스트를 언어 태그별로 필터링할 수 있습니다. 이탈리아어로 태그가 지정된 블록만 내보냅니다. 출력은 메뉴의 이탈리아어 텍스트만 포함하는 문서입니다. 인식되었지만 필터링된 영어 설명은 출력에 표시되지 않습니다. 이 선택적 추출은 다른 언어의 주변 텍스트와 격리된 특정 언어의 텍스트가 필요한 번역 워크플로, 언어 학습 자료 및 콘텐츠 분석에 유용합니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

단계별: 특정 언어로 된 텍스트 추출

스캔한 PDF를 WukongPDF의 OCR 도구에 업로드하세요. 문서에 있는 언어를 선택합니다. 이탈리아어-영어 메뉴의 경우 이탈리아어와 영어를 모두 선택하세요. OCR을 실행하세요. 이 도구는 모든 텍스트를 인식하고 각 블록에 언어별로 태그를 지정합니다. OCR이 완료되면 언어 필터를 사용하여 이탈리아어를 선택하세요. 필터링된 텍스트를 일반 텍스트 파일, Word 문서 또는 이탈리아어 블록만 포함된 새 PDF로 내보냅니다.

언어 감지의 정확성은 언어의 특수성에 따라 달라집니다. 이탈리아어와 영어는 동일한 알파벳을 사용하지만 단어 패턴이 다릅니다. OCR 엔진은 단어 빈도를 분석하여 이를 구별합니다. 이탈리아어에는 모음으로 끝나는 단어가 많습니다. 영어에는 자음으로 끝나는 단어가 많습니다. 언어가 명확할수록 언어 태그 지정이 더 정확해집니다. 스페인어 및 포르투갈어와 같이 밀접하게 관련된 두 언어는 짧은 텍스트 블록에서 엔진에 의해 혼동될 수 있습니다.

같은 줄에서 혼합 언어 텍스트 처리

일부 문서에는 프랑스어 문장과 영어 번역이 같은 줄에 짝을 이루는 언어 교과서와 같이 한 줄 안에 언어가 혼합되어 있습니다. OCR 엔진은 소수 언어 단어에 태그를 잘못 지정하여 전체 라인을 주요 언어로 분류할 수 있습니다. 이러한 문서의 경우 블록 수준의 언어 선택 추출은 충분히 정확하지 않습니다. 다른 접근 방식이 필요합니다.

대안은 각 언어를 단일 인식 언어로 사용하여 OCR을 두 번 실행하는 것입니다. 이탈리아어 전용 OCR 패스는 이탈리아어 텍스트를 잘 인식하지만 영어 텍스트를 손상시킵니다. 영어 전용 패스는 영어를 잘 인식하지만 이탈리아어를 엉망으로 만듭니다. 두 출력을 비교하고 각 텍스트 세그먼트에 대해 올바른 버전을 수동으로 선택하십시오. 이 이중 전달 접근 방식은 시간이 더 걸리지만 문장 수준에서 언어가 인터리브되는 문서에 대해 가장 정확한 언어별 추출을 생성합니다.

추출된 텍스트 확인 및 정리

대상 언어의 텍스트를 추출한 후 언어 필터링이 정확한지 확인합니다. 추출된 텍스트에서 분명히 잘못된 언어로 된 단어를 검색합니다. 메뉴에서 추출한 이탈리아어 텍스트에는 "grilled"와 같은 영어 단어가 포함되어서는 안 됩니다. 또는 "함께 제공" 메뉴가 이탈리아어 설명에서 의도적으로 해당 단어를 사용하지 않는 한. 예상치 못한 외국어가 포함된 필터링된 텍스트는 수동 수정이 필요한 언어 태그 오류를 나타냅니다.

대상 언어로 맞춤법 검사를 실행합니다. 이탈리아어 맞춤법 검사는 이탈리아어 추출에 잘못 포함된 영어 단어를 표시합니다. 맞춤법 검사 플래그는 추출된 모든 단어를 읽지 않고도 언어 태그 오류를 찾는 효율적인 방법입니다. 언어 필터링 및 맞춤법 검사를 거친 PDF 데이터 추출은 번역, 분석 또는 보관할 준비가 되었습니다. WukongPDF의 스캔 PDF OCR(언어 필터링 포함)은 원치 않는 언어를 제거하기 위한 혼합 언어 OCR 출력 후처리보다 더 깔끔한 단일 언어 추출을 생성합니다.

언어 선택형 OCR을 위한 실제 응용 프로그램: 번역된 문서에서 이중 언어 용어집 만들기. 모든 소스 언어 용어와 모든 대상 언어 용어를 별도로 추출합니다. 각 소스 용어는 페이지 또는 인접한 열의 거의 동일한 수직 위치에 해당 대상 용어를 갖기 때문에 페이지에서의 위치를 기준으로 정렬합니다. 정렬된 출력은 번역가가 향후 번역 전반에 걸쳐 일관성을 보장하는 데 사용할 수 있는 용어 목록이 됩니다. 이 용어집 작성 기술은 일관된 용어가 중요한 기술 번역에 널리 사용됩니다.

2열 이중 언어 계약과 같이 언어가 별도 열에 있는 문서의 경우 언어 선택 추출이 열 선택 작업이 됩니다. 왼쪽 열은 하나의 언어이고 오른쪽 열은 다른 언어입니다. 유사한 언어를 혼동시킬 수 있는 언어 감지에 의존하는 대신 PDF를 잘라내어 각 열을 별도로 추출하세요. 각 열에 대해 단일 언어 OCR을 실행합니다. 이 열 자르기 접근 방식은 명확한 열 언어 구분이 있는 문서에 대한 언어 필터링보다 더 안정적입니다.

역사적 다국어 문서와 관련된 보관 프로젝트의 경우 언어 선택형 OCR과 메타데이터 태깅이 결합되어 연구자가 수천 개의 문서에서 특정 언어로 된 콘텐츠를 찾을 수 있는 검색 가능한 아카이브를 생성합니다. 각 문서의 OCR 출력에는 감지된 언어로 태그가 지정됩니다. 18세기 프랑스어 문서를 검색하는 연구자는 다국어 컬렉션 전체에서 프랑스어 텍스트만 필터링할 수 있습니다. 이러한 선택적 접근 방식은 언어를 혼합하는 무딘 도구에서 언어 연구를 위한 정밀 도구로 보관 OCR을 변환합니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →