글로벌 비즈니스, 학술 연구, 법률 문서 검토에서 자신이 사용하지 않는 언어로 작성된 스캔 PDF을 받는 것이 그 어느 때보다 일반적입니다. 텍스트를 추출하고, 번역하고, 문서의 내용을 이해해야 합니다. 문제는 단지 파일에 OCR을 실행하는 것이 아닙니다. 추출된 텍스트가 번역하기에 충분히 정확하도록 올바른 언어 설정으로 OCR을 실행하고 있습니다. OCR PDF 처리 중에 잘못된 언어를 선택하면 번역 엔진이 복구할 수 없는 잘못된 출력이 생성됩니다.
OCR 엔진은 문자를 볼 수 없습니다. 그들은 모양을 보고 그 모양을 특정 언어의 문자 패턴과 일치시킵니다. OCR 엔진에 문서가 영어로 되어 있지만 실제로는 러시아어로 되어 있다고 말하면 엔진은 키릴 문자 모양을 알고 있는 가장 가까운 라틴 문자로 매핑합니다. 그 결과 원본 텍스트와 아무런 관련이 없는 무작위로 보이는 문자 문자열이 생성됩니다. 올바른 언어 설정을 얻거나 가능한 경우 자동 감지를 사용하는 것은 전체 OCR-번역 파이프라인에서 가장 중요한 결정입니다.
WukongPDF의 PDF를 텍스트로 변환 및 OCR 도구는 번역 및 분석을 위해 스캔한 문서에서 텍스트를 추출합니다. 올바른 OCR 언어 선택과 신뢰할 수 있는 번역 서비스를 결합하면 읽을 수 없는 외국어 스캔을 5분 이내에 이해할 수 있는 문서로 변환할 수 있습니다.

1단계: 문서 언어 식별
OCR 소프트웨어를 터치하기 전에 문서의 언어를 확실하게 식별하십시오. 문서 메타데이터나 파일 이름에서 해당 언어를 암시하는 경우 거기서부터 시작하세요. 그렇지 않은 경우 PDF를 열고 몇 페이지를 살펴보십시오. 텍스트를 읽지 않고도 시각적 단서로 인해 가능성이 크게 좁아집니다. 스크립트 계열은 독특합니다. 라틴어 스크립트는 대부분의 유럽 언어에 사용됩니다. 키릴 문자는 러시아어, 우크라이나어, 불가리아어 및 세르비아어에 사용됩니다. 아랍어 문자에는 아랍어, 페르시아어, 우르두어가 포함됩니다. CJK는 중국어, 일본어, 한국어를 다룹니다. Devanagari는 힌디어, 마라티어, 네팔어를 다룹니다.
스크립트군조차 시각적으로 식별할 수 없는 경우에는 대표 문단의 스크린샷을 찍어 Google 번역의 이미지 번역 기능이나 역 이미지 검색에 업로드하세요. 이러한 도구는 대부분의 경우 스크립트와 특정 언어를 모두 식별합니다. 문서가 라오스어가 아닌 태국어, 일본어가 아닌 한국어라는 사실을 아는 것은 정확한 OCR 출력과 쓸모없는 문자 노이즈의 차이를 만듭니다.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
2단계: 대상 언어를 지원하는 OCR 도구 선택
모든 OCR 도구가 모든 언어를 지원하는 것은 아닙니다. Adobe Acrobat Pro에는 약 40개 언어에 대한 OCR 엔진이 함께 제공됩니다. 텍스트 인식 도구에는 설정 대화 상자에 언어 선택 드롭다운이 포함되어 있습니다. Google에서 유지 관리하는 무료 오픈 소스 OCR 엔진인 Tesseract는 다운로드 가능한 언어 데이터 파일을 통해 100개 이상의 언어를 지원합니다. Google Cloud Vision API는 200개 이상의 언어로 가장 광범위한 언어를 지원하며 자동 언어 감지를 선택 기능으로 포함합니다.
식별할 수 있는 단일 언어로 된 문서의 경우 OCR을 실행하기 전에 올바른 언어를 지정하면 이러한 도구 중 하나가 작동합니다. 영어와 프랑스어로 된 조항이 있는 이중 언어 계약서와 같이 여러 언어가 포함된 문서의 경우 여러 동시 언어를 지원하거나 단락별로 자동 감지할 수 있는 도구가 필요합니다. 적절한 언어 데이터 팩을 갖춘 Google Cloud Vision과 Tesseract는 둘 다 다국어 문서를 처리하지만 언어 전환 경계의 정확성은 결코 완벽하지 않습니다.
3단계: 올바른 언어로 OCR 구성 및 실행
Adobe Acrobat Pro에서 스캔한 PDF를 열고 도구, 스캔 및 OCR로 이동하여 텍스트 인식, 이 파일에서를 차례로 선택합니다. 언어 선택기 옆에 있는 편집 버튼을 클릭하세요. 텍스트 인식 대화 상자의 드롭다운에서 올바른 기본 언어를 선택하세요. 문서에 두 번째 언어가 포함되어 있으면 언어 추가 버튼을 클릭하고 해당 언어도 선택하세요. Acrobat은 두 언어를 동시에 처리합니다. 확인을 클릭한 다음 텍스트 인식을 클릭하세요. Acrobat은 OCR 패스를 실행하고 인식된 텍스트를 스캔한 이미지 뒤에 보이지 않는 레이어로 포함시킵니다. 이제 문서를 검색할 수 있습니다.
Tesseract에서 명령줄 호출은 -l 플래그를 사용하여 언어를 지정합니다. 러시아어의 경우 tesseract input.pdf 출력 -l rus, 일본어의 경우 tesseract input.pdf 출력 -l jpn 또는 이중 언어 프랑스어-영어 문서의 경우 tesseract input.pdf 출력 -l fra+eng. 필요한 언어 데이터 파일을 먼저 설치하십시오. Tesseract는 기본적으로 영어로만 제공됩니다. Google Cloud Vision의 경우 API 호출에는 BCP-47 언어 코드 배열을 허용하는 LanguageHints 매개변수가 포함됩니다. Cloud Vision은 언어 힌트가 전혀 필요하지 않은 자동 언어 감지 모드도 제공하므로 문서의 언어를 실제로 모르는 경우 가장 간단한 옵션이 됩니다.
4단계: 추출된 텍스트 복사 및 번역
OCR이 완료된 후 번역을 보내기 전에 텍스트 품질을 확인하십시오. Acrobat에서 찾기 도구를 열고 문서에서 인식하는 일반적인 단어를 검색합니다. 검색 결과 일치하는 항목이 발견되면 OCR이 작동한 것입니다. 추출된 텍스트의 단락을 선택하고 복사한 후 일반 텍스트 편집기에 붙여넣습니다. 반복되는 기호, 중간에 끊어지는 단어, 인식할 수 없는 큰 문자 블록 등 명백한 OCR 오류를 검색합니다. 텍스트의 5% 이상이 손상된 것으로 나타나면 다른 언어 설정이나 더 높은 해상도 설정으로 OCR을 다시 실행하십시오.
추출된 텍스트가 시각적 온전성 검사를 통과하면 전체 텍스트를 복사하여 번역 도구에 붙여넣습니다. Google 번역, DeepL 또는 Microsoft 번역기는 모두 일반 텍스트 입력을 허용합니다. 긴 문서의 경우 DeepL과 Google Translate는 수동 복사 단계를 건너뛰는 검색 가능한 PDF의 직접 파일 업로드를 지원합니다. 번역 출력은 이해, 연구 및 내부 비즈니스 용도로 충분합니다. 법률, 의료 또는 출판 수준의 정확성을 위해 검색 가능한 PDF를 전문 번역가에게 보내십시오. 그러면 번역자는 OCR 레이어를 시작점으로 사용하고 원본 스캔 페이지에 대해 기계 번역을 수정합니다.
스크립트가 혼합되어 있거나 표준이 아닌 글꼴이 포함된 문서 처리
라틴어 스크립트에 영어 기술 용어가 포함된 아랍어 연구 논문과 같이 스크립트가 혼합된 문서는 단일 스크립트를 기대하는 OCR 엔진을 혼란스럽게 합니다. 먼저 주요 스크립트에 대해 OCR을 구성한 다음 동일한 문서에서 소수 스크립트를 대상으로 두 번째 단계를 실행합니다. 두 OCR 레이어를 모두 내보내고 텍스트 편집기에서 결합하여 결과를 병합합니다. 엔진이 기본 스크립트에 최적화되어 있기 때문에 소수 스크립트 구절의 정확도가 낮아집니다.
장식용 서체, 오래된 타자기 글꼴, 필기체 글꼴 등 비표준 글꼴은 올바른 언어를 선택하더라도 OCR 정확도를 떨어뜨립니다. PDF 페이지를 400DPI 이상의 고해상도 이미지로 변환하고, 선명하게 하기 필터를 적용하고, 대비를 높여 OCR 엔진에 공급하는 방식으로 이러한 문서를 사전 처리합니다. 자동 페이지 분할을 위해 --psm 3을 사용하여 활성화된 Tesseract의 내장 전처리는 적당한 글꼴 변형을 처리합니다. 심각하게 품질이 저하되거나 스타일이 지정된 텍스트의 경우 Google Cloud Vision API는 일반적으로 모델이 더 큰 실제 글꼴 샘플 모음에서 훈련되었기 때문에 로컬 OCR 엔진보다 성능이 뛰어납니다.
| OCR 도구 | 다중 언어 지원 | 자동 감지 | 에 가장 적합 |
|---|---|---|---|
| 어도비 아크로뱃 프로 | 40개 이상의 언어 | 수동 선택 | 전문적인 문서, 높은 정확도 |
| 테서랙트(오픈소스) | 100개 이상의 언어 | 수동 선택 필요 | 일괄 처리, 스크립팅, 무료 |
| 구글 클라우드 비전 | 200개 이상의 언어 | 자동 감지 가능 | API 통합, 혼합 스크립트 |
| 온라인 OCR 서비스 | 10~50개 언어 | 수동 선택 | 빠른 단일 문서 OCR |
번역된 콘텐츠에 대한 조치를 취하기 전 정확성 확인
OCR에 이어 기계 번역을 수행하면 OCR 오인식과 번역 모호함이라는 두 가지 잠재적 오류가 발생합니다. 중요한 문서의 경우 이중 언어를 사용하는 동료나 전문 번역가에게 무작위로 선택한 번역 단락을 원본 PDF와 비교하도록 요청하여 출력물을 무작위로 확인하세요. 5분 동안의 확인을 통해 그럴듯해 보이지만 완전히 잘못된 텍스트를 생성하는 잘못된 언어 설정과 같은 치명적인 오류를 포착합니다.
외국어로 스캔한 PDF를 정기적으로 처리하는 경우 체크리스트를 작성하십시오. 즉, 언어 식별, 일치하는 OCR 엔진 선택, 올바른 언어 매개변수로 OCR 실행, 추출된 텍스트의 문자 정확성 무작위 검사, 번역 및 샘플 단락 확인이 가능합니다. 2~3개의 문서 이후에는 워크플로가 일상화되어 파일을 열고 번역된 결과를 읽는 데 5분도 채 걸리지 않습니다.
문서 처리와 관련하여 보안에 민감한 문서의 경우 오프라인 OCR은 클라우드 노출을 완전히 방지합니다. Tesseract는 언어 데이터 파일을 한 번 다운로드한 후 네트워크 요청 없이 로컬로 실행됩니다. Adobe Acrobat Pro는 Document Cloud에 로그인하지 않고도 텍스트 인식 기능을 통해 로컬로 OCR을 수행합니다. 법적 자료 제출 또는 민감한 비즈니스 서신과 같은 기밀 외국어 자료의 경우 오프라인 텍스트 검토와 결합된 로컬 OCR이 원본 문서 콘텐츠를 통제된 환경 내에 유지합니다.
OCR만으로는 충분하지 않은 경우: 보조 전사 서비스
극심한 글꼴 저하, 손으로 쓴 텍스트 또는 심하게 혼합된 스크립트로 인해 OCR 정확도가 사용할 수 없을 정도로 낮은 문서의 경우 보조 전사 서비스가 사람이 검증한 출력을 제공합니다. 이러한 서비스는 초기 기계 OCR 통과와 사람의 검토 및 수정을 결합하며 일반적으로 페이지당 비용을 청구합니다. 처리 시간은 몇 시간에서 며칠까지입니다. 외국어 출생 증명서나 특허 출원과 같이 정확성이 협상 불가능한 단일 중요한 문서의 경우, 사람이 전사하는 비용은 잘못 인식된 텍스트에 대한 조치의 위험으로 인해 정당화됩니다. 품질을 평가하려면 먼저 기계 OCR을 실행하십시오. 단어의 15% 이상이 인식되지 않거나 명백히 잘못된 경우 기계 출력을 수동으로 수정하는 데 시간을 소비하는 대신 보조 전사로 에스컬레이션하세요.
PDF OCR을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
