Tips & Tricks

PDF에 포함된 이미지 내부의 텍스트를 번역하는 방법

PDF 번역 도구는 문서의 텍스트 스트림을 처리하여 한 언어의 단어를 다른 언어로 변환합니다. 단락, 제목, 캡션을 읽습니다. 하지만 이미지 안에 있는 텍스트는 읽지 않습니다. 표지판 사진, 다른 언어로 된 사용자 인터페이스 스크린샷, 이미지의 일부로 렌더링된 축 레이블이 있는 차트 등에는 모두 표준 번역 도구가 무시하는 텍스트가 포함되어 있습니다. 텍스트가 PDF 텍스트 스트림에 없기 때문입니다. 이는 이미지 픽셀에 내장되어 있습니다. 포함된 이미지 내의 텍스트를 번역하려면 이미지를 추출하고, 이미지에 대해 OCR을 실행하고, 인식된 텍스트를 번역한 다음, 번역된 이미지를 다시 포함하거나 번역을 오버레이로 추가해야 합니다. 이미지가 포함된 텍스트에 대한 PDF 번역 워크플로는 표준 텍스트 번역보다 복잡하지만 그렇지 않으면 번역되지 않은 콘텐츠를 다룹니다.

How to Translate Text Inside Embedded Images in a PDF

번역 가능한 텍스트가 포함된 이미지 식별

PDF의 모든 이미지에 번역할 가치가 있는 텍스트가 포함되어 있는 것은 아닙니다. 장식 사진, 배경 질감, 회사 로고에는 번역 가능한 콘텐츠가 포함되어 있지 않을 수 있습니다. 소프트웨어 응용 프로그램의 스크린샷, 레이블이 지정된 구성 요소가 있는 다이어그램, 문서 또는 기호 사진, 축 레이블이 포함된 차트에는 모두 대상 언어의 독자가 이해해야 하는 텍스트가 포함되어 있습니다. PDF를 스캔하고 텍스트가 포함된 모든 이미지를 식별하세요. 번역 작업 흐름을 위해 이러한 이미지에 플래그를 지정하세요.

PDF에 텍스트가 포함된 이미지는 두 가지 범주로 분류됩니다. 스크린샷이나 레이블이 지정된 다이어그램과 같이 텍스트가 디자인에 따라 이미지의 일부인 경우와 문서가 디지털 방식으로 생성되지 않고 스캔되었기 때문에 이미지에 텍스트가 나타나는 경우입니다. 스캔한 PDF는 페이지당 하나의 큰 이미지입니다. 스캔한 페이지의 모든 텍스트는 페이지 이미지에 포함됩니다. 디지털로 생성된 PDF에는 텍스트 기반 페이지에 단일 스크린샷이 있을 수 있습니다. 번역이 필요한 PDF 이미지은 텍스트가 PDF 텍스트 스트림이 아닌 이미지 픽셀에 나타나는 이미지입니다.

WukongPDF

PDF 번역을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

이미지 추출 및 텍스트 인식

PDF에서 사용 가능한 최고 해상도로 이미지를 추출합니다. 원본 해상도를 유지하는 PDF 이미지 추출 도구를 사용하세요. 추출 단계에서 압축 아티팩트가 발생하지 않도록 추출된 각 이미지를 PNG 파일로 저장합니다. 추출된 각 이미지를 열고 텍스트를 읽을 수 있는지 확인합니다. 텍스트를 명확하게 읽기에 이미지 해상도가 너무 낮은 경우 가능하면 더 높은 해상도로 다시 추출하십시오. 그렇지 않으면 이 이미지가 신뢰할 수 없는 OCR 결과를 생성할 수 있습니다.

추출된 각 이미지에 대해 OCR을 실행하여 텍스트를 인식합니다. OCR 엔진은 이미지 내의 텍스트 영역을 식별하고 인식된 문자를 해당 위치와 함께 출력합니다. 인식된 텍스트와 각 텍스트 영역의 경계 상자 좌표를 포함하여 각 이미지에 대한 OCR 출력을 저장합니다. 이 정보는 나중에 번역된 텍스트를 이미지의 올바른 위치에 배치하는 데 필요합니다. WukongPDF는 문서 변환 워크플로의 일부로 포함된 이미지의 텍스트를 인식할 수 있는 OCR PDF 처리를 처리합니다.

컨텍스트를 유지하면서 인식된 텍스트 번역

이미지에서 인식되는 텍스트는 단편적인 경우가 많습니다. 다이어그램에는 단일 단어 레이블이 포함될 수 있습니다. 스크린샷에는 문장 맥락 없이 메뉴 항목과 버튼 라벨이 포함될 수 있습니다. 이 조각난 텍스트는 단어 의미를 명확하게 하는 주변 언어적 맥락이 없기 때문에 기계 번역 엔진에 어려운 작업입니다. 가능한 한 많은 맥락을 제공하세요. 레이블이 파일이라고 읽고 소프트웨어 메뉴의 스크린샷에 나타나는 경우 번역 입력에서 이것이 실제 개체가 아닌 메뉴 항목이라는 점을 참고하세요.

여러 텍스트 영역이 있는 이미지의 경우 각 영역과 해당 번역 간의 매핑을 유지합니다. 10개의 레이블이 있는 다이어그램은 각각 번역이 필요한 10개의 개별 텍스트 문자열을 생성합니다. 원본 텍스트, 번역된 텍스트 및 경계 상자 좌표를 스프레드시트와 같은 구조화된 형식으로 함께 유지합니다. 이 매핑은 번역된 텍스트를 이미지에 배치하는 마지막 단계에서 사용됩니다. PDF 번역 출력이 유용하려면 번역된 텍스트가 원본 텍스트를 대체하거나 동반하여 이미지의 올바른 위치에 나타나야 합니다.

번역된 텍스트를 이미지에 다시 배치

번역된 텍스트를 이미지에 배치하는 데는 두 가지 접근 방식이 있습니다. 첫 번째 접근 방식은 원본 텍스트를 번역문으로 대체합니다. 이미지 편집기에서 이미지를 엽니다. 각 텍스트 영역에 대해 해당 영역을 배경색으로 채워 원본 텍스트를 지웁니다. 원본의 스타일과 최대한 일치하는 글꼴을 사용하여 번역된 텍스트를 동일한 영역에 배치합니다. 이 접근 방식을 사용하면 원본과 비슷하지만 언어가 다른 깔끔한 번역 이미지가 생성됩니다.

두 번째 접근 방식은 원본 텍스트와 함께 번역을 추가합니다. 번역된 텍스트를 원본 텍스트 아래 또는 옆에 대비되는 색상으로 배치합니다. 이 접근 방식은 두 언어를 모두 이해하고 번역을 소스와 비교하려는 독자를 위해 원본을 보존합니다. 지우고 바꾸는 것보다 빠르지만 결과 이미지는 시각적으로 더 혼잡합니다. 청중의 요구에 따라 접근 방식을 선택하십시오. 대상 언어만 읽는 운영자를 위한 교육 매뉴얼은 대체의 이점을 얻습니다. 이중 언어 참조 문서는 나란히 표시되는 것이 좋습니다.

번역된 이미지를 PDF에 다시 포함

이미지가 번역된 텍스트로 처리된 후에는 PDF에 다시 배치해야 합니다. 각 원본 이미지를 번역된 이미지로 바꿉니다. 대체 이미지는 페이지에서 원본과 동일한 공간에 맞아야 합니다. 번역된 이미지의 픽셀 크기가 원본과 다른 경우 PDF의 원본 경계 상자와 일치하도록 크기를 조정하세요. PDF 페이지 레이아웃은 변경되어서는 안 됩니다. 눈에 보이는 유일한 차이점은 이미지 내의 텍스트 언어입니다.

번역되지 않은 원본 PDF를 참조용으로 유지하면서 번역된 이미지가 포함된 PDF를 새 버전으로 저장합니다. 번역된 PDF를 열고 각 이미지를 확인하여 확인하세요. 번역된 텍스트가 읽기 쉽고, 위치가 올바르며, OCR이나 번역 오류가 없는지 확인하세요. 이미지 번역이 포함된 PDF 번역은 문서, 텍스트 스트림 및 이미지의 모든 텍스트 요소에 대상 언어의 독자가 액세스할 수 있을 때 완료됩니다.

자동화 대신 수동 번역을 선택해야 하는 경우

안전 경고, 법적 고지, 기술 사양 등 중요한 텍스트가 포함된 이미지의 경우 기계 번역 대신 인간 번역가의 수동 번역을 고려하세요. 기계 번역 오류와 결합된 OCR 오류는 실제 결과를 가져오는 방식으로 안전 지침의 의미를 변경할 수 있습니다. 소수의 중요한 이미지를 사람이 번역하는 데 드는 비용은 잘못된 번역에 드는 비용에 비해 적습니다.

수동 번역이 실용적이지 않은 대규모 이미지 배치의 경우 검토 단계를 구현합니다. 기계 번역 및 재삽입 후 대상 언어를 읽는 검토자가 번역된 이미지 샘플의 정확성을 확인하도록 합니다. 샘플에서 시스템 오류가 발견되면 OCR 설정이나 번역 엔진 매개변수를 조정하고 배치를 다시 처리하세요.

포함된 이미지의 텍스트 번역은 전 세계 사용자가 PDF에 완전히 액세스할 수 있도록 만드는 마지막 단계인 경우가 많습니다. 본문 텍스트, 제목, 캡션이 번역되었습니다. 이미지는 번역되지 않은 최종 콘텐츠로 남아 있습니다. 이 단계를 완료하면 모든 매체의 모든 텍스트가 대상 언어로 제공되는 문서가 생성됩니다.

이미지가 포함되어 자주 업데이트되는 문서의 경우 문서 생성 프로세스 중에 이미지 텍스트를 PDF 텍스트 스트림으로 이동할 수 있는지 여부를 고려하십시오. 이미지의 일부가 아닌 텍스트 오버레이로 저장된 레이블이 있는 다이어그램은 표준 텍스트 번역 도구를 사용하여 번역할 수 있으므로 추출-OCR-번역-재포함 워크플로우가 완전히 필요하지 않습니다.

최종 번역된 이미지의 품질은 파이프라인의 각 단계 품질에 따라 달라집니다. 고해상도 이미지 추출을 통해 선명한 OCR 입력이 생성됩니다. 정확한 OCR은 번역을 위한 올바른 텍스트를 생성합니다. 좋은 번역 엔진은 의미를 보존합니다. 조심스럽게 다시 삽입하면 시각적 품질이 유지됩니다. 각 단계는 이전 단계에 따라 달라집니다.

이미지가 포함된 텍스트에 대한 PDF 번역 워크플로는 이미지 처리, OCR, 번역 및 재포함을 단일 파이프라인에 결합하기 때문에 가장 노동 집약적인 번역 시나리오입니다. 가능한 한 많은 단계를 자동화하면 수동 작업이 줄어듭니다.

태그라인이 있는 회사 로고나 표준 다이어그램 등 여러 PDF에서 동일하게 나타나는 이미지의 경우 이미지를 한 번 번역하고 재사용하세요. 번역된 이미지는 원본 이미지가 나타나는 모든 PDF로 대체될 수 있습니다.

이 문서에서는 이 특정 시나리오에서 PDF 작업을 위한 주요 기술과 고려 사항을 다룹니다. 여기에 설명된 방법은 다양한 도구와 플랫폼에 적용되므로 독자가 자신의 작업 흐름과 기술 환경에 가장 적합한 접근 방식을 선택할 수 있는 유연성을 제공합니다.

설명된 실제 단계는 초기 문제부터 실제 솔루션까지 명확한 경로를 제공합니다. 각 기술은 신뢰성과 접근성을 고려하여 선택되었으며, 독자가 PDF 도구에 대한 이전 경험에 관계없이 일관된 결과를 얻을 수 있도록 보장합니다.

WukongPDF 및 유사한 플랫폼은 이 문서에 설명된 이미지 텍스트 번역 작업 흐름을 지원하는 OCR 및 문서 처리 도구를 제공합니다. 이러한 도구를 결합하면 포괄적인 번역 범위가 가능해집니다.

WukongPDF

PDF 번역을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →