프랑스어로 작성된 연구 논문에는 영어를 사용하는 검토자가 이해해야 하는 캡션이 있는 그림과 머리글이 있는 표가 포함되어 있습니다. 검토자는 이중 언어를 구사하는 동료와 함께 작업하므로 본문 텍스트는 프랑스어로 유지될 수 있습니다. 전체 문서를 번역하는 것은 불필요하며 기술적인 내용에 오류가 발생할 위험이 있습니다. 그림 캡션과 표 헤더만 번역하면 검토자에게 본문 텍스트를 건드리지 않고 시각적 요소를 해석하는 데 필요한 정보가 제공됩니다.
캡션 및 헤더의 선택적 PDF 번역은 위치, 형식 또는 콘텐츠 패턴을 기준으로 특정 텍스트 요소를 식별할 수 있는 도구가 필요한 정밀 작업입니다. 캡션은 일반적으로 그림 아래에 더 작은 글꼴로 표시됩니다. 테이블 헤더는 테이블의 첫 번째 행에 굵은 텍스트로 표시됩니다. 이러한 형식 지정 신호를 사용하면 선택적 추출 및 번역이 가능합니다.

선택적 번역을 위한 캡션 및 헤더 식별
학술 및 기술 PDF의 그림 캡션은 예측 가능한 형식 패턴을 따릅니다. 그림 바로 아래나 옆에 나타납니다. 본문보다 작은 글꼴 크기(일반적으로 8~10포인트)를 사용합니다. 그들은 종종 Figure로 시작하고 그 뒤에 숫자가 옵니다. 이러한 패턴을 사용하면 캡션 텍스트를 수동 또는 자동으로 식별할 수 있습니다.
테이블 헤더는 테이블의 첫 번째 행에 표시되며, 배경이 음영 처리된 굵은 텍스트로 표시되는 경우가 많습니다. 머리글 행은 데이터 행과 구조적으로 구별됩니다. PDF 표 추출 도구는 위치와 형식으로 머리글 행을 식별하고, 머리글 텍스트를 추출하고, 데이터 행을 그대로 둘 수 있습니다.
PDF 형식은 캡션과 헤더를 의미상 태그가 지정된 요소가 아닌 위치가 지정된 텍스트 개체로 저장합니다. 이를 추출하려면 텍스트 위치, 글꼴 속성, 이미지 또는 테이블 구조와의 근접성에 대한 분석이 필요합니다. 범용 텍스트 추출 도구는 캡션과 본문 텍스트를 구별할 수 없습니다. 문서 레이아웃을 이해하는 전문 도구가 가능합니다.
PDF 번역을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
선택적 번역 작업 흐름
먼저 PDF에서 캡션과 헤더 텍스트를 추출합니다. 이미지와 관련된 위치와 글꼴 특성으로 각 캡션을 식별합니다. 테이블 구조에서의 위치에 따라 각 테이블 헤더를 식별합니다. 추출된 텍스트를 위치 참조가 있는 번역 목록으로 컴파일합니다.
둘째, 추출된 텍스트를 번역합니다. 기계 번역은 캡션과 헤더에 사용되는 간단한 언어에 적합합니다. 번역에 대한 인적 검토를 통해 기술 용어가 올바르게 번역되고 도메인별 용어가 보존되는지 확인합니다.
WukongPDF는 특정 텍스트 요소를 분리할 수 있는 PDF를 텍스트로 추출하는 기능을 제공합니다. 번역과 결합된 추출은 원본 본문 텍스트를 유지하면서 번역된 캡션과 헤더를 생성합니다.
번역된 캡션 및 헤더 다시 삽입
번역 후 번역된 텍스트를 PDF의 원래 위치에 다시 배치합니다. 번역된 캡션은 각 그림 아래의 원래 캡션을 대체합니다. 번역된 헤더는 각 테이블의 원래 헤더를 대체합니다. 본문 텍스트는 변경되지 않습니다.
언어 간 번역 길이 차이에 주의가 필요합니다. 더 긴 영어 텍스트로 번역되는 프랑스어 캡션은 동일한 공간에 맞추기 위해 글꼴 크기가 약간 작거나 줄 간격이 더 좁아야 할 수 있습니다. 페이지 레이아웃을 방해하지 않고 번역에 맞게 텍스트 형식을 조정합니다.
선택적 번역이 올바른 접근 방식인 경우
선택적 번역은 독자가 시각적 요소를 이해해야 하지만 본문을 자세히 읽을 필요가 없는 경우에 적합합니다. 언어 장벽을 넘어선 과학적 협업, 국제 제출물에 대한 기술 검토, 다국어 출판 워크플로우는 이러한 목표 접근 방식의 이점을 누리고 있습니다.
전체 문서 번역에 비해 선택적 번역의 비용과 시간 절약은 본문 텍스트에 대한 캡션과 헤더의 비율에 비례합니다. 본문 80%, 캡션 20%로 구성된 문서는 캡션만 번역할 경우 번역 비용의 80%를 절약합니다.
선택적 번역을 위한 캡션 및 헤더 식별은 특정 문서 또는 출판 형식에 대한 문서 레이아웃 분석 모델을 교육하여 부분적으로 자동화할 수 있습니다. 저널 템플릿으로 훈련된 모델은 해당 템플릿을 사용하는 모든 기사에서 캡션과 헤더를 매우 정확하게 식별할 수 있습니다.
번역 메모리 도구는 동일한 필드의 여러 문서에 걸쳐 반복되는 캡션 문구의 번역을 저장할 수 있습니다. 그림 X와 같은 문구는 수십 개의 논문에 나타나는 것과 모든 논문에 걸쳐 일관된 번역의 이점 사이의 관계를 보여줍니다.
선택적 번역을 위한 품질 보증 프로세스에서는 올바른 텍스트가 번역되었는지, 잘못된 텍스트(본문)가 번역되었는지 모두 확인해야 합니다. 검토자는 원본과 비교하여 번역된 캡션 샘플을 확인하고 해당 페이지의 본문 텍스트가 원래 언어로 유지되는지 확인합니다.
캡션에 본문 텍스트에 대한 숫자 참조가 포함된 문서의 경우 자세한 내용은 섹션 3.2를 참조하세요. 번역에서는 이러한 상호 참조를 정확하게 유지해야 합니다. 존재하지 않는 섹션을 가리키는 잘못 번역된 상호 참조는 혼란을 야기합니다.
번역된 캡션이 PDF에 다시 삽입되면 미묘한 색상 차이나 여백의 표기 등을 통해 새 텍스트가 원래 본문 텍스트와 시각적으로 구별될 수 있어야 합니다. 그래야 독자가 선택적으로 번역된 문서를 보고 있다는 것을 이해할 수 있습니다.
선택적 번역 접근 방식은 추상 번역, 국제 데이터베이스를 위한 키워드 번역, 다국어 출판물을 위한 그림 라벨 번역 등 대상 번역의 이점을 누릴 수 있는 다른 문서 요소로 확장될 수 있습니다.
여러 언어로 저널을 제작하는 학술 출판사에게 캡션과 헤더의 선택적 번역은 비용이 많이 드는 전체 번역과 번역이 전혀 없는 것 사이의 비용 효율적인 중간 지점을 제공합니다.
캡션과 헤더의 선택적 번역은 청중이 전체 내용을 이해해야 할 때 전체 문서 번역을 대체하는 것이 아니라 특정 요구 사항을 위한 정밀 도구입니다.
선택적 번역의 비용 효율성은 전체 번역 비용이 엄청나게 많이 드는 국제 협력에 매력적인 옵션이 됩니다.
선택적 번역은 다국어 문서 협업을 위한 타겟 솔루션을 제공합니다.
과학 논문의 그림 캡션은 자동화된 추출 도구가 식별할 수 있는 예측 가능한 패턴을 따릅니다. 즉, 그림 아래에 나타나고 더 작은 글꼴을 사용하며 그림으로 시작하고 그 뒤에 숫자가 옵니다.
테이블 머리글은 테이블 상단에 표시되고 굵은 텍스트를 사용하는 경우가 많으며 추출 도구가 식별을 위해 사용하는 특징인 음영처리된 배경을 가질 수 있다는 점에서 데이터 행과 구조적으로 구별됩니다.
추출 프로세스에서는 번역된 텍스트가 올바른 글꼴 속성과 간격을 사용하여 올바른 위치에 다시 배치될 수 있도록 원래 형식 정보를 보존해야 합니다.
다국어 출판물의 경우 캡션과 헤더를 추출하고 모든 대상 언어로 번역하고 각 버전을 별도의 PDF 레이어로 삽입하는 등 선택적 번역을 체계적으로 적용할 수 있습니다.
과학 캡션에 대한 기계 번역의 품질은 이러한 구조화된 텍스트 요소를 처음부터 번역하는 것보다 사람이 사후 편집하는 것이 더 빠르고 비용도 저렴할 정도로 향상되었습니다.
본문 텍스트와 캡션 간의 글꼴 크기 차이는 자동화된 추출 도구가 캡션 텍스트를 식별하는 데 사용하는 주요 신호이며, 캡션은 일반적으로 주변 본문 텍스트보다 2~4포인트 작습니다.
테이블 머리글 행은 각 테이블의 첫 번째 행으로서의 위치, 굵은 텍스트 형식, 데이터 행과 구별되는 음영처리된 배경 등으로 식별할 수 있습니다.
추출된 캡션과 헤더는 페이지 번호와 위치 좌표를 유지하는 구조화된 목록으로 컴파일되어야 번역 후 정확한 재삽입이 가능합니다.
번역 메모리 도구는 이전 문서의 번역된 캡션을 동일한 필드에 저장할 수 있으므로 일관성을 높이고 반복되는 용어에 대한 번역 비용을 줄일 수 있습니다.
번역된 캡션을 다시 삽입하려면 언어 간 텍스트 길이 차이를 고려해야 하며, 원래 캡션 공간에 번역된 텍스트가 맞도록 필요에 따라 글꼴 크기나 줄 간격을 조정해야 합니다.
선택적 번역에 대한 품질 보증에는 올바른 텍스트 요소가 추출되었는지, 번역이 정확한지, 본문 텍스트가 실수로 수정되지 않았는지 확인하는 것이 포함됩니다.
여러 언어로 논문을 출판하는 학술 저널의 경우 캡션과 헤더의 선택적 번역을 표준 단계로 제작 워크플로우에 통합할 수 있습니다.
전체 번역에 비해 선택적 번역의 비용 절감 효과로 인해 번역 예산이 제한된 프로젝트 및 출판물에서도 국제 협업이 가능해집니다.
과학 캡션에 사용되는 구조화되고 정형화된 언어의 기계 번역 품질은 일반적으로 서술형 텍스트보다 높기 때문에 사후 편집 부담이 줄어듭니다.
본문 텍스트의 원래 언어를 유지하면서 특정 문서 요소만 번역하는 기능은 국제 문서 작업 흐름에 유연성을 제공합니다.
여러 언어 커뮤니티에 걸친 연구 공동 작업의 경우 선택적 번역을 통해 각 공동 작업자는 선호하는 언어로 시각적 증거에 액세스할 수 있습니다.
이러한 선택적 접근 방식을 통해 번역 리소스가 제한된 팀과 프로젝트에서 다국어 문서 공동 작업에 액세스할 수 있습니다.
그림 캡션과 표 헤더의 타겟 번역은 독자가 시각적 요소를 해석하는 데 필요한 필수 컨텍스트를 제공합니다.
캡션과 헤더를 선택적으로 번역하면 해외 독자가 본문 전체를 번역하지 않고도 문서의 시각적 증거를 이해할 수 있습니다.
문서 번역에 대한 이러한 타겟 접근 방식은 비용을 절감하는 동시에 언어 장벽을 넘어서 시각적 정보에 대한 접근성을 높입니다.
캡션 추출은 주변 본문 텍스트와의 글꼴 크기 및 위치 차이에 따라 달라집니다.
PDF의 캡션 텍스트는 일반적으로 본문 텍스트보다 2~4포인트 작은 글꼴 크기를 사용하여 해당 그림 바로 아래 또는 옆에 배치되므로 텍스트 위치와 서식 특성을 분석하는 자동 추출 도구로 식별할 수 있습니다.
캡션과 헤더의 선택적 번역을 통해 전 세계 독자에게 시각적 정보에 대한 접근 권한을 제공합니다.
이 기능을 통해 국제적인 연구 협력이 보다 쉽게 이루어지고 비용 효율성이 향상됩니다.
문서 번역에 대한 선택적 접근 방식은 전체 번역 비용을 들이지 않고도 특정 요구 사항을 해결합니다.
| 요소 | 식별 신호 | 번역 우선순위 | 재삽입 참고사항 |
|---|---|---|---|
| 그림 캡션 | 아래 그림; 더 작은 글꼴; 그림 N 접두사 | 높은 | 같은 입장; 글꼴 크기를 조정해야 할 수도 있습니다 |
| 테이블 헤더 | 첫 번째 행; 용감한; 음영처리된 bg | 높은 | 동일한 세포; 정렬 유지 |
| 축 라벨 | 차트 축에 인접 | 중간 | 회전 조정이 필요할 수 있음 |
| 범례 항목 | 색상 견본 + 텍스트 | 낮은 | 별도로 추출되지 않는 경우가 많음 |
PDF 번역을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
