번역 도구를 통해 PDF를 실행하면 결과 문서에 단순한 레이아웃 변경 이상의 서식 문제가 발생하는 경우가 많습니다. 수학 기호, 통화 기호, 악센트 문자와 같은 특수 문자는 빈 상자, 물음표 또는 완전히 잘못된 문자로 대체될 수 있습니다. 포함된 글꼴이 렌더링을 중지하여 텍스트의 전체 섹션이 사라지거나 기본 시스템 글꼴로 표시될 수 있습니다. 번역 중에 기호 및 PDF 글꼴에 어떤 일이 발생하는지 이해하면 이러한 문제를 예측하고 기호 정확성이 중요한 문서에 대한 올바른 번역 접근 방식을 선택하는 데 도움이 됩니다.
주요 내용
PDF 번역 도구는 문서에서 텍스트 레이어를 추출하고 기계 번역 엔진을 통해 이를 실행한 다음 번역된 텍스트를 원래 레이아웃에 다시 배치하는 방식으로 작동합니다. 이 파이프라인의 모든 단계에서 기호 및 특수 문자가 위험에 처해 있습니다. 추출 시 기호 인코딩을 잘못 해석할 수 있고, 번역 엔진이 알파벳이 아닌 문자를 제거하거나 손상시킬 수 있으며, 대상 언어가 원본 문서에 포함된 글꼴에 없는 문자를 사용할 때 글꼴 대체 문제가 다시 삽입될 수 있습니다.

PDF 번역이 텍스트 추출 단계를 처리하는 방법
번역이 이루어지기 전에 도구는 PDF에서 읽을 수 있는 텍스트를 추출해야 합니다. 텍스트가 포함된 기본 디지털 PDF의 경우 이 추출은 문서의 콘텐츠 스트림에서 문자 코드를 읽고 포함된 글꼴의 인코딩 테이블을 사용하여 이를 유니코드 값에 매핑합니다. 인코딩 테이블이 불완전하거나 손상되었거나 유니코드 규칙을 따르지 않는 사용자 정의 매핑을 사용하는 경우 이 단계에서 기호 및 특수 문자가 문제가 됩니다. 이전 소프트웨어로 생성된 PDF는 화면의 유로 기호처럼 보이는 것이 표준 유니코드 테이블에서는 아무 것도 매핑되지 않는 문자 코드로 내부적으로 저장되는 비표준 인코딩을 사용할 수 있습니다.
인코딩 매핑이 실패하면 추출 프로세스에서 대체 문자(일반적으로 유니코드 대체 문자 또는 물음표)가 생성됩니다. 이 실패는 자동으로 발생합니다. 추출된 텍스트는 기호 주변의 문자와 숫자가 괜찮아서 얼핏 평범해 보이지만, 문서의 의미에 중요한 통화 기호, 수학 연산자, 악센트 문자는 번역이 시작되기도 전에 사라졌습니다. 금융 PDF에서 유로 기호를 확인할 수 없는 추출 단계는 "총액: 2,500유로"로 변합니다. "총계: 2,500" 또는 "총계: 2,500 ?" 번역된 출력은 해당 오류를 상속합니다.
PDF 번역을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
번역 엔진이 기호 및 특수 문자에 수행하는 작업
기계 번역 엔진은 자연어 텍스트에 최적화되어 있습니다. 기술 사양이나 재무제표와 같이 단어와 기호가 혼합된 문장을 접할 때 기호 처리는 특정 엔진과 언어 쌍에 따라 달라집니다. 대부분의 최신 신경 기계 번역 시스템은 통화 기호, 백분율 표시 및 일반적인 수학 연산자와 같이 비언어적으로 인식되는 기호를 통과합니다. 그러나 법률 문서에 사용되는 섹션 기호, 과학 텍스트의 학위 기호 또는 특정 업계의 전문 표기와 같이 덜 일반적인 기호는 번역 엔진의 텍스트 정규화 단계에서 삭제되거나 대체될 수 있습니다.
실제 번역 전에 실행되는 정규화 단계는 입력된 텍스트를 표준화된 형식으로 변환합니다. 텍스트를 소문자로 만들고, 중요하지 않은 것으로 간주되는 구두점을 제거하고, 유니코드 문자를 표준 형식으로 정규화할 수 있습니다. 대부분의 문서에서 이는 도움이 됩니다. 번역 엔진이 "Hello"를 처리하지 못하게 합니다. 그리고 "안녕하세요" 다른 말로. 그러나 특정 기호가 의미를 담고 있는 문서의 경우 정규화가 해를 끼칠 수 있습니다. 아래 첨자 숫자를 사용하는 화학 공식, 도 및 분 기호가 있는 GPS 좌표 세트 또는 섹션 표시가 있는 법적 인용은 모두 정규화에 의해 의미가 변경되거나 읽을 수 없게 만드는 방식으로 변경될 수 있습니다.
글꼴 대체: 번역된 텍스트가 종종 다르게 보이는 이유
글꼴 대체의 시각적 영향은 미묘한 것부터 심각한 것까지 다양합니다. 라틴 글꼴이 다른 라틴 글꼴을 대체하는 경우 문자 너비는 약간 변경되지만 텍스트는 계속 읽을 수 있습니다. 라틴어 글꼴이 비라틴어 쓰기 시스템을 대체하는 경우 라틴어 글꼴에는 필수 문자가 전혀 포함되어 있지 않기 때문에 결과는 일반적으로 빈 직사각형이나 물음표의 행입니다. 이것이 바로 아랍어, 중국어, 일본어, 한국어 또는 키릴 언어로 번역할 때 재삽입 단계에서 글꼴 가용성에 특별한 주의가 필요한 이유입니다.
번역 후에는 새 텍스트를 PDF에 다시 배치해야 합니다. 원본 문서에 포함된 글꼴에는 원본 텍스트에 있던 문자만 포함됩니다. 번역된 텍스트에 영어 문서의 프랑스어 또는 스페인어 번역의 악센트 문자와 같이 원본에 없는 문자가 포함된 경우 원본에 포함된 글꼴이 해당 문자를 렌더링할 수 없습니다. PDF 뷰어는 대체 글꼴로 대체되어 주변 텍스트와 거의 다르게 보입니다. 그 결과 대부분의 텍스트가 원본 서체로 표시되지만 가끔 번역된 단어나 악센트 부호가 있는 문자가 눈에 띄게 다른 글꼴로 표시되어 페이지가 고르지 못하고 전문적이지 않은 것처럼 보이는 문서가 탄생했습니다.
이 문제는 완전히 다른 표기 체계를 사용하는 언어로 번역할 때 가장 심각합니다. 영어 PDF를 러시아어, 아랍어, 중국어 또는 일본어로 번역하려면 라틴 스크립트 글꼴에 포함되지 않은 문자가 필요합니다. 번역된 텍스트 전체를 대체 글꼴로 렌더링해야 하며 문서의 시각적 특성이 완전히 변경됩니다. 특정 문자 너비와 줄 높이를 포함하여 원본 텍스트에 사용된 레이아웃 형상은 번역된 텍스트에 맞지 않습니다. 줄 바꿈이 이동하고, 단락이 늘어나거나 줄어들고, 신중하게 정렬된 요소가 잘못 정렬됩니다.
기호 민감도에 따른 번역 방식 선택
실용적인 사전 번역 확인은 PDF를 열고 특수 문자가 포함된 단락을 일반 텍스트 편집기에 복사하는 것입니다. 복사하여 붙여넣기 작업 후에도 특수 문자가 그대로 유지된다면 PDF의 텍스트 인코딩은 표준이며 번역 추출 단계에서 특수 문자가 손상될 가능성은 거의 없습니다. 붙여넣을 때 문자가 깨지거나 사라지는 경우 PDF는 번역 중에 문제를 일으키는 비표준 인코딩을 사용합니다. 글꼴 포함을 활성화하여 PDF를 다시 생성하는 등 소스에서 인코딩을 수정하는 것이 번역 후 손상된 문자를 복구하는 것보다 더 효과적입니다.
재무 보고서, 과학 논문, 법률 문서, 기술 매뉴얼 등 기호가 중요한 문서의 경우 가장 안전한 접근 방식은
다른 쓰기 시스템으로 번역되는 문서의 경우 출력물이 원본과 다르게 보일 것이라는 점을 인정하고 이에 따라 계획을 세우십시오. 픽셀 단위까지 완벽한 레이아웃 일치를 기대하는 대신 대상 언어로 깨끗하고 읽기 쉬운 문서를 생성하는 데 집중하세요. 번역 후 수동 또는 반자동 레이아웃 조정을 위한 예산 시간을 확보합니다. 열 너비를 조정하고, 테이블을 재정렬하고, 모든 특수 문자가 올바르게 렌더링되었는지 확인하세요. 번역 후 서식 지정에 소요되는 추가 시간은 쓰기 시스템 전반에 걸친 작업 비용이며, 레이아웃 작업 없이 원활한 교차 스크립트 번역을 약속하는 도구는 실제로 어려운 문제를 지나치게 단순화합니다. WukongPDF의 번역 도구는 변환 프로세스 전반에 걸쳐 포함된 글꼴 데이터를 보존하여 텍스트를 다시 삽입하는 동안 글꼴이 대체될 때 발생하는 기호 손상을 최소화합니다.
자주 묻는 질문
PDF를 직접 번역해야 합니까, 아니면 먼저 편집 가능한 형식으로 변환하고 번역한 후 PDF로 다시 내보내야 합니까? Word로 변환하고, Word 문서를 번역하고, PDF로 다시 내보내는 2단계 접근 방식은 일반적으로 Word가 원시 PDF 텍스트 추출보다 유니코드를 더 일관되게 처리하므로 기호 충실도가 더 좋습니다. 비용은 Word를 통한 왕복으로 인해 수동으로 수정해야 하는 레이아웃 변경이 발생한다는 것입니다. 짧은 문서의 경우 2단계 방법을 사용하면 레이아웃 작업을 할 가치가 있습니다. 매우 긴 문서의 경우 인코딩을 유지하는 도구를 사용하여 직접 PDF를 번역하는 것이 더 실용적입니다.
텍스트를 추출하고 외부에서 번역한 다음 수동으로 다시 PDF 레이아웃에 배치하여 PDF를 번역할 수 있습니까? 예, 이 수동 파이프라인을 사용하면 모든 단계에서 기호 처리 및 글꼴 선택을 완벽하게 제어할 수 있지만 시간이 많이 걸리고 짧은 문서에만 실용적입니다. 50페이지 분량의 기술 매뉴얼의 경우 수동 재삽입이 불가능합니다. 자동 번역과 수동 번역 사이의 결정은 궁극적으로 출력에 대해 얼마나 많은 제어가 필요한지, 그리고 얼마나 많은 시간을 투자할 수 있는지에 대한 결정입니다.
번역하기 전에 PDF를 Word로 변환하면 기호 손실을 방지할 수 있나요?
먼저 Word로 변환하면 번역 도구가 Microsoft Word의 유니코드 처리를 통해 텍스트에 액세스할 수 있습니다. 이는 일반적으로 원시 PDF 텍스트 추출보다 더 안정적입니다. 이 추가 단계는 특히 이미 표준 유니코드 인코딩을 사용하는 최신 소프트웨어로 생성된 문서의 경우 인코딩 관련 기호 손실을 해결하는 경우가 많습니다. 단점은 Word 변환 자체로 인해 레이아웃이 변경될 수 있다는 것입니다. 기호가 많은 문서의 경우 향상된 문자 정확도는 일반적으로 레이아웃 작업을 정당화합니다.
PDF 번역 중에 수학 방정식이 자주 깨지는 이유는 무엇입니까?
PDF의 수학 방정식은 일반적으로 변수와 숫자에 대한 텍스트 문자, 전용 수학 글꼴의 특수 수학 기호, 벡터로 그린 분수 막대, 근호 및 기타 표기법 요소가 혼합된 형태로 저장됩니다. 번역 엔진은 텍스트 레이어를 처리할 때 방정식을 문장으로 처리하고 기호 순서를 재정렬하거나 정규화할 수 있습니다. 벡터로 그린 요소는 전혀 텍스트가 아니며 건드리지 않고 번역을 통과하지만 번역된 텍스트에 대한 정렬은 거의 항상 깨집니다. 수학 내용이 많은 문서의 경우 가장 신뢰할 수 있는 접근 방식은 번역에서 방정식을 제외하고 주변 산문만 번역하는 것입니다.
번역을 처리하는 PDF 형식이 있습니까?PDF 형식 다른 것보다 더 나은가요?
완전히 포함된 유니코드 글꼴이 포함된 PDF/A는 하위 집합 글꼴 및 사용자 정의 인코딩이 포함된 표준 PDF보다 더 안정적으로 번역됩니다. PDF/A의 전체 포함 및 유니코드 요구 사항은 번역 중 기호 손상의 가장 일반적인 두 가지 원인인 글꼴 글리프 누락과 비표준 문자 매핑을 제거합니다. 문서가 번역될 것이라는 것을 알고 있다면 번역을 실행하기 전에 PDF/A로 저장하는 것이 좋습니다.
PDF 번역을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
