다국어 PDF는 국제 비즈니스, 정부 및 법적 상황에서 일반적입니다. 계약서는 모든 페이지의 병렬 열에 영어와 프랑스어로 표시될 수 있으며 각 언어 버전은 동일한 법적 비중을 갖습니다. 제품 설명서에는 각각 다른 지역 시장을 대상으로 하는 별도의 영어, 스페인어, 중국어 섹션이 포함될 수 있습니다. 정부 양식은 단일 문서가 전체 다국어 사용자에게 서비스를 제공할 수 있도록 단일 페이지에 5개 언어로 지침을 제공할 수 있습니다. 그러한 문서에서 정보를 수정하는 문제는 제거할 텍스트와 보존할 텍스트를 언어별로 신중하게 결정해야 하기 때문에 단일 언어 PDF를 수정하는 것보다 근본적으로 더 복잡합니다.
해당 관할권의 공개 규칙에 따라 민감한 것으로 간주되지 않는 다른 언어의 동일한 정보를 유지하면서 한 언어의 민감한 텍스트를 제거해야 할 수도 있습니다. 동일한 공식 문서의 다른 언어 버전에는 다른 개인 정보 보호 규정이 적용되므로 프랑스어 및 스페인어 버전은 완전히 표시되도록 하고 개인 이름의 영어 버전만 수정해야 할 수도 있습니다. 또는 한 언어 섹션의 분류된 정보를 수정하고 다른 언어의 분류되지 않은 요약은 그대로 유지해야 할 수도 있습니다. 이러한 시나리오에는 전체 페이지가 아닌 개별 텍스트 블록 수준에서 작동하는 편집 기술이 필요하며, 해당 기술은 다국어 콘텐츠가 PDF 파일 내에 저장되는 방식을 정확하게 이해하는 것에서 시작됩니다.

다국어 텍스트가 PDF 문서 내에 저장되는 방식
PDF 파일은 개별 문자가 실행될 때 텍스트를 저장하며 각 문자는 페이지 캔버스의 정확한 x 및 y 좌표에 배치됩니다. 모든 문자에는 고유한 글꼴 식별자, 크기, 색상 및 정확한 배치 좌표가 있습니다. 중요한 점은 PDF 형식에는 언어 개념이 내장되어 있지 않다는 것입니다. 같은 페이지에 있는 영어 텍스트 블록과 프랑스어 텍스트 블록은 파일 구조 어디에서나 영어 또는 프랑스어로 태그 지정되거나 레이블이 지정되지 않습니다. 이는 단순히 페이지의 서로 다른 영역에 위치한 두 개의 독립적인 문자 모음이며, 각 언어의 특정 문자 집합 및 인쇄 규칙에 최적화된 서로 다른 글꼴로 렌더링될 가능성이 높습니다.
이러한 언어 메타데이터의 부재는 역설적이게도 언어별 편집에 가장 큰 장애물이자 이를 기술적으로 가능하게 만드는 기능입니다. 메타데이터 태그를 읽어서 어떤 텍스트가 어떤 언어에 속하는지 자동으로 식별할 수 있는 교정 도구가 없기 때문에 이는 장애물입니다. PDF의 내부 개체 테이블에는 언어 열이 없습니다. 각 언어의 텍스트 블록이 다른 언어와 완전히 구조적으로 독립되어 있기 때문에 한 언어 버전을 수정해도 실제로 다른 언어 버전에는 영향을 미치지 않으므로 언어별 수정이 가능합니다. 영어 텍스트 실행과 프랑스어 텍스트 실행은 파일에서 서로 다른 바이트 범위를 차지하며 독립적으로 조작할 수 있습니다.
실제로 이는 2열 레이아웃의 왼쪽 열에 있는 영어 텍스트 단락 위에 교정 직사각형을 그릴 때 PDF 교정 도구가 좌표가 해당 직사각형 내에 속하는 문자 실행만 제거한다는 것을 의미합니다. 다른 좌표에 안전하게 위치한 오른쪽 열의 프랑스어 텍스트는 그대로 유지됩니다. 분리는 언어적인 것이 아니라 순전히 기하학적이지만 기하학이 언어 경계와 안정적으로 연관되어 있기 때문에 작동합니다. 각 페이지의 어느 영역에 어떤 언어가 포함되어 있는지 정확하게 식별할 수 있다면 언어별로 선택적으로 수정할 수 있습니다.
PDF 편집을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
수정 전 언어 맵 생성
언어별 교정을 위한 가장 중요한 준비 단계는 무엇이든 교정하기 전에 문서의 완전한 언어 맵을 만드는 것입니다. 모든 페이지를 체계적으로 살펴보고 어떤 텍스트 블록이 어떤 언어에 속하는지 정확하게 식별하십시오. 병렬 열 레이아웃에서는 1~20페이지에서 왼쪽 열이 언어 A이고 오른쪽 열이 언어 B임을 문서화합니다. 누적 레이아웃에서는 각 페이지의 상단 1/3이 영어, 중간 1/3은 스페인어, 하단 1/3은 중국어입니다. 섹션별로 언어가 교체되는 문서에서는 각 언어 섹션의 페이지 범위를 표시합니다. 어떤 텍스트가 어떤 언어에 속하는지 확인하기 위해 편집 프로세스 중에 참고할 수 있는 스프레드시트, 마크업 스크린샷, 손으로 쓴 메모 등 간단한 참조 문서를 만듭니다.
언어 맵은 특정 단락을 확대하여 교정을 적용하기 전에 보고 있는 언어를 확인해야 할 때 신뢰할 수 있는 참조 역할을 합니다. 이는 가장 일반적인 언어별 편집 오류를 방지합니다. 즉, 작업 중인 언어 지역을 잊어버렸기 때문에 실수로 잘못된 언어로 된 텍스트를 편집하는 것입니다. 잘못된 언어로 된 텍스트가 공식 문서에서 편집된 이유를 설명해야 하는 시간과 잠재적인 결과에 비해 지도를 만드는 데 소요되는 시간은 사소한 것입니다.
글꼴 정보를 사용하여 언어 식별 지원
PDF 형식은 언어 태그를 저장하지 않지만 모든 문자 실행에 대한 자세한 글꼴 정보를 저장하며 이 글꼴 데이터는 언어 식별을 위한 강력한 프록시 역할을 할 수 있습니다. 다양한 쓰기 시스템에는 근본적으로 다른 글꼴 기술이 필요합니다. 아래 표에는 일반적인 글꼴 스크립트 유형이 일반적으로 나타내는 언어와 각각에 대한 편집 고려 사항이 매핑되어 있습니다.
| 글꼴 스크립트 유형 | 표시된 언어 | 키 수정 고려사항 |
|---|---|---|
| 라틴 스크립트 글꼴 | 영어, 프랑스어, 스페인어, 독일어, 이탈리아어, 포르투갈어, 네덜란드어 및 대부분의 기타 서유럽 언어 | 어떤 특정 언어인지 시각적으로 확인하세요. 문자가 여러 언어에 걸쳐 많이 겹칩니다. |
| CJK 글꼴(SimSun, MS Mincho, Batang) | 중국어(간체 또는 번체), 일본어, 한국어 | 글꼴 이름은 종종 대상 언어를 직접적으로 나타냅니다. |
| 아랍어 스크립트 글꼴 | 아랍어, 페르시아어(페르시어), 우르두어, 파슈토어 | 텍스트 방향은 오른쪽에서 왼쪽입니다. 교정 직사각형은 RTL 레이아웃을 고려해야 합니다. |
| 키릴 문자 글꼴 | 러시아어, 우크라이나어, 불가리아어, 세르비아어, 마케도니아어 | 문자 모양은 이러한 언어에서 매우 유사합니다. 육안 확인 필수 |
| Devanagari 및 인도어 글꼴 | 힌디어, 마라티어, 네팔어, 산스크리트어 및 기타 남아시아 언어 | 복잡한 글리프 모양이 교정 직사각형 배치에 영향을 미칠 수 있음 |
글꼴 정보는 '세계 7000개 언어 중 어느 언어'에서 '이 특정 문자 체계를 사용하는 소수의 언어 중 어느 언어'로 언어 식별 문제를 좁힙니다. 실제 텍스트 콘텐츠의 시각적 검사와 결합하면 글꼴 기반 식별이 거의 모든 실제 문서에서 언어별 교정을 확실하게 수행할 수 있을 만큼 충분히 안정적입니다.
표준 PDF 도구를 사용하여 언어별 편집 수행
표준 PDF 교정 도구에는 언어 선택기 기능이 포함되어 있지 않습니다. '영어만 수정' 또는 '프랑스어만 수정'을 선택할 수 있는 드롭다운 메뉴가 없습니다. 파일에서 영구적으로 제거하려는 콘텐츠 위에 직사각형 영역을 그리는 방식으로 수정이 수행됩니다. 언어별 교정의 경우 이는 동일한 페이지의 인접한 영역을 차지하는 다른 언어의 텍스트를 정확하게 피하면서 대상 언어의 텍스트만 포함하는 교정 직사각형을 주의 깊게 그려야 함을 의미합니다.
영어가 페이지의 왼쪽 45%를 차지하고 프랑스어가 오른쪽 45%를 차지하고 그 사이에 명확한 여백이 있는 깔끔한 병렬 열 레이아웃에서는 작업을 관리하기 쉽습니다. 영어 열 텍스트를 덮는 교정 직사각형을 그리고 프랑스어 열은 완전히 그대로 둡니다. 각 필드 레이블이 수직으로 쌓인 세 가지 언어로 표시되는 양식과 같이 언어가 인터리브된 문서에서 작업을 수행하려면 최소 200%까지 확대하고 위나 아래 줄에 잘리지 않고 대상 언어 줄만 덮는 정확하고 좁은 직사각형을 그려야 합니다.
WukongPDF의 PDF 편집 도구는 진정한 파괴적인 편집을 수행하여 단순히 검은색 직사각형으로 덮는 것이 아니라 PDF 파일 구조에서 선택한 내용을 영구적으로 제거합니다. 언어별 편집의 경우 각 페이지를 최소 200% 확대합니다. 각 직사각형이 대상 언어 텍스트만 포함하는지 확인하면서 교정 직사각형을 주의해서 그립니다. 모든 교정을 적용한 후 일반 확대/축소로 전체 문서를 스크롤하여 시각적 확인을 수행합니다. 비대상 언어 텍스트가 온전하고 완전히 읽을 수 있으며 언어 영역 간 경계에서 실수로 잘린 흔적이 없는지 확인합니다.
모든 언어 버전에 나타나는 공유 콘텐츠 처리
다중 언어 문서의 일부 요소는 성격상 모든 언어 버전에서 공유됩니다. 계약 참조 번호, 법원 사건 번호, 금액, 날짜 또는 부동산 주소는 번역 시 변경되지 않는 사실이므로 각 언어 섹션에서 동일하게 나타날 수 있습니다. 그러한 공유 정보를 수정해야 하는 경우 해당 정보가 나타나는 모든 단일 언어 버전에서 수정해야 합니다. 사건 번호를 영어 섹션에서 수정하고 프랑스어 섹션에 표시하면 검토자가 즉시 알아차릴 수 있는 명백하고 해로운 불일치가 발생합니다.
공유 정보를 한 언어로 보존하고 다른 언어로 수정해야 하는 정당한 이유가 있는 경우 해당 이유를 명시적으로 문서화해야 합니다. 어떤 언어 버전이 편집되었는지, 선택적 편집에 대한 특정 법적 또는 규제 기반, 편집 결정이 내려진 권한을 설명하는 간략한 첨부 메모를 작성하거나 PDF에 메타데이터를 포함하십시오. 이 문서는 선택적 제거가 편집 프로세스의 감독이나 오류가 아닌 고의적이고 정당한 결정임을 입증함으로써 편집을 수행한 사람과 문서를 공개한 조직을 모두 보호합니다.
매우 복잡한 다중 관할권 법적 프레임워크에 따라 언어별 편집 요구 사항이 적용되는 문서의 경우 편집을 수행하기 전에 법률 전문가와 상담하세요. 언어별로 편집할 수 있는 기술적 역량이 존재하며 신중하게 수행할 때 신뢰할 수 있습니다. 언어별로 정보를 선택적으로 공개하는 것의 법적 타당성은 전적으로 특정 규제 상황에 따라 달라지는 별도의 문제입니다. PDF 번역 의미도 고려해야 합니다. 즉, 수정되지 않은 언어 버전만 읽을 수 있는 수신자는 수정된 버전으로 제한된 수신자와 실질적으로 다른 공개 정보 세트를 받을 수 있습니다.
PDF 편집을 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
