Tips & Tricks

숫자는 그대로 유지하면서 PDF 표 셀의 텍스트만 번역하는 방법

PDF 테이블 번역에는 일반 문서 번역과는 다른 독특한 과제가 있습니다. 테이블에는 근본적으로 다른 두 가지 데이터 유형, 즉 번역이 필요한 텍스트와 그대로 유지되어야 하는 숫자가 혼합되어 있습니다. 유로화 가격표에는 프랑스어에서 영어로 번역된 제품 설명이 필요하지만 가격, 수량 및 SKU 코드는 전혀 변경되지 않아야 합니다. 재무 보고서에는 수익 수치와 백분율 값이 고정된 상태로 설명이 번역되어야 합니다. 표준 PDF 번역 도구는 모든 콘텐츠를 균일하게 처리하는 경우가 많으므로 서식 변경, 소수 구분 기호 변환 또는 실수로 인한 문자 대체를 통해 숫자가 변경될 위험이 있습니다.

문제는 번역 도구가 텍스트와 숫자를 구별할 수 없다는 것이 아닙니다. 대부분의 최신 번역 엔진은 숫자 패턴을 인식하고 이를 그대로 유지합니다. 문제는 혼합 콘텐츠 문자열에 숫자가 포함되어 있을 때, PDF 추출 프로세스가 셀 경계를 잘못 식별할 때, 번역된 텍스트를 다시 삽입하면 테이블 레이아웃이 깨질 때 발생합니다. 번역하기 전에 텍스트와 숫자 콘텐츠를 분리하는 체계적인 접근 방식은 일관되게 정확한 결과를 생성합니다.

WukongPDF의 PDF 내보내기 및 번역 도구는 언어 변환 중에 테이블 구조를 유지합니다. 표가 많은 문서의 경우 번역 엔진을 실행하기 전에 표를 사전 처리하여 숫자 셀을 분리하면 번역 후 수정을 최소화하면서 가장 정확한 출력을 얻을 수 있습니다.

How to Translate Only the Text in PDF Table Cells While Keeping Numbers Untouched

번역 도구가 때때로 숫자를 변경하는 이유

번역 엔진은 텍스트 문자열을 언어 단위로 처리합니다. 테이블 셀에 1,500개의 단위가 포함되어 있으면 엔진은 이를 혼합 문자열로 간주하고 1,500이 그대로 둘 숫자인지 아니면 번역할 구문의 일부인지 결정해야 합니다. 2024년 이후 모델에서 훈련된 대부분의 엔진은 일반적인 숫자 형식에 대해 이를 올바르게 처리합니다. 여전히 문제를 일으키는 극단적인 경우에는 유럽식 1.500,00 표기법이 US 1,500.00으로 불필요하게 변환될 수 있는 소수 구분 기호와 엔진이 대상 언어의 규칙에 따라 기호를 이동하거나 복제할 수 있는 통화 기호가 포함됩니다.

날짜 형식은 또 다른 빈번한 피해입니다. 미국 영어 소스 문서에서 2025년 3월 7일로 기록된 날짜는 2025년 3월 7일을 의미합니다. 번역 엔진이 영국 영어 사용자를 위해 날짜 형식도 현지화하는 경우 표시를 2025년 7월 3일로 변환하여 의미가 완전히 바뀔 수 있습니다. 가장 안전한 접근 방식은 날짜를 숫자와 함께 보호된 콘텐츠로 처리하고 주변 텍스트만 번역하는 것입니다.

WukongPDF

PDF 번역을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

방법 1: Excel에서 테이블 전처리

가장 제어하기 쉬운 작업 흐름은 번역하기 전에 PDF 테이블을 Excel로 추출하는 것입니다. 테이블 구조를 유지하는 도구를 사용하여 PDF를 Excel로 변환합니다. 결과 스프레드시트에서 열을 스캔하고 어느 열에 번역 가능한 텍스트와 숫자 데이터가 포함되어 있는지 식별합니다. 번역된 콘텐츠에 대한 새 시트를 삽입합니다. 텍스트 열만 번역에 적합한 형식으로 복사합니다. 번역 도구에 직접 붙여넣거나 별도의 파일로 내보냅니다.

텍스트 열을 번역한 후 번역된 텍스트를 스프레드시트의 해당 위치에 다시 붙여넣고 숫자 열은 그대로 유지합니다. 결합된 테이블에서 셀 정렬 문제를 검토한 다음 완성된 스프레드시트를 PDF로 내보냅니다. 이 방법은 숫자가 번역 엔진을 통과하지 않기 때문에 숫자 변경이 전혀 발생하지 않도록 보장합니다. 단점은 수동 열별 워크플로가 필요하다는 것입니다. 이는 10~50행이 있는 테이블에는 실용적이지만 수백 행이 있는 문서에는 노동 집약적입니다.

방법 2: 정규식 기반 콘텐츠 마스킹 접근 방식 사용

일부 전문 번역 도구와 CAT(컴퓨터 지원 번역) 플랫폼은 특정 텍스트를 번역 불가능으로 표시하는 정규식 패턴을 지원합니다. 번역을 실행하기 전에 쉼표가 있는 숫자, 소수점이 있는 숫자, 통화 접두사가 붙은 숫자, 백분율 값, 날짜 패턴 등 숫자 형식과 일치하는 정규식 패턴을 정의하세요. 이러한 패턴을 보호된 콘텐츠 규칙으로 적용합니다. 그런 다음 번역 엔진은 보호된 패턴과 일치하는 텍스트 세그먼트를 건너뛰고 나머지 텍스트만 번역합니다.

이 방법은 대부분의 숫자 데이터가 예측 가능한 형식을 따르는 문서에 적합합니다. 예를 들어 모든 항목에 걸쳐 일관된 가격 형식을 사용하는 제품 카탈로그는 달러 금액에 대해 \$\d{1,3}(,\d{3})*\.\d{2}와 같은 패턴으로 보호할 수 있습니다. 여러 섹션에 걸쳐 다양한 숫자 형식을 사용하는 문서의 경우 정규식 접근 방식에는 더 많은 패턴과 테스트가 필요합니다. 번역 후 문서의 여러 부분에서 최소 10개의 숫자 값을 무작위로 검사하여 서식 드리프트가 발생하지 않았는지 확인하세요.

방법 3: 복사-번역-붙여넣기 작업 흐름

PDF의 단일 표의 경우 가장 간단한 방법은 텍스트 셀을 한 번에 한 열씩 복사하고 번역 도구를 통해 실행한 다음 결과를 다시 원본 표의 복사본에 붙여넣는 것입니다. 개별 표 셀에서 텍스트를 선택하고 복사할 수 있는 PDF 편집기를 사용합니다. 각 열의 텍스트를 번역 텍스트 상자에 붙여넣고 번역된 출력을 복사한 다음 Word, Google Docs 또는 표 편집을 지원하는 PDF 편집기에서 다시 작성된 표의 해당 열에 붙여넣습니다.

이 방법은 큰 테이블에서는 지루하지만 번역되는 내용과 원본을 유지하는 내용을 픽셀 수준에서 제어할 수 있습니다. 붙여넣기 단계에서는 레이아웃 문제가 발생합니다. 번역된 텍스트는 원본 텍스트보다 긴 경우가 많으며, 독일어나 스페인어와 같은 언어의 경우 20~30% 길어지는 경우도 있습니다. 테이블을 마무리하기 전에 테이블 그리드를 깨지 않고 더 긴 번역된 텍스트를 수용할 수 있도록 열 너비를 조정하세요. 번역된 콘텐츠가 원래 셀 크기에 맞지 않는 경우 텍스트가 넘치거나 잘리는 대신 글꼴 크기를 0.5~1포인트 줄이는 것이 좋습니다.

혼합 콘텐츠 셀 처리

일부 테이블 셀은 실제로 단일 문자열에 텍스트와 숫자를 혼합합니다. 교체 부품 BP-4402의 주문 15개는 숫자 15와 부품 코드 BP-4402가 주변의 텍스트가 대상 언어로 변환되는 동안 번역 없이 그대로 유지되어야 하는 예입니다. 이러한 셀의 경우 번역하기 전에 자리 표시자 토큰에 숫자 세그먼트와 식별자를 래핑합니다. 15를 NUM1로 바꾸고 BP-4402를 CODE1로 바꿉니다. 번역을 실행하세요. 그런 다음 자리 표시자를 번역된 출력의 원래 값으로 바꿉니다.

번역 엔진은 자리 표시자를 번역할 수 없는 토큰으로 처리하고 그대로 보존하기 때문에 이 자리 표시자 기술은 안정적으로 작동합니다. 변환 후 간단한 찾기 및 바꾸기를 통해 자리 표시자를 원래 값으로 다시 바꿉니다. 혼합 콘텐츠 셀이 많은 테이블의 경우 수동으로 수행하는 대신 짧은 스크립트를 사용하여 자리 표시자 삽입 및 교체를 자동화합니다.

접근작동 방식제한
전체 번역모든 것을 번역한 다음 수동으로 숫자를 수정하세요.시간이 많이 걸리는 수정 단계
선택적 복사 번역텍스트 셀만 복사, 외부 번역, 다시 붙여넣기취약한 레이아웃 보존
정규식 패턴 보호번역 도구에서 숫자 패턴을 보호된 텍스트로 표시정규식 또는 보호된 범위를 지원하는 도구가 필요합니다.
2계층 PDF 접근 방식숫자를 따로 추출하고, 텍스트를 번역하고, 재결합하세요.복잡한 작업 흐름, 고가치 문서에 가장 적합

숫자를 그대로 유지하면서 PDF 표 셀의 텍스트만 번역하는 것은 정밀한 작업입니다. Excel 전처리 방법은 복잡한 테이블에 가장 안정적입니다. 정규식 기반 보호는 예측 가능한 숫자 형식의 문서에 작동합니다. 수동 복사-번역-붙여넣기 접근 방식은 빠른 일회성 요구 사항을 충족합니다. 어떤 방법을 선택하든 번역 전후의 숫자 값 샘플을 비교하는 5분 간의 확인 과정을 통해 문서가 대상에게 전달되기 전에 모든 문제를 찾아냅니다.

번역 후 품질 검증 체크리스트

PDF 테이블의 텍스트를 번역한 후 문서를 공유하기 전에 체계적인 품질 검사를 실행하세요. 먼저 원본 테이블과 번역된 테이블의 총 행 수를 비교합니다. 개수가 다른 경우 추출 또는 삽입 단계 중에 행이 삭제되거나 중복된 것입니다. 둘째, 원본 문서와 다른 열의 5개 숫자 값을 무작위로 검사합니다. 소수점, 쉼표, 통화 기호 및 음수 기호가 변경되지 않았는지 확인합니다. 셋째, 열 정렬이 모든 행에서 일관되는지 확인합니다. 잘못 정렬된 단일 열은 헤더를 기준으로 해당 열의 모든 데이터를 이동합니다.

전문적 또는 법적 용도로 번역된 테이블의 경우 대상 언어의 원어민이 번역된 셀 샘플을 검토하도록 합니다. 표 내용의 기계 번역은 때때로 기술적으로는 정확하지만 산업별 용어에 대해서는 문맥상 부적절한 번역을 생성합니다. 5분간의 인적 검토를 통해 자동화된 품질 검사에서 놓친 용어 문제를 찾아냅니다. PDF 번역 워크플로에는 사람의 확인 단계가 포함되어 비즈니스에 중요한 문서에 대해 일관되게 신뢰할 수 있는 결과를 생성합니다.

번역하기 전에 숫자 콘텐츠를 분리하는 데 추가 시간을 소비하면 정확성이 향상됩니다. 숫자는 모두 정확하지만 제품명이 조금 어색한 번역된 가격표는 유용한 문서입니다. 제품 이름은 완벽하지만 소수점이 이동된 번역된 가격표는 책임이 됩니다. 수치 정확성을 우선시하고 즉석 점검으로 검증합니다.

반복 번역 워크플로에서 숫자 보호 자동화

반복 일정에 따라 유사한 테이블 문서를 번역하는 조직의 경우 숫자 셀을 자동으로 식별하고 보호하는 전처리 스크립트를 구축하면 워크플로에서 수동 검사 단계가 제거됩니다. 정규식을 사용하는 Python 스크립트는 PDF에서 추출된 CSV를 스캔하고, 80% 이상의 숫자 값이 포함된 열에 보호된 태그를 지정하고, 번역 도구가 건너뛸 콘텐츠를 확인할 수 있는 마크업 파일을 출력할 수 있습니다. 스크립트는 수천 개의 행이 있는 테이블에 대해 1초 이내에 실행되며, 일관성을 통해 인간 검토자가 실수로 번역 엔진에서 보호해야 하는 숫자를 놓칠 위험이 제거됩니다. 숫자 보호 작업 흐름을 구현한 후 분기별로 한 번씩 소스와 번역된 PDF 테이블을 비교하여 보호 규칙이 진화하는 문서 세트의 모든 숫자 패턴을 여전히 포착하고 있는지 확인하세요.

WukongPDF

PDF 번역을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →