PDF에서 텍스트를 선택하고 복사하여 Word에 붙여넣으면 동일한 텍스트가 생성됩니다. 대신 문장 중간에 줄바꿈이 나타납니다. 특수 문자는 쓰레기 기호로 변합니다. 글꼴이 변경됩니다. 깔끔하게 정렬된 단락은 하드 리턴과 무작위 간격으로 들쭉날쭉하게 엉망이 됩니다. 텍스트는 기술적으로는 있지만 서식이 손상되었습니다.
PDF는 어디에서나 동일하게 보이도록 설계되었습니다. 편집이 가능하도록 설계되지 않았습니다. 복사-붙여넣기는 이러한 절충안을 드러냅니다.
PDF에서 Word로 복사 작업 중에 텍스트가 변경되는 이유를 이해하면 붙여넣은 텍스트 수정, 적절한 변환 도구 사용 또는 소스 문서로 돌아가기 중에서 선택하는 데 도움이 됩니다. WukongPDF의 PDF 형식 변환 도구는 추출을 적절하게 처리하여 복사-붙여넣기 문제를 완전히 방지합니다.

PDF에서 텍스트를 저장하는 방법과 표시하는 방법
PDF 내에서 텍스트는 좌표 격자의 개별 문자 배치로 저장됩니다. 각 문자에는 X 및 Y 위치가 있습니다. hello라는 단어는 5개의 독립 문자(h는 (100,200), e는 (108,200) 등)일 수 있습니다. 시청자는 동일한 Y 좌표에서 서로 옆에 위치하므로 이를 단어로 렌더링합니다. 복사하여 붙여넣으면 수신 애플리케이션은 이러한 개별 위치에서 단어와 문장을 재구성합니다.
재구성 알고리즘은 간격을 기반으로 단어와 줄이 시작하고 끝나는 위치를 추측합니다. 일반적인 단어 간격보다 크면 줄 바꿈으로 해석될 수 있습니다. 가변 간격을 사용하여 양쪽 정렬된 단락은 알고리즘을 혼동하여 무작위로 나누기를 삽입합니다. fi 및 fl과 같은 결합 문자인 합자에는 해당 유니코드가 부족하여 붙여넣은 출력에서 문자가 누락되거나 대체될 수 있습니다.
PDF를 Word로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
줄바꿈이 문장 중간에 나타나는 이유
문장 중간에 나타나는 강한 줄 바꿈은 가장 일반적인 복사-붙여넣기 아티팩트입니다. PDF는 페이지 레이아웃과 일치하는 줄에 텍스트를 저장합니다. 한 시각적 줄에서 다음 줄로 이어지는 문장은 두 개의 개별 문자 위치 집합으로 저장됩니다. 복사 알고리즘은 한 시각적 줄의 끝과 다음 줄의 시작 사이의 간격을 확인하고 단락 구분을 삽입합니다.
Word에서 이러한 구분선을 수동으로 수정한다는 것은 원하지 않는 각 구분선을 삭제하고 공백을 추가하는 것을 의미합니다. 한 단락에서는 약간의 성가심이 있습니다. 50페이지 문서의 경우 1시간의 시간을 낭비합니다. 문자 위치에서 단락을 재구성하는 PDF-Word 변환기는 이를 올바르게 처리하여 줄 바꿈된 텍스트를 결합하고 실제 단락 경계에만 나누기를 삽입합니다.
특수문자 및 글꼴 대체 문제
PDF는 복사 컴퓨터에 설치되지 않은 글꼴을 사용할 수 있습니다. 복사 작업에서 사용할 수 없는 글꼴의 문자가 발견되면 대체 글꼴로 대체되거나 문자가 완전히 삭제됩니다. 글머리 기호는 물음표가 됩니다. Em 대시는 빈 상자가 됩니다. 둥근 따옴표는 곧은 따옴표가 되거나 사라집니다. 텍스트가 PDF에 있지만 문자 인코딩이 깔끔하게 매핑되지 않아 붙여넣기 대상에 표시될 수 없습니다.
포함된 글꼴은 표시 문제를 방지하지만 복사-붙여넣기는 포함된 글꼴을 전송하지 않습니다. 대상 응용 프로그램은 자체 글꼴을 사용하므로 특정 문자가 없거나 다르게 인코딩될 수 있습니다. 적절한 PDF-Word 변환 도구는 시스템 클립보드보다 더 지능적으로 글꼴 매핑을 처리하여 PDF 글꼴 인코딩을 유니코드로 변환하고 모든 문자를 보존합니다.
| 복사-붙여넣기 문제 | 원인 | 피하는 방법 |
|---|---|---|
| 무작위 줄 바꿈 | PDF는 단락이 아닌 시각적 선으로 텍스트를 저장합니다. | 복사-붙여넣기 대신 PDF-Word 변환기 사용 |
| 왜곡된 특수 문자 | 시스템에서 글꼴을 사용할 수 없습니다. 인코딩이 일치하지 않습니다. | 소스 PDF가 포함된 글꼴을 사용하는지 확인하거나 변환기를 사용하십시오. |
| 합자 누락(fi, fl, ff) | 합자 문자 모양에 해당하는 단일 유니코드가 없습니다. | 합자를 별도의 문자로 분해하는 변환기 사용 |
| 서식이 손실됨(굵게, 기울임꼴) | PDF의 텍스트와 별도로 저장된 서식 | 복사하여 붙여넣으면 서식이 손실된다는 점을 인정하세요. 변환기 사용 |
| 텍스트 순서가 잘못됨 | 다중 열 또는 복잡한 레이아웃으로 인해 추출이 혼동됨 | 레이아웃 감지와 함께 변환기 사용 |
복사-붙여넣기 대신 PDF-단어 변환 사용
변환 도구는 PDF의 내부 구조를 읽고 클립보드가 할 수 없는 방식으로 단락, 표 및 서식을 재구성합니다. 출력된 Word 문서는 텍스트 흐름을 유지하고 제목을 Word 스타일로 유지하며 테이블을 편집 가능한 상태로 유지합니다. 변환에는 복사-붙여넣기와 동일한 수의 클릭이 필요하며 약간의 정리가 필요한 결과가 생성됩니다.
WukongPDF의 변환 도구는 이러한 재구성을 자동으로 처리합니다. PDF를 업로드하고, 출력 형식으로 Word를 선택한 후, 적절하게 구성된 문서를 다운로드하세요. 변환에 소요되는 몇 초의 시간이 절약된 정리 시간으로 보답됩니다. 한 페이지보다 긴 문서의 경우 변환은 PDF에서 사용 가능한 Word 파일로의 총 시간에 대한 복사-붙여넣기보다 빠릅니다.
비표준 인코딩 및 오른쪽에서 왼쪽으로 쓰는 텍스트 처리
레거시 시스템이나 비라틴어 스크립트로 작성된 PDF에는 추가 복사-붙여넣기 문제가 있습니다. 아랍어, 히브리어, 중국어 또는 일본어 텍스트가 포함된 문서는 시스템 클립보드가 올바르게 해석하지 못할 수 있는 인코딩 체계를 사용합니다. PDF 뷰어에는 필요한 글꼴과 인코딩 테이블이 있으므로 시각적 텍스트가 화면에 올바르게 렌더링됩니다. 해당 테이블이 없는 클립보드는 완전히 잘못된 출력을 생성합니다.
다국어 PDF용으로 설계된 변환 도구에는 클립보드에 없는 인코딩 감지 기능이 포함되어 있습니다. PDF의 글꼴 인코딩 테이블을 분석하고, 문자 모양 색인을 올바른 유니코드 코드 포인트에 매핑하고, 올바르게 인코딩된 텍스트를 출력합니다. 언어 내용이 혼합된 문서, 아랍어 각주가 있는 영어 본문 텍스트, 다이어그램의 중국어 레이블, 다국어 인식 변환기가 필수적입니다. 클립보드 접근 방식은 언어 중 하나 이상에서 실패하며 종종 모든 언어에서 실패합니다.
소스 애플리케이션이 더 나은 옵션인 경우
가장 깨끗한 Word 문서는 PDF를 만든 응용 프로그램에서 나옵니다. PDF를 Word에서 내보낸 경우 원본 Word 파일을 다시 엽니다. Google Docs에서 내보낸 경우 대신 Word 파일로 다운로드하세요. 소스 응용 프로그램에는 PDF가 병합한 원래 형식, 스타일 및 구조가 있습니다.
PDF는 편집 형식이 아닌 배포 형식입니다. 어디에서나 동일하게 보이도록 디자인되었으며 수정되지 않았습니다. 편집이 필요한 경우 원본으로 돌아가세요. 소스를 사용할 수 없고 PDF만 있으면 복사하여 붙여넣기가 아닌 적절한 변환 도구를 사용하십시오. 이 작업을 위해 도구가 만들어졌습니다. 클립보드는 그렇지 않았습니다.
PDF를 Word로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
