PDF에서 텍스트를 복사하여 Word나 텍스트 편집기에 붙여넣으면 종종 끊어진 줄이 엉망이 됩니다. PDF의 각 줄은 붙여넣은 출력에서 별도의 단락이 되며, 줄 바꿈으로 인해 텍스트를 연속적인 산문으로 편집할 수 없게 됩니다. PDF를 Word로 변환하거나 복사한 후 원치 않는 줄 바꿈을 제거하는 것은 찾기 및 바꾸기와 몇 가지 키보드 단축키를 사용하여 자동화할 수 있는 서식 정리 작업입니다.
주요 내용
PDF 텍스트 추출은 모든 시각적 줄 끝에 하드 줄 바꿈을 배치합니다. 텍스트 편집기에 붙여 넣으면 각 줄이 별도의 단락이 됩니다. 가장 빠른 수정 방법은 실제 단락 사이에 이중 줄 바꿈을 유지하면서 한 줄 바꿈을 제거하는 와일드카드를 사용한 찾기 및 바꾸기입니다. 이 단일 작업은 몇 초 안에 끊어진 텍스트를 흐르는 단락으로 변환합니다.

PDF 텍스트 복사에 줄바꿈이 너무 많은 이유
PDF는 텍스트를 개별 선 개체로 저장하며, 각 개체는 페이지의 특정 좌표에 위치합니다. 텍스트가 한 줄에서 다음 줄로 연속적으로 흐르는 워드 프로세서 문서와 달리 PDF에는 텍스트 흐름이라는 개념이 없습니다. 각 줄은 별도의 개체입니다. 텍스트를 복사할 때 추출 프로세스는 이러한 줄 개체를 순서대로 읽고 각 줄 뒤에 줄 바꿈을 배치합니다. 왜냐하면 단락을 끝내는 줄 바꿈과 단락 내의 줄 바꿈인 줄 바꿈을 구별할 수 없기 때문입니다.
문제는 여러 열로 구성된 PDF와 서식이 지정된 텍스트 문서에서 생성된 PDF에서 가장 잘 나타납니다. PDF에서 4개의 시각적 줄에 걸쳐 있는 단락을 붙여 넣으면 4개의 별도 단락이 되며 각 단락은 단락 표시로 끝납니다. 이 텍스트를 편집하려면 줄을 수동으로 다시 결합해야 하는데, 이는 몇 단락 이상에서는 지루한 작업입니다. 찾기 및 바꾸기 접근 방식은 재결합을 자동화합니다.
PDF를 Word로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
찾기 및 바꾸기를 사용하여 한 줄 바꿈 제거
찾기 및 바꾸기를 사용하여 끊어진 줄을 연결한 후 유지되어야 했지만 유지되지 않은 단락 구분이 있는지 텍스트를 검색합니다. 글머리 기호나 번호가 매겨진 목록은 각 글머리 기호나 번호가 한 줄에 있기 때문에 가장 흔히 발생하는 피해입니다. 찾기 및 바꾸기 방법은 이를 단일 단락으로 결합합니다. 각 글머리 기호 또는 번호 앞의 줄바꿈을 수동으로 복원합니다. 이 정리 단계는 몇 분 정도 걸리지만 세련된 최종 문서를 생성합니다.
복사한 텍스트를 Word에 붙여넣습니다. Ctrl+H로 찾기 및 바꾸기를 엽니다. 찾을 내용 필드에 ^p를 입력하여 단락 기호를 일치시킵니다. 바꿀 내용 필드에 공백을 한 번 입력합니다. 모두 바꾸기를 클릭합니다. 문서의 모든 단락 표시가 공백으로 바뀌어 모든 텍스트가 하나의 단락으로 결합됩니다. 이는 실제 단락 사이의 단락 표시도 제거하기 때문에 너무 공격적입니다. 이 문제를 해결하려면 먼저 실제 단락을 구분하는 이중 단락 표시를 보호하세요. 먼저 ^p^p를 @@PARA@@과 같은 자리 표시자로 바꾸세요. 그런 다음 나머지 단일 ^p 표시를 공백으로 바꿉니다. 마지막으로 @@PARA@@를 ^p^p로 바꾸어 단락 나누기를 복원합니다.
와일드카드 찾기 및 바꾸기 접근 방식을 확장하여 보다 복잡한 정리 패턴을 처리할 수 있습니다. 섹션 제목이 있는 문서는 콜론으로 끝나고 단락 기호가 오는 줄과 같은 제목 텍스트 패턴을 일반적인 줄 바꿈 제거 전 자리 표시자로 대체하여 보호할 수 있습니다. 본문 텍스트 줄을 결합한 후 자리 표시자에서 제목 나누기를 복원합니다. 이렇게 하면 단락 구조와 제목 구분이 모두 유지됩니다.
Word에서 이 3단계 프로세스는 약 30초가 소요되며 모든 길이의 텍스트에 적용됩니다. 핵심은 문서 텍스트 어디에도 나타나지 않는 자리 표시자를 사용하고 있다는 것입니다. 한 줄 바꿈을 바꾼 후 텍스트는 연속 단락으로 흐릅니다. 각 원래 단락 나누기는 이중 줄 바꿈으로 유지됩니다. 이제 문서를 일반 산문처럼 편집할 수 있습니다. WukongPDF의 PDF 형식 도구는 변환 중에 단락 구조를 유지하므로 복사 후 필요한 수동 줄 바꿈 정리 작업의 양을 줄여줍니다.
빠른 수정을 위해 온라인 텍스트 정리 도구 사용
원클릭 정리로 한 줄씩 수동으로 편집하는 시간이 몇 분씩 절약됩니다.
OCR 처리된 스캔 PDF에서 복사된 텍스트의 경우 OCR 오류로 인해 줄 바꿈 문제가 더욱 복잡해집니다. 잘못 인식된 각 문자는 이미 깨진 텍스트에 노이즈를 추가합니다. 이 경우 줄바꿈을 제거한 후 맞춤법 검사기를 통해 텍스트를 실행하세요. 맞춤법 검사기는 줄 바꿈 제거로 해결할 수 없는 OCR 오류를 찾아냅니다. 줄바꿈 제거와 맞춤법 검사를 함께 사용하면 스캔한 문서에서 가장 깔끔한 출력물을 얻을 수 있습니다.
PDF에서 복사된 텍스트 정리를 전문으로 하는 여러 무료 온라인 도구가 있습니다. 복사한 텍스트를 도구에 붙여넣으면 단락 나누기를 유지하면서 한 줄 바꿈이 자동으로 제거됩니다. 이러한 도구는 수동 찾기 및 바꾸기 방법과 동일한 논리를 사용하지만 한 번의 클릭으로 적용됩니다. Word에서 찾기 및 바꾸기를 설정하는 것이 작업이 정당화하는 것보다 더 많은 노력을 기울이는 일회성 텍스트 정리 작업에 이상적입니다.
온라인 텍스트 정리 도구를 선택할 때 잠재적으로 민감한 텍스트를 제3자 웹사이트에 붙여넣고 있다는 점에 유의하세요. 기밀 문서의 경우 온라인 도구 대신 로컬 애플리케이션에서 수동 찾기 및 바꾸기 방법을 사용하십시오. 수동 방법은 오프라인에서 작동하고 텍스트를 컴퓨터에 유지하며 동일한 결과를 생성합니다.
향후 복사본에서 줄 바꿈 문제 방지
텍스트 추출 품질은 PDF 생성 방법에 따라 달라집니다. 워드 프로세서로 생성된 PDF는 일반적으로 스캔 및 OCR로 생성된 PDF보다 내부 텍스트 순서가 더 좋습니다. 워드 프로세서로 생성된 PDF의 텍스트 순서는 원본 문서의 읽기 순서를 따릅니다. OCR로 생성된 PDF의 텍스트 순서는 OCR 엔진이 텍스트를 인식한 공간 순서를 따르며, 이는 다중 열 또는 복잡한 레이아웃의 읽기 순서와 일치하지 않을 수 있습니다.
정기적으로 PDF에서 텍스트를 복사해야 하는 경우 작업 흐름을 조정하여 정리 부담을 최소화하세요. PDF 뷰어에서 직접 복사하는 대신 텍스트를 복사하기 전에 PDF를 Word로 변환하세요. PDF-Word 변환 도구는 줄 바꿈 결합을 처리하고 흐르는 텍스트를 생성하도록 설계되었습니다. 변환된 Word 문서에는 여전히 약간의 정리가 필요하지만 PDF 뷰어에서 직접 복사한 텍스트보다는 훨씬 적습니다.
다른 사람이 텍스트를 복사해야 하는 PDF를 만들려면 PDF를 만드는 동안 접근성 태그를 활성화하세요. 태그가 있는 PDF에는 단락이 시작되고 끝나는 위치를 텍스트 추출 도구에 알려주는 구조 정보가 포함되어 있습니다. 태그가 있는 PDF에서 복사한 텍스트는 태그가 없는 PDF의 텍스트보다 훨씬 더 깔끔합니다. 추출 도구가 줄 위치에서 단락 경계를 추측하는 대신 단락 구조 태그를 사용하기 때문입니다.
Word에서 PDF를 생성할 때 PDF 내보내기 설정에서 '접근성을 위한 문서 구조 태그' 옵션을 활성화하세요. 이는 텍스트 추출 도구가 단락 경계를 식별하는 데 사용하는 PDF에 구조적 정보를 포함합니다. 태그가 있는 PDF에서 추출된 텍스트는 줄 위치를 추측하는 대신 추출 도구가 구조 태그에서 단락이 시작하고 끝나는 위치를 알기 때문에 잘못된 줄 바꿈이 훨씬 적습니다.
자주 묻는 질문
원본 PDF에 사용된 글꼴이 텍스트 복사의 깔끔한 정도에 영향을 줍니까? 네, 상당히 그렇습니다. 적절한 인코딩과 함께 표준 PostScript 또는 TrueType 글꼴을 사용하는 PDF는 사용자 정의 인코딩 글꼴을 사용하는 PDF보다 더 깔끔하게 복사됩니다. 일부 사용자 정의 글꼴은 문자 A로 표시되는 내용이 내부적으로 완전히 다른 문자 코드로 저장되는 비표준 문자 매핑을 사용합니다. 이러한 PDF에서 텍스트를 복사하면 추출된 텍스트에 완전히 잘못된 문자가 포함될 수 있습니다. OCR 기반 추출 외에 글꼴 인코딩 문제에 대한 수정 사항은 없습니다.
PDF에서 붙여넣은 텍스트의 단어 중간에 임의의 공백이 삽입되는 이유는 무엇입니까? 이를 텍스트 조각화라고 하며 PDF가 개별 문자 또는 작은 문자 그룹을 별도의 텍스트 개체로 저장할 때 발생합니다. PDF 뷰어는 텍스트 추출 중에 개체 사이에 공백을 삽입합니다. 자동 수정은 없습니다. 유일한 해결책은 수동 교정입니다. 적절한 글꼴 포함 및 텍스트 인코딩을 사용하여 생성된 PDF는 조각화가 발생할 가능성이 적습니다.
줄 바꿈을 전혀 하지 않고 PDF에서 텍스트를 복사하는 방법이 있습니까? 일부 PDF-텍스트 추출 도구는 의도적으로 연속 단락을 생성합니다. 이 도구는 동일한 단락에 속하는 텍스트 레이아웃과 연결 줄을 분석합니다. 출력은 복사하여 붙여넣는 것보다 깔끔하지만 표준 선택 및 복사 방법 대신 추출 도구를 사용해야 합니다. 빈번한 텍스트 추출의 경우 전용 추출 도구에 투자하면 정리 시간이 크게 절약됩니다.
붙여넣은 PDF 텍스트의 단어 중간에 추가 공백이 있는 이유는 무엇입니까?
이는 PDF가 각 문자 또는 작은 문자 그룹을 사이에 작은 간격이 있는 별도의 텍스트 개체로 저장할 때 발생합니다. 텍스트 추출 프로세스에서는 각 간격에 공백을 삽입합니다. 공백은 합법적인 단어 공백과 구별할 수 없기 때문에 이에 대한 자동 수정은 없습니다. 수동 교정 및 수정이 유일한 솔루션입니다. 적절한 글꼴이 포함된 PDF를 생성하면 문자 수준의 텍스트 조각화 발생이 줄어듭니다.
열 정렬을 손상시키지 않고 PDF 테이블에서 텍스트를 복사할 수 있습니까?
표준 복사-붙여넣기는 테이블 구조를 유지하지 않습니다. 모든 열의 텍스트는 읽기 순서대로 추출되어 뒤죽박죽된 시퀀스를 생성합니다. 열이 보존된 테이블 데이터를 복사하려면 테이블 구조를 감지하는 PDF-Excel 변환 도구를 사용하십시오. Excel 출력은 열 정렬을 유지하므로 구조를 그대로 유지하면서 Excel에서 복사할 수 있습니다.
PDF 뷰어가 텍스트 복사의 깔끔함에 영향을 미치나요?
예. Adobe Acrobat의 텍스트 추출은 일반적으로 가장 깨끗합니다. 브라우저 기반 뷰어는 텍스트 추출이 아닌 표시에 최적화되어 있기 때문에 줄 바꿈이 더 많이 발생하는 경우가 많습니다. 텍스트를 자주 복사해야 하는 경우 브라우저 기반 뷰어보다는 추출용 전용 PDF 리더를 사용하세요.
PDF를 Word로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
