작업할 수 있는 형식의 PDF 텍스트가 필요합니다. 서식이 있는 Word 문서가 아니고 숨겨진 텍스트 레이어가 있는 검색 가능한 PDF가 아니라 단락이 단락이고 제목이 제목인 일반 텍스트 파일입니다. 문서 구조를 유지하는 PDF를 텍스트로 변환하면 콘텐츠를 분석, 용도 변경 또는 보관할 수 있습니다. 텍스트 파일은 모든 편집기에서 열리고 스크립트로 처리될 수 있으며 현재 문서 형식이 더 이상 사용되지 않는 지금부터 수십 년 동안 계속 읽을 수 있습니다.
잘 구성된 텍스트 내보내기의 가치는 편리함 그 이상입니다. 일반 텍스트는 지금까지 만들어진 디지털 형식 중 가장 휴대성이 뛰어난 형식입니다. 1970년에 작성된 텍스트 파일은 어제 작성된 텍스트 파일만큼 쉽게 열립니다. PDF를 깔끔하고 구조화된 텍스트로 변환하면 소프트웨어가 어떻게 발전하더라도 문서 콘텐츠에 계속 액세스할 수 있습니다.

단순 복사-붙여넣기가 단락 구조를 유지하지 못하는 이유
PDF에서 모든 텍스트를 선택하고 복사하면 클립보드는 PDF 콘텐츠 스트림에 나타나는 순서대로 텍스트를 수신합니다. 콘텐츠 스트림은 논리적 문서 구조가 아닌 일련의 그리기 지침입니다. 원본 PDF 작성자가 페이지에 맞게 텍스트를 줄 바꿈한 위치에 줄 바꿈이 나타납니다. 단락 나누기는 클립보드 캡처에서 손실되는 추가 줄 간격으로 표시될 수 있습니다. 제목은 구조적 역할을 나타내지 않고 일반 텍스트로 나타날 수 있습니다.
복사하여 붙여넣기 출력의 경우 원래 단락 구조를 복원하려면 수동으로 형식을 다시 지정해야 합니다. 붙여넣은 텍스트를 훑어보고, 단락이 시작하고 끝나는 위치를 식별하고, 단락 내에서 텍스트를 감싸는 하드 줄 바꿈을 제거하고, 해당 위치에 단락 나누기를 추가해야 합니다. 여러 페이지로 구성된 문서의 경우 이 수동 정리는 내용을 다시 입력하는 것보다 시간이 더 오래 걸릴 수 있습니다.
PDF 형식 텍스트 내부 표현은 워드 프로세서가 텍스트를 표현하는 방식과 근본적으로 다릅니다. 워드 프로세서는 단락 표시가 있는 흐름으로 텍스트를 저장합니다. PDF는 텍스트를 페이지에 배치된 문자로 저장합니다. 배치된 문자를 흐르는 단락으로 변환하려면 단락 감지에 대한 인쇄 규칙을 이해하는 추출 도구가 필요합니다.
이 차이를 이해하는 것이 깨끗한 추출의 핵심입니다.
PDF를 Word로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
구조화된 텍스트 추출 도구 사용
전용 텍스트 추출 도구는 데이터 수준에서 PDF를 분석하고 논리적 문서 구조를 재구성합니다. 줄 간격, 들여쓰기 및 글꼴 변경을 보고 단락 경계를 감지합니다. 더 큰 글꼴 크기, 굵은 형식 및 번호 매기기 패턴을 감지하여 제목을 식별합니다. 출력에서는 텍스트 서식에 반영된 문서 계층 구조를 유지합니다.
WukongPDF는 브라우저를 통해 PDF에서 텍스트를 추출하기 위한 PDF 내보내기 기능을 제공합니다. 추출은 소스 PDF에 식별할 수 있는 충분한 서식 정보가 포함된 단락 구조를 유지합니다. 서식 단서가 없는 PDF의 경우 추출된 텍스트는 원래 읽기 순서를 유지합니다.
텍스트 추출 도구를 선택할 때 정기적으로 처리하는 문서와 유사한 문서에서 테스트해 보세요. 텍스트를 추출하고 원본 PDF와 비교합니다. 단락 경계가 올바른지, 제목이 식별 가능한지, 악센트 문자 및 기호와 같은 특수 문자가 유지되는지 확인하세요. 한 유형의 문서에서는 잘 작동하는 도구가 다른 문서에서는 어려움을 겪을 수 있습니다.
텍스트 추출 중 특수 콘텐츠 처리
테이블은 텍스트 추출에 가장 까다로운 콘텐츠 유형입니다. PDF의 표는 데이터를 행과 열로 시각적으로 표시하지만 내부 표현에서는 읽기 순서, 열 순서 또는 예측할 수 없는 순서로 셀을 저장할 수 있습니다. 테이블을 구체적으로 처리하지 않는 텍스트 추출 도구는 A 열 값이 B 열 값 사이에 나타나는 인터리브된 텍스트를 생성합니다. 중요한 표 형식 콘텐츠가 포함된 PDF의 경우 일반 텍스트 대신 CSV 또는 Excel로 변환하는 것이 좋습니다.
글머리 기호 또는 숫자가 텍스트 흐름의 일부가 아닌 별도의 위치 문자로 저장되면 추출 중에 글머리 기호 및 번호 매기기 목록의 구조가 손실될 수 있습니다. 추출된 텍스트는 목록 항목이 목록에 속한다는 표시 없이 별도의 단락으로 표시될 수 있습니다. 일부 추출 도구는 목록 패턴을 감지하고 접두사 문자를 추가하여 목록 구조를 유지합니다.
각주와 미주는 공간적 어려움을 나타냅니다. PDF 시각적 레이아웃에서는 각주를 참조하는 텍스트에서 멀리 떨어진 페이지 하단에 각주가 나타납니다. 텍스트 추출에서 각주는 참조가 포함된 단락 중간에 나타날 수도 있고, 관련되지 않은 단락 사이에 나타날 수도 있습니다. 최고의 추출 도구는 각주를 문서 끝으로 미루거나 단락 경계에 삽입합니다.
최대한의 청결성을 위해 추출된 텍스트를 후처리합니다.
추출 후 텍스트 파일에 대해 정리 단계를 실행합니다. 여러 공백을 단일 공백으로 변환하려면 찾기 및 바꾸기를 사용하세요. 줄 끝에서 후행 공백을 제거합니다. 원본 PDF를 스캔한 경우 일반적인 OCR 아티팩트(반복되는 문자, 단어 사이의 공백 누락, 잘못 인식되는 구두점)를 확인하십시오.
제목 식별이 중요한 문서의 경우 추출된 텍스트에서 줄 시작 부분에 굵은 텍스트나 모두 대문자 텍스트로 시작하는 섹션을 검색합니다. 이러한 서식 패턴은 제목을 나타내는 경우가 많습니다. 두 번째 수준 제목의 경우 ##과 같이 일관된 접두사를 사용하여 제목을 수동으로 표시하여 문서 구조를 일반 텍스트로 명시적으로 만듭니다.
출력 텍스트 파일의 인코딩은 장기적인 사용성에 중요합니다. UTF-8은 최신 텍스트 파일의 표준 인코딩이며 거의 모든 쓰기 시스템의 문자를 지원합니다. UTF-8로 저장된 텍스트 파일은 모든 최신 장치에서 올바르게 열립니다. ASCII 또는 Latin-1과 같은 이전 인코딩은 영어가 아닌 언어의 문자를 잃습니다. PDF에서 텍스트를 내보낼 때 내보내기 도구가 UTF-8 인코딩을 사용하는지 확인하거나 후처리 단계에서 출력을 UTF-8로 변환합니다.
여러 언어로 된 텍스트가 포함된 PDF의 경우 텍스트 추출은 존재하는 모든 언어의 문자 집합을 처리해야 합니다. 가끔 프랑스어나 독일어 단어가 포함된 영어 문서에서는 확장된 라틴 문자 집합에 포함된 문자를 사용합니다. 영어와 일본어가 혼합된 문서에는 완전한 유니코드 지원이 필요합니다. 대부분의 최신 추출 도구는 다국어 텍스트를 올바르게 처리하지만 영어가 아닌 텍스트가 포함된 페이지의 출력을 테스트하면 문자 처리가 확인됩니다.
머리글과 바닥글은 추출 중에 반복되는 텍스트를 표시하여 출력을 복잡하게 만들 수 있습니다. 모든 페이지에 나타나는 페이지 번호, 문서 제목, 날짜 스탬프가 주요 내용과 함께 추출됩니다. 일부 추출 도구는 반복되는 머리글 및 바닥글 텍스트를 감지하고 제거할 수 있습니다. 도구에 이 기능이 포함되어 있지 않으면 여러 페이지에 걸쳐 반복되는 줄을 식별하는 사후 처리 스크립트를 통해 해당 줄을 필터링할 수 있습니다.
복잡한 다중 열 레이아웃이 있는 PDF의 경우 텍스트 추출 순서를 프로그래밍 방식으로 결정하기 어려울 수 있습니다. 2열로 구성된 학술 논문은 먼저 1열로 추출한 다음 2열로 추출해야 합니다. 각 페이지의 열에 서로 다른 기사가 포함된 신문 레이아웃은 최고의 추출 알고리즘에도 도전합니다. 이러한 문서의 경우 추출된 텍스트를 의도한 읽기 순서로 복원하려면 수동으로 다시 정렬해야 할 수도 있습니다.
추출된 텍스트 파일은 분석을 위해 자연어 처리 도구를 통해 추가 처리될 수 있습니다. 감정 분석, 키워드 추출 및 주제 모델링은 모두 일반 텍스트 입력에서 작동합니다. PDF를 깨끗한 텍스트로 변환하면 수동으로 읽고 주석을 달아야 하는 문서 컬렉션에 대한 분석 기능이 잠금 해제됩니다.
두 개 이상의 문자를 단일 문자 모양으로 결합하는 특수 인쇄 문자인 합자를 사용하는 PDF에서 텍스트를 추출하면 예상치 못한 결과가 발생할 수 있습니다. fi 및 fl과 같은 일반적인 합자는 PDF 인코딩에 따라 단일 문자로 추출되거나 두 개의 별도 문자로 추출될 수 있습니다. 전문적으로 조판된 책과 학술 저널에서 흔히 볼 수 있는 광범위한 합자를 사용하는 문서에서는 추출된 텍스트의 정확성을 주의 깊게 확인해야 합니다.
마주보는 페이지가 단일 이미지로 함께 스캔된 스캔한 책에서 생성된 PDF의 경우 텍스트 추출은 먼저 스캔한 각 이미지를 왼쪽 및 오른쪽 페이지로 분할한 다음 각 절반에서 OCR을 실행해야 합니다. 마주보는 페이지를 분할하지 못하면 왼쪽 페이지의 마지막 단어가 오른쪽 페이지의 첫 번째 단어로 이어지는 텍스트가 생성됩니다.
PDF의 일반 텍스트 출력은 다양한 다운스트림 프로세스에 대한 입력으로 사용될 수 있습니다. 텍스트 분석 도구는 주요 주제와 감정을 식별할 수 있습니다. 번역 도구는 텍스트를 다른 언어로 변환할 수 있습니다. 검색 인덱싱 도구를 사용하면 조직 전체에서 문서 콘텐츠를 검색할 수 있습니다. 일반 텍스트 파일은 PDF를 더 넓은 텍스트 처리 도구 생태계에 연결하는 범용 교환 형식입니다.
PDF 폴더에서 일괄 텍스트 추출을 통해 검색 가능한 텍스트 코퍼스가 생성됩니다. 추출된 텍스트 파일은 데스크톱 검색 도구로 색인화할 수 있으므로 단일 검색 상자에서 수백 개의 PDF 콘텐츠를 검색할 수 있습니다. 이 기능은 원본 PDF 파일을 수정하지 않고도 정적 문서 아카이브를 검색 가능한 기술 자료로 변환합니다.
PDF에서 깨끗한 텍스트로 내보내면 문서 콘텐츠를 가장 이식성이 뛰어나고 내구성이 뛰어난 형식으로 표현되며, 전체 텍스트 검색부터 자연어 처리, 향후 수십 년 동안 읽을 수 있는 형식의 장기 보관 보존에 이르기까지 모든 사용 사례에 사용할 수 있습니다.
적절한 텍스트 추출 설정에 시간을 투자하면 문서 콘텐츠의 검색, 분석, 번역 및 보관을 위한 기반이 되는 깔끔하고 구조화된 출력이 생성됩니다.
PDF에서 추출된 잘 구조화된 텍스트 파일은 문서 내용을 가장 쉽게 접근할 수 있고 미래에도 사용할 수 있는 형식으로 보존합니다.
결과 텍스트 파일은 앞으로 몇 년 동안 귀하의 요구 사항을 충족할 것입니다.
| 콘텐츠 유형 | 추출 동작 | 품질 팁 |
|---|---|---|
| 본문 단락 | 맞춤 텍스트로 추출됨 | 단락 나누기가 원본과 일치하는지 확인하세요. |
| 제목 | 글꼴 크기/굵게로 감지됩니다. ##으로 표시 | 식별된 모든 제목을 확인하세요. |
| 테이블 | 셀은 인터리브될 수 있습니다. 대신 CSV 내보내기를 고려해 보세요. | 표 형식 데이터의 경우 Excel/CSV 출력을 사용하세요. |
| 기울기 | 총알이 손실될 수 있습니다. 수동으로 접두사 추가 | 목록 항목이 그룹화되어 있는지 확인 |
PDF를 Word로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
