Tips & Tricks

PDF를 OCR하고 인식된 텍스트를 마크다운 파일로 내보내는 방법

PDF를 OCR하면 인식된 텍스트가 PDF 편집기 내부의 텍스트 상자에 나타납니다. 당신은 그것을 읽을 수 있습니다. 복사해서 붙여넣으시면 됩니다. 그러나 실제로 원하는 것은 해시 형식의 제목, 별표 목록, 대괄호-괄호 쌍의 링크, 빈 줄로 구분된 단락이 있는 Markdown 파일의 텍스트입니다. Markdown은 개발자, 기술 작가, 블로거 및 정적 사이트 생성기, 메모 작성 앱 또는 코드 저장소에 넣을 수 있는 깨끗하고 이식 가능한 텍스트가 필요한 모든 사람의 공용어입니다.

스캔한 PDF에서 Markdown 파일로 이동하는 것은 2단계 파이프라인입니다. OCR이 텍스트를 인식한 다음 서식 지정 단계에서 인식된 텍스트를 Markdown 구문으로 변환합니다. 각 단계에는 최종 출력의 품질에 영향을 미치는 도구 선택이 있습니다.

How to OCR a PDF and Export the Recognized Text as a Markdown File

1단계: PDF를 OCR하여 인식된 텍스트 추출

OCR 단계는 PDF를 검색 가능하게 만드는 것과 동일합니다. OCR PDF 도구를 사용하여 스캔한 페이지를 처리합니다. 이 도구는 각 페이지에 텍스트 레이어를 추가합니다. Markdown 내보내기의 경우 가능한 한 많은 구조적 정보(제목인 텍스트, 본문인 텍스트, 목록이나 표의 일부인 텍스트)를 보존하는 형식으로 OCR 출력을 원합니다. 표준 OCR 엔진은 모든 구조적 정보가 손실되는 일반 텍스트를 출력합니다. 제목과 본문 단락은 줄 바꿈으로 구분된 구별할 수 없는 텍스트 블록이 됩니다.

최상의 결과를 얻으려면 레이아웃 인식 텍스트 추출을 지원하는 OCR 엔진을 사용하십시오. 이러한 엔진은 페이지에 있는 텍스트의 공간적 배열을 분석하고 글꼴 크기, 위치 및 다른 요소와의 근접성을 기준으로 제목, 본문 텍스트, 캡션 및 각주를 구분할 수 있습니다. OCR 엔진이 캡처하는 구조적 정보가 많을수록 Markdown 변환이 더 깔끔해집니다. Adobe Acrobat Pro의 다음으로 내보내기 기능에는 "서식 있는 텍스트" 일부 구조적 단서를 보존하는 옵션입니다. OCR 엔진은 다운스트림 변환 도구가 제목 수준과 단락 나누기를 추론하는 데 사용할 수 있는 글꼴 크기와 위치 메타데이터를 보존합니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

2단계: 인식된 텍스트를 마크다운으로 변환

PDF에 텍스트 레이어가 있으면 Markdown으로의 변환은 여러 경로를 통해 진행될 수 있습니다. 가장 간단한 방법은 Markdown을 출력 형식으로 지원하는 PDF 편집기에서 직접 내보내는 것입니다. WukongPDF의 내보내기 옵션에는 PDF가 OCR 처리될 때 대상 형식으로 Markdown이 포함됩니다. 출력 형식으로 Markdown을 선택하면 도구는 Markdown 규칙에 따라 형식이 지정된 인식된 텍스트가 포함된 .md 파일을 생성합니다. 큰 글꼴로 시작하는 줄은 해시 접두사가 붙은 제목이 되고, 들여쓰기된 줄은 목록 항목이 되며, 일반 단락은 빈 줄로 구분됩니다.

직접 Markdown 내보내기를 사용할 수 없는 경우 파이프라인은 인식된 텍스트를 RTF 또는 HTML과 같은 서식을 유지하는 서식 있는 텍스트 형식으로 내보낸 다음 변환 도구를 사용하여 해당 중간 형식을 Markdown으로 변환합니다. 범용 문서 변환기인 Pandoc은 이 파이프라인을 잘 처리합니다. PDF의 텍스트를 HTML로 내보낸 후 pandoc input.html -f html -t markdown -o output.md를 실행합니다. Pandoc은 HTML 제목 태그를 Markdown 해시로, HTML 목록 태그를 Markdown 목록 마커로, HTML 링크 태그를 Markdown 링크 구문으로 변환합니다. 출력 품질은 PDF에서 HTML로 내보낸 품질에 따라 달라집니다. PDF 내보내기가 깨끗하고 잘 구성된 HTML을 생성하면 Pandoc은 깨끗한 Markdown을 생성합니다. 내보내기로 인해 인라인 스타일과 의미 없는 태그가 포함된 지저분한 HTML이 생성되면 그에 따라 마크다운도 지저분해집니다.

마크다운 출력에서 OCR 오류 정리

인식된 텍스트의 OCR 오류는 변경되지 않고 Markdown 출력으로 전달됩니다. 일반적인 오류에는 "cl" "d"로 인식됩니다. "rn" "m"으로 인식됩니다. 그리고 "1" "l"로 인식됩니다. 특히 작은 글꼴 크기나 낮은 품질의 스캔에서는 더욱 그렇습니다. 텍스트가 게시되거나 공유되는 경우 이러한 오류를 잡기 위해 Markdown 파일을 통한 검토 과정이 필수적입니다.

대부분의 코드 편집기와 마크다운 편집기에는 인식할 수 없는 단어를 강조 표시하는 맞춤법 검사 기능이 포함되어 있어 OCR 오류를 쉽게 찾을 수 있습니다. 강조 표시된 단어를 검토하고 원본 PDF와 비교하여 수정하세요. 잘못 인식될 가능성이 가장 높고, 잘못 발표할 경우 가장 큰 피해를 입힐 수 있는 고유명사, 기술용어, 숫자에 특히 주의하세요. OCR에서 "$123,000"을 인식한 재무 보고서 "$128,000"로 둘 다 유효한 숫자 형식이기 때문에 자동 맞춤법 검사에서 포착할 수 없는 중대한 오류가 포함되어 있습니다. 원본 문서에 대한 중요한 값을 수동으로 확인하는 것이 유일하게 신뢰할 수 있는 보호 장치입니다.

마크다운 변환에서 이미지 및 테이블 보존

Markdown은 외부 파일(![alt text](path/to/image.png))을 참조하여 이미지를 처리합니다. PDF를 Markdown으로 변환할 때 PDF의 이미지를 추출하여 별도의 파일로 저장해야 하며 Markdown 텍스트의 올바른 위치에 참조 링크를 삽입해야 합니다. WukongPDF의 PDF Markdown으로 내보내기에는 변환의 일부로 이미지 추출이 포함됩니다. PDF의 각 이미지는 Markdown 파일과 함께 폴더에 PNG 또는 JPEG 파일로 저장되며 Markdown 텍스트에는 적절한 이미지 참조 태그가 포함되어 있습니다.

테이블은 더 까다롭습니다. 마크다운 테이블은 사람이 읽기는 쉽지만 PDF는 테이블을 구조화된 데이터로 저장하지 않기 때문에 자동화된 변환기가 PDF 테이블 데이터에서 생성하기 어려운 파이프 및 대시 구문을 사용합니다. 위치에 문자를 저장합니다. 변환기는 문자 위치에서 테이블 격자를 리버스 엔지니어링해야 하며, 이로 인해 병합된 셀, 여러 줄의 셀 내용 또는 동일하지 않은 열 너비가 있는 복잡한 테이블에 대해 불완전한 결과가 생성됩니다. 균일한 열과 단일 행 셀 내용이 포함된 간단한 그리드 테이블은 안정적으로 변환됩니다. 복잡한 테이블은 Markdown 출력에서 수동으로 재구성해야 할 수도 있습니다. 테이블이 제대로 변환되지 않으면 Markdown 테이블 구문이 아닌 별도의 이미지로 내보내는 것이 좋습니다. 복잡한 테이블의 깔끔하게 읽을 수 있는 이미지는 정렬되지 않은 열로 렌더링되는 왜곡된 Markdown보다 더 유용합니다.

마크다운 파일 사용하기

결과 Markdown 파일은 모든 텍스트 편집기, Obsidian 또는 Notion과 같은 메모 작성 앱, Hugo 또는 Jekyll과 같은 정적 사이트 생성기 또는 VS Code와 같은 코드 편집기에서 열립니다. Markdown을 사용하면 웹사이트용 HTML, 배포용 PDF, 워드 프로세싱용 DOCX를 생성하거나 수십 년 동안 읽을 수 있는 검색 가능하고 버전 제어가 가능한 일반 텍스트 형식으로 텍스트를 유지할 수 있습니다.

이 파이프라인의 가치는 아카이브 자료에서 가장 분명하게 드러납니다. 오래된 스캔 보고서, 역사적 문서, 절판된 출판물 등 모두 검색이 가능할 뿐만 아니라 변형도 가능해졌습니다. 2005년의 스캔 보고서는 최신 편집기에서 편집하거나, 웹 사이트로 변환하거나, 블로그 게시물에 인용하거나, 프로그래밍 방식으로 분석할 수 있는 Markdown 파일이 됩니다. 20년 동안 이미지 내부의 텍스트를 잠근 PDF 형식은 더 이상 콘텐츠 사용 방법을 제한하지 않습니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →