Tips & Tricks

두 페이지로 스캔한 책을 개별 단일 PDF 페이지로 분리하는 방법

평판 스캐너에서 펼쳐진 책이나 제본된 보고서를 스캔합니다. 각 스캔은 두 페이지(왼쪽 페이지와 오른쪽 페이지)를 하나의 와이드 이미지로 나란히 캡처합니다. 결과 PDF를 볼 때 각 시트는 두 페이지가 펼쳐져 있습니다. 왼쪽 페이지의 텍스트가 오른쪽 페이지의 텍스트와 연결됩니다. 두 페이지 사이의 여백에 걸쳐 있는 문구를 검색하면 아무것도 반환되지 않습니다. PDF는 시각적으로 원본 책에 충실하지만 사실상 읽기용 문서로 사용할 수 없습니다.

두 페이지로 스캔한 스프레드를 개별 단일 페이지 PDF로 분리하는 것은 책, 제본된 보고서 또는 잡지를 디지털화하는 모든 사람의 일반적인 요구 사항입니다. 이 프로세스에는 각 이중 너비 페이지를 가운데로 분할하고 절반을 순차적인 단일 페이지 문서로 재정렬하는 작업이 포함됩니다. 올바른 접근 방식을 사용하면 100페이지 분량의 책 스캔(50장 분량)이 처음부터 끝까지 올바르게 읽는 200페이지 분량의 PDF가 됩니다.

How to Separate a Two-Page Scanned Book Spread Into Individual Single PDF Pages

두 페이지 스프레드 문제 이해

책을 평판 위에서 스캔하면 스캐너는 유리 영역 전체를 하나의 이미지로 캡처합니다. 펼쳐진 책의 두 페이지가 모두 유리에 맞으면 스캔에는 두 페이지가 나란히 표시됩니다. PDF에서는 이를 가로 방향의 단일 페이지로 처리합니다. 페이지 크기는 높이보다 너비가 11 x 8.5인치일 수 있습니다. 원본 책의 각 페이지는 스캔 영역의 약 절반을 차지합니다. 과제는 이 넓은 페이지를 각각 하나의 책 페이지를 포함하는 두 개의 세로 방향 페이지로 나누는 것입니다.

정확한 중앙을 간단히 분할하면 완벽하게 정렬된 스캔이 가능하지만 책 스캔은 거의 완벽하지 않습니다. 척추는 홈통 근처에 곡선 왜곡을 만들 수 있습니다. 왼쪽 페이지와 오른쪽 페이지의 너비가 동일하지 않을 수 있습니다. 책이 스캔 간에 약간 이동하여 페이지마다 분할 지점이 다를 수 있습니다. 도서 스캔에 대한 좋은 분할 PDF 접근 방식은 이러한 불일치를 처리해야 합니다.

WukongPDF

PDF 분할을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

방법 1: 각 스프레드를 왼쪽과 오른쪽 절반으로 자르기

가장 신뢰할 수 있는 방법은 2단계 프로세스입니다. 각 스프레드를 잘라 왼쪽 페이지를 추출한 다음 다시 잘라 오른쪽 페이지를 추출합니다. 스캔한 PDF를 엽니다. 자르기 도구를 사용하여 각 페이지의 왼쪽 절반을 선택합니다. 자르기 상자 외부의 모든 항목을 숨기는 자르기를 적용합니다. 파일을 왼쪽 페이지 버전으로 저장합니다. 그런 다음 원본을 다시 열고 오른쪽 절반을 잘라 오른쪽 페이지 버전으로 저장합니다. 마지막으로 두 파일을 인터리브합니다. 왼쪽 파일의 1페이지, 오른쪽 파일의 1페이지, 왼쪽 파일의 2페이지, 오른쪽 파일의 2페이지 등입니다.

자르기 도구는 자르기 영역을 명명된 사전 설정으로 저장하는 것을 지원하므로 왼쪽 절반과 오른쪽 절반을 한 번 정의하고 한 번의 클릭으로 모든 페이지에 적용할 수 있습니다. 이 도구는 또한 모든 홀수 또는 모든 짝수 페이지에 자르기를 일괄 적용하는 기능을 지원합니다. 이는 모든 스프레드가 일관된 레이아웃을 공유할 때 유용합니다.

방법 2: 페이지 크기별로 분할

모든 스프레드가 자동 문서 공급기 또는 전용 책 스캐너를 사용하여 스캔한 경우 일반적으로 너비가 정확히 동일한 경우 치수 기반 분할이 수동 자르기보다 빠릅니다. 페이지 너비를 2로 나누고 해당 좌표에 분할 지점을 설정합니다. 너비가 11인치인 스프레드는 5.5인치로 나뉩니다. 분할을 모든 페이지에 균일하게 적용합니다. 이 방법은 빠르며 전체 문서에 대해 단일 작업이 필요하지만 스프레드가 완벽하게 중앙에 있지 않거나 책이 스캔 사이에 이동하는 경우 실패합니다.

각 스프레드가 수동으로 배치된 평판에서 스캔된 문서의 경우 운영자가 합리적으로 일관성을 유지했다면 차원 기반 분할은 종종 허용 가능한 결과를 생성합니다. 확인하려면 처음 몇 페이지를 분할하고 분할선에서 텍스트가 잘리지 않는지 확인하세요. 분할로 인해 콘텐츠가 한쪽에서 지속적으로 잘리는 경우 분할 좌표를 조정하고 다시 시도하세요. 샘플에서 분할 지점이 확인되면 모든 페이지에 적용합니다.

방법 3: OCR을 사용하여 홈통 및 자동 분할 감지

일부 고급 스캐닝 소프트웨어에는 자동 확산 감지 기능이 포함되어 있습니다. 소프트웨어는 스캔한 각 페이지를 분석하고 책 여백의 어두운 수직 띠를 식별한 다음 해당 선을 따라 페이지를 분할합니다. 이렇게 하면 고정된 좌표를 사용하는 대신 각 페이지의 실제 내용에 맞게 조정되므로 가장 정확한 분할이 생성됩니다. 여백은 일반적으로 페이지에서 가장 어두운 수직 영역이며 이미지 분석 알고리즘에 의해 안정적으로 감지됩니다.

WukongPDF의 스캔된 PDF 처리에는 도서 스캔에 대한 자동 여백 감지가 포함됩니다. 스캔을 업로드하면 도구가 각 페이지의 척추 그림자를 식별하고 최적의 분할선을 계산하며 올바른 읽기 순서로 페이지가 포함된 단일 페이지 PDF를 생성합니다. 분할 결과를 수동으로 검토하는 것이 좋습니다. 특히 자동 감지가 여백이 아닌 이미지 중앙을 통해 분할선을 배치할 수 있는 여백을 가로지르는 풀 블리드 이미지가 있는 페이지의 경우 더욱 그렇습니다.

분할 후 페이지 재정렬

스캔한 펼침면을 분할하면 읽기 순서에 따라 재정렬해야 하는 페이지가 생성됩니다. 펼침면으로 스캔된 책은 왼쪽으로 1장, 오른쪽으로 1장, 왼쪽으로 2장, 오른쪽으로 2장의 순서로 페이지를 생성합니다. 올바른 읽기 순서는 오른쪽으로 1번 펼치기, 왼쪽으로 2번 펴기, 오른쪽으로 2번 펴기, 왼쪽으로 3번 펴기입니다. 첫 번째 왼쪽 페이지는 앞표지 안쪽이거나 제목 페이지 앞의 빈 페이지인 경우가 많으므로 실제 책과 비교하여 의도한 순서를 확인하세요.

재정렬 단계는 수동이지만 간단합니다. 페이지 축소판을 표시하는 뷰어에서 분할 PDF를 엽니다. 페이지를 올바른 순서로 드래그하세요. WukongPDF의 페이지 재정렬 도구는 모든 페이지를 썸네일 그리드로 표시하므로 순서를 쉽게 보고 수정할 수 있습니다. 200페이지 분량의 책을 올바르게 다시 주문하려면 10~15분 정도 걸립니다. 스캔한 책의 순서가 올바른 PDF는 처음부터 끝까지 자연스럽게 읽히는 반면, 순서가 잘못된 PDF는 독자가 페이지 사이를 앞뒤로 이동하게 하기 때문에 시간이 많이 소요됩니다. 이것이 바로 분할이 해결하려고 했던 문제입니다.

분할 및 재정렬 후 최종 단일 페이지 PDF에서 OCR을 실행합니다. 이제 각 페이지의 텍스트 방향이 올바르게 지정되고 분리되어 양면 페이지 스프레드에서 OCR을 실행하는 것과 비교하여 OCR 정확도가 향상됩니다. 단일 페이지 OCR은 읽기 순서가 페이지 순서와 일치하는 텍스트 레이어도 생성하므로 구문을 검색하면 올바른 페이지 순서로 결과가 반환됩니다. 변환된 PDF 페이지는 이제 읽을 수 없는 이중 페이지 이미지 더미가 아니라 적절하게 순서가 지정되고 검색 가능한 디지털 책입니다.

전체 문서에서 왼쪽과 오른쪽 페이지의 너비가 동일하지 않고 분할 지점이 고르지 않은 책 스캔의 경우 반복적으로 참조할 문서에 대해 페이지별 수동 자르기는 시간을 투자할 가치가 있습니다. 자동 여백 감지 기능은 페이지의 80%를 올바르게 처리합니다. 나머지 20%는 개별적인 주의가 필요합니다. 일반적으로 페이지 레이아웃이 변경되는 장의 시작과 끝 페이지 또는 여백 전체에 걸쳐 전면 그림이 포함된 페이지입니다. 해당 페이지에서는 자동 분할로 인해 이미지 중간이 잘리거나 반대쪽 페이지가 일부만 보일 수 있습니다. 각 줄의 처음 몇 단어와 마지막 몇 단어를 분할하여 확인한 후 각 페이지 축소판을 열면 분할 경계에서 내용이 손실되지 않았음을 확인할 수 있습니다. 확인 패스는 페이지당 약 30초가 걸리며 대부분 올바른 분할을 정확히 올바른 분할로 변환합니다.

WukongPDF

PDF 분할을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →