Tips & Tricks

원본 파일 이름을 유지하면서 스캔한 PDF에서 OCR을 일괄 실행하는 방법

스캔한 문서 폴더에서 OCR PDF을 실행하면 원본과 이름이 일치하는 검색 가능한 PDF가 생성됩니다. 일괄 OCR 도구가 출력 파일의 이름을 일반적으로 출력1.pdf, 출력2.pdf와 같이 바꾸면 원본과 검색 가능한 버전 간의 연결이 끊어집니다. OCR 프로세스를 통해 파일 이름을 보존하면 스캔한 문서를 체계적으로 정리하고 추적할 수 있습니다.

파일 이름 보존은 기능 제한이 아니라 구성 세부 사항입니다. 대부분의 OCR 도구는 기본적으로 입력 파일 이름을 기반으로 출력 파일 이름을 생성하거나 출력 이름 지정 패턴을 지정할 수 있습니다. 핵심은 200개의 파일 이름이 변경된 것을 발견한 후가 아니라 배치를 실행하기 전에 올바른 설정이나 명령줄 플래그를 찾는 것입니다.

WukongPDF의 스캔 PDF OCR 도구는 원본 파일 이름을 유지하면서 문서를 개별적으로 일괄적으로 처리합니다.

How to Batch-Run OCR on Scanned PDFs While Keeping Original Filenames

Acrobat Pro의 액션 마법사를 사용한 일괄 OCR

Acrobat Pro의 작업 마법사는 폴더에서 다단계 PDF 처리를 자동화합니다. 도구, 작업 마법사, 새 작업으로 이동합니다. 올바른 OCR 언어 및 출력 설정을 선택하여 텍스트 인식 단계를 작업에 추가합니다. 지정된 출력 폴더에 파일을 저장하는 저장 단계를 추가하고 선택적으로 _OCR과 같은 접미사를 추가하여 검색 가능한 파일을 원본과 구별합니다.

입력 폴더에서 작업을 실행합니다. Acrobat은 각 파일을 열고 OCR을 실행한 후 원본 파일 이름에 접미사를 추가하여 출력을 저장하고 다음 파일로 이동합니다. 출력 폴더에는 원본 report.pdf에 해당하는 report_OCR.pdf와 같은 이름을 가진 검색 가능한 PDF가 포함되어 있습니다. 접미사 접근 방식은 원본 파일 이름을 유지하면서 어떤 파일이 OCR 처리되었는지 명확하게 표시합니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

Tesseract를 사용한 명령줄 일괄 OCR

Tesseract는 한 번에 하나의 이미지 파일을 처리합니다. 스캔한 PDF 폴더의 일괄 OCR을 수행하려면 먼저 각 PDF 페이지를 이미지로 변환하고 Tesseract를 실행한 다음 검색 가능한 PDF로 다시 결합하세요. 쉘 스크립트가 파이프라인을 처리합니다. 폴더의 각 PDF에 대해 스크립트는 기본 파일 이름을 추출하고, 페이지를 TIFF 이미지로 변환하고, 적절한 언어 플래그로 Tesseract를 실행하고, 원래 기본 파일 이름으로 검색 가능한 PDF를 생성합니다.

스크립트는 매개변수 확장을 사용하여 파일 확장자를 제거합니다. base=${f%.pdf}는 .pdf 없이 파일 이름을 제공합니다. Tesseract의 출력 이름은 $base이고 검색 가능한 PDF는 ${base}_searchable.pdf로 저장됩니다. 원본 파일 이름은 출력 이름에 유지됩니다. 한 줄 루프는 전체 폴더를 처리합니다. for f in *.pdf; tesseract $f ${f%.pdf} -l eng PDF를 수행합니다. 완료.

OCRmyPDF를 사용한 간소화된 일괄 OCR

OCRmyPDF는 기존 PDF에 OCR 텍스트 레이어를 추가하는 Python 기반 명령줄 도구입니다. 내부적으로 이미지 추출, OCR 및 PDF 리어셈블리를 처리합니다. 단일 명령으로 하나의 PDF(ocrmypdf input.pdf output.pdf)를 처리합니다. 출력에서는 페이지 이미지를 유지하고 그 뒤에 인식된 텍스트를 보이지 않는 레이어로 추가합니다.

일괄 처리의 경우 OCRmyPDF는 --batch 플래그가 있는 폴더 경로를 허용하거나 쉘 스크립트에서 반복될 수 있습니다. PDF 처리에서 Tesseract에 비해 가장 큰 장점은 OCRmyPDF가 PDF 입력 및 출력과 직접 작동한다는 것입니다. 중간 이미지 변환이 필요하지 않습니다. 출력 파일 이름은 원래 명명 규칙을 유지하면서 파일별로 지정할 수 있습니다. 대용량 스캔 문서의 디지털화를 위해 쉘 루프와 결합된 OCRmyPDF는 원시 스캔에서 검색 가능한 아카이브까지 가장 효율적인 경로를 제공합니다.

도구배치 방법파일 이름 처리
Acrobat Pro 액션 마법사작업 생성, 폴더에 적용원본 파일 이름을 유지하고 접미사를 추가합니다.
테서랙트 CLI폴더에 대한 쉘 for 루프출력이 입력 파일 이름과 일치합니다.
OCRmyPDF파일 또는 배치당 단일 명령설정에 따라 새 파일을 덮어쓰거나 생성합니다.

일괄 OCR 출력 확인

일괄 처리 후 원본을 보관하기 전에 출력 파일의 샘플을 확인하세요. 알파벳순으로 정렬된 파일 목록의 다양한 부분에서 3~5개의 출력 PDF를 엽니다. 스캔한 이미지에 보이는 단어를 검색하세요. 검색에서 해당 단어가 발견되면 해당 파일에 대해 OCR이 성공한 것입니다. 각 샘플 파일의 첫 번째 페이지, 중간 페이지 및 마지막 페이지를 무작위로 확인합니다. 페이지의 스캔 품질이 다를 경우 문서 내에서 OCR 품질이 달라질 수 있습니다.

문서 워크플로우의 경우 OCR에 실패한 문서, 검색 결과가 아무것도 없는 PDF로 표시된 문서의 경우 설정을 조정하여 OCR을 다시 실행하세요. 원본 스캔 품질이 낮은 경우 이미지 해상도를 400DPI로 높입니다. Tesseract의 결과가 좋지 않으면 다른 OCR 엔진을 사용해 보십시오. 전체 배치를 다시 실행하는 대신 문제 파일을 개별적으로 처리합니다.

파일 이름 보존 기능을 갖춘 일괄 OCR은 액세스할 수 없는 스캔 문서 폴더를 모든 파일을 원본으로 추적할 수 있는 검색 가능한 아카이브로 변환합니다. 파일 이름은 원본 스캔과 OCR 강화 버전 간의 링크입니다.

OCR 강화 스캔 PDF의 장기 저장

설정이 완료되면 일괄 OCR 처리 후 페이지 이미지와 OCR 텍스트 레이어를 모두 보존하는 위치에 검색 가능한 PDF를 저장합니다. 텍스트 레이어가 포함된 PDF/A 형식이 보관 표준입니다. PDF/A 출력 설정과 함께 Acrobat Pro 또는 Ghostscript를 사용하여 OCR 출력을 PDF/A로 변환합니다.

실제로 OCR 텍스트 레이어는 최소한의 파일 크기 오버헤드(일반적으로 5~15%)를 추가합니다. 검색 가능성을 위해 약간 큰 파일을 선택하는 것은 거의 항상 그만한 가치가 있습니다. 검색할 수 없는 스캔 문서는 검색할 수 있는 문서보다 훨씬 덜 유용합니다.

실제로 일괄 OCR 출력의 디렉터리 구조는 중첩된 폴더를 처리할 때 입력 구조를 반영해야 합니다. 상대 경로 구조를 유지하는 재귀 배치 스크립트는 OCR 강화 파일이 원본과 동일한 조직 계층을 유지하도록 보장합니다.

문서 워크플로와 관련하여 수천 개의 문서가 포함된 대규모 일괄 OCR 프로젝트의 경우 워크로드를 여러 세션 또는 컴퓨터로 분할하는 것을 고려하십시오. OCR은 계산 집약적이므로 단일 시스템에서 1만 페이지 배치를 처리하는 데 몇 시간이 걸릴 수 있습니다.

설정이 완료되면 일괄 OCR 프로젝트를 완료한 후 모든 입력 파일, 해당 출력 파일, 사용된 OCR 엔진 및 설정, 처리 날짜를 나열하는 처리 매니페스트를 생성합니다. 매니페스트는 처리된 파일의 문서 및 기록 역할을 합니다.

실제로 이를 살펴보면 검색 불가능한 스캔 아카이브에서 검색 가능한 OCR 강화 컬렉션으로의 전환은 가장 영향력이 큰 디지털화 활동 중 하나입니다. 이전에 접근할 수 없었던 문서를 검색하는 기능은 해당 문서를 정적 기록에서 활성 정보 리소스로 변환합니다.

OCR 처리 속도는 문서의 복잡성에 따라 다릅니다. 텍스트 전용 페이지는 빠르게 처리됩니다. 표, 혼합 글꼴 또는 장식 요소가 포함된 페이지는 시간이 더 오래 걸립니다. 균일한 텍스트 페이지 묶음은 다양한 콘텐츠 묶음보다 빠르게 완료됩니다.

대부분의 도구에서 OCR 언어 설정은 일괄 처리 시간과 정확성에 영향을 미칩니다. 문서에 실제로 존재하는 언어만 선택하면 불필요한 처리 오버헤드가 방지되고 사용되지 않는 언어 모델에서 잘못된 문자 인식이 줄어듭니다.

텍스트와 사진이 모두 포함된 문서의 경우 OCR 엔진은 사진 영역의 텍스트 인식을 시도하여 노이즈 문자를 생성할 수 있습니다. 사후 OCR 필터링은 인식된 텍스트의 공간 분포를 분석하여 이러한 아티팩트를 제거합니다.

일반적으로 OCR 입력 이미지의 DPI 설정은 처리 속도와 정확성의 균형을 맞춥니다. 300DPI가 표준 권장 사항입니다. 400DPI는 작은 텍스트의 정확성을 향상시킵니다. 200 DPI는 처리 속도가 빠르지만 미세한 문자가 누락될 수 있습니다.

일괄 OCR 후 원본에 나타나는 것으로 알려진 용어를 사용하여 처리된 파일에 대해 키워드 검색 테스트를 실행합니다. 키워드를 찾을 수 없는 파일은 설정을 조정하여 다시 처리하거나 직접 검토해야 합니다.

OCR 출력 파일은 처리된 파일과 원본을 분리하는 폴더 구조에 저장되어야 합니다. 이렇게 하면 이미 OCR이 강화된 파일을 실수로 다시 처리하는 것을 방지하고 아카이브를 체계적으로 정리할 수 있습니다.

실제로 이러한 맥락에서 OCR 텍스트 레이어를 추출하여 각 문서에 대한 일반 텍스트 파일로 별도로 저장할 수 있습니다. 별도의 텍스트 파일은 각 PDF를 개별적으로 열지 않고도 아카이브 전체에서 전체 텍스트 검색을 지원합니다.

문서 처리 시 고부가가치 스캔 아카이브의 경우 두 가지 다른 엔진으로 OCR을 실행하고 출력을 비교하는 것이 좋습니다. 엔진 간의 불일치는 수동 확인이 필요한 불확실한 인식을 강조합니다.

일괄 OCR은 종이 아카이브와 디지털 검색 사이의 다리입니다. 스캔하고 OCR 처리한 종이 문서 보관 캐비닛은 검색 가능한 지식 기반이 됩니다. 물리적인 것에서 검색 가능한 디지털로의 전환은 조직이 이룰 수 있는 가장 영향력 있는 정보 관리 혁신 중 하나입니다.

파일 이름 보존 기능을 갖춘 일괄 OCR은 액세스할 수 없는 스캔 문서 폴더와 검색 가능한 디지털 아카이브 사이의 다리 역할을 합니다. 처리가 자동화됩니다. 파일 이름은 추적성을 제공합니다. OCR 텍스트 레이어는 모든 문서를 검색 가능하게 만듭니다. 이 조합은 정적 컬렉션을 활성 정보 리소스로 변환합니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →