Tips & Tricks

악보나 기보법이 포함된 PDF를 OCR하는 방법

악보는 광학 문자 인식에 대한 독특한 과제를 제시합니다. 표준 OCR 엔진은 악보를 구성하는 오선, 음표 머리, 줄기, 보, 음자리표 및 동적 표시의 복잡한 조합이 아닌 영숫자 문자의 수평선을 인식하도록 제작되었습니다. 악보를 PDF로 스캔하면 악보 이미지가 생성되며 해당 이미지를 편집 및 재생 가능한 디지털 악보로 변환하려면 텍스트 문서에서 OCR을 실행하는 것과 근본적으로 다른 접근 방식이 필요합니다. 표준 OCR이 제공하는 것과 음악가에게 필요한 것 사이의 격차는 전체 하위 분야, 광학 음악 인식 또는 OMR이 이를 해결하기 위해 개발될 만큼 충분히 넓습니다.

How to OCR a PDF That Contains Sheet Music or Musical Notation

표준 OCR 도구가 기보법으로 인해 실패하는 이유

표준 OCR 소프트웨어는 영숫자의 수평선을 감지합니다. 악보를 만나면 5개의 평행선이 인식 엔진을 혼란스럽게 합니다. 소프트웨어는 오선을 표 테두리, 밑줄 또는 필터링할 단순한 노이즈로 해석할 수 있습니다. 노트 헤드는 흩어진 점이나 얼룩으로, 줄기는 수직 막대로, 빔은 두꺼운 수평선으로 잘못 해석됩니다. 그 결과 원본 악보와 전혀 유사하지 않은 뒤죽박죽된 출력이 생성됩니다. 이 실패는 OCR 엔진의 품질이 낮아서 발생하는 문제가 아닙니다. 이는 카테고리 불일치입니다. 엔진은 악보가 아닌 텍스트 말뭉치를 기준으로 훈련되었으며 캐릭터를 구성하는 요소에 대한 기본 가정이 적용되지 않습니다.

일반적인 피아노 악보에는 버팀대에 의해 결합된 두 개의 보표, 보표당 여러 음색, 아티큘레이션 표시, 슬러, 타이, 다이내믹스 및 페달 표시가 포함되어 있다는 점을 고려하면 복잡성이 배가됩니다. 전체 오케스트라 악보에는 악기 이름, 마디 번호, 리허설 표시 및 템포 표시가 추가됩니다. 이러한 요소 중 어느 것도 표준 OCR PDF 엔진이 사용하는 문자별 인식 모델에 매핑되지 않습니다. 각 음악 기호는 오선보와 특정 공간적 관계를 차지하며, 2차원 위치 지정은 1차원 줄 단위 텍스트 인식기가 캡처할 수 없다는 의미를 전달합니다.

음악 표기법은 또한 상응하는 텍스트가 없는 공간 문법을 사용합니다. 보표에 있는 음표 헤드의 수직 위치에 따라 피치가 결정됩니다. 수평 간격은 리듬 지속 시간을 나타냅니다. 다른 음표보다 2인치 오른쪽에 위치한 4분음표는 완전히 다른 음악적 의미를 갖습니다. 텍스트용으로 설계된 OCR 도구에는 이 2차원 언어를 해석하는 메커니즘이 없습니다. 고도로 전문화되고 동등한 유니코드가 없는 기호를 포함하는 음악 조각에 사용되는 글꼴조차도 표준 OCR 엔진이 식별하도록 훈련된 문자 세트를 벗어납니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

더 나은 OCR 결과를 위해 악보 PDF 준비

악보 PDF를 인식 시스템에 공급하기 전에 몇 가지 준비 단계를 수행하면 출력 품질을 크게 향상시킬 수 있습니다. 스캔이 최대한 깨끗한지 확인하는 것부터 시작하십시오. 300~600DPI의 해상도는 음악 OCR에 이상적입니다. 해상도가 낮으면 메모 머리 부분과 작은 연결 표시가 함께 흐려지고, 해상도가 지나치게 높으면 인식 정확도가 향상되지 않고 종이 질감과 인쇄 아티팩트가 증폭됩니다. 목표는 가장 작은 의미 있는 기호(일반적으로 스타카토 점 또는 우연한 유예 음표)가 노이즈와 구별될 수 있을 만큼 충분한 픽셀을 차지하는 선명한 이미지입니다.

PDF가 평판 스캐너가 아닌 사진으로 생성된 경우 원근 왜곡을 확인하십시오. 비스듬히 촬영된 페이지에는 더 이상 완벽하게 수평이 아닌 보표가 있어 음악 OCR이 의존하는 보선 감지 알고리즘이 작동하지 않습니다. 진행하기 전에 스캐닝 소프트웨어나 PDF 편집기의 기울기 조정 기능을 사용하여 각도를 수정하세요. 전체 페이지 너비에서 1도만 벗어나도 음표 머리 위치가 충분한 픽셀만큼 이동하여 음 높이를 잘못 식별할 수 있습니다.

원래 표기법에 포함되지 않은 표시를 모두 제거하세요. 연필 주석, 커피 얼룩, 라이브러리 스탬프 및 펀치 구멍은 모두 인식 엔진이 해결해야 하는 시각적 소음을 생성합니다. 많은 PDF 편집기에는 사소한 결함을 처리할 수 있는 정리 또는 얼룩 제거 필터가 포함되어 있습니다. 점수가 많이 표시된 경우, 사용 가능한 경우 더 깨끗한 사본에서 작업하는 것을 고려하십시오. 소스 품질에 추가 노력을 들이면 인식 정확도가 기하급수적으로 향상됩니다. 적절한 기울기 및 반점 제거를 통해 처리된 깨끗한 400 DPI 스캔은 같은 페이지의 처리되지 않은 사진보다 30~40% 더 높은 인식률을 달성할 수 있습니다.

음악 전용 OCR 기술의 작동 방식

광학 음악 인식 또는 OMR이라고도 불리는 음악 OCR은 텍스트 인식을 훨씬 뛰어넘는 다단계 접근 방식을 취합니다. 첫 번째 단계는 직원 라인 탐지 및 제거입니다. 이 소프트웨어는 각 직원의 5개 평행선을 식별하고 Hough 변환 또는 유사한 선 감지 알고리즘을 사용하여 정확한 위치를 계산합니다. 일단 위치를 찾으면 이미지에서 오선이 수학적으로 제거되고 음악 기호만 남습니다. 이 단계만으로도 음악 OCR이 텍스트 OCR과 근본적으로 달라지며, 보선이 구부러지거나 끊어지거나 간격이 고르지 않은 경우 대부분의 오류가 발생하는 곳이기도 합니다.

보표 제거 후 두 번째 단계에서는 페이지에 남아 있는 모든 표시를 분류합니다. 노트 헤드는 타원형 모양과 보표선 위치를 기준으로 한 위치로 식별됩니다. 줄기는 노트 헤드에 부착된 수직선 세그먼트로 감지됩니다. 보는 여러 개의 줄기를 연결하는 두꺼운 수평 또는 비스듬한 막대로 인식됩니다. 샤프 및 내림표, 음자리표, 박자 기호, 쉼표 및 조음 표시와 같은 사고는 각각 수천 개의 예를 통해 훈련된 자체 인식 모델을 가지고 있습니다. 최신 OMR 시스템은 디지털 악보 라이브러리에서 생성된 합성 데이터에 대해 훈련된 컨벌루션 신경망을 사용하여 다양한 음악 조각 스타일을 처리할 수 있습니다(OMR Research Group, University of Leeds, 2025).

마지막 단계는 인식된 기호를 일관된 악보로 재조립하는 음악적 해석입니다. 여기에는 음표가 줄기를 공유하고 수직으로 정렬될 때 음표를 코드로 그룹화하고, 음표 머리 유형을 깃발, 점, 광선과 결합하여 리듬 값을 계산하고, 감지된 음자리표 및 조표를 기반으로 음표 머리의 수직 위치를 특정 피치에 매핑하는 작업이 포함됩니다. 출력은 일반적으로 MuseScore, Sibelius 또는 Finale와 같은 표기법 소프트웨어에서 열 수 있는 MusicXML 또는 MIDI 파일입니다. 각 단계에는 고유한 오류율과 오류가 복합되어 있으므로 기호 분류에서 95% 정확하고 음악 해석에서 90% 정확한 시스템은 약 85% 음표 정확도의 최종 출력을 생성하지만 여전히 수동 수정이 필요합니다.

온라인 OCR 도구를 통해 악보 실행

WukongPDF의 스캔 PDF OCR 기능은 악보 PDF를 처리하고 제목, 작곡가 이름, 템포 표시 및 가사와 같은 기본 텍스트 요소를 추출할 수 있습니다. 표기법을 MusicXML로 변환하지는 않지만 악보의 텍스트 레이어를 효과적으로 처리합니다. 이는 작곡가나 제목별로 스캔한 악보의 대규모 라이브러리를 검색해야 하거나 별도의 편집을 위해 보컬 악보에서 가사를 추출하려는 경우에 유용합니다. 추출된 텍스트는 영어, 이탈리아어, 독일어, 프랑스어 등 원본의 언어를 유지합니다.

악보 PDF를 OCR 도구에 업로드하여 시작하세요. 시스템은 각 페이지를 처리하여 악보 영역과 별도로 텍스트 영역을 식별합니다. 인식된 텍스트는 PDF 내에 검색 가능한 레이어로 포함되며 악보의 원래 그래픽 모양은 변경되지 않습니다. 음악은 원본 스캔과 동일해 보이지만 이제 문서 내에서 텍스트 문자열을 검색할 수 있습니다. 이러한 하이브리드 접근 방식은 성능에 대한 시각적 충실도를 유지하는 동시에 카탈로그 작성 및 조사를 위한 디지털 접근성을 추가합니다.

광범위한 연주 지침, 각주 또는 텍스트 형식의 중요한 해설이 포함된 악보의 경우 OCR은 해당 텍스트 자료를 모두 별도의 텍스트 파일이나 Word 문서로 추출할 수 있습니다. 검색 가능한 디지털 카탈로그를 작성하는 음악 사서와 프로그램 노트를 준비하는 지휘자는 이것이 특히 유용하다고 생각합니다. 500개의 스캔된 악보 컬렉션은 '안단테'라고 표시된 모든 작품을 검색하거나 전체 라이브러리에서 특정 음악 용어에 대한 모든 언급을 찾을 수 있으면 훨씬 더 관리하기 쉬워집니다.

일반 OCR과 전용 악보 표기 소프트웨어 중에서 선택

도구 선택은 출력에서 필요한 사항에 따라 다릅니다. 아래 표에는 범용 PDF OCR 도구와 특수 광학 음악 인식 응용 프로그램 간의 주요 차이점이 요약되어 있습니다.

기능일반 PDF OCR전용 OMR 소프트웨어
기본 출력검색 가능한 PDF, 추출된 텍스트MusicXML, MIDI, 편집 가능한 표기법
직원 라인 처리노이즈 또는 이미지 요소로 처리알고리즘을 통해 탐지 및 제거
피치 인식지원되지 않음직원 위치의 전체 피치 매핑
리듬 해석지원되지 않음음표 길이, 박자표, 튜플릿
텍스트 추출제목, 가사, 템포 표시텍스트와 모든 음악 기호
다음에 가장 적합검색 가능한 악보 아카이브, 가사 추출, 목록화편집, 조옮김, 재생, 편곡

많은 실제 작업의 경우 일반 OCR 도구를 사용하면 더 적은 설정으로 필요한 대부분을 얻을 수 있습니다. 스캔한 악보 모음을 텍스트 검색 가능하게 만들거나 합창단 리허설 시트의 보컬 악보에서 가사를 가져오는 것이 목표인 경우 브라우저 기반 OCR이 이러한 작업을 효율적으로 처리합니다. 실제 음표 편집, 새 키로 조옮김 또는 편곡 생성에는 OMR 가져오기 기능이 있는 전용 표기법 소프트웨어가 적합한 도구입니다. 두 가지 접근 방식은 상호보완적입니다. 실용적인 작업 흐름에서는 목록화 및 검색을 위해 일반 OCR을 사용한 다음, 음악 편집이 필요한 특정 악보에 대해 전용 OMR로 전환합니다.

OCR 출력 수정 및 디지털 점수 마무리

텍스트든 음악이든 OCR 프로세스는 첫 번째 패스에서 완벽한 출력을 생성하지 않습니다. 악보 작업을 할 때는 결과를 검토하고 수정하는 데 시간을 투자해야 합니다. 악보에서 추출된 텍스트의 경우 문자 l을 숫자 1로 착각하거나 문자 O를 숫자 0과 혼동하거나 오선과 겹치는 문자를 잘못 읽는 등의 일반적인 오류를 확인합니다. 'allegretto' 또는 'diminuendo'와 같은 이탈리아어 템포 표시는 주로 영어 텍스트로 훈련된 OCR 엔진이 이러한 용어에 대한 강력한 언어 모델을 갖고 있지 않을 수 있기 때문에 특히 오류가 발생하기 쉽습니다.

전용 OMR 소프트웨어를 사용한 경우 검토 프로세스가 더 복잡해집니다. MIDI 출력을 재생하고 일반적으로 페이지 가장자리, 얼룩 근처 또는 음표 머리가 겹치는 조밀한 코드 부분에서 발생하는 잘못된 음표를 들어보십시오. 조표와 박자표가 올바르게 식별되었는지 확인하십시오. 사고가 예상대로 조치를 수행하는지 확인하십시오. 대부분의 OMR 응용 프로그램은 불확실한 판독값을 다른 색상으로 강조 표시하므로 소프트웨어가 표시한 영역에 초점을 맞춰 수정할 수 있습니다. 검토 단계는 실패의 징후가 아니라 워크플로의 일부입니다. 전문 음악 조각사라도 디지털로 옮겨진 악보를 교정하는 데 상당한 시간을 소비합니다.

확인되면 인식된 음악 데이터가 포함된 PDF로 점수를 내보냅니다. 이렇게 하면 원본 스캔과 비슷하지만 기계가 읽을 수 있는 음악 표현이 포함된 파일이 제공됩니다. 이러한 파일은 디지털 음악 라이브러리 시스템에서 색인을 생성하거나, 연습용 앱으로 가져오거나, 기술이 발전함에 따라 계속 액세스할 수 있는 형식으로 보관할 수 있습니다. 시각적 보존과 디지털 접근성의 결합을 통해 원본 논문이 품질이 저하된 후에도 오랫동안 연주자, 학자 및 청취자가 음악 작품을 계속 사용할 수 있도록 보장합니다.

그것이 진정한 보상입니다.

작업은 결과만큼 가치가 있습니다.

WukongPDF

PDF OCR을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →