樂譜對光學字元辨識提出了獨特的挑戰。標準 OCR 引擎旨在識別字母數字字元的水平線,而不是構成樂譜的五線譜線、音符頭、符幹、橫梁、譜號和動態標記的複雜組合。當您將樂譜掃描成 PDF 時,您得到的是樂譜影像,而將該影像轉換為可編輯、可播放的數位樂譜需要採用與在文字文件上執行 OCR 完全不同的方法。標準 OCR 提供的內容與音樂家所需的內容之間的差距足夠大,以至於已經開發出整個子領域——光學音樂識別(OMR)來解決這個問題。

為何標準 OCR 工具無法處理樂譜
標準 OCR 軟體可偵測字母數字字元的水平線。當它遇到五線譜時,五條平行線會迷惑辨識引擎。軟體可能會將五線譜解釋為表格邊框、底線或只是要過濾掉的雜訊。音符頭被誤解為雜散點或斑點,莖被誤解為垂直條,梁被誤解為粗水平線。結果是混亂的輸出,與原始樂譜沒有相似之處。此故障並非 OCR 引擎品質低落的問題。這是類別不匹配:引擎是根據文本語料庫而不是樂譜進行訓練的,並且其關於字符構成的基本假設不適用。
當您考慮到典型的鋼琴樂譜包含兩個由大括號連接的五線譜、每個五線譜有多個聲部、發音標記、連線、連線、力度和踏板標記時,複雜性就會成倍增加。完整的管弦樂樂譜添加了樂器名稱、小節編號、排練標記和速度指示。這些元素均未對應到標準OCR PDF引擎所依賴的逐字辨識模型。每個音樂符號與五線譜都具有特定的空間關係,並且二維定位所承載的含義是一維逐行文本識別器無法捕獲的。
樂譜也使用空間語法,沒有等效的文字。音符頭在五線譜上的垂直位置決定了它的音高。水平間距表示節奏持續時間。位於另一個四分音符右側兩英寸處的四分音符具有完全不同的音樂意義。專為文字設計的 OCR 工具並沒有解釋這種二維語言的機制。即使是音樂雕刻中使用的高度專業化的字體,包含沒有 Unicode 等效項的符號,也不屬於標準 OCR 引擎經過訓練可識別的字元集。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
準備樂譜 PDF 以獲得更好的 OCR 結果
在將樂譜 PDF 輸入任何識別系統之前,一些準備步驟可以顯著提高輸出品質。首先確保您的掃描盡可能乾淨。 300 至 600 DPI 的解析度是音樂 OCR 的理想選擇。較低的解析度會導致音符頭和小發音標記模糊在一起,而過高的解析度會放大紙張紋理和列印偽影,而不會提高辨識精度。目標是獲得清晰的圖像,其中最小的有意義的符號(通常是斷奏點或偶然的裝飾音符)佔據足夠的像素以與雜訊區分開。
如果您的 PDF 是根據照片而不是平板掃描器建立的,請檢查透視變形。以一定角度拍攝的頁面的五線譜將不再完全水平,這會影響音樂 OCR 所依賴的五線譜線檢測演算法。在繼續操作之前,請使用掃描軟體或 PDF 編輯器中的傾斜校正功能來校正角度。整個頁面寬度上即使只有 1 度的偏差也會使音符頭位置移動足夠的像素,從而導致音高錯誤識別。
刪除不屬於原始符號的所有標記。鉛筆註記、咖啡漬、圖書館印章和打孔都會產生視覺噪音,辨識引擎必須解決這些噪音。許多 PDF 編輯器都包含可以處理微小缺陷的清潔或去斑濾鏡。對於標記較多的樂譜,請考慮使用更清晰的副本(如果有)。在源質量上花費的額外努力在識別準確性方面得到了指數級的回報。經過適當的糾偏和去斑處理後的乾淨 400 DPI 掃描可實現比同一頁面未經處理的照片高 30% 至 40% 的識別率。
音樂特定 OCR 技術的工作原理
音樂 OCR(有時稱為光學音樂辨識或 OMR)採用的多階段方法遠遠超出了文字辨識的範圍。第一階段是人員在線檢測和清除。該軟體識別每個員工的五個平行線,並使用霍夫變換或類似的線檢測演算法計算它們的精確位置。一旦找到,五線譜線就會以數學方式從圖像中減去,只留下音樂符號。僅此一步就使音樂 OCR 與文字 OCR 根本不同,如果五線譜線彎曲、斷裂或間距不均勻,這也是大多數錯誤產生的地方。
人員移除後,第二階段將頁面上剩餘的每個標記進行分類。音符頭透過其橢圓形狀及其相對於五線譜線的位置來識別。莖被檢測為附加到音符頭的垂直線段。梁被認為是連接多個桿的粗水平或傾斜桿。升記號和降記號、譜號、拍號、休止符和發音記號等記號都有自己的識別模型,經過數千個範例的訓練。現代 OMR 系統使用基於數位樂譜庫生成的合成資料進行訓練的捲積神經網絡,使它們能夠處理各種音樂雕刻風格(OMR 研究小組,利茲大學,2025 年)。
最後階段是音樂詮釋,將辨識的符號重新組合成連貫的樂譜。這包括當共享主幹並垂直對齊時將音符分組為和弦,透過將音符頭類型與旗、點和梁相結合來計算節奏值,並根據檢測到的譜號和調號將音符頭的垂直位置映射到特定音高。輸出通常是 MusicXML 或 MIDI 文件,可以在 MuseScore、Sibelius 或 Finale 等記譜軟體中開啟。每個階段都有自己的錯誤率和錯誤複合,因此符號分類準確率達到 95%、音樂解釋準確率達到 90% 的系統會產生大約 85% 音符準確度的最終輸出,但仍需要手動校正。
透過線上 OCR 工具運行樂譜
WukongPDF 的掃描 PDF OCR 功能可以處理樂譜 PDF 並提取底層文本元素,如標題、作曲家姓名、節奏標記和歌詞。雖然它不會將記譜轉換為 MusicXML,但它可以有效地處理樂譜的文字圖層。當您需要按作曲家或標題在大型掃描樂譜庫中進行搜尋時,或者當您想要從聲樂樂譜中提取歌詞進行單獨編輯時,這非常有用。提取的文本保留原始語言,無論是英語、義大利語、德語或法語。
首先將樂譜 PDF 上傳到 OCR 工具。系統處理每個頁面,將文字區域與樂譜區域分開識別。然後,識別出的文字將作為可搜尋層嵌入到 PDF 中,而樂譜的原始圖形外觀保持不變。您的音樂看起來與原始掃描相同,但您現在可以在文件中搜尋文字字串。這種混合方法保留了性能的視覺保真度,同時增加了編目和研究的數位可近性。
對於包含大量文字形式的演奏說明、腳註或批評評論的樂譜,OCR 可以將所有文字資料提取到單獨的文字檔案或 Word 文件中。音樂圖書館員建立可搜尋的數位目錄和指揮家準備節目說明發現這特別有價值。當您可以搜尋所有標記為「行板」的作品或在整個庫中找到每個提及特定音樂術語的內容時,500 個掃描樂譜的集合變得更加易於管理。
通用OCR和專用樂譜軟體之間的選擇
您選擇的工具取決於您需要的輸出。下表概述了通用 PDF OCR 工具和專用光學音樂辨識應用程式之間的主要差異。
| 功能 | 通用 PDF OCR | 專用 OMR 軟體 |
|---|---|---|
| 主輸出 | 可搜尋的 PDF、擷取的文本 | MusicXML、MIDI、可編輯符號 |
| 人員線路處理 | 視為雜訊或影像元素 | 透過演算法檢測並刪除 |
| 音調識別 | 不支援 | 員工位置的完整音調映射 |
| 節奏詮釋 | 不支援 | 音符長度、拍號、連音 |
| 文字擷取 | 標題、歌詞、節奏標記 | 文字加上所有音樂符號 |
| 最適合 | 可搜尋樂譜檔案、歌詞擷取、編目 | 編輯、移調、播放、編曲 |
對於許多實際任務,通用 OCR 工具只需較少的設定即可滿足您的大部分需求。如果您的目標是使掃描的樂譜集合可進行文字搜索,或從合唱團排練表的聲樂樂譜中提取歌詞,基於瀏覽器的 OCR 可以有效地處理這些任務。對於編輯實際音符、移調到新調或建立編排,具有 OMR 匯入功能的專用記譜軟體是正確的工具。這兩種方法是互補的。實用的工作流程使用通用 OCR 進行編目和搜索,然後切換到專用 OMR 來處理需要音樂編輯的特定樂譜。
修正 OCR 輸出並最終確定您的數位樂譜
無論是文字或音樂,任何 OCR 過程都無法在第一遍就產生完美的輸出。在處理樂譜時,需要花時間檢查和修正結果。對於從樂譜中提取的文本,檢查是否存在常見錯誤,例如將字母 l 誤認為數字 1、將字母 O 與數字 0 混淆以及誤讀與五線譜線重疊的字元。義大利節奏標記(如“allegretto”或“diminuendo”)特別容易出錯,因為主要針對英語文本訓練的 OCR 引擎可能沒有針對這些術語的強大語言模型。
如果您使用專用的 OMR 軟體,審核過程會更加複雜。播放 MIDI 輸出並聆聽錯誤的音符,這些音符通常出現在頁面邊緣、污跡附近或音符頭重疊的密集和弦通道中。檢查調號和拍號是否正確辨識。驗證意外事件是否如預期執行該措施。大多數 OMR 應用程式都會以不同的顏色突出顯示不確定的讀數,因此您可以將修正集中在軟體標記的區域上。審核步驟是工作流程的一部分,而不是失敗的跡象。即使是專業的音樂雕刻家也會花費大量時間校對數位轉錄的樂譜。
驗證後,將您的樂譜匯出為 PDF,並嵌入已識別的音樂資料。這將為您提供一個看起來像原始掃描的文件,但包含音樂的機器可讀表示。此類文件可以透過數位音樂庫系統進行索引,匯入到練習應用程式中,或以隨著技術的發展而保持可存取的格式進行存檔。視覺保存和數位可訪問性的結合確保了音樂作品在原始紙張損壞很長時間後仍可供表演者、學者和聽眾使用。
這才是真正的回報。
工作是值得的。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
