Tips & Tricks

楽譜または楽譜を含む PDF を OCR する方法

楽譜は、光学式文字認識に独特の課題をもたらします。標準の OCR エンジンは、楽譜を構成する五線、符頭、符尾、連桁、音部記号、強弱記号の複雑な組み合わせではなく、英数字の水平線を認識するように構築されています。楽譜をスキャンして PDF に保存すると、楽譜の画像が得られます。その画像を編集可能で再生可能なデジタル楽譜に変換するには、テキスト ドキュメントで OCR を実行する場合とは根本的に異なるアプローチが必要です。標準 OCR が提供するものとミュージシャンが必要とするものとの間のギャップは十分に大きいため、これに対処するために光学式音楽認識 (OMR) というサブフィールド全体が開発されました。

How to OCR a PDF That Contains Sheet Music or Musical Notation

標準の OCR ツールが楽譜で失敗する理由

標準の OCR ソフトウェアは、英数字の横線を検出します。五線譜に遭遇すると、5 本の平行線が認識エンジンを混乱させます。ソフトウェアは、五線を表の境界線、下線、またはフィルタリングして除去すべき単なるノイズとして解釈する場合があります。符頭は点や塊として、符尾は縦棒として、連桁は太い横線として誤解されます。結果として、元のスコアとは似ても似つかない、ごちゃごちゃした出力が生成されます。この障害は、OCR エンジンの品質が低いという問題ではありません。これはカテゴリの不一致です。エンジンは楽譜ではなくテキスト コーパスに基づいてトレーニングされており、文字を構成するものについての基本的な前提が適用されません。

一般的なピアノ スコアには中括弧で結合された 2 つの譜表が含まれており、譜表ごとに複数の声部、アーティキュレーション マーク、スラー、タイ、ダイナミクス、ペダル記号が含まれていることを考えると、複雑さはさらに増します。フルオーケストラスコアには、楽器名、小節番号、リハーサルマーク、テンポ表示が追加されます。これらの要素はいずれも、標準の OCR PDF エンジンが依存する文字ごとの認識モデルにマップされません。各音楽記号は五線譜に対して特定の空間関係を占めており、その 2 次元の配置は 1 次元の行ごとのテキスト認識装置では捉えることができない意味を持っています。

楽譜も、テキストに相当するものがない空間文法を使用します。五線上の符頭の垂直位置によって、そのピッチが決まります。水平方向の間隔はリズミカルな継続時間を示します。四分音符の 2 インチ右に位置する四分音符は、まったく異なる音楽的意味を持ちます。テキスト用に設計された OCR ツールには、この 2 次元言語を解釈するメカニズムがありません。音楽の彫刻に使用されるフォントでさえ、高度に専門化されており、Unicode に相当するものがない記号が含まれており、標準の OCR エンジンが識別するように訓練されている文字セットの範囲外にあります。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

より良い OCR 結果を得るための楽譜 PDF の準備

楽譜 PDF を認識システムに入力する前に、いくつかの準備手順を行うことで、出力品質を大幅に向上させることができます。まず、スキャンが可能な限りクリーンであることを確認します。 300 ~ 600 DPI の解像度は音楽 OCR に最適です。解像度が低いと符頭と小さなアーティキュレーションマークがぼやけてしまいますが、解像度が高すぎると認識精度が向上せずに紙の質感や印刷アーチファクトが増幅されます。目標は、最小の意味のある記号 (通常はスタッカート ドットや装飾音符の臨時記号) が、ノイズと区別できるのに十分なピクセルを占める、鮮明な画像です。

PDF がフラットベッド スキャナーではなく写真から作成された場合は、遠近法の歪みがないか確認してください。斜めに撮影されたページでは、譜表が完全に水平ではなくなり、音楽 OCR が依存する譜表線検出アルゴリズムが機能しなくなります。スキャン ソフトウェアまたは PDF エディタのデスキュー機能を使用して、続行する前に角度を修正します。ページ全体の幅全体で 1 度でもずれると、音符の頭の位置が十分なピクセルだけずれて、ピッチの誤認識が発生する可能性があります。

元の表記の一部ではないマークは削除してください。鉛筆の注釈、コーヒーの染み、図書館のスタンプ、パンチ穴はすべて、認識エンジンが回避する必要がある視覚的なノイズを生成します。多くの PDF エディターには、軽微な欠陥を処理できるクリーンアップ フィルターまたは斑点除去フィルターが含まれています。大きくマークされたスコアについては、よりクリーンなコピーが利用可能な場合は、それから作業することを検討してください。ソースの品質に費やす余分な労力は、認識精度において飛躍的に報われます。適切なデスキューと斑点除去で処理されたクリーンな 400 DPI スキャンは、同じページの未処理の写真よりも 30 ~ 40% 高い認識率を達成できます。

音楽特有の OCR テクノロジーの仕組み

音楽 OCR は、光学式音楽認識または OMR とも呼ばれ、テキスト認識をはるかに超えた多段階のアプローチを採用しています。最初の段階は、スタッフラインの検出と削除です。ソフトウェアは各譜表の 5 本の平行線を識別し、ハフ変換または同様の線検出アルゴリズムを使用してその正確な位置を計算します。位置が特定されると、譜線が画像から数学的に差し引かれ、音楽記号のみが残ります。このステップだけが、楽譜 OCR がテキスト OCR と根本的に異なる点であり、五線が曲がっていたり、途切れていたり、不均等な間隔であったりする場合、ほとんどのエラーが発生する場所でもあります。

スタッフが削除された後、第 2 段階でページに残っているすべてのマークが分類されます。符頭は、楕円形の形状と、五線があった位置との相対的な位置によって識別されます。符幹は符頭に付随する垂直線分として検出されます。梁は、複数の幹を接続する太い水平または斜めの棒として認識されます。シャープとフラット、音部記号、拍子記号、休符、アーティキュレーション記号などの臨時記号には、それぞれ数千の例でトレーニングされた独自の認識モデルがあります。最新の OMR システムは、デジタル スコア ライブラリから生成された合成データでトレーニングされた畳み込みニューラル ネットワークを使用し、さまざまな音楽彫刻スタイルを処理できるようにしています (OMR Research Group、リーズ大学、2025)。

最終段階は音楽解釈であり、認識された記号が一貫したスコアに再組み立てされます。これには、音符が符幹を共有し、垂直方向に整列する場合に音符をコードにグループ化し、符頭タイプとフラグ、ドット、連桁を組み合わせてリズミカルな値を計算し、検出された音部記号と調号に基づいて符頭の垂直位置を特定のピッチにマッピングすることが含まれます。出力は通常、MuseScore、Sibelius、Finale などの記譜ソフトウェアで開くことができる MusicXML または MIDI ファイルです。これらの各段階には独自のエラー率があり、エラーが複合するため、記号分類で 95 パーセントの精度、音楽解釈で 90 パーセントの精度を備えたシステムは、音符精度が約 85 パーセントの最終出力を生成しますが、それでも手動による修正が必要です。

オンライン OCR ツールによる楽譜の実行

WukongPDF の スキャン PDF OCR 機能は、楽譜 PDF を処理し、タイトル、作曲家名、テンポ記号、歌詞などの基礎となるテキスト要素を抽出できます。記譜法を MusicXML に変換しませんが、楽譜のテキスト レイヤーを効果的に処理します。これは、スキャンされたスコアの大規模なライブラリを作曲者またはタイトル別に検索する必要がある場合、または個別に編集するためにボーカル スコアから歌詞を抽出する必要がある場合に便利です。抽出されたテキストは、英語、イタリア語、ドイツ語、フランス語など、元の言語を保持します。

まず、楽譜 PDF を OCR ツールにアップロードします。システムは各ページを処理し、楽譜領域とは別にテキスト領域を識別します。認識されたテキストは PDF 内に検索可能なレイヤーとして埋め込まれますが、スコアの元のグラフィックの外観は変更されません。音楽は元のスキャンと同じように見えますが、ドキュメント内のテキスト文字列を検索できるようになりました。このハイブリッド アプローチでは、パフォーマンスの視覚的な忠実性を維持しながら、カタログ作成や調査のためのデジタル アクセシビリティを追加します。

広範な演奏指示、脚注、または重要なコメントがテキスト形式で含まれているスコアの場合、OCR はそのテキスト内容をすべて別のテキスト ファイルまたは Word 文書に抽出できます。検索可能なデジタル カタログを作成する音楽図書館員や、プログラム ノートを作成する指揮者にとって、これは特に価値があると考えられます。 「アンダンテ」とマークされたすべての曲を検索したり、ライブラリ全体で特定の音楽用語の言及をすべて見つけたりできると、スキャンされた 500 のスコアのコレクションがはるかに管理しやすくなります。

一般的な OCR と専用の楽譜作成ソフトウェアの選択

ツールの選択は、出力から何が必要かによって異なります。以下の表は、汎用 PDF OCR ツールと特殊な光学式音楽認識アプリケーションの主な違いをまとめたものです。

機能一般的な PDF OCR専用OMRソフトウェア
一次出力検索可能な PDF、抽出されたテキストMusicXML、MIDI、編集可能な記譜法
スタッフライン対応ノイズまたは画像要素として扱うアルゴリズムで検出して削除します
ピッチ認識サポートされていません五線位置からのフルピッチマッピング
リズム解釈サポートされていません音符の長さ、拍子記号、連符
テキスト抽出タイトル、歌詞、テンポ記号テキストとすべての音楽記号
こんな方に最適検索可能な楽譜アーカイブ、歌詞抽出、カタログ化編集、移調、再生、編曲

多くの実際的なタスクでは、一般的な OCR ツールを使用すると、少ないセットアップで必要なもののほとんどを得ることができます。スキャンしたスコアのコレクションをテキスト検索可能にすること、または合唱団のリハーサル シートのボーカル スコアから歌詞を抽出することが目的の場合、ブラウザ ベースの OCR はこれらのタスクを効率的に処理します。実際の音を編集したり、新しいキーに移調したり、アレンジメントを作成するには、OMR インポートを備えた専用の記譜ソフトウェアが最適なツールです。 2 つのアプローチは補完的です。実際のワークフローでは、カタログ作成と検索に一般的な OCR を使用し、音楽編集が必要な特定のスコアについては専用の OMR に切り替えます。

OCR 出力の修正とデジタルスコアの完成

テキストであれ音楽であれ、最初のパスで完璧な出力を生成する OCR プロセスはありません。楽譜を扱うときは、結果のレビューと修正に時間がかかることを想定してください。スコアから抽出されたテキストについて、文字 l と数字の 1 の間違い、文字 O と数字の 0 の混同、五線と重なる文字の読み間違いなどの一般的なエラーがないか確認します。 「アレグレット」や「ディミヌエンド」などのイタリア語のテンポ記号は、主に英語のテキストでトレーニングされた OCR エンジンにはこれらの用語に対する強力な言語モデルがない可能性があるため、特にエラーが発生しやすくなります。

専用の OMR ソフトウェアを使用した場合、レビュー プロセスはより複雑になります。 MIDI 出力を再生して、間違ったノートを聞きます。通常、ページの端、汚れの近く、または符頭が重なっている密集したコードパッセージで発生します。調号と拍子記号が正しく識別されていることを確認してください。臨時記号が期待どおりに小節を通過することを確認します。ほとんどの OMR アプリケーションは、不確実な読み取り値を別の色で強調表示するため、ソフトウェアがフラグを立てた領域に焦点を当てて修正することができます。レビュー手順はワークフローの一部であり、失敗の兆候ではありません。プロの楽譜彫刻家でも、デジタル的に転写された楽譜の校正にはかなりの時間を費やしています。

確認したら、認識された音楽データが埋め込まれた PDF としてスコアをエクスポートします。これにより、オリジナルのスキャンに似たファイルが得られますが、音楽の機械可読表現が含まれています。このようなファイルは、デジタル音楽ライブラリ システムによってインデックスを作成したり、練習用アプリにインポートしたり、テクノロジーが進化してもアクセス可能な形式でアーカイブしたりできます。視覚的な保存とデジタル アクセシビリティの組み合わせにより、元の紙が劣化した後も、演奏者、学者、リスナーが音楽作品を利用できる状態が維持されます。

それが本当の見返りです。

仕事は結果に価値がある。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →