Kyutai、マルチ楽器音楽の MIDI 変換向けオープンウェイトモデル「MuScriptor」を公開
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
Kyutai と Mirelo は、多楽器の音楽録音から MIDI を生成するオープンウェイトモデル「MuScriptor」をリリースし、単一楽器の転写では解決できなかった複雑なミックスの課題に挑戦している。
AI深層分析を開く2026年8月1日 19:58
AI深層分析
キーポイント
Decoder-Only Transformer の採用
MuScriptor は音声セグメントのメルスペクトログラムを入力とし、言語モデル化されたタスクとしてピッチ、タイミング、楽器を自己回帰的に予測するアーキテクチャを採用している。
3 段階のトレーニングパイプライン
同モデルは、約 145 万ファイルの合成データによる事前学習、17 万曲の実録音データによる微調整、および 300 トラックの手動検証データを用いた強化学習という 3 段階を経て訓練される。
性能とライセンスの明示
評価では既存モデルを凌駕するスコアを示し、1.4B パラメータの大規模版を含む 3 つのサイズバリアントが Hugging Face で提供されるが、商用利用は制限されている。
学習段階ごとの性能向上と実データの影響
合成データのみのトレーニングではフレームF1は競争力があるがオンセットやマルチスコアが弱く、実データを追加すると全ての指標が約20ポイント向上する。さらにRL事後学習により偽陰性が減少し、オンセットタイミングが鋭くなる。
標準MIDI出力による多様な活用事例
標準MIDI形式の出力により、プロデューサーによる音色再構成や音楽学者による歴史的録音の分析、教育現場でのライブピアノロール表示など幅広いワークフローが可能となる。
重要な引用
Kyutai and Mirelo team now release MuScriptor to close that gap.
In effect, transcription becomes a language-modeling task, following the MT3 tokenization scheme.
The reward sums three F-scores: onset, frame, and offset. As a result, the model learns to favor cleaner transcriptions.
Clearly, every stage improves results, and real data matters most.
編集コメントを表示
編集コメント
多楽器の複雑なミックス音源を扱う課題に対して、データ駆動型のアプローチで大きな進展を示した事例である。商用利用制限はあるものの、研究コミュニティや非営利用途における音楽 AI の発展に寄与する重要なリリースと言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
自動音楽転写(AMT)は、オーディオ録音を通常 MIDI 形式の記譜音符に変換する技術です。単一楽器の転写はすでにそれなりに機能していますが、フルな多楽器ミックスの転写はまだ困難な課題です。Kyutai と Mirelo のチームは、このギャップを埋めるために MuScriptor を公開しました。これは、多くのジャンルにわたる実際の多楽器録音データで訓練されたオープンウェイトモデルです。
この記事では、MuScriptor の仕組み、ベンチマーク結果、および実行方法について解説します。
MuScriptor とは何か?
MuScriptor の核心は、音楽転写専用のデコーダーオンリー Transformer です。まず、短いオーディオセグメントのメルスペクトログラムを読み込みます。次に、ピッチ、タイミング、楽器を表現する MIDI 形式トークンを自己回帰的に予測します。つまり、転写処理は MT3 トークン化スキームに従った言語モデルタスクとして扱われます。
今回のリリースでは、Hugging Face で 3 つのウェイトバリアントが提供されています。サイズは小(103M)、中(307M、デフォルト)、大(1.4B)です。推論コードには MIT ライセンスが適用されます。一方、モデルウェイトは CC BY-NC 4.0 ライセンスのため、商用利用は制限されています。
3 つの段階からなるパイプラインの仕組み
MuScriptor の主眼はアーキテクチャではなくデータにあります。そのため、訓練は 3 つの段階を経て行われ、各段階が前段階を基盤として構築されます。
事前学習には DSynth を使用し、約 145 万の MIDI ファイルを処理します。トレーニング中はオンザフライパイプラインがこれらを合成します。データ拡張にはピッチシフト、テンポ変更、ベロシティ調整、楽器のランダム化が含まれます。250 以上のサウンドフォントとランダムなデチューニングにより、ほぼ無限のオーディオ実現が可能となります。
微調整には DReal を使用し、これは内部で収集された 17 万枚の録音セットです。これらを合わせると、注釈付きノートアライメントを含む合計 1 万 1000 時間以上になります。アライメントの多くは、補間と動的時間ワーピング(Dynamic Time Warping)を用いたオーディオシンボリック同期から得られます。品質の低いペアは、ワーピング距離と最大時間伸長係数によってフィルタリングされます。
強化学習によるポストトレーニングには DRL を使用し、300 曲の手動検証済みトラックを処理します。チームは REINFORCE とグループ相対的利得正規化(group-relative advantage normalization)を組み合わせた GRPO 類似手法を適用しています。報酬はオンセット、フレーム、オフセットの 3 つの F スコアの合計で構成されます。その結果、モデルはよりクリーンなトランスクリプションを好むように学習します。
パフォーマンス評価には、正確な注釈を持つ 372 曲のホールドアウトトラックである DTest を使用します。研究チームは mir_eval ライブラリから楽器非依存メトリクスを報告しています。その中で Multi F1 は最も厳格であり、正しい楽器の特定も必要とするためです。
以下の表は、大規模モデル(約 13 億パラメータ)を用いた各トレーニング段階を、YourMT3+ ベースラインと比較したものです。
モデル (DTest) オンセット F1 フレーム F1 オフセット F1 ドラムス F1 マルチ F1
YourMT3+(ベースライン) 32.5 45.5 17.8 41.4 21.9
MuScriptor · DSynth 34.5 48.9 16.1 21.0 16.2
MuScriptor · DSynth + DReal 54.4 69.3 42.3 43.3 41.6
MuScriptor · DSynth + DReal + DRL 60.4 73.3 49.0 50.2 48.2
明らかに、各段階が結果を改善しており、実データの影響が最も大きいです。合成データのみでのトレーニングでは競合可能なフレーム F1 を達成しますが、オンセットとマルチスコアは弱くなります。DReal を追加すると、すべての指標が約 20 ポイント向上します。最後に、RL(強化学習)によるポストトレーニングにより、偽陰性が減少し、オンセットのタイミングが鋭敏化されます。
クロスデータセットテストも同様の傾向を示しています。例えば、Dagstuhl ChoirSet におけるフレーム F1 は 51.0 から 80.7 に上昇します。それでも、合唱曲のようなハードなスタイルでは、オンセットとオフセットは依然として低くなります。
はじめに
インストールは 1 つのコマンドで完了し、推論は音符イベントを直接ストリーミングします。
コピー コード コピー済み別のブラウザを使用してください
pip install muscriptor (または:uv add muscriptor)
from pathlib import Path
from muscriptor import TranscriptionModel
デフォルトの「medium」バリアントをダウンロードします("small" / "large" も受け付けます)
model = TranscriptionModel.load_model()
音符イベントをストリーミングします。既知の楽器で条件付けることも可能です
for event in model.transcribe("audio.wav", instruments=["acoustic_piano", "drums"]):
print(event) # NoteStartEvent / NoteEndEvent / ProgressEvent
または、直接 MIDI ファイルに書き出すこともできます
Path("out.mid").write_bytes(model.transcribe_to_midi("audio.wav"))
公開されたモデルについては、RL(強化学習)後のトレーニング済みであるため、cfg_coef を 1 に設定してください。また、uvx muscriptor serve は、ライブピアノロールを備えたブラウザ用 Web UI を起動します。
使用例と具体例
出力が標準 MIDI 形式であるため、多くのワークフローが可能になります:
プロデューサーはミックスから MIDI ベースラインを抽出し、DAW(デジタルオーディオワークステーション)で再編成できます。
音楽学者は歴史的録音を編集可能なスコアに変換して分析に活用できます。
MIR(音楽情報検索)研究者は、転写結果をコードや調認識システムに入力できます。
教育者は、再生中にライブピアノロールを表示する練習用ツールを構築できます。
開発者は、楽器の条件付けパラメータを指定することでドラムのみを転写することも可能です。
強みと弱み
強み:
クラシックからヘビーメタルまでを含む 170,000 曲の実録音データでトレーニング済み。
オープンウェイトに加え、MIT ライセンスの推論コードを提供し、3 つのサイズバリアントを用意。
DTest ベンチマークにおける YourMT3+ ベースライン(F1 スコア 21.9)に対し、マルチ F1 スコアは 48.2 を達成。
楽器条件付けにより出力をカスタマイズし、セグメント間予測の安定性を向上。
ストリーミング API でノートイベントと MIDI データを生成し、ブラウザ用 Web UI も提供。
弱み:
ウェイトは CC BY-NC 4.0 ライセンスのため、商用展開には制限がある。
トークナイザーがベロシティ(強さ)情報を保持せず、同じピッチ・同じ楽器の重なり合う音符を表現できない。
合唱曲や類似スタイルにおいて、オンセットとオフセットの精度は相対的に低い。
大規模モデルを実用的な速度で動作させるには GPU が必要。
5 秒間のセグメントサイズが長距離コンテキストの把握と推論速度に制限をもたらす。
AI算出
主要ニュースainew評価標準
AI モデルの具体的なアーキテクチャ(デコーダーオンリー Transformer)、学習パイプライン(DSynth/DReal/DRL)、および性能数値が詳細に記述されており、新規性の高い主要な技術発表である。ただし、日本企業や日本固有のコンテキストは含まれていないため、日本の関連性は低めとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 25
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み