[2026年5月13日提出 (v1)、最終改訂 2026年7月29日 (本バージョン, v2)]
要旨:テキスト駆動の象徴的音楽生成モデルの開発は、テキストと音楽が整列したデータセットの不足と自動キャプション生成パイプラインの信頼性の低さにより、依然として困難である。ほとんどの取り組みはMIDIに焦点を当ててきたが、楽譜表現はテキスト駆動生成においてほとんど未開拓である。我々は、自然言語プロンプトから楽譜を生成するための計画段階と実行段階からなる2段階フレームワークである\textit{Text2Score}を提示する。象徴的XMLデータから直接監督信号を導き出すことで、ノイズの多いまたは不足したテキスト-音楽ペアを回避するキャプションに基づく訓練に代わる手法を提案する。計画段階では、LLMオーケストレータが自然言語プロンプトを楽器、調、拍子記号、和声などの音楽属性を定義する構造化された小節ごとの計画に翻訳する。この計画は、実行段階で生成モデルが構造的制約に基づいてインターリーブされたABC記譜法を生成する際の指針となる。出力品質を評価するため、演奏可能性、可読性、楽器利用度、構造的複雑性、プロンプト遵守度を網羅し、専門の音楽家によって裏付けられた評価フレームワークを導入する。\textit{Text2Score}は、客観的および主観的次元の両方において、純粋なLLMベースのエージェントフレームワークおよび3つのエンドツーエンドベースラインを一貫して上回る。本研究で使用したデータセット、コード、評価セットおよびLLMプロンプトをオープンソース化する。デモはプロジェクトページ (this https URL) で利用可能である。
投稿履歴
投稿者: Keshav Bhandari [メールを表示]
[v1]
2026年5月13日 水曜日 12:24:41 UTC (495 KB)
[v2]
2026年7月29日 水曜日 12:52:17 UTC (365 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.