[2026年5月13日提交 (v1),最后修订于2026年7月29日(本版本,v2)]
摘要:由于对齐的文本-音乐数据集稀缺且自动标注流程不可靠,开发文本驱动的符号音乐生成模型仍然具有挑战性。虽然大多数研究都集中在MIDI上,但在文本驱动生成中,乐谱表示方式在很大程度上尚未得到充分探索。我们提出\textit{Text2Score},这是一个由规划阶段和执行阶段组成的两阶段框架,用于从自然语言提示生成乐谱。通过直接从符号XML数据中提取监督信号,我们提出了一种替代基于标注的训练方法,避免了使用噪声或稀缺的文本-音乐对。在规划阶段,LLM协调器将自然语言提示翻译成结构化的逐小节计划,定义乐器、调性、拍号、和声等音乐属性。该计划指导执行阶段的生成模型在结构约束下生成交错的ABC记谱法。为了评估输出质量,我们引入了一个涵盖可演奏性、可读性、乐器利用率、结构复杂度和提示遵循度的评估框架,并由专业音乐家验证。\textit{Text2Score}在客观和主观维度上均持续优于纯基于LLM的智能体框架和三个端到端基线。我们开源了本工作中使用的数据集、代码、评估集和LLM提示;演示可在我们的项目页面上找到(this https URL)。
提交历史
来自:Keshav Bhandari [查看邮箱]
[v1]
2026年5月13日 星期三 12:24:41 UTC (495 KB)
[v2]
2026年7月29日 星期三 12:52:17 UTC (365 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.