英文题目:Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment

会议身份:conference:interspeech:2026:conference-paper-id:hasumi26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#指令微调 #强化学习 #音乐 #音乐理解

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Takuya Hasumi:机构信息未能从会议 PDF 纯文本可靠映射
  • Welly Naptali:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音乐情绪回归要求从波形预测唤醒度(arousal,能量强度)与效价(valence,愉悦度)在1至9区间的连续分值,难点在于标注主观噪声大、效价声学线索弱、自回归文本解码器只有下一个词元预测目标而无数值误差目标,开源模型零样本直接预测常失效。该文先用伪问答式指令微调(Instruction Tuning,IT)建立音频到分数文本的映射,冻结音乐编码器并以低秩适配微调解码器学习粗粒度分数格式,再用反馈驱动对齐(Feedback-Driven Alignment,FDA)以组相对策略优化(Group Relative Policy Optimization,GRPO)直接优化分数精度,奖励为负平方误差、解析失败给-200大惩罚。与纯似然训练相比,关键差异是从模仿文本转向按组内归一化优势做裁剪策略更新,从而更有效利用编码器特征并显著提升效价等难维度的实际意义。在混合通用音乐问答训练下,FDA后DEAM唤醒度与效价决定系数(\(R^2\))为0.48与0.35,较同设置纯指令微调明显改善且MusicQA三指标基本保持。结论仅在DEAM与MERGE及MusicFM加Vicuna 7B组合下验证,未证明跨风格、跨标注体系与零样本外推能力。训练使用单卡NVIDIA A100,原文未披露完整耗时、推理延迟与部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,为什么直接问大模型不行?

这篇论文的输入是一段音乐音频和一个文字提问,输出是一个用自然语言说出的情感分数。初学者可以这样理解任务:给模型放一首 30 秒左右的歌,然后问它,在 1 到 9 的唤醒度量表上这首歌是几分,在 1 到 9 的愉悦度量表上又是几分。唤醒度通俗说就是听起来有多激烈多有能量,放松的摇篮曲分数低,激烈的摇滚分数高。愉悦度通俗说就是听起来有多正面多愉快,阴郁压抑的分数低,明亮欢快的分数高。两个分数都保留 1 位小数,例如 3.2 或 5.6。

论文要解决的矛盾是,音乐大语言模型已经能做很多音乐信息检索任务,例如描述乐器和音乐特点,甚至能做调性和速度估计,但在情感回归上表现很差。原文引用已有基准指出,即使是最先进的音乐大语言模型,在情感回归上的表现也不比直接预测数据集均值的朴素基线更好。作者的假设是这不是模型听不懂情感,而是训练中缺少显式的情感回归目标。多数音乐大语言模型只被训练去预测下一个词,没有被要求把连续数值误差真正压下去。因此本研究的输出不是再做一个只能输出数字的专用回归器,而是让同一个能问答的模型既能输出分数又能保持问答能力。

本解读的输入是论文正文证据与两张官方原图像素,目标是把方法走通到可复述的程度。必须保留的信息包括模型三模块结构与冻结更新关系、伪问答构造方式、2 阶段训练顺序、奖励函数形态、数据集划分与采样方式、评价指标方向与关键数字。资源状态方面,本次没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码模型或数据已公开,只能按论文文字交代实验条件。

情感识别与音乐大模型各走了哪条路线?

音乐情感识别这条路线长期使用编码器加回归头的办法。早期有用卷积神经网络从音频特征估计情感,有用循环神经网络做乐器情感识别,也有用变换器结构。还有工作把歌词文本编码器和音乐编码器结合起来,因为歌词也携带情感。论文提到的两个对照属于这条路线,一个是在情感分类与回归多个数据集上联合训练并引入和弦识别的模型,另一个是在 MERGE 上从零训练卷积音乐编码器的模型。这类模型的特点是直接优化数值误差,分数算得相对准,但只能输出分数,不擅长开放式问答和解释。

音乐大语言模型是另一条路线。它把音频编码器和大语言模型接在一起,用投影器把声音表示映射到语言词元空间,再让语言模型按提示生成回答。已有模型能做音乐字幕、问答、调性和速度估计。通用音频大模型例如 Qwen2-Audio 和 Phi-4-Multimodal 也被纳入比较,它们参数量与本文模型接近,训练中报告使用了基于成对偏好的偏好优化来改善指令跟随与安全性,但论文在零样本条件下评测它们的情感回归,发现决定系数为负,说明通用问答监督本身不足以对齐精确情感水平。

反馈驱动对齐是本文从语言模型数学推理和视觉问答中借来的第三条经验。原文明确使用反馈驱动对齐一词指代使用可验证数值奖励的策略优化,而不是泛指人类偏好。作者比较了近端策略优化与组相对策略优化,指出前者需要学习价值函数即评论家,会增加训练复杂度且优化不稳定,因此选择后者。后者只用标量回归奖励做组内相对比较,避免了价值函数学习,流程更简单且通常更稳定。这个选择是理解全文训练设计的关键分叉点。

情感回归任务如何定义,什么算答对?

论文把任务定义为回归型音乐情感识别。给定音乐波形与文字提示,模型要生成包含唤醒度或愉悦度分数的自然语言回答,再从文本中解析出数值。分数范围是 1 到 9,越高表示越激烈或越愉快。评价时按[10] 的提示流程提问,用第 3.3 节描述的方法从生成文本中抽取分数。原文报告在本次实验中所有样本和模型的分数抽取都成功,每个回答都得到唯一的唤醒度或愉悦度分数,因此报告的决定系数差异主要反映数值预测精度,而不是格式解析失败。

评价指标是决定系数 R2。它的方向是越大越好,零表示与始终预测数据集均值的方法相当,负值表示还不如预测均值,正值越大表示越准。初学者容易把 R2 当成准确率,这是不对的,例子是:同样是唤醒度 R2 为 0.56 与 0.38,0.56 更好,但它不是 56% 正确的意思,而是相对均值基线的解释方差比例。论文同时在 MusicQA 上用 BLEU@4、METEOR 和 ROUGE-L 评价通用问答能力,这 3 个值同样是越大越好,用于检查做回归时有没有把问答能力弄丢。

唤醒度 × 愉悦度: 唤醒度负责刻画音乐的能量或激烈程度,愉悦度负责刻画音乐的正负向愉悦程度,二者搭配的原因是它们共同构成罗素环形模型的 1 对正交轴,组合后才能把一条音乐片段的情感强度表示为 1 到 9 范围内的两个连续分数,而不是单一的好听或不好听。

这个概念桥说明为什么论文要同时报告唤醒度和愉悦度两个 R2。如果只看唤醒度,会高估模型对情感的整体把握,因为愉悦度标注更主观,论文明确指出愉悦度更难学,这也解释了后文为什么指令微调在愉悦度上提升有限而反馈对齐带来大幅改善。

两阶段方法全景:先学会说话,再学会算准

全文方法可以概括为两步走。第一步是指令微调,用配对的音乐与真值分数组成伪问答,让模型学会回答格式和粗略情感水平。第二步是反馈驱动对齐,在指令微调后的模型上采样多个回答,用数值奖励直接优化分数误差,捕捉更细粒度的情感水平。图 2 的训练管线正是这个顺序,但要先看清单模型结构才能理解每一步动了哪些参数。

模型由音乐编码器、投影器和文本解码器组成。音乐编码器把原始波形变成帧级嵌入序列,投影器在时间轴上降采样并映射到语言词元维度,得到与文本词元维度对齐的潜在嵌入 E,文本解码器同时消费 E 和文字提示 x 并输出回答词元分布。训练时编码器冻结,只优化投影器和解码器。解码器部分使用低秩适配,只动查询与值投影矩阵。

下面这张图展示的是单样本推理时的数据流,是后文讨论冻结与更新、监督来源的基础,请按输入到输出的顺序阅读。

看图路径: 1. 先从左上音乐波形出发沿箭头看到音乐编码器再到投影器再到文本解码器;2. 再看右上文字提问是如何与音乐嵌入一起进入文本解码器的;3. 最后确认底部回答中数值分数是由解码器生成的自然语言携带的

原论文 Figure 1:The overview of the music large language model (Mu- sicLLM) for emotion regression.

论文图 1。原论文 Figure 1:“The overview of the music large language model (Mu- sicLLM) for emotion regression.”。

这张图实际收到像素,可以解读箭头与模块关系。从左上音乐波形出发,向下进入梯形音乐编码器,编码器上方有雪花标记表示冻结。编码器输出向右进入投影器,投影器上方有火焰标记表示可训练,投影器向下输出 E,E 再向右进入文本解码器。右上文字提问 What is the arousal score of this track 同时向下进入文本解码器,解码器上方同样有火焰标记。解码器向下输出 Response 即 The score is 3.2。

整个路径说明声音与文字在解码器处汇合,分数以自然语言形式输出,而不是由独立回归头输出。这个结构决定了后文奖励必须先从文本中解析分数才能计算误差。

三个模块各自做什么,投影器为何关键?

音乐编码器采用 MusicFM,它在百万歌曲数据集上预训练。它的作用是提供有效的音乐特征表示。论文用 MusicFM 探针做了一个很强的基线:对编码器输出做层归一化再加仿射变换得到分数,只微调归一化参数与仿射矩阵去最小化平方误差。这个基线在多个情况下超过专用编码器模型,说明编码器本身已经携带可用于情感回归的信息,问题在于大语言模型部分没有被教会如何用好它。

文本解码器采用 Vicuna,一个 7000000000 参数的开源聊天模型。它的作用是按聊天格式生成回答。格式固定为用户加问题、助手加回答,回答对应 y,前面部分对应 x。投影器由两个线性层夹一个修正线性单元组成,输入在时间轴上按降采样率 5 拼接,先投影到中间空间再映射到解码器维度。它的作用是解决时间长度与维度不匹配,让声音嵌入能当作词元一样被解码器读取。

音乐编码器 × 文本解码器: 音乐编码器负责把原始波形变成帧级声学表示,文本解码器负责在给定音乐表示和文字提问条件下逐词生成回答,二者搭配的原因是编码器懂声音但不懂问答格式而解码器懂语言但听不见声音,组合后投影后的音乐嵌入与文本词元拼在一起输入解码器,使同一模型既能听又能说出分数。

对复现而言,关键是冻结与更新分工。原文明确训练时冻结音乐编码器参数,用低秩适配更新文本解码器的查询与值投影矩阵,秩为 8,投影器全部优化。最大回答长度为 128 个词元。这意味着梯度路径不经过编码器,只经过投影器与解码器的适配部分。原文没有报告投影器中间维度与学习率等全部细节,这是缺项,不从模型名称推定实现。

如何构造伪问答并分两步训练?

因为已有情感回归数据集只有数字分数,没有问答句子,作者用 GPT-4o 设计了 20 个问题模板和 20 个回答模板,再用程序把保留 1 位小数的分数填进去,例如 5.6。问题例子包括在 1 到 9 唤醒度量表上问这首歌是几分,以及问愉悦度从负向到正向该打几分。回答例子包括唤醒度水平是某分数,以及我会在 1 到 9 量表上打某分数。这种构造保证格式一致,又让连续分数以自然语言输出。指令微调的目标是式 1 的对数似然,即给定音乐嵌入 E 和提示 x,逐词预测回答词元。训练 50 轮,优化器为 AdamW,批量八,梯度累积两步。

反馈驱动对齐阶段对每个音乐与提示采样 G 等于 8 个回答,按奖励算组内均值与标准差得到优势,再用裁剪与散度惩罚优化策略。原文 GRPO 参数设 G 为八,贝塔为零,埃普西隆为 0.02。选择贝塔为零的理由是引用近期大模型研究,认为去掉散度项能稳定训练并提升性能。训练 10 轮,批量一,梯度累积两步。奖励函数是式 8:若解析失败给负二百的大惩罚以鼓励格式一致,否则给负平方误差。分数抽取函数会避免把量表说明中的一或九误当分数,例如从 I would assign a 3.6 on the 1-9 scale 中抽出 3.6。

指令微调 × 反馈驱动对齐: 指令微调负责用真值分数问答对教会模型输出格式和粗略情感水平,反馈驱动对齐负责用预测误差算出的数值奖励进一步压低平方误差,二者搭配的原因是只学下一个词的似然对连续数值不敏感,组合后先学会说话再学会算准,实现从会答到答准的递进。

下面这张图是 2 阶段对比的示意图,请对照文字理解监督信号的差异。

看图路径: 1. 先看左侧指令微调框内单个回答与对数似然箭头的对应关系;2. 再看右侧反馈对齐框内同一输入采样出两个不同分数的分支;3. 最后看底部真值 3.2 指向两侧奖励大小不同的红色双向箭头

原论文 Figure 2:Training pipeline of MusicLLM in our work.

论文图 2。原论文 Figure 2:“Training pipeline of MusicLLM in our work.”。

这张图实际收到像素,左侧为指令微调框,MusicLLM 下方只生成一个回答 The score is 5.6,双向箭头指向红色条形与对数似然文字,说明监督是真值文本的似然。右侧为反馈驱动对齐框,同一 MusicLLM 生成两个回答,分别是 5.6 与 3.6,底部真值为 3.2,红色双向箭头分别标注较少奖励与较大奖励,说明监督是按与真值距离给出的相对奖励。3.6 离 3.2 更近因此奖励更大。这个可视化对应了后文为什么反馈对齐能进一步压低误差。

组相对策略优化 × 可验证数值奖励: 组相对策略优化负责在没有价值网络的情况下比较同一输入下多个采样回答的相对好坏,可验证数值奖励负责把回答中解析出的分数与真值分数的负平方误差直接变成奖励,二者搭配的原因是回归任务天然给出标量误差,组合后可以用组内均值方差归一化的优势直接优化策略,避免学习评论家带来的不稳定。

该桥解释了组相对策略优化与可验证数值奖励的组合意义。对初学者可复述为:先采样 8 个说法不同的分数,再按谁离真值近给谁高分,最后让模型往高分组的方向多走一步,同时用裁剪限制步长。

数据划分、音频采样与基线条件是什么?

实验使用两个公开情感回归数据集。DEAM 由约 45 秒片段组成,沿用已有划分,训练验证测试为 1261 比 271 比二百七十。MERGE 由约 30 秒片段组成,标签是通过 Warriner 词典把 AllMusic 标签半自动映射得到,划分为 2490 比 532 比五百三十二。MusicQA 是开放式音乐问答数据集,包含乐器与情绪等通用问题,用于检查通用能力。所有实验把音频切成 30 秒段,训练时随机裁剪,评测时取中间段。这个采样细节是复现时必须对齐的条件,否则同一首歌取不同段会引入差异。

基线分 3 类。第一类是 MusicFM 探针,只调归一化与仿射参数。第二类是专用编码器模型,分别引用[23] 与[24] 在 DEAM 与 MERGE 上的分数。第 3 类是开放模型 Qwen2-Audio-Instruct 与 Phi-4-Multimodal,在零样本下评测,论文说明不清楚 DEAM 与 MERGE 是否在其训练中出现过。比较公平性方面,探针与专用模型只做分数预测,不做开放问答,而本文模型要同时做两件事,因此论文强调目标不是用单一模型在纯回归分数上取代探针,而是对齐一个能同时做回归与问答的统一模型。

硬件与运行条件方面,每模型在单张英伟达 A100 上训练。指令微调与反馈对齐的轮数批量与累积步数已在上一节交代。评测时分数抽取全部成功,因此 R2 不受解析失败影响。原文未报告随机种子、学习率、解码温度与统计显著性检验,这些是复现时的缺项,需要补做多次运行才能判断波动范围。

不加通用问答时,两种训练各带来多少提升?

先看不混入 MusicQA 的孤立情感回归设置,比较问题是只用指令微调够不够,再加反馈对齐能多赚多少,指标方向是 R2 越大越好。表前需要明确公平条件:同一 DEAM 与 MERGE 划分,同一中间段评测,同一 R2 指标,基线包括探针与专用编码器模型,本文策略包括只做指令微调与指令微调加反馈对齐。

来源证据量化值一量化值二量化值三量化值四
来源句一0.380.260.400.05
来源句二0.560.550.29—
来源句三0.620.310.510.43
来源句四0.520.62230.48;0.31;24

表后解释主要收益与代价。只做指令微调时,唤醒度学到一定程度但愉悦度明显偏弱,MERGE 愉悦度仅为 0.05,整体不如探针,也未全面超过专用模型。加上反馈对齐后 4 个格全部上升,DEAM 唤醒度从 0.38 到 0.56,DEAM 愉悦度从 0.26 到 0.55,MERGE 唤醒度从 0.40 到 0.55,MERGE 愉悦度从 0.05 到 0.29,其中愉悦度相对增幅更大。代价是探针或专用模型在部分格仍更高,例如 DEAM 唤醒度探针 0.62 高于本文 0.56,MERGE 愉悦度探针 0.43 高于本文 0.29,说明在纯数字精度上专用路线仍有优势。未胜出项必须保留:本文模型的价值在于还能做开放问答,而探针不能,这是下一节要验证的保持能力。

加入通用问答后,回归与问答能否兼得?

再看混入 MusicQA 的设置,比较问题是通用问答监督会不会冲淡回归,以及反馈对齐能否在混合目标下挽回精度。公平条件是同一模型骨架 MusicFM 加 Vicuna,同一 R2 与问答三指标,基线包括只训 MusicQA、MusicQA 加情感指令微调、再加反馈对齐,以及零样本开放模型。指标方向是回归 R2 越大越好,问答 BLEU@4、METEOR、ROUGE-L 越大越好。

来源证据量化值一量化值二量化值三量化值四
来源句二0.320.350.430.01;0.15;0.40
来源句三0.480.350.500.24;0.15;0.39

表后解释兼得与代价。只训 MusicQA 时 4 个回归 R2 全为负,说明通用问答监督 alone 不足以对齐精确情感水平,这与已有基准一致。加入情感指令微调后唤醒度明显回升,DEAM 从负到 0.32,MERGE 到 0.43,但愉悦度依然弱,DEAM 为 -0.35,MERGE 仅 0.01,论文解释是愉悦度标注更主观。再加反馈对齐后 4 个回归格全部改善,DEAM 愉悦度从负转正到 0.35,MERGE 愉悦度到 0.24,唤醒度也有额外提升。问答侧在混入回归后没有丢失,从 0.13,0.14,0.38 到 0.15,0.15,0.40,再到 0.15,0.15,0.39,基本保持。

开放模型零样本 R2 全为负且问答也不高,例如 Qwen2-Audio 在 DEAM 为 -3.47 与 -2.02,Phi-4 为 -2.22 与 -3.52,支持任务特定适配重要的判断。限制是混合目标下回归分数低于孤立回归设置,论文认为是情感监督占比被稀释所致。

哪些结论有边界,哪些不能推广?

论文直接报告的是在特定数据集与特定模型配置下的结果,支持的判断是反馈对齐相对指令微调有实质提升,尤其在愉悦度上,同时 MusicQA 能力在本次评测中得以保持。需要用可能或待验证表达的是对原因的解释,例如愉悦度更主观所以更难学,混合目标分数更低是因为情感监督占比下降,这些是有限解释而非因果证明。

未评测边界必须说清。研究只用了 DEAM 与 MERGE 2 个数据集与 MusicFM 加 Vicuna 一种骨架,没有验证其他音乐编码器、更大或更小语言模型、其他语言或长曲结构下的表现。原文结论也明确限定为特定数据集与模型配置。没有测量误判率、延迟、推理开销与输出帧率,因此不能承诺这些量得到改善。训练资源只交代单卡 A100 与轮数批量,没有给出总时长与显存占用,部署成本无法复算。

另一个边界是数值相同不是同一指标的证据。唤醒度与愉悦度的 R2 不能直接相减比大小,DEAM 与 MERGE 的 R2 也不能直接平均,因为数据集标注方式与分布不同。百分点与相对百分比也不同,论文只报告 R2 绝对值,没有报告相对提升百分比,解读时不要自行换算成百分比增幅。此外,开放模型的训练数据未披露,不能断定它们没见过评测集,只能说在本次零样本评测条件下为负。

要复现这套流程,先做什么,后查什么?

复现先做三件事。第一,按论文划分准备 DEAM 与 MERGE,音频统一切 30 秒段,训练随机裁剪,评测取中间段,并用同一提示流程提问。第二,用 GPT-4o 或等价方式生成二十问二十答模板,把 1 位小数分数程序化填入,保证回答格式一致,再按聊天格式组织用户与助手。第三,搭建 SLAM-LLM 架构,音乐编码器用 MusicFM 并冻结,投影器按两线性夹修正线性单元、时间拼接降采样率 5 实现,解码器用 Vicuna 并加秩 8 低秩适配于查询与值矩阵,最大回答长度一百二十八。

再按顺序训练。先指令微调 50 轮,再反馈对齐 10 轮,组采样数八,裁剪阈 0.02,去掉散度惩罚。奖励实现要先写分数抽取函数,避免抽到量表说明中的一或九,解析失败给负二百,否则给负平方误差。评测时先确认抽取成功率,再算 R2,同时在 MusicQA 上算三问答指标,检查回归提升是否以问答下降为代价。

还需补的验证包括多次随机种子下的波动、不同裁剪段的影响、解析失败率的单独报告,以及去掉散度项与保留小散度项的对照。资源状态方面,本次未发现可验证的公开代码模型或数据链接,因此当前只能按文字复写,不能声称已公开或当前可用。若后续要扩展到调性与速度等其他可验证数值目标,需要为每个任务重写抽取函数与奖励尺度,不能直接复用情感奖励。

何时值得尝试这条路线,一句话如何记住它?

当你的音乐大模型已经能聊天但报不准连续分数,且你有配对的音频与真值分数时,这条路线值得尝试。先用指令微调让它学会说 The score is 这样的格式,再用数值奖励让它把数字说准,这个顺序不要颠倒。如果只有问答数据而没有数值监督,不要指望问答训练顺带学会精确回归,论文中只训 MusicQA 时 R2 为负就是反证。

记住它的方式是沿一个样本走一遍:30 秒音乐进冻结的编码器变成特征,进可训练的投影器变成 E,与提问一起进可训练的解码器生成带分数的句子,从句子中抽出数字与真值算平方误差,误差越小奖励越大,组内比较后更新投影器与适配参数。重复多轮后,唤醒度与愉悦度同时变准,而问答指标基本不动。

最终判断要分开说。论文显示反馈驱动对齐在 2 数据集上都改善了回归,尤其挽救了愉悦度,并保持了问答能力,这是向统一音乐信息检索系统迈出的一步。但论文也显示孤立回归下探针在部分格仍更高,混合目标会稀释回归监督,且结论限于特定配置。因此它不是取代专用回归器的宣告,而是在需要一个模型同时会算分与会问答时,提供了一条直接优化分数误差的可复述路径。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总