论文解读
把谱面与演奏对齐成文本:MuNo-SP 如何让模型听见弹了什么与怎么弹
针对音频语言模型只靠粗粒度标题难以刻画力度、 timing 与声部进行的问题,该研究用对齐后的谱面加演奏 MIDI 构造文本表示 MuNo-SP 并自动生成长时间听觉分析与问答,在 MuSP-Bench 联合理解与人工偏好上报告了高于 ABC 与 MIDI 文本基线的准确率,代价是表示更长且仍限于古典钢琴与 MIDI 可表达的属性。
针对音频语言模型只靠粗粒度标题难以刻画力度、 timing 与声部进行的问题,该研究用对齐后的谱面加演奏 MIDI 构造文本表示 MuNo-SP 并自动生成长时间听觉分析与问答,在 MuSP-Bench 联合理解与人工偏好上报告了高于 ABC 与 MIDI 文本基线的准确率,代价是表示更长且仍限于古典钢琴与 MIDI 可表达的属性。
针对歌唱音频的专家式指导反馈问题,VocalCoachBench 用同曲可控对比与异曲多样场景的双子集和原子主张拆分来构造可复现评估,12 个音频语言模型的实测显示成对排序可行但细粒度 Top-3 识别与严格诊断命中率仍低于多数类基线且严格命中低于 7%。
该文在 1x 到 3x 主观评分基础上,用视频时间信息、语音语速和音乐节拍分别拟合指数衰减并融合成视听模型,在独立新序列上与主观均值高度一致,但意图推断只做到粗粒度辅助。
音乐理解 | 6.8/10
音乐理解 | 6.3/10
音乐理解 | 6.5/10
音乐理解 | 8.0/10
音乐转录 | 6.3/10
音乐理解 | 6.5/10
音乐理解 | 6.1/10
音乐理解 | 5.5/10
音乐理解 | 6.2/10
音频理解 | 8.5/10
音乐推荐 | 5.8/10
音乐理解 | 7.2/10
音乐理解 | 8.2/10
音视频交互 | 5.9/10
音乐理解 | 8.7/10
音乐理解 | 8.4/10
音乐理解 | 7.6/10