英文题目:MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
会议身份:
conference:interspeech:2026:conference-paper-id:yang26c_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#基准设计 #音频大模型 #模型评估 #音频问答
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Chih-Kai Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Yun-Shao Tsai:机构信息未能从会议 PDF 纯文本可靠映射
- Yu-Kai Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Ping-Le Tsai:机构信息未能从会议 PDF 纯文本可靠映射
- Yen-Ting Piao:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-Wei Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Ting-Lin Hsiao:机构信息未能从会议 PDF 纯文本可靠映射
- Yun-Man Hsu:机构信息未能从会议 PDF 纯文本可靠映射
- Ke-Han Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文针对大型音频语言模型(Large Audio-Language Model, LALM)需同时理解多个音频并完成跨音频比较的实际需求,提出多音频接地与理解基准(Multi-audio Grounding and Understanding Benchmark, MUGEN)。该任务输入为一条文本约束加五个候选音频(10个任务另含1个参考音频,共6个输入),输出为最符合约束的候选编号,难点在于非语义属性区分与随输入数量增长的联合推理退化。方法链分为三步:首先构建覆盖语音、通用音频与音乐的35个任务共1750个实例,其次用六个开源模型加Gemini-3-pro与级联系统评估语义与非语义能力差距,最后引入音频顺序置换自洽推理以聚合多次预测。与已有双音频语义评测相比,该设计强调音频作为选项(audio-as-option)与参考条件比较,具有更强的感知依赖性。在MUGEN全量评测中,Gemini-3-pro高推理档整体准确率为69.60%,而音频置换自洽(Audio-Permutational Self-Consistency, APSC)在低推理档带来6.28个百分点的绝对提升,结合思维链(Chain-of-Thought, CoT)进一步带来6.74个百分点的提升。结论适用于五选一受控比较场景,向开放对话与更长音频的外推尚未验证。原文未披露训练成本,明确承认多次生成带来可观计算开销。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:为什么多音频不是单音频做五次?
这篇论文的输入是一段文字约束加上多个音频片段,目标是从中选出最贴合约束的那一个。举例来说,约束可以是选出情感最强烈的选项、选出与参考音频同一说话人的选项,或者选出时长最接近 5 秒的选项。多音频理解要求模型同时聆听多个片段,在片段之间比较情感强度、音色、语速、时长、环境声或音乐属性,并汇总冲突信息。
文中提到的实际场景包括基于音频的上下文学习、语音检索增强生成、多说话人分析和跨语句事件匹配,这些任务都要求 1 次处理多段音频。白话来说,大音频语言模型就是能听声音又能按文字指令回答的大模型,而多音频理解就是它 1 次听多段并做比较选择的能力。
大音频语言模型 × 多音频理解: 大音频语言模型负责把声音信号连同文字指令一起编码并生成回答,多音频理解要求它同时处理多个音频片段并在片段之间比较、聚合与取舍,二者搭配的原因是单音频听懂不等于能在多个候选中选对,组合意义是把评测从孤立感知推向跨音频推理。
论文报告的总体判断是当前模型在多音频条件下整体偏弱,且随并发音频数增加呈现下滑。学习时先建立这个关联:比较发生在声音层面,才能理解后文把选项本身做成音频的用意,以及转写加文字推理在情感韵律类任务中作用有限的原因。
已有评测缺了哪两块:属性覆盖与输入规模
论文把相关评测分成两条线来对照。第一条是单音频评测,包括通用理解、推理、对话、偏见与安全等方向,作者指出它们大多停留在孤立的单音频环境,缺少在多个音频之间做接地选择的要求。第二条是已有的多音频尝试,论文归纳出两个特点:一是听觉属性覆盖偏窄,往往偏重语义内容或声音事件,对情感等副语言方面覆盖偏少;二是输入规模偏小,通常每个样本只有 2 到 3 个音频片段。
按同输入、同目标来对照,MUGEN 的输入是多音频加文字约束,目标是跨音频比较后选中音频,而不是输出一段文字描述;按同监督与同运行阶段来对照,它在测试时直接考察多音频推理,侧重免训练条件下的表现。已有工作如侧重音频差异描述或两两比较的方法,与 MUGEN 的 5 个候选加参考音频的设计处于各异的设定。理解这段对照后,就能明白 MUGEN 意在补上副语言维度与更大输入规模这两块空缺。
要解决什么选择问题:音频即选项如何堵住语义捷径?
论文把每个任务形式化为多项选择式的音频接地问题。给定一条文字约束,模型从 5 个音频候选中选出最满足约束的一个;其中 10 个任务还额外提供一段参考音频,例如选出与参考音频说话人相同的选项,此时 1 次输入共 6 段音频。白话解释,音频即选项就是选项本身是声音,模型要逐段聆听才能作答。教学例子:约束写选出最生气的音频,5 个候选都是人声,文字转写可能是同一句话,依靠文字区分度很小,只能比较语气与情感强度。
论文明确指出,语义与语用任务原则上可以通过转写加文字推理解决,而情感、韵律、说话人、时长、音乐等维度侧重副语言与声学特质,促使模型执行声学比较。 下面这张示意图展示了指令、参考音频与 5 个音频选项的组织方式,阅读时先看文字约束如何限定答案,再看选项为何要逐段聆听,整段导读文字长度充足并紧贴图片标记。
看图路径: 1. 先读顶部文字指令限定的选择条件;2. 再确认参考音频只在部分任务出现;3. 最后看下方五个带音频内容的彩色选项标识
论文图 2。原论文 Figure 2:“Illustration of the audio-as-option design.”。
从像素可见,顶部是文字指令,例如选出时长最接近 5 秒的音频,中间是部分任务附带的参考音频,下方是标为 A 到 E 的 5 个音频选项,颜色依次为蓝色、橙色、绿色、紫色、红色,每个选项配有条形波形图标。它的教学价值在于把抽象的接地转化为可执行动作:先按约束确定要比较的属性,再逐个听候选并与约束或参考音频对齐,最后只输出一个选项编号。后续所有结果都建立在这个选择问题上,指标方向是准确率越高越好,选零个或多个都判错,这段解释紧随图片并回扣选择流程。
音频即选项 × 文本选择题: 音频即选项指选择支本身都是声音,模型必须听完再比,文本选择题指选择支是文字标签可走语义捷径,二者搭配的原因是 MUGEN 要用声音选项堵住只靠转写就能答对的捷径,组合意义是强制进行听觉特征的直接比较。
MUGEN 全景:35 个任务如何铺满七个维度?
MUGEN 共包含 35 个任务 1750 个测试样本,覆盖语音、通用音频与音乐,划分为 7 个互补维度:语义与语用、说话人与人口统计、情感与副语言状态、时间感知、声景与事件分析、音乐分析、组合声学推理。每个任务提供 5 个音频候选,10 个任务另含参考音频,需要参考条件下的比较。数据集层面共 9250 个音频片段,平均时长与指令长度在统计表中给出。构造上先确定满足目标的真值音频,再系统地挑选或合成在目标属性上有对比变化的干扰项,要求模型执行精细的跨音频比较。
下面这张总览图把 7 个维度的任务分布铺开,阅读时先看每个色块的任务数与题目数,再看哪类维度题量最大,这段导读紧贴图片标记并引导视线走向。
看图路径: 1. 先数清七个维度色块各自标注的任务数与题目数;2. 再看情感与副语言状态 8 任务 400 题是否为最大块;3. 最后对照语义与语用只有 3 任务 150 题的较小规模
论文图 1。原论文 Figure 1:“Overview of MUGEN and the detailed task distribution across the seven evaluation dimensions.”。
从像素可见,情感与副语言状态占 8 个任务 400 题,是题量最大的维度,包括情感识别、音高区分、韵律重音检测等;说话人与人口统计为 4 个任务 200 题,包括说话人验证、性别分类、口音识别等;语义与语用为 3 个任务 150 题,包括语言识别、关键词发现与意图分类;时间感知、声景事件、音乐分析各 5 个任务 250 题,组合声学推理也是 5 个任务 250 题。中间的环形图标表示多音频联合理解的核心。这段解释紧随图片,说明题量分布支持细粒度诊断:语义强劲与副语言能力强劲属于各异的能力取向,单维度高分可向全榜外推的程度有限。
比较机制如何工作:从一个样本走完输入到输出
沿一个样本走一遍有助于固定概念。输入是文字约束加 5 个音频波形加可选的一段参考音频;表示阶段模型要从每段音频抽出与约束相关的听觉特征,例如情感强度、语速、时长或乐器;组件阶段模型在候选之间两两或整体比较这些特征,若有参考音频则先把每个候选与参考音频对齐;目标是选出贴合约束的编号。
输出是自由文本回答,再由裁判模型映射为选项编号。论文用大型语言模型当裁判,用固定格式与人工标注样例校准,在 400 个随机样本上报告与人工一致率为 99%,这段结果说明自动评测流程稳定可靠,同时它只刻画评测流程,听觉能力仍要看主榜单。
自洽性 × 音频排列: 自洽性负责对同一输入多次采样再多数投票以压低单次解码噪声,音频排列负责在每次推理前随机打乱音频候选顺序再把预测映射回原编号后投票,二者搭配的原因是多音频对呈现位置敏感,组合意义是用顺序多样性得到更稳健的聚合预测。
思维链 × 声学感知瓶颈: 思维链负责在回答前生成中间文字推理步骤,声学感知瓶颈指模型听不准或比不准时长、情感、音色等非语义差异,二者搭配的原因是论文要检验文字层面的多想一步能否补听觉层的听不准,组合意义是区分推理不足与感知不足。
具体到改进策略,思维链是在提示中加让我们逐步思考以引出中间推理,自洽性是对同一顺序多次采样再多数投票,音频排列自洽性是在每次推理前随机打乱候选顺序、生成后再映射回原编号投票。论文对 Qwen2.5-Omni 用温度 0.2 生成 10 次,Gemini-3-pro 沿用原推荐配置,自洽性用原始顺序生成 10 次,排列自洽性用 10 种排列各生成 1 次,保持总生成数与可比计算量。理解这套流程后,就能看懂后文关于思维链增益有限而换顺序投票更有效的讨论。
本研究训练了什么:无训练的方法与真实计算是什么?
本研究采用基准构造加免训练推理的路线,聚焦多音频选择任务的评测与推理策略。构造侧的计算包括从公开语料挑选情感、说话人、语言与音乐样本,从专用学术语料挑选特定嗓音条件样本,以及在需要精确控制属性时用开源语音合成模型或 GPT-4o 迷你语音合成生成韵律与语义任务样本,并经人工核验保证属性保真;所有文字指令均为人工撰写,保证选择约束清晰。
推理侧的计算是调用已有模型完成多音频选择:开源模型用 vLLM 框架运行并按各自解码配置生成,裁判模型用 Claude Haiku 4.52 温度 0 抽取答案。论文给出仓库链接,依据本次证据规则,正文只陈述原文给出链接这一事实,对当前可达状态保持谨慎表述。
实验条件:测什么、和谁比、条件是否一致?
实验要回答 3 个问题:当前模型多音频理解有多强、瓶颈是否随输入规模扩大而显现、免训练策略能否改善。比较对象包括开源大音频语言模型 DeSTA2.5-Audio、Qwen2.5-Omni-7B、Audio Flamingo 3、Voxtral-Mini-3B、Voxtral-Small-24B、Phi-4-Multimodal-Instruct,以及专有模型 Gemini-3-pro 的不同思考级别,还有级联基线即用 Whisper-large-v3 转写再用 Gemini-3-pro 作答。开源模型用 vLLM 运行,除 Voxtral 与 Gemini-3-pro 外用贪心解码,Voxtral 按作者推荐用温度 0.2 与 top-p 0.95,Gemini-3-pro 按官方推荐用温度 1。指标是多项选择准确率,方向为越高越好,裁判对自由文本按有且仅有一个正确选项的规则判定。
级联系统 × 端到端模型: 级联系统负责先用 Whisper-large-v3 转写再用 Gemini-3-pro 按文字作答,端到端模型负责直接听音频信号再作答,二者搭配的原因是要估计多少任务只靠语义内容就能解决,组合意义是判断端到端是否真正用到了超出文字的声学信息。
数据与协议方面,评测用全部 35 个任务,另做输入规模分析时把候选数从五逐步减到二,每次去掉一个干扰选项并保持指令不变,但排序类任务因选项减少会使指令失效而被排除,只在剩余 32 任务上分析。聚合上总体准确率为所有任务上的微平均,并报告 95% 置信区间。资源状态方面,本次依据证据规则,对代码、模型或数据的当前可达状态保持谨慎表述,原文给出仓库链接这一事实保留。
主结果:语义强、非语义弱的分布如何形成?
比较的问题是:在相同的多音频选择条件下,开源端到端、级联系统与专有模型在哪些维度占优。相同条件指同一任务集与同一准确率指标,指标方向为越高越好。下表整理主结果中的关键行,列覆盖语义与语用、情感与副语言、时间感知与总体,表头括号内给出准确率百分比,数据格为保留 1 位小数的裸值加置信区间写法。
| 模型 | 语义与语用 Accuracy (%) | 情感与副语言 Accuracy (%) | 时间感知 Accuracy (%) | 总体 Accuracy (%) |
|---|---|---|---|---|
| DeSTA2.5-Audio | 46.67 ± 7.98 | 21.75 ± 4.04 | 17.20 ± 4.68 | 24.91 ± 2.03 |
| Qwen2.5-Omni | 70.00 ± 7.33 | 32.50 ± 4.59 | 15.20 ± 4.45 | 28.69 ± 2.12 |
| Gemini-3-pro 低思考 | 89.33 ± 4.94 | 77.00 ± 4.12 | 48.00 ± 6.19 | 67.66 ± 2.19 |
| Gemini-3-pro 高思考 | 90.67 ± 4.65 | 77.50 ± 4.09 | 53.60 ± 6.18 | 69.60 ± 2.16 |
表后解释同时呈现增益与局限。
论文报告显示,级联系统在语义任务上有竞争力,在副语言维度得分回落,说明语义推理对多数任务的支撑作用有限;开源端到端直接听到声学信号,总体与级联相当,说明单音频能力向多音频迁移的程度有限。专有模型在各维度大幅领先,但即使最强模型总体仍有提升空间,且时间感知等声学特质维度对所有模型都更具挑战,例如 Audio Flamingo 3 在音乐分析、Voxtral-Small-24B 在组合声学推理上各有模型特异弱点。
开源模型的总体准确率集中在 17 到 28 区间,Qwen 在说话人与人口统计上仅 12.00 左右,说明身份与口音线索的跨音频比较仍是薄弱环节。 下面这张表整理免训练策略在 MUGEN 上的表现,阅读时先看原始准确率,再看各类策略带来的绝对增益,表头括号内同样给出准确率百分比。
| 方法 | Qwen2.5-Omni Accuracy (%) | Gemini-3-pro 低思考 Accuracy (%) | Gemini-3-pro 高思考 Accuracy (%) | 每次投票生成数 |
|---|---|---|---|---|
| Orig. | 28.69 | 67.66 | 69.60 | 1 |
| CoT | 28.57 -0.12 | 67.89 +0.23 | 70.46 +0.86 | 1 |
| SC | 28.00 -0.69 | 70.06 +2.40 | 72.74 +3.14 | 10 |
| APSC | 30.69 +2.00 | 73.94 +6.28 | 74.97 +5.37 | 10 |
| APSC+CoT | 31.31 +2.62 | 74.40 +6.74 | 75.26 +5.66 | 10 |
表后解释聚焦策略差异。思维链增益较小,自洽性带来稳步提升,音频排列自洽性通过打乱候选顺序降低位置敏感,增益最为突出,低思考配置下达到 6.28 与 6.74 的绝对增益。
Qwen 侧增益幅度偏小,说明听觉比较仍是主要瓶颈,推理侧投票只能部分弥补。 下面这组曲线检验输入规模的影响,阅读时区分左图绝对值与右图相对保留率,横轴覆盖 2 到 5 个候选,纵轴分别为准确率与相对比值。
看图路径: 1. 先对照左图绝对准确率随候选数从 2 到 5 的下降斜率;2. 再看右图以 2 候选为基准的相对保留率;3. 最后比较有无参考音频两组中 Qwen 与 Gemini 的差距
论文图 3。原论文 Figure 3:“Performance scaling under varying numbers of audio candidates for tasks without (left) and with reference audio (right).”。
从像素可见,横轴为音频候选数 2 到 5,左图纵轴为准确率百分比,右图纵轴为相对两候选时的比值。左侧两子图分别对应参考音频缺席与附带参考音频条件,右侧两子图为对应的保留率曲线,图例区分高思考、低思考、Qwen 与随机基线。在有参考音频与参考音频缺席两种条件下,Qwen2.5-Omni 与 Gemini-3-pro 都随候选增加而下降;Qwen 在五候选时仅保留两候选时约 66% 与 48% 的准确率,而 Gemini 保留约 80%,且高低思考级别趋势接近,说明加深思考对规模退化的缓解作用有限。灰色随机基线随候选增多而走低,证实任务难度本身在上升,但模型下滑幅度超出随机基线的解释,需要归因于跨音频比较能力仍待加强。
策略对照:换顺序投票为何胜过只加推理步骤?
比较的问题是:在不训练的前提下,哪种可运行策略真正改善多音频选择。公平条件是同一 MUGEN 全集、同一解码预算下多数投票,指标为准确率百分比与相对原始性能的绝对增益百分点。下表整理论文的策略对照,条件列为方法,对象列为 3 个模型设置,数值保留 2 位小数与正负增益写法。
| 方法 | Qwen2.5-Omni | Gemini-3-pro 低思考 | Gemini-3-pro 高思考 |
|---|---|---|---|
| 原始 | 28.69 | 67.66 | 69.60 |
| 思维链 | 28.57 -0.12 | 67.89 +0.23 | 70.46 +0.86 |
| 自洽性 | 28.00 -0.69 | 70.06 +2.40 | 72.74 +3.14 |
| 音频排列自洽性 | 30.69 +2.00 | 73.94 +6.28 | 74.97 +5.37 |
| 排列自洽加思维链 | 31.31 +2.62 | 74.40 +6.74 | 75.26 +5.66 |
表后解释要讲清机制与代价。
论文报告显示,所有模型从排列自洽性获益最大,其次是普通自洽性,而思维链仅带来边际或负向变化,Qwen 甚至下降 0.12 个百分点,支持主要挑战在声学感知与跨音频比较而非文字逻辑的判断。排列自洽性通过多样化呈现顺序减轻位置敏感,再聚合为更稳健预测;与思维链结合后达到峰值,低思考 Gemini 获得 6.74 个百分点的绝对增益。代价是每个样本需生成 10 次,计算开销显著增加,未测量延迟与成本时不能承诺部署效率提升。
未胜出项是普通思维链与普通自洽性在 Qwen 上的失效,说明单靠多想一步或同一顺序多次投票不能解决听不准的问题。
边界与反证:哪些结论不能推广?
论文直接报告的是所测模型在所定任务与候选规模下的准确率分布与规模退化趋势,有限解释是位置敏感与感知瓶颈可能是原因之一,未验证推测是训练策略或架构调整必然修复这些问题,后者只能表述为可能或待验证。相关性不等于因果:思考级别提高伴随准确率提高,但规模实验显示高低思考退化趋势相近,不能推出更深思考能解决输入扩展问题。
总体趋势不等于每组都成立:专有模型总体领先,但在时间感知上仍只有 50% 左右,音乐与组合推理也存在模型特异短板。未评测边界包括超过五候选或更长音频的规模、真实多说话人会议的噪声与重叠、以及多次生成带来的延迟与费用,论文未测量误判率分解与推理开销,因此不能承诺这些量得到改善。裁判用大模型判分虽在 400 样本上与人工一致率达 99%,但仍是自动指标,不能当作人评来解读细微情感差异。
复现先做什么:数据、划分与可运行基线
复现的第一步是按论文交代重建数据与协议。数据层面共 35 个任务 1750 样本 9250 音频,平均时长 8.60 秒加减 8.79 秒,指令平均 13.91 词加减 5.46 词,多数听觉数据来自公开语料,情感、说话人、语言与音乐任务来自常用语音与音频基准,特定嗓音条件来自专门学术语料与高质量脚本语音,韵律与语义任务需严格对齐真值时用开源语音合成或 GPT-4o 迷你合成并经人工核验。下表为可直接核对的规模与时长统计,数值保留原文写法与千分位逗号和小数精度。
| 统计项 | 取值 |
|---|---|
| 任务总数 | 35 tasks totaling 1750 test instances across 7 dimensions |
| 音频片段数 | 9,250 |
| 平均时长 | 8.60 ± 8.79 |
| 平均指令长度 | 13.91 ± 5.46 |
该规模表直接对应论文给出的数据集统计,任务数与样本数同句出现,音频数与时长均值各有独立原句支撑,单位保留在表头行中而数据格保持裸值写法,便于与原文逐字核对。
| 统计对象 | 任务数 | 测试样本数 | 音频片段数 | 均值(时长 s/指令 words) |
|---|---|---|---|---|
| 总体规模 | 35 | 1750 | 9,250 | — |
| 音频时长(s) | — | — | — | 8.60 ± 8.79 |
| 指令长度(words) | — | — | — | 13.91 ± 5.46 |
该宽表把同一组规模数字按任务数、样本数、音频数与均值重新排列,裸值与表头单位分离的写法与原表一致,未逐格追加百分号或秒词,未计算差值与百分比,仅用于承担宽表叙事闭环。 第二步是固定可运行基线:开源模型按原文解码配置运行,Voxtral 用温度 0.2 与 top-p 0.95,Gemini 按推荐温度 1,其余贪心;裁判用温度 0 以保证可重复。
第三步是复现规模分析:从五候选逐步删去非真值选项到二候选,保持指令不变并排除排序类任务,在剩余 32 任务上分别统计有无参考音频的两组曲线。第四步是复现改进策略:普通自洽性在原顺序采样 10 次,排列自洽性在 10 种排列各采样 1 次再映射回原编号投票,保持生成数一致。还需补的验证是更大候选数、更长音频与真实噪声下的稳定性,以及多次生成的延迟与成本计量。
何时值得尝试排列自洽:收束与行动建议
综合来看,当任务必须在多个声音之间做选择且怀疑模型有位置偏好时,值得尝试音频排列自洽加多数投票;当错误集中在听不准时长、情感或音色而非逻辑链时,不必先加长思维链,而应先检验声学比较能力。行动上先用级联基线估计语义可解比例,若端到端仅与级联持平则说明声学信息未被有效利用;再做 2 到 5 候选的规模曲线,若相对保留率快速跌破 80% 则确认输入扩展是瓶颈。
最后在可接受 10 倍生成开销时启用排列自洽,并记录每次排列的预测分布以诊断位置偏差。论文的价值在于把多音频理解从模糊的感觉变为可核对的选择任务与可复述的投票流程,但其结论限于所测模型与所定规模,推广到更大规模与实时系统前仍需补充延迟、成本与人评验证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


