📄 MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

标签:#音频质量评估 #音频大模型 #基准测试 #模型评估 #音频理解

8.9/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.7/1.5

🔥 8.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音频质量评估 | #音频大模型 | #基准测试 #模型评估 | arxiv

👥 作者与机构

第一作者:Yize Li(Northeastern University) 通讯作者:正文未明确标注 作者列表:Yize Li、Ningyuan Yang、Sile Yin、Sindhuja Thogarrati、Sung-En Chang、Andrew C. Singer、Xue Lin、Chuan-Che Huang、Shuo Zhang(机构:Northeastern University;Bose Corporation;Stony Brook University)

💡 毒舌点评

MRMAD 并非普通的泛音频问答集合,而是把参考利用、严重度比较和跨轮排序做成了可诊断协议。它最有说服力的地方是许多强模型接近随机,以及删除参考后几乎不掉分;这直指音频 grounding 的基础缺口。基准尚不能替代主观质量评测,但很适合做模型前端和多轮接口的压力测试。下一步应加入人类标定、复合真实退化和自由解释证据。

📌 核心摘要

大型音频语言模型在语音识别、声源语义和音乐问答上进步很快,但“听懂内容”并不等于具备音频质量辨别能力。MRMAD 专门检验模型能否在多轮中记住干净参考、识别退化种类,并比较或排序同一内容的退化强弱。基准覆盖 speech、music、sound 三域,按适用性施加环境噪声、滤波、MP3、混响、回声、神经声码器、DSP 去噪伪影和丢包等 9 类处理,形成 8400 道多项选择题。

3 个任务逐级提高跨轮要求:DTI 给干净参考和强退化片段,要求从 4 类选项辨认类型;DSC 比较 audible 与 strong;DSR 对 audible、medium、strong 3 段排序;作者统一评测 18 个近期模型。多数开源模型在 DTI、DSR 接近 25% 随机水平,在 DSC 接近 50%;Gemini 3.1 Pro 显著领先,三项平均为 86.22%、90.81%、64.25%,但闭源身份本身不保证可靠,GPT-Audio-1.5 就表现较弱。

诊断显示失败不只是“不会推理”:许多模型替换或删除第 1 轮干净参考后几乎不掉分,说明并未真正做参考对比;部分音频 tokenizer 对强退化仍产生高度相似表示,低级质量线索可能在进入语言模型前已经被抹平;MRMAD 的价值在于把表示、跨轮记忆和比较推理拆开观察,但合成的 3 档单一退化、多项选择提示和缺少人类主观标定仍限制它替代真实质量评测。

数据分域排除规则是结论可靠性的关键:音乐不测可能被当作创作效果的回声,环境声不测本来就可能存在的背景噪声与去噪伪影;这样减少语义歧义,也使 3 个域并非拥有完全相同的退化集合,跨域平均必须按 9:8:7 的题量设计理解。

🔗 开源详情

作者明确在 https://github.com/Bose/MRMAD 发布代码和数据,全文披露素材来源、域适用退化、采样比例、模板结构与统一解析协议。该开放度足以重建大多数题目;闭源模型的具体服务版本和长期可用性仍会令榜单随时间漂移。

🏗️ 方法概述和架构

素材输入。语音来自 VCTK、LibriSpeech、HiFi-TTS、LJSpeech,共 5400 段;音乐来自 MUSDB18-HQ、URMP、FMA-small,每首抽 2 个不重叠的 15 秒片段,共 4800 段;环境声来自 TAU Urban 2019 与过滤后的 FSD50K,共 4200 段。所有音频转单声道、重采样到 16 kHz,并在施加退化前做 RMS 响度归一化,保存干净参考。

退化生成。语音适用 9 类退化;音乐排除可能被视为艺术效果的 echo;sound 排除环境噪声和 DSP 去噪伪影,因为其原始内容可能天然含相似成分,形成 9:8:7 的域适用比例。每个参考分别生成 audible、medium、strong 三档,参数范围按语音、音乐和声音的谱时特性微调。背景噪声取自 DEMAND。输出不是随意混合退化,而是同一参考、相同退化类型、可控强度的成组音频。

任务编排。DTI 是 2 轮:第 1 轮给参考,第 2 轮给 strong 退化和 4 个候选;3 个干扰项从不同感知组抽样,减少同类难辨歧义。DSC 2 轮给同一参考的 audible 与 strong 版本,随机交换顺序和“更强/更弱”问法。DSR 3 轮呈现 audible、medium、strong,要求升序或降序排列;选项含正确序列、2 个相邻互换和 1 个较容易干扰序列。每轮只接收 1 段音频和 1 条文字提示,最终仅输出字母。

请在下图中核对 speech、music、sound 3 个域如何连接 9 类退化,再比较 DTI、DSC、DSR 对单段识别和跨段标尺的要求。

MRMAD benchmark overview. MRMAD evaluates multi-turn multi-audio degradation perception and quality understanding across three audio domains, nine degradation types, and three tasks.

图中诊断子集只取三域共同适用的退化,任务端从类型识别递进到 2 段比较和 3 段排序;这解释了排行榜必须按域与任务拆开。

采样和评测。8400 题按 DTI:DSC:DSR=3:3:1,域按 9:8:7;每题使用唯一参考。语音按 192 位说话人和退化均衡,音乐在 track 级避免 DTI/DSC 片段重叠,环境声按 clip 级唯一。所有模型使用同一多轮模板和基于正则的答案解析,准确率按任务、域、退化类型汇总。诊断另在 6 种跨域共有退化的 900 条 DTI 子集上删除/污染参考轮,并比较投影后音频 token 的余弦相似度。

退化参数不是只用“轻、中、重”标签区分。以环境噪声为例,3 档信噪比分别从 10 至 15、0 至 5、-10 至 -5 dB 采样;MP3 使用 32、16、8 kbps;语音低通的截止频率从较高频段逐级降到 750–1500 Hz。每个参考的相关随机条件尽量固定,只改变控制强度,使比较任务不被其他噪声片段或另一房间参数偷换。

提示设计也专门降低文本捷径。每类任务维护多种自然语言模板,音频呈现顺序、询问更强还是更弱、排序方向和选项位置均随机化。DTI 的 3 个错误选项从正确退化所属感知组之外抽取;DSR 的错误序列包含 2 个相邻交换和 1 个较容易的排列。正则解析只接受最终选项字母,不给冗长解释额外得分。

诊断子集从三域共同适用的 6 类退化中均衡抽取 900 题。作者分别删除参考轮、用高斯噪声替换参考,再计算干净与强退化在音频投影后的 token 余弦相似度。前项测试跨轮证据是否被使用,后项定位低级退化信息是否在进入语言解码器之前已被压缩,两者难以互相替代。

💡 核心创新点

  1. 基准首先把低级音频质量感知从单段分类扩展为多轮、多音频关系判断。DTI 测“是什么”,DSC 测 2 段“谁更严重”,DSR 测 3 段完整次序;后两项迫使模型保持同一质量标尺,能暴露单轮问答无法看到的跨轮记忆和比较不一致。

  2. 数据构造随后遵循域适用性。作者没有把 9 类算法机械施加到所有领域,而是排除音乐 echo、声音域环境噪声与 DSP 去噪,按 9:8:7 配置素材和问题。这减少“退化其实是合法内容”的标签噪声,同时让语音、音乐、环境声共享评测框架。

  3. 有了排行榜后,分析继续追到失败位置。参考替换/删除实验检查模型是否真用第 1 轮,投影 token 相似度检查退化信息是否在 audio encoder 到 LLM 接口前消失,reasoning/non-reasoning 成对比较则说明增加思维链不会自动修复感知。3 组诊断共同把失败从笼统的“大模型听不懂”分解为感知表示、跨轮利用和推理 3 个瓶颈。

  4. 随机基线也随任务结构显式变化。类型识别和 3 段排序都是 4 选 1,机会水平为 25%;2 段严重度比较只有 2 选 1,机会水平为 50%。把 3 项分开报告,避免了用同一总准确率掩盖排序任务的额外跨轮负担,也能识别模型只是会做二元比较、却难以维持全局次序的情况。

  5. 这些设计使基准不仅给模型排序,也能回答错误发生在何处:任务间落差指向跨轮比较,参考干预指向上下文利用,投影相似度指向音频接口。3 条证据相互补充,但都只是诊断关联。

📊 实验结果

MRMAD 主表要回答的比较问题是:代表模型在 DTI、DSC、DSR 上相对随机基线的收益分别有多大?

模型DTI 平均↑DSC 平均↑DSR 平均↑
Random Guess25.0050.0025.00
MiMo-Audio-Instruct33.5852.6431.50
Qwen3-Omni-Thinking36.5860.7032.42
Qwen2.5-Omni29.1450.1733.58
Gemini 3.1 Pro86.2290.8164.25
Gemini 3.5 Flash60.6478.1151.08

Gemini 3.1 Pro 相对最佳开源模型在 DTI、DSC、DSR 分别领先 49.64、30.11、30.67 个绝对点。推理训练的作用不一致:Qwen3 Omni Thinking 相对 Instruct 三项提高 1.27、8.06、6.50 点,但匹配模型对平均仅为 -0.25、+0.93、-0.79。多数开源模型在类型识别和排序接近随机,说明困难不只来自答案格式。参考删除诊断和 token 相似度分析又表明,不少模型未充分使用干净参考,且编码器可能把退化细节压平。

排行榜的分母来自基准构造而非模型输出:MRMAD 来源池按 9:8:7 准备 5400 条 speech 域 clips、4800 条 music 域 clips 和 4200 条 sound 域 clips。这里 5400 条的指标是 speech 域片段数,方法是基准构造(benchmark construction),基线不适用;它描述覆盖规模,不是准确率或随机猜测成绩。三域片段经 DTI、DSC、DSR 任务构成 8400 道多项选择题,并由 18 个 LALMs 按任务专属随机基线评估;8400 是问题数,不是音频片段数。

任务难度具有清楚层次:即使 Gemini 3.1 Pro 在类型识别和 2 段比较超过 86% 与 90%,3 段排序也只有 64.25%;最强开源排序结果仅 33.58%,离机会水平不远。说明模型能描述单个片段,不代表能在 3 轮中维护一致的严重度标尺。按退化看,丢包与低通通常更容易,压缩、带通和混响更难,排行榜平均值因此难以替代逐类型诊断。

参考轮干预揭示额外性能边界:Qwen2.5-Omni 与 Audio Flamingo 3 在参考被替换或删除后几乎不变,MiMo-Audio-Instruct 在单轮条件甚至更高;Qwen3-Omni-Thinking 依赖参考最多,但删除后的结果仍接近原设置。这些变化支持“参考利用不足”,但不能据此认定模型完全忽略音频,因为第 2 轮退化片段本身仍可提供类型线索。

🔬 细节详述

最终题量按域分为 speech 3150、music 2800、sound 2450;总题数 8400,平均音频长度 9.1 秒,平均问题长度 73.8 个词。素材池规模 5400/4800/4200 与最终题量采用不同统计口径,因为作者还需满足说话人、曲目、片段和退化均衡约束。DTI、DSC、DSR 的 3:3:1 比例意味着排序任务样本较少,比较模型时应分别看任务而非只看总平均。

请沿下图的数据构造链核对 speech、music、sound 的参考片段如何施加域适用退化和 3 档强度,再生成多轮问题并做平衡抽样。

Data construction pipeline of MRMAD.

图中退化模拟、任务模板与抽样连续相接,严重度在生成问题前已经绑定;投影表示只支持相关性分析,三档主观间距仍缺听者标定。

DTI 的干扰项按感知族组织:低通、带通、MP3 属谱或谱时类,混响与回声属时间效应,神经声码器与 DSP 去噪属算法处理,环境噪声和丢包独立。这让 strong 条件下的正确项更可辨,但也降低了相近退化之间的细粒度混淆压力。DSC 明示退化类别,只比较 audible 和 strong,因此其随机水平是 50%,难以和 DTI/DSR 的 25% 横比。

模型分析显示 packet loss、low-pass 往往比 MP3、band-pass、reverberation 容易,符合突发断裂和宽频高频衰减更显著的解释。SALMONN 在参考与强退化间保持高投影 token 相似度,Qwen2.5-Omni 对强度变化更敏感;这只是表征相关诊断,难以单凭余弦相似度断定因果。参考替换为高斯噪声或删掉首轮时,多数模型掉分有限,说明语言先验或单段线索可能主导答案。

closed-source 模型差异也很大:Gemini 领先,GPT-Audio-1.5 在 DSC 尤其低,证明“闭源”不是感知能力的代理。模型服务版本会变化,公开 leaderboard 需要固定日期、模板和解析器。数据与代码公开使题目可复跑,但第三方对闭源结果仍只能复现协议,难以冻结内部权重。

具体参数也影响题目是否真按严重度排序。神经声码器伪影先在对数梅尔谱加入噪声,再用 BigVGAN 重建;处理链从 16 kHz 升到 24 kHz,生成后再降回 16 kHz。DSP 去噪则固定所加噪声和信噪比,只把谱门控强度从约 0.95 逐步提高到接近一。这样的控制提高内部一致性,但三档在听感上是否等距仍未经人类标定。

投影表示分析比较的是相关性而非充分性。SALMONN 在强退化下仍维持高相似度,提示表示偏向保存高层内容;Audio Flamingo 3 的曲线更低且随强度更有变化,但不同类别仍重叠。相似度只说明信息可能被压缩,无法单独证明语言模型拿不到其他层或其他 token 中的质量线索。

⚖️ 评分理由

  • 创新性 (1.6/2):把退化类型识别、2 段强弱比较和 3 段严重度排序统一为多轮多音频协议,要求模型跨轮保持参考与声学尺度,明显超越单段语义问答式音频基准。

  • 技术严谨性 (1.2/1.5):9 类退化按语音、音乐和环境声的适用性分别生成,并固定同一参考的相关条件,仅改变强度;但 3 档算法合成不能代表真实设备链中的连续与复合质量变化。

  • 实验充分性 (1.4/1.5):8400 道题覆盖 3 类音频、9 类退化和 18 个模型,另有参考删除、参考污染与音频令牌相似度诊断;机会水平和闭源最强模型差距均有完整报告。

  • 清晰度 (0.9/1):数据来源、题型比例、随机顺序、选项构造和答案解析按流程展开,表格分别标出 3 项任务准确率及机会水平,域间不适用的退化已剔除,公式与指标方向易于核对。

  • 影响力 (1.2/1.5):基准可推动音频大模型从内容语义转向压缩、混响和噪声等低级声学感知,并适合持续回归诊断;缺少人类听感标尺、真实设备链和开放式证据定位限制外推。

  • 开源 (1.5/1.5):作者明确在公开 GitHub 仓库发布 MRMAD 代码与数据,核心题目构造和评测资产均可获得,并说明多个源数据集的来源。

  • 可复现性 (0.4/0.5):论文披露单声道 16 kHz、响度归一化、各退化参数区间、题型采样比例、多轮模板和正则解析步骤,足以重建题目;闭源模型服务版本无法冻结,排行榜数值可能漂移。

  • 工程/实践价值 (0.7/1.5):标准化选择题适合自动回归测试,字母输出也降低评测解析成本;但多轮音频推理、连续主观质量、复合退化和真实终端延迟未被覆盖,不能替代听感测评。

🚨 局限与问题

退化由预设算法和三档离散强度合成,多项选择也可能受文本选项先验影响;它不能替代连续主观听感、真实设备链或开放式解释评测,跨轮结果还可能混入上下文长度差异。

进一步审视

所有退化来自预设算法和三档离散参数,现实设备链常把噪声、压缩、混响、削波与传输错误复合起来,并呈连续强度;多项选择还可能被选项措辞和感知族先验利用。源音频虽来自多数据集,仍未覆盖真实通话、助听设备、直播或用户生成内容中的质量分布。

基准没有人类听感标定来确认 audible/medium/strong 在三域的等距性,也不评价开放式理由是否与声音证据一致。16 kHz 单声道处理会丢掉部分高频和空间线索。多轮失败可能同时受上下文窗口、接口实现和模型版本影响,难以全部归因于音频 tokenizer。

题目要求只输出选项字母,降低解析歧义,也难以评估模型的解释是否基于正确声学证据。多模板和随机顺序减少位置偏差,却无法彻底消除选项集合泄露的感知分组先验。未来应加入开放式定位、成对人类听评和复合退化,才能区分“知道类别名称”与“能校准真实可感知质量”。

闭源模型结果还受服务端版本影响,第三方只能冻结提示、音频和评测日期,难以冻结权重。最佳系统与大规模通用多模态训练高度相关,现有实验没有控制训练数据规模,故难以把差距完全归因于某种音频 tokenizer 或推理训练。


← 返回 2026-08-25 语音/音乐/音频论文速递