英文题目:Robustness Assessment of Large Audio Language Models in Multiple-choice Evaluation

会议身份:conference:interspeech:2026:conference-paper-id:lopez26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#评测协议 #音频大模型 #模型评估 #鲁棒性 #音频问答

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Fernando López:机构信息未能从会议 PDF 纯文本可靠映射
  • Santosh Kesiraju:机构信息未能从会议 PDF 纯文本可靠映射
  • Jordi Luque:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文研究大型音频语言模型(Large Audio Language Models,LALMs)在多项选择问答(Multiple-Choice Question Answering,MCQA)中的评测失真,输入为音频加文本问题与4个候选项,输出为选项编号加文本,难点是文本先验和措辞变化会掩盖真实听觉理解。方法链分4步推进,先在默认文本下测LALMs并用无音频大语言模型估计语言偏置,再对选项排序做24种全排列测试位置敏感性,接着用两个生成模型分别改写问题与正确答案和干扰项,最后以0.5概率混合各项扰动形成低成本稳健性测试并用严格正确率汇总。相对已有基准只报单点准确率的做法,差异在于引入一致性率与全扰动下全对才算对的正确率并保留音频不变做隔离归因。在MMAU测试迷你集上无音频模型达到48.3%准确率,干扰项改写在部分模型上造成标准差高达13.7%的波动。结论仅适用于保持语义的语言扰动和所测3个基准与4个开源模型,未验证信号级扰动与开放式问答的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:为什么只看一次准确率会误导新人?

这篇论文研究的对象是大音频语言模型,用白话说就是能同时听声音和读文字、再用文字回答问题的模型,英文叫大型音频语言模型。研究生刚进语音、音乐、音频领域时,最容易接触到的评测就是多项选择问答,也就是给一段音频、一个文字问题和 4 个文字选项,模型选出一个,算答对的比例。

这种评测流行的原因是操作简单、打分客观、与人类考试形式一致。论文指出,当前大量音频理解进展都是用这类选择题报告的,一个数字就能排名。但问题在于,这个数字把两件事混在一起:一是模型是否真听懂了音频,二是题干和选项的文字本身是否已经泄露了答案。如果第二件事成立,那么换一下选项顺序、换一种问法,分数就会大幅抖动,所谓进步可能只是评测脆弱造成的假象。

因此本解读的目标是帮你复述出一套可核对的方法:固定音频不变,只动文字,分别测量语言偏置有多大、措辞变化带来多大波动、以及如何用更严格的指标重新报告成绩。必须保留的信息包括 3 个基准的名称与规模、四款被测音频模型的名称、纯文本对照模型的名称、扰动种类与版本数、以及一致率与全对正确率的定义与方向。

大音频语言模型 × 多项选择问答: 大音频语言模型负责听懂音频并结合文字作答,多项选择问答负责把作答压缩为四选一的准确率,二者搭配的理由是评测简单可比,组合意义是若选项文字本身泄露答案,准确率就不再只反映听觉理解。

本文的输出是一套可复现的扰动评测流程与结论:文本捷径确实存在,干扰项改写影响最大,长选项偏好是重要线索,混合扰动加严格指标能以可接受的计算量暴露不鲁棒。

术语小抄:新人最容易混淆的三组词怎么记?

第一组是音频模型与文本模型。前者输入包含音频,后者只看文字。对照的意义不是比谁更强,而是用文本模型的分数估计题目本身泄露了多少信息。

第二组是一致率与全对率。前者不看标准答案,只看多次回答是否彼此相同;后者必须每次都与标准答案一致。前者高而后者低,说明模型稳定地答错,这是新人最容易误读的地方。

第三组是重排与改写。前者不改任何文字,只换位置;后者不换位置语义,只换说法。论文报告显示,换位置已有影响,换干扰项说法影响最大。记住这个排序,就记住了全文的实证重心。

相关路线:这项工作站在哪两条线之间?

第一条线是音频基准从基础任务走向推理。论文提到早期基准侧重语音识别等基础能力,后来出现的多项选择基准开始考察推理,例如跨语音、声音、音乐的理解。按同输入、同目标来对照,这些基准的共同点是输入都是音频加文字选择题,目标都是报告准确率,监督都是人工标注的正确选项,运行阶段都是离线评测。本文不提出新音频任务,而是追问这些基准上的数字是否可信。

第二条线是大语言模型领域已经发现的选择题脆弱性。论文引用了选项顺序、提示措辞会改变大语言模型选择的研究,以及系统性一致性评测的工作。本文把这一思路搬到音频模型,但做了关键区分:音频是否提供了稳定的接地信号,还是语言框架主导了答案。为此作者明确把信号级扰动放在一边,例如插入静音、重排声事件、改变时长,声明那是正交方向,本文只研究语言敏感性。

这种定位决定了对照方式:不是比谁的绝对分数更高,而是比同一模型在文字变化前后是否保持正确。相关工作按同运行阶段看,都是评测期行为,不涉及重新训练模型。

再看一次相关工作:为什么不直接比绝对分数?

按同输入、同目标、同监督、同运行阶段来对照,本文与音频基准工作的输入相同、目标不同:前者要可信的测量,后者要覆盖更广的任务。与大语言模型鲁棒性工作的目标相近、输入不同:前者多了音频通道,需要回答音频是否稳定了答案。

因此直接比较绝对分数会混淆条件:不同模型在不同基准、不同选项数、不同解析规则下的分数不可比。论文的做法是保留原文实际可运行的策略做对照,例如同一模型在原始与扰动下的自身对比,以及有音频与无音频的对照,而不是用事后最优或理论上限代替可部署收益。这种比较观是新人做实验最应继承的部分。

要回答的问题:音频固定时答案还一致吗?

论文提出的核心问题是:当音频保持不变,只对语言部分做微小但保义的变化,大音频语言模型的答案是否一致且正确。具体拆成 4 个可操作的子问题:打乱选项顺序影响多大,改写问题影响多大,改写正确答案的措辞影响多大,改写干扰项的措辞影响多大。

这里需要先理解语言偏置这个术语。白话说就是不听声音也能猜对,英文是语言偏置。产生原因可能包括题干与选项的词汇线索、常见答案的先验频率、选项格式的人工痕迹。论文用纯文本对照来估计它,也就是把同样的问题和选项喂给不听音频的纯文本大语言模型,看它们能拿多少分。如果纯文本模型显著超过随机选择,就说明基准中存在可被利用的文本捷径。

语言偏置 × 纯文本对照: 语言偏置指不听音频只看题干和选项也能猜对,纯文本对照指把同一套题喂给不接音频的大语言模型,分工是前者为待测现象、后者为测量工具,搭配理由是只有扣除文本可解部分,才能分离出真正的音频理解增益。

第二个关键是评估目标从单点准确率转向分布。原来每个基准只报告一个准确率,现在要报告均值、标准差、最小值、最大值,以及跨版本的一致性和全对率。指标方向很明确:均值越高越好,标准差越小越稳,一致率越高越稳定,全对率越高越鲁棒。

方法全景:一个样本如何走完五种文字变化?

先沿一个样本走完全程。输入是一组三元组:一段音频、一个文字问题、4 个文字选项,其中一个是正确答案,3 个是干扰项。模型要输出选项编号加选项内容,评测程序用正则或内容精确匹配判定对错。输出只有一个选择,但研究者在外部把同一音频配上多个文字版本,反复调用模型,收集一组回答,再算统计量。

5 个版本对应图中的五列。第一列是原始数据,作为基线。第二列只重排选项顺序,文字一个字不改。第三列只改写问题,选项不动。第四列只改写正确答案的措辞,问题和干扰项不动。

第五列只改写干扰项的措辞,问题和正确答案不动。每种扰动都要求保持原意,作者对随机抽取的样本做了人工核验。

以下导读帮你看懂论文图 1 的教学意图,该图把同一音频配 5 种文字、分别喂给同一个音频语言模型的流程画了出来,底部用对勾和叉号直观展示翻转,理解这张图就理解了全文的实验逻辑。

看图路径: 1. 先从左到右确认五列:原始数据、选项重排、问题改写、答案改写、干扰项改写;2. 再看每列下方蓝色波形是否相同,确认音频固定、只改文字;3. 最后对比底部绿色对勾与红色叉号,定位哪类改写导致翻转

原论文 Figure 1:Evaluation protocol. Sample of each perturbation applied to a benchmark in isolation.

论文图 1。原论文 Figure 1:“Evaluation protocol. Sample of each perturbation applied to a benchmark in isolation. Correct answer is in green.”。

图中可见 5 个面板共享相同的蓝色波形,说明音频信号被刻意固定。每个面板上方是文字框,加粗表示被改动的位置,绿色表示正确答案。底部模型框都标为大音频语言模型,但最后两列出现红色叉号,说明仅改写问题或干扰项就足以让原本答对的样本答错。这种前导读加后解释的闭环告诉新人:波动不是来自听不清,而是来自文字框架。

选项重排 × 改写扰动: 选项重排负责打乱正确项位置而不改文字,改写扰动负责保持语义重写题干、正确答案或干扰项,分工是前者测位置敏感、后者测措辞敏感,搭配理由是二者正交,组合成混合扰动才能模拟真实评测中的复合变化。

在全景之上还有混合扰动。它不是把所有改写一次性全加上,而是对每个三元组以一定概率决定是否应用每种修改,从而以较少的版本数同时覆盖重排与改写的影响,后文实验条件节会给出具体概率与版本数。

组件与计算:版本数、改写工具和两个指标如何分工?

组件一是扰动生成。选项重排覆盖全部排列,4 个选项共有 24 种顺序,其中一种是原始顺序。问题改写、正确答案改写、干扰项改写各生成 6 个新版本加上原始版本,共 7 个版本。混合扰动也做 7 个版本。改写工具是两个生成模型,一个负责结合完整上下文生成 3 个不同版本,例如改写干扰项时会同时看到问题和正确答案,另一个负责在不同上下文信息条件下生成 3 个版本。作者强调改写后问题平均变短,选项平均变长,并对 620 个随机样本做了人工保义核验。

组件二是评测与解析。解码采用贪心策略,提示词统一要求模型按指定格式返回所选候选项。输入处理上,个别只有两个选项或超过 4 个选项的题目被统一为 4 个且保留正确答案。输出处理上,对只输出字母的模型做解析,使其符合统一格式。这些细节保证跨模型比较时提示与解析一致。

组件三是指标。第一个是一致率,考察多次回答之间两两是否相同,不需要标准答案,适用于正确答案或干扰项文字未变的条件。第二个是全对正确率,只有该题在所有扰动版本下全部答对才计 1 分,否则 0 分,再对所有题目平均。它比平均准确率更严格,适用于所有扰动。

一致率 × 正确率: 一致率负责衡量多次扰动下回答是否相同而不看对错,正确率负责衡量是否每次都答对,分工是前者看稳定性、后者看严格正确性,搭配理由是模型可能稳定地答错,组合后才能区分瞎稳定与真鲁棒。

沿样本看计算目标:假设某题有 7 个文字版本,模型给出 7 个回答,一致率统计这 7 个回答中有多少对是相同的,全对率检查这 7 个是否与标准答案全部一致。前者回答了稳不稳,后者回答了行不行,二者互补。

有训练吗:本研究训练了什么、冻结了什么?

本研究没有训练任何新的音频语言模型,也没有微调被测模型,这是一个纯评测型工作。因此不存在梯度路径、参数冻结与更新、优化器、学习率、训练轮数等需要交代的事项。若按模板追问哪些参数被冻结,答案是原文未报告训练,无法从模型名称推定其训练实现,也不把无训练等同于输出确定。

真实的计算过程是调用与生成。首先调用已有的开源音频模型做推理,解码策略为贪心。其次调用两个文本生成模型做改写,生成多版本基准。再次运行评测脚本做解析与打分,计算均值、标准差、极值、一致率与全对率。最后用纯文本大语言模型做无音频对照,以相同格式与解析流程估计语言偏置。

需要指出的缺项是:改写模型的采样温度、提示词全文、人工核验的具体通过标准在正文中未完整给出,只有数量与结论。复现时应以作者公开的评测代码与扰动后基准为准,而不是自行猜测提示词。本节未涉及神经网络训练,因此不存在拿掉某训练组件后必然怎样的因果结论。

实验条件:数据、模型、对照与聚合口径是什么?

数据侧用 3 个基准。第一个是所用版本的多任务音频理解子集,包含 1000 个样本,覆盖语音、声音、音乐,用于广泛的音频理解测量。第二个是更复杂的多源基准,同样 1000 个样本,覆盖语音、声音、音乐与混合源。第 3 个是聚焦语音的大规模基准,包含 5000 个样本,侧重语言丰富场景下的推理。三者共同提供通用与专用推理的评估基础。改写统计上,问题平均从 12.5 个词缩短到 9.6 个词,选项从 4.3 个词延长到 6.1 个词。

模型侧评测四款开源音频模型,分别为两款同一系列的大小模型、一款多模态模型和一款音频模型。另有三款已发表的参考模型用于拓宽上下文,以及随机选择基线。纯文本对照用三款文本大语言模型,只给问题与选项、不给音频,采用相同格式与解析流程,以实现跨模态直接比较。

协议侧每个扰动类型包含默认数据,混合扰动对每种修改以 0.5 概率应用,既全加又全不加的概率均为 0.0625。指标聚合是对题目平均,全对率要求单题全版本答对才计分。原文报告默认条件下结果与既往研究存在约正负 2 个百分点的漂移,可能来自解码策略或库版本差异,这提示复现时不要追求小数点后完全一致。

主结果:文本捷径有多大,哪种改写最致命?

先看语言偏置是否存在。纯文本模型在所有基准上都超过随机选择,其中一款大文本模型在一个基准上达到较高的平均准确率,比随机高出二十多个百分点,甚至超过部分早期音频模型,在另两个基准上也超过随机。这支持判断:现有选择题基准含有不听音频也能利用的文本捷径,随机选择不应作为音频模型的基线,纯文本对照才是有意义的基线。

下表把这一判断所需的比较问题、公平条件和指标方向收拢。比较问题是同样题目下无音频能拿多少分,公平条件是相同题目、相同选项、相同格式与解析、只是去掉音频,指标方向是准确率越高说明文本捷径越多,而非音频理解越强。

条件指标纯文本最强超随机幅度扰动敏感度
同题无音频对照准确率48.3%22.6 points13.7%
同题无音频对照文本捷径判断48.3%22.6 points13.7%
音频模型评测准确率波动48.3%22.6 points13.7%

上表的主要收益是把语言偏置从感觉变成可核对的数字:纯文本最强达到 48.3%,超出随机 22.6 个百分点,而干扰项改写可带来高达 13.7% 的标准差。代价是不能再只看单点准确率,必须同时报告波动。未胜出项是随机选择,它在多源基准中因部分题目只有两个选项而虚高,不适合当基线。需要说明的边界是文本捷径来源可能是词汇线索、先验频率或格式痕迹,原文未分解各自贡献。

再看扰动排序。选项重排与问题改写带来中等波动,模型有一定承受力。正确答案改写带来更高方差,干扰项改写带来最大的准确率与全对率下降,说明模型对选项措辞高度敏感。混合扰动能以中等程度同时捕捉各类变异,在全对率上得到充分体现。模型间比较显示,一款大音频模型总体准确率最高且在重排与问题改写下较稳,另一款多模态模型在干扰项改写下全对率最高,表现出更强的措辞鲁棒性,最小的模型则在干扰项改写下最弱。

干扰项改写 × 长选项偏好: 干扰项改写负责改变错误选项的措辞和长度,长选项偏好指模型倾向于选字数最多的选项,分工是前者为操作、后者为可能的机制解释,搭配理由是改写后选项平均变长,若模型本就有选长项捷径,准确率波动就有了可验证的来源。

反证与机制:长选项偏好能否解释波动?

论文进一步检验长选项偏好这个假设。因为改写后选项普遍变长,如果模型本来就爱选长的,那么干扰项改写的影响就有了机制线索。测量方法是统计模型选择最长选项的比例,并与数据中最长选项恰为正确答案的比例对比。

下表把该机制检验所需的条件、指标与对照收拢。比较问题是模型选长项的频率是否高于数据中长项为正确答案的先验,公平条件是同一基准、同一解码与解析,指标方向是选择比例越高说明偏好越强。

模型选最长比例长项为正确答案先验放大后命中机制判断
音频模型甲52.38%45.05%70.93%偏好长选项
音频模型乙50.31%45.05%77.94%偏好长选项
音频模型丙50.23%45.05%76.41%偏好长选项
音频模型丁42.51%45.05%74.29%偏好长选项

表后解释需要同时讲收益与代价。收益是四款模型选最长选项的比例多在 50% 左右,高于长项为正确答案的先验 45.05%,且当最长选项确实正确时选中率进一步放大到 70% 以上,这支持长选项可作为选择捷径的判断。代价与反例是其中一款模型选长比例低于先验,说明偏好强度因模型而异,不能把全部波动都归因于长度,措辞语义本身仍有影响。未评测的边界是长度与语义的解耦实验,例如固定长度只改语义,原文未做。

这一节的限定表达是:结果显示偏好存在,支持解释部分波动,可能仍有其他因素,待验证。不能从相关性直接写成因果,也不能承诺去掉长度偏好后波动必然消失。

边界在哪:哪些结论不能推广?

第一个边界是音频固定。全文刻意不做信号级扰动,因此结论只适用于语言鲁棒性,不能推广为模型对噪声、静音、混响、时长变化也同样脆弱或同样鲁棒。信号扰动是互补的未来方向。

第二个边界是改写工具与人工核验的覆盖度。改写由两个特定生成模型完成,人工核验抽查了 620 个样本并确认保义,但未覆盖全部样本,不能保证每个改写都完全等义。若个别改写引入语义漂移,波动会被高估。复现时应保留原始改写版本,而不是自行换模型重写后直接对比数字。

第 3 个边界是指标与成本。穷举所有扰动组合在计算上不可行,混合扰动是以概率采样实现的折中。全对率非常严格,只要一个版本答错整题即判错,因此数值天然偏低,不应与单点准确率直接比较大小。论文未测量推理延迟、显存开销与人工误判率,因此不能承诺该评测协议改善了效率或用户体验,它改善的是评估的可信度。

复现先做什么:按什么顺序重跑才可核对?

第一步重跑默认条件。按统一提示词与贪心解码,在 3 个基准的原始顺序与原始措辞下得到基线准确率,并与已发表结果对照,允许约正负 2 个百分点的漂移。若漂移远超该范围,先检查解析规则与库版本,而不是直接怀疑模型。

第二步重跑纯文本对照。去掉音频,只给问题与选项,用相同格式调用文本模型,验证是否显著超过随机选择。这一步决定了后续波动解读的底座:若文本捷径不存在,后续扰动的影响才更可能归因于音频 grounding 不稳。

第三步逐类加扰动。先跑 24 种选项重排,再跑问题、答案、干扰项各 7 个版本,最后跑混合扰动 7 个版本。每个阶段同时记录均值、标准差、极值、一致率与全对率,注意一致率只适用于正确答案或干扰项未变的条件,全对率适用于全部条件。

关于可用性必须如实说明:本次收到的证据中未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。论文正文给出一个代码链接,但按本次核验规则应视为本次未能确认可达,复现前需自行确认链接当前是否可用。关键超参数与信息条件是贪心解码、统一输出格式、四选项归一化、混合扰动概率 0.5。

收束:何时值得用这套更严格的评测?

当你的研究目标是报告音频理解的真实增益,而不是刷选择题单点分数时,这套方法值得尝试。特别是新模型只比基线高几个百分点时,更应先做纯文本对照与干扰项改写,确认增益不是来自文本捷径或措辞运气。

可复述的方法一句话是:固定音频,分别重排选项、改写问题、改写正确答案、改写干扰项,再做概率混合,每种做多版本,用均值加标准差、一率与全对率共同报告。实践中若计算预算有限,可直接采用混合扰动加全对率,它以较少版本同时反映重排与改写的敏感性。

还需补的验证包括信号级扰动、长度与语义解耦、以及把扰动作为数据增强是否真能减轻语言偏置。论文把后者列为未来工作,支持但未验证。记住总体趋势不等于每题都成立,平均稳不代表每种改写都稳,严格指标的价值正在于暴露那些被平均数掩盖的失败。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总