英文题目:A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models

会议身份:conference:eacl:2026:conference-paper-id:2026.eacl-long.42

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #环境声 #语音 #音频问答

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Iwona Christop:机构信息未能从会议 PDF 纯文本可靠映射
  • Mateusz Czyżnikiewicz:机构信息未能从会议 PDF 纯文本可靠映射
  • Paweł Skórzewski:机构信息未能从会议 PDF 纯文本可靠映射
  • Łukasz Bondaruk:机构信息未能从会议 PDF 纯文本可靠映射
  • Jakub Kubiak:机构信息未能从会议 PDF 纯文本可靠映射
  • Marcin Lewandowski:机构信息未能从会议 PDF 纯文本可靠映射
  • Marek Kubis:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为包含口语问题与待推理语音或声音片段的单段音频,输出为是否二值判断,难点在于必须联合识别语音内容与非语音事件并完成计数比较与属性推理,单转写或单字幕管线无法求解。构建链分为任务征集与规则过滤以剔除主观与不可判定任务,模板实例化以控制标签均衡与可再生扩展,语音克隆与声音库拼贴合成以统一响度与衔接,最后经人工校验形成可复现评测流程。与仅孤立评测识别或分类的已有音频基准相比,该基准把问题本身嵌入音频并要求跨录音比较,因而能暴露级联系统也难以跨越的组合失效。人类在216样本的ART-H子集上达到92.90%准确率,而最优级联系统在是否设置下仅56.21%绝对准确率,最优音频大模型仅54.73%,基本处于随机水平。结论仅适用于清晰合成英语主导的受控拼贴场景,未验证噪声混响多语自发语音与音乐专业知识的外推能力。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,这篇解读要保留什么?

这篇解读的输入是论文正文与官方原图像素,目标是让刚进入语音音乐音频领域的研究生能核对并复述方法。必须保留的信息包括任务定义与两条选题规则、9 类任务的构成、模板加语音合成加声音库的构造链条、两种评测协议与裁判设置、人类基线与模型主结果。输出是 1 篇按学习依赖展开的中文技术解读,不做营销式判断,所有数字与条件回到原文核对。

多模态大语言模型在这里指能同时处理文字与音频的模型。已有音频评测多是孤立考单项,例如语音识别、声景分类、音频描述各自测准确率。论文指出的问题是,即使单项都很好,也不能保证模型能把不同类别的线索合起来回答一个问题。特别是很多模型由分别预训练的文本部件与音频部件拼接而成,拼接不等于会联合推理。

举一个教学例子帮助理解,例子不是论文数据:先听到两声猫叫与三声铃声,再听到提问铃声与猫叫次数是否一样多。只做声音分类能认出猫和铃,只做计数能数出次数,但回答是否一样多需要同时认对两类声音并比较数量。论文的音频算术、跨录音说话人比较、文本加声音推理等任务,都是这种需要跨类别组合的提问。

因此学习顺序是先看任务与相关路线,再看方法全景与组件计算,再看构造与推理的实际操作,再看实验条件、结果与反证,最后看复现与收束。后文术语首次出现会先给白话再给英文,简称固定,便于回指。

已有音频基准在测什么,为什么还缺推理?

早期思路如语音版语言理解基准,把文字任务读成语音再测,重点是抗识别错误,不是音频推理。后续通用音频大模型基准覆盖语音理解、声景理解与分类三大块,但三块分开打分,做法上多用大模型当裁判,有的还用同一模型既当选手又当裁判,存在偏好风险。商用模型公开的音频成绩也多集中在语音识别与语音翻译,用词错率与翻译分数报告。

与本文最接近的是大规模多任务音频理解与推理基准,它有上 10000 条音频与人工标注问题,覆盖语音、环境声与音乐,强调信息抽取与推理。论文用附录逐类对比说明本文 9 类任务在其中没有完全对应。更关键的差异有三点:对方部分音乐题需要和声与和弦等专门知识,不利于一般研究者做错误分析;对方问题是文字给出、与音频分离,而本文把问题也合成语音并拼进同一条音频;对方是多选并用闭源模型生成干扰项,存在模型偏爱自己生成文本的风险,而本文是否问答版本把回答限制为是否,避开了干扰项构造偏置。

另一条相关工作关注背景噪声、情感、说话人与房间混响的一致性,用两段录音比哪段更合理。人类觉得容易,模型常错,但它 1 次只扰动一个方面,不要求基于整段录音做多步推断。本文的定位正在于此:不是再加一个单项分类,而是要求模型在同一条音频内组合多种声音现象。

什么样的问题才算音频推理题?

论文先立两条选题规则。第一条是不能只靠单个专用模块的输出加语言模型就解出来。也就是说,不能只靠语音转写回答,也不能只靠音频描述加问答就回答,必须同时用到音频中多种现象。第二条是无听力障碍的普通人不用专业训练就能做,不依赖音乐家或调音师的超常能力,也不做情绪与音质这类因人而异的主观判断。

按这两条,作者组内征集到 25 个候选,再剔除无法可靠判分与无法改写成是否问答的题目,最后留下 9 类:音频算术、音频变换检测、跨录音语种识别、跨录音说话人识别、选择性文本推断、声音推理、语音特征比较、文本与声音推理、文本与时空定位推理。每类各 1000 条,共 9000 条,是否答案各半,模板层面也尽量均衡。

语音转写 × 音频推理: 语音转写的分工是把语音变成文字,只保留语言内容;音频推理的分工是同时利用语音内容、说话人特征、非语音声音与变换关系再做判断。两者搭配的理由是转写会丢掉音色、语种、背景声与先后比较信息,而推理恰好需要这些被丢掉的信息,组合意义在于检验模型是否真的听了完整音频而不是只读了转写文字。

这意味着复述时要抓住判定标准:若一题只听文字就能答对,或只听背景声就能答对,它就不应入选;入选题必须跨线索,例如先按性别选出该听谁,再回答那个人说了什么,或先认出两种动物再比较大小。

从规则到可播放音频,全流程经过哪些站?

构造是多阶段过程。先定规则,再请有经验的语音与语言工程师提候选任务并筛选,然后为每类任务写问题模板,最后用语音合成与声音库填充槽位并拼接成任务实例。模板的好处是可控扩充与防污染:以后换一批未公开的声音重填模板,就能在不泄露测试集的情况下重测。

下图是论文给出的任务准备流程,阅读时把 3 条支线分开再看汇合点,重点是模板如何成为中间枢纽。

看图路径: 1. 先从左侧任务制定规则箭头看到领域专家,再看到任务框;2. 再看任务如何向下变成任务模板框;3. 最后看声音库、语音合成模型与模板如何三路汇入任务实例

原论文 Figure 1:Task preparation process.

论文图 1。原论文 Figure 1:“Task preparation process.”。

这张流程图显示任务制定规则先经过领域专家形成任务,任务再向下形成任务模板;底部任务实例同时接收来自语音合成模型、声音数据库与任务模板的 3 路输入。教学含义是规则与专家只决定考什么,真正可播放的考题由模板加声音加合成语音共同决定,任一支线换料都会改变最终音频但不改变判定逻辑。

任务模板 × 任务实例: 任务模板的分工是规定问题句式、槽位类型与正确答案的判定规则;任务实例的分工是把具体语句、声音片段与说话人填充进槽位并合成为一条可播放音频。搭配理由是模板保证标签可自动推导与均衡,实例保证每次提问的声音实现不同,组合意义是既能批量生成又能在数据泄露时换料重测。

模板槽位如何规定输入、表示与正确答案?

每个模板包含问题句、若干槽位与答案推导规则。槽位可以填词、整句或声音标签,填充时从预先准备的集合随机取,同时按规则自动算出是否答案。沿一条样本走完就是:输入为问题语音加语句语音加声音事件,经过说话人与声音识别,再按模板规则做计数、比较或常识判断,最后输出是否。

下图用文本与声音推理的 1 例展示槽位机制,关键是看已填充值与候选池的关系,而不是把图当成真实音频波形。

看图路径: 1. 先读顶部问题句与中间已填充的雷声语句;2. 再看虚线框内备选语句列表与备选声音标签列表;3. 最后沿两条箭头确认语句槽与声音槽分别取自哪个列表

原论文 Figure 2:Example of a template. Both the sentence and the sound are chosen randomly from predefined lists;…

论文图 2。原论文 Figure 2:“Example of a template. Both the sentence and the sound are chosen randomly from predefined lists; the target answer can be inferred from these values.”。

这张示例图顶部是英文问题是否在谈论随后听到的声音,中间已填入雷声的描述句与雷声标签,虚线框内分别是备选语句表与备选声音表,两条箭头指回已选项。可见模板先定句式,随机抽取只是实例化手段,答案由所抽语句主题与所抽声音是否一致决定,同时还要为模板各部分选择合适的克隆用说话人。

音频算术模板规定两类声音各出现若干次,比较次数是否相等、是否 2 倍、是否为偶数或奇数、谁更多谁更少,次数范围限定在 1 到 4 次。

\[where sA, sB ∈S, sA ̸= sB; nA, nB ∈⟨1, 4⟩.\]

上式说明声音取自铃声猫叫等集合且两类不同,次数各在一到四之间,是否答案由次数相等与否直接推导,不需要外部知识。

跨录音语种模板涉及爱沙尼亚语、芬兰语、匈牙利语与波兰语,比较 3 人是否同语、能否听到两种或 3 种语言,或问首都与邻国关系。说话人集合的约束保证比较对象互不相同。

\[where sA, sB, sC ∈S; sA ̸= sB ̸= sC.\]

上式是 3 人比较时的互异约束,答案为是当且仅当 3 人语种相同或互不相同,取决于具体问法,模型必须先辨语种再做逻辑判断。

同国判断则化为语种是否相同,因为集合中每种语言对应一个国家。

\[if language(sA) = language(sB).\]

上式说明当且仅当 2 人语种相同才判为来自同一国家,这把地理知识压缩成语言比较,普通人可做,模型则需先听出语种。

本研究训练了什么,没有训练什么,声音从哪里来?

本研究没有训练新的多模态大模型,也没有微调被测模型,训练一节实际承担的是数据集构造过程。需要讲清的是合成与筛选的计算链,而不是优化器与梯度。论文未报告被测模型的参数冻结与更新细节,解读不从模型名字推定实现。

问题语音统一用同一个音色合成,以保证提问风格一致。做法是先在朗读数据集上用中等规模识别模型筛出词错率为零的样本,再合成后再转写 1 次找仍为零的样本,最后人工听选最自然的一条作为提问音色。需要语句的 5 类任务从带多口音的英语语料选 10 个说话人,同样经过转写筛选与人工试听。跨录音语种任务用多语语料的 4 个语种,每语选 3 人,每人一条 2 到 5 秒且识别无错的录音。声音事件来自共享声音库中知识共享零协议样本,人工挑出短音、短旋律与背景声并修剪到单事件。

合成管线基于可做零样本克隆的语音合成模型,结构沿用变换器并改用旋转位置编码,用较小的时长预测器与基于联结时序分类的强制对齐得到音素时长,再用高保真生成对抗网络声码器从 80 维梅尔谱生成波形。所有录音归一化到 -20 分贝满刻度,问句与内容之间留出自然静音,短音截到 5 秒并做淡出,背景声叠加时把底层语音压低 20 分贝并做淡入淡出以保证可懂度。

下表是基准的规模统计,阅读时先确认每类样本数相同,再看模板数与说话人语句声音数的差异,表中数量不代表难度排序。

#Templates# Speakers# Utterances
6N/AN/A
4N/AN/A
61212
448
4436
4103

该表显示 9 类各有若干模板与不同的说话人语句声音配额,总量 9000 条、三十多小时音频。规模差异主要来自模板设计,例如声音推理模板多而说话人比较模板少。代价是全干净合成语音,若模型在干净条件下已失败,换成噪声条件只会更差,因此论文把更难声学条件的验证往后放。

测什么、与谁比、条件是否一致、指标方向如何?

评测回答两个问题:在强制是否输出下模型能否听懂并推理,在自由描述下失败形态是什么。与谁比包括两类级联与多个开源音频模型:级联用大识别模型转写再交由大语言模型回答,端到端包括音频火烈鸟、伽马、通义音频对话与音频指令版、超声音等版本。每个模型在是否协议下跑 5 次取平均,以考察是否稳定超过随机猜测。

是否协议提示模型只答是否,自动判分先看是否相关即是否为是否,再在相关回答上算相对准确率,在全部样本上算绝对准确率,越高越好。描述协议不限形式,允许自由回答,再用两个大语言模型当裁判判断相关与正确,裁判间一致率另行报告。是否协议重可比性,描述协议重错误分析,两者互补。

级联系统 × 端到端音频大模型: 级联系统的分工是先用 Whisper 做语音识别再把文字交给大语言模型回答;端到端音频大模型的分工是直接消费音频波形或声学特征并回答。搭配理由是前者代表只靠转写的上限参照,后者代表真正需要听声的被测对象,组合意义是若端到端还不如只看转写的级联,就说明音频感知或跨线索组合出了问题。

下表是描述协议下总体相关率与准确率的汇总,阅读时先看相关率再看准确率,注意同一模型在不同裁判下可能一宽一严。

ModelRelevant Accuracy RelevantAccuracy Agreement
Whisper + Llama 62.62%0.35350.4834
Whisper + Qwen 89.68%0.48820.5697
GAMA 1.31%0.00890.0154
Qwen-Audio-Chat 14.50%0.07780.0548
Qwen2-Audio 92.26%0.44900.4683

该表显示级联与部分端到端模型相关率较高,但绝对准确率多未过半;伽马与音频对话模型相关率很低,说明自由回答时大量跑题。代价是裁判本身有偏好,例如有的裁判对自家模型更宽容,因此论文同时报告双裁判与人裁判一致性,未胜出项与低相关模型同样保留,避免只看冠军。

是否问答下谁答出来了,谁还在猜?

是否问答是主结果。论文报告两条级联几乎 100% 相关,绝对准确率约 54% 与五十六。端到端中只有音频火烈鸟做到 100% 相关且绝对准确率约 54% 点七,超声音新版相关率约 99.7% 且准确率约 53%。其余模型相关率明显更低,伽马最低,绝对准确率仅约 20%。单样本与换模板单样本实验显示,给同模板示例略有提升,给不同模板示例反而下降,说明示例不能替代真正的音频理解。

分任务看,跨录音说话人识别最难,平均绝对准确率不足四成且没有模型在 5 次中任 1 次过半;选择性文本推断相对最好。人类在精简子集上达 92.9%,3 类最易接近满分,口音与语种两类最低但仍远高于模型。这支持论文判断:题目对人可解,对模型难。

相关回答率 × 绝对准确率: 相关回答率的分工是度量模型是否按要求输出可判定的是否回答;绝对准确率的分工是度量在全部样本上答对的比例。搭配理由是只看答对率会掩盖大量拒答或跑题,只看相关率会掩盖瞎猜,组合意义是同时报告才能区分是不听话还是听不懂。

下表是描述协议下以一个裁判判分的分任务绝对准确率,阅读时按行看模型特长是否跨任务泛化,按列看哪些任务系统性更难,数值越高越好。

ModelAAATDCRLICRSISTI
Whisper + Llama0.1580.1570.1260.2750.503
Whisper + Qwen0.4510.3900.2680.3940.446
0.4390.3820.4960.3850.501
Ultravox v0.4.10.1580.0220.3190.2200.281
Ultravox v0.60.4050.3520.2860.1760.372
Average0.2810.2240.2840.2470.341

该表显示语音特征比较与文本声音推理平均较高,音频变换检测与跨录音说话人识别平均较低;部分模型在某列可达 60% 以上,但在他列跌到一成以下,说明泛化有限。未胜出项如伽马与音频对话在多列接近零,不是删除的异常点,而是转写偏置与跑题的证据。反例是级联在某些列反而高于端到端,提示端到端并未稳定利用声学线索。

换一种问法与换一个裁判,结论还成立吗?

描述协议加双裁判可视为对评测方式的对照。换裁判后任务难度排序大体一致:语音特征比较与文本声音推理仍较高,变换检测与语种识别仍较低,但绝对数值随裁判宽严浮动。级联用自家裁判给自己打分更高,音频火烈鸟等模型的分数则在两裁判下接近,说明裁判偏好不可忽略。

错误分析基于人工抽查。是否协议下主要是没听出有语音或声音,以及把任务做成转写或说话人识别;描述协议下更多样,包括没听懂问题、随机猜测、语言错乱、复述提示词、臆测现实知识。是否协议把错误收敛到感知与任务混淆,描述协议放大了控制不稳。

是否问答 × 描述问答: 是否问答的分工是用强制输出是否来做自动判分,减少评判模型偏好;描述问答的分工是允许自由回答再用大模型做裁判,以观察真实失败形态。搭配理由是前者控制评测噪声,后者暴露转写偏置与猜测行为,组合意义是两种协议互相印证,避免把评判方式的宽严当成推理能力的差距。

下表是换另一个裁判后的分任务绝对准确率,阅读条件与上表相同,重点比较同一模型同一任务在两裁判下的升降,而不是把两表数字直接相减当成提升量。

ModelAAATDCRLICRSISTI
Whisper + Llama0.1250.0080.1280.4910.559
Whisper + Qwen0.6600.5120.2800.5130.466
0.5420.3530.6040.3730.502
Ultravox v0.4.10.1000.0030.1970.1860.205
Ultravox v0.60.5210.3400.2600.2070.427
Average0.3450.2110.2860.2960.348

该表同样显示变换检测与语种识别偏低,时空定位推理在该裁判下略高。同一模型跨表差异可达数个百分点,支持裁判有系统性宽严的判断。代价是自动裁判与人的一致性并不完美,低分模型的裁判一致率高多因回答明显无关,而中等模型的人机分歧更大,因此论文强调模型级分析与谨慎解读自动分数。

哪些边界没有测,哪些结论不能推广?

论文明确说明 9 类任务不完备,通过测试不等于达到人类音频推理水平。这是缺失证据而非技术错误,相关性也不是因果,不能把基准得分直接当成通用听觉智能。

声学条件是主要边界。全部提问与语句为干净合成语音,背景声也经过电平与淡入淡出控制。论文的理由是若干净条件已失败,噪声下只会更差,因此先暴露推理错误而非纠缠录音质量。但这也意味着结论不能推广到远场、重混响、重叠说话与真实口音分布,实际部署仍需补测。

评测方式也有边界。是否协议限制了表达,描述协议依赖大模型裁判,而人机裁判一致性在部分模型上偏低。论文未测量延迟、成本与误判率,不能承诺这些量得到改善。此外资源状态显示论文引用的商用模型介绍链接当前不可用,解读不把该链接当作正文开源依据,也不据此评价闭源模型能力。

要复现应先做什么,需要哪些关键信息?

先复现数据构造而非模型训练。按规则写模板并固定答案推导函数,再准备 3 类音频:统一音色的问题语音、多说话人语句语音、单事件声音与背景声。问题音色需经过识别零错筛选与人工试听,语句说话人同样筛选,语种任务限定语种与时长,声音需修剪与电平归一化。拼接时控制静音间隔、截断时长、淡入淡出与背景压低量,标签按模板自动生成并检查是否均衡。

再复现评测。是否协议用固定提示要求只输出是否,跑多次取平均并分别报告相关率、绝对准确率与相对准确率;描述协议用固定裁判提示判断相关与正确,双裁判并报告一致率,有条件加人工抽查。随机子集实验显示 216 条子集的标准差小于 0.035,因此可用精简子集先做 1 小时人工验证,再跑全量。

还需补的验证包括真实录音与更多口音语种、更长上下文与重叠声、以及不依赖大模型裁判的细粒度错误标注。论文提供模板可换料重测的思路,复现时应保留模板与声音来源分离,以便未来防污染重测。

何时值得尝试这个基准,一句话如何带走?

当你的模型单项音频分数已不错,但不确定它是否真在听完整音频时,值得用该基准做 1 次联合推理体检。特别是拼接式多模态模型、依赖转写的流水线、以及声称能做声音问答的系统,都应先过是否协议再看描述协议的失败分布。

带走的判断是:人类易解不等于模型易解,跨线索组合才是分水岭。若端到端不如只看转写的级联,优先查音频感知与任务 grounding;若是否尚可但描述跑题,优先查指令控制与转写偏置。模板化与全合成是为可控与可重测付出的代价,后续要在真实声学与更广任务上补验证,才能把基准分数翻译成部署信心。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eacl-2026 论文汇总