英文题目:Probing Audio-Visual Reasoning in Multimodal Language Models through the Lens of Audio

会议身份:conference:acl:2026:conference-paper-id:2026.acl-long.1697

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #音视频 #音视频问答

评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Kaixiong Gong:机构信息未能从会议 PDF 纯文本可靠映射
  • Kaituo Feng:机构信息未能从会议 PDF 纯文本可靠映射
  • Bohao Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Yibing Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Mofan Cheng:机构信息未能从会议 PDF 纯文本可靠映射
  • Shijia Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiaming Han:机构信息未能从会议 PDF 纯文本可靠映射
  • Benyou Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yutong Bai:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhuoran Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiangyu Yue:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文面向多模态大语言模型需联合短音频与图像视频证据作答的视听推理任务,输入为音频加视觉配对与多选题题干、输出为选项答案,实际难点在于模型虽能识别复杂语音内容却可能在计数与响度音高时长等基础听觉属性上失准并向高层推理传导误差。方法链第一步以极简合成声构建仅含单调声与静音间隔的听觉探针DeafTest,负责隔离测试计数与属性辨别等底层听力。第二步按多模态必要性原则人工策划覆盖音色空间动态与音乐交通等域及时间推理的视听基准AV-Odyssey,其题面经视觉与音频模型过滤以剔除单模态可解问题,前一步的听力假设由此进入跨基准关联检验。第三步以零样本评测与人工标注误差归因连接底层感知与高层推理,负责判定视听错误是否源于听觉误感知并输出相关性结论。相对已有偏重高层视觉的视听问答基准,关键机制差异在于将低层听觉能力作为显式前置变量并施加单模态可解性过滤,其实际意义是把推理失败定位到感知瓶颈而非融合策略。在DeafTest基准下,Gemini 2.5 Pro的平均准确率为91.5,高于Gemini 1.5 Flash的平均准确率65.0,且两基准得分Pearson相关系数为0.945。该结论适用边界限于短音频配对的多选题零样本设置,尚未验证长视频交互与开放生成场景的失败条件。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要保留什么?

本文的输入是论文原文提供的文字证据和官方原图像素,目标是让刚进入语音、音乐和音频方向的研究生能够核对关键做法并用自己的话复述方法。必须保留的信息包括任务定义、数据构造动作、评测条件、关键数字及其单位与适用范围,以及作者明确标注的局限。本文的输出是 1 篇按学习依赖展开的中文技术解读,不做营销式判断,不引入证据之外的公开性断言。

资源状态方面,本次没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,只能讨论论文报告的方法和结果。全文先沿着一个样本走完输入到输出,再展开基准全景、构造细节、实验条件和结果反证,最后给出复现起点。教学用的举例会明确标为例子,不添加无来源的数值或效果承诺。

已有音画评测在测什么,为什么还不够?

论文把相关工作分为两支。第一支是多模态大语言模型本身,从文本大模型扩展到视觉语言模型,再扩展到接受音频输入的全模态模型,代表工作包括统一输入输出的系列模型和各类音视频语言模型。第二支是评测基准,已有视觉理解和数学推理基准较多,音画问答基准包括视听问答、动态音画场景问答、全景音画问答以及近期提出的全模态基准。

论文指出已有音画基准多关注高层视觉任务,对声音属性的覆盖和对跨模态必须性的控制不足,容易让模型绕过音频只靠视觉或文本记忆作答。受视觉领域盲测工作的启发,作者提出反向思路:先不考复杂推理,直接考模型能不能听见最基本的响度、音高、时长和个数。这一定位决定了后文两个基准的分工,一个管听觉下限,一个管音画协同上限。

DeafTest 要解决的听觉下限问题是什么?

DeafTest 要回答的问题是,多模态大语言模型在能识别复杂语音内容的同时,是否连单调、被静音间隔清楚分开的基本声音属性都分辨不清。论文称其灵感来自音叉试验传统中的施瓦巴赫测试思想,只考基本声音性质。任务形式是二选一,随机猜测基线为 50%。声音计数任务给一段包含多个单调音的片段,要求数出个数;响度比较给两段音问哪段更响。

音高比较问哪段更高;时长比较问哪段更长。图 1 展示了其中响度和音高两类任务的提问方式,3 个代表性模型在示例上全部答错,这为后文系统评测做了直观铺垫。 为理解提问方式,先看该图左右两栏如何组织同一类比较题。

看图路径: 1. 先看左右两栏的提问句式:都是比较第一段和第二段哪个更响或更高;2. 再看每栏下方三行模型的回答框是否都标了红色叉号;3. 对比上下两条波形示意:响度栏看振幅粗细差异,音高栏看密集程度差异

原论文 Figure 1:Illustration of two out of four DeafTest tasks: loudness and pitch comparison.

论文图 1。原论文 Figure 1:“Illustration of two out of four DeafTest tasks: loudness and pitch comparison.”。

该图左栏是响度比较,右栏是音高比较,每栏都给出第一段音频和第二段音频两个待比对象,并用波形粗细或密集程度示意差异,下方并列 3 个模型的错误回答。这种设计把听觉比较压缩为 1 次二选一判断,排除了复杂语义干扰,因此若模型在此失手,后续把听错归因于推理难度的解释就不成立,这正是 DeafTest 作为下限探针的价值。

两个基准如何分工并连成一条诊断链?

论文的方法全景是两条互补的诊断线。第一条是 DeafTest,测低级听觉感知,题量小、属性少、形式统一,用于快速判断模型能不能听准。第二条是 AV-Odyssey 基准,用于测高级音画推理,共包含 4555 道题、覆盖 26 个任务,要求题目必须同时使用音频和视觉才能解出。两条线的连接假设是,若低级感知是瓶颈,则 DeafTest 分数应能预测 AV-Odyssey 分数。论文用散点图和皮尔逊相关系数验证这一假设,并用人工错误标注进一步区分听错与想错。

数据构造上,AV-Odyssey 先按声音属性设计任务,再人工收集音频、图像和视频并做双人校验,最后用视觉模型和音频模型过滤掉单模态可解题。评测上全部采用多选题和零样本设置,避免主观评分带来的不可比。

低级听觉感知 × 音画推理: 低级听觉感知负责分辨响度、音高、时长和个数等信号级属性,音画推理负责把听到的声音与图像或视频中的对象、事件和语义对应起来,二者搭配的理由是后者必须以前者正确编码声音为前提,组合意义在于把高层错误归因到听错还是想错,从而指导先补听觉对齐再做复杂推理。

沿一个样本走完全流程有助于理解全景。以音色类动物识别为例,输入是一段标注为狮吼的音频和 4 张动物图,模型先要把音频表示为声源身份假设,再把图像表示为候选对象集合,然后在跨模态匹配组件中计算音频假设与每张图的相符度,目标是选出相符度最高的选项并输出选项字母。若第一步把狮吼编码成象鸣,后续推理再合理也会选错,这就是低级感知错误向上传导的完整链路。

AV-Odyssey 的七类声音属性各考什么组件能力?

AV-Odyssey 按声音属性分为 7 类,每类对应不同的组件压力。音色类要求匹配视听对,例如狮吼配狮子图,还包括歌手识别和鸟种识别等需要预训练知识的高级任务,考的是声源身份编码与视觉身份的对齐。语气类考语音情感和梗图理解,需要同时从语调和画面推断幽默原因,考的是韵律与语义的联合。旋律类考舞蹈配乐、影视配乐和乐谱匹配,要求理解音乐风格与动作节奏的对应。空间类要求从声音推断声源距离或 3 维角度,考的是双耳或强度线索与画面几何的结合。

时间类考动作起止时间估计和音画同步,考的是跨模态时序对齐。幻觉类借鉴视觉幻觉评测思路,考模型是否会编造不存在的声源。复杂类则要求综合多种属性做动作预测与追踪。7 类任务共同保证评测不只偏向某一种听觉线索。

音色 × 跨模态匹配: 音色指区分狮吼、乐器、枪声等声源质地的听觉线索,跨模态匹配指把该线索与图像中的声源对象连起来,音色提供听侧的身份假设,跨模态匹配提供视侧的候选集合,二者组合后模型才能完成例如听到狮吼就选狮子图而不是大象图的任务。

为看清任务版图,可以把 26 个任务看作外环、7 类属性看作内环的扇形结构,音色类占据最大扇区并细分为乐器、歌手、枪声、鸟类、动物、交通工具、材质、场景、危险、动作和进食声等识别子任务,其余扇区分别容纳语气、旋律、空间、时间、幻觉和复杂任务。这种组织让读者在复述时先说属性再说子任务,避免把 26 个并列任务记成无结构清单。

本研究训练了什么,没有训练什么?

本研究的主体部分没有训练新的大模型,而是做基准构造与零样本调用评测,因此不存在主模型的梯度更新、参数冻结与解冻或优化器配置需要报告。真实的计算过程是 3 段。第一段是题目构造计算,包括从公开数据集和互联网收集音频、图像和视频,人工编写题干和选项,再由 2 位专家逐题校验,文本题干尽量精简以避免泄露视觉信息。

第二段是单模态过滤计算,用多个视觉语言模型和多个音频语言模型分别试做全部题目,剔除任一侧能单独解出的题目,论文报告约 2.54% 的题目因此被过滤。第 3 段是被测模型推理计算,在零样本下用精简提示调用开闭源多模态模型作答并统计准确率。附录另有一个初步的改进试点,对问答推理模型在音画问答数据上微调一个轮次后重测,这属于概念验证而非主方法,论文明确表示未调超参数、未扩大数据、未延长训练。

多模态必要性过滤 × 单模态可解性: 单模态可解性指只看图或只听音频就能答对的题目,多模态必要性过滤指用视觉语言模型和音频语言模型分别试做并剔除这类题目,前者是需要排除的捷径,后者是保证音画协同的筛选动作,组合后剩下的题目才真正考查听觉与视觉必须联合才能解出的能力。

复述时要注意,未报告训练细节不是缺项,而是本研究设计使然。若将来要复现过滤环节,需要补记所用视觉与音频模型的具体版本、解码温度和判定阈值,因为原文只给出模型名单和过滤比例,没有给出每次调用的完整配置,这会影响过滤严格程度的可比性。

评测条件如何保证音画必须协同且可比?

评测协议按问题组织。测什么方面,DeafTest 测 4 个基本听觉属性,AV-Odyssey 测 26 个音画协同任务。与谁比方面,闭源包括不同规模的 Gemini 系列、Reka 系列和 GPT-4o 相关版本,开源包括统一输入输出系列、各类视频与音频语言模型以及问答推理模型,另设随机猜测基线。条件是否一致方面,全部采用零样本设置,不做微调和少样本提示,文本提示被最小化以排除冗余信息,多选题形式消除对人工或大模型主观评分的依赖。

指标方向都是准确率,越高越好,但 DeafTest 是二选一,随机基线为 50%,AV-Odyssey 多为四选一,随机基线为 25%,不能直接跨基准比较绝对值。聚合对象方面,DeafTest 报告每类任务准确率及其平均,AV-Odyssey 报告每属性维度平均、排序和全题平均。人类基线方面,招募 2 名无领域专长的研究生,在抽样子集上零样本作答,DeafTest 每类抽 20 题共 80 题,AV-Odyssey 每任务抽 10 题共 260 题,结果应视为非专家初步估计。

零样本评测 × 多选题客观评测: 零样本评测指不做微调和示例提示直接测试模型固有能力,多选题客观评测指用固定选项计算准确率而不用人评或大模型评,前者保证比较的是底座能力而非适配技巧,后者保证分数可复算,组合后不同开闭源模型可以在同一协议下直接对比。

下表是 AV-Odyssey 任务统计的原表选择,用于核对任务划分与题量,前导问题是各属性下的子任务题量是否均衡,公平条件是同一原矩阵的行列定义,指标方向是题量本身不代表难度。

Task NameTask Category ClassNumber
Recognition Timbre28200
Recognition Timbre20200
Recognition Timbre13200
Recognition Timbre39200
Recognition Timbre13200

该表给出部分任务的名称、所属类别与题数,原表共 26 行,此处选择前几行用于展示结构。可见音色类多个识别子任务每类多为 200 题左右,进食声等个别任务因素材限制题量略少。这种题量设计保证每个子任务都有足够的统计量,同时提醒读者在比较子任务准确率时注意分母差异,不能把小样本任务的 1 次波动当成系统性优势。

主结果显示了什么相关性,数字如何读?

主结果分 3 层。第一层是 DeafTest 显示的基本听觉短板。声音计数上表现最好的模型也只有 81%,而人类可轻松达到 100%,且声音单调并由静音间隔清楚分开。响度和音高比较上,除个别模型外多数模型不敏感,若干模型低于 60%,接近 50% 的随机基线。时长比较分化最大,个别模型达 99%,而部分模型只有 40% 左右。

第二层是 AV-Odyssey 显示的整体偏低,当前模型在复杂音画整合任务上仍有明显不足,具体分任务数字见附录宽表。第 3 层是两者的关联,DeafTest 平均分与 AV-Odyssey 准确率的皮尔逊相关高达 0.945,低分模型在高阶基准上也一致偏低。 为理解相关强度,先看总体散点的拟合关系。

看图路径: 1. 先确认横轴是 DeafTest 准确率,纵轴是 AV-Odyssey 准确率,均为百分比;2. 再看红色虚线拟合趋势与右上角 Gemini 2.5 Pro 孤立高点的位置;3. 比较左下角聚集的 Reka 系列与随机基线点的重叠程度

原论文 Figure 2:Performance on DeafTest and AV-Odyssey, showing a strong positive correlation.

论文图 2。原论文 Figure 2:“Performance on DeafTest and AV-Odyssey, showing a strong positive correlation.”。

该散点横轴为 DeafTest 百分比,纵轴为 AV-Odyssey 百分比,红色虚线为趋势线,右上角高点对应新一代模型,左下角聚集点对应多个 Reka 版本与随机基线。读图时应确认纵轴是原始准确率而非改变量,向上为好,不能把左下聚集误读为个别异常,趋势成立不等于每个子任务都同等相关,后文分属性相关会进一步拆解。

\[Pearson = 0.945\]

上式是论文报告的总体相关系数,符号为皮尔逊相关,输入是各模型的两个基准分数向量,计算目标是线性相关强度,原文明确实现为跨模型散点拟合,数值保留 3 位小数。区分原始目标与近似时,该系数描述的是相关而非因果,不能直接读成提高听觉分数必然等量提高推理分数。 比较 DeafTest 关键数字时,先提出公平问题:是否同为二选一、同为零样本、同为准确率越高越好。

下表整理了原文直接报告的代表性数字,随机基线与实际可运行模型并列,百分点差异可直接相减,相对百分比需另算。

条件指标随机基线代表模型 A代表模型 B
声音计数准确率50.0Gemini 1.5 Pro 81%人类 100%
响度比较准确率50%多数模型 under 60%强模型 100% 量级
时长比较准确率50%Reka Core 40.0%Reka Edge 44.0%
时长比较准确率50%Gemini 2.5 Pro 99.0%通用随机 50%

该表的主要收益是快速定位短板,声音计数上最好模型与人类仍差约 19 个百分点,响度上多数模型几乎无区分力,时长上模型间极差超过 50 个百分点。

具体代价是该表混合了不同来源句子的精度写法,81% 与 99.0% 的小数位数不同,复述时保留原精度不做四舍五入。未胜出项方面,多个 Reka 版本在时长上低于随机基线,说明不是所有增大规模的尝试都改善了听觉编码,这是重要的负结果。

错误从哪里来,哪些对照支持听觉瓶颈?

论文用两类反证支持听觉瓶颈解释。第一类是分任务相关拆解,把声音计数、响度、音高、时长分别与 AV-Odyssey 做散点,4 个子相关的皮尔逊系数分别为 0.63、0.89、0.94 和 0.78,音高与响度的预测力更强,计数的预测力相对最弱,说明不同低级属性对高阶推理的指示作用并不等同。第二类是人工错误标注,对代表性模型的 104 个错误做分类,发现约 60% 三属于音频理解错误,视觉理解约占 10%,文本理解约占 8%,推理本身约占 10% 三,另有约 6% 为拒答。这一分布与 DeafTest 的弱听觉表现相互印证。 为看清听错如何导致选错,先看一个典型误判案例。

看图路径: 1. 先读题干:四选一动物图匹配一段狮吼音频;2. 再看模型输出如何把音频误判为大象鸣叫并因此选第四图;3. 最后读错误原因段确认视觉识别正确但听觉识别错误的分工

原论文 Figure 5:An example of audio understanding error. More examples are provided in the Appendix F.

论文图 5。原论文 Figure 5:“An example of audio understanding error. More examples are provided in the Appendix F.”。

该例题干要求从 4 张动物图中选出与音频匹配的一项,音频内容为狮吼,4 张图分别为青蛙、狗、狮子和象群,模型却把音频判为大象鸣叫并选择第四图。错误原因段明确写出视觉识别正确但听觉识别错误,且狮吼与象鸣声学特征相近导致混淆。这说明即使视觉分支正常,听觉分支的 1 次误判就足以决定最终错误。 下表把总体相关、人类抽样基线和轻量微调试点放在一起,比较问题是相关性能否转化为可操作的改进,公平条件是同为 AV-Odyssey 准确率,指标方向越高越好。

条件指标基线本方法比较对象
人类抽样 DeafTest准确率Gemini-2.5-Pro 91.5%人类 100%抽样 80 题

该表显示总体相关很强但仍是相关性证据,微调试点带来约 1.6 个百分点的提升,支持增加音画问答监督可能部分缓解听觉瓶颈,但论文强调这只是概念验证,未调超参数也未扩大数据,不能当作可部署收益。

未胜出项是人类在 AV-Odyssey 抽样上也只有约 40% 7.7,说明该基准对非专家人类同样困难,不能把人类满分只在 DeafTest 成立的事实推广到高阶任务。

音频理解错误 × 推理错误: 音频理解错误指把狮吼听成象鸣这类对声音本身的误判,推理错误指听对了但选错对应关系或时序,前者分工在信号到语义的映射,后者分工在语义之间的组合,区分二者的理由是论文 104 例人工标注显示音频理解错误占 63%,说明瓶颈主要在听而不在想。

哪些边界尚未评测,相关性还能说什么?

论文明确列出 3 类未覆盖方向。第一是长视频理解,例如 5 分钟以上的视频,第二是实时交互场景,第三是理解与生成联合任务。这些方向仍是未来工作,本文结论不应外推到这些场景。第二类局限是影响音画推理的因素可能不止基础听觉,论文用相关性和错误占比支持听觉是主要瓶颈,但未穷举架构、对齐策略和数据配比等其他因素,因此相关性不是因果证明。

第 3 类是人类基线与部分子任务样本较小,例如空间类中 3 维角度和距离估计每类仅 20 题左右,小样本下的波动较大,解读单点高低时需谨慎。附录还报告答案位置分布接近均匀,四选项占比在 24.5% 至 25% 点六之间,说明位置偏置控制较好,但这不等于消除了所有数据偏置。缺失证据不是技术错误,未测量延迟、成本和误判率时,不承诺这些量得到改善。

要复现先做什么,需要哪些信息条件?

复现可分 3 步。第一步复现 DeafTest 探针,按原文构造单调音、静音间隔、响度差、音高差和时长差的二选一题目,以二选一准确率为指标,随机基线固定为 50%,优先核对声音计数与时长比较两类分化最大的任务。第二步复现 AV-Odyssey 抽样评测,按 26 任务清单收集音频、图像和视频,保持题干精简,再用若干视觉模型和音频模型做单模态过滤并记录被滤比例,原文报告的约 2.54% 可作为参考量级而非必须复刻的精确值。

第 3 步在零样本下调用待测模型,用固定多选题模板统计准确率,区分二选一与四选一基线,保留小数精度和千分位写法。关键超参数与信息条件方面,需记录音频采样率、响度差分贝组写法、音高差半音数、时长差毫秒数、提示模板、解码温度和选项随机化方式,原文未完全公开这些底层数值时应如实标注缺项,不从模型名称推定实现。关于可用性,本次未验证到可用的代码、权重或数据链接,因此复现应从论文描述重新实现,不假设存在可直接运行的官方仓库。

下表整理基准规模与质量控制的关键量,便于核对复现起点,比较问题是规模与过滤强度是否足够支撑协同性结论。

条件指标基线本方法比较对象
基准规模题量小规模探针 80 题4555 题26 个任务

该表的主要收益是给出可核对的锚点,题量与任务数决定统计效力,过滤比例决定协同性纯度,选项分布决定位置偏置风险。

代价是过滤所用模型名单版本若不一致,复现的过滤比例会漂移,此时应报告所用模型与阈值而非强求复刻 2.54%。未评测边界是长视频与实时交互,复现时不要自行加入这些条件并与原数比较。

何时值得尝试补听觉,收束判断是什么?

综合全文,当模型在复杂音画任务上出错且错误集中在声源误判、响度音高不敏感或时序对不准时,值得先补低级听觉对齐再调高层推理。具体动作包括增加音画问答监督、加强音色与空间属性的对比数据、以及在评测中保留 DeafTest 这类下限探针以监控是否倒退。论文报告试点微调带来小幅提升,支持数据侧投入可能有效,但尚未证明这是最优路径。

收束判断是,当前多模态模型的高层音画推理受限于低级听觉感知的证据较强,总体相关达 0.945 且人工标注中听错占多数,但这仍是有限解释而非因果定论。对于研究生,复述方法时应先讲清两个基准的分工与过滤动作,再讲清二选一与四选一基线不可混比,最后讲清相关性、错误分布与微调增益各自的支持边界,这样既能准确转述论文,也能为后续补验证留出明确缺口。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总