英文题目:HAVE-Bench: Hierarchical Audio-Visual Evaluation from Perception to Interaction
会议身份:
conference:cvpr:2026:conference-paper-id:Zhong_HAVE-Bench_Hierarchical_Audio-Visual_Evaluation_from_Perception_to_Interaction_CVPR_2026_paper
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#基准测试 #基准设计 #音视频 #音视频问答
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Muyan Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Erfei Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Sen Xing:机构信息未能从会议 PDF 纯文本可靠映射
- Weiyun Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wen Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuchen Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Yanting Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaowei Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Wenhai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jifeng Dai:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该基准输入为图像或街景与语音或环境声的组合,输出为单选、开放回答或多轮动作序列,难点在于长时多源音频理解、跨模态多跳推理与跨轮记忆规划。构建链分四步:先按感知、推理、交互划分认知层级并区分指令性音频与上下文音频,再对图文问答做口语化清洗与语音合成以形成语音指令任务,接着对视频关键帧与音频做对齐过滤并人工构造细粒度匹配与推理问题,最后为导航、解谜与音乐复现实例化多轮任务图与转移判据。与已有音视频评测相比,机制差异在于把被动感知扩展到目标驱动的主动交互,并用统一评测工具支持混合输入与多轮裁决。在包含2451个样本的评测中,Gemini2.5-Flash在交互层平均成功率仅为30.4%,显著低于其感知与推理表现,揭示了记忆与规划瓶颈。结论适用于短至中长语音与结构化视觉场景,对开放域长对话与实时流式交互的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要保留什么?
这篇解读的输入是论文正文证据与 3 张官方原图像素,目标是让刚进入语音、音乐和音频领域的研究生能复述方法并核对实验条件。必须保留的信息包括任务分层方式、音频两种角色、样本量与来源、构造流程、评测协议、参与模型、主要数字和作者指出的局限,输出是 1 篇按学习依赖展开的中文技术解读。
先把任务说清楚。论文研究的是带音频的多模态大语言模型怎么做音频视觉理解,输入同时有音频、图像和文字,输出是选择或开放回答,在交互层还要输出多轮行动。作者认为已有基准多是被动感知,音频只是背景,缺少从低层感知到高层推理再到行动的结构化爬坡,也缺少长而复杂、多声源的真实声音。
为此论文提出分层基准,直接目标是系统比较模型在感知、推理和交互 3 层的表现,并区分语音是指令还是上下文。教学例子只帮助理解,不携带效果数字。例子一是听到洗衣机声并看厨房人物,判断能发声的电器是否正被操作。例子二是听到烤箱关门加按键加运行的连续声,判断按了哪个键。例子三是听到目的地语音后连续看地图和街景并做转向选择。
已有路线走到哪里,为什么还缺交互层?
先看模型路线。论文把相关模型分成音频文本和音频视觉文本两类,早期工作把语音和声音接入大语言模型,但缺少视觉 grounding,中期把音频当作转写等辅助输入,后期用共享嵌入或查询结构更紧地融合 3 模态,最近出现能同时处理图像、音频和文字的统一模型。论文点名的开放模型包括 Ola、VITA-1.5、MiniCPM-o、Qwen2.5-Omni 等,闭源以 Gemini 系列为代表。
这些进展说明模型侧已经能吃 3 模态输入,但评测侧没有跟上。再看基准路线,视觉问答基准从感知走向推理,音频语言基准覆盖分类、识别和指令跟随,音频视觉基准把声音放进视频,但多局限于自然环境声或音乐场景。更新的基准开始分化出长上下文、鲁棒性、幻觉和协同推理等方向。
论文判断这些工作仍有 3 个瓶颈。第一是缺少交互层评测,音频很少作为指导视觉推理或行动的指令,多轮、依赖记忆的交互基本没测。第二是缺少分层结构,任务散落在单个维度上,看不出从感知到推理的能力爬坡。第三是声音太短太干净,缺少混合声源、长语音和重叠事件。
对照时要守住同条件原则。同样吃音频加图像的问答基准可以对照感知和推理的题目形式,但如果它只有单轮,就不能直接比较多轮记忆。如果监督只是类别标签,就不能等同于需要定位声源并描述属性的问答。如果运行阶段只是离线打分,就不能等同于按任务图逐步判定的交互成功率。
要测的到底是哪个问题,难在哪里?
论文把问题定义成沿着认知层级和音频角色两个正交轴展开的评测。认知层级是感知、推理、交互,音频角色是指令音频和上下文音频。感知多是单轮单跳,配短而单一的声音。推理仍是单轮,但要做时间、因果或知识型多跳,声音更长、多源或有先后结构。
交互是多轮、有目标的行动,要求每步的视听理解不超出下层的基本功,但要加上跨轮记忆和规划。难点的第一层在声音,真实场景的声音有先后、有混合、有长语音,模型要先在混合中听准,再把声音事件和图像区域对上。
第二层难点在指令形式,当问题本身是说出来的,模型不能依赖文字题干的清晰结构,要先理解口语,再做原来的视觉推理。第 3 层难点在记忆和规划,导航要记住目的地和已走路径,解谜要先学规则再答题,音乐复现要对比目标和当前渲染并调参数。
论文因此提出 3 个可检验的预期。复杂长音频会拉开开放模型和闭源模型的差距,语音指令问答会弱于同样内容的文本指令问答,多轮交互会暴露记忆和规划短板,而不只是单步视听能力不行。后文实验正是围绕这 3 个预期组织证据。
三层加两种音频角色的全景是什么样?
全景可以这样走。一个样本先看音频是什么角色,如果是说出来的问题,就走指令分支,如果是环境声、操作声、讲座或音乐,就走上下文分支。再看认知层级,如果是短而单跳,就落在感知,如果要多跳整合,就落在推理,如果要走多轮任务图,就落在交互。
表示上每步的观测都包含图像和音频,目标是给出答案或行动,输出用选择准确率、开放回答裁判打分或任务图路径成功率衡量。下面这张总览图把 5 个例子按 3 层摆开,读图时注意例子如何同时展示输入写法和答案形式,是理解全景的关键。
看图路径: 1. 先看底部三条色带如何把五个例子分成感知、推理、交互三层;2. 再对比左列语音提问与中列环境声音在输入写法上的差异;3. 最后沿右侧导航三轮观察地图街景与语音指令如何随轮次推进
论文图 1。原论文 Figure 1:“Hierarchical Levels and Examples of HAVE-Bench.”。
从可见像素看,左上音频 grounding 问答给的是洗衣机声加厨房图,问题问图中能发声的电器是否正被操作,答案是否定的。左下指令识别给的是语音提问加雪山航拍图,直接问是不是某座山。中间上是烤箱关门加按键加运行的组合声,问题问按了面板上哪个键,答案指向开始键。
中间下是数学讲座录音加手绘方块图,问题问两块演示了什么过程,答案是线性变换。右侧导航用 3 轮展示记忆要求,第一轮给地图和目的地语音,第二轮问前面还有几个路口才转弯,第 3 轮问是否到达。这张图不支持精确计数,只能确认任务形态从单轮问答走向多轮行动。
每层的题目长什么样,输入输出如何规定?
感知层分两类指令任务和两类上下文任务。指令感知包括指令识别和富文本问答,前者要求按语音指令识别图中对象或属性,后者要求读出图表、文档或路牌中的文字并理解,输入可记为图像加指令音频到答案。上下文感知包括跨模态匹配和音频 grounding 问答,前者是一段声音配多张图选最对应的一张,后者是用声音线索在场景中定位声源并描述属性。
感知 × 推理: 感知负责在短而单一的音频下完成对齐和识别,例如听出洗衣机声并判断图中人物动作,推理则要求在更长、多源或有先后顺序的音频下做多跳、时序或因果整合,例如组合烤箱关门与按键声再判断按键,二者搭配的理由是先保证听准对准,再检验能否联合声画想清楚,组合意义是把难度从单跳识别推向需要过程和知识的问答。
推理层同样分指令和上下文。指令推理包括数学推理和多学科推理,题目更长、更需要计数、比较、几何或跨学科因果组合,输入形式与指令感知相同,但推理链更长。上下文推理包括组合音频推理和话语推理,前者处理多源或有先后顺序的声音并做场景级声源识别和时序因果推理,后者把长讲座或对话与幻灯片、图表结合起来答题。
指令音频 × 上下文音频: 指令音频是把问题本身说出来,用语音代替文字指挥看图,上下文音频是不发指令的背景或补充信息,例如环境声、操作声、讲座录音和音乐,模型必须把它与图像融合才能答题,二者搭配的理由是区分语音作为查询和语音作为证据两种角色,组合意义是可以分别诊断跟随语音指令的能力和融合声音场景的能力。
论文强调一个设计规则是双模态依赖,即题目必须同时需要声音和图像,单模态可解或只看选项就能猜的样本要丢掉。 grounding 问答还要求图中至少有两个看起来都可能发声的物体,避免只看图就能蒙对。下面这张分布图展示最终样本在两轴上的落点,读图时把内圈层级和外圈子任务对应起来看。
看图路径: 1. 先看内圈三块如何把总量切分为感知、推理和交互;2. 再看外圈每个子任务括号里的音频角色与数量标注;3. 最后比较指令类任务与上下文类任务在各层的分布位置
论文图 2。原论文 Figure 2:“Our proposed HAVE-Bench is organized along two orthogonal axes: (i) a cognitive hierarchy with three levels: percep- tion, reasoning, and interaction, and (ii) the role of audio,…”。
从可见像素看,内圈标出感知、推理、交互三块,外圈感知包括指令识别、富文本问答、跨模态匹配、音频 grounding 问答,推理包括数学、多学科、组合音频、话语,交互包括解谜、音乐复现、导航。括号里同时标出指令、上下文或两者兼有的角色,其中音乐复现同时涉及两种角色。像素能辨认的数字以正文为准,更细的划分口径以后文表格为准。
多轮交互 × 任务图: 多轮交互指模型要在连续多个状态下听看并行动,例如导航要记住目的地并在每个路口选择,任务图把这种过程形式化为状态节点和带成功标准的边,只有按边走通到目标状态才算成功,二者搭配的理由是把记忆和规划显式变成可判定的一步步转移,组合意义是让交互不再是笼统聊天,而是能检查是否记住目标并按规则行动。
交互层有导航、解谜和音乐复现 3 种。导航的状态是地图加街景视点,语音给寻路指令,模型每步输出转弯或直行。解谜的状态是菜单、学习和作答等界面配置,语音给规则和提示,模型必须先进入学习再作答。音乐复现的状态是一个参数元组,包括旋律、节奏、乐器、速度和响度。
语音图像模式 × 文本图像模式: 语音图像模式输入的是说出来的问题加图像,文本图像模式输入的是同一问题的文字版加图像,二者搭配的理由是做内容等价对照,排除题目本身难易的影响,组合意义是可以判断模型是否把文字下的推理能力真正迁移到语音下,如果文字能做对而语音做错,差距更可能在语音理解或跨模态迁移上。
形式化上每个交互任务是一张任务图,节点是离散状态,边带有一句自然语言成功标准,模型从起点出发,只有裁判判定转移成立才能走向下一状态,到达目标状态才算成功。沿一个样本走完全流程有助于复述,以指令识别为例,输入是一张图加一段说出来的问题,组件是多模态大语言模型的联合推理,目标是回答是否或是什么。
跨模态匹配 × 音频 grounding 问答: 跨模态匹配是给一段声音从多张图里选出最对应的一张,考声音和画面的粗对齐,音频 grounding 问答是给定一张图和一段声音,再用文字提问声源位置或属性,考先定位再描述的细对齐,二者搭配的理由是从选择到问答逐步加深定位要求,组合意义是可以区分模型是只能听出类别,还是能在复杂画面中找到具体发声者。
评测时选择题直接算准确率,开放题由大模型裁判比对参考答案的事实和语义等价性,交互则由同一裁判按边标准逐步判定路径是否走通。
没有训练新模型时,数据构造承担了什么计算?
本研究没有训练新的神经网络模型,训练一节的职责由数据构造流程承担。真实计算过程是数据筛选、语音合成、人工标注和人工核验,不涉及梯度更新、参数冻结或优化器设置,论文也未报告这些训练细节,缺项就明确记为未报告,不从模型名字推定实现。
指令音频的起点是已有图文问答数据集的验证或测试切分,覆盖识别、文档图表、数学和多学科推理。预处理先去掉口语时长过长、重度依赖表格代码或嵌套结构、含难读公式和占位符的题目,对填空改写成完整问句,并用大模型把别扭文字改成流畅且语义忠实的口语形式。再做质量打分降采样,按准确、连贯、清晰、相关和深度打分,均衡各子类数量。
语音生成用高保真合成和人工朗读两路,其中部分样本由多名朗读者在录音室条件朗读,其余用合成语音,人工朗读全部经过人工核验。上下文音频的起点是多个公开音频视频数据集和网上搜集的音频图像对,覆盖自然环境、人声对话、人类活动声和音乐,并分室内外和静态动态。预处理从每个视频均匀抽关键帧并配对齐音频,用大模型写描述并过滤低质量片段,再算语义对齐,丢掉对齐弱的对子。
跨模态匹配完全人工标注,按声音分类体系分组,正例配同子类的细粒度干扰图,再配同大类的图组成四选一。其他上下文任务由标注员按难度模板手写题目,同样守住双模态依赖。交互数据的起点是场景蓝图和素材,导航用地图和街景视点,音乐用乐谱做目标并用开源工具合成中间音频,解谜用程序生成或网上搜集的棋盘界面。标注员实例化具体的任务图并为每条合法转移写一句成功标准。下面这张流程图展示 3 类数据如何走不同预处理再汇入统一核验,读图时注意分叉与汇合的位置。
看图路径: 1. 先沿顶部三列看指令、上下文和交互三类数据源的起点差异;2. 再看中间预处理层如何分别做口语转换、关键帧匹配和状态选择;3. 最后看底部两类标注如何汇入人工核验这一统一出口
论文图 3。原论文 Figure 3:“Data annotation pipeline of HAVE-Bench.”。
从可见像素看,顶层三列分别是图文问答、音频视频数据集和场景特定的交互素材,中层分别做口语形式转换、关键帧音频匹配加模型过滤、具体状态选择,底层汇入合成语音加人工朗读和人工标注两个标注通道,最后统一到人工核验。箭头表示数据流向,不表示模型训练,图中未给出可精读的数值,数值证据以后文表格为准。
测了哪些模型,条件是否一致,指标方向是什么?
被测模型包括开放模型 Ola、VITA-1.5、Megrez-3B-Omni、MiniCPM-o、Ming-Lite-Omni、Qwen2.5-Omni,以及闭源的 Gemini 系列,论文说明因 3 模态闭源模型有限而聚焦 Gemini。所有模型走统一推理协议,基于公开评测工具包接入官方实现,官方示例不支持多轮音频图像对话时作者自行补接口,闭源模型走官方接口。
所有模型用同一输入提示,大模型裁判用 GPT-4o,结果取 3 次独立运行的平均以减小方差。评测分 3 种题型,选择题直接算准确率,模型输出自由文本时用语义匹配映射到最一致的选项。开放题由裁判比对参考答案,考虑事实和语义等价,每个子任务有针对性提示和人工示例以统一标准。
交互题由同一裁判按当前观测和边的成功标准逐轮判定,只有走通到目标状态的路径才算成功。指标方向都是越高越好,准确率和成功率都是分数越高越好,但原文表格多为裸数值,解读时不擅自逐格加百分号,单位以原文表头和说明为准。
公平条件方面,同一提示、3 次平均和统一裁判是主要控制,但不同模型的音频前端、上下文长度和多轮接口实现仍可能不同,论文未报告推理延迟和计算开销,这些量不能从分数推定。资源状态方面,本次未发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开,只能按论文文字理解方法,复现时先做接口和裁判对齐。
语音指令与文本指令的差距有多大,哪层差距最大?
要回答的比较问题是,在统一协议下语音图像模式是否系统性弱于文本图像模式,以及开放模型与最强闭源模型的差距是否随层级变大。指标方向是分数越高越好,公平条件是同一提示、同一裁判加 3 次平均。下面这张原表比较指令音频任务在语音与文本两种模式下的表现,行按模型分组,每组两行分别对应语音和文本,列从左到右是识别、富文本、数学、多学科和平均,数值保留原文写法。
| SI | 78.5 | 89.5 | 46.0 | 71.0 | 71.3 |
|---|---|---|---|---|---|
| TI | 80.7 | 88.8 | 49.0 | 74.1 | 73.2 |
| SI | 83.1 | 88.6 | 47.0 | 57.8 | 69.1 |
| TI | 84.3 | 90.6 | 46.0 | 62.9 | 70.9 |
| SI | 80.7 | 62.1 | 38.7 | 51.0 | 58.1 |
| TI | 82.9 | 65.1 | 42.1 | 54.2 | 61.1 |
| SI | 81.3 | 86.0 | 45.4 | 50.0 | 65.7 |
| TI | 86.7 | 88.6 | 49.0 | 61.0 | 71.3 |
| SI | 75.5 | 82.2 | 41.7 | 51.0 | 62.6 |
| TI | 81.5 | 84.8 | 42.7 | 63.1 | 68.0 |
| SI | 78.1 | 80.0 | 40.3 | 48.8 | 61.8 |
| TI | 77.1 | 81.2 | 44.0 | 57.2 | 64.9 |
| SI | 67.0 | 68.1 | 22.0 | 34.0 | 47.8 |
| TI | 70.7 | 77.3 | 37.7 | 51.5 | 59.3 |
| ASR+GPT-4.1 SI | 83.3 | 89.5 | 48.6 | 74.4 | 74.0 |
| ASR+Gemini2.5-Flash SI | 79.9 | 90.6 | 49.2 | 71.8 | 72.9 |
| ASR+Qwen-2.5-Omni SI | 84.1 | 89.5 | 46.7 | 61.1 | 70.3 |
表后解释要同时说收益与代价。可见的模式是文本模式几乎全面高于语音模式,推理列的差距更大。以 Ming-Lite-Omni 为例,语音下多学科较低而文本下明显更高。以 Ola 为例,语音下多学科较低而文本下高出十余点。以 Megrez-3B-Omni 为例,语音下数学很低而文本下高出很多。论文用转写对照做了内容等价控制,先用语音识别把语音问题转成文字再走文本流程,结果与直接文本模式接近,因此作者判断差距主要在模型未能把文本下的推理迁移到语音下,而不是合成语音本身听不清。
未胜出项也要指出,个别感知列差距很小,例如 Gemini 富文本语音与文本基本持平,说明感知层的语音跟随相对好一些,但推理层普遍掉点。另一组必须保留的主结果是层级总体差距,论文报告最强闭源是 Gemini2.5-Flash,最好开放是 Qwen2.5-Omni,感知层两者差距很小,推理层明显扩大,交互层进一步扩大,所有模型从感知到推理再到交互一致下降。下面这张整理表把这些总体判断放在同一行内交代清楚,条件、模型、阶段和指标都在同一行内说明。
| 比较维度 | 指标与阶段 | 闭源参考 | 开放参考 | 差距与边界 |
|---|---|---|---|---|
| 感知总体 | 总分越高越好 | Gemini2.5-Flash 感知小幅领先 | Qwen2.5-Omni 紧随 | 感知差距约 +0.5,开放个别子任务反超 |
| 推理总体 | 总分越高越好 | Gemini2.5-Flash 多学科 71.0 | Qwen2.5-Omni 多学科 57.8 | 推理差距约 +8.2,差距拉大 |
| 交互总体 | 成功率越高越好 | Gemini2.5-Flash 平均 30.4 | Qwen2.5-Omni 交互更低 | 差距约 +12.4,且所有模型未超 40% |
| 样本总量 | 样本数 | 总量 2451 | 感知推理交互之和 | 总量由 3 层加总得到 |
表后解释要给出机制和反例。论文报告交互层 Gemini 平均 30.4 左右,仍远未解决,说明多轮记忆和规划是主要瓶颈。作者进一步指出交互每步所需的单步视听能力并不超纲,模型在单轮感知和推理中已能处理路牌文字、街景和简单音乐属性,但在多轮中记不住目标地图和参考音乐,解谜还经常跳过学习阶段直接作答。这支持跨轮记忆而非单步能力的解释,但属于有限解释而非因果证明,因为没有单独消融记忆模块。代价是交互判定依赖大模型裁判,裁判本身的误差未被单独测量,不能把成功率等同于人工评测。
转写对照和分层对照排除了什么,又留下了什么?
第一个对照是语音转文字再答题。做法是用大语音识别模型先把语音问题转写成文字,再走文本图像流程。如果转写后分数回到文本水平,就说明题目内容在合成和朗读中保真,差距不在音频清晰度。论文报告转写后各模型的平均分接近各自的文本平均分,例如转写加 Gemini 与文本接近,转写加 Qwen 与文本接近。
这个对照支持语音保真度合理的判断,留下的问题是模型在语音下联合推理的能力不足。第二个对照是分层内部比较。感知层开放与闭源接近,Qwen 甚至在指令识别和跨模态匹配上超过 Gemini,上下文感知中匹配任务接近而 grounding 问答拉开差距。
推理层指令任务中多学科差距最大,上下文任务中话语推理差距大于组合音频。交互层导航、音乐和解谜三项全面偏低,Gemini 最好但也只有 30 左右,解谜还暴露不按菜单、学习、作答流程走的问题。这些对照共同支持难度随层级递增的判断,但总体趋势不等于每组每步都成立,个别模型在个别子任务上仍有反超。
失败条件也要如实记录。Ola 的交互结果记为缺失,原因是作者无法用官方实现跑通多轮音频图像对话,这不是零分,而是一个未评测边界,比较交互平均时不能把它当成已测模型。论文也承认导航图像因授权只发布全景编号和坐标,复现时需要自行按同样方式获取街景,这会引入实现差异。
哪些结论还不能下,缺了哪项验证?
先区分 3 种表述。论文直接报告的是各层分数和语音弱于文本的现象,有限解释是记忆和迁移不足导致交互和语音推理掉点,未验证推测是未来加强长音频数据和迁移训练就能解决,这些方向合理但本文没有训练对照,不能当成已证明的因果。
缺项要具体点名。第一,没有测量误判率、延迟和成本,分数高不能承诺更快更便宜。第二,开放回答和交互判定都用大模型裁判,裁判与人工的一致性、稳定性没有单独报告,不能把自动分当成人评。第三,交互只有 3 种场景,导航、解谜和音乐复现不能代表所有真实交互,换场景后结论是否成立待验证。
第四,音频保真只用转写对照间接说明,没有报告词错率和人听测,合成与朗读的比例影响也没有拆开。读数时还要注意单位和聚合。原文多处用裸数值表示分数,百分点和相对百分比是不同概念,不能把十余点的绝对差距说成相对提升率。不同指标的差值不能混进同一模型列下比较,成功率和准确率各有聚合对象,跨表直接相减没有意义。
原文表头或算术如有冲突,应标注冲突而不是编造口径凑一致,本文按原文文字保留差距描述,不自行重算。总体趋势不等于每组每步都成立,引用时要同时给出适用条件和反例。
要复现这套评测,先做什么,需要什么条件?
复现的第一步是对齐输入。指令任务需要把文字题改成口语形式再合成语音,注意去掉过长结构、难读公式和占位符,填空改成完整问句,必要时用大模型改写并保留语义,人工朗读部分要做人工核验。上下文任务需要从视频均匀抽关键帧并配对齐音频,先过滤低质量再算对齐,只保留双模态依赖的样本, grounding 问答要保证图中有多个可能声源。
交互任务需要先定蓝图再实例化任务图,为每条边写一句可判定的成功标准,并准备地图街景、乐谱合成音频和解谜界面 3 类素材。第二步是对齐评测。选择题算准确率并处理自由文本映射,开放题用同一裁判和同一提示比对参考答案,交互题逐轮判定转移并检查是否走通到目标。
所有分数取 3 次平均。复现时要保留关键信息条件,包括模型版本、语音识别版本、裁判版本和提示词,否则分数不可比。第三步是处理可运行性。开放模型按官方实现接入评测工具包,多轮音频图像对话不支持时需要自行补接口并记录改动。闭源模型走官方接口,注意配额和版本漂移。
导航街景因授权只给编号和坐标,需要自行获取并记录获取时间与范围。当前没有完成验证的公开资源链接,因此把本研究当成方法可复现但资源待确认的状态,先做小规模链路跑通,再扩大到全量。
何时值得尝试这套思路,还有什么误解要澄清?
当研究问题涉及语音指挥看图、长而混合的声音理解或多轮记忆规划时,这套分层思路值得尝试。它把先听准对准、先想清楚再行动的依赖关系显式化,有助于定位短板在语音前端、跨模态融合还是记忆规划。如果只做短而干净的单轮分类,就不需要整套交互评测,取感知和推理子集即可。
两个常见误解需要澄清。第一,语音模式差不等于录音不清楚,转写对照显示内容保真尚可,差距更可能在语音与推理的联合上,但这仍是支持性证据,不是已验证的模块级因果。第二,交互分低不等于每步都不会,论文的解释是单步能力尚可而跨轮记忆和规划不足,改进方向应先补记忆机制和流程跟随,再谈更强的单步感知。
收束时回到可核对的事实。总量 2451 个样本按感知、推理、交互分布,指令与上下文两角色贯穿各层,最强闭源在感知仅小幅领先,到推理和交互差距拉大且交互无人超过 40 分,语音指令推理系统性弱于文本指令推理。这些是论文直接报告的核心,迁移训练和数据增强是待验证的下一步,复现时优先对齐语音构造、双模态依赖筛选和任务图裁判三处细节。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 4 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


