英文题目:NaVLA\(^2\): A Vision-Language-Audio-Action Model for Multimodal Instruction Navigation

会议身份:conference:aaai:2026:conference-paper-id:38886

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #多模态学习 #空间音频信号 #声源定位

评分:7.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jugang Fan:机构信息未能从会议 PDF 纯文本可靠映射
  • Peihao Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Changhao Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Qing Du:机构信息未能从会议 PDF 纯文本可靠映射
  • Jian Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Mingkui Tan:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

多模态指令导航要求智能体在未见室内环境中依据包含类别、代表图像、语言描述和听觉文本描述的指令依次经过1至5个地标并在终点3米内停止,难点在于多相似物体消歧、声音语义与方位联合接地和长程分段规划。NaVLA2先用模态专用编码器分别抽取自中心RGB图像、双耳空间音频语义与空间分支特征及多模态指令特征,再经两层MLP适配器对齐到共享表示空间后交错送入大语言模型联合推理,最后由CoThinkAct模块并行生成意图思考链与以特殊标识符约束的多步离散动作。编码器输出进入适配器完成跨模态对齐,对齐后序列进入大语言模型形成场景理解,理解结果进入CoThinkAct同时展开高层推理与低层动作规划从而保持决策一致。与仅用视觉文本的视觉语言动作模型不同,该方法显式保留双耳方向线索并联合语义与空间音频,使声音发射体定位更准且推理过程可解释。在MINav基准未见环境评测下,完整NaVLA2的成功率指标SR为0.272,高于无音频消融版本的0.206。该提升仍伴随绝对成功率偏低与轨迹偏长,表明复杂多模态接地仍有较大研究空间。该结论适用边界受限于Habitat加SoundSpaces合成声场与前进25厘米转向30度离散动作设置,尚未验证真实噪声连续控制与开放词汇泛化。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/felixfjg/NaVLA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,学完能复述什么?

本文的输入是论文原文证据与 4 张官方原图像素,目标是让刚进入语音、音乐与音频方向的研究生能核对方法并复述流程。必须保留的信息包括任务定义、数据构造 2 个阶段、仿真器观测与动作设置、模型双分支音频编码与边想边做模块、3 阶段训练、评测条件与主结果数字。输出是 1 篇中文技术解读,按学习依赖从任务到方法再到实验展开。

读者学完应能说清智能体每一步看到什么、听到什么、读到什么指令、输出什么思考与动作,以及数据从物体标注到指令生成的完整链路。文中例子均明确标为例子,不代表论文报告的效果。代码当前可用,地址为论文给出的仓库链接,本文不评价代码质量,只记录原文声明的可用状态。

已有导航路线走到哪里,为何还需要新任务?

论文把已有工作分为目标到达导航、指令跟随导航与面向导航的视觉语言动作模型 3 条线。目标到达导航只给高层目标,要求智能体自行探索到达指定物体,细分为单目标与多目标。单目标包括图像目标、物体类别目标与音频目标导航,多目标要求按顺序找多个物体,开放词表版本允许用类别、图像或语言灵活描述目标。这类任务概念简单,但在相似物体多或开阔区域大时容易变成盲搜。

指令跟随导航给出描述路径与路标的细粒度语言指令,要求逐步跟随到达目标。从离散导航图的语言导航,到更长更多样的指令,再到连续环境视觉语言导航与长程多阶段导航,以及需要边导航边交互的任务,监督信号越来越丰富,但指令仍是纯文本。例如论文举例,去桌子旁边的椅子,在有多张桌椅的房间里仍有歧义。

视觉语言动作模型把视觉语言模型扩展到具身动作,出现基于拓扑图的推理、面向多任务的通用导航智能体、理解 3 维语义的通用体,以及在真实环境部署的视频导航方法。论文指出这类模型通常只处理视觉与语言,忽略空间声音,且多为端到端直接映射到动作,可解释性有限。本文的新任务正好补在这两处空位:指令侧引入多模态引用,模型侧引入空间音频与显式推理。

多模态指令导航要求智能体做什么?

多模态指令负责按顺序给出路标与目标的引用方式,明确先经过哪些路标再到达最后目标,并为每个物体指定类别、图像、语言、听觉中的一种引用模态;多模态观测负责每一步提供第一视角 RGB 图像与双耳空间音频,给出实时视觉与方向听觉证据以接地这些引用。两者必须组合使用,原因是仅有指令无法确认当前所见是否为所指物体,仅有观测则在多个相似物体间会产生歧义而迷失,只有指令给出顺序约束、观测给出实时证据,才能把依次接地与动作选择闭环起来。

多模态指令 × 多模态观测: 多模态指令负责说明要经过什么、用什么线索指认它,包括物体类别、代表图像、语言描述和听觉文字描述;多模态观测负责在当前时刻提供可验证的证据,包括第一视角 RGB 图像和双耳空间音频。两者搭配的原因是只给指令不给观测无法定位,只给观测不给指令会盲搜;组合意义是让智能体把指令中的每一处引用逐段在观测中接地,再决定前进或转向。

多模态指令导航简称 MINav,要求智能体在未见过的室内环境中从随机起点出发,依据一条多模态指令穿过若干路标到达最后提到的目标物体。指令中的多模态引用有 4 种:物体类别、代表图像、语言描述、听觉文字描述。最后一个提到的物体是终点,之前的是路标。每一步智能体收到第一视角 RGB 图像与双耳空间音频,结合对指令的理解,从 4 个离散动作中选择一个:前进、左转、右转、停止。前进是移动 25 厘米,转动是旋转 30 度。

当预测停止或达到最大步数时回合结束,若在目标物体 3 米半径内停下则算成功。图前导读如下:下面这张俯视图把起点、路径、3 个引用框与 3 段式指令画在同一场景中,适合先建立任务直觉,再进入形式化定义。

看图路径: 1. 先找到俯视图中的 Start 橙色点与 Goal 绿色点,沿白色箭头看完整行走路径;2. 再分别定位绿色语言路标框、蓝色图像路标框与橙色音频目标框的引线指向;3. 对照底部指令三句话,确认每句话与一个路标框的模态如何对应

原论文 Figure 1:In Multimodal Instruction Navigation (MINav) task, the agent receives multimodal observations and…

论文图 1。原论文 Figure 1:“In Multimodal Instruction Navigation (MINav) task, the agent receives multimodal observations and fol- lows the multimodal instructions to reach the goal location.”。

该图显示一个客厅到厨房的俯视场景,白色箭头从上方起点绕行至下方终点。绿色框是语言路标,描述一张浅棕色矩形木桌的结构与相对位置;蓝色框是图像路标,给出一张餐桌椅的实拍小图;橙色框是音频目标,写明带排水声的水槽。底部指令对应分为三句,每句包含 1 个方向短语加一个引用。

这种画法直接对应论文的问题形式化:指令按顺序给出路标,观测每步更新,动作空间离散,成功用距离阈值判定。例子:假设指令说先向右前方找木桌,再向右前方找图片中的餐桌,最后向右前方到带排水声的水槽,智能体就必须依次接地这 3 个引用,而不是只记住最后的水槽。

NaVLA2 的全称是视觉语言音频动作模型,输入包括多模态观测与多模态指令,输出包括高层思考与低层动作序列。处理顺序是每种模态先用专用编码器提取特征,再经轻量适配器对齐到共享表示空间,按设计好的提示词交错拼接后送入大语言模型。大语言模型最后一层隐状态被两路复用:一路经语言头生成思维链,另一路取出特殊标记对应的隐向量经动作头解码为多步动作。图前导读如下:下图左侧对比已有模型与新模型,右侧展开编码器、适配器、语言模型与双头的连接,适合 1 次性看清主路径与分支汇合点。

看图路径: 1. 先对比左侧已有 VLA 与中间 NaVLA2 的输入输出差异,注意音频与多模态指令的加入;2. 再看右侧编码器到适配器再到大模型的纵向连线,确认视觉与双分支音频在哪里拼接;3. 最后定位底部 LM Head 与 Action Head 两个分支,观察特殊标记隐状态的去向

原论文 Figure 3:Overview of our NaVLA2. Different from existing VLA models, we enable the agent to perceive…

论文图 3。原论文 Figure 3:“Overview of our NaVLA2. Different from existing VLA models, we enable the agent to perceive multimodal observation and understand multimodal instructions.”。

该图右侧显示视觉编码器接视觉适配器输出多个视觉标记,语义音频编码器接语义适配器输出一个语义标记,空间音频编码器接空间适配器输出一个空间标记,文本经分词器输出多个文本标记,所有标记共同送入大语言模型。大语言模型下方一侧经语言头输出思维链文字,另一侧从特殊标记隐状态经动作头输出多步动作。左侧对比表明,已有模型只看图像与文字指令并直接输出动作,新模型同时看图像与音频、读多模态指令,并输出可读意图加动作。

与纯视觉语言动作模型相比,新增作用有两点:一是听到发声物体的类别与方位,二是让决策过程可检查。1 次前向同时完成思考与多步动作预测,也减少了逐步调用大模型的次数。

双分支音频与边想边做如何分工?

空间语义音频编码器的输入是双耳音频,输出是语义嵌入与空间嵌入拼接后的音频表示。具体做法是一路把双耳下混为单声道送入语义编码器再过语义适配器,另一路把原始双耳信号送入空间编码器再过空间适配器。论文使用的语义与空间编码器分别为 CLAP 与 SpatialAST,视觉编码器为 CLIP ViT-L/14,大语言模型为 Vicuna-7B-v1.5,适配器与动作头均为两层多层感知机。这样的安排理由是已有大多模态模型只关注语义,忽略了立体声中的方向线索,而人类正是靠方向听觉定位发声物体。

语义音频编码 × 空间音频编码: 语义音频编码分工是回答响的是什么,把双耳音频下混为单声道后提取声音类别语义;空间音频编码分工是回答声音从哪里来,直接利用双耳信号中的方向与混响差异。两者搭配的原因是只知类别不知方位仍难接近发声目标,只知方位不知类别易走错物体;组合意义是拼接成最终音频表示,让语言模型同时获得是什么与在哪里。

边想边做模块简称 CoThinkAct,输入是大语言模型最后一层隐状态,输出是自然语言思维链与 N 步动作序列。思维链明确写出当前目标是哪个路标或终点及其相对方向,并以特殊标记结束;由于自回归特性,该标记自然汇总了前文推理。动作头读取该标记的隐向量并解码为与意图一致的动作序列。论文强调两路并行、共享上下文,使想与做一致且可解释。

高层思考 × 低层动作序列: 高层思考分工是用自然语言说清当前目标是哪个路标或终点、相对方向如何,并以特殊标记收束推理;低层动作序列分工是把该标记对应的隐状态解码为连续多步离散动作。搭配原因是分开生成易出现想与做不一致,直接映射动作又不可解释;组合意义是 1 次大模型前向同时产出可读意图与意图一致的多步动作。

轨迹拼接的计算目标是把分段规划的子轨迹连成最终导航路径。论文先按起点终点规划最短原始轨迹,再沿线选 1 到 5 个附近物体,最后一个为目标其余为路标,每个物体随机选一种模态引用。从起点出发以第一个路标为目标规划第一段,从第一段终点出发以第二个路标为目标规划第二段,依此类推。为防止偏离过大,若最终路径与原始路径测地长度比超过 2 则丢弃该回合。

\[as τfinal = [τstage1, τstage2, ..., τstageN]. To prevent large\]

该式中 tau_stage 加下标表示第几段子轨迹,tau_final 表示拼接后的最终路径,N 表示路标加目标的总段数。实现上是按段依次规划再首尾相接,不是直接对全程做 1 次平滑。

数据如何从物体标注变成可训练的导航样本?

数据集构造分 2 个阶段。第一阶段为每个物体生成对齐的多模态引用四元组。物体类别侧把 HM3DSem 中 1660 个众包类别映射为 312 个基础类别,以减少稀疏与冗余。代表图像侧在物体 2 米半径内所有合法站位朝向物体中心渲染候选视图,用帧覆盖率、整图与类别的 CLIP 相似度、裁剪物体图与类别的 CLIP 相似度三项乘积打分,取最高分者。

语言描述侧以内在属性与外在属性分别处理:内在属性把代表图像送入视觉语言模型生成描述,外在属性利用场景图提取物体间空间关系,再用模型汇总为流畅短句。听觉描述侧先让模型生成物体可能发出的声音文字,再用该文字查询声音库检索候选片段,用 BERT 相似度过滤低于 0.5 的样本,保留的文字描述作为听觉引用,检索到的音频片段用于仿真器渲染。第二阶段基于引用合成导航回合。

起点终点要求同楼层且距离 5 到 30 米,规划最短轨迹后选附近物体并随机选模态,再分段重规划并拼接,计算每段起点到对应路标的相对方向,最后用模型生成多模态指令。训练集共 43908 个回合来自 145 个场景,测试集 2628 个回合来自 36 个场景,并由 3 位专家每场景选 10 个高质量回合组成 360 个回合的精简测试子集。图前导读如下:下图上排展示三列标注流水线,下排展示轨迹生成与长度分布,适合核对从物体到指令的每一步操作。

看图路径: 1. 先沿上排三列看代表图像、语言描述、听觉描述各自的输入与输出框;2. 再看下排 Episode Generation 中俯视图轨迹颜色与中间指令三段的对应关系;3. 最后观察右下两张直方图的横轴词数与米数分布范围

原论文 Figure 2:Two-stage dataset construction pipeline for MINav task.

论文图 2。原论文 Figure 2:“Two-stage dataset construction pipeline for MINav task.”。

该图上排以冰箱为例,左侧显示俯视候选站位与两张候选图的打分淘汰,中间显示视觉模型抽取颜色形状结构与场景图抽取上下左右关系再汇总成句,右侧显示从提问冰箱可能发出什么声音到压缩机运转声再到检索过滤得到带嗡鸣声的冰箱。图中还给出帧覆盖率与 CLIP 相似度的具体数值例子。下排左侧显示起点终点与分段轨迹,中间显示包含图像占位符与语言描述的生成指令,右侧显示指令词数与轨迹米数的直方图分布。

代表图像 × 语言描述: 代表图像分工是给出物体的精确外观锚点,通过帧覆盖率与 CLIP 相似度三项乘积选出最具代表性的视角;语言描述分工是给出颜色材质与空间关系的文字概括,融合视觉模型抽取的内在属性与场景图抽取的外在关系。搭配原因是图像擅长消歧外观相似物,文字擅长表达相对位置;组合意义是同一物体拥有对齐的多模态引用,指令生成时可随机选用任一模态。

三阶段训练到底训练了什么、冻结了什么?

NaVLA2 采用 3 阶段训练。第一阶段做音频文本对齐,目标是把音频经适配器对齐到共享语言空间。由于已复用对齐好的视觉适配器,该阶段只训练音频适配器。数据是合并清洗已有音频描述数据集得到的 27 万余语义音频文本对,每段音频采样 3 个混响方向对,与混响房间脉冲响应卷积得到双耳音频并在描述后追加方向信息,生成 81 万余空间音频文本对,训练 2 个轮次。

第二阶段做多模态指令微调,目标是让大语言模型分别理解图像、视频与音频,采样已有数据集构建 100 万多模态问答样本,全量微调大语言模型 1 个轮次。第 3 阶段在 MINav 上微调,每个样本格式为多模态指令、历史视觉观测、当前视觉与音频观测、未来 N 步动作序列,历史观测从过去 RGB 中均匀采样 K 帧按视频表示编码,提示词明确要求推断路标相对方向并规划下一步动作。该阶段对大语言模型用秩为 16 的低秩适配微调,并联合训练词嵌入、语言头与动作头。

论文未报告优化器、学习率、批量大小与硬件预算的具体数值,这部分缺项在复现时需要自行记录,不从模型名称推定实现。

仿真器、基线与指标在什么条件下比较?

仿真器基于 Habitat 与 SoundSpaces 2.0 构建,每步渲染第一视角 RGB 与双耳空间音频。为提高效率,仅在指令包含听觉引用的回合启用音频传感器,此时把对应音频片段插入引用物体中心,并在智能体高度加 1 对麦克风模拟双耳感知,用房间脉冲响应与原始音频卷积生成带声学特性的空间音频。视觉与音频观测每步更新,更接近实时感知。评测在未见环境进行,若在目标 3 米半径内停止算成功。

指标包括成功率、 oracle 成功率、路径加权成功率、导航误差、轨迹长度与归一化动态时间规整,成功率与路径加权越高越好,导航误差与轨迹长度越低越好。基线覆盖随机智能体、全模态大模型零样本、面向语言导航的地图方法、强化学习两种变体、行为克隆、以及视频导航模型。随机智能体按训练集动作分布采样。强化学习分只给目标与给全路径指令两种,奖励结合目标成功、距离减少与时间惩罚。行为克隆用与强化学习相同网络,在第 3 阶段数据上做交叉熵监督。

地图方法与视频导航模型原本面向纯文本指令,论文用 CLIP 把图像引用转为最相似类别标签后适配到本任务。视频导航模型按与本方法相同的数据量与训练设置重新训练以保证公平。

主结果测了什么,谁在可运行条件下更优?

主结果要回答在相同 MINav 评测下,完整多模态方法是否优于零样本、强化学习、模仿学习与已有导航模型,以及多模态指令是否比只给目标更有效。比较条件是所有微调模型均在 MINav 数据上训练并在未见环境评测,零样本模型不微调直接按相似提示推理。指标方向是成功率与路径加权越高越好。下表整理论文直接报告的核心数字与随机动作分布,表中成功率与路径加权保留原文百分号写法,动作成分保留原文数值。

表前问题是:在保留可运行策略与必要基线的前提下,新方法的成功率与效率提升是多少,随机基线的动作偏置是什么。

条件指标本方法次优可运行基线含义数值关系
MINav 未见环境成功率27.2%强化学习全指令变体27.2% SR (+11.6%)
MINav 未见环境路径加权成功率19.6%强化学习全指令变体19.6% SPL (+4.4%)
训练集动作统计前进占比54.1%左转 22.8%,右转 21.5%,停止 1.6%54.1%FORWARD,22.8% TURN_LEFT,21.5% TURN_RIGHT,1.6% STOP

表后解释如下:论文报告新方法显著优于所有强基线,成功率 27.2% 相对次优提升 11.6 个百分点,路径加权 19.6% 提升 4.4 个百分点,这支持多模态接地与显式推理在该任务上的价值。

代价是轨迹长度与导航误差仍有优化空间,且绝对成功率未过 30%,说明任务仍难。未胜出项方面,已有语言导航最优方法与视频导航模型在本任务上表现不足,强化学习只给目标的变体明显弱于给全路径指令的变体,这支持中间路标提供更密集监督的判断。图前导读如下:下图按终点模态与回合内模态种类数分组报告性能,适合判断哪种线索最能消歧。

看图路径: 1. 先看左图按终点模态分组的柱状图,比较图像、语言、音频、类别四组的高低;2. 再看右图随 episode 内模态种类数从 1 到 4 变化的成功率与路径加权曲线走势;3. 注意左右两图纵轴均为百分比,右图有左右双纵轴分别对应两条曲线

原论文 Figure 4:Impact of different modalities on performance.

论文图 4。原论文 Figure 4:“Impact of different modalities on performance.”。

该图左半按终点引用模态分组,代表图像组的成功率与路径加权最高,只用物体类别组最低,语言与音频居中;右半显示当回合内不同模态种类数从 1 增至 4 时,成功率与路径加权总体上升,单模态时最低。这支持论文的判断:更多模态有助于消歧,其中图像贡献最大。但总体趋势不等于每一步都成立,原文未给出分组样本量与显著性检验,因此不能把分组差异解读为因果证明。

成功率 × 路径加权成功率: 成功率分工是回答是否在目标 3 米半径内停下,路径加权成功率分工是回答是否走了接近最短路的成功路径。搭配原因是只看成功率会奖励绕远碰运气,只看路径长度会忽略是否到达;组合意义是同时报告两者才能判断方法是真正理解指令高效到达,还是靠长距离探索偶然成功。

拿掉空间分支或思考分支会发生什么?

消融要回答音频双分支各自贡献多少,以及边想边做中动作头与思维链是否缺一不可。实验保持模型与数据不变,只开关语义分支、空间分支、动作头或思维链,用成功率、路径加权与导航误差衡量。指标方向是成功率与路径加权越高越好,导航误差越低越好。表前问题是:在相同 MINav 精简测试条件下,去掉任一音频分支或推理分支后,成功率与效率如何变化。

indicating thatexplicit reasoningsupportsbetter navigation
SettingSR ↑SPL↑ NE ↓
No Action Head0.2560.1656.582
No CoT0.2610.1926.304
CoThinkAct0.2720.1966.242

表后解释如下:该原表显示同时关闭双分支时成功率最低,仅加语义分支小幅提升,仅加空间分支带来更大增益,同时开启双分支达到最高成功率,这支持空间与语义互补、空间对导航更关键的判断。另一组消融报告去掉动作头改由语言模型直接输出文本动作会明显降低性能,尤其路径加权下降;只输出特殊标记而不生成思维链也会下降。这支持高层思考与低层序列预测协同提升可解释性与性能的判断。

需要注意原文表格中同时开启双分支的路径加权略低于仅开空间分支,说明成功率提升伴随一定的路径代价,不是所有指标单调最优。论文未测量延迟与计算开销,因此不能承诺双分支与思维链改善了推理速度。

哪些结论有边界,哪些验证还没有做?

论文直接报告的是在仿真器与固定动作离散化下的结果,成功阈值为 3 米,前进 25 厘米、转向 30 度,起点终点距离 5 到 30 米且最终与原始路径长度比不超过 2。这些条件限定了结论适用范围:换用连续速度控制、更小停止半径或更长距离时表现可能变化,原文未评测。听觉引用依赖检索音频与房间脉冲响应合成,真实房间混响、噪声与麦克风差异未覆盖,因此仿真增益能否迁移到真实机器人属于待验证推测。

数据侧类别映射、代表图像打分、语言汇总与听觉过滤均含模型与阈值选择,例如听觉过滤阈值为 0.5,阈值变化对质量的影响未做敏感性分析。训练侧缺失优化器、学习率、批量与硬件预算,推理侧未报告帧率、延迟与显存,成本与部署可行性无法从本文核对。分组分析显示多模态更好,但未报告每组样本量与统计显著性,相关性不等于因果。总体成功率仍不高,说明多模态理解仍有较大研究空间,这正是论文希望推动的方向。

要复现应先准备什么,按什么顺序跑?

复现先做信息条件核对:确认代码仓库当前可达,区分代码开源与权重下载是否分别可用,记录本文缺失的超参数与硬件预算。数据侧按原文规模核对:训练集 43908 回合跨 145 场景,测试集 2628 回合跨 36 场景,精简测试 360 回合;音频文本对齐 27 万余语义对与 81 万余空间对,多模态问答 1,000,000 样本,导航微调 379,000 样本。下表把这些规模放在同一视图,便于逐项勾选,表中数字保留原文写法。表前问题是:复现需要哪些数据与划分,数量级与场景数分别是多少,指标单位如何对应。

阶段数据内容数量场景条件用途
MINav 构造训练回合43908 episodes145 training scenes导航微调
MINav 构造测试回合2628 episodes36 test scenes未见环境评测
MINav 筛选精简测试360 episodes每场景 10 个高质量回合人工核验子集
第一阶段语义音频文本对271K semantic-audio-text pairs合并清洗已有描述集音频适配器对齐
第一阶段空间音频文本对813K spatial–audio–text pairs卷积混响房间脉冲响应并追加方向空间语义对齐
第二阶段多模态问答1M samples采样已有图像视频音频集大模型指令微调
第 3 个阶段导航样本379K training samples交错多模态指令与观测低秩微调与双头训练

表后解释如下:按先跑仿真器验证观测渲染,再跑第一阶段音频对齐检查双耳合成是否正常,再跑第二阶段多模态理解,最后在导航数据上微调并在精简测试上用成功率、路径加权与导航误差验收。

仿真器仅在含听觉引用的回合启用音频传感器,复现时需保持该开关逻辑一致,否则音频缺失会导致条件不一致。随机基线动作分布与离散动作步长需与原文一致,否则比较失去公平性。若权重未公开,只能复现流程而不能直接复现数字,这一点要在记录中明确区分。

何时值得尝试这个方案,还需补哪项验证?

当环境中有多个同类物体、纯文本如桌子旁的椅子无法唯一指认,且能获得物体图像或特征声音时,值得尝试多模态指令加空间音频的方案。代表图像适合消歧外观,语言描述适合表达空间关系,听觉文字加空间音频适合定位发声目标,三者随机组合可覆盖不同缺失条件。NaVLA2 的适用前提是能承担 3 阶段训练与仿真渲染成本,并接受离散动作与 3 米成功半径的评测定义。若只能部署连续控制或要求更严的停止精度,需要重新验证。

还需补的验证包括真实房间音频迁移、不同过滤阈值与打分权重下的稳定性、分组差异的统计显著性,以及推理延迟与显存开销。常见误解是把声音当成额外文本提示即可,本文显示方向线索需要专门的空间分支编码;另一个误解是思维链只是解释附带品,本文的动作头正是读取汇总推理的特殊标记隐状态来保证想与做一致。抓住这两点,就抓住了本文相对已有视觉语言动作模型的核心增量。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总