英文题目:OmniEcho: Spatial Audio Understanding for Embodied Agents
标签:#音视频问答 | #多模态学习 | #空间音频信号 | #基准测试
评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Ruixun Liu:机构信息未在 arXiv HTML 中可靠披露
- Yuxuan Wang:机构信息未在 arXiv HTML 中可靠披露
- Jiacheng Xie:机构信息未在 arXiv HTML 中可靠披露
- Yuhuan You:机构信息未在 arXiv HTML 中可靠披露
- Donghua Cai:机构信息未在 arXiv HTML 中可靠披露
- Junming Lin:机构信息未在 arXiv HTML 中可靠披露
- Xiong-Hui Chen:机构信息未在 arXiv HTML 中可靠披露
- Zhifang Guo:机构信息未在 arXiv HTML 中可靠披露
- Yunfei Chu:机构信息未在 arXiv HTML 中可靠披露
- Qize Yang:机构信息未在 arXiv HTML 中可靠披露
- Xize Cheng:机构信息未在 arXiv HTML 中可靠披露
- Jin Xu:机构信息未在 arXiv HTML 中可靠披露
- Yiwu Zhong:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作处理具身智能体在真实室内场景中联合 4 通道 FOA 音频、单视角视频与语言指令完成空间问答和声源导航的问题,难点在于真实空间音频采集昂贵、仿真音频与视觉几何难对齐、预训练全模态模型缺乏空间听觉通道。方法链分四步推进:先在 197 个真实场景采集 OmniEchoBench-QA 的 2,972 个问答并在 30 个真实场景采集 OmniEchoBench-Nav 的 900 个导航样本与 12,900 条 FOA 接收记录,再用统一球谐编码渲染器合成大规模问答与导航训练数据,然后分两阶段预训练轻量 FOA 编码器以获得语义对齐和查询条件定位能力,最后将冻结的 FOA 编码器与原生语义音频塔并联接入 Qwen3-Omni-30B-A3B 并只训练投影器与语言模型。与仅用单通道音频或缺乏视觉监督的基线相比,双通路设计保留语义能力同时显式注入方向与距离线索。在 OmniEchoBench-QA 音视频设置下总体准确率为 28.5%,在 OmniEchoBench-Nav 声引导导航下成功率(Success Rate,SR)为 16.2%,已接近部分文本引导基线。结论仅适用于近场室内 FOA 条件,细粒度方位角、距离估计与自主停止仍不可靠。原文未披露推理延迟与部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,模型要输出什么?
这篇论文研究的是会听方向的具身智能体。输入是 3 类信号的组合:第一是 1 阶 Ambisonics 空间音频,白话就是用 4 个通道同时记录声音内容与到来方向的录音格式;第二是视觉观察,可以是单视角视频或历史帧加当前帧;第三是任务相关的问题或指令。输出分两类:感知任务输出简短回答,例如声源在左侧后方、距离约多少米、相机向右转多少度。
导航任务输出未来 8 个路点,智能体据此转成前进与转向动作并自主决定何时停止。必须保留的关键信息是所有基准音频都是真实录制的 4 通道,训练音频是按几何一致方式渲染的 4 通道,二者都与相机朝向对齐。读者复述时要抓住一条主线:声音给出视野外的线索,视觉给出遮挡与布局约束,模型把二者放在同一时间轴上做推理与行动。
与视觉语言导航和音频视觉导航有何不同?
传统视觉语言导航的输入是图像加路线文本,决策依赖地标描述与历史轨迹,不把声源方向与距离当作原生证据。音频视觉导航虽也听声找目标,但常用仿真双耳音频,且多为最短路规划或带语言中介的规划,没有在真实录制空间音频上同时评测感知与导航。空间音频理解方向已有 3 条路线:做定位距离估计的编码器、做音频文本对齐的对比学习、把空间表征接到音频语言模型做描述与推理。
最接近的是 Spatial-Omni,但原文指出它训练时不用视觉帧,也不做声音引导导航。本文的差异在于统一基准与统一模型:同一套真实场景既考问答又考导航,同一模型既要回答方向运动定位旋转与认知地图问题,又要在没有路线文本时靠声音走过去。这种对照说明本文不是简单给全模态模型加一个麦克风,而是在补方向几何这一路证据。
基准考什么,为什么强调视野外的声音?
OmniEchoBench 分为问答与导航两部分。问答部分强调声源在当前视野外或动态进出视野,使纯视觉不足以答题。采集做法是先写剧本规定声学事件、演员运动与相对相机的时空关系,再由真人 1 次同步录下第一人称主视角视频、全景视频与 4 通道 1 阶 Ambisonics 音频。全景只用于标注,测试时模型只能看到单视角视频或单帧加 4 通道音频。标注以 2 赫兹标出每个活动声源相对录音设备的实时位置,再用规则采样生成题目。
题目分两大子集:一是 2372 道视频时序推理,含方向 1069 道、3 维定位 521 道、声源运动 473 道、相机旋转 309 道;二是 600 道鸟瞰图认知地图题,给以自我为中心且上方为前方的俯视图加同位置录音,从 4 个候选位置选声源。导航部分在 30 个真实室内场景各放 30 个样本共 900 个,每个样本在已知 3 维位置放一个单声源,并在约 1 米网格的 12 至 17 个接收点密集录制 4 通道,形成空间声场。测试时智能体按当前位置取最近接收点录音,并按当前朝向做方向重映射,再结合历史帧当前视图与简短任务语行动。
下图展示了问答基准的题型与规模,读时注意坐标系限定语是解题关键。
看图路径: 1. 先读左侧圆环中方向运动定位旋转与认知地图的切分;2. 再读右侧四个题型的提问时刻与坐标系限定语;3. 最后核对左下 2972 对问答与 197 场景的规模标注
论文图 2。原论文 Figure 2::“Overview of OmniEchoBench-QA, which comprises 2,972 QA pairs across 197 scenes and 600 bird’s-eye view images, assessing a model’s understanding of spatial audio.”。
该图左侧用圆环给出 8 个子任务的切分,右侧给出 4 个代表性问法:相机本体坐标系下的近似方向、3 维定位的方向加米数、世界坐标系下的整体运动朝向、相机转多少度才能居中声源,最下方是俯视图四选一。教学例子是:若在 7.5 秒听到嗡鸣振动声,模型需先判断它在当前朝向的右后方,再结合视频判断是否可见;若问从 31.5 秒到 50 秒玩具车的整体走向,则需在固定于初始朝向的世界系下回答,而不是随相机转动改变答案。这种设计把方向估计、距离估计、运动与视角变化拆开,便于定位模型短板。
任务形式化:每步模型看到什么输出什么?
感知形式化为给定 4 通道音频、视频或单图与问题,预测答案;导航形式化沿用 InternNav,每步给定语言指令、过去均匀采样的历史帧加当前帧与当前时间窗 4 通道,预测未来 8 步轨迹。这种统一使同一大模型既做问答又做导航。关键信息条件是导航指令只标识声音事件而不泄露目的地与路线,接收点按最近位置选取并做方向重映射,前向与相机朝向始终对齐。例子是找音乐声源时,模型需先报出前左约 4.6 米,再规划穿门左转接近,而不是直接被告知房间名。这种形式化解释了为何仿真基线难以直接对比:它们多为双耳输入且无语义加空间联合理解的要求。
OmniEcho 全景:双通路如何接入大模型?
为理解方法全景,可先沿一个样本走完流程。导航或问答开始时,模型拿到历史帧、当前帧、4 通道音频与文本。音频被分成两路:一路把全向通道混成单声道送入原有冻结音频塔,保留原模型的语义听感;另一路把完整 4 通道送入新加的轻量 FOA 编码器,抽出空间词元,再经可训练投影器映射到语言嵌入空间,按时间顺序插到对应语义音频词元之后。视觉塔与文本编码器保持冻结,只有语言模型参数与投影器更新。
感知时大模型直接输出答案,导航时输出 8 个相对路点再转成离散动作。这种安排的理由是已有全模态模型语义强但无方向感,另起空间通路可避免破坏原有能力。下图左侧对比传统全模态与空间全模态的输入输出,右侧给出基准六任务的划分,阅读时把左到右看成从信号到行动的闭环。
看图路径: 1. 先看左侧传统全模态与 OmniEcho 两条输入箭头,确认空间音频是新增输入;2. 再看右侧基准扇形中方向 1069 与定位 521 等数字的占比关系;3. 最后对照中间机器人从问号到走向声源的动作变化理解任务闭环
论文图 1。原论文 Figure 1::“Overview of OmniEcho and OmniEchoBench.”。
图中左上传统模型只有指令、图像与单通道音频,遇到遮挡或视野外目标只能猜;左下 OmniEcho 多一路空间音频,机器人能形成声源与自身位置的示意图并走向目标。右侧扇形把感知 4 类与导航两类声音放在同一基准下,数字标出各题量。复述时要强调几何一致是贯穿全文的约束:声源轨迹、听者位姿与相机画面在渲染与评测中始终对齐,否则方向监督会错位。
空间音频如何从波形变成可推理的词元?
FOA 编码器是新增的核心组件。白话说,它是把 4 通道波形变成一串能被语言模型读懂的向量。实现上每段音频先转成 5 通道输入图:全向通道的对数梅尔谱加 3 个主动强度分量与扩散度,均按 ACN 与 SN3D 约定。卷积前端在时间上降采样 8 倍,约每秒 12.5 个词元,再经 5 层 Transformer 得到 384 维序列。语义头用可学习查询做注意力池化得到 512 维片段嵌入,与冻结 CLIP 文本嵌入对齐。
定位头用查询条件交叉注意力回归方位角俯仰角与距离。编码器约 11,900,000 参数,在第 3 阶段冻结。投影器是两层多层感知机,先做层归一化再做 384 到 2048 的映射,输出经时间重采样与语义音频词元对齐,写入预留占位符并用可学习的起始与结束标记包围,不扩词表。
1 阶 Ambisonics × 语义音频通路: 1 阶 Ambisonics 负责携带声源相对听者的方向与距离等几何信息,语义音频通路负责识别声音是什么,二者搭配的原因是单通道语义模型能听懂内容却丢了方位,而纯空间特征又不稳,组合后模型同时知道是什么和在哪里,新增作用是让问答与导航能联合使用内容与方位。
FOA 编码器 × 投影器: FOA 编码器分工是从 5 通道声学特征中抽出随时间变化的空间表征,投影器分工是把 384 维空间表征映射到语言模型词嵌入空间,搭配理由是冻结的大模型只接受语言空间的输入,组合意义是空间信息以占位符形式按时间顺序插入语义音频词元之后参与推理而不破坏原有语义能力。
相机本体坐标系 × 世界坐标系: 相机本体坐标系分工是描述当前朝向下的左右前后,世界坐标系分工是固定在相机初始朝向以描述运动朝向与长期轨迹,搭配原因是相机转动时同一世界方向会换成本体方向,组合意义是方向题与运动题分别在各自坐标系下求真值,避免把相机转动误判成声源移动。
渲染层面统一用球谐编码把单声道声干按距离衰减与方向函数合成 4 通道,听者与相机同位,方位角定义为正前方 0 度、左为正 90 度、右为负 90 度。下列公式是该渲染的核心,符号含义是声干、距离、增益与方向函数,计算目标是把多个声源在当前听者坐标系下叠成 4 通道信号,可选距离衰减与房间反射。
\[\mathbf{a}(t)=\sum_{i}\frac{g_{i}}{r_{i}(t)}\mathbf{Y}\!\big(\theta_{i}(t),\phi_{i}(t)\big)s_{i}(t),\]该式之后的方法细节是:感知训练用视频几何校正后的轨迹直接算方向距离与可见性生成问答,导航训练把目标声源放在轨迹终点并按当前位姿变换到听者坐标系再编码,保证看到的画面与听到的方向一致。
看图路径: 1. 沿视频图像文本与 FOA 四波形三路输入向下追踪到大模型;2. 比较原生音频塔与 FOA 塔在词元序列中的前后拼接位置;3. 确认右侧冻结与可训练图标分别落在编码器与投影器上
论文图 5。原论文 Figure 5::“Overview of our unified spatial omni model built on Qwen3-Omni-Thinker.”。
此图把上述双通路画得很具体:上方 FOA 波形中 W 通道被引出混成单声道走原生音频塔,完整 4 通道走 FOA 塔;下方两类词元按粉蓝相间拼接后进入大模型,右侧放大 FOA 编码器到投影器再到占位符的链路,雪花表示冻结、火焰表示可训练。读图时注意空间词元不是替代语义词元,而是紧跟其后的补充证据,这解释了消融中去掉任一路都会掉点的现象。
三阶段训练与仿真数据如何构造?
训练分 3 个阶段。第 1 阶段做语义对齐:用 100,000 段含 1 至 4 声源的合成静态场景,把音频片段嵌入与冻结 CLIP 文本嵌入用平衡 Sigmoid 目标对齐,平衡是因为正样本仅占约千分之三。第二阶段做查询条件定位:从第 1 阶段热启动,给定描述某一声源的文本查询,用交叉注意力回归其方位角俯仰角与对数距离,角度用正余弦编码并归一化以避开正负 180 度跳变,损失是角度均方误差加距离对数域绝对误差再加一半权重的语义正则。第 3 阶段接入 Qwen3-Omni 大模型,只训投影器与语言模型,冻结 FOA 编码器、音频塔与视觉塔,在 32 卡上约 4 天完成。
语义对齐预训练 × 查询条件定位: 语义对齐预训练分工是让 FOA 编码器在 644 类标签的开放词表上先学会声音语义,查询条件定位分工是给定文本查询让模型回归对应声源的方位角俯仰角与距离,搭配原因是直接学定位易丢失语义,组合意义是先立语义再学几何并保留语义正则,使小编码器同时具备可检索与可定位能力。
语义对齐的逐样本损失是对正负标签分别平均后再平均,目的是在类别极不平衡时不被负样本淹没。
\[\mathcal{L}_{\mathrm{sem}}^{(i)}=\frac{1}{2}\left(\frac{1}{|\mathcal{P}_{i}|}\sum_{j\in\mathcal{P}_{i}}\mathrm{BCE}(s_{ij},1)+\frac{1}{|\mathcal{N}_{i}|}\sum_{j\in\mathcal{N}_{i}}\mathrm{BCE}(s_{ij},0)\right),\]第二阶段总损失是角度项加 0.5 倍距离项加 0.5 倍语义项,权重是原文给定配置。
\[\mathcal{L}_{\mathrm{stage2}}=\mathcal{L}_{\mathrm{ang}}+\lambda_{d}\,\mathcal{L}_{\mathrm{dist}}+\lambda_{s}\,\mathcal{L}_{\mathrm{sem}},\qquad\lambda_{d}=\lambda_{s}=0.5.\]数据构造分两条线。感知线用大模型当导演生成结构化场景,含前景与环境声源的语义标签、响度、起止时间与轨迹,再生成全景视频提示与单声源特写提示,用视频生成模型渲染后抽取单声源音频为声干;因导演轨迹与像素仅近似一致,再用分割跟踪与单目深度校正几何,补画外声源与相机偏航,最后渲染 4 通道并从轨迹直接生成方向运动定位旋转 4 类问答,共 1484 视频产出 26585 题,另有 2000 运动场景产出 18518 纯音频题与 10 万静态片段供预训练。
导航线把 R2R、RxR、VLN-PE 与 ScaleVLN 转成声音引导监督:用视觉语言模型看终点附近 5 帧提出不泄露位置房间与家具名的声音事件,约一半为语音呼唤、一半为环境事件,再用语音合成与视频生成模型合成音频,放在轨迹终点按逆距离衰减编码,有房间几何的加镜像源早期反射与跨房间衰减,无几何的只用直达声,并可加 1 至 3 个方向噪声。最终训练混合共 363193 例,细节见下表后的实验条件节。
训练数据规模与分布对齐做了什么?
除上述 3 个阶段,论文还用分布对齐减轻仿真偏差。声源类型上两边语义混合的 Jensen-Shannon 散度为 0.14 比特,残差是基准更重报警电子音而训练集覆盖更多机械工具水声;距离上两边中位同为 2.8 米,KS 统计量 0.20;任务类型上训练集另加非空间检测计数识别题以提升整体感知。这种对齐支持仿真能赋予基础空间听感的判断,但可能待验证的是对齐后仍需真实微调才能明显涨点。教学上可把分布图理解为先让仿真与真实在类型与距离上大致重叠,再靠小量真实数据修残差,而不是指望 1 次渲染解决全部泛化。
在什么条件下评测,指标方向如何读?
问答评测用 2 阶段协议:先去掉思考标记,再用文本大模型把自由回答抽成是否、方向集合、度数、米数与选项字母等结构字段,只做归一化不判对错;再用固定规则判分,多选要求字母全同,八方向要求方向集合全同且反方向缺席,角度要求误差在正负 45 度内且转向正确,3 维定位要求距离误差在正负 2 米内且方位正确,总体准确率是微平均。导航在 Habitat 闭环评测,与文本基线用相同起终点。
每步按实时位姿取最近接收点并把水平方向分量重映射到自中心坐标系,截断 10 秒送模型,1 次返回 8 个相对路点再转成前进 0.25 米与转向 15 度的离散动作,上限 50 次决策或 500 步,停滞检测会强制终止。停止条件统一用智能体自停:输出空轨迹或最大路点位移小于 0.3 米且偏航可忽略即停。指标中成功率与路径加权成功率越高越好,导航误差越低越好,Oracle 成功率指轨迹曾进入成功半径的比例,轨迹长度为总路长。OmniEchoBench-Nav 成功半径 1 米,VLN-CE 的 R2R 为 3 米。
硬件与超参按原文交代,第 3 阶段全局批量 128、序列长 32768、余弦退火。
基准规模总览:多少场景多少题?
为快速核对规模,可把问答与导航的体量放在一张表里。比较问题是:该基准是否同时覆盖感知细粒度与导航闭环?公平条件是同为真实录制 4 通道,指标是场景数、题量与接收点密度。
| 基准部分 | 场景数量 | 问答或样本数量 | 音频格式 | 任务覆盖 |
|---|---|---|---|---|
| 问答基准 | 197 场景 | 2972 对问答 | 1 阶 Ambisonics 4 通道 | 方向定位运动旋转认知地图六任务 |
| 导航基准 | 30 真实环境 | 900 样本每景 30 个 | 4 通道 48 千赫兹 | 单声源密集声场导航 |
表后解释是:问答侧 197 场景配 2972 题保证每类有数百题可做细拆,导航侧 30 场景配 900 样本与每样本 12 至 17 接收点保证声场密集;代价是真实采集成本高,难以像仿真那样无限扩展,因此需仿真训练补量。未胜出或未覆盖的是大户外与强噪声场景较少,结论外推时需谨慎。
主结果:声音能替代路线文字到什么程度?
问答主结果显示 OmniEcho 在纯音频与音视结合下总体与多数子任务领先已评模型,音视结合总体 28.5 分,去掉视觉后方向定位运动三项基本不变而相机旋转明显下降,说明前者可主要靠空间音频,后者更依赖视角变化的视觉证据。导航主结果需分两个基准看。在真实采集的导航基准上,声音引导比文本路线更难,但 OmniEcho 仍接近部分文本基线;传统仿真模型转双耳后表现明显更差,且难以自主停止。下列数字表聚焦真实导航的可运行策略与真值方向的对照,真值方向是事后分析用的 Oracle,不可当作可部署收益。
表前比较问题是:在相同起点终点与自停条件下,仅靠声音能否走近目标并停住?公平条件是同一回合集与同一动作离散化,指标方向是成功率与路径加权成功率越高越好,轨迹越短且误差越低越好。
| 导航条件 | 成功率 | 路径加权成功率 | 轨迹长度 | 导航误差与 Oracle 成功率 |
|---|---|---|---|---|
| FOA 音频可部署策略 | 16.2% | 11.5% | 7.02 米 | 误差 4.09 米,曾到达 52.89% |
| 真值方向 Oracle 分析 | 23.7% | 22.1% | 3.47 米 | 误差 4.14 米,曾到达 34.33% |
表后解释是:真值方向把成功率从 16.2% 提到 23.7%、路径加权从 11.5% 提到 22.1%、轨迹从 7.02 米缩到 3.47 米,支持方向估计改善路径效率的判断;但最终误差从 4.09 米变为 4.14 米、曾到达率从 52.89% 降到 34.33%,说明光有完美方位仍不能保证进入 1 米圈,停止时机仍是瓶颈。未胜出项是 Oracle 在曾到达率上反而更低,提示更短轨迹可能减少探索覆盖。另 1 基准 VLN-CE 上 OmniEcho 以音频指令取得 22.2% 成功率与 16.3% 路径加权,略超早期文本基线但落后更强的文本系统,尤其路径效率差距明显。
声音引导导航 × 文本引导导航: 声音引导导航分工是只给声音事件提示而不给路线文本,靠听声辨位逐步接近目标,文本引导导航分工是给路线级语言指令按地标执行,搭配比较的原因是二者共享同一批起点终点与仿真器以检验声音能否替代文字,组合意义是揭示声音在成功率上可接近早期文本基线但在路径效率与停止判断上代价更大。
失败分解进一步显示:约 36.67% 回合曾到达但未成功停住,47.11% 从未到达,只有 16.22% 成功停住;单步接近率为 60.2%,整程净接近率为 64.7%,平均净接近 2.07 米,距离预测平均绝对误差 2.20 米、中位 1.61 米、偏置高估 0.70 米、相关仅 0.27。这些数字支持粗方向基本可用、细距离与停止不可靠的结论。
哪部分设计真正带来定位能力?
消融围绕两个问题:要不要 FOA 编码器与语义预训练。输入表示与第 1 阶段预训练的曲线显示特征输入远优于原始波形,且语义预训练进一步改善收敛与终点精度。读图时注意纵轴是误差向下越好,不能把下降直接读成准确率上升,且只能读原文标注的终点数值。
看图路径: 1. 先确认三张子图纵轴分别是方位角俯仰角与距离误差且向下越好;2. 再比较蓝色 feat5+stage1 与橙色两条基线随轮次的下降速度;3. 最后读出第 10 轮三组曲线的终点数值差异
论文图 6。原论文 Figure 6::“Ablation on input representation and Stage-1 pretraining.”。
3 张子图分别给出方位角、俯仰角与距离误差随轮次的变化,蓝色特征加第 1 阶段全程最低,黄色无预训练居中,棕色原始波形最高,终点差距在距离上最明显。表前比较问题是:在相同定位头与训练轮次下,特征设计与语义初始化是否都必要?公平条件是同一合成语料与同一回归目标,指标方向是 3 类误差越低越好。
| 编码器配置 | 方位角误差 | 俯仰角误差 | 距离误差 | 训练条件 |
|---|---|---|---|---|
| 5 通道特征加语义预训练 | 17.9 度 | 7.70 度 | 1.13 | 第一二阶段完整 |
| 原始 4 通道波形加语义预训练 | 30.5 度 | 13.8 度 | 1.65 | 同轮次对照 |
表后解释是:5 通道特征把方位角误差从 30.5 度降到 17.9 度、俯仰角从 13.8 度降到 7.70 度,支持预抽强度与扩散度提供更强定位线索的判断;去掉第 1 阶段则性能下降,支持语义初始化助优化的判断,但代价是需额外 10 万片段预训练。另一组消融显示双编码器加冻结 FOA 最优总体 28.5 分,去掉原生语义路降到 26.2 分,解冻 FOA 反而全子任务下降,说明冻结能保护前 2 阶段学到的空间表征。负结果是相机旋转在加入 FOA 后提升有限,再次指向该任务更依赖视觉。
还有哪些做不到,仿真到真实的缺口多大?
论文明确承认 3 类局限。第一是细粒度几何:3 维定位中模型能抓粗方向但会把前右判成正右并低估距离,相机旋转能判对方向但把 47 度高估成 135 度,说明粗理解与精估计之间仍有缺口。第二是导航停止:大量回合曾到达却不停,单帧观察缺时间上下文,无法从响度不再增大或距离不再减小判断到达,未来需加轻量音频位姿记忆。第三是仿真偏差:虽已对齐声源类型、距离中位 2.8 米与运动分布,但基准更重报警电子音而训练集更广,距离分布 KS 统计量 0.20 仍有差异。
用 1000 真实样本微调可把总体从 28.5 提到 34.9,方向加 8.4、定位加 7.5、运动加 10.9,但旋转与认知地图提升小,支持小量真实数据能补仿真短板但非全任务均匀生效。相关性不等于因果,未测量延迟与误判率时不能承诺实时性改善。
复现先做什么,需要哪些数据与代码条件?
复现应先按学习依赖准备数据再训模型。数据侧需拿到 197 场景问答与 30 场景导航的真实 4 通道及位姿标注,或按原文渲染管线自建仿真:声源轨迹与听者位姿已知,按球谐编码合成 4 通道并保持与画面对齐,问答真值从轨迹直接计算而不用语言模型编答案。模型侧需 Qwen3-Omni 大模型权重、冻结 CLIP 文本编码器与新 FOA 编码器结构,按 3 阶段顺序训练,不可跳过语义对齐直接做定位,否则易干扰。评测侧问答用抽取加规则判分,导航用 Habitat 同起终点、自停与 1 米成功半径。
资源状态是正文开源声明的唯一依据:本次未发现来源绑定且完成验证的资源,不得声称代码模型或数据已公开,实际复现前必须先确认可达性。训练混合共 363193 例,导航子集采样概率约 0.3 并做动作重平衡,细节见下表。
表前说明是:该表只交代训练构成与真实微调收益,不用于替代主结果比较;数字单位是样本数与分数,聚合对象是全文混合与留出测试。
| 数据来源 | 使用数量 | 备注与条件 |
|---|---|---|
| 空间音视问答仿真 | 26585 | 与导航监督联合训练,总计 363193 例 |
| RxR 导航 | 92418 例 | 同上采样,R2R 用 31577 例,VLN-PE 用 28969 例 |
| 真实微调 | 28.5 到 34.9 分 | 1000 真实样本训练其余测试的平均分提升 |
表后解释是:大规模仿真提供可扩展监督是主要收益,代价是分布仍偏且需真实数据校正;未评测边界包括未见房间的长走廊混响与多人同时呼唤的干扰,部署前需补验证。
何时值得尝试声音引导,下一步补哪项验证?
当目标在视野外、被遮挡或文本无法描述位置时,值得尝试声音引导;当需要精确停靠或最短路效率时,仍需配视觉避障与记忆型停止器。复述方法时记住双通路加 3 阶段是全文骨架:语义通路保内容,空间通路补方向,投影器做翻译,冻结策略保能力。还需补的验证是:在真实机器人上测不同混响与噪声下的停止成功率,报告延迟与算力开销,并公开可运行的评测服务以便他人核对。本文的价值在于用真实录音证明空间音频可作为具身推理的有效信号,同时把细定位、测距与自主停止标为开放挑战。
📎 论文与评分元数据
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses


