英文题目:Hear you are: Teaching LLMs Spatial Reasoning with Vision and Spatial Sound

会议身份:conference:cvpr:2026:conference-paper-id:Ryu_Hear_you_are_Teaching_LLMs_Spatial_Reasoning_with_Vision_and_CVPR_2026_paper

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #多模态学习 #空间音频信号 #音视频问答

评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Hyeonggon Ryu:机构信息未能从会议 PDF 纯文本可靠映射
  • Joon Son Chung:机构信息未能从会议 PDF 纯文本可靠映射
  • David Harwath:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该任务输入为360度全景图像与10秒双耳音频及自然语言问题,输出为声源类别、方位角与俯仰角、距离及跨模态空间关系判断,难点在于发声体不可见或多个同类可见物体共享语义线索,仅靠语义匹配无法定位。方法链分三步:先以视觉编码器保留全景空间切分特征并以双耳音频编码器保留方位线索,再经各自Q-Former投影器分别映射为128个视觉与64个音频查询令牌输入大语言模型,最后由Qwen2-7B-Instruct联合问题文本生成答案,训练前另以单模态分类与定位任务对编码器热启动。与单声道声源定位和音视频大模型的关键差异是显式引入双耳方向信息而非仅靠语义相似检索,使模型能在视觉相似物体并存时做空间消歧,具有实际意义。在Hear You Are QA测试集下,本方法的Q8 DoA准确率为64.27,高于VideoLLaMA2的Q8 DoA准确率46.37。结论适用边界仅限72个训练与9个测试Matterport3D室内仿真场景,对真实录音、户外与动态声源尚未验证,外推受限。训练成本为8张A5000上训练3个周期约3天,推理开销与部署硬件细节原文未进一步披露。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么只做语义匹配不够用?

输入是本论文的任务设定与目标读者需要保留的关键信息。目标是让刚进入语音与音频领域的研究生能复述视听空间推理的方法与实验条件。必须保留的信息包括任务定义、数据构造方式、模型输入输出、训练冻结策略与评测条件。本文输出是 1 篇可核对的技术解读,不做超出原文的推广断言。

视听学习过去常用单耳音频做语义或时间对应,例如判断画面里哪只狗在叫。白话说,语义对应就是声音听起来像什么、画面里什么东西看起来会发出这种声音。原文指出这类工作大多用单耳音频,不包含声源空间位置信息。人类则用双耳听觉感知方向,双耳差异与混响提供了声音从哪里来的线索。

论文用两个生活例子说明矛盾。第一个例子是手机在包里响,语义线索铃声存在,但包本身不会响,模型必须把声音定位到包的位置。第二个例子是教室里多个学生都能说话,语义都是人声,老师必须靠空间音频判断是哪一个学生在提问。也就是说,当语义缺失或语义重复时,单靠长得像会发声的物体无法做唯一判断。

语义对应 × 空间对齐: 语义对应负责回答声音是什么、画面中哪个物体长得像会发这种声音的东西,空间对齐负责回答声音从哪个方向和距离传来、与哪个画面位置重合,二者搭配的理由是语义在遮挡物和同类多目标时会失效,组合意义是先用语义缩小候选,再用空间在候选中做唯一绑定。

下面先看论文用来讲清上述矛盾的示意图,左侧讲语义错位,右侧讲语义重复,两个场景都需要空间推理才能收敛到唯一答案。

看图路径: 1. 先从左到右看四格漫画的人物朝向与气泡文字;2. 再对比第二格背包旁 RRRR 拟声词与第一格找手机请求的对应关系;3. 最后看第四格老师背对学生、头顶想我的人群中谁在提问的视角设置

原论文 Figure 1:Audio-Visual Spatial Reasoning.

论文图 1。原论文 Figure 1:“Audio-Visual Spatial Reasoning. (Left) A phone rings out of sight inside a bag; although the sound’s semantic cue (“ring tone”) is present, spatial reasoning is required to…”。

这张四格漫画的教学价值在于把两种失败模式画成了可复述的操作。第一格有人问手机在哪里并请求拨打电话,第二格铃声标记出现在背包旁边,人物说在包里,说明视觉上沉默的包是靠声音方向找到的。第三格老师在黑板前写公式,学生说我有一个问题,第四格转为老师视角面对 4 名学生并想谁在提问,说明多个同语义目标必须靠声源方向区分。图注明确写道准确的视听理解不仅需要语义对齐,还需要空间理解。研究生复述时应强调这不是简单的声源定位,而是发声源与附近沉默物体或同类物体之间的关系推理。

同输入同目标的已有路线差在哪里?

相关工作按同输入、同目标、同监督与同运行阶段对照,才能看出本文的增量。第一条路线是视听声源定位。白话说,就是给定一段查询音频,在画面里框出对应物体。原文回顾了从交叉模态注意力加对比学习,到无负样本自监督、模态内相似性、弱监督、用语音与多正样本等改进。这些方法都用单耳音频,只能做语义对应,没有空间理解。另一支用空间音频做定位,例如用 4 通道音频加多视角合成的 3 维定位,或用视听对齐保证的检测数据集,但前者声源在画面中不可见,后者把视觉只当辅助定位信号,不处理发声与沉默物体共存的上下文推理。

第二条路线是纯空间音频推理,不含视觉。原文提到用 SoundSpaces 2.0 合成空间问答并训练空间音频编码器加大语言模型,可以做事件检测、方向距离估计与例如狗叫声左边是什么声音这类推理,另一支用 1 阶 ambisonics 做对比语言音频预训练。这些工作证明了空间音频本身的信息量,但没有把全景视觉的空间上下文接进来。

第三条路线是视听大语言模型。白话说,就是把音频与图像特征接到大语言模型做问答。原文提到处理音频图像视频接地的模型、用最优传输对齐特征的模型、聚合问题相关线索的模型,以及评测幻觉与鲁棒性的基准。这些模型大多用单耳音频,处理不了需要方向消歧的任务。最近也有引入 3 维空间推理基准的工作,但复杂视听场景中的消歧仍未被充分探索。本文的定位是同时用全景视觉与双耳音频做问答,问题覆盖空间对应、相对位置、空间加语义对应与语义共现 4 类。

任务的操作定义与九类问题是什么?

论文把视听空间推理定义为理解声音与视觉上下文之间的空间关系。操作上,每个样本是一张 360 度全景图加一段 10 秒双耳波形加一个自然语言问题,模型要输出类别、是否发声、方位角、俯仰角、距离或是否可见等答案。区别于声源定位或视听分割,任务要求推理发声源与非发声物体之间的相对位置,以及在多个同类视觉物体中定位真正的声源。

为此论文定义了 9 个基础问题模板。第一类是空间对应,问声音类别与来自哪里,答案例如电话铃声与柜子位置,测试音频与空间对齐的视觉源能否正确绑定,包含语义错位但位置重合的反事实样本,例如钢琴位置播放狗叫声,迫使模型不依赖语义先验。第二类是相对位置,问声源相对智能体与参考物体是更近更远、左右前后上下、角度与距离,例如手风琴声到狗的距离与相对方位。

第 3 类是空间加语义对应,细分为单个语义匹配物体、多个语义匹配物体、给定多个物体找发声者、给定类别找具体实例 4 种,答案要同时给类别与方向距离。第 4 类是语义共现,问声音类别与声源是否在画面中可见,要求即使看不见对应物体也能做空间音频理解。论文用 ChatGPT-4o 把每个基础问题改写为多个人性化表述,增加语言多样性。

教学例子明确标为例子:假设查询是狗叫声,画面有两只外观相近的狗分别在左侧与右侧,单耳模型只能说有狗,本文任务要求输出右侧那只在方位角 150 度、距离 1.7 米处发声。这只是帮助理解任务形式的举例,不代表原文报告了该具体数值。

从全景图加双耳音频到答案的主路径是什么?

方法全景先沿一个样本走完输入到输出。输入是单张全景图与对应双耳音频加问题文本。视觉编码器处理全景帧并输出保留空间布局的补丁标记序列,不做池化以保留位置。音频编码器处理语谱图并输出保留空间声学线索的音频标记序列。两个编码器之后各接一个投影器,把特征映射到语言模型隐维度,视觉侧生成 128 个投影标记,音频侧生成 64 个投影标记。投影后标记与问题嵌入一起送入大语言模型,按标准语言建模目标用交叉熵逐标记优化,生成答案文本。

下图是论文给出的 3 段式管线,先特征提取,再投影到共享嵌入空间,再与问题嵌入融合做多模态推理,适合对照下文的冻结与训练策略来读。

看图路径: 1. 先沿左侧数据集经图像与空间音频箭头到编码器的主路径看数据流向;2. 再看视觉投影器与音频投影器向上汇入大语言模型的两个分支;3. 最后确认问题经嵌入分支汇入的位置与火焰与雪花标记的冻结状态差异

原论文 Figure 3:The pipeline of our framework: feature extraction, projection, and multimodal reasoning.

论文图 3。原论文 Figure 3:“The pipeline of our framework: feature extraction, projection, and multimodal reasoning.”。

图中可见左侧数据集同时提供全景图与空间音频,中间视觉编码器与音频编码器并行,右侧视觉投影器、音频投影器与问题嵌入 3 路汇入顶部大语言模型。像素上可辨认视觉编码器与投影器及大语言模型旁有火焰标记,音频编码器旁有雪花标记,对应原文视觉侧可训练、音频编码器冻结的安排。研究生复述时应说清数据流是图像走视觉分支、波形经语谱图走音频分支,2 分支只在投影后才与语言模型交互,而不是在像素层融合。

编码器与投影器各自算什么?

组件按分工拆解。视觉编码器采用 SigLIP2 的 NaFLEX 设置,白话说就是支持可变分辨率与宽高比的视觉骨干,适合处理 224×812 的长条全景图。它输出补丁标记序列,保留每个补丁在全景中的位置,便于后续回答方位角与距离。实现上对补丁嵌入与注意力层用 LoRA 微调,LoRA 是一种低秩适配方法,只训练少量增量参数。

音频编码器采用来自 BAT 的预训练 Spatial-AST 双耳音频编码器,输入是双耳语谱图,输出是音频标记序列。该编码器已在同样的音频事件分类与定位任务上预训练,能保留方向线索。关键安排是整个训练过程中该编码器保持冻结,不更新参数。

双耳音频 × 单耳音频: 单耳音频分工是提供声音类别等语义线索,双耳音频分工是在此之外保留左右耳到达时间差、强度差与混响造成的方向和距离线索,搭配视觉的原因是全景图给出物体的角位置参考,组合意义是把音频的方向估计映射到图像坐标系从而区分外观相同但位置不同的目标。

视觉编码器 × 音频编码器: 视觉编码器分工是把 224×812 全景图切分为保留空间布局的补丁标记序列,音频编码器分工是把双耳语谱图编码为保留空间声学线索的音频标记序列,搭配理由是两者都需要位置可比的序列表示才能被语言模型做跨模态指代,组合意义是经各自投影器映射到同一隐空间后与问题嵌入拼接做联合推理。

投影器 × 大语言模型: 投影器分工是把视觉 64 到 128 量级的查询标记和音频标记压缩并对齐到语言模型隐维度,大语言模型分工是接收投影后标记加问题文本并按语言建模目标生成答案,搭配理由是编码器输出维度与语言空间不一致,组合意义是冻结音频编码器而训练投影器与微调语言模型,让空间线索以软提示形式参与答案生成。

投影器都采用 Q-Former 结构,白话说就是用一组可学习查询标记通过注意力从编码器特征中抽取固定数量标记。音频侧基于 BAT 的实现与预训练权重,视觉侧改编自 BLIP-2,只用前两层注意力及其权重。查询标记数固定为音频 64、视觉 128,所有投影器参数全量可训练。大语言模型骨干是 Qwen2-7B-Instruct。原文未给出投影器内部注意力头数与隐藏维度的完整清单,这部分属于缺项,复述时不应从模型名称推定。梯度路径按原文描述是投影器与大语言模型 LoRA 及视觉编码器 LoRA 可更新,音频编码器无梯度。

数据如何仿真与 warm start 如何做?

训练与构造部分承担方法职责,因为数据本身是仿真生成的。空间音频仿真器用 SoundSpaces 2.0,白话说就是基于几何声学的房间脉冲响应卷积器。给定声源位置、单耳信号、接收器位置与朝向,把单耳信号与环境房间脉冲响应卷积得到观测信号。接收器配置为用默认头相关传输函数记录双耳信号。场景网格来自 Matterport3D,包含 90 栋完整扫描建筑,平均 24.5 个房间、2.61 层、517.34 平方米楼面面积。

论文用 72 个场景训练、9 个验证、9 个测试。每个场景放一个声源,位置随机但排除被墙遮挡或在不同房间的情况。

声源音频来自 VGGSound,原始有 200,000 条 10 秒视频片段、309 类音频事件。论文人工剔除常发生在户外或视觉上难以对应单一物体的类别,例如飞机飞过与人群行进,并沿用原始测试划分,从训练划分中采样出与测试同规模的验证集。视觉物体因现有 3 维物体数据集的发声类别太少而自行生成,从 VGGSound 选 150 类、ImageNet 选 40 类,用 Stable Diffusion 3 生成 2 维图,人工过滤低质量后每类保留 40 张,再用 InstantMesh 方法提升为 3 维物体。每类发声物体保留 32 张训练、4 张验证、4 张测试。

声源可绑定语义匹配物体、语义不同的随机物体或随机空位置。每场景还随机插入最多 3 个与主要物体类别不同的随机物体,以减轻注入物体与原场景之间的可见接缝等渲染捷径,并增加视觉复杂度。

下图是数据集中室内全景示例,适合理解物体布置与仿真痕迹,后续做复现时要检查这类痕迹是否成为捷径。

看图路径: 1. 先横向扫视全景长条图的左右拼接边界与房间结构连续性;2. 再定位前景中吉他的悬浮感与周围浴室墙面和家具的比例关系;3. 最后观察右侧镜面与柜体区域的拉伸与重影等渲染痕迹

原论文 Figure 2:Image sample from Hear You Are QA dataset.

论文图 2。原论文 Figure 2:“Image sample from Hear You Are QA dataset.”。

像素上可见这是一张横向拉伸的浴室全景,左侧有窗与椅子,中间有吉他、马桶与毛巾架,右侧有镜面与柜体。吉他边缘较锐利且悬浮感明显,右侧镜面有拼接拉伸,这些正是原文担心的渲染伪影。论文的缓解动作是加随机干扰物与保留精确 3 维位置朝向等真值参数,问题答案用手工规则从场景构造参数自动填充。研究生应记住全景由 18 张水平视场 20 度的图像拼接而成,中心对齐智能体前视方向。

发声物体 × 干扰物体: 发声物体分工是提供与查询音频在位置上严格重合的真值源,干扰物体分工是提供语义相同但位置不同或语义不同但位置重合的反例,搭配理由是只放真值源模型会走语义捷径,组合意义是通过在同一场景混放两类物体强迫模型同时用类别与方位角、俯仰角和距离做判断。

编码器的 warm start 是单模态预训练。视觉侧用两类辅助问题:分类问在给定方位角、俯仰角与距离坐标处检测到什么物体,定位问给定类别预测方位角、俯仰角与距离。视觉先做分类学语义,再做分类加定位学空间 grounding。音频侧用类似任务:分类问检测到什么声音,定位问预测方位角、俯仰角与距离,两任务从一开始联合训练。全模型训练 3 个轮次,在 8 张 A5000 上有效批量 128,图像编码器与大语言模型用 LoRA 秩 16,耗时 3 天。图像按 SigLIP2 预处理,音频按 BAT 预处理,音频采样 32 千赫。

用什么条件测什么问题?

实验按问题组织。测的是 9 类问答上的分类准确率、方向到达准确率、平均角度误差与平均距离误差。方向到达准确率越高越好,角度与距离误差越低越好。比较对象包括 3 类基线。第一类是音频视听声源定位方法 ISSL 与 ACL-SSL,输入是图像加单耳音频,不处理语言,用跨模态检索与定位指标评估,只在不需要语言处理的任务上评测。

第二类是多模态大语言模型 VideoLLaMA2,为公平起见替换为与本文相同的视觉与音频编码器及同样的大语言模型骨干,但在输入上用单耳音频,而本文用双耳。第 3 类是仅问题文本的随机基线与假设理想编解码器的 Oracle,Oracle 用元数据,代表上限而非可部署策略。

单模态 warm start 性能作为参考,音频检测精度 0.575、平均角度误差 38.01 度、大于 30 度比例 0.289、平均距离误差 0.476 米,视觉检测精度 0.633、平均角度误差 26.89 度、大于 30 度比例 0.161、平均距离误差 0.332 米,说明各编码器已学到有效的单模态表示。消融设置比较 R 加 B 加 Q、R 加 M 加 Q、B 加 Q、M 加 Q、R 加 Q,其中 R 是图像、B 是双耳、M 是单耳、Q 是问题,测试双耳是否提供单耳加视觉无法提供的空间线索。还做了训练在 R 加 B 加 Q、测试在 R 加 M 加 Q 与 B 加 Q 的跨条件评估。

资源状态说明:本次收到的证据中没有来源绑定且完成 HTTPS 验证的资源,资源状态为 NONE,因此不得声称代码、模型或数据已公开。原文写道将开源数据集与训练代码,但按本次可核对原则应表述为论文声明计划开源,本次未能确认可达。

主结果在何处需要空间线索?

主结果的比较问题是:在语义足够与语义不足的定位任务上,双耳加视觉是否优于单耳加视觉与纯定位方法,公平条件是 VideoLLaMA2 与本文共享编码器与语言骨干、仅音频通道不同,指标方向是类别与方向到达准确率越高越好。下表选择原表中有叙事闭环的两行,聚焦最接近的可运行基线与本文方法在非匹配与多目标场景上的差距。

MethodQ1 (non-matching)Q7 (DoA)Q8 (class)Q8 (DoA)
VideoLLaMA2 [10] R+M+Q50.7568.5775.3346.37
Ours R+B+Q61.6773.2170.2764.27

表后解释主要收益与具体代价。论文报告显示,在 Q1 对齐与 Q7 方向到达这类单个匹配物体场景,语义足够,单耳已能定位,VideoLLaMA2 与本文接近。但在 Q1 非匹配场景视觉物体与音频语义无关,本文 61.67% 而 VideoLLaMA2 为 50.75%,在 Q8 方向到达场景有两个同类物体,本文 64.27% 而 VideoLLaMA2 为 46.37%,差距拉大。支持的判断是基线因只有单耳而缺空间信息,无法在语义错位或语义重复时做唯一绑定。代价是本文在 Q8 类别上 70.27% 低于 VideoLLaMA2 的 75.33%,说明空间分支没有在所有语义分类上都占优。

未胜出项是纯定位方法在非匹配上仅 10% 左右,表明跨模态检索不能替代问答推理。限制是这些数字来自仿真全景与合成 3 维物体的测试划分,能否推广到真实房间与真实遮挡仍待验证。

拿掉视觉或把双耳换成单耳会发生什么?

消融的比较问题是:图像与双耳各自对 9 类任务的贡献是什么,公平条件是同一问答构造与同一评测划分,仅改变输入模态,指标方向与主结果一致。下表选择原表中问题基线与两类定位基线在声音分类与对齐任务上的表现,用于说明随机猜测与单耳定位的下限。

MethodModality Q1 (class)Q1 (aligned)Q1 (non-matching)Q7 (class)
Question Only Q3.503.002.442.56
ISSL [43, 44] R+M26.9728.8312.9428.46
ACL-SSL [32] R+M40.5632.8310.6140.41

表后解释主要收益与反例。论文报告显示,Q1 声音分类上双耳与单耳相近,说明语义线索相当,但在来自哪里准确率上双耳加视觉 69.64% 高于单耳加视觉 64.10%,体现空间优势。Q3 与 Q4 在声源可见时两者接近,可见时视觉可提供空间信息,但在声源不可见时双耳优势明显,例如 Q4 方向到达准确率双耳 41.18% 而单耳 16.71%。Q5 单个匹配物体时单耳靠视觉可达 64.54% 发声准确率,Q6 有两个视觉相似匹配时单耳掉到 52.33% 近似随机猜,而双耳保持 72% 以上,说明多目标消歧必须靠双耳。

Q8 平均方向误差上单耳 50.80 度而纯双耳 32.32 度,单耳靠视觉但受语义混淆影响更大。反例是 Q2 是否问题上仅视觉加问题已达 85.28%,不输多模态,说明部分相对位置问题可被视觉捷径解决。跨条件评估显示在 R 加 B 加 Q 训练后转测 R 加 M 加 Q,Q7 与 Q8 变化小而 Q5 与 Q6 发声准确率差距明显,论文解释为后者只需是否回答而不需要精细定位,纯音频分支难以利用空间推理,而视觉信号有助于对齐音频位置与画面。原文未报告统计显著性与多次随机种子方差,复述时应标为待验证。

哪些结论不能从当前证据推出?

区分直接报告、有限解释与未验证推测。直接报告的是仿真集上的准确率与误差数字,以及双耳在不可见声源与多同类目标上的优势。有限解释是论文对跨条件评估中 Q5 与 Q6 差距的讨论,原文用可能带来隐式空间线索等措辞,属于支持性解释而非因果证明。未验证推测包括真实房间混响、头部转动、动态声源、户外噪声与真实遮挡下的表现,原文未测量误判率、延迟、推理开销与帧率,不能承诺这些量得到改善。

缺失证据不是技术错误,但必须指明。论文未给出投影器层数之外的完整超参数、优化器与学习率调度细节,仅说补充材料有更多细节;未报告训练能耗之外的部署成本;未做真人听音评价,自动指标不能当人评。总体趋势不等于每组都成立,例如 Q8 类别上本文低于单耳基线,说明双耳增益是有条件的。相关性不是因果,单模态 warm start 中视觉定位误差小于音频,不能直接推出视觉在所有联合任务中主导,还需看问题是否需要方向消歧。

复现先做什么与何时值得尝试?

何时值得尝试:当你的场景同时满足全景或宽视场视觉可用、需要区分语义相同但位置不同的目标、且能获得双耳或多通道音频时,本文的双耳加视觉问答管线值得尝试。若只有单耳且目标语义唯一,原文显示单耳加视觉已足够,不必引入双耳仿真。

复现先做什么:先按原文划分复现数据管线,用 SoundSpaces 2.0 与 Matterport3D 的 72 训练、9 验证、9 测试场景,用 VGGSound 过滤后的类别与 Stable Diffusion 3 加 InstantMesh 生成的每类 40 张物体,按 32 训练、4 验证、4 测试保留发声物体,检查随机位置排除穿墙与跨房间的逻辑。再复现单模态 warm start 的分类与定位问答,核对音频与视觉的检测精度与角度距离误差是否落在相近区间,然后冻结 Spatial-AST 音频编码器,只训练 Q-Former 投影器与视觉及语言模型的 LoRA。输入严格保持单张 224×812 全景与 10 秒 32 千赫双耳波形,问题模板先用 9 个基础模板再加改写,避免一开始就引入新的语言分布。

还需补哪项验证:补充真实房间录制的双耳加全景小规模测试,检验渲染接缝与合成物体的域差距;补充多次种子与置信区间;补充推理延迟与显存占用,因为原文只报告 8 卡 A5000 训练 3 天,未报告单卡推理成本。开源状态按本次证据应写论文声明将开源,本次未能确认链接可达,不应写成已可下载。

一句话收束与可带走的检查表

收束回答:视听空间推理的关键不是把更强的分类器接到语言模型,而是让方向与距离成为可与画面位置对齐的一等信号,论文用仿真全景加双耳问答证明了这一点,但上限与真实泛化仍有距离。

可带走的检查表包括:任务是否包含语义错位或多同类目标,否则单耳加视觉可能已够;数据是否记录了每声源的 3 维位置朝向与房间脉冲响应参数,能否用规则重放问题答案;模型是否保留了视觉补丁的空间布局与音频的双耳差异,投影后标记数是否为视觉 128 音频 64;训练是否冻结音频编码器而微调视觉与语言模型;评测是否同时看类别准确率、方向到达准确率、角度误差与距离误差,并区分声源可见与不可见。

记住百分点与相对百分比不同,不同指标的差值不能混放,数值相同也不代表同一指标。按此表复述与复现,就能把本文的方法与证据讲清楚而不夸大。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 1 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 cvpr-2026 论文汇总