📄 Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds
标签:#音频生成 #多模态模型 #空间音频 #零样本 #音频理解
7.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5
✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #多模态模型 | #空间音频 #零样本 | arxiv
👥 作者与机构
- 第一作者:Masaki Yoshida(北海道大学)
- 通讯作者:未说明
- 作者列表:Masaki Yoshida(北海道大学)、Ren Togo(北海道大学)、Takahiro Ogawa(北海道大学)、Miki Haseyama(北海道大学)
💡 毒舌点评
论文定义了一个新颖且实用的任务——为预训练的3DGS世界自动生成空间一致的音景,并用一套巧妙的“无训练”流水线解决了跨视角实例关联这一核心难题,Gaussian Set Matching的设计具有洞察力。然而,整篇工作在本质上仍是对多个成熟基础模型(VLM、SAM、T2A)的工程组合,缺乏对生成声音本身与视觉场景之间细粒度语义对齐的深度建模,且提出的评价指标在真值依赖和语义绑定上存在明显空白,难以支撑“高质量音景生成”这一更高级别声明。
📌 核心摘要
- 论文要解决的问题是:为给定的、可自由导航的3D高斯泼溅(3DGS)世界,自动生成一个空间上一致、可随听者位置实时空间化的音景(soundscape)。
- 方法核心是一个名为Scene2Sound的无训练框架,它通过“听觉地基”(auditory grounding)将声音发射对象锚定到持久的3D位置。该流程使用VLM进行多视角场景理解,通过新提出的“高斯集匹配”(GSM)实现跨视角的实例关联,从而在3D空间中放置声源。
- 与直接生成单视角波形、全景音频或依赖单张图片的已有方法不同,Scene2Sound首次通过多视角关联,在任意给定的3DGS世界中构建了基于对象(object-based)的、可由音频引擎重新渲染的音景表示,确保了声音在不同视角下的空间一致性。
- 主要实验结果:在自家构建的SoundscapePLY(24个生成场景)和D-SAV360(81个真实场景)数据集上,Scene2Sound在音频质量(FAD)和语义对齐(CLAP)上优于大多数空间音频基线,并且在论文提出的两个空间一致性指标(LMC和CGC)上显著优于单视角方法(如SonoWorld)。用户主观评价(MOS)也显示其在偏好、空间一致性和语义一致性上均显著优于其他空间音频基线。
| 方法 | FADD↓ | FADC↓ | CLAP↑ | IB↑ | 1-IACC | ILD |
|---|---|---|---|---|---|---|
| Scene2Sound(Ours) | 83.8 | 77.5 | 0.320 | 0.128 | 0.254 | 6.24 |
| SonoWorld (re-impl.) | 79.3 | 74.2 | 0.130 | 0.144 | 0.091 | 3.16 |
| OmniAudio | 94.7 | 90.5 | 0.205 | 0.110 | 0.458 | 6.74 |
| See2Sound | 99.7 | 95.9 | 0.066 | 0.037 | 0.615 | 7.04 |
| ViSAGe | 96.8 | 102.9 | 0.011 | 0.057 | 0.155 | 3.40 |
| Non-spatial (best) | 87.8 | 77.2 | 0.353 | 0.122 | 0.000 | 0.00 |
表中“Non-spatial (best)”行对应MMAudioT在FAD和CLAP上的最佳表现,以提供参考。
| 方法 | LMC↑ | RR | CGC↑ | Prec.↑ | Rec.↑ |
|---|---|---|---|---|---|
| per-viewpoint baselines | ≈0 | ≈1 | — | — | — |
| SonoWorld (re-impl.) | −0.214 | 0.96 | 0.065 | 0.124 | 0.063 |
| Scene2Sound(Ours) | +0.283 | 0.96 | 0.259 | 0.441 | 0.229 |
- 实际意义在于,它为将纯视觉的3DGS世界升级为多模态沉浸式体验提供了一套自动化、无需逐场景训练的解决方案,对虚拟现实、游戏和3D内容创作具有直接的应用价值。
- 主要局限是:它高度依赖其基础模型(VLM、SAM3)的性能,错误会级联放大;不处理声学传播效应(如混响、遮挡);只处理静态3DGS场景,无法为动态或交互性物体生成声音;空间一致性评价缺乏真实声音-物体绑定的事实标签。
🔗 开源详情
- 代码:论文中未提及代码链接。项目页面(https://masaki-lmd.github.io/scene2sound/)在出版时可能提供代码,但当前稿件未给出具体仓库地址。
- 模型权重:论文方法为免训练框架,不涉及训练模型权重,因此未提供模型权重。
- 数据集:论文提出并使用了 SoundscapePLY 测试集。作者声明完整数据集将在出版时发布(“the full dataset will be released upon publication”),因此 has_dataset 为“是”,但当前未提供下载链接或具体获取方式。
- Demo:项目页面包含可导航的双耳音频视频演示结果,地址为 https://masaki-lmd.github.io/scene2sound/ ,但无独立的在线交互式 Demo 链接。
- 复现材料:论文正文及附录提供了完整的复现细节,包括俯仰视角选择算法参数(N=20, K=5)、高斯集匹配阈值(\(J_{min}=0.15\))、VLM 提示词设计、音频生成与渲染配置,以及详细的消融实验与灵敏度分析结果,但未提供独立的复现包或配置文件下载。
- 论文中引用的开源项目:
- Qwen2.5-VL-32B(视觉语言模型)
- SAM3(Segment Anything Model 3,用于对象分割与接地)
- Stable Audio Open (SAO,用于文本到音频合成)
- FLUX.2 9B(用于生成概念图像)
- DreamScene360(用于从真实 \(360^{⧵circ}\) 图像重建 3DGS 场景)
- SonoWorld(作为对比基线)
- AudioLCM、FlashAudio、TangoFlux、Lumina-Next(作为音频生成相关工作)
- CLIP-IQA(用于视角质量评分)
- Marble(用于生成 3DGS 场景的订阅服务,不属开源项目) 以上开源项目在论文中均未直接给出下载地址或代码仓库链接,需通过各自官方渠道获取。
🏗️ 方法概述和架构
Scene2Sound是一个多阶段、模块化的流水线框架,用于为预训练的3DGS场景生成空间音景。其核心工作流分为五个阶段。
下图展示了Scene2Sound的整体流水线框架,包括三个主要阶段。

图中清晰显示了从视点选择、VLM场景理解、音频源放置到最终音频渲染的完整流程。
1. 自动视点选择(Automatic Viewpoint Selection): 针对没有拍摄参考的生成式3DGS场景,该模块自动选择K个高质量的、能最大化场景覆盖的观察视点。它基于“3DGS场景多为中空结构”的假设,从场景鲁棒中心点向外进行斐波那契球面射线采样,生成候选相机。然后,通过一个质量-覆盖率联合目标函数,贪心地选择出K个视点,目标函数中每个高斯原语的“被覆盖度”由其是否在视点中可见、视点的CLIP-IQA质量分数以及与相机距离的反权重共同决定。每个选定的视点会渲染出一张等距柱状投影全景图,供后续模块处理。
2. 场景理解(Scene Understanding): 将所有选中的全景图送入一个大型视觉-语言模型(VLM,如Qwen2.5-VL-32B)进行联合分析。VLM的任务是根据一个精心设计的结构化提示,识别出两类声音事件:(i)点声源,即有具体3D位置的声音(如喷泉、汽车发动机),并要求为每个点声源输出一个简单的短语作为“地基查询”供后续分割模型使用,以及一个详细的“音频提示”供声音生成模型使用;(ii)环境声床,即无空间属性、弥漫性背景声(如风声、远处交通噪音),仅需提供音频提示。VLM输出的“源ID”指明了那些在多视图中被观测到的、属于同一语义类的对象。该过程还利用JSON schema和few-shot exemplar确保输出结构化,并定义估计大小和响度以指导音频渲染。
3. 音频源生成(Audio Source Generation): 这是一个相对独立的模块,它接收场景理解模块生成的“音频提示”(文本),利用一个文本到音频的扩散模型(如Stable Audio Open)直接为每个声源ID合成一段约30秒的音频波形。点声源音频被转为单声道以进行3D空间化,而环境声保持立体声以提供沉浸式氛围。
4. 音频源放置(Audio Source Placement): 这是本方法的核心创新所在,它将2D图像平面上的对象区域提升为3D空间中的持久声源锚点。该过程分为三步:
- 视觉地基(Visual Grounding): 使用一个文本提示驱动的分割模型(如SAM3),以VLM输出的“地基查询”为指引,在每个视点的全景图上生成精确的分割掩码。每个掩码被视为对某个潜在声源的一次2D观测。
- 元数据基础的高斯识别: 利用3DGS渲染器(如gsplat)的图块基础渲染元数据:光栅化器将图像平面划分为固定尺寸的屏幕空间图块,并记录每个图块关联的高斯原语集。对于每个掩码,提取覆盖其像素的图块所关联的高斯集。通过一个深度一致性门限移除背景原语,仅保留与物体相关的部分。该门限计算掩码中渲染深度中值 \(d_{med}\),并剔除相机距离超过 \(⧵alpha_d ⧵cdot d_{med}\)(\(⧵alpha_d=1.5\))的高斯。
- 实例关联:高斯集匹配(GSM): 这是一个关键算法,用于解决跨视角实例关联问题。利用3DGS的共享持久原语集作为跨视图索引,同一物体的观测在不同视角下对应的高斯集在2D和3D空间中高度重叠。对于相同源ID的分组,计算跨相机掩码高斯集之间的Jaccard相似度 \(J(⧵mathcal{G}_{k,m},⧵mathcal{G}_{k',m'})=⧵frac{|⧵mathcal{G}_{k,m}⧵cap ⧵mathcal{G}_{k',m'}|}{|⧵mathcal{G}_{k,m}⧵cup ⧵mathcal{G}_{k',m'}|}\)。使用阈值 \(J_{min}=0.15\) 和并查集聚类,将跨视角观测合并为统一3D实例,同时保持不同实例分离。
- 位置估计(Position Estimation): 对于每个3D声源实例,其最终位置通过对其覆盖的所有高斯原语中心进行加权平均计算,权重是该高斯在渲染中出现在图块中的总次数(曝光度),并乘以分割掩码置信度。
下图详细展示了高斯集匹配(GSM)如何实现跨视角的实例关联。

图中通过一个风扇的例子,演示了从多视角分割掩码到3D高斯集合并,再到最终一致位置估计的过程。
5. 音频渲染(Audio Rendering): 最终,所有被放置在3D空间中的声音源(点声源)以及非定向的环境声床被送入一个标准的基于对象的音频引擎。该引擎根据实时的听者位置和姿态,动态计算每个点声源的音量衰减、方位和距离感,通过HRTF(头相关传输函数)进行双耳渲染,从而实现可自由导航的空间音频体验。距离衰减参考点声源的估计大小和响度。
💡 核心创新点
- 新任务定义:听觉地基下的3DGS世界音景生成。 之前的工作或生成与单视点绑定的音频,或将音频源锚定在由单张全景图重建的伪3D场景中。本文首次将任务设定为:为任意预训练的、未经任何声音标注的3DGS世界,自动发现并锚定持久的3D声源,生成可被标准音频引擎重新渲染的对象化音景。这从根本上将问题从“生成一段声音”转变为“让世界发声”。
- 高斯集匹配(GSM):实现无训练的跨视角实例关联。 在3DGS中进行实例分割通常需要为高斯原语添加新的可学习特征并进行训练。GSM巧妙地利用了3DGS渲染元数据(图块-高斯关联),通过计算Jaccard相似度来衡量跨视角观测的3D重叠关系,从而无需任何训练、无需手工特征或3D几何推理,就能以极低的计算代价实现稳健的实例匹配与合并,这是一个极具洞察力的设计。
- 空间一致性评价双轴模型:LMC与CGC。 现有的音频质量/语义指标无法评估声音是否随听者移动而正确反应(空间一致性)。本文提出的“听者运动一致性”(LMC)指标从时空距离关系检验音频对位移的响应是否符合几何预期,“跨视角地基一致性”(CGC)则通过留一视角检验来度量放置的声源是否在场景中“站得住脚”。该评价体系为空间音频生成任务提供了关键的评价工具。
- SoundscapePLY基准数据集。 论文构建并发布了由24个生成式3DGS场景组成的测试基准,涵盖不同视觉领域和音景特征,为后续研究比较提供标准化平台。
📊 实验结果
论文在自建的 SoundscapePLY(24 个生成场景)和真实世界 D‑SAV360(81 个场景)两个基准上进行了定量、定性与主观实验,并与 11 个基线方法(含非空间与空间音频方法)进行对比。
下图展示了主观评价的结果,比较了Scene2Sound与基线方法在偏好、空间一致性和语义一致性上的表现。

图中MOS评分显示,所提方法在所有维度上均显著优于基线,误差条表示标准错误。
表 I 展示了各方法在固定视点下的音频质量指标。Scene2Sound 在空间音频方法中取得了最好的语义对齐分数(CLAP=0.320),且 FADC(77.5)与最强的非空间基线(MMAudioT)可比。双耳线索(1‑IACC, ILD)表明其空间化有效,但数值因混合环境声床而低于直接输出双耳波形的方法。
表 I. 音频质量与语义对齐(SoundscapePLY)
| 方法 | FADD↓ | FADC↓ | CLAP↑ | IB↑ | 1‑IACC | ILD |
|---|---|---|---|---|---|---|
| Scene2Sound(Ours) | 83.8 | 77.5 | 0.320 | 0.128 | 0.254 | 6.24 |
| SonoWorld (re‑impl.) | 79.3 | 74.2 | 0.130 | 0.144 | 0.091 | 3.16 |
| OmniAudio | 94.7 | 90.5 | 0.205 | 0.110 | 0.458 | 6.74 |
| See2Sound | 99.7 | 95.9 | 0.066 | 0.037 | 0.615 | 7.04 |
| ViSAGe | 96.8 | 102.9 | 0.011 | 0.057 | 0.155 | 3.40 |
| Non‑spatial (best) | 87.8 | 77.2 | 0.353 | 0.122 | 0.000 | 0.00 |
表 III 给出了论文提出的两个空间一致性指标:听者‑运动一致性(LMC)和跨视角几何一致性(CGC)。Scene2Sound 在 LMC 上达到 +0.283,而 SonoWorld 为负值(‑0.214),逐视点基线期望值为 0,表明 Scene2Sound 的音频响应与听者运动方向一致。在 CGC 上,Scene2Sound 达到 0.259,大幅领先 SonoWorld(0.065),且持有精度 0.441,反映其声源放置具有更强的未观测视点支持。
表 III. 空间一致性(SoundscapePLY)
| 方法 | LMC↑ | RR | CGC↑ | Prec.↑ | Rec.↑ |
|---|---|---|---|---|---|
| per‑viewpoint baselines | ≈0 | ≈1 | — | — | — |
| SonoWorld (re‑impl.) | −0.214 | 0.96 | 0.065 | 0.124 | 0.063 |
| Scene2Sound(Ours) | +0.283 | 0.96 | 0.259 | 0.441 | 0.229 |
表 V 剥离了关键组件。场景级音频(Scene‑level)和平面混音(Flat mix)使 LMC 降为 0,证实对象级分解和 3D 空间渲染对导航一致性不可或缺。移除跨视角实例关联(w/o inst. assoc.)使实例数从 21.0 膨胀至 66.9,精度从 0.441 骤降至 0.302,而 CGC 几乎不变,说明高斯集匹配在固定事件清单下主要提升放置精度。单视点变体(Single viewpoint)检测到的源与实例均减少;随机相机(Random cameras)使 CGC 跌至 0.060。
表 V. 消融实验(SoundscapePLY)
| Variant | FAD↓ | IB↑ | ILD | LMC↑ | CGC↑ | Prec.↑ | Nsrc | Ninst |
|---|---|---|---|---|---|---|---|---|
| Scene2Sound | 83.8 | 0.128 | 6.24 | +0.283 | 0.259 | 0.441 | 3.4 | 21.0 |
| Scene‑level | 90.6† | 0.110† | 5.49† | 0 | — | — | — | — |
| Flat mix | 81.4† | 0.098† | 2.90† | 0 | — | — | — | — |
| Single viewpoint | 84.5† | 0.112† | 5.81† | — | 0.187 | 0.322 | 3.0 | 13.3 |
| Random cameras | n.e. | n.e. | n.e. | n.e. | 0.060 | 0.100 | n.e. | n.e. |
| w/o inst. assoc. | 84.3† | 0.114† | 7.31† | +0.228‡ | 0.259 | 0.302 | 3.4 | 66.9 |
| w/o Ambient fold | 82.8† | 0.122† | 6.43† | +0.217‡ | 0.256 | 0.424 | 5.2 | 21.4 |
| † FAD 在采纳的放置配置下用变体缓存的预采纳音频重计算;‡ LMC 在用变体放置的声源重新渲染后计算。n.e. = 未评估。 |
在 D‑SAV360 的 81 个真实世界场景上,Scene2Sound 取得最佳 FADD/FADC(65.3/59.3),但 FADDS(84.4)因参考集为真实录音而非合成音频而较高。受限于单拍摄位置,空间一致性 LMC 整体为 +0.068,在有接地源的场景中为 +0.120,仍保持在零假设之上。(论文未给出该数据集下的完整对照表格,仅报告上述汇总数值。)
表 VIII 在 24 个场景上扫描匹配阈值 Jmin。采纳值 0.15 在 CGC、精度和 LMC 之间取得平衡。
表 VIII. Jaccard 阈值敏感性(24 场景,持有 CGC 协议)
| Jmin | 0.01 | 0.05 | 0.10 | 0.15 | 0.20 | 0.50 |
|---|---|---|---|---|---|---|
| CGC ↑ | 0.159 | 0.224 | 0.251 | 0.259 | 0.265 | 0.286 |
| Prec. ↑ | 0.320 | 0.410 | 0.440 | 0.441 | 0.443 | 0.396 |
| LMC ↑ | +0.206 | +0.211 | +0.236 | +0.253 | +0.247 | +0.244 |
(注:表 VIII 中 LMC 的扫描值 +0.253 为预修订配置,最终完整系统 LMC 为 +0.283。)
19 名听力正常的参与者在移动视点视频上,对 Scene2Sound 以及三个空间音频基线(See2Sound、OmniAudio、ViSAGe)进行 1–5 MOS 评分。Scene2Sound 在所有维度上均显著优于基线(p<0.001,Bonferroni 校正):
- 总体偏好:3.77(最佳基线 2.68)
- 空间一致性:3.57(最佳基线 2.48)
- 语义一致性:3.75(最佳基线 2.75)
关键结论: Scene2Sound 通过听觉地基和多视角高斯集匹配,首次在可自由导航的 3DGS 世界中实现了空间一致、语义相关的音景生成。其核心优势体现在空间一致性指标(LMC、CGC)和主观评价上,且消融实验证明跨视角实例关联、多视点覆盖以及对象‑环境分离对空间行为和位置精度至关重要。
🔬 细节详述
- 训练数据: 方法本身无需训练(零样本)。使用的预训练模型:VLM是Qwen2.5-VL-32B-AWQ量化版;分割模型是SAM3;文本到音频模型是Stable Audio Open。SoundscapePLY的生成使用了FLUX.2 [klein] 9B和Marble工具。D-SAV360场景通过DreamScene360重建。
- 损失函数: 未说明(流程无训练)。
- 训练策略: 未说明。
- 关键超参数: 视角数K=5,候选射线采样数N=20。GSM的Jaccard匹配阈值 \(J_{min}=0.15\)。深度一致性门限的缩放因子 \(⧵alpha_d=1.5\)。听者运动一致性(LMC)的容差 \(⧵epsilon\) 设为评价集中位成对音频距离的 \(10^{-6}\) 倍。环境声床和点声源的能量归一化策略有明确系数和规则。
- 训练硬件: 未涉及训练。推理使用一块NVIDIA RTX A6000 (48 GB GPU),每个场景总耗时约222秒,其中VLM分析占50%。
- 推理细节: 生成30秒、44.1kHz的波形。点声源音频被转为单声道进行空间化,环境声保持立体声。音频引擎使用标准Web Audio API的PannerNode进行HRTF双耳渲染。
- 正则化或稳定训练技巧: 未说明。
⚖️ 评分理由
创新性 (1.2/2):首次定义在预训练3DGS世界中通过听觉地基生成空间一致音景的任务,提出高斯集匹配(GSM)实现无训练跨视角实例关联,创造性解决多视图对象锚定问题,但整体框架仍为成熟基础模型的工程组合,缺乏对生成声音与视觉场景的细粒度语义对齐建模。[SCORING_SOURCE_1, A_SUMMARY]
技术严谨性 (1.0/1.5):GSM利用3DGS渲染元数据进行Jaccard匹配,逻辑合理且有深度一致性门限等细节,但声音生成仅做类别级匹配而忽略实例具体状态,且将所有声源简化为点声源,假设过强,对分布式声源缺乏处理,存在技术粗糙之处。[A_LIMITS, A_METHOD]
实验充分性 (1.0/1.5):在自建和真实数据集上与多个基线对比,包含消融、灵敏度、用户研究和阶段可靠性分析,实验较为全面;但主观评价存在距离线索与GSM贡献的混杂,未剥离,空间一致性指标无法验证声音‑语义对象正确绑定,GSM对低质量3DGS的鲁棒性未充分验证。[A_LIMITS, A_RESULTS, SCORING_SOURCE_24, SCORING_SOURCE_23]
清晰度 (0.8/1):论文整体结构清晰,流水线五阶段描述详细,附录提供了提示词、算法、评价协议等补充材料,但部分指标(如LMC/CGC)的直觉和局限性解释可更充分。[A_METHOD, SCORING_SOURCE_17]
影响力 (0.8/1.5):为3DGS世界赋予空间音频对VR、游戏等沉浸式体验有直接价值,但方法依赖静态场景和现有模型,声音语义对齐粗粒度,短期内学术影响受限于任务的新颖性和泛化局限。[A_SUMMARY, A_LIMITS]
开源 (0.5/1.5):论文明确承诺未来开放核心产物,但当前尚未发布可用代码、模型权重或数据资源。
可复现性 (0.5/0.5):论文及附录完整披露了所有超参数(K=5, N=20, Jmin=0.15, αd=1.5等)、VLM提示词设计、评价指标细节、推理硬件与耗时分布,无训练步骤,复现所需信息充分。[SCORING_SOURCE_27, SCORING_SOURCE_36, A_OPEN]
工程/实践价值 (1.2/1.5):完全免训练的模块化流水线,单块A6000推理一个场景约222秒,可直接用于任意预训练3DGS世界,自动视点选择和音频引擎渲染具备实际部署价值,实用性强。[SCORING_SOURCE_36, A_SUMMARY]
🚨 局限与问题
论文明确承认的局限: * 动态性缺失: 仅适用于静态3DGS世界,无法捕捉物体运动或交互产生的声音变化(如风车加速、碰撞)。 * 无传播效应: 不模拟声音在环境中的传播、混响和遮挡效应。 * 级联错误: 作为零样本pipeline,其最终质量完全受限于其组成模块(VLM, SAM, T2A)的上限,错误会向下传递。 * 数据局限: 真实场景验证受限于单视点拍摄数据的可获取性;缺乏包含真实音景和实例级标注的多视点数据集。 * 评价盲区: LMC/CGC指标无法验证声音是否被绑定到了正确的语义对象上。 审稿人发现的潜在问题: * 声音与视觉的语义对齐过于粗粒度: 方法只要求声音类型(如“汽车引擎声”)与检测到的对象类别(如“汽车”)匹配,但不关心声音特性(如引擎转速、老旧程度)是否真的与视觉观测(如一辆停着的古董车 vs. 一辆飞驰的现代车)相符。这使得生成的声音更偏向于“原型化”而非真正反映场景实例。 * 对“对象是潜在声源”的假设过强: 方法将所有分割出的对象都视为独立的单点声源。然而,现实中的声音可能是从一个区域(如一片森林、一条河流)发出的分布式声源。将一条河简化为一个点声源,在近距离漫游时会明显缺乏真实感。 * GSM的泛化性风险: GSM的有效性高度依赖于3DGS的渲染质量和图块划分。对于重建质量差、漂浮物多、或高斯原语巨大的场景,由于高斯集会严重重叠,Jaccard匹配可能失效或错误合并远近不同的物体。论文虽通过实验证明在精细重建场景下有效,但其在粗粒度或稀疏3DGS上的鲁棒性未得到验证。 * 主观评价的混杂因素: 用户研究中,Scene2Sound是唯一提供6自由度(DoF)平移距离衰减的基线,而其他方法仅支持旋转或固定声道。因此,用户对“空间一致性”的高分可能很大程度来源于对距离线索的感知,而非本文的核心贡献——GSM带来的位置精度提升。该实验设计无法剥离这两者的效应。