📄 FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting
标签:#音频生成 #扩散模型 #多模态模型 #数据集 #音频理解
6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1/1.5
✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #扩散模型 | #多模态模型 #数据集 | arxiv
👥 作者与机构
- 第一作者:Chen Yang
- 通讯作者:Jinbao Wang
- 作者列表:Chen Yang, Ganye Wen, Bin Huang, Jiayi Lyu, Zehai Niu, Linlin Shen, Jinbao Wang (Shenzhen University)
💡 毒舌点评
本文敏锐地指出了现有3D音效生成研究中普遍忽视物体内部物理状态这一关键盲点,并为此构建了首个细粒度、物理对齐的FillImpact数据集,为解决此问题提供了坚实的数据基础,任务定义和数据集贡献突出。然而,其提出的FillGauss框架本质上是将成熟的3DGS编码器、文本编码器和预训练音频扩散模型(TangoFlux)进行了模块化组合与微调,在生成模型或物理编码机制层面缺乏底层原创性。此外,核心数据集和代码均未开源,严重削弱了其作为领域基准的学术影响力和可复现性。
📌 核心摘要
本文定义并致力于解决“细粒度填充感知撞击音生成”新任务,即生成能反映物体内部填充状态(如水、米)对撞击音物理特性影响的3D感知音效。为此,作者构建了包含88个真实物体、5000余条录音的多模态数据集FillImpact,并通过声学分析证明了其数据与物理定律的一致性。在此基础上,提出了生成框架FillGauss,该框架通过融合3D高斯泼溅(3DGS)几何特征、精确的3D击打坐标以及细粒度的文本物理条件,指导一个基于TangoFlux的潜在扩散模型生成撞击音。实验表明,FillGauss在客观指标(FAD)和主观评估上优于基线,能够生成具有位置、击打物和填充状态感知能力的撞击音。论文声称其在虚拟现实、游戏等场景具有应用潜力,但主要局限在于核心数据集与代码未公开,且技术框架是现有成熟模块的组合。
下图直观展示了FillGauss框架的三大核心能力,以及FillImpact数据集中的部分物体样本。

图中左侧为FillImpact数据集中的真实物体,右侧展示了FillGauss在位置感知、击打物感知和填充感知三个维度上的声谱图生成效果,清晰呈现了框架的任务目标。
🔗 开源详情
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及模型权重的公开链接
- 数据集:论文中未提及数据集的公开下载链接或开源协议
- Demo:论文中未提及在线演示链接
- 复现材料:论文中描述了详细的训练配置(如 PyTorch、AdamW 优化器、学习率 \(1\times 10^{-4}\)、80个epoch、在 NVIDIA RTX 4090 上训练)、数据处理流程(如音频重采样至 48kHz、3DGS 全局边界框归一化)以及基线模型的微调细节。但所有这些信息均未附带具体的代码仓库、检查点或可访问的附录链接。
- 论文中引用的开源项目:
- SonicGauss: 3D感知的冲击音生成基线模型。
- TangoFlux: 文本到音频的基线扩散模型。
- 3D Gaussian Splatting (3DGS): 核心的3D表示方法。
- SplatFormer: 用于提取3DGS特征的编码器架构。
- Stable Audio Open: 提供预训练 Audio VAE 的项目。
- Hunyuan 3D 2.1: 用于生成纹理贴图的工具。
- Revo Scan: 3D扫描仪软件/硬件。
- DiffSound: 论文提到的结合隐式表示和扩散模型的框架。
- RealImpact: 论文对比的基准数据集。
- ObjectFolder / ObjectFolder 2.0: 论文对比的多模态数据集。
- The Greatest Hits Dataset: 论文对比的音视频数据集。
- Sound-20K: 论文提到的合成数据集。
- VGGish: 用于计算 FAD 指标的预训练模型。
🏗️ 方法概述和架构
FillGauss是一个端到端的多模态条件生成框架,其目标是:给定一个物体的3D高斯泼溅(3DGS)表示、一个精确的3D击打坐标、以及描述击打物和内部填充状态的文本提示,输出一段物理上合理的撞击音波形。整个框架可以分解为以下核心组件:
- 多模态编码器组:
- 3DGS编码器 (Gaussian Encoder):采用SplatFormer架构,将物体的3DGS参数(位置、尺度、颜色、旋转、不透明度)序列编码为一组点云级的几何特征 \(\mathbf{F}_{G} \in \mathbb{R}^{N \times D}\),其中 \(N\) 是高斯点数量,\(D\) 是嵌入维度。该编码器负责捕获物体的外部表面几何先验。
- 位置编码器 (Position Encoder):对3D击打坐标 \(\mathbf{p} \in \mathbb{R}^{3}\) 应用NeRF风格的高频位置编码 \(\gamma(\mathbf{p})\),公式为 \(\gamma(\mathbf{p})=[\sin(2^{0}\pi\mathbf{p}),\cos(2^{0}\pi\mathbf{p}),\dots,\sin(2^{L-1}\pi\mathbf{p}),\cos(2^{L-1}\pi\mathbf{p})]\)。编码后的向量通过一个MLP映射为单个空间特征向量 \(\mathbf{F}_{p} \in \mathbb{R}^{1 \times D}\)。该组件编码了影响局部共振的关键空间信息。
- 状态编码器 (State Encoder):论文评估了两种策略来编码内部物理状态:(1) 硬编码 (HardCode):将离散的击打物、填充物、填充水平类别通过可学习的嵌入层映射为三个特征向量,再拼接。(2) 细粒度文本提示 (Fine-grained Text Prompting):将物理状态转化为自然语言描述(如“用钢制击打物击打。内部完全装满水”),输入一个冻结的预训练文本编码器(如T5)得到文本特征序列 \(\mathbf{F}_{text} \in \mathbb{R}^{L_{text} \times D}\)。消融实验证明后者效果更优。
FillGauss的完整框架如下图所示,包含多模态编码器组和跨模态注意力融合模块。

图中展示了3DGS编码器、位置编码器和文本编码器分别提取特征后,通过自注意力和交叉注意力机制融合,最终送入去噪网络生成音频的完整数据流。
跨模态注意力融合模块 (Cross-modal Attention Fusion):这是建模物理交互的核心。
- 上下文自注意力 (Context Self-Attention):首先将位置特征 \(\mathbf{F}_{p}\) 和文本特征 \(\mathbf{F}_{text}\) 拼接形成上下文标记 \(\mathbf{C}\),然后通过一个多头自注意力(MHSA)层进行融合:\(\mathbf{C}^{\prime}=\text{MHSA}(\mathbf{Q}=\mathbf{C},\mathbf{K}=\mathbf{C},\mathbf{V}=\mathbf{C})+\mathbf{C}\)。其物理动机是隐式建模击打位置与内部填充状态之间的耦合关系(例如,击打水面线上方与下方的能量注入差异)。
- 几何交叉注意力 (Geometry Cross-Attention):以3DGS几何特征 \(\mathbf{F}_{G}\) 作为查询(Q),以统一后的物理上下文 \(\mathbf{C}^{\prime}\) 作为键(K)和值(V),进行交叉注意力计算:\(\mathbf{A}_{cross}=\text{MHCA}(\mathbf{Q}=\mathbf{F}_{G},\mathbf{K}=\mathbf{C}^{\prime},\mathbf{V}=\mathbf{C}^{\prime})\)。这使得全局几何结构能够根据其与击打点的相关性,动态聚合局部的冲击属性。
- 特征拼接:最后,将原始的 \(\mathbf{F}_{G}\) 与交叉注意力的输出 \(\mathbf{A}_{cross}\) 拼接,形成最终的综合多模态条件特征 \(\mathbf{F}_{fused}=\text{Concat}(\mathbf{F}_{G},\mathbf{A}_{cross})\)。
潜在音频扩散网络 (Latent Audio Diffusion Network):该网络基于预训练的TangoFlux(一个文本到音频的Diffusion Transformer)进行初始化和微调。音频信号首先由一个冻结的预训练音频VAE压缩到潜在空间,得到 \(\mathbf{z}_{0}\)。扩散过程在潜在空间进行,去噪网络 \(\mathcal{D}_{\theta}\) 接收带噪潜在 \(\mathbf{z}_{t}\)、时间步 \(t\) 以及通过交叉注意力注入的 \(\mathbf{F}_{fused}\) 条件,预测目标速度或噪声残差。训练采用Huber损失 \(\mathcal{L}_{huber}\)(阈值 \(\delta=1.0\))替代均方误差(MSE),以增强对早期扩散阶段大噪声的鲁棒性。
组件间的数据流清晰:文本和空间信息先融合形成“物理上下文”,再与全局几何特征交互,最终融合后的特征作为条件送入扩散网络。整个设计将问题分解为几何编码、物理状态编码、跨模态融合和条件生成四个阶段。
💡 核心创新点
- 任务定义创新:首次明确定义了“细粒度填充感知撞击音生成”任务,将物体内部状态(填充物种类、填充量)这一被现有工作忽略但至关重要的物理维度纳入3D音效生成的考量范围,显著提升了任务的真实性和挑战性。
- 数据集构建创新:构建了首个专门针对该任务的多模态真实数据集FillImpact。它不仅包含5000+录音,更重要的是通过系统的声学分析(如验证频率与填充质量的平方根反比关系)证明了数据与物理定律的一致性,为训练物理感知模型提供了可靠基础。
- 框架设计创新:提出了FillGauss框架,首次将3D高斯泼溅(3DGS)表示与内部物理状态条件相结合用于音效生成。其设计的跨模态注意力融合机制(自注意力+交叉注意力)被解释为用来建模几何、位置和内部状态之间的物理交互。
下图展示了FillImpact数据集的构建流程和层级分布结构。

左侧为从真实物体到多模态数据的采集流程,右侧层级结构图详细展示了从外部容器材料、内部填充状态到击打物材料的组合分布,体现了数据集的系统性。
📊 实验结果
论文在自建的FillImpact数据集(80%/20%划分)上进行实验,采用定量、定性、主观评估和消融研究。
主比较实验:与两个基线对比:SonicGauss(3DGS条件生成模型)和TangoFlux(文本条件生成模型),均提供零样本(ZS)和微调(FT)版本。
表I:定量比较
| 模型 | FAD ↓ | KL sig ↓ | IS Avg ↑ | IS Std ↓ |
|---|---|---|---|---|
| SonicGauss (ZS) | 7.8909 | 1.2022 | 1.0136 | 1.85e-4 |
| TangoFlux (ZS) | 15.5368 | 1.6947 | 1.0062 | 0.85e-4 |
| SonicGauss (FT) | 1.5653 | 0.5750 | 1.0156 | 2.85e-4 |
| TangoFlux (FT) | 1.0627 | 0.7700 | 1.0151 | 2.61e-4 |
| FillGauss (Ours) | 1.3500 | 0.6977 | 1.0160 | 2.93e-4 |
主观评估:由8名参与者进行。结果如下: 表II:综合主观评估
| 模型 | MOS (↑) | Win Rate (↑) | Attr. Count (↑) |
|---|---|---|---|
| TangoFlux (ZS) | 1.50 ± 1.16 | 3.6% | 0.36 ± 0.98 |
| TangoFlux (FT) | 3.64 ± 0.74 | 37.5% | 2.64 ± 1.48 |
| SonicGauss (ZS) | 4.50 ± 0.65 | 16.1% | 1.43 ± 1.42 |
| SonicGauss (FT) | 4.36 ± 0.63 | 33.9% | 1.95 ± 1.77 |
| FillGauss (Ours) | 4.43 ± 0.76 | 69.6% | 3.62 ± 1.51 |
表III:细粒度属性匹配率 (%)
| 模型 | Striker | Mat. | Pos. | Fill Mat. | Level |
|---|---|---|---|---|---|
| TangoFlux (ZS) | 11.9% | 7.1% | 9.5% | 4.8% | 2.4% |
| TangoFlux (FT) | 73.8% | 71.4% | 59.5% | 31.0% | 28.6% |
| SonicGauss (ZS) | 50.0% | 21.4% | 31.0% | 14.3% | 26.2% |
| SonicGauss (FT) | 54.8% | 35.7% | 42.9% | 31.0% | 31.0% |
| FillGauss (Ours) | 88.1% | 90.5% | 71.4% | 52.4% | 59.5% |
消融研究: 表IV:核心组件消融
| 配置 | FAD ↓ | KL sig ↓ | IS Avg ↑ | IS Std ↓ |
|---|---|---|---|---|
| w/o self-attention | 1.4111 | 0.6434 | 1.0161 | 2.89e-4 |
| w/o cross-attention | 1.5623 | 0.5904 | 1.0162 | 2.84e-4 |
| w/o \(\mathcal{L}_{huber}\) | 1.4854 | 0.6297 | 1.0162 | 3.01e-4 |
| Hard-code | 1.4936 | 0.6506 | 1.0158 | 2.81e-4 |
| Final (Ours) | 1.3500 | 0.6977 | 1.0160 | 2.93e-4 |
敏感度分析: 表V:3DGS稀疏化水平影响
| 配置 | FAD ↓ | KL sig ↓ | IS Avg ↑ | IS Std ↓ |
|---|---|---|---|---|
| L1 (Ours) | 1.3504 | 0.6977 | 1.0160 | 2.93e-4 |
| L2 | 1.3940 | 0.6872 | 1.0161 | 2.85e-4 |
| L3 | 1.6182 | 0.6712 | 1.0166 | 2.68e-4 |
| L4 | 2.2265 | 0.6642 | 1.0172 | 2.88e-4 |
| L5 | 2.5718 | 0.7439 | 1.0175 | 2.81e-4 |
分析:FillGauss在主要指标FAD上优于微调后的3D感知基线SonicGauss(FT)(1.35 vs 1.57)。TangoFlux(FT)在FAD上得分更低(1.06),但缺乏3D空间感知能力。主观评估中,FillGauss在胜率和属性识别准确率上大幅领先。消融实验证实了各模块的有效性,移除交叉注意力导致FAD退化最严重。敏感度分析表明,模型在中度3DGS稀疏化下保持稳健,但极端稀疏化会显著损害性能。
🔬 细节详述
- 训练数据:使用自建的FillImpact数据集,包含88个物体、超过5000条录音。数据按80%/20%划分训练/测试集。音频重采样至48kHz,并通过预训练的音频VAE压缩为潜在表示。
- 损失函数:采用Huber损失 \(\mathcal{L}_{huber}\),阈值 \(\delta\) 设为1.0。
- 训练策略:基于AdamW优化器,基础学习率 \(1 \times 10^{-4}\),使用线性学习率调度器。每个设备批量大小为15,训练80个epoch。
- 关键超参数:3DGS编码器采用SplatFormer架构;位置编码频率层级 \(L\) 未明确说明;文本编码器使用冻结的预训练模型(论文示例中提及T5);音频VAE也冻结。
- 训练硬件:单张NVIDIA RTX 4090 GPU (24GB)。
- 推理细节:论文未说明具体的采样步数、去噪策略等推理时细节。
- 其他细节:3DGS和击打坐标都进行了全局边界框归一化,缩放到[-1.5, 1.5]的坐标空间。
⚖️ 评分理由
创新性 (1.2/2):首次明确定义了‘细粒度填充感知撞击音生成’新任务,并构建了首个专门针对此任务的物理对齐的FillImpact数据集,任务定义和数据集贡献突出。但生成框架是3DGS编码器、文本编码器和预训练音频扩散模型的模块化组合,在生成模型或物理编码机制层面底层原创性有限。
技术严谨性 (1.0/1.5):框架设计合理,数据流清晰,提出的跨模态注意力融合模块(自注意力+交叉注意力)有明确的物理建模动机解释。消融实验(表IV)验证了各组件的有效性,证明移除交叉注意力对性能损害最大。但物理建模深度受限,依赖隐式注意力学习物理关系,未显式融入物理方程。
实验充分性 (1.1/1.5):提供了与SonicGauss和TangoFlux两个基线的对比,进行了定量、定性、主观评估和全面的消融研究。但实验设计未能完全剥离文本语义与3D几何信息各自带来的独立增益(如TangoFlux微调后部分属性识别率也较高),且核心数据集仅覆盖88个物体、2种填充物,场景复杂性验证有限。
清晰度 (0.9/1):架构描述详尽,对多模态编码器、跨模态注意力融合模块及扩散网络的组件、数据流和公式解释清晰。图表(如图5)有效展示了框架结构,实验结果部分组织有条理。
影响力 (0.8/1.5):定义了一个新颖且具有物理意义的音频生成任务,为解决物体内部状态对撞击音的影响提供了新思路和数据集基础。论文声称在VR、游戏等场景有应用潜力,但目前框架和数据集在更复杂物理场景和物体上的泛化能力未得到充分验证,限制了其即时影响力。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.2/0.5):论文在附录中详细描述了训练配置(如优化器、学习率、轮数)、数据处理(音频重采样、3DGS归一化)和基线微调细节。但所有信息均未附带具体的代码仓库、模型检查点或可直接下载的数据集,实际复现仍非常困难。
工程/实践价值 (1.0/1.5):提出了一个完整的、端到端的多模态条件生成框架FillGauss,并构建了配套的真实世界数据集FillImpact,展示了从数据采集、3DGS重建到生成模型训练的完整工程流程。实验表明其框架在自建数据集上优于基线,具备处理物理状态条件的工程能力。但未验证在更复杂真实场景(如动态内部状态)中的表现。
🚨 局限与问题
论文明确承认的局限:
- 3DGS稀疏化影响:极端稀疏化会破坏表面完整性,导致音效质量显著下降(表V)。
- 人类感知差距:主观评估表明,尽管优于基线,但生成音效在精细属性辨别上与真实音效仍有差距。
审稿人发现的潜在问题:
- 实验评估公平性:TangoFlux作为强大的文本模型,通过微调也能在部分属性(如Striker, Mat.)上获得不错的识别率(表III),这可能模糊了引入3D几何信息带来的真实增益。实验设计未能完全剥离文本语义与3D几何各自的独立贡献。
- 数据集通用性与规模:尽管数据集精心构建,但仅包含88个物体、2种填充物(水、米)、3种击打物,覆盖的物理场景仍然有限。模型在更复杂物体(非规则容器、多材质混合)或更复杂内部动态(如晃动液体)上的表现未被验证,限制了结论的普遍性。
- 物理建模深度:模型通过隐式的注意力机制学习物理关系,并未显式融入任何物理方程或模拟先验。其“物理合理性”更多体现在输出结果与统计物理规律的吻合上,而非模型架构本身具有物理可解释性。
- 条件文本模板的设计:用于描述内部状态的文本模板(如“quarter full”)是固定的。论文未分析模板描述粒度(如“10% full” vs “slightly filled”)对生成结果的影响,也未探讨模型对更自由化、自然语言描述的理解和泛化能力。
- 评估指标局限性:FAD等客观指标在音频生成任务中虽常用,但其与人类听觉感知的对应关系并非完美。论文未探讨其他音频质量评估指标(如PESQ、SI-SDR等)的结果。