Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

📄 Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models 标签:#音视频问答 #多模态模型 #空间音频 #强化学习 6.7/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.7/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频问答 | #多模态模型 | #空间音频 #强化学习 | arxiv 👥 作者与机构 第一作者:Zhi Zeng(标注为共同一作,机构编号 1;机构名称未在正文中说明) 共同一作:Cheng Zhang、Zesheng Yang(机构编号 1)、Rendong Pi(机构编号 2) 作者列表:Zhi Zeng¹、Cheng Zhang¹、Zesheng Yang¹、Rendong Pi²、Jiaying Wu³、Di Zhang¹、Zihan Ma¹、Guodong Li⁴、Zhou Yang¹、Yu Xiang²、Yifei Zheng⁵、Minnan Luo¹(前四位标注 equal contribution;通讯作者未说明;1–5 为机构编号,机构名称未在论文中给出) 💡 毒舌点评 亮点:把"移动声源的时空跟踪与视觉绑定"正式定义为四级 QA 任务,并用模态必要性约束从构造上堵死单模态捷径,定位精准;ST-Omni-R1 平均 77.83% 领先最强闭源基线 Gemini-2.5-Pro(37.28%)达 40.55 个百分点,差距显著。 短板:核心产物(ST-OmniQA 数据、STA-encoder 代码、模型权重)完全未开源,一个基准论文拿不出基准本身,是最大的硬伤;全部数据来自 Matterport3D+SoundSpaces 2.0 单一仿真管线,真实场景只有音频模态的部分迁移证据;高度相关的近作 ST-AudioLM 在正文中被点名却未入表对比;且所有通用基线均为零样本,与经过同分布 SFT 的本文方法并不对等,“碾压式"领先需要打折解读。 📌 核心摘要 要解决的问题:现有音频语言模型(LALM)多以全局事件语义表示整段音频,视觉语言模型缺乏空间音频线索,SELD 则受限于固定词表与结构化输出,三者均无法对移动声源执行"定位—跟踪—跨模态绑定"的联合开放推理。 方法核心:构建 ST-OmniQA 基准(40K 全景视频 + 400K QA,四级能力 A/B/C/D,式 (2) 模态必要性约束),提出 ST-Omni-R1 模型,由 STA-encoder(1 个语义 token + 40 个时序轨迹 token)、Qwen2.5-VL-7B-Instruct 视频分支、两层 MLP 音频连接器组成,经 Stage A→D 渐进课程学习与推理树强化学习(RT-GRPO)训练。 新在哪里:基准层面要求答案仅在联合视听证据下唯一可解(\(|\mathcal{C}_A|>1, |\mathcal{C}_V|>1, |\mathcal{C}_{AV}|=1\));表示层面将 FOA 的时变声强向量转为有序轨迹 tokens,并与全景视觉实例绑定。 主要实验结果:ST-OmniQA 上 ST-Omni-R1(SFT+RT-RL)平均语义准确率 77.83%,最强闭源基线 Gemini-2.5-Pro 为 37.28%;TAU-NIGENS/L3DAS22/STARSS23 三个公开空间音频基准上总体均优于 BAT(注意 TAU-NIGENS 的 Elevation 子项上 BAT 50.00 略高于本文 49.50)。 实际意义:为"空间音频+全景视频"的动态声源推理提供了基准与基线系统,可能推动音视频问答、具身智能中声源跟踪与视觉绑定方向的研究。 主要局限:训练与评测均来自 Matterport3D+SoundSpaces 2.0 同一仿真引擎,真实场景仅有音频/音视频迁移的部分证据;模型、数据、代码均未开源;RT-GRPO 奖励权重与树节点打分细则未披露;Level C 仅 55.70% 且无失败模式分析。 下图展示了ST-OmniQA基准中的一个单源音频-视觉接地任务示例。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 493 words

Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

📄 Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds 标签:#音频生成 #多模态模型 #空间音频 #零样本 #音频理解 7.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #多模态模型 | #空间音频 #零样本 | arxiv 👥 作者与机构 第一作者:Masaki Yoshida(北海道大学) 通讯作者:未说明 作者列表:Masaki Yoshida(北海道大学)、Ren Togo(北海道大学)、Takahiro Ogawa(北海道大学)、Miki Haseyama(北海道大学) 💡 毒舌点评 论文定义了一个新颖且实用的任务——为预训练的3DGS世界自动生成空间一致的音景,并用一套巧妙的“无训练”流水线解决了跨视角实例关联这一核心难题,Gaussian Set Matching的设计具有洞察力。然而,整篇工作在本质上仍是对多个成熟基础模型(VLM、SAM、T2A)的工程组合,缺乏对生成声音本身与视觉场景之间细粒度语义对齐的深度建模,且提出的评价指标在真值依赖和语义绑定上存在明显空白,难以支撑“高质量音景生成”这一更高级别声明。 ...

2026-08-04 · 更新于 2026-08-14 · 4 min · 695 words

RIPPLE: Generating Multi-Channel Phase, Not Recovering It

📄 RIPPLE: Generating Multi-Channel Phase, Not Recovering It 标签:#空间音频 #流匹配 #音频理解 #Transformer #模型评估 7.1/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #流匹配 | #空间音频 #Transformer | arxiv 👥 作者与机构 第一作者:Jaehyuk Lee(未说明) 通讯作者:Donghun Lee(未说明) 作者列表:Jaehyuk Lee(未说明)、Yeajin Lee(未说明)、Dayeon Shin(未说明)、Donghun Lee(未说明) 💡 毒舌点评 这篇论文的核心理念——“相位应该是生成的而不是恢复的”——是一个精准且有价值的洞察,尤其在处理多通道信号时,传统逐通道的恢复方法确实会系统性地破坏通道间结构。在空间音频和地震两个物理无关领域做了验证,实验设计很有说服力。但论文的开源承诺几乎为零,仅有“代码将在接收后发布”的表态,且未提供任何架构细节或模型权重,直接拉低了其可复现性和影响力。总体看,这是一篇有清晰贡献和严谨证据链的扎实工作,但其“可操作范式转变”的潜力有待代码和预训练模型的公开来兑现。 📌 核心摘要 要解决什么问题:多通道波形(如空间音频、三分量地震信号)生成中,相位通常被委托给逐通道恢复模块(如Griffin-Lim、神经声码器、VAE解码器),这会系统性破坏通道间相位关系(即真正承载物理信息的东西),而且这种破坏在常用的幅度指标上几乎不可见,导致现有方法在评分上表现良好但物理信息已被丢弃。该问题不是某个生成模型的失败,而是所有基于“逐通道相位恢复”的pipeline共有的、不可逾越的上限(Table 5证明了在完全没有生成误差的Oracle恢复下,这个上限依然存在)。 方法核心是什么:RIPPLE重新诠释Griffin-Lim,不再将其作为最终相位估计器,而是作为一个从源相位初始化的相位先验(以携带通道间结构),然后引入一个解耦的两阶段Rectified Flow分别对幅度和相位进行建模。相位流从先验出发流向目标相位,并加入显式的通道间相位差(IPD)损失来把通道一致性作为训练目标。方法将相位生成从“从零合成”转化为“残差校正”。 与已有方法相比新在哪里:之前的方法要么完全避开学习相位(如神经声码器内置合成)、要么逐通道生成而不设立跨通道目标,要么从噪声开始忽略可用的物理先验。RIPPLE第一次把逐通道相位估计重构为通道间相位生成,并以源相位初始化的Griffin-Lim作为结构化先验,而非随机噪声。同时,它首次将IPD作为显式训练目标直接优化,并在解耦训练中引入了独立的timestep采样以防止通道结构坍塌。 主要实验结果如何:在FOA空间音频环境迁移上,RIPPLE的ΔSpatial-Angle达到0.319,显著优于Diff-SAGe†的0.534,更远优于基于逐通道Griffin-Lim恢复的Tango†(1.557)和RIPPLE (GL)(1.586)。在地震跨台站翻译上,RIPPLE将S波偏振角误差(PAE_S)从Heggs的55.0°(随机期望57.3°)降到33.8°,同时GOF从49.85提升到68.79。严格的消融实验表明,去掉Griffin-Lim先验或用高斯噪声替代,在空间音频上ΔSpatial-Angle恶化到约1.6(chance水平),在地震上PAE_S恶化到57.3°(chance水平)。 实际意义是什么:为所有依赖通道间相位结构的多通道生成任务(空间音频合成、地震波形模拟、声源定位等)提供了一个可操作的范式转变——从逐通道“恢复”切换到跨通道“生成”,并给出了具体的技术实现路径。 主要局限性是什么:框架强依赖于源和目标通过同一底层源信号关联的假设(即成对翻译场景),无法直接应用于从语义或单声道合成空间音频等缺乏源相干性的任务;未进行主观听感测试(对FOA格式而言合理,但未充分讨论该局限性对终端应用的影响);Griffin-Lim迭代次数K的鲁棒性仅在推理时测试,未系统性验证训练时的敏感性;架构关键细节的缺失(如UNet的具体层数、通道数、conditioning encoder的结构)削弱了可复现性。 🔗 开源详情 代码:论文中提及“代码将在接受后发布”,但未提供任何可用链接。 模型权重:未提供。 数据集:论文使用了公开的 Spatial LibriSpeech 和 SCEDC(南加州地震数据中心)数据集,但未提供具体下载链接或处理脚本。 Demo:未提及。 复现材料:只提供了算法伪代码(Algorithm 1, 2)和部分超参数,但未提供可直接运行的代码仓库、配置文件或checkpoint。关键的UNet网络结构未公开。 🏗️ 方法概述和架构 RIPPLE是一个两阶段流匹配框架,用于源到目标多通道波形的翻译。输入包括C通道源波形 \(w^{(s)}\)、目标波形 \(w^{(t)}\)(训练时)和条件向量 \(c\)(如位置、房间等元数据),输出为C通道目标波形 \(w^{(t)}\)。 ...

2026-07-31 · 更新于 2026-08-14 · 4 min · 739 words

PathRIR: Physics-Guided Acoustic Path Selection and Late-Tail Compensation for Fast Room Impulse Response Simulation

📄 PathRIR: Physics-Guided Acoustic Path Selection and Late-Tail Compensation for Fast Room Impulse Response Simulation 标签:#空间音频 #高效推理 #音频理解 #Transformer #模型评估 7.2/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #空间音频 | #高效推理 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Shaoheng Xu(未说明) 通讯作者:未说明 作者列表:Shaoheng Xu(未说明)、Chunyi Sun(未说明)、Jihui Zhang(未说明)、Amy Bastine(未说明)、Prasanga N. Samarasinghe(未说明)、Thushara D. Abhayapala(未说明) 💡 毒舌点评 论文在“物理可解释性”与“仿真加速”之间找到了一个聪明的平衡点,用两个轻量MLP替代粗暴的纯神经网络生成,保留了ISM的显式几何结构,这点很讨喜。子树级重要性监督是一种有洞察力的设计,非短视的逐点裁切。然而,所有实验仅局限于合成不规则房间且无真实RIR校准,加上完全零开源,让这套声称“快速高效”的pipeline目前更像一则设计精巧的概念验证,离真正可复现、可信赖的工具还有明显距离。 ...

2026-07-28 · 更新于 2026-08-14 · 2 min · 374 words

SceneBind: Binding What and Where Across Vision, Audio and Language

📄 SceneBind: Binding What and Where Across Vision, Audio and Language 标签:#多模态模型 #音视频理解 #对比学习 #空间音频 #音频理解 6.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #多模态模型 | #对比学习 #空间音频 | arxiv 👥 作者与机构 第一作者:Mingfei Chen (University of Washington) 通讯作者:Eli Shlizerman (University of Washington) 作者列表:Mingfei Chen (University of Washington), Zijun Cui (University of Washington, University of Texas at Dallas), Ruoke Zhang (University of Washington), Hyeonggon Ryu (Hankuk University of Foreign Studies), Eli Shlizerman (University of Washington) 💡 毒舌点评 论文将场景理解从“是什么”推进到“在哪里”,提出了一个完整的语义-空间绑定框架和配套数据集,实验设计扎实,在空间检索任务上优势明显。然而,它本质上是将视觉领域的“对象槽”思想嫁接到音视频场景理解中,创新更多在于问题定义和工程组合;更关键的是,论文对空间音频信号的利用较为浅层(仅简单拼接特征),且核心贡献与音频领域的直接关联性有限,影响力主要惠及多模态和具身智能社区。 ...

2026-07-17 · 更新于 2026-08-14 · 2 min · 421 words

Tight-Frame Reconstruction for Acoustic Intensity Estimation Using Cardioid Microphone Pairs

📄 Tight-Frame Reconstruction for Acoustic Intensity Estimation Using Cardioid Microphone Pairs 标签:#空间音频 #理论分析 #声源定位 #多通道 #鲁棒性 6.8/10 | 创新 1.1/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.2/0.5 | 工程 0.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:理论研究 | 评分置信度:中 | #声源定位 | #空间音频 | #理论分析 #多通道 | arxiv 👥 作者与机构 第一作者:Akira Omoto 通讯作者:Akira Omoto(omoto@design.kyushu-u.ac.jp) 作者列表:Akira Omoto(Kyushu University, Faculty of Design) 💡 毒舌点评 论文的数学框架构建得相当优雅,球谐函数展开误差传播和有效泄漏指标 \(\Lambda(\omega)\) 的设计具有明确的物理可解释性,为声强测量阵列设计提供了一个有力的理论分析工具。然而,其致命的缺陷在于“闭环缺失”——整篇论文是一场精巧的理论推演与仿真游戏,完全没有用哪怕最简单的原型阵列进行实测验证。作者在结论中坦承原型制作“正在开发中”,但这无法掩盖结论可信度的根本性不足。在无任何真实硬件实验闭环的情况下,审稿人难以判断文中假设(如误差模型的线性分解、通道噪声不相关)在实际工程中的有效性,也无法评估该框架相对于成熟商用设备(基于P-P法)的真实性能增益。此外,工作高度聚焦于声强测量这一相对小众的声学测量领域,与当前音频/语音信号处理的主流机器学习范式毫无交集,其影响力天花板非常明显。 ...

2026-07-14 · 更新于 2026-08-14 · 3 min · 524 words

Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

📄 Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering 标签:#Transformer #多模态模型 #空间音频 #音频大模型 #参数高效微调 7.1/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #多模态模型 | #Transformer | #空间音频 #音频大模型 | arxiv 👥 作者与机构 第一作者:Shuo-Chun Lin(中央研究院信息科学研究所,台湾) 通讯作者:Hen-Hsen Huang(中央研究院信息科学研究所,台湾) 作者列表:Shuo-Chun Lin(中央研究院信息科学研究所,台湾)、Hen-Hsen Huang(中央研究院信息科学研究所,台湾) 💡 毒舌点评 论文提出“抖动噪声作为随机共振桥”来绕过大语言模型标准化层对立体声音频几何信息的压缩,想法新颖,实验在合成数据上的结果也确实令人印象深刻。然而,整个工作建立在极其简化的声像定位场景(单音源、无HRTF、仅振幅差异)之上,其声称的“零样本泛化”也仅限于振幅的不同值,距离解决真实世界的空间音频理解问题还有相当距离,更像是一篇方法验证的原理证明。 ...

2026-07-13 · 更新于 2026-08-14 · 2 min · 350 words

Learning-based Physics-Constrained Neural Kernel for Sound Field Estimation With Source-Position-Dependent Directional Weighting

📄 Learning-based Physics-Constrained Neural Kernel for Sound Field Estimation With Source-Position-Dependent Directional Weighting #声源定位 #空间音频 #低资源 #预训练 5.2/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 0.6/1.5 | 清晰 0.6/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5 📝 5.2/10 | 后50% | #声源定位 | #预训练 | #空间音频 #低资源 | arxiv 👥 作者与机构 第一作者:Mattia Marella(National Institute of Informatics, Tokyo, Japan / University of Ferrara, Ferrara, Italy) 通讯作者:未明确标注,推测为Shoichi Koyama(同为NII,且为项目资助获得者) 全部作者:Mattia Marella(NII / Univ. Ferrara)、Shoichi Koyama(NII) 💡 毒舌点评 这篇文章试图用一个直白且合理的想法——把源位置喂进INR让方向权重学会跨源共享——来解决物理约束神经核单快照过拟合的问题。想法本身没有毛病,方向权重朝向镜像源聚焦的可视化也算亮点。但通篇实验在一个玩具级的模拟房间里打转,声称可推广到“practical measurements”却毫无实测数据支撑,跨房间泛化更是只字不提,这跟只在MNIST上验证一个声称能解决通用视觉问题的方法有什么本质区别?致命的是,代码、模型、数据一概没有,训练细节缺失到让人怀疑作者自己能不能把实验复现出来。放在NeurIPS/ICML的bench上,这篇工作目前的状态顶多算个workshop poster。 ...

2026-07-08 · 更新于 2026-08-14 · 2 min · 221 words

INFER: Learning Implicit Neural Frequency Response Fields for Confined Acoustic Environments

📄 INFER: Learning Implicit Neural Frequency Response Fields for Confined Acoustic Environments #空间音频 6.4/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.4/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.4/10 | 前50% | #空间音频 | #空间音频 | arxiv 👥 作者与机构 第一作者:Harshvardhan C. Takawale(马里兰大学帕克分校计算机系;工作完成于Dolby Laboratories, Inc.) 通讯作者:Harshvardhan C. Takawale(htakawal@umd.edu) 作者列表:Harshvardhan C. Takawale(马里兰大学帕克分校计算机系 / Dolby Laboratories, Inc.)、Nirupam Roy(马里兰大学帕克分校计算机系)、C. Phillip Brown(Dolby Laboratories, Inc.) 💡 毒舌点评 这篇文章以“frequency-first”为旗号,构建了一个工程上相当完备的频域神经声场建模管道。将Kramers-Kronig因果关系约束引入神经声场渲染,确实为黑箱模型注入了一丝物理可解释性,这值得肯定。然而,论文最大的争议点在于:它猛烈抨击时域方法“难以捕获频率选择性行为”,但其自身在关键的时域混响指标T60上却遭遇了灾难性滑坡(Buck数据集上T60误差高达9.8,而AVR仅为3.2)。作者将这一退化轻描淡写地归因于“感知频率加权”,但并未从原理上令人信服地论证为何频域建模必然导致时域包络的崩溃。这在某种程度上是“在频域考场上用频域模型吊打时域学生”,其宣称的39%幅度提升和51%相位提升,其比较基准的公平性值得读者深思。 ...

2026-07-04 · 更新于 2026-08-14 · 1 min · 161 words

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

📄 JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments #声源定位 #多模态模型 #空间音频 #参数高效微调 #数据集 8.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.1/10 | 前25% | #声源定位 | #多模态模型 | #空间音频 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Zhan Liu(清华大学、腾讯AI Lab) 通讯作者:Chao Zhang(清华大学) 作者列表:Zhan Liu(清华大学、腾讯AI Lab)、Changli Tang(清华大学)、Yuxin Wang(香港科技大学)、Zhiyuan Zhu(浙江大学)、Youjun Chen(香港中文大学)、Yiwen Shao(腾讯AI Lab)、Tianzi Wang(腾讯AI Lab)、Lei Ke(腾讯AI Lab)、Zengrui Jin(清华大学)、Chao Zhang(清华大学) 💡 毒舌点评 本文提出了在3D模拟物理环境中进行联合音视频定位与推理的框架 JAEGER,其核心贡献 Neural IV 和 SpatialSceneQA 数据集为空间音频理解研究提供了有价值的工具和基准。亮点在于系统性整合了 RGB-D 视觉与多通道 FOA,并在附录中通过 SimpleFuse 基线实验初步证明了其架构设计的有效性,而非仅依赖于多模态输入的堆砌。然而,实验设计存在明显的“避重就轻”:正文主表(Table 2)回避了 SimpleFuse 基线,将其置于附录,这使得核心主张——即架构的优越性——在主叙述中缺乏最直接的量化支撑。此外,3D 视觉接地任务中,专门针对 3D 的模型 N3D-VLM 竟获得 0.0 IoU,这一零样本、无适配的对比方式极不公正,更像是对基线的“处决”而非“比较”。更严重的是,多说话人推理任务在正文中汇报了接近 100% 的准确率,营造出任务已被解决的假象,而论文在附录中承认,当干扰项增至 4-6 个时性能迅速下降,这种对任务天花板效应(ceiling effect)的深度分析本应是正文的核心内容,却被掩盖于近乎完美的数字之下。 ...

2026-07-04 · 更新于 2026-08-14 · 4 min · 742 words