CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

📄 CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning 标签:#空间音频 #对比学习 #音频检索 #多通道 #长音频处理 7.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.9/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #对比学习 | #音频检索 #多通道 | arxiv 👥 作者与机构 第一作者:Peiwei Ren(Xi’an Jiaotong Liverpool University, China) 通讯作者:Peiwei Ren;Jinbo Hu;Fang Kang;Shan Liang;Yin Cao 作者列表:Peiwei Ren、Jinbo Hu、Fang Kang、Shan Liang、Yin Cao(机构:Xi’an Jiaotong Liverpool University, China;MiLM Plus, Xiaomi Inc., China;Center for Machine Vision and Signal Analysis, University of Oulu, Finland;Institute of Acoustics, Chinese Academy of Sciences) ...

2026-08-26 · 更新于 2026-09-04 · 3 min · 618 words

Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

📄 Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes 标签:#空间音频 #音视频生成 #声源定位 #多通道 #CNN 6.9/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #CNN | #音视频生成 #声源定位 | arxiv 👥 作者与机构 第一作者:Qingyu Luo(Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K.) 通讯作者:论文未单独标注通讯作者;作者邮箱均为 University of Surrey 域名 作者列表:Qingyu Luo、Peng Zhang、Wenwu Wang、Philip J. B. Jackson(机构:Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K.) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 850 words

AudioWorldSim: Realistic Binaural Audio Datasets For World Models

📄 AudioWorldSim: Realistic Binaural Audio Datasets For World Models 标签:#空间音频 #生成模型 #数据集 #多通道 9.7/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.7/10 | 前10% | 文档类型:系统技术报告 | 评分置信度:中 | #空间音频 | #生成模型 | #数据集 #多通道 | arxiv 👥 作者与机构 第一作者:Luis Vitor Zerkowski(VISGRAF;IMPA) 通讯作者:正文未明确标注 作者列表:Luis Vitor Zerkowski、Luiz Velho(机构:VISGRAF;IMPA) 💡 毒舌点评 这是少见的把声学 bug 根因、特征尺寸、吞吐和失败率都写清楚的工具论文。同源卷积与 IR 补零修复的不是美化指标,而是会污染世界模型训练的真实不连续。最需要克制的是把开放生成器说成开放数据集或已验证的世界模型方案:5% 后端失败、材质禁用、场景许可和缺少下游实验仍是硬边界。 ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 435 words

Dancing Through Soundscapes: Designing a Low-Cost, Sound-Based Device for Sensing and Interpreting Movement and Dance

📄 Dancing Through Soundscapes: Designing a Low-Cost, Sound-Based Device for Sensing and Interpreting Movement and Dance 标签:#音频交互 #音频生成 #空间音频 #实时处理 5.2/10 | 创新 0.9/2 | 严谨 0.9/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 5.2/10 | 后50% | 文档类型:应用研究 | 评分置信度:中 | #音频交互 | #音频生成 | #空间音频 #实时处理 | arxiv 👥 作者与机构 Swen E. Gaudl 来自瑞典哥德堡大学并兼任英国 Seam CoLab 有限公司研究员,Silvia Carderelli-Gronau 来自巴斯斯巴大学并兼任同一公司职务。研究历经四年的通过设计做研究与共同创作迭代,面向舞者与混合能力用户群体。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 254 words

Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion

📄 Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion 标签:#空间音频 #扩散模型 #多通道 #鲁棒性 6.2/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #空间音频 | #扩散模型 | #多通道 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Xiang Zhou(西北工业大学 智能声学与沉浸式通信中心;南洋理工大学 数字信号处理实验室) 通讯作者:Wen Zhang(西北工业大学 智能声学与沉浸式通信中心,wen.zhang@nwpu.edu.cn) 作者列表:Xiang Zhou(西北工业大学 智能声学与沉浸式通信中心;南洋理工大学 数字信号处理实验室)、Zhengqiao Zhao(西北工业大学 智能声学与沉浸式通信中心)、Zhengding Luo(西北工业大学 智能声学与沉浸式通信中心)、Wen Zhang(西北工业大学 智能声学与沉浸式通信中心) 💡 毒舌点评 这篇论文用 GASHP 前端、双分支条件扩散和低阶/高阶空间正则的组合,试图解决稀疏五麦克风阵列下 FOA/SOA 编码的欠定与病态问题。整体思路清楚,物理投影至少避免了直接伪逆放大噪声,消融也基本支持各模块贡献。但硬伤同样直接:没有代码、没有模型权重、数据仅有“on request”的空泛承诺;2.66 秒/4 秒音频的推理速度与实时部署背道而驰;Table 3 中估计 SOA 反投影超过 Ground Truth 的结果,作者解释为二阶截断误差,却没有提供任何控制实验排除模型过拟合到特定阵列响应或参考信号失真。更刺眼的是,相关工作里明确讨论了同为生成式稀疏麦克风 Ambisonic 编码的 Flow-HOA,实验却完全不做对比,这削弱了“相对于最新生成式基线”的说服力。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 928 words

Numerical and perceptual validity of synthetic Head-Related Transfer Functions at scale

📄 Numerical and perceptual validity of synthetic Head-Related Transfer Functions at scale 标签:#声源定位 #生成模型 #空间音频 #模型评估 #数据集 7.6/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 7.6/10 | 前25% | 文档类型:应用研究 | 评分置信度:高 | #声源定位 | #生成模型 | #空间音频 #模型评估 | arxiv 👥 作者与机构 第一作者:Katarina C. Poole(Imperial College London, Dyson School of Design Engineering) 通讯作者:Katarina C. Poole(Imperial College London, Dyson School of Design Engineering) 作者列表:Katarina C. Poole(Imperial College London, Dyson School of Design Engineering)、Lorenzo Picinali(Imperial College London, Dyson School of Design Engineering) 💡 毒舌点评 这是一篇在空间音频领域做得相当扎实的大规模评估工作,用 200 名受试者的 HRTF 数据把“合成 HRTF 是否可替代实测 HRTF”这个问题问到了数值、模型和行为三个层面,结论(合成 HRTF 在行为上追平实测、KEMAR 显著更差)对个性化空间音频的规模化落地有直接价值。但论文的硬伤也很明显:数值发现的偏差集中在低仰角后方,行为错误却全挤在前后中线,这种错位暴露了现有数值/模型度量与真实感知之间的断层——作者诚实承认了这一点,并在讨论中列举了几条可能的改进方向(如基于临界带的感知加权、整合中耳/内耳听觉模型、更大规模行为数据集),但没有任何一条被实际验证或给出预测指标,使得结论止步于“哪里对不上”而非“该怎么解决”。此外,随机 HRTF 意外低 LSD 的反直觉结果被一带而过,Barumerli 模型在空间相关性上的系统性失败(对 KEMAR 的极角精度甚至显著负相关)也没有被深究结构原因,这些未消化的事实削弱了论文在感知有效性评估层面的方法论贡献。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 846 words

Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Mode

📄 Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Mode 标签:#音频生成 #扩散模型 #空间音频 #多通道 #零样本 6.3/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #扩散模型 | #空间音频 #多通道 | arxiv 👥 作者与机构 第一作者:Eloi Moliner(Meta Reality Labs Research;Aalto University, Acoustics Lab, DICE, Espoo, Finland) 通讯作者:未说明 作者列表:Eloi Moliner(Meta Reality Labs Research;Aalto University, Acoustics Lab, DICE)、Christoph Hold(Meta Reality Labs Research)、Juan Azcarreta Ortiz(Meta Reality Labs Research)、Sebastian Prepeliţă(Meta Reality Labs Research)、Ishwarya Ananthabhotla(Meta Reality Labs Research)、Daniel Wong(Meta Reality Labs Research)、Sanjeel Parekh(Meta Reality Labs Research)、Sanha Lee(Meta Reality Labs Research) 💡 毒舌点评 本文首次将无条件扩散先验与 diffusion posterior sampling 结合用于高阶 Ambisonics RIR 编码,并通过 range-projected 压缩频谱距离显著压制弱高阶分量误差,这是一个有价值的组合洞察。但“设备无关”的核心卖点只在一个 7 麦克风阵列上实证,训练数据、ATF 与权重全部闭源,听音测试仅 13 人且无统计检验,让人很难判断这到底是通用方法还是内部数据工程能力。 ...

2026-08-17 · 更新于 2026-09-04 · 5 min · 878 words

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

📄 Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models 标签:#音视频问答 #多模态模型 #空间音频 #强化学习 6.7/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.7/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频问答 | #多模态模型 | #空间音频 #强化学习 | arxiv 👥 作者与机构 第一作者:Zhi Zeng(标注为共同一作,机构编号 1;机构名称未在正文中说明) 共同一作:Cheng Zhang、Zesheng Yang(机构编号 1)、Rendong Pi(机构编号 2) 作者列表:Zhi Zeng¹、Cheng Zhang¹、Zesheng Yang¹、Rendong Pi²、Jiaying Wu³、Di Zhang¹、Zihan Ma¹、Guodong Li⁴、Zhou Yang¹、Yu Xiang²、Yifei Zheng⁵、Minnan Luo¹(前四位标注 equal contribution;通讯作者未说明;1–5 为机构编号,机构名称未在论文中给出) 💡 毒舌点评 亮点:把"移动声源的时空跟踪与视觉绑定"正式定义为四级 QA 任务,并用模态必要性约束从构造上堵死单模态捷径,定位精准;ST-Omni-R1 平均 77.83% 领先最强闭源基线 Gemini-2.5-Pro(37.28%)达 40.55 个百分点,差距显著。 短板:核心产物(ST-OmniQA 数据、STA-encoder 代码、模型权重)完全未开源,一个基准论文拿不出基准本身,是最大的硬伤;全部数据来自 Matterport3D+SoundSpaces 2.0 单一仿真管线,真实场景只有音频模态的部分迁移证据;高度相关的近作 ST-AudioLM 在正文中被点名却未入表对比;且所有通用基线均为零样本,与经过同分布 SFT 的本文方法并不对等,“碾压式"领先需要打折解读。 📌 核心摘要 要解决的问题:现有音频语言模型(LALM)多以全局事件语义表示整段音频,视觉语言模型缺乏空间音频线索,SELD 则受限于固定词表与结构化输出,三者均无法对移动声源执行"定位—跟踪—跨模态绑定"的联合开放推理。 方法核心:构建 ST-OmniQA 基准(40K 全景视频 + 400K QA,四级能力 A/B/C/D,式 (2) 模态必要性约束),提出 ST-Omni-R1 模型,由 STA-encoder(1 个语义 token + 40 个时序轨迹 token)、Qwen2.5-VL-7B-Instruct 视频分支、两层 MLP 音频连接器组成,经 Stage A→D 渐进课程学习与推理树强化学习(RT-GRPO)训练。 新在哪里:基准层面要求答案仅在联合视听证据下唯一可解(\(|\mathcal{C}_A|>1, |\mathcal{C}_V|>1, |\mathcal{C}_{AV}|=1\));表示层面将 FOA 的时变声强向量转为有序轨迹 tokens,并与全景视觉实例绑定。 主要实验结果:ST-OmniQA 上 ST-Omni-R1(SFT+RT-RL)平均语义准确率 77.83%,最强闭源基线 Gemini-2.5-Pro 为 37.28%;TAU-NIGENS/L3DAS22/STARSS23 三个公开空间音频基准上总体均优于 BAT(注意 TAU-NIGENS 的 Elevation 子项上 BAT 50.00 略高于本文 49.50)。 实际意义:为"空间音频+全景视频"的动态声源推理提供了基准与基线系统,可能推动音视频问答、具身智能中声源跟踪与视觉绑定方向的研究。 主要局限:训练与评测均来自 Matterport3D+SoundSpaces 2.0 同一仿真引擎,真实场景仅有音频/音视频迁移的部分证据;模型、数据、代码均未开源;RT-GRPO 奖励权重与树节点打分细则未披露;Level C 仅 55.70% 且无失败模式分析。 下图展示了ST-OmniQA基准中的一个单源音频-视觉接地任务示例。 ...

2026-08-11 · 更新于 2026-09-04 · 3 min · 493 words

Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

📄 Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds 标签:#音频生成 #多模态模型 #空间音频 #零样本 #音频理解 7.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #多模态模型 | #空间音频 #零样本 | arxiv 👥 作者与机构 第一作者:Masaki Yoshida(北海道大学) 通讯作者:未说明 作者列表:Masaki Yoshida(北海道大学)、Ren Togo(北海道大学)、Takahiro Ogawa(北海道大学)、Miki Haseyama(北海道大学) 💡 毒舌点评 论文定义了一个新颖且实用的任务——为预训练的3DGS世界自动生成空间一致的音景,并用一套巧妙的“无训练”流水线解决了跨视角实例关联这一核心难题,Gaussian Set Matching的设计具有洞察力。然而,整篇工作在本质上仍是对多个成熟基础模型(VLM、SAM、T2A)的工程组合,缺乏对生成声音本身与视觉场景之间细粒度语义对齐的深度建模,且提出的评价指标在真值依赖和语义绑定上存在明显空白,难以支撑“高质量音景生成”这一更高级别声明。 ...

2026-08-04 · 更新于 2026-09-04 · 4 min · 695 words

RIPPLE: Generating Multi-Channel Phase, Not Recovering It

📄 RIPPLE: Generating Multi-Channel Phase, Not Recovering It 标签:#空间音频 #流匹配 #音频理解 #Transformer #模型评估 7.1/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #流匹配 | #空间音频 #Transformer | arxiv 👥 作者与机构 第一作者:Jaehyuk Lee(未说明) 通讯作者:Donghun Lee(未说明) 作者列表:Jaehyuk Lee(未说明)、Yeajin Lee(未说明)、Dayeon Shin(未说明)、Donghun Lee(未说明) 💡 毒舌点评 这篇论文的核心理念——“相位应该是生成的而不是恢复的”——是一个精准且有价值的洞察,尤其在处理多通道信号时,传统逐通道的恢复方法确实会系统性地破坏通道间结构。在空间音频和地震两个物理无关领域做了验证,实验设计很有说服力。但论文的开源承诺几乎为零,仅有“代码将在接收后发布”的表态,且未提供任何架构细节或模型权重,直接拉低了其可复现性和影响力。总体看,这是一篇有清晰贡献和严谨证据链的扎实工作,但其“可操作范式转变”的潜力有待代码和预训练模型的公开来兑现。 📌 核心摘要 要解决什么问题:多通道波形(如空间音频、三分量地震信号)生成中,相位通常被委托给逐通道恢复模块(如Griffin-Lim、神经声码器、VAE解码器),这会系统性破坏通道间相位关系(即真正承载物理信息的东西),而且这种破坏在常用的幅度指标上几乎不可见,导致现有方法在评分上表现良好但物理信息已被丢弃。该问题不是某个生成模型的失败,而是所有基于“逐通道相位恢复”的pipeline共有的、不可逾越的上限(Table 5证明了在完全没有生成误差的Oracle恢复下,这个上限依然存在)。 方法核心是什么:RIPPLE重新诠释Griffin-Lim,不再将其作为最终相位估计器,而是作为一个从源相位初始化的相位先验(以携带通道间结构),然后引入一个解耦的两阶段Rectified Flow分别对幅度和相位进行建模。相位流从先验出发流向目标相位,并加入显式的通道间相位差(IPD)损失来把通道一致性作为训练目标。方法将相位生成从“从零合成”转化为“残差校正”。 与已有方法相比新在哪里:之前的方法要么完全避开学习相位(如神经声码器内置合成)、要么逐通道生成而不设立跨通道目标,要么从噪声开始忽略可用的物理先验。RIPPLE第一次把逐通道相位估计重构为通道间相位生成,并以源相位初始化的Griffin-Lim作为结构化先验,而非随机噪声。同时,它首次将IPD作为显式训练目标直接优化,并在解耦训练中引入了独立的timestep采样以防止通道结构坍塌。 主要实验结果如何:在FOA空间音频环境迁移上,RIPPLE的ΔSpatial-Angle达到0.319,显著优于Diff-SAGe†的0.534,更远优于基于逐通道Griffin-Lim恢复的Tango†(1.557)和RIPPLE (GL)(1.586)。在地震跨台站翻译上,RIPPLE将S波偏振角误差(PAE_S)从Heggs的55.0°(随机期望57.3°)降到33.8°,同时GOF从49.85提升到68.79。严格的消融实验表明,去掉Griffin-Lim先验或用高斯噪声替代,在空间音频上ΔSpatial-Angle恶化到约1.6(chance水平),在地震上PAE_S恶化到57.3°(chance水平)。 实际意义是什么:为所有依赖通道间相位结构的多通道生成任务(空间音频合成、地震波形模拟、声源定位等)提供了一个可操作的范式转变——从逐通道“恢复”切换到跨通道“生成”,并给出了具体的技术实现路径。 主要局限性是什么:框架强依赖于源和目标通过同一底层源信号关联的假设(即成对翻译场景),无法直接应用于从语义或单声道合成空间音频等缺乏源相干性的任务;未进行主观听感测试(对FOA格式而言合理,但未充分讨论该局限性对终端应用的影响);Griffin-Lim迭代次数K的鲁棒性仅在推理时测试,未系统性验证训练时的敏感性;架构关键细节的缺失(如UNet的具体层数、通道数、conditioning encoder的结构)削弱了可复现性。 🔗 开源详情 代码:论文中提及“代码将在接受后发布”,但未提供任何可用链接。 模型权重:未提供。 数据集:论文使用了公开的 Spatial LibriSpeech 和 SCEDC(南加州地震数据中心)数据集,但未提供具体下载链接或处理脚本。 Demo:未提及。 复现材料:只提供了算法伪代码(Algorithm 1, 2)和部分超参数,但未提供可直接运行的代码仓库、配置文件或checkpoint。关键的UNet网络结构未公开。 🏗️ 方法概述和架构 RIPPLE是一个两阶段流匹配框架,用于源到目标多通道波形的翻译。输入包括C通道源波形 \(w^{(s)}\)、目标波形 \(w^{(t)}\)(训练时)和条件向量 \(c\)(如位置、房间等元数据),输出为C通道目标波形 \(w^{(t)}\)。 ...

2026-07-31 · 更新于 2026-09-04 · 4 min · 739 words