每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

三点脉冲响应如何撑起一条隧道的可走动混响:Bunkervik 共极点模态引擎

针对长条形隧道内接收位置连续变化时混响特征平滑过渡的问题,该演示用三位置实测脉冲响应构造 6300 个共享极点的模态合成引擎并做残差插值,时域归一化误差低于 3.5%,代价是仅覆盖纵轴一维移动且高频需外推补偿。

 · 更新于 2026-09-24 · 约 22 分钟 · 10990 字 阅读 →
论文解读

在二维平面上连续试听脉冲响应集合:IRIS 用高斯加权与有界卷积做轻量导航

IRIS 把已测或自定义脉冲响应集合排成二维可导航平面,用高斯距离加权与最多 8 路有界卷积做实时试听,在 Apple M4 Pro 上 512 采样缓冲下 16 路 1 秒 IR 平均 2.87 毫秒等三组条件保持在 10.67 毫秒预算内,代价是只做简化时域混合而不保证物理最优与感知透明。

 · 更新于 2026-09-24 · 约 15 分钟 · 7356 字 阅读 →
论文解读

先认出是什么,再听出在哪里:跨实例视觉提示的选择性测向

针对混合声中只定位目标声源的问题,该研究用跨实例图像做语义提示,先做语义对齐再做多频带空间对齐,在 VGGSound-SSL 上报告平均绝对误差 16.59 度、准确率 71.29%,代价是依赖合成空间音频与人工核验的提示池。

 · 更新于 2026-09-24 · 约 20 分钟 · 9621 字 阅读 →
论文解读

先按人找声音,再按位置修声音:用空间相关增强 HRTF 个性化

针对未见被试在稀疏测量下难以个性化 HRTF 的问题,该工作用图网络分别做基于被试检索的个性化和基于位置检索的上采样,再用前者输出微调后者,报告在 SONICOM 上 3 个方向时把 LSD 从 4.33 dB 降到 3.60 dB,代价是需要先测少量方向并做两阶段预训练加微调。

 · 更新于 2026-09-24 · 约 23 分钟 · 11100 字 阅读 →
论文解读

野外长音频与多音频并存时,模型为何听得到却答不对

MMAU-Pro 用 5305 组野外音频与 49 项技能考查长时、多音频、空间与文化理解,最强模型仅 59.2% 准确率,暴露感知到推理的断层与指令遵循短板。

 · 更新于 2026-09-24 · 约 21 分钟 · 10274 字 阅读 →
论文解读

多模态指令导航:用语言、图像和声音共同消除目标歧义

针对单模态指令在相似物体环境中易歧义的问题,论文提出 MINav 任务与 NaVLA2 个模型,用空间语义双分支音频编码与边想边做解码实现多模态接地,最强证据是在 MINav 上达到 27.2% 成功率与 19.6% 路径加权成功率,代价是仍需三阶段训练与连续仿真渲染。

 · 更新于 2026-09-24 · 约 20 分钟 · 9630 字 阅读 →
论文解读

个体化 HRTF 为何不只改变定位准确率而是改变定向动作的发起时机

在听觉引导视觉搜索任务中比较个体化与 KEMAR 非个体化 HRTF 在消声与混响下的行为,证据显示消声下个体化使反应时平均缩短约 200 ms 且优势集中于动作发起而非总运动量,混响下优势消失。

 · 更新于 2026-09-24 · 约 23 分钟 · 11134 字 阅读 →
论文解读

双耳相位不可丢:从 Mel 模糊到复数 VAE 的空间音频重建

为解决视觉遮挡下世界模型缺乏空间听觉的问题,BinauralVAE 对比三种 VAE 在 0.2 秒双耳片段上的重建能力,显示保留相位的复数 VAE 在低频段实现可听的空间保真,而幅值-only 与四通道实数 VAE 分别因 ITD 丢失与相位塌缩而失效。

 · 更新于 2026-09-24 · 约 23 分钟 · 11495 字 阅读 →
论文解读

墙体遮挡下的分布式声学叙事:用拓扑图与几何提示补全多房间声场景

针对多房间中墙体遮挡导致单点麦克风观测碎片化的问题,论文用分布式麦克风的拓扑感知图融合与几何约束的冻结大语言模型推理将声学证据补全为物理一致的叙事,并在受控仿真中以三元组与空间一致性等指标验证其相对集中式基线的优势与代价。

 · 更新于 2026-09-24 · 约 22 分钟 · 11004 字 阅读 →
论文解读

在单通道约束下用稀疏相对脉冲响应重建空间:HOA 参数化编码的显式房间建模

针对三阶 HOA 在约 27 kbps 单传输通道下混响建模不足的问题,论文以波束成形参考盲估计相对空间房间脉冲响应并拆为稀疏波包与残差包络进行参数化,在未见 SRIR 上取得与 32 kbps IVAS 相当且验证集上略优的 QASTANet 分数,同时把空间参数压到约 2 kbps。

 · 更新于 2026-09-24 · 约 24 分钟 · 12011 字 阅读 →
论文解读

一步到位改三维声场:SwanWeave 为何把事件、空间、运动与房间一起学

SwanWeave 针对 FOA 四通道声场的指令编辑任务,用可控房间仿真构造 125K/类单操作与 250K 复合操作的源-目标配对监督,以潜空间流匹配为生成器,配合双层路由的 SE-MoE 与面向错编负样本的 SPO 偏好对齐及分阶段课程,实现一阶段复合编辑,并在客观与人评上一致优于现有通用与立体声编辑基线,代价是依赖仿真数据与约 10 秒短场景。

 · 更新于 2026-09-24 · 约 26 分钟 · 12707 字 阅读 →