aaai-2026 论文深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对长条形隧道内接收位置连续变化时混响特征平滑过渡的问题,该演示用三位置实测脉冲响应构造 6300 个共享极点的模态合成引擎并做残差插值,时域归一化误差低于 3.5%,代价是仅覆盖纵轴一维移动且高频需外推补偿。
IRIS 把已测或自定义脉冲响应集合排成二维可导航平面,用高斯距离加权与最多 8 路有界卷积做实时试听,在 Apple M4 Pro 上 512 采样缓冲下 16 路 1 秒 IR 平均 2.87 毫秒等三组条件保持在 10.67 毫秒预算内,代价是只做简化时域混合而不保证物理最优与感知透明。
针对混合声中只定位目标声源的问题,该研究用跨实例图像做语义提示,先做语义对齐再做多频带空间对齐,在 VGGSound-SSL 上报告平均绝对误差 16.59 度、准确率 71.29%,代价是依赖合成空间音频与人工核验的提示池。
针对未见被试在稀疏测量下难以个性化 HRTF 的问题,该工作用图网络分别做基于被试检索的个性化和基于位置检索的上采样,再用前者输出微调后者,报告在 SONICOM 上 3 个方向时把 LSD 从 4.33 dB 降到 3.60 dB,代价是需要先测少量方向并做两阶段预训练加微调。
MMAU-Pro 用 5305 组野外音频与 49 项技能考查长时、多音频、空间与文化理解,最强模型仅 59.2% 准确率,暴露感知到推理的断层与指令遵循短板。
针对单模态指令在相似物体环境中易歧义的问题,论文提出 MINav 任务与 NaVLA2 个模型,用空间语义双分支音频编码与边想边做解码实现多模态接地,最强证据是在 MINav 上达到 27.2% 成功率与 19.6% 路径加权成功率,代价是仍需三阶段训练与连续仿真渲染。
在听觉引导视觉搜索任务中比较个体化与 KEMAR 非个体化 HRTF 在消声与混响下的行为,证据显示消声下个体化使反应时平均缩短约 200 ms 且优势集中于动作发起而非总运动量,混响下优势消失。
为解决视觉遮挡下世界模型缺乏空间听觉的问题,BinauralVAE 对比三种 VAE 在 0.2 秒双耳片段上的重建能力,显示保留相位的复数 VAE 在低频段实现可听的空间保真,而幅值-only 与四通道实数 VAE 分别因 ITD 丢失与相位塌缩而失效。
针对多房间中墙体遮挡导致单点麦克风观测碎片化的问题,论文用分布式麦克风的拓扑感知图融合与几何约束的冻结大语言模型推理将声学证据补全为物理一致的叙事,并在受控仿真中以三元组与空间一致性等指标验证其相对集中式基线的优势与代价。
针对三阶 HOA 在约 27 kbps 单传输通道下混响建模不足的问题,论文以波束成形参考盲估计相对空间房间脉冲响应并拆为稀疏波包与残差包络进行参数化,在未见 SRIR 上取得与 32 kbps IVAS 相当且验证集上略优的 QASTANet 分数,同时把空间参数压到约 2 kbps。
SwanWeave 针对 FOA 四通道声场的指令编辑任务,用可控房间仿真构造 125K/类单操作与 250K 复合操作的源-目标配对监督,以潜空间流匹配为生成器,配合双层路由的 SE-MoE 与面向错编负样本的 SPO 偏好对齐及分阶段课程,实现一阶段复合编辑,并在客观与人评上一致优于现有通用与立体声编辑基线,代价是依赖仿真数据与约 10 秒短场景。