论文解读

只看画面就分割:音频缺席时音频-视觉分割为何失灵

论文指出当前音频-视觉分割模型依赖视觉显著性而忽视音频,用 AVSBench-Robust 的正负音频对照和分类器引导的相似度学习把单源 G-mIoU 做到 87.672 并把负样本误激活压到近零,代价是正样本分割分数略有回落。

 · 更新于 2026-09-24 · 约 18 分钟 · 8657 字 阅读 →
论文解读

多模态指令导航:用语言、图像和声音共同消除目标歧义

针对单模态指令在相似物体环境中易歧义的问题,论文提出 MINav 任务与 NaVLA2 个模型,用空间语义双分支音频编码与边想边做解码实现多模态接地,最强证据是在 MINav 上达到 27.2% 成功率与 19.6% 路径加权成功率,代价是仍需三阶段训练与连续仿真渲染。

 · 更新于 2026-09-24 · 约 20 分钟 · 9630 字 阅读 →
论文解读

个体化 HRTF 为何不只改变定位准确率而是改变定向动作的发起时机

在听觉引导视觉搜索任务中比较个体化与 KEMAR 非个体化 HRTF 在消声与混响下的行为,证据显示消声下个体化使反应时平均缩短约 200 ms 且优势集中于动作发起而非总运动量,混响下优势消失。

 · 更新于 2026-09-24 · 约 23 分钟 · 11134 字 阅读 →
论文解读

多人声场叠加下如何用声音同时还原三维姿态:SoundMHPE 的多尺度与时序解耦

针对多人运动导致声学特征叠加与互反射延迟混叠的问题,SoundMHPE 用多尺度 STFT 编码器与每帧每人独立查询的时序解码器在 6 小时 AMP 数据集上实现多人 3D 姿态估计,并在 MPJPE 等指标上优于声学与 WiFi 基线,代价是需在受控室内采集与同步动捕数据。

 · 更新于 2026-09-24 · 约 23 分钟 · 11142 字 阅读 →
论文解读

用成对心形麦克风测声强方向:紧框架阵列为何能做到 50 Hz 到 20 kHz

论文用消声室实测脉冲响应验证成对心形传声器的声强测向,在 50 Hz 到 20 kHz 内比较 TF24 与 TF6 和 20mm 与 100mm 间距,最强证据是 20mm 的 TF24 在干扰信号比 -20 dB 和 -30 dB 时全频段中值跟踪误差在 2.5 度以内,代价是大间距高频和强干扰下误差明显增大且存在与波长相关的峰。

 · 更新于 2026-09-24 · 约 20 分钟 · 9881 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-04

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 40 分钟 · 19562 字 阅读 →
论文解读

同一停靠点听见两种世界:ARFT 把超声与射频钉在同一坐标上

声源定位 | 6.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11176 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-03

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 49 分钟 · 24532 字 阅读 →
论文解读

把 2M 维坐标压到一条曲线上:BOGE 如何用物理先验与贝叶斯优化校准水下柔性阵

声源定位 | 5.7/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12536 字 阅读 →
论文解读

EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models

声源定位 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5988 字 阅读 →
论文解读

Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

空间音频 | 6.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6952 字 阅读 →
论文解读

A Computationally Efficient Likelihood Approximation for Target Tracking in Time-Varying Multipath Channels

声源定位 | 9.8/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4554 字 阅读 →
论文解读

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

音频事件检测 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5752 字 阅读 →
论文解读

Moving Horizon Estimation for Underwater Target Tracking Based on Time-Difference-of-Arrival Measurements

声源定位 | 6.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5318 字 阅读 →
论文解读

Numerical and perceptual validity of synthetic Head-Related Transfer Functions at scale

声源定位 | 7.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8223 字 阅读 →
论文解读

Neural Array-Generic Direction-of-Arrival Estimation Exploiting Array Transfer Functions

声源定位 | 6.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6231 字 阅读 →
论文解读

Physics-Informed Learning for Robust Acoustic Localization with Calibrated Uncertainty

声源定位 | 6.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6273 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-11

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 114 分钟 · 56810 字 阅读 →
论文解读

Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence

声源定位 | 6.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6953 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-07

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 57 分钟 · 28125 字 阅读 →