只看画面就分割:音频缺席时音频-视觉分割为何失灵
论文指出当前音频-视觉分割模型依赖视觉显著性而忽视音频,用 AVSBench-Robust 的正负音频对照和分类器引导的相似度学习把单源 G-mIoU 做到 87.672 并把负样本误激活压到近零,代价是正样本分割分数略有回落。
论文指出当前音频-视觉分割模型依赖视觉显著性而忽视音频,用 AVSBench-Robust 的正负音频对照和分类器引导的相似度学习把单源 G-mIoU 做到 87.672 并把负样本误激活压到近零,代价是正样本分割分数略有回落。
针对单模态指令在相似物体环境中易歧义的问题,论文提出 MINav 任务与 NaVLA2 个模型,用空间语义双分支音频编码与边想边做解码实现多模态接地,最强证据是在 MINav 上达到 27.2% 成功率与 19.6% 路径加权成功率,代价是仍需三阶段训练与连续仿真渲染。
在听觉引导视觉搜索任务中比较个体化与 KEMAR 非个体化 HRTF 在消声与混响下的行为,证据显示消声下个体化使反应时平均缩短约 200 ms 且优势集中于动作发起而非总运动量,混响下优势消失。
针对多人运动导致声学特征叠加与互反射延迟混叠的问题,SoundMHPE 用多尺度 STFT 编码器与每帧每人独立查询的时序解码器在 6 小时 AMP 数据集上实现多人 3D 姿态估计,并在 MPJPE 等指标上优于声学与 WiFi 基线,代价是需在受控室内采集与同步动捕数据。
论文用消声室实测脉冲响应验证成对心形传声器的声强测向,在 50 Hz 到 20 kHz 内比较 TF24 与 TF6 和 20mm 与 100mm 间距,最强证据是 20mm 的 TF24 在干扰信号比 -20 dB 和 -30 dB 时全频段中值跟踪误差在 2.5 度以内,代价是大间距高频和强干扰下误差明显增大且存在与波长相关的峰。
共分析 30 篇语音/AI 论文
声源定位 | 6.4/10
共分析 18 篇语音/AI 论文
声源定位 | 5.7/10
声源定位 | 8.8/10
空间音频 | 6.9/10
声源定位 | 9.8/10
音频事件检测 | 6.6/10
声源定位 | 6.5/10
声源定位 | 7.6/10
声源定位 | 6.4/10
声源定位 | 6.2/10
共分析 40 篇语音/AI 论文
声源定位 | 6.8/10
共分析 21 篇语音/AI 论文