方向不够用时,用距离与混响把几乎重叠的说话人分开
针对目标说话人提取中干扰声与目标方向接近且混响模糊空间线索的问题,该工作在 SpatialNet 骨干上加入区域方向卷积、高斯核距离编码与混响参数调制,并在方位差为零的极端条件下报告大幅提升,但小距离间隔叠加相似混响指纹时仍有退化。
针对目标说话人提取中干扰声与目标方向接近且混响模糊空间线索的问题,该工作在 SpatialNet 骨干上加入区域方向卷积、高斯核距离编码与混响参数调制,并在方位差为零的极端条件下报告大幅提升,但小距离间隔叠加相似混响指纹时仍有退化。
该文研究已知麦克风与声源位置下用直达与反射距离估计鞋盒房间六面墙的问题,提出三距离全求解器与两距离正交求解器并结合 RANSAC 剔除误检,最强证据是已知 chirp 与未知移动音乐两类仿真及 ScanNet++ 伪合成与实录中仍能找回多面墙,代价是逐墙剔除会误删他墙对应距离且后几面墙更难找。
针对加性噪声下传统加权预测误差去混响鲁棒性下降和多通道延迟观测导致矩阵求逆复杂度为 O(M^3L^3) 的问题,论文用观测自相关矩阵主特征向量重建参考信号并压缩延迟观测子空间,在 8 麦克、混响时间 800 毫秒、白噪声与扩散噪声各两种信噪比仿真中提升去混响增益,代价是压缩维度与迭代近似带来性能与复杂度权衡。
该工作用短时傅里叶变换相位的正弦余弦作输入,结合卷积、双向门控循环和自注意力估计 0-360 度方位角,在仿真混响干净条件下平均角度误差 19.9 度、个性化到说话人与房间后降到 11.3 度,代价是仍需仿真预训练和少量目标域微调才能泛化。
针对特设麦克风网络中到达时差含大量离群点时方向估计易陷入局部极小的问题,该文把估计写成内点数最大化并用两点临界点枚举保证全局最优,在合成数据上 80% 离群率下仍保持可用、在 13 段室外无人机实录上优于离散化与最小二乘,代价是计算量随测量数平方增长且依赖内点界的选取。
针对混响噪声下有多个间歇强干扰时的多通道语音增强问题,论文用黎曼平均的首席特征向量抗干扰、再向样本相关矩阵的子空间投影来抑制噪声,并以 MVDR 波束形成器验证,在所报告的 SIR、SNR、混响和阵元数条件下取得更低的 NMSE 与更高的 PESQ 和 STOI,但低维投影阈值选择与高 SIR 下黎曼分支的退化仍是代价与边界。
针对声源活动范围大致已知但精确位置未知的多通道分离问题,论文把导向矢量约束在预测导向矢量张成的低维子空间内并扩展迭代源导向框架,用固定与灵活两种子空间维度配置在四声源混响仿真中对照标准 ISS 与平均导向矢量 MVDR,代价是仍依赖预测网格与混响条件且原文未给出可复述的逐点数值。
该研究在八麦克风声学无人机检测定位任务上对比保形预测、证据学习与异方差回归,报告显示保形方法按构造实现名义覆盖、证据不确定性与分类错误相关而异方差回归定位误差最低,但纯噪声输入下模型仍保持 0.93 以上置信度而无法拒绝无效目标。
针对噪声加混响同时存在的语音与音乐恢复问题,论文把多麦克风观测的最小二乘数据保真项与正则项组成反问题并用前向后向算法展开为 10 层网络,在已知或估计房间冲激响应与噪声标准差的条件下,LibriSpeech 上多麦克风展开结构取得最好客观与主观指标,代价是依赖房间与噪声先验且去混响层数与去噪器规模不可过小。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对喙鲸回声定位点击序列中因转向或停叫造成的长检测空缺,论文用基于置信传播的多目标跟踪先产生碎片轨迹,再经平滑与拼接补全连续轨迹,在仿真与 5 段真实数据上以 GOSPA 总误差下降为证据,但拼接同时抬高了定位与虚假目标误差。
论文把多通道回放检测定义为按声学环境逐个学习的域增量问题,用 ReMASC 全部 24 种顺序对比朴素微调、EWC、GPM 与任务专用波束形成器,最强证据是 TSB 显著降低平均错误率但未减少遗忘,而最后出现的环境主导最终性能。
该文要解决厅堂在人员与声源变化下混响时间漂移的问题,选择用卷积神经网络估计当前混响时间再由强化学习调节面板吸声系数的闭环路线,给出的最强证据是动态条件下把混响时间维持在目标 0.15 秒以内,代价是全过程依赖仿真反馈且未报告真实厅堂部署的延迟与能耗实测。
针对未知发射时间的单声源被动定位,论文把问题保持为 ToA 最小二乘并联合估计位置与发射时刻,用基于边的分布式 ADMM 给出闭式局部更新,仿真显示严格停止阈值下其趋势接近集中式求解器与 CRLB 参考,但宽松阈值出现高位平台且收敛只对平滑近似证明。
针对传统降噪不分期望声与噪声一起压制的问题,该文把保向降噪写成降噪项与保持项加权优化,用方向调制的卷积网络从混合参考一次估计多通道 FIR 滤波器组,在 3300 个仿真场景以 22.8 dB 降噪和 -11.4 dB 期望失真取得折中,代价是近方向受阵列可分性限制且需按几何重训。
针对多房间中墙体遮挡导致单点麦克风观测碎片化的问题,论文用分布式麦克风的拓扑感知图融合与几何约束的冻结大语言模型推理将声学证据补全为物理一致的叙事,并在受控仿真中以三元组与空间一致性等指标验证其相对集中式基线的优势与代价。
声场重建 | 8.7/10
语音分离 | 7.5/10
语音增强 | 7.3/10
语音分离 | 6.5/10