四人餐馆对话要听清谁:CHiME-9 ECHI 在眼镜与助听器上做因果多说话人抽取
论文研究餐馆噪声下四人对话的同伴语音抽取,选择带说话人注册的目标说话人抽取与因果约束,用听音转写正确率与 P.835 质量分证明头部系统相对基线有实质提升,而客观指标与听感排名不一致且保留噪声与保真度不可兼得。
论文研究餐馆噪声下四人对话的同伴语音抽取,选择带说话人注册的目标说话人抽取与因果约束,用听音转写正确率与 P.835 质量分证明头部系统相对基线有实质提升,而客观指标与听感排名不一致且保留噪声与保真度不可兼得。
针对双麦克风线性阵列只能做一阶、难以保持波束形状随指向平移的问题,该研究用深度网络直接估计两通道复权值去逼近预设的一阶与三阶心形差分图案,在端射方向取得高于经典差分与参数化方法的信号失真比,同时保持跨指向与跨频率的形状一致,并以左右各一个转向模型演示立体声录制,代价是训练依赖无混响仿真与固定阵列几何。
针对反无人机音频定位中固定窗长在声学证据与时间对应延迟之间的矛盾,该工作用最小探针提取无标签声学状态并以 PPO 同时选择窗口长度与 Mamba 时间特征权重,在 MMAUD-V1 上以 0.23 s 平均窗口取得 0.30 m 误差与 0.136 s 延迟,代价是需要三阶段训练与跟踪反馈维持。
论文把空间房间脉冲响应的聚合回声方向建模为球谐非负密度,用平方和半定规划做极大似然估计与逆变换采样,再以球面切片 Wasserstein 位移插值直线路径上的声源与反射密度,实验显示 Wasserstein 插值在整条路径上切片距离最小,但代价是切片离散化与非负约束带来的两步优化。
针对漫射噪声下单目标实时提取问题,论文用最大加权似然把 NSR-ILRMA 与 RCSCME 改写为逐帧在线更新,并在静止与移动说话人仿真及真实录音中对比在线与分块批处理路线,其代价是每帧仍需矩阵求逆加速与稳定性控制且处理时间接近移位长度。
该文用理想比值掩蔽比较麦克风、波束形成器和 Ambisonics 三种域的增强,报告显示波束域语音质量最高而 Ambisonics 域更好地保留残留干扰的空间属性,且所有方法都保留目标声源定位线索,但以混响目标为期望才能保住混响。
针对不规则麦克风阵列难以得到可用 FOA 的问题,该文用常规编码加信号相关残差构成四通道接口,并用理论 FOA 教师做帧级置换不变蒸馏来优化事件与定位信息,代价是信号级重建误差反而变大。
针对助听器 10 ms 延迟与头影效应下的可转向增强问题,论文提出 FiLM 条件化的 OnlineSpatialNet 与 IPD 相位保持损失,在 8 ms 窗条件下恢复指向性并在 PESQ/ESTOI/SI-SDR 上接近 32 ms 基线,代价是仍需固定主瓣宽度与衰减上限且依赖仿真 HARTF 训练。
针对多车同时遮挡的非视距预警问题,该工作在原始 8 通道波形上做隔帧未来潜表示预测预训练,再用双向长短期记忆网络做三头微调,在 T 路口验证取得方向与计数与车型同步提升,代价是仅验证至多 2 辆车且跨场景需少样本适配。
针对可穿戴多通道录音中佩戴者自干扰过强与注册音频失配问题,论文用佩戴者抑制加目标提取加后处理三阶段流水线,在开发集上多数客观指标超过官方基线,在测试集上以可懂度下降为代价换取目标语音质量与总体质量提升。
针对两头同龄雄性幼鲸近距离身体接触时连续重叠喀哒声串难以归属的问题,论文用单通道恒 Q 变换谱加步间间隔节律做声学解交织,再用三元紧凑阵列到达时差定位投影到视频验证,在简单场景聚类误差为 0.0%、最难场景达 25.79%,并以 10 度容限实现主要发射者最高 100% 水平视觉一致,代价是垂直方向系统性偏差与近平面阵列几何盲区导致两个场景无法最终归属。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
针对平面阵下圆形方位排序在 360 度回绕处带来学习负担的问题,该工作用两个正交折叠直线排序分别训练分离网络再按方位打分二选一,在混响会议室评估中对圆形排序取得小而一致的提升,代价是需要方位估计且推理侧要维护多个网络。
针对远场多通道会议中混响噪声与重叠语音的日志难题,该工作把神经 FCASA 的高斯源方差模型推广为瘦峰广义高斯与学生 t 分布的重尾模型并统一为高斯尺度混合训练目标,在 AMI、AliMeeting 和 CHiME-6 上报告了日志错误率与 Jaccard 错误率下降,但部分形状参数会退化且跨语料直接迁移仍明显变差。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
针对麦克风间距未知、增益未校准且各通道噪声功率不同的自组织阵列,论文用确定性最大似然把语音序列与传递函数的闭式解代入似然,只留对角噪声协方差做数值优化,在 4 通道 LibriSpeech 仿真上把阵列信噪比做到 21.18/20.63 dB 而逼近已知噪声的广义特征值波束形成上限,代价是每条语音单独迭代约 2000 轮且混响下客观可懂度与音质提升有限。
针对目标与干扰在单个阵列看来同方向而波束形成失效的问题,该研究用几何约束线性解混做空间滤波、再用跨阵列非目标估计构建多通道维纳后置滤波,在三阵列混响实验中多数指标超过 NMF 与 NTF 基线,但稀疏先验强度与混响条件会带来失真与抑制的权衡。
针对可穿戴 6 自由度声音事件定位与检测中混响和噪声破坏声学空间线索的问题,该文用信噪比与混响时间辅助监督学场景嵌入并以此控制音频-运动融合门,在 6DoF SELD 数据集上把聚合误差降到 0.265、相对静态融合降低 5.69%,代价是增加 18.6K 参数和 37.4M 计算量。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对分布式子阵列间通信贵、难同步的问题,论文提出只在子阵列间共享非负矩阵分解变量的三种去中心化独立低秩矩阵分析,并报告基共享变体在混响与采样时间偏移下保持稳定分离的主要证据与建模代价。