单麦克风既要分开声音又要估计每个声源的房间响应:DAMSEP 的联合做法
DAMSEP 针对单麦克风混叠下丢失空间信息的问题,用分离主干加共享去混响与多声源复数传递函数估计做联合训练,在 HETMIXR 上以可复述的混响重建约束实现分离与近远排序,最强证据是相对 TF-Locoformer 的 SI-SDRi 提升 0.65 dB,代价是需要成对干净与混响监督和固定扫频解码流程。
DAMSEP 针对单麦克风混叠下丢失空间信息的问题,用分离主干加共享去混响与多声源复数传递函数估计做联合训练,在 HETMIXR 上以可复述的混响重建约束实现分离与近远排序,最强证据是相对 TF-Locoformer 的 SI-SDRi 提升 0.65 dB,代价是需要成对干净与混响监督和固定扫频解码流程。
针对平面阵下圆形方位排序在 360 度回绕处带来学习负担的问题,该工作用两个正交折叠直线排序分别训练分离网络再按方位打分二选一,在混响会议室评估中对圆形排序取得小而一致的提升,代价是需要方位估计且推理侧要维护多个网络。
针对分布式子阵列间通信贵、难同步的问题,论文提出只在子阵列间共享非负矩阵分解变量的三种去中心化独立低秩矩阵分析,并报告基共享变体在混响与采样时间偏移下保持稳定分离的主要证据与建模代价。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对麦克风少于声源的欠定盲分离,论文把时频掩蔽引入切换型 MVDR 的目标函数并联合优化滤波器、组合系数与掩蔽,报告在 2 麦 3/4 说话人任务上优于直接掩蔽、FastMNMF 与掩蔽 MVDR,但效果依赖掩蔽质量与声源相对位置。
针对声源活动范围大致已知但精确位置未知的多通道分离问题,论文把导向矢量约束在预测导向矢量张成的低维子空间内并扩展迭代源导向框架,用固定与灵活两种子空间维度配置在四声源混响仿真中对照标准 ISS 与平均导向矢量 MVDR,代价是仍依赖预测网格与混响条件且原文未给出可复述的逐点数值。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对单通道双人语音分离,eConv-TasNet 在保留编码器解码器基础上以组级早分离替代逐单元分离并以指数加权跨组聚合替代全量求和,在多基准上提升分离质量并降低参数与延迟,代价是峰值精度仍低于大参数 Transformer 路线。
针对语音分离模型分离网络最重、均匀剪枝易伤轻层的矛盾,SepPrune 用结构分析定位、可微掩码选通道、剪后微调恢复的分布优化,在三数据集多骨干上降低参数与计算量,而一轮微调即可恢复大部分性能,但大幅剪枝时恢复速度因结构而异。
针对全双工对话需要保留轮转、重叠与反馈时序但真实录音纠缠不清的问题,ConversationalVoice 用质量校验的分离、词面固定的重建与上下文约束的扩展三阶段产出共享格式的双轨数据,并在自动评估中保持 0.983 至 0.991 的同说话人相似度与正向区分度,同时以重建提升预测音质而扩展维持相近交互密度。
说话人日志 | 6.6/10
语音分离 | 8.2/10
语音识别 | 7.1/10
语音分离 | 5.0/10
语音分离 | 6.2/10
语音分离 | 7.3/10
语音分离 | 7.4/10
音频伪造检测 | 8.3/10
语音分离 | 6.3/10
语音分离 | 5.1/10