论文解读

单麦克风既要分开声音又要估计每个声源的房间响应:DAMSEP 的联合做法

DAMSEP 针对单麦克风混叠下丢失空间信息的问题,用分离主干加共享去混响与多声源复数传递函数估计做联合训练,在 HETMIXR 上以可复述的混响重建约束实现分离与近远排序,最强证据是相对 TF-Locoformer 的 SI-SDRi 提升 0.65 dB,代价是需要成对干净与混响监督和固定扫频解码流程。

 · 约 19 分钟 · 9453 字 阅读 →
论文解读

圆环排序的断点代价:用互补折叠直线排序重组多通道分离的输出顺序

针对平面阵下圆形方位排序在 360 度回绕处带来学习负担的问题,该工作用两个正交折叠直线排序分别训练分离网络再按方位打分二选一,在混响会议室评估中对圆形排序取得小而一致的提升,代价是需要方位估计且推理侧要维护多个网络。

 · 更新于 2026-09-25 · 约 25 分钟 · 12490 字 阅读 →
论文解读

只共享频谱不共享空间:去中心化 ILRMA 如何在分布式麦克风阵列上分离

针对分布式子阵列间通信贵、难同步的问题,论文提出只在子阵列间共享非负矩阵分解变量的三种去中心化独立低秩矩阵分析,并报告基共享变体在混响与采样时间偏移下保持稳定分离的主要证据与建模代价。

 · 更新于 2026-09-25 · 约 16 分钟 · 7714 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 247 分钟 · 123292 字 阅读 →
论文解读

欠定下不失真分离:把时频掩蔽写进切换波束形成器的代价函数

针对麦克风少于声源的欠定盲分离,论文把时频掩蔽引入切换型 MVDR 的目标函数并联合优化滤波器、组合系数与掩蔽,报告在 2 麦 3/4 说话人任务上优于直接掩蔽、FastMNMF 与掩蔽 MVDR,但效果依赖掩蔽质量与声源相对位置。

 · 更新于 2026-09-25 · 约 18 分钟 · 8733 字 阅读 →
论文解读

活动范围已知时,把导向矢量更新压进低维子空间做半盲分离

针对声源活动范围大致已知但精确位置未知的多通道分离问题,论文把导向矢量约束在预测导向矢量张成的低维子空间内并扩展迭代源导向框架,用固定与灵活两种子空间维度配置在四声源混响仿真中对照标准 ISS 与平均导向矢量 MVDR,代价是仍依赖预测网格与混响条件且原文未给出可复述的逐点数值。

 · 更新于 2026-09-25 · 约 21 分钟 · 10084 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 307 分钟 · 153423 字 阅读 →
论文解读

组末才分人、跨组再加权:eConv-TasNet 压缩跳连的分离改进

针对单通道双人语音分离,eConv-TasNet 在保留编码器解码器基础上以组级早分离替代逐单元分离并以指数加权跨组聚合替代全量求和,在多基准上提升分离质量并降低参数与延迟,代价是峰值精度仍低于大参数 Transformer 路线。

 · 更新于 2026-09-25 · 约 20 分钟 · 9572 字 阅读 →
论文解读

先找重层再剪通道:SepPrune 为语音分离模型省算力的三步剪枝

针对语音分离模型分离网络最重、均匀剪枝易伤轻层的矛盾,SepPrune 用结构分析定位、可微掩码选通道、剪后微调恢复的分布优化,在三数据集多骨干上降低参数与计算量,而一轮微调即可恢复大部分性能,但大幅剪枝时恢复速度因结构而异。

 · 更新于 2026-09-25 · 约 17 分钟 · 8155 字 阅读 →
论文解读

从纠缠录音到可控双轨:分离、重建与扩展如何分工保留对话时序

针对全双工对话需要保留轮转、重叠与反馈时序但真实录音纠缠不清的问题,ConversationalVoice 用质量校验的分离、词面固定的重建与上下文约束的扩展三阶段产出共享格式的双轨数据,并在自动评估中保持 0.983 至 0.991 的同说话人相似度与正向区分度,同时以重建提升预测音质而扩展维持相近交互密度。

 · 更新于 2026-09-25 · 约 21 分钟 · 10184 字 阅读 →
论文解读

当发言意愿也需要先验:用 Beta 倾向补全多通道日志的贝叶斯闭环

说话人日志 | 6.6/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11955 字 阅读 →
论文解读

REDnet: Recursive Encoder and Decoder for Speech Separation under Unknown Number of Speakers and Variable Number of Microphones

语音分离 | 8.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5941 字 阅读 →
论文解读

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

语音识别 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5235 字 阅读 →
论文解读

BiTSE: Binaural Target Speaker Extraction in Noisy Multi-Talker Environments for AR Glass Arrays

语音分离 | 5.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9824 字 阅读 →
论文解读

Dynamic Clustering for Cross-Segment Permutation Alignment in Long Speech Separation

语音分离 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6452 字 阅读 →
论文解读

SAGE: Switch-Aware EEG-Guided Soft Gating for Target Speaker Extraction with In-Trial Switching

语音分离 | 7.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4976 字 阅读 →
论文解读

WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction

语音分离 | 7.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7245 字 阅读 →
论文解读

ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

音频伪造检测 | 8.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7713 字 阅读 →
论文解读

TF-MossFormer: Integrating Convolution Gated Local-Global Attentions for Enhanced Time-Frequency Domain Monaural Speech Separation

语音分离 | 6.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5695 字 阅读 →
论文解读

Addressing Limited Data in Auditory Attention Decoding with Diffusion Generative Models

语音分离 | 5.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5908 字 阅读 →