论文解读

不用先分离也能听清目标人:以参考语音作声纹提示的统一识别

针对多人重叠时只转写目标说话人并在目标缺席时拒识的问题,该报告用参考语音拼接混合语音加文本提示的端到端大语言模型方案,在合成与真实会议集上报告了目标说话人词错率下降,同时保留单人识别与空文本拒识能力,但拒识率与误拒之间仍需权衡。

 · 更新于 2026-09-24 · 约 20 分钟 · 9660 字 阅读 →
论文解读

用可训练插值对齐脑电、以双路编码放大目标差异的目标说话人提取

针对脑电与语音采样率不对齐且单路编码只看目标相关特征的问题,TIDENet 用可训练转置卷积做脑电重采样、用结构共享双路编码分别建模相关与无关特征,在 Cocktail Party 和 AVED 上取得最高的 SDR、SI-SDR、STOI、ESTOI 和 PESQ,但单加语音双路时增益有限且 ESTOI 最优变体不是全量模型。

 · 更新于 2026-09-24 · 约 21 分钟 · 10280 字 阅读 →
论文解读

Adaptive Deterministic Flow Matching for Target Speaker Extraction

目标说话人提取 | 8.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5050 字 阅读 →
论文解读

Flexio: Flexible Single- and Multi-Channel Speech Separation and Enhancement

语音分离 | 8.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3940 字 阅读 →
会议任务专题

ICASSP 2026 - 目标说话人提取

共 1 篇 ICASSP 2026 目标说话人提取 方向论文

 · 更新于 2026-09-24 · 约 4 分钟 · 1713 字 阅读 →