论文解读
不用先分离也能听清目标人:以参考语音作声纹提示的统一识别
针对多人重叠时只转写目标说话人并在目标缺席时拒识的问题,该报告用参考语音拼接混合语音加文本提示的端到端大语言模型方案,在合成与真实会议集上报告了目标说话人词错率下降,同时保留单人识别与空文本拒识能力,但拒识率与误拒之间仍需权衡。
针对多人重叠时只转写目标说话人并在目标缺席时拒识的问题,该报告用参考语音拼接混合语音加文本提示的端到端大语言模型方案,在合成与真实会议集上报告了目标说话人词错率下降,同时保留单人识别与空文本拒识能力,但拒识率与误拒之间仍需权衡。
针对脑电与语音采样率不对齐且单路编码只看目标相关特征的问题,TIDENet 用可训练转置卷积做脑电重采样、用结构共享双路编码分别建模相关与无关特征,在 Cocktail Party 和 AVED 上取得最高的 SDR、SI-SDR、STOI、ESTOI 和 PESQ,但单加语音双路时增益有限且 ESTOI 最优变体不是全量模型。
目标说话人提取 | 8.0/10
语音分离 | 8.0/10
共 1 篇 ICASSP 2026 目标说话人提取 方向论文