论文解读
Assessing the Impact of Speaker Identity in Speech Spoofing Detection
音频深度伪造检测 | 8.0/10
音频深度伪造检测 | 8.0/10
语音编码器 | 7.5/10
语音生物标志物 | 7.0/10
说话人识别 | 7.5/10
语音合成 | 7.5/10
共 1 篇 ICASSP 2026 说话人识别 方向论文
语音匿名化 | 7.5/10
语音匿名化 | 7.0/10
说话人验证 | 7.5/10
说话人识别 | 7.5/10
这篇论文旨在探究自监督语音模型(S3M)的不公平性究竟在模型的哪个层级产生。研究团队采用了一种轻量级的线性探针方法,在多个S3M(如WavLM, Wav2Vec2, BEST-RQ, Whisper)的每一层嵌入上,同时评估了说话人识别(SID)和自动语音识别(ASR)任务的整体性能及对不同说话人组
本文旨在解决开放集说话人识别中的鲁棒性问题,即系统在仅有少量目标说话人注册样本的情况下,需同时准确识别已知说话人并可靠拒识未知说话人。作者在先前SpeakerRPL V1框架基础上提出了三项关键改进:
这篇论文的核心贡献在于系统性地揭示并量化了语音抑郁症检测模型中普遍存在的“说话人身份泄露”问题。作者指出,当前许多报告高准确率的模型,其性能可能严重依赖于对说话人身份(声纹)的记忆,而非对抑郁相关声学