Evaluating Pre-trained Speech Encoders for Spontaneous Speech Detection and Out of Domain Synthetic Speech Generalisation in Indic Languages
📄 Evaluating Pre-trained Speech Encoders for Spontaneous Speech Detection and Out of Domain Synthetic Speech Generalisation in Indic Languages 标签:#语音伪造检测 #预训练 #语音属性识别 #多语言 #模型评估 6.0/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音伪造检测 | #预训练 | #语音属性识别 #多语言 | arxiv 👥 作者与机构 第一作者:Varun Rai(Indian Institute of Technology Guwahati, Assam, India) 通讯作者:未说明 作者列表:Varun Rai(Indian Institute of Technology Guwahati, Assam, India)、Pavan Kumar J(AI & Robotics Technology Park (ARTPARK), I-Hub @ IISc, Bangalore, India)、Sujith Pulikodan(AI & Robotics Technology Park (ARTPARK), I-Hub @ IISc, Bangalore, India)、Nihar Desai(AI & Robotics Technology Park (ARTPARK), I-Hub @ IISc, Bangalore, India) 💡 毒舌点评 本文在 22 种印度语言上首次系统评估多个冻结语音编码器,并给出了语言可判别性与自发语音检测之间编码器依赖的折中关系,这是有价值的基准性发现;但合成语音检测只用 Whisper-small 单编码器,OOD 泛化结论又建立在仅四个训练 TTS 系统与两个外部 TTS 系统之上,缺乏与传统 AASIST、RawNet2、CQCC/LFCC 等基线的同条件比较,分类结果也缺少多次运行方差或显著性检验,几何邻近性解释更像观察性关联而非被充分控制的因果结论。 ...