ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks
📄 ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks #语音伪造检测 #对比学习 #预训练 #自监督学习 🔥 评分:8.5/10 | arxiv 👥 作者与机构 第一作者:Aurosweta Mahapatra(约翰霍普金斯大学,语言与语音处理中心 (CLSP)) 通讯作者:Berrak Sisman(约翰霍普金斯大学,语言与语音处理中心 (CLSP)),Nicholas Andrews(约翰霍普金斯大学,语言与语音处理中心 (CLSP))(根据联系邮箱和致谢推断) 其他作者: Ismail Rasim Ulgen(约翰霍普金斯大学,语言与语音处理中心 (CLSP)) Kong Aik Lee(香港理工大学) 💡 毒舌点评 亮点:这篇论文的“脑回路”很清奇,不教模型去死记硬背伪造品的长相,而是先让它闭关修炼,通过“听”大量真实语音来内化人类说话时抑扬顿挫的“气韵”(韵律)。这种“先学正道,再辨邪魔”的思路,确实比单纯刷题(拟合伪造数据)高明不少,在面对情感丰富的“影帝级”伪造语音时,表现出了惊人的韧性。 槽点:不过,这套“两阶段修炼法”听起来就挺费算力的,训练步骤繁琐,而且为了“气韵”修炼,还得额外准备一个韵律编码器和说话人嵌入模型,系统复杂度直线上升。最让人嘀咕的是,论文里对“韵律不一致”的具体定义和建模方式,感觉还有点“玄学”,可解释性有待加强。 🔗 开源详情 代码:论文中明确提到将公开代码,并提供了一个项目网站链接:https://prosdd.github.io/ProSDD_website/。预计代码将托管在GitHub上。论文中未提供具体的GitHub仓库地址和stars数量。 模型权重:论文中未明确说明是否会公开预训练或最终的模型权重。 数据集:实验中使用的所有数据集(LibriSpeech, ASVspoof系列, EmoFake, EmoSpoof-TTS)均为公开学术数据集,可通过官方渠道获取。 预训练权重:模型基于公开的预训练XLS-R骨干。 在线Demo:论文中未提及。 依赖的开源项目:论文中明确引用的开源模型/工具包括:XLS-R (SSL backbone), ECAPA-TDNN (说话人嵌入), RawBoost (数据增强), 以及作为基线的RawNet2, AASIST, XLSR-SLS。 📌 核心摘要 这篇论文旨在解决当前语音深度伪造检测(SDD)系统在面对富有表现力和情感的合成语音攻击时泛化能力不足的核心问题。现有方法过度依赖伪造数据,容易学习数据集特定的伪影,而非自然语音的可迁移特征。为此,作者提出了ProSDD,一个创新的两阶段框架。第一阶段,模型仅使用真实语音,通过一个受监督的掩码预测任务,学习以说话人身份为条件的韵律变化(基于音高、语音活动和能量),从而内化自然语音的韵律多样性。第二阶段,模型在欺骗分类任务中,将上述韵律预测任务作为辅助监督目标进行联合优化,以保持对韵律结构的敏感性。实验表明,ProSDD在ASVspoof 2019和2024基准上均优于基线模型,尤其在表达性数据集(如EmoFake和EmoSpoof-TTS)上实现了显著的性能提升(例如,将ASVspoof 2024的EER从25.43%降至16.14%)。该研究证明了显式建模自然语音韵律变异性对于提升SDD系统泛化能力的关键作用。其局限性可能在于对韵律特征的依赖,以及两阶段训练带来的额外计算开销。 🏗️ 模型架构 ProSDD的整体架构基于一个预训练的XLS-R(wav2vec 2.0的多语言版本)自监督学习(SSL)骨干网络,并对其进行两阶段微调。 ...