Deepfake Audio Detection Using Self-supervised Fusion Representations
📄 Deepfake Audio Detection Using Self-supervised Fusion Representations #音频深度伪造检测 #语音伪造检测 #自监督学习 #预训练 #数据增强 ✅ 7.5/10 | 前25% | #音频深度伪造检测 | #自监督学习 | #语音伪造检测 #预训练 | arxiv 学术质量 5.5/7 | 选题价值 1.5/2 | 复现加成 0.5 | 置信度 高 👥 作者与机构 第一作者:Khalid Zaman(论文中未提及具体机构) 通讯作者:未说明 作者列表:Khalid Zaman(未说明)、Qixuan Huang(未说明)、Muhammad Uzair(未说明)、Masashi Unoki(未说明) 注:论文文本中未提供作者的所属机构信息。 💡 毒舌点评 论文的亮点在于敏锐地抓住了“组件级伪造”这一更贴近现实的场景,并设计了一个将语音和环境声专用编码器进行跨模态融合的框架,思路清晰且实验验证了其有效性。然而,其短板在于“对比不充分”,论文中的基线系统相对简单,缺乏与当前主流深度伪造检测模型(如纯AASIST、或使用单一更强SSL模型的方法)的直接对比,使得其性能提升的绝对说服力打了一些折扣。 🔗 开源详情 代码:https://github.com/OrgHuang/KHUM-ESDD2.git 模型权重:论文中未提及具体模型权重的托管链接(如HuggingFace/ModelScope)。论文中提到的预训练模型为XLS-R和BEATs,其权重信息需从引用的原始论文或相应平台获取。 数据集:CompSpoofV2数据集。论文中提及该数据集是为ESDD2挑战赛引入的,但未提供公开的直接下载链接,应通过挑战赛官方渠道获取。 Demo:论文中未提及 复现材料:论文中详细描述了实验设置,包括:使用PyTorch框架、在单张NVIDIA RTX 4090 GPU上运行、优化器为Adam(初始学习率1e-4)、批次大小64、训练12轮次、采用了加权多任务损失(语音和环境分支权重为1.0,原始分支权重为0.2)及排序正则化(权重0.5)、数据增强策略(多种混合方式和随机噪声注入)以及过采样方法。但论文中未明确提及是否公开完整的训练配置文件或预训练检查点。 论文中引用的开源项目:论文中引用了以下开源项目(模型/工具),但未提供其GitHub等代码仓库链接,信息来源于其引用的原始论文。 XLS-R:预训练语音模型[20] BEATs:预训练环境音模型[21] AASIST:声学反欺骗分类器[22] Wav2vec 2.0:自监督学习模型[16] HuBERT:自监督学习模型[17] WavLM:自监督学习模型[18] 📌 核心摘要 这篇论文旨在解决音频深度伪造检测中的新挑战:语音和环境声音可能被独立篡改的“组件级”伪造问题。其方法核心是提出一个双分支架构,分别使用针对语音的XLS-R和针对环境声的BEATs两个预训练模型提取特征,并通过一个匹配头建模两者差异以估计原始音频,同时利用多头跨注意力机制促进两个分支的信息交互。与主要将音频视为整体的传统方法相比,该工作的创新点在于显式地建模了语音和环境声组件的独立表示及其交互,以捕捉组件间的伪造不一致性。实验在CompSpoofV2数据集上进行,所提方法在测试集上取得了70.20%的F1分数,相比基线系统(63.27%)提升了近7个百分点,环境声音的等错误率(EER)也从42.79%显著降低至18.83%,证明了其有效性。该工作的实际意义在于为更复杂的、包含多种声音成分的真实世界音频伪造检测提供了可行的解决方案。其主要局限性在于实验对比主要局限于挑战赛基线,未与领域内其他先进模型进行广泛对比,且组件间的交互机制相对直接。 ...