📄 Learning Tight Rejection Boundaries without Negatives for Strict One-Class Audio Deepfake Detection #语音伪造检测
9.3/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1/1.5
🔥 9.3/10 | 前10% | #语音伪造检测 | #无监督学习 | arxiv
👥 作者与机构 第一作者:Yuze Zhao(哈尔滨工业大学深圳) 通讯作者:Wei Jiang(哈尔滨工业大学网络空间安全学院) 作者列表:Yuze Zhao(哈尔滨工业大学深圳)、Kuiyuan Zhang(哈尔滨工业大学网络空间安全学院)、Zhongyun Hua(哈尔滨工业大学深圳)、Yushu Zhang(江西财经大学计算机与人工智能学院)、Qing Liao(哈尔滨工业大学深圳)、Wei Jiang(哈尔滨工业大学网络空间安全学院) 💡 毒舌点评 这篇文章的野心让人眼前一亮:它试图在完全不看任何伪造样本的前提下,仅靠真实语音就训练出一个既能圈定真实分布又能明确划出“哪是假”边界的检测器,这在音频深伪检测领域确实是个硬骨头。方法核心“用结构破坏的探针代替假样本当负类”的想法很巧妙,跨域和未知攻击的鲁棒性提升也相当扎实。不过,亮点背后也藏着隐忧:探针家族纯靠人工设计,万一未来的攻击技术高明到连音频的时序、频谱、相位结构都不带破绽,这套边界恐怕就会被钻空子。另外,在线标准化虽然有效缓解了余弦坍塌,但对比的归一化方法有限,缺乏更深入的理论解释。总体而言,是一篇想法新颖、实验扎实的顶会候选,但在理论深度和终极鲁棒性上仍有待打磨。
📌 核心摘要 本工作瞄准严格单类音频深度伪造检测中的核心难题:如何在仅用真实语音训练、完全不接触任何伪造样本的前提下,学习一个既能压缩真实分布、又能在嵌入空间中明确划出拒绝边界的检测器。 提出 CA-SOADD (Centroid-Anchored Strict One-Class Audio Deepfake Detection),采用“质心锚定的三目标学习”框架:质心紧凑性 (\(\mathcal{L}_{\text{cpt}}\)) 锚定真实核心、良性视图不变性 (\(\mathcal{L}_{\text{binv}}\)) 稳定质心邻域、质心参考的边界塑造 (\(\mathcal{L}_{\text{cabs}}\)) 通过结构破坏探针施加余弦间隔约束,在不引入显式负类的情况下收紧接受域。 与放松的单类方法(训练时引入伪造或辅助负样本)和纯紧凑性驱动的 Deep-SVDD 等彻底划清界限:CA-SOADD 严格对齐推理时的余弦-质心打分规则,首次将离线形边界探针与质心参照间隔引入语音伪造检测,完全避免了对伪造样本的判别学习或代理判别。 在多个基准上验证了有效性:ASVSpoof-2021 LA/DF 上 AUC/EER 达到 96.9%/7.3% 和 96.9%/8.4%,ASVSpoof-5 上 92.7%/13.4%,CtrSVDD 歌唱基准 EER 16.83%,MLAAD 跨语言基准全语言 EER 17.70%,均大幅优于同严格协议下的其他单类基线,并在跨基准迁移(ASVSpoof-2021→ASVSpoof-5)中超越有监督检测器。 贡献了系统的消融分析:证实边界塑造损失、良性不变性、在线标准化均起关键作用,尤其是代理判别损失(BCE、InfoNCE)无法复现增益,证明增益来自评分对齐的边界塑形而非代理判别。此外,探针池按机制族移除的分析验证了整体方法对特定探针的鲁棒性。 实际意义:提供了一种完全脱离伪造样本的开集检测方案,天然适应快速演变的生成攻击,部署时无需收集、标注或假设攻击类型,可降低对抗性语音检测系统的持续维护成本。 主要局限:结构破坏探针池依赖人工设计,对保留自然语音结构但含细微伪造痕迹的攻击覆盖不足;在线标准化缺乏与更多归一化方法的深度对比;跨域场景下阈值需域内真实样本校准;多语言场景禁用 \(\mathcal{L}_{\text{binv}}\),暴露了良性不变性与多中心分离间的潜在冲突;未在工业级真实管道中验证。 🔗 开源详情 代码:https://github.com/120L020310/CA-SOADD (论文声明的开源仓库) 模型权重:未发布 数据集: ASVSpoof-2021 LA/DF:需向 https://www.asvspoof.org/ 申请 ASVSpoof-5:需向 https://www.asvspoof.org/ 申请 CtrSVDD:https://github.com/nii-yamagishilab/CtrSVDD MLAAD:https://github.com/nii-yamagishilab/mlaad 复现材料:附录 B(在线标准化伪代码)、C.3(探针池算子参数与实现细节)、C.4(探针生成器范式诊断)、E(真实阈值校准流程)、F.1/F.2(损失权值与间隔敏感度分析)提供了充分信息;所有实验在单卡 NVIDIA RTX 5090 上完成。 论文引用的开源/公开项目(部分列举): XLSR / wav2vec 2.0: https://github.com/facebookresearch/fairseq/tree/main/examples/wav2vec WavLM: https://github.com/microsoft/unilm/tree/master/wavlm HuBERT: https://github.com/facebookresearch/fairseq/tree/main/examples/hubert Deep-SVDD: https://github.com/lukasruff/Deep-SVDD AASIST: https://github.com/clovaai/aasist RawNet2: https://github.com/jungjee/RawNet CSI: https://github.com/alinlab/CSI 其他引用的方法(OC-SVM, CutPaste, NAD, OC-Softmax, LCNN, RawGAT, ABC-CapsNet, MPE, ASDG, IG-SVD, NaturalSpeech 3, MaskGCT 等)的官方仓库或论文出处已在原文参考文献中标注。 🏗️ 方法概述和架构 CA-SOADD 严格遵循单类学习协议,训练全程只使用真实语音,推理采用余弦相似度到质心的打分规则。整体流程如图2所示:原始真实语音波形 \(x\) 经过几何稳定表征提取器 \(f_\theta\) 得到句级嵌入 \(z\),嵌入经过在线标准化后参与三目标联合训练,同时维护一个仅从真实样本更新的运行质心 \(c\)。
...