Dual-Granularity Orthogonal Disentanglement for Generalizable Audio Deepfake Detection
📄 Dual-Granularity Orthogonal Disentanglement for Generalizable Audio Deepfake Detection #课程学习 7.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 7.2/10 | 前50% | #课程学习 | #课程学习 | arxiv 👥 作者与机构 作者: Zhuodong Liu, Hugen Lv, Xiangyu Li, Chunhong Yuan 机构: 1 北京交通大学, 中国; 2 上海交通大学, 中国; 3 ITMO University, 俄罗斯 邮箱: 22711104@bjtu.edu.cn, 23722056@bjtu.edu.cn, xiangyuli@sjtu.edu.cn, 521031@niuitmo.ru 💡 毒舌点评 这篇论文像一份精心包装的“轻量级”方案,试图用两个损失项和一个学习率调度器来解决音频深度伪造检测中的一个核心难题——身份泄漏。优点是问题定义明确,框架相对简洁,且在跨数据集评估中确实比简单的梯度反转(GRL)要好。但审稿人必须指出:1)其所谓的“双粒度”正交性(余弦相似度和交叉协方差)在数学上并非完全独立,存在一定的概念重叠;2)核心贡献“避免辅助网络或对抗训练”的优势在论文中被过度强调,因为相关领域(如ALDEN, Beyond Identity)已经展示了更复杂但可能更强大的解耦方法,而本文并未在同等条件下(如相同数据增强、相同评估协议)与这些最前沿方法进行公平、直接的数值对比,只是以“不直接可比”为由简单带过;3)论文声称的“参数效率”(与300M+参数的SSL模型相比)虽然属实,但这种对比本身有些取巧,因为SSL模型的目标和泛化能力通常更广,而本文的模型是高度特化的;4)实验仅在有限的几个数据集和一种训练-测试划分(训练于ASV21-DF,测试于ITW)上验证了跨数据集泛化,对于真实世界中千变万化的合成器类型和录音条件,其泛化边界并未得到充分探索。总体而言,这是一篇扎实的工作,但离顶会要求的“突破性”或“系统性”仍有距离。 ...