ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection

📄 真假混在一起时,只给整段打分为什么不够:ToolDF 的分诊式推理 英文题目:ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection 一句话:针对一段音频里真伪线索并存的混合伪造问题,ToolDF 让音频大模型做分诊编排而非直接判真假,在复合测试上拿到 81.89 的复合平均分,代价是性能仍受分离器和专家检测器上限牵制。 标签:#音频伪造检测 | #多模态模型 | #参数高效微调 | #基准测试 评分:8.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Taewoo Kim:Multi-Modal Research Center, KETI, South Korea;Department of Artificial Intelligence, Korea University, South Korea Young Han Lee:Multi-Modal Research Center, KETI, South Korea Nam In Park:机构信息未在 arXiv HTML 中可靠披露 Chanwoo Kim:Department of Artificial Intelligence, Korea University, South Korea 💬 毒舌点评 把混合真伪检测从整段二分类改写为可解析的编排推理,用监督轨迹把分离与分诊决策学了出来,思路干净。短板是整套裁决仍被外挂分离器和四个专家上限锁死,工具错则编排再漂亮也只是把错误解释得很清楚。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 815 words

Beyond Speech: Dual-Domain SSL Fusion for Unified All-Type Audio Deepfake Detection

📄 类型未知时如何判真假:用两套耳朵听同一段音频 英文题目:Beyond Speech: Dual-Domain SSL Fusion for Unified All-Type Audio Deepfake Detection 一句话:面对语音、环境声、歌声、音乐四类混合且类型未知的真假判别,论文用 EAT-large 与 XLS-R-300M 的双域互补融合构建统一决策边界,并在评测集上以 95.58% Macro-F1 取得第二,代价是依赖封闭挑战集且未开源复现细节。 标签:#音频伪造检测 #自监督学习 #模型融合 评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Cunhang Fan:State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, School of Computer Science and Technology, Anhui University, Hefei, Anhui, China Junqin Cao:State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, School of Computer Science and Technology, Anhui University, Hefei, Anhui, China Tian Gao:Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta, Hefei, Anhui, China Zhipeng Xie:Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta, Hefei, Anhui, China Jun Xue:Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University, Wuhan, Hubei, China Zhao Lv:State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, School of Computer Science and Technology, Anhui University, Hefei, Anhui, China Xin Fang:University of Science and Technology of China, Hefei, Anhui, China 💬 毒舌点评 用 EAT-large 管宽带声学事件、XLS-R-300M 管波形与语音细节的双域分工思路清晰,token 维拼接规避帧对齐、让注意力在统一池中自适应选线索的做法务实,保守的双重门控语音精炼也确实避免了硬路由的类型误判雪崩。但本质仍是 24 层加权求和加拼接再池化的常规融合,对伪造机理没有新假设与新约束,挑战集第二名的成绩建立在闭源、固定阈值 0.5、无显著性检验和仅在 AT-ADD 内验证的封闭环境下,可迁移性与开放域稳健性论证单薄。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1461 words

Decay-Region Group Delay as a Forensic Cue for AI-Generated Impulsive Sounds

📄 别只听响度:为什么 AI 炸点声会在“尾巴”里露馅 英文题目:Decay-Region Group Delay as a Forensic Cue for AI-Generated Impulsive Sounds 一句话:论文把脉冲声真伪的判别从幅度谱移到衰减区的群延迟,用后 50% 帧的跨频带变异性等 9 维特征在同分布下拿到 AUC 0.884、单通道群延迟图让 CNN 达到 90% 以上准确率,却在生成器留一平均准确率仅 66.7% 且 AudioLDM2 上近乎失效,证明这是一条可解释的互补线索而非通用检测器。 标签:#音频伪造检测 #Transformer #音频分类 #可解释性 评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 JaeHyeong Chang:机构信息未在 arXiv HTML 中可靠披露 Chengzhe Sun:机构信息未在 arXiv HTML 中可靠披露 Siwei Lyu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把物理可解释的群延迟衰减区不一致性做成了可验证的取证线索,并用生成器留一与参数敏感性分析诚实地暴露了泛化脆弱性;短板是数据集高度依赖增强与源域错配,且最具区分度的特征在最难的生成器上仍近乎失效,离可用检测器还有距离。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 963 words

On the Robustness of Audio Deepfake Detection under Audio Watermarking

📄 On the Robustness of Audio Deepfake Detection under Audio Watermarking 标签:#音频伪造检测 #音频水印 #鲁棒性 #模型评估 7.7/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频伪造检测 | #音频水印 | #鲁棒性 #模型评估 | arxiv 👥 作者与机构 第一作者:Zi Qian Yong(School of Information Technology, Monash University, Malaysia campus) 通讯作者:正文未明确标注通讯作者 作者列表:Zi Qian Yong、Ajinkya Kulkarni、Julia K. Lau、Hwa Hui Tew、Shu-Min Leong、Raphaël C.-W. Phan、Sébastien Marcel(机构:School of Information Technology, Monash University, Malaysia campus;Idiap Research Institute, Switzerland) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 763 words

AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection

📄 AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection 标签:#音频伪造检测 #自监督学习 #基准测试 #鲁棒性 #模型评估 9.6/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1.4/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 9.6/10 | 前10% | 文档类型:数据集与基准 | 评分置信度:中 | #音频伪造检测 | #自监督学习 | #基准测试 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Yuankun Xie(Communication University of China, Beijing, China;同时隶属 Ant Group) 通讯作者:正文未明确标注 作者列表:Yuankun Xie、Haonan Cheng、Jiayi Zhou、Xiaoxuan Guo、Tao Wang、Changhao Zhang、Jian Liu、Weiqiang Wang、Ruibo Fu、Xiaopeng Wang、Hengyan Huang、Xiaoying Huang、Long Ye、Guangtao Zhai(机构:Communication University of China, Beijing, China;Ant Group;Machine Intelligence, Ant Group, Shanghai, China;Institute of Automation, Chinese Academy of Sciences, Beijing, China;Beijing Institute of Technology, Beijing, China;Shanghai Jiao Tong University, Shanghai, China) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 506 words

Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task

📄 Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task 标签:#音频伪造检测 #Transformer #音乐理解 #鲁棒性 #可解释性 5.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频伪造检测 | #Transformer | #音乐理解 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Alexandru-Ștefan Moroșanu(Gheorghe Asachi Technical University of Iași,Department of Computer Science and Engineering, Faculty of Automatic Control and Computer Engineering) 作者列表: Alexandru-Ștefan Moroșanu(Gheorghe Asachi Technical University of Iași,Department of Computer Science and Engineering, Faculty of Automatic Control and Computer Engineering) Valerian Cecan(Gheorghe Asachi Technical University of Iași,Department of Computer Science and Engineering, Faculty of Automatic Control and Computer Engineering) Ștefan-Daniel Achirei(Gheorghe Asachi Technical University of Iași,Department of Computer Science and Engineering, Faculty of Automatic Control and Computer Engineering) Laura Erhan(Gheorghe Asachi Technical University of Iași,Department of Computer Science and Engineering, Faculty of Automatic Control and Computer Engineering;Free University of Bozen-Bolzano) 通讯作者:论文原文未标注通讯作者。 💡 毒舌点评 该文把“编辑音频”作为硬负例来考验 AI 音乐检测器,并通过按参考曲目分组切分来减少泄漏,问题定义比单纯 AI-vs-原始歌曲更有现实价值;但只有 Random Forest 和 MobileNetV2 这类弱基线,又不公开数据、代码或模型,最终只能证明 PaSST 在这个自建数据集上“能用”,难以支撑更一般的鲁棒性结论。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 935 words

AT-ADD: All-Type Audio Deepfake Detection Challenge Summary

📄 AT-ADD: All-Type Audio Deepfake Detection Challenge Summary 标签:#音频伪造检测 #自监督学习 #语音伪造检测 #模型融合 #基准测试 6.3/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音频伪造检测 | #自监督学习 | #语音伪造检测 #模型融合 | arxiv 👥 作者与机构 第一作者:Yuankun Xie(Communication University of China & Ant Group,北京,中国;原文标注共同贡献) 通讯作者:未说明 作者列表:Yuankun Xie(Communication University of China & Ant Group)、Haonan Cheng(Communication University of China)、Jiayi Zhou(Machine Intelligence, Ant Group,上海)、Xiaoxuan Guo(Communication University of China & Ant Group)、Tao Wang(Machine Intelligence, Ant Group,上海)、Changhao Zhang(Machine Intelligence, Ant Group,上海)、Jian Liu(Machine Intelligence, Ant Group,上海)、Weiqiang Wang(Machine Intelligence, Ant Group,上海)、Ruibo Fu(Institute of Automation, Chinese Academy of Sciences,北京)、Xiaopeng Wang(Beijing Institute of Technology,北京)、Hengyan Huang(Communication University of China)、Xiaoying Huang(Communication University of China)、Long Ye(Communication University of China)、Guangtao Zhai(Shanghai Jiao Tong University,上海) 💡 毒舌点评 该工作总结了覆盖面较广的音频伪造检测挑战,数据规模和双赛道设计有实际价值,尤其是将语音、环境声、歌声和音乐纳入统一评测。短板也很明显:评估集未见生成器只给数量、不给清单,缺少按类型/生成器/扰动的细粒度分析,参赛系统描述更像榜单笔记而非可复现技术报告。论文没有官方基线、消融或统计显著性检验,因此“all-type”和“robust”的性能声明更多停留在排行榜数字层面。 ...

2026-08-17 · 更新于 2026-09-04 · 4 min · 821 words

Assessing AI-generated music detection in real-world broadcast monitoring

📄 Assessing AI-generated music detection in real-world broadcast monitoring 标签:#音频伪造检测 #CNN #数据集 #基准测试 #鲁棒性 6.8/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音频伪造检测 | #CNN | #数据集 #基准测试 | arxiv 👥 作者与机构 第一作者:David López-Ayala(机构未说明) 通讯作者:未说明 作者列表:David López-Ayala(未说明)、Fernando García de la Cruz(未说明)、Pablo Zinemanas(未说明)、Emilio Molina(未说明)、Martín Rocamora(未说明) 💡 毒舌点评 BAMM 的定位对工业广播监控确实有价值,40 小时真实电视录音和 CFM/STB/RTB 三级评测让“合成广播不能完全代表真实广播”这一结论有了比较直接的证据。但审稿人无法忽略一个根本性设计问题:用于标注 BAMM 的五模型集成中包含了本文随后要评测的 CNN Clean,因此 CNN Clean 在 RTB 上的结果带有循环验证成分;同时 AI 类要求五模型一致同意,导致数据集只覆盖“干净条件下容易被集成识别”的 AI 音乐,而非广播场景中的自然分布。再加上评测只对比同一 CNN 架构的两个训练域变体,没有报告 SpecTTTra、逻辑回归、MLP 等已被用作集成组件的检测器在 BAMM 上的表现,“当前 CNN 训练方法不足”的方向性判断可信,但具体的量化边界被明显削弱。 ...

2026-08-10 · 更新于 2026-09-04 · 4 min · 689 words

How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures

📄 How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures 标签:#音频伪造检测 #CNN #模型评估 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频伪造检测 | #CNN | #模型评估 | arxiv 👥 作者与机构 第一作者:Fernando Garcia de la Cruz(未说明) 通讯作者:未说明 作者列表:Fernando Garcia de la Cruz(未说明)、David López-Ayala(未说明)、Pablo Zinemanas(未说明)、Emilio Molina(未说明)、Martín Rocamora(未说明) 💡 毒舌点评 将"AI音乐检测"从二元判断推向连续能量比回归,并用EnCodec伪影构造可控混合数据,问题意识和方法论都切中混合音乐生产的真实需求。可惜"AI stem"只是codec重建而非真实生成器输出,实验完全在自建pipeline中闭环,回归模型也仅是同一CNN换了输出头,距离部署级检测系统还差一次跨生成器的验证与模型校准。 ...

2026-08-10 · 更新于 2026-09-04 · 2 min · 348 words

Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry

📄 Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry 标签:#音频伪造检测 #模型集成 #语音合成 #自监督学习 #音频理解 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频伪造检测 | #模型集成 | #语音合成 #自监督学习 | arxiv 👥 作者与机构 第一作者:Seunghyun Kim(Soonchunhyang University, Department of AI and Big Data Engineering, Asan, Republic of Korea) 第二作者:Junghyun Kim(Soonchunhyang University, Department of AI and Big Data Engineering, Asan, Republic of Korea) 通讯作者:Jiyoung Woo(Soonchunhyang University, Department of AI and Big Data Engineering, Asan, Republic of Korea) 💡 毒舌点评 这篇论文用一套闭合的竞赛环境,把“多骨干 SSL 集成的防御优势”掰开揉碎讲得透彻,预注册的证伪实验和三维表示几何分析是难得的严谨,为“架构保险”提供了可量化的证据。然而代码、模型、生成器全部闭源,对组织者真实数据 11.25% 误报率的解释依赖一个未经证实的采样率巧合猜想,这让整套结论的可复现性与泛化说服力打了折扣;生成赛道的官方第一名更是建立在一个被团队内部检测器判定为无效的提交上,堪称年度黑色幽默。 ...

2026-08-04 · 更新于 2026-09-04 · 4 min · 752 words