Assessing AI-generated music detection in real-world broadcast monitoring

📄 Assessing AI-generated music detection in real-world broadcast monitoring 标签:#音频伪造检测 #CNN #数据集 #基准测试 #鲁棒性 6.8/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音频伪造检测 | #CNN | #数据集 #基准测试 | arxiv 👥 作者与机构 第一作者:David López-Ayala(机构未说明) 通讯作者:未说明 作者列表:David López-Ayala(未说明)、Fernando García de la Cruz(未说明)、Pablo Zinemanas(未说明)、Emilio Molina(未说明)、Martín Rocamora(未说明) 💡 毒舌点评 BAMM 的定位对工业广播监控确实有价值,40 小时真实电视录音和 CFM/STB/RTB 三级评测让“合成广播不能完全代表真实广播”这一结论有了比较直接的证据。但审稿人无法忽略一个根本性设计问题:用于标注 BAMM 的五模型集成中包含了本文随后要评测的 CNN Clean,因此 CNN Clean 在 RTB 上的结果带有循环验证成分;同时 AI 类要求五模型一致同意,导致数据集只覆盖“干净条件下容易被集成识别”的 AI 音乐,而非广播场景中的自然分布。再加上评测只对比同一 CNN 架构的两个训练域变体,没有报告 SpecTTTra、逻辑回归、MLP 等已被用作集成组件的检测器在 BAMM 上的表现,“当前 CNN 训练方法不足”的方向性判断可信,但具体的量化边界被明显削弱。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 689 words

How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures

📄 How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures 标签:#音频伪造检测 #CNN #模型评估 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频伪造检测 | #CNN | #模型评估 | arxiv 👥 作者与机构 第一作者:Fernando Garcia de la Cruz(未说明) 通讯作者:未说明 作者列表:Fernando Garcia de la Cruz(未说明)、David López-Ayala(未说明)、Pablo Zinemanas(未说明)、Emilio Molina(未说明)、Martín Rocamora(未说明) 💡 毒舌点评 将"AI音乐检测"从二元判断推向连续能量比回归,并用EnCodec伪影构造可控混合数据,问题意识和方法论都切中混合音乐生产的真实需求。可惜"AI stem"只是codec重建而非真实生成器输出,实验完全在自建pipeline中闭环,回归模型也仅是同一CNN换了输出头,距离部署级检测系统还差一次跨生成器的验证与模型校准。 ...

2026-08-10 · 更新于 2026-08-14 · 2 min · 348 words

Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry

📄 Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry 标签:#音频伪造检测 #模型集成 #语音合成 #自监督学习 #音频理解 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频伪造检测 | #模型集成 | #语音合成 #自监督学习 | arxiv 👥 作者与机构 第一作者:Seunghyun Kim(Soonchunhyang University, Department of AI and Big Data Engineering, Asan, Republic of Korea) 第二作者:Junghyun Kim(Soonchunhyang University, Department of AI and Big Data Engineering, Asan, Republic of Korea) 通讯作者:Jiyoung Woo(Soonchunhyang University, Department of AI and Big Data Engineering, Asan, Republic of Korea) 💡 毒舌点评 这篇论文用一套闭合的竞赛环境,把“多骨干 SSL 集成的防御优势”掰开揉碎讲得透彻,预注册的证伪实验和三维表示几何分析是难得的严谨,为“架构保险”提供了可量化的证据。然而代码、模型、生成器全部闭源,对组织者真实数据 11.25% 误报率的解释依赖一个未经证实的采样率巧合猜想,这让整套结论的可复现性与泛化说服力打了折扣;生成赛道的官方第一名更是建立在一个被团队内部检测器判定为无效的提交上,堪称年度黑色幽默。 ...

2026-08-04 · 更新于 2026-08-14 · 4 min · 752 words

Improved Robustness in AI-Generated Music Detection

📄 Improved Robustness in AI-Generated Music Detection 标签:#音频伪造检测 #CNN #鲁棒性 #可解释性 #音乐生成 8.0/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.0/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频伪造检测 | #CNN | #鲁棒性 #可解释性 | arxiv 👥 作者与机构 第一作者:Emile Dugelay(未说明) 通讯作者:未说明 作者列表:Emile Dugelay(Deezer Research)、Thomas Barand(Deezer Research)、Baptiste Campeas(Deezer Research)、Aurélien Laouar(Deezer Research)、Darius Afchar(Deezer Research)、Romain Hennequin(Deezer Research) 💡 毒舌点评 这篇论文用一个漂亮的对数频率重映射把速度变化攻击转化成了平移不变性问题,轻量架构的鲁棒性是“长”在骨头里的,比“遇事不决就做数据扩增”的套路确实高明一个段位。但它目前只是把速度缩放这一把刀给挡了,对均衡器、动态压缩、有损转码等其他常见的音频“化妆术”视而不见,等于穿了件只能防劈砍、却怕刺戳的铠甲。此外,模型紧耦合于生成器的转置卷积指纹,换个没有这种梳状伪影的生成器架构就得歇菜,跨生成器的通用性几乎为零。 ...

2026-07-31 · 更新于 2026-08-14 · 4 min · 794 words

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

📄 Less is More: Modality-Decoupling for General AIGC Audio-Video Detection 标签:#多模态模型 #自监督学习 #音频伪造检测 #音频理解 #Transformer 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频伪造检测 | #多模态模型 | #自监督学习 #音频理解 | arxiv 👥 作者与机构 第一作者:Jielun Peng(Harbin Institute of Technology) 通讯作者:Xiaopeng Hong(Harbin Institute of Technology) 作者列表:Jielun Peng(Harbin Institute of Technology)、Yabin Wang(Harbin Institute of Technology)、Yaqi Li(Harbin Institute of Technology)、Jincheng Liu(Harbin Institute of Technology)、Xiaopeng Hong(Harbin Institute of Technology)、Athanasios V. Vasilakos(University of Agder) 💡 毒舌点评 论文找到了通用AIGC音视频检测中的真问题——跨模态对齐假设的失效,且用实验数据有力地证伪了它。但方法层面的回应,尤其决策级融合,过于简单粗暴,max规则与独立性假设几乎是把问题本身又当成了答案,复杂度全压在双塔的单模态设计上,却对“如何更好地融合”这一核心后续问题几乎交白卷。 ...

2026-07-30 · 更新于 2026-08-14 · 4 min · 819 words

ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

📄 ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization 标签:#音频伪造检测 #多模态模型 #语音增强 #语音分离 #音频理解 8.3/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频伪造检测 | #多模态模型 | #语音增强 #语音分离 | arxiv 👥 作者与机构 第一作者:Yuxiong Xu(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室) 通讯作者:Bin Li(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室) 作者列表:Yuxiong Xu(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室)、Kaiqing Lin(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室)、Bin Li(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室)、Haodong Li(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室)、Sheng Li(Afirstsoft Technology Group Co., Ltd.) 💡 毒舌点评 这篇论文将一个合理的洞察——用推理链指导多模态取证——包装成了一个工程上相当庞大的框架。它在交叉数据集泛化上的提升令人信服,但方法本身是多个已知组件(CoT、渐进式对齐、多任务损失)的精心组合,缺少一个令人拍案叫绝的“aha moment”。FACoT数据集的构建是最大的工程贡献,但CLAP过滤的可靠性存疑,用0.2相似度阈值一刀切的做法显得过于粗暴。 ...

2026-07-30 · 更新于 2026-08-14 · 2 min · 378 words

Audio Cross Verification Using Dual Alignment Likelihood Ratio Test

📄 Audio Cross Verification Using Dual Alignment Likelihood Ratio Test 标签:#音频伪造检测 #无监督学习 #可解释性 #音频理解 #Transformer 6.5/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频伪造检测 | #无监督学习 | #可解释性 #音频理解 | arxiv 👥 作者与机构 第一作者:未说明(论文中仅列出作者名,未明确标识第一作者) 通讯作者:未说明 作者列表:Heidi Lei, Arm Wonghirundacha, Irmak Bukey, TJ Tsai 机构:未说明 💡 毒舌点评 本文提出了一个基于外部一致性验证的音频取证新范式,其核心方法双重对齐似然比检验(DA-LRT)在框架设计上颇具巧思,可解释性也优于黑箱模型。然而,该工作的“阿喀琉斯之踵”在于其实验评估:仅在一个干净、单说话人、理想压缩的DAPS数据集上进行测试,且篡改素材来自同一录音,这种过于“温室”般的实验环境,极大地削弱了结论对真实、复杂、对抗性场景的说服力,使其实际应用价值大打折扣。论文更像一个概念验证,而非一个已准备好应对现实挑战的系统。 ...

2026-07-21 · 更新于 2026-08-14 · 2 min · 372 words

Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection

📄 Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection 标签:#语音伪造检测 #模型集成 #音频伪造检测 #自监督学习 #音频理解 6.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.4/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音伪造检测 | #模型集成 | #音频伪造检测 #自监督学习 | arxiv 👥 作者与机构 第一作者:André Runewicz(Fraunhofer SIT) 通讯作者:未说明 作者列表:André Runewicz(Fraunhofer SIT)、Karla Schäfer(Fraunhofer SIT)、Martin Steinebach(Fraunhofer SIT) 💡 毒舌点评 一篇典型的面向特定挑战赛的系统技术报告,工程整合能力值得肯定,但学术创新性不足,且完全不开源的做法严重削弱了其作为学术论文的价值。它更像是一个参赛团队的技术总结,而非一篇能推动领域进展的研究。 ...

2026-07-21 · 更新于 2026-08-14 · 2 min · 418 words

PC-Mix: Partial-Component Audio Spoofing Detection under Mixed Speech and Environmental Sound Conditions

📄 PC-Mix: Partial-Component Audio Spoofing Detection under Mixed Speech and Environmental Sound Conditions 标签:#音频伪造检测 #多任务学习 #音频理解 #Transformer #模型评估 8.9/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.9/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音频伪造检测 | #多任务学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Zhenshan Zhang(Zhejiang University & National University of Singapore) 通讯作者:Ming Li(National University of Singapore) 作者列表:Zhenshan Zhang(Zhejiang University & National University of Singapore)、Xueping Zhang(Zhejiang University)、Linxi Li(Zhejiang University)、Yechen Wang(Zhejiang University)、Ming Li(National University of Singapore) 💡 毒舌点评 论文敏锐地抓住了“部分组件欺骗”这一更贴近真实场景的威胁模型,并构建了首个包含环境声音部分欺骗的数据集PC-Mix,数据构建流程设计细致,评估协议全面,为后续研究提供了坚实基础。但实验部分缺少与当前最强部分欺骗检测方法的直接对比,削弱了其声称的贡献力度;且其影响力主要局限于音频安全这一相对垂直的领域。 ...

2026-07-14 · 更新于 2026-08-14 · 2 min · 422 words

SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation

📄 SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation #音频伪造检测 #基准测试 #数据集 #迁移学习 #领域适应 6.5/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.6/1 | 影响 0.8/1.5 | 开源 0.8/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.5/10 | 前50% | #音频伪造检测 | #迁移学习 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Linxi Li(University of Warwick, WMG)、Yuncong Yu(机构未说明,标记为同等贡献) 通讯作者:未说明 作者列表:Linxi Li(University of Warwick, WMG)、Yuncong Yu(机构未说明)、Qianwei Guo(机构未说明)、Liwei Jin(机构未说明)、Yechen Wang(机构未说明)、Carsten Maple(University of Warwick, WMG) 💡 毒舌点评 这篇论文的贡献清晰但格局有限。作为一个基准数据集工作,SynSFX通过"共享提示词子集"为理解生成器artifact提供了一个精妙的诊断工具,其实验有力地揭露了现有检测器学到的只是"生成器指纹"而非"伪造痕迹"这一尴尬现实。然而,作为一篇顶会投稿,其定位略显尴尬。它既缺乏与新近数据集(如CompSpoofV2)在统一基准上的横向PK来确立自身压倒性优势,又完全没有提出任何新的检测方法或算法框架来尝试解决它自己所揭示的难题。这使得整篇论文更像一份深入且严谨的"问题陈述报告",而非一个完整的、有破有立的解决方案。这项工作是扎实且有洞察力的,但它的贡献边界非常清晰,距离方法论的突破尚有一步之遥。 ...

2026-07-07 · 更新于 2026-08-14 · 3 min · 457 words