ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization
📄 ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization 标签:#音频伪造检测 #多模态模型 #语音增强 #语音分离 #音频理解 8.3/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频伪造检测 | #多模态模型 | #语音增强 #语音分离 | arxiv 👥 作者与机构 第一作者:Yuxiong Xu(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室) 通讯作者:Bin Li(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室) 作者列表:Yuxiong Xu(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室)、Kaiqing Lin(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室)、Bin Li(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室)、Haodong Li(深圳大学,广东省智能信息处理重点实验室,深圳市媒体安全重点实验室)、Sheng Li(Afirstsoft Technology Group Co., Ltd.) 💡 毒舌点评 这篇论文将一个合理的洞察——用推理链指导多模态取证——包装成了一个工程上相当庞大的框架。它在交叉数据集泛化上的提升令人信服,但方法本身是多个已知组件(CoT、渐进式对齐、多任务损失)的精心组合,缺少一个令人拍案叫绝的“aha moment”。FACoT数据集的构建是最大的工程贡献,但CLAP过滤的可靠性存疑,用0.2相似度阈值一刀切的做法显得过于粗暴。 ...