SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation
📄 SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation 标签:#音频生成 #流匹配 #语音合成 #音乐生成 #统一音频模型 7.6/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.6/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #音频生成 | #流匹配 | #语音合成 #音乐生成 | arxiv 👥 作者与机构 第一作者:Yunrui Cai(香港中文大学;实习于快手 Kling Team) 通讯作者:Xu Li(快手 Kling Team)、Helen Meng(香港中文大学) 作者列表: Yunrui Cai(香港中文大学;快手 Kling Team) Xu Li(快手 Kling Team) Yucheng Zhou(快手 Kling Team) Jinchao Li(快手 Kling Team) Dingdong Wang(香港中文大学) Dongchao Yang(香港中文大学) Xixin Wu(香港中文大学) Chen Zhang(快手 Kling Team) Zhiyong Wu(清华大学深圳国际研究生院) Pengfei Wan(快手 Kling Team) Helen Meng(香港中文大学) 💡 毒舌点评 用“连续音频块路由 + 先验/证据冲突门”把条件计算从 token 级提升到局部连续结构,确实比任务级或帧级 MoE 更贴合语音/音乐/音效的短时连续性,受控消融和路由可视化初步撑起了核心 claim。但公开基准上并未全面压过专用 SOTA,复杂场景优势主要靠自家 100 条提示 + Gemini 参考无关裁判背书;代码仓库虽然挂在项目主页,但权重和训练数据依然没有放出,“统一音频场景生成”的增量价值仍需要更独立、更可复现的验证。 ...