WanSong v1.0 Technical Report
📄 WanSong v1.0 Technical Report 标签:#音乐生成 #扩散模型 #歌唱生成 #强化学习 #音频理解 7.6/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 ✅ 7.6/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐生成 | #扩散模型 | #歌唱生成 #强化学习 | arxiv 👥 作者与机构 第一作者:未说明 通讯作者:未说明 作者列表:Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou (Wan Team, Alibaba Group) 💡 毒舌点评 亮点:双音轨(人声/背景)独立建模方案直击痛点,有效解决了CFG引导下两者质量此消彼长的困境,工程实现细节丰富,展现了工业级长音频生成系统的完整设计。 短板:作为一篇旨在展示“商业级”系统的技术报告,完全缺乏开源承诺与代码/模型释放计划,评估体系(尤其是自研的“音乐性”评估模型)的公正性和可验证性存疑,这极大地削弱了其作为学术论文的可信度和影响力。论文回避了与近期同期、架构相似的强基线(如DiffRhythm2, ACE-Step)的直接实验对比,使其声称的性能优势显得不完整。 ...