📄 WanSong v1.0 Technical Report

标签:#音乐生成 #扩散模型 #歌唱生成 #强化学习 #音频理解

7.6/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5

7.6/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐生成 | #扩散模型 | #歌唱生成 #强化学习 | arxiv

👥 作者与机构

  • 第一作者:未说明
  • 通讯作者:未说明
  • 作者列表:Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou (Wan Team, Alibaba Group)

💡 毒舌点评

亮点:双音轨(人声/背景)独立建模方案直击痛点,有效解决了CFG引导下两者质量此消彼长的困境,工程实现细节丰富,展现了工业级长音频生成系统的完整设计。 短板:作为一篇旨在展示“商业级”系统的技术报告,完全缺乏开源承诺与代码/模型释放计划,评估体系(尤其是自研的“音乐性”评估模型)的公正性和可验证性存疑,这极大地削弱了其作为学术论文的可信度和影响力。论文回避了与近期同期、架构相似的强基线(如DiffRhythm2, ACE-Step)的直接实验对比,使其声称的性能优势显得不完整。

📌 核心摘要

本文介绍了WanSong v1.0,一个用于商业级、长时长(最高5分钟)歌曲生成的纯扩散基础模型。论文要解决的核心问题是:现有自回归或多阶段级联方法在生成效率和长时音频保真度上存在挑战,且难以平衡人声与背景音乐的质量。其核心方法是将音频视为连续令牌,采用端到端的单阶段扩散框架。与已有方法相比,主要创新在于提出了“双音轨令牌方案”以独立建模人声和背景音乐,并利用强化学习(RLHF)与人类偏好对齐。实验结果显示,在自建的评估基准上,WanSong在发音错误率(PER)和自研的音乐性评分上优于多个现有系统。例如,在客观评估中,其PER(7.43%)显著低于Suno V5(22.80%)和Mureka V7.6(12.7%)。本文的实际意义在于提供了一个完整的、可用于商业场景的端到端音乐生成系统设计方案。主要局限性包括:评估基准和自研评估模型的公平性与通用性存疑;论文未提供任何开源计划;关键训练细节(如完整超参数、数据集构成)缺失,严重影响可复现性;未与DiffRhythm2等近期强基线进行直接对比。

关键实验结果表格: 表1:VAE重建质量对比(音乐基准,200个样本)

方法STFT ↓MEL ↓SI-SDR (dB) ↑
Stable Audio 21.4300.8564.386
Ours (压缩比2048)1.1630.7724.661
Ours (压缩比1024)1.0290.6297.246

表3:主要模型客观评估对比

模型PER (%) ↓SongEval ↑Muq ↑
LeVo27.113.42 (Cla) …0.34
MurekaV7.612.74.38 (Cla) …0.43
SunoV522.804.44 (Cla) …0.44
WanSong (ours)7.434.47 (Cla) …0.44

表4:自研音乐性评估对比

模型Musicality ↑
LeVo1.69
MurekaV7.63.83
SunoV54.18
WanSong (ours)5.49

表5:令牌压缩比消融实验(PT-90s模型)

VAE压缩比patch size实际压缩比PER(%) ↓Quality (1-5) ↑
20481204819.22.1
10242204820.62.4
10241102415.03.2

🔗 开源详情

  • 代码:论文中未提及代码链接
  • 模型权重:论文中未提及模型权重链接(如HuggingFace或ModelScope)
  • 数据集:论文中未提及训练数据集(“超过600万小时的多语言歌曲数据”)的开源获取方式或具体链接。
  • Demo:论文中未提及在线演示链接
  • 复现材料:论文中提供了关键的技术细节(如模型架构、VAE配置、训练步骤、GPU数量和训练时长),但未提供可下载的完整配置文件、预训练检查点或复现代码包。
  • 论文中引用的开源项目:论文引用了多个模型或工具(如Stable Audio 2, SeedTTS, SongEval, Muq等),但未提供这些项目的具体代码或主页链接。
    • Stable Audio 2
    • SeedTTS
    • SongEval
    • Muq
    • LeVo
    • MurekaV7.6
    • SunoV5 (注:以上项目在论文中仅以名称被引用或用作对比基线,未提供其开源仓库或官网的URL。)

🏗️ 方法概述和架构

WanSong是一个端到端的单阶段纯扩散框架,旨在从文本描述和歌词直接生成高质量、长时长、包含分离人声和背景音乐的立体声歌曲。

WanSong v1.0的核心架构如下图所示,其包含文本编码、音频编码以及混合Transformer主干网络。

Figure 2: Our hybrid-transformer backbone.

下图展示了文本经LLM编码、音频经两个独立VAE分别编码为人声与背景音乐令牌后,通过双流块与单流块构成的混合MMDiT网络进行联合处理的架构细节。

整体流程概述:系统接收文本条件(由LLM编码的歌词和风格描述)和随机噪声,通过一个扩散Transformer主干网络,直接在连续音频潜空间中去噪,最终输出两个独立的音频潜变量流,分别对应人声和背景音乐,再经由VAE解码器还原为双声道波形。所有令牌(文本和音频)在输入模型前会进行拼接,为了提高批次内的令牌吞吐量和利用率,来自不同样本的序列会被打包在一起。

主要组件/模块详解

  1. 变分自编码器 (VAE):其功能是将44.1kHz的原始立体声音频压缩成连续的潜序列表示,作为扩散模型的操作空间。为了保留更多高频细节以利于人声保真,论文采用了一个压缩比为1024的1D VAE(潜空间帧率约43.1 Hz),相比Stable Audio 2的2048压缩比减半。其内部结构是一个编码器-解码器网络,训练时对抗一个多尺度判别器。损失函数包含:多分辨率STFT幅度损失(\(L_{mag}\))、判别器特征匹配损失(\(L_{fmap}\))、铰链对抗损失(\(L_{Adv}\))和KL散度正则损失(\(L_{KL}\))。
  2. 文本条件编码器:采用一个解码器式大语言模型来编码输入的文本提示(包括歌词、风格等),生成文本令牌序列。
  3. 扩散主干网络:混合MMDiT:这是模型的核心,负责执行去噪过程。它接收一个由文本令牌双音轨音频潜变量令牌拼接而成的序列。模型采用了一种混合MMDiT架构,灵感来自Flux。具体而言,网络中只有部分层(比例约为 \(N/(N+K)=0.3\))对不同模态(文本 vs. 音频)学习独立参数,其余层共享参数以减少计算量。此外,在每个Transformer块内使用全共享AdaLN(自适应层归一化)以进一步优化参数效率。
  4. 双音轨令牌方案与联合学习:这是解决人声与背景音乐质量失衡的关键设计。在模型输出端,网络为人声背景音乐生成两个独立的潜变量流。然而,在训练过程中,为了学习两者的内在依赖关系(如节奏、和声),模型在每个Transformer块内部将它们视为同一令牌的不同“通道”进行处理,这被称为“层内联合学习”。这既保证了输出时的分离,又允许模型在学习阶段捕获两者的关联。

组件间的数据流与交互: 文本提示经LLM编码为\(C_{txt}\)。音频方面,原始波形经VAE编码为人声潜变量\(X_{vocal}\)和背景音乐潜变量\(X_{bgm}\)。在扩散训练步骤中,为它们分别添加时间步\(t\)对应的噪声,得到带噪潜变量。这些潜变量与文本条件\(C_{txt}\)一起,拼接成序列输入混合MMDiT网络。网络输出预测的速度场,分别对应人声和背景音乐的去噪方向。损失函数对这两部分的速度预测误差分别加权求和,实现联合优化。

关键设计选择及动机

  • 纯扩散 vs 自回归:放弃自回归以追求更高的并行生成效率和长序列建模的稳定性。
  • 连续潜空间 vs 离散令牌:避免离散化带来的信息损失,直接建模高保真音频的连续分布。
  • 双音轨独立建模:早期实验发现,CFG强度对人声和背景音乐质量的调节方向相反,联合建模会导致模型过度关注人声而抑制复杂的背景音乐。独立建模从根源上解耦了两者。
  • 混合MMDiT:在模型容量和参数效率之间取得平衡,避免为所有层都维护模态独立的参数导致模型过大。

多阶段/多模块逐层展开: 预训练分为三个阶段:先在90秒音频片段上训练,再过渡到300秒,最后进行监督微调(SFT)。这遵循了课程学习的思想,逐步提升模型生成长时序的能力。推理时,通过步蒸馏技术可以加速去噪过程。

💡 核心创新点

  1. 双音轨令牌方案:创新性地提出将人声和背景音乐在潜空间中分离建模,从根本上解决了联合建模时CFG引导无法平衡二者质量的痛点。这使得模型可以直接输出分离的双音轨,极大方便了下游的混音和编辑。
  2. 纯端到端扩散架构:摒弃了复杂的多阶段级联(如AR+扩散)流程,采用单一的连续扩散Transformer直接生成长时音频。这简化了生成流水线,并可能带来更一致的音频质量和更高的推理效率(通过步蒸馏)。
  3. 多维度RLHF对齐:针对音乐生成的独特性,从“音乐性”、“歌词准确性”和“提示对齐”三个维度分别训练奖励模型,并结合DPO(优化全局结构)和ReFL(优化局部细节)进行对齐,策略设计具有针对性。
  4. 高压缩比VAE与域平衡训练:通过将VAE压缩比从行业常见的2048降至1024,显著提升了时频细节的保留能力(SI-SDR提升显著),为高保真生成奠定了基础。同时,在VAE训练时采用50%音乐、40%语音、10%声音的平衡采样,增强了其在音乐和语音两种模态上的泛化能力。
  5. 工程化系统整合:报告详尽地展示了一个从数据构建(6百万小时)、模型设计、多阶段训练到评估的完整工业级音乐生成系统,具有很高的工程参考价值。

📊 实验结果

本部分报告 WanSong v1.0 的实验评估结果,包括 VAE 重建性能、主模型客观评估、自研音乐性评估以及压缩比的消融研究。

在音乐和语音基准上,WanSong 的 VAE(压缩比 1024)在各项指标上均显著优于基线。结果总结于表 1 和表 2。

表1:VAE 重建质量对比(音乐基准,200个样本)

方法STFT ↓MEL ↓SI-SDR (dB) ↑
Stable Audio 21.4300.8564.386
Ours (压缩比2048)1.1630.7724.661
Ours (压缩比1024)1.0290.6297.246

表2:VAE 重建质量对比(语音基准,2000个随机样本)

方法STFT ↓MEL ↓SI-SDR (dB) ↑
Stable Audio 20.9990.7548.653
Ours (压缩比2048)0.7830.59310.371
Ours (压缩比1024)0.6980.45812.922

在自建的200样本、4语言、多风格测试集上,WanSong 与多个商业模型进行了对比,评估指标包括发音错误率(PER)、SongEval 和 Muq 文本对齐分数。结果如表3所示。

表3:主要模型客观评估对比

模型PER (%) ↓SongEval ↑Muq ↑
ClaCohMemMusNat
LeVo27.113.423.593.473.453.280.34
MurekaV7.612.74.384.514.474.354.320.43
SunoV522.804.444.564.534.414.340.44
WanSong (ours)7.434.474.554.574.464.40.44

注:SongEval 包含 Cla (清晰度), Coh (连贯性), Mem (记忆点), Mus (音乐性), Nat (自然度) 五个子维度。

使用作者团队自研的音乐性评估模型(基于80K人工标注歌曲训练,评分范围0-10)进行评估,结果如表4所示。

表4:自研音乐性评估对比

模型Musicality ↑
LeVo1.69
MurekaV7.63.83
SunoV54.18
WanSong (ours)5.49

注:此评估模型由论文团队自行开发,其公正性和泛化能力存疑。

在90秒时长的预训练模型上,研究了不同 VAE 压缩比和 patch size 对性能的影响。结果如表5所示。

表5:令牌压缩比消融实验(PT-90s模型)

VAE压缩比patch size实际压缩比PER(%) ↓Quality (1-5) ↑
20481204819.22.1
10242204820.62.4
10241102415.03.2

注:Quality 分数由专家评估员评定。

关键结论

基于以上实验结果,可以得出以下关键结论:

  1. VAE 设计有效:WanSong 采用的 1024 压缩比 VAE 在音乐和语音重建任务上均显著优于 Stable Audio 2 的 2048 压缩比 VAE,尤其是在 SI-SDR 指标上提升巨大,验证了降低压缩比以保留更多高频细节的设计选择。
  2. 发音准确度领先:在主模型客观评估中,WanSong 在发音错误率(PER)上表现最佳(7.43%),远低于 Suno V5 和 Mureka V7.6,显示出在歌词表达上的优势。
  3. 音乐性自评得分高:在自研的音乐性评估模型上,WanSong 得分(5.49)显著高于其他基线。但需注意,此评估模型的公正性与泛化能力未经外部验证。
  4. 低压缩比是关键:消融实验表明,将实际令牌压缩比从 2048 降至 1024(通过调整 VAE 或 patch size)是提升模型生成质量(PER 和音质)的最有效因素。更高的 patch size 会引入质量损失。
  5. 评估局限性:论文未与 DiffRhythm2、ACE-Step 等近期采用相似技术路线的强基线进行直接实验对比,其 SOTA 声明的全面性有待进一步验证。评估也未涵盖时长稳定性、结构一致性等更细粒度的维度。

🔬 细节详述

  • 训练数据:报告提及使用超过600万小时的多语言歌曲数据,经过严格的五阶段处理流程(收集、预处理、过滤、标注、采样)。VAE训练使用了约2.6亿个音频片段,域比例为音乐:语音:声音=50:40:10。具体数据来源、语言分布、风格构成未详细说明。
  • 损失函数:主模型训练损失为 \(L=\alpha_{vocal}\mathbb{E}_{t}[||\theta(X_{vocal,t},C_{txt},t)-V_{vocal,t}||^{2}]+\alpha_{bgm}\mathbb{E}_{t}[||\theta(X_{bgm,t},C_{txt},t)-V_{bgm,t}||^{2}]\)。\(\alpha_{vocal}\) 和 \(\alpha_{bgm}\) 的具体值未说明。VAE损失包含\(L_{mag}\)、\(L_{fmap}\)、\(L_{Adv}\)、\(L_{KL}\),权重(\(\lambda_{mag}\), \(\lambda_{fmap}\) 等)未说明
  • 训练策略
    • 优化器:AdamW。
    • 学习率:VAE训练中G为2e-4,D为3e-4。主模型训练的学习率未说明
    • Batch size/Warmup未说明
    • 训练步数:VAE在32张A100上训练1.5M步,使用1.5秒音频片段。主模型分三阶段(90s, 300s, SFT)训练,每阶段具体步数未说明
    • 数据增强:VAE训练使用随机相位反转和潜变量噪声增强。主模型训练中的增强策略未说明
  • 关键超参数
    • 模型规模:总模型参数约25B。
    • 架构细节:混合MMDiT中共享层与独立层的比例(\(N/(N+K)=0.3\))。VAE潜维度\(C_z=64\)。其他如层数、隐藏维度、注意力头数等未说明
  • 训练硬件:VAE训练使用32张NVIDIA A100 GPU。主模型训练硬件未说明
  • 推理细节:提到可通过步蒸馏加速,具体蒸馏方法和加速比未说明。解码策略、CFG强度范围等未说明

模型训练使用了超过600万小时的多语言歌曲数据,其完整的五阶段数据处理流水线如下图所示。

Figure 1: Data pipeline overview.

下图详细展示了从多源数据收集、预处理(包括音轨分离)、基于多质量分数过滤、标注到场景感知采样的完整数据构建流程。

⚖️ 评分理由

  • 创新性 (1.8/2):双音轨令牌方案独立建模人声与背景音乐,解决了CFG引导下的质量平衡问题,纯端到端扩散架构简化生成流程,具有系统级创新性。

  • 技术严谨性 (1.3/1.5):基于混合MMDiT架构和双音轨独立建模方案,技术实现合理,VAE训练与域平衡策略有效,但部分细节未完全透明。

  • 实验充分性 (1.0/1.5):提供了VAE重建质量、主模型客观评估和压缩比消融实验,但评估基准自建且自研评估模型未经外部验证,未与近期强基线进行直接对比,实验设计存在公平性漏洞。

  • 清晰度 (0.9/1):论文结构清晰,方法描述详尽,图表和公式完整,但部分细节如损失权重未说明,稍有影响。

  • 影响力 (1.2/1.5):作为商业级音乐生成系统,具有实际应用价值,但评估方法的公平性存疑可能限制其学术影响力。

  • 开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。

  • 可复现性 (0.1/0.5):论文披露了模型架构和基本训练流程,但关键超参数、损失权重、数据集构成等缺失,严重影响可复现性。

  • 工程/实践价值 (1.3/1.5):报告详尽展示了从数据构建到模型设计的完整工业级音乐生成系统,具有很高的工程参考价值和实践意义。

🚨 局限与问题

1. 论文明确承认的局限

  • 评估方法的局限性:论文指出,其使用的客观评估模型EvalScore因训练数据有限(约2000首歌曲),泛化能力难以保证,因此采用了自研的音乐性评估模型。这间接承认了客观评估体系不够稳健。

2. 审稿人发现的潜在问题

  • 评估的公平性与可比性:论文自建的评估基准和自研的评估模型缺乏外部验证,与使用公开标准数据集和公认评估指标的同行工作(如Suno, Mureka)对比时,存在“自说自话”的风险,结果的可比性大打折扣。
  • 与近期强基线的对比缺失:论文未与架构相似的近期强基线(如DiffRhythm2, ACE-Step)进行实验对比,无法判断其性能提升的真正程度,这是实验设计的一个重大漏洞。
  • “双音轨”方案的普适性:该方案是针对人声/背景音乐这一特定分离任务设计的,对于其他需要多轨道生成的音乐场景(如鼓、贝斯、和弦乐器分离)是否同样有效,未作讨论。
  • 长时生成的稳定性:报告声称支持5分钟生成,但未提供关于音乐结构连贯性、长期依赖性、风格一致性等方面的定量或定性分析。
  • 开源与可复现性:完全不开源,且关键训练细节缺失,使得论文的贡献主要停留在概念和工程描述层面,难以被学术社区验证、复现和改进。
  • 损失权重不透明:人声与背景音乐学习强度的平衡系数\(\alpha_{vocal}\)和\(\alpha_{bgm}\)未公开,这使得读者无法评估模型在两者之间是否存在隐性的偏好。

← 返回 2026-07-17 语音/音乐/音频论文速递