📄 Qwen-Music Technical Report
标签:#音乐生成 #多模态模型 #歌唱生成 #扩散模型 #大语言模型
7.4/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.4/1.5
✅ 7.4/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐生成 | #多模态模型 | #歌唱生成 #扩散模型 | arxiv
👥 作者与机构
- 作者列表:来自 Qwen Team。论文附录列出了 Core Contributors 和 Contributors 的名单,其中 Jin Xu 标注为通讯作者。机构未在论文中明确说明。
💡 毒舌点评
亮点在于其将大语言模型的生成范式与专业音乐渲染管线深度融合,构建了一个完整、可控且在评测中表现突出的工业级系统,展现了团队强大的工程整合能力。短板在于整个系统完全闭源,且训练数据筛选、奖励模型构建等关键工程细节的“黑箱”属性,使其学术贡献的可验证性和可复现性大打折扣。
📌 核心摘要
本文介绍了Qwen-Music,一个用于生成带有人声完整歌曲的大规模音乐生成系统。该系统旨在解决从文本描述、歌词和音乐属性生成高质量、结构连贯歌曲,以及基于参考音频进行翻唱的技术挑战。核心方法是将生成过程解耦为语义作曲与声学渲染两个阶段,构建了Qwen-Music-Tokenizer、Qwen-Music-LLM和Qwen-Music-Render三大组件,并引入了旋律链式思维(Melody-CoT)机制进行显式旋律规划。相较于现有方法,其创新在于将大语言模型用于语义token序列建模,并设计了质量分级预训练课程和多阶段偏好对齐策略。在600个中英文提示词的客观评测中,Qwen-Music在16项音乐性和音频质量指标中的13项上取得最优结果;在盲测主观评估中,其生成质量优于MiniMax Music 2.6、Mureka V8、Suno V5等多个商业系统,并相对于最强的Suno V5.5略有优势(50.3% vs 49.7%)。该系统的实际意义在于推动了可控、高保真、结构连贯的端到端歌曲生成技术。主要局限性在于整个系统完全闭源,且训练数据筛选、奖励模型构建等关键工程细节不够透明,限制了其可复现性与学术影响力。
🔗 开源详情
- 代码:论文中未提及Qwen-Music系统的代码链接。
- 模型权重:论文中未提及Qwen-Music模型权重链接。
- 数据集:论文中未提及开源数据集链接或具体获取方式。论文提及模型在超过500万小时的多语言音乐数据上进行训练,并使用了内部基于MOS的奖励模型和评估数据集(如SongBench、SongEval、AI生成的参考集、真实流行歌曲参考集等),但均未提供公开访问链接或开源协议。
- Demo:论文中未提及在线演示或Demo链接。
- 复现材料:论文中未提及可公开获取的训练配置、检查点或附录材料。
- 论文中引用的开源项目:论文中提到了多项第三方技术或工具,但未提供它们的开源项目链接。具体包括:
- RMVPE:用于提取50 Hz人声音高曲线,提及于Wei et al., 2023,未提供链接。
- BestRQ:用于Qwen-Music-Tokenizer的双向自监督预训练,提及于Chiu et al., 2022,未提供链接。
- Qwen3-Embedding-0.6B:用作渲染器中的文本编码器,提及于Zhang et al., 2025,未提供链接。
- Qwen3.5-Omni:用于初始化Qwen-Music-LLM骨干网络及作为指令遵循的奖励模型,提及于Team, 2026,未提供链接。
- Qwen3-ASR:用于评估歌词可懂度的自动语音识别系统,提及于Shi et al., 2026,未提供链接。
- SpectroStream:其2D卷积架构被Spec-VAE参考,提及于Li and others, 2025,未提供链接。
- εar-VAE、Stable Audio Open (SA-Open)、Levo 2、SAME-L:在渲染器评估中作为基线对比的开源音频VAE系统,提及于各自文献,但文中未提供具体链接。
- SongBench、SongEval、AudioBox-Aesthetic:用作客观评估指标的框架,提及于各自文献,但文中未提供数据或代码链接。
- Gemini 3.1 Pro:用于评估标签遵循程度,提及于Comanici et al., 2025,未提供链接。
- Direct Preference Optimization (DPO)、Group Sequence Policy Optimization (GSPO):提及的训练对齐方法,未提供代码链接。
🏗️ 方法概述和架构
Qwen-Music是一个端到端的音乐生成流水线,其核心思想是将复杂的歌曲生成任务分解为“语义作曲”和“声学渲染”两个相对独立的阶段,以平衡生成可控性与输出保真度。整体流程为:用户输入自然语言描述和歌词,系统首先通过一个重写器将其转化为结构化文本条件(包含音乐标签和歌词),然后Qwen-Music-LLM基于该条件自回归地生成一串低帧率(25 Hz)的离散音乐语义token,最后Qwen-Music-Render将这些语义token连同文本条件作为指导,渲染生成48kHz的高保真立体声音频波形。
主要组件详解:
- Qwen-Music-Tokenizer:负责将原始音频波形压缩为25 Hz的单码本音乐语义token流。其骨干网络是一个0.6B参数的Conformer编码器,包含卷积前端和24层Conformer。训练分为四个阶段:首先使用BestRQ进行双向自监督预训练学习通用音乐表征;然后将注意力转换为因果模式以适应自回归建模;接着进行多任务监督微调(SFT),使用CTC歌词转录、Mel频谱图重建和色度特征重建三个损失函数,迫使编码器表征同时保留语义和声学信息;最后插入一个包含32768个码字的向量量化(VQ)瓶颈,并通过平滑插入和分阶段解冻的稳定训练策略完成最终离散化。输出即为供下游LLM使用的25 Hz token序列。
下图概述了Qwen-Music-Tokenizer的训练流程。

图中展示了四个训练阶段:双向预训练、因果适应、多任务SFT和VQ微调。
Qwen-Music-LLM:核心是一个基于33B参数Qwen3.5-Omni初始化的自回归大语言模型。它接收文本条件(标签和歌词),并预测音乐语义token序列。其关键创新是Melody-CoT(旋律链式思维)机制。在生成完整的混合音乐语义token之前,模型可以先生成一个由旋律token组成的中间计划。这些旋律token由专门的旋律分词器从参考音频的基频轮廓中提取:先用RMVPE提取50Hz基频,下采样至6.25Hz,然后转换为相对于序列中位数的相对MIDI音高偏移,并量化为256个离散值。这种相对表示法避免了泄露绝对音高和音色信息。在训练时,模型混合学习三种序列模式:纯文本到音乐、带段落级旋律CoT的生成、以及带唯一段落级旋律CoT的生成,后者通过为重复段落(如副歌)只采样一个代表性旋律,防止模型过度依赖参考。
Qwen-Music-Render:负责将离散的语义token“渲染”成高保真波形,包含三个子阶段。
- 扩散Transformer(DiT):一个1.3B参数的Diffusion Transformer,接收带噪声的连续声学潜变量,以及作为条件的音乐语义token序列和文本嵌入(通过冻结的文本编码器提取并经Transformer处理)。通过条件流匹配预测去噪后的潜变量。文本条件通过交叉注意力注入,并支持分类器自由引导(CFG),采用“文本丢弃”策略。
- Spec-VAE:一个类似SpectroStream的2D卷积自动编码器。编码器将48kHz立体声STFT复数频谱图压缩为128维、25Hz的潜变量(192倍压缩)。解码器从潜变量重建粗略的复数频谱图。其解码器中引入了Spec-SnakeBeta激活函数,这是一种频率感知的激活函数,其周期性调制参数沿频率轴学习,初始化基于对数频率先验。
- Band-Mode Refiner:一个轻量的ConvNeXt-1D模块,用于对Spec-VAE解码器的输出进行精修。它根据频率带的特点应用不同策略:低频仅修正相位,中频同时修正幅度和相位,高频仅修正幅度。初始化时所有权重为零,确保训练稳定。
下图详细展示了Qwen-Music-Render的内部架构。

图中展示了DiT、Spec-VAE和Band-Mode Refiner如何协同工作,将语义token转换为音频波形。
组件间数据流:文本描述 -> 重写器 -> 结构化文本条件 -> Qwen-Music-LLM(条件化生成)-> 音乐语义token序列 -> Qwen-Music-Render(结合文本条件进行渲染)-> DiT预测声学潜变量 -> Spec-VAE解码器生成粗略频谱图 -> Band-Mode Refiner精修 -> 逆STFT得到48kHz立体声波形。
下图展示了Qwen-Music系统的完整推理数据流。

图中清晰显示了从文本输入到最终音频输出的各个阶段,包括重写器、LLM和渲染器的交互。
关键设计选择:采用语义token作为中间表示,是为了在降低LLM建模的序列长度和计算复杂度的同时,保留足够的音乐语义信息,而将高频声学细节的恢复交给专门的渲染器。Melody-CoT的设计则平衡了旋律控制力和风格自由度。
💡 核心创新点
- Melody-CoT(旋律链式思维)机制:在文本到音乐生成中引入显式旋律规划步骤,先生成粗粒度的旋律轮廓token序列,再生成完整的音乐。这解决了文本提示通常不指定具体旋律的问题,提升了生成的结构性和可控性。同时,它为翻唱生成提供了统一的接口,通过替换参考旋律token来实现风格迁移。
- 质量分级预训练课程:为应对5M小时异质音乐数据的质量差异,论文训练了一个内部MOS预测模型对数据按质量排序,并设计了从低质量(Q3-Q6)到高质量(Q2、Q1)的三阶段课程学习策略。这比简单丢弃低质数据更高效,使模型先广泛覆盖,再逐步聚焦于高质量生成。
- Band-Mode Refiner(频带模式精修器):针对不同频率带在幅度和相位重建上的不同误差特性,设计了一个轻量级后处理模块,分别采用相位修正、联合修正和幅度修正策略。该设计有效提升了Spec-VAE解码后的频谱保真度,尤其在中低频段。
- Spec-SnakeBeta激活函数:将BigVGAN中的SnakeBeta激活扩展为频率感知版本,其周期性调制参数沿STFT频率轴独立学习,并基于对数频率进行初始化。这使神经网络能更好地适应不同频段的声学特性。
- 完整的工业级系统与训练流程:报告详细构建了从数据筛选(声学质量管道)、模型训练(多阶段课程与多阶段对齐)到推理渲染的完整pipeline,提供了系统级的大规模音乐生成解决方案,工程参考价值高。
📊 实验结果
论文在文本到音乐生成和翻唱生成两个任务上进行了全面评估。
下图展示了在盲测中,Qwen-Music与领先商业系统的胜率对比。

从图中可见,Qwen-Music在多个对比中获得超过50%的胜率,显示其竞争力。
文本到音乐生成(600个中英文提示词): 客观指标评测结果如下表所示:
| 指标 (↑) | Qwen-Music | Suno V5.5 | Suno V5 | Mureka V8 | MiniMax Music 2.6 | MiniMax Music 2.5+ |
|---|---|---|---|---|---|---|
| SongBench | ||||||
| 旋律 | 7.03 | 6.70 | 7.01 | 6.98 | 6.64 | 6.41 |
| 编曲 | 7.35 | 7.03 | 7.20 | 7.14 | 6.72 | 6.45 |
| 音乐性 | 6.22 | 5.83 | 6.12 | 6.05 | 5.67 | 5.50 |
| 人声 | 7.44 | 6.95 | 7.37 | 7.38 | 6.99 | 6.89 |
| 器乐 | 7.24 | 6.85 | 7.03 | 7.01 | 6.64 | 6.52 |
| 混音 | 7.13 | 6.88 | 7.07 | 6.97 | 6.59 | 6.38 |
| 结构 | 6.94 | 6.83 | 6.98 | 7.02 | 6.55 | 6.27 |
| SongEval | ||||||
| 连贯性 | 4.55 | 4.28 | 4.44 | 4.49 | 4.33 | 4.28 |
| 音乐性 | 4.42 | 4.12 | 4.30 | 4.36 | 4.19 | 4.15 |
| 记忆度 | 4.51 | 4.27 | 4.43 | 4.51 | 4.29 | 4.23 |
| 清晰度 | 4.45 | 4.17 | 4.33 | 4.37 | 4.23 | 4.17 |
| 自然度 | 4.37 | 4.10 | 4.27 | 4.37 | 4.16 | 4.08 |
| AudioBox-Aesthetic | ||||||
| 内容享受度 | 7.47 | 7.35 | 7.40 | 7.31 | 7.39 | 7.42 |
| 内容有用性 | 7.86 | 7.85 | 7.75 | 7.67 | 7.82 | 7.83 |
| 制作复杂度 | 6.64 | 6.67 | 6.71 | 6.67 | 6.64 | 6.49 |
| 制作质量 | 8.15 | 8.08 | 8.08 | 7.95 | 8.15 | 8.20 |
| 标签跟随 (Gemini 3.1 Pro, 1-10) | ||||||
| 流派 | 8.08 | 8.33 | 8.28 | 8.46 | 8.01 | 7.60 |
| 情绪 | 8.94 | 8.93 | 8.98 | 8.67 | 8.57 | 8.20 |
| 乐器 | 8.65 | 8.80 | 8.89 | 8.66 | 8.15 | 7.79 |
| 人声性别 | 7.85 | 7.54 | 7.58 | 7.77 | 7.57 | 7.48 |
| 人声音色 | 8.68 | 8.71 | 8.67 | 8.38 | 8.31 | 8.58 |
| 可懂度 (PER, ↓) | ||||||
| PER | 6.10 | 4.19 | 6.80 | 9.04 | 6.40 | 6.29 |
| 主观盲测中,Qwen-Music获得59.1%胜率(vs MiniMax 2.5+)、66.7%(vs MiniMax 2.6)、58.3%(vs Mureka V8)、55.4%(vs Suno V5)和50.3%(vs Suno V5.5)。在Artificial Analysis Music with Vocals Leaderboard上以JazzCat名义排名第三。 |
翻唱生成(AI生成参考集):
| 指标 | Qwen-Music (section) | Qwen-Music (unique section) | Suno V5.5 | Suno V5 | MiniMax Cover |
|---|---|---|---|---|---|
| 旋律跟随 (Melody MAE, ↓) | 1.48 | 1.80 | 2.00 | 1.87 | 1.89 |
| 标签跟随 (流派) | 5.92 | 7.34 | 8.27 | 7.14 | 5.42 |
翻唱生成(真实流行歌曲参考集):
| 指标 | Qwen-Music (section) | Qwen-Music (unique section) | MiniMax Cover |
|---|---|---|---|
| SongBench | |||
| 旋律 | 6.55 | 6.57 | 6.18 |
| 编曲 | 6.84 | 6.86 | 6.16 |
| 音乐性 | 5.75 | 5.79 | 5.30 |
| 人声 | 7.07 | 7.09 | 6.73 |
| 器乐 | 6.96 | 7.00 | 6.41 |
| 混音 | 6.66 | 6.67 | 6.25 |
| 结构 | 6.48 | 6.46 | 6.13 |
| 可懂度 (PER, ↓) | 20.20 | 18.49 | 22.48 |
| 旋律跟随 (Melody MAE, ↓) | 1.44 | 1.80 | 1.76 |
| 标签跟随 | |||
| 流派 | 6.90 | 7.35 | 5.84 |
| 情绪 | 7.48 | 8.05 | 7.05 |
| 乐器 | 8.05 | 8.30 | 7.23 |
| 人声性别 | 8.88 | 9.18 | 6.80 |
| 人声音色 | 8.21 | 8.54 | 7.75 |
Qwen-Music-Render 消融实验:
| 潜在骨干 | 文本条件 | CFG策略 | SongBench (旋律) | SongBench (音乐性) | SongEval (连贯性) |
|---|---|---|---|---|---|
| Levo 2 VAE | 无 | LM-token drop | 6.55 | 5.66 | 4.28 |
| Levo 2 VAE | 标签+歌词 | LM-token drop | 6.56 | 5.71 | 4.31 |
| Spec-VAE | 仅标签 | LM-token drop | 6.88 | 6.04 | 4.44 |
| Spec-VAE | 标签+歌词 | Full-drop | 6.89 | 6.05 | 4.38 |
| Spec-VAE | 标签+歌词 | LM-token drop | 6.88 | 6.04 | 4.39 |
| Spec-VAE | 标签+歌词 | Text-drop | 6.96 | 6.17 | 4.47 |
🔬 细节详述
- 训练数据:超过500万小时的多语言音乐数据。具体来源未说明。使用内部MOS奖励模型进行质量评分,并按流派内百分位数分为7个质量等级(Q1-Q7),丢弃最低的Q7,使用Q1-Q6训练。用于Renderer训练的数据经过严格的声学质量管道筛选。
- 损失函数:
- Qwen-Music-Tokenizer Stage 1: BestRQ掩码预测损失(交叉熵)。
- Stage 3 SFT: 组合损失 = CTC歌词损失 + Mel频谱图重建损失(谱收敛+幅度) + 色度特征重建损失。
- Stage 4 VQ: 上述SFT损失(CTC权重降为0.5) + VQ承诺损失。
- Qwen-Music-LLM: 标准的下一token预测交叉熵损失,同时应用于旋律CoT区域和音乐语义token区域。
- Qwen-Music-Render DiT: 条件流匹配损失。
- Spec-VAE + Refiner: 组合损失 = 多分辨率STFT损失 + IF/GD相位损失 + LSGAN对抗损失(含特征匹配) + KL正则化。还使用了K-加权感知滤波、MSLR立体声分解、自适应对数幅度归一化等技巧。
- 训练策略:
- Tokenizer训练:四阶段课程(双向BestRQ预训练 -> 因果适应 -> 多任务SFT -> VQ微调)。
- LLM预训练:三阶段课程(Q3-Q6动态采样 -> Q2退火 -> Q1高质量精炼)。初始化自Qwen3.5-Omni 33B。
- LLM后训练:三阶段对齐(高质量SFT冷启动 -> 迭代离线DPO -> 在线GSPO)。
- Render训练:DiT分两阶段(大规模预训练 + 高质量SFT)。Spec-VAE+Refiner分三阶段(重建预训练 -> 引入波形域对抗训练 -> 冻结编解码器,训练Refiner并引入频谱域判别器)。
- 关键超参数:
- Tokenizer: 0.6B Conformer, 24层,宽度1024,16头,25Hz,码本大小32768。
- LLM: 33B参数(自Qwen3.5-Omni初始化)。
- Render DiT: 1.3B参数,32层,宽度1024,24头。
- Spec-VAE: 输入48kHz立体声STFT (2×480×T),压缩至128维、25Hz潜变量(192倍压缩)。
- 旋律分词器: 从50Hz基频下采样至6.25Hz,相对MIDI编码,256码本。
- 训练硬件:未说明。
- 推理细节:DiT渲染支持分类器自由引导(CFG),论文采用了“文本丢弃”策略,即无条件分支保留语义token但丢弃文本条件。具体引导强度未说明。
- 数据筛选:报告中详细描述了用于筛选Render训练数据的声学质量管道,包括元数据检查、比特率分析、响度分析、假立体声检测和基于噪声底检测的频谱截止检测。
⚖️ 评分理由
创新性 (1.4/2):基于[A_SUMMARY]和[A_METHOD],创新点包括将LLM用于语义token建模、引入Melody-CoT进行显式旋律规划以及设计质量分级训练课程,这些属于系统级工程整合优化,但并非范式突破。
技术严谨性 (1.1/1.5):基于[A_METHOD],系统架构设计逻辑清晰,各组件功能划分合理,技术细节描述充分。但部分评估环节的严谨性有待商榷,如所用的客观指标本身的信效度讨论。
实验充分性 (1.2/1.5):基于[A_RESULTS]和[A_LIMITS],评估覆盖多任务、多基线、主客观指标,但缺乏与学术界开源模型的对比,且主观评估样本量等细节未充分说明,影响了评估的全面性。
清晰度 (0.9/1):基于[A_METHOD],论文组织结构良好,图表清晰。但部分技术描述略显冗长,在Renderer损失函数等模块堆砌大量技术名词,可能增加读者理解负担。
影响力 (1.3/1.5):基于[A_SUMMARY]和[A_METHOD],该工作直接针对音乐生成核心任务,展示了强大的系统构建能力和工程整合实践,其完整的工业级pipeline对业界和学界均有重要参考意义。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.1/0.5):基于[A_LIMITS]和[A_OPEN],尽管描述了架构和许多流程细节,但关键信息大量缺失,包括:训练数据构成、内部MOS奖励模型细节、各组件具体训练硬件与耗时、以及许多训练超参数,独立团队几乎无法复现。
工程/实践价值 (1.4/1.5):基于[A_METHOD]和[A_SUMMARY],作为系统技术报告,其构建了从数据筛选、多阶段课程训练到复杂Renderer训练的完整工业级pipeline,包含大量可操作的工程细节和解决方案,参考价值高。
🚨 局限与问题
- 论文明确承认的局限:作者在结论中提到,未来工作将探索更灵活的长上下文音乐结构建模、更精细的歌唱和表演表现力控制,以及更高效的渲染架构。这间接承认了当前系统在长时序结构控制、表现力细节和推理效率上仍有提升空间。
- 审稿人发现的潜在问题:
- 完全闭源与可复现性危机:这是最核心的问题。作为一个声称SOTA的大规模系统,不开源代码、模型和数据,使得其所有技术声明和实验结果都无法被独立验证和复现,严重削弱了论文的学术贡献。
- 训练数据与奖励模型的“黑箱”:5M小时数据的筛选严重依赖一个未公开细节的MOS奖励模型。该模型的质量、偏差直接影响整个课程学习的有效性。DPO/GSPO的奖励信号也来自未充分描述的模型。
- 模型规模与计算成本未披露:虽然给出了参数量(Tokenizer 0.6B, LLM 33B, DiT 1.3B),但训练所需的具体计算资源(GPU小时数、能耗)未提及,难以评估其可行性和环境成本。
- 评估的局限性:主观评估虽由专业评委进行,但样本量(600个提示词,每个系统对比)和评委多样性(50人)未详细说明。客观指标如SongBench、SongEval等,其本身的信效度和与人类偏好的相关性也存在讨论空间。翻唱生成评估中,使用AI生成歌曲作为参考集可能与真实应用场景存在差距。