📄 Qwen-Music Technical Report

标签:#音乐生成 #多模态模型 #歌唱生成 #扩散模型 #大语言模型

7.4/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.4/1.5

7.4/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐生成 | #多模态模型 | #歌唱生成 #扩散模型 | arxiv

👥 作者与机构

  • 作者列表:来自 Qwen Team。论文附录列出了 Core Contributors 和 Contributors 的名单,其中 Jin Xu 标注为通讯作者。机构未在论文中明确说明。

💡 毒舌点评

亮点在于其将大语言模型的生成范式与专业音乐渲染管线深度融合,构建了一个完整、可控且在评测中表现突出的工业级系统,展现了团队强大的工程整合能力。短板在于整个系统完全闭源,且训练数据筛选、奖励模型构建等关键工程细节的“黑箱”属性,使其学术贡献的可验证性和可复现性大打折扣。

📌 核心摘要

本文介绍了Qwen-Music,一个用于生成带有人声完整歌曲的大规模音乐生成系统。该系统旨在解决从文本描述、歌词和音乐属性生成高质量、结构连贯歌曲,以及基于参考音频进行翻唱的技术挑战。核心方法是将生成过程解耦为语义作曲与声学渲染两个阶段,构建了Qwen-Music-Tokenizer、Qwen-Music-LLM和Qwen-Music-Render三大组件,并引入了旋律链式思维(Melody-CoT)机制进行显式旋律规划。相较于现有方法,其创新在于将大语言模型用于语义token序列建模,并设计了质量分级预训练课程和多阶段偏好对齐策略。在600个中英文提示词的客观评测中,Qwen-Music在16项音乐性和音频质量指标中的13项上取得最优结果;在盲测主观评估中,其生成质量优于MiniMax Music 2.6、Mureka V8、Suno V5等多个商业系统,并相对于最强的Suno V5.5略有优势(50.3% vs 49.7%)。该系统的实际意义在于推动了可控、高保真、结构连贯的端到端歌曲生成技术。主要局限性在于整个系统完全闭源,且训练数据筛选、奖励模型构建等关键工程细节不够透明,限制了其可复现性与学术影响力。

🔗 开源详情

  • 代码:论文中未提及Qwen-Music系统的代码链接。
  • 模型权重:论文中未提及Qwen-Music模型权重链接。
  • 数据集:论文中未提及开源数据集链接或具体获取方式。论文提及模型在超过500万小时的多语言音乐数据上进行训练,并使用了内部基于MOS的奖励模型和评估数据集(如SongBench、SongEval、AI生成的参考集、真实流行歌曲参考集等),但均未提供公开访问链接或开源协议。
  • Demo:论文中未提及在线演示或Demo链接。
  • 复现材料:论文中未提及可公开获取的训练配置、检查点或附录材料。
  • 论文中引用的开源项目:论文中提到了多项第三方技术或工具,但未提供它们的开源项目链接。具体包括:
    • RMVPE:用于提取50 Hz人声音高曲线,提及于Wei et al., 2023,未提供链接。
    • BestRQ:用于Qwen-Music-Tokenizer的双向自监督预训练,提及于Chiu et al., 2022,未提供链接。
    • Qwen3-Embedding-0.6B:用作渲染器中的文本编码器,提及于Zhang et al., 2025,未提供链接。
    • Qwen3.5-Omni:用于初始化Qwen-Music-LLM骨干网络及作为指令遵循的奖励模型,提及于Team, 2026,未提供链接。
    • Qwen3-ASR:用于评估歌词可懂度的自动语音识别系统,提及于Shi et al., 2026,未提供链接。
    • SpectroStream:其2D卷积架构被Spec-VAE参考,提及于Li and others, 2025,未提供链接。
    • εar-VAE、Stable Audio Open (SA-Open)、Levo 2、SAME-L:在渲染器评估中作为基线对比的开源音频VAE系统,提及于各自文献,但文中未提供具体链接。
    • SongBench、SongEval、AudioBox-Aesthetic:用作客观评估指标的框架,提及于各自文献,但文中未提供数据或代码链接。
    • Gemini 3.1 Pro:用于评估标签遵循程度,提及于Comanici et al., 2025,未提供链接。
    • Direct Preference Optimization (DPO)、Group Sequence Policy Optimization (GSPO):提及的训练对齐方法,未提供代码链接。

🏗️ 方法概述和架构

Qwen-Music是一个端到端的音乐生成流水线,其核心思想是将复杂的歌曲生成任务分解为“语义作曲”和“声学渲染”两个相对独立的阶段,以平衡生成可控性与输出保真度。整体流程为:用户输入自然语言描述和歌词,系统首先通过一个重写器将其转化为结构化文本条件(包含音乐标签和歌词),然后Qwen-Music-LLM基于该条件自回归地生成一串低帧率(25 Hz)的离散音乐语义token,最后Qwen-Music-Render将这些语义token连同文本条件作为指导,渲染生成48kHz的高保真立体声音频波形。

主要组件详解:

  1. Qwen-Music-Tokenizer:负责将原始音频波形压缩为25 Hz的单码本音乐语义token流。其骨干网络是一个0.6B参数的Conformer编码器,包含卷积前端和24层Conformer。训练分为四个阶段:首先使用BestRQ进行双向自监督预训练学习通用音乐表征;然后将注意力转换为因果模式以适应自回归建模;接着进行多任务监督微调(SFT),使用CTC歌词转录、Mel频谱图重建和色度特征重建三个损失函数,迫使编码器表征同时保留语义和声学信息;最后插入一个包含32768个码字的向量量化(VQ)瓶颈,并通过平滑插入和分阶段解冻的稳定训练策略完成最终离散化。输出即为供下游LLM使用的25 Hz token序列。

下图概述了Qwen-Music-Tokenizer的训练流程。

Figure 5: Overview of Qwen-Music-Tokenizer. The tokenizer maps music waveforms to 25 Hz Music Semantic Tokens through BestRQ pretraining, causal adaptation, multi-task SFT, and VQ tokenizer training.

图中展示了四个训练阶段:双向预训练、因果适应、多任务SFT和VQ微调。

  1. Qwen-Music-LLM:核心是一个基于33B参数Qwen3.5-Omni初始化的自回归大语言模型。它接收文本条件(标签和歌词),并预测音乐语义token序列。其关键创新是Melody-CoT(旋律链式思维)机制。在生成完整的混合音乐语义token之前,模型可以先生成一个由旋律token组成的中间计划。这些旋律token由专门的旋律分词器从参考音频的基频轮廓中提取:先用RMVPE提取50Hz基频,下采样至6.25Hz,然后转换为相对于序列中位数的相对MIDI音高偏移,并量化为256个离散值。这种相对表示法避免了泄露绝对音高和音色信息。在训练时,模型混合学习三种序列模式:纯文本到音乐、带段落级旋律CoT的生成、以及带唯一段落级旋律CoT的生成,后者通过为重复段落(如副歌)只采样一个代表性旋律,防止模型过度依赖参考。

  2. Qwen-Music-Render:负责将离散的语义token“渲染”成高保真波形,包含三个子阶段。

    • 扩散Transformer(DiT):一个1.3B参数的Diffusion Transformer,接收带噪声的连续声学潜变量,以及作为条件的音乐语义token序列和文本嵌入(通过冻结的文本编码器提取并经Transformer处理)。通过条件流匹配预测去噪后的潜变量。文本条件通过交叉注意力注入,并支持分类器自由引导(CFG),采用“文本丢弃”策略。
    • Spec-VAE:一个类似SpectroStream的2D卷积自动编码器。编码器将48kHz立体声STFT复数频谱图压缩为128维、25Hz的潜变量(192倍压缩)。解码器从潜变量重建粗略的复数频谱图。其解码器中引入了Spec-SnakeBeta激活函数,这是一种频率感知的激活函数,其周期性调制参数沿频率轴学习,初始化基于对数频率先验。
    • Band-Mode Refiner:一个轻量的ConvNeXt-1D模块,用于对Spec-VAE解码器的输出进行精修。它根据频率带的特点应用不同策略:低频仅修正相位,中频同时修正幅度和相位,高频仅修正幅度。初始化时所有权重为零,确保训练稳定。

下图详细展示了Qwen-Music-Render的内部架构。

Figure 6: Overview of Qwen-Music-Render. Music Semantic Tokens and text conditions guide a semantic-conditioned DiT that predicts acoustic latents. Spec-VAE decodes the latents into complex spectrograms, and the Band-Mode Refiner corrects b

图中展示了DiT、Spec-VAE和Band-Mode Refiner如何协同工作,将语义token转换为音频波形。

组件间数据流:文本描述 -> 重写器 -> 结构化文本条件 -> Qwen-Music-LLM(条件化生成)-> 音乐语义token序列 -> Qwen-Music-Render(结合文本条件进行渲染)-> DiT预测声学潜变量 -> Spec-VAE解码器生成粗略频谱图 -> Band-Mode Refiner精修 -> 逆STFT得到48kHz立体声波形。

下图展示了Qwen-Music系统的完整推理数据流。

Figure 4: Overview of the Qwen-Music inference pipeline. Given a user request, Qwen-Music first rewrites the natural-language description into a structured textual condition, including musical tags (such as genre, singer characteristics, in

图中清晰显示了从文本输入到最终音频输出的各个阶段,包括重写器、LLM和渲染器的交互。

关键设计选择:采用语义token作为中间表示,是为了在降低LLM建模的序列长度和计算复杂度的同时,保留足够的音乐语义信息,而将高频声学细节的恢复交给专门的渲染器。Melody-CoT的设计则平衡了旋律控制力和风格自由度。

💡 核心创新点

  1. Melody-CoT(旋律链式思维)机制:在文本到音乐生成中引入显式旋律规划步骤,先生成粗粒度的旋律轮廓token序列,再生成完整的音乐。这解决了文本提示通常不指定具体旋律的问题,提升了生成的结构性和可控性。同时,它为翻唱生成提供了统一的接口,通过替换参考旋律token来实现风格迁移。
  2. 质量分级预训练课程:为应对5M小时异质音乐数据的质量差异,论文训练了一个内部MOS预测模型对数据按质量排序,并设计了从低质量(Q3-Q6)到高质量(Q2、Q1)的三阶段课程学习策略。这比简单丢弃低质数据更高效,使模型先广泛覆盖,再逐步聚焦于高质量生成。
  3. Band-Mode Refiner(频带模式精修器):针对不同频率带在幅度和相位重建上的不同误差特性,设计了一个轻量级后处理模块,分别采用相位修正、联合修正和幅度修正策略。该设计有效提升了Spec-VAE解码后的频谱保真度,尤其在中低频段。
  4. Spec-SnakeBeta激活函数:将BigVGAN中的SnakeBeta激活扩展为频率感知版本,其周期性调制参数沿STFT频率轴独立学习,并基于对数频率进行初始化。这使神经网络能更好地适应不同频段的声学特性。
  5. 完整的工业级系统与训练流程:报告详细构建了从数据筛选(声学质量管道)、模型训练(多阶段课程与多阶段对齐)到推理渲染的完整pipeline,提供了系统级的大规模音乐生成解决方案,工程参考价值高。

📊 实验结果

论文在文本到音乐生成和翻唱生成两个任务上进行了全面评估。

下图展示了在盲测中,Qwen-Music与领先商业系统的胜率对比。

Figure 2: Blind A/B preference results between Qwen-Music and leading proprietary systems, including MiniMax Music 2.5+, MiniMax Music 2.6, Mureka V8, Suno V5, and Suno V5.5, judged by professional human raters. Each pair is evaluated under

从图中可见,Qwen-Music在多个对比中获得超过50%的胜率,显示其竞争力。

文本到音乐生成(600个中英文提示词): 客观指标评测结果如下表所示:

指标 (↑)Qwen-MusicSuno V5.5Suno V5Mureka V8MiniMax Music 2.6MiniMax Music 2.5+
SongBench
旋律7.036.707.016.986.646.41
编曲7.357.037.207.146.726.45
音乐性6.225.836.126.055.675.50
人声7.446.957.377.386.996.89
器乐7.246.857.037.016.646.52
混音7.136.887.076.976.596.38
结构6.946.836.987.026.556.27
SongEval
连贯性4.554.284.444.494.334.28
音乐性4.424.124.304.364.194.15
记忆度4.514.274.434.514.294.23
清晰度4.454.174.334.374.234.17
自然度4.374.104.274.374.164.08
AudioBox-Aesthetic
内容享受度7.477.357.407.317.397.42
内容有用性7.867.857.757.677.827.83
制作复杂度6.646.676.716.676.646.49
制作质量8.158.088.087.958.158.20
标签跟随 (Gemini 3.1 Pro, 1-10)
流派8.088.338.288.468.017.60
情绪8.948.938.988.678.578.20
乐器8.658.808.898.668.157.79
人声性别7.857.547.587.777.577.48
人声音色8.688.718.678.388.318.58
可懂度 (PER, ↓)
PER6.104.196.809.046.406.29
主观盲测中,Qwen-Music获得59.1%胜率(vs MiniMax 2.5+)、66.7%(vs MiniMax 2.6)、58.3%(vs Mureka V8)、55.4%(vs Suno V5)和50.3%(vs Suno V5.5)。在Artificial Analysis Music with Vocals Leaderboard上以JazzCat名义排名第三。

翻唱生成(AI生成参考集):

指标Qwen-Music (section)Qwen-Music (unique section)Suno V5.5Suno V5MiniMax Cover
旋律跟随 (Melody MAE, ↓)1.481.802.001.871.89
标签跟随 (流派)5.927.348.277.145.42

翻唱生成(真实流行歌曲参考集):

指标Qwen-Music (section)Qwen-Music (unique section)MiniMax Cover
SongBench
旋律6.556.576.18
编曲6.846.866.16
音乐性5.755.795.30
人声7.077.096.73
器乐6.967.006.41
混音6.666.676.25
结构6.486.466.13
可懂度 (PER, ↓)20.2018.4922.48
旋律跟随 (Melody MAE, ↓)1.441.801.76
标签跟随
流派6.907.355.84
情绪7.488.057.05
乐器8.058.307.23
人声性别8.889.186.80
人声音色8.218.547.75

Qwen-Music-Render 消融实验:

潜在骨干文本条件CFG策略SongBench (旋律)SongBench (音乐性)SongEval (连贯性)
Levo 2 VAELM-token drop6.555.664.28
Levo 2 VAE标签+歌词LM-token drop6.565.714.31
Spec-VAE仅标签LM-token drop6.886.044.44
Spec-VAE标签+歌词Full-drop6.896.054.38
Spec-VAE标签+歌词LM-token drop6.886.044.39
Spec-VAE标签+歌词Text-drop6.966.174.47

🔬 细节详述

  • 训练数据:超过500万小时的多语言音乐数据。具体来源未说明。使用内部MOS奖励模型进行质量评分,并按流派内百分位数分为7个质量等级(Q1-Q7),丢弃最低的Q7,使用Q1-Q6训练。用于Renderer训练的数据经过严格的声学质量管道筛选。
  • 损失函数
    • Qwen-Music-Tokenizer Stage 1: BestRQ掩码预测损失(交叉熵)。
    • Stage 3 SFT: 组合损失 = CTC歌词损失 + Mel频谱图重建损失(谱收敛+幅度) + 色度特征重建损失。
    • Stage 4 VQ: 上述SFT损失(CTC权重降为0.5) + VQ承诺损失。
    • Qwen-Music-LLM: 标准的下一token预测交叉熵损失,同时应用于旋律CoT区域和音乐语义token区域。
    • Qwen-Music-Render DiT: 条件流匹配损失。
    • Spec-VAE + Refiner: 组合损失 = 多分辨率STFT损失 + IF/GD相位损失 + LSGAN对抗损失(含特征匹配) + KL正则化。还使用了K-加权感知滤波、MSLR立体声分解、自适应对数幅度归一化等技巧。
  • 训练策略
    • Tokenizer训练:四阶段课程(双向BestRQ预训练 -> 因果适应 -> 多任务SFT -> VQ微调)。
    • LLM预训练:三阶段课程(Q3-Q6动态采样 -> Q2退火 -> Q1高质量精炼)。初始化自Qwen3.5-Omni 33B。
    • LLM后训练:三阶段对齐(高质量SFT冷启动 -> 迭代离线DPO -> 在线GSPO)。
    • Render训练:DiT分两阶段(大规模预训练 + 高质量SFT)。Spec-VAE+Refiner分三阶段(重建预训练 -> 引入波形域对抗训练 -> 冻结编解码器,训练Refiner并引入频谱域判别器)。
  • 关键超参数
    • Tokenizer: 0.6B Conformer, 24层,宽度1024,16头,25Hz,码本大小32768。
    • LLM: 33B参数(自Qwen3.5-Omni初始化)。
    • Render DiT: 1.3B参数,32层,宽度1024,24头。
    • Spec-VAE: 输入48kHz立体声STFT (2×480×T),压缩至128维、25Hz潜变量(192倍压缩)。
    • 旋律分词器: 从50Hz基频下采样至6.25Hz,相对MIDI编码,256码本。
  • 训练硬件:未说明。
  • 推理细节:DiT渲染支持分类器自由引导(CFG),论文采用了“文本丢弃”策略,即无条件分支保留语义token但丢弃文本条件。具体引导强度未说明。
  • 数据筛选:报告中详细描述了用于筛选Render训练数据的声学质量管道,包括元数据检查、比特率分析、响度分析、假立体声检测和基于噪声底检测的频谱截止检测。

⚖️ 评分理由

  • 创新性 (1.4/2):基于[A_SUMMARY]和[A_METHOD],创新点包括将LLM用于语义token建模、引入Melody-CoT进行显式旋律规划以及设计质量分级训练课程,这些属于系统级工程整合优化,但并非范式突破。

  • 技术严谨性 (1.1/1.5):基于[A_METHOD],系统架构设计逻辑清晰,各组件功能划分合理,技术细节描述充分。但部分评估环节的严谨性有待商榷,如所用的客观指标本身的信效度讨论。

  • 实验充分性 (1.2/1.5):基于[A_RESULTS]和[A_LIMITS],评估覆盖多任务、多基线、主客观指标,但缺乏与学术界开源模型的对比,且主观评估样本量等细节未充分说明,影响了评估的全面性。

  • 清晰度 (0.9/1):基于[A_METHOD],论文组织结构良好,图表清晰。但部分技术描述略显冗长,在Renderer损失函数等模块堆砌大量技术名词,可能增加读者理解负担。

  • 影响力 (1.3/1.5):基于[A_SUMMARY]和[A_METHOD],该工作直接针对音乐生成核心任务,展示了强大的系统构建能力和工程整合实践,其完整的工业级pipeline对业界和学界均有重要参考意义。

  • 开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。

  • 可复现性 (0.1/0.5):基于[A_LIMITS]和[A_OPEN],尽管描述了架构和许多流程细节,但关键信息大量缺失,包括:训练数据构成、内部MOS奖励模型细节、各组件具体训练硬件与耗时、以及许多训练超参数,独立团队几乎无法复现。

  • 工程/实践价值 (1.4/1.5):基于[A_METHOD]和[A_SUMMARY],作为系统技术报告,其构建了从数据筛选、多阶段课程训练到复杂Renderer训练的完整工业级pipeline,包含大量可操作的工程细节和解决方案,参考价值高。

🚨 局限与问题

  1. 论文明确承认的局限:作者在结论中提到,未来工作将探索更灵活的长上下文音乐结构建模、更精细的歌唱和表演表现力控制,以及更高效的渲染架构。这间接承认了当前系统在长时序结构控制、表现力细节和推理效率上仍有提升空间。
  2. 审稿人发现的潜在问题
    • 完全闭源与可复现性危机:这是最核心的问题。作为一个声称SOTA的大规模系统,不开源代码、模型和数据,使得其所有技术声明和实验结果都无法被独立验证和复现,严重削弱了论文的学术贡献。
    • 训练数据与奖励模型的“黑箱”:5M小时数据的筛选严重依赖一个未公开细节的MOS奖励模型。该模型的质量、偏差直接影响整个课程学习的有效性。DPO/GSPO的奖励信号也来自未充分描述的模型。
    • 模型规模与计算成本未披露:虽然给出了参数量(Tokenizer 0.6B, LLM 33B, DiT 1.3B),但训练所需的具体计算资源(GPU小时数、能耗)未提及,难以评估其可行性和环境成本。
    • 评估的局限性:主观评估虽由专业评委进行,但样本量(600个提示词,每个系统对比)和评委多样性(50人)未详细说明。客观指标如SongBench、SongEval等,其本身的信效度和与人类偏好的相关性也存在讨论空间。翻唱生成评估中,使用AI生成歌曲作为参考集可能与真实应用场景存在差距。

← 返回 2026-07-14 语音/音乐/音频论文速递