<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>歌唱生成 on 语音/音乐/音频论文速递</title>
    <link>https://nanless.github.io/audio-paper-digest-blog/tags/%E6%AD%8C%E5%94%B1%E7%94%9F%E6%88%90/</link>
    <description>每日 AI 自动生成的语音/AI 领域论文深度分析</description>
    <language>zh-cn</language>
    <lastBuildDate>Fri, 17 Jul 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nanless.github.io/audio-paper-digest-blog/tags/%E6%AD%8C%E5%94%B1%E7%94%9F%E6%88%90/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>WanSong v1.0 Technical Report</title>
      <link>https://nanless.github.io/audio-paper-digest-blog/posts/2026-07-17-wansong-v10-technical-report-2607-14749/</link>
      <pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://nanless.github.io/audio-paper-digest-blog/posts/2026-07-17-wansong-v10-technical-report-2607-14749/</guid>
      <description>&lt;h1 id=&#34;-wansong-v10-technical-report&#34;&gt;📄 WanSong v1.0 Technical Report&lt;/h1&gt;
&lt;p&gt;标签：#音乐生成 #扩散模型 #歌唱生成 #强化学习 #音频理解&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;7.6/10&lt;/strong&gt; | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5&lt;/p&gt;
&lt;p&gt;✅ &lt;strong&gt;7.6/10&lt;/strong&gt; | 前25% | 文档类型：系统技术报告 | 评分置信度：高 | #音乐生成 | #扩散模型 | #歌唱生成 #强化学习 | &lt;a href=&#34;https://arxiv.org/abs/2607.14749&#34;&gt;arxiv&lt;/a&gt;&lt;/p&gt;
&lt;h3 id=&#34;-作者与机构&#34;&gt;👥 作者与机构&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;第一作者：未说明&lt;/li&gt;
&lt;li&gt;通讯作者：未说明&lt;/li&gt;
&lt;li&gt;作者列表：Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou (Wan Team, Alibaba Group)&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;-毒舌点评&#34;&gt;💡 毒舌点评&lt;/h3&gt;
&lt;p&gt;亮点：双音轨（人声/背景）独立建模方案直击痛点，有效解决了CFG引导下两者质量此消彼长的困境，工程实现细节丰富，展现了工业级长音频生成系统的完整设计。
短板：作为一篇旨在展示“商业级”系统的技术报告，完全缺乏开源承诺与代码/模型释放计划，评估体系（尤其是自研的“音乐性”评估模型）的公正性和可验证性存疑，这极大地削弱了其作为学术论文的可信度和影响力。论文回避了与近期同期、架构相似的强基线（如DiffRhythm2, ACE-Step）的直接实验对比，使其声称的性能优势显得不完整。&lt;/p&gt;</description>
      <content:encoded><![CDATA[<h1 id="-wansong-v10-technical-report">📄 WanSong v1.0 Technical Report</h1>
<p>标签：#音乐生成 #扩散模型 #歌唱生成 #强化学习 #音频理解</p>
<p><strong>7.6/10</strong> | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5</p>
<p>✅ <strong>7.6/10</strong> | 前25% | 文档类型：系统技术报告 | 评分置信度：高 | #音乐生成 | #扩散模型 | #歌唱生成 #强化学习 | <a href="https://arxiv.org/abs/2607.14749">arxiv</a></p>
<h3 id="-作者与机构">👥 作者与机构</h3>
<ul>
<li>第一作者：未说明</li>
<li>通讯作者：未说明</li>
<li>作者列表：Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou (Wan Team, Alibaba Group)</li>
</ul>
<h3 id="-毒舌点评">💡 毒舌点评</h3>
<p>亮点：双音轨（人声/背景）独立建模方案直击痛点，有效解决了CFG引导下两者质量此消彼长的困境，工程实现细节丰富，展现了工业级长音频生成系统的完整设计。
短板：作为一篇旨在展示“商业级”系统的技术报告，完全缺乏开源承诺与代码/模型释放计划，评估体系（尤其是自研的“音乐性”评估模型）的公正性和可验证性存疑，这极大地削弱了其作为学术论文的可信度和影响力。论文回避了与近期同期、架构相似的强基线（如DiffRhythm2, ACE-Step）的直接实验对比，使其声称的性能优势显得不完整。</p>
<h3 id="-核心摘要">📌 核心摘要</h3>
<p>本文介绍了WanSong v1.0，一个用于商业级、长时长（最高5分钟）歌曲生成的纯扩散基础模型。论文要解决的核心问题是：现有自回归或多阶段级联方法在生成效率和长时音频保真度上存在挑战，且难以平衡人声与背景音乐的质量。其核心方法是将音频视为连续令牌，采用端到端的单阶段扩散框架。与已有方法相比，主要创新在于提出了“双音轨令牌方案”以独立建模人声和背景音乐，并利用强化学习（RLHF）与人类偏好对齐。实验结果显示，在自建的评估基准上，WanSong在发音错误率（PER）和自研的音乐性评分上优于多个现有系统。例如，在客观评估中，其PER（7.43%）显著低于Suno V5（22.80%）和Mureka V7.6（12.7%）。本文的实际意义在于提供了一个完整的、可用于商业场景的端到端音乐生成系统设计方案。主要局限性包括：评估基准和自研评估模型的公平性与通用性存疑；论文未提供任何开源计划；关键训练细节（如完整超参数、数据集构成）缺失，严重影响可复现性；未与DiffRhythm2等近期强基线进行直接对比。</p>
<p><strong>关键实验结果表格：</strong>
<strong>表1：VAE重建质量对比（音乐基准，200个样本）</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">方法</th>
					<th style="text-align: left">STFT ↓</th>
					<th style="text-align: left">MEL ↓</th>
					<th style="text-align: left">SI-SDR (dB) ↑</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">Stable Audio 2</td>
					<td style="text-align: left">1.430</td>
					<td style="text-align: left">0.856</td>
					<td style="text-align: left">4.386</td>
			</tr>
			<tr>
					<td style="text-align: left">Ours (压缩比2048)</td>
					<td style="text-align: left">1.163</td>
					<td style="text-align: left">0.772</td>
					<td style="text-align: left">4.661</td>
			</tr>
			<tr>
					<td style="text-align: left">Ours (压缩比1024)</td>
					<td style="text-align: left">1.029</td>
					<td style="text-align: left">0.629</td>
					<td style="text-align: left">7.246</td>
			</tr>
	</tbody>
</table>
<p><strong>表3：主要模型客观评估对比</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">模型</th>
					<th style="text-align: left">PER (%) ↓</th>
					<th style="text-align: left">SongEval ↑</th>
					<th style="text-align: left">Muq ↑</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">LeVo</td>
					<td style="text-align: left">27.11</td>
					<td style="text-align: left">3.42 (Cla) &hellip;</td>
					<td style="text-align: left">0.34</td>
			</tr>
			<tr>
					<td style="text-align: left">MurekaV7.6</td>
					<td style="text-align: left">12.7</td>
					<td style="text-align: left">4.38 (Cla) &hellip;</td>
					<td style="text-align: left">0.43</td>
			</tr>
			<tr>
					<td style="text-align: left">SunoV5</td>
					<td style="text-align: left">22.80</td>
					<td style="text-align: left">4.44 (Cla) &hellip;</td>
					<td style="text-align: left">0.44</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>WanSong (ours)</strong></td>
					<td style="text-align: left"><strong>7.43</strong></td>
					<td style="text-align: left"><strong>4.47 (Cla) &hellip;</strong></td>
					<td style="text-align: left"><strong>0.44</strong></td>
			</tr>
	</tbody>
</table>
<p><strong>表4：自研音乐性评估对比</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">模型</th>
					<th style="text-align: left">Musicality ↑</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">LeVo</td>
					<td style="text-align: left">1.69</td>
			</tr>
			<tr>
					<td style="text-align: left">MurekaV7.6</td>
					<td style="text-align: left">3.83</td>
			</tr>
			<tr>
					<td style="text-align: left">SunoV5</td>
					<td style="text-align: left">4.18</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>WanSong (ours)</strong></td>
					<td style="text-align: left"><strong>5.49</strong></td>
			</tr>
	</tbody>
</table>
<p><strong>表5：令牌压缩比消融实验（PT-90s模型）</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">VAE压缩比</th>
					<th style="text-align: left">patch size</th>
					<th style="text-align: left">实际压缩比</th>
					<th style="text-align: left">PER(%) ↓</th>
					<th style="text-align: left">Quality (1-5) ↑</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">2048</td>
					<td style="text-align: left">1</td>
					<td style="text-align: left">2048</td>
					<td style="text-align: left">19.2</td>
					<td style="text-align: left">2.1</td>
			</tr>
			<tr>
					<td style="text-align: left">1024</td>
					<td style="text-align: left">2</td>
					<td style="text-align: left">2048</td>
					<td style="text-align: left">20.6</td>
					<td style="text-align: left">2.4</td>
			</tr>
			<tr>
					<td style="text-align: left">1024</td>
					<td style="text-align: left">1</td>
					<td style="text-align: left">1024</td>
					<td style="text-align: left">15.0</td>
					<td style="text-align: left">3.2</td>
			</tr>
	</tbody>
</table>
<h3 id="-开源详情">🔗 开源详情</h3>
<ul>
<li>代码：论文中未提及代码链接</li>
<li>模型权重：论文中未提及模型权重链接（如HuggingFace或ModelScope）</li>
<li>数据集：论文中未提及训练数据集（“超过600万小时的多语言歌曲数据”）的开源获取方式或具体链接。</li>
<li>Demo：论文中未提及在线演示链接</li>
<li>复现材料：论文中提供了关键的技术细节（如模型架构、VAE配置、训练步骤、GPU数量和训练时长），但未提供可下载的完整配置文件、预训练检查点或复现代码包。</li>
<li>论文中引用的开源项目：论文引用了多个模型或工具（如Stable Audio 2， SeedTTS， SongEval， Muq等），但未提供这些项目的具体代码或主页链接。
<ul>
<li>Stable Audio 2</li>
<li>SeedTTS</li>
<li>SongEval</li>
<li>Muq</li>
<li>LeVo</li>
<li>MurekaV7.6</li>
<li>SunoV5
（注：以上项目在论文中仅以名称被引用或用作对比基线，未提供其开源仓库或官网的URL。）</li>
</ul>
</li>
</ul>
<h3 id="-方法概述和架构">🏗️ 方法概述和架构</h3>
<p>WanSong是一个端到端的单阶段纯扩散框架，旨在从文本描述和歌词直接生成高质量、长时长、包含分离人声和背景音乐的立体声歌曲。</p>
<p>WanSong v1.0的核心架构如下图所示，其包含文本编码、音频编码以及混合Transformer主干网络。</p>
<p><img alt="Figure 2: Our hybrid-transformer backbone." loading="lazy" src="https://arxiv.org/html/2607.14749v1/x2.png"></p>
<p>下图展示了文本经LLM编码、音频经两个独立VAE分别编码为人声与背景音乐令牌后，通过双流块与单流块构成的混合MMDiT网络进行联合处理的架构细节。</p>
<p><strong>整体流程概述</strong>：系统接收文本条件（由LLM编码的歌词和风格描述）和随机噪声，通过一个扩散Transformer主干网络，直接在连续音频潜空间中去噪，最终输出两个独立的音频潜变量流，分别对应人声和背景音乐，再经由VAE解码器还原为双声道波形。所有令牌（文本和音频）在输入模型前会进行拼接，为了提高批次内的令牌吞吐量和利用率，来自不同样本的序列会被打包在一起。</p>
<p><strong>主要组件/模块详解</strong>：</p>
<ol>
<li><strong>变分自编码器 (VAE)</strong>：其功能是将44.1kHz的原始立体声音频压缩成连续的潜序列表示，作为扩散模型的操作空间。为了保留更多高频细节以利于人声保真，论文采用了一个压缩比为1024的1D VAE（潜空间帧率约43.1 Hz），相比Stable Audio 2的2048压缩比减半。其内部结构是一个编码器-解码器网络，训练时对抗一个<strong>多尺度判别器</strong>。损失函数包含：多分辨率STFT幅度损失（\(L_{mag}\)）、判别器特征匹配损失（\(L_{fmap}\)）、铰链对抗损失（\(L_{Adv}\)）和KL散度正则损失（\(L_{KL}\)）。</li>
<li><strong>文本条件编码器</strong>：采用一个<strong>解码器式大语言模型</strong>来编码输入的文本提示（包括歌词、风格等），生成文本令牌序列。</li>
<li><strong>扩散主干网络：混合MMDiT</strong>：这是模型的核心，负责执行去噪过程。它接收一个由<strong>文本令牌</strong>和<strong>双音轨音频潜变量令牌</strong>拼接而成的序列。模型采用了一种<strong>混合MMDiT架构</strong>，灵感来自Flux。具体而言，网络中只有部分层（比例约为 \(N/(N+K)=0.3\)）对不同模态（文本 vs. 音频）学习独立参数，其余层共享参数以减少计算量。此外，在每个Transformer块内使用<strong>全共享AdaLN</strong>（自适应层归一化）以进一步优化参数效率。</li>
<li><strong>双音轨令牌方案与联合学习</strong>：这是解决人声与背景音乐质量失衡的关键设计。在模型输出端，网络为<strong>人声</strong>和<strong>背景音乐</strong>生成两个独立的潜变量流。然而，在训练过程中，为了学习两者的内在依赖关系（如节奏、和声），模型在每个Transformer块内部将它们视为同一令牌的不同“通道”进行处理，这被称为“层内联合学习”。这既保证了输出时的分离，又允许模型在学习阶段捕获两者的关联。</li>
</ol>
<p><strong>组件间的数据流与交互</strong>：
文本提示经LLM编码为\(C_{txt}\)。音频方面，原始波形经VAE编码为人声潜变量\(X_{vocal}\)和背景音乐潜变量\(X_{bgm}\)。在扩散训练步骤中，为它们分别添加时间步\(t\)对应的噪声，得到带噪潜变量。这些潜变量与文本条件\(C_{txt}\)一起，拼接成序列输入混合MMDiT网络。网络输出预测的速度场，分别对应人声和背景音乐的去噪方向。损失函数对这两部分的速度预测误差分别加权求和，实现联合优化。</p>
<p><strong>关键设计选择及动机</strong>：</p>
<ul>
<li><strong>纯扩散 vs 自回归</strong>：放弃自回归以追求更高的并行生成效率和长序列建模的稳定性。</li>
<li><strong>连续潜空间 vs 离散令牌</strong>：避免离散化带来的信息损失，直接建模高保真音频的连续分布。</li>
<li><strong>双音轨独立建模</strong>：早期实验发现，CFG强度对人声和背景音乐质量的调节方向相反，联合建模会导致模型过度关注人声而抑制复杂的背景音乐。独立建模从根源上解耦了两者。</li>
<li><strong>混合MMDiT</strong>：在模型容量和参数效率之间取得平衡，避免为所有层都维护模态独立的参数导致模型过大。</li>
</ul>
<p><strong>多阶段/多模块逐层展开</strong>：
预训练分为三个阶段：先在90秒音频片段上训练，再过渡到300秒，最后进行监督微调（SFT）。这遵循了课程学习的思想，逐步提升模型生成长时序的能力。推理时，通过步蒸馏技术可以加速去噪过程。</p>
<h3 id="-核心创新点">💡 核心创新点</h3>
<ol>
<li><strong>双音轨令牌方案</strong>：创新性地提出将人声和背景音乐在潜空间中分离建模，从根本上解决了联合建模时CFG引导无法平衡二者质量的痛点。这使得模型可以直接输出分离的双音轨，极大方便了下游的混音和编辑。</li>
<li><strong>纯端到端扩散架构</strong>：摒弃了复杂的多阶段级联（如AR+扩散）流程，采用单一的连续扩散Transformer直接生成长时音频。这简化了生成流水线，并可能带来更一致的音频质量和更高的推理效率（通过步蒸馏）。</li>
<li><strong>多维度RLHF对齐</strong>：针对音乐生成的独特性，从“音乐性”、“歌词准确性”和“提示对齐”三个维度分别训练奖励模型，并结合DPO（优化全局结构）和ReFL（优化局部细节）进行对齐，策略设计具有针对性。</li>
<li><strong>高压缩比VAE与域平衡训练</strong>：通过将VAE压缩比从行业常见的2048降至1024，显著提升了时频细节的保留能力（SI-SDR提升显著），为高保真生成奠定了基础。同时，在VAE训练时采用50%音乐、40%语音、10%声音的平衡采样，增强了其在音乐和语音两种模态上的泛化能力。</li>
<li><strong>工程化系统整合</strong>：报告详尽地展示了一个从数据构建（6百万小时）、模型设计、多阶段训练到评估的完整工业级音乐生成系统，具有很高的工程参考价值。</li>
</ol>
<h3 id="-实验结果">📊 实验结果</h3>
<p>本部分报告 WanSong v1.0 的实验评估结果，包括 VAE 重建性能、主模型客观评估、自研音乐性评估以及压缩比的消融研究。</p>
<p>在音乐和语音基准上，WanSong 的 VAE（压缩比 1024）在各项指标上均显著优于基线。结果总结于表 1 和表 2。</p>
<p><strong>表1：VAE 重建质量对比（音乐基准，200个样本）</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">方法</th>
					<th style="text-align: left">STFT ↓</th>
					<th style="text-align: left">MEL ↓</th>
					<th style="text-align: left">SI-SDR (dB) ↑</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">Stable Audio 2</td>
					<td style="text-align: left">1.430</td>
					<td style="text-align: left">0.856</td>
					<td style="text-align: left">4.386</td>
			</tr>
			<tr>
					<td style="text-align: left">Ours (压缩比2048)</td>
					<td style="text-align: left">1.163</td>
					<td style="text-align: left">0.772</td>
					<td style="text-align: left">4.661</td>
			</tr>
			<tr>
					<td style="text-align: left">Ours (压缩比1024)</td>
					<td style="text-align: left">1.029</td>
					<td style="text-align: left">0.629</td>
					<td style="text-align: left">7.246</td>
			</tr>
	</tbody>
</table>
<p><strong>表2：VAE 重建质量对比（语音基准，2000个随机样本）</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">方法</th>
					<th style="text-align: left">STFT ↓</th>
					<th style="text-align: left">MEL ↓</th>
					<th style="text-align: left">SI-SDR (dB) ↑</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">Stable Audio 2</td>
					<td style="text-align: left">0.999</td>
					<td style="text-align: left">0.754</td>
					<td style="text-align: left">8.653</td>
			</tr>
			<tr>
					<td style="text-align: left">Ours (压缩比2048)</td>
					<td style="text-align: left">0.783</td>
					<td style="text-align: left">0.593</td>
					<td style="text-align: left">10.371</td>
			</tr>
			<tr>
					<td style="text-align: left">Ours (压缩比1024)</td>
					<td style="text-align: left">0.698</td>
					<td style="text-align: left">0.458</td>
					<td style="text-align: left">12.922</td>
			</tr>
	</tbody>
</table>
<p>在自建的200样本、4语言、多风格测试集上，WanSong 与多个商业模型进行了对比，评估指标包括发音错误率（PER）、SongEval 和 Muq 文本对齐分数。结果如表3所示。</p>
<p><strong>表3：主要模型客观评估对比</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">模型</th>
					<th style="text-align: left">PER (%) ↓</th>
					<th style="text-align: left">SongEval ↑</th>
					<th style="text-align: left"></th>
					<th style="text-align: left"></th>
					<th style="text-align: left"></th>
					<th style="text-align: left"></th>
					<th style="text-align: left">Muq ↑</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left">Cla</td>
					<td style="text-align: left">Coh</td>
					<td style="text-align: left">Mem</td>
					<td style="text-align: left">Mus</td>
					<td style="text-align: left">Nat</td>
					<td style="text-align: left"></td>
			</tr>
			<tr>
					<td style="text-align: left">LeVo</td>
					<td style="text-align: left">27.11</td>
					<td style="text-align: left">3.42</td>
					<td style="text-align: left">3.59</td>
					<td style="text-align: left">3.47</td>
					<td style="text-align: left">3.45</td>
					<td style="text-align: left">3.28</td>
					<td style="text-align: left">0.34</td>
			</tr>
			<tr>
					<td style="text-align: left">MurekaV7.6</td>
					<td style="text-align: left">12.7</td>
					<td style="text-align: left">4.38</td>
					<td style="text-align: left">4.51</td>
					<td style="text-align: left">4.47</td>
					<td style="text-align: left">4.35</td>
					<td style="text-align: left">4.32</td>
					<td style="text-align: left">0.43</td>
			</tr>
			<tr>
					<td style="text-align: left">SunoV5</td>
					<td style="text-align: left">22.80</td>
					<td style="text-align: left">4.44</td>
					<td style="text-align: left">4.56</td>
					<td style="text-align: left">4.53</td>
					<td style="text-align: left">4.41</td>
					<td style="text-align: left">4.34</td>
					<td style="text-align: left">0.44</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>WanSong (ours)</strong></td>
					<td style="text-align: left"><strong>7.43</strong></td>
					<td style="text-align: left"><strong>4.47</strong></td>
					<td style="text-align: left"><strong>4.55</strong></td>
					<td style="text-align: left"><strong>4.57</strong></td>
					<td style="text-align: left"><strong>4.46</strong></td>
					<td style="text-align: left"><strong>4.4</strong></td>
					<td style="text-align: left"><strong>0.44</strong></td>
			</tr>
	</tbody>
</table>
<p><em>注：SongEval 包含 Cla (清晰度), Coh (连贯性), Mem (记忆点), Mus (音乐性), Nat (自然度) 五个子维度。</em></p>
<p>使用作者团队自研的音乐性评估模型（基于80K人工标注歌曲训练，评分范围0-10）进行评估，结果如表4所示。</p>
<p><strong>表4：自研音乐性评估对比</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">模型</th>
					<th style="text-align: left">Musicality ↑</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">LeVo</td>
					<td style="text-align: left">1.69</td>
			</tr>
			<tr>
					<td style="text-align: left">MurekaV7.6</td>
					<td style="text-align: left">3.83</td>
			</tr>
			<tr>
					<td style="text-align: left">SunoV5</td>
					<td style="text-align: left">4.18</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>WanSong (ours)</strong></td>
					<td style="text-align: left"><strong>5.49</strong></td>
			</tr>
	</tbody>
</table>
<p><em>注：此评估模型由论文团队自行开发，其公正性和泛化能力存疑。</em></p>
<p>在90秒时长的预训练模型上，研究了不同 VAE 压缩比和 patch size 对性能的影响。结果如表5所示。</p>
<p><strong>表5：令牌压缩比消融实验（PT-90s模型）</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">VAE压缩比</th>
					<th style="text-align: left">patch size</th>
					<th style="text-align: left">实际压缩比</th>
					<th style="text-align: left">PER(%) ↓</th>
					<th style="text-align: left">Quality (1-5) ↑</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">2048</td>
					<td style="text-align: left">1</td>
					<td style="text-align: left">2048</td>
					<td style="text-align: left">19.2</td>
					<td style="text-align: left">2.1</td>
			</tr>
			<tr>
					<td style="text-align: left">1024</td>
					<td style="text-align: left">2</td>
					<td style="text-align: left">2048</td>
					<td style="text-align: left">20.6</td>
					<td style="text-align: left">2.4</td>
			</tr>
			<tr>
					<td style="text-align: left">1024</td>
					<td style="text-align: left">1</td>
					<td style="text-align: left">1024</td>
					<td style="text-align: left">15.0</td>
					<td style="text-align: left">3.2</td>
			</tr>
	</tbody>
</table>
<p><em>注：Quality 分数由专家评估员评定。</em></p>
<h3 id="关键结论">关键结论</h3>
<p>基于以上实验结果，可以得出以下关键结论：</p>
<ol>
<li><strong>VAE 设计有效</strong>：WanSong 采用的 1024 压缩比 VAE 在音乐和语音重建任务上均显著优于 Stable Audio 2 的 2048 压缩比 VAE，尤其是在 SI-SDR 指标上提升巨大，验证了降低压缩比以保留更多高频细节的设计选择。</li>
<li><strong>发音准确度领先</strong>：在主模型客观评估中，WanSong 在发音错误率（PER）上表现最佳（7.43%），远低于 Suno V5 和 Mureka V7.6，显示出在歌词表达上的优势。</li>
<li><strong>音乐性自评得分高</strong>：在自研的音乐性评估模型上，WanSong 得分（5.49）显著高于其他基线。但需注意，此评估模型的公正性与泛化能力未经外部验证。</li>
<li><strong>低压缩比是关键</strong>：消融实验表明，将实际令牌压缩比从 2048 降至 1024（通过调整 VAE 或 patch size）是提升模型生成质量（PER 和音质）的最有效因素。更高的 patch size 会引入质量损失。</li>
<li><strong>评估局限性</strong>：论文未与 DiffRhythm2、ACE-Step 等近期采用相似技术路线的强基线进行直接实验对比，其 SOTA 声明的全面性有待进一步验证。评估也未涵盖时长稳定性、结构一致性等更细粒度的维度。</li>
</ol>
<h3 id="-细节详述">🔬 细节详述</h3>
<ul>
<li><strong>训练数据</strong>：报告提及使用超过600万小时的多语言歌曲数据，经过严格的五阶段处理流程（收集、预处理、过滤、标注、采样）。VAE训练使用了约2.6亿个音频片段，域比例为音乐：语音：声音=50:40:10。<strong>具体数据来源、语言分布、风格构成未详细说明。</strong></li>
<li><strong>损失函数</strong>：主模型训练损失为 \(L=\alpha_{vocal}\mathbb{E}_{t}[||\theta(X_{vocal,t},C_{txt},t)-V_{vocal,t}||^{2}]+\alpha_{bgm}\mathbb{E}_{t}[||\theta(X_{bgm,t},C_{txt},t)-V_{bgm,t}||^{2}]\)。\(\alpha_{vocal}\) 和 \(\alpha_{bgm}\) 的具体值<strong>未说明</strong>。VAE损失包含\(L_{mag}\)、\(L_{fmap}\)、\(L_{Adv}\)、\(L_{KL}\)，权重（\(\lambda_{mag}\), \(\lambda_{fmap}\) 等）<strong>未说明</strong>。</li>
<li><strong>训练策略</strong>：
<ul>
<li><strong>优化器</strong>：AdamW。</li>
<li><strong>学习率</strong>：VAE训练中G为2e-4，D为3e-4。主模型训练的学习率<strong>未说明</strong>。</li>
<li><strong>Batch size/Warmup</strong>：<strong>未说明</strong>。</li>
<li><strong>训练步数</strong>：VAE在32张A100上训练1.5M步，使用1.5秒音频片段。主模型分三阶段（90s, 300s, SFT）训练，每阶段具体步数<strong>未说明</strong>。</li>
<li><strong>数据增强</strong>：VAE训练使用随机相位反转和潜变量噪声增强。主模型训练中的增强策略<strong>未说明</strong>。</li>
</ul>
</li>
<li><strong>关键超参数</strong>：
<ul>
<li><strong>模型规模</strong>：总模型参数约25B。</li>
<li><strong>架构细节</strong>：混合MMDiT中共享层与独立层的比例（\(N/(N+K)=0.3\)）。VAE潜维度\(C_z=64\)。其他如层数、隐藏维度、注意力头数等<strong>未说明</strong>。</li>
</ul>
</li>
<li><strong>训练硬件</strong>：VAE训练使用32张NVIDIA A100 GPU。主模型训练硬件<strong>未说明</strong>。</li>
<li><strong>推理细节</strong>：提到可通过步蒸馏加速，具体蒸馏方法和加速比<strong>未说明</strong>。解码策略、CFG强度范围等<strong>未说明</strong>。</li>
</ul>
<p>模型训练使用了超过600万小时的多语言歌曲数据，其完整的五阶段数据处理流水线如下图所示。</p>
<p><img alt="Figure 1: Data pipeline overview." loading="lazy" src="https://arxiv.org/html/2607.14749v1/x1.png"></p>
<p>下图详细展示了从多源数据收集、预处理（包括音轨分离）、基于多质量分数过滤、标注到场景感知采样的完整数据构建流程。</p>
<h3 id="-评分理由">⚖️ 评分理由</h3>
<ul>
<li>
<p>创新性 (1.8/2)：双音轨令牌方案独立建模人声与背景音乐，解决了CFG引导下的质量平衡问题，纯端到端扩散架构简化生成流程，具有系统级创新性。</p>
</li>
<li>
<p>技术严谨性 (1.3/1.5)：基于混合MMDiT架构和双音轨独立建模方案，技术实现合理，VAE训练与域平衡策略有效，但部分细节未完全透明。</p>
</li>
<li>
<p>实验充分性 (1.0/1.5)：提供了VAE重建质量、主模型客观评估和压缩比消融实验，但评估基准自建且自研评估模型未经外部验证，未与近期强基线进行直接对比，实验设计存在公平性漏洞。</p>
</li>
<li>
<p>清晰度 (0.9/1)：论文结构清晰，方法描述详尽，图表和公式完整，但部分细节如损失权重未说明，稍有影响。</p>
</li>
<li>
<p>影响力 (1.2/1.5)：作为商业级音乐生成系统，具有实际应用价值，但评估方法的公平性存疑可能限制其学术影响力。</p>
</li>
<li>
<p>开源 (0.0/1.5)：论文未发布核心代码、模型权重或数据资源，也未给出明确的后续开源承诺。</p>
</li>
<li>
<p>可复现性 (0.1/0.5)：论文披露了模型架构和基本训练流程，但关键超参数、损失权重、数据集构成等缺失，严重影响可复现性。</p>
</li>
<li>
<p>工程/实践价值 (1.3/1.5)：报告详尽展示了从数据构建到模型设计的完整工业级音乐生成系统，具有很高的工程参考价值和实践意义。</p>
</li>
</ul>
<h3 id="-局限与问题">🚨 局限与问题</h3>
<p><strong>1. 论文明确承认的局限</strong>：</p>
<ul>
<li><strong>评估方法的局限性</strong>：论文指出，其使用的客观评估模型EvalScore因训练数据有限（约2000首歌曲），泛化能力难以保证，因此采用了自研的音乐性评估模型。这间接承认了客观评估体系不够稳健。</li>
</ul>
<p><strong>2. 审稿人发现的潜在问题</strong>：</p>
<ul>
<li><strong>评估的公平性与可比性</strong>：论文自建的评估基准和自研的评估模型缺乏外部验证，与使用公开标准数据集和公认评估指标的同行工作（如Suno, Mureka）对比时，存在“自说自话”的风险，结果的可比性大打折扣。</li>
<li><strong>与近期强基线的对比缺失</strong>：论文未与架构相似的近期强基线（如DiffRhythm2, ACE-Step）进行实验对比，无法判断其性能提升的真正程度，这是实验设计的一个重大漏洞。</li>
<li><strong>“双音轨”方案的普适性</strong>：该方案是针对人声/背景音乐这一特定分离任务设计的，对于其他需要多轨道生成的音乐场景（如鼓、贝斯、和弦乐器分离）是否同样有效，未作讨论。</li>
<li><strong>长时生成的稳定性</strong>：报告声称支持5分钟生成，但未提供关于音乐结构连贯性、长期依赖性、风格一致性等方面的定量或定性分析。</li>
<li><strong>开源与可复现性</strong>：完全不开源，且关键训练细节缺失，使得论文的贡献主要停留在概念和工程描述层面，难以被学术社区验证、复现和改进。</li>
<li><strong>损失权重不透明</strong>：人声与背景音乐学习强度的平衡系数\(\alpha_{vocal}\)和\(\alpha_{bgm}\)未公开，这使得读者无法评估模型在两者之间是否存在隐性的偏好。</li>
</ul>
<hr>
<p><a href="/audio-paper-digest-blog/posts/2026-07-17/">← 返回 2026-07-17 语音/音乐/音频论文速递</a></p>
]]></content:encoded>
      <category>音乐生成</category>
      <category>扩散模型</category>
      <category>歌唱生成</category>
      <category>强化学习</category>
      <category>音频理解</category>
    </item>
    <item>
      <title>Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion</title>
      <link>https://nanless.github.io/audio-paper-digest-blog/posts/2026-07-16-adapting-a-diffusion-based-music-synthesis-model-2607-13278/</link>
      <pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://nanless.github.io/audio-paper-digest-blog/posts/2026-07-16-adapting-a-diffusion-based-music-synthesis-model-2607-13278/</guid>
      <description>&lt;h1 id=&#34;-adapting-a-diffusion-based-music-synthesis-model-to-human-voice-conversion&#34;&gt;📄 Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion&lt;/h1&gt;
&lt;p&gt;标签：#语音转换 #歌唱生成 #迁移学习 #领域适应 #音频理解&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;6.0/10&lt;/strong&gt; | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5&lt;/p&gt;
&lt;p&gt;✅ &lt;strong&gt;6.0/10&lt;/strong&gt; | 前50% | 文档类型：方法研究 | 评分置信度：高 | #语音转换 | #迁移学习 | #歌唱生成 #领域适应 | &lt;a href=&#34;https://arxiv.org/abs/2607.13278&#34;&gt;arxiv&lt;/a&gt;&lt;/p&gt;
&lt;h3 id=&#34;-作者与机构&#34;&gt;👥 作者与机构&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;第一作者：Ben Maman（Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU) 和 Fraunhofer IIS）&lt;/li&gt;
&lt;li&gt;通讯作者：未说明&lt;/li&gt;
&lt;li&gt;作者列表：Ben Maman（FAU 和 Fraunhofer IIS）、Frank Zalkow（FAU 和 Fraunhofer IIS）、Hans-Ulrich Berendes（FAU 和 Fraunhofer IIS）、Paolo Sani（FAU 和 Fraunhofer IIS）、Christian Dittmar（Fraunhofer IIS）、Meinard Müller（Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU) 和 Fraunhofer IIS）&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;-毒舌点评&#34;&gt;💡 毒舌点评&lt;/h3&gt;
&lt;p&gt;这篇论文的跨领域迁移思路确实有启发性，尝试将音乐合成的条件机制应用于语音转换，展示了统一音频生成的一种潜在路径。然而，其核心贡献的论证深度严重不足：1) 实验基线选择不当，未与同类架构的扩散或流匹配模型对比，削弱了“迁移成功”的说服力；2) 对关键负面结果（如音素保真度下降）的归因分析流于表面，缺乏消融实验；3) 尽管提出了统一框架的愿景，但联合训练（T5-All）导致质量下降的矛盾未被解决，其实用价值存疑；4) 最关键的是，作为一篇方法研究，其训练代码、模型权重和关键训练配置均未开源，可复现性极差，严重削弱了其作为后续研究基石的影响力。&lt;/p&gt;</description>
      <content:encoded><![CDATA[<h1 id="-adapting-a-diffusion-based-music-synthesis-model-to-human-voice-conversion">📄 Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion</h1>
<p>标签：#语音转换 #歌唱生成 #迁移学习 #领域适应 #音频理解</p>
<p><strong>6.0/10</strong> | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5</p>
<p>✅ <strong>6.0/10</strong> | 前50% | 文档类型：方法研究 | 评分置信度：高 | #语音转换 | #迁移学习 | #歌唱生成 #领域适应 | <a href="https://arxiv.org/abs/2607.13278">arxiv</a></p>
<h3 id="-作者与机构">👥 作者与机构</h3>
<ul>
<li>第一作者：Ben Maman（Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU) 和 Fraunhofer IIS）</li>
<li>通讯作者：未说明</li>
<li>作者列表：Ben Maman（FAU 和 Fraunhofer IIS）、Frank Zalkow（FAU 和 Fraunhofer IIS）、Hans-Ulrich Berendes（FAU 和 Fraunhofer IIS）、Paolo Sani（FAU 和 Fraunhofer IIS）、Christian Dittmar（Fraunhofer IIS）、Meinard Müller（Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU) 和 Fraunhofer IIS）</li>
</ul>
<h3 id="-毒舌点评">💡 毒舌点评</h3>
<p>这篇论文的跨领域迁移思路确实有启发性，尝试将音乐合成的条件机制应用于语音转换，展示了统一音频生成的一种潜在路径。然而，其核心贡献的论证深度严重不足：1) 实验基线选择不当，未与同类架构的扩散或流匹配模型对比，削弱了“迁移成功”的说服力；2) 对关键负面结果（如音素保真度下降）的归因分析流于表面，缺乏消融实验；3) 尽管提出了统一框架的愿景，但联合训练（T5-All）导致质量下降的矛盾未被解决，其实用价值存疑；4) 最关键的是，作为一篇方法研究，其训练代码、模型权重和关键训练配置均未开源，可复现性极差，严重削弱了其作为后续研究基石的影响力。</p>
<h3 id="-核心摘要">📌 核心摘要</h3>
<ol>
<li><strong>要解决什么问题</strong>：现有语音、歌唱、音乐生成模型高度专用，缺乏能处理混合或中间音频类型（如歌唱+乐器）的统一框架。本文旨在探索将为器乐合成设计的扩散模型迁移到语音转换（包括说话和歌唱）任务的可行性。</li>
<li><strong>方法核心</strong>：将一个基于T5 Transformer的、用于多乐器音乐合成的扩散模型进行适配。核心是“条件机制的重用与扩展”：将音乐合成中基于音符的条件（如钢琴卷帘）扩展为包含音素后验图（PPG）和音高轮廓（f0），并将原本用于控制乐器音色/声学的特征级线性调制（FiLM）重新解释为对说话人/歌手身份的条件。</li>
<li><strong>与已有方法相比新在哪里</strong>：新在提出了一种跨领域模型迁移的路径，即利用音乐合成模型中成熟的、用于控制复杂多声部音色和声学的条件机制（FiLM和注意力），来解决语音转换中的表现者相似性控制问题，并在一个统一的框架内处理说话和歌唱。</li>
<li><strong>主要实验结果</strong>：实验表明，适配后的模型（T5-Voc）在语音和歌唱的自然度与表现者相似性上，可以匹配甚至超越专用的语音转换系统（MAC-Voc）。同时，它保持了较高的音高保真度。但音素保真度指标上劣于专用模型。加入器乐数据联合训练（T5-All）会导致语音和歌唱质量下降。主要结果如下表所示：</li>
</ol>
<table>
	<thead>
			<tr>
					<th style="text-align: left">模型</th>
					<th style="text-align: left">语音自然度 (MUSHRA)</th>
					<th style="text-align: left">歌唱自然度 (MUSHRA)</th>
					<th style="text-align: left">歌唱相似度 (Likert)</th>
					<th style="text-align: left">语音 FAD (Test)</th>
					<th style="text-align: left">歌唱 FAD (Test)</th>
					<th style="text-align: left">歌唱 RPA</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left"><strong>T5-Voc</strong></td>
					<td style="text-align: left">68.63 ± 18.11</td>
					<td style="text-align: left"><strong>59.11 ± 17.54</strong></td>
					<td style="text-align: left"><strong>3.25 ± 1.09</strong></td>
					<td style="text-align: left">0.162</td>
					<td style="text-align: left">0.108</td>
					<td style="text-align: left"><strong>94.7</strong></td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>MAC-Voc</strong></td>
					<td style="text-align: left">68.34 ± 17.98</td>
					<td style="text-align: left">55.84 ± 17.53</td>
					<td style="text-align: left">2.75 ± 1.11</td>
					<td style="text-align: left">0.171</td>
					<td style="text-align: left">0.110</td>
					<td style="text-align: left">93.6</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>T5-All</strong></td>
					<td style="text-align: left">53.15 ± 17.66</td>
					<td style="text-align: left">49.94 ± 19.27</td>
					<td style="text-align: left">-</td>
					<td style="text-align: left">0.187</td>
					<td style="text-align: left">0.142</td>
					<td style="text-align: left">94.2</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>PAD-Voc</strong></td>
					<td style="text-align: left">20.12 ± 15.55</td>
					<td style="text-align: left">15.90 ± 10.57</td>
					<td style="text-align: left">-</td>
					<td style="text-align: left">0.345</td>
					<td style="text-align: left">0.271</td>
					<td style="text-align: left">92.7</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>参考/锚点</strong></td>
					<td style="text-align: left">99.28 ± 4.49 / 20.12 ± 15.55</td>
					<td style="text-align: left">99.89 ± 1.64 / 15.90 ± 10.57</td>
					<td style="text-align: left">-</td>
					<td style="text-align: left">0.002 (Vocoded)</td>
					<td style="text-align: left">0.004 (Vocoded)</td>
					<td style="text-align: left">-</td>
			</tr>
	</tbody>
</table>
<ol start="5">
<li><strong>实际意义</strong>：证明了专用音乐生成模型中设计的条件机制（如FiLM）具有一定的通用性，可被迁移到语音领域。这为未来构建能统一处理语音、歌唱、音乐的音频生成系统提供了有价值的参考和初步验证。其利用独立特征提取器进行自监督训练的范式也具有工程参考价值。</li>
<li><strong>主要局限性</strong>：1) 加入器乐数据进行联合训练（T5-All）会导致语音和歌唱质量下降，揭示了统一建模中的核心挑战。2) 音素保真度（PPG距离）劣于专用模型，表明模型的“创造性”可能损害内容保真。3) 基线对比不充分，未与同类扩散/流匹配模型对比。4) 训练数据未公开，且未提供代码、模型或关键训练配置，可复现性存疑。</li>
</ol>
<h3 id="-开源详情">🔗 开源详情</h3>
<ul>
<li>代码：论文中未提及代码仓库链接。</li>
<li>模型权重：论文中未提及具体的模型权重（如HuggingFace/ModelScope）链接。</li>
<li>数据集：论文中未提及可公开访问的数据集链接或获取方式。所用数据集为内部数据（proprietary and public sources），但作者指出所有用于生成伪标注的特征提取器（如CREPE, wav2vec2.0, TRILL等）均为公开可用。</li>
<li>Demo：（在线演示链接或“论文中未提及”）
<ul>
<li>项目主页（含定性样本）：<code>https://benadar293.github.io/voice-conversion</code></li>
</ul>
</li>
<li>复现材料：论文中未提及训练配置、检查点等具体复现材料的链接或获取方式。文中说明“训练和采样程序遵循原始出版物”。</li>
<li>论文中引用的开源项目：
<ol>
<li><strong>wav2vec 2.0 (用于PPG提取)</strong>：<code>https://huggingface.co/vitouphy/wav2vec2-xls-r-300m-timit-phoneme</code></li>
<li><strong>ForwardTacotron (作为PAD-VC基础)</strong>：<code>https://github.com/axelspringer/ForwardTacotron</code></li>
<li><strong>CREPE (用于f0估计)</strong>：论文中提及使用该模型，但未提供链接。</li>
<li><strong>TRILL (用于音频嵌入)</strong>：论文中提及使用该模型，但未提供链接。</li>
<li><strong>BigVGAN (声码器)</strong>：论文中提及使用该声码器，但未提供链接。</li>
<li><strong>Onsets and Frames (用于钢琴卷帘估计)</strong>：论文中提及使用该模型，但未提供链接。</li>
<li><strong>mir_eval (用于音高评估)</strong>：论文中提及使用该工具，但未提供链接。</li>
</ol>
</li>
</ul>
<h3 id="-方法概述和架构">🏗️ 方法概述和架构</h3>
<p>本文的方法是一个多阶段流水线，核心在于将用于音乐合成的条件扩散模型架构适配至语音转换任务。整体流程为：<strong>输入（源音频）→ 特征提取 → 条件编码 → 扩散模型生成 → 输出（目标音频）</strong>。</p>
<p>下图展示了将音乐合成扩散模型适配至语音转换的整体架构。</p>
<p><img alt="Fig. 1: Overview of our model. “CAT”: Concatenation along the channel axis, “C.A.”: Cross-attention, ‘N’: Number of stacked blocks." loading="lazy" src="https://arxiv.org/html/2607.13278v1/x1.png"></p>
<p>图中左侧显示时间变化条件（f0、PPG和可选的钢琴卷帘）通过编码器融合，右侧显示全局条件（表演者身份和扩散时间步）通过FiLM层注入解码器，实现条件生成。</p>
<ol>
<li>
<p><strong>整体流程概述</strong>：系统首先从源音频（纯语音/歌唱或带伴奏的歌唱）中提取时间变化的条件特征（音高f0和音素PPG），以及一个全局表现者身份嵌入。这些条件被输入到一个基于T5 Transformer的扩散模型中，该模型通过条件去噪过程生成目标表现者风格下的梅尔频谱图，最后通过一个通用的BigVGAN声码器将其转换为波形。</p>
</li>
<li>
<p><strong>主要组件详解</strong>：</p>
<ul>
<li><strong>特征提取管线</strong>：
<ul>
<li><strong>音高提取</strong>：使用CREPE模型估计源音频的基频（\(f_0\)）轮廓。</li>
<li><strong>音素提取</strong>：使用预训练的wav2vec 2.0模型（<code>wav2vec2-xls-r-300m-timit-phoneme</code>）提取音素后验图（PPG），表示每帧属于各音素的概率分布。</li>
<li><strong>伴奏信息提取</strong>：对于混合音频，先使用声源分离模型分离人声，再使用多乐器Onsets and Frames变体估计钢琴卷帘（MIDI）。</li>
<li><strong>表现者身份提取</strong>：使用TRILL模型提取音频嵌入，以捕捉说话人或歌手的音色和风格信息。</li>
</ul>
</li>
<li><strong>音高范围适应</strong>：为解决源与目标表现者音域差异，对源\(f_0\)轮廓进行对数频率半音阶（semitone）上的均值平移，使其匹配目标表现者的平均音高。具体公式为：\(p^{\mathrm{tar}}_{t}=p^{\mathrm{src}}_{t}-\mu^{\mathrm{src}}_{p}+\mu^{\mathrm{tar}}_{p}\)，其中\(p\)为半音阶值。</li>
<li><strong>条件编码器</strong>：一个基于T5自注意力层的编码器。其输入是沿通道轴拼接的PPG和\(f_0\)特征（对于混合数据，还包括钢琴卷帘）。它学习一个融合的、时间对齐的表示，该表示随后通过<strong>交叉注意力</strong>注入到解码器中。</li>
<li><strong>扩散式频谱解码器</strong>：一个基于T5自注意力层的解码器。其输入是带噪的梅尔频谱图，预测所加的噪声。它通过与条件编码器的交叉注意力来接收时间变化的条件。此外，在每一层都通过<strong>FiLM（特征级线性调制）</strong> 层接收全局条件（扩散时间步和通过TRILL嵌入表示的表现者身份）。FiLM通过学习一个缩放（scale）和偏移（shift）向量，对网络隐藏层的特征进行仿射变换，从而将全局条件注入模型。</li>
<li><strong>条件Dropout</strong>：训练时随机独立地丢弃（置零）各个条件（\(f_0\), PPG, 表现者嵌入），以概率\(p^{\mathrm{drop}}_{c}\)丢弃单个条件，并以概率\(p^{\mathrm{drop}}_{\mathrm{all}}\)联合丢弃所有条件。这既增强了模型的鲁棒性，也使分类器自由引导（CFG）成为可能，允许在推理时控制生成受条件约束的强度。</li>
<li><strong>声码器</strong>：使用通用的BigVGAN声码器将生成的梅尔频谱图转换为波形。选择通用声码器是为了评估模型生成人声-乐器混合信号的潜力。</li>
</ul>
</li>
<li>
<p><strong>组件间的数据流与交互</strong>：</p>
<ul>
<li><strong>并行特征提取</strong>：\(f_0\)、PPG、钢琴卷帘（可选）和TRILL嵌入从源音频中独立并行地提取出来。</li>
<li><strong>条件编码路径</strong>：时间变化特征（\(f_0\)+PPG，可选+钢琴卷帘）被拼接后，送入<strong>条件编码器</strong>，生成一个时间对齐的上下文向量序列。</li>
<li><strong>生成路径</strong>：随机采样的高斯噪声与扩散时间步信息一起输入<strong>频谱解码器</strong>。解码器在每一层通过<strong>交叉注意力</strong>与条件编码器输出的上下文交互，以吸收内容信息（音素、音高、乐谱）。同时，在每一层通过<strong>FiLM层</strong>接收表现者身份嵌入和扩散时间步信息，以实现全局风格和去噪进度的控制。</li>
<li><strong>后处理</strong>：解码器输出的估计“干净”梅尔频谱图（或通过反向扩散过程迭代得到）送入<strong>声码器</strong>生成最终波形。</li>
</ul>
</li>
<li>
<p><strong>关键设计选择及动机</strong>：</p>
<ul>
<li><strong>选择音乐合成模型（T5）而非语音专用模型</strong>：动机是音乐合成模型天然具备处理复杂、多声部、多样化音色/声学环境的能力，其条件机制（如用于控制版本/表演者的FiLM）被假设可以很好地泛化到控制“人声表现者身份”。</li>
<li><strong>采用“PPG+f0”而非文本或歌词</strong>：PPG是语音/歌唱中与说话人无关的音素表示，且对源语言/歌词变化更鲁棒，适合作为内容条件。\(f_0\)则明确控制旋律和语调。</li>
<li><strong>使用通用声码器（BigVGAN）</strong>：目的是评估模型在生成人声-乐器混合信号方面的潜力，因为专用人声声码器可能不擅长处理乐器声部。</li>
<li><strong>采用扩散模型</strong>：复用了所适配的音乐合成模型原有的扩散框架，未在本文中比较其他生成范式。</li>
</ul>
</li>
<li>
<p><strong>多阶段展开</strong>：系统明显分为<strong>特征提取与预处理</strong>、<strong>条件编码</strong>、<strong>扩散生成</strong>、<strong>波形合成</strong>四个阶段。每个阶段都使用了独立的、预训练的或专门的组件。</p>
</li>
<li>
<p><strong>专业术语解释</strong>：</p>
<ul>
<li><strong>音素后验图（PPG）</strong>：一种时间对齐的特征序列，每一帧是一个向量，表示该帧属于各个音素（如 /a/, /t/）的概率分布，捕捉了语言内容。</li>
<li><strong>特征级线性调制（FiLM）</strong>：一种条件化神经网络的方法。它通过学习一个缩放（scale）和偏移（shift）向量，对网络隐藏层的特征进行仿射变换，从而将全局条件（如表现者身份、扩散时间步）注入模型。</li>
<li><strong>条件Dropout</strong>：训练时随机“关闭”某些条件输入，以提升模型对不完整条件的鲁棒性，并为推理时的引导采样做准备。</li>
<li><strong>分类器自由引导（CFG）</strong>：一种在推理时控制条件强度的技术，通过条件样本和无条件样本的加权组合实现，需要模型在训练时通过条件Dropout学会生成无条件样本。</li>
</ul>
</li>
</ol>
<h3 id="-核心创新点">💡 核心创新点</h3>
<ol>
<li><strong>跨领域条件机制的重用</strong>：将音乐合成中用于控制乐器版本/音色的FiLM条件机制，创造性地重用于控制人声转换中的说话人/歌手身份。这为利用成熟音乐生成模型的技术栈解决语音问题提供了新思路。</li>
<li><strong>统一的条件框架</strong>：通过将钢琴卷帘（MIDI）替换为PPG和\(f_0\)的组合，建立了一个统一的时间变化条件表示，使得同一个模型架构可以处理纯乐器、纯人声以及混合输入，向统一音频生成迈出了探索性的一步。</li>
<li><strong>免标注的大规模训练范式</strong>：利用独立的、公开的预训练特征提取器（wav2vec2 for PPG， CREPE for \(f_0\)）自动为大量未标注的语音、歌唱、音乐数据生成伪标签，从而构建大规模训练集，无需人工标注，降低了数据门槛。</li>
<li><strong>全面的跨域评估</strong>：系统性地评估了从音乐领域迁移到语音领域的模型，在多个维度（自然度、相似度、音高、音素）上与专用语音转换系统进行了详细对比，并坦诚地报告了失败案例（如联合训练导致质量下降、音素保真度降低），为后续研究提供了清晰的基准和问题方向。</li>
</ol>
<h3 id="-实验结果">📊 实验结果</h3>
<p>实验全面评估了模型在自然度、表现者相似性、音高控制和音素保真度四个方面的表现。</p>
<p>歌手相似度的主观评分如下图所示。</p>
<p><img alt="Fig. 4: Singer similarity listening test results." loading="lazy" src="https://arxiv.org/html/2607.13278v1/x4.png"></p>
<p>图中T5-Voc在条件于参考歌手时得分显著高于MAC-Voc，显示FiLM条件机制在控制表现者身份上的优势。</p>
<p>歌唱自然度的主观听测结果如下图所示。</p>
<p><img alt="Fig. 3: Singing naturalness listening test results." loading="lazy" src="https://arxiv.org/html/2607.13278v1/x3.png"></p>
<p>图中T5-Voc的评分略高于MAC-Voc，且差异显著，表明模型在歌唱任务上表现更优。</p>
<p>语音自然度的主观听测结果如下图所示。</p>
<p><img alt="Fig. 2: Speech naturalness listening test results." loading="lazy" src="https://arxiv.org/html/2607.13278v1/x2.png"></p>
<p>图中可见T5-Voc和MAC-Voc的评分显著高于T5-All和PAD-Voc，且T5-Voc与MAC-Voc在统计上无显著差异，验证了模型在语音任务上的有效性。</p>
<p>在原始音频重建任务上，评估者对语音和歌唱的自然度评分（0-100）。参考为原始音频的声码器重建版本，锚点为PAD-Voc模型输出。</p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">模型</th>
					<th style="text-align: left">语音自然度 (Mean ± Std)</th>
					<th style="text-align: left">歌唱自然度 (Mean ± Std)</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">T5-Voc</td>
					<td style="text-align: left">68.63 ± 18.11</td>
					<td style="text-align: left">59.11 ± 17.54</td>
			</tr>
			<tr>
					<td style="text-align: left">MAC-Voc</td>
					<td style="text-align: left">68.34 ± 17.98</td>
					<td style="text-align: left">55.84 ± 17.53</td>
			</tr>
			<tr>
					<td style="text-align: left">T5-All</td>
					<td style="text-align: left">53.15 ± 17.66</td>
					<td style="text-align: left">49.94 ± 19.27</td>
			</tr>
			<tr>
					<td style="text-align: left">PAD-Voc</td>
					<td style="text-align: left">20.12 ± 15.55</td>
					<td style="text-align: left">15.90 ± 10.57</td>
			</tr>
			<tr>
					<td style="text-align: left">Ref. (Vocoded)</td>
					<td style="text-align: left">99.28 ± 4.49</td>
					<td style="text-align: left">99.89 ± 1.64</td>
			</tr>
	</tbody>
</table>
<p>评估生成音频与目标歌手的相似度（1-5分）。T5-Voc和MAC-Voc在两种条件下进行对比。</p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">条件</th>
					<th style="text-align: left">T5-Voc 平均分</th>
					<th style="text-align: left">MAC-Voc 平均分</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">条件于参考歌手 (ref)</td>
					<td style="text-align: left">3.25 ± 1.09</td>
					<td style="text-align: left">2.75 ± 1.11</td>
			</tr>
			<tr>
					<td style="text-align: left">条件于其他歌手 (other)</td>
					<td style="text-align: left">1.76 ± 1.06</td>
					<td style="text-align: left">1.76 ± 1.06</td>
			</tr>
	</tbody>
</table>
<p>使用Fréchet Audio Distance (FAD) 评估。All-FAD衡量整体质量（与真实录音集的距离），Perf-FAD衡量表现者相似度（与同一表现者真实录音集的距离）。Vocoded为原始音频经声码器处理的结果。</p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">模型</th>
					<th style="text-align: left">语音 FAD (Test)</th>
					<th style="text-align: left">语音 FAD (Train)</th>
					<th style="text-align: left">语音 Perf-FAD</th>
					<th style="text-align: left">歌唱 FAD (Test)</th>
					<th style="text-align: left">歌唱 FAD (Train)</th>
					<th style="text-align: left">歌唱 Perf-FAD</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">T5-Voc</td>
					<td style="text-align: left">0.162</td>
					<td style="text-align: left">0.118</td>
					<td style="text-align: left">0.156</td>
					<td style="text-align: left">0.108</td>
					<td style="text-align: left">0.093</td>
					<td style="text-align: left">0.141</td>
			</tr>
			<tr>
					<td style="text-align: left">T5-All</td>
					<td style="text-align: left">0.187</td>
					<td style="text-align: left">0.141</td>
					<td style="text-align: left">0.190</td>
					<td style="text-align: left">0.142</td>
					<td style="text-align: left">0.128</td>
					<td style="text-align: left">0.192</td>
			</tr>
			<tr>
					<td style="text-align: left">PAD-Voc</td>
					<td style="text-align: left">0.345</td>
					<td style="text-align: left">0.288</td>
					<td style="text-align: left">0.343</td>
					<td style="text-align: left">0.271</td>
					<td style="text-align: left">0.257</td>
					<td style="text-align: left">0.356</td>
			</tr>
			<tr>
					<td style="text-align: left">MAC-Voc</td>
					<td style="text-align: left">0.171</td>
					<td style="text-align: left">0.113</td>
					<td style="text-align: left">0.163</td>
					<td style="text-align: left">0.110</td>
					<td style="text-align: left">0.092</td>
					<td style="text-align: left">0.178</td>
			</tr>
			<tr>
					<td style="text-align: left">Vocoded</td>
					<td style="text-align: left">0.002</td>
					<td style="text-align: left">0.054</td>
					<td style="text-align: left">0.573</td>
					<td style="text-align: left">0.004</td>
					<td style="text-align: left">0.065</td>
					<td style="text-align: left">0.369</td>
			</tr>
	</tbody>
</table>
<p>评估生成音频对源音频音高轮廓的保持程度。指标包括原始音高准确率（RPA，50音分阈值）和考虑有声段的总体准确率（Ov50，50音分；Ov25，25音分）。</p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">模型</th>
					<th style="text-align: left">语音 RPA</th>
					<th style="text-align: left">语音 Ov50</th>
					<th style="text-align: left">语音 Ov25</th>
					<th style="text-align: left">歌唱 RPA</th>
					<th style="text-align: left">歌唱 Ov50</th>
					<th style="text-align: left">歌唱 Ov25</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">T5-Voc</td>
					<td style="text-align: left">83.0</td>
					<td style="text-align: left">81.9</td>
					<td style="text-align: left">71.6</td>
					<td style="text-align: left">94.7</td>
					<td style="text-align: left">92.5</td>
					<td style="text-align: left">83.1</td>
			</tr>
			<tr>
					<td style="text-align: left">T5-All</td>
					<td style="text-align: left">80.4</td>
					<td style="text-align: left">80.8</td>
					<td style="text-align: left">70.4</td>
					<td style="text-align: left">94.2</td>
					<td style="text-align: left">92.1</td>
					<td style="text-align: left">82.2</td>
			</tr>
			<tr>
					<td style="text-align: left">PAD-Voc</td>
					<td style="text-align: left">78.2</td>
					<td style="text-align: left">79.1</td>
					<td style="text-align: left">68.5</td>
					<td style="text-align: left">92.7</td>
					<td style="text-align: left">89.4</td>
					<td style="text-align: left">78.0</td>
			</tr>
			<tr>
					<td style="text-align: left">MAC-Voc</td>
					<td style="text-align: left">79.8</td>
					<td style="text-align: left">80.1</td>
					<td style="text-align: left">69.6</td>
					<td style="text-align: left">93.6</td>
					<td style="text-align: left">91.8</td>
					<td style="text-align: left">81.8</td>
			</tr>
	</tbody>
</table>
<p>评估生成音频与源音频在音素内容（PPG）上的一致性，使用Jensen-Shannon散度（J-S）和Wasserstein距离（Wass.）衡量，数值越低表示保真度越高。</p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">模型</th>
					<th style="text-align: left">语音 J-S ↓</th>
					<th style="text-align: left">语音 Wasserstein ↓</th>
					<th style="text-align: left">歌唱 J-S ↓</th>
					<th style="text-align: left">歌唱 Wasserstein ↓</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">MAC-Voc</td>
					<td style="text-align: left">0.322</td>
					<td style="text-align: left">4.334</td>
					<td style="text-align: left">0.245</td>
					<td style="text-align: left">2.151</td>
			</tr>
			<tr>
					<td style="text-align: left">T5-Voc</td>
					<td style="text-align: left">0.338</td>
					<td style="text-align: left">4.495</td>
					<td style="text-align: left">0.266</td>
					<td style="text-align: left">2.319</td>
			</tr>
			<tr>
					<td style="text-align: left">T5-All</td>
					<td style="text-align: left">0.352</td>
					<td style="text-align: left">4.628</td>
					<td style="text-align: left">0.273</td>
					<td style="text-align: left">2.346</td>
			</tr>
			<tr>
					<td style="text-align: left">PAD-Voc</td>
					<td style="text-align: left">0.351</td>
					<td style="text-align: left">4.660</td>
					<td style="text-align: left">0.276</td>
					<td style="text-align: left">2.329</td>
			</tr>
	</tbody>
</table>
<p>评估在带伴奏的歌唱转换任务中，使用不同条件组合的效果。FAD值越低，表示生成音频与原始信号越接近。</p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">条件</th>
					<th style="text-align: left">FAD (Test Mix)</th>
					<th style="text-align: left">FAD (Train Mix)</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">MIDI</td>
					<td style="text-align: left">0.277</td>
					<td style="text-align: left">0.250</td>
			</tr>
			<tr>
					<td style="text-align: left">MIDI+F0+PPG</td>
					<td style="text-align: left">0.236</td>
					<td style="text-align: left">0.213</td>
			</tr>
	</tbody>
</table>
<p><strong>关键结论：</strong></p>
<ol>
<li><strong>自然度与相似性</strong>：适配自音乐合成模型的T5-Voc，在语音和歌唱的自然度上与专用的流匹配模型MAC-Voc表现相当，在歌唱任务上甚至略有优势（MUSHRA评分59.11 vs. 55.84，统计显著）。在控制目标歌手身份的能力上，T5-Voc的歌手相似度评分显著高于MAC-Voc，表明其条件机制（FiLM）在跨领域迁移后对表现者身份的控制更为有效。而仅使用重建损失的PAD-Voc在所有指标上均表现不佳。</li>
<li><strong>客观质量与音高控制</strong>：FAD指标进一步支持了听测结果，T5-Voc在整体质量（All-FAD）和尤其在表现者相似度（Perf-FAD）上均优于MAC-Voc。在音高控制方面，所有模型在歌唱任务上均表现出很高的准确率（&gt;92% RPA），T5-Voc略微领先，表明该模型能很好地保持源音频的音高轮廓。</li>
<li><strong>音素保真度的权衡</strong>：在音素内容保持方面，MAC-Voc在所有指标上均优于T5-Voc。作者将此归因于T5-Voc的架构（纯注意力）可能带来更高的生成多样性或“创造性”，例如可能改变某些发音细节，这在某些应用场景下可能是一种特性而非缺陷。</li>
<li><strong>跨领域数据的影响</strong>：在训练数据中加入器乐（T5-All）会导致模型在语音和歌唱任务上的自然度、相似性以及音素保真度等指标全面下降。这揭示了在单一模型中处理不同类型音频数据的挑战。</li>
<li><strong>联合条件的优势</strong>：在带伴奏的歌唱转换实验中，同时使用乐谱（MIDI）和人声特征（F0+PPG）作为条件，比仅使用MIDI能生成更接近原始信号的音频，证明了在统一框架下整合多种条件信息的有效性。</li>
</ol>
<h3 id="-细节详述">🔬 细节详述</h3>
<ul>
<li><strong>训练数据</strong>：使用三个内部数据集：语音（\(\mathcal{D}_{\mathrm{speech}}\)，约33小时，2男3女共5个说话人）、歌唱（\(\mathcal{D}_{\mathrm{sing}}\)，约31小时，包括SingStyle111数据集及从混合数据中分离的人声）、混合（\(\mathcal{D}_{\mathrm{mix}}\)，约90小时，包含冬之旅、流行、摇滚、古典器乐）。训练组合为\(\mathcal{D}_{\mathrm{voc}}\)（语音+歌唱）和\(\mathcal{D}_{\mathrm{all}}\)（全部）。各集合均划分了测试集。</li>
<li><strong>损失函数</strong>：T5模型（包括T5-Voc和T5-All）使用L1损失预测噪声（扩散模型标准损失）。PAD-Voc模型使用频谱L1重建损失。MAC-Voc（FlowMAC）使用流匹配目标。</li>
<li><strong>训练策略</strong>：论文指出所有模型的训练和采样程序遵循原始出版物。</li>
<li><strong>关键超参数</strong>：论文未提供T5模型的具体大小（如层数、隐藏维度）、优化器、学习率、批大小、训练步数。特征提取使用CREPE和<code>wav2vec2-xls-r-300m-timit-phoneme</code>。</li>
<li><strong>训练硬件</strong>：致谢中提到使用了Erlangen国家高性能计算中心（NHR@FAU）的HPC资源。</li>
<li><strong>推理细节</strong>：解码策略未详细说明。提到使用分类器自由引导（CFG），但未提供引导强度等具体参数。</li>
<li><strong>正则化或稳定训练技巧</strong>：主要使用条件Dropout，但\(p^{\mathrm{drop}}_{c}\)和\(p^{\mathrm{drop}}_{\mathrm{all}}\)的具体概率值未说明。</li>
</ul>
<h3 id="-评分理由">⚖️ 评分理由</h3>
<ul>
<li>
<p>创新性 (1.2/2)：论文提出跨领域模型迁移路径，将音乐合成FiLM机制重用于人声转换身份控制，并建立统一条件框架（PPG+f0+钢琴卷帘），有一定新意。但核心思路（迁移条件机制）非完全原创，且未深入解决迁移中暴露的核心矛盾（如联合训练质量下降），创新深度有限。</p>
</li>
<li>
<p>技术严谨性 (1.0/1.5)：方法描述清晰，框架设计合理（扩散模型、FiLM、条件Dropout），推理逻辑自洽。但存在明显技术局限：联合训练导致质量下降、音素保真度降低的根源未通过实验归因分析澄清（如缺乏消融），削弱了方法论的完备性。</p>
</li>
<li>
<p>实验充分性 (0.8/1.5)：实验覆盖自然度、相似性、音高、音素保真度及混合音频初步实验，评估较全面。但关键不足：基线选择不公平，未与同类扩散/流匹配语音转换模型对比；对关键负面结果（音素保真度下降）缺乏消融实验进行归因分析；缺乏失败案例详细分析。</p>
</li>
<li>
<p>清晰度 (0.9/1)：论文结构清晰，方法概述、实验设置和结果图表展示合理。写作流畅，对核心概念（如FiLM、PPG）解释到位。但部分细节（如T5模型具体大小、关键超参数p_drop_c/all）描述不够具体，不过这主要影响可复现性而非核心表达清晰度。</p>
</li>
<li>
<p>影响力 (1.0/1.5)：论文证明了音乐生成模型条件机制（FiLM）的通用性，为统一音频生成系统提供初步验证和参考路径，对音频生成研究有启发。但影响力受限于联合训练质量下降、音素保真度不足等实际挑战，以及未完全解决的跨域建模矛盾。提供项目主页展示定性样本，增加了实用参考价值。</p>
</li>
<li>
<p>开源 (0.0/1.5)：论文未发布核心代码、模型权重或数据资源，也未给出明确的后续开源承诺。</p>
</li>
<li>
<p>可复现性 (0.1/0.5)：论文描述了整体架构和流程，但关键配置大量缺失：未提供T5模型具体大小、优化器、学习率、批大小、训练步数等超参数；未说明条件Dropout具体概率值；训练数据为内部数据集；推理细节（如CFG引导强度）未充分说明。</p>
</li>
<li>
<p>工程/实践价值 (1.0/1.5)：展示了跨领域模型迁移的工程可行性，利用公开特征提取器（wav2vec2, CREPE）构建伪标签进行自监督训练，降低了数据门槛。统一框架处理语音、歌唱、混合输入的思路有工程价值。但联合训练导致质量下降、音素保真度问题表明当前工程化路径尚不成熟，存在明显实用性限制。</p>
</li>
</ul>
<h3 id="-局限与问题">🚨 局限与问题</h3>
<p><strong>论文明确承认的局限</strong>：</p>
<ol>
<li>加入器乐数据进行联合训练（T5-All）会导致语音和歌唱质量下降（约10-15 MUSHRA分），表明在统一模型中平衡不同领域存在挑战。</li>
<li>模型在音素保真度指标上劣于专用模型MAC-Voc，表明其生成的“创造性”可能损害内容的精确保真，这是一个需要根据应用权衡的特性。</li>
<li>使用通用声码器（BigVGAN）可能不是人声质量的最优选择。</li>
<li>未对混合数据生成（vocal-instrumental mixtures）进行定量评估（后文补充了初步实验）。</li>
</ol>
<p><strong>审稿人发现的潜在问题</strong>：</p>
<ol>
<li><strong>基线选择的公平性不足</strong>：论文将跨领域迁移的模型（T5）与专用语音模型（MAC-Voc）对比，但两者在生成范式（扩散 vs 流匹配）和模型架构上存在差异。缺少与同为Transformer-based的扩散或流匹配语音转换模型的对比，使得难以剥离“架构优势”与“迁移成功”的贡献。</li>
<li><strong>音素保真度下降的根源未明</strong>：论文将T5-Voc音素保真度较低归因于其更高的“表达性”和注意力架构，但这更像是一个观察而非深入分析。是PPG条件被FiLM或注意力机制部分“覆盖”？还是扩散过程引入了不稳定的语音变化？缺乏消融实验来定位问题。</li>
<li><strong>评估的全面性</strong>：论文未进行音素可懂度的主观听测，仅依赖客观PPG距离指标。在某些场景下，客观指标可能无法完全反映主观可懂度。</li>
<li><strong>数据偏见</strong>：训练数据中男性歌手占主导（混合集\(\mathcal{D}_{\mathrm{mix}}\)中33 male vs 4 female），可能影响模型对女性声音的泛化能力，但评估未细分此方面。</li>
<li><strong>缺乏失败案例分析</strong>：虽然提及了质量下降，但未展示具体的失败样本（如音素错误、音色混叠），这不利于社区深入理解模型的弱点。</li>
<li><strong>声码器选择的影响</strong>：使用通用声码器（BigVGAN）可能同时损害了所有对比模型（包括基线MAC-Voc）的语音质量上限，使得所有模型的自然度评分都可能被低估，但这并未在实验中作为变量被控制或讨论。</li>
</ol>
<hr>
<p><a href="/audio-paper-digest-blog/posts/2026-07-16/">← 返回 2026-07-16 语音/音乐/音频论文速递</a></p>
]]></content:encoded>
      <category>语音转换</category>
      <category>歌唱生成</category>
      <category>迁移学习</category>
      <category>领域适应</category>
      <category>音频理解</category>
    </item>
    <item>
      <title>Qwen-Music Technical Report</title>
      <link>https://nanless.github.io/audio-paper-digest-blog/posts/2026-07-14-qwen-music-technical-report-2607-11699/</link>
      <pubDate>Tue, 14 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://nanless.github.io/audio-paper-digest-blog/posts/2026-07-14-qwen-music-technical-report-2607-11699/</guid>
      <description>&lt;h1 id=&#34;-qwen-music-technical-report&#34;&gt;📄 Qwen-Music Technical Report&lt;/h1&gt;
&lt;p&gt;标签：#音乐生成 #多模态模型 #歌唱生成 #扩散模型 #大语言模型&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;7.4/10&lt;/strong&gt; | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.4/1.5&lt;/p&gt;
&lt;p&gt;✅ &lt;strong&gt;7.4/10&lt;/strong&gt; | 前50% | 文档类型：系统技术报告 | 评分置信度：高 | #音乐生成 | #多模态模型 | #歌唱生成 #扩散模型 | &lt;a href=&#34;https://arxiv.org/abs/2607.11699v1&#34;&gt;arxiv&lt;/a&gt;&lt;/p&gt;
&lt;h3 id=&#34;-作者与机构&#34;&gt;👥 作者与机构&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;作者列表：来自 Qwen Team。论文附录列出了 Core Contributors 和 Contributors 的名单，其中 Jin Xu 标注为通讯作者。机构未在论文中明确说明。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;-毒舌点评&#34;&gt;💡 毒舌点评&lt;/h3&gt;
&lt;p&gt;亮点在于其将大语言模型的生成范式与专业音乐渲染管线深度融合，构建了一个完整、可控且在评测中表现突出的工业级系统，展现了团队强大的工程整合能力。短板在于整个系统完全闭源，且训练数据筛选、奖励模型构建等关键工程细节的“黑箱”属性，使其学术贡献的可验证性和可复现性大打折扣。&lt;/p&gt;
&lt;h3 id=&#34;-核心摘要&#34;&gt;📌 核心摘要&lt;/h3&gt;
&lt;p&gt;本文介绍了Qwen-Music，一个用于生成带有人声完整歌曲的大规模音乐生成系统。该系统旨在解决从文本描述、歌词和音乐属性生成高质量、结构连贯歌曲，以及基于参考音频进行翻唱的技术挑战。核心方法是将生成过程解耦为语义作曲与声学渲染两个阶段，构建了Qwen-Music-Tokenizer、Qwen-Music-LLM和Qwen-Music-Render三大组件，并引入了旋律链式思维（Melody-CoT）机制进行显式旋律规划。相较于现有方法，其创新在于将大语言模型用于语义token序列建模，并设计了质量分级预训练课程和多阶段偏好对齐策略。在600个中英文提示词的客观评测中，Qwen-Music在16项音乐性和音频质量指标中的13项上取得最优结果；在盲测主观评估中，其生成质量优于MiniMax Music 2.6、Mureka V8、Suno V5等多个商业系统，并相对于最强的Suno V5.5略有优势（50.3% vs 49.7%）。该系统的实际意义在于推动了可控、高保真、结构连贯的端到端歌曲生成技术。主要局限性在于整个系统完全闭源，且训练数据筛选、奖励模型构建等关键工程细节不够透明，限制了其可复现性与学术影响力。&lt;/p&gt;</description>
      <content:encoded><![CDATA[<h1 id="-qwen-music-technical-report">📄 Qwen-Music Technical Report</h1>
<p>标签：#音乐生成 #多模态模型 #歌唱生成 #扩散模型 #大语言模型</p>
<p><strong>7.4/10</strong> | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.4/1.5</p>
<p>✅ <strong>7.4/10</strong> | 前50% | 文档类型：系统技术报告 | 评分置信度：高 | #音乐生成 | #多模态模型 | #歌唱生成 #扩散模型 | <a href="https://arxiv.org/abs/2607.11699v1">arxiv</a></p>
<h3 id="-作者与机构">👥 作者与机构</h3>
<ul>
<li>作者列表：来自 Qwen Team。论文附录列出了 Core Contributors 和 Contributors 的名单，其中 Jin Xu 标注为通讯作者。机构未在论文中明确说明。</li>
</ul>
<h3 id="-毒舌点评">💡 毒舌点评</h3>
<p>亮点在于其将大语言模型的生成范式与专业音乐渲染管线深度融合，构建了一个完整、可控且在评测中表现突出的工业级系统，展现了团队强大的工程整合能力。短板在于整个系统完全闭源，且训练数据筛选、奖励模型构建等关键工程细节的“黑箱”属性，使其学术贡献的可验证性和可复现性大打折扣。</p>
<h3 id="-核心摘要">📌 核心摘要</h3>
<p>本文介绍了Qwen-Music，一个用于生成带有人声完整歌曲的大规模音乐生成系统。该系统旨在解决从文本描述、歌词和音乐属性生成高质量、结构连贯歌曲，以及基于参考音频进行翻唱的技术挑战。核心方法是将生成过程解耦为语义作曲与声学渲染两个阶段，构建了Qwen-Music-Tokenizer、Qwen-Music-LLM和Qwen-Music-Render三大组件，并引入了旋律链式思维（Melody-CoT）机制进行显式旋律规划。相较于现有方法，其创新在于将大语言模型用于语义token序列建模，并设计了质量分级预训练课程和多阶段偏好对齐策略。在600个中英文提示词的客观评测中，Qwen-Music在16项音乐性和音频质量指标中的13项上取得最优结果；在盲测主观评估中，其生成质量优于MiniMax Music 2.6、Mureka V8、Suno V5等多个商业系统，并相对于最强的Suno V5.5略有优势（50.3% vs 49.7%）。该系统的实际意义在于推动了可控、高保真、结构连贯的端到端歌曲生成技术。主要局限性在于整个系统完全闭源，且训练数据筛选、奖励模型构建等关键工程细节不够透明，限制了其可复现性与学术影响力。</p>
<h3 id="-开源详情">🔗 开源详情</h3>
<ul>
<li>代码：论文中未提及Qwen-Music系统的代码链接。</li>
<li>模型权重：论文中未提及Qwen-Music模型权重链接。</li>
<li>数据集：论文中未提及开源数据集链接或具体获取方式。论文提及模型在超过500万小时的多语言音乐数据上进行训练，并使用了内部基于MOS的奖励模型和评估数据集（如SongBench、SongEval、AI生成的参考集、真实流行歌曲参考集等），但均未提供公开访问链接或开源协议。</li>
<li>Demo：论文中未提及在线演示或Demo链接。</li>
<li>复现材料：论文中未提及可公开获取的训练配置、检查点或附录材料。</li>
<li>论文中引用的开源项目：论文中提到了多项第三方技术或工具，但未提供它们的开源项目链接。具体包括：
<ul>
<li><strong>RMVPE</strong>：用于提取50 Hz人声音高曲线，提及于Wei et al., 2023，未提供链接。</li>
<li><strong>BestRQ</strong>：用于Qwen-Music-Tokenizer的双向自监督预训练，提及于Chiu et al., 2022，未提供链接。</li>
<li><strong>Qwen3-Embedding-0.6B</strong>：用作渲染器中的文本编码器，提及于Zhang et al., 2025，未提供链接。</li>
<li><strong>Qwen3.5-Omni</strong>：用于初始化Qwen-Music-LLM骨干网络及作为指令遵循的奖励模型，提及于Team, 2026，未提供链接。</li>
<li><strong>Qwen3-ASR</strong>：用于评估歌词可懂度的自动语音识别系统，提及于Shi et al., 2026，未提供链接。</li>
<li><strong>SpectroStream</strong>：其2D卷积架构被Spec-VAE参考，提及于Li and others, 2025，未提供链接。</li>
<li><strong>εar-VAE、Stable Audio Open (SA-Open)、Levo 2、SAME-L</strong>：在渲染器评估中作为基线对比的开源音频VAE系统，提及于各自文献，但文中未提供具体链接。</li>
<li><strong>SongBench、SongEval、AudioBox-Aesthetic</strong>：用作客观评估指标的框架，提及于各自文献，但文中未提供数据或代码链接。</li>
<li><strong>Gemini 3.1 Pro</strong>：用于评估标签遵循程度，提及于Comanici et al., 2025，未提供链接。</li>
<li><strong>Direct Preference Optimization (DPO)、Group Sequence Policy Optimization (GSPO)</strong>：提及的训练对齐方法，未提供代码链接。</li>
</ul>
</li>
</ul>
<h3 id="-方法概述和架构">🏗️ 方法概述和架构</h3>
<p>Qwen-Music是一个端到端的音乐生成流水线，其核心思想是将复杂的歌曲生成任务分解为“语义作曲”和“声学渲染”两个相对独立的阶段，以平衡生成可控性与输出保真度。整体流程为：用户输入自然语言描述和歌词，系统首先通过一个重写器将其转化为结构化文本条件（包含音乐标签和歌词），然后Qwen-Music-LLM基于该条件自回归地生成一串低帧率（25 Hz）的离散音乐语义token，最后Qwen-Music-Render将这些语义token连同文本条件作为指导，渲染生成48kHz的高保真立体声音频波形。</p>
<p><strong>主要组件详解：</strong></p>
<ol>
<li><strong>Qwen-Music-Tokenizer</strong>：负责将原始音频波形压缩为25 Hz的单码本音乐语义token流。其骨干网络是一个0.6B参数的Conformer编码器，包含卷积前端和24层Conformer。训练分为四个阶段：首先使用BestRQ进行双向自监督预训练学习通用音乐表征；然后将注意力转换为因果模式以适应自回归建模；接着进行多任务监督微调（SFT），使用CTC歌词转录、Mel频谱图重建和色度特征重建三个损失函数，迫使编码器表征同时保留语义和声学信息；最后插入一个包含32768个码字的向量量化（VQ）瓶颈，并通过平滑插入和分阶段解冻的稳定训练策略完成最终离散化。输出即为供下游LLM使用的25 Hz token序列。</li>
</ol>
<p>下图概述了Qwen-Music-Tokenizer的训练流程。</p>
<p><img alt="Figure 5: Overview of Qwen-Music-Tokenizer. The tokenizer maps music waveforms to 25 Hz Music Semantic Tokens through BestRQ pretraining, causal adaptation, multi-task SFT, and VQ tokenizer training." loading="lazy" src="https://arxiv.org/html/2607.11699v1/x2.png"></p>
<p>图中展示了四个训练阶段：双向预训练、因果适应、多任务SFT和VQ微调。</p>
<ol start="2">
<li>
<p><strong>Qwen-Music-LLM</strong>：核心是一个基于33B参数Qwen3.5-Omni初始化的自回归大语言模型。它接收文本条件（标签和歌词），并预测音乐语义token序列。其关键创新是<strong>Melody-CoT（旋律链式思维）机制</strong>。在生成完整的混合音乐语义token之前，模型可以先生成一个由旋律token组成的中间计划。这些旋律token由专门的<strong>旋律分词器</strong>从参考音频的基频轮廓中提取：先用RMVPE提取50Hz基频，下采样至6.25Hz，然后转换为相对于序列中位数的相对MIDI音高偏移，并量化为256个离散值。这种相对表示法避免了泄露绝对音高和音色信息。在训练时，模型混合学习三种序列模式：纯文本到音乐、带段落级旋律CoT的生成、以及带唯一段落级旋律CoT的生成，后者通过为重复段落（如副歌）只采样一个代表性旋律，防止模型过度依赖参考。</p>
</li>
<li>
<p><strong>Qwen-Music-Render</strong>：负责将离散的语义token“渲染”成高保真波形，包含三个子阶段。</p>
<ul>
<li><strong>扩散Transformer（DiT）</strong>：一个1.3B参数的Diffusion Transformer，接收带噪声的连续声学潜变量，以及作为条件的音乐语义token序列和文本嵌入（通过冻结的文本编码器提取并经Transformer处理）。通过条件流匹配预测去噪后的潜变量。文本条件通过交叉注意力注入，并支持分类器自由引导（CFG），采用“文本丢弃”策略。</li>
<li><strong>Spec-VAE</strong>：一个类似SpectroStream的2D卷积自动编码器。编码器将48kHz立体声STFT复数频谱图压缩为128维、25Hz的潜变量（192倍压缩）。解码器从潜变量重建粗略的复数频谱图。其解码器中引入了<strong>Spec-SnakeBeta</strong>激活函数，这是一种频率感知的激活函数，其周期性调制参数沿频率轴学习，初始化基于对数频率先验。</li>
<li><strong>Band-Mode Refiner</strong>：一个轻量的ConvNeXt-1D模块，用于对Spec-VAE解码器的输出进行精修。它根据频率带的特点应用不同策略：低频仅修正相位，中频同时修正幅度和相位，高频仅修正幅度。初始化时所有权重为零，确保训练稳定。</li>
</ul>
</li>
</ol>
<p>下图详细展示了Qwen-Music-Render的内部架构。</p>
<p><img alt="Figure 6: Overview of Qwen-Music-Render. Music Semantic Tokens and text conditions guide a semantic-conditioned DiT that predicts acoustic latents. Spec-VAE decodes the latents into complex spectrograms, and the Band-Mode Refiner corrects b" loading="lazy" src="https://arxiv.org/html/2607.11699v1/x3.png"></p>
<p>图中展示了DiT、Spec-VAE和Band-Mode Refiner如何协同工作，将语义token转换为音频波形。</p>
<p><strong>组件间数据流</strong>：文本描述 -&gt; 重写器 -&gt; 结构化文本条件 -&gt; Qwen-Music-LLM（条件化生成）-&gt; 音乐语义token序列 -&gt; Qwen-Music-Render（结合文本条件进行渲染）-&gt; DiT预测声学潜变量 -&gt; Spec-VAE解码器生成粗略频谱图 -&gt; Band-Mode Refiner精修 -&gt; 逆STFT得到48kHz立体声波形。</p>
<p>下图展示了Qwen-Music系统的完整推理数据流。</p>
<p><img alt="Figure 4: Overview of the Qwen-Music inference pipeline. Given a user request, Qwen-Music first rewrites the natural-language description into a structured textual condition, including musical tags (such as genre, singer characteristics, in" loading="lazy" src="https://arxiv.org/html/2607.11699v1/figures/model.jpg"></p>
<p>图中清晰显示了从文本输入到最终音频输出的各个阶段，包括重写器、LLM和渲染器的交互。</p>
<p><strong>关键设计选择</strong>：采用语义token作为中间表示，是为了在降低LLM建模的序列长度和计算复杂度的同时，保留足够的音乐语义信息，而将高频声学细节的恢复交给专门的渲染器。Melody-CoT的设计则平衡了旋律控制力和风格自由度。</p>
<h3 id="-核心创新点">💡 核心创新点</h3>
<ol>
<li><strong>Melody-CoT（旋律链式思维）机制</strong>：在文本到音乐生成中引入显式旋律规划步骤，先生成粗粒度的旋律轮廓token序列，再生成完整的音乐。这解决了文本提示通常不指定具体旋律的问题，提升了生成的结构性和可控性。同时，它为翻唱生成提供了统一的接口，通过替换参考旋律token来实现风格迁移。</li>
<li><strong>质量分级预训练课程</strong>：为应对5M小时异质音乐数据的质量差异，论文训练了一个内部MOS预测模型对数据按质量排序，并设计了从低质量（Q3-Q6）到高质量（Q2、Q1）的三阶段课程学习策略。这比简单丢弃低质数据更高效，使模型先广泛覆盖，再逐步聚焦于高质量生成。</li>
<li><strong>Band-Mode Refiner（频带模式精修器）</strong>：针对不同频率带在幅度和相位重建上的不同误差特性，设计了一个轻量级后处理模块，分别采用相位修正、联合修正和幅度修正策略。该设计有效提升了Spec-VAE解码后的频谱保真度，尤其在中低频段。</li>
<li><strong>Spec-SnakeBeta激活函数</strong>：将BigVGAN中的SnakeBeta激活扩展为频率感知版本，其周期性调制参数沿STFT频率轴独立学习，并基于对数频率进行初始化。这使神经网络能更好地适应不同频段的声学特性。</li>
<li><strong>完整的工业级系统与训练流程</strong>：报告详细构建了从数据筛选（声学质量管道）、模型训练（多阶段课程与多阶段对齐）到推理渲染的完整pipeline，提供了系统级的大规模音乐生成解决方案，工程参考价值高。</li>
</ol>
<h3 id="-实验结果">📊 实验结果</h3>
<p>论文在文本到音乐生成和翻唱生成两个任务上进行了全面评估。</p>
<p>下图展示了在盲测中，Qwen-Music与领先商业系统的胜率对比。</p>
<p><img alt="Figure 2: Blind A/B preference results between Qwen-Music and leading proprietary systems, including MiniMax Music 2.5+, MiniMax Music 2.6, Mureka V8, Suno V5, and Suno V5.5, judged by professional human raters. Each pair is evaluated under" loading="lazy" src="https://arxiv.org/html/2607.11699v1/x1.png"></p>
<p>从图中可见，Qwen-Music在多个对比中获得超过50%的胜率，显示其竞争力。</p>
<p><strong>文本到音乐生成（600个中英文提示词）：</strong>
客观指标评测结果如下表所示：</p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">指标 (↑)</th>
					<th style="text-align: left">Qwen-Music</th>
					<th style="text-align: left">Suno V5.5</th>
					<th style="text-align: left">Suno V5</th>
					<th style="text-align: left">Mureka V8</th>
					<th style="text-align: left">MiniMax Music 2.6</th>
					<th style="text-align: left">MiniMax Music 2.5+</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left"><strong>SongBench</strong></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
			</tr>
			<tr>
					<td style="text-align: left">旋律</td>
					<td style="text-align: left"><strong>7.03</strong></td>
					<td style="text-align: left">6.70</td>
					<td style="text-align: left">7.01</td>
					<td style="text-align: left">6.98</td>
					<td style="text-align: left">6.64</td>
					<td style="text-align: left">6.41</td>
			</tr>
			<tr>
					<td style="text-align: left">编曲</td>
					<td style="text-align: left"><strong>7.35</strong></td>
					<td style="text-align: left">7.03</td>
					<td style="text-align: left">7.20</td>
					<td style="text-align: left">7.14</td>
					<td style="text-align: left">6.72</td>
					<td style="text-align: left">6.45</td>
			</tr>
			<tr>
					<td style="text-align: left">音乐性</td>
					<td style="text-align: left"><strong>6.22</strong></td>
					<td style="text-align: left">5.83</td>
					<td style="text-align: left">6.12</td>
					<td style="text-align: left">6.05</td>
					<td style="text-align: left">5.67</td>
					<td style="text-align: left">5.50</td>
			</tr>
			<tr>
					<td style="text-align: left">人声</td>
					<td style="text-align: left"><strong>7.44</strong></td>
					<td style="text-align: left">6.95</td>
					<td style="text-align: left">7.37</td>
					<td style="text-align: left">7.38</td>
					<td style="text-align: left">6.99</td>
					<td style="text-align: left">6.89</td>
			</tr>
			<tr>
					<td style="text-align: left">器乐</td>
					<td style="text-align: left"><strong>7.24</strong></td>
					<td style="text-align: left">6.85</td>
					<td style="text-align: left">7.03</td>
					<td style="text-align: left">7.01</td>
					<td style="text-align: left">6.64</td>
					<td style="text-align: left">6.52</td>
			</tr>
			<tr>
					<td style="text-align: left">混音</td>
					<td style="text-align: left"><strong>7.13</strong></td>
					<td style="text-align: left">6.88</td>
					<td style="text-align: left">7.07</td>
					<td style="text-align: left">6.97</td>
					<td style="text-align: left">6.59</td>
					<td style="text-align: left">6.38</td>
			</tr>
			<tr>
					<td style="text-align: left">结构</td>
					<td style="text-align: left">6.94</td>
					<td style="text-align: left">6.83</td>
					<td style="text-align: left">6.98</td>
					<td style="text-align: left"><strong>7.02</strong></td>
					<td style="text-align: left">6.55</td>
					<td style="text-align: left">6.27</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>SongEval</strong></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
			</tr>
			<tr>
					<td style="text-align: left">连贯性</td>
					<td style="text-align: left"><strong>4.55</strong></td>
					<td style="text-align: left">4.28</td>
					<td style="text-align: left">4.44</td>
					<td style="text-align: left">4.49</td>
					<td style="text-align: left">4.33</td>
					<td style="text-align: left">4.28</td>
			</tr>
			<tr>
					<td style="text-align: left">音乐性</td>
					<td style="text-align: left"><strong>4.42</strong></td>
					<td style="text-align: left">4.12</td>
					<td style="text-align: left">4.30</td>
					<td style="text-align: left">4.36</td>
					<td style="text-align: left">4.19</td>
					<td style="text-align: left">4.15</td>
			</tr>
			<tr>
					<td style="text-align: left">记忆度</td>
					<td style="text-align: left"><strong>4.51</strong></td>
					<td style="text-align: left">4.27</td>
					<td style="text-align: left">4.43</td>
					<td style="text-align: left">4.51</td>
					<td style="text-align: left">4.29</td>
					<td style="text-align: left">4.23</td>
			</tr>
			<tr>
					<td style="text-align: left">清晰度</td>
					<td style="text-align: left"><strong>4.45</strong></td>
					<td style="text-align: left">4.17</td>
					<td style="text-align: left">4.33</td>
					<td style="text-align: left">4.37</td>
					<td style="text-align: left">4.23</td>
					<td style="text-align: left">4.17</td>
			</tr>
			<tr>
					<td style="text-align: left">自然度</td>
					<td style="text-align: left"><strong>4.37</strong></td>
					<td style="text-align: left">4.10</td>
					<td style="text-align: left">4.27</td>
					<td style="text-align: left">4.37</td>
					<td style="text-align: left">4.16</td>
					<td style="text-align: left">4.08</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>AudioBox-Aesthetic</strong></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
			</tr>
			<tr>
					<td style="text-align: left">内容享受度</td>
					<td style="text-align: left"><strong>7.47</strong></td>
					<td style="text-align: left">7.35</td>
					<td style="text-align: left">7.40</td>
					<td style="text-align: left">7.31</td>
					<td style="text-align: left">7.39</td>
					<td style="text-align: left">7.42</td>
			</tr>
			<tr>
					<td style="text-align: left">内容有用性</td>
					<td style="text-align: left"><strong>7.86</strong></td>
					<td style="text-align: left">7.85</td>
					<td style="text-align: left">7.75</td>
					<td style="text-align: left">7.67</td>
					<td style="text-align: left">7.82</td>
					<td style="text-align: left">7.83</td>
			</tr>
			<tr>
					<td style="text-align: left">制作复杂度</td>
					<td style="text-align: left">6.64</td>
					<td style="text-align: left">6.67</td>
					<td style="text-align: left"><strong>6.71</strong></td>
					<td style="text-align: left">6.67</td>
					<td style="text-align: left">6.64</td>
					<td style="text-align: left">6.49</td>
			</tr>
			<tr>
					<td style="text-align: left">制作质量</td>
					<td style="text-align: left">8.15</td>
					<td style="text-align: left">8.08</td>
					<td style="text-align: left">8.08</td>
					<td style="text-align: left">7.95</td>
					<td style="text-align: left">8.15</td>
					<td style="text-align: left"><strong>8.20</strong></td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>标签跟随 (Gemini 3.1 Pro, 1-10)</strong></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
			</tr>
			<tr>
					<td style="text-align: left">流派</td>
					<td style="text-align: left">8.08</td>
					<td style="text-align: left">8.33</td>
					<td style="text-align: left">8.28</td>
					<td style="text-align: left"><strong>8.46</strong></td>
					<td style="text-align: left">8.01</td>
					<td style="text-align: left">7.60</td>
			</tr>
			<tr>
					<td style="text-align: left">情绪</td>
					<td style="text-align: left">8.94</td>
					<td style="text-align: left">8.93</td>
					<td style="text-align: left">8.98</td>
					<td style="text-align: left">8.67</td>
					<td style="text-align: left">8.57</td>
					<td style="text-align: left">8.20</td>
			</tr>
			<tr>
					<td style="text-align: left">乐器</td>
					<td style="text-align: left">8.65</td>
					<td style="text-align: left">8.80</td>
					<td style="text-align: left">8.89</td>
					<td style="text-align: left">8.66</td>
					<td style="text-align: left">8.15</td>
					<td style="text-align: left">7.79</td>
			</tr>
			<tr>
					<td style="text-align: left">人声性别</td>
					<td style="text-align: left"><strong>7.85</strong></td>
					<td style="text-align: left">7.54</td>
					<td style="text-align: left">7.58</td>
					<td style="text-align: left">7.77</td>
					<td style="text-align: left">7.57</td>
					<td style="text-align: left">7.48</td>
			</tr>
			<tr>
					<td style="text-align: left">人声音色</td>
					<td style="text-align: left">8.68</td>
					<td style="text-align: left">8.71</td>
					<td style="text-align: left">8.67</td>
					<td style="text-align: left">8.38</td>
					<td style="text-align: left">8.31</td>
					<td style="text-align: left">8.58</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>可懂度 (PER, ↓)</strong></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
			</tr>
			<tr>
					<td style="text-align: left">PER</td>
					<td style="text-align: left">6.10</td>
					<td style="text-align: left"><strong>4.19</strong></td>
					<td style="text-align: left">6.80</td>
					<td style="text-align: left">9.04</td>
					<td style="text-align: left">6.40</td>
					<td style="text-align: left">6.29</td>
			</tr>
			<tr>
					<td style="text-align: left">主观盲测中，Qwen-Music获得59.1%胜率（vs MiniMax 2.5+）、66.7%（vs MiniMax 2.6）、58.3%（vs Mureka V8）、55.4%（vs Suno V5）和50.3%（vs Suno V5.5）。在Artificial Analysis Music with Vocals Leaderboard上以JazzCat名义排名第三。</td>
					<td></td>
					<td></td>
					<td></td>
					<td></td>
					<td></td>
					<td></td>
			</tr>
	</tbody>
</table>
<p><strong>翻唱生成（AI生成参考集）：</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">指标</th>
					<th style="text-align: left">Qwen-Music (section)</th>
					<th style="text-align: left">Qwen-Music (unique section)</th>
					<th style="text-align: left">Suno V5.5</th>
					<th style="text-align: left">Suno V5</th>
					<th style="text-align: left">MiniMax Cover</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left"><strong>旋律跟随 (Melody MAE, ↓)</strong></td>
					<td style="text-align: left"><strong>1.48</strong></td>
					<td style="text-align: left">1.80</td>
					<td style="text-align: left">2.00</td>
					<td style="text-align: left">1.87</td>
					<td style="text-align: left">1.89</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>标签跟随 (流派)</strong></td>
					<td style="text-align: left">5.92</td>
					<td style="text-align: left">7.34</td>
					<td style="text-align: left"><strong>8.27</strong></td>
					<td style="text-align: left">7.14</td>
					<td style="text-align: left">5.42</td>
			</tr>
	</tbody>
</table>
<p><strong>翻唱生成（真实流行歌曲参考集）：</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">指标</th>
					<th style="text-align: left">Qwen-Music (section)</th>
					<th style="text-align: left">Qwen-Music (unique section)</th>
					<th style="text-align: left">MiniMax Cover</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left"><strong>SongBench</strong></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
			</tr>
			<tr>
					<td style="text-align: left">旋律</td>
					<td style="text-align: left">6.55</td>
					<td style="text-align: left">6.57</td>
					<td style="text-align: left">6.18</td>
			</tr>
			<tr>
					<td style="text-align: left">编曲</td>
					<td style="text-align: left">6.84</td>
					<td style="text-align: left">6.86</td>
					<td style="text-align: left">6.16</td>
			</tr>
			<tr>
					<td style="text-align: left">音乐性</td>
					<td style="text-align: left">5.75</td>
					<td style="text-align: left">5.79</td>
					<td style="text-align: left">5.30</td>
			</tr>
			<tr>
					<td style="text-align: left">人声</td>
					<td style="text-align: left">7.07</td>
					<td style="text-align: left">7.09</td>
					<td style="text-align: left">6.73</td>
			</tr>
			<tr>
					<td style="text-align: left">器乐</td>
					<td style="text-align: left">6.96</td>
					<td style="text-align: left">7.00</td>
					<td style="text-align: left">6.41</td>
			</tr>
			<tr>
					<td style="text-align: left">混音</td>
					<td style="text-align: left">6.66</td>
					<td style="text-align: left">6.67</td>
					<td style="text-align: left">6.25</td>
			</tr>
			<tr>
					<td style="text-align: left">结构</td>
					<td style="text-align: left">6.48</td>
					<td style="text-align: left">6.46</td>
					<td style="text-align: left">6.13</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>可懂度 (PER, ↓)</strong></td>
					<td style="text-align: left">20.20</td>
					<td style="text-align: left">18.49</td>
					<td style="text-align: left">22.48</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>旋律跟随 (Melody MAE, ↓)</strong></td>
					<td style="text-align: left">1.44</td>
					<td style="text-align: left">1.80</td>
					<td style="text-align: left">1.76</td>
			</tr>
			<tr>
					<td style="text-align: left"><strong>标签跟随</strong></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
					<td style="text-align: left"></td>
			</tr>
			<tr>
					<td style="text-align: left">流派</td>
					<td style="text-align: left">6.90</td>
					<td style="text-align: left">7.35</td>
					<td style="text-align: left">5.84</td>
			</tr>
			<tr>
					<td style="text-align: left">情绪</td>
					<td style="text-align: left">7.48</td>
					<td style="text-align: left">8.05</td>
					<td style="text-align: left">7.05</td>
			</tr>
			<tr>
					<td style="text-align: left">乐器</td>
					<td style="text-align: left">8.05</td>
					<td style="text-align: left">8.30</td>
					<td style="text-align: left">7.23</td>
			</tr>
			<tr>
					<td style="text-align: left">人声性别</td>
					<td style="text-align: left">8.88</td>
					<td style="text-align: left">9.18</td>
					<td style="text-align: left">6.80</td>
			</tr>
			<tr>
					<td style="text-align: left">人声音色</td>
					<td style="text-align: left">8.21</td>
					<td style="text-align: left">8.54</td>
					<td style="text-align: left">7.75</td>
			</tr>
	</tbody>
</table>
<p><strong>Qwen-Music-Render 消融实验：</strong></p>
<table>
	<thead>
			<tr>
					<th style="text-align: left">潜在骨干</th>
					<th style="text-align: left">文本条件</th>
					<th style="text-align: left">CFG策略</th>
					<th style="text-align: left">SongBench (旋律)</th>
					<th style="text-align: left">SongBench (音乐性)</th>
					<th style="text-align: left">SongEval (连贯性)</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td style="text-align: left">Levo 2 VAE</td>
					<td style="text-align: left">无</td>
					<td style="text-align: left">LM-token drop</td>
					<td style="text-align: left">6.55</td>
					<td style="text-align: left">5.66</td>
					<td style="text-align: left">4.28</td>
			</tr>
			<tr>
					<td style="text-align: left">Levo 2 VAE</td>
					<td style="text-align: left">标签+歌词</td>
					<td style="text-align: left">LM-token drop</td>
					<td style="text-align: left">6.56</td>
					<td style="text-align: left">5.71</td>
					<td style="text-align: left">4.31</td>
			</tr>
			<tr>
					<td style="text-align: left">Spec-VAE</td>
					<td style="text-align: left">仅标签</td>
					<td style="text-align: left">LM-token drop</td>
					<td style="text-align: left">6.88</td>
					<td style="text-align: left">6.04</td>
					<td style="text-align: left">4.44</td>
			</tr>
			<tr>
					<td style="text-align: left">Spec-VAE</td>
					<td style="text-align: left">标签+歌词</td>
					<td style="text-align: left">Full-drop</td>
					<td style="text-align: left">6.89</td>
					<td style="text-align: left">6.05</td>
					<td style="text-align: left">4.38</td>
			</tr>
			<tr>
					<td style="text-align: left">Spec-VAE</td>
					<td style="text-align: left">标签+歌词</td>
					<td style="text-align: left">LM-token drop</td>
					<td style="text-align: left">6.88</td>
					<td style="text-align: left">6.04</td>
					<td style="text-align: left">4.39</td>
			</tr>
			<tr>
					<td style="text-align: left">Spec-VAE</td>
					<td style="text-align: left">标签+歌词</td>
					<td style="text-align: left">Text-drop</td>
					<td style="text-align: left"><strong>6.96</strong></td>
					<td style="text-align: left"><strong>6.17</strong></td>
					<td style="text-align: left"><strong>4.47</strong></td>
			</tr>
	</tbody>
</table>
<h3 id="-细节详述">🔬 细节详述</h3>
<ul>
<li><strong>训练数据</strong>：超过500万小时的多语言音乐数据。具体来源未说明。使用内部MOS奖励模型进行质量评分，并按流派内百分位数分为7个质量等级（Q1-Q7），丢弃最低的Q7，使用Q1-Q6训练。用于Renderer训练的数据经过严格的声学质量管道筛选。</li>
<li><strong>损失函数</strong>：
<ul>
<li>Qwen-Music-Tokenizer Stage 1: BestRQ掩码预测损失（交叉熵）。</li>
<li>Stage 3 SFT: 组合损失 = CTC歌词损失 + Mel频谱图重建损失（谱收敛+幅度） + 色度特征重建损失。</li>
<li>Stage 4 VQ: 上述SFT损失（CTC权重降为0.5） + VQ承诺损失。</li>
<li>Qwen-Music-LLM: 标准的下一token预测交叉熵损失，同时应用于旋律CoT区域和音乐语义token区域。</li>
<li>Qwen-Music-Render DiT: 条件流匹配损失。</li>
<li>Spec-VAE + Refiner: 组合损失 = 多分辨率STFT损失 + IF/GD相位损失 + LSGAN对抗损失（含特征匹配） + KL正则化。还使用了K-加权感知滤波、MSLR立体声分解、自适应对数幅度归一化等技巧。</li>
</ul>
</li>
<li><strong>训练策略</strong>：
<ul>
<li><strong>Tokenizer训练</strong>：四阶段课程（双向BestRQ预训练 -&gt; 因果适应 -&gt; 多任务SFT -&gt; VQ微调）。</li>
<li><strong>LLM预训练</strong>：三阶段课程（Q3-Q6动态采样 -&gt; Q2退火 -&gt; Q1高质量精炼）。初始化自Qwen3.5-Omni 33B。</li>
<li><strong>LLM后训练</strong>：三阶段对齐（高质量SFT冷启动 -&gt; 迭代离线DPO -&gt; 在线GSPO）。</li>
<li><strong>Render训练</strong>：DiT分两阶段（大规模预训练 + 高质量SFT）。Spec-VAE+Refiner分三阶段（重建预训练 -&gt; 引入波形域对抗训练 -&gt; 冻结编解码器，训练Refiner并引入频谱域判别器）。</li>
</ul>
</li>
<li><strong>关键超参数</strong>：
<ul>
<li>Tokenizer: 0.6B Conformer, 24层，宽度1024，16头，25Hz，码本大小32768。</li>
<li>LLM: 33B参数（自Qwen3.5-Omni初始化）。</li>
<li>Render DiT: 1.3B参数，32层，宽度1024，24头。</li>
<li>Spec-VAE: 输入48kHz立体声STFT (2×480×T)，压缩至128维、25Hz潜变量（192倍压缩）。</li>
<li>旋律分词器: 从50Hz基频下采样至6.25Hz，相对MIDI编码，256码本。</li>
</ul>
</li>
<li><strong>训练硬件</strong>：未说明。</li>
<li><strong>推理细节</strong>：DiT渲染支持分类器自由引导（CFG），论文采用了“文本丢弃”策略，即无条件分支保留语义token但丢弃文本条件。具体引导强度未说明。</li>
<li><strong>数据筛选</strong>：报告中详细描述了用于筛选Render训练数据的声学质量管道，包括元数据检查、比特率分析、响度分析、假立体声检测和基于噪声底检测的频谱截止检测。</li>
</ul>
<h3 id="-评分理由">⚖️ 评分理由</h3>
<ul>
<li>
<p>创新性 (1.4/2)：基于[A_SUMMARY]和[A_METHOD]，创新点包括将LLM用于语义token建模、引入Melody-CoT进行显式旋律规划以及设计质量分级训练课程，这些属于系统级工程整合优化，但并非范式突破。</p>
</li>
<li>
<p>技术严谨性 (1.1/1.5)：基于[A_METHOD]，系统架构设计逻辑清晰，各组件功能划分合理，技术细节描述充分。但部分评估环节的严谨性有待商榷，如所用的客观指标本身的信效度讨论。</p>
</li>
<li>
<p>实验充分性 (1.2/1.5)：基于[A_RESULTS]和[A_LIMITS]，评估覆盖多任务、多基线、主客观指标，但缺乏与学术界开源模型的对比，且主观评估样本量等细节未充分说明，影响了评估的全面性。</p>
</li>
<li>
<p>清晰度 (0.9/1)：基于[A_METHOD]，论文组织结构良好，图表清晰。但部分技术描述略显冗长，在Renderer损失函数等模块堆砌大量技术名词，可能增加读者理解负担。</p>
</li>
<li>
<p>影响力 (1.3/1.5)：基于[A_SUMMARY]和[A_METHOD]，该工作直接针对音乐生成核心任务，展示了强大的系统构建能力和工程整合实践，其完整的工业级pipeline对业界和学界均有重要参考意义。</p>
</li>
<li>
<p>开源 (0.0/1.5)：论文未发布核心代码、模型权重或数据资源，也未给出明确的后续开源承诺。</p>
</li>
<li>
<p>可复现性 (0.1/0.5)：基于[A_LIMITS]和[A_OPEN]，尽管描述了架构和许多流程细节，但关键信息大量缺失，包括：训练数据构成、内部MOS奖励模型细节、各组件具体训练硬件与耗时、以及许多训练超参数，独立团队几乎无法复现。</p>
</li>
<li>
<p>工程/实践价值 (1.4/1.5)：基于[A_METHOD]和[A_SUMMARY]，作为系统技术报告，其构建了从数据筛选、多阶段课程训练到复杂Renderer训练的完整工业级pipeline，包含大量可操作的工程细节和解决方案，参考价值高。</p>
</li>
</ul>
<h3 id="-局限与问题">🚨 局限与问题</h3>
<ol>
<li><strong>论文明确承认的局限</strong>：作者在结论中提到，未来工作将探索更灵活的长上下文音乐结构建模、更精细的歌唱和表演表现力控制，以及更高效的渲染架构。这间接承认了当前系统在长时序结构控制、表现力细节和推理效率上仍有提升空间。</li>
<li><strong>审稿人发现的潜在问题</strong>：
<ul>
<li><strong>完全闭源与可复现性危机</strong>：这是最核心的问题。作为一个声称SOTA的大规模系统，不开源代码、模型和数据，使得其所有技术声明和实验结果都无法被独立验证和复现，严重削弱了论文的学术贡献。</li>
<li><strong>训练数据与奖励模型的“黑箱”</strong>：5M小时数据的筛选严重依赖一个未公开细节的MOS奖励模型。该模型的质量、偏差直接影响整个课程学习的有效性。DPO/GSPO的奖励信号也来自未充分描述的模型。</li>
<li><strong>模型规模与计算成本未披露</strong>：虽然给出了参数量（Tokenizer 0.6B, LLM 33B, DiT 1.3B），但训练所需的具体计算资源（GPU小时数、能耗）未提及，难以评估其可行性和环境成本。</li>
<li><strong>评估的局限性</strong>：主观评估虽由专业评委进行，但样本量（600个提示词，每个系统对比）和评委多样性（50人）未详细说明。客观指标如SongBench、SongEval等，其本身的信效度和与人类偏好的相关性也存在讨论空间。翻唱生成评估中，使用AI生成歌曲作为参考集可能与真实应用场景存在差距。</li>
</ul>
</li>
</ol>
<hr>
<p><a href="/audio-paper-digest-blog/posts/2026-07-14/">← 返回 2026-07-14 语音/音乐/音频论文速递</a></p>
]]></content:encoded>
      <category>音乐生成</category>
      <category>多模态模型</category>
      <category>歌唱生成</category>
      <category>扩散模型</category>
      <category>大语言模型</category>
    </item>
  </channel>
</rss>
