📄 GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model
标签:#语音合成 #强化学习 #流匹配 #自回归模型 #音频理解
8.0/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5
🔥 8.0/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #强化学习 | #流匹配 #自回归模型 | arxiv
👥 作者与机构
- 第一作者:Guanrou Yang (1,2, 未说明具体机构)
- 通讯作者:Xie Chen (1,2, 未说明具体机构, 标注为corresponding author)
- 作者列表: Guanrou Yang (1,2), Tian Tan (1), Qian Chen (4), Ziyang Ma (1,2), Yakun Song (1,2), Zhikang Niu (1,2), Qi Chen (1,2), Wenming Tu (1), Haitao Li (2,5), Shan Yang (3), Xie Chen (1,2)
注:原文脚注1-5对应不同机构,但具体机构名称在正文中完全未给出,无法获知作者所属单位。
💡 毒舌点评
这篇论文将一个直观但被长期忽视的洞见打磨成了在TTS强化学习中极其实用的武器:当预训练模型奖励高度饱和时,指数奖励加权会退化,而线性带符号组归一化优势能充分恢复组内信用分配信号。方法利落,实验扎实且有体系化的消融支持。然而,它仍未完全挣脱"精密工程组合"的范畴——所有组件都能在GRPO、流匹配和奖励加权回归文献中找到前身,真正的理论贡献仅在于一次泰勒展开。各独立机构的匿名处理也让审稿读起来多了一分"猜谜"感。
📌 核心摘要
本文针对自回归扩散文本到语音(AR-Diffusion TTS)模型在强化学习微调时遭遇的根本性困难:现有基于轨迹的策略梯度方法须将确定性ODE采样转为随机SDE,并逐步追踪似然比,不但计算开销巨大,且引入扰动噪声。论文提出GROW,一种组相对优势加权的同策略RL方法。其核心有别于主流的做法,在于直接在标准的流匹配回归损失上施加带符号的、组内Z标准化的优势权重,并用Wasserstein-2速度惩罚锚定预训练参考模型,完全规避了SDE转换和轨迹似然估计。论文通过泰勒展开揭示了,对于奖励高度集中的强预训练TTS模型,传统的正指数奖励加权会退化为奖励无关的"自模仿"项占主导,而零均值带符号线性优势则能保留关键的组内信用分配对比信号。在LibriSpeech和Seed-TTS中英文三个测试集上,GROW平均将词错误率(WER)从2.016降至1.558,说话人相似度(SIM)从0.676提升至0.715,同时保持自然度(UTMOS)不受损。训练效率方面,GROW的10-NFE采样训练比32-NFE的DiTAR-GRPO基线快约2.9倍。论文摘要中已提供GitHub代码链接,并承诺开源全部代码、模型检查点与复现配置。
🔗 开源详情
- 代码:https://github.com/yanghaha0908/GROW (论文中已提供)
- 模型权重:论文承诺将开源所有模型检查点(“We will open-source complete GROW codes, faithful DiTAR reproduction, and all model checkpoints”),但未提供具体的模型权重下载链接。
- 数据集:
- LibriSpeech(英文,公开数据集)
- Seed-TTS EN 和 Seed-TTS ZH(内部评估集,论文中未提供获取链接)
- 预训练使用Emilia语料库(公开,https://huggingface.co/datasets/amphion/Emilia)
- Demo:论文未提及
- 复现材料:论文提供了详尽的训练与RL微调配置(组大小、奖励标准化、学习率、NFE、β_W2、CFG系数等),可在代码仓库基础上复现,但未单独提供额外的复现文档包。
- 论文引用的关键开源项目:Qwen3-0.6B(作为AR骨干)、Semantic-VAE(语音编码器)、F5-TTS sway采样调度表、Whisper-large-v3、WavLM-large、Paraformer-zh
🏗️ 方法概述和架构
GROW是一种面向流匹配生成模型的在线RL微调框架,专门部署于自回归扩散TTS模型DiTAR上。其核心思路是利用流匹配损失天然的吸收奖励信号的能力,通过优势加权直接进行策略改进,而非通过策略梯度修改采样过程。整个方法围绕四个紧密耦合的在线阶段展开:
1. 在线采样与奖励评估 每个训练步从数据集取一条样本(提示语音、提示文本、目标文本),从当前策略模型(待优化的DiTAR)采样G个候选语音(论文设G=8),形成一组同提示的"组"。每个候选语音分别送入两个固定的、不可微的奖励模型进行评估:一个说话人编码器(WavLM-large)计算候选语音与提示语音的说话人相似度(\(R_{sim} = \cos(\text{SPK}(\hat{x}), \text{SPK}(x^{ref}))\));一个语音识别模型(Whisper-large-v3用于英文,Paraformer-zh用于中文)计算词错误率WER,并转换为 \(R_{wer} = 1 - \text{WER}\) 作为智能度奖励。这两个奖励模型在整个训练过程中均被冻结。
2. 组相对优势计算(方法核心) 这是GROW保持竞争力的核心设计,旨在解决强预训练TTS模型的奖励高度集中于高值区间而导致的信号衰减问题:
- 从奖励加权到优势加权:引入组平均作为基线,将原始奖励\(R^{(k)}\)中心化为优势\(A^{(k)} = R^{(k)} - \bar{R}\),消去常数因子\(\exp(\tau \bar{R})\),使损失权重专注于样本间的相对差异。
- 从指数到线性带符号权重:当奖励方差极小时,优势\(A^{(k)}\)很小,指数权重\(\exp(\tau A^{(k)})\)的泰勒展开主项为常数1,导致损失被奖励无关的"自模仿"项主导。GROW通过四步转化:①取一阶泰勒展开\(1+\tau A^{(k)}\);②舍弃常数自模仿项1;③将正标量\(\tau\)吸收进学习率;④以组内标准差\(\sigma\)进行缩放,最终得到带符号线性权重\(w^{(k)} = A^{(k)}/\sigma\)。该权重是零均值的,正数代表优于组平均,负数代表劣于组平均,具有同时拉近优质样本并推远劣质样本预测速度场的双重作用。
- 多目标组合:针对智能度和说话人相似度两个尺度、方差各异的奖励流,GROW先在组内对各奖励流分别进行Z标准化(减去均值除标准差),再以等权重(\(\lambda_{wer} = \lambda_{sim} = 1\))线性求和,得到最终的组相对优势\(w^{(k)}\)。若组内奖励方差为零,依照DAPO的动态采样策略丢弃该组并重新采样。
3. 优势加权流匹配回归 将计算出的组相对优势直接作为损失权重施加于标准流匹配回归。对每个候选语音,将其与提示语音拼接后送入VAE编码器,得到目标隐层表征\(x_1^{(k)}\)。采样噪声\(x_0^{(k)} \sim \mathcal{N}(0, I)\)和时间步\(t^{(k)} \sim \mathcal{U}[0,1]\),构造插值\(x_t^{(k)} = (1-t^{(k)})x_0^{(k)} + t^{(k)}x_1^{(k)}\),目标速度场为\(v^* = x_1^{(k)} - x_0^{(k)}\)。损失函数由两部分构成:
- 优势加权流匹配损失:\(\sum_k w^{(k)} \|v_\theta(x_t^{(k)}, t^{(k)}) - v^*\|^2\),优势权重\(w^{(k)}\)直接缩放每样本的MSE。
- Wasserstein-2速度锚定损失:\(\beta_{W2} \sum_k \|v_\theta(x_t^{(k)}, t^{(k)}) - v_{\theta_{ref}}(x_t^{(k)}, t^{(k)})\|^2\),计算当前模型与冻结参考模型在相同\((x_t, t)\)输入上预测速度的MSE。该锚定项是防止带符号权重导致负样本回归误差发散的关键,将微调后的速度场约束在预训练模型附近,起到"引力中心"的作用。默认\(\beta_{W2} = 0.025\)。 值得注意的是,流匹配回归损失仅在条件速度预测 \(v_c\) 上计算,而非推理时通过无分类器引导(CFG)得到的引导速度 \(v_g = v_c + \gamma(v_c - v_\varnothing)\)。消融实验表明,对 \(v_g\) 计算损失会使RL更新近乎失效。
4. 模型更新与在线迭代 总损失仅对策略模型参数 \(\theta\) 求梯度,通过AdamW优化器更新。奖励评估、标准化的高斯噪声以及参考模型的速度预测均不参与梯度计算。此过程不断循环,模型策略随优化步数在线迭代改进。整个方法完全不修改采样过程(确定性ODE)、不计算轨迹似然,实现了极简且高效的训练循环。
💡 核心创新点
- 带符号的组相对优势加权:通过泰勒展开论证了在奖励高度饱和的强预训练TTS场景下,正指数奖励加权会退化为由常数主导、缺失信用分配信号的"自模仿"项。提出以带符号的、组内归一化的线性优势代替指数权重,有效放大组内候选样本间的细微差异,使奖励对比信号成为RL更新的主导项。该设计同时支持推远劣质样本和拉近优质样本,学习信号更强。
- 将GRPO式优势估计直接融入流匹配回归:开创性地跳出"采样ODE转SDE进行轨迹级策略梯度"的主流范式,提出可以像GRPO那样用组平均构造优势基线,但不用于策略梯度的蒙特卡洛估计,而是作为损失权重直接施加于流匹配回归。这完全避免了修改采样过程、追踪逐步似然比和处理发散等复杂操作。
- Wasserstein-2速度锚定策略:针对带符号权重可能使负权重样本回归误差无限增大的风险,引入对冻结参考模型速度场的W2距离惩罚作为"引力中心"。消融实验证明移除该锚定项会导致说话人相似度无法提升,而适中的锚定强度是实现稳定策略改进的关键。
- 训练速度场的关键选择:通过详尽消融实验揭示了在流匹配RL损失中应使用不含CFG的条件速度预测\(v_c\),而非推理时采用的引导速度\(v_g\)。这一反直觉但至关重要的发现为后续工作提供了明确的经验准则。
📊 实验结果
论文在LibriSpeech-PC test-clean、Seed-TTS EN和Seed-TTS ZH三个多语言零样本TTS基准上,与预训练模型和DiTAR-GRPO基线进行了系统对比,并开展了五项核心消融实验。
表1:零样本TTS性能与训练效率对比(GROW vs. DiTAR-GRPO)
| 方法 | 训练NFE | 加速比 | LibriSpeech test-clean | Seed-TTS EN | Seed-TTS ZH | Avg. Δ vs. 预训练 |
|---|---|---|---|---|---|---|
| 预训练 | – | – | WER↓ 2.373 / SIM↑ 0.648 / UTMOS↑ 4.30 | WER↓ 2.406 / SIM↑ 0.663 / UTMOS↑ 3.95 | WER↓ 1.269 / SIM↑ 0.717 / UTMOS↑ 3.14 | – |
| DiTAR-GRPO | 32 | 1× | WER↓ 2.149 / SIM↑ 0.674 / UTMOS↑ 4.29 | WER↓ 2.017 / SIM↑ 0.688 / UTMOS↑ 3.91 | WER↓ 1.144 / SIM↑ 0.736 / UTMOS↑ 2.97 | WER↑ 0.246 / SIM↑ 0.023 / UTMOS↓ 0.07 |
| DiTAR-GRPO | 10 | 2.6× | WER↓ 2.332 / SIM↑ 0.683 / UTMOS↑ 4.31 | WER↓ 1.728 / SIM↑ 0.699 / UTMOS↑ 3.97 | WER↓ 1.180 / SIM↑ 0.738 / UTMOS↑ 2.98 | WER↑ 0.269 / SIM↑ 0.030 / UTMOS↓ 0.04 |
| DiTAR-GRPO | 5 | 4.0× | WER↓ 2.393 / SIM↑ 0.665 / UTMOS↑ 4.21 | WER↓ 1.873 / SIM↑ 0.688 / UTMOS↑ 3.93 | WER↓ 1.194 / SIM↑ 0.730 / UTMOS↑ 2.91 | WER↑ 0.196 / SIM↑ 0.018 / UTMOS↓ 0.11 |
| GROW | 32 | 1.1× | WER↓ 1.868 / SIM↑ 0.701 / UTMOS↑ 4.33 | WER↓ 1.750 / SIM↑ 0.703 / UTMOS↑ 4.01 | WER↓ 1.000 / SIM↑ 0.743 / UTMOS↑ 3.13 | WER↑ 0.477 / SIM↑ 0.040 / UTMOS↑ 0.03 |
| GROW | 10 | 2.9× | WER↓ 1.927 / SIM↑ 0.701 / UTMOS↑ 4.33 | WER↓ 1.763 / SIM↑ 0.702 / UTMOS↑ 4.00 | WER↓ 0.983 / SIM↑ 0.742 / UTMOS↑ 3.12 | WER↑ 0.458 / SIM↑ 0.039 / UTMOS↑ 0.02 |
| GROW | 5 | 4.3× | WER↓ 1.992 / SIM↑ 0.697 / UTMOS↑ 4.33 | WER↓ 1.721 / SIM↑ 0.702 / UTMOS↑ 4.04 | WER↓ 1.096 / SIM↑ 0.742 / UTMOS↑ 3.19 | WER↑ 0.413 / SIM↑ 0.038 / UTMOS↑ 0.06 |
注:“Avg. Δ"为三个测试集相比预训练模型绝对提升的平均值。GROW在各项指标上均大幅领先GRPO,同时UTMOS略有提升,而GRPO的UTMOS平均有所下降。GROW对NFE高度鲁棒,10-NFE几乎无损于32-NFE性能,且训练速度比32-NFE GRPO快2.9倍。
表2:权重函数消融实验
| 权重函数 | LibriSpeech test-clean | Seed-TTS EN | Seed-TTS ZH | Avg. Δ vs. 预训练 |
|---|---|---|---|---|
| exp(τr) | WER↓ 2.361 / SIM↑ 0.647 | WER↓ 2.251 / SIM↑ 0.666 | WER↓ 1.151 / SIM↑ 0.716 | WER↑ 0.095 / SIM↑ 0.000 |
| exp(τA) | WER↓ 2.223 / SIM↑ 0.646 | WER↓ 2.102 / SIM↑ 0.662 | WER↓ 1.127 / SIM↑ 0.712 | WER↑ 0.199 / SIM↑ -0.003 |
| A/σ (本方法) | WER↓ 1.927 / SIM↑ 0.701 | WER↓ 1.763 / SIM↑ 0.702 | WER↓ 0.983 / SIM↑ 0.742 | WER↑ 0.458 / SIM↑ 0.039 |
结果表明,指数权重在奖励集中的TTS任务上几乎无法提升SIM,且对WER改善有限,这直接证明了"自模仿"项的主导效应。带符号的线性优势在两项指标上均实现大幅领先。
表3:CFG与训练速度选择消融实验
| 配置 (γ, v) | LibriSpeech-PC | Seed-TTS EN | Seed-TTS ZH | Avg. Δ vs. 预训练 |
|---|---|---|---|---|
| (1.5, vg) | WER↓ 2.287 / SIM↑ 0.657 | WER↓ 2.283 / SIM↑ 0.671 | WER↓ 1.195 / SIM↑ 0.723 | WER↑ 0.094 / SIM↑ 0.007 |
| (0, vc) | WER↓ 1.953 / SIM↑ 0.688 | WER↓ 1.648 / SIM↑ 0.695 | WER↓ 1.052 / SIM↑ 0.744 | WER↑ 0.465 / SIM↑ 0.033 |
| (1.5, vc) (默认) | WER↓ 1.927 / SIM↑ 0.701 | WER↓ 1.763 / SIM↑ 0.702 | WER↓ 0.983 / SIM↑ 0.742 | WER↑ 0.458 / SIM↑ 0.039 |
对引导速度\(v_g\)计算损失几乎使RL更新失效,这指示RL更新应专注于条件生成本身。\(\gamma=0\)提供了更好的WER降低(0.465 vs 0.458),但SIM增益较小(0.033 vs 0.039),且可额外节省一半的采样计算。
表4:学习率η和W2锚定权重β_W2的联合消融实验
| η | β_W2 | LibriSpeech-PC | Seed-TTS EN | Seed-TTS ZH | Avg. Δ vs. 预训练 |
|---|---|---|---|---|---|
| 2e-6 | 0 | WER↓ 2.31 / SIM↑ 0.64 | WER↓ 2.23 / SIM↑ 0.66 | WER↓ 1.11 / SIM↑ 0.71 | WER↑ 0.134 / SIM↑ -0.003 |
| 2e-6 | 0.025 | WER↓ 1.93 / SIM↑ 0.70 | WER↓ 1.76 / SIM↑ 0.70 | WER↓ 0.98 / SIM↑ 0.74 | WER↑ 0.458 / SIM↑ 0.039 |
| 2e-6 | 0.05 | WER↓ 2.13 / SIM↑ 0.69 | WER↓ 1.89 / SIM↑ 0.69 | WER↓ 0.99 / SIM↑ 0.74 | WER↑ 0.344 / SIM↑ 0.030 |
| 2e-6 | 0.1 | WER↓ 1.98 / SIM↑ 0.67 | WER↓ 1.84 / SIM↑ 0.69 | WER↓ 1.15 / SIM↑ 0.73 | WER↑ 0.360 / SIM↑ 0.020 |
| 2e-6 | 1 | WER↓ 2.37 / SIM↑ 0.65 | WER↓ 2.28 / SIM↑ 0.67 | WER↓ 1.19 / SIM↑ 0.72 | WER↑ 0.068 / SIM↑ 0.004 |
| 1e-6 | 0.025 | WER↓ 1.98 / SIM↑ 0.69 | WER↓ 1.87 / SIM↑ 0.70 | WER↓ 1.11 / SIM↑ 0.74 | WER↑ 0.362 / SIM↑ 0.035 |
| 5e-6 | 0.1 | WER↓ 2.14 / SIM↑ 0.67 | WER↓ 2.03 / SIM↑ 0.68 | WER↓ 1.13 / SIM↑ 0.73 | WER↑ 0.251 / SIM↑ 0.017 |
| 1e-5 | 0.1 | WER↓ 2.30 / SIM↑ 0.67 | WER↓ 2.00 / SIM↑ 0.68 | WER↓ 1.05 / SIM↑ 0.73 | WER↑ 0.231 / SIM↑ 0.018 |
结果显示,完全移除锚定项(\(\beta_{W2}=0\))会导致SIM无法提升;过强的锚定(\(\beta_{W2}=1\))则几乎锁死模型。最佳性能在适中锚定(0.025)与适中学习率(2e-6)处取得。
表5:奖励组合消融实验
| 奖励配置 | LibriSpeech-PC | Seed-TTS EN | Seed-TTS ZH | Avg. Δ vs. 预训练 |
|---|---|---|---|---|
| 仅WER | WER↓ 1.958 / SIM↑ 0.649 | WER↓ 1.646 / SIM↑ 0.663 | WER↓ 1.087 / SIM↑ 0.720 | WER↑ 0.452 / SIM↑ 0.001 |
| 仅SIM | WER↓ 2.291 / SIM↑ 0.704 | WER↓ 1.963 / SIM↑ 0.706 | WER↓ 1.047 / SIM↑ 0.747 | WER↑ 0.249 / SIM↑ 0.043 |
| WER+SIM (默认) | WER↓ 1.927 / SIM↑ 0.701 | WER↓ 1.763 / SIM↑ 0.702 | WER↓ 0.983 / SIM↑ 0.742 | WER↑ 0.458 / SIM↑ 0.039 |
组合两种奖励能同时实现两方面收益。此外,仅优化SIM也带来了显著的WER下降(0.249),而仅优化WER对SIM无提升,揭示了两个优化目标间的不对称耦合关系。
🔬 细节详述
以下技术细节均基于论文原文:
- 预训练数据与配置:预训练使用Emilia语料库英中部分,总计约95K小时语音。语音经Semantic-VAE编码为40Hz、64维隐层。DiTAR自回归主干为Qwen3-0.6B Transformer,28层,隐藏维度1024;LocDiT为6层Transformer,维度1024,120M参数;使用AdamW优化器,学习率在前10K步线性增至1e-4再线性衰减。200K步检查点作为RL阶段的初始化和参考模型\(q\)。
- RL训练数据:RL阶段使用一个平衡的多语言提示集,共30K条。其中10K英语和10K中文来自Emilia语料库(要求DNSMOS > 3.2),另10K英语来自LibriTTS train-clean-100。每条语音时长1.5至15秒。
- 损失函数:包含两项——①带组相对优势权重的流匹配MSE损失,权重\(w^{(k)}\)由各奖励流组内Z标准化后等权重求和得到;②Wasserstein-2速度锚定MSE损失,权重\(\beta_{W2}=0.025\)。总损失仅对策略模型参数\(\theta\)求梯度。
- 训练策略:优化器AdamW,恒定学习率\(2\times10^{-6}\),batch size 128。RL阶段运行数百步。每步从当前策略采样\(G=8\)个候选语音。使用Euler求解器,采用F5-TTS的sway采样调度表(系数-1),在推理时应用CFG(强度\(\gamma=1.5\))。流匹配回归损失使用无CFG的条件速度\(v_c\)计算。若组内奖励方差为零,丢弃该组并重采样(DAPO策略)。
- 推理与评估:评估NFE固定为32,训练采样NFE默认为10。奖励模型使用Whisper-large-v3(英文WER)和Paraformer-zh(中文WER),说话人编码器为WavLM-large。UTMOS仅作为感知质量辅助指标,不参与奖励计算。
- GRPO基线实现细节:论文所述DiTAR-GRPO基线并非原始GRPO的直接迁移,而是进一步采用了MixGRPO(将SDE随机性限制在3步去噪窗口内)和CPS(使步间噪声水平与调度表一致)两个增强策略,是经过强化的基线。
- 训练硬件:未说明。
- 资金与致谢:未提供。
⚖️ 评分理由
创新性 (1.5/2):提出带符号的组归一化线性优势替代传统指数奖励加权,直接应用于流匹配回归,并配合Wasserstein-2速度锚定,通过泰勒展开系统论证了奖励高度集中时自模仿项占主导的问题,该设计在RL-for-TTS中具有明确的独创性。([SCORING_SOURCE_4/22], [SCORING_SOURCE_11/22])
技术严谨性 (1.3/1.5):方法推导严谨:泰勒展开揭示正指数权重退化,组相对优势计算自洽,W2锚定有效防止负权重样本发散,算法框架完整。然而对奖励模型偏差和奖励篡改风险未作技术层面讨论,形成轻微假设漏洞。([SCORING_SOURCE_11/22], [SCORING_SOURCE_12/22], [A_LIMITS])
实验充分性 (1.0/1.5):与增强版DiTAR-GRPO对比充分,权重函数、CFG与训练速度、学习率与锚定强度、奖励组合等消融实验系统全面。但未与DPO、RWR等其他RL方法族比较,缺乏跨模型泛化验证,NFE=5下部分WER异常未作误差分析,且无人类评估支撑自动指标结论。([A_RESULTS], [A_LIMITS])
清晰度 (0.8/1):算法伪代码、实验表格和组织清晰,但论文缺失所有作者与机构隶属信息,在完整性上明显不足;结论未明确总结方法局限,降低了阅读的完整感。([A_METHOD], [A_RESULTS], [A_LIMITS])
影响力 (0.9/1.5):为流匹配TTS的在线RL微调提供了一种简洁有效的新范式,在多语言基准上实现了WER和SIM的稳定提升,且不影响自然度,对语音合成社区有实际参考价值。但通用性未跨架构证实,当前影响集中在AR-Diffusion TTS子领域。([A_SUMMARY], [A_RESULTS])
开源 (1.0/1.5):已提供代码仓库https://github.com/yanghaha0908/GROW,并承诺开源全部模型检查点与复现配置,但目前模型权重尚未实际发布,属于核心产物部分开放,尚未完全兑现。([A_OPEN])
可复现性 (0.3/0.5):论文详尽给出了组大小、NFE、学习率、β_W2、CFG系数等RL超参数与训练配置,但未说明训练硬件,RL步数以“several hundred”模糊表述,部分复现细节缺失,整体稍显不足。([SCORING_SOURCE_19/22], [A_OPEN])
工程/实践价值 (1.2/1.5):方法支持低NFE(10或5)采样训练,保持性能的同时比32-NFE GRPO基线快2.9倍,且完全不需修改确定性ODE采样或引入SDE噪声,工程实现极简,具有显著的训练效率优势和良好的可落地性。([A_RESULTS 表1], [SCORING_SOURCE_16/22])
🚨 局限与问题
1. 论文明确承认的局限
- 论文在结论中未明确承认具体局限;其方法适用范围隐含为强预训练流匹配模型。未来工作可扩展到更广泛的生成任务。
2. 审稿人发现的潜在问题
- 跨模型泛化性存疑:论文声称GROW可用于F5-TTS等纯流匹配模型,但所有实验仅在DiTAR这一个AR-Diffusion模型上开展,缺乏直接的跨架构泛化性证据,“即插即用"的通用性有待验证。
- 对比方法广度不足:虽与强化后的DiTAR-GRPO充分对比,但缺少与基于DPO、AR-DPO或朴素的奖励加权回归(RWR)等其他RL/对齐方法族的直接比较,使得"GROW是目前最佳RL方案"的声明在方法覆盖面上不够充分。
- 奖励模型偏差的完全继承:优化目标完全由自动化评估标准(Whisper、WavLM、UTMOS)定义。论文有效证明了可在这些自动指标上实现显著提升,但缺乏人类评估或明确的感知分析表明这些增益确实对应于人类感知的、无偏差的音质与说话人相似度改善。“奖励篡改"的潜在风险(模型学会利用评估器而非真正提升智能度/相似度)未被讨论。
- 作者与机构信息完全缺失:在非完全双盲的正式提交中,这种省略降低了论文的完整性。
- NFE=5下的GROW退化分析不足:表1显示NFE=5时GROW在Seed-TTS EN上的WER反而略低于NFE=10(1.721 vs 1.763),这一反常规现象未被讨论。