英文题目:Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models

会议身份:conference:interspeech:2026:conference-paper-id:li26ba_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #强化学习 #音频大模型 #音频生成

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Xiquan Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Junxi Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenxi Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Haina Zhu:机构信息未能从会议 PDF 纯文本可靠映射
  • Ziyang Ma:机构信息未能从会议 PDF 纯文本可靠映射
  • Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

文本到音频生成(Text-to-Audio Generation)的输入是自然语言描述,输出是高保真声景波形,难点在于多事件组合与时序逻辑难以对齐且人耳对瑕疵高度敏感。该工作先以条件流匹配(Conditional Flow Matching)预训练潜空间生成器,再将去噪过程重构为马尔可夫决策过程(Markov Decision Process)并用在线组相对策略优化(Group Relative Policy Optimization)采样多轨迹更新策略,最后以大型音频语言模型(Large Audio Language Model)的是非问答概率作为细粒度奖励回传。与离线直接偏好优化(Direct Preference Optimization)及对比语言音频预训练(Contrastive Language-Audio Pretraining)奖励的关键差异在于在线探索与语义推理奖励的结合。预训练使用大规模音频文本语料与流变换器主干,在线阶段以组规模采样多轨迹估计优势并回传归一化肯定概率奖励。在TTA-Bench精度子集基准评测下,Resonate-GRPO的AQAScore指标为0.737,高于Resonate-PT的AQAScore指标0.651。该结论目前仅在该基准与短音频场景验证,对音乐、长时序与多语言提示的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,输出是什么,为什么文本到音频难对齐?

这篇论文研究的输入是一段自然语言描述,例如同时出现金属敲击、摩擦和木头轻响,输出是一段与描述相符的高保真音频。读者可以把任务理解为给定文本条件,模型要在变分自编码器潜空间里生成一段音频潜变量,再解码回梅尔频谱图和波形。难点在于描述往往包含多个声音事件,还有并行、先后和交织等时序逻辑,模型既要把每个事件都生成出来,又要把响度、音色和时间关系放对。只做 1 次监督回归容易学会平均化的声音,听起来含糊或漏事件。

论文把这个问题拆成两段,先用条件流匹配预训练学会从噪声到音频的基本映射,再用在线强化学习按语义对齐奖励继续打磨。文本编码用冻结思路的语言模型,音频侧用潜变量变换器,这是后续所有改动的基础。

文本到音频生成 × 流匹配: 文本到音频生成负责把自然语言描述转成波形或频谱表示的声音,流匹配负责规定从噪声潜变量到音频潜变量的连续速度场学习方式,二者搭配的原因是生成需要一条稳定可采样的轨迹,而流匹配用回归速度向量给出这条轨迹,组合意义是先用条件流匹配预训练得到能跟随文本的基础生成器,再在其上去做强化微调。

按原文交代,预训练语料约 370 万音频文本对、共 10,000 小时,来源包括音频描述、音频集、声音场景和弱标注描述等多类数据。评估用文本到音频基准的准确性子集,共 1500 条多样提示,专门考察多事件和复杂时序。客观评价分两类,一类是音频美学模型给出的内容愉悦度、内容有用度、产生复杂度和产生质量,数值越大越好,一类是语义对齐分数,包括对比语言音频预训练分数和基于问答的对齐分数。主观评价请 10 位音频专家对抽样音频按 1 到 5 打分,维度是整体质量和与文本的相关性。理解这套输入输出和评价划分,是读懂后面奖励设计和表格比较的前提。

已有路线做了什么,为什么离线方法和粗奖励不够?

在文本到音频领域,已有强化工作大致走过 3 条路。第一条是训练自定义奖励模型再做加权监督微调,代表是早期的人类偏好对齐工作。第二条是用对比语言音频预训练模型挑偏好对,再做直接偏好优化,代表是第二代指令扩散模型和后续的反馈数据管线。第 3 条是迭代式偏好优化,用现成的对比模型当奖励反复做直接偏好优化,代表是流匹配基线中的排序偏好优化。论文认为前两类仍有两个局限,一是离线范式的数据生成与模型训练解耦,容易出现分布偏移并限制策略探索,二是对比模型有词袋效应,对时间和组合推理弱,给出的奖励粗且与人类感知对得不好。

在线强化学习 × 离线直接偏好优化: 离线直接偏好优化负责用事先采好的人选或模型选偏好对直接调策略,不再采样新轨迹,在线强化学习负责让当前策略边采样边拿奖励边更新,二者搭配比较的原因是离线省算力但偏好数据与当前策略分布脱节,在线能探索新分布但需要随机采样器和奖励模型,组合意义是论文用在线分组相对策略优化替代离线路线来验证探索是否带来可测增益。

与之并行的背景是强化学习已在大语言模型、图像生成、文本到语音和语音增强里见效,常用算法包括分组相对策略优化和面向流匹配的在线改造。论文的选择是把在线分组方法搬到文本到音频,而不是继续在离线偏好对上打补丁,同时把奖励从对比模型换成大音频语言模型。教学上可以这样记,离线方法像拿旧考卷讲新课,在线方法像让学生当场做题当场批改,前者省事但题目分布旧了,后者费算力但能看到当前水平的真实错误。论文后面用直接偏好优化、监督微调和先微调再强化的对照来支撑这个判断。

要解决的具体矛盾是什么,成功标准如何定?

具体矛盾是生成器已经能发出像样的声音,但在多事件提示下容易漏事件、错时序,而现有奖励看不出这种细错。成功标准因此定成两条同时成立,一是语义对齐分数上升,二是音频质量不掉。论文用问答式对齐分数当主要语义尺子,用产生质量和内容有用度当主要质量尺子,再用主观整体质量和相关性复核。

需要提醒初学者,分数高不等于每个样本都好,总体趋势成立时仍可能有单样本变差,论文用组内归一化和散度约束来压住这种波动,但没有报告误判率或每步延迟,读结果时不要把平均增益理解成无代价。另一个边界是奖励模型与评价模型必须分开,否则模型可能学会讨好某个打分器,论文明确训练用一个大音频语言模型,评价换另一个指令模型,这一点在复现时必须保留。

整体链路如何从一句话走到一段被打分的音频?

沿一个样本走一遍最清楚。输入文本先经文本编码器变成条件向量,音频波形在训练时先转梅尔频谱图再编码成潜变量。训练预训练阶段的做法是给干净潜变量加噪声得到中间状态,让变换器预测该时刻的速度场,目标是噪声减去干净数据的向量。推理或强化采样阶段从标准正态噪声出发,按学到的速度场逐步去噪得到音频潜变量,再解码成波形。强化阶段的不同在于同提示 1 次采一组音频,每条音频连同原文本一起送给大音频语言模型问是否包含所述事件,取回答是的概率当奖励,组内比较后更新生成器。

流匹配 × 分组相对策略优化: 流匹配负责给出确定性常微分方程去噪过程,分组相对策略优化负责对同提示的一组采样按组内归一化奖励算优势并做裁剪更新,二者搭配需要先把确定性常微分方程改成等价的随机微分方程采样器以获得探索噪声,组合意义是把去噪每一步看成马尔可夫决策动作,从而能对转移概率做策略梯度优化。

下图把左边的生成器结构和右边的采样打分更新闭环画在了一起,读图时先分左右再找闭环。左半是条件如何进入每一层变换器,右半是同提示多轨迹如何产生奖励和优势,右下角的是否题是奖励来源,右上角是带散度约束的裁剪目标。

看图路径: 1. 先从左侧顶部文本与加噪潜变量两条输入线向下追踪,看它们在多模态块与单模态块如何汇合再输出速度场;2. 再看右侧同一提示如何分出多个并行去噪轨迹,确认奖励与优势计算发生在整组音频生成之后;3. 对照右下角是否题与是或否概率条,确认奖励是归一化后的肯定回答概率;4. 沿右上角策略优化箭头回到生成器,确认这是一个采样加打分加更新的闭环

原论文 Figure 1:Left: the model architecture of Resonate. Right: The employed Flow-GRPO training paradigm.

论文图 1。原论文 Figure 1:“Left: the model architecture of Resonate. Right: The employed Flow-GRPO training paradigm.”。

这张图的可执行信息是 3 条。第一,文本分支经过语言模型、多层感知机和时间调制进入主干,加噪潜变量分支经过卷积多层感知机进入主干,说明文本和时间共同调制生成过程。第二,中间多个并行频谱示意表示同组不同随机轨迹,箭头上的随机微分方程项说明噪声是探索来源。第三,奖励不是人工规则,而是大音频语言模型对是否包含事件这一问句的肯定概率,优势是对整组奖励做归一化后得到的相对值。抓住这 3 条,就能把后面组件节的公式文字对应到真实计算位置。

生成器每层做什么,奖励的是否题如何算成数字?

生成器按原文采用类流风格的流变换器,主干是 16 个多模态块后接 36 个单模态块,隐藏维度 448,总参数 470M。多模态块同时看文本条件和音频潜变量,单模态块继续在音频侧精化表示,最后输出每个时刻的速度预测。文本侧用指令微调过的语言模型编码,加噪潜变量侧用卷积多层感知机做适配,时间步经线性层后以调制方式注入各块。这种安排的理由是文本需要深度融合而音频细节需要局部建模,分开适配再融合比早期粗拼接更稳。原文没有给出注意力头数和变分自编码器细节,复现时应按引用的基础模型默认配置补齐并记录,不从参数量反推结构。

大音频语言模型 × 音频问答打分: 大音频语言模型负责听音频并理解文本描述中的事件与时序关系,音频问答打分负责把评价变成一道是否题并取回答是的归一化概率作奖励,二者搭配的原因是对比语言音频预训练模型容易出现词袋效应而忽略组合与时序,大音频语言模型能做更细的听觉推理,组合意义是用单 token 问答概率得到与人类判断更一致且计算量可控的稠密奖励。

奖励的计算可以复述为 4 步。第一步构造问句,模板是音频是否包含文本描述的声音事件,请回答是或否。第二步把生成的音频和该问句一起送入大音频语言模型,得到回答是和否的对数似然。第三步对这两个分数做二分类归一化,得到肯定回答的概率。第 4 步把该概率直接当作该音频相对该提示的奖励,只在去噪终点给分,中间步骤奖励为零。

论文引用先前工作说明这种问答打分与人类判断相关性更强,且每次只迫模型输出一个词,计算开销可控。需要区分的是训练奖励用一个模型,评价对齐分数换另一个更强的指令模型,目的是降低刷分风险。

优势归一化 × 散度约束: 优势归一化负责把同组奖励减均值除标准差得到每条样本的相对好坏,散度约束负责用相对熵项把新策略拉回参考策略附近,二者搭配的原因是只追求高奖励容易走偏或钻奖励空子,组合意义是在组内竞争选出更好轨迹的同时限制整体漂移幅度,使流匹配生成器稳定提升。

策略优化侧把去噪过程形式化为马尔可夫决策过程,状态是文本、时间步和当前潜变量,动作是下一步潜变量,策略是给定当前状态预测下一步的高斯分布。初始状态从提示分布和标准正态采样,转移是确定性推进到下一步,奖励只在终点结算。对同提示采到的整组轨迹,先对终点奖励做均值方差归一化得到优势,再用带裁剪的策略比值乘优势求平均并减去与参考策略的散度惩罚。

为支持探索,确定性常微分方程被改成保持相同边缘分布的逆时随机微分方程,离散更新是均值项加噪声项,高斯均值来自速度预测,方差由噪声水平参数控制。原文明确噪声系数、组大小和散度系数的取值,复现时应原样保留。

分哪两个阶段训练,每阶段的数据、步数和更新对象是什么?

训练分预训练和强化后训练两段。预训练用约 3,700,000 对、10,000 小时的大语料做条件流匹配,批量 256,共 500,000 步,目标是学会速度场,得到基线模型。强化阶段只用音频描述训练集的提示集合做在线采样,不再需要新的音频真值,组大小 24,噪声水平 0.7,散度系数 0.04,共 1000 步。更新对象是流匹配生成器,文本编码器和奖励用的大音频语言模型保持冻结,奖励模型只做前向打分不更新。采样器用随机微分方程版本以保证每步转移概率有显式高斯密度,从而能算新旧策略比值。论文没有报告优化器类型、学习率和硬件时长,这部分是复现缺项,需要自己记录并做小规模试跑确认稳定。

对照组训练条件按原文交代如下。直接偏好优化作为离线基线,监督微调在音频描述训练集上微调 50,000 步,先微调再强化是两段串行。原文报告监督微调虽提升对齐但拉低质量,离线偏好优化只带来小幅对齐提升,这些对照说明数据质量和在线探索是关键变量。复现时应保持同一预训练起点再分叉,避免用不同起点比较。代码与演示链接在原文脚注给出,资源状态显示代码和演示当前可用,初学者应先跑通预训练推理再开强化循环,不要一开始就调大组大小。

在什么数据和指标上测,如何保证打分器不既当裁判又当教练?

数据侧预训练语料覆盖音频描述、音频集、声音描述、视听场景和弱标注描述等多源,强化提示取自音频描述训练集的提示集合,评估用文本到音频基准准确性子集的 1500 条提示,覆盖并行、序列和复杂交织的多事件场景。指标侧客观质量用音频美学模型的 4 个维度,语义用对比分数和问答对齐分数,主观用专家整体质量和相关性。关键的公平设计是奖励与评价用不同模型,训练用问答打分的旧版全模态模型,评价用新版指令模型,相关性对照还引用了提示音频语言模型数据集上的人类评分比较。

下表把必须核对的配置收拢成可执行清单,读表时注意参数是原文直接报告的值,未报告的学习率和硬件不在表内,复现时要如实记为缺项。

条件内容模型或取值阶段说明
主干结构多模态块与单模态块16 与 36预训练隐藏维度 448,总参数 470M
强化配置组大小与噪声与散度24 与 0.7 与 0.04后训练强化 1000 步,提示取自音频描述训练集
奖励与评价打分器分工训练用旧版全模态,评价用新版指令全程降低刷分风险,相关性在提示音频集上对照
评估协议基准与主观1500 条准确性子集,10 人专家 1 到 5 分评估客观含美学 4 维与两种语义分数

表后需要强调两点。第一,组大小 24 和噪声 0.7 是论文在消融中选出的效率与效果折中,不是理论最优,改硬件或改采样步数时要重做小网格。第二,主观只抽 10 条波形给 10 位专家打分,样本量小,适合看方向不适合当成绝对排名,引用时应同时给出客观分数和置信区间意识。

主结果在什么条件下赢了,代价和未胜出项是什么?

比较问题是同为文本到音频生成器,在同一 1500 条准确性提示下,谁的语义对齐更高且质量不掉。公平条件是各基线用各自原文的推理步数和参数量,方向是美学 4 维、对比分数、问答对齐分数越大越好,主观整体质量和相关性越大越好。论文报告强化后模型在问答对齐和对比分数上双双居首,产生质量居首,内容有用度接近最优,同时主观两项也居首,且推理只需 25 步、参数 470M,小于多数 800M 以上基线。

条件指标基线本方法比较对象
1500 条准确性子集问答对齐分数0.7290.737上代最优
1500 条准确性子集问答对齐分数0.6770.737流匹配基线
1500 条准确性子集对比分数低于 0.4760.476所有基线中最高
1500 条准确性子集产生质量低于 6.0646.064所有基线中最高
1500 条准确性子集内容有用度接近最优5.328大模型基线略高但语义落后

表后解释主要收益与代价。收益是相对预训练起点,对齐从 0.651 升到 0.737,产生质量从 5.923 升到 6.064,说明在线强化同时改善了语义和保真度。代价是强化阶段每提示要采 24 条音频并调大音频语言模型打分,训练吞吐明显低于离线方法。未胜出项也要点名,内容有用度上大模型基线略高,但其对齐明显落后,说明论文的均衡更好而非每项全胜。限制是主观样本少、未测延迟和误判率,不能把平均胜势推广为每条提示必胜。

在线相对离线强多少,换奖励和换超参会怎样?

第一个消融问训练范式是否关键。比较对象是同一起点的直接偏好优化、监督微调、先微调再强化和直接强化。方向同主结果,对齐和质量越大越好。论文显示离线偏好优化对齐只从 0.651 到 0.676,质量几乎不动,监督微调虽把对比推到 0.461、对齐推到 0.675,却把内容有用度从 5.238 拉到 5.114、产生质量拉到 5.764。先微调再强化能部分挽回但仍不如直接强化,直接强化达到对齐 0.737 和质量最优。论文的解释是野外录音质量参差,微调会过拟合噪声分布并压缩后续探索空间。

条件指标基线本方法比较对象
同一起点问答对齐0.6760.737离线偏好优化
同一起点质量有用度与产生质量5.237 与 5.9245.328 与 6.064离线偏好优化几乎不动
同一起点对比与对齐0.461 与 0.6750.476 与 0.737监督微调
同一起点质量有用度与产生质量5.114 与 5.7645.328 与 6.064监督微调掉质量
同一起点训练链条先微调再强化居中直接强化最优多阶段策略

第二个消融问奖励来源是否关键。用问答打分当奖励在内容有用度、产生质量和对齐上全面好于用对比分数当奖励,用对比分数当奖励只在对比分数本身略高,原因是直接优化该目标。这支持大音频语言模型反馈更细、与人类更一致的判断。第三个消融问噪声与组大小,左图噪声从 0 升到 0.7 时对齐从约 0.651 经 0.713 和 0.725 升到 0.737,到 0.9 回落到 0.732,说明适度噪声帮助探索、过大噪声易刷分。右图组大小从 0 经 4 和 12 到 24 时对齐从约 0.651 经 0.697 和 0.733 升到 0.737,说明大组优势估计更稳,论文选 24 是效果与效率折中。

看图路径: 1. 先看左图横轴噪声水平从 0 到 0.9 的变化,确认纵轴是越高越好的对齐分数;2. 再看右图横轴组大小从 0 到 24 的变化,确认组增大时曲线是否单调上升;3. 对比两图在 0 点标注的未做强化基线,确认强化起点位置;4. 读出两图峰值点标注的 0.737,确认最佳噪声与最佳组大小的取值

原论文 Figure 2:Ablation study on Flow-GRPO configurations.

论文图 2。原论文 Figure 2:“Ablation study on Flow-GRPO configurations.”。

这张图要按像素读出两个单调段和一个拐点。左图橙色折线随噪声水平上升先陡后平,峰值标红 0.737 在 0.7 处,0.9 处回落到 0.732,零点标注为未做强化。右图青色折线随组大小上升同样先陡后平,4 人组约 0.697,12 人组约 0.733,24 人组标红 0.737。解释是噪声控制探索强度,组大小控制优势估计方差,二者都要适中。反例是噪声 0.9 和小组 4 的效果都明显低于峰值,复现时不要只抄峰值而不做该硬件下的稳定性检查。

哪些结论还不能下,哪些边界没有测?

论文直接报告的是在给定基准、给定打分器和给定采样步数下的平均增益,有限解释是对分布偏移和词袋效应的归因,未验证的推测是更大组或更高质量监督数据一定更好。缺失证据不是技术错误,但引用时要用词区分。相关性不等于因果,问答分数与人类评分相关高不等于模型真正理解时序,仍可能是利用了打分器的偏好。未测量的量包括每秒输出、端到端延迟、显存峰值和误判率,论文没有承诺这些量改善,部署前需自己补测。

另一个边界是奖励只在终点给分,中间步骤没有过程监督,长时序复杂提示的信用分配仍粗。评价侧主观样本少,不同专家方差大,客观美学模型本身也有偏好,不能把自动指标当成人评。最后,强化提示只来自音频描述训练集,换领域或换语言时泛化待验证。

要复现先跑什么,关键超参和信息条件如何保留?

先做环境与资源确认。原文给出代码和演示链接,资源状态为当前可用,可以先打开演示听效果再拉代码。按依赖装好音频编解码、频谱提取和变换器环境,优先跑通预训练模型的 25 步推理,确认能从文本生成音频并算出美学分数和对比分数。第二步冻结文本编码器和奖励模型,只让生成器可训练,把采样器切换到随机微分方程版本,检查转移概率的高斯对数密度是否可导。

第三步用小批量试跑在线循环,同提示先采 4 条打通奖励问句模板,确认是或否概率能正常归一化,再放大到 24 条。关键超参原样保留,组大小 24,噪声水平 0.7,散度系数 0.04,强化 1000 步,主干 16 加 36、隐藏维度 448。信息条件上训练与评价打分器必须分开,不要为了省模型而混用。常见误解是把监督微调当成必经步骤,论文证据恰好相反,直接在预训练起点上做强化更好,先微调可能锁住探索。若复现中出现对齐升但质量掉,先查数据噪声和散度系数,再查噪声水平是否过大。

何时值得尝试这种在线问答奖励,还需补哪项验证?

当你的生成器已能发出清晰声音但多事件漏检多、时序错位多,且手头没有大规模人类偏好对时,这种方法值得尝试。它的适用条件是能承担同提示多采样的算力,有可用的大音频语言模型做是否题打分,且能接受终点稀疏奖励。操作顺序是先保证流匹配基线稳定,再开小噪声小组合上在线循环,最后再放大到论文配置。不值得的情形是推理延迟敏感或打分器与部署场景严重错配,此时应先做数据清洗或轻量监督微调。

还需补的验证有三项,一是在新领域提示上测对齐与质量是否同向提升,二是补测推理步数减半时的保持度,三是做打分器替换实验看增益是否依赖特定大模型。只有这三项都通过,才能把论文的基准胜势理解成可迁移的方法增益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总