英文题目:WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training
会议身份:
conference:acl:2026:conference-paper-id:2026.findings-acl.114
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#强化学习 #SFT #后训练 #语音 #语音对话系统
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Yifu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Shengpeng Ji:机构信息未能从会议 PDF 纯文本可靠映射
- Qian Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Tianle Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Yangzhuo Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ziqing Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wen Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Jingyu Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Haoxiao Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xueyi Pu:机构信息未能从会议 PDF 纯文本可靠映射
- Fan Zhuo:机构信息未能从会议 PDF 纯文本可靠映射
- Zhou Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端语音对话模型以语音提问为输入并直接生成交错文本与语音回复,难点在于序列级稀疏偏好监督需分摊到稠密语音Token而共享参数更新易使文本梯度主导并引发声学漂移。WavAlign先对同一提示采样4个语音回复并解码为音频送入奖励模型打分以获得序列奖励与组内优势,其输出的奖励分组直接进入下一步混合目标的门控计算。接着该方法将GRPO偏好梯度掩码限制在文本通道以精炼语义,同时保留覆盖全Token的SFT作为分布锚点以维持语音可行性,二者的损失权重由上一步奖励统计决定。最后依据最大奖励与归一化方差计算方向门与信息门并经指数滑动平均得到动态混合权重,从而按权重加权SFT与文本GRPO实现单阶段自适应训练。与全Token偏好更新不同,该机制把偏好塑形限定在语义通道而把声学稳定交给稠密监督,避免了稀疏奖励稀释语义信号并改善了智能与表达的帕累托权衡。在OpenAudioBench基准下,Ours (Dynamic)的平均得分为57.6,高于Text-Token RL (Unified)的56.2。该结论适用边界受限于1到5分自动语音评委与有限混合音频指令数据的可靠性与校准,换用更可靠声学反馈或更大规模数据时门控行为与增益尚未验证,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么值得做端到端?
本文的研究对象是端到端语音对话。输入是语音或文本形式的对话上下文,输出是同时包含文本序列与语音序列的口语回复。白话说,模型既要想清楚说什么,也要用合适的声音说出来。英文对应为 spoken dialogue model,有时称为 omni-modal 或 speech language model。
级联路线的做法是把任务拆成 3 段:语音识别转写、文本大模型回答、语音合成朗读。每段单独优化,接口是文字。端到端路线的做法是用一个主干直接处理语音信号,在内部统一表示语义内容与副语言属性,再生成文本 token 与语音 token。论文的动机是级联存在误差传递与信息损失,而端到端原则上能让高层推理与细粒度声学表达更紧密配合。
端到端语音对话模型 × 级联系统: 端到端语音对话模型负责在同一个主干内直接处理语音输入并联合生成文本与语音,承担语义理解与副语言表达的统一建模;级联系统负责把自动语音识别、大语言模型与语音合成串起来,分段完成理解与生成。WavAlign 选择端到端路线的原因是级联会带来误差传递与信息损失,而统一建模需要同时解决语义与声学两路优化,组合意义在于把后训练设计在共享参数的联合分布上。
但论文报告的现实是,当前开源端到端系统并没有稳定超过强级联基线,语义能力、自然度与表达力都有明显提升空间。因此后训练的目标被明确为在同一个端到端模型内同时改善语义对话质量与语音自然度及表达力,且不以牺牲一方为代价。后续所有方法与实验都围绕这个双目标展开,评价也分为语义与表达两类。本文当前没有可验证的代码与模型资源声明,复现只能依据正文描述的算法与数据流程,不应默认代码已公开。
已有哪些路线,为什么直接套用偏好优化会失灵?
与本文同输入同目标的相关工作包括交错生成、并行生成与思考者说话者分解 3 类架构。交错生成指输出单一交错的文本语音 token 流,并行生成指文本与语音两条流用耦合状态同时生成,思考者说话者分解指先思考再说话的 2 阶段生成。论文用两种代表性主干验证通用性:交错式的 VITA-Audio 与并行式的 KimiAudio。
同监督与同运行阶段的对照包括有监督微调、离线直接偏好优化与在线组相对策略优化。有监督微调使用演示数据做教师强制交叉熵,在每个位置给出稠密约束。直接偏好优化使用预先采样的偏好对做离线学习。组相对策略优化对每个输入采样一组轨迹,用奖励得到组相对优势,再做裁剪代理目标并加散度正则,需要在线 rollout。
论文指出已有单阶段混合后训练多为同质文本策略,例如用熵感知不确定性、统一反馈连续体或动态辅助项调节有监督与强化学习的混合,但它们假设标量偏好对所有 token 同样有信息量。语音对话的特殊性在于标量偏好对异质语音 token 信息量不足,且跨模态耦合弱、梯度能量不平衡。把类别差异当成同条件胜负是不恰当的,本文的对照价值在于同一数据与预算下比较全 token 与仅文本的作用范围,以及固定权重与动态权重的混合方式。
统一偏好优化的失败模式具体表现在哪里?
论文把失败归纳为 3 个相互关联的机制。第一是跨模态权衡与不一致:语义奖励与人类偏好对齐较好,而声学奖励偏离人类偏好,两类目标近乎正交。第二是弱梯度耦合与能量不平衡:文本梯度主导共享参数更新,稠密语音 token 得到的监督弱且方差高。第三是语音 token 过于稠密导致信号稀释与信用分配困难:序列级优势要在很长语音序列上分摊。
操作层面的表现是,直接在混合文本语音输出上做序列级偏好目标,语义可能变好但语音质量经常下降,出现声学漂移与自然度降低。奖励建模也加剧了声学优化的困难:与文本语义正确性不同,声学表达力缺乏干净可靠的标量信号,且容易被虚假声学线索劫持。
为了让研究生能复述诊断逻辑,论文做了 3 组实证:用重复采样比较评测者与人类在语义与声学两轴的一致性,用重复采样比较语义与声学多样性方差,用 2 次反向传播分离文本损失与语音损失的梯度几何。这些分析共同支持后文的设计选择:语义判断作为主要的可靠排序信号,语音可行性用稠密监督维持。
WavAlign 一轮训练走完是怎样的流程?
先沿一个样本走完全流程。输入对话上下文进入当前策略,策略采样出一组口语回复,每条回复包含文本与语音两部分。生成的语音被解码成音频,直接送给奖励模型打分,得到一组标量奖励。接着从这组奖励计算两个统计量:最大值与归一化方差。再由门控与平滑得到本步混合权重,最后用混合目标更新参数。
本段先给出流程导读,重点是区分两条监督各管哪些 token 以及权重何时偏向哪一边,下图把采样、打分、统计、门控与混合目标放在同一回路中。
看图路径: 1. 先从左到右跟随输入到策略采样再到奖励与统计的主路径;2. 再看下方混合目标如何把全 token 有监督与仅文本偏好优化并列;3. 最后确认门控输出的权重如何同时送入两项损失的系数
论文图 6。原论文 Figure 6:“Overview of the proposed single stage adaptive hybrid post training.”。
上图展示的单阶段自适应混合回路可以这样复述:上半部分是从策略到采样组,再到奖励、统计与门控系数的单向链路;下半部分是混合目标的两个分支,左侧有监督微调覆盖全部 token 以保证稳定性与语音自然度,右侧偏好优化只作用于文本 token 以做语义偏好塑形,并用掩码遮掉语音 token。门控系数同时控制两项的相对比重,训练始终保留至少一部分有监督成分作为安全锚,避免在奖励不可靠时完全交给偏好梯度。
混合目标与门控如何计算,梯度证据支持什么?
理解符号需要先固定表示。模型对输入上下文定义文本与语音的联合条件分布,其对数似然可以按 token 类型分成文本部分与语音部分之和。这种划分与内部是交错、并行还是 2 阶段无关,只按 token 类型归属求和,为后文只在文本子集上施加偏好损失提供了统一接口。
混合目标的计算意图是把稠密锚定与局部偏好塑形加权相加,权重由 rollout 质量动态决定。偏好项通过掩码只保留文本 token 的得分,语音 token 不接受偏好梯度。有监督项始终覆盖全部 token。下面的公式是该混合目标的原文形式,先看符号再看目标。
\[Lhybrid(θ) = (1−λt) LSFT(θ)+λt L(T)\]门控的计算目标是只在方向可靠且可分时才增大偏好比重。方向门用最大奖励相对中性分 3 的 sigmoid,全部样本低于 3 时偏好梯度通常有噪或方向错误。信息门直接使用归一化奖励方差,方差越大说明候选越可分。两者相乘再乘以最大值 0.8 得到原始权重,因此至少保留 0.2 的有监督成分。下面的公式对应平滑与乘积结构。
\[λt = (1 −α)λraw α = 0.9, (12)\]\[= λmax gt(R) gt(V )\]有监督微调 × 组相对策略优化: 有监督微调负责在每个 token 位置提供稠密的教师强制约束,承担稳住分布特别是语音自然度的作用;组相对策略优化负责用组内相对优势做在线偏好塑形,承担在语义方向上探索更优回答的作用。两者搭配的原因是单一稀疏偏好信号难以同时指导稠密语音 token,组合意义是让稠密锚定保住声学可行性,让稀疏偏好只在信息可靠时调整语义。
语义通道 × 声学行为: 语义通道指文本 token 承载的内容正确性、相关性与结构,负责对话是否有用;声学行为指语音 token 决定的清晰度、流畅度、韵律与情感适配,负责听起来是否自然得体。WavAlign 把偏好梯度限制在语义通道而把声学行为交给显式锚定的原因是两类目标近乎正交且奖励可靠性不同,组合意义是避免有益于语义的更新扰动脆弱的声学分布。
方向门 × 信息门: 方向门负责判断本步 rollout 是否存在至少一个可接受样本,用最大奖励相对阈值 3 的 sigmoid 决定偏好方向是否可信;信息门负责判断候选之间是否足够可分,用归一化奖励方差决定偏好比较是否有信息量。两者相乘得到原始混合权重的原因是要同时满足可靠与可分,组合意义是只在两个统计量都支持时才增大偏好优化比重,否则退回有监督微调。
梯度几何的证据进一步支持模态解耦。论文用 2 次反向分别得到文本损失梯度与语音损失梯度,在全部层上计算范数比与余弦相似度。导读是先看能量谁主导,再看方向是否一致,下图给出 3 类目标下的分布。
看图路径: 1. 先比较左图三组方法下文本与语音梯度范数比的中心位置;2. 再看右图三组方法下余弦相似度是否集中在零附近;3. 最后注意组相对策略优化分布更宽而有监督微调更集中
论文图 4。原论文 Figure 4:“Empirical geometry of text vs. speech gradients under different objectives.”。
上图可见的要点是文本与语音梯度方向总体接近正交,余弦集中在零附近,而范数比在不同目标下位置不同。论文据此认为偏好梯度最有效的区域是承载语义的文本部分,把偏好更新限制在文本 token 比更新全部 token 更可靠。需要强调的是这属于有限解释,相关性不等于因果,梯度正交本身不证明必然漂移,还需结合后文的消融与主结果一起判断。
训练数据、偏好对与优化设置如何构造?
训练数据总量为 13510 条音频指令样本,覆盖智力与表达力。来源包括公开数据集与自建数据,没有使用专有内部数据。自建部分针对风格控制与风格理解,分别用显式模板生成,再加上表达性对话、复述鲁棒性以及逻辑、数学、代码与创作等推理类数据。附录还列出内部整理与混合来源的子集。论文称详细组成与构造流程在附录中给出,正文只报告总量与覆盖目标。
偏好对的构造与一致性评价、多样性统计共用同一重复采样结构。对每个提示采样 8 个候选口语回复,评测者给出 1 到 5 分的语义分与声学分,再用固定加权和合并为效用分,默认权重为 0.5。取效用最高与最低者组成 1 对,仅当两者差距超过阈值 0.5 才保留。若效用并列,先按语义分再按声学分打破平局,最终每个提示形成一个偏好对用于离线偏好学习。
在线训练的每一步采样组大小默认为 4,采样温度 0.9,top-p 为 0.9,学习率 1e-6,批大小 1,最大序列长度 2048。散度正则系数文本与语音均为 0.01。奖励模型使用 Gemini-2.5-Pro 对模型语音回复打分,语义与副语言打分的提示模板在附录中逐字给出。所有训练运行使用 4 卡 A100。论文未报告冻结哪些参数,也未给出梯度在各模块的完整路径假设,复现时不应从模型名称推定实现,缺项应明确记为未报告。
用什么基准、按什么协议测语义与表达?
评价按问题组织为 3 套基准共 18 个子任务。VoiceBench 测指令遵循与安全,包括多项问答与推理子集。OpenAudioBench 侧重知识与推理。VStyle 针对副语言控制,包括声学属性、风格指令遵循、角色扮演与共情。论文强调严格遵循各基准官方评价协议,VoiceBench 与 OpenAudioBench 在文本输出上用官方流程与各自的语言模型裁判,VStyle 在语音输出上用官方流程与指定裁判,所有分数用官方脚本计算。
基线分组保证条件可比。标准组是基础模型与教师强制有监督微调。直接偏好优化组分为全 token 与仅文本两种作用范围。在线强化学习组包括全 token、仅文本以及先有监督后强化的 2 阶段串行。动态混合是本文方法。所有变体共享同一主干、数据与训练预算,消融中智力取多个推理子集的均值,表达力取 VStyle 4 维均值。
指标方向需要事先固定:基准分数越高越好,裁判一致性用相关越高越好、平均绝对误差越低越好,同提示内排序用 Spearman 越高越好。人类主观评价用盲测并排比较,在有用性与自然度两轴以及总体偏好上选更优者或平局,用符号检验报告是否显著优于基线。硬件与裁判配置已在训练节交代,复现时应保持解码与裁判设置一致,否则组内方差的变化可能来自配置而非模型随机性。
语义与表达的主结果支持什么判断,有何代价?
先提出比较问题:在同一主干与数据下,动态混合能否同时改善语义与表达,而不是用一方换另一方。公平条件是所有方法共享主干与预算,指标方向为基准分越高越好。下图先看奖励可靠性,因为它决定偏好信号能否用于排序。
看图路径: 1. 先确认横轴为语义一致性、纵轴为声学一致性且越高越好;2. 再看左图全局相关与右图同提示内排序两幅面板的点位;3. 最后数有多少点落在对角线下方以判断声学更弱
论文图 3。原论文 Figure 3:“Judge/reward-model agreement with human evaluation on semantic vs. acoustic dimensions.”。
上图左右两幅分别显示全局相关与同提示内排序相关,横轴语义、纵轴声学。大多数点落在对角线下方,说明声学一致性系统性弱于语义,尤其在同提示内排序 regime 中差距更稳定。由于重复采样选择正是偏好构造所用的 regime,这一结果支持把语义判断作为主要可靠的排序信号,而语音可行性用稠密监督维持。这属于支持性解释,不是声学奖励必然无用的证明。
再看多样性是否同样指向声学区分度不足。下表比较人类评分下两种架构的语义与声学方差,表前问题是同一提示多次采样时哪一轴变化更大,公平条件是固定解码设置使组内差异反映模型随机性。
| 数据集 | 样本类型 | 语义方差 | 声学分差 | 比较结论 |
|---|---|---|---|---|
| vitaaudio | 人评均值 | 1.066 | 0.387 | 语义高于声学 |
| kimiaudio | 人评均值 | 0.911 | 0.509 | 语义高于声学 |
表后解释是人类评分下语义方差明显高于声学,说明重复采样在语义上更易拉开差距,在声学上区分较弱。这与评测者散点图一致,共同说明声学偏好信号的信息量有限。代价是若坚持用全序列偏好优化,稠密语音 token 会分摊稀疏优势,导致声学漂移。下图从评测者视角复核同一结论。
看图路径: 1. 先看左图两种架构下语义柱与声学柱的高度差;2. 再看右图各评测者散点相对对角线的位置;3. 最后对照左右两图是否一致指向声学区分度更弱
论文图 5。原论文 Figure 5:“Semantic vs. acoustic diversity under repeated sampling reveals weaker acoustic discriminability.”。
上图左为人类评分的柱状比较,右为评测者方差的散点,大多点仍在对角线下方。需要指出未胜出项:全 token 直接偏好优化在表达基准上出现严重退化,有监督微调在风格指令与声学属性上依然很有竞争力,说明稠密监督对细粒度副语言实现是有效的。
智力 × 表达力: 智力指指令遵循、知识推理与安全等语义能力,在 VoiceBench 与 OpenAudioBench 的文本输出上评价;表达力指副语言控制、角色扮演与共情等语音表现,在 VStyle 的语音输出上评价。论文同时报告两者的原因是端到端模型容易顾此失彼,组合意义是用同一混合训练在帕累托意义上同时推进两者,而不是用语义提升换声学退化。
主结果的文字报告显示,教师强制有监督在推理较重的子集上经常低于基础模型,论文将其归因于小规模多域监督的梯度干扰与对齐税,但这属于有限解释。全 token 偏好优化为次优,把偏好更新限制在文本语义 token 带来更可靠的智力增益,动态混合在此基础上进一步缓解灾难性遗忘并取得总体最强的语义与表达聚合表现。总体趋势不等于每组每步都成立,具体数字需看消融表。
作用范围与加权方式哪一个更关键,平滑是否必要?
本节的比较问题是混合时先改哪里以及按什么比重改。公平条件是同一主干、数据与预算,智力为多个推理子集均值,表达力为语音风格均值,越高越好。下表固定比较作用范围与加权策略,偏好损失的作用范围分为全部 token 与仅文本,有监督始终覆盖全部 token。
| Scope Strategy | IQ | EQ |
|---|---|---|
| All Tokens Fixed Weights (0.5/0.5) | 48.70 | 2.48 |
| Text Tokens Fixed Weights (0.5/0.5) | 52.60 | 2.60 |
| All Tokens Dynamic Weights | 48.84 | 2.50 |
| Text Tokens Dynamic Weights w/o EMA | 53.15 | 2.53 |
| Text Tokens Ours (Dynamic Weights) | 55.24 | 2.92 |
表后解释是作用范围至关重要:同样固定 0.5 对 0.5 混合,仅文本偏好明显优于全 token,智力与表达分别为 52.60 与 2.60 对比 48.70 与 2.48。固定权重还暴露智力与表达的权衡,偏向有监督的 0.7 对 0.3 把表达抬到 2.72 但智力降到 49.94。全 token 动态加权仍受限,而仅文本动态加权取得最好结果,去掉指数滑动平均后明显回落,说明平滑对稳定性重要。
评测者与人类一致性的细粒度对照进一步说明声学排序不可靠。表前问题是不同裁判在语义与声学两轴上与人类的差距,公平条件是同一重复采样池与 1 到 5 分量表,相关越高越好、误差越低越好。
| Intra-ID | Spearmansem | Intra-ID Spearmanacous | MAEsem | MAEacous |
|---|---|---|---|---|
| 0.700 | 0.505 | 0.621 | 0.671 | |
| 0.539 | 0.234 | 0.787 | 1.219 | |
| 0.583 | 0.289 | 0.981 | 1.276 | |
| 0.573 | 0.230 | 0.819 | 1.156 | |
| 0.455 | 0.195 | 0.902 | 0.792 |
表后解释是跨裁判与数据集,最稳定的差距出现在同提示内排序:语义排序一致性持续强于声学。全局相关上个别裁判的声学也不低,但一旦进入同提示内比较,声学区分度迅速下降。这支持训练信号可靠性的判断,也解释了为什么动态门控要用最大值与方差两个统计量。未胜出项是部分裁判在全局声学相关上并不差,不能据此认为声学奖励已可用,因为偏好构造恰恰依赖同提示内区分。
人类并排主观评价提供另一条证据。表前问题是相对原始模型,新方法是否在内容与语音两轴都被偏好,公平条件是盲测、顺序随机、每项 3 名标注者并按多数投票聚合,胜率越高越好。
| 评价维度 | 胜率 | 平局率 | 负率 | 显著性 |
|---|---|---|---|---|
| Helpfulness | 63.8 | 16.2 | 20.0 | < 0.001 |
| Naturalness | 66.2 | 13.8 | 20.0 | < 0.001 |
| Overall | 68.8 | 13.7 | 17.5 | < 0.001 |
表后解释是新方法在有用性、自然度与总体上均显著优于基线,总体约 4 比 1 的胜负比。但需注意评价集仅 40 项且每项 3 人,推广到更广分布仍待验证,且自动指标不能替代人评。指数滑动平均系数与组大小的敏感性分析显示系数 0.9 最好,过小导致权重方差大,过大导致滞后,组增大到 8 带来智力增益但表达改善有限,去掉平滑在两种组大小下都明显下降。
哪些结论还不能下,缺了哪项验证?
论文明确列出两项局限。第一是只研究序列级奖励信号,没有运行基于更强 token 级或帧级反馈的语音 token 实验,原因是资源有限。白话说,语音侧还没有得到稠密可靠的指导,混合损失框架之外的更细粒度反馈可能进一步改善语音质量与稳定性,但本文未验证。第二是音频裁判的可靠性与校准尚不如文本语义裁判,动机观察与最终结果的故事可能随更好的音频裁判而变化。
除作者自述,还需补三项验证才能把判断做实。其一是统计显著性与方差:主结果多为单次运行的均值比较,未报告多次种子下的置信区间。其二是成本与延迟:训练资源只给出卡数与超参数,未报告墙钟时间、采样开销与推理延迟,总体趋势不等于每步都省。其三是分布外与安全:安全子集虽有覆盖,但误判率与对抗条件下的表现未充分展开,不应承诺这些量得到改善。相关性不是因果,梯度正交与方差差异支持设计但不证明必然性。
要复现应先做什么,需要保留哪些关键设置?
复现先做数据与评价的对齐。再做算法的最小闭环。数据侧按 13510 的混合口径重建公开与自建两部分,自建的风格控制与理解模板、表达性对话与复述数据需保留原始提示格式,偏好对必须用同一重复采样结构生成:每提示 8 候选、语义与声学 1 到 5 分、加权和默认 0.5、差距阈值 0.5、并列先按语义后按声学打破平局。评价侧严格用官方脚本与裁判,文本基准看文本输出,语音风格基准看语音输出,不混用指标。
算法侧先实现联合分布的 token 类型划分,再实现混合目标:有监督覆盖全部 token,偏好只在文本 token 上计算组相对策略优化。门控按最大奖励与归一化方差计算,阈值 3、最大方差 4、最大值 0.8、斜率超参数与平滑系数 0.9 都要保留。组大小 4、温度 0.9、top-p 为 0.9、学习率 1e-6、批大小 1、最大长度 2048、散度系数文本与语音均为 0.01。训练初期权重通常较低,后期稳定在 0.35 到 0.55 之间,可用该轨迹做冒烟测试。
信息条件方面,论文给出方法与数据描述,但本次没有验证到可用的代码与模型资源,不应写已公开或当前可用。若要声称可运行,必须区分代码开源、权重下载与系统可运行三件事,并给出本次实际验证到的链接状态。未报告的参数冻结与梯度路径不要猜,缺项在复现记录中明确标注。
何时值得尝试这种混合,何时不值得?
当任务同时要求说什么与怎么说,且已观察到统一偏好优化改善语义但损伤自然度时,值得尝试本文的模态分工混合。适用条件是能获得可靠的语义排序信号,能承担在线采样与语音解码打分的成本,且有足够的演示数据做声学锚定。此时把偏好限制在文本、把有监督保留在全部 token,并用最大值与方差门控调节比重,是论文验证过的更稳的起点。
当声学目标本身需要强塑造,或已有可靠的 token 级声学反馈时,不应照搬仅文本偏好。同样,当音频裁判明显不可靠或采样预算极小时,动态门控会长期偏向有监督,偏好侧的收益有限,还需补更可靠的声学评价或更稠密的语音监督。论文特有的误解需要澄清:固定增大有监督比重能抬表达但会压语义,动态不等于始终增大偏好,去掉平滑会明显回落。最终判断是该方法在两种架构上给出更好的智力与表达权衡,但仍是序列级奖励下的折中方案,不是声学问题的最终解。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



