英文题目:Rectifying the Emotional Flow: Aligning Priors and Dynamic Guidance for High-Arousal Text-to-Speech

会议身份:conference:acl:2026:conference-paper-id:2026.acl-long.998

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #测试时自适应 #语音 #文本到语音

评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Fangming Feng:机构信息未能从会议 PDF 纯文本可靠映射
  • Dongjie Fu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zequn Xie:机构信息未能从会议 PDF 纯文本可靠映射
  • Yu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yangyang Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhou Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Tao Jin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

高唤醒文本到语音以文本与情感参考为输入合成愤怒惊叫等强情感语音,难点在于标准各向同性高斯初值偏向中性韵律而均匀无分类器引导又易扭曲声学流形导致语言崩溃。该框架为无需重训练的推理期双阶段整流,先由情感校正噪声先验以高引导尺度做前瞻伪欧拉推进再以基准尺度回退,等价注入强度正比于尺度差的情感语义梯度并将初值推入目标情感吸引盆。前一步输出的情感化初值进入似然逆引导调控的流匹配去噪过程,该步骤把学习条件分布建模为中性分布与理想情感分布的加性混合并反解纯净向量场。由此导出随似然比变化的动态尺度,仅在漂向中性时增强干预并以截断上限防止发散,从而在保持声学稳定下维持高强度表达。与恒定引导直接放大特征差不同,该方法从混合假设中解耦中性干扰并按几何发散自适应调度,实际意义在于平滑轨迹减少离散误差与声学抖动。在HIED评测下,F5-TTS结合该方法的WER为2.53%,低于基线F5-TTS的4.41%。该结论适用边界限于迭代式扩散与流匹配解码器,原文明确声明不适用于离散自回归与单步前馈架构,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/MM-Speech/emo-tts — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么高唤醒最难?

这篇论文研究的输入是文本加情感控制信息,输出是带有目标情感韵律的语音。初学者要建立的动作画面是:模型先从一团随机噪声出发,一步一步去噪或沿向量场搬运,最终落到一句可懂且有情感的语音上。

对朗读式中性语音,当前流匹配与扩散模型已经很自然。但尖叫、哭泣、大笑这类高唤醒情感韵律变化剧烈,训练数据稀少,在生成空间中只占很窄的区域。

论文要解决的矛盾是稳定性与表现力的权衡。想要更强烈的情感,就容易把字念糊、出现颤音和伪影。想要字念清楚,就容易退回平淡的中性语调。

开场必须保留的关键信息是:这是一个推理阶段框架,不重训模型。它包含两个可插拔部件,评测覆盖标准情感库与自建高强度子集。代码当前可用,官方仓库已经公开。

情感语音与推理优化各走了哪条路?

情感文本转语音的主线是从 2 阶段回归到端到端生成。早期例子如 Tacotron 与 FastSpeech 系列解决的是对齐与推理速度,情感控制主要靠标签嵌入、参考音频的零样本迁移,或大语言模型加自然语言提示。

另一条主线是流匹配成为主流骨架。代表做法如 Matcha-TTS、F5-TTS 与 CosyVoice 系列,把合成看作沿常微分方程的连续轨迹生成。

推理优化主线则来自图像扩散模型的经验。初始噪声带有隐式生成偏置,最优噪声检索可以改变语义。固定权重的分类器无关引导只在特定区间开启,才能兼顾质量与多样性。

论文明确指出这些图像先验不能直接搬到语音情感任务。因为高维情感流形容易坍缩,而语音域的免训练激活转向在高强度下不稳定。作者把工作定位为面向语音流形的推理优化:不动权重,只矫正起点与途中引导。

基线在高强度数据上到底卡在哪里?

论文先用 CosyVoice2 在高强度情感数据上做了 1 次大规模摸底。由于样本量大,作者用 Gemini 2.5 Pro 作为人类评价的代理,计算情感平均意见分与总体平均意见分。横轴是情感强度是否达标,纵轴是整体音质是否完好。

实际分布显示,大量样本挤在左上高稳定但表达不足区与左下低质量区。少数冲到右侧高唤醒的样本又有不少掉到右下音质退化区,右上理想平衡区的点极为稀少。

这个摸底动作的教学意义是:它把抽象权衡变成了可数的分布。后续所有改进都要回答是否把点从左侧搬到右上,而不是只把某一轴拉高。

作者进一步把原因归为两处。标准各向同性高斯初始化自带中性韵律偏置,轨迹容易滑向中性局部最优。均匀的分类器无关引导在全时间步做线性外推,容易扭曲声学流形并引入伪影。

看图路径: 1. 先看横轴情感分与纵轴总体分划分出的四个象限与文字标注;2. 再数左上蓝色点团与左下绿色点团的密集程度与纵轴位置;3. 最后定位右上理想平衡区橙色点的数量与右下红色点的位置

原论文 Figure 1:The stability-expressiveness trade-off in high- arousal TTS.

论文图 1。原论文 Figure 1:“The stability-expressiveness trade-off in high- arousal TTS.”。

上图把困境画成了散点分布。蓝色点团集中在高总体分但情感分偏低的上部,绿色点团集中在情感分偏低且总体分偏低的下部。红色点是情感分上去了但总体分仍偏低的退化样本,橙色理想点只在右上有零星几个。

该图支持的判断是基线不是偶发失败,而是系统性偏向中性或以牺牲可懂度换强度。其限制是该图用的是自动代理打分,不是后文的人类盲测,因此不能直接当作最终音质结论。

两个推理部件如何分工拉住情感轨迹?

方法全景可以沿一个样本走一遍。输入是一句目标文本、说话人参考与目标情感,例如悲伤的高唤醒哭腔。表示阶段是模型内部的条件向量场,声学分支保证字念清楚,情感分支提供哭腔的韵律方向。

组件阶段先做情感矫正噪声先验,把随机起点沿语义梯度搬到悲伤流域附近。再做似然逆引导,在每一步比较条件与无条件预测的似然比,漂回中性时加大引导,已在情感区时放松引导。

目标是让整条轨迹始终贴着高唤醒流形走。输出是既有强度又可懂的语音。论文用几何语言总结为矫正情感流:基线是灰色虚线,中途漂移;新方法是紫色实线,起点已对准、途中被动态拉回。

情感流形 × 声学流形: 情感流形分工是刻画不同情感韵律所在的高概率区域,声学流形分工是约束发音可懂与音质自然的语音区域,搭配理由是高唤醒情感是声学流形上的稀疏子区域,只追情感会冲出可懂区、只保可懂会退回中性,组合意义就是让轨迹始终落在两者交叠的理想语音区。

为理解这种分工,先看总览图的左右对照。左侧强调起点搬移,右侧强调途中旋钮,中间把两层流形上下叠放,说明情感对准与声学稳定必须同时满足。

看图路径: 1. 先沿左侧从标准高斯经前视与回退得到矫正起点的红色箭头看起点搬移;2. 再看中间声学流形与情感流形两层中基线灰色虚线与紫色矫正线的分叉;3. 最后看右侧似然比公式如何切换高引导与低引导两条去噪分支

原论文 Figure 2:Overview of our method. Left: ERNP injects a semantic gradient to align the initial state with…

论文图 2。原论文 Figure 2:“Overview of our method. Left: ERNP injects a semantic gradient to align the initial state with the target emotional manifold.”。

总览图左侧画出从标准高斯点团经前视步跳到高引导区、再经中性回退得到矫正起点的两段箭头。中间画出基线在声学与情感两层都偏向模糊语音、而矫正线落到理想语音的过程,右侧给出似然比大则引导小、似然比小则引导大的旋钮公式。

该图支持的机制直觉是起点负责进入正确的吸引盆,途中引导负责防止回退。其限制是示意图的流域颜色深浅只是定性,不代表真实概率密度数值。

起点噪声如何从随机变成带情感方向?

第一个组件是情感矫正噪声先验,白话是给起点加一个指向目标情感的推力。英文名为 Emotion-Rectified Noise Prior,后文简称矫正先验。操作分 3 步:先从标准高斯采样一个锚点,再做前视步,最后做校准步。

前视步用较高的初始引导尺度沿欧拉方向向前走一个伪步长。校准步从伪状态用基准引导尺度往回走,落回起点时刻,得到的点就是矫正后的初始噪声。论文的几何解释是两步速度差近似等于情感语义梯度。

打比方就像射箭前先朝靶心方向迈半步,之后整条飞行就不必大幅转弯。对应到真实组件,就是起点已经带有情感方差,后续求解器不必剧烈转向,从而减少结构伪影。

情感矫正噪声先验 × 似然逆引导: 情感矫正噪声先验分工是把采样起点从中性偏置区搬到目标情感流域附近,似然逆引导分工是在去噪途中发现漂回中性时再加力,搭配理由是只改起点仍可能走偏、只调途中则起点差距太大需要剧烈纠正,组合后起点已对准、途中只做小幅纠偏,从而同时保住发音稳定和情感强度。

符号与计算目标需要先讲清。条件流匹配的合成遵循由学习向量场驱动的常微分方程,状态随时间从噪声搬运到语音,条件包含文本、说话人与情感。

\[dxt = vθ(xt, t, c)dt\]

上式中 xt 是当前带噪状态,t 是时间,c 是条件,v 是模型预测的速度。矫正先验的前视计算就是在该速度上用高引导算 1 次,再按步长平移。

\[xτ = x0 + τ · ˜vλinit(x0, 0)\]

上式中 x0 是原始高斯锚点,tau 是伪步长,带下标的速度是高引导下的预测。校准步再从中间状态回退,两式相减即得到起点修正量。原文给出伪代码对应算法 1,修正只作用于采样起点,因此属于推理计算,不更新参数。

途中引导如何只在漂回中性时加力?

第二个组件是似然逆引导,白话是根据漂移程度自动拧大的情感旋钮。英文名为 Likelihood-Inverse Guidance,后文简称逆引导。传统做法是固定放大条件与无条件预测之差,论文认为高唤醒不是中性的线性延长。

因此作者把学到的条件分布建模为中性分布与理想情感分布的加性混合,混合纯度系数默认取 0.95。目标是从混合中解出纯净的理想情感分布,再对其取对数梯度得到纯净向量场。

推导后向量场写成基准加动态尺度乘差值的标准引导形式,但尺度不再是常数。直觉是:似然比远大于 1 说明已在情感区,尺度趋近 1;似然比接近下界说明退化为中性回退,尺度变大以强力纠正。为防分母趋零发散,尺度上限截断为 30。

条件流匹配 × 分类器无关引导: 条件流匹配分工是按学到的向量场沿常微分方程把噪声搬运成语音,分类器无关引导分工是把条件预测与无条件预测之差放大以增强条件,搭配理由是流匹配给出连续可干预的每步速度,而固定放大的传统引导在高唤醒区会扭曲声学流形,因此需要把固定放大换成随状态变化的放大。

混合假设的数学起点是把条件密度写成两项加权和,权重由纯度决定。

\[pθ(xt|cemo) = (1 −π) · p(xt) + π · ptrue(xt|cemo)\]

上式中 p 为中性分布,ptrue 为理想情感分布,pi 为纯度。由此解出纯净场并整理为引导形式。

\[vtrue(xt) = vu(xt) + λ(xt, t) · (vc(xt) −vu(xt))\]

上式中 vu 为无情感条件的速度,vc 为带情感条件的速度,lambda 为状态相关尺度。尺度本身由似然比决定。

\[Rt = pθ(xt | cemo)\]

上式中分子是带情感条件的密度,分母是中性密度,比值记为 Rt。论文进一步用转移核的高斯假设,把对数似然比增量写成速度几何差,保证 Rt 可在采样中递归估计。

似然比 × 引导尺度: 似然比分工是实时度量当前状态更像目标情感还是更像中性回退,引导尺度分工是决定这一步把条件方向放大多少,搭配理由是漂移程度每步都在变,固定尺度不是过大就是不足,因此用似然比的倒数关系算出状态相关尺度,越接近中性就给越大纠正,已在情感区就接近只用条件场。

该组件的真实计算在算法 2 中。每步先算条件与无条件速度,再由当前 Rt 算尺度并截断,用矫正场做欧拉更新,最后用速度差更新下一步的对数似然比。原文未给出该递归之外的额外监督,速度来自冻结的预训练模型。

没有重训时,真正的计算发生在哪里?

本研究没有训练阶段,没有更新任何语音模型的权重。也没有报告新的损失函数、优化器或训练轮数。必须明确的是,无训练不等于确定性求解,输出仍受随机起点与求解步数影响。

真实计算全部在推理阶段。一是矫正先验的两步速度查询与起点平移,需要 2 次前向。二是逆引导在每个去噪步的 2 次前向加 1 次尺度计算与 1 次状态更新,外加 1 次似然比递归。

对于 CosyVoice2 这类把情感与文本在语言模型阶段融合的模型,论文设计了双分支策略。分别送入带情感提示与不带情感提示的输入,得到情感引导条件与无条件,再固定随机种子送入扩散部分生成。

超参数方面,原文明确给出纯度取 0.95、最大尺度取 30、前视引导与基准引导以 30 与 1 的组合最优。伪步长记为 tau 但未在本节给出具体数值,属于复现时需回查代码的缺项。代码当前可用,但这只代表推理代码可得,不代表权重与环境已验证。

数据、基线与指标如何保证可比?

数据方面用三块公开基准:ESD、EmoVoice 与 Expresso,其中中性参考音频来自目标说话人。ESD 无官方测试划分,作者沿用前人做法取前 100 条提示与特定说话人构造评测集,Expresso 只用朗读子集。

为聚焦高唤醒,作者从多个开源学术语料筛选出高强度情感数据集。共 400 条极端唤醒样本,覆盖愤怒、开心、悲伤、惊讶各 100 条,涉及 37 个说话人,男性 295 条、女性 105 条。

筛选动作用预训练唤醒度预测器打分排序后只保留顶层。每个说话人至少保留一条高唤醒参考与一条带真实音频的目标文本,保证参考与目标可配对。

模型方面选 3 个可控情感基线:Index-TTS2、CosyVoice2 与纯前馈流匹配的 F5-TTS。指标分客观与主观:客观用词错率衡量可懂度,中文用 FunASR、英文用 Whisper,情感用 emotion2vec 算余弦相似度与召回,自然度用 UTMOSv2 代理。

主观用相似度、韵律、质量、情感 4 维平均意见分。大规模处用 Gemini 2.5 Pro 自动打分,小规模 50 条做人类盲测。聚合口径按数据集分别报告,词错率越低越好,其余相似度、召回与意见分越高越好。硬件与统计显著性在证据中未报告,属于缺项。

主结果是否同时保住字准与情感强度?

比较问题是:在相同文本、说话人与情感条件下,接入矫正先验加逆引导后,能否同时降低词错率并提升情感相似度。公平条件是固定随机种子与参考音频,基线为原模型直接生成。指标方向是词错率越低越好,情感相似度与意见分越高越好。

下表是标准基准上的总体比较,保留了原模型的基线行与接入新方法的行,覆盖相似度、韵律、质量与情感 4 维人类评价。表前说明已交代比较对象与方向,表后将解释收益与代价。

ModelMethod SMOSPMOSQMOSEMOS 2024) to extract representations and compute the
Base3.853.623.793.53
+Ours3.913.873.903.82
Base3.923.783.953.94
+Ours3.773.794.024.18

上表显示接入方法后 CosyVoice2 的情感分从 3.53 升至 3.82,韵律与质量也有提升。IndexTTS2 的情感分从 3.94 升至 4.18,质量也有提升,但相似度略降,说明情感增强不总是免费,音色相似可能付出小代价。

另一组未胜出项是 ESD 上的 IndexTTS2,由于该分布已是其训练数据,词错率改进余地小,仅情感相似度小幅提升。这支持推理优化在已拟合分布上增益有限的判断。

为补足高唤醒证据,下表整理 F5-TTS 在高强度集上的可运行策略对比,数字来自原文连续句,单位保留原文百分号与小数精度。比较问题仍是同一骨架下基线直接生成与接入新方法生成的可懂度与情感强度差异。

条件指标基线本方法比较对象
HIED 高唤醒词错率4.41%2.53%F5-TTS
HIED 高唤醒情感平均意见分3.633.89F5-TTS 人类评价

该表报告的方法把词错率从 4.41% 降至 2.53%,情感分从 3.63 升至 3.89,支持高强度下同时改善可懂度与情感强度的结论。其限制是不同情感指标并不完全同向,自动相似度与人类情感分可能出现分化,复现时需要两类指标同看。

为理解途中引导为何更稳,先看引导尺度随时间的变化。左图标准高斯起点在 0.2 附近出现剧烈尖峰且多条样本抖动,右图矫正起点峰值明显降低且曲线收拢,导读段已说明横轴为扩散时间、纵轴为引导尺度。

看图路径: 1. 先对比左右两图纵轴引导尺度的量程与峰值高度;2. 再看横轴扩散时间在 0.2 附近红色均值曲线的尖峰与波动;3. 最后观察右侧多条灰色单样本曲线是否收拢在均值周围

原论文 Figure 3:Curves of guidance coefficient λt over time.

论文图 3。原论文 Figure 3:“Curves of guidance coefficient λt over time. Left: Standard Gaussian Noise (unstable spikes); Right: Emotion-Rectified Noise Prior (stable trajectory).”。

上图可见左侧红色均值在 0.2 处冲高且灰色单样本线上下穿插,纵轴量程达到 30。右侧纵轴量程仅 14 左右,红色均值平滑下降,灰色线紧贴均值。该对比支持矫正先验提供热启动、避免剧烈纠正的解释,但不能把末步收敛推广为全程最优,极少步数下的表现还需看低步数分析。

跨数据集与低步数下结论还成立吗?

第二个结果问题是:离开高强度集、换到标准集,方法是否依然有效。比较条件是同一 F5-TTS 骨架、同一情感参考的零样本迁移,只切换数据集。指标仍是词错率越低越好,情感相似度与自然度代理越高越好。

下表是跨数据集的客观扩展,保留基线与新方法两行,覆盖 3 个数据集。表前已说明比较条件与指标方向,表后将讨论收益边界与未评测项。

DatasetMethod WERESUTMOSv2
Baseline3.620.783.16
+Ours2.380.823.19
Baseline3.910.773.47
+Ours2.670.833.65
Baseline3.790.723.41
+Ours2.910.793.58

上表显示 3 个数据集的词错率均下降、情感相似度均上升,自然度代理也小幅上升。这支持方法改进的是解码器本身的生成动力学,而不依赖大语言模型的语义引导。代价是该表未报告人类情感分,不能把自动相似度直接当成人评。

低步数方面,原文报告在函数求值次数为 25、10、5 时,基线词错率从 4.36% 恶化到 15.29%,而新方法在 5 步时仍保持 7.98%。几何指标上累积角偏差从 34.26 降至 15.83,对数直线度从 2.28 降至 1.04,支持轨迹更直、离散化误差更小的解释。

但同组召回在低步数下有所回落,说明极少步数仍以部分情感召回为代价换稳定。这是必须保留的反例,总体趋势不等于每组每步都成立。

拿掉起点矫正或换掉动态引导会发生什么?

消融问题是:情感强度与可懂度的收益分别来自哪个部件。实验固定用 IndexTTS2 在高强度集上对比。先看起点部件:标准高斯与矫正噪声的对比显示,去掉矫正后情感相似度与召回明显下降,词错率也有所恶化。

再看引导部件:固定放大的分类器无关引导情感相似度不低,但词错率高达 4.08%。限区间引导虽稳定但强度不足,而逆引导取得最低词错率与最高相似度。下表把两组消融放在一起,数字均来自原文连续句,未做四舍五入或单位换算。

条件指标对照策略本方法数值关系
HIED 起点消融情感相似度0.730.84去矫正下降
HIED 起点消融召回51.5%54.2%去矫正下降
HIED 引导消融词错率4.08%3.05%固定引导更高
HIED 引导消融情感相似度0.790.84逆引导更高

上表显示起点消融使相似度从 0.84 掉到 0.73、召回从 54.2% 掉到 51.5%。引导消融中固定放大词错率高达 4.08%,而逆引导取得最低词错率 3.05% 与最高相似度 0.84。解释是矫正噪声已带来情感方差,若再无差别放大就会过饱和并干扰发声。

未胜出项是固定引导在相似度上并非全败,说明只看情感分会掩盖可懂度代价,必须两类指标同看。为从表示层面验证起点的作用,再看噪声的降维可视化,导读段已说明颜色与点团含义。

看图路径: 1. 先确认图例中灰色标准高斯噪声与四种颜色矫正噪声的对应关系;2. 再看灰色点团与彩色点团在二维投影中是否分离成簇;3. 最后观察开心与惊讶簇之间是否存在部分交叠边界

原论文 Figure 4:t-SNE visualization of Standard Gaussian Noise vs. Rectified Noise.

论文图 4。原论文 Figure 4:“t-SNE visualization of Standard Gaussian Noise vs. Rectified Noise.”。

上图可见左下大片灰色点为标准高斯噪声,右上按开心橙色、惊讶红色、愤怒绿色、悲伤蓝色形成各自簇,灰色与彩色几乎不交叠。该分布支持矫正噪声已编码情感语义的判断,其边界是降维投影会压缩距离,不能据此断言原始高维空间的线性可分程度。

超参数方面,纯度从 0.9 到 0.99 的扫描显示过低分离不足,过高接近 1.0 会出现数值不稳定。最大尺度从 10 到 50 的扫描显示截断为 10 时无法纠正中性漂移,截断为 50 时音质下降,因此选纯度 0.95 与截断 30。起点强度以 30 与 1 的组合最优,加到 40 时收益停滞,说明过度矫正会扰动语言结构。

哪些情况本文方法帮不上忙?

论文明确报告的主要限制是依赖连续概率流与迭代去噪。由于矫正先验与逆引导都从常微分方程性质推导,它们不直接适用于非迭代架构,例如离散自回归模型或单步前馈网络。

第二个限制是超参数敏感。纯度接近 1.0 与截断过大都会带来不稳定或音质损失,低步数下召回也会回落,因此总体趋势不等于每组每步都成立。

第 3 个限制是评测缺项。未测量误判率的统计显著性、推理延迟、显存与帧率,总体质量提升不能承诺延迟下降。大规模处用的自动代理打分与人类评价相关但不等同,不能把自动分当成人评。

相关性也不是因果。轨迹更直与词错率更低同时出现,支持几何矫正的解释,但未证明直线度单独导致可懂度提升。复现时应把几何指标与听感指标分开记录。

要复现应先跑通哪条最小链路?

复现先做三件事。第一,按官方仓库说明准备环境与权重,确认代码当前可用不等于权重与数据自动可达,先跑通任一基线的原始推理。

第二,固定随机种子与参考音频,先只加矫正先验。实现前视与回退 2 次前向,检查高强度样本的情感相似度是否上升、引导尺度峰值是否从剧烈尖峰降到个位数区间。

第三,再加逆引导。实现每步的似然比递归与尺度截断,检查词错率是否下降、音质是否回升。关键超参数保留原文值:纯度 0.95、最大尺度 30、前视 30 与基准 1 的组合。

评测时区分中文与英文的识别器、区分自动相似度与人类 4 维打分。不要把不同指标的差值混在同一列下比较,也不要把自动指标当成人评。

还需补的验证是多次种子的均值方差、低步数下的召回变化,以及在自己数据上的中性漂移频率。以判断动态引导的触发是否过于频繁或不足。

何时值得尝试这种只改推理的思路?

当基线已能念清楚但情感不够浓,或一加情感强度就含糊时,值得尝试这种只改推理的思路。因为它不动权重、成本低于重训,且在多个基线与数据集上同时改善了可懂度与情感强度。

它的适用条件是骨架必须是迭代的流匹配或扩散模型,并能给出条件与无条件两个速度。若是单步或离散自回归架构,则不在适用范围。

实践中常见的误解是把起点噪声当成纯随机从而忽视初始化,或把引导越大越好当成准则。本文的证据恰好反过来:起点带有中性偏置必须矫正,引导必须在漂移时才加大。

收束时回到起点到终点的完整链路。文本与情感进入条件场,矫正先验把起点搬到情感流域,逆引导沿途按似然比拧旋钮,最终落到既有强度又可懂的理想语音区。未来若要更稳,还需补上不确定性校准与延迟测量,才能把实验室的轨迹矫正变成可部署的收益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总