英文题目:Continuous Time-Varying Emotion Control Zero-Shot Text-To-Speech With Emotion Orthogonal LoRA

会议身份:conference:interspeech:2026:conference-paper-id:wan26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#LoRA #偏好优化 #零样本 #文本到语音

评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Chenchen Wan:机构信息未能从会议 PDF 纯文本可靠映射
  • Minchuan Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Yan Shi:机构信息未能从会议 PDF 纯文本可靠映射
  • Peng Qi:机构信息未能从会议 PDF 纯文本可靠映射
  • Shaojun Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jing Xiao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

零样本情感文本到语音需以文本、参考语音与目标情感轨迹为输入生成语音,在保留说话人身份与可懂度的同时实现连续且随时间变化的情感控制,难点在于离散标签过粗而参考提示易纠缠音色与韵律。第一步负责条件准备,用预训练 predictor 提取帧级效价唤醒度支配度序列并插值对齐到梅尔帧,其输出作为逐帧标量控制信号进入下一步。第二步负责解耦注入,冻结流匹配主干并在线性变换内插入三路低秩分支,每帧隐状态按对应标量加权叠加增量并施加分支间正交正则,学到的解耦扰动进入对齐阶段。第三步负责两阶段优化,先以条件流匹配损失加正交损失监督微调获得可控初值,再冻结参考模型每条件采样8个候选并以情感轨迹相似度、说话人相似度与1减词错率复合奖励做流式直接组偏好优化。与单路低秩适配或外部条件拼接的差异在于将情感建模为变换空间的正交低秩扰动而非输入拼接,因而更利于句内情感转场且少数据可训。在EMO-change上情感相似度达0.778且唤醒效价轨迹相似度达0.914,显著高于同数据微调基线与大资源EmoCtrl-TTS。该结论限于英语训练加日语到英语跨语言与RAVDESS拼接转场评测,未验证长时多轮切换与强口音泛化。原文未披露训练推理成本与延迟吞吐。

🔗 开源与复现资源

  • 演示资源:https://wancc-p.github.io/EoLoRA/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么情感难做?

本文的输入是三部分。第一是待合成的文本,第二是一段参考语音及其文字,用于提供零样本场景下的音色。第三是一条帧级情感序列,即每 1 帧梅尔频谱对应的效价、唤醒、优势 3 个连续值。输出是与文本内容一致、音色接近参考人、韵律跟随给定情感轨迹的语音。 必须保留的信息包括参考语音决定的说话人身份、文本决定的字词内容,以及情感序列决定的随时间变化的表达强度。

本文的输出是 1 篇可复述方法的中文解读,重点讲清样本如何从输入走到表示、组件、目标和输出。 难点在于情感通过基频走向、能量、语速和音质细微变化体现,容易与音色和内容韵律纠缠。离散标签只能区分高兴或悲伤等大类,无法表达强度差异和平滑过渡。基于参考的提示方式直接复制参考韵律,调情感时容易连带改变音色。本文因此选择连续 3 维情感表示,并研究如何在数据有限时既增强控制又不破坏质量。

流匹配 × 零样本语音合成: 流匹配负责给出从噪声到梅尔频谱的连续变换路径和训练目标,零样本语音合成负责在只有一段参考语音时复刻其音色和语速,二者搭配的理由是前者提供高质量可扩展的生成主干,后者提供无需目标说话人训练数据的运行方式,组合意义是情感控制只需在冻结主干上做小幅调制而不重训整个生成器。

流匹配主干已经能做到高自然度和较好的说话人保持,但它本身没有为情感维度预留解耦接口。直接在外部拼接情感向量容易被主干平滑掉,尤其在句内情绪转折处,生成会逐渐漂向提示语音自带的情感。本文把调制做进主干线性变换内部,是为了解决这种弱化和漂移。

已有路线各解决了什么,还缺哪一块?

离散情感控制路线用少量类别标签驱动合成,例如改进表现力并研究情感与说话人解耦的工作,但控制信号仍限于几个类别,无法做细粒度强度和过渡。自由文本提示路线用自然语言描述情感,灵活性提高,但不同措辞结果波动大,需要精心设计数据才能稳定。 维度情感路线用效价、唤醒、优势 3 个连续值描述积极性、激活度和支配感。有工作据此构造球面表示来控制风格和强度,无需人工情感标注。

有工作对齐帧级轨迹实现零样本时变控制,但依赖大规模情感资源。本文明确在有限训练数据下工作,这是与上述大规模路线的重要条件差异。 强化学习路线开始进入语音生成。有工作用直接偏好优化增强情感表达,有工作用组相对策略优化改善流匹配语音的自然度和说话人相似度。但系统性地用强化学习提升情感可控性,特别是时变可控性的工作仍然有限。

本文的第二阶段正是对准这一缺口。 低秩适配原本是对大模型每层加一个低秩更新, steering 能力强但没有显式机制分离不同情感属性。本文保留低秩高效的思想,但把一个更新拆成 3 条分别对齐 3 个情感维度的分支,这是理解全文方法分叉点的关键。

本文到底要解决哪个可验证的问题?

本文研究基于预训练流匹配主干的零样本语音合成中的连续与时变情感控制。问题可以表述为给定文本、参考语音和目标情感轨迹,生成语音在内容正确、音色接近参考人的前提下,其情感轨迹与目标轨迹一致。评估时需要同时看情感跟随、韵律相似、可懂度和说话人相似度,而不是只看情感一侧。

时变情感控制 × 话语级情感控制: 话语级情感控制分工是用整句恒定的效价值处理全局风格,时变情感控制分工是让效价值随帧变化以表达句内转折,搭配理由是同一套按帧加权公式既支持常数序列也支持变化序列而无需改结构,组合意义是 1 次实现从强度微调到情绪转折的连续控制。

两个有源的评测协议对应两种难度。跨语言协议用日语语音做提示、英语文本做输入,检验情感和音色能否跨语言迁移。情绪转折协议把同一文本但不同情感的两句话拼成一个提示,检验合成能否跟随句内明确的情绪跳变。两者都要求内容与身份保持稳定,这是后文判断代价的基准。 本文不追求用离散标签复刻某个固定情绪,而是提供每步可调的连续接口。

话语级控制是其特例,即把 3 维值设为常数。时变控制是其一般形式,即 3 维值随帧变化。这种统一是后文公式按帧加权的原因。

方法全景:一个样本走完全程

沿一个样本走一遍有助于建立依赖顺序。训练时,模型拿到加噪语音、语音提示、文本提示和帧级情感序列,目标是预测重建所需的流。推理时,模型拿到参考语音段、目标文本和目标情感序列,通过求解常微分方程逐步去噪生成梅尔频谱。情感序列在 2 阶段都存在,只是训练时来自真实语音的预测值,推理时来自用户指定的目标轨迹。 主干是基于扩散变换器的条件流匹配语音合成模型,原文建立在预训练的 F5-TTS 基础检查点上。

文本先过文本编码器,再与语音表示和时间步信息汇合进入变换器块。情感正交低秩适配以内插方式作用于选定的线性层,不改变主干原有权重的冻结状态。 训练分两段。第一段是有监督微调,同时优化流匹配目标和分支间正交正则。第二段是偏好对齐,在当前模型采样多个候选,用组合奖励排序后优化偏好目标。

两段都围绕同一个要求,即增强情感跟随但保持可懂度和说话人相似度。 以下架构图把训练与推理并置,是理解数据流和监督位置的最直接依据。读图时先分清左右两条路径,再定位情感分支的插入点。

看图路径: 1. 先从左下输入区沿箭头向上追踪文本、掩蔽语音与 VAD 序列如何汇入 DiT 模块;2. 再看中间黄色 EO-LoRA 框内三条 V/A/D 分支如何与冻结权重 W 并联相加;3. 对比右侧推理分支中噪声、待生成区与参考语音的走向与左侧训练分支的差异;4. 确认虚线标注的正交损失作用在分支两两之间而非主损失路径上

原论文 Figure 1:Overall architecture of EO-LoRA TTS. Left: training.

论文图 1。原论文 Figure 1:“Overall architecture of EO-LoRA TTS. Left: training.”。

该图左侧为训练,上方掩蔽频谱与预测流之间形成重建损失回路,下方依次为带噪输入、掩蔽区、文本与情感序列,最底部为真值。中间黄色框为情感分支,冻结权重与 3 条分支并联,帧表示分别乘以对应情感标量后相加。右侧为推理,底部参考语音提供音色,上方待生成区从噪声出发经变换器与常微分方程求解器得到输出,虚线表示的正交损失只约束分支两两之间。图中火焰与雪花图标分别暗示可训练与冻结,但具体冻结范围以正文文字为准。

三条分支如何调制线性层,正交约束算什么?

先讲白话。低秩适配是指不改原矩阵,而学两个小矩阵相乘来近似所需的改变量,参数少且接近零初始化时不破坏原模型。情感正交低秩适配是指为效价、唤醒、优势各学 1 对小矩阵,每 1 帧用对应的情感标量加权后叠加到原变换上。正交约束是指要求 3 条分支学到的等效改变量两两正交,减少冗余和串扰。

效价唤醒优势 × 情感正交低秩适配: 效价唤醒优势分工是提供每帧连续可调的情感标量,分别对应积极程度、激活程度和控制感,情感正交低秩适配分工是为每个维度各学一条低秩更新矩阵并用标量加权叠加到冻结线性层上,搭配理由是标量直接乘分支可以实现帧级时变控制,正交约束减少分支间冗余,组合意义是得到可解释且解耦的内部情感接口。

具体计算按帧进行。记某线性层预训练权重为输入维到输出维的矩阵,输入为按帧排列的隐表示。冻结原权重,引入 3 组低秩矩阵,每组秩远小于输入输出维度。设第 t 帧的情感标量为效价值、唤醒值、优势值,则该帧输出等于原变换加上三项标量与对应分支变换的加权和。话语级控制即令标量在全句为常数,帧级控制即令其随时间变化。

原文经消融选择把分支插入注意力块的值投影和输出投影以及前馈块的线性层,记为 v 加 o 加 ff。 正交约束作用在等效更新之间。对效价、唤醒、优势 3 个分支形成 3 个无序对,计算每对更新矩阵的弗罗贝尼乌斯内积除以各自范数乘积,即余弦相似度,再平均。分母做停止梯度以避免不稳定缩放。为避免直接构造大矩阵,原文用迹的等价形式只涉及秩乘秩的小矩阵运算。

同时为避免零初始化导致归一化项数值不稳定,分支的第二个矩阵用小范数随机矩阵初始化,使初始更新接近零而正则仍有效。 需要指出缺项。原文未报告分支缩放系数之外的门控或归一化细节,也未给出正交项梯度回传到两个低秩矩阵的具体分配之外的额外技巧,复现时应按原文超参数先跑通,再排查实现差异,不从模型名称推定未写明的归一化。

两段训练各优化什么,偏好信号从哪来?

第一段是有监督微调。损失为流匹配损失加正交损失,正交权重为 0.05。情感序列的来源是关键监督链。原文用在 MSP-PODCAST 上微调过的 wav2vec2 情感预测器,以 0.5 秒窗、0.30 秒跳提取帧级预测,再线性插值到梅尔帧数,并把预测值线性归一化到负 0.5 到 0.5 区间。低秩秩为 16,缩放系数为 32,可训练参数约 10M。

第二段是 Flow-DGPO 对齐。给定文本、参考语音和情感序列等条件,从当前模型采样一组候选,组大小为 8,采样步数为 32。对每个候选算标量奖励,再在组内做均值方差归一化得到优势。优势为正的进入偏好子集,非正的进入非偏好子集,权重取优势绝对值。优化目标是基于到冻结参考模型的流匹配损失差的偏好目标,偏好强度系数为 20。

直观含义是降低好候选的流匹配损失、抬高差候选的损失,幅度按优势加权。 奖励是三项加权。情感项为候选与目标情感序列的相似度,说话人项为与参考音频的说话人相似度,可懂度项为 1 减去词错率,词错率由语音识别模型计算,三项都归一化到 0 到 1 区间,权重分别为 3、1、1。

直接组偏好优化 × 流匹配偏好对齐: 直接组偏好优化分工是同一条件下采样一组候选并按组内归一化优势分成偏好与非偏好子集,用流匹配损失差做偏好回归,流匹配偏好对齐分工是把该思想适配到语音流匹配模型的损失形式并加入情感、说话人、可懂度组合奖励,搭配理由是语音难以给出逐帧人工排序而组内比较更稳定,组合意义是在不损害质量指标的前提下增强情感跟随。

原文未报告第二段是否冻结主干之外的全部参数、优化器与学习率调度等细节,这是复现时的具体缺项。已明确的是参考模型冻结、组内归一化、损失差形式和奖励构成,复现应先固定这些已验证条件,再补齐未报告的优化配置并记录对照。

数据、协议与指标如何对应到问题?

训练数据为两个情感语料。EmoVoice-DB 含 2 万多条英语情感语音约 40 小时,ESD 英语子集含 10 个说话人、每人每种情绪 350 条、每人约 1750 条约 1.2 小时,情绪覆盖生气、高兴、悲伤、惊讶、中性。合计约 50 小时,与对比的 EmoCtrl-TTS 所用的 60,000 小时加 27,000 小时加 460 小时量级形成鲜明条件差异,比较时必须带上这一前提。 评测协议沿用对比工作的做法。情绪转折集按 EmoCtrl-TTS 方式用 RAVDESS 构造,把同一文本不同情感的两句拼成带明确转折的提示,用固定文本合成并检验是否跟随转折。

跨语言集按日语到英语协议,用日语语音做提示、翻译后英语文本做输入,检验跨语言的情感与音色保持。主干未在日语数据上训练,这是后文跨语言说话人相似度差距的已知不利条件。 客观指标有五项。词错率由 Whisper-large-v3 计算,越低越好。说话人相似度为生成与参考提示的 WavLM-large 说话人嵌入余弦,越高越好。

AutoPCP 为话语级韵律相似度,越高越好。情感相似度为生成与提示的 emotion2vec 情感嵌入序列按帧对齐后的平均余弦,越高越好。唤醒效价相似度为预测器提取的唤醒效价轨迹的平均帧级余弦,越高越好。主观指标为自然度、说话人相似度、情感相似度的 5 分制平均意见分,20 名英语母语听众评 20 条,报告均值与 95% 置信区间。 基线包括微调 F5-TTS 与 EmoCtrl-TTS。

微调 F5-TTS 把情感序列作为额外条件流嵌入后与标准输入融合再进主干,是实际可运行的同数据对照。EmoCtrl-TTS 未公开,原文转引其报告值,转引值不能视为同环境复跑,比较时需注明。

主结果在什么条件下成立,代价是什么?

比较问题是同等有限数据下,内部低秩调制是否比外部条件拼接更好地提升时变跟随,同时不损害可懂度和音色。公平条件是两者都只用 EmoVoice-DB 加 ESD 约 50 小时并基于同一 F5-TTS 主干。指标方向为情感与韵律三项越高越好,词错率越低越好,说话人相似度越高越好。

条件韵律相似度情感相似度唤醒效价相似度说话人相似度词错率
跨语言集基线2.830.6320.6010.4268.4%
跨语言集本方法3.270.6880.6790.4424.9%
转折集基线3.170.6930.8370.6947.1%
转折集本方法3.510.7530.9050.7410.6%

说话人相似度 × 情感相似度: 说话人相似度分工是检验音色是否被情感调制带偏,情感相似度分工是检验韵律是否跟上目标情感轨迹,搭配理由是只看其一会掩盖控制与保真的折中,组合意义是判断方法是否在增强表现力的同时没有牺牲身份和可懂度。

上表把跨语言与转折两种条件分开展示,避免把不同协议的差值混为一列。跨语言下本方法相对基线的韵律、情感、唤醒效价三项全面提升,词错率下降,说话人相似度小幅上升。转折集下提升更显著,词错率从 7.1% 降到 0.6%,唤醒效价相似度达到 0.905。原文报告加上 Flow-DGPO 后两集进一步提升,跨语言达到韵律 3.37、情感 0.701、唤醒效价 0.692,转折集达到韵律 3.60、情感 0.778、唤醒效价 0.914。 主要收益是句内转折跟随更有效,原文认为内部调制比外部拼接更不易被平滑。

具体代价与反例是跨语言下与大规模数据的 EmoCtrl-TTS 相比,情感相似度接近但说话人相似度和词错率仍有差距,原文归因于主干未见日语数据。未胜出项必须保留,即有限数据与跨语言提示的组合仍是边界,未评测的语言对不能推广。

插入位置与正交项各自贡献了什么?

消融要回答两个可操作问题。第一,分支插在哪里。第二,去掉正交约束会掉多少。比较条件均为转折集上的同一主干与同一情感监督,指标方向同上。

条件韵律相似度情感相似度唤醒效价相似度训练稳定性适用建议
注意力值加输出加前馈3.510.7530.905稳定默认选择
注意力查询加键加值加输出3.340.6920.903后期易退化不推荐
查询加键加值加输出加前馈3.390.7190.900部分恢复次选
去掉正交约束3.310.7080.843控制减弱需补验证
完整方法3.510.7530.905稳定采用

原文对插入位置的解释是涉及查询与键的配置优化不够稳定,韵律与情感在训练后期趋于退化,因此默认采用值、输出与前馈的组合。

去掉正交约束时,情感相似度从 0.753 降到 0.708,唤醒效价从 0.905 降到 0.843,支持正交项减少分支间干扰的判断。强化对齐阶段在两集上同时提升可控性与质量,没有出现明显的折中,这是原文报告的趋势,但总体趋势不等于每组每步都成立。 失败条件也应记录。原文未给出查询键分支不稳定的梯度诊断,也未报告不同秩与缩放系数的扫描,这是待补的验证,不是技术错误。复现时应先固定默认插入位置,再单独开关正交项,避免同时改多处导致归因不清。

哪些结论有边界,什么还没有测?

直接报告的是在约 50 小时数据、给定预测器与给定主干下,内部 3 分支调制加偏好对齐提升了两个协议上的情感跟随与质量指标。有限解释是正交约束通过降低分支冗余稳定了各维度控制,这一解释有去掉约束后下降的对照支持,但未做分支级因果分解。未验证推测是分支权重可直接对应人类可感知的效价或唤醒强度,原文未做感知标定,不应把标量大小直接读作情绪百分比。 缺失证据不是错误,但影响承诺范围。

原文未测量误判率之外的延迟、实时率、推理步数与显存开销,也未报告训练硬件预算,因此不能承诺延迟或成本改善。训练资源、推理开销、输出帧率与实际延迟应分别讨论,本文只能复述已报告的采样步数与组大小,不能外推到部署延迟。 另一个边界是情感监督本身来自预测器。预测器的窗口、跳长、插值与归一化都会进入训练目标,若预测器在某些音色或语言上偏差大,控制会继承该偏差。

跨语言实验已提示主干语言覆盖的影响,同一担忧适用于情感预测器的语言覆盖,复现到新语言时需先校验预测器质量。

要复现应先固定什么,再补什么?

先固定信息条件。情感序列必须用同一流程构造,即 wav2vec2 预测器在 0.5 秒窗、0.30 秒跳下预测,再插值到梅尔帧并归一化到负 0.5 到 0.5。文本、参考语音与情感序列的帧对齐方式必须与主干掩蔽重建流程一致,否则控制信号与声学帧错位。主干用预训练 F5-TTS 基础检查点,分支秩 16、缩放 32,插入值、输出与前馈,正交权重 0.05。 再固定两段流程。

第一段跑有监督微调加正交损失,第二段跑组大小 8、采样 32 步、偏好强度 20、奖励权重 3、1、1 的 Flow-DGPO。评估用同一五项客观指标与同一 20 人 20 条的主观协议,转折与跨语言构造沿用原文引用的协议,避免自造划分导致不可比。 还需补的验证包括优化器与学习率、冻结范围、第二段参考模型的更新时机、不同秩与插入组合的扫描,以及新语言下预测器与主干的覆盖检查。

演示页当前可用,链接为官方页面,但可用不等于代码与权重可运行,复现前应区分页面可达、代码开源与权重下载三件事。常见误解是把低秩分支当成外部情感嵌入拼接,实际它是按帧乘以标量后直接改写线性层输出,理解错这一点会导致复现时把条件加错位置。

何时值得尝试,何时应谨慎?

当任务需要连续强度与句内转折,且只有数十小时情感数据时,该方法值得尝试。它的接口直接,每帧 3 个标量即对应 3 条分支的加权,话语级与时变控制统一,无需重训主干。当已有大规模情感数据或提示语音与目标语言高度一致时,大规模基线仍可能在音色与可懂度上占优,应按本文条件差异重新评估。 跨语言场景应谨慎。日语提示到英语合成的例子显示情感可迁移,但说话人相似度差距与主干语言覆盖有关,换语言对前需先测主干与预测器的覆盖。

若应用要求严格的身份保持,应把说话人相似度与情感相似度联合监控,不只看情感单项。 下一步可验证的是分支解耦的感知对应、查询键不稳定的原因、以及在其他生成主干上的迁移性。原文已提出向其他主干扩展的计划,但尚未报告结果,应视为待验证方向。总体判断是该文在有限数据下给出了一条可复述的内部调制加偏好对齐路径,证据支持其在两个协议上的收益,边界也已在跨语言条件与未测成本上标明。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总