英文题目:EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis

会议身份:conference:interspeech:2026:conference-paper-id:wu26f_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #零样本 #语音 #文本到语音

评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Minghui Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Ganjun Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zikun Fang:机构信息未能从会议 PDF 纯文本可靠映射
  • Ting Meng:机构信息未能从会议 PDF 纯文本可靠映射
  • Hongchuan Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Bingao Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yonglong Cai:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiasheng Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Jun Du:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

指令引导的情感语音合成需从自由文本同时恢复语言内容与细粒度情感强度,现有方法或依赖参考音频而存在音色耦合,或仅用粗粒度标签导致强度不可控。本文提出双路径框架EmoInstruct-TTS,先由情感嵌入Emotion2embed融合语义与声学特征并施加分类与序数约束,再由指令条件情感流模型ICE-Flow从指令语义回归样本级嵌入并对齐协方差,随后大语言模型基于指令与文本生成语义令牌,最后条件流匹配声码器结合情感嵌入与说话人嵌入合成波形。与纯文本提示相比,该设计以显式向量承载强度几何,以语言模型保留语言可懂度,兼顾灵活性与声学接地。在21组情感强度零样本任务中,男性双路径MOS达到4.28、ESMOS达到4.25,女性双路径MOS达到4.25、ESMOS达到4.10,均超越CosyVoice2和CosyVoice3;48类任务ECS为0.870。该结论限于中文ESD与CNCED衍生数据及封闭集评估,未验证开放式情感描述的外推能力。原文未披露训练、推理硬件与完整训练成本,仅给出推理增量延迟分析。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要解决的控制难题是什么?

这篇论文的输入是两段文字:一段是自然语言指令,例如描述说话人性别年龄与情感强度,另一段是要读出来的目标文本。目标输出是带有指定情感的语音波形,且要在未见说话人上保持音色稳定。必须保留的关键信息是 48 个情感状态的划分、双路分离的设计以及零样本评测条件。刚入门的读者容易把情感合成理解为给模型加一个快乐或悲伤标签就行,但原文指出的问题更细:粗标签管不住强度,纯指令又缺乏明确的声学对应,导致生成不稳定。

比如同样写很快乐,轻微愉悦和高亢兴奋在语速、能量和音高动态上完全不同,如果模型只看到文字,学到的映射会来回摇摆。另一个难点是参考语音驱动的方法需要情感录音做提示,会带来说话人依赖和音色串扰。因此论文把任务定义为在只有文字指令时,既要理解语义,又要给出可落地的声学情感控制。本文没有收到代码、模型或数据已公开的可用资源声明,不得声称已公开,只能按论文文字复述方法与条件。

两条已有路线各卡在哪里?

第一条路线是提示语音驱动,用一段情感录音提取风格向量去条件合成。白话说就是给模型听一个范例,再模仿着读新句子。它的优点是声学细节直接来自真实语音,但缺点是推理时需要准备合适的参考音频,且参考人的音色容易污染目标说话人,出现原文所说的说话人依赖与音色不匹配。第二条路线是文本指令驱动,用大语言模型或指令提示直接指导生成。白话说就是用文字描述想要的效果,灵活且不需要参考音频。

但原文指出,这类系统多依赖粗粒度情感类别,缺乏对细粒度情感变化与强度的显式建模,语言指令本身也不足以捕捉详细的声学关联。两条路线在输入、目标和监督上不同:前者同目标但需要音频监督与配对参考,后者同输入形式但监督多停留在语义层面。本文的对照选择是同时与指令型强基线比较,并在消融中拆开双路,而不是把类别差异直接当成同条件胜负。

为什么强度需要单独建模与评测?

举例说明,假设指令是年轻男声、非常开心,系统需要同时决定读什么字、用什么节奏和能量读。如果只用一个快乐标签,模型无法区分低、中、高 3 种强度,评测时听感就会时强时弱。原文把标签集明确写成 27 个细粒度情感类别,加上 7 个主要情感乘以 3 档强度构成的 21 组强度组合,总计 48 个情感状态。这种划分把问题从分类变成兼顾分类与排序:类别要分对,强度要有序。评测也相应分成 21 组强度任务、27 类细粒度任务和 48 类综合任务,分别看自然度、情感相似度和客观对齐。若只在粗类别上评测,就看不出强度控制是否真正起作用,这也是后文要单独报告强度排序准确率的原因。

双路框架如何分工,一句话走完一个样本?

先沿一个样本走完全程。输入指令为非常开心的年轻男声,目标文本为 What a wonderful day。指令先被轻量文本编码器编码成语义特征,再经指令条件情感流模型生成一个情感向量;同时指令与目标文本一起进入大语言模型生成语义 token 序列;随后语义 token、情感向量与说话人嵌入一起生成梅尔谱,再经 BigVGAN 声码器得到波形。这样语义规划与情感声学控制分离,前者管读对读顺,后者管像不像指定强度。

下面这张总览图把两条旧路线与新框架并排比较,重点看输入如何分叉与汇合。

看图路径: 1. 先看上面两小框的输入箭头:参考语音驱动与纯文字指令驱动各用什么做控制;2. 再看下面大框中指令如何分叉:一路直达合成模型,一路经 ICE-Flow 转成中间向量;3. 确认目标文本在三类框架中始终是独立输入,不被情感控制替代;4. 对比三类框架输出端是否都指向同一目标语音,理解双路要解决的模糊性

原论文 Figure 1:Comparison between previous and proposed emo- tional speech synthesis frameworks.

论文图 1。原论文 Figure 1:“Comparison between previous and proposed emo- tional speech synthesis frameworks.”。

上半两小框分别对应旧路线:左框目标文本加提示语音进入合成模型,右框目标文本加文字指令进入合成模型。下半大框是本文框架:目标文本直达合成模型,指令同时直达合成模型并经 ICE-Flow 转成 Emotion2embed 再进入合成模型。像素可见的箭头表明,中间向量是新增的显式控制通路,而不是把指令复述一遍。这种安排的理由在正文明确写出:互补语义规划与显式情感控制,目标是在零样本下同时保自然度和情感可控性。

Emotion2embed 怎样把语义与声学压成一个向量?

Emotion2embed 的白话含义是语义声学情感嵌入,即把文字描述的含义与真实语音的声学特征拼成一个统一向量。英文名首次出现后,后文简称情感向量。具体做法是给定情感语音和配对文本描述,分别用 Sentence-BERT 编码器取语义特征、用 ECAPA-TDNN 编码器取声学特征,两路各为 512 维,拼接成 1024 维再经联合投影到 896 维。实现细节在图注与正文中一致:情感向量维度为 896,文本编码器在训练表示阶段用 bge-large-zh v1.5。训练目标是多任务:情感分类、强度分类加有序强度约束。

强度约束的做法是对向量做归一化并学习方向向量,用间隔排序损失要求低、中、高三档的投影得分单调递增。监督来源是人工核验的细粒度标签与强度标签,属于有监督结构化,不是无监督聚类。

自然语言指令 × Emotion2embed: 自然语言指令负责语义规划,分工是告诉系统要说什么、语境意图是什么,形式灵活但声学含义模糊;Emotion2embed 负责声学调制,分工是给出与真实情感语音对齐的 896 维向量,直接约束韵律与音色表现。两者搭配的原因是指令单独难以表达强度对应的声学关联,而向量单独缺乏语言上下文。组合意义是双路互补:指令进大语言模型生成语义 token,向量进声学解码器做显式情感控制。

该向量被要求说话人无关,目的是换说话人时情感控制不变形。表示质量的直接证据是后文的分布可视化与强度排序准确率,而不是仅凭分类准确率判断。

ICE-Flow 如何只看文字就猜出声学向量?

ICE-Flow 的白话含义是指令条件情感流模型,即以指令语义为条件生成情感向量的模型。英文缩写首次出现后简称流映射器。输入是指令文本,经多语言 MiniLM 编码成语义特征,输出是条件分布上的情感向量。训练时有真实语音可查:对每条指令文本与真实情感语音,用已训好的情感向量抽取器得到样本级目标,再用回归损失让生成向量逼近该目标。这样文字生成的向量能反映真实声学实现带来的变异,而不是只学类平均。

为了防止坍缩到原型,论文加入分布级正则,对齐同情感强度标签下生成向量与真实向量协方差的差异。推理时只有指令语义可用,模型采样生成向量,并可用无分类器引导控制指令依从强度。原文未报告引导系数的具体取值与扫描过程,这是复现时需要补记的缺项,不从模型名推定默认实现。

Emotion2embed × ICE-Flow: Emotion2embed 是目标表示,分工是编码 27 类细粒度情感与 21 组强度组合并保持说话人无关;ICE-Flow 是映射器,分工是把指令文本语义转换为该表示。搭配原因是推理时没有真实情感语音可用,必须从文字推断向量。组合意义是训练时用真实语音抽取的样本级向量监督 ICE-Flow,使推理时仅靠文字也能生成声学可落地的情感向量。

右半系统图对应像素显示,噪声加语义条件进入条件流匹配模块,MiniLM 在下提供条件,输出为 896 维向量,并用虚线与左半真实向量做回归对齐,这与正文公式描述一致。

合成管线中三类信息在哪里汇合?

合成阶段有 3 类信息:语义 token 序列、情感向量与说话人嵌入。语义 token 序列由大语言模型根据指令、文本与情感向量生成,代表语言内容与上下文意图;情感向量由流映射器根据指令生成,代表强度有序的声学控制;说话人嵌入与参考语音保留音色。声学特征用条件流匹配生成,再经 BigVGAN 合成。

大语言模型主干为 Qwen2.5-0.5B,用 LoRA 适配,秩为 32,可训练参数为 9.87M。原文只说明该适配条件包含指令文本、内容文本与情感向量,未报告哪些层冻结、梯度是否截断以及重置时机,因此不能从参数量推定训练开销或收敛行为。

下面这张管线图值得按面板细读,左中右分别对应表示训练、映射训练与完整合成。

看图路径: 1. 沿左图自下而上追踪语音与文本如何经双编码器拼接投影到 896 维;2. 看中图噪声加语义条件经条件流匹配生成向量的输入输出关系;3. 看右图指令与文本如何分别进入不同编码器再汇入大语言模型;4. 确认说话人参考与情感向量在声学解码阶段才汇合的位置

原论文 Figure 2:The dual-path instruction-guided synthesis pipeline of EmoInstruct-TTS.

论文图 2。原论文 Figure 2:“The dual-path instruction-guided synthesis pipeline of EmoInstruct-TTS.”。

左图自下而上可见语音进声学编码器、文本进 Sentence-BERT 编码器,拼接投影到 896 维,上方分类器带 27 类与 21 强度辅助监督。中图可见指令与文本进 MiniLM,语义条件与噪声进条件流匹配,输出 896 维向量并与左图向量做回归对齐。右图可见指令与文本分送不同编码器后汇入大语言模型,上方经流匹配与 BigVGAN 输出频谱,右侧有说话人参考输入。像素确认了双路在语言模型与声学解码两处先后汇合,而非单点拼接。

语义 token 序列 × 情感嵌入: 语义 token 序列由大语言模型处理指令与目标文本产生,分工是保证语言内容与上下文意图正确;情感嵌入由 ICE-Flow 从指令产生,分工是提供强度有序的声学控制信号。搭配原因是只用语义 token 会丢失细粒度强度,只用情感嵌入会导致语言不稳定。组合意义是两者与说话人嵌入一起条件生成梅尔谱,再经 BigVGAN 声码器成波形,实现可复述的分离控制。

样本级回归 × 分布级正则: 样本级回归负责让指令生成的向量逼近同一条真实语音抽出的向量,保留真实声学变异;分布级正则负责对齐同情感强度标签下生成向量与真实向量的协方差,防止坍缩到类原型。搭配原因是只做回归仍易均值化,只做分布对齐则无锚点。组合意义是两者相加构成 ICE-Flow 目标,在降低原型坍缩的同时保持强度排序精度。

数据如何构造,训练顺序是什么?

训练数据来自情感语音数据集与中文自然复杂情感数据集,并经半自动标注管线构成两个子集。Dataset-Base 含 49903 条,用 Gemini-2.5 Pro 结合语音与元数据自动生成情感描述,提供弱语义监督做大规模预训练;Dataset-Annotation 含 28402 条,从基础库挑选高表现力样本做人工核验,标注细粒度类别与强度,最终覆盖 27 类与 7 乘 3 的 21 组强度组合,留 7600 条做评测。训练顺序是流映射器先在基础集上训练 100 轮,批量 2048,用 Adam 加余弦退火,初始学习率 1 乘 10 的负 4 次方,再在人工核验集上微调。大语言模型用 LoRA 适配。

原文未报告声学解码器与声码器是否联合训练、训练轮数与硬件时长,因此训练成本节只能写已报告的优化器与批量设置,不能估算总算力。推理时无需参考情感语音,只需指令文本、目标文本与目标说话人参考,这是零样本条件的关键。

评测在什么条件下比,指标方向如何读?

评测组织为零样本男女声分开报告,比较对象是实际可运行的 CosyVoice2 与 CosyVoice3,以及去掉情感向量只留文本、去掉文本指令只留情感向量的两个消融。主观指标为平均意见分、情感相似度与说话人相似度,数值越大越好,由 20 位语音专家听评,每样本 3 人打分。客观指标为情感向量余弦相似度越大越好、词错误率越小越好。分布一致性指标包括原型坍缩分数越小越好、方差比越接近 1 越好、切片 Wasserstein 距离越小越好、强度排序准确率越大越好。

公平条件是同为零样本、同任务划分、同文本集,不同指标的差值不能混放一列比较,自动指标不能当成人评。原文存在基线版本与消融命名在表格中大小写不一致,但数值矩阵完整,本文按原表数值复述,不自行归一命名。

表示是否真的分出类别与强度顺序?

要回答表示问题,先看可视化再看分布数字。上排是 27 类,下排是 21 组强度,左中右分别为旧表示、本文表示与指令生成表示。导读时应先确认完整对象:同数据上的降维散点,颜色代表类别或强度,时间范围为同一评测划分。

看图路径: 1. 横向比较上排三图在 27 类情感上的点云离散与重叠程度;2. 纵向比较下排三图在 21 组强度上的成团与条带结构;3. 观察中间列相对左列是否出现更紧凑的簇与更连续的强度趋势;4. 观察右列相对中间列边界是否更平滑但仍保留强度 ordering

原论文 Figure 3:The representation performance of emoition2vec, emoition2embed, and ICE-Flow emoition2embed.

论文图 3。原论文 Figure 3:“The representation performance of emoition2vec, emoition2embed, and ICE-Flow emoition2embed.”。

像素可见左列点云混杂重叠,类别边界不清;中间列出现更紧凑的团块,且同一主要情感内强度呈现连续趋势;右列边界更平滑但仍保留强度 ordering。不能把散点密集直接等同于分类准确率,也不能把末端一团推广为全程有序,需结合下表分布数字判断。分布表显示样本级监督把原型坍缩从 0.89 降到 0.73、方差比从 0.65 升到 0.88,加入分布正则后进一步到 0.67 与 0.96,切片距离降到 0.22,强度排序准确率从 0.78 升到 0.91。这支持指令生成向量捕捉了真实变异而非坍缩到原型,但仍是有限解释,需主观听感验证。

情感相似度 × 说话人相似度: 情感相似度负责衡量合成语音与目标情感的听感接近程度,是本工作要提升的主指标;说话人相似度负责衡量音色与目标说话人的一致性,是不能牺牲的约束。搭配原因是情感控制常会扰动音色,必须同时报告。组合意义是双指标对照可以判断改进是否以丢音色为代价,原文中 CosyVoice3 在部分说话人相似度上仍有竞争力即属此类对照。

主观与客观结果支持什么,又没赢在哪里?

比较问题是双路是否在同为零样本时同时提升自然度与情感相似度,且不丢音色与可懂度。公平条件是同 21 组强度与 27 类任务、男女声分开、基线为可运行的 CosyVoice2 与 CosyVoice3。指标方向是主观三项越大越好,客观情感相似越大越好、词错误率越小越好。

先看分布一致性对照,它回答映射训练中两项损失各自的作用。

变体原型坍缩分数越小越好方差比越接近 1 越好切片距离越小越好强度排序准确率越大越好
ICE-Mean0.890.650.580.78
ICE-Sample0.730.880.350.86
ICE-Sample 加分布正则0.670.960.220.91

表后解释需要同时写收益与代价。收益是样本级监督与分布正则逐步降低坍缩并改善方差比与排序精度,支持声学接地与多样性保留。代价是该表只评价向量分布,不直接等于语音听感,仍需下表主观结果佐证,且未报告统计显著性方法,不能断言每组都显著。

再看 21 组强度任务的主观结果,它是核心可部署收益。

说话人模型自然度越大越好情感相似度越大越好说话人相似度越大越好
女声CosyVoice24.18 ± 0.093.92 ± 0.144.46 ± 0.10
女声CosyVoice34.15 ± 0.103.98 ± 0.154.47 ± 0.09
女声双路4.28 ± 0.084.25 ± 0.124.52 ± 0.09
男声CosyVoice24.14 ± 0.103.80 ± 0.164.50 ± 0.09
男声CosyVoice34.08 ± 0.113.92 ± 0.154.55 ± 0.08
男声双路4.25 ± 0.094.10 ± 0.134.48 ± 0.10

表后解释要指出未胜出项。双路在男女声的自然度与情感相似度上均为最高,女声情感相似度从约 3.9 提升到 4.25,男声从约 3.8 到 3.9 提升到 4.10。但说话人相似度并非全胜:男声上 CosyVoice3 的 4.55 高于双路的 4.48,说明情感增强未完全转化为音色保持优势。在更难的 27 类任务上原文报告双路增益更大,但消融退化也更明显,提示细粒度任务更依赖双路互补。客观 48 类结果见下,情感对齐最高但可懂度不是最优。

模型情感余弦相似度越大越好词错误率越小越好说话人任务
CosyVoice20.8553.57%男女混合零样本48 类
CosyVoice30.8651.97%男女混合零样本48 类
双路0.8702.59%男女混合零样本48 类
去情感向量只留文本0.8593.29%男女混合零样本48 类
去文本只留情感向量0.8674.86%男女混合零样本48 类

表后解释需区分直接报告与推测。论文直接报告双路情感相似最高为 0.870,CosyVoice3 词错误率最低为 1.97%。这支持双路改善情感可控且保持有竞争力的识别准确率。只留情感向量的变体情感相似仍有 0.867 但词错误率升到 4.86%,支持语义指导对语言稳定的作用,但不能反推拿掉语义必然在所有文本上都恶化。总体趋势不等于每组都成立,原文未给出按情感细分的误差棒,这是适用边界。

拿掉一路会发生什么,推理多花多少时间?

消融的操作是二选一:去掉情感向量只留文本指令,或去掉文本指令只留情感向量,其余管线与零样本条件不变。21 组强度任务上两者都导致自然度与情感相似度下降,27 类任务上下降更显著,说明两路互补而非冗余。客观上只留文本时情感与可懂度双降,只留向量时情感尚可但可懂度大降,提示向量管情感、文本管语言的分离假设得到支持。

失败条件是纯向量在没有语义规划时语言不稳定,这对长句或生僻词可能更明显,但原文未按文本难度分组,这是未评测边界。推理成本方面,论文报告 MiniLM 只需 1 次非自回归前向约 2 毫秒,条件流匹配 25 步欧拉采样约 3 毫秒,相对基线数百毫秒合成延迟,典型语句增加不到 1%,很短语句约 1 到 2%。原文未测量误判率与端到端延迟分布,因此不能承诺延迟在所有设备上都可忽略,训练资源与实际延迟需分别讨论。

哪些结论还不能下,缺了什么验证?

首先缺失证据不是技术错误,但要明确边界。开放式无预设类别的自然语言描述是未来工作,当前 48 状态仍是闭集,遇到集外情感表述时行为待验证。其次听评为专家小样本,每样本 3 人,未报告统计检验与一致性,不能把均值差距直接读成显著。再次客观词错误率最优仍是基线,说明情感增强与可懂度之间存在权衡,未测量不同强度档的分别代价。最后资源状态为未发现可用链接,本次不能确认代码权重可达,复现只能依赖文字描述与超参数,缺引导强度、解码步数与冻结细节。相关性不等于因果,可视化紧凑不能证明合成一定更像,仍需听感与客观对齐共同支持。

要复现应先做什么,先核对哪些数?

复现先做数据与表示。按 49903 基础加 28402 人工核验的划分重建标签,核对 27 类与 21 组强度的总数为 48,留 7600 条评测。先训情感向量抽取器到 896 维,检查强度排序是否单调,再训流映射器:基础集 100 轮、批量 2048、Adam 余弦退火、初始学习率 1 乘 10 的负 4 次方,然后在人工集微调。大语言模型用 Qwen2.5-0.5B 加 LoRA 秩 32,记录可训练参数是否为 9.87M,并补记冻结层与引导系数。合成侧固定条件流匹配与 BigVGAN,零样本下分男女声报告自然度、情感相似度、说话人相似度与情感余弦相似度、词错误率。先复现分布表从 0.89 到 0.67 的下降与排序准确率从 0.78 到 0.91 的上升,再复现 21 组主观增益,最后检查男声说话人相似度上基线更高的反例是否同样出现,以确认评测口径一致。

何时值得尝试这种双路做法?

当任务需要用文字指定强度且没有参考音频时,这种把语义理解与声学控制分开的做法值得尝试。它的可复述动作是先学一个带强度排序的情感向量,再学一个从文字到该向量的映射,合成时双路汇合。若只有粗标签或只关心音色克隆,双路的额外复杂度可能不划算。还需补的验证是集外描述、长文本稳定性与端到端延迟分布。教学上记住一句话:指令决定说什么,向量决定以多强情感说,两者缺一都会在听感或可懂度上付出代价。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总