英文题目:Empathy Omni: Enabling Empathetic Speech Response Generation Through Large Language Models

会议身份:conference:interspeech:2026:conference-paper-id:wang26q_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #多模态学习 #语音 #语音对话系统 #语音合成

评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:模型报告

👥 作者与机构

  • Haoyu Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Guangyan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiale Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Jingyu Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuehai Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yiwen Guo:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为携带韵律与情绪线索的用户语音,输出为语义恰当且韵律共情的文本与语音回复,难点在于相同文本在不同情绪下语义迥异而情感对话数据稀缺昂贵且标注一致性难保证。首先双分支编码器分别抽取语义内容与情感表征并降采样至10Hz融合送入大语言模型,其次大语言模型同步生成回复文本与词元级情绪轨迹作为显式情感规划并以DTW对齐监督,最后语音解码器以门控融合语言信号并经情感自适应调制生成声学词元与波形。相对从数据隐式学习情绪一致的语音大语言模型,该工作将语义生成与韵律控制解耦并允许单句内情绪过渡,从而降低对大规模高质量情感对话的依赖。在1000条情感查询测试集下,Empathy Omni的Speech Emotion MOS为4.23,高于OpenS2S的Speech Emotion MOS 4.11。结论仅适用于6类基本情绪与中英文可控合成主导分布,对细微混合情绪仍易生成语义对但情感平淡的回复。原文未披露训练时长、推理延迟与部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么?

这篇论文研究的输入是一段用户语音查询,其中同时包含语义内容和副语言线索。副语言线索是白话说的说话方式,包括情绪、态度和意图,论文强调同样的词用不同情感说出来含义会根本改变。目标输出是两部分:一是文本回复,二是直接可播放的共情语音回复,要求语音在发音可懂的同时语气与用户情绪匹配。

对刚入门的读者,先建立一个样本走查。假设用户用低落缓慢的语气说出内容,系统不能只转写文字去回答,还要识别出悲伤倾向,生成先安抚再给建议的文本,并让合成语音在整句保持低沉连贯的韵律,而不是用中性播报语气读出安慰词。这就是论文说的从只把回复内容转成语音,进到理解情绪并控制表达。

必须保留的信息是:论文明确不依赖大规模预训练和海量高质量情绪对话,而是用显式情感规划加可控合成数据管道来降低数据与算力需求。输出形态是端到端语音大语言模型,延迟与自然度动机是绕开语音识别到大语言模型再到语音合成的级联。论文文末给了一个匿名演示链接,但本次收到的资源验证状态为未发现可用资源,因此不能写代码、模型或数据当前已公开,只能说论文正文提及该演示地址,是否可达未在本解读中验证。

已有路线为什么还不够?

第一条相关路线是端到端多模态语音交互,例如 Mini-Omni、LLaMA-Omni 和 VocalNet。它们直接从语音查询生成文本与语音回复,省去级联环节。这类工作主要解决通用语义问答与交互延迟,论文把 Empathy Omni 也放在这个双塔结构下,但指出它们对情绪的显式控制不足。

第二条路线是韵律与情绪对话系统。论文提到已有工作开始做共情回复,但多数靠数据隐式学情绪一致性,没有显式的情感规划步骤。这带来两个依赖:一是需要大量标注好的情绪对话,二是需要大规模训练。原文明确说情绪对话数据稀缺且标注贵,这就是要做数据高效与可控方法的动机。

第三条路线是近期的共情语音大语言模型,例如 GLM-4-Voice 与 OpenS2S。论文在实验中把它们作为实际可运行的比较对象,而不是只比类别概念。需要区分的是:类别差异不能当同条件胜负,只有在同一测试集、同一评分流程下的数字才能比较。论文的对照正是按同一 VoiceBench 子集和同一 1,000 条情绪查询集来组织,这为后文结果讨论提供了公平性基础。

论文把困难具体定在哪里?

论文把任务定义为在有限数据和不做大规模预训练的条件下,仍能听懂用户语音中的情绪并生成情绪一致的高质量语音。难点有 3 层。第一层是表示纠缠:如果语义和情感混在一个特征里,模型难以单独控制语气起伏,更难处理一句内的情绪转换。第二层是对齐困难:目标语音的帧级情绪特征很多,但回复文本是词元级,且笑声、叹息和呼吸没有标准音素文本,传统强制对齐器容易失效。第 3 层是数据瓶颈:自然情绪对话少,读式语料语气单一,真实录音多样但噪声大、转写与标注成本高。

举例来说,一个包含先惊讶后安抚的长回复,如果只有句级情绪标签,合成语音只能全句用一种风格,无法前半句提高音调、后半句放缓。论文因此要求做到词元同步的情绪计划,让每个词元都有对应的情绪向量。另一个例子是目标语音中的叹息段没有对应文字,若硬用强制对齐会丢掉该段,而论文希望保留这类段落对整体悲伤感知的贡献,所以改用动态时间规整做软对齐。

整体先走一遍:从语音到语音经过了谁?

按一个样本走完全流程有助于建立依赖顺序。输入语音先并行进入两个冻结的预训练语音编码器,分别得到语义帧序列和情绪帧序列。两者各自经过轻量降采样投影,把帧率降到 10 Hz,再在每帧拼接并投影成统一的语音嵌入序列,送入指令跟随的大语言模型。大语言模型输出回复词元,同时情绪预测头为每个词元输出一个情绪向量,形成词元同步的情绪轨迹。语音解码器以词嵌入、大语言模型隐状态和情绪轨迹为条件,自回归生成离散声学 token,再经 CosyVoice2 的流式声码结构转成梅尔谱与波形。

下图是理解该流程的关键,右侧明确区分了 2 阶段各训练哪些模块,左侧展示了从输入波形到输出波形的主路径与情绪支路的汇合点。建议先看主路径,再看情绪支路在哪里注入。

看图路径: 1. 先从底部输入波形沿语音编码器、降采样适配器到大语言模型的纵向主路径走一遍;2. 再看情绪预测头如何从语言模型隐状态分出一条指向融合模块的情绪支路;3. 对照右侧 Stage 1 与 Stage 2 的冻结与训练图标,确认两阶段各更新哪些模块;4. 放大中间红色虚线框,观察拼接、门控与自适应层归一化三者的连接顺序

原论文 Figure 1:Model Architecture and Training Process.

论文图 1。原论文 Figure 1:“Model Architecture and Training Process.”。

结合像素可见内容解释这张图。左下是输入波形进入语音编码器与降采样适配器,再进入绿色大语言模型模块;绿色圆点序列代表大语言模型隐状态,向上引出 I、can、feel、your 等词元示意。红色情绪预测头从隐状态分出箭头进入红色融合模块,融合模块上方是蓝色语音解码器,再向上是声学 token 方块与黄色流匹配加 HiFi-GAN 模块,最顶部是输出波形与表情示意。中间红色虚线放大框显示拼接、门控系数与自适应层归一化的计算顺序。

右侧 Stage 1 标注情绪预测头、大语言模型低秩适配部分与降采样适配器为训练态,语音编码器为冻结态;Stage 2 则语言模型与适配器转冻结,语音解码器与融合模块为训练态。该图只说明模块连接与分阶段冻结关系,不给出具体数值与曲线。

两个编码器如何把说什么和怎么说分开?

语音编码器部分用两个分支。语义分支是 Whisper large-v3 编码器,白话理解为听清字与发音的分支;情绪分支是 emotion2vec large 模型,白话理解为听出语气与情感的分支。原文说两者原生帧率较高,例如 50 Hz,直接送入大语言模型会导致序列过长与计算开销大。

降采样做法是改编自 SLAM 的帧堆叠多层感知机结构,不用传统卷积层。操作是先截掉余数帧使长度能被降采样率整除,例如降采样率为 5,再把连续 5 帧沿特征维拼接,经过两层线性投影加 ReLU 激活映射到大语言模型隐层尺寸。目标帧率是 10 Hz,论文称这样在提效的同时保留显著韵律动态。关键冻结条件是两个编码器严格冻结,只训练降采样适配器与后续投影参数。每帧的降采样语义向量与情绪向量拼接投影,得到同步的语音嵌入序列,原文称其同时表示说了什么和如何表达。

语义特征 × 情绪特征: 语义特征负责听清说了什么,由 Whisper large-v3 编码器提取语言与音素内容;情绪特征负责听出怎么说的,由 emotion2vec large 模型提取韵律与情感线索。二者搭配的原因是同一句话换一种语气含义会变,只用语义会丢失意图。组合意义是两者下采样到 10 Hz 后拼接投影成同一语音嵌入序列,让大语言模型同时以内容和表达方式为条件做理解与回复。

复述时要注意:冻结意味着编码器参数不更新,梯度只走适配器与投影;同步是指两支在时间上对齐后再拼接,不是各自独立送入大语言模型。论文未报告该适配器在不同降采样率下的对比,因此不能推断 10 Hz 是否最优,只能说原文选择了该工作点。

情绪轨迹如何逐词元给出计划并对齐?

大语言模型骨干是预训练的指令跟随模型,后文训练节给出具体为 Qwen2.5-7B-Instruct。为实现显式情感控制,论文在大语言模型最后一层隐状态上加情绪预测头,把每个生成词元的隐状态映射为 768 维情绪向量,整句即为预测的情绪轨迹。推理时大语言模型同步输出文本词元与其情绪向量,不需要外部预测器或前视。

监督来源是目标回复波形经同一情绪编码器抽出的帧级情绪轨迹。问题是帧数与词元数不一致,且非言语发声无文本可对齐。论文不用强制对齐器,而用动态时间规整计算帧级特征与词元级预测之间的累积对齐代价,距离用平方欧氏距离,递推取三方向最小值。对齐路径确定后,把映射到同一词元的多帧取平均,得到该词元的目标情绪向量。训练目标是多任务损失:下一词元交叉熵加均方误差加余弦损失,后两项约束预测向量与目标在幅度和方向上接近。原文给出损失权重记为 lambda1 与 lambda2,但所给证据片段未列出具体数值,这是缺项,不猜测。

情绪轨迹 × 自适应层归一化: 情绪轨迹是与每个回复词元同步的一串情绪向量,负责给出整句的情感计划,包括句内情绪起伏;自适应层归一化负责把该向量转成每步的缩放和平移去调制语音解码器。二者搭配的原因是把说什么和以什么语气说分开,避免内容与韵律纠缠。组合意义是语言内容保持稳定发音,情感计划独立控制 prosody,从而支持长回复中持续的悲伤或恐惧语气。

动态时间规整 × 词元同步监督: 动态时间规整负责把帧级情绪特征对齐到词元级预测,不要求每帧有音素标注;词元同步监督负责为每个生成词元算出一个平均目标情绪向量并计算损失。二者搭配的原因是笑声、叹息和呼吸等非言语发声对情绪重要但强制对齐器常失效。组合意义是在无强制对齐条件下仍能为每个词元提供可学习的情感目标,使推理时能同步输出文本与情绪向量。

学习依赖是先理解帧对词元的多对一平均,再理解损失分工:交叉熵管文本内容,另两项管情绪向量。原文未给出梯度是否截断情绪编码器的说明,但因编码器冻结,可知监督目标本身不更新,只训练预测侧。

两阶段各训练谁,解码器如何用情绪?

训练分 2 个阶段。第一阶段微调大语言模型骨干以对齐语音与文本,重点是理解语音线索并生成共情回复。实现上用 LoRA,秩为 8,同时训练降采样适配器与情绪预测头。学习率原文明确给出两组:LoRA 参数用 5 乘 10 的负 5 次方,适配器与情绪头用 2 乘 10 的负 4 次方,权重衰减 0.01。第二阶段训练语音解码器。

解码器是有 6 个解码器块、隐层 3584 的因果 Transformer,学习率 2 乘 10 的负 4 次方,权重衰减 0.01。所有训练在 8 张 NVIDIA H20 上进行。

解码器输入在每步有两路对齐的语言信号:词嵌入与大语言模型隐状态,用 sigmoid 门融合。门控系数由两者拼接经线性加偏置再过 sigmoid 得到,融合结果为门控加权和。情绪轨迹经自适应层归一化注入,由情绪向量生成每步的缩放与平移去调制归一化表示,原文强调这是内容与情感解耦控制。训练时先用目标语音抽出的真实情绪特征为条件,再按线性计划从混合概率 0 到 1 逐渐混入预测情绪向量,以缓解训练测试不一致。声学侧采用 CosyVoice2 的离散声学分词器与块感知因果流匹配模型支持流式合成,每 W 个声学 token 成块以平衡延迟与质量,再经 HiFi-GAN 声码器转波形。原文未报告 W 的具体取值与块延迟测量,这是缺项。

门控融合 × 语音解码器: 门控融合负责用 sigmoid 门加权合并词嵌入的词汇精确性和大语言模型隐状态的上下文语义;语音解码器负责据此自回归预测 CosyVoice2 声学 token。搭配原因是只用一侧信号时发音或长程连贯易受损。组合意义是融合后的语言表示再经情绪轨迹调制后送入解码器,使可懂度与情感表达同时保留。

可控语音合成 × 情绪一致性过滤: 可控语音合成负责按 GPT-4o 写的对话文本和情绪指令用 CosyVoice2 生成多说话人语音,解决情绪对话稀缺问题;情绪一致性过滤负责用语音识别词错率和语音情绪识别剔除听不清或情绪不对的样本。搭配原因是合成量大但质量参差,直接训练会引入噪声。组合意义是只保留可懂且情绪标签与语音判断一致的样本,再混入真实录音提升声学多样性。

需要明确:第一阶段语音编码器冻结,第二阶段大语言模型与适配器按图示转冻结,主训练对象是语音解码器与融合模块。情绪预测头在第二阶段图示为冻结,但正文又说逐步混入预测向量,这里混入是指作为条件输入,不等于更新预测头参数,复述时不要混淆条件与训练对象。

数据如何构造,测什么条件?

训练与评估用 VoiceAssistant-400k 与自建的 EmotionalQA-200k。EmotionalQA 覆盖 20 个领域与 6 类基本情绪:高兴、愤怒、恐惧、悲伤、厌恶和惊讶,由合成与真实录音三策略组成。策略一是端到端合成:GPT-4o 生成跨领域与情绪的对话文本对,情绪标签扩展为描述性指令引导 CosyVoice2 可控合成,再经语音识别词错率可懂度过滤与语音情绪识别一致性过滤,贡献约 135,000 条,占 67.5%。

策略二是基于 ESD 改写合成:用 17,500 条朗读式句子做种子,GPT-4o 改写为口语化用户查询并生成共情回复,两侧都按情绪指令合成,随机采样参考说话人嵌入增强多样性,经同样两道过滤后保留约 15,000 条,占 7.5%。策略三是从公开情绪语音与影视对白收集真实录音,经语音活动检测切分、语音分离降噪、语音识别转写与语音文本双侧情绪标注一致性过滤,得到约 50,000 条,占 25%,声学更自然、情绪动态更丰富。

通用问答评估用 VoiceBench 的 AlpacaEval、CommonEval、WildVoice、IFEval 与 SD-QA 子集,语音自然度用 UTMOS。共情评估自建 1000 条情绪查询测试集,覆盖多场景与 6 类情绪,模型同时产生文本与语音回复。可懂度用 Whisper-large-v3 转写语音再与模型文本输出算词错率,原文提醒该指标依赖识别器,不能完全代表人听可懂度。情绪用 GPT-4o 盲评 1 到 5 分,输入含用户查询、目标情绪标签、语音转写与外部情绪识别结果,不告知模型身份,固定提示词与温度 0。另有 40 名母语者盲听,按整体自然度与情感表现力打 1 到 5 分的语音情绪平均意见分,给出均值与 95% 置信区间。

比较对象包括 Qwen2-Audio、GLM-4-Voice、Ichigo、LLaMA-Omni、VITA-1.0、Moshi,以及有显式共情能力的 OpenS2S。硬件与优化器条件见上一节,解码温度等推理超参数除情绪评分固定温度 0 外未系统报告。

通用能力是否被情绪建模拖累?

比较问题是:加入显式情感建模后,通用语音理解与指令跟随是否明显下降,语音质量是否提升。公平条件是同一 VoiceBench 子集与同一 UTMOS 流程,指标方向均为越高越好。论文报告 Empathy Omni 在 CommonEval 与 IFEval 最优,Alpaca 与 WildVoice 接近最优,UTMOS 最高。表后解释是门控融合稳定发音与长程连贯,词元同步情绪轨迹经自适应层归一化控制韵律而不破坏语言内容,减少不自然音高与节奏伪影。代价是 Alpaca 与 WildVoice 未拿第一,说明情绪分支没有带来通用问答的全面领先,只是未明显拖累。

下表只整理全文连续原句中实际出现的数字,不把仅在原表矩阵中的裸值抄入。需要特别标注一个冲突:正文句子写 WildVoice 为 3.13,而原表矩阵对应格为 3.19,两处不一致,解读时以原句为准并标注该冲突,未自行取舍。

系统AlpacaEval 分数CommonEval 分数IFEval 分数UTMOS 分数
Empathy Omni3.843.4727.894.41
GLM-4-Voice3.97原文连续句未报告原文连续句未报告原文连续句未报告
LLaMA-Omni原文连续句未报告原文连续句未报告原文连续句未报告3.98
WildVoice 对照3.133.18未评测边界未评测边界

上表显示的主要收益是通用指令约束满足与语音质量同时报告最优,具体代价是 Alpaca 上 3.84 低于 GLM-4-Voice 的 3.97,WildVoice 句子值 3.13 低于对照 3.18。未胜出项是 GLM-4-Voice 的 Alpaca 与 WildVoice 更高,LLaMA-Omni 在 SD-QA 等子集的数值因无连续原句支撑未列入本表,不能据此断言该子集胜负。总体判断用支持而非证明:结果支持引入显式情感建模未大幅牺牲通用能力,但总体趋势不等于每组都成立。

共情回复的情绪与可懂度谁更好?

比较问题是:在 1000 条情绪查询上,谁的回复更承认用户情绪、立场更恰当且语义与情绪一致,同时发音更稳定。公平条件是同一查询集、同一转写器算词错率、同一 GPT-4o 盲评流程与同一盲听随机顺序,指标方向为情绪分越高越好、词错率越低越好。论文报告 Empathy Omni 在情绪 GPT 分、语音情绪平均意见分最高,词错率最低。表后机制解释是显式预测词元同步情绪轨迹改善情绪一致性与表现力,解码器条件设计保留可懂度。定性观察称对需持续韵律塑造的悲伤与恐惧尤其有效,失败多在细微或混合情绪,语义合适但语音情绪偏通用。

系统Emotion GPT Score 分数Speech Emotion MOS 分数ASR-WER适用条件
Empathy Omni 完整模型3.974.235.61需持续韵律的悲伤恐惧更有效
消融去掉融合模块3.153.856.42情绪更平、发音稳定性下降
OpenS2S3.374.115.99有显式共情能力的对照
未胜出对照2.43 以下组存在3.42 以下组存在更高无显式共情组整体偏低

上表的主要收益是情绪分与听感分同时领先且词错率更低,具体代价与反例是细微混合情绪仍可能生成情绪通用语音,且自动词错率不等于人听可懂度。未胜出项包括 GLM-4-Voice、Ichigo、VITA-1.0、Moshi 与 LLaMA-Omni 在该测试上低于完整模型,其中无显式共情组分数更低。需要区分直接报告与推测:领先是论文直接报告,归因于情绪轨迹是有限解释,未来更细粒度强度控制是待验证方向。

去掉融合模块会发生什么?

消融问题是验证融合词嵌入、大语言模型隐状态与情绪轨迹的模块是否必要。条件是同一情绪查询集与同一三指标,比较完整模型与去掉融合模块的变体。论文报告去掉后情绪 GPT 分从 3.97 降到 3.15,语音情绪平均意见分从 4.23 降到 3.85,词错率从 5.61 升到 6.42。主观检查称去掉词嵌入易出现发音与节奏问题,去掉情绪轨迹则即使文本显共情语音仍偏平。

该消融支持融合设计对同时保证可懂与情感表达是关键,但不能外推为拿掉任一子部件必然同等下降,因为论文只报告整体去掉融合模块的数字,未分别给出只去门控、只去自适应层归一化的独立数字。训练与部署成本方面,论文未报告参数量增量、推理延迟与实时率,因此不能承诺该模块无额外开销。复现时应先按完整模型跑通,再做整体消融,不自行补做无源的子模块数值。

哪些边界尚未验证?

第一是情绪粒度边界。论文结论明确说处理细微情绪仍有挑战,模型有时优先语义内容而弱化情绪线索,失败案例集中在微妙或混合情绪。这意味着高兴、悲伤等 6 类基本情绪的结论不能推广到讽刺、愧疚等复杂社会情绪。第二是数据与评估边界。合成数据依赖语音识别与情绪识别过滤,过滤阈值与两类过滤各自剔除比例未在证据片段中给出。

真实录音来自公开语料与影视对白,其授权与说话人重叠情况未交代,不能自行假设无泄漏。第三是指标边界。词错率依赖特定识别器,情绪 GPT 分依赖特定大模型评委与固定提示词,40 人听感分的语种、耳机与环境条件未详述,跨语言与跨评委的稳定性待验证。第四是成本边界。训练只给出 8 卡 H20 与学习率,未给出总时长、显存占用、推理帧率与首包延迟,实际延迟需单独测量。

总体上,缺失证据不是技术错误,但在未测量误判率与延迟前,不承诺这些量得到改善。

要复现应先准备什么?

先按学习依赖准备 3 类材料。数据侧先复刻 EmotionalQA 构造:用 GPT-4o 按 20 领域乘 6 情绪写对话文本,把情绪标签扩展为描述性合成指令,用 CosyVoice2 生成语音,再做语音识别可懂度过滤与情绪一致性过滤;另用 ESD 的 1.75 10,000 种子改写口语化查询并同样合成过滤;真实录音需做语音活动检测、分离降噪、转写与双侧情绪一致性过滤。注意保留过滤阈值与保留率,否则无法复现约 13.5 万、1.5 万与 5 万的配比。

模型侧用 Qwen2.5-7B-Instruct 做骨干,Whisper large-v3 与 emotion2vec large 做冻结编码器,降采样到 10 Hz,情绪头输出 768 维,解码器 6 块隐层 3584。先跑第一阶段 LoRA 微调与情绪轨迹动态时间规整监督,再跑第二阶段语音解码器训练并按 0 到 1 线性混入预测情绪。评估侧固定情绪 GPT 评分为温度 0 与同一提示词,用同一识别器算词错率,盲听随机顺序。何时值得尝试:如果已有语音大语言模型基线且用户查询情绪变化大、长回复韵律连贯性差,可尝试加入词元同步情绪轨迹;如果只有中性朗读数据,应先补合成加过滤管道。

还需补的验证是细粒度情绪强度控制、子模块独立消融与延迟测量。资源状态上,本次未发现完成验证的开源声明,不得把演示链接当作代码或权重已公开。

这篇工作留下了什么判断?

回到中心矛盾:有限数据下既要听懂情绪又要说出有情绪的高质量语音。论文的选择是用显式计划代替隐式从数据中学习情绪一致性,用双编码器解耦说什么与怎么说,用动态时间规整解决无文本段落的对齐,用门控加自适应层归一化把计划注入合成,用合成加过滤加真实录音解决数据稀缺。最强证据是通用能力未明显下降的同时,情绪 GPT 分 3.97、语音情绪平均意见分 4.23 与词错率 5.61 均报告最优,且去掉融合后三指标同步变差。

主要代价是细微混合情绪仍偏通用,以及过滤阈值、推理开销与跨场景稳定性尚未充分报告。对研究生而言,可复述的方法链是输入语音到双特征到降采样拼接,到大语言模型加逐词元情绪向量,到门控融合加情绪调制解码,到声码器波形;可核对的点是冻结关系、学习率、配比与三指标方向。下一步值得做的是更细的情感强度表示与独立子模块验证,而不是直接把总体趋势当作每句都成立。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总