英文题目:CE-CoT: A Contrastive Empathetic Chain-of-Thought Training Strategy for Improving Emotion Consensus in Empathetic Speech LLMs
会议身份:
conference:interspeech:2026:conference-paper-id:chen26o_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#对比学习 #语音大模型 #后训练 #语音 #语音对话系统
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jing-Han Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Ya-Tse Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Bo-Hao Su:机构信息未能从会议 PDF 纯文本可靠映射
- Xin-Yu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Krishna Somandepalli:机构信息未能从会议 PDF 纯文本可靠映射
- Chi-Chun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
共情语音交互要求输入语音的说话人情绪与智能体回复情绪方向一致,难点在于语音大模型常能正确做语音情绪识别却生成情绪错位的回复。作者提出对比式共情思维链(Contrastive Empathetic Chain-of-Thought,CE-CoT),将单条回复拆为情绪标签(Emotion,e)、忽略情绪的中性回复(Neutral Response,rneu)与融合第一人称情绪反应和探索性追问的修正回复(Revised Response,rrev)三段,先由文本大模型Qwen-7B-Chat基于转录文本与真实情绪标签生成教师目标,再让语音大模型在语音输入加相同提示下复现该推理结构,从而保持训练与推理行为一致。相比直接模仿回复的常规行为对齐,该结构用同一输入下的中性与修正构成隐式对比,迫使模型学习修正方向。在MSP-Podcast评测任务下,BLSP-Emo经CE-CoT对齐相对常规对齐版本的情感共识得分提升为19.1%,高于相对预训练版本的情感共识得分提升18.8%。该提升源于语音模型以KL散度拟合教师三段式推理而非仅拟合表层文本,使情绪识别、中性生成与共情修正形成可控链条。该结论适用边界受限于单轮四类情绪与Gemini Flash 2.0自动裁判,尚未验证多轮对话与更细腻共情策略。原文未披露训练、推理或部署成本
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪一个失败?
本文的输入是用户说的一段语音,目标是让语音大模型回一句共情的话。初学者容易以为只要把语音转成文字再让大语言模型回话就行,但语音里还有语气、停顿和能量等声学线索,文字转写会丢掉这些信息。更关键的是评价维度不同:以往常用语音情绪识别准确率看模型是否认对情绪,用情绪反应看回话是否积极投入,用探索看是否会追问以深入交流,这些都不保证方向正确。
论文举的例子是用户很生气,模型确实识别出生气,识别这一步算对,但回了一句很高兴的话,这就是方向错了。方向错了会让用户困惑、降低信任,严重时还可能加重情绪困扰。 论文因此把情绪一致性单独拿出来作为研究对象。白话说,情绪一致性就是回话情绪与说话人情绪是否同向;英文名是情绪共识,缩写为 EC。
它的计算方式在后文实验条件里交代,这里先记住结论:认对不等于回对。本文的目标就是提高回对方向的比例,而不是只提高识别准确率或回话热情感。
语音情绪识别 × 情绪一致性: 语音情绪识别负责判断说话人当前是高兴、生气、悲伤还是中性,情绪一致性负责判断智能体回话所表达的情绪是否与说话人状态同向;两者搭配的原因是前者只管看懂,后者才管回应对不对方向,组合意义在于把认对但回错这类失败显式度量为共情失准,而不是计入识别正确。
本解读默认只用论文原文证据写作,不引入外部评价。资源状态方面,本次没有发现来源绑定且完成安全验证的代码、模型或数据资源,因此不能声称代码、模型或数据已公开,复现部分只能讲论文写明的步骤与缺项。
背景补充:为什么语音比文字更需要显式方向控制?
文字共情可以直接在提示里写情绪标签,相当于开卷考试;语音共情必须先听再回,相当于先听写再答题。听写这一步受口音、噪声、说话风格影响,错一点就可能带偏整句。论文强调语音大模型不能依赖显式标签加提示设计,必须从声学信号推断情绪,这是不确定性的来源。 显式方向控制的含义是让模型在生成时走完可检查的步骤,而不是把情绪藏在隐向量里。
若只优化最终文字相似度,模型可能学会漂亮的安慰套话,但套话的方向未必对。CE-CoT 把中性套话与对齐改写并置,就是为了让方向在监督信号里显形。 这也解释了为什么通用大模型情绪一致性低:通用训练优化的是问答正确与流畅,不是共情方向。没有针对方向的监督与提示,流畅的错方向回答反而更容易出现。
已有路线在同输入同目标下做到哪里,还缺什么?
第一条路线是文本共情与情绪共识研究。输入是文字对话,目标是生成情绪对齐的回话,监督多来自人工标注或配对数据。论文引用的情绪共识概念来自这类工作,其作用是把回话情绪与说话人情绪是否匹配算成匹配率。这条路线的好处是有明确的提示设计可以依赖显式情绪标签,但缺点是不能直接搬到语音,因为语音大模型必须先从声学信号推断情绪,多了一层不确定性。 第二条路线是共情语音大模型。
代表是 BLSP-Emo 和 RE-LLM。BLSP-Emo 的做法是做行为对齐,让语音模型模仿期望回话;RE-LLM 的做法是进一步融入情绪细微差别。它们的输入是语音加提示,目标是生成共情回话,运行阶段都是推理时直接由语音生成。这类模型在论文的预训练对照中相对通用语音模型情绪一致性更高,说明共情能力不是通用大模型自然涌现的,需要专门设计或适配。
第 3 条路线是通用语音与通用大模型。包括 Qwen2Audio、Qwen-7B-Chat 文本骨干和作为商用对照的 Gemini 2.5 Pro。它们的输入可以是语音或文字,目标是通用理解与问答,没有专门为共情方向做训练。论文报告这类模型在多数数据集上情绪一致性低于 0.5,支持了通用能力不等于共情方向正确的判断。
3 条路线在同输入、同目标、同监督上的对照点是:都测情绪一致性这个方向指标,都在推理阶段由语音或文字生成回话,但监督来源不同,文本路线可用显式标签,语音路线只能用转写加标签生成的期望回答做间接监督。本文的增量正在于不改模型结构,只改训练与推理都使用的提示结构,让语音模型显式走完对照推理。
为什么认对情绪后还会回错方向?
沿一个样本走一遍更容易看清问题。假设用户说周末去露营,语气是高兴的。理想流程是先从语音听出高兴,再回一句同样高兴并追问露营细节的话。但实际模型可能在第一步识别对了,第二步生成时却被通用问答习惯带偏,回了一句很抱歉、听起来很难过的话。论文的案例正是这种情况:面对高兴的露营转写,预训练与普通对齐版本都回了悲伤口吻,只有带 CE-CoT 的版本回了高兴口吻。
这个问题之所以在语音里更突出,是因为文本大模型可以直接在提示里写明用户情绪是高兴,而语音大模型要自己从波形里听出来。听错、听不准或听对了但生成时没用上,都会导致方向错。普通行为对齐只要求模仿最终回话文字,没有要求模型把中性写法和对齐写法分开,也就没有显式告诉模型哪一部分是错方向。 因此论文把问题定义为缺乏显式方向控制。
解决思路不是加更大的声学编码器,而是把 1 次生成拆成可检查的 3 步,让错误方向在训练目标里可见。这是后文两步训练范式的前提。
CE-CoT 两步范式先做什么后做什么?
CE-CoT 的中文可读名是对比式共情思维链训练策略。它的全景分两步。第一步是对比式共情回答生成,属于预处理:用文本大模型根据转写文本和真值情绪标签造出期望回答。第二步是带 CE-CoT 的行为对齐:用第一步造出的数据去微调语音大模型,输入换成真实语音加同样的提示,但不再给真值情绪标签。训练与推理用同一套提示,保持行为一致。
下面这张图是理解全文的关键,它把两步、提示内容和裁判任务画在同一张图里。读图时先看主路径,再看提示框,最后看裁判框,不要把裁判框当成训练目标。
看图路径: 1. 先看左侧面板上半部分文本大模型如何由提示加转写文本生成期望的三段式回答;2. 再看左侧面板下半部分语音大模型如何由同一提示加语音输入生成预测的三段式回答;3. 对照右侧上面提示框中识别情绪、写中性回答、再改写的三句指令顺序;4. 最后看右侧下面裁判提示框中要求判定的四类情绪与给出理由加证据片段的任务
论文图 1。原论文 Figure 2:“The training paradigm of our proposed method contains two steps.”。
从像素可见,左上面板标出第一步由 CE-CoT 提示加转写文本经过文本大模型得到期望回答,期望回答里并排画出情绪标签、中性回答与改写回答 3 个色块;左下面板标出第二步由同一 CE-CoT 提示加语音输入经过语音大模型得到预测回答,再与期望回答算散度损失;右上面板写出先识别情绪、再写中性回答、最后用第一人称补情绪反应并加一个探索式提问的指令;右下面板写出裁判任务,要求从中性、高兴、悲伤、生气 4 类中判回话主要回应的情绪并给出理由与证据片段。这个闭环说明训练学的是推理结构,而评价测的是最终改写回答的方向。
三段式回答里每个部分算什么,负例正例如何构成?
每个样本的思维链回答包含 3 个部分。第一部分是显式情绪标签,白话就是模型先说出它认为用户是什么情绪,用于建立上下文。第二部分是中性回答,白话就是故意忽略情绪线索写一条平淡的回答,作为非共情基线。第三部分是改写后的共情回答,白话就是在中性回答基础上改写,明确用第一人称表达回应者的情绪反应,并加一个关于用户感受或经历的探索式问题。
中性回答 × 情绪对齐改写: 中性回答的分工是故意忽略情绪线索给出一条无共情基线,情绪对齐改写的分工是在此基础上用第一人称补情绪反应并追加一个探索式提问;搭配理由是同一输入下同时给出负例与正例形成隐式对照,组合意义是让模型在训练中学会远离中性写法、靠近对齐写法,而不是只模仿表面文字。
论文把中性回答记为负例,把改写回答记为正例,构成隐式对照结构。训练时优化目标是让模型生成更靠近正例、远离负例。需要注意原文没有给出显式的对照损失公式,只写了用散度损失去对齐整个 3 段式序列,因此不能把隐式对照理解成加了一项负采样损失,它是通过同时监督中性与改写两段文字,让模型在相同条件下学会区分两种行为。
情绪反应 × 探索: 情绪反应的分工是表达回应者自身的共情卷入,探索的分工是通过追问引导用户讲出感受或经历;两者搭配的原因是共情质量既要接住当下情绪又要推进深入互动,组合意义是改写步骤同时瞄准这两个维度,避免只安慰一句却不继续倾听。
举例说,如果用户高兴地讲露营,中性回答可能是平铺直叙地复述露营这件事,改写回答则会先表达我也很为你高兴,再追问露营里最开心的是哪一段。前者不算错事实,但缺方向;后者才算方向对且愿意深聊。评价时只取改写回答做情绪一致性判定,中性回答不直接参评。
组件再走一遍:从语音到最终回话的执行顺序是什么?
执行顺序固定为 3 步。第一步识别用户情绪,建立上下文;第二步写中性回答,忽略情绪线索;第 3 步改写,补第一人称情绪反应并加一个探索式问题。推理时语音大模型同样走这 3 步,输出同样是 3 段,但评价只看第 3 段。
对初学者来说,可以把这 3 步记成审题、写 baseline、再改写。审题决定方向,baseline 提供对照,改写负责共情质量。3 步共用同一输入条件,保证对照公平:同一句话的中性版与共情版放在一起,模型才能学到差别不在事实而在情绪表达与追问。 实现上论文用词拼接把提示词与语音编码拼在一起再解码,没有改编码器结构。预测序列与期望序列的对齐发生在词级别,学的是结构与内容一起对齐,而不仅是最终一句话的相似。
监督从哪里来,参数如何更新,哪些细节未报告?
第一步的监督来源是文本大模型。论文把语音的转写文本、CE-CoT 提示和真值情绪标签拼在一起喂给 Qwen-7B-Chat,与 BLSP-Emo 和 RE-LLM 的配置保持一致,让它为每个训练样本生成包含情绪标签、中性回答与改写回答的期望回答。这样每个语音转写对都有自己的对齐目标,且同一输入下同时有中性和对齐两种写法。
普通行为对齐 × 带 CE-CoT 的行为对齐: 普通行为对齐的分工是让语音大模型直接模仿文本大模型生成的期望回答,带 CE-CoT 的行为对齐的分工是让模型模仿包含情绪标签加中性回答加改写回答的 3 段式推理结构;搭配比较的原因是两者监督来源相同但提示与目标结构不同,组合意义在于分离出结构化对照推理带来的增益,而不是模型变大带来的增益。
第二步把语音输入和同样的 CE-CoT 提示拼在一起喂给语音大模型,模型在没有真值标签的情况下生成预测的 3 段式回答,再与第一步的期望回答做对齐。原文明确写对齐用最小化散度损失实现,公式含义是让预测序列在每个位置上的词分布靠近期望序列,而不是只比表面文字相似度。论文称所有骨干都严格沿用原始实现而不改结构,用于公平比较。 未报告的缺项要如实指出。
原文没有说明冻结哪些参数、更新哪些参数,没有给出学习率、批量大小、训练轮数与硬件预算,也没有说明散度损失之外的梯度路径细节。复现时只能先按论文说的做:第一步用同一文本骨干与同一提示生成期望数据,第二步用同一提示加语音微调并保持训练推理提示一致,具体优化器设置需要补做实验记录,不能从模型名字推定实现。
训练与推理一致性为什么重要?
一致性的含义是训练时用的 CE-CoT 提示在推理时原样使用。若训练用 3 段式、推理只让模型回一句话,模型就没有机会展示学到的对照结构,方向控制也会失效。论文在两步都用同一提示,就是为了让部署时的行为与训练时的行为一致。 另一个一致性是监督来源一致。普通对齐与带 CE-CoT 对齐都用同一文本骨干生成期望回答,区别只在提示与结构,因此增益更可能来自结构而非数据来源变化。
这是论文公平比较的设计意图。 复现时要保留这种一致,不要在推理时去掉中性段以省长度。若担心长度与延迟,应单独记录输出长度与延迟并做权衡实验,而不是直接改掉结构,因为原文没有测量这些量,任何省长度的改动都需要重新验证方向是否还保得住。
在哪些数据、哪些模型和什么裁判下比较,指标方向是什么?
数据覆盖 4 套。IEMOCAP 用 4 个主要情绪的 5531 条话语,1 至 4 会话训练、第 5 会话测试,并带有维度标注;ESD 用英文子集的 4 个情绪,训练测试按 7 比 3 划分且情绪均衡,效价唤醒标签由预训练语音模型生成伪标签;MSP-Podcast 是从播客来的自然情绪语料,论文为与 IEMOCAP 可比抽样 4290 条训练与 1245 条测试,保持原始划分;MESC 来自电视剧的情感支持对话,只保留求助者话语并过滤到 4 个主要情绪,训练 9320 条、测试 1206 条,同样用伪标签补维度特征。
4 套都统一到高兴、生气、悲伤、中性 4 个情绪,便于跨库比较。 模型分两组。预训练无行为对齐组包括 Qwen-7B-Chat 文本骨干、不微调的 BLSP-Emo、RE-LLM、Qwen2Audio 和 Gemini 2.5 Pro,用于看内在共情能力。普通行为对齐组是对 BLSP-Emo、RE-LLM 和 Qwen2Audio 按各自原有提示方案生成期望回答再训练,用于隔离方法影响。带 CE-CoT 组是在同样骨干上把提示与目标换成 3 段式结构再训练。
文本期望生成统一用 Qwen-7B-Chat,情绪一致性裁判统一用 Gemini Flash 2.0。
情绪一致性分数 × 大模型裁判: 情绪一致性分数的分工是给出是否同向的二值判定,大模型裁判的分工是从回话文字中推断其主要回应的情绪并与真值比较;搭配原因是人工逐条判情绪成本高而需要自动可复现的度量,组合意义是把主观共情对齐转化为可在 4 个数据集上统一计算的匹配率,但也引入裁判自身误判的风险。
指标方面,情绪一致性是二值匹配率,真值与裁判推断一致记 1 否则记 0,再算均值与标准差,越高越好。显著性用 McNemar 检验做配对比较,并只在真值为高兴、生气、悲伤的样本上做敏感比较,因为中性误判对共情伤害相对小。情绪反应与探索沿用已有打分,越高越好,但在条件评估中若情绪一致性为 0 则把这两项置零,用于看错方向是否抵消了高共情分。
情绪一致性提高了多少,在哪里最明显?
先看总体问题:带 CE-CoT 的行为对齐是否在条件一致时高于普通行为对齐。论文报告在 3 个语音骨干上几乎所有数据集都有统计显著提升。预训练通用模型多数情绪一致性低于 0.5,而专门为共情设计的未微调 BLSP-Emo 在 IEMOCAP 和 ESD 上相对更高,支持共情方向需要专门设计而非通用能力自然涌现。普通行为对齐带来小幅但不稳定的提升,带 CE-CoT 则更稳定更强。 下表整理 BLSP-Emo 这条主线的提升幅度,比较对象同时保留相对预训练版本与相对普通对齐版本,避免只挑有利基线。
指标方向都是越高越好,显著性在原文主表用星号标出。
| 条件 | 指标 | 相对预训练基线增益 | 相对普通对齐增益 | 比较对象 |
|---|---|---|---|---|
| IEMOCAP | 情绪一致性 | 6.8% | 6.8% | BLSP-Emo |
| ESD | 情绪一致性 | 17.9% | 9.6% | BLSP-Emo |
| MSP-Podcast | 情绪一致性 | 18.8% | 19.1% | BLSP-Emo |
| MESC | 情绪一致性 | 35.2% | 19.3% | BLSP-Emo |
表前已说明比较问题是同一骨干下结构化对照是否带来额外增益,公平条件是骨干与数据划分不变,只换提示与目标结构。表后解释是:自然播客与情感支持对话上的增益更大,说明在情绪更自然、上下文更难的数据上显式方向控制更有用。
代价是 ESD 上普通对齐本来已高达 0.973 附近,继续提升空间小,后文第二张表会显示 RE-LLM 在该库甚至略有回落,不能把总体趋势理解为每库必胜。 第二张表看另外两个骨干与条件评估的代价,用于检查方法是否只对某一个模型有效。
| 条件 | 指标 | 本方法关键数字 | 普通对齐参照 | 比较对象 |
|---|---|---|---|---|
| MSP-Podcast | 情绪一致性增益 | 29.6% | 普通对齐基线 | RE-LLM |
| MESC | 情绪一致性增益 | 12.8% | 普通对齐基线 | RE-LLM |
| MSP-Podcast | 情绪一致性增益 | 18.7% | 普通对齐基线 | Qwen2Audio |
| MESC | 情绪一致性增益 | 22.7% | 普通对齐基线 | Qwen2Audio |
| 全条件评估 | 情绪反应衰减率 | 26.3% | 超过一半 | RE-LLM 带 CE-CoT 相对普通对齐 |
表后解释是:RE-LLM 与无专门共情训练的 Qwen2Audio 同样获益,其中 Qwen2Audio 在所有数据集上都是带 CE-CoT 最高,支持无共情专用训练的模型更需要对照推理;未胜出项是 RE-LLM 在 ESD 上普通对齐已达 0.973,带 CE-CoT 略有下降,说明接近天花板时结构化改写可能引入波动。
条件评估的衰减率更小意味着更少的高分回话因方向错被置零,这是方向正确带来的实际共情收益。
高共情分在方向错时会发生什么,案例说明什么?
这一节回答一个反证问题:如果情绪反应与探索本来打分很高,但方向错了,实际共情效果还剩多少。论文的做法是条件评估:情绪一致性为 0 的样本,其情绪反应与探索直接置零,再看均值掉多少。结果是普通对齐的 RE-LLM 原始情绪反应与探索最高,但条件平均反而低于预训练 BLSP-Emo;带 CE-CoT 的 BLSP-Emo 与 RE-LLM 在条件平均上都高于普通对齐与预训练版本,且衰减率大约只有普通对齐的一半。这支持了强烈但错方向的共情会降低实际效果,而提高方向正确能保住共情分。
案例用高兴的露营话语验证了这一点。预训练与普通对齐版本都回了悲伤口吻,虽然追问句式完整、情绪反应字数不少,但方向错了,裁判给 0 分。带 CE-CoT 版本正确回了高兴口吻并追问露营细节,裁判给 1 分。教学例子表明,不能只看回话长度或追问数量,必须先看方向。 论文还提到带 CE-CoT 的回话没有直说高兴这个词,而是从上下文表达理解,裁判仍能判对。
这显示裁判有一定灵活性,但也正因如此,裁判框架还需要进一步验证,不能把自动匹配率直接当成人工感受。
哪些边界没有测,不能承诺什么?
第一,未分析内部推理与语音情绪识别、推理痕迹、最终回话之间的链路。模型是先认对再回对,还是认错了但蒙对了回话,本文没有拆开验证,因此不能把增益归因到某一步。 第二,情绪一致性只用了一种实现,即大模型裁判在 4 个情绪里选一个主要情绪。没有比较其他度量,也没有报告裁判自身的误判率,因此不能承诺该分数等于人工感知的共情好坏。 第三,实验只限单轮。
真实情感支持往往是多轮,情绪会转移,策略也要调整,本文没有验证多轮交互与更细的情绪策略维度。 第四,成本缺项。原文没有报告训练资源、推理开销、输出速度与实际延迟,因此不能承诺该方法在延迟或成本上更优。总体趋势不等于每组每步都成立,ESD 天花板附近的波动就是提醒。
要复述方法先做什么,需要补哪项验证?
先准备数据与划分。按原文用 IEMOCAP 第 5 会话做测试、其余训练,ESD 只用英文子集并保持情绪均衡与 7 比 3 划分,MSP-Podcast 保持原始划分并按原文抽样量,MESC 只保留求助者话语并按原始划分。4 个情绪统一为中性、高兴、生气、悲伤,伪标签部分按原文用同一类预训练语音模型生成,但要记录伪标签噪声。 再做两步流程。第一步用 Qwen-7B-Chat 加 CE-CoT 提示、转写文本与真值标签生成期望 3 段式数据。
第二步用同一提示加真实语音微调 BLSP-Emo、RE-LLM 或 Qwen2Audio,不给真值标签,损失按原文用散度对齐整个序列。骨干严格沿用原始实现不改结构。评价时只取改写回答,用 Gemini Flash 2.0 按四分类提示判方向并算匹配率,再用 McNemar 检验在非中性样本上比普通对齐。 还需补的验证是裁判一致性、人工抽检、多轮扩展与开销记录。由于本次没有可用资源绑定,不能写代码已公开或权重可下载,只能说按上述信息条件重走流程,超参数与冻结策略需自行补记。
何时值得尝试,何时要谨慎?
当任务是语音输入的单轮共情回话,且已有可用的转写与情绪标签能造期望数据时,值得尝试 CE-CoT。它的改动小,不改模型结构,只改提示与目标结构,适合在已有语音大模型上做行为对齐。尤其在自然播客与情感支持这类情绪表达更真实的数据上,论文显示增益更大。 当数据已接近天花板、或任务是多轮支持、或需要严格人工共情评价时要谨慎。接近天花板时额外结构可能带来波动,多轮时单轮的方向定义不够用,自动裁判也不能替代人工判断。
常见误解是把中性回答当成无用输出。实际上它是训练时的负例,用于让模型看见错方向长什么样;评价时不直接用它,但没有它,对照就立不起来。另一个误解是把高情绪反应分当成共情好,条件评估恰恰说明方向错会让高分失效。记住先对方向,再谈热情与追问,这就是本文最可带走的一句话。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
