英文题目:ES4R: Speech Encoding Based on Prepositive Affective Modeling for Empathetic Response Generation
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.1708
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#注意力机制 #大语言模型 #语音 #语音对话系统 #语音合成
评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Zhuoyue Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaohui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaocui Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Wen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Daling Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shi Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Yifei Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
共情回复生成(Empathetic Response Generation,ERG)需从多轮语音对话历史同时恢复语义与韵律情感,并生成文本与语音共情回复,难点在于级联转写丢失副语言信息,而通用编码器早压缩加编码后浅拼接又弱化情感。ES4R(Empathetic Speech for Response)先对每轮声谱下采样后做轮内多头自注意力(Intra-Turn Attention)以凸显情感片段并按时序拼接为对话序列,再经轮间多头自注意力(Inter-Turn Attention)建模情感动态后送入冻结的 Whisper-large-v3 编码器与卷积适配器,得到语音侧表示,随后以语音为查询对文本历史做跨模态注意力融合,驱动 Qwen3-8B 生成回复。合成侧仅用能量轨迹选择振奋安抚中性策略并逆能量加权融合风格向量,经 StyleTTS2 输出语音。与已有级联与隐式编码方案不同,该框架把结构化情感上下文显式置于编码之前而非依赖编码器隐式学习。在 AvaMERG 测试集上 ES4R(Qwen)的 BLEU-4 为 0.0758,超过最强基线 Qwen2.5-Omni 的 0.0683。该结论限于单数据集有参微调与离线非流式设置,跨域与实时交互尚未验证。原文未披露训练推理部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/Bean0901/ES4R — 链接可访问(HTTP 200)
- 模型相关资源:https://huggingface.co/Qwen/Qwen3-8B — 暂时无法访问
- 模型相关资源:https://huggingface.co/meta-llama/Llama-3 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,哪些信息不能丢?
这篇论文研究的输入是多轮语音对话历史,记为从第 1 轮到第 i 减 1 轮的语音集合,每一轮是 1 次说话人与倾听者的完整问答。目标是为当前轮生成共情的文本回复,并进一步合成为共情的语音回复。初学者可以把任务想象成客服或倾诉场景:用户用带有语速、停顿、音量起伏的声音讲述困扰,系统既要听懂字面意思,也要感知情绪强度与变化,再用合适的措辞和语气回应。
必须保留的信息有两类。第一类是语言内容,即说了什么事件与需求;第二类是副语言信息,即怎么说的,包括韵律、语速、节奏和音质。论文强调真实交互中情绪是连续微妙的,离散情绪标签难以覆盖,也难以承担大规模标注成本。因此方法不依赖显式情绪分类监督,而是直接从语音中构建结构化的情感上下文表示。输出包括文本与语音两种形态,文本要求话题相关且有同理心,语音要求在自然度的基础上体现情感一致性与共情表现力。
例如一段对话中说话人说最近努力改变却看不到意义,文本只看到自我怀疑,语音还可能带有低能量与缓慢节奏。系统若只看转写文本,容易给出空泛鼓励;若保留声学线索并结合多轮能量走向,就更可能先肯定对方意识到小步也有进展,再给出具体支持。论文的 3 段划分正是为此服务:先理解情感,再生成文本,最后合成语音。
已有两条路线为何留下了情感缺口?
语音对话大模型处理语音输入主要有两条路线。第一条是级联流水线,先用自动语音识别把语音转成文字,再把文字送入大语言模型。白话说就是先听写再理解,英文是 cascaded pipeline。第二条是隐表示端到端,用语音编码器把原始语音变成帧级表示,再经模态适配器对齐到大模型嵌入空间,英文是 latent representation。论文指出前者转写时丢弃韵律与音质,后者早压缩与浅层拼接会弱化细粒度声学信息,尤其在多轮场景中难以建模跨轮情感动态。
下面这张图把三者的主路径并排对比,读图时注意中间方块代表信息形态的变化。
看图路径: 1. 沿最上方一行看语音到文字再到大模型的箭头走向;2. 对比中间一行语音到隐表示再到大模型的中间方块差异;3. 观察最下方一行在隐表示前增加的情感建模与跨模态方块位置
论文图 1。原论文 Figure 1:“Comparison of speech dialogue system ar- chitectures. (a) Cascaded pipeline through ASR. (b) End-to-end latent representations. (c) Ours model.”。
从像素可见,第一行从红色语音波形经箭头到文档图标的文字,再到大模型图标,最后到蓝色语音波形输出;第二行把文字替换为粉色块状隐表示;第三行在隐表示之前增加了网格状情感建模方块与三角形的跨模态融合符号,且输出波形颜色更深。这种画法对应的主张是:情感建模应放在编码之前,而不是编码后简单拼接。相关工作中显式情绪监督路线如用语音情感识别数据集做对齐或构建多维标注数据,虽有效但标注主观且成本高,本文明确走无离散情绪监督的语音驱动路线。
任务如何形式化,三阶段各自解决什么?
论文把任务定义为给定语音历史生成文本与语音共情回复,分为共情理解、共情生成与语音合成 3 个阶段。理解阶段解决如何从多轮语音中得到情感增强的上下文表示;生成阶段解决如何让该表示主导语义检索与融合以生成贴合当前对话状态的文本;合成阶段解决如何把文本变成韵律合适的语音而不做情绪分类。每一轮被定义为 1 次完整的说话人到倾听者的交换,这种定义使轮内与轮间建模有明确边界。
与 Empatheia 的差异需要先讲清,避免误比。原文说明 Empatheia 以文本、语音与视频为输入且依赖显式情绪监督,而本研究是纯语音输入且无任何情绪标签,模态假设不同使直接比较不合适。这个边界决定了后文基线选择:比较对象都是在相同语音输入条件下微调并测试的系统,而不是多模态加监督的系统。
ES4R 全景:三段数据流如何衔接?
ES4R 全称是基于前置情感建模的语音编码框架用于共情回复生成,英文是 ES4R。整体组件包括语音编码器加双层注意力模块、卷积模态适配器、跨模态融合模块加指令跟随大语言模型,以及基于 StyleTTS2 的合成模块。数据流是语音历史先做情感建模再编码对齐,然后与文本历史融合生成回复,最后用能量轨迹选策略合成语音。
级联流水线 × 隐表示端到端: 级联流水线负责先把语音转写成文字再交给大语言模型,分工是保留语义但会丢弃韵律和音质;隐表示端到端负责用语音编码器直接输出帧级表示再对齐到文本空间,分工是保留声学连续性但早压缩会弱化细粒度情感,ES4R 搭配两者的教训是把情感建模提前到编码之前,再做融合,从而同时要语义可读与情感连续。
下图是全文最关键的总览,阅读时按从左到右的三块颜色区分阶段,并注意虚线箭头表示文本历史来自语音识别分支。
看图路径: 1. 从左到右确认三阶段标题与颜色分块的输入输出衔接;2. 在阶段一内定位频谱图、下采样、轮内与轮间注意力的上下顺序;3. 在阶段二内区分文本历史与语音表示作为键值与查询的标注;4. 在阶段三内找到能量轨迹与三种策略分支到合成器的箭头
论文图 2。原论文 Figure 2:“The overall framework of ES4R. Stage 1: Intra-Turn and Inter-Turn attention are used to prepositive affective modeling.”。
从像素可见,阶段一顶部是多个蓝色波形表示对话音频历史,下方是彩色频谱图、降采样、轮内注意力的小网格与轮间注意力的长条网格,最后经蓝色语音编码器到浅紫色模态适配器;阶段二顶部有语音到文本历史的分支,中间是两条橙色长条分别标注文本与语音表示,下方是绿色大语言模型框内含文本路径与语音路径及两个损失;阶段三顶部仍是语音历史,中间是风格向量融合与能量轨迹框内 3 个表情分支,底部是紫色合成器与波形输出。这种布局说明文本分支只提供语义键值,语音分支提供查询,融合表示才是生成的主条件。
理解阶段:如何在编码前算出情感上下文?
理解阶段的起点是对每一轮语音提取时频声学特征。先用 Whisper 特征提取器得到矩阵,再在输入侧做下采样以控制序列长度。下采样后才做双层注意力,这种前置顺序是论文的核心主张:先增强情感结构,再交给通用编码器,从而减轻早压缩带来的衰减。
\[Xk = FE(sk) ∈RTk×df ,\]上式中 Xk 是第 k 轮的声学特征矩阵,Tk 是时间帧数,df 是特征维数,FE 代表特征提取器。实现细节是 Whisper-large-v3 的特征提取器,采样率与梅尔滤波器组数等配置见后文训练节。接着轮内注意力在单轮内部做自注意力以突出关键情感片段。
\[= MHSA( ˜Xk, ˜Xk, ˜Xk),\]上式中输入与查询键值都是下采样后的同一轮特征,输出是该轮的注意力表示。之后把各轮表示按时间顺序拼接成对话级序列,再做轮间注意力以建模上下文依赖与情感动态。
\[HInter = MHSA(Hhist\]上式中 Hhist 是拼接后的对话历史表示,HInter 是轮间输出。最后把 HInter 送入 Whisper 编码器,再经卷积模态适配器映射到大模型嵌入空间。
轮内注意力 × 轮间注意力: 轮内注意力负责在单个话轮内部突出关键情感片段,分工是时间帧级的加权;轮间注意力负责在多轮拼接序列上建模情感随对话的演变,分工是对话级的依赖,两者搭配的理由是单轮表达与多轮动态缺一不可,组合后输出增强的情感上下文表示供编码器使用。
生成阶段:语音如何挑选值得关注的语义?
生成阶段的目标是让语音上下文表示在语义检索中起主导作用。记文本历史的嵌入序列为 Etext,它由转写文本经大模型词嵌入得到;记语音侧经适配器对齐后的序列为 Espch。以语音为查询、文本为键和值做跨模态注意力,得到融合表示 Efused。
\[Efused = CrossAttn(Espch\]该计算使语音去选择哪些历史语义更值得注意,而不是把语音与文本简单拼接。为在学习语音理解的同时保留文本能力,训练采用双路径输入:文本路径输入文本历史加目标回复,语音路径用融合语音表示替换文本历史。并采用 PLoRA,只对融合语音部分应用低秩适配,以最小化对原有文本指令能力的干扰。
语音引导的跨模态注意力 × 双路径输入: 语音引导的跨模态注意力负责以语音表示为查询去检索文本历史中值得关注的语义,分工是情感主导的语义激活;双路径输入负责同时保留纯文本路径与语音融合路径,分工是维持大模型原有文本能力并学习语音理解,两者搭配使生成既对齐当前情感状态又不破坏文本指令能力。
训练目标由两部分相加且不设权重。交叉熵损失用语音路径生成正确回复,KL 蒸馏损失用文本路径作为教师指导语音路径。
\[Ltotal = LCE + LKL\]其中总损失是两者之和,交叉熵与 KL 的具体求和形式分别对有效目标位置取平均。原文明确总损失无权重设置,这意味着两项同等相加,复现时不应自行引入加权系数。
合成阶段:能量与风格如何决定语气?
合成阶段在得到共情文本后,从对话历史音频中提取能量轨迹并选择共情策略,再用支持参考音色克隆与细粒度韵律控制的 StyleTTS2 生成语音。论文强调能量轨迹只是轻量可解释的韵律调节器,用于共情韵律适配,而不做情绪分类;情感理解与语义对齐已在前 2 阶段完成。具体做法是对每轮提取平均帧级能量,用最近已完成轮与首轮的差估计轨迹。差为正视为唤醒度上升,增强情感共鸣。
差为负视为下降,生成更舒缓支持的韵律;否则采用中性风格。
对应 3 组生成超参数:高唤醒设置时长因子与表现力因子分别为 1.0 与 1.1,舒缓设置为 0.85 与 1.2,中性设置为 0.95 与 1.0。其中较小的值导致语速更慢,较大的值使扩散采样更多变从而更具表现力,这些取值在 StyleTTS2 有效范围内凭经验设定。为防止历史中微妙的消极表达被平均掉,引入同理心记忆加权:用风格编码器从每句话提取风格向量,再按逆能量加权融合,使低能量轮获得更高权重。最后把融合风格向量、所选参数与生成文本共同送入采样器。
能量轨迹 × 风格向量融合: 能量轨迹负责用每轮平均能量差估计唤醒度升降趋势,分工是轻量可解释的韵律调节信号;风格向量融合负责用逆能量加权聚合历史话语的风格向量,分工是防止低能量负向表达被平均掉,两者搭配后与生成文本共同控制合成器的时长与表现力参数。
交叉熵损失 × KL 蒸馏损失: 交叉熵损失负责让语音融合路径生成正确目标回复,分工是语音条件下的直接监督;KL 蒸馏损失负责让文本路径作为教师指导语音路径的输出分布,分工是迁移丰富的语义分布,两者相加构成总损失,使语音理解向文本语义看齐。
哪些参数训练,哪些冻结,优化如何组织?
语音编码器采用 Whisper-large-v3 的编码器,输出维度为 1280,训练时冻结不更新。模态适配器是卷积下采样器,核尺寸与步长使总体下采样倍数为 8,隐维度为 512。大语言模型主干为 Qwen3-8B,并为验证可移植性在 Llama-3.1-8B-Instruct 上做变体,均通过 HuggingFace 因果语言模型接口实现。适配方法为 LoRA,只注入到注意力投影层,秩为 16,缩放因子为 16,丢弃率为 0.1,且在音频范围内按模态感知激活,只作用于语音衍生嵌入对应的词元。
优化器为 AdamW,学习率为 5 乘 10 的负 5 次方,权重衰减为 0.05,训练 2 轮,有效批量为 8,梯度裁剪为 1.0,精度为 BF16,框架为 PyTorch 加 HuggingFace,并用 DeepSpeed ZeRO-2 并行,随机种子为 42,知识蒸馏温度为 2,平滑权重为 0.5 且作用于回复词元。语音合成直接使用预训练 StyleTTS2 而不额外微调。原文未报告缺失的梯度细节不应猜测,例如编码器冻结意味着其参数不更新,但不应据此推定整个系统输出确定,因为大模型采样与扩散合成仍有随机性。
数据、基线与评价从哪些角度设条件?
实验只使用 AvaMERG 数据集中文本与语音两种模态的对话数据,该数据集是 EmpatheticDialogues 的扩展。所有模型都在 AvaMERG 上微调并在测试集上评价。基线包括级联的识别加语言模型、直接用编码器输出的端到端系统,以及 BLSP-Emo、SALMONN、OpenS2S、LLaMA-Omni 2 与 Qwen2.5-Omni。跨数据集泛化在 MELD 上做零样本测试,该数据集是来自电视剧老友记的多方对话,与咨询类对话存在域偏移。
自动评价用 BLEU、BERTScore、ROUGE 与 Distinct 衡量生成与参考的相似相关及多样性,其中 Distinct 越高表示词汇多样性越高,BERTScore 与 ROUGE、BLEU 越高表示语义一致性越好。语音质量因文本语音对齐而无传统客观指标,依赖人工评价。人工文本评价从话题理解、情绪识别、回复具体性、可操作建议与共情深度 5 个方面做盲测 A 与 B 偏好比较;人工语音评价从对话级语音质量、情感一致性与共情表现力 3 个平均意见分维度比较。大模型评价用 GPT-5 在质量、共情、完整性与流畅度 4 个维度打 0 到 10 分。硬件与数据划分细节原文未充分展开,复现时需以公开代码中的脚本为准,不自行编造划分口径。
主结果在什么条件下胜出,代价是什么?
要回答的比较问题是:在相同 AvaMERG 微调与测试条件下,ES4R 的语义一致性与共情质量是否优于可运行的级联与端到端基线。公平条件是所有模型都在同一数据集上微调,指标方向是 BLEU、ROUGE、BERTScore 越高越好,人工偏好中胜率越高越好。
| ASR+LLM | 5.04 | 5.52 | 4.47 | 6.81 |
|---|---|---|---|---|
| Whisper+LLM | 5.21 | 6.54 | 5.14 | 7.42 |
| BLSP-emo | 7.07 | 7.56 | 5.87 | 8.62 |
上表是原文可用的大模型评价数字矩阵,行是 3 个基线,列是质量、共情、完整性与流畅度方向的得分,数值越大表示越好。表后解释需要同时看到收益与代价:论文报告 ES4R 在语义指标与人工文本 5 个维度上胜出,且在两种大模型主干上稳定;但在 Distinct 多样性上略低于部分基线,原文解释为级联系统的误差累积带来随机性虚高多样性,以及部分基线用了更大规模外部数据,而 ES4R 仅在 AvaMERG 上训练,更侧重语义与情感可靠性而非词汇多样性。这是一个明确的代价陈述,不应把多样性低误读为全面失败。
第二个比较问题是合成策略的可运行性:能量轨迹与风格融合的参数是否具体可执行。下表整理了原文连续语句中逐字出现的参数与规则,便于复述时直接照抄而不换算。
| 条件 | 指标 | 高唤醒设置 | 舒缓设置 | 中性设置 |
|---|---|---|---|---|
| 能量轨迹上升、下降或持平 | 时长因子与表现力因子 | 1.0 与 1.1 | 0.85 与 1.2 | 0.95 与 1.0 |
表后解释是:高唤醒增强共鸣,下降转舒缓,中性保自然;时长因子越小语速越慢,表现力因子越大韵律越丰富。未胜出项是语音整体质量维度,流式基线在流畅与延迟上有优势,ES4R 在表现力强但自然度平衡上仍有挑战,这与原文提到的同时维持质量与情感保真度困难的判断一致。
拿掉关键模块后哪里退化最多?
消融要验证的反证是:若去掉双层注意力或跨模态融合,性能是否回落。原文报告去掉双层注意力后 BLEU-4 大幅下降,大模型评价 4 个维度与人工 5 个维度显著恶化;去掉跨模态注意力影响相对较小,在话题理解与可操作建议上仍保留合理能力,说明跨模态是在高质量情感上下文上的互补角色。去掉共情语音合成后情感表现力与一致性胜率下降,证明能量轨迹与策略选择把情感理解转化为了可感知的韵律特征。
下面这张图用堆叠条形展示多维质量评估,读图时先看图例再看深色胜率段高度。图例中黄色、粉色与绿色分别对应与去掉跨模态、去掉双层注意力及与简单端到端基线的比较,深色为胜,中色为平,浅色为负。
看图路径: 1. 对比左右两幅轮次相似度矩阵对角线方框的明暗对比;2. 查看右侧柱状图中轮内相似度与轮间相似度的两组高度;3. 确认最右侧内聚比柱状图中基线与本方法的数值标注
论文图 4。原论文 Figure 4:“Representation analysis. Left and middle represent turn-level cosine similarity matrices for ES4R and Whisper baseline.”。
从像素可见,左侧两幅矩阵横纵轴均为轮次索引,颜色条从蓝到红表示余弦相似度从 0 到 1,对角线附近有用方框标出的同对话块;右侧两组柱状图分别显示轮内与轮间相似度以及内聚比,ES4R 的轮内柱明显高于基线而轮间基本持平,内聚比从 1.00 升至 1.08。原文用 12 段对话共 37 轮计算的数字进一步支持该视觉判断,整理如下表,所有数字均来自原文连续原句的逐字引用。
| 条件 | 指标 | 基线表示 | 本方法表示 | 比较对象 |
|---|---|---|---|---|
| 同对话内与跨对话间平均余弦相似度之比 | 内聚比与相似度 | 0.898 与 0.896,比值 1.00 | 0.898 到 0.967 与 0.896 到 0.893,比值 1.08 | Whisper 编码器输出与双注意力后表示 |
表后解释是:原始编码器内外相似度几乎相同,说明纯声学特征不能捕捉对话级情感连续性;加入双层注意力后轮内相似度上升而轮间微降,带来约 8 个百分点的内聚提升,热图上表现为更清晰的跨对话对比。这与去掉双层注意力后共情深度胜率回落的消融方向一致,但相关性不等于因果,仍需结合主结果与人工评价综合判断。
还有哪些边界与未测量项?
论文明确的局限有两点。第一,共情语音合成采用能量引导的策略选择且说话风格集合有限,设计简单可解释,但支持更丰富细粒度可控策略是未来方向。第二,前置情感建模在编码前做并行注意力计算,未给词元级自回归解码增加额外复杂度,但低延迟与流式扩展仍留待未来工作。这意味着当前结果不支持对实时延迟改善的承诺,原文也未测量误判率、延迟或成本,不应声称这些量得到优化。
另一边界是评价规模:人工评价每维度在 100 段对话上做成对判断,每个维度 300 次判断,与先前对话评价规模相当,但总体趋势不等于每组都成立。跨数据集测试虽显示在 MELD 上的迁移能力,但域偏移显著,报告显示的优势应理解为有限证据下的支持,而非已验证的普适因果。
复现先做什么,需要哪些代码与权重?
复现的第一步是按 3 阶段组织数据流:准备语音历史与对应转写文本历史,前者走特征提取、下采样、轮内拼接与轮间注意力再编码对齐,后者走大模型词嵌入作为键值;然后实现以语音为查询的跨模态融合与双路径训练;最后实现能量计算、策略选择与逆能量风格融合再调用合成器。关键超参数应原样保留:适配器下采样倍数 8,LoRA 秩 16 与缩放 16,学习率 5 乘 10 的负 5 次方,批量 8,训练 2 轮,种子 42,合成 3 组参数如前表。
资源状态是唯一依据:代码链接当前可用,地址为公开仓库,可写已公开;两个大模型权重链接本次未能确认可达,应写本次未能确认可达,不写已公开或不可用。附录中的指令模板与评价提示词应以原文为准,评价时注意文本路径转写来自 Whisper-large-v3,嵌入来自大模型词嵌入层。训练资源与推理开销原文未给硬件预算,复现时需自行记录显存与耗时,不把总体趋势推广为每步都成立。
何时值得尝试这种前置建模?
当任务是多轮语音共情对话,且观察到转写后情感变平或编码后跨轮连贯性差时,值得尝试把结构化情感上下文建模提前到编码之前,再让语音主导语义融合。适用条件是已有可用的语音编码器与指令大模型,且能接受有限风格集合的合成策略;若追求词汇多样性或流式低延迟,需要额外补充分集机制与流式推理验证。
对初学者的可复述要点是:输入是多轮语音,输出是文本与语音;先在轮内找关键片段,再在轮间看情感走向,然后用语音去挑文本,最后用能量选语气。记住无离散情绪标签、双路径加总损失无权重、合成不做分类这 3 条,就抓住了方法与评价的骨架。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


