英文题目:Emotion-Wheel-Guided Audio-Referred Text Representation for Multimodal Emotion Recognition in Conversation
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.1875
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#对比学习 #多模态学习 #语音 #语音情感识别
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Eunseon Seong:机构信息未能从会议 PDF 纯文本可靠映射
- Harim Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Dahye Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Changhyun Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Dong-Kyu Chae:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
对话情绪识别以包含N条话语的对话为输入,需结合上下文为每条目标话语预测离散情绪标签,输入为文本与音频,文本承载显式语义而音频提供韵律语调等副语言线索,两者信息容量不对等且情绪标签间存在连续亲疏关系,平等融合易受干扰是实际难点。该方法先用RoBERTa文本编码器与WavLM/Wav2vec音频编码器分别提取表示,并经对齐模块投影到相干空间以缓解模态差异。对齐后音频表示作为交叉注意力的参考融入文本编码器后半部分,得到音频参考文本融合表示,前半层输出直接进入后半层参与跨模态交互。融合表示经单个线性分类头以交叉熵损失预测情绪标签,并与对齐损失及情绪轮引导监督对比损失按阶段联合优化,先实现模态对齐后再引入情绪结构约束。与均匀推开所有负对的监督对比学习不同,该方法按Russell环形模型设定的情绪角度调整负对排斥强度,使相近情绪保持较近而对立情绪被推远,从而显式对齐表征几何与情绪亲疏。在IEMOCAP评测设置下,EMART(WavLM)的准确率为70.79,高于ECERC的68.15。其适用边界受限于仅在IEMOCAP与MELD的音频加文本条件下验证,视觉模态尚未融合,跨语种对话与角度映射变更等外推尚未验证。训练成本方面模型在单个NVIDIA GeForce H100硬件上训练,IEMOCAP平均约20分钟而MELD平均约10分钟。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么对话情绪识别不能把两个模态同等对待?
输入是对话中的一个目标话语,附带它的上文历史,目标是判断该话语的情绪标签。论文只研究音频加文本两个模态,不包含视觉。需要保留的关键信息是:文本承载显式语义,音频承载韵律、语调和节奏等副语言线索;两者的信息容量不同。论文用单模态对照说明这一点,文本在 2 个数据集上都明显高于音频,因此作者主张不能平等融合。
对于刚入门的读者,可以这样理解学习依赖:先要接受模态分工不同,再看融合结构如何体现主次,最后看损失函数如何体现情绪之间的远近。本文的输出是一套可复述的方法流程、实验条件和可核对的数字结论,不做超出原文的推广。论文还指出第二个矛盾:很多方法把情绪当作互不相关的离散类别,但心理学上高兴与兴奋更接近,高兴与悲伤更疏远,若把误判高兴为兴奋和误判高兴为悲伤同等惩罚,学到的表示就丢失了情绪结构。
这就引出本文两条主线:模态感知的融合,以及情绪轮引导的表示学习。
同输入同目标的前人路线与本文分歧在哪里?
在相同输入和相同目标下,前人多模态对话情绪识别主要把模态看作功能等价,精力放在设计融合机制。论文点名的路线包括用模态特定图做上下文建模,用动态融合减少冗余,用超图传播多频率关系,以及用证据与成因注意力整合情绪信息。这些方法在输入上与本文可比,但在模态假设上不同。另一条相关路线是考虑模态异质性,例如把音频作为主要模态、把文本通过跨模态注意力纳入的音频语言预训练。
本文同样承认异质性,但选择相反的主次:以文本为主、音频为辅。在情绪连续性方面,多数研究做离散分类,不建模标签之间的连续关系。最接近的前人工作是把情绪簇映射到愉悦度、激活度和支配度的 3 维空间,再做簇级别对比学习,引入了可度量的情绪原型。但论文指出该方法对所有负样本一视同仁,不同情绪类别被等距推开,没有显式对齐情绪远近。本文的分歧正在这里:保留原型思想,但把推开强度与情绪轮上的角度距离挂钩。
理解这段对照有助于避免误解:本文不是在通用多模态融合上取胜,而是在模态主次假设和情绪距离假设上做了不同选择。
任务输入、输出与数据构造如何定义?
论文把 1 次对话定义为 N 个话语的集合,每个话语包含语音片段和文本转写,任务是为每个话语预测一个情绪标签。这是一个话语级分类任务,但允许使用对话上下文。数据预处理的具体动作是:把当前目标话语之前的若干话语拼接到当前输入之前,形成长文本;为了在长历史中突出目标,加入说话人标识和话语标识。说话人标识用特殊符号区分当前说话人与他人,话语标识用一个标记显式标出正在分类的目标话语,历史与目标之间用分隔符隔开。
举例来说,假如目标是当前人说的一句疑问句,模型看到的文本会先出现他人的上一句问候,再出现分隔符,然后出现标记加当前说话人标识加目标句子。音频输入则是与当前目标文本对齐的语音片段,不把全部历史音频都拼接进来。这样的构造把上下文建模交给文本编码器处理,同时保持音频与目标文本的对应关系。复述时要注意:历史拼接、说话人标记和目标标记是文本侧的动作,音频侧只是取当前片段,这是后文不对称融合的数据基础。
EMART 整体走通一个样本需要哪几步?
先沿一个样本走完全程。输入是 1 对音频片段与拼接好的上下文文本。文本经过前 6 层编码器得到语言表示,音频经过音频编码器得到声学表示,两者在融合前先做 1 次对齐,然后声学表示作为参照进入后 6 层多模态编码器,与文本表示做跨模态交互,得到融合表示。融合表示一方面进入线性分类头做情绪分类,另一方面进入投影头做情绪轮引导的对比学习。训练目标由分类损失、对齐损失和情绪结构损失组成。下图把这种主次关系和距离思想画成了左右两路,左路强调主辅融合,右路强调连续表示,值得先建立整体印象。
为理解主次融合与情绪距离这两条线索,先看下图左右两部分如何分工,再对应到后文的编码器与损失函数。
看图路径: 1. 先看左上条形图,比较同一数据集下文本与音频的准确率柱长;2. 再看左下箭头,确认音频指向跨模态注意力、文本作为主干的位置;3. 再看右上离散与连续示意,理解相近与远离的标注含义;4. 最后看右下圆环,观察高兴与兴奋距离短、高兴与悲伤距离长的箭头
论文图 1。原论文 Figure 1:“Main Idea of EMART. (a) Modality-aware fusion strategy, (b) Emotion-structure-aware representa- tion learning.”。
这张图左侧用条形图报告了文本单模态在 MELD 和 IEMOCAP 上高于音频单模态的现象,右侧用离散与连续的对比引出相近情绪应更近、疏远情绪应更远的要求。下方左侧把音频标注为补充、文本标注为主要,并用箭头把音频送入包含跨模态注意力的多模态编码器;下方右侧用圆环展示兴奋与高兴距离短、悲伤与高兴距离长的约束意图,中间的 нейтральный 类别位于圆心附近。结合正文可以确认:融合不是对称拼接,而是文本主干加音频参照;表示学习不是等距推开,而是按角度距离调节推开强度。
编码器如何切分?音频怎样参照进入文本?
模型结构的具体动作是把 RoBERTa 基础模型切成两段。前 6 层初始化自预训练 RoBERTa 的前 6 层,用作单模态文本编码器;后 6 层初始化自预训练 RoBERTa 的后 6 层,并加入跨模态注意力,用作多模态编码器。音频编码器采用预训练语音模型,例如 WavLM 或 Wav2vec,用于提取声学表示。单模态阶段分别得到音频序列表示和文本序列表示,维度分别记为音频帧数与文本长度对应的隐层维度。
融合阶段以文本表示为主序列,音频表示作为补充信息参与每一层多模态编码器的跨模态注意力计算,最终得到融合表示。这种切分的选择在论文中有明确的对照依据:融合开始层太早会打断语言表示的形成,太晚则留给跨模态交互的层数不足,第 6 层是兼顾两者的位置。
文本主模态 × 音频辅助线索: 文本主模态负责提供显式语义含义,是分类的主要依据;音频辅助线索负责提供韵律、语调和节奏等副语言信息。两者搭配的理由是论文图 1 实证显示文本单模态明显强于音频,若平等融合会引入干扰,因此组合机制是让音频通过跨模态注意力参照进入文本编码器,只做补充而不改写语义主干。
下图展示了从波形和拼接文本到对齐矩阵,再到 6 层文本编码器和 6 层多模态编码器的完整数据流,右侧还画出情绪轮约束前后分布的变化方向。
看图路径: 1. 沿底部输入向上看文本编码器六层与多模态编码器六层的堆叠关系;2. 看左侧音频编码器分出两路,一路做对齐矩阵、一路进入跨模态注意力;3. 看中间对齐矩阵对角线为 1 的配对含义;4. 看右侧两个圆形分布,比较加入情绪轮约束前后同类聚集的变化
论文图 3。原论文 Figure 3:“The overview of EMART, which is composed of an audio encoder, a text encoder, and a multimodal encoder, trained with an audio–text alignment loss and an emotion wheel–guided…”。
这张图左侧从波形进入音频编码器,经过池化后同时走向对齐模块和多模态编码器;底部文本带有他人标识、分隔符、目标标记和当前说话人标识,进入文本编码器。中间的对齐矩阵用行列对应同一话语的音频与文本,对角线为配对位置。右侧上方是受情绪轮约束后的聚集分布,下方是约束前的分散分布,箭头表示对比损失把分布拉向符合心理距离的形状。结合正文可知,对齐发生在融合之前,分类头位于多模态编码器之上,情绪结构损失作用于投影后的归一化特征。
跨模态注意力 × 多模态编码器: 跨模态注意力负责把音频表示作为键和值,让文本表示作为查询去取需要的副语言信息;多模态编码器负责提供发生这种取用的深层位置,即 RoBERTa 后 6 层。搭配原因是前 6 层先形成稳定的语言表示,后 6 层再做融合,组合后得到的是音频参照的文本表示,可直接用于分类和情绪结构约束。
情绪轮距离如何变成可计算的对比强度?
情绪结构建模从标签映射开始。论文把每个非中性情绪映射到圆周上的一个角度,角度取值在零到两周之间,中性情绪不分配角度,而是放在圆心附近,作为与其他情绪弱相关的状态。IEMOCAP 和 MELD 各有自己的情绪到角度的映射表,例如悲伤、愤怒、高兴和兴奋在圆周上处于不同方位。对于锚样本与负样本,先计算它们在情绪轮上的真实角度距离,取顺时针与逆时针中较短的一段弧长。再计算融合表示经投影并归一化后,两个样本向量之间夹角的余弦相似度。
传统监督对比希望负样本夹角趋向完全相反,本文则引入一个补偿角,使优化目标变为调整后的夹角趋向完全相反,从而等价于让实际夹角趋向真实情绪角度距离。实现上通过调整后的余弦相似度完成,公式中包含补偿角的余弦与正弦项,并加入小数保证数值稳定。样本集合分为 3 类:同标签为正样本,涉及中性的为弱正样本,其余为负样本。
正样本与弱正样本使用不同温度系数的指数相似度,负样本使用调整后余弦的指数相似度,最终按批量构造情绪轮引导的监督对比损失。
情绪轮 × 监督对比学习: 情绪轮负责给出情绪之间心理距离的真值,即把每个情绪映射到 Russell 环形模型的角度位置;监督对比学习负责把同类拉近、异类推远。搭配原因是传统监督对比把所有异类等同推远,丢失了高兴与兴奋更近、高兴与悲伤更远的结构,组合后推远强度按角度距离调节,使表示空间对齐心理结构。
对齐模块与情绪损失的分工需要单独澄清,因为它们作用在不同阶段且目标不同。
音频文本对齐损失 × 情绪轮引导对比损失: 音频文本对齐损失负责在融合前缩小两种模态表示的差异并去冗余,保证跨模态输入是一致的;情绪轮引导对比损失负责在融合后约束不同情绪样本之间的相对距离。搭配原因是先对齐再融合可以减少模态干扰,然后再学情绪结构,训练时先用分类加对齐热身,若干轮后再加入情绪结构损失。
三个损失按什么顺序加入?每步监督来自哪里?
最终目标由三部分组成:标准交叉熵分类损失、音频文本对齐损失和情绪轮引导的监督对比损失。分类损失的监督来自话语级情绪标签,作用于融合表示经过线性分类头的预测。对齐损失的监督来自同一话语的音频与文本是否配对,形式上让配对位置相关性趋向一致,同时减少非配对位置的冗余,控制系数调节两项的相对重要性。情绪结构损失的监督来自情绪轮角度与批量内标签关系,作用于投影并归一化后的融合特征。
训练顺序是分阶段的:在设定的轮数之前,只用分类损失加对齐损失,让模型先达到模态对齐;超过该轮数后,再加入情绪结构损失。论文报告了各损失系数和弱正样本权重的敏感性,但未完整报告梯度是否截断、音频编码器是否冻结或全部更新等实现细节,复现时应把这些缺项记为待确认,不从模型名称推定冻结策略。
训练流程按小批量循环:先编码音频与文本并池化投影计算对齐损失,再经多模态编码器得到融合表示并计算情绪结构损失,最后加权求和更新参数。
数据、划分、基线与运行条件是否可比?
论文在两个对话情绪数据集上评估。IEMOCAP 是双人对话数据,共约七千多条话语,分布在多个会话中,情绪包括高兴、悲伤、中性、愤怒、兴奋和挫折。划分上采用前 3 个会话训练、第四个会话验证、第五个会话测试。MELD 是多人对话数据,共一千多段对话、一万多条话语,情绪包括愤怒、厌恶、悲伤、高兴、中性、惊讶和恐惧,采用官方划分的训练、验证和测试集。基线包括纯文本的对话模型、图结构多模态模型和基于变换器的多模态模型,共 7 个代表性方法。
公平性处理上,原文说明对原本使用 3 个模态的基线只保留音频与文本重跑,以便与本文的双模态设置对齐。模型规模上,文本编码器为 RoBERTa 基础模型,音频编码器为 WavLM 基础模型或 Wav2vec 基础模型,总参数量约为两亿三千万。优化器、学习率、批量大小、训练轮数和硬件开销见下表,复现时应严格对齐这些条件。下表整理了原文报告的训练配置与成本,数字与单位保留原文写法,适用条件在表后说明。
主结果在相同双模态条件下支持什么判断?
比较的问题是:在只用音频加文本且基线同样只用这两个模态的条件下,本文方法在准确率和加权 F1 上是否更好。指标方向是越高越好,报告的是 3 次随机种子中的最优运行,附录另有均值与标准差。IEMOCAP 部分重点看整体准确率与加权 F1,以及各情绪类别的 F1;MELD 部分同样看整体准确率与加权 F1。下表把 ECERC 与本文两种音频编码器变体放在同一条件下比较。
| 条件 | 指标 | ECERC 基线 | EMART-WavLM | EMART-Wav2vec |
|---|---|---|---|---|
| IEMOCAP 整体 | 准确率 | 68.15 | 70.79 | 68.39 |
| IEMOCAP 整体 | 加权 F1 | 68.36 | 70.93 | 68.61 |
| IEMOCAP 高兴类 | 类别 F1 | 57.64 | 60.42 | 52.78 |
| IEMOCAP 中性类 | 类别 F1 | 66.67 | 83.07 | 69.01 |
| IEMOCAP 悲伤类 | 类别 F1 | 78.78 | 79.59 | 80.41 |
表后解释需要同时给出收益与代价。论文报告显示,在 IEMOCAP 上 WavLM 变体比 ECERC 高出约 2.43 个百分点的准确率和约 2.78 个百分点的 F1,Wav2vec 变体提升较小。MELD 上的提升幅度相对更小,且不同音频编码器的优劣在 2 个数据集上并不一致,说明性能依赖音频预训练模型的选择。未胜出的细节同样重要:某些情绪类别上本文方法并非全面领先,例如愤怒和兴奋类别的数字并不突出;MELD 上的恐惧、厌恶等低频类别的绝对值仍然偏低。模态分析还显示,ECERC 在 MELD 上加入音频后反而出现下降,而本文方法在 2 个数据集上加入音频都有增益,支持了主辅融合设计的有效性,但这仍是有限解释,不等于因果证明。
哪个损失在起作用?情绪轮是否比等距推开更好?
消融要回答两个问题:对齐损失与情绪结构损失各自贡献多少;情绪轮距离是否优于传统等距对比。第一个问题的条件是固定主干与融合位置,只开关两个损失。第二个问题的条件是固定纯文本单模态模型,只更换对比损失的变体,包括无对比、传统监督对比、簇级别对比和本文情绪轮方法。下图先给出第二个问题的直观比较。
为比较无对比、传统监督对比、簇级别对比与情绪轮引导对比在同一文本模型上的效果,先看下图各柱子的相对高度,再回到表中核对对齐与情绪损失的组合。
看图路径: 1. 先确认横轴两个数据集分组与纵轴加权 F1 百分比范围;2. 在每个分组内从左到右比较四根柱子的高度顺序;3. 重点观察情绪轮柱子相对 SCCL 柱子的增量;4. 注意 IEMOCAP 组传统监督对比柱子低于纯文本柱子的反例
论文图 4。原论文 Figure 4:“Effect of emotion-wheel mapping in super- vised contrastive loss.”。
这张图纵轴为加权 F1 百分比,横轴为 2 个数据集分组,每个分组内有四根柱子。可见在 IEMOCAP 分组中传统监督对比柱子略低于纯文本柱子,而簇级别对比高于纯文本,情绪轮柱子最高;在 MELD 分组中四根柱子单调上升,情绪轮同样最高。像素可辨认的数值支持这一排序,但具体小数应以正文表格为准。该结果支持情绪距离建模的价值,也揭示传统等距推开可能在某些数据上带来负作用。下表进一步给出两个损失组合的消融数字,条件覆盖双模态完整模型。
| 配置 | IEMOCAP 准确率 | IEMOCAP 加权 F1 | MELD 准确率 | MELD 加权 F1 |
|---|---|---|---|---|
| 无对齐无情绪损失 | 64.70 | 64.58 | 63.10 | 62.31 |
| 仅对齐损失 | 68.02 | 67.06 | 65.25 | 63.30 |
| 仅情绪损失 | 68.21 | 68.21 | 65.75 | 63.72 |
| 对齐加情绪损失 | 70.79 | 70.93 | 66.70 | 64.71 |
表后解释应指出:单独使用任一损失都比两者都不用更好,两者合用达到最优,其中情绪结构损失的增益更大。融合起始层的对照也支持第 6 层的选择,过早融合破坏语言表示,过晚融合则交互不足。超参数敏感性显示弱正样本权重、对齐系数和情绪损失系数相互牵制,最优点在不同数据集上不完全一致,因此复现时需要按数据集分别调参,不能直接迁移。未评测的边界是视觉模态缺失,以及音频编码器固定为两种基础模型,未覆盖更大规模语音模型的影响。
本文的结论在哪些边界之外不再成立?
论文明确承认两个局限。第一,框架只融合音频与文本,未纳入视觉模态,而视觉是情绪识别的另一条有效线索,因此结论不能推广到 3 模态系统。第二,性能随音频预训练模型的选择而变化,差距来自不同语音表示与情绪类别的对齐程度,这意味着换用其他语音编码器时主结果数字可能改变。除此之外,从证据角度还有三点需要保留。基线重跑虽然统一为双模态,但图模型与变换器模型的原始超参数是否完全适配双模态输入,原文未充分展开。
主结果取 3 次种子中的最优值,均值与方差只在附录中给出,单看最优值会高估稳定性。情绪到角度的映射基于心理学模型的人工设定,中性作为弱正样本的处理也是启发式的,若更换角度设定或弱正权重,情绪距离约束的效果可能变化。这些都不是技术错误,而是复述时必须保留的适用条件:当前可用性方面,证据清单未发现可验证的开源代码与模型资源,因此不能声称代码或权重已公开。
要复现这套方法,先后要做什么?
复现的第一步是按原文重建数据输入。取对话历史拼接到目标之前,加入当前说话人与他人标识以及目标标记,文本侧使用 RoBERTa 的分词与分隔符设置,音频侧取与目标对齐的语音片段。第二步是搭建编码器:文本前 6 层与后 6 层的切分与初始化要与预训练权重对应,音频编码器任选 WavLM 基础模型或 Wav2vec 基础模型,后 6 层加入跨模态注意力。
第三步是实现 3 个损失:分类交叉熵、对齐损失和情绪轮对比损失,特别注意中性样本的弱正处理、角度距离取短弧、补偿角调整后的余弦计算,以及投影后归一化。第四步是按阶段训练:先用分类加对齐训练至设定轮数,再加入情绪结构损失,超参数需要按数据集分别搜索。下表汇总原文给出的可直接照抄的运行条件,复现时优先对齐这些条目。
| 项目 | IEMOCAP 设置 | MELD 设置 | 模型规模 | 硬件与时间 |
|---|---|---|---|---|
| 训练轮数 | 20 轮 | 10 轮 | 文本 125M 参数 | 单卡 H100 |
| 学习率 | 2e-5 | 1e-5 | 音频 94.4M 参数 | 平均 20 分钟与 10 分钟 |
| 批量大小 | 64 | 32 | 总计 229.6M 参数 | Adam 优化器 |
表后说明适用条件:上述轮数、学习率和批量大小是论文网格搜索后的选择,不是通用最优值;总参数量对应基础模型规模,若更换大模型则显存与时间都会变化;训练时间是在特定硬件上的平均值,不能当作推理延迟。还需要补做的验证包括:报告多次种子的均值方差、固定音频编码器做多次重复、公开角度映射的敏感性测试,以及补充视觉模态后的对比。若无法获取原文代码,应从数据构造与损失公式开始独立实现,并用附录的模态组合表检验音频增益是否复现。
何时值得尝试这套主辅融合加距离约束?
当任务中文本明显强于音频,且错误集中在相似情绪之间时,这套方法值得尝试。文本为主的设计适合语音质量不稳定或文本语义更可靠的对话场景,音频只在需要语气辅助时介入,可以减少跨模态干扰。情绪轮约束适合类别之间存在明确亲疏关系的标签体系,例如高兴与兴奋、悲伤与挫折之间容易混淆的情形,它通过调节推开强度让表示保留这种亲疏。反之,若模态强度接近或视觉信息不可或缺,则不应直接套用本文结论,需要重新设计 3 模态融合。
若标签体系没有心理学距离依据,也不宜硬套圆环角度,而应先验证距离假设。学习上建议记住两句话:先对齐再融合,先分类热身再学结构。复述方法时抓住切分位置、配对监督来源和角度补偿三处,就能把全文讲清楚,而不依赖对视觉或大模型的额外假设。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


