英文题目:Conflict-Aware Pseudo-Labeling via Acoustic Signals for Multi-Task Speech Emotion Recognition

会议身份:conference:interspeech:2026:conference-paper-id:zhou26f_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#模型集成 #多任务学习 #弱监督学习 #语音 #语音情感识别

评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Haojie Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Shunfei Liang:机构信息未能从会议 PDF 纯文本可靠映射
  • Chengze Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhizhong Bai:机构信息未能从会议 PDF 纯文本可靠映射
  • Yicheng Feng:机构信息未能从会议 PDF 纯文本可靠映射
  • Ning Wang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音情感识别 Speech Emotion Recognition(SER)以整句语音为输入并输出单一情感类别,难点在于同一话语内存在静音、中性过渡与情感突变,仅用话语 utterance 级标签会抹平局部判别线索。本文构建三模块方法链:先将训练集划分为 K 个不重叠子集并按留一交叉验证训练 K 个子模型,去掉池化层后得到帧级候选预测;再按超过 K/2 的多数投票将时间轴切分为共识区 Consensus Region 与冲突区 Conflict Region,共识区赋硬伪标签,冲突区以全局回填 Global Back-filling 策略直接用话语真值监督;最后以共享编码器联合优化话语分支与帧级分支,推理时丢弃辅助分支。与依赖自动语音识别 Automatic Speech Recognition(ASR)转写或复杂结构重设计的同期多任务方法不同,该机制仅用声学信号做细粒度监督并以全局先验显式纠偏。共享编码器采用预训练HuBERT提取帧级特征,帧级辅助损失对共识区用伪标签监督、对冲突区用话语真值回填并加权,再与话语级交叉熵损失联合优化。在IEMOCAP五折留一会话验证设置下,本方法的加权准确率为78.10%,高于Gao等方法的加权准确率77.85%。该结论限于 acted 与对话式英文、德文短句情感分类,尚未验证长时、重叠、强噪声或跨语种外推,且原文未披露训练时长、推理延迟与部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/sfxii/CAPL-SER — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么整句标签不够用?

这篇解读的输入是论文原文证据与两张官方原图像素,目标是让刚进入语音情感识别的研究生能复述方法、核对条件与复现实验,必须保留的信息是数据划分、子模型构造、共识与冲突定义、回填规则、损失组成、超参数与评测协议,输出是 1 篇按学习依赖展开的中文技术讲解。任务是语音情感识别,输入是一段语音话语,输出是一个情感类别,例如愤怒、高兴、中性、悲伤。

初学者容易把这个任务理解成把整段音频丢进模型直接分类,但论文强调人类情感是动态且短暂的,一句话里可能混着中性静音、情绪突变与模糊过渡。如果只用一个整句标签去监督整段,模型在池化时会被迫把这些局部差异平均掉,判别力下降。白话说,整句标签只告诉模型这句话总体像什么情绪,没有告诉模型哪几帧真正有情绪、哪几帧只是静音。英文对应概念是话语级监督,记作 utterance-level supervision。另一端是帧级监督,记作 frame-level supervision,它希望给每 1 帧一个目标,让模型保留局部线索。

论文要解决的矛盾就是整句标签太粗、帧级真值又没有人工标注,如何在不依赖文本转写的前提下造出可靠的帧级辅助监督。教学例子仅为例子:比如一句标为高兴的话,开头 2 秒可能是沉默,中间才出现笑声,若把高兴强加给所有帧,沉默帧就被错误监督了,这个例子不附带任何论文外的数值与效果承诺。

已有路线在补什么短板,各自留下什么代价?

按同输入、同目标、同监督来对照,相关工作可分成 3 类。第一类是结构改造,做法是增强局部特征建模,例如引入多尺度融合或状态空间结构,输入仍是纯声学、目标仍是话语分类,优点是不需要额外标注,代价是结构变复杂且仍受整句标签粗粒度的限制。

第二类是自动语音识别多任务,记作 Automatic Speech Recognition,缩写 ASR,把细粒度语言信息当辅助任务隐式利用,输入增加了语音对应的文本或识别目标,目标是同时做好识别与情感分类,优点是对齐更细,代价是需要代价高昂的人工转写与额外训练开销。第 3 类是信号驱动的伪标签与不确定性建模,例如生成稠密目标或显式处理标注者分歧,输入仍是声学,监督来自模型自身预测,优点是摆脱文本依赖,代价是朴素伪标签在模糊帧上经常互相冲突,若不处理冲突就会传播噪声。

论文把自己放在第 3 类,但明确加上冲突处理:不盲目相信所有伪标签,而是先用多视角一致性筛选哪里可信。这一定位决定了后文所有设计都要回答同一个问题,即没有文本时如何判断哪 1 帧的伪标签值得学。

要解决的具体问题与不做什么如何界定?

论文要解决的具体问题是,在只有话语级真值 yi 可用的条件下,为长度为 T 的帧序列构造帧级辅助目标,使得共享编码器既学到共识帧的局部判别线索,又在冲突帧上保持全局语义一致。输入记作 xi,标签记作 yi,类别集合记作 C,帧索引记作 t。论文不做显式转写监督,不引入辅助文本,不在推理阶段保留辅助分支。也就是说,帧级分支只在训练时当正则项存在,推理时丢弃,不增加推理计算开销。

这个界定对复现很重要:不要把帧头当成推理必需模块,也不要误以为方法需要语音转文本系统。另一个界定是上游与下游骨干不同,为减少同骨干确认偏置,上游伪标签生成用 emotion2vec-base,下游联合训练用 HuBERT-base-ls960。论文没有报告把两者换成同一骨干会怎样,因此不能从模型名字推定换骨干必然更好或更差,只能按原文条件复现。

方法全景:一个样本如何走完输入到输出?

先沿一个样本走完全程。输入是一条话语 xi 与它的整句真值 yi。第一步是协同推理,记作 collaborative inference,做法是把原始训练集切成 K 个不重叠子集,每次留出一份、用其余 K 减 1 份训练一个子模型,得到 K 个参数状态不同的子模型 M1 到 MK,再去掉池化层、保留线性分类头,对未池化的帧特征逐帧推理,得到每帧 K 个候选类别。第二步是冲突感知标签分配,记作 conflict-aware label assignment,做法是对每帧做多数投票,超过 K 除以 2 票的类别成为主导类别并赋硬伪标签,进入共识区,否则判为冲突区并用整句真值 yi 回填。

第三步是多粒度联合监督,记作 multi-granularity joint supervision,做法是用 HuBERT 共享编码器抽出特征序列 E,一路经注意力池化与话语头受真值监督,另一路经帧头受最终伪标签监督,两路损失加权成总目标。训练完成后只保留共享编码器与话语头做推理。

话语级监督 × 帧级伪标签: 话语级监督负责守住整句的全局情感主题,分工是给最终分类兜底;帧级伪标签负责补上局部判别细节,分工是让编码器不被池化抹平,搭配理由是单靠前者会平均掉静音与过渡帧、单靠后者会引入噪声,组合意义是用全局标签约束局部学习,形成多粒度联合目标。

本段导读图 1 全景需要至少 30 个汉字的完整说明:下图把 3 段流程画在同一张架构里,左侧是数据切分与子模型训练,中间是投票与回填,底部是双分支联合训练,建议按箭头顺序阅读以建立因果链。

看图路径: 1. 先从左上面板看原始训练集如何分成 D1 到 DK 并交叉训练出 M1 到 MK;2. 再看右上波形与表情矩阵如何按帧对齐出每个子模型的候选预测集合;3. 接着看中上面板多数投票如何把序列分成共识色块与冲突问号块;4. 最后看下面板共享编码器分出的注意力池化话语头与帧头如何汇成总损失

原论文 Figure 1:Overall architecture of the proposed method.

论文图 1。原论文 Figure 1:“Overall architecture of the proposed method.”。

图 1 的解释紧接标记之后展开。面板 a 显示原始训练集分出 D1 到 DK,再交叉连线训练出 M1 到 MK,下方小图说明训练时编码器冻结、只训练池化与多层感知机层,推理时去掉池化直接用分类头对波形分段输出表情符号矩阵。面板 b 显示候选集合先经过多数投票与冲突检测器分成浅蓝共识块与橙色冲突问号块,再把整句真值送入全局回填框生成最终伪标签,其中绿色表示被回填修正的位置。

面板 c 显示共享编码器输出 E 后分叉,上面经注意力池化到话语头算话语损失,下面经帧头算共识损失与修正损失并按系数合并成总损失。该图支持的核心判断是伪标签不是 1 次生成的,而是先分歧暴露、再分区处理、最后双目标联合优化。

子模型如何造出分歧,投票阈值如何切分时间轴?

组件按依赖顺序讲。先讲数据切分。设原始训练集为 D,含 N 条样本,每次选 K 减 1 个子集训练一个子模型,共得到 K 个子模型集合 M。每个子模型用预训练 emotion2vec 做特征提取器,该阶段提取器参数冻结,帧级特征序列经池化聚成整句表示,再经线性分类头受原始标签 yi 监督。这个安排的理由是让子模型收敛到不同的数据子集视角,从而带有不同的预测偏置。

训练完成后做结构调整:移除池化层,保留已训练的线性分类头,使分类器能对未池化特征产生弱帧级候选预测。对任意话语 xi,第 k 个模型对第 t 帧的预测类别记作该帧的候选之一,K 个模型合起来记作该帧的候选集合。由于子集不同,它们的一致代表判别线索在时间上稳定。再讲标签分配。共识区记作 Scons,要求某主导类别得票超过 K 除以 2,此时该帧目标设为该主导类别。

冲突区记作 Sconf,对应无严格多数、含平票的情况,此时该帧目标设为整句真值 yi。原文明确用整句真值当全局先验,目的是在局部线索模糊时让特征学习服从可靠的宏观主题。

协同推理 × 冲突感知标签分配: 协同推理的分工是制造多样性并收集候选预测,让不同数据视角的子模型各自对同一帧投票;冲突感知标签分配的分工是根据得票是否过半把时间轴切成共识区与冲突区,搭配理由是只有先暴露分歧才能决定哪里可信、哪里要回填,组合意义是把原始投票集合转化为可直接监督的最终伪标签序列。

阈值选择的含义要讲清。超过一半是严格多数,不是相对多数,平票必然落入冲突区。K 的取值按数据集的留 1 会话结构来定,IEMOCAP 取 4,EmoDB 取 9,MELD 取 5,这不是随意超参数,而是与可用划分结构对应。

共识区 × 冲突区: 共识区的分工是提供锐利的局部监督,对应超过 K/2 票一致的帧并赋硬伪标签;冲突区的分工是标记不可靠位置,对应无严格多数或平票的帧并用整句真值回填,搭配理由是情感突变与模糊过渡必然产生分歧,组合意义是在保留可信细节的同时阻止噪声沿时间传播。

此处再补一个易错点。共识帧的硬伪标签可能与整句真值不一致,论文允许这种不一致,因为它认为多视角一致的局部线索可能揭示与全局不同的瞬时情绪,而冲突帧才强制回到全局,这种不对称处理是方法的关键。

注意力池化 × 共享编码器: 共享编码器的分工是从波形表示中抽出帧级特征序列 E,是两个分支的公共底座;注意力池化的分工是按时间重要性把变长 E 压成定长话语向量,分工是服务话语头做全局分类,搭配理由是帧头需要原始时序而话语头需要压缩语义,组合意义是同一套特征同时接受全局与局部两种梯度。

损失如何把共识与回填拼成可优化的目标?

训练分上游与下游 2 个阶段,参数冻结与更新要分开说。上游是伪标签生成阶段,emotion2vec 编码器冻结,只训练池化与分类头,目标是话语分类,训练完调整结构做帧级推理。下游是联合训练阶段,HuBERT 作为共享编码器参与端到端优化,输出帧级特征序列 E,分别进入话语分支与帧分支。话语分支用注意力池化自适应聚合变长序列成定长向量,再映射到情感空间,损失记作 Lutt,用交叉熵对整句真值监督。帧分支直接对 E 逐帧约束,损失记作 Lframe,由共识项 Lcons 与修正项 Lrect 组成。

共识项只在共识帧上计算交叉熵,用指示变量 mi,t 标记,mi,t 为 1 表示该帧属于共识区,否则为 0,分母是共识帧总数,若掩码为空则该项置零。修正项只在冲突帧上计算交叉熵,目标用整句真值 yi,分母是冲突帧总数,同样空掩码置零。完整辅助损失为 Lframe 等于 Lcons 加 alpha 乘 Lrect,其中 alpha 控制修正项强度以免过度依赖整句标签。总目标为 Ltotal 等于 Lutt 加 lambda 乘 Lframe,其中 lambda 平衡辅助正则的贡献。原文报告 lambda 取 10,alpha 取 0.35,优化器用 AdamW,批量大小固定为 64,IEMOCAP 与 EmoDB 学习率取 2 乘 10 的负 4 次方,MELD 取 5 乘 10 的负 5 次方,实验在 4 块 NVIDIA A40 上用 PyTorch 实现。

全局回填 × 帧级正则项: 全局回填的分工是用整句真值给冲突帧一个可靠先验,做法是把这些帧的目标直接设为 yi;帧级正则项的分工是把共识损失与回填损失按权重拼成 Lframe 去约束共享编码器,搭配理由是回填需要一个可调强度以免过度依赖全局标签,组合意义是让辅助分支在训练时塑形表示、推理时可丢弃而不增加开销。

需要指出的缺项是原文未给出学习率衰减、训练轮数与早停细节,也未报告梯度是否在伪标签生成阶段回传到上游编码器之外的其他路径,因此复现时只能按冻结与端到端 2 阶段的字面描述实现,不从模型名称推定额外冻结或解冻。

在哪些数据与协议上测,用什么指标才可比?

实验按测什么、与谁比、条件是否一致来组织。数据集有 3 个。IEMOCAP 是英语交互式双人情感数据库,约 12 小时视听数据、10 名演员,论文把高兴与兴奋合并为一类,共选 5531 条、覆盖愤怒、高兴、中性、悲伤 4 类,采用 5 折留 1 会话交叉验证,记作 Leave-One-Session-Out。EmoDB 是德语表演数据库,535 条、10 名专业说话人、男女各半,覆盖愤怒、无聊、厌恶、恐惧、高兴、悲伤、中性 7 类,采用说话人无关的 10 折留一说话人交叉验证。MELD 是取自电视剧老友记的多人对话数据集,超 13000 条、7 类情感,遵循官方划分。

指标按分布选:IEMOCAP 与 EmoDB 报告加权准确率 WA 与非加权准确率 UA,WA 按样本总数算总体准确,UA 按每类准确平均以照顾类别不平衡,越高越好;MELD 因高度不平衡报告加权 F1 分数 WF1,越高越好。对比如 Shen、Mai、Ma、Gao、Kwok、Zhao、Wan、Zhu 等近年方法,其中 ASR 多任务方法占多数,比较时要注意文本依赖与纯声学条件不同,不能把类别差异直接当同条件胜负。

代码状态是正文开源声明的唯一依据之外,本次收到的资源状态显示代码链接当前可用,地址为论文给出的仓库,但本次解读不把可用等同于权重可下载或系统可一键运行,复现仍需核对环境与划分脚本。

主结果在什么条件下成立,强在哪里?

主结果要回答纯声学多粒度监督能否超过依赖文本或复杂结构的方法。先提出比较问题:在相同数据集与公开划分下,只用声学信号的本方法在 WA、UA 与 WF1 上是否优于已报告的 ASR 辅助与结构改造基线,指标方向均为越高越好,公平条件是遵循各数据集原划分与指标定义。下表整理核心数字,单位保留原文写法,裸值含义按表头与相邻说明交代,数值相同不代表指标相同。

数据集指标本方法对比方法对比值
EmoDBWA UA97.30% 97.19%对应原文报告见表后解释

表后解释至少 25 个汉字并给出收益与代价。论文报告本方法在 IEMOCAP 取得 78.10% WA 与 79.07% UA,在 EmoDB 取得 97.30% WA 与 97.19% UA,在 MELD 取得 55.48% WF1,显示在表演与对话两类语料上一致占优。在 MELD 上超过次优的 DropFormer 约 6.23 个百分点,支持其在噪声与不平衡对话场景下的稳定性。代价是上游需训练 K 组子模型,且下游联合训练引入 lambda 与 alpha 2 个权重,调参成本高于单目标微调。

未胜出项也要说明:原文表 1 中 Gao 等在 IEMOCAP 曾报告 77.85% WA 与 78.49% UA,接近本方法,说明在该库上差距并非断层式领先,不能推广为所有划分都成立。 本段导读图 2 需要至少 30 个汉字的完整说明:下图是 IEMOCAP Session 1 话语特征的 t-SNE 投影,左右分别为基线与本方法,建议先看图例再对比簇的分离与混叠。

看图路径: 1. 先确认顶部图例中红色愤怒、橙色高兴、绿色中性、蓝色悲伤的对应关系;2. 再对比左图基线与右图本方法中红色簇与绿色簇的分离程度;3. 观察右侧橙色与蓝色点在右下与右上是否形成更集中的各自区域;4. 注意两图都只展示 IEMOCAP Session 1 的话语级特征投影

原论文 Figure 2:t-SNE visualization of utterance-level feature repre- sentations on the IEMOCAP dataset (Session 1).

论文图 2。原论文 Figure 2:“t-SNE visualization of utterance-level feature repre- sentations on the IEMOCAP dataset (Session 1).”。

图 2 的解释紧接标记之后展开。左图基线呈连续混杂结构,红色愤怒虽有成团,但橙色高兴、绿色中性、蓝色悲伤在右侧与底部大面积交叠,说明仅用话语监督的表示区分度不足。右图本方法中红色簇在左上更集中,绿色簇在左下更集中,橙色与蓝色在右侧各自延续但交叠减少,类间边界更清晰。该可视化支持冲突感知伪标签加全局先验能学到更具判别力的编码器表示,但属于定性证据,不能替代准确率数字,也未测量误判率与延迟改善。

拿掉分区或回填会怎样,哪种朴素做法反而有害?

消融按问题组织:帧级辅助是否总是有益,不分区直接广播整句标签会怎样,只学共识区不回填够不够。比较条件是同一 IEMOCAP 协议与同一 WA、UA 指标,方向越高越好。下表整理论文特有的 3 种监督策略,指标单位为百分比,裸值按原文表头理解。

监督策略数据集指标取值含义
全局广播到所有帧IEMOCAPUA71.54%低于基线
仅共识区监督IEMOCAPUA76.78%有效但非最优
本方法共识加回填IEMOCAPWA UA78.10% 79.07%最优

表后解释至少 25 个汉字并点出反例。

全局广播把整句标签强加给所有帧,UA 掉到 71.54%,甚至低于基线,支持静音或过渡帧被错误监督会引入严重标签噪声的判断。仅共识区监督把 UA 提到 76.78%,支持共识伪标签本身是有效的辅助监督。本方法用整句真值动态填充冲突区后达到 79.07% UA,支持在保留局部细节的同时维持全局一致的组合价值。限制是消融只在 IEMOCAP 上报告,未在 EmoDB 与 MELD 上展开同组对照,因此不能把该排序推广到所有语料。

另一类论文特有细节是上下游性能关系:下游显著超过上游基础模型,论文解释为冲突策略通过回填缓解了不可靠局部伪标签,而非盲目继承上游预测,这支持去噪机制的必要性,但属于有限解释而非因果证明。

哪些边界没有测,哪些推论不能做?

区分直接报告、有限解释与未验证推测。直接报告的是 3 个数据集上的准确率与加权 F1 提升,以及全局广播有害、仅共识有效、回填最优的排序。有限解释的是 t-SNE 更清晰意味着表示更具判别力,以及下游超上游意味着回填缓解了噪声,这些解释与数字一致但未做因果干预,不能写成已证明。未验证的是延迟、帧率、推理成本与误判率,原文明确辅助分支推理时丢弃,但未测量实际延迟与显存变化,因此不能承诺推理更快或更省。

数据边界是 IEMOCAP 合并了高兴与兴奋,EmoDB 只有 535 条且为表演语音,MELD 为电视剧对话,三者都不等于自然人机交互,跨语种与跨场景泛化待验证。方法边界是 K 依赖留一结构,alpha 与 lambda 只报告一组取值,未报告敏感性曲线,阈值超过一半是否最优也未做扫描。原文表头、图注与算术未发现需要标注的互相冲突,但复现时仍需核对折平均的聚合对象是折平均还是样本拼接平均,原文只写交叉验证,未给出标准差与显著性检验。

复现先做什么,需要哪些信息条件?

复现按可执行顺序讲。第一步准备数据与划分:IEMOCAP 按 5 折留 1 会话、合并高兴与兴奋后取 5531 条 4 类,EmoDB 按 10 折留一说话人 7 类,MELD 用官方划分,不要自行重划分。第二步跑上游协同推理:用 emotion2vec-base 冻结编码器,按 K 等于 4、9、5 分别在 3 个库上交叉训练子模型,保留线性头,去掉池化后逐帧推理得到每帧 K 个候选。第三步做投票与回填:严格多数判共识并赋主导类别硬标签,否则判冲突并赋整句真值,生成最终伪标签。

第四步跑下游联合训练:用 HuBERT-base-ls960 做共享编码器,一路注意力池化加话语头,一路帧头受伪标签监督,按 lambda 为 10、alpha 为 0.35、批量 64、学习率 IEMOCAP 与 EmoDB 取 2 乘 10 的负 4 次方、MELD 取 5 乘 10 的负 5 次方、优化器 AdamW 启动。第五步评测:IEMOCAP 与 EmoDB 看 WA 与 UA,MELD 看 WF1,注意百分点与相对百分比不同。信息条件方面,论文给出仓库链接且本次资源状态显示当前可用,但可用仅指链接可达,不等于权重、划分脚本与环境都开箱即用,缺失的训练轮数、早停与随机种子需自行补验证并记录。

何时值得尝试:当只有整句标签、没有文本且怀疑静音与过渡帧拖累池化时,可优先试共识加回填的帧级正则;当已有高质量转写且 ASR 链路成熟时,不必为换成本方法而拆掉现有链路。

一句话收束:何时用它,何时不用?

回到中心矛盾:整句标签省标注但抹平动态,帧级真值细但拿不到,朴素伪标签细但吵。论文的选择是用多样子模型的多数一致来定义可信,用整句真值给存疑位置兜底,再用双分支把两种粒度压进同一个编码器。证据支持它在 3 个库上取得报告中的最优数字,且消融支持分区与回填各自的贡献,但代价是上游多模型训练与两个平衡系数的调试,边界是小库易过拟合的缓解只在 EmoDB 上定性提及、可视化只在单会话上展示。

若你的场景也是纯声学、无文本、长句中混有静音与情绪起伏,先按原文 K 与超参数复现共识加回填,再补标准差、阈值敏感性与延迟测量;若场景已有可靠文本或对逐帧可解释性有强要求,则需另做验证后再决定是否采用。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总