英文题目:SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training

会议身份:conference:interspeech:2026:conference-paper-id:choi26e_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对抗训练 #自监督学习 #语音 #语音情感识别

评分:5.2/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.5/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:后50% | 文档类型:方法研究

👥 作者与机构

  • Eunseo Choi:机构信息未能从会议 PDF 纯文本可靠映射
  • Hyunku Kang:机构信息未能从会议 PDF 纯文本可靠映射
  • Chanwoo Kim:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

说话人不变量语音情感识别需从原始波形预测情绪类别,难点在于情感标注稀缺且说话人特性与情感线索在声学层面深度纠缠,导致在固定说话人上学到的相关性无法泛化到未见说话人。 SISER第一步以微调的wav2vec 2.0 base为特征编码器,将原始波形编码为帧级上下文表示并汇成定长话语向量,同时送入情感与说话人两个分支。 第二步情感分支用三层全连接加PReLU将该向量映射为四类情绪分布,并以情绪交叉熵保留情感可分性。 第三步说话人分支用输入适配至768维的ECAPA-TDNN加线性层从同一向量预测每折训练说话人身份,以强判别器暴露浅层分类器漏检的残留说话人线索。 第四步采用编码器与判别器交替冻结优化,以熵最大化显式迫使说话人后验趋向均匀分布并按权重λ与情感损失联合,使编码器输出难以归因于任一说话人,这与梯度反转仅要求分错而不约束失败方式形成关键差异。 在 IEMOCAP 合并兴奋与幸福后的 5531 条 4 分类、留一会话 10 折交叉验证下,表 1 报告测试集非加权准确率为 60.63%,相对无增强 CNN+GRU 基线 51.15% 提升 9.48 个百分点,且接近带速度扰动增强基线的 59.91%。 该结论仅在 10 说话人英文表演语料下验证,未检验跨语料、跨语言与噪声外推,且正文与表格间均值存在矛盾。 代码已在脚注公开,训练在单卡 NVIDIA A100 上完成,训练时长与推理成本未披露。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么说话人会干扰判断?

这篇论文的输入是一段原始语音波形,输出是这段语音表达的情感类别。研究使用的数据集是交互式情感二元动作捕捉数据库,也就是常说的情感语音数据集,该数据集包含 5 个会话、共 10 名说话人,每段话标注了愤怒、高兴、中性、悲伤 4 类情感,其中原文把兴奋合并到高兴以平衡分布,共五千多条话语。

对于刚进入语音情感识别的研究生,第一个要建立的直觉是,同一句话由不同人说出来,基频、共振峰、语速和音色都不同,而情感也恰恰体现在基频起伏、能量和语速上,两者在声学层面是缠在一起的。模型如果只在固定几名说话人上训练,很容易把某个人的音色和某种情感绑定,例如把某位男声的低沉直接当成中性或悲伤的证据,换到未见过的新说话人时这种绑定就失效了,这就是论文反复强调的说话人失配。

第二个难点是标注难,情感标注需要人工听辨且一致性不高,数据量远小于语音识别,因此不能指望靠无限堆标注数据解决问题。论文的目标就是在标注有限且测试说话人未见过的情况下,让表示保留情感、去掉说话人。需要保留的关键信息是,后文所有准确率都是在未见说话人上测得的,不是随机划分话语,复述时不能把说话人无关说成与文本无关或与噪声无关。

已有路线解决了什么,还缺哪一块?

第一条路线是自监督预训练表示。wav2vec 2.0 直接吃原始波形,先用卷积下采样再用变换器建模上下文,通过对遮蔽片段做对比预测来学习,不需要情感标签。已有工作显示这类特征在小标注下优于手工声学特征,微调也能得到不错的情感性能,分层研究还发现不同层编码了互补的声学信息。它的作用是解决标注稀缺,但论文指出它并不自动解决说话人纠缠,单纯在情感目标上微调不能保证说话人信息被压制。

第二条路线是域对抗训练,最早作为学习域不变表示的通用框架提出,后来被用于语音识别、说话人自适应和情感识别。常见做法是梯度反转,只惩罚编码器可被判别出说话人,但没有约束判别器输出应该长什么样,编码器把所有样本都推到某一个错误说话人上也能满足目标。熵最小化与熵最大化的思路则明确要求后验分布趋向均匀,即对所有源域都不确定。

已有情感对抗工作采用了熵最大化,但说话人判别器多用浅层全连接,容量有限,部分说话人维度可能逃过检测。第三条路线是说话人判别器设计,ECAPA-TDNN 原本是说话人确认模型,带有挤压激励残差块、多尺度时间上下文和注意力池化,本身就是为了把说话人分开。论文的判断是,判别器太弱则对抗压力不足,编码器输出仍残留说话人信息。因此本文的增量是把强编码器和强判别器放在同一个熵对抗框架里,并通过对照说明判别器结构是关键变量。

论文把问题形式化成什么,需要满足什么条件?

论文把训练集写成每条样本三元组,即语音、情感标签和说话人标签的集合,目标是学到一个固定维度的整句嵌入,使情感信息最大化、说话人信息最小化。这里整句嵌入是从帧级上下文表示汇聚或直接传递给下游的向量,后文的可视化就是在这个层面比较情感是否可分。学习条件是说话人独立,即训练、验证和测试的说话人不重叠,主实验采用留 1 会话交叉验证,每折用 8 人训练、1 人验证、1 人测试,所有报告都反映在未见说话人上的性能。

举一个教学用的例子可以帮助理解,但它不是论文数据:假设训练集中一号女声说高兴时语速都很快,模型可能把快语速等同于高兴,测试时二号男声高兴时语速正常就会判错,这就是说话人相关性。要验证是否解决,必须在未见说话人上同时看情感可分性和说话人不可分性,只看训练说话人上的准确率是没有说服力的。论文没有承诺解决文本内容、口音或信道差异,复述时不要把说话人不变扩大为一切域不变。

整个系统让一条语音经历了什么?

沿着一条样本走一遍是最清楚的。原始波形先进入基于 wav2vec 2.0 的特征编码器,记为编码模块,输出帧级上下文表示序列,论文把该序列直接作为话语表示传递给下游,记为编码器对输入的映射。同一份表示同时送往两个分支,一个是情感分类器,由堆叠的全连接层把表示映射到情感类别分布,另一个是说话人分类器,用 ECAPA-TDNN 加线性输出层把表示映射到训练说话人分布。

训练时两个分支对编码器提出相反要求,情感分支要求表示对情感可判别,说话人分支在不同步骤扮演不同角色,一会儿要求自己能判别说话人,一会儿要求编码器让自己判别不出来。下面的框架图把这种交替关系画得很明确,红色与蓝色箭头不是数据流向的两种选择,而是两个训练步骤,理解这一点才能读懂后文的冻结与更新安排。

为理解 2 阶段如何交替,先看整体模块划分与箭头含义,下图是理解冻结范围和损失归属的关键。

看图路径: 1. 先从底部原始波形向上看,经过卷积与多层变换器得到编码器输出的路径;2. 再对比红色第一步箭头与蓝色第二步箭头分别冻结了哪些模块、更新了哪些模块;3. 观察左上说话人分支的线性层同时连接交叉熵损失与熵最大化损失的位置;4. 观察右上情感分支三层全连接层只连接情感交叉熵损失的结构

原论文 Figure 1:Overview of the proposed framework.

论文图 1。原论文 Figure 1:“Overview of the proposed framework. Red and blue arrows denote the two alternating training steps: red for Step 1 (SC update with ENC and EC frozen) and blue for Step 2 (ENC and…”。

从像素上看,底部是原始波形条带,向上经过标有卷积的三角形和多层变换器方块,其中顶部两层用红色标出,对应正文只解冻最后两层变换器的设置。左上绿色框是说话人分类器,内部是白色 ECAPA-TDNN 块加绿色线性层,顶部同时引出交叉熵损失和熵最大化两个损失头;右上粉色框是情感分类器,内部是 3 层粉色全连接层,顶部只引出一个交叉熵损失头。红色箭头从编码器指向说话人分支,图例注明第一步只更新说话人分类器并冻结编码器与情感分类器。

蓝色箭头从编码器同时指向两个分支,图例注明第二步更新编码器与情感分类器并冻结说话人分类器。这种画法直接对应后文的损失组合,即第一步优化说话人交叉熵,第二步联合优化情感交叉熵与说话人熵。需要提醒的是,图没有画出梯度在第二步是否穿过说话人分类器内部参数,冻结的含义按正文是说话人分类器参数不更新,但其输出分布仍用于计算熵并回传到编码器。

三个模块各自负责什么计算?

编码器采用预训练的 wav2vec 2.0 基础模型,输入是原始波形,输出是帧级上下文表示。论文在情感数据上微调时只解冻最后两层变换器,其余层保持预训练权重,这是小数据下常用的做法,既保留通用语音知识又让顶层适配情感任务。表示维度与后文 ECAPA-TDNN 输入维度对应为 768,判别器输入维度据此调整。情感分类器由 3 层全连接层加参数化修正线性单元激活组成,把话语表示映射到 4 个情感类别的概率分布,用情感交叉熵监督。

说话人分类器采用标准 ECAPA-TDNN 结构,包含挤压激励残差块与多尺度时间上下文,最后加线性层映射到每折训练说话人数。它的强体现在时间聚合与通道注意力,能捕捉浅层全连接发现不了的说话人模式。

自监督表示 × 说话人不变性: 自监督表示指 wav2vec 2.0 在大量无标注语音上预训练得到的帧级上下文特征,分工是缓解标注情感数据稀缺并提供可迁移的起点;说话人不变性指编码器输出无法被判别出是哪个说话人,分工是保证情感分类器在未见说话人上仍有效;二者搭配的原因是仅微调预训练编码器做情感分类仍会残留说话人线索,必须再用对抗压力把说话人线索挤出去,组合意义是既保留情感可分性又消除说话人可分性。

ECAPA-TDNN × 浅层说话人分类器: ECAPA-TDNN 分工是用多尺度时间上下文聚合与通道注意力捕捉更细的说话人模式,能发现浅层分类器漏掉的说话人维度;浅层说话人分类器分工是仅用全连接层做说话人判别,对抗压力较弱;搭配理由是判别器越强,回传给编码器的对抗梯度越丰富,编码器才被迫做更彻底的解耦,组合意义是把判别器容量从实现细节提升为影响解耦质量的关键变量。

从实现角度看,编码器输出的序列被直接送给下游模块作为话语表示,论文没有报告额外的注意力池化或均值池化的具体公式,因此复述时只能说序列被直接传递,不应脑补平均池化或注意力权重的计算细节。情感分支与说话人分支共享同一份编码器输出,这是对抗成立的前提,如果两个分支看到的是不同表示,抑制说话人就不会作用到情感所用的表示上。

两步交替训练如何更新,谁冻结,谁提供监督?

训练分为两步交替。第一步训练说话人分类器,此时编码器与情感分类器冻结,只有说话人分类器更新,目标是最小化说话人交叉熵,即给定编码器输出,正确说话人的预测概率越高越好。这一步让判别器跟上当前编码器的分布,避免判别器太弱而给出无效对抗信号。

第二步联合训练编码器与情感分类器,此时说话人分类器冻结,目标是两项的加权组合,一项是情感交叉熵越小越好,保证表示对情感有用,另一项是说话人输出分布的熵越大越好,即对所有训练说话人的预测概率越均匀越好。权重系数取 0.5,沿用前人工作,越大越偏向情感分类,越小则说话人压制越强,但可能丢掉情感信息。

论文强调,因为说话人分类器是 ECAPA-TDNN,回传到编码器的对抗梯度携带了多时间尺度与通道注意的信息,比浅层分类器更丰富,从而推动更彻底的说话人去除。

熵最大化 × 梯度反转: 梯度反转分工是让编码器在说话人分类上表现变差,但未规定要以何种方式变差,允许把表示坍缩到某一个错误说话人类别也算满足目标;熵最大化分工是明确要求说话人后验分布逼近在全部训练说话人上的均匀分布,即对谁都不确定;搭配理由是论文同时比较两种目标以说明约束目标分布的重要性,组合意义是熵目标给出更稳定、更彻底的说话人抑制方向。

优化器采用自适应矩估计,学习率设为万分之一,批量大小为 64,共训练 300 轮,实验在单张英伟达 A100 上完成。需要如实指出未报告项:原文没有给出两步在每个批量内是按 1 次对 1 次交替,还是按若干步对若干步交替,也没有报告是否对说话人分类器做周期性重置或早停,这些缺项在复现时需要自行记录并固定,不能从模型名称推定。梯度路径方面,原文明确的是第一步不更新编码器,第二步不更新说话人分类器,但第二步熵损失的梯度必然经过冻结的说话人分类器到达编码器,冻结指的是参数不更新,不是梯度不通过。

数据、划分、特征与指标是如何固定的?

数据沿用 IEMOCAP 的常见做法,把兴奋与高兴合并后得到 4 类,共 5531 条,其中愤怒 1103 条、高兴 1636 条、中性 1708 条、悲伤 1084 条,类别仍不均衡,因此同时看加权与非加权准确率是有意义的。基线复现前人熵最大化方法但去掉速度扰动的数据增强,原方法用 4 种速度比把训练集扩到 5 倍,本文为了分离编码器与判别器结构的贡献并贴近不一定能做增强的实际场景,在原始样本上训练。特征方面,基线按前人流程提取,wav2vec 2.0 变体直接用预训练基础模型并只解冻最后两层变换器。

划分采用 10 折留 1 会话交叉验证,每折 8 人训练、1 人验证、1 人测试,验证集与测试集都是未见说话人。指标同时报告非加权准确率与加权准确率,前者对小类更公平,后者反映总体命中率,方向都是越高越好。

未加权准确率 × 加权准确率: 未加权准确率分工是先算每个情感类别的召回率再平均,不受样本多的类别主导,适合 IEMOCAP 4 类样本不均衡的情况;加权准确率分工是总体判对样本数除以总样本数,反映整体命中率;二者搭配的原因是只看其一会掩盖少数类被忽视或多数类主导的问题,组合意义是同时报告才能判断改进是整体提升还是偏向某一类。

本文声明源代码公开,但本次可核对的资源状态显示未发现完成超文本传输安全协议状态验证的绑定资源,因此不能写代码当前可用或已公开,只能说论文正文给出了仓库地址,复现前需自行确认该链接当前是否可达。权重下载与数据获取方式在给定证据中没有进一步说明,同样不能推定。

主结果测了什么,条件公平吗,数字支持什么?

主结果要回答的问题是,在都不做数据增强且都在未见说话人上测试时,强编码器加熵对抗是否优于仅换编码器或仅用梯度反转。比较是公平的,因为除第一行带增强的复现结果外,其余四行都不做增强且共享相同的 10 折协议与指标。表中同时给出验证集与测试集,验证集同样是未见说话人,测试集是另 1 名未见说话人,因此测试集数字更能反映泛化。下表整理测试集的关键数字,单位保留原文的百分比写法,裸值含义由表头指标交代。

条件指标基线无增强仅换编码器无对抗本文方法增强对照
测试集非加权准确率51.15%56.46%60.63%59.91%

表后需要同时读出收益与代价。收益是本文方法在测试集上达到 60.63% 非加权准确率与 58.53% 加权准确率,比无增强基线高 9.48 个百分点,比仅换 wav2vec 2.0 但不做说话人解耦的 56.46% 继续提升,且在无增强条件下达到与带增强对照 59.91% 相当的水平,论文据此认为说话人不变学习可以在一定程度上补偿数据扩增的缺失。

代价与反例是,同样用 ECAPA-TDNN 但改用梯度反转时测试集为 56.95% 非加权准确率,略低于不做对抗的 56.46% 对应变体的验证趋势,说明强判别器配不合适的目标并不能保证提升,这支持熵目标通过约束均匀分布带来更稳定解耦的解释。另一个边界是带增强的原文结果本身仍很高,本文没有在增强与强判别器同时开启时报告结果,因此不能说该方法在增强下一定继续领先。

为判断提升是否只是整体偏移,再看嵌入可视化。下图比较同一会话 2 名说话人的话语嵌入,颜色表情感、形状表说话人,是对数值结果的分布层面补充。

看图路径: 1. 先确认图例中颜色代表情感类别、标记形状代表说话人身份的编码规则;2. 再对比左中右三幅子图在相同两个说话人上情感颜色的聚集程度;3. 观察中间 SISER 子图中红色与绿色点团是否比左右两侧更集中;4. 注意不要把单点散布误读为整体分布,重点看类别块的重叠面积变化

原论文 Figure 2:t-SNE visualizations of utterance-level embeddings for two speakers in Session 1.

论文图 2。原论文 Figure 2:“t-SNE visualizations of utterance-level embeddings for two speakers in Session 1. Color indicates emotion category and marker shape indicates speaker identity (◦: 01F, △: 01M).”。

从像素上看,三幅子图横轴与纵轴都是降维后的第一维与第二维,右下图例用红、橙、蓝、绿区分愤怒、高兴、中性、悲伤,用圆圈与三角区分 2 名说话人。左侧基线点团呈斜向带状,不同颜色大面积重叠,情感可分性有限;右侧仅换编码器的变体出现一定聚集但颜色仍明显混合;中间本文方法的红色与绿色点团更集中,蓝色与橙色仍有散布但重叠面积相对减小。论文据此称对抗训练带来了更具情感判别力的表示。这种可视化支持数值结论,但它只展示第一个会话的 2 名说话人,不能推广到全部 10 折,且降维本身会扭曲距离,只能作为定性证据,不能当成说话人信息已被完全去除的证明。

强判别器与强编码器各自贡献多少,有无反证?

消融要回答的问题是,性能提升到底来自换编码器还是换判别器。论文选择最接近 10 折均值的第二折做代表,在两种编码器与两种说话人分类器之间交叉比较。比较条件是同一折、同一协议,只替换其中一个部件,因此增量可以归因到被替换的部件。下表不罗列绝对准确率,只整理原文明确用句子报告的增量,单位为百分点,避免把表格裸值与句子增量混用。

被替换部件保持不变的另一部件指标报告增量对照含义
浅层分类器换为 ECAPA-TDNN卷积加循环编码器非加权准确率+7.13%强判别器在弱编码器上仍有效
浅层分类器换为 ECAPA-TDNNwav2vec 2.0 编码器非加权准确率+6.49%强判别器在强编码器上仍有效
卷积加循环换为 wav2vec 2.0浅层分类器非加权准确率+1.73%强编码器在弱判别器下增益较小
卷积加循环换为 wav2vec 2.0ECAPA-TDNN非加权准确率+1.09%强判别器部分补偿了编码器差异

表后解释需要点出主要判断与限制。主要判断是,把 3 层全连接说话人分类器换成 ECAPA-TDNN,在两种编码器下分别带来 7.13 个百分点与 6.49 个百分点的提升,而把编码器从卷积加循环换成 wav2vec 2.0 只带来 1.73 个百分点与 1.09 个百分点的提升,因此论文认为判别器结构的影响至少不小于编码器选择。限制是该结论来自第二折单折比较,虽然第二折被论证最接近均值,但单折仍可能受特定说话人组合影响。

10 折稳定性分析显示本文方法均值与方差为 62.73% 正负 1.72,低于基线的波动,但原文不同位置对本文方法均值的表述存在 62.73% 与 60.63% 两套数字,分别对应消融所用折内口径与主表测试集口径,复述时必须注明口径不同,不能直接说论文自相矛盾,也不能自行合并。未胜出项是梯度反转变体,它在主表中没有超过无对抗变体,构成对目标选择的反证。

哪些结论有边界,哪些验证还没有做?

首先是数据边界,所有结论都来自 IEMOCAP 这一个英文 acted 数据集,包含 10 名演员的脚本与即兴对话,没有在其他语种、自发情感或信道差异更大的数据上验证,因此跨语种与跨场景泛化属于待验证。其次是增强边界,主张可补偿数据增强缺失的证据是无增强本文方法与带增强前人结果相当,但没有报告增强加本文方法的组合,也没有固定增强下的公平消融,因此不能推出增强无用。

再次是判别器代价,ECAPA-TDNN 比浅层分类器参数更多、训练更复杂,论文没有报告训练时长、显存占用与推理开销,推理时虽然可以丢弃说话人分支,但训练成本仍需计入,不能承诺总体成本下降。还有测量边界,论文用准确率与可视化说明解耦,但没有直接报告说话人分类器在最终表示上的残留准确率或等错误率,也没有报告每类情感的召回率,因此不能把准确率提升等同于说话人信息为零。

最后是文本数字冲突的处理,主结果部分同时出现测试集 60.63% 与均值 62.73% 两种表述,表格口径与折平均口径不同,引用时必须同时注明数据集划分阶段与聚合对象,否则会把验证集、测试集与折平均混为一谈。

要复现这篇论文,先固定什么,再跑什么?

第一步固定数据与划分。按合并兴奋到高兴后的 4 类标签准备 5531 条话语,严格执行 10 折留 1 会话交叉验证,每折 8 人训练、1 人验证、1 人测试,验证与测试均为未见说话人,不要改成随机划分话语,否则说话人独立条件就被破坏。第二步固定编码器与解冻范围。使用 wav2vec 2.0 基础模型,只解冻最后两层变换器,输入维度 768 要与 ECAPA-TDNN 输入对齐,情感分类器用 3 层全连接加参数化修正线性单元。第三步固定 2 阶段训练。

第一步冻结编码器与情感分类器,只用说话人交叉熵更新 ECAPA-TDNN 分支;第二步冻结说话人分类器,用情感交叉熵减去说话人熵的加权和更新编码器与情感分类器,权重取 0.5,优化器用学习率万分之一、自适应矩估计、批量 64、300 轮。第四步固定对照。必须同时跑无增强基线、仅换编码器无对抗、梯度反转加 ECAPA-TDNN、熵最大化加 ECAPA-TDNN 4 条可运行策略,并同时记录验证集与测试集的非加权与加权准确率,不能只跑本文方法。

缺项清单是交替频率、早停规则、随机种子与说话人分类器是否重置原文未交代,复现时要自行固定并报告。由于本次未能确认代码链接可达,不要假设下载即能运行,应先核对仓库中的模型版本、依赖与预训练权重路径。

什么时候值得尝试这个方法,如何一句话记住它?

当你的情感识别在训练说话人上表现尚可,但换到新说话人就明显下滑,且标注量不足以覆盖更多说话人时,这个方法值得尝试。它的记忆点是,用强判别器逼出弱说话人表示,再用均匀分布目标代替模糊的变差要求。强编码器解决起点质量,强判别器解决对抗压力,熵目标解决优化方向,三者缺一不可。复现时优先验证判别器替换的增量,因为论文证据显示它比单纯升级编码器更关键。

还需要补的验证是,在你自己的数据上同时测情感准确率与说话人残留可分性,并记录训练成本与推理时是否丢弃说话人分支。如果只能做一件事,先在固定划分下跑通无对抗与熵对抗的对比,确认提升来自解耦而非随机波动,再考虑引入数据增强或更复杂的情感分类头。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总