英文题目:Learning Emotion-discriminative Representations for Zero-Shot Cross-Lingual Speech Emotion Recognition

会议身份:conference:interspeech:2026:conference-paper-id:mi26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对抗训练 #对比学习 #跨语言 #零样本 #语音情感识别

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jinyi Mi:机构信息未能从会议 PDF 纯文本可靠映射
  • Ding Ma:机构信息未能从会议 PDF 纯文本可靠映射
  • Tomoki Toda:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

零样本跨语言语音情感识别的输入为源语言与辅助非目标语言的带标注语音,输出为未见目标语言的happy等四类情感标签,难点在于语言韵律文化差异与说话人捷径导致的分布失配。先由与源语言匹配的wav2vec 2.0接收源语言与非目标语言语音并提取帧级表示再均值池化为句向量,再将该句向量送入监督对比分支按语言感知权重拉近跨语言同情感样本并推远异类样本以输出情感对齐的句向量。最后将对齐后的句向量送入梯度反转层驱动的说话人分类器对抗遗忘说话人身份以输出去身份化向量,该向量直接作为线性情感分类器的输入以输出最终情感后验。与仅做整体域对抗或依赖大规模多语言预训练的前人工作不同,该方法显式建模情感条件下的跨语言一致性并解耦说话人变异,具有用少语言数据实现迁移的实际意义。在9组零样本跨语言设置下,Proposed的UAR指标为82.26%,高于Baseline 2的UAR指标73.21%。结论的适用边界仅为happy、angry、sad和neutral的四情感闭集与英汉德法乌尔都语圈内迁移,开放情感与远距离语系外推能力尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,先保留哪些关键信息?

这篇解读的输入是论文原文证据与两张官方原图像素,目标是让刚进入语音情绪领域的学生能复述方法与实验条件。必须保留的信息是任务定义、训练见过谁没见过谁、3 个损失的分工、采样构造、9 组任务的比较条件与主数字,不做无源推广。

语音情绪识别要从说话声中判断高兴、生气、悲伤、中性等状态。同语言训练测试时系统表现尚可,换一种语言测试时性能常明显下降,因为口音、韵律习惯、文化表达与录音条件都变了。对研究生而言,关键直觉是声学特征里混着 3 类信息:情绪、语言与说话人,跨语言时后两类成为干扰。

零样本跨语言在这里含义很窄:训练只用源语言和若干辅助非目标语言的标注情绪语音,测试语言的数据在训练阶段完全不用,连无标注语音和语言标签也不用。这与需要目标语音做对抗适应的做法不同,后文所有零样本结论都依赖这一信息隔离条件。

论文要解决的矛盾是既要对齐情绪类别结构,又不能靠目标语言救场。作者选择用少量语言的数据低成本地学出情绪判别、语言无关、说话人无关的表示,而不是做五十多种语言的大规模多语言预训练。理解这一点才能明白为什么后文同时需要对比拉齐和去说话人两条腿。

已有路线为什么还不够?

跨语言情绪识别的常见路线是迁移学习。先用源语言大规模语料预训练自监督模型,再到目标语言情绪数据上微调,以适应语言特性。这条路线在目标语言有足够标注时可行,但在许多低资源语言缺乏可靠情绪标注时就不现实。

另一类路线是不需要目标情绪标签,但仍要用目标语音或语言标签,例如用生成对抗网络学语言无关表示,用域对抗神经网络加语言分类器和梯度反转层缓解分布失配,或用层锚定利用语音模型的层次结构找语料共性。还有路线靠多语言自监督预训练把泛化能力归因于覆盖五十多种语言的大规模预训练。这些工作主要压语言分布差异,较少显式约束情绪类别在语言之间是否对齐。

论文的切入点是把对齐粒度从语言域下沉到情绪类别。也就是说,不只让源语言整体分布靠近目标语言整体分布,而是让不同语言中同为高兴的样本彼此靠近,不同情绪彼此远离。同时去掉说话人这条捷径,避免模型靠音色记情绪。这种从域对齐到类别结构对齐的转变,是后文引入有监督对比的理由。

任务的形式化与数据符号是什么?

论文把训练数据记为源语言标注集与非目标语言标注集的并集,目标语言数据在训练中不用。每个训练样本写成四元组,包含语音波形、情绪标签、语言标签和说话人身份。情绪标签空间在所有语言间共享,固定为 4 个类别:高兴、生气、悲伤、中性。语言集合是训练中出现的语言集合。

举例说明信息条件:若任务记为英语到德语,则英语是源语言,德语是目标语言,中文、乌尔都语、法语等其余语言充当非目标辅助语言。训练能看到英语加辅助语言的情绪标签与说话人身份,看不到德语的任何语音。测试时直接拿德语语音做情绪分类。

这种设定下,模型必须在训练阶段就把情绪表示做得足够通用。评估用非加权平均召回率与宏平均 F1,都是先按类计算再平均的指标,方向都是越高越好,适合类别不平衡的跨语言分类。论文共设计 9 组源到目标的组合,每组都把剩下语言当作非目标语言,这是理解表 1 配置的关键。

方法全景:一个样本走完输入到输出

先沿一个样本走全程。训练时一条源或非目标语言的情绪语音进入特征提取器,得到话语向量。同一向量同时进入三处:情绪分类器算交叉熵损失,有监督对比分支算跨语言情绪拉齐损失,说话人对抗分类器算说话人损失。3 个损失加权求和后联合优化特征提取器与两个分类头。推理时一条目标语言语音只走特征提取器加情绪分类器,直接输出目标情绪标签,不再经过对比与对抗分支。

下图是理解分叉与汇合的唯一像素依据,训练行在上、推理行在下,训练虚线框内是情绪解耦模块。

看图路径: 1. 先从左侧源与非目标情绪语音入口沿箭头走到特征提取器;2. 再看虚线解耦模块内三路分支如何从同一特征分叉;3. 对照下方推理行确认目标语音只走特征提取加情绪分类;4. 观察对比分支中拉近与推远箭头标注的同与不同情绪

原论文 Figure 1:Illustration of the proposed method. “Source” and “Target” denote the source and target languages,…

论文图 1。原论文 Figure 1:“Illustration of the proposed method. “Source” and “Target” denote the source and target languages, respectively. “Non-target” denotes non-target languages.”。

从像素看,左侧绿色与蓝色标注的源与非目标情绪语音箭头进入浅蓝色特征提取器小框,小框注明用源语言预训练。随后一路向上进入绿色对抗说话人分类器并输出说话人标签,一路向右进入粉色情绪分类器并输出源与非目标情绪标签,一路向下进入橙色有监督对比学习大框。大框内以深红色圆点为锚点,右侧红色阴影圆内同情绪形状被虚线拉住标注拉近,左侧灰色虚线圆内异色形状被推开标注推远。

特征提取器与情绪分类器之间有一个火焰状小标记,提示该处参数在对抗与对比压力下更新。下方推理行只有目标情绪语音到特征提取器再到情绪分类器再到目标情绪标签的单链,没有辅助分支。这种训练多目标、推理单链的设计,正是为了把语言与说话人不变性提前压进特征。

特征提取:帧表示如何变成一句话向量?

白话说,特征提取要把变长波形变成定长语义向量。英文名是特征提取器,论文用预训练自监督模型 wav2vec 2.0 充当。它先用卷积层看局部声学,再用 Transformer 编码器看上下文,输出逐帧隐表示矩阵,帧数由时长决定,维度由模型决定。

随后对时间维做均值池化,把所有帧向量平均成一条话语向量。这个操作没有可学参数,但决定了后文所有损失都作用在同一粒度的表示上。论文按源语言选择语言匹配的 wav2vec 2.0 基础模型初始化,并用低秩适配、瓶颈适配器与权重门控做微调,所有系统保持相同实现以保证公平。

有监督对比学习 × 跨语言情绪对齐: 有监督对比学习负责按情绪标签决定谁该拉近谁该推远,跨语言情绪对齐负责规定跨语言同情绪对更重要,二者搭配的原因是只按情绪聚类仍可能按语言分堆,组合后模型在同一情绪类内优先缝合不同语言的子分布,形成语言无关的情绪结构。

对初学者而言,记住入口一致性很重要:情绪分类、对比拉齐、说话人对抗都吃同一个池化后向量,任何一路的梯度都会改变特征提取器。这为后文总损失的联合优化埋下依赖。

wav2vec 2.0 × 均值池化: wav2vec 2.0 负责把波形变成逐帧上下文表示,均值池化负责把变长帧序列压成一条定长话语向量,二者搭配的原因是情绪标签在话语级而声学编码在帧级,组合后得到可直接送入情绪分类器、对比损失和说话人分类器的共享入口表示 h。

对比分支:如何让不同语言的同情绪靠拢?

白话说,有监督对比学习就是按标签办事的聚类:同情绪拉近,异情绪推远。英文名是监督对比学习,论文进一步加了语言感知权重。与标准做法平等对待所有同情绪对不同,论文给跨语言同情绪对更大权重,用超参数控制跨语言对齐强度,要求该权重大于 1。

计算目标是让锚样本与同情绪集合的余弦相似度相对所有非锚样本更高。温度系数调节分布锐利程度,损失对批次内每个锚点平均。直觉是若批次里没有跨语言同情绪对,跨语言对齐就无从谈起,因此采样构造与损失同等重要。

为保证批次内同时有多语言多情绪,论文设计分层跨语言采样:先抽若干不同语言,再抽若干情绪类,对每个语言情绪对随机抽若干条样本,批次总量等于三者乘积,且要求语言数与类别数都不小于 2、每对样本数不小于 2。论文实际取语言数 3、类别数 4、每对 3 条。教学例子:若抽到 3 个语言 4 情绪每对 3 条,则一批 27 条,锚点既有同语言同情绪正例,也有跨语言同情绪正例,还有异情绪负例,对比才有意义。该例子只是算术演示,不代表某次真实抽样。

说话人对抗学习 × 梯度反转层: 说话人对抗学习负责提出去说话人身份的目标,梯度反转层负责在反向传播时把说话人分类的梯度反号传给特征提取器,二者搭配的原因是正向仍能训练说话人分类器而逆向迫使特征变笨,组合后特征提取器学会让说话人分类器做不对,从而抑制说话人捷径。

对抗分支:如何去掉说话人捷径?

白话说,说话人对抗学习就是让特征对说话人身份变笨。英文名是说话人对抗学习,核心是梯度反转层。分类器结构是梯度反转层后接两层线性层,中间有激活与丢弃。正向时它努力按特征猜说话人,反向时梯度反转层把梯度取反再传给特征提取器,于是说话人分类器越想做对,特征提取器越往让它做错的方向走。

损失形式是对说话人正确标签的交叉熵。由于梯度反转,优化效果是分类器参数最小化该损失,而特征提取器被对抗地推向最大化该损失。论文动机写得很直白:防止模型把说话人特征当作情绪分类的捷径,从而学到说话人无关的情绪表示。

需要区分的是,这一路不提供情绪监督,只提供去身份压力。若单独使用而无对比拉齐,特征可能只是混淆说话人但仍按语言分堆;若单独用对比而无对抗,聚类可能仍残留音色结构。这正是论文坚持两者集成的机制理由。

训练如何组织:数据、损失权重与监督来源?

训练数据是源语言标注集与非目标语言标注集的并集,目标语言不用。监督来源有三:情绪标签供交叉熵与对比正负划分,语言标签供跨语言加权,说话人身份供对抗分类。3 个损失按权重相加,总损失等于情绪交叉熵加对比权重乘对比损失加对抗权重乘对抗损失。论文报告对比权重取 1.0,对抗权重取 0.3,跨语言对权重取 2.5,分层采样取语言 3、类别 4、每对 3 条。

零样本跨语言 × 非目标语言: 零样本跨语言负责规定训练时完全见不到目标语言数据,非目标语言负责提供除源语言和目标语言之外的辅助标注语言,二者搭配的原因是不能用目标数据就只能从多源缝隙中逼出通用结构,组合后训练集等于源语言加非目标语言,用语言多样性替代目标监督。

参数更新上,特征提取器、情绪分类器、说话人分类器联合优化。情绪分类器与说话人分类器各自最小化自身损失,特征提取器同时受 3 路梯度影响,其中对抗路梯度经反转。论文未报告学习率、轮数、早停与优化器细节,这是复现时需要补查的缺项,不能从模型名推定。

推理阶段没有训练动作:目标语音经特征提取与情绪分类直接得标签。理解训练多分支、推理单分支的不对称,是避免把对比与对抗误当成测试时模块的关键。

实验条件:数据、划分与基线是否可比?

论文用 5 个数据集对应 5 种语言代号:英语、中文、德语、法语、乌尔都语,统一聚焦高兴、生气、悲伤、中性 4 类。英语用 MELD 的多人会话数据并沿官方划分,中文用情绪语音库中文子集并给出训练验证测试量,德语用 EMO-DB 并自划分,法语用 CaFE 并自划分,乌尔都语用电视访谈数据并自划分。实现用 Python 与 PyTorch,在 Xeon Gold 与 Tesla V100 上训练评估,特征编码器按源语言选用匹配的 wav2vec 2.0 基础模型。

非加权平均召回率 × 宏平均 F1: 非加权平均召回率负责先算每类召回再平均以免大类主导,宏平均 F1 负责先算每类 F1 再平均以同时看查准与查全,二者搭配的原因是情绪数据常类别不平衡,组合后能比准确率更诚实地反映跨语言小类是否被牺牲。

比较条件上,所有系统共享相同特征提取器与情绪分类器结构,差别只在训练数据与是否加入对比与对抗。基线 1 只用源语言微调,基线 2 用源加非目标语言微调但无新增损失,上限系统用目标语言数据微调因而不再是零样本。提出方法含完整版与两个消融版:去对比版与去对抗版。这种设计让主对比回答多语言数据加结构损失是否超越单纯多语言数据,让消融回答每一路的增量。

资源状态方面,本次未发现来源绑定且完成验证的代码模型数据资源,不得声称代码模型或数据已公开。复现只能依赖论文文字描述的数据划分与超参数。

九组任务如何构成?训练量与说话人数受何影响?

9 组任务的逻辑是每次选一源一目标,其余作非目标。例如英语到德语时非目标为中、乌、法语,英语到法语时非目标为中、德、乌语,英语到中文时非目标为德、乌、法语,余类推。论文给出每组训练样本数与说话人数,例如到德语任务约 20000 条、到法语任务约 20000 条、到中文任务约 9000 条,说话人数在 286 至 288 之间。样本不平衡主要来自各语料原始规模差异,中文目标任务训练量明显更小,这为后文中文目标性能整体偏低提供了条件背景。

采样层面,分层批量保证每批有多语言多情绪,但不能改变整体语言不平衡。若某语言总量小,它在跨语言正对中的出现频率仍受限,加权系数只能放大已抽到对的影响,不能无中生有。这是理解跨语言权重作用边界的重要细节。

评估在各目标测试集上算平均召回与宏 F1,9 组再算平均。论文的可视化固定用英语到德语任务,每语言每情绪随机抽 6 条测试语音做 t-SNE,观察的是已学隐表示的聚类行为,而非分类准确率本身。

主结果:完整版比可运行基线好多少,代价是什么?

要回答的核心问题是:在完全不用目标数据的前提下,结构损失是否比单纯增加辅助语言数据更有效。公平条件是同编码器同分类头,指标方向越高越好。下表把完整版与基线 2 的关系浓缩为平均指标与提升百分点,表中数字单元格均有逐字原句支撑。

系统平均 UAR平均 F1相对基线 2 的 UAR 提升相对基线 2 的 F1 提升
完整提出方法82.26%81.96%9.05%9.38%
基线 2可运行多语言微调基线可运行多语言微调基线基准基准

表后解释:论文报告完整版平均 UAR 与 F1 达到 82.26% 与 81.96%,相对基线 2 平均提升 9.05 个百分点与 9.38 个百分点,是 9 组中最接近上限的结果。即使只保留一路的版本仍整体优于基线,支持结构损失确有增量。但代价有二:一是仍需源加多辅助语言的标注与说话人标签,二是与目标监督上限平均约 91.92% 与 91.41% 量级仍有明显距离,尤其在中文目标的 3 组上绝对值偏低,说明通用表示尚未完全弥合语言与语料差异。

看图路径: 1. 先看图例确认颜色代表情绪而形状代表语言;2. 对比上排三块基线与上限的散点是混杂还是成团;3. 再看下排三块提出方法中完整版是否最紧凑分离

原论文 Figure 2:Visualizations of hidden representations extracted from (a) Baseline 1, (b) Baseline 2, (c) Upper…

论文图 2。原论文 Figure 2:“Visualizations of hidden representations extracted from (a) Baseline 1, (b) Baseline 2, (c) Upper Bound, (d) Proposed w/o LSupCLR, (e) Proposed w/o LSpkAdv, and (f) Proposed,…”。

从像素看,图 2 共六块 t-SNE 散点,左列图例以颜色区分情绪、以形状区分语言。上排基线 1 各色点大面积交织几乎无团块,基线 2 出现若干色团但类间仍粘连,上限在目标语言上成团清晰但其他语言判别性差。下排去对比版与去对抗版已比基线紧凑,但完整版右下块形成 4 个最紧凑分离的大团:黄色愤怒在左、绿色高兴在上、蓝色悲伤在右、红色中性在下,且同色内不同形状点混在一起,正是跨语言同情绪缝合的可视证据。需注意散点只是该次抽样的分布示意,不能读出精确数值,也不能把一组的紧凑推广为 9 组每组都同样紧凑。

反证:拿掉对比或对抗各掉多少?

消融要回答每一路是否必要,而非拿掉后必然怎样。比较对象是完整版与其两个变体,条件同编码同数据同评估。下表只放原句直接报告的平均值与下降百分点,避免把不同指标混入模型列。

系统平均 UAR平均 F1去除后 UAR 下降去除后 F1 下降
完整提出方法82.26%81.96%基准基准
去对比损失版本待验证需回原文表核对待验证需回原文表核对5.40%5.26%
去说话人对抗版本待验证需回原文表核对待验证需回原文表核对2.15%1.82%

表后解释:论文报告去掉有监督对比导致平均 UAR 与 F1 下降 5.40 个百分点与 5.26 个百分点,去掉说话人对抗导致下降 2.15 个百分点与 1.82 个百分点,支持对比是最大来源、对抗提供稳健性增益的判断。未胜出项也很明确:两个单路版本都不如完整版,说明单靠聚类或单靠去身份都不够。但限制是论文只做去除式消融,未报告只用对比加权而无分层采样、或不同权重取值的敏感性,权重选择的稳健性仍待验证。

边界与未验证的推测是什么?

直接报告的是 9 组平均与各组数字显示完整版优于基线,支持跨语言情绪对齐有效的解释。有限解释是可视化显示更紧凑的情绪团块,可能对应更好的泛化,但散点紧凑与准确率之间是相关而非因果,不能当作证明。

未验证的推测包括:更大权重是否一直更好、去说话人是否在所有语料上都不伤情绪韵律、中文目标偏低究竟是语言距离还是训练量小所致。论文未测量误判率分布、延迟、推理开销与训练成本,总体平均提升不等于每组每步都成立,更不能承诺延迟或成本改善。

信息条件边界是训练仍依赖多语言情绪标签与说话人标签,目标语言真正零接触。若实际只有单源语言而无辅助语言,该方法的跨语言正对将无法构造,效果待验证。未来工作提出更强对齐与多模态信息以逼近上限,这也反向说明单靠音频对比加对抗尚未闭合差距。

复现先做什么,需要补哪项验证?

值得尝试的时机是手头有源语言标注加少量辅助语言标注,但目标语言无任何数据,且怀疑模型在靠音色或语言猜情绪时。复现先做四件事:按论文统一四情绪标签与划分重建 9 组数据源,核对训练样本数与说话人数;按源语言加载对应 wav2vec 2.0 基础模型并保持跨系统同适配实现;实现分层批量保证每批多语言多情绪共存,再实现语言感知加权对比与梯度反转对抗;固定对比权重 1.0、对抗权重 0.3、跨语言权重 2.5 先跑通,再补学习率与早停的缺项。

还需补的验证是权重敏感性、不同随机种子的方差、每组显著性,以及中文目标低性能的归因分析。记录训练时长、显存与推理耗时,区分训练资源、推理开销与实际延迟。由于本次无可用资源链接,不应假设官方代码可下载,所有细节以论文文字为准。

收束:用一句话记住方法与适用条件

记住这条链:共享情绪标签提供类别结构,多语言批量提供跨语言正对,加权对比负责缝合语言,说话人对抗负责擦除音色,情绪分类负责守住判别目标。训练见源加非目标、不见目标,测试直接跨语言,这种信息隔离是所有零样本数字成立的前提。

当辅助语言多样且说话人多变时,该组合可能以较低数据成本提升跨语言情绪判别;当只有单语言或无说话人标签时,先补数据条件再谈方法。重提结果时应带条件:完整版平均约八成二,超多语言微调基线约 9 个百分点,去对比掉约 5 个百分点、去对抗掉约两个百分点,但仍低于目标监督上限。下一步验证应放在权重稳健性、误差归因与成本测量上,而不是重复摘要式的泛化断言。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总