英文题目:SETEAB: Multiscale approach with Squeeze-and-Excitation Temporal Enhanced Aware Block for Speech Emotion Recognition
会议身份:
conference:interspeech:2026:conference-paper-id:vo26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#CNN #高效推理 #鲁棒性 #语音 #语音情感识别
评分:6.1/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Duy Vo:机构信息未能从会议 PDF 纯文本可靠映射
- Kiet Anh Hoang:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Do:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音情感识别需从语音声学输入预测离散情绪类别,难点在于说话风格、语种与噪声差异大且情绪线索稀疏易变,跨库域偏移更使泛化异常困难。本文提出基于挤压激励时序增强感知模块的轻量多尺度框架 Squeeze-and-Excitation Temporal Enhanced Aware Block,简称 SETEAB,以兼顾精度与效率。方法链为深度卷积下采样先压缩短时冗余并保留显著情感线索,挤压激励残差模块 SE-Res2Block 再强化局部多尺度与通道判别性,时序增强感知模块 TEAB 堆叠负责双向长程情绪动态建模,最后由加权双向融合与多层聚合输出话语级表示。与 TIM-Net 直接相加双向特征不同,该框架引入预归一化与门控残差及全局方向权重与层级权重,实现自适应 past-future配比与多层级协同表达。在 EmoBox 协议下 5 个库内基准平均指标上,SETEAB R=2 平均非加权准确率 UA 为 47.69%,超过 TIM-Net 的 42.22% 与 MS-SENet 的 42.97%,同时跨库平均加权准确率 WA 达到 37.53%,高于 MS-SENet 的 34.31%。该结论限于 acted 与会话语音的 EmoBox 划分,尚未验证强噪声与自发情绪外推。成本方面模型仅约 0.4-0.5M 参数与 0.06-0.12G FLOPs,显著轻于 wav2vec 2.0 base 的约 95M 参数与 33.53G FLOPs。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,什么信息不能丢?
这篇论文研究的是语音情感识别,也就是听一段话,判断说话人处于哪种情感状态。输入是一段 utterance 级别的语音波形,论文先把它转成 Mel 谱图,记为时间帧数 T 与 Mel 频带数 M 构成的 2 维表示,输出是对整段话的情感类别预测。初学者容易把这件事理解成声音分类,但情感与音素、说话人、通道噪声混在一起,且说话风格、语言背景和环境噪声都会改变声学实现,所以模型必须在去掉冗余的同时保留随时间展开的情感起伏。
论文明确提出 3 个必须同时守住的目标:模型要紧凑,识别要准,换一个语料库仍能用。后续所有设计都围绕这三件事展开,前端压缩管紧凑,局部多尺度与通道校准管判别性,双向时序与加权融合管跨时间的情感动态。复述时要记住,输入是 16 kHz 重采样后的 80 维对数 Mel 谱,输出是整段话的类别,中间任何压缩都不能把情感变化的对比关系压平。
已有路线走到哪里,TIM-Net 留下了什么缺口?
早期方法依赖手工声学特征加支持向量机等传统分类器,后来卷积网络负责抓局部谱模式,循环网络负责抓帧间时序,再后来 Wav2Vec 2.0 与 WavLM 这类自监督模型把精度推高,但计算量大,难以部署到资源受限的边缘设备。于是轻量路线受到重视,例如基于深度可分离卷积与全卷积的 Light-SERNet,用更少的参数维持可比性能。在高效时序建模里,TIM-Net 是一个强基线,它用带空洞因果卷积的时间感知块堆叠起来抓多尺度时序依赖,MS-SENet 则在 TIM-Net 上加入多尺度融合与 Squeeze-and-Excitation 机制。
论文认为标准时间感知块仍有三处不足:缺少显式归一化可能带来优化不稳定与梯度衰减,标准卷积可能带来特征冗余且对时间分辨率控制有限,直接把双向结果相加默认过去与未来同等重要,未必符合情感动态。这三点直接对应后文的 4 个改动,学习时不要把它们当成泛泛批评,而是每个缺口对应一个可核对的组件替换。
要解决的具体矛盾是什么?
论文要解决的矛盾是精度、效率与泛化三者难以兼得。大模型精度尚可但参数与浮点运算量大,小模型省资源但时序建模能力与跨库稳定性不足。具体到 TIM-Net 这条线,问题被拆成 4 个可操作的子问题:早期帧序列冗余导致计算浪费,局部多尺度特征缺乏通道选择,时序块稳定性与特征复用不足,双向与多层融合方式过于简单。
举例来说,如果一段话的愤怒集中在后半段,前半段平稳,那么等权重的双向相加会稀释后半段的贡献,多层等权平均也会稀释最具判别力的那一层。论文把例子中的这种不对称性变成可学习权重来处理,但例子本身只是帮助理解,论文并未给出该例的具体数值,效果必须回到后文表格中的平均指标与跨库指标去核对。
一个样本如何走完输入到输出?
沿着一个样本走一遍最清楚。输入语音先提取 Mel 谱图 X,再经过深度卷积下采样得到压缩特征 Z,压缩倍率由下采样块数决定。Z 同时走两条路,一条按原始时间顺序,一条按反转时间顺序,每条先过 SE-Res2Block 做局部多尺度与通道校准,得到双向的初始表示。接着每条路各堆叠 8 个时间增强感知块,逐层精炼时序表示,每一层的双向输出先做加权双向融合成该层特征,所有层的特征再做多层聚合得到整段话表示 f,最后送入分类头。
论文强调分工:前端先去短时冗余,中间局部模块强化判别线索,时序栈负责长程情感动态,融合模块负责方向与层级的不对称整合。下图是理解该流水线的唯一像素依据,先看主路径再看分支汇合,不要只记模块名字。
从左侧特征提取经下采样进入上下双分支特征学习,再经融合进入分类头的整体布局值得先建立方向感,图中上下两路分别对应前向与反向时间,中间成对融合与右侧多层融合是复述时最容易漏掉的环节。
看图路径: 1. 先从左侧语音与 Mel 谱输入出发,沿下采样箭头看到上下两条前向与反向分支;2. 再看每层 TEAB 输出如何成对汇入中间的加权融合得到 f1 至 fn;3. 对照下方两个展开框,核对 SE-Res2Block 的卷积与 SE 顺序以及 TEAB 的归一化到门控顺序;4. 最后确认融合后的 f 进入分类头的单向箭头
论文图 1。原论文 Figure 1:“Overview of the proposed SETEAB for speech emotion recognition with four key improvements: depthwise convolution subsampling, SE-Res2Block, the proposed Temporal Enhanced Aware…”。
上图显示输入分支、堆叠时序块、层级融合与分类头构成闭环,下方两个展开框分别给出 SE-Res2Block 与时间增强感知块的内部顺序。可见 SE-Res2Block 保持残差直连并在末端做通道加权,时间增强感知块从层归一化与逐点扩展开始,经深度卷积、批量归一化、丢弃与 Sigmoid 门回到残差相加。复述时要说清双向不是两个独立模型,而是同一类块在正序与逆序输入上递归应用,融合权重与层级权重是后文训练学到的参数。
前端压缩与局部校准做了什么?
前端下采样的白话含义是把时间轴变短。论文采用类似 FastConformer 的做法,每个块步长为 2、核大小为 3,第一个块用标准 2 维卷积,其余块用深度可分离卷积,总压缩倍率为 2 的 NS 次方。实现上先对 Mel 谱做 1 次带激活的 2 维卷积,再对中间结果反复做深度卷积加逐点卷积并加激活,时间长度按公式逐步减半。论文报告了 R 为 2 与 R 为 4 两个变体,R 越大序列越短、计算越小,但压缩过狠也可能丢掉细粒度情感对比,后文用平均指标来权衡。
局部精炼由 SE-Res2Block 承担,它先用 3 段 1 维卷积结构展开多尺度局部模式,其中中间一段为带空洞的多尺度卷积,再用全局平均池化压缩时间维,用两层全连接学通道权重并做逐通道相乘,最后与输入相加保留原表示。
深度可分离卷积下采样 × 情感线索保留: 深度可分离卷积下采样负责用更少的参数和计算把过密的短时帧序列压缩下去,情感线索保留是它必须守住的目标,二者搭配的理由是情感变化比音素变化慢,不必逐帧保留,组合意义在于前端先去掉冗余短时起伏,让后续时序模块只处理更紧凑且仍含情感起伏的序列。
SE-Res2Block × 通道重标定: SE-Res2Block 负责在局部给出多尺度时间感受野,通道重标定负责判断哪些通道更与情感有关,二者搭配的原因是多尺度分支会产生大量通道,若不加权则噪声通道与情感通道同等参与,组合意义是先展开局部多样性,再用全局平均池化与两层全连接学到的权重把情感相关通道放大。
初学者要分清,前端解决的是时间冗余与计算量,SE 模块解决的是通道选择,二者不互相替代。论文把下采样放在 SE 之前,顺序含义是先压缩再精炼,避免在过长序列上浪费局部建模容量。
TEAB 与加权融合如何建模时间?
时间增强感知块是论文对 TIM-Net 时间感知块的升级。白话说,它是一个带归一化、扩通道、深度滤波与门控的时序单元。输入是通道数为 64 的序列,先做层归一化,再用逐点卷积把通道扩展 4 倍并加激活,接着用核大小为 3 的深度卷积做时间方向滤波,再经激活、批量归一化与丢弃得到门控前的响应,经 Sigmoid 变成 0 到 1 的门,最后用门对原输入做逐元素加权并与原输入相加。空洞因子按层指数增长,第 i 层为 2 的 i 减 1 次方,丢弃率为 0.1,方向上正序与逆序各堆 8 块。
加权双向融合替代了直接相加,它引入全局共享的两个可学习标量 a 与 b,分别缩放前向与后向特征后再做全局平均池化,多层聚合再引入每层一个可学习权重。2 阶段含义不同,a 与 b 管方向不对称,层权重管层级不对称。
TEAB × 门控残差: TEAB 负责对压缩后的序列做稳定的双向时序建模,门控残差负责决定在原表示上叠加多少新强调,二者搭配的原因是直接替换容易丢失原有信息而直接相加又缺乏选择性,组合意义是保留从输入到输出的直连通路,同时用 Sigmoid 门逐位置调节强调强度,只放大时序上显著的情感片段。
前向时序 × 后向时序: 前向时序负责累积过去对当前的影响,后向时序负责从未来回看当前在情感走向中的位置,二者搭配的原因是情感高潮往往需要前后对比才能确认,直接等权相加默认过去未来同等重要,组合意义是用全局可学习权重 a 与 b 先平衡 2 个方向,再用层级权重 λ 整合多层,形成更符合情感动态的 utterance 表示。
复述时不要把空洞、扩展、门控混为一谈:扩展增加通道表达容量,空洞扩大时间感受野,门控决定保留多少,二者缺一都会改变论文报告的精度与效率平衡,但论文未逐项给出拿掉空洞的独立数值,不应自行推断必然下降多少。
训练时更新什么,如何防止过拟合?
训练是有监督分类训练,目标是交叉熵,输出是整段话的情感类别。优化器用 Adam,初始学习率为 0.001,1 阶与 2 阶动量系数分别为 0.93 与 0.98,权重衰减为 1e-6,学习率每轮乘 0.98 衰减。批量大小按数据集区分,MELD 与 IEMOCAP 为 16,其余数据集为 32,论文说明这是受配备 Intel Core i7-12800、32 GB 内存与 4 GB 显存 RTX A1000 工作站的硬件限制。防止过拟合的手段包括概率为 0.2 的随机数据增强、谱增强、标签平滑系数 0.1 与耐心为 20 轮的早停。
数据增强包括正负 5 帧的随机时移、正负 2 个半音的音高扰动、0.8 至 1.2 倍的联合语速音高缩放、系数为 0.8 的时间拉伸,以及训练时对谱特征做谱增强。论文明确给出了可学习融合权重的存在,但未单独说明哪些参数冻结、梯度是否截断、何时重置融合权重,复现时应按全部参数参与交叉熵优化来理解,缺失的冻结与截断细节不应自行脑补。硬件与批量设置意味着换卡或换批量可能改变结果,比较时要固定这些条件。
数据、划分、指标与基线如何保证可比?
库内评价采用 EmoBox 基准协议,以保证划分标准与可复现比较,数据集包括 EMOVO、IEMOCAP、RAVDESS、MELD 与 CREMA-D,指标为非加权准确率与宏 F1,方向都是越高越好,目的是反映类别平衡性能。跨库评价同样遵循该基准,在 IEMOCAP、RAVDESS、MELD 与 SAVEE 上做训练测试域错开的组合,指标为加权准确率,用于考察域偏移下的泛化。音频统一重采样到 16 kHz,用 25 ms 窗与 10 ms 帧移提取 80 维对数 Mel 谱并做倒谱均值归一化。基线包括 wav2vec 2.0 base、TIM-Net 与 MS-SENet,复杂度按 5 秒输入统计参数量与浮点运算量。
非加权准确率 × 宏 F1: 非加权准确率负责按类别先算召回再平均,避免大类主导结论,宏 F1 负责同时考虑每类的精确率与召回率,二者搭配的原因是情感数据常类别不平衡,只看总体准确率会掩盖小类失效,组合意义是在库内评价时同时报告二者,以类别平衡视角检验轻量压缩是否损害了小类情感。
需要提醒的是,库内用类别平衡指标而跨库用加权准确率,二者聚合对象不同,不能把两类数字直接相减比较。论文未报告显著性检验与随机种子方差,跨库只给出均值与标准差,阅读时应把均值差距与较大标准差放在一起看,不能只记最高值。
库内精度与效率的 trade-off 究竟如何?
要回答的核心问题是轻量模型是否在更小开销下取得了更高的平均精度,比较必须在同一 EmoBox 划分与同为 5 秒输入统计开销的条件下进行,指标越高越好而参数与浮点运算越低越好。下表把论文正文直接报告的平均指标与开销放在一起,R 表示下采样率,变体范围对应 R 为 2 与 R 为 4 的两档,最后一列只转述论文的定性判断,不引入新数值。
| 评价条件 | 指标 | wav2vec 2.0 base | SETEAB 变体范围 | 原文结论 |
|---|---|---|---|---|
| 5 秒输入统计 | 参数量 | 95M | 0.4-0.5M | 变体显著更小 |
| 5 秒输入统计 | 计算量 | 33.53GFLOPs | 0.06-0.12GFLOPs | 变体显著更低 |
下图比较四者在计算与精度平面上的位置,重点看两个 SETEAB 圆点是否同时靠上,以及 R 为 4 是否在精度接近的情况下明显靠左。
看图路径: 1. 先确认横轴为 FLOPs(G) 而纵轴为 UA score(%),越靠上表示识别越好;2. 比较左上红色 R=4 圆点与右上绿色 R=2 圆点在纵轴上的接近程度与横轴上的左右距离;3. 再看左下蓝色 TIM-Net 与右下橙色 MS-SENet 的纵轴高度明显低于两个 SETEAB 圆点
论文图 2。原论文 Figure 2:“Comparison of performance–efficiency trade-off in terms of FLOPs(G) and UA% across baseline and our models.”。
上图可见两个 SETEAB 圆点纵轴明显高于 TIM-Net 与 MS-SENet,其中 R 为 4 的红色圆点在横轴约 0.06 附近仍保持与 R 为 2 相近的高度,而 TIM-Net 蓝色圆点虽横轴也很靠左但纵轴最低。这支持论文所说的 R 为 4 在保持竞争精度的同时大幅降低计算,但也显示 TIM-Net 在极低计算下精度损失更大。像素能辨别的是相对位置与标注文字,不能从圆点大小读出精确参数量,数值仍以正文表格为准。
跨库泛化是否更稳?
为检验跨库泛化是否只是单组偶然,下表把 4 种模型跨库加权准确率的均值与波动并列,重点看均值领先与标准差之间的权衡。
| 模型 | 平均 WA (%) | 标准差 | 12 组第一数 | RAVDESS 上表现 |
|---|---|---|---|---|
| wav2vec 2.0 base | 27.67 | 5.27 | — | — |
| TIM-Net | 32.78 | 5.18 | — | — |
| MS-SENet | 34.31 | 4.35 | — | — |
| SETEAB | 37.53 | 8.20 | 7 | 在 3 个训练来源下均最高 |
表后要同时讲支持与限制。支持来自均值 37.53% 高于 34.31%、32.78% 与 27.67%,且在 12 组跨库组合中 7 组第一,尤其在 RAVDESS 作为测试集时 3 个训练来源下均最高,说明压缩加校准加门控的组合学到了更可迁移的表示。限制是 SETEAB 的标准差为 8.20%,大于其他模型的 4 至 5 个百分点,说明平均优势伴随更大的跨组波动,总体趋势不等于每一组都更稳。论文未报告跨库的类别级误差与统计检验,也未评测噪声、语种错配等更贴近实际的边界,不能把跨库均值领先直接推广为野外部署必然更可靠。
每个组件是否都带来了增益?
消融要回答的是双向融合基线之上,加入通道校准与下采样是否继续提升。论文以仅有加权双向融合为起点,逐步加入 SE-Res2Block、深度下采样与双向下采样变体,评价仍是五库平均 UA 与平均 F1。报告的趋势是加入 SE-Res2 后表示能力提升,再加入下采样后平均指标进一步提升,完整模型取得最好整体性能。
需要指出,论文给出的消融是平均指标层面的趋势,未报告每个数据集上的逐项变化,也未给出拿掉 TEAB 门控或归一化的独立对照,因此只能说在已有组合下各组件正向贡献得到支持,不能反推任一组件在所有语料上都不可或缺。复现消融时应固定增强、优化器与早停条件,否则平均指标的微小差距可能被训练噪声淹没。
还有哪些没测、没讲清、不能承诺?
首先是资源声明,原文未发现来源绑定且完成验证的开源资源,因此不能声称代码、模型或数据已公开,复现只能依据论文文字与超参数自行实现。其次是缺项,论文未说明随机种子、重复次数、显著性检验、融合权重初始化与重置时机,也未给出梯度截断与参数冻结细节,这些都会影响复现方差。
第三是测量边界,库内只报告类别平衡指标而未报告延迟、内存峰值与误判代价,跨库只报告加权准确率而未报告每类性能,效率只用参数量与浮点运算表示,训练资源、推理开销与实际延迟需要分别讨论。第四是冲突与口径风险,若表头单位与数据格写法不一致,应以原文表头与相邻说明为准,不自行换算百分点与相对百分比。
最后是因果措辞,组件与指标提升之间是相关支持而非严格因果,未做反事实干预时应使用报告与支持的表述,跨库方差较大的部分应使用待验证的表述。
要复现应先固定什么,再跑什么?
复现的第一步是固定信息条件:按 16 kHz 重采样,用 25 ms 窗、10 ms 帧移提取 80 维对数 Mel 谱并做倒谱均值归一化,采用 EmoBox 划分,库内看非加权准确率与宏 F1,跨库看加权准确率。第二步是固定训练条件:Adam 参数与衰减策略、标签平滑 0.1、耐心 20 轮早停、增强概率 0.2 的具体扰动范围与谱增强、批量大小按数据集取 16 或 32。第三步是固定模型条件:通道数 64、逐点扩展比 4、深度卷积核 3、丢弃 0.1、空洞按 2 的幂增长、每方向 8 个 TEAB,以及 R 为 2 与 R 为 4 两档下采样。
建议先复现 TIM-Net 基线与加权融合基线,再依次加入 SE-Res2Block 与下采样,观察平均指标变化是否与论文趋势一致。由于没有官方代码与权重可供下载,任何第三方实现都应声明为自行复现,比较时保留实际可运行的基线,不得用搜索最优或事后挑选的最优层权重代替可部署收益。
何时值得尝试这种设计?
当任务是整段话情感分类、输入为 Mel 谱序列、部署预算有限且需要在多个语料间迁移时,SETEAB 的思路值得尝试:先用深度可分离下采样把序列压短,再用通道校准保留情感相关维度,再用带归一化与门控的双向时序块建模不对称的情感动态,最后用方向权重与层级权重做 2 阶段融合。它的可核对证据是五库平均与跨库平均的同时领先以及数量级更小的开销,它的代价是跨库波动更大且实现细节依赖自行补齐。
后续最值得补的验证是固定种子多次重复并报告方差与检验,补充每类性能与真实设备延迟,以及在噪声与语种偏移下的跨库边界。只有补齐这些,才能把论文显示的精度效率平衡真正转化为可部署的稳健收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

