📄 Explainable Lightweight Compact Deep Models for Speech Emotion Recognition
标签:#语音情感识别 #低资源 #可解释性 #音频理解 #Transformer
5.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5
📝 5.4/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音情感识别 | #低资源 | #可解释性 #音频理解 | arxiv
👥 作者与机构
- 第一作者:Nelly Elsayed
- 通讯作者:未说明
- 作者列表:Nelly Elsayed(论文中仅列出此一位作者,未标注机构)
💡 毒舌点评
本文试图在资源受限设备上部署语音情感识别系统这一有前景的方向上做出贡献,其“轻量”和“可解释”的目标设定是务实的。然而,论文的实际执行与声称的雄心之间存在巨大鸿沟。最致命的问题在于其实验验证的力度远远不足以支撑其结论:仅仅在一个极小(480样本)、说话人稀缺(4人)且性别单一(均为男性)的SAVEE数据集上进行了评估。尽管采用了留一说话人协议,但如此有限的样本量使得报告的高达96.875%的准确率和0.977的UAR极可能缺乏统计稳健性,其泛化能力存疑。论文在对比实验中,将自家结果与众多背景不同的历史工作进行“表格并列”,并轻描淡写地注明“谨慎解读”,这本质上是一种不公平的比较,无法证明本文方法的优越性。所谓的“可解释性”分析仅停留在对单个样本的定性观察,未能系统地验证Grad-CAM或注意力权重与情感预测之间的因果关联,使该部分工作流于表面展示。此外,关键的模型架构细节(如CNN各层具体配置)缺失,且未开源任何代码或模型,使得论文的可复现性和实际工程价值大打折扣。总体而言,这是一篇目标明确但执行粗糙、证据不足的论文。
📌 核心摘要
本文旨在解决语音情感识别(SER)模型在资源受限设备上部署时面临的计算成本高和可解释性差的问题。作者提出了一种基于轻量级卷积神经网络(CNN)的可解释SER框架,其核心是使用对数梅尔频谱图(log-Mel spectrogram)作为输入特征,通过一个仅包含约33k参数的紧凑CNN进行特征提取,并采用注意力统计池化(ASP)机制来聚焦于情感信息丰富的时段。为提升模型透明度,框架集成了基于梯度的类激活映射(Grad-CAM)作为事后解释工具。 与现有依赖复杂深度混合架构的方法相比,本文的新意在于将轻量化、可解释性设计明确地整合到一个部署导向的pipeline中。实验在SAVEE数据集上报告了96.875%的准确率和0.977的UAR,参数量远低于对比的基线模型(如1M至26M)。这表明紧凑架构在理论上可能达到高性能。然而,该结果的可靠性受限于实验设置:SAVEE数据集过小(480条音频,仅4名男性说话人),评估协议虽为留一说话人(leave-one-speaker-out),但样本量不足以支撑统计显著性;同时,论文未提供任何代码或模型,完全无法复现和验证。 实际意义在于为边缘设备SER提供了一种轻量化设计思路和初步的可解释性分析框架。主要局限性包括:实验验证不充分(数据集过小、缺乏跨数据集和跨架构的公平比较)、未开源任何成果、以及可解释性分析仅停留在单一样本的定性展示层面,未能验证其预测与真实情感标签的因果关联。
🔗 开源详情
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及
- 数据集:Surrey Audio-Visual Expressed Emotion (SAVEE) 数据集。论文中未提供直接的下载链接,但描述了数据来自四位男性说话者,共480条语句。
- Demo:论文中未提及
- 复现材料:论文中提供了详细的训练配置,包括:使用Adam优化器(学习率
\(2\times10^{-3}\),权重衰减\(10^{-3}\))、批量大小为32、训练160个epoch、FFT大小400(窗口25ms,帧移10ms)、64个Mel滤波器、所有语句被填充或裁剪至4秒固定长度。实验使用了固定随机种子以确保可复现性。但论文未提供具体的代码、检查点或附录材料。 - 论文中引用的开源项目:论文中主要引用了学术论文,并未明确提及或列出特定的第三方开源项目或工具的链接。
🏗️ 方法概述和架构
本文提出的语音情感识别(SER)框架是一个模块化、端到端的流水线,其设计核心在于平衡模型的识别精度、计算效率与预测可解释性。该框架的整体流程可以概括为:原始语音信号输入 → 基于对数梅尔频谱图(log-Mel spectrogram)的特征提取 → 经由一个轻量级卷积神经网络(CNN)主干进行特征编码 → 通过注意力统计池化(ASP)模块将时变特征聚合为固定长度的句子级表征 → 最终由全连接层完成情感类别预测。同时,框架集成了梯度加权类激活映射(Grad-CAM)作为事后可解释性分析工具,独立于训练过程,用于可视化模型决策所依赖的时频区域。下面将对各核心组件的结构、功能、数据流及关键设计选择进行详细阐述。
1. 整体流程与数据流 整个系统处理流程始于一段原始数字语音信号(通常以16kHz采样)。该信号首先被送入特征提取模块,经过一系列信号处理操作,转换为一个二维的、归一化的对数梅尔频谱图。这个频谱图作为深度学习模型的输入,被送入紧凑CNN主干网络。CNN对这个二维图像进行多层次的卷积处理,逐步提取出包含局部时频情感模式的二维特征图序列。随后,这些特征图通过一个关键的注意力统计池化(ASP)模块:首先沿频率轴进行平均,得到一系列对应于时间帧的特征向量;然后,ASP机制学习注意力权重,对这些时变向量进行加权,计算出一阶统计量(加权均值)和二阶统计量(加权标准差),并将它们拼接起来,形成一个固定长度的句子级嵌入向量。这个嵌入向量最后被送入一个或多个全连接层进行分类,输出对应7种情感类别的预测概率。在推理和分析阶段,可并行运行可解释性模块(Grad-CAM),它作用于CNN最后一层的特征图,生成热力图,并与输入频谱图叠加,以直观展示模型决策关注的时频区域。整个数据流是单向的:特征提取 → CNN特征编码 → ASP时间聚合 → 全连接分类 → 输出预测;同时Grad-CAM分支进行独立的解释性分析。
2. 核心组件详述
- 2.1 特征提取模块
- 功能:将一维时域语音波形转换为二维的、适合CNN处理的时频表示,并减少说话人及录音环境变异的影响。
- 内部结构与实现:该模块是一个固定的信号处理流水线,不包含可学习参数。
- 分帧与加窗:输入语音信号首先被分割成重叠的短时帧(帧长25ms,帧移10ms),并对每帧施加窗函数。
- 短时傅里叶变换(STFT):对每一帧应用STFT(FFT点数400),得到复数频谱,然后取其幅度平方,得到功率谱。
- 梅尔滤波器组投影:将功率谱通过一组64个三角形的梅尔滤波器组。这些滤波器模拟人耳对频率的非线性感知,在低频区域分辨率高,在高频区域分辨率低。投影后得到64维的梅尔频谱。
- 对数压缩:对梅尔频谱的每个值取对数(并加入一个极小值ε以防数值溢出),得到对数梅尔频谱。对数压缩能缩小数值的动态范围,并使特征分布更接近高斯分布。
- 定长裁剪/填充与归一化:由于语音长度不一,所有语句的频谱图在时间维度被裁剪或零填充至固定长度(例如4秒)。随后进行每句归一化,即对每个语句的频谱图独立计算均值和方差并做标准化。这一步旨在削弱录音条件和说话人个体差异带来的特征偏移。
- 输入:原始语音波形(16kHz采样)。
- 输出:归一化的对数梅尔频谱图,其形状为 (频率滤波器数, 时间帧数),即 (64, T)。这是一个二维矩阵,可视为单通道图像。
紧随本段的图5展示了一个被正确分类为“惊讶”的语音样本的Log-Mel频谱图输入。

图中横轴为时间帧,纵轴为梅尔频率箱;零填充用于将不同长度的语音处理为固定长度输入,体现了特征提取模块的输出形式。
2.2 紧凑CNN主干网络
- 功能:作为特征编码器,从输入的时频表示中学习与情感表达相关的局部和层次化的时空模式。
- 内部结构与实现:这是一个设计为“浅层”和“轻量级”的卷积神经网络,旨在以极低的参数量(约33k)捕获有效信息。
- 结构概览:网络由一个初始的卷积stem层和后续的三个紧凑卷积块堆叠而成。这种浅层结构与使用LSTM/GRU的深层混合架构形成对比,是作者为追求极致轻量化所做的关键设计选择。
- Stem层:作为网络的入口,通常使用一个卷积层对输入频谱图进行初步的特征变换和可能的通道数提升。
- 紧凑卷积块:每个块内部结构相同,依次包含:
- 卷积层:使用小尺寸的卷积核(论文未指定具体尺寸,但这是轻量化设计的常见选择)在时频维度上滑动,提取局部特征。
- 批归一化(Batch Normalization):对每个mini-batch内的特征进行归一化,加速训练收敛并起到一定的正则化作用。
- 非线性激活函数:引入非线性,通常使用ReLU或其变体。
- Dropout:在训练期间随机丢弃一部分神经元的输出,以防止模型过拟合,增强泛化能力。
- 输入:归一化的对数梅尔频谱图,形状为 (64, T, 1)。
- 输出:一组编码了时频维度情感模式的二维特征图,形状大致为 (H’, W’, C),其中C是卷积后得到的特征通道数,H’和W’是经过卷积(可能带下采样)后的频率和时间维度尺寸。这些特征图仍然保留了时间维度的结构。
2.3 注意力统计池化(ASP)模块
- 功能:将CNN输出的、具有可变时间长度的二维特征图序列,聚合为一个固定长度的、对情感信息敏感的句子级表征向量。它是连接时变特征与定长分类输入的关键桥梁,并提供了时间维度的可解释性。
- 内部结构与实现:
- 频率维度平均:首先,对CNN输出的每个时间步的特征图,在频率维度(H’)上取平均值,得到一个时间步的特征向量序列
{𝐡_t},其中𝐡_t ∈ ℝ^C,t = 1, ..., T'。 - 注意力权重学习:该模块包含一个可学习的注意力子网络(通常是一个小型的全连接层或MLP),它以每个时间步的特征向量
𝐡_t为输入,输出一个标量分数e_t。然后,通过Softmax函数将所有时间步的分数归一化,得到注意力权重α_t,满足Σα_t = 1。α_t表示了模型认为第t个时间帧对于当前情感判断的重要程度。 - 统计量计算:利用注意力权重
α_t,计算两个一阶和二阶统计量:- 注意力加权均值向量
𝝁:𝝁 = Σ_t (α_t * 𝐡_t)。它代表了在考虑了时间重要性后的特征均值。 - 注意力加权标准差向量
𝝈:𝝈 = sqrt( Σ_t (α_t * (𝐡_t - 𝝁)^2) )。它捕获了特征在时间上的变异程度,提供了超越均值的附加信息。
- 注意力加权均值向量
- 嵌入拼接:最终的句子级嵌入向量
𝐳由𝝁和𝝈拼接而成:𝐳 = [𝝁; 𝝈] ∈ ℝ^{2C}。
- 频率维度平均:首先,对CNN输出的每个时间步的特征图,在频率维度(H’)上取平均值,得到一个时间步的特征向量序列
- 输入:CNN输出的、经过频率平均后的时变特征向量序列
{𝐡_t}。 - 输出:固定长度的句子级嵌入向量
𝐳,以及注意力权重序列{α_t}(可用于解释)。 - 交互:该模块接收CNN的特征图,输出给分类器。同时,注意力权重
{α_t}可被单独提取出来进行可视化分析。
2.4 分类器
- 功能:将句子级嵌入向量映射到情感类别空间,产生最终的预测。
- 内部结构与实现:通常由一个或多个全连接层构成。最后一层的神经元数量等于情感类别数(本例中为7:愤怒、厌恶、恐惧、快乐、悲伤、惊讶、中性),并使用Softmax激活函数输出每个类别的概率。训练时通常采用交叉熵损失函数。
- 输入:来自ASP模块的句子级嵌入向量
𝐳。 - 输出:7维向量,表示各情感类别的预测概率。
2.5 可解释性模块(Grad-CAM)
- 功能:作为事后分析工具,可视化CNN在做出预测时所关注的时频区域,提升模型决策的透明度。
- 内部结构与实现:该模块独立于模型训练,只在分析时运行。其工作原理如下:对于一个给定的目标类别(例如模型预测的“惊讶”),计算该类别得分(通常是Softmax之前的逻辑值)相对于CNN最后一个卷积层输出特征图的梯度。这些梯度在特征图的空间维度(时间与频率)上进行全局平均池化,得到每个特征通道的重要性权重。然后,将这些通道重要性权重与对应的特征图进行加权求和,并通过ReLU激活,生成一个类别的激活热力图。最后,将此热力图上采样至输入频谱图的大小,并与原始的对数梅尔频谱图叠加显示。
- 输入:CNN最后一层的特征图,以及目标类别的得分。
- 输出:与输入频谱图尺寸相同的热力图,高亮区域表示对预测贡献大的时频区域。
- 交互:与CNN主干网络单向连接,仅读取其特征图和梯度,不修改模型参数或预测结果。
下图展示了Grad-CAM激活热力图在原始Log-Mel频谱图上的叠加可视化。

图中高激活区域(亮色部分)与语音中声学显著的成分对齐,表明模型决策关注于特定的时频区域,增强了预测的可解释性。
3. 组件间的数据流与交互方式
数据流严格遵循前向传播路径:原始语音 → 特征提取 → CNN → ASP → 分类器 → 输出预测。这是一个串行的主流程。可解释性模块(Grad-CAM)作为一个并行分支,在训练完成后单独激活。它需要两次前向/后向传播:一次正向计算得到预测结果和最后一层特征图,一次反向传播计算梯度。该分支的数据流是:(CNN最后一层特征图 + 预测类别梯度) → Grad-CAM计算 → 热力图。ASP模块内部的注意力权重 {α_t} 是另一个重要的可解释性信号,它在主流程中自然产生,可以直接提取用于分析模型在时间轴上的关注点。
4. 关键设计选择及其动机
- 选择轻量级CNN而非深度混合架构:这是本文最核心的设计选择。动机明确是为了面向资源受限环境(如边缘设备、移动终端)。通过使用浅层、少通道的CNN,避免使用计算开销大的LSTM/GRU等循环单元,将模型参数量压缩至33k级别(Table I),实现了极低的存储和计算开销。
- 采用log-Mel频谱图作为输入特征:这是图像式SER方法的经典选择。其动机在于平衡信息保留与计算效率。梅尔滤波器组模拟人耳感知,能有效提取与情感相关的韵律和频谱特征;对数压缩符合听觉系统的非线性响应;二维图像形式便于利用成熟的CNN进行处理。虽然增加了预处理开销,但相比直接处理原始波形,通常能获得更稳定的性能。
- 引入注意力统计池化(ASP):简单的全局平均池化会忽略时间动态性。ASP的动机是显式地建模时间维度的重要性,让模型能够聚焦于语音中情感表现最强烈的片段(如语调突然升高的部分)。同时,其生成的注意力权重
α_t天然地提供了一种时间维度的可解释性信号,这是全局平均池化无法提供的。 - 集成Grad-CAM进行事后解释:轻量化和压缩可能牺牲部分模型透明度。引入Grad-CAM的动机是弥补“黑箱”模型的缺陷,通过可视化时频热力图,帮助用户理解模型是否关注了符合人类直觉的情感相关声学线索(如能量、音高变化区域),从而增强信任和调试能力。
- 整体模块化设计:将流程清晰划分为特征提取、特征编码、时间聚合、分类和解释五个模块。这种设计职责清晰,便于理解、修改和扩展。例如,可以相对独立地替换CNN主干或尝试不同的池化策略。
5. 架构图描述 论文图2展示了整个框架的架构。图中从左到右清晰地描绘了完整的处理流程:最左侧是原始语音波形;其后是特征提取模块,输出标有“时间”和“频率”轴的log-Mel频谱图;频谱图被送入一个标记为“Compact CNN Backbone”的模块,该模块由一系列卷积层(图中可能用方框表示)构成;CNN输出的特征图序列连接至“Attentive Statistics Pooling”模块,该模块内部示意了注意力权重和统计量计算;ASP的输出(句子级嵌入)再连接至“FC Classifier”模块,最终输出情感标签。与此同时,从“Compact CNN Backbone”到“Grad-CAM”有一条并行的箭头,表示特征图被送入Grad-CAM模块进行独立分析。整个图示直观地体现了主流程与可解释性分支并存的系统架构。
下图展示了本文提出的轻量级可解释语音情感识别框架的整体架构。

图中清晰地描绘了从语音输入到情感预测的完整流程,包括特征提取、紧凑CNN编码、注意力统计池化以及并行集成的Grad-CAM可解释性模块。
💡 核心创新点
- 面向部署的轻量级SER流水线整合:将紧凑CNN、注意力统计池化和Grad-CAM可视化明确整合为一个面向边缘/移动设备部署的端到端SER框架。其创新性不在于单个技术组件,而在于针对“可解释”与“轻量”这一双重目标的系统性工程组合,旨在提供一种实用的部署解决方案。
- 极致轻量的模型设计:在SER任务上探索了模型参数的极限压缩(仅33k参数),并报告了在小数据集上仍能保持高精度的可能性。这为在计算和内存资源极其有限的IoT或嵌入式设备上部署SER提供了理论上的探索。
- 多粒度可解释性分析框架:不仅使用Grad-CAM进行特征级别的可视化,还利用ASP模块产生的注意力权重进行时间维度的重要性分析。这种结合从“模型关注什么频段”和“模型关注什么时段”两个层面提供了可解释性,比单一解释方法更全面。
📊 实验结果
论文的主要实验在SAVEE数据集上进行,采用留一说话人(leave-one-speaker-out)协议(3人训练验证,1人测试)。关键结果如下表所示。需要特别注意的是,所有对比实验均基于作者整理的文献结果,且各研究使用的数据集划分、特征、预处理可能不同,因此对比仅为“高阶比较”,非严格公平。
表III:在SAVEE数据集上与现有方法的性能对比(根据论文Table III整理)
| 模型 | 特征表示 | 架构 | 准确率 (%) | 参数量 |
|---|---|---|---|---|
| Mountzouris et al. | Log-Mel spectrogram | CNN + Attention (ATN) | 74.0 | ~0.5–2 M |
| Liu et al. | Spectrogram features | CNN + Attention + LSTM fusion | 94.5 | ~3–15 M |
| Ali et al. | Hybrid MFCC features | CNN classifier | 93.0 | ~0.2–2 M |
| Mishra et al. | eGeMAPS features | Deep Belief Network | 56.76 | ~0.1–2 M |
| Pinnamaraju et al. | Spectrogram features | ResNet (transfer learning) | 85–90 | ~11–26 M |
| Ottoni et al. | Spectrogram features | Meta-learned CNN | 90.62 | ~0.8–3 M |
| Ahmed et al. | Spectrogram features | 4-layer CNN | ~76 | ~1 M |
| Nath et al. | Handcrafted features | Random Forest (ML baseline) | 72 | ~0.5 M |
| Nath et al. | Acoustic features | BiLSTM | 72 | ~5 M |
| Ouyang et al. | Spectrogram features | CNN-LSTM hybrid | 61.1 | ~1–5 M |
| 本文方法 | Log-Mel spectrogram | Compact CNN + ASP + XAI | 96–97 | 0.033 M (33,208) |
表II:本文模型在SAVEE测试集上的详细评估指标(根据论文Table II整理)
| 指标 | 值 |
|---|---|
| 准确率 (Accuracy) | 96.875% |
| 未加权平均召回率 (UAR) | 0.977 |
| Cohen‘s Kappa | 0.96184 |
| 95% 置信区间 | (0.93, 1.00) |
| Hamming Loss | 0.03125 |
| F1-score | 0.96875 |
| 误报率 (FPR) | 0.0052 |
| 漏报率 (FNR) | 0.0313 |
| 召回率 (TPR) | 0.9688 |
| 特异性 (TNR) | 0.9948 |
表I:模型训练特性(根据论文Table I整理)
| 指标 | 值 |
|---|---|
| 训练时间 | 245.87 秒 |
| 每个Epoch平均时间 | 2.08 秒 |
| 可训练参数数量 | 33,208 |
| 训练准确率 | 98.33% |
关键消融实验与细分结果:论文未提供任何消融实验(如移除ASP、移除Grad-CAM、改变CNN深度/宽度对性能的影响)。虽然论文展示了混淆矩阵(Figure 3),但未给出不同情感类别的详细细分性能数值。可解释性部分仅给出了对单一样本的定性分析图(Figure 5-8)。
下图显示了模型在SAVEE测试集上的归一化混淆矩阵。

图中可见多数情感类别(如愤怒、厌恶、中性)达到完美分类,但“快乐”与“惊讶”之间存在少量混淆,提供了分类性能的细粒度视角。
🔬 细节详述
- 训练数据:SAVEE数据集,480条音频,4名男性说话人,7种情感。预处理包括:16kHz采样,转为log-Mel谱图(64个梅尔滤波器),零填充/截断至4秒固定长度。未提及数据增强。
- 损失函数:未说明。
- 训练策略:优化器Adam,学习率
\(2\times10^{-3}\),权重衰减\(10^{-3}\),批次大小32,训练最多160个epoch。使用了固定随机种子以确保可复现性。未提及学习率调度策略(如warmup、decay)。 - 关键超参数:CNN主干仅说明包含一个卷积stem层和三个轻量卷积块,未提供每层的具体结构(通道数、卷积核尺寸)。ASP模块的注意力嵌入维度未说明。
- 训练硬件:未说明。
- 推理细节:仅提及用于分类,未提供解码或流式相关细节。
- 正则化技巧:在CNN块中使用了Dropout,但具体比率未说明。
⚖️ 评分理由
创新性 (1.2/2):基于证据账本[A_SUMMARY]和[A_METHOD],论文将轻量级CNN、注意力统计池化和Grad-CAM可视化整合为面向边缘设备部署的端到端SER流水线,创新性在于针对轻量化与可解释性的系统性工程组合,而非单个组件创新。
技术严谨性 (1.0/1.5):基于证据账本[A_METHOD],方法设计逻辑清晰,无公开推导错误;但CNN具体结构细节缺失(如卷积核尺寸),属于可复现性问题而非技术错误,因此技术严谨性未受根本影响。
实验充分性 (0.6/1.5):基于证据账本[A_RESULTS]和[A_LIMITS],实验仅在SAVEE小数据集(480样本,4名男性)上进行,缺乏跨数据集泛化、消融实验、统计检验;基线对比不公平(不同协议/特征),无法充分支撑性能声明。
清晰度 (0.8/1):基于证据账本[A_METHOD]和原文,论文结构清晰,公式和图表解释详细;但模型架构中CNN具体通道数和卷积核尺寸未说明,部分细节缺失影响清晰度。
影响力 (0.7/1.5):基于证据账本[A_SUMMARY],框架针对语音情感识别在资源受限设备部署,有实际应用潜力;但实验验证有限且数据集单一,影响力受限于泛化性不足。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.3/0.5):基于证据账本[A_OPEN]和[A_LIMITS],训练配置(优化器、学习率)部分披露,但CNN核心结构细节缺失、硬件环境未说明,关键复现步骤不完整。
工程/实践价值 (0.8/1.5):基于证据账本[A_SUMMARY]和[A_LIMITS],框架设计面向边缘设备部署,参数量极低(33k),具有轻量化工程价值;但未报告推理延迟、内存占用等实际效率指标。
🚨 局限与问题
- 论文明确承认的局限:
- 作者在比较部分承认:“Because prior studies often employ different experimental protocols, feature representations, and dataset splits, direct numerical comparisons should be interpreted with caution.” 这指出了对比的非公平性。
- 论文未明确讨论数据集规模小、说话人少、性别单一的局限性。
- 审稿人发现的潜在问题:
- 实验可复现性与泛化性危机:SAVEE数据集过小(480样本),说话人仅4位且全为男性。留一说话人协议下,模型性能可能严重依赖于特定说话人的特征,报告的高精度(>96%)极可能不具统计显著性,且在其他数据集(如IEMOCAP, RAVDESS)上可能表现骤降。
- 不公平的基线比较:Table III中的对比毫无控制变量,不同论文的特征、模型、评估协议均不同。论文未在同一数据划分、同一特征下复现任何基线,这种比较只能作为粗略参考,不能用于证明本文方法的优越性。
- 可解释性分析流于表面:Grad-CAM和注意力权重分析仅提供了单一样本的定性观察。未进行系统性的评估,例如:解释区域是否与人类标注的情感发音段(如高音调段)对齐?移除解释中高亮区域是否会导致预测变化?当前分析无法验证“可解释性”的有效性。
- 模型细节缺失:“Compact CNN backbone”的具体结构(层数、每层通道数、卷积核)未给出,严重影响可复现性。
- 未考虑计算效率:仅以参数量作为“轻量”的指标,但未报告实际的推理延迟、内存占用或功耗,这对于面向边缘设备的部署声明是不充分的。