📄 HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition
标签:#多任务学习 #多模态模型 #模型集成 #音视频 #音频理解
7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.5/1.5
✅ 7.9/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频 | #多任务学习 | #多模态模型 #模型集成 | arxiv
👥 作者与机构
- 第一作者:Aleksei Bakin
- 通讯作者:Andrey V. Savchenko (av savchenko@hse.ru)
- 作者列表:Aleksei Bakin(Sber AI Lab, Moscow, Russia / HSE University, Laboratory of Algorithms and Technologies for Network Analysis, Nizhny Novgorod, Russia)、Andrey V. Savchenko(Central University, Moscow, Russia)
💡 毒舌点评
这篇论文堪称竞赛驱动型工程研究的模范生,它用“冻结主干、精调后处理”的哲学,在ABAW-11挑战赛中打出了极其高效且可复现的成绩单。其系统化地验证了,在有限数据和资源下,投资于预测校准(平滑、偏差、阈值)和智能融合,其收益可能超过盲目增大骨干模型。然而,这种“调参炼丹术”的胜利,掩盖了方法学内核的薄弱:所有后处理技术(高斯平滑、坐标搜索阈值)均为经典技巧的组合,缺乏对“为何有效”的理论洞察或数据驱动发现。论文的结论声称“可媲美更重的端到端方法”,但在MTL任务上,其验证集分数(1.56)并未超越ABAW-7冠军Netease Fuxi(1.53)在相同验证集上的结果,且对比的基线是过时的ConvNeXt,而非最新SOTA;影响力也仅限于ABAW竞赛的窄众圈子,对更广阔的音频/语音研究领域几乎没有方法论层面的启发。
📌 核心摘要
问题:本文旨在解决ABAW-11挑战赛中的两项任务:在s-Aff-Wild2数据集上进行多任务学习(MTL),同时预测效价、唤醒度、表情和动作单元(AU);以及在BAH数据集上进行视频级的矛盾/犹豫(A/H)识别。
方法核心:核心思想是采用冻结的轻量级预训练模型作为特征提取器,仅训练轻量化的任务特定头部(MLP),并通过系统化的后处理和多模型/多模态融合来提升性能,而非端到端微调大型主干。
新颖性:与主流依赖大型自监督ViT或MAE并进行端到端微调的SOTA方案不同,本文系统性地验证了“冻结主干+校准后处理”范式的有效性。其创新点不在于单一技术的突破,而在于对多种已知后处理技术(时序平滑、表达偏差校正、阈值优化、骨干融合、AffectNet混合)的精心组合与流程化,并提出了适用于两项不同挑战的统一框架。
主要结果:
- MTL任务:在s-Aff-Wild2验证集上,集成模型达到P_MTL=1.56,显著优于官方ConvNeXt基线(0.45),并略高于作者在ABAW-7的验证结果(1.49)。
- A/H任务:在BAH数据集公开测试集上,提出的音视频文本融合管线达到视频级Macro F1=0.731,优于之前ABAW-10的冠军方案(0.727)和官方基线(0.283)。
表1: MTL任务关键结果 (s-Aff-Wild2验证集)
方法 P_VA P_EXPR P_AU P_MTL Organizer baseline (ABAW-4) 0.12 0.10 0.12 0.34 HSEmotion (ABAW-7, 2nd val) 0.56 0.42 0.52 1.49 Netease Fuxi AI Lab (ABAW-7 winner) 0.54 0.43 0.56 1.53 ABAW-11 ConvNeXt 基线 – – – 0.45 本文最终集成 0.56 0.46 0.54 1.56 表2: A/H任务关键结果 (BAH公开测试集)
方法 视频级Macro F1 ABAW-10基线 0.343 VisPBF (ABAW-10冠军) 0.727 ABAW-11基线 (Video-LLaVA) 0.283 本文最佳配置 0.731 实际意义:为资源受限或注重隐私保护的场景提供了一种可行的情感计算方案。该方法不需要传输原始音视频数据,只传递特征或预测结果,适合边缘设备部署。其工程化流程对竞赛参与者和系统构建者有直接参考价值。
主要局限性:方法创新性有限,本质是工程优化;性能提升主要来自后处理和融合,对核心表征学习未做贡献;在MTL任务上仍未超越ABAW-7的冠军方案;影响力局限于情感计算和ABAW竞赛社区。
🔗 开源详情
- 代码:https://github.com/bakinalexey/abaw-11-mtl-bah-recognition
- 模型权重:论文中未提及用于下载预训练模型权重(如MT-EmotiDDAMFN, MT-EmotiEffNet-B0, HuBERT-large, RoBERTa-go_emotions)的具体链接。
- 数据集:论文中未提及公开获取链接。主要使用数据集包括:
- s-Aff-Wild2:用于MTL挑战。
- BAH数据集:用于A/H识别挑战。 这些数据集为ABAW竞赛的官方数据集。
- Demo:论文中未提及在线演示或Demo地址。
- 复现材料:完整的PyTorch实现,包括训练脚本、评估代码、超参数配置和推理流程,已包含在上述GitHub代码仓库中。
- 论文中引用的开源项目:(论文中仅提及项目名称或基础模型,未提供明确链接)
- PyTorch
- EfficientNet-B0
- VGGFace2 (数据集)
- AffectNet (数据集)
- HuBERT-large
- RoBERTa-base
- GoEmotions (数据集)
- DDAMFN (Dual-Direction Attention Mixed Feature Network)
- ConvNeXt
- Video-LLaVA
🏗️ 方法概述和架构
本文为ABAW-11竞赛的两项挑战提出了两个独立的处理管线,均遵循“冻结主干特征提取 + 轻量级头部训练 + 系统化后处理与融合”的核心设计范式。
1. MTL挑战管线 (用于s-Aff-Wild2数据集) 整体流程为:输入视频帧 → 两个并行的冻结主干提取特征 → 三个独立的任务头部(VA、EXPR、AU)生成初始预测 → 分别进行任务特定的后处理 → 加权融合两个主干的输出 → 最终预测。
- 主要组件:
- 特征提取主干 (冻结):使用两个预训练于VGGFace2并在AffectNet上进行多任务微调的模型:MT-EmotiDDAMFN(输出522维描述符,包含512维嵌入
x和10维AffectNet分数s,其中s包含8个表情logits和VA预测)和 MT-EmotiEffNet-B0(输出1290维描述符,包含1280维嵌入x和10维AffectNet分数s)。两者在整个训练过程中保持参数冻结。 - 任务特定头部 (可训练):均为轻量级网络,在s-Aff-Wild2的
cropped_aligned数据上训练。- EXPR头部:线性层+Softmax,输入为对应主干的
[x, s]拼接向量,输出8类表情概率。 - VA头部:仅使用主干输出的10维AffectNet分数
s,通过tanh激活输出效价和唤醒度预测。 - AU头部:单隐藏层(128单元,ReLU)的前馈网络,输入为
[x, s],输出12个sigmoid值,对应12个AU。
- EXPR头部:线性层+Softmax,输入为对应主干的
- 后处理模块:这是提升性能的关键,按任务独立施加。
- 时序高斯平滑:对VA和EXPR的预测概率在视频序列内进行平滑,减少帧间抖动。使用高斯核,窗口宽度
δ和标准差σ针对每个主干和任务在验证集上网格搜索确定。 - 表达偏差校正:通过坐标搜索在验证集上为每个EXPR类别学习一个logit偏置
b,用于校正类别不平衡。 - AU阈值优化:为12个AU分别优化决策阈值
t_{AU,i},替代统一的0.5阈值,以最大化验证集上的平均F1。 - 骨干加权融合:使用任务特定权重(VA:1.0, EXPR:0.4, AU:0.5)融合两个主干的预测。融合发生在平滑和偏差校正之后。
- AffectNet混合:对于融合后的EXPR预测,检查冻结主干MT-EmotiDDAMFN输出的原始AffectNet分数
s。如果其对某个基本表情(前7类)的置信度超过阈值(集成时为0.88),则直接采用该AffectNet预测作为最终标签,否则使用融合后的预测。
- 时序高斯平滑:对VA和EXPR的预测概率在视频序列内进行平滑,减少帧间抖动。使用高斯核,窗口宽度
- 特征提取主干 (冻结):使用两个预训练于VGGFace2并在AffectNet上进行多任务微调的模型:MT-EmotiDDAMFN(输出522维描述符,包含512维嵌入
- 数据流与设计选择:两个主干独立运行,共享输入但特征不同。头部在两个主干的特征上独立训练。后处理在融合前(单个主干)和融合后均有应用。选择冻结主干是基于“AffectNet预训练已捕获足够低层情感信息”的假设,旨在证明在有限竞赛数据下,优化预测校准比更新主干参数更高效。
2. A/H视频识别管线 (用于BAH数据集) 整体流程为:输入视频及其音频、文本 → 三个模态的冻结编码器提取特征 → 特征对齐(插值) → 三个模态特定的帧级MLP分类器 → 帧级预测的加权融合 → 视频内时序聚合 → 可选的全局文本门控 → 视频级二分类决策。
- 主要组件:
- 模态编码器 (冻结):
- 视觉:MT-EmotiEffNet-B0提取1280维面部嵌入
x^{face}和10维表达/VA分数s。 - 音频:HuBERT-large处理16kHz单声道音频,输出1024维隐藏状态
h^{audio}。 - 文本:RoBERTa-base (在GoEmotions上微调) 编码视频文本,输出768维token/句子嵌入
e^{text}。
- 视觉:MT-EmotiEffNet-B0提取1280维面部嵌入
- 特征对齐:由于音频和文本的时间轴与视频帧不对齐,通过线性插值将
h^{audio}和e^{text}映射到视频帧索引上,得到h^{audio}(t)和e^{text}(t)。 - 帧级分类器:为每个模态训练一个独立的MLP(单隐藏层64单元,ReLU,单个sigmoid输出),使用带正样本权重
w_+ = N_{neg}/N_{pos}的二元交叉熵损失。输入为对应模态的帧级特征。 - 融合与聚合:
- 晚期融合:将三个模态的帧级概率按权重(0.20, 0.45, 0.35)加权平均。
- 时序聚合:对视频内所有帧的融合概率取平均值或最大值,得到视频分数
s(v)。 - 全局文本门控:训练一个独立的视频级文本分类器(基于池化的RoBERTa特征进行标准化后,使用逻辑回归)。如果该分类器预测的A/H概率低于阈值(
τ_global=0.41),则强制将视频预测置为0,否则使用聚合后的视频分数。
- 模态编码器 (冻结):
- 数据流与设计选择:各模态特征独立提取并插值对齐后,在帧级进行融合,再聚合到视频级。引入全局文本门控是基于“文本是矛盾/犹豫最强线索”的观察(验证集上文本MLP帧级Weighted F1达0.77),作为强先验过滤掉文本上明显不含歧义的视频。
💡 核心创新点
系统化的冻结主干+校准后处理范式:在竞赛场景下,系统性地证明并实践了“不微调重主干,而是通过后处理榨取性能”的可行性。这挑战了“性能提升必须依赖更大模型和端到端训练”的常见思路。
- 局限:并非全新范式,但将其系统化应用于ABAW竞赛的多个任务并取得竞争力结果。
- 作用与收益:显著降低了训练和部署的计算成本,增强了隐私保护能力(数据无需离开设备),并提供了清晰的性能提升路径(每一步后处理都贡献了可衡量的增益,如表3所示)。
针对不同任务的后处理策略解耦与组合:深入分析了不同任务(VA、EXPR、AU)对后处理的敏感性差异,并据此设计解耦的后处理流程。例如,AU检测主要受益于阈值优化,而VA和EXPR则更受益于时序平滑。
- 局限:这些都是已知的机器学习技巧,论文的新颖性在于组合和应用。
- 作用与收益:提供了任务感知的校准方案,避免了“一刀切”的处理,最大化了每个后处理步骤的效用。
统一框架应对多挑战:将同一设计哲学(冻结主干、轻量头部、后处理融合)成功应用于两项不同的ABAW挑战(MTL和A/H),体现了方法的通用性和模块化。
- 局限:两个管线仍然是独立的,未共享组件。
- 作用与收益:展示了框架的灵活性,为类似多任务/多模态情感分析问题提供了可复用的工程模板。
全局文本门控机制用于视频级A/H识别:在音视频融合后,增加一个基于文本的视频级二分类器作为硬门控,利用文本模态的高可靠性来过滤低置信度样本。
- 局限:这是一种基于先验知识的简单策略,门控阈值需要精心调整。
- 作用与收益:有效提升了视频级Macro F1(从0.69到0.73),证明了在强模态存在时,利用简单规则进行后过滤的有效性。
📊 实验结果
我们在s-Aff-Wild2数据集的官方训练集和验证集上评估了提出的ABAW-11 MTL流水线(第3.1节)。由于缺失标签,142,333个训练帧仅提供103,917个效价/唤醒度值、90,645个表情标签和103,316个AU标签。验证集包含26,876个同时具有完整VA和AU标签的人脸,但仅有15,440个表情标签。
表1:在s-Aff-Wild2验证集上与以往ABAW挑战赛发布方法MTL得分的比较。
| 方法 | \(P_{VA}\) | \(P_{EXPR}\) | \(P_{AU}\) | \(P_{MTL}\) |
|---|---|---|---|---|
| Organizer baseline (ABAW-4) | 0.12 | 0.10 | 0.12 | 0.34 |
| HSEmotion (ABAW-7, 验证集第2名) | 0.56 | 0.42 | 0.52 | 1.49 |
| AIWELL-UOC | 0.37 | 0.28 | 0.47 | 1.11 |
| SCU ACers | 0.37 | 0.30 | 0.49 | 1.16 |
| HFUT-MAC1 | 0.38 | 0.30 | 0.50 | 1.18 |
| HSEmotion (ABAW-7, 验证集) | 0.41 | 0.33 | 0.51 | 1.25 |
| Netease Fuxi AI Lab (ABAW-7 冠军) | 0.54 | 0.43 | 0.56 | 1.53 |
| ABAW-11 ConvNeXt 基线 | – | – | – | 0.45 |
| 本文最终集成 | 0.56 | 0.46 | 0.54 | 1.56 |
表1总结了以往ABAW论文中在s-Aff-Wild2上报告的MTL得分。我们ABAW-11流水线在带标签的验证集上的消融实验见表2和表3。
在s-Aff-Wild2验证集上,我们的集成模型达到了\(P_{MTL}=1.56\),优于ABAW-7的验证集集成结果(1.49,相同的分割协议)和官方的ABAW-11 ConvNeXt基线(0.45)。
表2:在验证集上对提出的ABAW-11 MTL流水线进行的消融实验。
| 配置 | \(P_{VA}\) | \(P_{EXPR}\) | \(P_{AU}\) | \(P_{MTL}\) |
|---|---|---|---|---|
| MT-EmotiDDAMFN + 头部 | 0.48 | 0.33 | 0.50 | 1.31 |
| MT-EmotiEffNet-B0 + 头部 | 0.44 | 0.34 | 0.49 | 1.27 |
| MT-EmotiDDAMFN + 后处理 | 0.56 | 0.44 | 0.52 | 1.53 |
| MT-EmotiEffNet-B0 + 后处理 | 0.52 | 0.45 | 0.52 | 1.49 |
| 集成 (DDAMFN + EffNet) | 0.56 | 0.46 | 0.54 | 1.56 |
表3:在单主干MT-EmotiDDAMFN上进行的增量后处理消融实验。
| 步骤 | \(P_{VA}\) | \(P_{EXPR}\) | \(P_{AU}\) | \(P_{MTL}\) |
|---|---|---|---|---|
| 帧级头部 | 0.48 | 0.33 | 0.50 | 1.31 |
| + VA 平滑 | 0.56 | 0.33 | 0.50 | 1.39 |
| + EXPR 平滑 | 0.56 | 0.38 | 0.50 | 1.44 |
| + EXPR 偏差 | 0.56 | 0.43 | 0.50 | 1.49 |
| + AffectNet 混合 | 0.56 | 0.44 | 0.50 | 1.50 |
| + AU 阈值优化 | 0.56 | 0.44 | 0.52 | 1.53 |
最终评估协议应用了在验证集上选定的后处理参数,无需进一步调整,集成权重被应用于使用仅在训练集上训练的头部的51,159个官方测试帧。
我们在官方BAH数据集分割上评估了提出的ABAW-11 A/H流水线(第3.2节):778个训练视频、124个验证视频和525个公开测试视频。
表4:以往ABAW挑战赛论文中在BAH数据集上报告的视频级Macro F1。
| 方法 | Macro F1 |
|---|---|
| ABAW-10 基线 | 0.343 |
| Lenovo PCIE | 0.675 |
| LEYA | 0.714 |
| Fennec | 0.715 |
| VisPBF (ABAW-10 冠军) | 0.727 |
| ABAW-11 基线 (Video-LLaVA 零样本) | 0.283 |
| 本文最佳配置 | 0.731 |
表4列出了以往BAH挑战赛论文中报告的视频级Macro F1得分。在ABAW-11公开测试集上,提出的流水线达到了视频级Macro F1 0.73,远高于官方的Video-LLaVA基线(0.283)。
表5:在ABAW-11验证集上对提出的A/H流水线进行的帧级消融实验(除非注明,否则τ=0.5)。
| 配置 | Weighted F1 | Macro F1 |
|---|---|---|
| 仅面部 MLP | 0.71 | 0.52 |
| 仅音频 MLP | 0.67 | 0.53 |
| 仅文本 MLP | 0.77 | 0.59 |
| 早期融合 MLP (τ=0.4) | 0.76 | 0.60 |
| 晚期融合 (τ=0.55) | 0.79 | 0.59 |
表6:在ABAW-11验证集(124个视频)和公开测试集(525个视频)上对提出的A/H流水线进行的视频级消融实验。验证集多数类基线始终预测非A/H。
| 配置 | 分割 | Macro F1 | AP |
|---|---|---|---|
| 多数类 | 验证集 | 0.28 | 0.60 |
| 基于拼接特征的随机森林 | 验证集 | 0.67 | 0.82 |
| 早期融合 MLP | 验证集 | 0.68 | 0.85 |
| 晚期融合,均值聚合 | 验证集 | 0.72 | 0.85 |
| 晚期融合,最大值聚合 | 验证集 | 0.71 | 0.83 |
| 晚期融合,均值 | 公开测试集 | 0.69 | 0.79 |
| 晚期融合,均值 + 硬全局文本门控 | 公开测试集 | 0.71 | 0.80 |
| 晚期融合,最大值 | 公开测试集 | 0.69 | 0.82 |
| 晚期融合,最大值 + 硬全局文本门控 | 公开测试集 | 0.73 | 0.82 |
| 仅全局文本分类器 | 公开测试集 | 0.734 | 0.87 |
帧级MLP在所有902个训练和验证视频上进行了微调,全局文本分类器在相同的902个视频上进行了训练,融合和门控超参数通过在公开测试集上网格搜索进行选择。主要提交将采用最大值+门控配置应用于私有测试集(152个视频)。
我们的实验揭示了三个一致的观察结果。首先,时序校准带来的贡献远大于用更大的架构替换轻量级冻结主干,这表明在s-Aff-Wild2上,主导的误差来源是时序一致性而非特征质量。其次,对于矛盾识别,文本信息仍是最强的模态,而视听线索主要能改善边界案例。最后,两项挑战都表明,无需端到端微调即可实现有竞争力的情感识别,从而降低计算成本并简化部署。
关键结论
MTL任务 (s-Aff-Wild2):
- 本文提出的集成模型在验证集上达到\(P_{MTL}=1.56\),显著优于官方的ConvNeXt基线(0.45),并略高于ABAW-7冠军Netease Fuxi在同一验证集上的结果(1.53)。
- 消融实验(表2,表3)表明,系统化的后处理(尤其是时序平滑、表达偏差校正和AU阈值优化)是性能提升的关键。例如,对MT-EmotiDDAMFN主干,后处理将\(P_{MTL}\)从1.31提升至1.53。
- 加权融合两个轻量级主干(MT-EmotiDDAMFN和MT-EmotiEffNet-B0)进一步将\(P_{MTL}\)提升至1.56。
A/H任务 (BAH):
- 在公开测试集上,采用晚期融合与全局文本门控的配置达到最佳Macro F1(0.731),优于ABAW-10冠军方案(0.727)。
- 帧级分析(表5)显示,文本是预测矛盾/犹豫的最强单一模态(Weighted F1 0.77),晚期融合(0.79)优于早期融合(0.76)。
- 视频级分析(表6)表明,全局文本分类器本身就能达到较高的Macro F1(0.734),这支持了“文本是强烈线索”的观点。本文提出的全局文本门控机制有效利用了这一先验知识。
🔬 细节详述
- 训练数据:
- MTL: s-Aff-Wild2数据集。训练集142,333帧(部分标签缺失:103,917 VA, 90,645 EXPR, 103,316 AU),验证集26,876帧(VA/AU完整,15,440帧有EXPR标签)。
- A/H: BAH数据集。训练集778视频,验证集124视频,公开测试集525视频。
- 损失函数:
- MTL头部:单独训练,EXPR和AU用加权交叉熵(未给出具体权重),VA用基于CCC的损失(原文未明确写出,但由“sum of weighted categorical cross-entropy for facial expressions and CCC for valence and arousal”推断)。
- A/H帧级MLP:二元交叉熵,带正样本权重
w_+ = N_neg / N_pos。
- 训练策略:
- MTL头部:使用早停法(early stopping)分别在验证集的各自指标上停止。
- A/H帧级MLP:在最终提交时,使用训练+验证集(902视频)联合微调。全局文本分类器在同样902视频上训练。
- 具体优化器、学习率、batch size、训练轮数等细节未提供。
- 关键超参数:
- MTL:时序平滑窗口δ和宽度σ、表达偏差b、AffectNet混合阈τ_blend、骨干融合权重w_VA/w_EXPR/w_AU。
- A/H:融合权重w1/w2/w3、平滑宽度δ、聚合方式(mean/max)、门控阈值τ_global、决策阈值τ。
- 这些超参数均通过在验证集(MTL)或公开测试集(A/H)上网格搜索选定。
- 训练硬件:未说明。
- 推理细节:无特殊解码策略,为标准的前向推理和后处理。
- 正则化:未说明。可能仅依赖早停和轻量级头部本身。
⚖️ 评分理由
创新性 (1.2/2):论文系统性地验证了在资源受限场景下‘冻结主干+校准后处理+轻量融合’范式的有效性,提出了适用于两项不同ABAW挑战的统一框架,特别是其全局文本门控机制等工程组合为竞赛和系统构建提供了有价值的工程洞察和可复用的模板。
技术严谨性 (1.2/1.5):论文描述了完整的系统管线,方法逻辑清晰,针对MTL和A/H任务的处理流程设计合理。消融实验(表3、表5、表6)步骤分明,有力地支撑了‘后处理和融合是关键性能提升来源’的核心论点。
实验充分性 (1.2/1.5):实验覆盖了两个任务、多个强基线(包括竞赛冠军)和详细的组件消融。但在A/H任务中,超参数选择基于公开测试集,可能导致对公开测试集的过拟合,报告的0.731 Macro F1可能高估了模型真实泛化能力。
清晰度 (1.0/1):论文结构清晰,从引言、方法、实验到结论逻辑连贯。图1、图2有效地展示了管线架构。术语使用准确,方法描述详细,清晰度很高。
影响力 (0.5/1.5):该工作主要贡献是情感计算领域的系统工程优化,其影响力局限于ABAW竞赛社区。音频只是所提A/H管线中的一个次要模态,核心框架(冻结面部主干+文本门控)属于视觉与多模态情感分析,对语音/音频研究的基础方法论推动有限。
开源 (1.2/1.5):论文承诺并提供了完整的PyTorch实现代码,包括训练脚本、评估代码、超参数配置和推理管线(A_OPEN)。但核心产物文档不完整,未提供用于下载预训练模型权重的具体链接。
可复现性 (0.1/0.5):尽管提供了代码,但关键复现细节严重缺失。包括:主干模型(如MT-EmotiDDAMFN)的具体预训练权重来源、训练任务的损失函数具体权重、头部和MLP训练时的优化器、学习率、batch size、训练轮数、硬件环境等均未说明(A_LIMITS)。
工程/实践价值 (1.5/1.5):论文的核心价值体现在完整的工程实践上。它展示了从特征提取、头部设计到后处理和融合的完整、模块化、可操作的系统构建流程。‘冻结主干’策略具有明确的工程优势:降低训练成本、简化部署、保护隐私。
🚨 局限与问题
- 论文明确承认的局限:论文在结论中指出,其方法的成功依赖于预训练主干(如EmotiEffNet)的质量。作者承认,进一步提升可能需要探索更先进的特征提取器。此外,论文专注于竞赛任务,未在更广泛的基准上验证方法。
- 审稿人发现的潜在问题:
- 方法论深度不足:论文的核心是系统集成,缺乏对“为什么这些后处理技巧有效”的深层分析。例如,时序平滑对VA有效的原因是什么?是标签噪声还是数据特性?未探讨。
- 性能天花板明显:在MTL任务上,其集成结果(1.56)仍仅与ABAW-7冠军Netease Fuxi(1.53)在相同验证集上打平或略高,并未建立压倒性的新SOTA,表明单纯靠后处理和融合,性能提升存在天花板,最终可能被更强的表征学习方法超越。
- 与SOTA对比的公平性:在MTL上,论文将自己的验证集结果与ABAW-7冠军的验证集结果对比,是公平的。但在A/H上,与ABAW-10冠军对比的是公开测试集结果,而ABAW-10冠军的结果可能来自其私有测试集,数据分布不完全一致,对比的严谨性稍弱。
- 实验设计的潜在风险:在A/H任务中,超参数是通过在公开测试集(525视频)上网格搜索选择的,而验证集(124视频)结果未用于最终选择。这可能导致对公开测试集的过拟合,使得报告的0.731 Macro F1可能略微高估了模型的真实泛化能力。更严谨的做法应使用验证集调参。