HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition
📄 HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition 标签:#多任务学习 #多模态模型 #模型集成 #音视频 #音频理解 7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.5/1.5 ✅ 7.9/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频 | #多任务学习 | #多模态模型 #模型集成 | arxiv 👥 作者与机构 第一作者:Aleksei Bakin 通讯作者:Andrey V. Savchenko (av savchenko@hse.ru) 作者列表:Aleksei Bakin(Sber AI Lab, Moscow, Russia / HSE University, Laboratory of Algorithms and Technologies for Network Analysis, Nizhny Novgorod, Russia)、Andrey V. Savchenko(Central University, Moscow, Russia) 💡 毒舌点评 这篇论文堪称竞赛驱动型工程研究的模范生,它用“冻结主干、精调后处理”的哲学,在ABAW-11挑战赛中打出了极其高效且可复现的成绩单。其系统化地验证了,在有限数据和资源下,投资于预测校准(平滑、偏差、阈值)和智能融合,其收益可能超过盲目增大骨干模型。然而,这种“调参炼丹术”的胜利,掩盖了方法学内核的薄弱:所有后处理技术(高斯平滑、坐标搜索阈值)均为经典技巧的组合,缺乏对“为何有效”的理论洞察或数据驱动发现。论文的结论声称“可媲美更重的端到端方法”,但在MTL任务上,其验证集分数(1.56)并未超越ABAW-7冠军Netease Fuxi(1.53)在相同验证集上的结果,且对比的基线是过时的ConvNeXt,而非最新SOTA;影响力也仅限于ABAW竞赛的窄众圈子,对更广阔的音频/语音研究领域几乎没有方法论层面的启发。 ...