共分析 1 篇论文


⚡ 今日概览

✅ 筛选入选 1 篇 → 🔬 深度分析完成

🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。

🏷️ 热门方向

方向数量分布
#语音情感识别1 篇█

📊 论文评分排行榜(1 篇,按分数降序)

排名论文总分分档文档类型主任务
🥇Enhancing Multimodal Emotion Recognition via Multi…3.8后 50%方法研究#语音情感识别

📋 论文列表

🥇 音频三路特征与视频时空建模为何需要注意力来对齐:多模态情绪识别的可复述路径

英文题目:Enhancing Multimodal Emotion Recognition via Multi-Feature Encoding and Attention-Based Fusion

标签:#语音情感识别 | #注意力机制 | #音视频 | #RNN | #CNN

评分:3.8/10 | 创新 1/2 | 技术严谨 0.7/1.5 | 实验充分 0.4/1.5 | 清晰度 0.6/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.4/1.5

排名:后 50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Xu Lin:College of Computer Science and Technology, Jilin University, Changchun 130012, China
  • Ke Wang:College of Computer Science and Technology, Jilin University, Changchun 130012, China
  • Hui Kang:College of Computer Science and Technology, Jilin University, Changchun 130012, China;Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University, Changchun 130012, China
  • Xinying Wang:College of Computer Science and Technology, Jilin University, Changchun 130012, China;Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University, Changchun 130012, China

📌 核心摘要

输入为同步的语音波形与人脸视频序列,输出为 7 类离散情感标签,难点在于单模态易受噪声与表情欺骗影响且两模态时序与维度不对齐。方法链分三步:音频分支并行提取 Wav2Vec2 语义嵌入(Semantic Embedding,1×512)、MFCC(25 维)与基于 Librosa 的统计声学描述子并经全连接层对齐后加权求和,再经 BiLSTM(Bidirectional Long Short-Term Memory,双向长短期记忆网络)建模时序;视频分支对熵选帧后用 ResNet50 提取 2048 维空间特征并送入 BiLSTM 聚合时序;两者输出经层归一化后以视频为查询、音频为键值做多头交叉注意力融合,最后由支持向量机(Support Vector Machine,SVM)分类。与仅做拼接或单模态建模相比,该设计以交叉注意力实现模态间自适应加权,意图缓解特征冗余并提升少数类鲁棒性。在 MELD 测试集上多模态模型报告微平均准确率 93.7%,在 IEMOCAP 上报告准确率 90.3% 与 F1 88.5%,均显著高于对比的 EF-LSTM 等基线。该结论仅在作者自定的 8:2 划分与未公开文本模态缺失的条件下成立,未验证跨数据集、跨说话人与真实噪声下的外推能力。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。