📄 InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

标签:#多模态模型 #对比学习 #数据集 #基准测试 #智能座舱

7.3/10 | 创新 1.1/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5

7.3/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #多模态模型 | #对比学习 | #数据集 #基准测试 | arxiv

👥 作者与机构

  • 第一作者:Hao Yang(哈尔滨工业大学)
  • 通讯作者:Bing Qin(哈尔滨工业大学)(论文未明确标注通讯作者,但根据作者列表最后一位及邮箱格式推断)
  • 作者列表:Hao Yang(哈尔滨工业大学)、Yanyan Zhao(哈尔滨工业大学)、Kewei Zhao(哈尔滨工业大学)、Hongbo Zhang(哈尔滨工业大学)、Tian Zheng(哈尔滨工业大学)、Yusheng Liu(哈尔滨工业大学)、Xing Fu(哈尔滨工业大学)、Bichen Wang(哈尔滨工业大学)、Yu Zhang(哈尔滨工业大学)、Hao He(SERES)、Zhen Wu(SERES)、Xuda Zhi(SERES)、Yongbo Huang(SERES)、Bing Qin(哈尔滨工业大学)

💡 毒舌点评

论文在座舱场景中创新性地融合了对话文本和红外模态,数据构建流程规范且具有工程价值。然而,其核心卖点之一——用于“跨语言评估”的英文基准——完全依赖质量不可控的机器合成语音,这不仅引入了严重的偏差,更使其关于跨语言性能的结论沦为一项对语音合成技术的间接评估,极大地削弱了研究的科学严谨性。模型比较的公平性也存在疑问。

📌 核心摘要

本文为解决现有座舱情感识别数据集缺乏对话语义和多模态信息的问题,提出了InCarEmo数据集。该数据集集成了RGB、红外视频、车内音频和对话文本,构建了涵盖情感识别、疲劳检测和分心监测三个任务的基准。论文提出了轻量级的三阶段基线模型CAMEL,通过模态特定微调、跨模态对比对齐和多分类器投票集成,在情感识别任务上取得了82.25%的准确率,优于多个经过微调的大型多模态模型。然而,论文一个重要的局限性在于,其构建的英文基准完全由合成语音构成,且疲劳/分心任务样本量较小,这限制了相关结论的泛化性。

🔗 开源详情

  • 代码:提供了。论文明确指出:“The InCarEmo dataset is publicly available at https://github.com/zkw52/InCarEmo and licensed for non-commercial academic research and use. To promote transparency and facilitate further research, we provide the open-source fine-tuning code for the CAMEL model on the InCarEmo dataset, along with the resulting fine-tuned model weights.” 因此,代码仓库(包含数据集、微调代码及预训练权重)为:https://github.com/zkw52/InCarEmo
  • 模型权重:提供了。根据上述描述,CAMEL模型的微调后权重在同一个代码仓库中提供。
  • 数据集:提供了。数据集名为 InCarEmo,与代码一同在GitHub仓库发布。获取链接与代码仓库相同:https://github.com/zkw52/InCarEmo
  • Demo:论文中未提及在线演示链接。
  • 复现材料:提供了。复现所需的关键材料包括:1. 完整数据集;2. CAMEL模型的微调代码和最终模型权重;3. 训练配置详情:论文在实验部分详细说明了训练流程,包括两阶段训练法、学习率、硬件、epoch数等。
  • 论文中引用的关键开源项目:GPT-4o, higgs-audio, face_recognition, MediaPipe FaceMesh, CLIP, Chinese-HuBERT, Qwen3-0.6B/Qwen3, Whisper, emoCLIP, LanguageBind Thermal, Qwen2.5-VL, R1-Omni, HumanOmni-5B, Emotion-LLaMA, AffectGPT。大部分仅提供了论文引用,未提供具体模型链接。

🏗️ 方法概述和架构

本文的核心方法包括两部分:InCarEmo数据集的构建流程,以及基于该数据集的基准评估框架与轻量级基线模型CAMEL。

1. 数据集构建流程: 该流程是一个系统化的多阶段流水线。

  • 脚本生成与标注:首先人工设计座舱内常见对话主题(如交通状况、行程规划),然后使用GPT-4o生成约2000个多轮对话脚本。利用大语言模型(LLM)为每个对话标注细粒度情感标签,最后由经过培训的标注员进行人工审核以确保合理性与一致性。
  • 数据采集:采集在停放的真实车辆内进行,保留了真实的车内光照和空间条件。参与者(25人)按照脚本表演,由前置摄像头(1920×1080)和外部麦克风同步录制RGB视频、红外视频和音频,最终构建了3600个情感视频片段(平均时长7.5秒)以及500个用于疲劳和分心检测的视频片段。
  • 质量审核与标注:由专家评估每个视频的语音清晰度、面部可见度及情感表达一致性,不合格的样本被要求重录。每个样本由三位专家独立标注,Cohen‘s kappa系数达到0.87。

下图展示了InCarEmo数据集的构建流程。

Figure 1. Overview of the InCarEmo dataset construction process.

图中详细呈现了从脚本生成、多模态数据采集到质量审核与标注的完整步骤,体现了数据构建的系统性和严谨性。

2. 任务定义与评估框架: 论文定义了三个基于同步多模态片段 [t-w, t] 的任务,输入为 (V_t, A_t, T_t),目标是学习映射 f_θ

  • 情感识别:将情绪分为6类(中性、快乐、悲伤、愤怒、惊讶、焦虑)。
  • 疲劳与分心监测:支持粗粒度(疲劳/分心/正常)和细粒度(如闭眼、打哈欠、喝酒、使用手机等)标签空间。
  • 辅助英文基准:通过LLM翻译文本,并使用higgs-audio框架,基于中文原音频和英文文本合成英文语音。随后通过有效性检查、ASR转写词错误率(WER)阈值过滤、音频时长对齐检查等多阶段流程,过滤掉约40%的低质量合成样本。

3. CAMEL基线模型架构: 这是一个专为资源受限车载环境设计的轻量级、模块化多模态融合系统,以情感识别版本(CAMEL-emotion)为例,分为三个阶段:

  • Stage 1: 模态特定微调:每个模态使用独立的预训练骨干网络进行微调。视觉(RGB)使用CLIP-base ViT处理每5帧检测并拼接的人脸;红外使用CLIP-Large处理热力图人脸;音频使用Chinese-HuBERT处理5秒音频片段;文本使用Qwen3-0.6B编码器。每个模态头部在分类损失下独立训练,学习各自的情感敏感特征。
  • Stage 2: 跨模态对比对齐:在已微调的编码器基础上,引入一个跨模态对比学习模块。目标是学习一个共享的情感子空间,使得来自同一样本的不同模态嵌入相互靠近,不同样本的嵌入相互远离。具体通过定义视觉-音频、视觉-文本、音频-文本三对模态间的InfoNCE对比损失来实现,总损失为三者之和。
  • Stage 3: 多分类器投票预测:在对齐后的嵌入上,针对不同的模态组合(如V, A, T, VA, VAT等)训练多个轻量级分类器。在推理时,聚合这些分类器的输出概率进行软投票,得到最终预测。这种集成方式旨在提升在噪声和低光条件下的鲁棒性。 对于疲劳检测任务(CAMEL-state的部分),则使用MediaPipe FaceMesh提取面部地标,计算眼纵横比(EAR)、嘴纵横比(MAR)和闭眼百分比(PERCLOS)等特征输入分类器。

💡 核心创新点

  1. 首次系统引入对话语本和红外模态的座舱多模态数据集:InCarEmo首次在座舱场景中将对话文本、红外热成像与RGB视频、车内音频相结合,为捕捉驾驶场景下情感产生的交互和环境线索(如低光照、温度特征)提供了更全面的数据基础。
  2. 全面且具有挑战性的基准测试设计:论文不仅提供了标准的多模态融合基准,还系统评估了模态缺失、噪声条件(特别是通过合成英文数据模拟的跨语言/跨语音条件)等实际挑战,为研究模型鲁棒性提供了重要测试平台。
  3. 提出面向资源受限场景的轻量级三阶段融合框架(CAMEL):CAMEL模型采用清晰的模块化设计(独立微调、对比对齐、投票集成),通过轻量级组件和集成策略,在保持较低计算开销(944M参数)的同时,在情感识别任务上取得了优于多个参数量更大的模型的性能。

下图比较了不同模型在六种情感类别上的识别表现,用于观察各模型在不同类别上的强弱项。

Figure 4. 不同模型在六类情感识别任务上的性能分布比较。

图中按类别展示了各模型的性能分布,能够直观看出不同模型并非在所有情绪类别上都保持一致优势。

📊 实验结果

论文在情感识别、疲劳检测、分心监测三个任务上进行了广泛实验。

表2:不同模型在情感识别任务上的性能比较(中文数据集)

方法模态参数Acc.Pre.Rec.F1
Qwen3-0.6B文本 (T)752M25.9212.7516.8614.52
Qwen3-8B文本 (T)8.19B54.9371.7354.2855.94
Whisper音频 (A)74M24.5112.3522.5613.27
Chinese-HuBERT音频 (A)95M16.3410.5215.7611.22
Chinese-HuBERT-Large音频 (A)317M20.3211.2720.3412.68
CLIP视觉 (V)151M24.2329.6228.9320.43
CLIP-Large视觉 (V)428M19.7230.9528.4018.00
emoCLIP视觉 (V)151.3M29.1931.3729.8624.79
GPT-4o视觉 (V)-57.5659.0550.9550.94
CLIP红外 (IR)151M47.3834.7041.2639.45
LanguageBind红外 (IR)330M56.1359.0852.6456.82
GPT-4o文本+视觉 (T+V)-75.5876.3377.2175.40
Qwen2.5-VL-3B文本+视觉 (T+V)3.75B50.8761.2144.6946.36
Qwen2.5-VL-7B文本+视觉 (T+V)8.29B55.7863.4255.2854.55
HumanOmni-5B多模态 (T+V+A)1.37B22.8219.7819.9610.75
R1-Omni多模态 (T+V+A)1.37B18.137.817.425.90
R1-Omni (ft.)多模态 (T+V+A)1.37B47.9142.7338.5431.56
Emotion-LLaMA多模态 (T+V+A)7B46.4850.1251.4644.60
Emotion-LLaMA (ft.)多模态 (T+V+A)7B74.6573.6373.0573.13
AffectGPT多模态 (T+V+A)7B57.7557.9255.4153.54
AffectGPT (ft.)多模态 (T+V+A)7B73.2471.6374.5472.50
CAMEL-emotion多模态 (T+V+A)944M82.2580.9578.5279.56

表3:疲劳与分心检测任务性能比较

模型疲劳检测 Acc.疲劳检测 F1分心检测 Acc.分心检测 F1
Qwen2.5-VL-3B (zero-shot)41.4127.9137.0025.03
Qwen2.5-VL-7B (zero-shot)66.0865.5261.1742.00
GPT-4o (zero-shot)37.8919.9749.4530.22
CAMEL-state84.5880.4381.0681.24

表4:不同模态组合在中英文数据集上的性能比较(情感识别任务)

语言指标VATVAVTATVAT
中文Accuracy70.9973.8041.6981.1371.8380.0082.25
中文F1-score67.8571.5028.2879.1568.6676.7979.56
英文Accuracy72.5248.0951.9169.4774.8158.7877.86
英文F1-score67.4643.9849.0860.7968.7857.2372.97

关键分析

  • 多模态融合(VAT)显著优于任何单模态或双模态组合。
  • 在零样本设置下,GPT-4o在视觉(57.56%)和文本+视觉(75.58%)任务上表现最佳。
  • 经过在InCarEmo上微调后,专用模型Emotion-LLaMA和AffectGPT性能大幅提升,但均不及参数量更小的CAMEL-emotion。
  • 在英文合成基准上,所有包含音频的模态组合(A, VA, AT, VAT)性能均出现下降,如VAT的F1从79.56降至72.97,证实了合成语音带来的挑战。

下图展示了 Video LLM 的提示词构建示例:系统把视频输入、任务说明和具体问题组织为一次多模态评测请求。

Figure 3. An example of prompting a Video LLM.

该示例说明论文如何向 Video LLM 提供座舱视频与情绪识别指令,用于统一不同模型的评测输入;它不是模型准确率对比图。

🔬 细节详述

  • 训练数据:数据集按主体独立方式划分为训练集(80%)、验证集(10%)和测试集(10%)。情感识别任务中文部分3600个片段,英文合成部分2000个;疲劳230个片段,分心270个片段。
  • 损失函数:单模态微调和分类任务使用交叉熵损失。跨模态对齐阶段使用InfoNCE对比损失。
  • 训练策略:两阶段训练。第一阶段单模态微调3个epoch,学习率\(1\times10^{-5}\)。第二阶段全模型训练100个epoch,学习率\(5\times10^{-5}\)。论文未提及优化器、batch size、学习率调度策略等细节。
  • 关键超参数:视觉CLIP-base (150M),音频Chinese-HuBERT (94M),文本Qwen3-0.6B (596M),融合网络 (104M),总计944M参数。时间窗口w=5秒。
  • 训练硬件:第一阶段单张80GB NVIDIA A100 GPU,第二阶段单张40GB NVIDIA A100 GPU。未说明训练时长。
  • 数据增强:音频使用SpecAugment和随机增益扰动;视觉使用face_recognition每5帧检测人脸。
  • 英文基准构建细节:使用LLM API翻译文本,使用higgs-audio框架合成语音。过滤标准包括:有效性检查、ASR转写WER检查、音频时长对齐检查。约40%的合成样本被过滤。

⚖️ 评分理由

  • 创新性 (1.1/2):在座舱场景中首次系统性地整合RGB、红外、音频和对话文本多模态数据,并设计了全面的基准任务,具有领域创新性。

  • 技术严谨性 (1.1/1.5):数据集构建流程(GPT生成、人工录制、专家标注)规范,标注者一致性高(kappa=0.87)。CAMEL基线模型设计合理。但疲劳检测模块的描述不足,缺乏对关键特征(EAR/MAR)阈值选择的论证。

  • 实验充分性 (1.0/1.5):提供了跨模态、多基线、多任务的广泛实验,并有模态缺失等分析。然而,核心卖点之一的英文基准效度存疑(合成语音),疲劳/分心任务样本量较小,模型对比公平性受质疑,影响了部分结论的可靠性。

  • 清晰度 (0.9/1):论文整体结构清晰,数据集构建和评估框架描述详尽。但疲劳检测模块(CAMEL-state)中,对EAR/MAR/PERCLOS特征提取的具体参数阈值和分类器设计描述不够具体。

  • 影响力 (0.5/1.5):数据集针对智能座舱这一特定应用领域,对座舱内多模态情感和状态分析有直接推动作用。但研究结论高度依赖该特定数据集,且英文基准的效度限制了其更广泛的影响力。

  • 开源 (1.2/1.5):代码、数据集及CAMEL模型权重均已开源,且明确了非商业学术研究许可,核心产物完整开放。但仓库对数据集的详细使用说明和许可证文件等文档完整性未在账本中充分体现。

  • 可复现性 (0.3/0.5):论文披露了模型架构、两阶段训练流程、部分超参数(学习率、epoch)和硬件,但关键训练细节如优化器、batch size、学习率调度策略,以及疲劳/分心任务的具体训练配置缺失,影响精确复现。

  • 工程/实践价值 (1.2/1.5):提出的CAMEL基线模型专为资源受限的车载环境设计,采用轻量级模块和投票集成策略,具有明确的工程实践目标和应用价值。

🚨 局限与问题

  1. 论文明确承认的局限
    • 英文基准数据由合成语音构成,可能存在质量与自然度问题。
    • 疲劳和分心监测任务的样本量相对较小。
    • 数据采集于静止车辆,缺少实际动态驾驶数据。
  2. 审稿人发现的潜在问题
    • 英文基准的效度危机:依赖合成语音且过滤掉40%样本后,剩余数据的分布可能严重偏离真实英文驾驶对话。这使得“跨语言评估”(Table 4)的结论非常薄弱,更像是一项对higgs-audio合成质量的评估,而非对模型跨语言能力的有效测试。
    • 数据集的生态效度:参与者是“表演”预设脚本中的情绪,而非自然产生的情绪,这可能限制数据在真实、自发驾驶场景中的泛化能力。
    • 模型比较的公平性:CAMEL采用了针对该数据集设计的三阶段训练流程和多个专用编码器。而大型多模态模型(如Emotion-LLaMA)虽然经过了微调,但其微调策略、数据增强和超参数是否得到了同等程度的优化,存在疑问。这种架构和训练范式的根本差异使得性能对比的绝对公平性难以保证。
    • 音频模态分析不足:尽管音频是重要模态,但论文对音频特征(如声学特性)与情绪状态之间的关系缺乏深入的分析和可视化,削弱了对其模型理解深度的信心。
    • “SOTA claim”的条件性:论文声称CAMEL达到SOTA,但这是在特定条件下的结果。在零样本设置下,GPT-4o在部分任务上表现更好;模型性能高度依赖于在InCarEmo数据集上的微调。因此,该“SOTA”声明是高度条件化的,仅适用于该特定数据集和评估协议下。

← 返回 2026-07-17 语音/音乐/音频论文速递