英文题目:HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses Through Reasoning MLLMs

会议身份:conference:aaai:2026:conference-paper-id:39685

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #多模态模型 #音视频问答

评分:7.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Zheng Qin:机构信息未能从会议 PDF 纯文本可靠映射
  • Ruobing Zheng:机构信息未能从会议 PDF 纯文本可靠映射
  • Yabing Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Tianqi Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Yi Yuan:机构信息未能从会议 PDF 纯文本可靠映射
  • Jingdong Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Le Wang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作针对多模态大语言模型在人类中心场景下难以兼顾细粒度感知、隐含意图理解与共情回应的问题,输入为长视频、音频与多轮对话文本,输出为十五项单选题形式的感知判断、隐含意图理解与回应策略选择,难点在于长时跨模态记忆、情绪与意图推断及共情反馈规划需要联合完成。其方法链先构建HumanSense基准的三千余题四层金字塔评测以输出分层能力画像,再将该画像输入模态消融,对比视觉、听觉与转录文本贡献以定位听觉视觉互补点。接着以上一步定位的全模态问答为独立训练集,对Qwen2.5-Omni-7B依次做纯视频推理、纯音频推理到视听联合推理的三阶段GRPO强化学习以得到推理模型,最后从成功推理轨迹提炼关键特征—情绪—上下文提示模板,用于免训练增强非推理模型。与已有视频理解评测相比,关键机制差异在于同时考核回应内容与回应策略,并强制模型先整合人物特征、情绪与上下文再推理作答,使评测与优化直接面向可验证的交互决策,具有端到端指导意义。在HumanSense tiny基准下,人类评估者的平均准确率为0.875,高于GPT-4o的0.552。该结论适用边界限于所选开源数据与零样本单选评测协议,向开放式生成、实时交互与跨文化场景的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么?要解决的陪伴问题是什么?

这篇解读的输入是会议论文正文证据与本次收到的官方原图像素,目标是让刚进入语音与音频方向的研究生能复述 HumanSense 做了什么、怎么搭基准、怎么训练推理模型、实验条件如何保留公平性。必须保留的信息是任务分层、数据来源与题量、评测模型范围、模态消融设置、多阶段强化学习的输入顺序、免训练提示模板,以及人类与模型的差距数字。输出是 1 篇分节、可核对的中文技术解读,不做营销式判断。

论文要解决的问题不是单纯的看图说话或语音识别,而是让多模态大语言模型在真人交互中先看清听清,再读懂隐含的人际状态,最后给出共情且 context-aware 的回应。这里的 context-aware 指回应要依据多轮对话、说话人特征、情绪与场景来选择,而不是只回一句语法正确的通用安慰。白话说,多模态大语言模型就是能同时读视频帧、听声音、读文字并用语言模型做判断的系统。

论文把能力拆成 3 段:多模态感知、隐含信息理解、多轮交互中的回应策略,其中回应既包括说什么,也包括摆出什么表情策略。教学例子:同样一句我家里人可能不同意,如果只看文字会以为是普通陈述,结合低头、停顿与为难语气才能判断需要先共情再给建议,这正是论文强调视听文缺一不可的原因。

已有路线走到哪里?HumanSense 补哪块?

按同输入、同目标、同监督来对照,已有路线分三支。第一支是文本大语言模型,做对话模拟与文本情感分类,输入只有文字,优点是推理强,缺点是看不到表情与肢体,听不到语调。第二支是视觉多模态大语言模型,能看脸与动作,论文点名评测了 Qwen2.5-VL、Qwen2-VL、LLaVA-OneVision、LLaVA-NeXT-Video、VideoLLaMA3 与 InternVL3,输入是视频加文本,缺点是丢了对话内容与韵律。第三支是全模态模型与音频语言模型,前者如 Qwen2.5-Omni、IXC2.5-OmniLive 与 Ola 要同时吃视频、音频与文本,后者如 Qwen2-Audio 专攻声音。

已有基准多测视频理解,StreamingBench 测流式视频理解,HumanOmniV2 开始测意图、情绪与欺骗,但论文明确指出它缺乏对回应规划与交互能力的评测。HumanSense 的补位就是把感知、理解、回应做成端到端阶梯,并让模型扮演交互中的一方,用真实人类记录作为正确回应来比对。这不是简单加任务数量,而是把以往只考看懂了什么扩展到考下一步回什么才得体。

15 个任务如何从看见走到回得体?

论文把 HumanSense 组织成 4 层金字塔。底层是感知,上层是理解与回应,要求模型先有扎实的感知基础才能做深层理解,最终在顶层做反馈决策。表面感知考单模态短片段,包括人脸外貌、原子动作、手势与表情。复杂感知考多模态长时记忆,包括复杂动作描述、异常分类、跨镜头人数重识别计数、结合视听判断谁说了某句话。上下文理解考隐含信息,包括熟悉度、氛围是否和谐、人物关系、是否说谎、电话录音中的欺诈类型。

反馈策略考交互,包括面对说话人应摆出什么表情、基于多轮心理咨询史选出合适的下一句。所有题都是单选题,模型要扮演交互一方作答。

表面感知 × 复杂感知: 表面感知负责单模态短片段的原子判断如外貌、动作、手势与表情,复杂感知负责长视频多目标的序列判断如复杂动作描述、异常分类、人数重识别与谁在说话,前者考看清,后者考记住并关联,搭配原因是没有原子能力就无法组合成长程记忆,组合意义是构成金字塔底座,只有底座牢固才能谈理解与回应。

以下导读帮你看总览图:该图把 4 个大块按从左到右、从上到下的流程排布,每格给出英文任务名、一个具体问答示例与胶片式缩略图,底部单独画出反馈策略的多轮对话形态,箭头表示能力依赖方向。

看图路径: 1. 先从左到右看表面感知、复杂感知、上下文理解三列的任务标题;2. 再看底部反馈策略中表情策略与心理咨询两块的提问方式;3. 对照每格右侧胶片缩略图确认输入是视频片段而非单图;4. 注意绿色正确答案与题干的对应关系

原论文 Figure 1:HumanSense benchmark is structured hierarchically to evaluate the end-to-end, human-centric…

论文图 1。原论文 Figure 1:“HumanSense benchmark is structured hierarchically to evaluate the end-to-end, human-centric process of perception, understanding, and feedback through a series of demonstrated…”。

看完图应抓住三点。第一,感知格的问题都很短,如认动作、认手势、认表情,输入依赖单片段。第二,理解格的问题需要结合外貌年龄差与对话内容,如判断已婚、约会还是父子。第三,回应格不再问视频里发生了什么,而是问你作为模型下一步应显示什么情绪或说什么话,正确答案来自真实听众表情标注与专业心理咨询记录。图中绿色标记的是正确选项,右侧胶片提醒你输入包含时间维度,不能只看 1 帧。这种从原子感知到长程理解再到行动的设计,就是后文多阶段训练要对齐的阶梯。

方法全景:先测出短板,再用推理补高层

论文的方法分两步走。第一步是建基准并全面评测主流模型,覆盖视觉模型、音频模型与全模态模型,全部零样本调用各模型默认提示词,视频处理按各自官方配置取帧率与分辨率,视觉模型只做视频题,音频模型只做音频题,全模态模型做全部题。第二步是基于观察做优化:作者认为得体反馈来自对全模态上下文、对方需求、情绪与个人特征的充分考量,因此推理能力是钥匙。

具体做法是多阶段、模态渐进的强化学习,得到 HumanSense-Omni-Reasoning,再把成功推理中稳定的思考模式提炼成免训练的提示模板,去提升非推理模型。沿一个样本走完全程有助于理解:输入是一段 2 人对话视频加问题,例如判断 2 人关系,模型先把视频帧与音频转成表示,经过全模态模型抽取人物特征、情绪词与对话要点,再在思考段中综合年龄外貌、语气与话题,最后输出单选字母。

基准负责暴露哪层不行,强化学习负责把思考过程练出来,提示模板负责把思考过程复用到没练过的模型上。

组件如何分工?视听文三路在哪里汇合?

组件按输入到输出可分为感知抽取、上下文整合与策略选择。感知抽取负责从视频帧拿脸、外貌、动作与手势,从音频拿话语内容、语调与环境声,从文本拿题干与选项。上下文整合负责把多轮对话与非言语线索拼成人物画像与氛围判断。策略选择负责在表情策略与心理咨询题中选出最得体的选项。白话说,全模态模型就是 3 路都会读的模型。论文的组合假设是,低层任务单路即可,高层任务必须 3 路汇合,因为关系与氛围既藏在长什么样,也藏在说什么与怎么说。

多模态大语言模型 × 全模态模型: 多模态大语言模型负责把视觉、听觉和文本统一成可推理的表示,全模态模型特指能同时原生处理视频、音频和文本 3 路输入的子类,二者搭配的理由是仅看画面会丢失语调与对话内容,仅听声音会丢失表情与手势,只有 3 路对齐才能支撑关系、氛围与欺诈这类高层判断,组合意义是让同一模型在感知层补齐信息,在理解层做跨模态印证。

再看理解与回应的关系。论文把理解层放在回应层之下,要求模型先答对熟悉度、和谐度与说谎,再答对该摆什么表情与说什么安慰话。

上下文理解 × 反馈策略: 上下文理解负责从对话历史与非言语线索中推断隐含的人际状态如熟悉度、和谐度与说谎,反馈策略负责在多轮交互中选出得体的下一步表情或话术,前者是后者的依据,后者是前者的检验,搭配原因是没有理解的回应容易文不对题,没有回应的理解无法落地为陪伴,组合意义是把评测从认对了什么推进到做对了什么。

这种分层不是装饰,后文消融显示只给视频时高层任务明显掉分,加上音频后回升,而转写文本对强全模态模型增益很小,说明原始音频已带足语义,弱音频模型才依赖显式文字。这也解释了为什么训练要分阶段让模型先练看、再练听、最后练视听结合。

多阶段强化学习与免训练提示各练了什么?

训练部分要交代监督来源、输入顺序与冻结情况。论文用与基准无关的独立数据建训练集,采用组相对策略优化做可验证奖励的强化学习,奖励来自单选题对错,问答增强时平衡正确选项分布并拉齐正确与错误选项长度,以避免奖励作弊。阶段安排是渐进的:第一阶段只用纯视频帧加文字问答,建立结合视觉感知的推理;第二阶段用音频问答,建立结合听觉感知的推理;第 3 阶段用完整视听问答,强化视听结合的推理。基座是 Qwen2.5-Omni-7B,完整训练配置放在开源代码中,正文未报告学习率、批量大小与更新步数的具体数值,这是复现时需回代码核对的缺项,不从模型名推定优化器细节。

可验证奖励的强化学习 × 组相对策略优化: 可验证奖励的强化学习负责只用选择题对错这类可自动判定的信号来优化推理链,组相对策略优化负责在同一问题采样一组回答并做组内相对比较来更新策略,前者解决奖励从哪里来,后者解决不用价值网络如何稳定更新,搭配原因是基准全是单选题天然可验证,组合意义是用低成本的对错信号把关键特征、情绪与上下文的思考模式压进模型。

免训练提示是另一条线。作者采样答对样本发现成功推理呈现一致模式:先看关键特征、情绪与上下文,再思考后作答,于是设计固定提示模板,要求模型分析视频或音频时先识别显著特征与行为、推断情绪状态、抽取相关对话,再基于这些要素推理结论。正文给出英文模板大意,实验显示该模板在高层任务上也能提升未训练模型。两条线的共性是都不改基准答案,只改思考过程的显式程度。

数据、划分与评测条件如何保证可比?

数据按原文交代:基准共 15 个渐进任务,来自开源数据集与油管视频,用模板加原标注生成问答,再用情绪识别、大语言模型与光学字符识别抽取任务信息,辅以多样化候选模板、选项均衡与长度拉齐做增强,抽两成人工质检,重点看心理咨询的多轮充分性与正确选项的专业性。题量上视频题与音频题分开计数,另抽 450 题做微型集,每任务 30 题,用于与人类基线对比。

评测条件上,所有模型零样本、默认提示词、各按官方视频配置处理,视觉模型不做音频题,音频模型不做视频题,全模态做全题。平均分报两种口径:不含音频题的平均用于跨模型公平比较,含全任务的平均用于看全模态整体。人类基线由评估者独立作答微型集得到。以下导读帮你看结构与时长图:左侧金字塔给出每层题量,右侧堆叠条按时长分段显示各任务视频长度分布,颜色对应时长区间。

看图路径: 1. 先看左侧金字塔 L1 到 L4 的层名与每层题量标注;2. 再看右侧按任务分组的堆叠条带确认短视频为主、长音频集中在何处;3. 对比 L1 每项 300 题与 L2 中异常分类仅 100 题的分布差异

原论文 Figure 2:Left: The structure and counts of evaluation tasks in HumanSense.

论文图 2。原论文 Figure 2:“Left: The structure and counts of evaluation tasks in HumanSense. Right: Benchmark statistics on video length.”。

看图应确认两点。第一,底层感知题量最大,顶层交互题量较小,符合金字塔设计。第二,多数视频任务集中在短时长段,异常分类与心理咨询等任务时长分布更散,这意味着长上下文记忆与多轮对话能力在顶层更关键。复现时应严格保留这种划分与口径,不要把两种平均分混用,也不要用转写文本替代原始音频去报主结果,因为转写文本仅用于消融研究。

主结果测了什么?谁在高层任务上占优?

主结果要回答感知是否够用、理解与回应差多少、全模态是否有优势。比较问题是:在同一零样本与各自官方视频配置下,视觉、全模态与音频模型在 4 层任务上的准确率如何,指标越大越好。公平条件是视觉只比视频题,全任务平均另算,人类基线只在微型集上对比。表前先明确:该表比较人类微型集准确率与最优模型的差距,以及全模态在音频欺诈题上相对专用音频模型的优势,数字方向均为越高越好。

条件指标视频题量音频题量总题量
全基准构成选择题数量32915913882

表后解释:该规模保证底层感知有足够样本练出区分度,顶层虽题量少但全部来自真人记录与专业咨询,难度集中在长上下文。代价是音频题只占约一成半,音频与全模态的比较样本有限,不能把个别任务的领先推广为全音频场景必胜。未胜出项是所有模型在高层心理咨询类任务上普遍偏低,说明感知补齐后推理仍是短板。

以下导读帮你看成功推理示例图:该图展示 4 个高层任务的思考与答案,顶部标注特征、情绪、上下文与思考四要素,正文用颜色区分外貌、情绪词与对话要点。

看图路径: 1. 先看顶部特征、情绪、上下文、思考四个图标确认推理切分;2. 再逐格看关系、氛围、表情策略与心理咨询的思考与答案对应;3. 注意颜色标记如何把外貌、情绪词与对话内容区分开

原论文 Figure 5:Examples of Successful Reasoning.

论文图 5。原论文 Figure 5:“Examples of Successful Reasoning. These cases cover four high-level perception and interaction tasks, including both video-based and audio-based questions.”。

看图应学到可复述的思考套路:关系题先看年龄胡须与面部结构再结合着装场景,氛围题先抓父亲去世与母亲角色等关键话题再看男孩表达困难,表情策略题抓住疫情统计的沉重语调而选悲伤,心理咨询题抓住六年伴侣与孩子等背景而选既反思自己又探究对方原因的平衡选项。这些例子报告显示模型确实在整合特征、情绪与上下文,而不只是蒙对字母。但需注意这是挑出的成功案例,不能当成每题都如此,失败条件在后文消融与限制中继续展开。

第二个比较问题是人类与模型的绝对差距有多大,全模态相对专用音频模型的优势是否可运行。表前明确:比较人类平均准确率、最优模型差距与欺诈题上的跨模型对照,均为准确率越高越好。

条件指标人类平均最优模型差距欺诈题对照
微型集与全集准确率87.5%29.7%0.74

表后解释:人类 87.5% 领先最优模型 29.7 个百分点,支持论文判断即高层交互任务仍有很大提升空间。欺诈题上全模态 0.74 超过专用音频模型,支持跨模态协同的判断。

但限制是人类基线只在 450 题微型集上测得,大集上的人类水平未测,且 GPT-4o 因接口暂不支持音频输入而缺测音频题,不能据此断定闭源必弱。原文对该缺测有明确说明,复现时应保留相同缺测标记而非补零。

拿掉一路输入会怎样?转写文本能替代耳朵吗?

消融按问题组织:测什么、与谁比、条件是否一致。论文用 Qwen2.5-Omni 与 Qwen2-Audio 做细粒度模态消融,记视频为 V、音频为 A、视频语音转写文本为 T,聚焦 6 个高难度任务,左四为视频题,右二为音频题。设置有二:给两类模型都加转写文本,以及让全模态退化为纯视频。指标仍是准确率,方向越高越好。

语音转写文本 × 原始音频: 语音转写文本负责提供对话字面语义的显式线索,原始音频负责保留语调、停顿与环境声等副语言信息,前者易读但会丢情绪,后者完整但难解码,搭配做消融的理由是区分模型是真听懂了声音还是只靠文字作答,组合意义是检验全模态训练是否让模型摆脱对转写文本的依赖。

以下导读帮你看模态消融折线图:横轴是 6 个任务,纵轴是准确率,图例区分视听、纯视频、纯音频、加转写等组合,注意左右两侧纵轴刻度不同。

看图路径: 1. 先确认横轴左侧四个视频任务与右侧两个音频任务的划分;2. 再比较纯视频线与视听结合线在关系识别上的落差;3. 观察音频模型加转写文本前后在欺诈识别上的变化幅度

原论文 Figure 4:Modality Ablation Across Different Tasks.

论文图 4。原论文 Figure 4:“Modality Ablation Across Different Tasks.”。

看图可得的判断是:视频任务中音频是视频的强补充,加上音频后熟悉度、氛围与关系识别明显提升,再加转写文本对强全模态模型增益很小,说明原始音频已提供足够语义。音频任务中弱音频模型明显依赖文本,没有文本时欺诈与咨询任务偏低,加上文本后回升,而全模态加不加文本差异不大,显示全面多模态训练带来优势。反例是所有模型在回应类任务上仍低于感知类任务,说明补模态不能替代推理。边界是转写文本仅用于本次消融,主结果表未用它,复现时不要把消融配置当成主配置去报分。

哪些结论还只是有限解释?缺了什么验证?

区分直接报告、有限解释与未验证推测。直接报告的是人类与模型差距、模态补充效应、多阶段训练后高层任务提升、提示增强对非推理模型有效。有限解释的是推理能力是钥匙,它有训练前后对照支持,但未做因果干预证明只有推理在起作用,可能与数据量与模态顺序混杂,应用词是支持而非证明。未验证推测是把表情与话术标签接到视频生成、语音合成与 talking head 就能得到高度拟人体验,论文只在引言展望,未测延迟、误判率与成本,不能承诺这些量得到改善。

缺失证据不是技术错误:正文未报告训练超参数细节、推理开销与帧率、统计显著性方法,总体趋势不等于每组每步都成立。另一冲突需标注:人类微型集上部分任务如说谎检测人类仅 0.533,而模型在某些高层任务上接近人类,这种单点接近不能推广为整体追平,需按任务分别讨论适用条件。

要复现应先跑什么?资源当前是否可达?

复现先做三件事。第一,按官方配置跑零样本评测,保留视觉只做视频、音频只做音频、全模态做全题的划分,两种平均分分开报,GPT-4o 缺测音频题要留空而非填零。第二,做模态消融时单独准备转写文本分支,不要污染主结果。第三,要训推理模型需回开源代码核对 3 阶段数据量、奖励函数与超参数,因为正文把细节指向附录与代码,正文证据未给出完整数值。资源状态按本次核验写:代码链接本次可达,可写当前可用。

扩展版本链接本次可达。数据集链接本次未能确认可达,必须写本次未能确认可达,不写已公开。硬件预算正文未报告,复现时需自行记录耗时与显存。问答增强中的选项均衡与长度拉齐要保留,否则强化学习可能出现奖励作弊。人工质检重点复核心理咨询上下文是否多轮充分、正确选项是否专业,这直接影响顶层结论的可信度。

何时值得尝试这套推理与提示方法?

当你的任务同时满足 3 条时值得尝试:输入有视频加声音、目标要判断隐含人际状态、输出要是下一步得体回应而非单句描述。此时可先复用论文的思考模板,即先显式写出关键特征、情绪与上下文再做结论,这对非推理模型是低成本起点。若要进一步提升,再按视频、音频、视听的顺序做可验证奖励的强化学习,用单选题对错做奖励并保留选项均衡。

还需补的验证是:在自有数据上测长对话的稳定性、在真实延迟下测可部署性、在人工评价下测共情是否真被用户感知,因为自动单选准确率不等于人评的得体。常见误解是以为加了音频就够了,论文的反证是感知补齐后心理咨询类任务仍低,缺的是长上下文推理。另一误解是把转写文本当成耳朵,消融显示它只能救弱音频模型,强全模态模型更吃原始音频中的副语言信息。

收束一句话:HumanSense 把陪伴拆成可测的阶梯,推理把阶梯连起来,但每一步仍需对照条件与代价来读分。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总