英文题目:Voices, Faces, and Feelings: Multi-modal Emotion-Cognition Captioning for Mental Health Understanding

会议身份:conference:aaai:2026:conference-paper-id:37210

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#医疗音频 #多模态学习 #音视频 #音频字幕生成

评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zhiyuan Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Yanrong Guo:机构信息未能从会议 PDF 纯文本可靠映射
  • Shijie Hao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文针对多模态心理健康分析仅输出诊断类别而缺乏可解释情感认知依据的难点,定义情感认知协同描述任务,输入为临床访谈切分的话轮级视频音频文本,输出为情感描述认知损伤描述及汇总画像。方法首先以VideoMAE、HuBERT与BERT提取各模态初始时序特征,得到各模态时间步表示。接着双流BridgeNet以两组Q-Former分别压缩融合为情感嵌入与认知嵌入,并以效价三分类对比学习和基于Jaccard重叠的多标签认知对比学习实现解耦。随后其输出拼接提示送入冻结LLaMA解码器自回归生成字幕,多话轮字幕再经大语言模型汇总为画像并辅助抑郁焦虑诊断。与通用多模态大模型和心理领域大语言模型隐式迁移特征不同,该机制显式分离情感与认知并对齐语言空间,从而提升可解释性与检测性能。在MMDA测试集情感描述任务下,本方法的F BERT分数为27.13,高于Sa2VA-8B的F BERT分数12.28。该结论适用边界受限于单中心中文临床访谈与自动标注加人工清洗语料,尚未验证跨语言跨中心与纵向追踪能力。训练成本涉及两块NVIDIA RTX A6000硬件上两阶段训练且第二阶段总参数约7.6B。

🔗 开源与复现资源

🧭 深度解读

为什么心理健康辅助分析缺的不是准确率而是可追溯的线索?

这篇论文的输入是临床访谈里的一段问答,包含视频里的人脸表情、音频里的语调停顿和文本里的问答内容,目标是先写出这个人此刻的情绪状态和认知受损情况,再把多段话语汇总成可供医生参考的画像,最后才做抑郁或焦虑的辅助判断。必须保留的信息是 3 模态如何被压缩、情绪和认知两路如何被分开约束、描述如何被大模型写出,以及在什么数据划分和基线条件下得到提升。

对刚入门的同学,白话先行:分类模型相当于老师只给学生打一个总分,医生不知道分从哪里来;纯文本大模型相当于只看 transcript 找失眠、自杀这类关键词,听不到哭腔也看不到面无表情。论文想做的是让模型像实习医生写观察记录一样,先写看到听到的情绪证据,再写问答中暴露的记忆、注意、语言问题。学习依赖是先理解任务与两条旧路线的局限,再看编码器到双路桥接再到解码器的全景,接着拆开查询压缩和两种对比损失的计算,然后讲 2 阶段训练与数据构造,最后用主结果、消融、统计和人评来限定结论。

输出是 1 篇可核对的方法复述,不做营销式判断,所有数字回到原文表格,教学用的举例会明确标为例子。

同输入同目标的旧路线卡在哪里?

第一条旧路线是心理障碍检测的分类路线,输入同样是多模态或文本,目标是直接输出抑郁或焦虑类别。原文回顾了用深度模型分类以及用 MentalBERT 等做法,指出这类方法不揭示哪些线索关联到疾病,临床支持时说服力弱。即使有用迁移学习引入情感特征的工作,高维特征与预测结果的关系依然难解释,而且忽略了认知因素。

第二条路线是多模态大模型与心理大模型路线。通用多模态大模型如 BLIP-2、Qwen2.5-Omni、InternVL-2.5、Sa2VA 在跨模态理解上很强,但论文报告它们在情绪认知描述上常输出短句或不一致的内容。心理领域大模型如 PsycoLLM、MindChat、EmoLLM、CPsyCoun 只看文本,无法描述非言语线索。自动描述路线如 SECap 用 HuBERT 加 Q-Former 抽语音情绪特征再用 LLaMA 写描述,给了本文直接启发,但此前没有把情绪和认知协同起来做心理健康画像。

对照点要按同输入、同目标、同监督来读:分类路线监督是疾病标签,本文监督是话语级情绪认知描述加类别标签;心理大模型运行阶段只有文本,本文运行阶段要求视听文 3 模态。所以不能把类别差异直接当同条件胜负,本文的比较意义在于补上可解释的中间描述层。

新任务把什么定为输入和输出?

新任务叫情绪—认知协同多模态描述,英文是 emotion–cognition cooperative multi-modal captioning,简称 ECMC。输入是一个话语样本,包含视频、音频和文本三部分,输出是这个话语的情绪描述句和认知描述句。多个话语的描述再被汇总成用户画像,画像连同原始对话一起交给通用大模型做辅助诊断。任务的判断标准有两层,一是描述本身与人工参考的接近程度,二是画像能否提升下游抑郁焦虑判断。

下图把 3 条路线并排展示,左列是输入模态,中列是模型,右列是输出形式和可解释性批注,适合先建立整体对照再进入细节。

看图路径: 1. 先看三行输入有何不同:第一行用视听文三模态,第二行只用文本,第三行恢复三模态;2. 再看每行输出形式:从单个抑郁标签,到带失眠词的判断,再到分开的情绪句与认知句;3. 最后看右侧批注对可解释性的评价递进

原论文 Figure 1:Different paradigms for mental disorder detection.

论文图 1。原论文 Figure 1:“Different paradigms for mental disorder detection. (a) Classification-based. (b) LLM-based. (c) Ours.”。

从像素可见,上面一行把视觉、音频、文本送入心理障碍识别模型,只输出抑郁一词,右侧批注是没有可解释性;中间一行只用文本进入大语言模型,输出带失眠等文本线索的判断;下面一行把 3 模态送入情绪—认知协同描述模型,输出分成情绪句和认知句两段,情绪句点出表情和语调,认知句点出定向、记忆、注意或语言 4 个域,右侧批注是基于多模态观察并对齐临床视角。这种分段输出是后文双路结构的直接来源,也是人评要分开打情绪准确和认知准确的原因。

一个样本如何走完输入到画像到判断?

拿一个问答轮次为例,输入是这几秒的视频帧、音频波形和转写文本。第一步用 3 个模态专用编码器抽初始表示,视频用 VideoMAE,音频用 HuBERT,文本用 BERT,得到随时间变化的序列特征。第二步用双路 BridgeNet 把 3 路序列压缩融合成两个向量,情绪嵌入 he 和认知嵌入 hc。第三步把起始符、he、hc 和提示词拼起来送入 LLaMA 解码器,生成这个话语的情绪—认知描述。对同一个体的多条话语重复上述过程,再用大模型把多条描述归纳成用户画像,最后把画像加原始对话送入基座模型得到疾病预测。

下图是整体框架,左侧是编码与双路对比,右侧是文本解码与画像生成,箭头表示数据流向而非训练顺序。

看图路径: 1. 沿左侧编码器到中间双路对比学习再到右侧大语言模型的箭头走一遍主路径;2. 对比上支情绪对比学习用标签矩阵与下支认知对比学习用渐变矩阵的差异;3. 确认 he 与 hc 如何与分词后的提示拼接到解码器输入

原论文 Figure 2:The framework of the proposed method.

论文图 2。原论文 Figure 2:“The framework of the proposed method.”。

从可见像素看,中间分为上下两支,上面是情绪对比学习配标签矩阵,下面是认知对比学习配渐变矩阵,分别输出 he 和 hc,再与分词器处理后的起始符和提示拼接进入大语言模型,右侧展示了情绪句提到表情眉唇、认知句提到记忆域的示例。这种双支汇合单解码器的布局解释了为什么训练要分 2 个阶段:先让两支各自学好可分的表示,再让解码器把它们拉到文本空间。

BridgeNet × LLaMA 解码器: BridgeNet 负责融合 3 模态并输出情绪嵌入 he 和认知嵌入 hc,LLaMA 解码器负责把这两个嵌入连同提示转成自然语言描述,二者搭配的理由是 BridgeNet 懂多模态压缩但不会写长文本,LLaMA 会写文本但看不懂原始音视频,组合后 BridgeNet 在第 2 阶段被交叉熵梯度推向大模型的文本空间,实现从向量到可读画像的对齐。

BridgeNet 怎样把三路长序列压成两个向量?

先讲符号与输入。记视频、音频、文本的初始表示为 Hv、Ha、Ht,每个都是时间步数乘特征维度的矩阵。BridgeNet 对每个模态准备一组可学习查询 Qm,查询先做自注意建模查询之间的依赖,得到更新后的查询,再以更新后的查询为查询向量,以该模态初始表示为键和值做交叉注意,把长序列的信息抽到少量查询上,随后过前馈层得到 Zm 的精炼版,3 模态的精炼结果拼接、投影、均值池化和归一化后得到 he 或 hc。情绪路和认知路各有一套同样的查询与注意参数,结构相同但监督不同。

\[Hv = Fv(Xv), Ha = Fa(Xa), Ht = Ft(Xt). (1)\]

上式是模态专用编码器的抽取动作,Fv、Fa、Ft 分别是预训练好的视频、音频、文本编码器,输出保留时间维度,为后文压缩提供原材料。原文明确冻结这些编码器,不从零训练,主要是数据量有限。

\[{he, hc} = Fbridge(Hv, Ha, Ht)\]

上式是双路桥接的融合动作,Fbridge 把 3 个初始表示映射成情绪嵌入 he 和认知嵌入 hc,前者捕捉情绪类别相关特征,后者编码认知受损相关特征。教学例子:好比 3 位记录员分别记表情、语调和文字,桥接模块是 2 位汇总员,1 位只摘情绪句素材,1 位只摘认知句素材,最后各交出一页摘要。

下图展示单路 BridgeNet 内部的三列结构,底部是 3 模态序列,顶部是对比学习约束。

看图路径: 1. 从底部 Hv、Ha、Ht 向上看三列各自经过可学习查询、自注意、交叉注意和前馈的顺序;2. 观察三列输出 Zv、Za、Zt 如何在拼接层汇合再经均值池化和归一化;3. 确认顶部对比学习同时约束 he 与 hc 两个出口

原论文 Figure 3:The architecture of BridgeNet.

论文图 3。原论文 Figure 3:“The architecture of BridgeNet.”。

从像素可见,底部 3 组方块是 Hv、Ha、Ht,中部每列自下而上是可学习查询、自注意、交叉注意、前馈,顶部三列输出汇入拼接层再经均值池化和归一化得到 he 或 hc,最上是对比学习。这种先分模态抽取再统一拼接的设计,搭配理由是保留模态特异性的同时压缩冗余,为情绪与认知的不同对比目标提供干净输入。

情绪表征 × 认知表征: 情绪表征负责从表情、语调和语义中抽取效价相关的状态,认知表征负责从问答内容中抽取定向、注意、记忆和语言 4 类受损线索,二者分工是因为抑郁焦虑既有情绪停滞或波动又有认知抑制,搭配的理由是单一路会把两类信号混在一起,双路解耦后再拼给解码器才能同时写出情绪句和认知句。

Q-former × 对比学习: Q-former 负责用可学习查询做自注意加交叉注意,把冗长的视频音频文本序列压缩成少量向量,对比学习负责规定这些向量在特征空间里谁该靠近谁该远离,二者搭配的原因是只压缩不约束会保留大量与情绪认知无关的细节,加上情绪按效价标签拉近、认知按 Jaccard 重叠软拉近,才能让压缩结果直接对应可描述的类别。

两种对比学习分别把谁拉近把谁推远?

情绪对比学习针对单标签三分类。按效价把 he 分成负性、中性、正性 3 类,计算批量内两两相似度除以温度系数得到相似矩阵,构造二值掩码标记同类且非自身的正例对。损失有两项,一项让同类对的对数概率最大化以收紧类内,另一项惩罚异类对的高相似以拉开类间。原文的心理学依据是负性情绪在抑郁分析中的显著性,但实现上 3 类平等建模。

认知对比学习针对多标签四分类。4 个域是定向障碍、注意障碍、记忆障碍和语言障碍,参考临床量表 MMSE 的思路。一个样本可同时带多个标签,因此不用硬的同类掩码,而用 Jaccard 系数做软权重:两空集相似度记为 1,一空一非空记为 0,否则取交集大小除以并集大小。损失按软权重加权拉近,高重叠的样本对更靠近,低重叠的被推远,同时保留第二项对低权重对的排斥。这种软拉近能刻画共病式的认知重叠。

两路都用 Q-Former 以 BERT 预训练参数初始化,训练第一阶段联合优化。需要指出的缺项是原文未报告查询数、隐藏维、温度系数的具体取值和调参过程,复现时只能先按代码仓库的实际配置核对,不能从模型名推定。

两阶段训练各冻结谁各更新谁?

第一阶段联合训练情绪抽取和认知抽取,目标是压缩融合多模态信息并得到可分的紧凑表示。此时模态专用编码器冻结,只更新两路 Q-Former 及投影层,Q-Former 用 BERT 参数初始化。损失是两路对比损失之和,梯度只回传到桥接参数,不进入编码器和解码器。

\[L1 = Lemo + Lcog,\]

上式是第一阶段总目标,Lemo 与 Lcog 分别是情绪与认知对比损失,直接相加意味着两路同等重要,原文未报告加权系数,可视为等权。

第 2 阶段把抽取到的特征接入大模型。此时模态编码器和大模型参数都冻结,只微调两路 BridgeNet,用交叉熵让大模型生成标注描述,从而把桥接输出推向大模型的输入空间。模型规模上,第一阶段总量约 701M、可训练约 598M;第 2 阶段总量约 7.6B、可训练约 605M,训练用了两块 RTX A6000,第一阶段批量 64 至多 500 轮,音频最大序列 1024、视频 512,优化器 AdamW 学习率 1.3 乘 10 的负 5 次方,第 2 阶段每卡微批量 8 累积 8 步并用 DeepSpeed ZeRO 2 阶段加半精度。

话语级描述 × 用户画像: 话语级描述负责对每个问答轮次写情绪句加认知句,用户画像负责把同一个体的多条话语描述汇总成负性情绪和认知受损的总体模式,前者分工是保留时间粒度和具体线索,后者分工是做跨轮次归纳,搭配后下游基座模型同时看到原文对话和画像,才能在做抑郁焦虑判断时引用可追溯的证据。

数据从哪里来、怎么划分、用什么衡量?

数据基于 MMDA 多模态抑郁焦虑数据集,原文称含 1025 个临床验证样本,每个样本有临床访谈的视觉、听觉和文本数据,抑郁焦虑标签来自 HAMD 与 HAMA 标准化评估。为得到话语级描述,先按问答轮切分访谈,用 Emotion-LLaMA 结合面部、声音和语义生成情绪描述,再用 DeepSeek-671B 结合这些输出与文本生成认知描述和两类标签,共得到 30592 个话语描述对。随后去掉寒暄、个人信息询问、旁支对话和短于 2 秒的片段,标注者剔除不一致标签,报告 Fleiss kappa 为情绪 0.64、认知 0.73,属较高度一致。过滤后训练 13536 段、验证 1402 段、测试 3790 段,类别分布为定向障碍 0.91%、注意障碍 8.54%、记忆障碍 10.38%、语言障碍 15.89%、负性情绪 31.85%,可见定向类极稀少。

客观指标上,描述质量用 BLEU-1、BLEU-2、BLEU-4、METEOR、ROUGE-L、CIDEr 和 FBERT,前 6 个偏词重叠,最后一个偏语义相似。疾病辅助判断用准确率 ACC 和 F1。主观指标用五点量表,由 8 位心理学从业者按情绪准确、认知准确、细节丰富、标签一致和总体质量打分。代码当前可用,仓库地址已在原文脚注给出,第三方 MindChat 与 EmoLLM 链接本次可达,但复现仍需核对权重与环境。

描述质量与下游辅助判断提升了多少?

比较问题是:在同样测试话语上,谁的情绪句和认知句更接近人工参考,以及把各家描述汇总成画像后能否提升同一批基座模型的抑郁焦虑判断。公平条件是所有方法生成的描述都经 DeepSeek-671B 汇总成画像,再连同原始对话送入 LLaMA-3-8B、Qwen3-8B、GLM4-9B 做判断,指标方向都是越高越好。

下表是认知描述的对比,覆盖通用多模态大模型与心理领域大模型,数值越大表示与参考越接近。

MethodModality Domain BLEU-1BLEU-2BLEU-4METEORROUGE-LCIDErF BERT
Sa2VA-8B VT15.826.241.6113.1522.591.6118.78
Qwen2.5-Omni-7B AVT12.825.301.4812.0419.561.4820.03
EmoLLM T17.006.661.9813.2919.081.9814.99
CPsyCoun T9.323.891.0618.8823.071.064.47
Ours AVT35.9225.0515.3235.8639.8215.3241.04

表后解释要同时看收益与代价。本方法在 BLEU-1 到 FBERT 七项上全面领先,例如 BLEU-4 与 CIDEr 达到 15.32,FBERT 达到 41.04,而次优的通用模型 Sa2VA 或 Qwen2.5-Omni 仅在 1 到 20 区间,纯文本心理模型因看不到表情语调更低。代价是本方法用了 3 模态输入和 2 阶段微调,推理链更长。未胜出项也要点名:在认知的人评细节维度本方法并非第一,说明词重叠领先不等于细节总是最多;定向障碍因占比不足 1% 在自动指标中易被淹没,这是未评测充分的边界。

自动指标 × 人工评价: 自动指标负责用词重叠和语义相似度衡量生成描述与参考描述的接近程度,人工评价负责由心理学从业者按情绪准确、认知准确、细节丰富、标签一致和总体质量打分,前者分工是可重复的大规模比较,后者分工是检查临床可读性和标签可信度,搭配才能避免只刷词重叠却写出空洞长句的问题。

下图是按疾病分组的情绪认知统计,左图抑郁对正常,右图焦虑对正常,5 个顶点是情绪与 4 个认知域。

看图路径: 1. 先确认左右两张雷达图分别对比抑郁与正常、焦虑与正常;2. 沿五个顶点读数:比较情绪顶点的差距与定向顶点的低值;3. 观察抑郁多边形整体外扩幅度大于焦虑的程度

原论文 Figure 4:Emotional and cognitive differences between nor- mal individuals and patients with different…

论文图 4。原论文 Figure 4:“Emotional and cognitive differences between nor- mal individuals and patients with different mental disorders”。

从像素读数看,左图抑郁组情绪 44.23 对正常 30.12,语言 22.99 对 13.98,注意 13.09 对 6.12,记忆 13.76 对 7.41,定向 1.22 对 0.74;右图焦虑组情绪 38.43 对 27.81,语言 20.09 对 14.67,整体外扩幅度小于抑郁。原文据此报告抑郁焦虑的负性情绪都高于健康人,抑郁的认知受损频率高于焦虑,定向最少见而注意记忆语言更常见,这支持了同时建模情绪与认知的必要性,但属于相关性统计,不能当因果证明。

画像交给不同基座模型是否都有效?

第二个比较问题是画像的跨模型通用性。做法固定:各家方法的话语描述先汇总成画像,再分别交给 3 个基座模型做抑郁和焦虑判断,报告每个基座下的准确率与 F1,以及相对无画像基线的平均增益。指标方向仍是越高越好,但要警惕长而无信息的描述会增加抽取难度反而降分。

下表是焦虑检测在 3 个基座下的结果对照,行是提供画像的方法,列是不同基座下的准确率与 F1 及平均增益。

MethodACCF1 MethodACCF1 MethodACCF1 Im ACC Im F1
Sa2VA-8B55.2152.7554.1762.7144.7958.46
Qwen2.5-Omni-7B50.0050.0065.6265.9643.7558.46
EmoLLM54.1755.1061.4666.0643.7558.46
CPsyCounX46.8854.0556.2563.1642.7158.02
Ours57.2958.5966.6769.1644.9558.91

表后解释要讲清支持的判断与限制。本方法在 3 个基座下都取得最高或接近最高的准确率与 F1,原文汇总抑郁平均提升 12.54 个百分点准确率和 9.16 个百分点 F1,焦虑平均提升 14.98 和 6.38。反例是部分基线画像反而让某些基座下降,例如 MindChat 在个别基座的 F1 出现负增益,说明无效描述会干扰判断。限制是汇总画像用的 DeepSeek-671B 本身带来额外计算与潜在偏置,且原文未报告误判率分布和延迟,不能承诺临床误诊或实时性得到改善。

少一个模态或少一路对比会怎样?

消融问题是各模态与两路对比各自贡献多少。原文用 FBERT 衡量整体情绪认知描述的语义相似度,逐项去掉音频、视频、文本或去掉情绪对比、认知对比。报告显示单模态中音频最好,多模态组合进一步提升,音频加文本互补性强;去掉任一路对比都会退化为单支结构而掉分,同时去掉两路下降最明显;全量 3 模态加双对比取得最高分 34.09。

教学上可以这样复述操作:先只给音频训练一版,只给视频训练一版,只给文本训练一版,记录 FBERT;再两两组合训练;最后在全模态基础上分别关闭情绪对比、关闭认知对比、同时关闭,观察分数从 29 到 23 再到 16 的阶梯。原文表格中单模态分数在 16 到 18 区间,双模态在 22 到 29 区间,全量 34.09,这种单调递增支持双路解耦的解释,但总体趋势不等于每一步都显著,定向类样本过少时单类提升可能不稳定。

未报告的缺项是各消融的方差与显著性检验,以及不同批量大小下对比损失的敏感性,复现时应补多次随机种子取均值和标准差,不能只报单次最高。

哪些结论还不能下、哪些边界尚未测?

首先是数据与标注边界。话语级参考由 Emotion-LLaMA 与 DeepSeek-671B 自动生成再经人工清洗,虽然 kappa 达到 0.64 与 0.73,但认知准确的人评仍低于情绪准确,说明从多模态加文本推断认知受损更难,自动参考本身可能带模型偏置。定向障碍仅 0.91%,模型对该类的描述能力在自动指标中几乎不可见。

其次是评估边界。自动指标偏词重叠,FBERT 虽偏语义仍是与参考的相似度,不是临床正确性;人评只有 8 位从业者打五点量表,未报告一致性系数和盲评流程。下游增益依赖 DeepSeek-671B 做汇总,不同汇总模型可能改变增益幅度。原文未测量推理延迟、显存占用随轮次增长的曲线和误判导致的临床风险,因此不能把准确率提升直接等同于可部署。

最后是因果表述。情绪认知分布差异是组间均值比较,支持任务合理性,但不能推出负性情绪导致抑郁或认知受损导致焦虑,相关性不是因果,纵向追踪才能谈机制。

要复现应先准备什么、按什么顺序跑?

先做信息条件核对。代码仓库当前可用,应先拉取 ECMC 仓库核对环境、权重下载方式和脚本是否可运行,区分代码开源与权重可下载是两回事。第三方 MindChat 与 EmoLLM 链接本次可达,可用于复现心理基线,但版本要锁定。MMDA 原始访谈是否可公开获取、 Emotion-LLaMA 与 DeepSeek-671B 的版本与提示词是否与仓库一致,是决定能否重放标注流程的关键。

再按学习依赖跑通最小闭环。第一步跑模态编码器冻结抽特征,确认视频 512、音频 1024 的截断与批量 64 不爆显存;第二步跑第一阶段双对比,检查情绪 3 类掩码与认知 Jaccard 权重的构造是否与公式一致,观察类内收紧是否发生;第三步跑第 2 阶段桥接到 LLaMA 的交叉熵微调,确认只更新桥接参数;第四步生成话语描述并用同一汇总模型做画像,最后在固定基座与固定提示下复测 ACC 与 F1。

还需补的验证是多次种子下的均值方差、定向类的单独召回、长对话画像的截断策略,以及去掉汇总模型后直接用话语描述做判断的对比,以排除增益来自汇总大模型本身。

何时值得尝试这个方法、带走哪三句话?

当你的场景同时有视频、音频和转写文本,且医生需要知道判断依据而不仅是标签时,值得尝试先生成情绪句加认知句再做判断的路线;当只有文本或只有单轮标签时,这套双路压缩加 2 阶段微调的收益会被削弱,不如先补模态或先做文本基线。复现时先跑通冻结编码器加双对比的第一阶段,再跑桥接到大模型的第 2 个阶段,不要一开始就全参数微调。

带走的三句话是:用两个向量分别承载情绪与认知,再用对比学习规定它们的邻里关系,是可解释性的来源;用冻结大模型加可训练桥接实现多模态到文本的对齐,是在有限数据下可行的工程选择;画像能提升多个基座模型的辅助判断,但提升幅度依赖汇总模型与数据清洗,定向等稀有类的结论待验证。

常见误解要澄清:词重叠高不等于临床正确,仍需人评把关;音频单模态最强不等于只用音频就够,多模态互补在原文中明确带来额外增益;平均增益为正不等于每个病例都变好,长而空的描述反而可能干扰模型。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总