英文题目:Unveiling the Landscape of Clinical Depression Assessment: From Behavioral Signatures to Psychiatric Reasoning

会议身份:conference:aaai:2026:conference-paper-id:37153

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集构建 #多模态学习 #大语言模型 #语音 #病理语音评估

评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Zhuang Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Guanqun Bi:机构信息未能从会议 PDF 纯文本可靠映射
  • Wen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiawei Hu:机构信息未能从会议 PDF 纯文本可靠映射
  • Aoyun Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiyao Xiao:机构信息未能从会议 PDF 纯文本可靠映射
  • Kun Feng:机构信息未能从会议 PDF 纯文本可靠映射
  • Minlie Huang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

临床抑郁评估的输入是访谈、图片描述与言语流畅任务下的音频、视频、转录本与功能性近红外光谱信号,输出是是否患重度抑郁障碍的二分类诊断,难点在于行为信号微弱异质且既往标签多依赖自评量表而非精神科确诊。作者先在玉泉医院采集临床多模态精神诊断数据集 C-MIND,由主任与副主任医师按 DSM-5给出确诊标签;接着用经典特征与基础模型嵌入训练判别模型以量化任务与模态价值并做任务融合与模态融合;最后以转录本提示大语言模型模拟精神科推理并注入结构化临床先验形成引导式推理。相比既往依赖自评标签与单模态手工设计,该工作以临床确诊为锚并强调任务诱发与跨通道互补,使评估更贴近真实诊疗逻辑。在 C-MIND 的 6:2:2 划分上图片描述任务的音频特征取得 94.10%的宏平均 F1,而引导式推理使 GPT-4o 在零样本下达到 60.53%仍低于监督转录本基线。该结论仅适用于中文单中心小样本与受控实验室采集,跨语言跨站点与重度共病泛化尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要解决的临床评估问题有多难?

本文输入是医院真实就诊场景的抑郁评估需求,目标是判断被试是否为重性抑郁障碍,输出是二分类诊断标签。论文强调已有常用数据多依赖自评量表如 PHQ-8,而非训练有素医生的诊断,少数含临床诊断的研究样本小于 30 人且任务模态有限,因此模型容易在受控条件下做复杂设计,却没有回答真实临床数据中什么信号真正有效。

对刚进入语音音乐音频的研究生,白话理解是:不要把抑郁检测当成给一段录音打分。临床标签来自面对面诊断访谈,行为数据来自结构化任务诱发,评估必须说明任务如何诱发、模态记录什么、标签如何确定。本文后续所有比较都围绕这三件事展开,任何脱离任务设计和标签来源的准确率都不具临床意义。

本次解读的输入是论文正文证据与官方原图像素,目标是复述可核对的方法与实验条件。必须保留的信息包括招募规模与诊断标准、三任务 4 模态的采集设置、两套特征与 6 种传统模型的比较口径、大模型 3 种推理策略与零样本少样本条件、主指标 Macro-F1。资源状态方面,本次未发现来源绑定且完成验证的资源,不得声称代码模型数据已公开。

已有路线走到哪里:数据与方法各缺什么?

数据路线按证据等级演进。早期用社交媒体自述做大规模语料,规模大但标签弱;随后在受控环境采集并用自评问卷分数做真值,如 DAIC-WOZ 用 PHQ-8;最近才出现医生正式诊断的语料,如 MODMA 有 53 人、CMDC 有 78 人,但队列较小或对照组未经临床确诊,且任务模态较窄。论文把 C-MIND 定位为更大且均衡、任务更多样、模态更全、含详细病历与 8 份心理量表的基准。

方法路线从单模态手工特征转向多模态融合,再到大语言模型。早期用文本音频视频的手工特征,后来用注意力或 Transformer 融合多通道,近期用大模型但缺乏领域知识适配。论文的对照思路是先用传统模型量化任务与模态的判别力,再测大模型能否做临床式推理,而不是直接提出更复杂的融合网络。

学习依赖上要记住:只有同输入、同目标、同监督、同运行阶段才能谈胜负。社交媒体文本分类与医院面诊诊断不是同一任务,自评分数回归与 DSM-5 二分类也不是同一监督,本文的比较只在 C-MIND 内部成立。

任务如何形式化:样本、观测与标签是什么?

每个被试完成访谈、图片描述、词语流畅 3 类任务共 10 个测试,同步记录音频、视频、转录文本、功能性近红外信号。功能性近红外信号指用近红外光测量前额叶血氧变化的神经生理信号,本文用 45 个光通道的统计特征表示。标签是主任与副主任医师按 DSM-5 标准经面对面访谈给出的临床诊断,问卷数据本研究仅作保留,不作为监督。

预测问题是二分类:把某任务某模态的特征映射为 0 健康或 1 抑郁。融合问题分两类:固定模态拼接多任务特征,看任务是否互补;固定任务拼接多模态特征再跨任务聚合,看多通道是否更稳健。大模型问题是把 10 个测试的文本或多模态信号拼成一个提示,预测同一二分类标签,比较直接预测、自由逐步推理、知识引导的结构化推理。

方法全景:两条线分别回答什么问题?

论文方法分两部分。第一部分是行为签名建模,回答 RQ1:不同任务与模态对抑郁评估的贡献是什么。做法是提取两套特征、训练多种传统模型、逐个评估任务模态对及其融合。第二部分是大模型精神科推理,回答 RQ2:大模型能否像精神科医生一样推理,以及知识注入如何改进。做法是比较 3 种提示策略在零样本与少样本下的表现,并做任务组合分析与个案分析。

行为签名 × 精神科推理: 行为签名指从访谈、图片描述、词语流畅任务的音频、视频、文本、功能性近红外信号中可观测的抑郁相关模式,负责提供可量化的诊断证据;精神科推理指临床医生结合任务要求解释说什么和怎么说、区分状态抱怨与特质性消极思维的判断过程,负责把信号放进诊断逻辑;两者搭配的原因是只有信号没有解释容易误读,只有推理没有信号无法落地,组合后系统既能量化哪类信号有效,又能按临床期望加权信号。

沿一个样本走一遍:某被试先做 45 秒自传访谈、45 秒图片描述、40 秒词语流畅,麦克风、相机、近红外设备同步记录,语音转写后人工校对;每段按任务切分并提取特征;传统模型输出诊断标签,大模型则读入拼接文本并按提示策略输出标签。目标都是拟合医生诊断,但前者靠判别训练,后者靠提示推理。

下图把上述两条线画在同一版式中,左侧是任务与模态汇入分类器的行为签名线,右侧是以知识和示例驱动大模型的推理线,下方标注 4 个子问题,适合对照阅读时定位每个实验属于哪条线。

看图路径: 1. 先看左侧行为签名建模的任务与模态如何汇入分类器;2. 再看右侧大模型推理的知识与示例两个输入箭头;3. 对照下方 RQ1a、RQ1b 与 RQ2a、RQ2b 四个子问题

原论文 Figure 3:Overview of the two-part research methodology, addressing: 1) the diagnostic value of behavioral…

论文图 3。原论文 Figure 3:“Overview of the two-part research methodology, addressing: 1) the diagnostic value of behavioral signatures (RQ1) and 2) the performance and enhancement of psychiatric reasoning…”。

该图左侧用任务框与模态框共同指向网络符号,表示先量化每个任务模态对再做融合;右侧用手册经验指南的知识框与对照抑郁示例框共同指向对话机器人,表示测试外部知识能否纠偏。下方 RQ1a 关注重要性排序,RQ1b 关注组合性能,RQ2a 测基线推理能力,RQ2b 测专家引导的增量,后文结果按此四格展开。

组件与计算:特征、模型与提示如何实现?

特征有两套。经典特征集是音频用 OpenSmile 的 eGeMAPS 共 88 维,视频用 OpenFace 含动作单元、视线、头姿共 4963 维,文本用 DeBERTa 嵌入,近红外用 45 通道统计得 630 维向量。基础模型特征集是音频用 Qwen2-Audio-7B、视频用 Qwen2.5-VL-72B、文本用 Qwen3-235B-A22B,取最后隐层并按时间全局最大池化,音频文本为 4096 维、视频为 8192 维,近红外因无公开预训练编码器仍用经典统计。

任务建模用分类器把特征映射到临床标签,融合时用拼接实现。任务融合固定模态拼接多任务,模态融合固定任务拼接多模态。传统骨干包括长短时记忆网络、卷积网络、多层感知机、k 近邻、随机森林、支持向量机。大模型文本端包括 GPT-4o、GPT-o3、DeepSeek-V3、DeepSeek-R1、Qwen3 思考与非思考模式,只用转录文本;多模态用 Qwen2.5-Omni 处理音频视频文本组合。

\[y(i) ∈{0, 1} m,t →y(i),\]

该式子的符号含义是被试 i 在模态 m 任务 t 下的特征映射到标签,取值为 0 或 1。计算目标是学习参数化的判别函数,原文未给出损失函数、优化器与梯度路径细节,因此不能推定训练实现,只能按证据说它用于量化每个任务模态对的诊断价值,融合表示同样送入该函数分类。

图片描述任务 × 音频模态: 图片描述任务负责给出统一视觉刺激并要求 45 秒描述,诱发情绪效价、注意偏向和细节丰富度差异;音频模态负责捕捉语调平淡、停顿延长、犹豫标记和韵律变化,分工是任务制造可比情境、音频记录表达方式;搭配理由是抑郁的消极解释偏向不仅体现在用词上,更体现在声音的钝化上,组合后在该任务音频上取得最高的 94.10% Macro-F1,成为最有效的任务模态对。

直接预测 × 精神科推理: 直接预测负责把拼接后的 10 个测试文本直接映射为 0 或 1 的二分类标签,不做中间解释;精神科推理负责在提示中加入任务定义和专家行为期望,引导模型先按任务分别评估再综合判断,分工是前者测模型自带关联、后者测临床知识能否纠偏;搭配比较的意义是揭示通用推理会过度反应字面消极词,而知识引导能降权孤立信号、识别积极情绪表达等保护因素,从而在零样本下稳定提升。

三任务的具体做法是访谈对愤怒事件、有意义事件、最爱食物等提示各说 45 秒;图片描述对猫、车祸、飞船等图片各描述 45 秒;词语流畅对四足动物、水果、城市、蔬菜等类别在 40 秒内尽量多说。采集在安静实验室、环境噪声低于 60 分贝,被试距麦克风约 20 厘米,每 10 个测试的音频单独记录,视频与近红外用时间戳切分对齐。

有无训练:本研究真正优化了什么?

本研究没有训练大语言模型,也没有报告微调大模型的梯度更新、参数冻结或重置时机。训练只发生在第一部分传统模型上:用 C-MIND 划分出的训练集学习从特征到临床标签的映射,在验证集调参,在测试集报告 Macro-F1,5 个随机种子平均。原文未报告这些传统模型的具体超参数、优化器与训练轮数,属于具体缺项,复现时需按技术附录补齐。

大模型部分是调用与提示比较,不是训练。直接预测要求无解释输出诊断,自由推理要求逐步思考后再预测,精神科推理在提示中加入任务定义与专家行为期望,引导关注症状相关线索。少样本条件加入对照与抑郁示例,观察示例是否与结构化指导冲突。近红外基础模型特征缺失不是技术错误,而是原文明确说明无公开预训练编码器,因此沿用统计特征。

下面这张采集流程图把训练数据的来源讲得最具体,阅读时可把左中右三栏分别对应标签来源、任务诱发方式与特征实现路径,避免把模型结构当成数据来源。

看图路径: 1. 从左向右跟随招募、评估协议与数据采集三段主流程;2. 核对中间三任务时长要求与绿色示例话语的对应关系;3. 观察右侧四模态各自上下两路特征提取路径的差异;4. 确认左下临床标签同时包含问卷与医生诊断两层

原论文 Figure 2:C-MIND collection pipeline, outlining participant recruitment, assessment protocol, and data…

论文图 2。原论文 Figure 2:“C-MIND collection pipeline, outlining participant recruitment, assessment protocol, and data acquisition.”。

该图左侧给出 169 人中 86 例确诊与 83 例对照的招募结果,以及 8 份问卷加 DSM-5 诊断的金标签流程;中间列出访谈、图片描述各 45 秒与词语流畅 40 秒的三任务要求与示例话语;右侧给出音频视频文本近红外的 4 模态与两套特征路径。由此可见传统模型的监督全部来自医生诊断,转录文本经过人工校对,训练前的数据条件是可核对的。

实验条件:数据、划分、指标与基线是什么?

数据来自 2022 年 12 月至 2025 年 4 月清华大学玉泉医院精神科,经伦理审查与知情同意,最终 169 人含 86 例抑郁与 83 例对照。平均年龄约 32.99 岁,抑郁组平均语音时长 171.84 秒、词数 392,对照组 125.01 秒、词数 519,总平均 152.16 秒、词数 445。评估协议分临床诊断与精神科任务两部分,诊断由十年以上经验的医生团队按 DSM-5 做出并保留病历,另有 HAMD、HAMA 等 8 份量表但本研究不用其做标签。

划分按 6 比 2 比 2 随机分为训练验证测试,主指标为 Macro-F1,附录有精确率召回率与每类 F1。所有结果在 5 个种子下平均。比较条件上,传统模型比较在同一任务模态特征下换骨干,大模型比较在同一输入拼接下换提示策略,任务组合比较固定模型换输入任务子集。多模态大模型与纯文本大模型的输入不同,因此不能视为同条件胜负,只能报告多模态输入未带来增益的现象。

下表整理队列与采集的核心可核对事实,比较问题是该数据集是否比既往临床诊断语料更大更均衡,公平条件是都看确诊人数与任务模态数,指标方向是人数越多、任务模态越全、对照组经确诊则证据越强。

条件指标抑郁组对照组合计与说明
招募队列人数8683169 人
采集医院时间范围2022 年 12 月起至 2025 年 4 月玉泉医院精神科
任务电池任务数访谈图片描述词语流畅共 10 测
同步模态模态数音频视频转录文本加 fNIRS 共 4 种
标签金标准DSM-5 医生诊断临床确诊对照另有 8 份量表备用

该表说明 C-MIND 在确诊样本量与任务模态丰富度上超过 MODMA 的 53 人与 CMDC 的 78 人,且对照组经临床确诊。代价是单中心中文数据,语言与设备条件特定;未胜出项是近红外与纯文本在单任务单模态下普遍偏弱,不能靠单一文本信号替代多通道评估。

主结果:哪些任务与模态真正有效?

传统模型结果显示音频与视频最具信息量,但效果与任务绑定。图片描述最能诱发抑郁标记,顶尖模型用该任务音频达 94.10% Macro-F1;词语流畅的音频也强,因为执行功能受损表现为停顿、犹豫标记与韵律减少;访谈是稳健基线,自传提示能诱发消极情感与过度概括,跨模态都有信号。文本与近红外整体弱于音视频。

下图左侧比较单模态与模态融合,右侧比较单任务与任务融合,纵轴均为 Macro-F1,箱体越高且越窄表示分数更高且更稳定,适合先看中位数再看离散程度。

看图路径: 1. 先确认纵轴为 Macro-F1、横轴为单模态与融合条件;2. 比较左侧模态融合与右侧任务融合的箱体位置与高度

原论文 Figure 4:Performance (Macro-F1) of modality fusion (left) and task fusion (right).

论文图 4。原论文 Figure 4:“Performance (Macro-F1) of modality fusion (left) and task fusion (right). Combining signals generally improves the Macro-F1 score and reduces performance variance.”。

该图显示融合后箱体整体上移且更窄,说明多源证据提高分数并降低方差。教学观察是不要只看最高点,要看融合条件的中位数与离散程度,这正是临床更关心的稳健性。未评测边界是融合用拼接实现,未比较注意力等复杂融合,结论限于拼接策略。

下表聚焦可运行策略的数字对比,比较问题是监督判别与提示推理谁更接近临床标签,公平条件是同为 C-MIND 测试集上的 Macro-F1,指标方向是越高越好。

条件指标监督文本模型最优文本大模型加知识多模态大模型
转录文本输入Macro-F168.24%60.53%46.36%
图片描述音频Macro-F194.10%未报告未报告
任务组合示例GPT-4o50.48% 单访谈55.68% 访谈加流畅60.53% 加精神科推理
模态说明监督训练零样本提示音视频文本组合
代价限制需训练数据仍落后监督未有效利用非言语线索

表后解释是主要收益来自音频视频与任务融合,最大代价是文本大模型即使加知识仍落后监督模型约 8 个百分点,多模态通用大模型在零样本精神科推理下仅 46.36%,说明通用多模态能力不等于临床非言语理解。反例是词语流畅单独用转录文本时偏弱,因转写丢失了时机与重复模式。

反证与消融:知识引导何时有效、何时失效?

大模型 3 种策略在零样本下,精神科推理对多数非思考模型稳定增益,如 GPT-4o 提升 7.01 个百分点、Qwen3 非思考提升 3.67 个百分点,优于直接预测与自由推理。少样本下增益分化:GPT-4o 自由推理提升 7.31 个百分点、精神科推理提升 8.34 个百分点仍有益;DeepSeek-V3 与 R1 在少样本推理下退化,R1 加自由推理下降 22.5 个百分点、加精神科推理下降 11.96 个百分点,论文解释为内置推理协议与外部注入逻辑冲突。

下图按模型分组展示零样本少样本与 3 种策略的组合,每组六根柱子,柱顶数字为相对直接预测的变化,适合先找正增益再找负增益的例外。

看图路径: 1. 按模型分组比较零样本与少样本六根柱子的高低;2. 读柱顶相对直接预测的变化数值判断增益或下降;3. 重点观察 DeepSeek-r1 与多模态模型的负向变化

原论文 Figure 5:Performance comparison of LLMs using three reasoning strategies in zero/few-shot settings.

论文图 5。原论文 Figure 5:“Performance comparison of LLMs using three reasoning strategies in zero/few-shot settings.”。

该柱状图显示思考型模型与多模态模型的柱子在加入推理后变矮,特别是最右侧多模态模型全面偏低。结论是知识引导不是万能,需与模型原生推理兼容,少样本示例可能干扰结构化指导。图中 GPT-o3 少样本自由推理的高增益与 DeepSeek-r1 的大幅下降并存,说明平均趋势不能代替逐模型判断。

任务融合 × 模态融合: 任务融合负责固定模态后拼接访谈、图片描述、词语流畅的特征,检验不同认知情感探针是否互补;模态融合负责固定任务后拼接音频、视频、文本、功能性近红外特征,检验多通道观测是否更稳健,分工是一个扩任务维度、一个扩观测维度;搭配理由是单一任务或单一模态都只看到侧面,组合后论文报告 Macro-F1 提高且方差减小,说明整体评估比单信号更可靠。

任务组合上 GPT-4o 从单访谈 50.48% 到访谈加流畅 55.68%,再到加精神科推理 60.53%,GPT-o3 趋势类似,支持多任务信息对大模型也有益。但词语流畅单独用文本时仍未被充分利用,因语言转录无法保留认知与情感的丰富性,这与 RQ1 中音频更适合该任务的发现一致。下表汇总该部分的可核对增益。

条件指标基线直接预测
GPT-4o 零样本Macro-F1直接预测基线
GPT-4o 少样本Macro-F1直接预测基线
DeepSeek-R1 少样本Macro-F1直接预测基线
Qwen2.5-Omni 零样本Macro-F1多模态输入
GPT-o3 少样本Macro-F1直接预测基线

该表的主要收益是知识引导在零样本非思考模型上稳定,代价是思考型与多模态模型可能冲突。未胜出项必须保留:DeepSeek-R1 与 Qwen2.5-Omni 的负结果说明不能把推理提示当成通用增益。

限制:哪些结论不能推广?

论文直接报告的是 C-MIND 内部、拼接融合、Macro-F1 下的比较,支持任务与模态的相对排序以及知识引导的平均增益。可能待验证的是这些排序能否推广到其他医院、语言、设备与年龄分布,原文为单中心中文数据,不能直接推广。相关性不等于因果,高分只说明行为模式与诊断相关,不能说该声音特征导致抑郁。

未测量项包括误诊率分布、延迟、推理成本、输出稳定性与临床部署风险,原文未报告训练资源与推理开销,因此不能承诺融合或大模型推理改善了实时性与成本。总体趋势不等于每组每步成立,例如融合平均更稳但个别组合方差仍大,精神科推理平均提升但在特定模型上显著下降。个案分析显示知识能纠正把低词数当作精神运动迟滞、把短暂抱怨当作核心抑郁的误读,但那是单样本解释,不能当作整体精度的证明。

复现先做什么:按原文重走关键步骤

先按采集条件重建数据理解:确认 169 人中 86 例 83 对照的 DSM-5 标签,10 个测试的时长与提示词,4 模态的采样率与对齐方式,音频 44.1 千赫 24 位、视频 640 乘 480 每秒 30 帧、转录经商用识别加人工校对、近红外 45 通道。不要用问卷分数替代临床标签。

再按特征与划分重跑判别实验:分别实现经典特征与基础模型特征两套,按 6 比 2 比 2 划分,用 6 种传统骨干逐个评估任务模态对,报告 Macro-F1 并在 5 种子下平均,然后做任务拼接与模态拼接的融合。复现时保留原文精度与单位,不自行四舍五入。

最后复现大模型比较:固定拼接 10 个测试文本,分别跑直接预测、自由推理、精神科推理的零样本与少样本,记录相对直接基线的百分点变化,注意百分点与相对百分比不同。检查 DeepSeek 思考模型与多模态模型的下降是否复现,以确认提示兼容性问题。缺项是传统模型超参数与大模型版本细节需查技术附录,本次无验证资源,不写已公开。

收束:何时值得尝试这种做法?

当你有临床确诊标签且能设计结构化任务时,值得优先尝试多任务多模态的拼接融合,特别是图片描述配音频、词语流畅配音频、访谈作基线的组合,因为论文显示它们互补且更稳健。当你想用大模型做辅助判断时,值得尝试把任务定义与行为期望写进提示做精神科推理,尤其在零样本非思考模型上,但要先在小样本上验证是否与模型的内置思考冲突,并保留监督判别基线作对照。

还需补的验证是跨中心跨语言的泛化、近红外与其他生理信号的增量价值、融合方法的系统比较、以及错误案例的临床风险分析。对语音音频新生的提醒是:先沿样本走完输入到表示到组件到目标到输出,再谈分数;把比喻对应到停顿、韵律、表情单元等真实信号,不把比喻当性质证明。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总