英文题目:Speech-based Psychological Crisis Assessment using LLMs
会议身份:
conference:interspeech:2026:conference-paper-id:chiba26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#数据增强 #指令微调 #多任务学习 #语音 #病理语音评估
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Terumi Chiba:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyun Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Yongsheng Tong:机构信息未能从会议 PDF 纯文本可靠映射
- Chao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是从中文心理支持热线录音直接预测三级心理危机等级,输入为长达数十分钟的真实求助对话,输出为无危机、低危机与中高危机,难点在于数据稀缺、隐私受限且纯文本转写会丢失哭泣与颤抖等关键情感证据。方法先用自动语音识别将长通话转写为文本,再由语音大模型按危机三元评估表抽取情感与声学表现并以括号形式注入转写文本,形成副语言富化转写。随后微调文本大语言模型,以分类损失完成等级分类,并以生成损失同步生成三元评估表推理链作为辅助正则,前一步的富化文本直接作为本步分类与生成的输入。将长通话切分为连续五分钟短块做数据增强,测试时对同属一通呼叫的所有短块预测多数投票回呼叫级。与直接微调语音端到端模型不同,该框架把副语言信息显式文本化从而复用强文本推理能力,避免在小数据上从零训练适配器。在呼叫级5折交叉验证评测下,本框架的宏F1分数为0.802,高于SpeechLLM基线的宏F1分数0.551。结论仅适用于该私有中文热线分布与三分类口径,未验证跨中心、跨语言与实时部署的外推性。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留什么?
本文解读的对象是一项中文心理支持热线研究,输入是真实热线录音,目标是把每一通电话判为无危机、低危机、中高危机三档之一。初学者容易把这件事理解为语音情感识别的直接延伸,但热线场景有 3 个硬约束需要先记住。第一是隐私敏感,音频与转写都在热线中心伦理规范下处理,不能随意外传。第二是数据稀缺,全文只报告 154 通电话,总时长约 100 小时,平均每通 39.49 分钟左右。第三是评估口径是呼叫级,不是句子级,临床要的是对整通电话的分诊建议,而不是某一句是否难过。
为此作者提出一条可复述的管线。先用中文自动语音识别得到词序列,再用语音大模型抽取哭泣、叹息、颤音等副语言线索并写回文本,形成富含副语言的转写,最后微调文本大模型输出危机等级。训练时还加了一路推理生成做辅助约束,并把长通话切成 5 分钟块做扩增。评估用呼叫级五折交叉验证,主要指标是宏 F1 值,兼报准确率。最终报告的最佳结果是准确率 0.805、宏 F1 值 0.802,超过声学基线、零样本大模型与语音大模型微调基线。
阅读时必须保留的信息包括数据规模与类别分布、3 个基线的可运行条件、五折与多数投票的聚合方式、副语言注入与推理增强各自的监督来源,以及消融中去掉每一项后的下降幅度。这些是判断方法是否可学、可比、可复现的依据。后文按学习依赖展开,先讲任务与已有路线,再走完一个样本的全流程,然后讲训练、实验条件、结果与反证,最后收束到复现清单。
已有路线在热线任务上各解决了什么?
在热线与咨询数据上,前人至少走过 3 条路线。第一条是手工声学特征加传统分类器,例如用功能级韵律与音质描述子刻画来电者声音,再训练支持向量机。这条路线输入是纯音频,优点是不需要转写,缺点是特征是整段统计量,难以捕捉跨语境的语义与求助意图。本文把这类方法作为声学基线,用开放工具包提取特征并只保留来电者音频,去除接线员声音,以排除混杂。
第二条是基于文本的分类器,从早期转换器分类器到近年用大模型做抑郁、自杀风险相关任务。这条路线输入是转写文本,优点是能利用语义与上下文,缺点是标准转写会丢掉副语言。本文引用的前人二分类工作即属于此类,只用真实危机转写做二分类,没有显式利用声音中的副语言信息。
第 3 条是直接能听音频的语音大模型,端到端输入语音并输出标签。这条路线理论上最完整,但本文的对照显示,在只有 154 通的小数据上直接微调语音模型效果有限。作者的判断是当前语音模型在语境化副语言推理上仍有短板,若无韵律感知的专门监督,容易欠利用 prosody。于是本文选择第四条折中路线:不让文本模型去听波形,而是把听到的结果翻译成文字再交给文本模型推理。这就是后文副语言注入的由来。
154 通电话长什么样,为什么说数据稀缺且敏感?
数据集来自中文心理支持热线,共 154 通。2 位均为热线评估主管的专家把每通标为 0 无危机、1 低危机、2 中高危机,并检查了标注一致性。来电者覆盖不同性别、年龄与职业,话题包括抑郁、焦虑、关系压力、自杀意念等,自发且情绪浓度高。所有音频与转写均按热线中心伦理规范处理,这是隐私敏感的具体含义:不是公开爬取的表演性语料,而是真实求助场景。
从统计看,数据呈现 3 个特点,初学者可对照下图逐项核对。下面这段导读先说明要看什么,再给出官方原图,最后解释它对建模的约束,请按顺序阅读。
看图路径: 1. 先看左上年龄直方图的均值线与中位数线位置,确认来电者集中在 20 岁左右;2. 再看右上时长直方图的双峰与均值约 39.5 分钟、中位数约 41.7 分钟;3. 对照左下三类数量 55、42、57,确认类别相对均衡;4. 最后看右下箱线图,比较 0 级与 1、2 级在时长中位数上的分离
论文图 1。原论文 Figure 1:“Data statistics: (a) age distribution, (b) duration distribution, (c) crisis level distribution, and (d) relation between duration and crisis level.”。
这张四面板图报告了可复现的数据画像。左上年龄直方图集中在 22 岁左右,8 人缺年龄信息;右上时长直方图呈双峰,短通话与长通话都不少;左下柱状图显示 3 类数量为 55、42、57,相对均衡;右下箱线图显示有危机的通话往往更长,无危机通话中位数明显更低。
这意味着模型不能简单用时长判危机,但时长分布不均提示切块与聚合时要保持呼叫级口径,否则长通话的块数优势会污染评估。性别信息仅 99 人可用,其中男 57、女 42,说明人口学字段有缺失,复现时不应假设字段完整。
一个样本如何从录音走到危机等级?
先沿一通电话走完全程。假设输入是一通 40 分钟左右的中文来电,含来电者与接线员交替说话。第一步用自动语音识别把语音转成中文词序列,得到只有字的原始转写,例如我被迫搬出宿舍之类的陈述句。第二步用语音大模型听原音频,按危机评估表的情感域约束抽取核心危机情绪及其声音表现,例如颤抖、低音量、明显抽泣,并判断悲伤大于焦虑。第三步把第二步的描述以方括号形式插回对应话语之后,形成富含副语言的转写。第四步把该长文本与分类提示拼接,送入微调后的文本大模型,模型在下一个词位置输出 0、1、23 个类别词的概率,取最大者为该块预测,多块再投票为整通预测。
下图是该流程的官方总览,导读要求先看主路径再看汇合点,读完后再看解释。
看图路径: 1. 沿左侧语音图标向右追踪主链:语音到转写再到富含转写最后到危机等级;2. 注意语音到语音大模型的第二条下行箭头,确认声学分支直接听原音频;3. 观察富含转写处两路汇合,理解文本与副语言描述在此合并
论文图 2。原论文 Figure 2:“The overall framework of the proposed method.”。
图中从左到右只有一条主链:语音经自动语音识别得到文本,同时语音直连语音大模型得到副语言描述,两者在富含转写处合并,再进入文本大模型输出危机等级。关键点是语音大模型框同时接收识别管线的上下文与原始语音,这与正文描述一致:不是让语音模型重做识别,而是让它在情感约束下做声音证据抽取。下游文本模型始终只读文字,因此所有声音信息必须显式写出来才能被利用,这就是显式文本化的核心取舍。
副语言注入把什么声音写成什么文字?
副语言在这里是白话的怎么说,包括哭泣、叹息、颤音、音量低、语速变化等非词信息。英文对应 paralinguistic cues。自动语音识别转写只保留说什么,副语言注入负责补回怎么说。实现上作者用 Step-Audio-R1 个模型,并用危机干预评估表的情感域做提示约束,要求只抽取与危机相关的核心情绪及其声音表现,而不是开放式声景描述。
自动语音识别转写 × 副语言注入: 自动语音识别转写负责把通话语音变成可读的词序列,分工是保留语义内容,但会丢掉哭泣、颤抖、低音量等声音证据;副语言注入负责用语音大模型抽取这些非言语线索并写成括号式文本,分工是补回情感强度;二者搭配是因为下游只有文本大模型能做强推理,组合后形成富含副语言的转写,让同一文本同时携带说什么和怎么说。
举一个论文给出的例子帮助理解,例子是教学示意而非新增证据。原始转写是我被迫搬出学校宿舍,纯文字可中性可委屈。注入后变成同一句话后跟方括号:颤抖声音、明显抽泣、低音量,表达极度悲伤无助,情绪为悲伤大于焦虑。这样下游模型看到搬出宿舍时,同时看到强度标记,不会只按字面判为中性搬家。原文强调这种对齐是话语级对齐,即描述紧跟对应话语,而不是整通一段总结,这对长对话推理很重要。
语音大模型 × 文本大模型: 语音大模型在此只做特征描述器,不直接分类,分工是听出悲伤大于焦虑、抽泣、颤音等表现;文本大模型负责读富含副语言的长对话并输出 0、1、2 危机等级,分工是做跨语境推理;搭配理由是数据只有 154 通,直接端到端训练语音模型易欠拟合,组合意义是把声学证据显式文本化,绕开在小数据上从零学习音频到标签映射的困难。
为什么不用语音向量直接拼给文本模型?作者做了一个对照:用 emotion2vec 抽每句情绪向量,经多层感知机适配器映射到文本向量空间,再与原始转写向量在序列维度拼接后联合建模。结果显示该隐式向量路线同样下降,说明在小数据上从零训练适配器不可靠。显式文本化的好处是无需学习新的模态对齐,直接复用文本大模型的语言先验,代价是描述粒度受提示与语音模型能力限制,且可能引入模型幻觉式的情绪词,复现时需保留原始提示与输出样例以备核查。
评估表约束如何进入提示与监督?
危机干预评估表简称 TAF,白话是危机分诊用的结构化量表,含情感、行为、认知 3 个域。情感域看情绪波动与表达,行为域看日常功能与冲动行为,认知域看思维清晰度与决策控制。数据集中专家只给了最终三分类,没有分开标 3 个域分数,这是必须记住的监督边界。
在注入阶段,TAF 只作为提示约束,告诉语音模型重点找情感域证据。在训练阶段,TAF 作为推理目标的结构,要求生成的解释必须按情感、行为、认知顺序给分并汇总。例如论文示例的推理目标写道:来电者悲伤焦虑但能流畅回答,对应轻度情感损伤;有自伤史但能上学社交,对应轻度行为损伤;能讲清情绪原因与计划、无认知混乱,对应轻度认知损伤,3 维 2 分加总后判 0 级。该文本不是临床金标准,而是用 gpt-oss-120b 按富含转写、真实标签与 TAF 标准生成的辅助目标,仅用于训练时的生成损失,评估仍只看专家三分类是否判对。
两路前向与切块扩增是怎样计算的?
训练管线有两路并行前向,输入是同一份富含副语言的转写。第一路拼接分类提示,提示大意是基于上述情绪表征与热线对话,评估危机等级为多少,模型在下一词位置对 0、1、23 个词算交叉熵分类损失。第二路拼接生成提示,要求按 TAF 约束生成标签解释,对目标推理词做教师强制的生成损失。最终目标是两者相加,共同更新同一文本模型的参数。 backbone 是 Qwen2.5-7B-Instruct,用低秩适配微调,只更新注意力投影等少量参数,优化器为 AdamW,学习率 3 乘 10 的负 5 次方,余弦退火加前 10% 线性热身,有效批量 16,单卡训练至收敛并固定随机种子。
数据扩增的动作很具体:把每通原始通话按时间切成不重叠的连续 5 分钟块,转写按同样边界对齐,保持块内时序与对话流不断裂,共得到 900 余块。训练见块,测试仍回通话:同一通话的所有块必须在同一折内,块预测经多数投票得到呼叫级预测。这保证了五折划分的泄漏控制。下图上半是注入示例,下半是两路损失汇合,读图时先看文字变化再看损失汇合。
看图路径: 1. 先读上半示例框,对比原始转写与加入颤抖、抽泣、低音量后的文本差异;2. 再看下半训练框,区分分类提示与生成提示两条并行输入路径;3. 沿右侧箭头找到分类损失与生成损失汇成总损失的节点
论文图 3。原论文 Figure 3:“Model training pipeline. The enriched transcript is used in two parallel forward passes: one with a classification prompt to predict the crisis level, and the other with a…”。
上半示例直观显示了从纯词序列到带方括号证据的转变,括号内同时有声音表现与情绪排序。初学者应注意这不是人工标注,而是语音模型输出,复现时要保存该中间文本。下半训练框显示分类提示加转写与生成提示加转写分别进入同一大模型,右侧分别产生目标类别词与目标解释词,再算出分类损失与生成损失并相加。图中写作生成损失与分类损失相加即总目标,与正文公式一致。
危机评估三元组 × 诊断推理链: 危机评估三元组指情感、行为、认知 3 个域的损伤评分,分工是给出临床可对照的评分结构;诊断推理链是由大模型按该结构生成的分步解释文本,分工是把标签背后的证据链写出来;搭配原因是专家只标了最终三分类,没有三域金标准,组合意义是用生成的推理做辅助生成目标,约束分类器关注与评估标准对齐的证据,而不是只记说话人特点。
分块数据扩增 × 多数投票聚合: 分块数据扩增负责把一通长通话切成多个连续 5 分钟块,分工是在训练时扩大样本量到 900 余块以稳定收敛;多数投票聚合负责在测试时把同一通话的所有块预测合并为一个呼叫级标签,分工是保证评估口径仍是通话级;搭配原因是切分不能改变以通话为单位的临床决策对象,组合后训练见多样本、测试仍判整通,避免把块级准确率误当呼叫级效果。
分类损失 × 生成损失: 分类损失对应分类提示下对 0、1、2 类别词的交叉熵,分工是直接优化危机等级判对;生成损失对应生成提示下对推理目标词的教师强制交叉熵,分工是要求模型复述评估逻辑;搭配原因是单靠 154 个标签容易过拟合,组合成总目标同时优化两路前向,让推理生成成为软约束,引导模型建立从对话内容到等级的中间解释。
需要指出的缺项是原文未报告推理目标的长度分布、生成损失权重搜索过程,以及切块后块级标签是否直接继承通话标签的细节。按描述推断块继承通话标签,但原文未明示块标签噪声处理,复现时应先按继承实现并记录块级与通话级的一致性,不自行脑补加权策略。
评估协议与基线是否在同条件下比较?
评估用呼叫级五折交叉验证,每折 80% 训练、20% 测试,块不跨折,测试经多数投票回通话。主要指标是五折宏 F1 值的均值与标准差,兼报准确率。宏 F1 值是对 3 类 F1 值取平均,类别均衡时仍能反映小类的判错,方向是越高越好。准确率是判对通话占比,方向同样越高越好,但长尾或时长偏置下可能高估,因此要以宏 F1 值为主。
3 个基线均为实际可运行策略。传统声学基线用 eGeMAPS 功能集经 OpenSMILE 提取,仅用来电者音频并去除接线员声音,再训练径向基核支持向量机。零样本基线把富含转写直接喂给 gpt-oss-120b 高推理模式,按 TAF 描述估计三域分数再汇总,不做领域微调。语音大模型基线用 Qwen2.5-Omni-7B 直接消费音频,遵循同样的数据扩增与五折多数投票,以检验显式文本化是否优于音频端建模。实现细节中微调 backbone、优化器与低秩设置均已给出,硬件为单张 A800,这是复现预算的直接依据。
资源可用性方面,本次收到的证据中没有完成超链接可达验证的资源,不得声称代码、模型或数据已公开。原文脚注给出 Paraformer-zh、Step-Audio-R1、gpt-oss-120b、Qwen2.5-Omni-7B 与 Qwen2.5-7B-Instruct 的模型页与 emotion2vec 页,但按本次核对规则只能视为文本提及,不能写当前可用或已公开。数据因伦理限制未见公开声明,复现时应按无公开数据准备。
主结果测了什么,谁赢了,代价是什么?
主结果要回答的问题是:在同为呼叫级五折与多数投票下,显式文本化加微调是否超过纯声学、零样本推理与直接语音建模。公平条件是后两者中的语音基线与本文方法共享扩增与折划分,声学基线同样只用来电者音频。指标方向是宏 F1 值与准确率越高越好。下表把论文直接报告的关键数字整理为五列,文本列用于说明条件,数字列保留原文写法,比较对象列标明可部署性。
| 系统 | 输入与训练条件 | 准确率 | 宏 F1 值 | 比较对象与可运行性 |
|---|---|---|---|---|
| 零样本大模型加富含转写 | 无微调,按评估表提示推理 | 未报告 | 0.371 | 可运行,提示推理 |
| 传统声学支持向量机 | 仅来电者音频手工特征 | 未报告 | 0.471 | 可运行,传统机器学习 |
| 本文方法 | 富含转写加微调文本大模型 | 0.805 | 0.802 | 可运行,本文最优 |
| 语音大模型微调 | 直接消费音频,同扩增同评估 | 落后本文 0.251 | 落后本文 0.251 | 可运行,端到端语音 |
上表数字均来自正文连续原句的逐字证据,表头单位与聚合口径按原文交代:准确率与宏 F1 值为五折均值,语音基线的差距为绝对增益 0.251。表前已提出比较问题与公平条件,表后在此解释收益与代价。主要收益是本文方法在宏 F1 值上明显高于 3 类基线,零样本仅 0.371 说明仅靠提示不够,声学仅 0.471 说明手工描述子缺语境语义,直接语音建模落后 0.251 支持了文本化在小数据下的有效性。
代价是该收益依赖切块扩增与微调,且推理目标为模型生成而非专家三域标签,不能把生成文本当临床解释。未胜出项是所有基线均未超过本文方法,但原文未报告延迟、误判率分布与跨中心泛化,因此不能承诺分诊一致性或资源节省在部署中必然成立。
拿掉哪一块掉得最多,替代方案行不行?
消融要回答 3 个子问题:扩增、注入、辅助损失各自贡献多少。条件保持 backbone 与评估不变,每次只动一项。指标仍看宏 F1 值下降幅度,下降越大说明该组件越关键。下表把下降幅度整理为五列,基准列固定为全文最优,变化列为原文报告的下降值。
| 配置 | 相对全文的变化 | 准确率 | 宏 F1 值 | 下降幅度与含义 |
|---|---|---|---|---|
| 全文最优 | 无改动 | 0.805 | 0.802 | 基准 |
| 去掉数据扩增 | 不切块直接训整通 | 下降 | 下降 10.0% | 掉得最多,易过拟合 |
| 去掉副语言注入 | 只用原始转写 | 下降 | 下降 4.1% | 丢失声音证据 |
| 改用向量拼接 | 情绪向量加适配器拼接 | 下降 | 下降 4.2% | 小数据难训适配器 |
| 去掉辅助推理损失 | 只留分类损失 | 下降 | 下降 1.7% | 软约束作用较小 |
上表下降幅度均有原文连续句支撑,基准数字与主结果一致。表后解释如下。去掉扩增带来 10.0% 绝对下降,是最大跌幅,支持作者的判断:154 通直接训长序列易记住说话人特点,切块后伪样本增多、收敛更稳。去掉注入下降 4.1%,说明纯转写丢掉了细粒度危机所需的情感信息。改用情绪向量拼接同样下降 4.2%,在其他设置不变下未追上显式注入,可能因适配器需从零训练而数据不足。
去掉辅助损失仅下降 1.7%,支持其作为有益软约束,但不是决定性因素。反例是即使去掉辅助损失,模型仍保持较高水平,说明主要增益来自注入与扩增,而非推理生成本身。边界是原文未做块长度搜索与投票策略搜索,5 分钟与多数投票是否为最优待验证。
哪些结论不能从现有证据推出?
首先,推理目标不是金标准。专家只标了最终三分类,情感、行为、认知三域分数是模型按真实标签与评估表生成的,训练时可做正则,测试时不能当临床依据,也不能把生成的解释直接发给接线员当诊断书。其次,数据缺失不可忽视。年龄缺 8 人,性别仅 99 人可用,时长双峰且危机通话更长,若在新中心时长分布不同,阈值与投票可能漂移。第三,评估局限在单中心 154 通的五折内,无跨中心、无前瞻、无人工一致性对比,未测量误判率、延迟与计算成本,因此论文自称是人工监督下的分诊支持而非替代,这一限定应保留。
相关性不等于因果。注入后性能提升支持声音证据有用,但不能推出括号中每个情绪词都准确,也不能推出模型真正理解了评估表逻辑。总体趋势不等于每通都好,宏 F1 值是平均,个别长通话或方言、重叠说话仍可能失败,原文未给出按类别或按时长的分项表,复现时应补充分层评估。最后,模型页链接在本次核对中未验证可达,不能据模型名推定分词、采样率或解码实现,缺失处应明确记为未报告,而不是按默认实现脑补。
复现先做什么,需要哪些超参数与信息条件?
若要复述方法,先按呼叫级准备数据。收集整通录音与专家三分类标签,记录年龄、性别缺失情况,保留接线员与来电者分轨或至少能分离来电者音频。用 Paraformer-zh 做中文识别得到原始转写,用 Step-Audio-R1 按情感域约束抽取声音表现并插回对应话语,保存富含转写中间文件以便抽查幻觉。切块时按 5 分钟不重叠连续切分,转写按同边界对齐,同一通话的块固定在同一折。
训练侧用 Qwen2.5-7B-Instruct 加低秩适配,秩 8、缩放 64,作用于注意力查询、键、值与输出投影。优化用 AdamW 默认设置,学习率 3 乘 10 的负 5 次方,余弦退火加前 10% 线性热身,有效批量 16,单卡 A800 训至收敛并固定种子。分类提示拼接富含转写后预测 0、1、2,生成提示拼接同一转写后复述三域推理,两路损失相加。推理目标用 gpt-oss-120b 按富含转写、真实标签与评估表生成,仅作辅助,不参与评估。测试时块预测多数投票回通话,报告五折宏 F1 值均值与标准差及准确率。
还需补的验证包括块长度与投票阈值敏感性、3 类分项指标、去除时长特征后的表现,以及跨中心或跨时段的泛化。若只能做一项,优先补按危机等级与时长分层的误差分析,因为时长与标签的相关可能带来捷径风险。
何时值得尝试这种文本化路线?
当你只有百量级真实语音、但有较强文本大模型可用,且任务需要长语境推理时,值得尝试先把声音翻译成文字再微调。本文的证据是该路线在呼叫级五折上达到准确率 0.805、宏 F1 值 0.802,超过同条件下的直接语音微调约 0.251,且去掉注入会掉 4.1%。这支持了在数据稀缺下复用文本先验的取舍。
当你有充足语音标注、能做韵律感知监督,或需要低延迟流式分诊时,不应直接照搬。本文未报告延迟与成本,5 分钟切块加两路微调的开销在热线实时场景中需重测。教学上的误解常是把括号情绪当人工金标准,或把块级数量当样本量夸大泛化。记住括号是模型听写,900 余块仍来自 154 通,评估单位始终是通话。带着这些边界去读结果,才能把该方法放在人工监督的分诊支持位置上,而不是替代临床判断。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


