英文题目:Automatic Detection of Stress from Speech in the Trier Social Stress Test
会议身份:
conference:interspeech:2026:conference-paper-id:drimalla26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#语音生物标志物 #集成学习 #生理信号 #语音 #音频分类
评分:5.7/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Hanna Drimalla:机构信息未能从会议 PDF 纯文本可靠映射
- Wieland R. Cremer:机构信息未能从会议 PDF 纯文本可靠映射
- Christine Kraus:机构信息未能从会议 PDF 纯文本可靠映射
- Oliver T. Wolf:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为实验室诱发求职演讲语音,输出为应激与对照条件标签及皮质醇、淀粉酶和情感变化值,难点在于个体差异大且应激声学线索细微易与任务交互混淆。处理链分为 4 步:先将 9 分钟录音裁剪并用 Sortformer 做说话人分离标注 Diarization 以保留被试语音,再用 librosa、Praat 与 openSMILE 提取梅尔频率倒谱系数 Mel-Frequency Cepstral Coefficients / MFCC、基频与扩展日内瓦极简声学参数集 extended Geneva Minimalistic Acoustic Parameter Set / eGeMAPS 并拼接为被试级向量,接着在折内标准化后训练逻辑回归与树集成分类回归模型,最后用沙普利加性解释 Shapley Additive Explanations / SHAP 解释特征贡献。与既往无对照或组内设计相比,组间随机对照加生理与情感多维验证使声学差异更可解释为应激效应。在 50 名被试的 10 折嵌套交叉验证中,极端梯度提升 Extreme Gradient Boosting / XGB 以准确率 0.82 与曲线下面积 Area Under Curve / AUC 0.82 显著超过多数类基线,支持语音可区分急性社会评价应激。结论仅适用于德语大学生实验室演讲场景,未验证真实世界噪声、跨语言与长期应激的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://github.com/nokiagiant/egemaps — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:要解决的压力测量困难是什么?
本解读的输入是论文原文证据与两张官方原图像素,目标是让刚进入语音与音频领域的研究生能复述方法与实验条件,核对关键数字,并理解结论的边界。必须保留的信息包括被试分组方式、录音与特征处理链、分类与回归的验证方式、基线比较结果以及作者承认的混杂。输出按学习依赖展开,先讲任务与对照路线,再讲数据采集与处理全景,然后讲特征与模型组件,接着讲验证与训练细节,最后讲结果、反证与复现要点。
研究面对的困难是压力常用自评量表与唾液生物标志物测量。论文指出唾液皮质醇与唾液淀粉酶是重要参照,但采集易受程序与情境因素影响,难以不打扰地、频繁地、大规模地标准化采集。语音的吸引力在于可以不打扰地反复记录,且已有文献报告基频、强度、语速与停顿在压力下出现细微但可靠的变化。白话说,就是人紧张时说话的音高、响度与流畅度会动,但单看一段录音很难直接判定紧张程度,需要对照实验把这种变化固定下来。
特里尔社会压力测试 × 友好控制条件: 特里尔社会压力测试负责通过求职演讲与心算在评审委员会面前制造社会评价威胁,友好控制条件负责保留相同的演讲结构但去掉评价威胁并改为友好交谈,二者搭配的理由是只有结构相同而威胁不同才能把语音差异归因于压力而非任务时长或话题,组合意义是形成组间对照的压力检测标签。
论文把特里尔社会压力测试简称为 TSST,把友好版简称为友好 TSST。TSST 是被广泛视为金标准的实验室社会心理压力范式,通过在假装的委员会面前演讲与心算制造社会评价威胁。友好 TSST 保留整体结构但去掉评价威胁,用于充当非压力控制条件。作者强调先前有工作只用 TSST 预测皮质醇时间序列,没有控制条件就无法回答语音能否区分压力与非压力,而有控制条件的工作采用被试内设计,可能因先后顺序导致友好条件也被污染,因此本研究采用全组间设计重新采集数据。
同类路线比较:为什么控制条件决定结论可信度?
按同输入、同目标、同监督作对照,可以把相关路线分成 3 类。第一类是用多样压力源训练通用压力检测,例如外语说话、表演压力或实验室诱发压力,输入都是语音,目标都是二分类或回归,但压力是否存在与强度往往不明确,结果不一致。第二类是在 TSST 内预测生理时间序列,例如用声学表示关联唾液皮质醇,监督来自多次唾液采样,优点是生理标签连续,缺点是没有非压力语音对照,无法证明模型学到的是压力而非说话人或任务本身。
第 3 类是引入友好 TSST 作对照,例如近期用可穿戴与语音区分压力与控制条件,但采用被试内设计,先做 TSST 再做友好条件时友好样本仍可能残留压力,导致分类困难。
本研究的差别在于坚持组间随机分配,一半人只做 TSST,一半人只做友好 TSST,从设计上切断顺序污染。它的监督同时包括情境标签与生理情感反应量:皮质醇反应性、淀粉酶反应性、正负情绪变化。这种安排使两个问题可以分开回答:语音能否区分情境,以及语音能否预测个体反应强度。作者没有声称解决连续跟踪或真实场景泛化,这些属于未验证的外推,阅读时不应把实验室组间准确率直接当作可穿戴实时检测性能。
任务如何定义:两个预测问题与各自标签是什么?
第一个任务是二分类:判断一段被试语音来自 TSST 还是友好 TSST。输入是每位被试一个 144 维的被试级特征向量,输出是情境标签。评估在跨被试层面进行,即训练与测试的被试不重叠,避免学到说话人身份。指标是分类准确率与 ROC 曲线下面积,方向都是越高越好,并与多数类基线比较。多数类基线在本数据中是猜测人数相等两类中的任意一类,期望准确率约 0.50。
第二个任务是回归:用同一语音特征预测压力反应强度。标签有 4 种,分别是皮质醇反应性、淀粉酶反应性、积极情绪变化与消极情绪变化。皮质醇与淀粉酶的反应性定义为任务后最大值减去基线值,情绪变化定义为任务后减去任务前。白话说,分类问的是哪种情境让人更紧张,回归问的是从声音能猜出每个人紧张了多少。回归在全样本与仅 TSST 子样本上分别训练,指标是平均绝对误差与预测值真值间的斯皮尔曼相关,前者越低越好,后者越高越好,并与每折取训练均值的平均值基线比较。
举例说明流程:假设 1 名被试完成 10 分钟演讲,系统先截取固定 9 分钟段,只保留其本人语音,提取 3 套声学统计并拼成一个向量,然后分类器输出压力概率,回归器输出预测的皮质醇升高值。这只是帮助理解的例子,不代表论文报告了该个体的数值,论文只报告跨被试聚合的准确率、误差与相关。
方法全景:从一个人走完录音到标签的全链路
沿一个样本走完全程有助于建立依赖顺序。起点是实验室录音:被试戴眼镜式麦克风,从准备阶段开始记录,原始时长约 16 分钟。接着截取从第 7 分钟开始的 9 分钟段,覆盖准备尾段与演讲任务,减少实验员交互噪声。然后用说话人分离模型区分屋内说话人,保留说话总时长最长的说话人作为被试,去除 50 毫秒衔接的重叠段,把属于被试的片段拼成连续波形,不插入超过自然停顿的额外静音。处理后 TSST 平均约 4.13 分钟,友好条件约 6.51 分钟,差异本身与委员会是否追问有关,后文讨论混杂时还会回到这一点。
随后进入特征表示:同一段被试语音分别经过 3 种互补工具链,得到 40 个梅尔频率倒谱系数均值、15 个经典嗓音参数与 88 维的扩展日内瓦极简声学参数集,再加上性别作协变量,拼成 144 维。每维特征在每个交叉验证划分内只用训练折做标准化,再应用到测试折,避免信息泄漏。最后进入建模:分类用逻辑回归、支持向量机、随机森林与梯度提升树 4 种算法区分 TSST 与友好条件;回归用支持向量回归、随机森林回归与梯度提升回归分别预测 4 种反应指标。特征重要性用沙普利可加解释在各折平均,用于复述哪些声音线索贡献最大。
这条链路的依赖关系是录音质量决定分离质量,分离质量决定特征统计是否干净,特征标准化方式决定交叉验证是否可信,验证方式决定性能数字能否复现。任何复现都必须按此顺序检查,而不是只调模型超参数。
语音如何变成向量:分离与三套特征各管什么?
录音设备是眼镜内置麦克风,采样为未压缩 16 千赫兹波形文件。说话人分离采用预训练的 Sortformer 模型,它是基于 Transformer 编码器的端到端语音转文本系统中的说话人监督分支。操作规则是自动做分离,取总说话时间最长者为被试,保留其片段并去掉重叠,拼接为每段录音一个波形。作者随机抽 12 段人工检查分离质量,确认无他人语音,并与另一常用分离工具比较,噪声占每人总时长不足 5%。初学者容易误以为分离是完美的,实际上委员会在友好条件下会追问,在压力条件下保持沉默,这种交互差异会改变可用的被试语音量与停顿结构,是后续必须记住的混杂。
说话人分离 × 声学韵律特征: 说话人分离负责从眼镜麦克风长录音中只保留被试本人的语音段并去掉重叠与他人说话,声学韵律特征负责把保留语音压缩为每人一个 144 维向量,分工不同但必须串联,搭配理由是若混入委员会提问则后续基频与发声率统计会被污染,组合后才得到可用于跨被试建模的干净输入。
3 套特征分工不同。第一套用语音信号处理库提取 40 个梅尔频率倒谱系数,先重采样到 22.05 千赫兹,按帧计算再平均,刻画频谱包络的整体形状。第二套用语音学软件经接口提取 15 个经典嗓音参数,例如平均与标准差基频、谐噪比、中位音高、抖动与微颤,刻画音高与嗓音质量。第 3 套用开源语音特征工具提取扩展日内瓦极简集共 88 个统计量,汇总音高、能量、频谱与嗓音质量。白话说,第一套听音色轮廓,第二套听音高抖动,第 3 套是学界常用的情感计算统计包。
三者拼接加性别共 144 维,性别用于控制男女声音差异。主成分分析降维作为对照尝试,但未提升性能,说明在 50 样本下保留原始特征已足够,降维没有带来额外泛化好处。
生理与情绪标签如何计算:反应性不是单点值
唾液在基线减 1 分钟、任务后 1 分钟与任务后 20 分钟采集,用唾液采集管收集并零下 18 摄氏度保存。皮质醇浓度单位为纳摩尔每升,用解离增强镧系荧光免疫法测量,检测下限为 0.5 纳摩尔每升,反映下丘脑垂体肾上腺轴活动。淀粉酶活性单位为单位每升,用显色底物法测量,反映交感神经唤醒。反应性指标取任务后最大值减基线,这种最大值减基线的做法在文献中被视为关键生理压力标记,比单点值更能反映升高幅度。
皮质醇反应性 × 唾液淀粉酶反应性: 皮质醇反应性负责刻画下丘脑垂体肾上腺轴的慢速内分泌应激,唾液淀粉酶反应性负责刻画交感神经的快速唤醒,二者搭配的理由是压力是多维生理过程,单一指标会漏掉不同时间尺度的反应,组合意义是检验语音特征究竟能预测哪一条通路的反应强度。
自评情绪用正负情绪量表,共 20 题,正负各 10 题,李克特 5 点计分,从几乎没有到非常强烈。分别在操作前后测量积极情绪与消极情绪得分,变化量为后减前。论文把这 4 种反应量都当作回归目标,而不是只看分类是否成功,理由是压力是多维的,情境可分不等于个体反应可预测。需要区分的是,皮质醇与淀粉酶是唾液生化测量,情绪是主观报告,它们的噪声来源与时间尺度不同,后文结果显示语音对它们的预测能力也不同,这正好支持多维评估的必要性。
没有神经网络训练时:调参与验证的真实计算是什么?
本研究没有训练深度神经网络,也没有微调声学预训练模型,因此不存在梯度反向传播、冻结层或早停。本节必须明确说明未训练的部分,再讲实际发生的计算:传统机器学习模型的超参数搜索、交叉验证聚合与基线比较。分类采用嵌套交叉验证,外层 10 折、内层 3 折调参;回归采用嵌套留一法,外层每次留 1 人、内层 5 折调参。所有预处理包括特征标准化与主成分分析都只在训练折内执行,这是防止泄漏的关键动作,复现时必须保留。
嵌套交叉验证 × 平均值基线: 嵌套交叉验证负责在外层评估泛化、在内层调超参数且所有标准化只在训练折内计算,平均值基线负责给出不听语音只猜均值时的误差下限,二者搭配的理由是小样本下极易因信息泄漏或波动而高估效果,组合后才能判断语音模型是否真正带来可部署的增益。
具体搜索空间按原文交代。逻辑回归调正则系数与惩罚类型;支持向量机调核函数、正则系数与核系数;随机森林固定 1000 棵树,调最大深度与分裂最小样本数;梯度提升树调树数、最大深度与学习率。
回归侧的支持向量回归、随机森林回归与梯度提升回归采用对应回归版本与类似网格。性能比较用考虑交叉验证依赖的校正配对 t 检验,相关系数因训练折重叠违反独立性假设而不报告显著性。特征重要性用沙普利可加解释跨折平均。代码与附加图按文中地址公开,但本次资源核查显示第三方扩展特征集链接当前不可用,复现时应以论文给出的工具版本号与主仓库为准,不依赖不可达链接。
缺项也要指出:原文未报告每次搜索耗时、硬件配置与推理延迟,也未报告固定随机种子或重复次数,因此无法从文本推定运行成本与结果方差,只能复现验证逻辑本身。
实验条件:谁被试、如何分组、录音如何截取?
数据来自健康德语大学生实验室压力诱发实验,经当地伦理委员会批准并遵循赫尔辛基宣言。排除标准包括有 TSST 经验、夜班、相关疾病用药、医疗或心理治疗、吸烟、物质滥用以及测试前运动进食饮水,纳入要求体重指数在 19 到 28 之间,女性需服用单相口服避孕药以减少内分泌波动。随机分配到压力或控制条件。压力条件采用改良版 TSST:5 分钟准备后进行 10 分钟模拟求职演讲,面对 1 男 1 女 2 位保持矜持的委员会成员并录像,委员会不给言语反馈,容忍较长停顿。
控制条件结构相同但去掉威胁:告知被试处于控制条件、可自选话题、委员会被介绍为友好交谈的实验室员工、不录像且会追问。基线时采集情绪量表与唾液,任务后 1 分钟与 20 分钟再采唾液,音频从准备开始记录。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 23.24 | 3.92 | 23.28 | 0.78;0.23;3.45;004 |
| 来源句二 | 24 | 4.27 | 23.27 | 1.90;11;44.0% |
上表显示总体平均年龄 23.24 岁、平均体重指数 23.28,女性占 46.0%,分组描述为压力组平均年龄 22.48 岁、体重指数 23.30、女性 48.0%,控制组平均年龄 24 岁、体重指数 23.27、女性 44.0%,原文表述为组间可比。代价是样本仅 50 人且为德语大学生,语言、年龄与健康筛选限制了向其他人群的推广。录音截取统一为从第 7 分钟开始的 9 分钟段,原始每组约 16.6 分钟,处理后压力组语音更短而控制组更长,这与委员会是否互动直接相关,复现时必须保留同一截取规则,否则停顿与语量特征会失去可比性。
情境能否分开:分类准确率与 ROC 说明什么?
操作检验先确认压力确实被诱发。对数转换后的皮质醇在任务后 1 分钟与 20 分钟显著高于控制组且基线无差异,淀粉酶轨迹组间无显著差异,消极情绪在压力组上升而控制组下降,积极情绪呈相反但不显著趋势。这意味着皮质醇与消极情绪是有效的压力信号,而淀粉酶在本设计中两组都有反应,不能作为区分压力的标签。这个检验是后续解释的基础:若语音能预测淀粉酶才奇怪,因为标签本身就不区分条件。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 0.82 | 0.11 | — | — |
| 来源句二 | 23.24 | 3.92 | 23.28 | 0.78;0.23;3.45;004 |
上表的主要收益是梯度提升树准确率 0.82 最高且显著高于基线,随机森林 0.80 接近,逻辑回归 0.78 与支持向量机 0.74 也显著但更低,说明非线性集成在小样本表格特征上占优。具体代价是标准差较大,逻辑回归达 0.23,提示折间波动大。未胜出项是支持向量机排序垫底,表明默认核与正则网格在本特征上不如树模型稳定。混淆矩阵显示压力组 20 对 5、控制组 21 对 4,误判相对均衡,没有一边倒向某一类。主成分降维未提升性能,属于负结果,说明问题不在维度过高。
下段先导读 ROC 图:该图横轴是误报率,纵轴是命中率,对角虚线是随机猜测,4 条阶梯曲线分别对应 4 种分类器,图例给出各自曲线下面积,数值越高代表跨阈值整体区分越好。
看图路径: 1. 先看横轴误报率与纵轴命中率的定义,再看对角虚线代表的随机猜测位置;2. 比较四条阶梯曲线在低误报区谁更早抬升,重点看图例中四个 AUC 数值;3. 观察随机森林与支持向量机曲线的分离位置,判断优势是全局还是局部阈值段;4. 把曲线优势与正文中准确率排序对照,看排序是否一致
论文图 1。原论文 Figure 1:“ROC curves for the classification models.”。
从像素可见 4 条曲线都明显位于对角线上方,低误报区已快速抬升到 0.6 以上命中率。图例显示随机森林曲线下面积 0.85 最高,梯度提升树 0.82 次之,逻辑回归 0.81,支持向量机 0.77 最低。这与准确率排序不完全相同:准确率最高的是梯度提升树,而跨阈值整体最优的是随机森林,说明单阈值准确率与全阈值面积评价角度不同。支持向量机在左段抬升最慢,与其准确率垫底一致。不能把末端接近 1.0 推广为全程完美,优势主要集中在中低误报区,且样本仅 50 人,曲线阶梯感明显,阈值微调会带来较大波动。
靠什么声音判别:重要特征与回归的成败如何对照?
特征重要性分析是对分类性能的拆解,不是独立的准确率比较。论文用沙普利值跨折平均找出梯度提升分类器最相关的 5 个特征:浊音谱通量变异性、低频谱能量、浊音段比率、局部微颤变异性与极低频谱能量。白话说,模型既看频谱随时间变化有多不稳定,也看低频能量分布,还看有声段占比与嗓音微颤的波动。这些特征与既往报告的音高、言语产出与微颤线索部分一致,另有阿尔法比率与哈马伯格指数等较少研究的特征在回归中出现,作者认为值得进一步验证,但目前只是关联而非因果。
下段先导读特征重要性图:该图纵轴是 5 个特征名称,横轴是沙普利值,零线左右分别指向控制与压力,颜色从蓝到红表示特征值从低到高,每个点代表一个被试在某折的贡献。
看图路径: 1. 先看横轴沙普利值的零线,左侧为指向控制类,右侧为指向压力类;2. 逐行看五个特征名称,记住谱通量变异性排在首位;3. 观察每行色点分布,区分高特征值偏右还是低特征值偏右;4. 比较浊音段比率与局部微颤变异性的左右分离是否干净
论文图 2。原论文 Figure 2:“Top 5 SHAP values for XGB Classifier.”。
从像素可见谱通量变异性在左负区聚集而在右正区高值聚集,低频能量与微颤变异性也呈现右侧高值聚集,浊音段比率右侧为高值,极低频能量左侧高值而右侧低值,说明高低取值对分类的推动方向不同。这种左右分离支持模型不是依赖单一方向的响度或音高,而是组合了稳定性与能量分布线索。但必须指出委员会互动差异会直接影响浊音段比率与停顿结构,因此不能断言这些特征纯粹反映生理紧张,协议线索无法完全排除。仅 TSST 子样本的回归仍显示类似模式,才使作者认为结果有一定稳健性。
沙普利可加解释 × 梯度提升树: 梯度提升树负责在表格特征上学习非线性分类与回归边界,沙普利可加解释负责把每折的预测拆解到每个特征的贡献并跨折平均,二者搭配的理由是高准确率本身不说明靠什么声音线索判别,组合意义是把黑箱性能还原为可复述的频谱与嗓音候选特征。
回归方面,全样本下支持向量回归预测皮质醇反应性优于均值基线,最相关特征包括浊音段比率、低中频能量、谱倾斜变化与低音高分布;消极情绪变化在全样本下梯度提升回归相关达 0.49 但误差未显著优于基线,仅在 TSST 子样本中显著优于基线且相关达 0.67,最相关特征包括平均基频上升斜率、第一共振峰带宽、哈马伯格指数、阿尔法比率与基频标准差。
反证是 20 分钟皮质醇值、淀粉酶反应性与积极情绪变化均未能稳定优于基线,其中淀粉酶正如操作检验所示两组轨迹本就无差异,预测失败反而符合预期。未评测边界是未比较预训练端到端与时序模型,作者明确把长短时记忆等时序建模列为未来工作。
边界在哪里:哪些结论不能从数字直接推出?
第一个边界是样本与人群。50 人、每组 25 人、德语大学生、严格健康筛选,决定了所有准确率与误差都带有较大不确定性,逻辑回归折间标准差达 0.23 就是信号。把 0.82 准确率理解为通用压力检测产品性能属于过度推广,论文只支持在相同实验室协议与相同截取规则下的组间区分。
第二个边界是协议混杂。压力组委员会沉默且录像,控制组委员会友好追问且不录像,导致处理后语音时长、提问打断与话题选择都不同。浊音段比率等特征可能同时编码说话机会与紧张程度,作者承认不能完全排除协议线索。仅 TSST 子样本仍能预测皮质醇与消极情绪,支持声音线索不完全是组间 artifacts,但并未彻底分离混杂,需要未来设计更严格的发言轮次控制。
第三个边界是标签与时间。20 分钟皮质醇未能预测,作者解释为时间点太少而未做标准化;淀粉酶两组无差异故预测失败不意外;情绪是主观报告,与生化指标噪声不同。相关性不等于因果,重要特征只是预测贡献大,不证明改变这些声音就能改变压力。训练资源、推理延迟与误判成本均未测量,不能承诺实时或临床可用性。
复现先做什么:按原文能重放的最小步骤是什么?
先按被试筛选与分组重建数据条件:健康德语大学生、体重指数 19 到 28、女性单相口服避孕药、随机分到 TSST 或友好 TSST,记录基线减 1 分钟、任务后 1 分钟与 20 分钟唾液及前后情绪量表。录音用 16 千赫兹未压缩格式,从第 7 分钟截 9 分钟,再用预训练分离模型取最长说话人为被试,去 50 毫秒重叠后拼接。人工抽查部分样本确认无他人语音,并记录处理后时长是否呈现压力组更短的模式,用于检查分离是否与原文一致。
再按工具版本重建特征:语音库 0.11.0 提 40 个梅尔倒谱系数并重采样到 22.05 千赫兹,语音学软件 6.1.38 经接口提 15 个经典参数,开源特征工具 2.6.0 提 88 维扩展集,加性别拼 144 维。每个交叉验证划分内只用训练折标准化,主成分分析只作为对照且同样在折内执行。分类用嵌套 10 折外层加 3 折内层,回归用嵌套留一法加 5 折内层,网格按原文列出的正则、核、树深、树数与学习率搜索,以多数类与均值基线为对照并用校正配对 t 检验。特征重要性用沙普利值跨折平均。
资源状态必须如实记录:主分析代码按文中地址公开,扩展特征集第三方链接本次核查为 404 不可用,写作时只能写该链接当前不可用,不能写已公开可用。复现时优先用论文给出的工具版本与主仓库,不依赖不可达页面。若要扩展,应先补时序模型对照与发言轮次控制实验,再谈真实场景部署。
何时值得尝试:给新生的行动清单与收束
当研究问题是实验室压力情境是否在语音中留下可跨人泛化的痕迹,且能拿到匹配的控制条件与生理标签时,这套流程值得尝试。它的价值在于把情境区分与反应强度预测分开,并用组间设计减少顺序污染,用嵌套验证减少泄漏,用基线检验避免被小样本波动误导。对于只有 TSST 而无控制条件的数据,只能做反应预测,不能做压力检测,新生在选题时要先分清这两类标签。
行动清单按依赖排序:先复述操作检验,确认皮质醇与消极情绪组间有效而淀粉酶无效;再重放分离与 144 维特征,检查时长差异是否复现;然后跑 4 种分类器与 3 种回归器,核对梯度提升树 0.82 与随机森林 0.85 面积是否在同一量级;最后看沙普利排序是否指向谱通量、低频能量与浊音比率。若某一步对不上,优先检查截取起点、分离说话人选择与折内标准化,而不是先调模型。
收束判断用论文的措辞层级表达:论文报告语音能显著区分 TSST 与友好条件,结果支持语音可作为压力的多维无扰指示,浊音比率与频谱能量等特征可能与压力相关但待验证。未验证的是真实场景泛化、连续跟踪与因果机制,这些需要更大样本、更严交互控制与时序多模态对照才能回答。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

