英文题目:GADVOX: The German Anxiety and Depression Voice Examination Dataset

会议身份:conference:interspeech:2026:conference-paper-id:spang26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#语音生物标志物 #数据集 #数据集构建 #语音 #病理语音评估

评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Robert P. Spang:机构信息未能从会议 PDF 纯文本可靠映射
  • Wafaa Wardah:机构信息未能从会议 PDF 纯文本可靠映射
  • Hritik Sauw:机构信息未能从会议 PDF 纯文本可靠映射
  • Ole Möller-Nilsson:机构信息未能从会议 PDF 纯文本可靠映射
  • Etleva Gjoni:机构信息未能从会议 PDF 纯文本可靠映射
  • Stefan Brandenburg:机构信息未能从会议 PDF 纯文本可靠映射
  • Maria Kreußlein:机构信息未能从会议 PDF 纯文本可靠映射
  • Lana Mohr:机构信息未能从会议 PDF 纯文本可靠映射
  • Sebastian Möller:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

针对德语缺乏焦虑抑郁语音资源、现有英语访谈语料难以兼顾双症状共病建模的问题,本文以情感中性自发语音为输入、以PHQ-9与GAD-7双量表连续严重度为输出构建筛查指示资源。采集链先经实验室预实验迭代筛选出十条中性结构化提示,再经众包平台随机呈现提示并同步采集语音、自评量表与人口学信息,随后经注意力检查与人机语音筛查过滤会话,最后拼接会话音频并用SQ-AST计算语音质量剖面随元数据发布。相比以临床访谈为主的DAIC-WOZ抑郁语料,关键机制差异在于同一人同时提供声学证据与双目标连续标签,支持多目标回归与共享痛苦因子分析,具有共病解耦研究意义。在GADVOX语料的语音质量关联评测下,GAD-7条件的Pearson相关系数为.015,高于PHQ-9条件的Pearson相关系数为.008。该结论仅适用于众包高教育水平人群的筛查指示建模,不能外推为临床诊断依据,且方言与录音环境未经系统控制。其适用边界受限于众包人群偏移与非临床自评标签,尚未验证临床诊断外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 数据相关资源:https://osf.io/k4z2v/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

本文的输入是论文原文与 3 张官方原图像素,目标是让刚进入语音心理健康方向的研究生能核对并复述数据集的构造方法与使用边界。必须保留的信息包括采集规模与流程、提示设计、拼接与质量估计做法、质检剔除链、人口学与设备构成、量表分布与信度、质量与严重度无关的核查结论,以及开放获取方式。输出是 1 篇按学习依赖展开的中文解读,不做营销式判断,不补无源数值。

阅读时先抓住一个样本的完整旅程:一个德语成年人在众包平台看到 10 个随机排序的中性提示,用自然声音各说一段约 20 秒,同期完成抑郁与焦虑自评量表,研究者把 10 段音频拼成一个会话文件并附上人口学、心理社会背景与会话级质量分数。这个配对关系是全文的核心,后续所有分布、相关与质量分析都围绕它展开。

需要提前说明的是,本文研究的是数据集构建而非某种检测模型的训练,因此没有模型结构与优化曲线可复述,复现指的是重走采集、质检与统计核查。资源状态方面,本次收到的唯一数据集链接状态为可用,元数据在开放科学框架仓库公开,完整音频需经合理申请与机构审核后获取,不能写成无条件直接下载。

已有路线卡在哪里,为什么德语双维度值得做?

过去十年用声音估计抑郁焦虑的思路是寻找可测量的发声变化,例如基频、语速、停顿模式与音质,再用深度学习拟合标签。论文回顾指出 Transformer 类方法在已有基准上达到约八成准确,但经验基础很薄,几乎都依赖仅 189 个访谈会话的英文临床访谈语料,与同类架构语音质量模型所用训练量差数量级。这意味着换语言、换场景时泛化依据不足。

第二个卡点是任务定义,多数工作做二分类,而临床常用的病人健康问卷与广泛性焦虑量表本来给出有序严重度,丢成二分类会损失阈值附近的信息。第三个卡点是共病,抑郁与焦虑共现超过 50%,只测其一容易把共享的声音变化误归于单一疾病。近期有工作尝试大规模远程录音的多模态生物标志物与基础模型影响,但都强调数据稀缺是瓶颈。德语语境下此前没有可自由获取的同类数据集,这就是本文的切入点。

教学上要区分同输入同目标的对照与跨类别借鉴,前者是英文访谈语料上的抑郁检测,后者是电信语音质量估计,两者运行阶段与监督来源不同,不能直接比准确率。本文不训练检测器,因此不宣称在检测精度上超越谁,只提供能支撑回归与双目标建模的资源。

要解决的具体问题与标签含义是什么?

具体问题是为德语提供可公开使用的语音加抑郁与焦虑严重度的数据,使研究者能做回归与双目标建模,并能初步分离共享与特异的声音关联。标签来自同一人完成的自评:抑郁用病人健康问卷 9 条目版本,焦虑用广泛性焦虑 7 条目版本,都是回想近两周症状频率的有序评分,加总后形成严重度总分。论文明确这是筛查指标而非临床诊断,不能当作医生确诊的金标准。

白话说,抑郁量表问的是情绪低落、兴趣减退、睡眠食欲变化等九方面的困扰程度,焦虑量表问的是紧张担忧、难以放松等七方面的困扰程度。英文名首次出现时记为抑郁量表(Patient Health Questionnaire-9,PHQ-9)与焦虑量表(Generalized Anxiety Disorder-7,GAD-7),后文简称 PHQ-9 与 GAD-7。关键设计是同一人既出声又填表,省去第三方转评,保证声学与标签天然配对。适用条件是社区众包样本,包含大量亚临床分数,分布右偏,阈值以上比例高于行政诊断患病率,这是抽样与测量工具差异所致,不代表德国人群患病率升高。

PHQ-9 × 回归建模: PHQ-9 负责提供抑郁严重度的有序评分,分工是把 9 个条目的自评加总为 0 到 27 区间的连续信号;回归建模负责直接拟合这个分数而不是只输出有病无病,搭配理由是二分类会丢弃阈值附近的渐变信息,组合意义是让声音模型能输出严重度并支持多阈值下的筛查分析。

沿一个样本走完流程有助于建立因果链:输入是 10 段德语自由言说与两份量表作答,表示是拼接后的会话波形加总分与条目分,组件是质检与质量估计,目标是得到可回归的双维度标签,输出是开放元数据行加受控音频文件。后续所有统计都是对这条链的核查,而不是对某个分类器的评测。

方法全景:从招募到可发布数据经过哪几站?

全景可分为五站。第一站是实验室预研究,用 25 人打磨提示,从开放式自由讲述转向结构化提示,最终保留 10 个情感中性、人人可答且不诱导透露隐私或健康信息的话题,例如理想的早晨、最近 1 次出门所见、喜欢的菜谱做法、印象深刻的书影、向陌生人介绍家乡、上次惊讶、放松的 1 天、熟悉的声音或气味、今天的 1 天、教别人系鞋带或写邮件。每题上方显示德语指导语,要求详细自由地用自然声音说约 20 秒,10 题随机排序分开录音。

第二站是众包主实验,在德语众包平台发布通用任务,不按症状预筛,参与者录音并填写量表、人口学与心理社会背景题,被鼓励使用外接麦克风。第三站是音频预处理,把 10 段单声道文件去首尾静音,按说话人内词句间平均停顿估计拼接间隔,再拼成 48 千赫单声道会话文件,同时保留原始分段。第四站是多阶段质检,含注意力陷阱、自动人声筛查与人工听辨。

第五站是会话级质量估计与元数据整理,用参考实现对每会话抽 5 段不重叠 10 秒片段打分取平均,形成总体、噪声、非连续、染色与响度 5 维档案。元数据以知识共享署名许可公开,音频经申请审核后提供,申请指引在仓库页面。

GAD-7 × 多目标回归: GAD-7 负责提供焦虑严重度的有序评分,分工是与 PHQ-9 平行刻画另 1 维度;多目标回归负责同时拟合两个分数,分工是共享声学编码并保留各自输出头,搭配理由是两者高度共病难以单任务切分,组合意义是能研究共享痛苦因子与各自特异声音关联。

这一全景的教学要点是区分选择性剔除与描述性度量:质检决定去留,质量分数只描述不筛选,避免把设备差但真实的样本系统性丢掉,从而保持严重度与质量无关的可验证性。

提示与拼接组件各自解决什么,又带来什么代价?

提示组件解决的是无人值守下回答过短与偏题。预研究发现直接说自由讲会导致短促犹豫,因此用具体但中性的问题支架,把回答拉到约 20 秒的流畅主题讲述,同时避开身份与健康披露。随机排序抵消顺序效应,情感中性降低话题本身对情绪声学特征的污染。代价是结构化会压缩极端自然变异,且德语原文与英译的语用差异需看元数据中的德语原稿。拼接组件解决的是分析单位统一,把 10 段拼成一个会话文件便于按人聚合标签。

做法分两步,先去每段首尾静音,再用语音活动检测估计该说话人词句间平均停顿并作为段间间隔插入,以保留个体语速节奏。论文坦承这可能改变与临床分析相关的暂停统计,因此同时提供原始分段,研究停顿的应使用分段而非拼接版。设备方面多数用内置麦克风,少部分用外接设备,房间混响与话筒距离未系统控制,只能靠质量分数做部分刻画。

众包采集 × 质量保障: 众包采集负责扩大样本量与生态效度,分工是用无监督居家录音获得自然变异;质量保障负责剔除注意力失败与非人声,分工是用陷阱题、自动检测与人工听辨守住标签与音频配对可信度,搭配理由是无人值守必然混入噪声,组合意义是以 29.3% 剔除率换取可用规模。

初学者易误解是提示越情绪化越能诱发抑郁声音,实际上本文故意用中性题以测特质性基线表达,而非情绪诱发反应,复述时要讲清这一取舍。

没有模型训练时,这里的计算到底是什么?

本研究没有训练抑郁焦虑检测网络,因此不存在优化器、梯度路径、参数冻结与早停可报告,不能把无训练理解为确定性求解。真实计算有 3 类。第一类是规则与信号处理:注意力检查要求四道陷阱题全对,两道复选框、两道分别嵌入两种量表的李克特格式;自动筛查判断是否缺失人声信号;人工由 1 名训练过的助理听每段开头数秒标为可能真人或非真人,只保留前者。

第二类是质量估计推理:调用已有的语音质量 Transformer 参考实现,对每会话抽取 5 个不重叠 10 秒块分别估计 5 维分数再平均,得到会话级档案,该模型参数不更新,只做前向推理。第 3 类是描述统计与信度计算:年龄均值标准差、性别与教育职业计数、录音与会话时长分布、量表总分均值标准差偏度峰度、严重度分级计数占比、量表内部一致性系数及其置信区间、双量表相关系数与显著性、质量与严重度的相关系数。缺项是人工仅听开头且仅单评分者,未报告评分者一致性。

方言、非母语与语码转换未系统控制;未测量建模所需的算力与延迟,因为尚无基线模型。这些缺项不是技术错误,但复用时需补验证。

语音活动检测 × 人工标注: 语音活动检测负责自动筛查是否含有人声能量与估计说话人内停顿,分工是低成本初筛与拼接时保留语速节奏;人工标注负责听开头数秒判断是否为真实人声,分工是排除合成语音与广播等自动方法易漏的情况,搭配理由是自动快但易误判、人工准但只能抽查,组合意义是 2 级互补后再做质量估计而不做筛选。

复述时要能说出监督来源:标签监督来自自评量表,质量监督来自预训练质量模型的迁移推理,人工监督只用于真伪二判且覆盖有限。

实验条件:谁在什么设备上说了多久,如何度量好坏?

最终质检后样本为 1004 个会话,来自初始 1420 人的招募池。年龄 18 到 77 岁,平均 37.2 岁,标准差 11.9 岁。性别组成为男性 511 人占 50.9%,女性 483 人占 48.1%,多样性 7 人占 0.7%,未说明 3 人占 0.3%。教育从初中到博士,以中学与学士为主,就业以在职为主,行业以信息技术、商务行政与医疗居多,论文提醒这偏向高教育与数字素养人群。录音设备八成内置麦克风,两成外接。

时长方面,拼接后中位会话时长 14.7 分钟,平均 18.4 分钟,标准差 13.6 分钟,范围 3.8 到 114.6 分钟,右尾是少数特别健谈者而非录音错误。聚合口径是按人会话级,质量分数是 5 段平均,时长是拼接后文件长度与平台任务耗时分别统计。好坏度量分两层,一层是数据完整性,用剔除链与信度表示;另一层是声学可用性,用 5 维质量分数表示,量程均为 1 到 5 分。

SQ-AST × ITU-T P.566: SQ-AST 负责实际计算语音质量多维分数,分工是作为神经网络估计器对 10 秒片段打分再平均到会话级;ITU-T P.566 负责定义多维质量分析的维度与量程,分工是给出总体、噪声、非连续、染色与响度的评价框架,搭配理由是需要可比的电信级质量语言,组合意义是让下游能透明地按质量分层或协变量控制。

下图展示录音时长与会话耗时的分布形态,是理解平均数被右尾拉高的关键,读图时注意区分纯语音长度与含填表等待的任务耗时。

看图路径: 1. 先看上面板橙色直方图的横轴录音时长与纵轴人数,确认峰值在 3 分钟附近且均值与中位数虚线位置;2. 再看下面板蓝色会话时长的横轴延伸到 120 分钟,确认主体在 10 到 20 分钟而右尾很长;3. 对比两面板的均值大于中位数,判断右偏分布并思考超长会话对聚合的影响;4. 核对图例中 M 与 Mdn 的数值是否与正文报告的拼接后时长一致

原论文 Figure 1:Distribution of recording (per file) and session (time on crowdsourcing task) durations in min.

论文图 1。原论文 Figure 1:“Distribution of recording (per file) and session (time on crowdsourcing task) durations in min.”。

上图上面板橙色为拼接后录音时长,峰值约在 3 分钟附近,均值 4.1 分钟略高于中位数 3.9 分钟,右侧拖到 10 分钟以上仍有零星样本。下面板蓝色为众包任务会话耗时,主体堆在 10 到 20 分钟,均值 18.4 分钟明显高于中位数 14.7 分钟,横轴延伸到 120 分钟的极长尾对应少数停留很久的参与者。两面板都呈现均值大于中位数的右偏,这是社区众包的典型形态。教学含义是建模时若按等长切分或按会话平均,需考虑长尾个体的权重,不能直接把平均 18.4 分钟理解为每人有效语音时长,纯语音中位数更接近 4 分钟量级。

标签长什么样:严重度分布与共病相关支持什么判断?

量表信度报告显示 PHQ-9 内部一致性系数为 0.85,置信区间 0.836 到 0.864,GAD-7 为 0.86,置信区间 0.848 到 0.874,与原验证研究相当,论文据此认为众包未明显降低测量质量,这是支持标签可用的直接证据。PHQ-9 总分范围 0 到 26,均值 7.6,标准差 5.1,偏度 0.88,超额峰度 0.47。按常用阈值,极轻 307 人占 30.6%,轻度 405 人占 40.3%,中度 180 人占 17.9%,中重度 85 人占 8.5%,重度 27 人占 2.7%,中度及以上合计 29.2%。GAD-7 总分范围 0 到 21,均值 8.0,标准差 4.5,偏度 0.86,超额峰度 0.26。极轻 441 人占 43.9%,轻度 353 人占 35.2%,中度 153 人占 15.2%,重度 57 人占 5.7%,中度及以上合计 20.9%。

两者呈强相关,散点与回归线显示同升同降,论文在不同位置给出 0.795 与 0.80 两种舍入,均显著。作者提醒阈值以上比例高于德国行政诊断患病率,但这是自评筛查与临床诊断的口径差异,不应解读为样本临床负担异常升高。心理社会背景题为多选,童年创伤、关系困难、成年创伤、进食困扰、强迫思维行为、性困扰、慢性疼痛与物质失控均有一定占比,约两成未勾选任何项,可作辅助分层变量而非验证量表。

比较问题是:在社区样本右偏且共病强的条件下,是否仍能做双维度回归而非被迫二分类,公平条件是同一批人同时提供双标签且信度达标,指标方向是分布覆盖全程且相关显著但非完全共线。下表把严重度分级收拢为可核对的形态,表后解释收益与代价。

分级对象区间定义极轻数量与占比轻度数量与占比中度及以上数量与占比
总体标签质量信度与相关PHQ-9 系数 0.85GAD-7 系数 0.86双量表相关约 0.80 显著

表后解释如下。主要收益是轻度与中度区间人数充足,支持回归拟合渐变而非只学两端极值,且双标签同源使多目标与共享痛苦因子建模成为可能。具体代价是重度格人数很少,抑郁重度仅 27 人,焦虑重度仅 57 人,尾部建模不确定性大。未胜出项是二分类简化在此并不占优,因为阈值附近样本密集,硬切会放大边界误判。未评测边界是方言与非母语变异未控制,跨人群泛化待验证。

下图进一步展示分布重叠与联合关系,导读强调先看边缘分布再看联合点云。

看图路径: 1. 先看上面板重叠直方图中蓝色 GAD-7 在低分更高、橙色 PHQ-9 尾部更长,并找到 10 分红色阈值线;2. 再看下面板散点横轴 PHQ-9 纵轴 GAD-7,确认点云沿黑色最小二乘线向上延伸;3. 比较阈值线划分的四个象限,观察共病区域的点密度是否高于单一高分区;4. 核对标题报告的相关系数与正文报告的数值方向是否一致

原论文 Figure 2:(a) Overlaid PHQ-9 and GAD-7 score distributions.

论文图 2。原论文 Figure 2:“(a) Overlaid PHQ-9 and GAD-7 score distributions.”。

上下面板共同报告同一结论。上面板密度直方图中蓝色焦虑在低分更突出,橙色抑郁在右侧尾部更厚,红色 10 分线标出中度阈值,可见大量样本在线左侧但仍有可观质量在线右侧。下面板散点横轴抑郁纵轴焦虑,点色深浅反映堆叠密度,黑色线为最小二乘趋势,标题报告相关约 0.80 且显著,红线同样标出双轴阈值,右上象限的共病密度高于单一高分区。这支持论文主张:适合做双目标回归或联合因子分析,而不是强行单二分类。限制是相关不等于因果,也不能据此推定声音特征必然共享,声学层面的分离仍需后续建模验证。

反证核查:录音质量是否偷偷与严重度相关?

论文做的关键反证是质量与严重度无关检验。5 维质量中总体均值 2.84,标准差 0.56,符合居家消费设备在无控环境的预期。噪声均值 3.78,非连续均值 3.68,响度均值 3.54,染色均值 3.16 且标准差 0.43 变异最大,反映设备多样性。检验结果是 PHQ-9 与总体分相关 0.008,显著性 0.800,GAD-7 与总体分相关 0.015,显著性 0.627,均无实质相关,论文据此判断症状严重度不随录音质量共变。这一步相当于消融式对照:如果高分者系统性设备更差或环境更吵,后续声学差异就可能是设备伪影,而当前结果不支持这种混杂。

另一个隐性对照是质检链本身:注意力全对才保留,自动筛掉无人声,人工剔除合成与广播,这种严格筛选可能引入选择偏倚,但换来的是标签与真人语音配对更干净。未胜出或未覆盖的是人工只听开头且单人评定,中间段混入非人声的风险未被完全排除;房间声学与话筒距离未测量,只能靠质量分数部分刻画。

比较问题是:在设备 heterogeneity 很大的条件下,质量分数能否作为透明协变量,公平条件是同一会话级平均口径,指标方向是分数越高越好且与标签无关。下图展示 5 维分布,表后有代价分析。

看图路径: 1. 先从左到右确认五个面板依次为总体、噪声、非连续、染色与响度,横轴均为 1 到 5 分;2. 再看每面板黑色虚线均值位置,确认总体最低而噪声与非连续最高;3. 比较染色面板分布最宽而响度面板最尖,思考设备多样性与录音电平的影响;4. 核对纵轴人数刻度均为 0 到 120,确认面板间高度可直接比较

原论文 Figure 3:Distributions of the five SQ-AST / ITU-T P.566 speech quality dimensions for all 1,004 sessions.

论文图 3。原论文 Figure 3:“Distributions of the five SQ-AST / ITU-T P.566 speech quality dimensions for all 1,004 sessions.”。

五面板绿色直方图共享横轴 1 到 5 分与纵轴 0 到 120 人。总体面板居中偏左,均值线在 2.84 附近。噪声与非连续面板明显右移,均值接近 3.7,说明多数录音无严重噪声与断续。染色面板最宽最矮,均值 3.16 附近,反映不同麦克风频响差异大。响度面板最尖,均值 3.54 附近,说明电平相对集中。

黑色虚线均为均值,教学动作是先比位置再比宽度,位置回答好坏,宽度回答多样性。结合无关检验,可复述为质量有变异但不系统性偏向高严重者,因此下游可按质量分层稳健性分析,而不是直接丢弃低分样本。

边界与误解:什么不能用这个数据说?

第一,自评不是诊断。PHQ-9 与 GAD-7 是筛查严重度的代理信号,不能写成临床确诊,也不能用于个体诊断结论,论文明确数据集服务于严重度建模与筛查指示。第二,抽样偏倚明确。众包偏向高教育与数字素养职业,中重度自评比例高于人群行政患病率,这是面板构成与测量口径所致,复用时应做加权或分层敏感性分析,不能直接推广到全人群。第三,声学控制有限。

方言、非母语、语码转换、房间混响与话筒距离均未系统控制,人审只覆盖开头且单人,拼接可能扰动停顿统计,研究停顿应回退到原始分段。第四,当前无基线模型。论文规划后续做声学特征管线、基准建模与自动语音识别转写的多模态分析,但本次未报告,任何关于检测精度、延迟或成本的承诺都无源。第五,开放不等于无门槛。元数据公开,音频需机构与目的审核并签署删除传播义务,被试可用伪名申请删除,研究者须向本地副本传播删除。

常见误解是把阈值以上占比高当作数据质量差,实际上这是社区自评的正常右偏,只要信度达标且质量无关成立,仍适合回归。

复现先做什么,需要哪些配置与核对点?

复现分 3 步。第一步取元数据与申请音频。访问开放科学框架仓库,先下载元数据中的德语原提示、人口学、量表条目分与总分、心理社会题、设备类型与 5 维会话质量分数,核对 1004 行是否与报告的人口构成一致,再按仓库指引提交机构与目的说明申请音频,收到后核对 10 段分文件与拼接文件的采样率声道与时长。第二步重走质检与统计。

按四陷阱全对、自动无人声剔除、人工开头听辨的顺序复算 1420 到 1138 到 1022 到 1004 的链条,复算年龄、性别、教育职业分布,复算拼接后中位 14.7 分钟与均值 18.4 分钟,复算双量表分级计数与信度区间,复算双量表相关与质量无关相关,任一不符先查聚合口径是按会话还是按片段。第 3 步做稳健性分层。按内置与外接麦克风、按质量五分位、按有无心理社会题分层重算分布,检查尾部小样本的波动;若研究停顿,只用原始分段重估停顿分布,避免拼接间隔的污染。

关键超参数与信息条件是每提示约 20 秒、10 题随机排序、每会话 5 段 10 秒质量平均、48 千赫单声道拼接。代码开源、权重下载与系统可运行要区分:本文公开的是数据与质量估计参考实现的使用结果,不是检测系统的代码与权重,因此不存在可直接运行的抑郁检测器。还需补的验证是多评分者一致性、方言分层与纵向重测信度。

何时值得尝试,一句话收束如何讲给同门?

当你的课题需要德语、需要同时看抑郁与焦虑、需要回归而非二分类、且能接受自评标签与众包偏倚时,这个数据值得尝试。它的分工很清晰:中性结构化提示保证可比的自由言说,同一人双量表保证可联合建模的监督,多阶段质检与质量分数保证可审计的透明度。代价也很清晰:重度尾部样本少、声学环境无控、人工核查覆盖浅、无现成基线可直接对比。

给同门的复述可以是:这是一个 1004 人的德语众包语音集,每人说 10 段中性话题并自评抑郁焦虑严重度,质检剔除近 30%,量表信度达标且分数与录音质量无关,适合做双目标严重度回归,但只能当筛查信号用,重度与跨人群结论需额外验证。

核对表把最易错的数字收拢,表前问题是哪些数字必须 1 次对齐才能证明可复用,公平条件是同一质检后样本与同一会话级口径,指标方向是分布右偏但覆盖全程、信度高、质量无关。

核对维度关键指标本研究取值对照取值适用判断
样本与时长年龄与会话时长18 到 77 岁均值 37.2 岁,会话中位 14.7 分钟均值 18.4 分钟初始 1420 人保留 1004 人规模可用但右尾需加权
标签分布分级与相关抑郁中度以上 29.2%,焦虑中度以上 20.9%,相关约 0.80行政患病率抑郁 14.4% 焦虑 8.1% 口径不同适合回归不代表患病率
质量档案5 维均值与无关检验总体 2.84 噪声 3.78 非连续 3.68 染色 3.16 响度 3.54,与标签相关近 0染色变异最大标准差 0.43可分层使用不做筛选
开放方式获取与伦理元数据公开音频申请审核伦理批件 412 号可撤回删除先跑元数据再申请音频

表后收束如下。主要收益是德语双维度回归首次有公开可用资源,且附带可直接用的质量协变量。未胜出项是尚无检测基线,不能回答哪种声学特征最有效。负结果是质量无关检验为零相关,这恰是好消息,说明设备不是混杂。未评测边界是纵向变化与干预效果,横断面 1 次采集回答不了病情波动。若决定使用,先用元数据复现分布与相关,再按质量与设备分层,最后才向音频建模投入算力。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总