英文题目:Temporal Partitioning of Vocal Activity for Detecting Vocal Hyperfunction from Neck-Surface Accelerometer Data

会议身份:conference:interspeech:2026:conference-paper-id:azarski26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#语音生物标志物 #模型集成 #生理信号 #病理语音评估

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Łukasz Łazarski:机构信息未能从会议 PDF 纯文本可靠映射
  • Bartłomiej Eljasiak:机构信息未能从会议 PDF 纯文本可靠映射
  • Szymon Szmajdziński:机构信息未能从会议 PDF 纯文本可靠映射
  • Teresa Makuch:机构信息未能从会议 PDF 纯文本可靠映射
  • Iwan Ryżenkow:机构信息未能从会议 PDF 纯文本可靠映射
  • Anna Plęs:机构信息未能从会议 PDF 纯文本可靠映射
  • Władysław Średniawa:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为长时程颈表加速度计(neck-surface accelerometer,NSA)经处理得到的50 ms帧级声学与气流特征,输出为受试者级咽创伤型发声过度功能(phonotraumatic vocal hyperfunction,PVH)与非咽创伤型发声过度功能(non-phonotraumatic vocal hyperfunction,NPVH)判别,难点在于日常发声行为高度异质且两类病理机制不同。方法链分三步:先按昼夜节律与发声类型将连续记录切分为多个时间窗,再在每个窗内对浊音帧计算分布统计量压缩为定长表征,最后用梯度提升树与逻辑回归分别建模并平均概率得到集成预测。核心机制差异是既往全天聚合抹平晨昏差异,而显式时段切分保留局部高强度用声片段的判别信息。在NeckVibe Challenge盲测集上,PVH集成受试者级ROC AUC为0.925,显著高于基线0.82并获第1名;NPVH为0.820,高于基线0.78并获第4名。结论仅适用于该挑战的采集设备与人群划分,对跨设备、跨语言及临床重度不平衡队列的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么全天平均会漏掉声带高功能?

本解读的输入是论文正文与 4 张官方原图,目标是让刚进入语音音乐音频领域的研究生能复述数据切分、特征构造与模型集成的完整动作,必须保留的关键信息包括被试构成、帧特征、3 种预处理、两类模型参数与 2 级评估口径,输出是 1 篇可核对的技术讲解而非效果宣传。

声带高功能不是单一声学事件,而是一类长期用嗓不当造成的代偿性肌肉用力模式。初学者容易把它理解为嗓音哑了,于是想把录音丢给分类器直接判断。论文把这条路拆成两条病理路线。音创伤型伴随结节息肉等器质改变,被解释为长期发声应力下反复组织损伤与炎症的适应结果,声门闭合更 abrupt,喉部作用力更大。非音创伤型则无结构病变,常被归为原发性肌紧张性发声困难,诱因杂糅心理应激与慢性黏膜刺激,表现为持续疲劳与间歇性紧张。

音创伤型声带高功能 × 非音创伤型声带高功能: 音创伤型声带高功能负责解释伴随结节息肉等器质性改变的持续力学损伤路径,非音创伤型声带高功能负责解释无结构病变但以持续肌紧张性发声困难为表现的功能性路径,二者搭配的原因是同属发声滥用误用但病理足迹一为持续一为间歇,组合意义是要求模型对前者捕捉全天稳定偏移,对后者捕捉短时高强度发作,不能用同一聚合尺度处理。

长期佩戴场景带来第二个难点。颈表加速度计放在喉下方记录皮肤振动,避免了麦克风的环境噪声与隐私问题,但 1 天的记录里有睡眠静默、说话、歌唱多种状态。如果把全天浊音帧直接平均求声压级基频与频谱倾斜,间歇紧张会被大量正常发声稀释,晨昏差异也会被抹平。论文因此把核心动作放在时间切分上:不是先换大模型,而是先让特征保留何时发声与何种发声类型,再谈分类器。

同输入同目标的前人路线走到了哪里?

在相同输入与相同目标下,前人已形成一条可运行的基线。输入同样是颈表加速度长期记录,目标同样是区分病理与健康对照,监督同样是临床诊断标签,运行阶段同样是离线按天或按段聚合后分类。特征侧常用声压级、基频、频谱倾斜的高阶汇总统计,机制侧常用阻抗逆滤波从加速度反推声门气流,再训练有监督分类器。论文引用的历史性能是音创伤型曲线下面积 0.82、非音创伤型 0.78,这构成后文所有比较必须保留的基线。

另一条相关路线是扩充行为观察维度。周级佩戴研究比较了音创伤患者与匹配对照在说话与歌唱用量上的差异,提出了每日音创伤指数等客观指标,并尝试实时生物反馈。这些工作支持了把歌唱单独建模的直觉:歌唱基频更高、用嗓负荷更大,病理的生理标记可能更显著。但它们多停留在组间差异描述,没有回答如何把日内节律切成可训练的特征窗口。

本文的差别在于预处理即模型选择。作者不主张用更深的网络压过小样本,而是测试了重叠时间窗、言语歌唱分离、5 分钟短窗 3 种切分,并为音创伤与非音创伤分别选模型结构。这种按亚型分治的思路,是理解后文为何音创伤用集成而非音创伤用短窗加提升树的关键。

要判什么?输入输出与成功标准是什么?

论文处理颈部振动挑战赛的两个二分类任务。任务一是检出音创伤型,正类为音创伤患者,负类为全部健康对照加非音创伤患者之外的对应集合,原文在交叉验证表中明确第一类分布为负类 297 例正类 171 例。任务二是对称地检出非音创伤型,正类为非音创伤患者,负类为音创伤加健康对照,交叉验证表中负类 376 例正类 92 例。初学者要注意负类构成随任务改变,不能把 2 个任务的对照组混为一谈。

输入是 50 毫秒帧级时间序列特征,包括基频、加速度导出的声压级、倒谱峰突出度、第一至第八谐波衰减斜率、第一二谐波差、低高频能量比,以及阻抗逆滤波导出的声门气流特征,另附浊音与歌唱行为掩膜、性别与匿名编号与监测日期。部分被试缺失逆滤波特征,论文按缺失处理而非删除被试。输出是被试级患病概率,最终按阈值判定。

成功标准是被试级受试者工作特征曲线下面积,越大越好,阈值用尤登指数另行选择。评估分两层:记录级以 1 天为样本,3,278 条记录中负类 2,127 条正类 1,151 条;被试级把同一人多天概率平均后再算指标。训练集 468 人有标签,测试集标签 withheld 做盲测。举例说明:若某人有 5 天记录,模型先给 5 个概率再平均得到 1 个人分,这就是后文按被试平均的含义,该例子仅解释聚合方向不引入新数值。

全流程如何从振动帧走到被试判定?

沿一个被试走完全程有助于建立依赖顺序。第一步是佩戴采集与帧特征提取,得到逐帧的声学与气流参数及浊音歌唱掩膜。第二步是时间切分与聚合,把帧按窗口与发声类型分组,在组内算分布统计量,形成每天数百维的定长向量。第三步是分类器给出记录级概率,第四步是同一人多天平均得到被试级概率并用阈值判定。交叉验证以人为组,保证同一人不同天不会同时出现在训练与验证。

预处理有 3 条并行路线。路线一针对音创伤做 10 个部分重叠的日内窗口,覆盖 24 小时并含跨夜窗口,窗口长约 3 至 5 小时,只用浊音帧。路线二把言语与歌唱分开聚合,窗口减为 4 个不重叠区间即 06:00-10:00、10:00-15:00、15:00-20:00 与 20:00-24:00,特征维度翻倍。路线三针对非音创伤调短窗长度与浊音占比阈值,并在全特征上做相关过滤与缺失过滤。

模型侧同样分治。音创伤用提升树加逻辑回归的概率平均集成,非音创伤用调参后的提升树。如下图所示,时间切分不是均匀切片,而是按行为与昼夜节律组织的窗口集合,理解该图是复现特征维度的前提。

看图路径: 1. 先沿外圈从 00:00 顺时针读出 7 个行为窗口的起止与命名;2. 再看内圈 3 个昼夜节律相位的覆盖范围如何与外圈重叠;3. 对比夜间 23-05 与日间 10-20 段的弧长差异,思考发声机会分布

原论文 Figure 1:Temporal segmentation strategy 1 for PVH detection.

论文图 1。原论文 Figure 1:“Temporal segmentation strategy 1 for PVH detection.”。

该环形图把 1 天组织成外圈 7 个行为窗口与内圈 3 个昼夜相位,外圈包括夜间休息 23-05、睡眠觉醒过渡 05-07、晨间激活 07-10、认知高峰 10-13、午后负荷 13-16、傍晚社交 16-20 与睡前减压 20-23,内圈为晨 08-12、午 12-17、晚 17-22。重叠设计的用意在原文有明确安排理由:降低对边界的敏感、捕捉相邻区间过渡、改善跨天泛化。复现时应先落实窗口起止与是否重叠,再核对每个窗口只用浊音帧这一过滤条件,否则统计量口径会整体偏移。

窗口内统计量与逆滤波特征如何构造?

窗口内的计算对象是固定的。路线一的声学集合包括倒谱峰突出度、第一二谐波差、频谱倾斜、低高频比、加速度幅值与声压级六项,每项每窗算均值、中位数、标准差、第 10 百分位与第 90 百分位,再加窗内浊音帧占比,于是得到 6 乘 10 乘 5 等于 300 个窗特征。逆滤波特征在全天尺度用同样描述子算 8 乘 5 等于 40 维,合计每天 350 维。路线二沿用同样声学集合与同样 5 个描述子,但按浊音言语与浊音歌唱分别聚合,窗口减至 4 个以控制维度膨胀。

颈表加速度 × 阻抗逆滤波: 颈表加速度负责以喉下微型加速度计无创记录皮肤振动并规避录音隐私与环境噪声,阻抗逆滤波负责从该振动反推声门气流类波形并导出闭合商等空气动力学量,二者搭配的原因是前者只给体表振动包络,后者给出声门开闭解释,组合意义是把声压级基频之外的发声机制信息补进特征。

日内时间分段 × 高阶统计聚合: 日内时间分段负责把连续佩戴记录按行为节律切成若干窗口以保留晨昏差异,高阶统计聚合负责在每个窗口内对浊音帧计算均值中位数标准差第 10 与第 90 百分位,分工搭配的原因是切分提供时间定位而统计提供分布形状,组合意义是让模型同时看到何时发声异常与异常是均值偏移还是离散度收缩。

特征语义值得逐个白话解释。倒谱峰突出度反映周期性谐波结构的清晰度,第一二谐波差与频谱倾斜反映声门闭合 abrupt 程度与高频衰减,低高频比反映能量分布,加速度幅值与声压级反映发声强度,逆滤波闭合商与开放商等反映声门开闭时相。初学者常把标准差只当噪声,本文恰把离散度当信号:下午晚上第一二谐波差变异小指向病理,晨间变异大指向对照,百分位则用于捕捉短时高强度尾部。

窗口的数据量并不均匀,下图给出各窗的覆盖占比,是判断统计量可靠性的直接依据。

看图路径: 1. 先读上方面板 7 个行为窗口的数据覆盖百分比柱高;2. 再读下面板晨午晚三相的覆盖百分比,确认下午最高;3. 注意 05-07 过渡段仅 0.3%,思考该窗统计量的方差风险

原论文 Figure 2:Data coverage across the ten time windows used in temporal segmentation strategy 1 for PVH…

论文图 2。原论文 Figure 2:“Data coverage across the ten time windows used in temporal segmentation strategy 1 for PVH detection.”。

上方面板显示 7 个行为窗口中傍晚社交 16-20 占比最高达 30.8%,午后与下午次之,夜间休息仅 4.5%,睡眠觉醒过渡仅 0.3%。下面板显示昼夜三相中午 12-17 占 37.5%,晚 17-22 占 35.1%,晨 08-12 仅 17.8%。这解释了为何夜间窗口的统计量方差大而判别贡献仍可能来自日间。若复现时发现晨间或过渡窗特征不稳定,应先检查该窗浊音帧数是否过少,而非直接调大模型容量。

模型如何训练?哪些参数更新、哪些没有?

本节按原文交代参数更新与监督来源,未报告处明确指出缺项而不从模型名推定。音创伤模型一是梯度提升树,版本为 3.1.3,树数 1000,学习率 0.03,最大深度 6,最小子节点权重 25,分裂正则伽马 0.2,行采样 0.6,列采样 0.7,一范数 0.7 与二范数 1.5,目标为二分类逻辑损失,以曲线下面积为评估指标。这些树参数在训练中更新,采样比例与正则系数在训练前冻结。模型二是逻辑回归,用 1.8.0 实现,最大迭代 1000,求解器为 lbfgs,二范数 C 等于 1.0,容差 1 乘 10 的负 4 次方,拟合截距,权重向量在训练中更新。集成仅做 2 模型概率平均,不做额外训练,因此没有可更新参数与梯度路径。

梯度提升树 × 逻辑回归集成: 梯度提升树负责在 10 个重叠时间窗的稠密统计特征上学习非线性阈值与交互,逻辑回归负责在言语歌唱分离后的特征上学习线性可加权重,二者搭配的原因是前者容量大适合刻画日内变异,后者结构简单适合高维分离特征并抑制过拟合,组合意义是以概率平均互补两种预处理视角,原文集成不再做 2 次训练。

非音创伤模型同样是提升树但配置不同:树数 500,学习率 0.03,最大深度 4,最小子节点权重 17,分裂正则伽马 7,行采样 0.8,列采样 0.4,一范数 0.2 与二范数 25,正类权重 8.5 以处理类别不平衡。监督来源均为训练集的临床诊断标签,验证侧用留一组交叉验证按被试划分。原文未报告优化器之外的学习率调度、早停轮数、随机种子与缺失逆滤波特征的具体填补算子,这些属于缺项,复现时需固定自己的处理并记录。作者还试过多层感知机、卷积与长短时记忆网络,均出现明显过拟合,归因于独立被试数有限,该结论支持小样本下优先做特征工程而非加深网络。

数据划分、基线与指标口径如何保证可比?

数据集共 582 人,其中音创伤 213 人及其匹配健康对照 169 人,非音创伤 116 人及其匹配对照 84 人。训练集 468 人有标签,测试集标签 withheld。年龄性别职业匹配的用意是让对照与病例在用嗓机会上可比,减少因职业歌唱量差异带来的混杂。帧特征已由主办方提供,复现者无需重做加速度到声压级的标定,但需保留浊音掩膜与歌唱掩膜的过滤口径。

留一组交叉验证 × 按被试平均: 留一组交叉验证负责以单个被试为组划分训练与验证以杜绝同一人多天记录泄漏,按被试平均负责把同一人多天的记录级概率先平均再判定以抑制单日波动,二者搭配的原因是前者保证评估诚实,后者对应临床以人为单位的诊断口径,组合意义是记录级曲线下面积与被试级曲线下面积分开报告且以后者为准。

基线必须保留原文可运行策略。非音创伤基线取自先前工作,即 5 分钟段且至少含 0.5% 浊音数据的聚合方式,作者把窗长与浊音阈值当超参数网格搜索,窗长含 60、150、300、600、1800、3600 秒,阈值含 0%、0.1%、0.5%、1%、5%、10%、20%、50%,并比较全部浊音、仅言语、仅歌唱 3 种帧选择。最终最优为 300 秒窗且至少 10% 言语歌唱数据,并把同一患者多窗再聚合成单样本后算均值、第 10 与第 90 百分位及标准差。音创伤侧的可运行对照是模型一与模型二各自的单模型,集成是待评策略而非基线。指标方向为曲线下面积、准确率、精确率、召回率越大越好,阈值用尤登指数为每个模型单独选择。

下表整理被试构成与划分口径,阅读时注意训练与盲测的标签可见性差异。

被试分组病例数匹配对照数标签可见性评估阶段
音创伤组213 人169 人训练集可见,测试集 withheld交叉验证加盲测
非音创伤组116 人84 人训练集可见,测试集 withheld交叉验证加盲测
全部合计582 人含在上述分组内训练 468 人盲测为剩余

该表说明病例对照匹配与标签 withheld 是公平条件的主要来源,任何打乱按人划分或混入测试标签的做法都会使后文曲线下面积不可比。原文未报告测试集的具体人数拆分与硬件耗时,复现时只能报告交叉验证侧的样本量与模型配置,不能编造测试分布或推理延迟。

主结果在相同口径下提升了多少?

比较问题是:在留一组按被试评估且阈值各自用尤登指数选择的条件下,单模型与概率平均集成谁的被试级判别更好,指标方向为曲线下面积与准确率越大越好。公平条件是同一批 468 人、同一按人划分、同一先记录后按人平均的聚合。下表为可运行策略的数字表,记录级与被试级分开,基线与历史最优在下一表对照。

评估层级指标模型一提升树模型二逻辑回归概率平均集成
记录级 3,278 条曲线下面积0.819未报告未报告
记录级 3,278 条准确率0.76未报告未报告
被试级 468 人曲线下面积0.8710.8810.891
被试级 468 人准确率0.8270.8310.840
被试级 468 人正类 F10.7640.7720.792

表后解释需同时给出收益与代价。收益是按人平均带来稳定增益,模型一从记录级 0.819 升至被试级 0.871,集成进一步升至 0.891 且准确率达 0.840,说明多天平均抑制了单日波动。代价是集成对正类精确率略降至 0.753,靠召回升至 0.836 换来 F1 最高 0.792,意味着更积极地检出音创伤但误报略增。未胜出项是任一单模型,其曲线下面积均低于集成约 1 至 2 个百分点,不能用单模型代替集成收益。

受试者工作特征曲线给出阈值层面的完整证据,导读后贴图再解释。

看图路径: 1. 先确认横轴为假正率纵轴为真阳性率,对角线为随机基线;2. 再比较蓝橙绿三条曲线在左上拐点处的高低与图例曲线下面积;3. 读出方框内三组尤登指数最优点阈值,观察集成阈值最低

原论文 Figure 3:ROC curves for PVH subject-level classification using LOGO cross-validation.

论文图 3。原论文 Figure 3:“ROC curves for PVH subject-level classification using LOGO cross-validation.”。

该图横轴为假正率纵轴为真阳性率,3 条曲线均远高于对角线。图例显示模型一曲线下面积 0.871,模型二 0.881,集成 0.891,集成在左上拐点处最高。方框标注最优点为模型一尤登指数 0.63 阈值 0.392,模型二 0.64 阈值 0.420,集成 0.68 阈值 0.365,集成阈值最低与其更积极的正类倾向一致。像素可辨的结论止于相对高低与标注数值,不能读出每一步的具体截断对,也不能把拐点优势推广为全阈值域均匀领先。

换掉时间尺度会发生什么?什么特征在起作用?

本节回答两个反证问题。第一是非音创伤是否同样受益于大时间窗,第二是音创伤的判别力来自哪些可解释特征。原文报告非音创伤侧把路线一的十窗与路线二的言语歌唱分离都试过,结果仅略好于已有最优,最终胜出的是 300 秒短窗加按患者聚合后再算分布统计的方案,留一组下达 0.823。作者的有限解释是音创伤有持续结构足迹适合宽窗,而非音创伤多为间歇肌紧张,宽窗会稀释短时发作,短窗的第 90 百分位更易捕捉高强度尾部,该解释应表述为支持而非因果证明。 特征重要性用可加解释给出方向性证据,导读后贴图再解释。

看图路径: 1. 先看纵轴前两行均为不同时段的第一二谐波差统计量;2. 再沿横轴零线区分左右,正向推动音创伤型反向推动对照;3. 观察颜色条,高值红与低值蓝在同一行分居两侧即为方向性信号

原论文 Figure 4:SHAP beeswarm plot showing the top 10 features for PVH detection (Model 1), ranked by importance…

论文图 4。原论文 Figure 4:“SHAP beeswarm plot showing the top 10 features for PVH detection (Model 1), ranked by importance from top to bottom.”。

该蜂群图按重要性从上到下排列前 10 特征,每点为一条观测,横轴为对模型输出的贡献,正向推向音创伤,负向推向对照。可见前两行午间 12:00-17:00 的第一二谐波差第 90 百分位与晚间 17:00-22:00 的标准差中,低值蓝点居右,高值红点居左,表明下午晚上变异小指向病理。晨间 07:00-10:00 的标准差则反向,高值红居左低值蓝居右,表明晨间变异大指向对照。逆滤波闭合商第 90 百分位高值红居右,支持闭合商升高与声门闭合病理的关联。未胜出或负结果是神经网络系列与歌唱独占帧的窄口径:前者因被试数有限过拟合,后者因多人数据不足无法建模,这提示小样本下容量与数据覆盖是硬约束。

哪些边界尚未被测量?

论文直接报告的局限首先是逆滤波特征缺失。子集被试因采集限制没有该类特征,分析中做了相应处理但未给出填补算子与缺失比例,复现时需把缺失指示与插补策略显式记录,否则闭合商等重要特征的贡献无法对齐。其次是窗口与阈值的选择依赖交叉验证最优,非音创伤的 300 秒与 10% 阈值是事后最优,不能直接当作可部署的固定超参数去承诺跨中心泛化。

未测量的边界同样要指明。原文未报告训练与推理耗时、内存占用、输出帧率与实际延迟,也未报告按性别职业分层的误判率,因此不能承诺实时生物反馈的延迟改善或公平性结论。相关性不等于因果:第一二谐波差变异与闭合商的方向性关联支持生理假设,但未做干预实验,不能断言压低某特征就能治愈。总体趋势不等于每组每步成立,傍晚覆盖最高不代表每个被试傍晚都有足够浊音,05-07 过渡窗的 0.3% 覆盖即为例外。

还有一处口径冲突需标注。正文一处把路线一描述为 10 个部分重叠窗口,配图却呈现 7 行为窗口加 3 昼夜相位的组织,二者在窗口计数与是否重叠上表述不一致。本文按像素以图为准描述行为与昼夜两套划分,按文字保留十窗重叠的说法,不自行编造两者映射关系,复现时应以代码实际窗口为准并报告。

复现先做什么?需要哪些信息条件?

复现顺序应沿学习依赖:先落实评估口径,再落实窗口,最后落实模型。第一步按被试做留一组划分,记录级先打分再按人平均,阈值用尤登指数在验证侧为每个模型单独选择,不能复用集成的 0.365 阈值去评单模型。第二步实现 3 种预处理:路线一按浊音帧在各窗算 5 种描述子加浊音占比,路线二按言语歌唱分别聚合且窗口改为 4 个不重叠区间,路线三实现可变短窗与浊音占比网格并在相关大于 0.9 与含缺失时过滤特征,再按天或按人聚合算均值、第 10 与第 90 百分位及标准差。第三步按原文超参数训练提升树与逻辑回归,集成只做概率平均。

关键超参数与信息条件要完整保留。提升树音创伤侧为 1000 树、学习率 0.03、深 6、最小子权重 25、伽马 0.2、行列采样 0.6 与 0.7、一范数 0.7 二范数 1.5;非音创伤侧为 500 树、学习率 0.03、深 4、最小子权重 17、伽马 7、采样 0.8 与 0.4、一范数 0.2 二范数 25、正类权重 8.5;逻辑回归为最大迭代 1000、lbfgs、C 等于 1.0、容差 1 乘 10 的负 4 次方。版本条件为提升树 3.1.3 与科学学习库 1.8.0。

资源状态是开源声明的唯一依据。本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码模型或数据已公开。还需补的验证包括缺失逆滤波的消融、跨设备跨中心的固定窗口测试,以及按性别职业分层的误差分析,这些缺项不否定已报告的交叉验证与盲测数值,但决定了能否直接部署。

何时值得尝试这种切分?

当监测信号具有昼夜节律与行为类型差异,且病理足迹可能是持续偏移或间歇发作之一时,值得尝试先切分再聚合。音创伤的持续足迹适合行为与昼夜窗口保留晨昏对比,并用言语歌唱分离放大高负荷下的标记;非音创伤的间歇紧张更适合短窗加尾部分位数,避免被全天平均稀释。两类任务分用不同尺度,是本文最应带走的判断。

盲测层面的最终对照如下表,阅读时注意验证与盲测阶段不同,数字不能直接相减当作提升量,但方向一致支持时间切分的价值。

任务盲测本方法曲线下面积历史基线曲线下面积挑战名次交叉验证对照
音创伤检出0.9250.82第 1 名集成 0.891
非音创伤检出0.8200.78第 4 名最优 0.823

该表显示音创伤集成在盲测达 0.925 并列第一,超越 0.82 个基线;非音创伤达 0.820 列第四,超越 0.78 基线且与交叉验证 0.823 接近,说明短窗方案的泛化偏差较小。代价是窗口与阈值需按亚型重选,神经网络在数百人规模下易过拟合,夜间与过渡窗覆盖过低会带来方差。若你的数据也是长期佩戴、多天每人、含言语歌唱混合,先复现按人划分与按人平均,再做窗口尺度消融,比先换大模型更可能得到诚实增益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总