英文题目:A Hierarchical Feature Engineering Framework for Automated Classification of Phonotraumatic and Non-Phonotraumatic Vocal Hyperfunction
会议身份:
conference:interspeech:2026:conference-paper-id:kim26x_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#语音生物标志物 #统计分析 #言语障碍 #病理语音评估
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- June-Woo Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Kangwook Jang:机构信息未能从会议 PDF 纯文本可靠映射
- Minu Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Hyunju Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为颈表加速度衍生的14维帧级声学与作用空气动力学序列,仅保留浊音帧,输出为受试者级发声创伤性发声过度功能对照常人与非发声创伤性发声过度功能对照常人二分类标签,难点是日常长时监测的高变异性与非创伤组无结构病变导致的分布重叠。方法第一步按受试者聚合静态分布与动态趋势描述子,静态层计算分布矩与分位数,动态层在一阶与二阶差分上计算趋势与波动量,形成197维表示。第二步以上一步表示为输入构造比值归一量与6项源滤波器及稳定努力耦合交互项,输出203维分层特征集以显式建模声学空气动力学关联。第三步将该特征集送入训练折内中位数插补与基于极端梯度提升的递归特征消除交叉验证筛选,再以固定超参数训练逻辑回归等五种分类器并做解释,区别于已有仅用简单时间平均而忽视动态与耦合关系的做法。在按受试者分组分层10折交叉验证集任务下,耦合特征逻辑回归的AUC为0.891 ± 0.04,高于静态特征的AUC 0.851 ± 0.05。结论受限于给定特征级数据与日汇总粒度的两组对照任务,不能外推至原始波形、连续预警或跨设备人群。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?为什么颈表加速度值得做?
本解读的输入是论文正文证据与 3 张官方原图像素,目标是让刚进入语音与音频领域的研究生能复述方法、核对实验条件并理解结论边界。必须保留的信息包括两个分类任务的定义、4 层特征的构造口径、被试级分组验证方式、单变量与多变量两条证据线,以及创伤性与非创伤性结果不对称这一中心事实。输出按学习依赖展开,先讲任务与路线,再讲方法全景与组件计算,然后讲验证流程、实验条件、结果与反证,最后给出复现清单。
发声过强是长期误用声音导致的一类嗓音障碍,临床上分为有器质性创伤的亚型与无器质性病变但肌肉紧张失衡的亚型。白话说,前者声带上能看到结节类损伤,后者更多是功能性用力模式异常。英文分别记为 phonotraumatic vocal hyperfunction,简称 PVH,和 non-phonotraumatic vocal hyperfunction,简称 NPVH。传统诊断依赖临床检查,而日常生活中如何用无创手段捕捉用声行为,是 ambulatory monitoring 即便携式日常监测要解决的问题。
论文选择 neck-surface acceleration 即颈表加速度,缩写 ACC,作为观测入口。具体动作是把加速度传感器贴在颈部表面,连续记录说话时经颈部组织传导的振动。与麦克风相比,它受环境噪声影响较小,适合整天佩戴;与直接测量声门气流相比,它完全无创。研究对象是 NeckVibe 挑战赛数据集提供的已提取好的帧级声学与空气动力学量,而不是原始波形。这一点决定了后续所有特征工程都是在给定表格型特征上做聚合,而不是从波形端到端学习。
同输入同目标的前人路线走了多远?
在相同输入与相近目标下,前人路线可分为三支。第一支是基于周平均行为差异的临床观察,例如比较有结节女性与匹配对照在一周内的日常发声剂量与声学分布,发现组间差异存在但日常变异很大。第二支是基于阻抗逆滤波估计声门气流,例如 subglottal impedance-based inverse filtering,缩写 IBIF,把颈表振动反推为声门气流波形,进而估计声流幅度、最大流量衰减率、开放商等量,用于评估发声效率。第三支是基于机器学习的初步分类,例如用颈表特征检测声带结节,但多采用单个特征的时间平均,忽略了动态过程与参数间耦合。
与这些路线相比,本文的输入相同,都是颈表加速度衍生量;目标相同,都是区分病理组与健康对照;监督相同,都是有标签的二分类;但运行阶段与表示不同,前人多用静态均值,本文系统比较静态分布、动态趋势、比率归一与生理耦合 4 种表示。教学例子是:若只比较平均音量,两组人可能重叠很大。
但若比较音量忽大忽小的剧烈程度,或比较周期性好坏与频谱倾斜的比值,差异可能显现。这只是帮助理解的例子,不代表论文报告了该例子的数值。
需要避免的误解是把类别差异当成同条件胜负。论文表格中引用的基线来自不同年份、不同受试者划分与不同特征口径,不能直接理解为本文方法在完全相同流水线上碾压前人。更准确的读法是:本文提供了一个在同一划分与同一评估协议下比较 4 种特征配置的受控实验,前人结果只作为背景参考。
要解决的两个二分类问题是什么?
论文处理两个独立的二分类任务。任务一是区分 PVH 与 PVH 对照组,任务二是区分 NPVH 与 NPVH 对照组。对照组是按研究设计匹配的健康人,不是把两个病例组合并再分。评估在被试级别进行,也就是先把一个人的多条录音聚合成一条被试级特征向量,再判断这个人属于病例还是对照。
沿一个样本走完全流程有助于建立全局观。假设有 1 位被试的多天颈表记录,已被切帧并标出每帧是否为浊音。第一步只保留浊音帧,聚焦真正的发声段;第二步对每 1 帧的 14 个基础量计算静态、动态、比率与耦合描述子;第 3 步把所有帧聚合成一条被试向量,并附上发声剂量百分比。
第四步把该向量送入单变量检验或多变量分类器,输出任务一或任务二的得分。目标是得分越高越倾向判为病例,输出即为该被试的预测标签与用于画 ROC 的连续分。
难点在于日常变异大且两类机制不同。PVH 有结构性损伤,声学周期性与气流波形的异常更持续;NPVH 无明确病灶,更多是紧张模式与心理负荷相关的功能波动,与对照分布重叠更大。因此论文假设单一均值不够,需要显式刻画波动与声气关系,这直接引出分层特征框架。
分层特征框架的全景如何串起来?
方法全景可概括为 4 层递进加两条证据线。4 层是静态层、动态层、比率层与耦合层,每一层都在前一层基础上增加描述子,最终形成 99 维、197 维、253 维与 203 维 4 种配置。两条证据线是单变量统计线与多变量机器学习线,前者逐特征检验可解释性,后者用特征选择加 5 种分类器检验联合判别力。所有实验对 2 个任务分别独立进行。
基础变量共 14 个加一个发声剂量。声学侧有 6 个,包括一二次谐波差、频谱高低频能量比、倒谱峰突出度、颈表加速度幅度及其对数形式、谱倾斜;空气动力学侧有 8 个 IBIF 衍生量,包括气流谐波差、谐波丰富度、最大流量衰减率、交流声流量、速度商、开放商、归一化幅度商与关闭商。发声剂量百分比定义为浊音帧占总录音时间的比例,全程参与每种配置。
缺失处理分两条路径,这是复现时最易混淆的点。统计分析排除含插补或缺失的观测,避免组间差异被填补值污染;机器学习则在每个训练折内用中位数插补,保证训练矩阵完整且不泄漏验证折信息。聚合对象始终是被试,而不是录音条数,这意味着样本量大的被试不会在评估中占据不公平权重。
静态分布与动态趋势各自算什么?
静态特征回答该被试的发声处在什么水平、散得多开、形状偏不偏。对每个基础量计算均值、标准差、5 分位、95 分位、偏度、峰度与四分位距,共 14 乘 7 再加发声剂量得到 99 维。白话说,均值与分位数定位置,标准差与四分位距定 spread 即离散程度,偏度与峰度定分布不对称与拖尾程度。这些量只看跨帧的总体分布,不保留时间顺序。
动态特征回答变化有多快、多剧烈、向哪个方向漂。做法是对帧序列求 1 阶差分与 2 阶差分,再统计差分均值、差分标准差、上尾差分幅度、平均绝对差分、2 阶差分标准差与线性趋势斜率。每基础量增加 7 个描述子,与静态合并后共 197 维。直觉是:即使两个人平均音高相同,一个人忽高忽低的抖动更大,就会在差分标准差与上尾分位上显现。
颈表加速度 × 阻抗逆滤波: 颈表加速度负责在日常环境下无创采集颈部振动信号,提供连续可穿戴观测;阻抗逆滤波负责把该振动反推为声门气流波形,估计声流幅度、开放商等空气动力学量,二者搭配的理由是只看表面振动无法解释声门开闭力学,而直接测声门气流又不适合长期佩戴,组合后新增的作用是得到可在发声段逐帧计算的生理可解释变量。
静态特征 × 动态特征: 静态特征负责刻画一整段录音内每个基础量的中心、离散与形状,如均值、标准差、5 分位、95 分位、偏度、峰度与四分位距;动态特征负责刻画帧间变化的 1 阶差分与 2 阶差分统计、斜率与上尾幅度,二者搭配的理由是平均值会抹掉用声习惯的波动,而只看变化又失去基线水平,组合后新增的作用是同时保留发声处在什么水平和它如何起伏。
实现细节上,特征只在浊音帧上计算,清音与静音不参与统计。差分与斜率依赖帧顺序,因此要求保留同一录音内的时间 order 即先后关系,不能打乱帧再算动态量。被试聚合时是先在帧级算好差分再做被试级统计,而不是先平均再差分,顺序不可颠倒。
比率归一与生理耦合为何要相除?
比率特征解决个体绝对水平不可比的问题。对每个基础量构造 4 个相对波动量:差分标准差除以均值、差分标准差除以标准差、斜率绝对值除以均值、平均绝对差分除以均值。在动态层基础上再加 14 乘 4 维,总计 253 维。白话说,就是把波动幅度除以基线,回答波动相对于自身水平算大还是小。这能削弱单纯嗓门大的人天然波动也大的尺度效应。
耦合特征用相除显式写出源滤波器交互。论文引入 6 个有生理动机的交互项,包括源滤波器耦合、稳定性与用力耦合、气动内部耦合 3 组,例如倒谱峰突出度除以谱倾斜、倒谱峰突出度除以谐波差、倒谱峰突出度除以波动强度,以及归一化幅度商与开放商各自除以波动强度。在动态层基础上加 6 维,总计 203 维。注意耦合配置不是在比率层上再加,而是在动态层上加 6 维,这解释了为何其维度小于比率配置。
比率特征 × 耦合特征: 比率特征负责把时间波动除以均值或标准差做归一化,如差分标准差除以均值;耦合特征负责把声学量与空气动力学量相除构成源滤波器交互项,如倒谱峰突出度除以谱倾斜,二者搭配的理由是前者消除个体音量差异,后者显式建模发声效率与声道输出的关系,组合后新增的作用是得到跨被试可比且有生理指向的关系量。
组合意义在于把不可比的绝对量变成可比的关系量。举例理解:周期性很好但频谱很倾斜的人,与周期性一般但频谱平坦的人,可能平均值相近,但比值指向不同的发声效率解释。这只是教学类比,论文并未声称该例子中的数值方向一定对应病例,真实方向需看统计检验与模型权重。
没有训练神经网络时真正算了什么?
本研究没有训练深度神经网络,也没有更新任何预训练语音模型的权重,因此 training 一节的真实含义是传统机器学习流水线的拟合与选择过程。具体计算包括 3 步:训练折内特征选择、分类器拟合、验证折打分,全程在被试分组下进行。未训练的对象必须明确:不存在反向传播到波形编码器、不存在微调、不存在梯度路径可画,监督来源是被试级病例对照标签,优化的是分类器自身参数与特征子集。
交叉验证策略是分层 10 折、以被试编号为分组变量。分层保证每折中病例对照比例接近总体,分组保证同一个人的所有录音只出现在训练或只出现在验证,避免同一说话人同时见于两端导致的高估。缺失值用训练折中位数插补,验证折套用该中位数,不在全量数据上提前算中位数。
单变量检验 × 多变量建模: 单变量检验负责逐个特征做韦尔奇 t 检验并用错误发现率校正,回答每个特征单独是否可分;多变量建模负责用逻辑回归、支持向量机、随机森林与梯度提升树联合使用经递归消除选出的特征,二者搭配的理由是前者保证临床可解释性,后者捕捉特征间非线性交互,组合后新增的作用是区分创伤性接近线性可分而非创伤性依赖交互的两种机制。
被试分组交叉验证 × 中位数插补: 被试分组交叉验证负责把同一个人的全部录音只放入训练或只放入验证,避免同一人信息泄漏;中位数插补负责在训练折内对缺失的逆滤波变量填入中位数,二者搭配的理由是既要保证评估的是跨人泛化,又要让含缺失的样本仍能参与训练,组合后新增的作用是在保持被试独立前提下维持高维特征矩阵完整。
特征选择用基于 XGBoost 估计器的递归特征消除加交叉验证,缩写 RFECV,只在训练折内执行,选出的子集再用于该折所有分类器的评估。论文说明也试过贪心搜索但效果次优,因此统一用 RFECV 结果。分类器比较 5 种:逻辑回归、带高斯核的支持向量机、随机森林、XGBoost 与 LightGBM,均用固定超参数跨折与跨特征集比较,意图是比较表示而非调参上限。模型解释用 SHAP 值在验证折上聚合,观察是少数主导特征还是多特征分布式贡献。
数据划分、缺失与指标条件如何核对?
复现先核对数据规模与划分口径。数据集总量与分组构成是核对起点,下表把论文报告的样本数与被试数按 4 组整理,缺失情况单独列出。需要强调聚合对象是被试,交叉验证的折是按人划分,而不是按录音条划分;指标均值与标准差是对 10 个验证折取平均,而不是对录音条取平均。
下表提出比较问题:在总量一定的前提下,两任务的病例对照是否平衡?缺失是否集中在某一组?公平条件是同一被试分组协议与同一缺失处理声明,指标方向是样本数与被试数越大统计越稳,缺失越少偏差越小。
| 条件 | 样本数 | 被试数 | 缺失说明 | 对照设置 |
|---|---|---|---|---|
| 全部数据 | 3278 | 468 | 部分被试缺失逆滤波量 | 分任务独立对照 |
| PVH 组 | 1151 | 171 | 37 条样本缺失 | 对应 PVH 对照 |
| PVH 对照组 | 992 | 136 | 无缺失 | 对应 PVH 组 |
| NPVH 组 | 637 | 93 | 11 条样本缺失 | 对应 NPVH 对照 |
| NPVH 对照组 | 498 | 68 | 7 条样本缺失 | 对应 NPVH 组 |
上表的主要收益是确认任务一数据量明显大于任务二,且 PVH 对照无缺失而其余 3 组均有少量缺失。具体代价是逆滤波缺失导致 9 人至少一条录音缺气动量,若在统计线直接删除会减少有效被试数,若在模型线插补则引入近似。未胜出项是论文未报告按性别、年龄或录音时长的分层表现,因此不能判断数据不平衡之外的混杂是否影响结果,这也是复现时需补记的边界。
统计方法按原文交代:每任务独立做韦尔奇 t 检验,不假设等方差与等样本量,用科恩 d 报告效应量,并在每个特征集内用 Benjamini-Hochberg 错误发现率校正控制多重检验的一类错误。机器学习指标包括 AUC、准确率、精确率、召回率与 F1,其中 AUC 越大越好,F1 兼顾查准查全。硬件预算与训练耗时原文未报告,这是明确缺项,不能从模型名称推定开销大小。
单变量统计显示了怎样的不对称?
本节的教学任务是读懂为何论文说任务一强可分而任务二几乎不可分。统计结果按 4 种特征配置汇总,任务一报告校正后显著数,任务二因无校正后显著而报告名义显著数。总体趋势是任务一显著特征数随表示变丰富而增加,任务二在任何配置下都没有通过错误发现率校正的特征。
下图前导读覆盖像素细节:左侧 6 个箱线图为任务一按校正后 p 值排序的前六特征,右侧 6 个为任务二按原始 p 值排序的前六特征。每小图横轴为病例与对照两组,纵轴为被试级特征值,箱体叠加散点显示分布,顶部标注 p 值与效应量。阅读时先看分离程度,再看标注的显著等级。
看图路径: 1. 先看左右两大面板标题确认左侧为任务一按校正后 p 值排序、右侧为任务二按原始 p 值排序;2. 再对比左右箱体分离程度与标注的效应量 d 值大小;3. 检查横轴分组标签确认绿色为病例组、橙色为对照组;4. 注意右侧面板顶部仅标注单星号名义显著而无多重校正显著
论文图 1。原论文 Figure 1:“Comparison of statistical features for PVH (Task 1) and NPVH (Task 2).”。
针对可见内容的解释是:左侧任务一箱体中位数错开明显,顶部标注三颗星与校正后 p 小于 0.001,效应量绝对值约 0.9 到 1.0,属于大效应,且多为动态与高阶分布描述子;右侧任务二两组箱体重叠严重,顶部仅单星号名义显著,效应量绝对值约 0.3,属于小效应。像素上左侧绿色与橙色点云中心分离,右侧两色点云几乎混在一起。这支持论文判断:日常汇总水平上 PVH 有稳健组间差异,NPVH 只有微弱探索性趋势。
该结论的适用条件是被试级日常汇总与排除缺失后的样本。若换成录音级检验或纳入插补样本,显著数可能变化,因此不能把此处显著数直接当成特征重要性排名用于部署。相关性也不等于因果,显著只说明分布不同,不证明该特征导致疾病。
多变量分类的主结果与代价是什么?
本节的教学任务是在受控表示比较下读主结果。比较问题是:从静态到动态到比率再到耦合,判别力是否单调提升?公平条件是同一分层 10 折被试分组、同一 RFECV 选择逻辑与固定超参数,指标方向是 AUC 与 F1 越大越好。下表把论文正文句子中明确报告的 AUC 与 F1 按配置整理,未在正文句子中出现的格子用横线表示不硬填,避免把表格矩阵的裸值当成已核对证据。
| 特征配置 | 任务一 AUC | 任务一 F1 | 任务二 AUC | 任务二 F1 |
|---|---|---|---|---|
| 静态 | 0.851 | — | 0.556 | — |
| 动态 | 0.869 | — | 0.682 | — |
| 比率 | 0.885 | 0.838 | 0.608 | — |
| 耦合 | 0.891 ± 0.04 | — | 0.728 ± 0.10 | 0.747 |
上表的主要收益是任务一随表示变丰富稳步提升,耦合加逻辑回归达到 0.891,而比率配置拿到最高的 F1 0.838;任务二静态接近随机猜测的 0.556,动态提升到 0.682,比率回落到 0.608,耦合加 LightGBM 达到 0.728。具体代价是任务二即使最优仍低于任务一约 0.16 的 AUC,且标准差达 0.10 到 0.21,说明折间波动大。未胜出项是比率特征在任务二未持续帮助,以及静态特征在任务二几乎无效,这提示归一化本身不能创造原本不存在的分离。
重提结果时增加机制视角:任务一的最优模型是线性逻辑回归,支持接近线性可分的解释;任务二的最优是 LightGBM,支持需要非线性交互的解释。但这只是有限解释,因为固定超参数下比较不能排除调参后线性模型追上的可能,待验证点是超参数搜索是否改变最优模型归属。
去掉哪一层表示会怎样?耦合层真的重要吗?
本节按消融逻辑组织:以静态为起点,依次看加动态、加比率、换耦合的增量。测的是同一评估协议下的 AUC 变化,与谁比是 4 种配置之间互比,条件一致性由固定超参数与同一分组保证。任务一呈现单调增益,说明每一层都带来新信息;任务二呈现先升后降再升,说明比率归一在小样本高重叠下不稳定,而耦合带来最大单步提升。
下图前导读针对任务一的最优线性模型的 SHAP 汇总:纵轴为特征名按贡献排序,横轴为 SHAP 值即对模型输出的影响,正值推向病例,负值推向对照,颜色表示特征值高低,红色为高、蓝色为低。观察时先看顶部若干行的红蓝分离方向,再看点云是集中还是发散。
看图路径: 1. 先确认横轴为 SHAP 值、纵轴为特征名按重要性从上到下排列;2. 再观察顶部谐波差动态特征的红蓝点在零线两侧的分离方向;3. 对比右侧颜色条确认红色为高特征值、蓝色为低特征值
论文图 3。原论文 Figure 2:“Task 1 SHAP summary (Logistic Regression).”。
针对可见内容的解释是:顶部谐波差的差分标准差行红色点偏右、蓝色点偏左,说明该波动越大越推向 PVH;随后多行的气流与谐波动态上尾量也呈现一致的方向性,且点云相对紧凑对称。这支持论文的分布式贡献判断,即任务一靠多个中等贡献特征稳定投票,而非单一主导特征。像素上未见某一行一家独大,底部长尾点虽有但不改变整体对称结构。
反证是耦合项本身在该 SHAP 前列并未占据主导,可见行名多为动态统计而非比值项。这并不否定耦合配置的整体增益,因为增益可能来自特征选择后整体分布的协同,而非单个耦合项的巨大 SHAP。未评测边界是论文未报告逐个移除 6 个耦合项的细粒度消融,因此不能说哪一个比值最关键,只能说耦合配置整体最优。
held-out 与任务二的不稳定说明了什么边界?
本节先看挑战赛保留测试集,这是与交叉验证不同的实验阶段。论文报告最优模型在未见测试集上任务一 AUC 为 0.917,任务二 AUC 为 0.579。结合验证阶段的 0.891 与 0.728,可以判断任务一泛化稳健甚至略升,而任务二从验证到测试大幅回落,说明任务二的验证增益可能依赖验证折的特定分布,跨分布稳定性差。
下图前导读针对任务二最优非线性模型的 SHAP 汇总:坐标含义与上一图相同,但取值范围与点云形态不同。先确认横轴范围明显更窄且右侧长尾更突出,再看顶部归一化幅度商、谐波 2 阶差分上尾与声气比值行的颜色混叠情况。
看图路径: 1. 先确认横轴仍为 SHAP 值但取值范围明显小于任务一的图;2. 再看顶部归一化幅度商与谐波动态特征的点云是否更发散;3. 观察多行中红蓝点混叠程度以判断方向一致性是否变弱
论文图 2。原论文 Figure 3:“Task 2 SHAP summary (LightGBM).”。
针对可见内容的解释是:顶部多行红蓝点在零线两侧混叠严重,部分高特征值既出现在正向也出现在负向,点云更宽更发散;气流开放商的平均绝对差分行蓝色低值点向右拖出长尾,说明少数样本主导了该特征的贡献方向。这与论文描述的集中但高方差、判别结构不如任务一稳定的判断一致。像素上任务二的对称性明显弱于任务一,不能把验证集上的 0.728 理解为已找到稳定边界。
局限还包括仅使用特征级表示而无原始波形、未建模长时间时序依赖、未测量延迟与部署成本。论文提出未来可用自监督语音模型直接建模原始时序以捕捉微颤与韵律细微变化,但这属于未验证推测,应表述为可能与待验证,而非已证明有效。
复现先做什么?按什么顺序核对?
复现按数据、特征、验证 3 步走,每步都有可执行动作。第一步核对数据口径:确认 4 组样本数与被试数、确认 9 人 55 条的逆滤波缺失分布、确认只用浊音帧与被试级聚合。任何把录音条当独立样本打乱分折的做法都会破坏分组条件,导致结果虚高。第二步重建特征:按 99、197、253、203 四档维度自检,静态 7 描述子、动态 7 描述子、比率 4 描述子、耦合 6 交互项缺一不可,特别注意耦合是在动态上加 6 维而非在比率上加。第 3 步重跑验证:实现分层 10 折被试分组,在训练折内做中位数插补与 RFECV,再用固定超参数评估 5 种分类器并报告均值与标准差。
下表把可部署策略与事后最优区分开,避免把挑选最优模型的验证数当成部署收益。比较问题是验证最优能否搬到保留集,与谁比是验证均值与保留集单点,条件是否一致需注意保留集分布可能不同,指标方向仍是 AUC 越大越好。
| 评估阶段 | 任务一 AUC | 任务二 AUC | 最优配置说明 | 可运行性 |
|---|---|---|---|---|
| 验证均值 | 0.891 | 0.728 | 耦合加线性或树模型 | 可运行流水线 |
| 保留测试 | 0.917 | 0.579 | 同上最优模型直推 | 可运行直推 |
| 论文摘要 | 0.891 | 0.728 | 与验证一致 | 非事后挑选 |
表后解释是:任务一从验证到保留保持高位,支持分层特征确有泛化价值;任务二大幅下滑,说明验证阶段的相对最优不等于可部署收益。具体代价是若只看验证就会高估任务二的实用性。未胜出项是论文未给出保留集上的准确率与 F1,也未报告折间最差折表现,因此复现时应补记完整分布而非只记均值。
关键超参数与信息条件按原文保留:分类器用固定配置而非广泛调参,RFECV 用树估计器且仅在训练折内,统计用韦尔奇 t 检验加错误发现率校正。资源状态方面,本次未发现来源绑定且完成验证的开源代码与数据链接,不得声称代码或数据已公开;复现应基于论文文字自实现并记录随机种子与折划分。
何时值得尝试这套分层特征?
综合两条证据线,值得尝试的条件很明确。当目标是 PVH 这类有持续生理痕迹的亚型,且观测是长期颈表监测的汇总特征时,从静态均值起步,逐步加入动态波动与声气比值,大概率带来稳定增益,且线性模型已具竞争力,复现成本较低。当目标是 NPVH 这类分布高度重叠的功能性亚型时,静态与比率几乎无效,动态与耦合只能带来有限且不稳定的提升,此时不应期待靠手工汇总特征解决,应补做时序建模或引入韵律、微扰与自主神经相关的细粒度表示,并用保留集验证稳定性。
还需补的验证包括按性别与严重程度分层、报告误判率与校准曲线、测量推理开销与功耗,以及在另一采集设备上的跨库测试。总体趋势不等于每组都成立,平均 AUC 高不代表每个被试都可分。对初学者的实践建议是:先复现被试分组与四档维度,再复现单变量显著不对称,最后才调模型;任何跳过前两步直接调参的做法都会掩盖任务二的本质困难。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


