英文题目:Towards Dys-XAI: Influence-Based Explanations for Dysarthria Severity Assessment
会议身份:
conference:interspeech:2026:conference-paper-id:wu26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#统计分析 #可解释性 #言语障碍 #病理语音评估
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Xiaoliang Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Qiyang Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yupei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Erfan Loweimi:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Williams:机构信息未能从会议 PDF 纯文本可靠映射
- Zhengjun Yue:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
构音障碍严重程度评估需将语音映射为典型 typical、轻度 mild、中度 moderate、重度 severe共4级有序标签,难点在于相邻级别差异连续且听觉感知评定本身存在评定者间变异。该工作先用梯度轨迹追踪TracIn计算每条训练语音对每条测试语音的影响分,再按测试真值标签聚合为类级向量并进一步按训练标签平均为4×4影响矩阵,最后按标签距离统计序数敏感性以刻画模型全局行为。与输出时频显著图或OpenSMILE描述子排序不同,该机制直接返回可听的支持与对抗参考样本,使有序比较显式化。在TORGO说话人无关划分的受控删除评测下,删除类内高影响20%样本后中度类别的准确率为0.3%,低于未删除基线的准确率36.8%,即从36.8%降至0.3%。删除低影响样本后中度与轻度性能回升超十个百分点且矩阵呈对角主导与邻级互助结构,支撑了解释的因果相关性与序数敏感性。结论目前仅在单数据集与弱线性分类器下成立,跨语种、跨采集条件与更强声学编码器的外推尚未验证。原文未披露训练、推理或部署成本,仅提供试听演示页而无代码权重开源。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么临床不敢直接用黑盒?
这篇论文的输入是一句英语语音,来自公开的 TORGO 库,输出是 4 个等级之一:典型、轻度、中度、重度,其中原文把中度到重度合并为重度。目标读者是刚进入语音或临床语音方向的研究生,需要先建立的事实是:严重度标签是有序的,轻度与中度是损伤连续体上的增量差异,不是颜色与动物那样泾渭分明的名义类。临床现在常用听觉感知评定,耗时且不同医生之间一致性有限,自动评估的吸引力在于快速、标准、可重复,能减轻负担并支持更频繁的监测。
论文报告深度学习在多个公开集上已达到可比专家评定的性能,但性能本身不足以进临床。医生和患者要据此调治疗计划、谈预后,如果模型只给一个等级而不给可核查的理由,就难以信任。解释在这里不只是研究者调试模型的工具,更是要交给终端用户复核和沟通的证据。为此作者把问题从问哪段频谱重要,改成问哪些训练录音支持这次判定、哪些训练录音反对这次判定。因为训练样本本身就是音频,可以直接放出来听,这与医生用原型案例做比较的习惯更接近。
构音障碍严重度评估 × 可解释人工智能: 构音障碍严重度评估负责把一句话映射到典型、轻度、中度、重度 4 个有序等级,支撑治疗计划和纵向跟踪;可解释人工智能负责说明为什么给出这个等级。两者搭配的原因是临床不仅要准,还要能核查和沟通,组合意义是把黑盒输出变成可回放、可对照的证据链。
本解读的输入是论文正文证据与 4 张官方原图像素,目标是让你能复述方法与实验条件并知道边界。必须保留的信息包括数据规模与划分、基分类器配置、影响分数的计算与聚合方式、删除实验的 3 条策略与关键数字、跨严重度矩阵与有序敏感度数值。输出是按学习依赖展开的自然段讲解,不做营销式判断。资源状态方面,本次没有发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开,只能按论文文字讲方法与结果。
已有的语音可解释方法在走哪条路,为什么不够用?
论文梳理的现有路线主要有 3 类。第一类是事后特征归因,包括时频显著性方法如 SHAP、LIME、注意力可视化,给出每个 utterance 内部哪块区域重要。第二类是对预定义声学特征集做重要性排序,例如 OpenSMILE 描述符。第 3 类是看模型层行为。这些方法都能产生热力图或排序分数,说明局部敏感度。
作者指出两点局限。第一,这些解释是局部的、 utterance 内的,不能直接回答关系证据:当前话语与相邻严重度等级相比处在什么位置。严重度是有序的,临床需要的恰恰是这种跨等级比较。第二,医生习惯用辅音精准度、元音集中化、异常韵律、语速慢、气息声这类感知构念推理,把频谱热力图或工程描述符名翻译成临床理由并不直接。比如后文案例里 SHAP 给出 equivalentSoundLevel dBp、mfcc4 sma3 amean 这类条目,声学上细致但难以做感知验证。
特征归因解释 × 基于实例的影响解释: 特征归因解释分工是标出哪段时频或哪个声学描述符对输出贡献大,基于实例的影响解释分工是找出哪些训练录音支持或反对当前判定。搭配理由是前者停留在 utterance 内部敏感度,后者直接暴露跨严重度等级的关系证据,组合意义是让医生能听参考音频做感知验证,而不是翻译热力图。
于是论文把视角从声学特征转向基于案例的训练实例。做法是沿用基于梯度的影响近似,但创新在为每个测试 utterance 算出覆盖整个训练集的影响分,并做两层结构化聚合:按严重度标签的类级别聚合,以及跨测试用例的模型级别聚合。最后用受控删除实验检验这些影响是否对应因果相关的预测证据,而不只是相关假象。这就把可解释性与可审计性连起来:判定可以追溯到可听的参考案例。
任务如何形式化,解释对象到底是什么?
论文沿用 TORGO 自带的说话人级严重度标注,把任务做成四分类有序分类。给定话语 x,标签 y 取 0 到 3,对应典型、轻度、中度、重度。训练集记为多个带标签对,被解释的模型是四分类器,用交叉熵损失训练。解释目标不是重训一个更准的模型,而是对测试样本的每次预测,量化哪些训练样本支持它、哪些反对它,以及这种影响在严重度等级上如何分布。
举个教学例子帮助理解,但这只是例子:假设测试是一句被判为重度的话,理想的解释会列出最支持的 5 条重度训练录音和最反对的 5 条典型或轻度录音,医生点开就能听两者在清晰度、语速上的差别。论文实际做的就是把这种直觉变成可计算的分数与聚合矩阵。需要注意,有序性在这里是建模与评估的假设,不是网络结构自带的顺序约束,后文有序敏感度分析正是用来检验模型是否学到了这种顺序。
方法全景:一个测试样本如何走完影响计算与聚合?
沿一个测试样本走一遍。输入是 80 维滤波器组特征,送入一个单全连接层加 Softmax 的线性分类器得到四分类预测。要解释这次预测,先取出训练过程中保存的多个检查点,对每个训练样本计算它与该测试样本在每个检查点的损失梯度内积并累加,得到该训练样本对该测试样本的影响分。正分表示两者梯度同向,在该点训练前者会降低后者的损失,是支持;负分表示反向,是对抗。
对该测试样本,把全训练集的影响分排序,就能挑出最支持与最对抗的训练话语,这是实例级解释。把同一真实等级的所有测试样本的影响向量平均,就得到该等级的类聚合向量,可按训练标签再平均成 4 乘 4 的类级别影响矩阵。把矩阵按有序距离取平均,就得到模型级别的有序敏感度曲线。最后用删除实验验证:如果删掉高影响样本,该等级准确率应系统性下降;如果删掉低影响样本,性能应持平或上升,而随机删除应变化很小。
影响分如何算,检查点与梯度对齐代表什么?
论文采用基于梯度的影响估计方法,思想是跟踪训练轨迹上的梯度对齐。训练时每个 epoch 后存一个检查点,实验中每折存 30 个检查点。影响分定义为测试样本损失梯度与训练样本损失梯度在所有检查点上的内积之和。符号含义在每个检查点都一样:内积为正说明方向相近,训练该样本有助于降低测试损失;为负说明方向相反,会增大测试损失。
梯度内积 × 训练轨迹追踪: 梯度内积分工是在单个检查点度量训练样本梯度与测试样本梯度方向是否一致,训练轨迹追踪分工是把多个 epoch 检查点的对齐结果累加起来。搭配原因是单点对齐噪声大且受优化阶段影响,组合意义是得到覆盖整个训练过程的每测试话语影响排序,能区分持续支持与阶段性巧合。
对每个测试样本,算出对 N 个训练样本的影响向量后排序,就能做个案解释。原文没有给出逐层梯度是否截断、是否只算最后一层等实现细节,只明确是按检查点累加的梯度内积,因此复述时不应脑补只用最后一层或用了 Hessian 近似。基分类器本身很简单,这使得梯度计算便宜,但也意味着影响模式与该线性模型的优化路径绑定,换大模型后结论需要重新验证。
从个案到矩阵再到有序距离,聚合解决什么?
个案影响能定位具体录音,但看不出系统规律。类级别聚合先把真实标签为 c 的所有测试样本的影响平均,得到每个训练样本对该等级的平均影响,再按训练标签分组平均,形成矩阵元,表示训练等级对测试等级的平均每样本影响。除以该训练等级的样本数是为了在类别不平衡下可比,测试侧用平均也是为了平衡不同等级测试量。
类级别聚合 × 模型级别聚合: 类级别聚合分工是按测试真实等级平均影响并按训练标签分解成 4 乘 4 矩阵,模型级别聚合分工是按有序距离对矩阵取平均得到有序敏感度曲线。搭配原因是前者保留谁支持谁的细节,后者检验是否越近越支持,组合意义是从个案解释上升到模型是否把严重度当作有序连续体的全局判断。
模型级别聚合把矩阵按有序距离折叠。距离零是 4 条对角线的平均,代表同级支持;距离一是 6 个相邻格的平均,代表邻级支持;距离二和三依次类推。如果模型尊重有序结构,平均影响应随距离单调递减:同级最强,相邻中等,远距变弱甚至为负。
如果距离二反而大于距离一,说明模型更依赖极端对比而非细粒度区分;如果曲线平坦,说明模型把严重度当名义类处理。这种把细节与全局分开的安排,让个案可听、全局可判。
基模型如何训练,检查点与删除重训如何安排?
基分类器不是大语音模型,而是 80 维 FBank 特征接单层全连接加 Softmax 的线性分类器。每折训练 40 个 epoch,使用 AdamW 优化器,学习率为 3e-4,批大小为 32。影响计算用的检查点是每个 epoch 后存一个,每折给出 30 个检查点用于累加。原文同时写训练 40 个 epoch 与用于影响的 30 个检查点,这里保留原文两种数字,不自行调和为 30 个 epoch,复现时应按原文先跑 40 个 epoch 再核对实际保存的检查点数。
删除实验用相同结构与训练协议在缩减后的训练集上重训,再在对应严重度等级的测试样本上测分类准确率。删除比例取 0、5、10、15、20 共五档,对每个测试等级按类聚合影响排序后执行 3 种策略:删影响最高的、删影响最低的、随机删。这种重训验证的是影响排序是否抓住预测相关证据,而不是只看 1 次前向的重要性分数。论文未报告学习率衰减、权重衰减取值、早停或多次随机种子的方差,这些是复现时的缺项,不应从模型名推定。
数据、划分、指标与对照条件是什么?
实验只用 TORGO 一个英语构音障碍数据集,约 21 小时录音,来自 15 个说话人,其中 8 名构音障碍者约 7.3 小时,7 名典型说话人约 13.7 小时,语音材料含孤立词与句子,共 17587 条话语,严重度标签在说话人级别给出。划分采用按说话人分组的分层 K 折交叉验证,分层依据说话人级严重度标签以尽量平衡各折类别比例,每次留一折测试,其余做训练与验证。这种按人分组能避免同一说话人的不同句子同时出现在训练与测试,这是临床语音评估中必须守住的防泄漏条件。
指标是每个严重度等级上的分类准确率,方向是越高越好。删除实验的公平条件是同结构、同协议重训,只改变删除的样本子集,并用随机删除做基线对照,以排除单纯数据量减少的影响。论文还做了跨严重度矩阵可视化、有序敏感度柱状图,以及一个重度案例的 SHAP 与影响法对照,并提到演示页放了可听示例,但本次无可验证的公开资源绑定,因此只按文字与图像素讲解,不声称链接当前可用。
跨严重度矩阵揭示了什么结构?
要回答的比较问题是:在控制类别样本数后,模型做每个等级判定时平均依赖哪个训练等级,指标是平均每样本影响,正为支持、负为反对,公平条件是矩阵元都经过组内样本数归一化。下面先看类级别影响矩阵的像素,它把这种依赖摆成四行四列,行是测试标签,列是训练标签。
看图路径: 1. 先看横轴训练标签与纵轴测试标签的四个等级对应关系;2. 再对比对角线与非对角线格内数值的正负和深浅;3. 重点观察典型行全为负的反对模式与失调集群内互支持;4. 核对右侧色条正为支持、负为反对的含义
论文图 1。原论文 Figure 2:“Class-level influence matrix S. Rows = test labels, columns = training labels. Red (dark) positive (supporting pre- dictions). Blue (light) negative (opposing predictions).”。
从像素可见的解释是:对角线主导每一行,轻度到轻度格为 22915,中度到中度格为 21570,是全矩阵最深的两个红色块,说明判定主要靠同级证据。典型到典型只有 1831,颜色很浅,论文的解释是典型样本较原型化,需要的判别证据较少。典型测试行除首格为正外,其余三格均为负,其中轻度训练对典型测试的反对最强为负 4261,恰好卡在典型与异常的边界上起判别锚点作用。在失调等级内部则互相支持,例如中度测试除自身外还从轻度得 5400、从重度得 2031 的正支持。
整体呈两层结构:典型与失调的 2 分,再加失调内部的有序渐变。未胜出的细节是重度到重度只有 7390,明显弱于轻度和中度的对角线,说明重度建模并不最自洽,这与后文重度混入静音段的审计发现相呼应。
| 条件 | 指标 |
|---|---|
| 轻度测试 | 平均影响 |
| 中度测试 | 平均影响 |
| 典型测试 | 平均影响 |
| 重度测试 | 平均影响 |
上表把矩阵中最能说明两层结构的 3 组对照摆出来,主要收益是同级支持远大于跨级,代价是典型同级支持弱、重度同级支持不如轻中度强。反例是典型行与失调行的符号模式相反,不能用单一有序递减概括,必须分开说:典型是被失调反对,失调内部是互相支持。这也提醒不能把自动的影响数值直接当临床严重度标尺,它度量的是该线性模型下的梯度对齐,不是感知评分。
删除高影响与低影响样本会怎样,随机删除起什么作用?
要回答的反证问题是:影响排序是否真的抓住预测相关证据。做法是对每个等级按类聚合影响排序,分别删 top 比例、bottom 比例与随机比例并重训,指标是该等级准确率,公平条件是同结构同协议,随机线用于排除数据量效应。
看图路径: 1. 先确认四个子图分别对应典型、轻度、中度、重度;2. 再对比红线高影响、绿线低影响、蓝线随机随删除比例的变化;3. 观察中度和重度红线陡降与绿线上升的分叉;4. 核对横轴是删除比例、纵轴是该等级准确率
论文图 2。原论文 Figure 1:“Validation from controlled deletion strategies indicate”。
从四子图像素可见的解释是:横轴都是删除比例 0 到 20,纵轴是该等级准确率(%),红线高影响删除在 4 个等级一致下坠,绿线低影响删除持平或上升,蓝线随机删除起伏很小。中度子图红线从约 36.8 在 10 处已接近零,20 处为 0.3;重度红线从约 72.3 阶梯式掉到 43.1;典型红线从约 93.7 掉到约 80 后走平;轻度红线基线只有约 5.5,删 10 已归零。
绿线则反向走高,中度到 47.0,重度到 81.1,轻度到 17.6。随机蓝线在各图基本横盘,证实效应来自选择而非减数据。
高影响删除 × 低影响删除: 高影响删除分工是去掉对某等级支持最强的训练样本看性能是否系统性下降,低影响删除分工是去掉影响最低或为负的样本看是否去噪提分。搭配原因是只看一侧无法区分重要性排序与单纯减数据,组合意义是在随机删除对照下双向验证影响分数是否对应因果相关的预测证据。
有序敏感度把矩阵按距离平均,横轴是从同级到相隔 3 级,纵轴是平均影响。要看的是是否越远越不支持。
看图路径: 1. 先看横轴有序距离从同级到相隔三级的四个柱;2. 再读每柱顶端标注的平均影响数值正负;3. 观察从高正到负的单调递减趋势;4. 核对纵轴是平均影响而非准确率
论文图 4。原论文 Figure 3:“Ordinal sensitivity analysis. Average influence S(d) decreases monotonically with ordinal distance d.”。
像素显示四柱从高到低为 13427、1028、负 642、负 2561,颜色从蓝黄橙到红,呈单调递减,同级是相邻的约 13 倍,距离二以上转负,支持模型把严重度编码为有序连续体而非名义类。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 中度删 20 | 准确率 | 原 36.8% | 高影响删后 0.3% | 低影响删后 47.0% 与随机微降 |
表后解释是:主要收益是双向验证成立,高影响删一致降、低影响删一致升,且最低基线的轻中度获益最大,说明低影响子集含噪声或错标样本;具体代价是轻度基线本身只有 5.5%,绝对值小、相对波动大,不能夸大 3 倍的临床意义。未胜出项是随机删除在典型上也有约 1 到 4 个百分点的抖动,说明小样本等级的单次重训方差不可忽略,论文未报告多次种子方差是明确局限。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 同级距离 0 | 平均影响 | 相邻 1028 | 同级 13427 | 约 13 倍于相邻 |
| 相邻距离 1 | 平均影响 | 远距负值 | 相邻 1028 | 弱正支持 |
该距离表的后解释是:同级支撑远高于相邻且远距转负,与单调递减像素一致,说明模型把严重度编码为有序连续体;相邻弱正支持而对立最强反对,边界在于绝对数值受梯度尺度影响,只能读相对排序与符号,不能当作临床严重度分值直接使用。
与特征归因相比实例解释好在哪,还暴露了什么数据问题?
这节的比较问题是:同样解释一个重度案例,SHAP 条形图与影响法给终端用户留下什么不同操作。左侧 SHAP 给出 88 个 OpenSMILE 描述符的重要性排序,像素可见蓝色正向条很长、红色负向条短,特征名密集难辨;右侧是可播放的测试句加 5 条最高与 5 条最低影响训练话语的播放条列表,形式上可直接试听。
看图路径: 1. 先看左侧条形图是声学描述符的重要性排序;2. 再看右侧是可播放的最高与最低影响训练话语列表;3. 对比左侧难读的特征名与右侧可直接试听的案例形式;4. 注意右侧面板是示意截图而非可播放控件
论文图 3。原论文 Figure 4:“Comparison of explanations generated by SHAP (left) and the proposed influence-based method (right) for a severe dysarthria case.”。
从像素可见的解释是:左侧即使能读出个别条目如等效声级或 MFCC 均值,也难以映射到辅音精准度或语速这类感知构念,更不支持回放验证;右侧把证据变成录音,医生能对比支持与对抗样本是否来自相邻等级,判断模型理由是否与听感一致。这是实例解释在临床沟通上的直接优势。
论文报告的另一个发现是审计价值:对多个重度测试取前五高影响训练话语时,很多用例共享几乎相同的 top 训练样本,人工检查发现其中若干是近乎静音的录音,尽管预处理已做静音去除,这些近静音段仍排在最前,且来自重度说话人。这支持模型学到了近静音与重度标签之间的虚假关联。原文用可能学到 spurious 关联的措辞,这是有限解释而非因果证明,但影响排序确实把问题样本直接浮出水面,说明框架不仅可解释而且可用于数据审计。局限是只展示了重度案例,未系统统计各等级受静音污染的比例,也未做去除静音后重训的对照,因此不能量化该伪相关对总体准确率的贡献。
要复现这套解释,先做什么,需要补哪些验证?
复现先做三件事。第一,按说话人分组复刻分层 K 折,保证同一说话人不跨训练测试,用 80 维 FBank 加单层线性 Softmax 跑出分等级基线,重点先看轻度是否同样低到个位数、中度是否在 30 多、重度是否在 70 多、典型是否在 90 以上,这是后续删除实验的起点。第二,在训练时每个 epoch 存检查点并保留原文的 30 个检查点用于影响累加,对每个测试话语算全训练集梯度内积排序,再按测试真实等级平均得到类向量与 4 乘 4 矩阵,注意组内除以样本数归一化。第三,用同结构同协议做 3 条删除线并重训,删除比例取 0 到 20,每档都要跑随机对照。
还需补的验证包括多次随机种子与交叉验证方差、去掉近静音段前后的对比、换更大声学模型或自监督特征后的影响稳定性,以及跨录音条件与更细标签粒度的泛化。关键超参数与信息条件是 40 个 epoch、AdamW、学习率 3e-4、批大小 32、FBank 80 维、TORGO 的 17587 条与说话人级标签。论文未绑定可验证的开源代码与可听演示页,本次亦无完成验证的资源,因此按不可用处理,不要假设能下载权重即跑。
何时值得尝试这种解释,边界与下一步是什么?
当你的任务标签有序、终端用户习惯听案例而非看热力图、且需要审计训练数据时,这种影响法值得尝试。它把每个判定变成可播放的支持与对抗证据,又用矩阵与有序距离检验模型是否学到连续体结构,用双向删除把相关性解释推向因果相关的证据。论文显示同级支持最强、相邻弱支持、远距反对,删除高影响样本系统性降分、删除低影响样本反而提分,这些是一致的证据链。
边界要讲清:结论绑定在 TORGO 单库与线性基分类器上,轻度基线极低限制了该等级结论的外推,静音伪相关只做了个案披露而未量化,训练与推理开销、延迟、误判率等部署量未测量。下一步是扩到更大更多样临床人群、检验录音条件与标签粒度变化下的稳健性,并补上去除问题样本后的重训对照。记住区分 3 类表述:论文直接报告的数字用报告,删除实验对忠实度的支撑用支持,对伪相关成因与临床收益的推断用可能待验证,这样才算可核对的复述。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



