英文题目:SiG-DML-L1.3: QUANTIFYING EXPLANATION DRIFT IN AUDIO USING POST-HOC EXPLAINABLE CONTINUAL LEARNING
会议身份:
conference:eusipco:2026:conference-paper-id:0001661
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#持续学习 #可解释性 #环境声 #音频分类
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Imbwaga, Joan:机构信息未能从会议 PDF 纯文本可靠映射
- Mulimani, Manjunath:机构信息未能从会议 PDF 纯文本可靠映射
- Räsänen, Okko:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
环境声分类需在类增量学习下逐任务引入不交新类并保持旧类可判,其难点在于灾难性遗忘会同时改变决策依据,而准确率无法反映推理稳定性。该工作先将原始音频转为对数梅尔谱并经冻结的PANNs CNN14得到512维表征,再用线性分类器逐任务学习并以交叉熵及不同持续学习约束更新参数,接着对同一旧任务样本用积分梯度(Integrated Gradients,IG)生成时频归因图并展平为解释向量,最后跨阶段以分布与向量距离量化解释漂移并与准确率和遗忘对照。与仅正则化权重的方法不同,该链条把回放样本与蒸馏一致性同时用于约束旧类预测,从而在保留旧表征使用的同时抑制新旧类竞争导致的特征漂移。在ESC-50按5个任务增量学习时,结合回放、正则和蒸馏的Hybrid2取得平均准确率0.44与平均遗忘0.3896,显著优于基线的0.1690与0.8439。该结论仅在50类环境声、小任务划分与冻结卷积主干下验证,未检验开放域噪声、说话人或音乐迁移及内在可解释模型的适用性。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
本文解读的对象是一项环境声音的类增量学习研究。输入是原始音频转成的 2 维对数梅尔谱,目标是在只能看到当前任务新类别样本的条件下,依次学会 50 个环境声类别,并在学完新任务后仍能分类已学过的旧类别。作者额外提出的问题是:即使旧任务准确率没有大跌,模型做决定的依据是否已经悄悄改变。输出因此有两类,一类是分类性能,另一类是对决策依据稳定性的度量。
解读的交付目标是让刚入门的研究生能复述完整链路:数据如何划分成任务,模型哪部分冻结哪部分更新,解释向量如何从梯度积分得到,漂移如何用距离算出,以及在什么训练条件下比较才是公平的。需要保留的关键信息包括数据集划分比例、特征与分类器结构、各类持续学习方法的具体参数、解释近似的插值步数,以及平均准确率、平均遗忘与 3 种漂移指标的方向。凡是教学用的比喻都会明确标为例子,不作为论文的结论。
初学者常以为持续学习只管准确率不掉就行。论文的起点恰好相反:性能稳定不等于推理稳定。当前任务学完后,旧类别样本不再出现,分类器权重会被新类别梯度推动,旧类别的归因重点可能随之移动。这种移动就是后文要量化的解释漂移。理解这一点后,再看性能指标才有完整意义。
灾难性遗忘 × 类增量学习: 灾难性遗忘指学新任务时旧任务准确率大幅下降,分工是描述性能损失;类增量学习指每次引入互不相交的新类别且不再提供旧样本,分工是规定任务结构与评测方式;二者搭配是因为类增量结构必然制造遗忘压力,组合后才能把平均准确率与平均遗忘作为同一过程的两面来读。
此前研究把可解释与持续学习放在哪里交汇?
在可解释人工智能一侧,常用思路是在训练结束后用事后方法给出特征重要性,不改动原模型结构。集成梯度属于这类方法,它沿从基线输入到真实输入的直线路径累积梯度,得到每个输入特征的贡献分数。它的优点是与卷积网络兼容,能给出细粒度的时频归因。在持续学习一侧,常见路线有 3 条:用重要性惩罚限制重要权重变化的正则化方法,用缓冲保存旧样本再混合训练的回放方法,以及用蒸馏让新旧输出保持一致的方法。论文把这两侧拼接起来:训练流水线负责类增量分类,解释流水线负责在每个阶段后对旧任务样本重新计算归因。
与图像域已有工作相比,本文的不同在于任务级动态。已有工作指出性能稳定不等于解释稳定,并用同一固定输入在不同训练阶段比较解释,关注样本级和结构级因素。本文则强调音频真实基准上的任务级演化:每个任务带来全新类别,类别总数从 10 逐步扩大到 50,竞争格局和特征依赖都会变化。作者明确把解释漂移的影响因素归纳为遗忘、扩大的类别竞争和特征漂移三者共同作用,而不是只看单一因素。这种定位决定了后文实验必须同时报告性能与漂移,并按任务拆解漂移曲线。
类增量任务到底难在哪里?
把 50 个环境声类别平均分成 5 个任务,每个任务含 10 个互不相交且随机选取的类别,是本文的问题定义。学习按阶段推进,记为初始阶段到最终阶段。每个阶段只能看到当前任务的标注音频,学完后要在已见过的所有类别上接受测试。模型由特征提取器和最后线性层组成,原始音频先经固定预处理转成对数梅尔谱,再映射为 512 维隐表示,最后由线性层产生对应已见类别数的输出。输出可分成旧任务部分和新任务部分,训练用交叉熵损失只在当前任务数据上计算。朴素基线不做任何抗遗忘处理,直接最小化当前交叉熵,这必然导致旧知识被覆盖。
举一个教学例子:假设任务 1 学会狗叫与咳嗽,任务 2 新来电锯与雨声,例子结束。此时分类器要在输出维度增加的情况下重新划分决策边界,但任务 1 的原始波形已不可见,只能靠旧权重记忆旧边界。新类别梯度会挤占共享的线性层容量,旧类别的正确依据可能从特定频带滑向其他位置。论文要回答的正是这种滑动有多大,是否可被不同持续学习策略抑制。注意例子中的类别名仅为帮助理解,实验实际使用随机划分的 10 类一组结构。
两阶段流水线如何把训练与解释接起来?
论文方法可看成两个阶段串联。第一阶段是类增量训练流水线:输入当前任务的对数梅尔谱,经冻结的卷积主干得到特征图,再经自适应平均池化得到 512 维向量,最后经线性层得到分类输出并计算损失。不同持续学习方法只改变损失或数据构成,不改变这一主路径。第二阶段是事后解释流水线:固定训练好的模型,对来自特定旧任务的若干样本重新计算集成梯度,把 2 维解释图展平成 1 维解释向量,再把多个样本的向量合并成该任务的解释分布。新旧任务之间的漂移就是两个分布之间的距离。
沿一个样本走完全程有助于建立直觉。取任务 1 中的一段 5 秒音频,先重采样到 32 千赫,用 2048 点窗长和 512 点跳长提取 64 个梅尔 bins 的对数谱,并按零均值单位方差归一化。该谱输入卷积主干得到 512 通道特征图,池化为 512 维表示,线性层输出当前已见类别的打分。解释时,以全零谱为基线,在基线与真实谱之间做 10 步线性插值,逐点求线性层输出对输入的梯度并平均,再乘以输入与基线的差,得到每个时频格的归因。把该图展平即得该样本的解释向量。
多个样本的向量构成任务分布,跨阶段比较即得漂移。这种设计把训练与解释解耦,解释不干扰训练梯度。
集成梯度对时频谱做了什么计算?
集成梯度的输入是单张对数梅尔谱,记为高乘宽矩阵。符号上用特征提取器表示卷积主干,用线性层表示最后分类层,用隐表示表示 512 维向量。计算目标是回答每个时频格对最终打分的贡献。对每个特征位置,方法从全零基线出发沿直线走到真实输入,把路径上各插值点的梯度累加平均,再乘以该位置的输入增量。论文用 10 步离散插值近似积分,插值点由基线加步数比例乘以输入差得到。
实现上借助 Captum 库完成,步数固定为 10。需要强调的是,归因是针对线性层输出计算的,特征提取器主干在实验中冻结,因此漂移主要反映线性层对冻结表示利用方式的变化,而不是底层声学滤波器本身的大改。
得到 2 维解释图后,方法把它展平成长度为高乘宽的 1 维向量。展平保留每个特征的独立分数,便于跨任务定量比较。随后把同一任务多个样本的向量汇总成解释分布。漂移定义为 2 个任务分布之间的距离,记为新旧分布的函数。论文探索多种距离以捕捉互补侧面:Wasserstein 距离关注分布整体搬运代价,余弦距离关注向量夹角即模式方向,欧氏距离关注整体幅度偏离。初学者应记住:归因向量是单样本解释,分布是任务级汇总,距离是跨阶段比较,3 层概念不要混用。
集成梯度 × 解释漂移: 集成梯度负责把对数梅尔谱每个时频格的贡献算成归因分数,分工是给出可比较的解释向量;解释漂移负责度量新旧任务下同一类解释分布的变化距离,分工是判断推理依据是否稳定;搭配理由是只有把归因变成向量与分布,才能用量化距离把漂移与遗忘分开讨论。
五种持续学习策略各自约束了什么?
基线是不加任何约束的直接微调,只最小化当前任务交叉熵。弹性权重巩固通过 Fisher 信息估计旧任务重要权重,在总损失中加一项 2 次惩罚,惩罚系数设为 20,用 10 个批次估计 Fisher 信息。它的约束对象是参数变化幅度,重要参数不许大动。无遗忘学习用蒸馏损失让新旧预测保持接近,权重系数设为 0.5,约束对象是输出一致性。经验回放维护 500 个样本的缓冲,每个训练批次混入 4 个旧样本,约束对象是数据分布,让优化同时看到新旧样本。
暗经验回放进一步在回放样本上同时保持旧预测与真实标签一致,兼具数据与蒸馏约束。混合策略把上述方法组合,论文中的混合 1 是回放加弹性权重巩固,混合 2 是回放加弹性权重巩固加无遗忘学习。
这些策略的稳定性与可塑性权衡不同。正则化类方法可塑性受限但没有旧数据,适合存储受限场景,但论文显示其抗遗忘能力有限。回放类方法直接恢复旧数据分布,效果更稳,但需要额外存储与训练时间。混合方法试图兼得:回放稳定表示,蒸馏稳定决策,惩罚限制关键权重漂移。理解这种分工后,才能明白为何后文混合 2 与暗经验回放同时在性能与漂移上占优,而弹性权重巩固单独使用时漂移反而偏高。
训练时哪些参数更新,哪些冻结,优化如何组织?
训练细节按原文交代如下。分类器采用预训练音频神经网络中的卷积 14 结构,冻结其卷积主干,只训练最后线性层。主干由卷积层、非线性激活、交替的最大池化与批归一化组成,输出 512 通道特征图,经全局平均池化得到 512 维向量。线性层设 50 个输出单元,对应环境声数据集的 50 类,打分用于分类。每阶段训练固定用交叉熵损失、Adam 优化器、批次 32、学习率 0.0001、5 个轮次,所有持续学习方法共享这组优化配置,各自额外参数如上节所述。持续学习实现基于 Avalanche 库,解释实现基于 Captum 库。
需要明确说明冻结与更新边界:声学特征提取部分冻结,不随任务更新;线性分类层随任务更新,且输出维度随已见类别数增长。梯度路径因此只经过线性层与冻结表示的接口,监督来源是当前任务标签,回放时额外加入缓冲样本的标签与旧输出。每个任务训练 5 轮后即进入评测与解释阶段,不会在任务间重置线性层权重,而是连续更新。这种设置意味着观察到的特征漂移不是底层滤波器漂移,而是线性层对同一冻结表示的不同加权方式发生了变化。原文未报告多次随机种子的方差与显著性检验,这是复现时需要补记的缺项,不应自行假设结果的统计显著性。
经验回放 × 无遗忘学习: 经验回放分工是把旧任务样本存入缓冲并与新任务数据一起训练,直接保留旧数据约束;无遗忘学习分工是用蒸馏损失让新旧预测保持接近,保留旧输出约束;搭配成混合方法是因为数据约束稳定表示、输出约束稳定决策,二者叠加后论文报告同时降低遗忘与解释漂移。
数据、划分与指标如何保证比较公平?
实验使用环境声分类基准 ESC-50,共 50 个真实环境声类别,每类 40 段 5 秒音频,总计 2000 段。数据集按 5 个预定义折组织,每折每类 8 段。论文采用 3 折训练、1 折测试、1 折验证的比例,即每类 24 段训练、8 段测试、8 段验证。类增量设置为 5 个任务,每任务 10 个随机选取的不相交类别,学完新任务后在已学所有类别上评测。所有方法共享同一任务划分、同一冻结主干、同一优化轮次与批次设置,只有抗遗忘机制不同,因此方法间比较具备相同的计算预算与数据可见性。
评测分性能与解释两套指标。平均准确率是学到当前任务为止各任务准确率的均值,方向是越高越好。平均遗忘是每个旧任务的历史最高准确率与当前准确率之差的最大值再平均,方向是越低越好。解释漂移用 3 种距离度量集成梯度归因的变化:Wasserstein 距离度量分布搬运代价,余弦距离度量向量夹角差异,欧氏距离度量整体幅度偏离,三者都是越低表示解释越稳定。原文还用归一化后的 Wasserstein 值来消除不同方法间的尺度影响,以便在同一散点中比较遗忘与漂移的关系。硬件与 wall-clock 成本原文未报告,这是成本分析的缺项。
谁在准确率与遗忘上胜出,代价是什么?
比较的问题是:在相同任务划分与训练预算下,哪种抗遗忘机制能同时提高平均准确率并降低平均遗忘。公平条件是共享冻结主干、5 轮训练与相同评测协议。指标方向是平均准确率越高越好,平均遗忘越低越好。下表整理论文正文连续句子中直接报告的性能数字,混合方法与回放方法为实际可运行策略,基线为对照。
| 方法 | 任务设置 | 平均准确率 AA | 平均遗忘 AF | 是否可运行 |
|---|---|---|---|---|
| 基线直接微调 | 5 任务每任务 10 类 | 0.1690 | 0.8439 | 是 |
| 经验回放 | 5 任务每任务 10 类 | 0.2950 | 0.5002 | 是 |
| 混合 2 回放加正则加蒸馏 | 5 任务每任务 10 类 | 0.4400 | 0.3896 | 是 |
表后解释需要同时看到收益与代价。基线准确率仅 0.1690 而遗忘高达 0.8439,报告显示学新任务时旧知识几乎被覆盖。经验回放把准确率提升到 0.2950 并把遗忘压到 0.5002,支持回放在缓解灾难性遗忘上的基础作用,但仍与混合方法有差距。混合 2 达到最高 0.4400 与最低 0.3896,暗经验回放紧随其后,支持 rehearsal 机制加混合策略在序列任务中的价值。代价是回放需要 500 样本缓冲与额外混合训练,混合 2 还叠加正则与蒸馏超参数,调参与存储成本高于纯正则方法。未胜出项是弹性权重巩固与无遗忘学习,论文报告它们仅比基线略好,说明只惩罚权重变化不足以应对类别持续扩张。
Wasserstein 距离 × 余弦距离: Wasserstein 距离分工是度量把一个解释分布搬运成另一个分布所需的最小代价,关注整体分布形状变化;余弦距离分工是度量展平后解释向量的夹角差异,关注归因模式方向是否转动;搭配使用才能区分原文强调的现象:所有方法余弦距离都高,说明漂移更多体现在幅度而非单纯方向变化。
解释漂移如何随方法变化,低漂移一定是好事吗?
比较的问题是:不同方法在解释稳定性上如何排序,以及低漂移数值是否总代表好的保持。公平条件是同一解释步数十步、同一基线零谱与同一任务样本来源。指标方向是 3 种漂移距离越低越稳定。下表整理正文直接给出的漂移数字,重点看分布距离与幅度距离。
| 方法 | 解释对象 | eWass 分布距离 | eCos 夹角距离 | l2 幅度距离 |
|---|---|---|---|---|
| 基线直接微调 | 任务级归因分布 | 0.0005 | 0.9784 | 0.4059 |
| 混合 1 回放加正则 | 任务级归因分布 | 0.0011 | 1.0039 | 0.6326 |
| 暗经验回放 | 任务级归因分布 | 0.0005 | 1.0028 | 0.3955 |
表后解释必须加入反证。基线在分布距离与幅度距离上都很低,但论文明确指出这是误导性的:其归因接近退化的近零值,不代表保留了有意义的解释。换句话说,模型已经忘掉旧任务,归因整体塌缩,分布之间自然显得接近。弹性权重巩固准确率略高于基线但漂移更高,支持归因开始随新任务自适应调整而部分遗忘旧依据。混合 1 的漂移高于混合 2,论文把前者的升高归因于弹性权重巩固,把后者的降低归因于回放加蒸馏共同稳定了旧预测。
暗经验回放在回放样本上加 logit 蒸馏,取得 0.0005 与 0.3955 的低漂移,支持回放加蒸馏能同时压住表示漂移与类别竞争。所有方法余弦距离都接近 1 左右,论文据此判断漂移更多体现在幅度而非单纯方向,这是一个需要记住的细节。
遗忘、任务推进与类别竞争如何推高漂移?
论文做了 3 组任务级剖析。第一组按方法看漂移均值,以 Wasserstein 为代表,无遗忘学习漂移最高,其次是混合 1 与弹性权重巩固,回放与混合方法更低,混合 2 最低且同时遗忘最低、准确率最高。第二组按任务看漂移演化:随着类别总数增加,各方法漂移都上升,后期任务如任务 4 与任务 5 扰动更大,说明新任务引入会系统性改变特征重要性,即使采用抗遗忘方法也难以完全消除。回放、混合 2 与暗经验回放在各任务上保持相对最低,支持缓冲机制能有效保留解释。第 3 组看遗忘与漂移散点:弹性权重巩固与无遗忘学习遗忘高且漂移高,回放降低二者,暗经验回放与混合 2 同时实现低遗忘与低漂移。
作者用扩大的类别竞争描述新旧类别争夺同一分类器容量的现象,用特征漂移描述分类器依赖的输入部位发生转移。每新增 10 类,线性层要为新类腾出决策空间,旧类边界被挤压,归因重点随之搬家。后期任务类别更多,竞争更激烈,因此遗忘与漂移同步放大。论文还用混合 2 在任务 1 与任务 5 的解释图对比做可视化:早期任务的关注位置在后期发生移动,说明持续学习影响的不只是准确率,更是推理过程本身。需要以可能待验证的语气补充:相关性不等于因果,论文显示遗忘与漂移同向变化,但未做干预性实验分离二者因果方向。
特征漂移 × 类别竞争: 特征漂移分工是描述分类器依赖的输入部位随任务推进发生转移;类别竞争分工是描述新旧类别共享同一分类器容量而互相挤压;搭配理由是类增量每加 10 个新类既扩大竞争又迫使特征重新分配,组合后解释了为何后期任务遗忘与解释漂移同步放大。
哪些边界没有被测到,不能承诺什么?
首先是解释方法的单一性。全文只用集成梯度一种事后方法,10 步近似,未比较其他归因方法或内在可解释结构,因此不能承诺结论对所有解释方法成立。作者在结尾也提出未来应比较内在方法与事后方法,检验解释阶段是否影响漂移。其次是数据与域偏移的单一性。只在 ESC-50 一个环境声基准上验证,未测试语音、音乐或其他域偏移,跨域泛化待验证。
第三是统计与成本缺项。原文未报告多种子均值方差、显著性检验、训练时长与推理开销,也未测量误判率与延迟,因此不能承诺混合方法在延迟或部署成本上同样占优。
另外要纠正一个易误解点:低解释漂移不自动等于好模型。基线的低漂移来自归因塌缩而非保持,必须结合准确率与遗忘一起读。同样,高漂移也不自动等于坏事,混合 1 的高漂移部分来自有意义的自适应调整。总体趋势不等于每组每步都成立,后期任务漂移更大是平均趋势,具体到某一样本可能不同。资源状态方面,本次未发现来源绑定且完成验证的代码与数据链接,不得声称代码模型或数据已公开,复现需按论文文字重建流程。
要复现这套结果,先固定哪些步骤?
复现应先锁定数据与任务划分。按每类 24 训练 8 测试 8 验证准备 ESC-50,将 50 类随机分成 5 组每组 10 类,固定随机种子并保存分组文件,确保所有方法用同一分组。预处理固定为 32 千赫采样,窗长 2048,跳长 512,64 个梅尔 bins,转对数谱后按零均值单位方差归一化。模型用预训练音频网络的卷积 14 主干并冻结,只初始化并训练最后 50 单元线性层。训练固定交叉熵、Adam、批次 32、学习率 0.0001、每任务 5 轮。持续学习超参数按原文设置:弹性权重巩固系数 20 并用 10 批次估计 Fisher 信息,回放缓冲 500 且每批混 4 旧样本,无遗忘学习系数 0.5,混合方法按组合实现。
解释与评测阶段,每学完 1 个任务就在已见类别上测准确率并记录历史最高以算遗忘。对每个旧任务取固定数量样本,用全零基线与 10 步插值计算集成梯度,展平后汇总成任务分布,再算 3 种距离。建议先复现基线、回放与混合 23 条曲线,验证基线低准确率高遗忘、回放居中、混合 2 最优的排序是否出现,再检查基线低漂移但归因幅度塌缩的现象是否存在。若要补验证,至少增加多种子重复、不同任务分组、以及第二种归因方法的对照,并记录训练时间与缓冲内存占用。
何时值得尝试回放加蒸馏,何时不必?
当系统需要长期在线学新声音类别且要求决策可审计时,值得尝试回放加蒸馏的混合方案。论文报告显示该组合同时改善性能与解释稳定性,混合 2 在 5 任务设置下达到可运行策略中的最优,暗经验回放接近。适用条件是允许保存数百条旧样本并承担额外混合训练成本,且特征主干可冻结。若存储严格受限只能用正则化方法,则要接受遗忘与漂移都偏高的现实,此时应加强对解释的监控而不是只看准确率。
当任务类别不再扩张或只需一次性离线训练时,不必引入持续学习与漂移监控,按常规训练与单次解释即可。最终判断应分层表达:论文直接报告的是排序与数值,论文支持的是回放稳定解释、遗忘与漂移同向变化,待验证的是因果方向与跨方法跨数据集的普适性。对于刚入门的研究者,记住一条操作准则:每次汇报持续学习结果时,同时给出旧任务的准确率、遗忘与解释距离,并检查低漂移是否伴随归因塌缩,这样才能避免把数值稳定误读为推理稳定。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
区域 3 · 查看论文原页
区域 4 · 查看论文原页
区域 5 · 查看论文原页
区域 6 · 查看论文原页
区域 7 · 查看论文原页
另有 12 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses






