英文题目:Investigating catastrophic forgetting in sound event classification
标签:#音频分类 | #持续学习 | #知识蒸馏 | #环境声
评分:6.6/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
👥 作者与机构
- Riccardo Casciotti:机构信息未在 arXiv HTML 中可靠披露
- Annamaria Mesaros:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文研究多标签声音事件分类中的类别增量学习,输入为统一至10秒的对数梅尔频谱,输出为全部已见类别的多标签存在概率,难点在于新旧类别声学模式重叠且无法访问旧数据时新训练极易干扰旧决策边界。方法链分四步:首先以动态分类头随任务扩张输出单元以容纳新类并保留旧类输出;其次以前一模型为教师用知识蒸馏软输出约束新模型以保留旧映射;再次基于免数据剪枝重要性评分排序卷积核并冻结重要核以引导更新至次要核;最后在首任务后完全冻结特征提取器与批归一化层而仅微调分类头。上一步的头扩张与旧模型保存为下一步蒸馏与核保护提供结构与参照,使表示保护与输出扩展衔接。与核级可塑性调制相比,冻结微调不再精细分配表示层可塑性,而是承认同域声学表示可复用并把抗干扰集中到输出层,具有实现简单与训练稳定的实际意义。在AudioSet非排序任务下,finetune的BWT指标为-0.5,高于kld的-3.5。结论适用边界限于同域且首任务含30类的音频分类增量,对跨域漂移、少样本新类与单遍在线学习尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/RiccardoCasciotti/Class-Incremental-SEC.git → https://github.com/RiccardoCasciotti/Class-Incremental-SEC — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么顺序学习会忘?
本文的输入是声音事件分类任务中的音频片段,目标是对一段音频同时判断存在哪些声音事件,属于多类别加多标签问题。举例来说,一段 10 秒录音里可能同时出现狗叫与汽车声,模型需要对每个类别独立输出存在概率,而不是只选一个最可能的类。学习依赖是先理解这种多标签输出,再理解增量条件。所谓灾难性遗忘,白话是学新东西把旧东西覆盖掉,英文是 catastrophic forgetting。原文在引言中把它定义为每当网络被用来学习新信息时遗忘过去存储知识的现象。
增量学习或持续学习,白话是分阶段学新类还不丢旧类,英文是 incremental learning、continual learning、lifelong learning。核心矛盾是稳定性与可塑性的权衡,英文是 stability-plasticity trade-off。稳定性指保留已学类的能力,可塑性指学会新类的能力。本文只研究同域声音分类中的类增量学习,英文是 class-incremental learning。每个任务带来一组互不相交的新类,学完当前任务后要在所有已见类上被评价。
输出是当前代码可用状态下可复现的实验比较,当前代码链接在本次核对中可用,论文给出仓库地址用于实验复现。读者需要保留的关键信息是任务划分、动态头、冻结范围与评价指标方向,后文按此展开。
同输入同目标下有哪些路线,它们各改了什么?
相关工作可以按改动位置分成 3 类,对照维度是同输入的声学特征、同目标的多标签分类、同监督的当前任务标签与同运行阶段的增量训练。第一类是正则化方法,白话是在损失函数上加约束让模型不要偏离旧解,英文是 regularization。例子包括知识蒸馏,白话是用旧模型输出做软目标,英文是 knowledge distillation,以及参数重要性惩罚,白话是对重要权重的大改动额外扣分。它们只改优化目标,不直接指定哪个卷积核不许动。
第二类是直接作用于优化动态的方法,白话是改每个参数实际收到的更新量,英文可称作 gradient or plasticity modulation。直觉是保护对旧任务重要的核,把学习压力引向不重要的核。第 3 类是架构方法,白话是改网络结构以容纳增长的输出空间,英文是 architectural methods。本文所有方法都使用分类器扩张机制,因为输出空间随任务增长。作者的定位是比较冻结、正则化、架构扩张与核级可塑性调制在类增量多标签声音分类中的效果,并在两个大规模音频数据集与不同任务配置和类顺序下评价。
教学例子是若把旧数据全部留下做联合训练,那不是增量条件,本文明确在学新任务时不能访问旧任务数据。
要解决的具体问题与评价口径是什么?
具体问题是给定 5 个任务序列,第 1 个任务含 30 类,后续 4 个任务各含 5 类,共 50 类,任务间类别互不相交,模型在学任务 2 到任务 5 时看不到旧任务数据,学完每个任务后要在累计已见类上计算平均精度均值。平均精度均值白话是对每个类按排序质量算平均精度再平均,英文是 mean average precision,缩写 mAP,适合多标签。持续学习指标有 3 个。遗忘度量白话是旧任务从历史最高分掉到当前分的平均值,英文是 Forgetting Measure,缩写 FM,越小越好。
后向迁移白话是学新任务对旧任务的平均影响,可正可负,英文是 Backward Transfer,缩写 BWT,越大越好,接近零表示干扰小。 intransigence 度量白话是增量模型在当前任务上与联合训练参考模型的差距,英文是 Intransigence Measure,缩写 IM,越小表示学新任务的能力越接近联合训练。原文强调最终目标不是只把当前任务分数做高,而是保持可塑性与稳定性的平衡。声音数据的难点是复杂、有噪声且常多事件共存,模型必须为重叠声学模式学出判别表示并在多步增量中保留。
方法全景:一个样本走完输入到输出需要哪些动作?
沿一个样本走一遍有助于建立依赖顺序。输入是一段被统一成 10 秒的音频,较短补零,较长裁成所需长度,随后计算对数梅尔谱图,英文是 log mel spectrogram,作为模型输入特征。表示阶段由 PANNs 风格卷积网络完成,主体是 6 个卷积块,每块含两个卷积层加一个批归一化层,英文是 batch normalization。组件阶段是全连接层担任的动态分类头,英文是 dynamic classifier head。输出阶段对每个类别独立做 S 形激活,英文是 sigmoid,得到多标签概率。
训练目标在增量阶段只用当前任务类别计算二元交叉熵损失,英文是 binary cross-entropy loss。构造动作是每学完 1 个任务就把最后一层输出单元增加 5 个,以容纳新类,同时保留旧类输出。推理时模型对所有已学输出单元打分。需要先记住这个主路径,后续冻结、蒸馏与核保护都是在这个路径上选择哪里允许更新、哪里用旧模型约束。 下面导读图 1 有助于把数据、训练、共享主干与动态头的时序关系 1 次看清,图中从左到右是任务 1 到任务 5,左侧图例区分数据、训练、模型与分类头 4 个层次。
看图路径: 1. 先从左到右看任务 1 到任务 5 的数据块确认每步只含新类;2. 再看绿色训练块中无旧数据访问的标注;3. 接着看蓝色共享主干与橙色分类头中圆点数量如何逐任务增加;4. 最后核对底部输出任务 1 到任务 5 的类区间是否与顶部一致
论文图 1。原论文 Fig. 1::“Incremental Learning setup with dynamic head expansion.”。
图 1 显示任务 1 含 1 到 30 类,后续每个任务各增加 5 类直至 46 到 50 类。每列绿色训练块都标注只用当前类且不能访问旧数据。蓝色共享主干在任务间向右传递,橙色动态分类头中圆点逐列增加,底部明确每任务输出区间。这种画法把类增量条件讲得很具体:数据互不相交,训练分阶段隔离,模型主干共享,输出维度单调增长。复述时应强调没有旧数据回放,任何保留旧知识的机制只能靠参数、损失或结构来实现。
动态头、蒸馏与核保护各自管什么?
动态头管输出空间的组织。它的分工是为每个类分配一个输出单元,学新任务时新增单元并保留旧单元,避免用固定输出去覆盖旧决策边界。特征提取器管声学表示的复用。它的分工是在首任务学出通用表示,后续任务尽量不破坏它。知识蒸馏管功能层面的保留。
做法是学新类前保存旧模型做教师,学新类时除学新标签外还要求复现教师在旧类上的输出,把教师输出当软目标。原文明确本工作只考虑知识蒸馏损失以保护过去表示,并引用了同时含余弦相似度损失的来源工作但未采用该第二项。核级保护管参数层面的保留。一条路线用被动滤波器剪枝启发的准则给每层每个核打分,训练后把排序向量存到模型外部,下个任务按降序保护最重要的核,实验保护比例为 12.5%、25%、50%、75% 与 100%。
另一条路线称为学习调制,白话是按更新幅度与累计激活选重要核,英文是 learning-modulation。做法是在任务训练中定期存权重并计算平均更新幅度,同时度量累计激活并排序,若重要核收到大于历史平均的更新则降低其可塑性,同时让次要核承担更多适应。最激进的对照是微调,白话是首任务后冻住全部卷积层含批归一化层、只更新分类头,英文是 fine-tuning。
类增量学习 × 灾难性遗忘: 类增量学习负责按任务顺序引入互不相交的新类集合并在测评时要求保留所有已见类,灾难性遗忘负责描述学新类时旧类性能下降的现象,二者搭配的原因是前者给出稳定性与可塑性必须同时成立的评价条件,后者是该条件下需要被度量的失效模式,组合意义是把增量协议变成可复述的遗忘实验。
动态分类头 × 特征提取器: 特征提取器负责把对数梅尔谱图变成可供多标签判别的共享声学表示,动态分类头负责为每个新任务增加 5 个输出单元以容纳新类,二者搭配的原因是输出空间随任务增长而表示空间可以复用,组合意义是把新类学习主要变成输出层组织问题而不是重写全部卷积核。
知识蒸馏 × 微调: 知识蒸馏负责用旧模型对旧类的软输出约束新模型不要偏离已学映射,微调在这里负责冻住全部卷积与批归一化层之后只更新分类头,二者搭配的原因是前者通过损失间接保留功能,后者通过禁止特征层更新直接保留表示,组合意义是对比间接正则与直接冻结哪一种在同域声音任务中更稳定。
核重要性排序 × 可塑性调制: 核重要性排序负责按剪枝启发的贡献度量给每层卷积核打分并选出最重要的 12.5% 到 100% 加以保护,可塑性调制负责在学新任务时减小重要核的更新幅度并把适应压力引向不重要核,二者搭配的原因是都想在不存旧数据的前提下区分该保与可改的参数,组合意义是检验细粒度保护是否优于整体冻结。
后向迁移 × 遗忘度量: 后向迁移负责度量学完新任务后旧任务相对其刚学完时平均变化的方向与大小,遗忘度量负责度量旧任务历史最高分与当前分的平均落差,二者搭配的原因是前者保留符号信息而后者只取正向遗忘,组合意义是同时回答是否干扰旧任务以及干扰中有多少是不可恢复的遗忘。
下面 3 个公式是评价口径的计算目标,符号先行解释有助于复述时不混淆。
\[\text{FM}_{k}=\frac{1}{k-1}\sum_{j=1}^{k-1}f_{j,k}\\\]\[\text{BWT}_{k}=\frac{1}{k-1}\sum_{j=1}^{k-1}mAP_{k,j}-mAP_{j,j}\\\]\[\text{IM}_{k}=mAP^{*}_{k}-mAP_{k,k}\]公式 1 的遗忘度量对每个旧任务取历史最高 mAP 减当前 mAP 再平均,公式 2 的后向迁移对每个旧任务取当前 mAP 减其刚学完时 mAP 再平均,公式 3 的僵化度量取联合训练参考在当前任务的 mAP 减增量模型刚学完当前任务的 mAP。其中 mAP 下标的含义是先学到哪个任务后在哪个任务上测得,参考模型下标星号表示联合训练。原文未给出这些指标之外的梯度路径细节,复述时不应脑补蒸馏温度或权重系数,因为原文没有报告这些超参数。
训练如何组织,哪些参数更新,哪些被冻结?
训练组织按任务顺序推进。先随机初始化模型在 30 类首任务上训练,然后把最后一层输出增加 5 个,再在 5 类新任务上训练且不接触旧数据,依此类推直至 5 个任务学完。优化器使用随机梯度下降,英文是 Stochastic Gradient Descent,缩写 SGD,初始学习率为 0.001,配合余弦退火调度回调降低学习率,英文是 cosine annealing schedule,早停耐心为 20 轮,英文是 early stopping。损失只在当前任务类别上计算二元交叉熵。验证在每个任务训练后立即运行,但验证集只含当前任务数据,这一点对理解指标很重要:训练中的验证分数不能直接当作累计 mAP。
参数更新规则按方法不同。微调在首任务后冻结全部卷积层与批归一化层,后续只更新分类头。知识蒸馏不冻结参数,而是用旧模型输出做额外损失约束。排序保护按比例冻结每层最重要的核,其余核允许更新。学习调制不做硬冻结,而是按历史更新与激活统计调制 incoming 更新幅度。
原文没有报告批大小、总轮数上限、数据增强、蒸馏损失权重、排序准则的逐层公式与调制系数的具体数值,复现时应把这些记为缺项,不要从模型名称推定实现。训练硬件方面原文致谢芬兰 CSC 提供的 LUMI 超算资源,但未给出可换算的 GPU 小时或批次预算。
数据、划分、特征与顺序条件是否一致?
实验用 2 个数据集。AudioSet 是大规模人类标注音频事件集,约 2,100,000 条 10 秒片段,527 类层级本体。FSD50K 是来自 Freesound 的开放集,51197 条片段,200 类源自 AudioSet 本体。2 个数据集都高度不平衡,有的类数千样本,有的仅数百或更少。为保证每任务有足够训练数据,作者在每个数据集中选样本量最大的 50 类,再划分成互不相交的任务集。
特征统一为对数梅尔谱图,采样率 32000 赫兹,傅里叶变换点数 1024,跳长 320,梅尔带数 64。模型结构在 2 数据集间保持一致,均为上述 6 块卷积加动态头。任务配置在 2 数据集间一致,均为 30 加 4 乘 5。顺序条件设两种,一种按类别样本量有序,英文是 ordered,首任务含样本最多的 30 类,另一种随机无序,英文是 not ordered,大样本类也可能出现在后期。随机划分重复 5 次,结果取平均。
比较公平性在于所有方法共享同一扩张头机制与同一任务序列,差异只在是否冻结、是否加蒸馏损失以及核级保护比例。 下表把可复现的数据与训练配置集中到一处,数据配置表不能代替结果表,后续结果另表给出。
| 条件 | 指标或参数 | 数据集 A 取值 | 数据集 B 取值 | 说明 |
|---|---|---|---|---|
| 类总数 | 选用最大类数 | 50 类 | 50 类 | 按样本量选最大者 |
| 任务划分 | 首任务与增量任务 | 30 类加 4 乘 5 类 | 30 类加 4 乘 5 类 | 互不相交 |
| 音频长度 | 统一时长 | 10 秒 | 10 秒 | 短补零长裁切 |
| 特征 | 采样率 | 32000 赫兹 | 32000 赫兹 | 对数梅尔谱图 |
| 特征 | 变换与带数 | 1024 点,320 跳长,64 带 | 1024 点,320 跳长,64 带 | 两集一致 |
| 优化 | 初始学习率与早停 | 0.001,20 轮 | 0.001,20 轮 | 余弦退火 |
| 结构 | 卷积块与输出激活 | 6 块,sigmoid | 6 块,sigmoid | 动态头扩张 |
表后需要说明该表的用途与边界。该表只解决能否按同样输入与任务重跑,不回答哪种防遗忘更好。
它的代价是未包含缺失的批大小与蒸馏权重等细节,复现时需先按原文仓库默认配置跑通,再补做超参数敏感性检查。未评测的边界包括跨域分布变化与回放类方法,原文明确未来工作才考虑不同类分布。
主结果:谁更稳,谁学新类更接近联合训练?
主结果用学完每个任务后的累计 mAP 走势与持续学习指标平均值来回答。累计 mAP 指在已学全部类上的 mAP,任务 0 为 30 类,任务 1 为 35 类,依此类推。原文报告的趋势是微调与知识蒸馏最有竞争力,微调稳定性尤其强,跨任务只有适度下降并持续优于基于排序的调制策略,知识蒸馏走势相近但在若干配置下落差更大。作者据此推断特征提取器在增量阶段保留了大量有用声学知识,灾难性退化主要不是表示丢失。持续学习指标支持该解释。
在 AudioSet 上微调的后向迁移接近零,知识蒸馏遗忘稍强,排序与学习调制则明显更负的后向迁移与更高的遗忘与僵化值,说明它们带来更多不稳定而非更好保留。在 FSD50K 上同样是微调遗忘最低,知识蒸馏与其他方法退化更大。原文还指出联合参考表现强,说明当所有类能共享输出结构时模型可维持高性能,而特征级调制收益有限,最重要因素可能是为新类提供合适且专用的输出、减少分类器层面干扰。
下面导读图 2 有助于同时比较数据集、顺序与方法的累计 mAP 走势,横轴是任务 0 到任务 4,纵轴是累计 mAP。
看图路径: 1. 先确认四个子图的行列布局与横轴任务 0 到任务 4;2. 再比较每子图中蓝色微调线与橙色联合线的相对位置;3. 接着观察红色学习调制线与其他秩约束线是否更快下探;4. 最后对比有序与无序两列在同一数据集上的走势差异
论文图 2。原论文 Fig. 2::“AudioSet and FSD50K Evaluation Metrics for the different learning setups.”。
从像素可见 4 个子图左上为无序 AudioSet,右上为有序 AudioSet,左下为无序 FSD50K,右下为有序 FSD50K。橙色联合线在 4 个子图中基本走平且位置最高,蓝色微调线紧随其下且斜率最缓,绿色知识蒸馏线略低于微调。红色学习调制线与其他秩约束线下降更快,尤其在早期任务 1 处落差大。FSD50K 子图的纵轴范围更高,起点约 60 而 AudioSet 起点约 42,但方法间相对顺序相似。像素不能精确读出每点小数,因此定量比较以原文表格为准,图只用于判断趋势与分组。
下表问题是 AudioSet 上哪种可运行策略遗忘最小且学新类最接近联合训练,公平条件是同任务划分与同动态头,指标方向为后向迁移越大越好、遗忘越小越好、僵化越小越好。
| 方法 | 后向迁移无序 | 后向迁移有序 | 遗忘无序 | 遗忘有序 | 僵化无序 | 僵化有序 |
|---|---|---|---|---|---|---|
| 微调 | -0.5 | -0.2 | 0.2 | 0.1 | 5.5 | 5.2 |
| 知识蒸馏 | -3.5 | -4.7 | 1.1 | 1.4 | 6.9 | 8.5 |
| 学习调制 | -16.6 | -16.7 | 13.8 | 13.1 | 33.5 | 31.1 |
| 排序 12.5% | -17.2 | -17.6 | 10.2 | 10.8 | 24.7 | 25.7 |
| 排序 25% | -16.6 | -17.7 | 9.5 | 10.0 | 23.7 | 25.5 |
| 排序 50% | -16.6 | -16.2 | 9.4 | 8.7 | 23.8 | 23.6 |
| 排序 75% | -14.8 | -13.9 | 7.7 | 7.1 | 21.4 | 20.1 |
| 排序 100% | -13.8 | -15.6 | 6.9 | 8.1 | 19.7 | 22.5 |
表后解释主要收益与代价。微调在两顺序下后向迁移最接近零且遗忘与僵化最低,说明冻住特征只调头的代价最小。
知识蒸馏是次优可运行策略,但僵化高于微调,说明学新类能力仍有差距。反例是学习调制与低比例排序保护在 AudioSet 上后向迁移约负 16 到负 17,遗忘约 10 到 13,明显未胜出。需要强调总体趋势不等于每步都成立,表值是 5 任务平均,逐任务走势以图 2 为准。
保护比例与顺序打乱会改变结论吗?
消融或对照围绕两个特有细节展开,一是排序保护比例,二是有序与无序的类顺序。原文报告排序方法对约束强度敏感,更严格的配置通常更好,而允许更多网络保持可适应的宽松配置通常后向迁移与僵化更差。作者的解释是强限制特征层可塑性在该场景有益,宽松约束可能既未学出有用表示又妨碍有效适应新类。从数字看 AudioSet 上排序 100% 与 75% 优于 12.5% 到 50%,FSD50K 上同样是高比例保护更稳,但即使最好的排序 100% 仍远差于微调,说明比例调优不能弥补路线差距。
顺序方面,原文称结论在有序与无序下总体成立,但在 FSD50K 上有序学习更有利,3 个指标都支持该方向。可能原因是 FSD50K 虽标多标签但绝大多数是单标签样本,首任务学最大的 30 类能提供对后续最有用的表示。无序时大样本类可能出现在后期,首任务表示较弱。教学上应把顺序当作适用条件而非次要细节:若首任务数据量小或代表性差,冻住特征的结论可能不再成立,但原文未测试这种小首任务条件。
下表问题是 FSD50K 上排序比例与顺序是否改变微调最优的判断,公平条件与上表相同,指标方向相同。
| 方法 | 后向迁移无序 | 后向迁移有序 | 遗忘无序 | 遗忘有序 | 僵化无序 | 僵化有序 |
|---|---|---|---|---|---|---|
| 微调 | -0.5 | -0.5 | 0.2 | 0.2 | 7.9 | 8.7 |
| 知识蒸馏 | -6.8 | -9.3 | 2.3 | 4.0 | 13.4 | 16.3 |
| 学习调制 | -19.9 | -11.5 | 13.3 | 9.0 | 39.2 | 29.1 |
| 排序 12.5% | -21.8 | -18.9 | 11.8 | 9.7 | 31.7 | 29.0 |
| 排序 25% | -20.9 | -17.7 | 10.8 | 9.6 | 30.7 | 27.5 |
| 排序 50% | -19.0 | -15.8 | 9.7 | 7.7 | 28.7 | 25.2 |
| 排序 75% | -17.0 | -13.4 | 7.8 | 6.9 | 26.1 | 22.8 |
| 排序 100% | -13.3 | -9.8 | 5.6 | 3.8 | 21.6 | 18.2 |
表后解释新增对照。FSD50K 上微调仍是遗忘最小的可运行策略,知识蒸馏次之但差距比 AudioSet 更大。排序内部存在单调趋势,保护比例越高遗忘与僵化越低,例如无序下排序 100% 遗忘 5.6 而 12.5% 遗忘 11.8,但即使 100% 仍高于微调的 0.2。
负结果是学习调制在无序下后向迁移负 19.9,为全表最差,说明核级调制在该任务上不稳。未评测边界是保护比例只做到 100%,没有测试只冻深层或只冻浅层的分层冻结,因此不能断言遗忘只在分类头之外的哪一层最重,只能复述作者的总体判断。
哪些判断有直接证据,哪些还只是推测?
直接报告的是微调与知识蒸馏在累计 mAP 与三项持续学习指标上优于排序与学习调制,以及排序内部高保护比例优于低保护比例,这些有表格与曲线支持。有限解释的是遗忘主要发生在深层尤其是分类头,特征提取器学到的表示可被后续任务复用而无需调制。原文用支持性语气给出该解释,但没有逐层冻结或逐层探针的对照来定位遗忘层,因此应表述为数据支持而非已证明因果。
待验证的是对同概率分布任务的假设,原文结论称对于遵循同分布的任务可认为特征层不是遗忘发生处,并把不同类分布留作未来工作。缺失证据不是技术错误,但复述时必须区分。未测量的量包括误判率分解、推理延迟、训练成本与内存占用,原文未报告这些量,不能承诺微调省时间或省显存,只能说它更新参数最少因而概念上更轻。相关性不等于因果,有序在 FSD50K 上更好不能直接推出大首任务必然更好,还需补小首任务与跨域实验。
原文表格与图注没有算术冲突,但表值是跨 5 次随机划分的平均,原文未报告方差或显著性,比较时应避免宣称微小差距显著。
要复现这篇工作,第一步先做什么?
复现先做环境与数据对齐。代码仓库在本次核对中可用,论文明确用于实验复现。先按仓库说明准备 AudioSet 与 FSD50K,复现选最大 50 类、首任务 30 类加后续 4 个 5 类的划分,并分别实现有序与无序两种顺序,无序重复 5 次随机划分取平均。特征按采样率 32000 赫兹、1024 点傅里叶变换、320 跳长、64 梅尔带计算对数梅尔谱图,音频统一 10 秒。模型按 6 个卷积块每块两卷积加批归一化加动态全连接头搭建,输出用 sigmoid,损失用当前任务二元交叉熵,优化用初始学习率 0.001 的随机梯度下降加余弦退火与 20 轮早停。
先跑联合训练参考与微调基线,确认累计 mAP 走势与原文图 2 量级一致,再跑知识蒸馏、排序多比例与学习调制。关键超参数与信息条件是当前任务标签可用、旧任务数据不可用、每步输出增加 5 个、微调冻住卷积与批归一化。缺项是蒸馏权重、排序打分公式细节与调制阈值,需以仓库默认实现为准并记录实际取值。区分代码开源与系统可运行:仓库可用不等于权重可下载,复现应从训练做起并保留随机种子与划分文件。
还需补的验证是报告均值加方差、记录训练时长与参数更新量,并补做小首任务与跨域顺序以检验结论边界。
何时值得尝试冻特征只调头,何时不要?
当任务是同域声音分类、首任务类别多且样本足、输出可用动态头扩张、且不能存旧数据时,值得先尝试冻住卷积特征只微调动态头。它的分工是保住通用声学表示,把学习集中到输出层组织,原文证据显示这种做法遗忘最小且训练稳定,并在记忆保持与学习可塑性间取得较好平衡。当首任务很小、后续出现域偏移、新类需要全新声学基元或必须压缩推理成本时,不要直接套用该结论,因为原文未验证这些条件,且知识蒸馏在学新类上仍与联合训练有差距。
常见误解是把核保护比例越高越好当成普遍规律,实际上原文只在该同域任务中观察到该趋势,且最好比例仍不如整体冻结。另一个误解是把累计 mAP 走平当成没有遗忘,必须同时看后向迁移、遗忘与僵化 3 个方向。复述方法时应按输入到表示到组件到目标到输出的顺序讲清动作,再用公式与表格固定证据,最后说明缺项与待验证点,这样的版本才可核对且可复述。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses

