英文题目:Cross Domain Few-Shot Class-Incremental Audio Classification Via Adversarial Contrastive Learning
会议身份:
conference:interspeech:2026:conference-paper-id:si26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#对抗训练 #持续学习 #对比学习 #少样本 #音频分类
评分:7.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Yongjie Si:机构信息未能从会议 PDF 纯文本可靠映射
- Yanxiong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Sen Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Beibei Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨域少样本类增量音频分类(Cross Domain Few-Shot Class-Incremental Audio Classification,CD-FCAC)要求模型以源域充分样本启动基会话,再用目标域每类仅5个样本持续学习新类,并在全部已见类上保持准确率。所提对抗对比训练(Adversarial Contrastive Learning,ACL)先用谱扰动器对对数梅尔谱做随机卷积扰动,再冻结模型沿梯度上升最大化分类损失生成伪目标域样本,接着将源域样本与对抗样本混合输入编码器与分类器联合优化,加权交叉熵保证分类,监督对比损失约束同类紧凑异类分离以预留新类决策空间,增量阶段冻结编码器并用旧类嵌入均值加新类样本更新余弦分类器。与仅用交叉熵或单一策略的已有少样本类增量方法不同,该方法将单源域泛化显式引入持续学习流程,以多样化伪域模拟未见域偏移。在NSynth-100到LS-100的5路5样本设置下平均准确率(Average Accuracy,AA)达到79.09%,高于最强组合基线AMFO+AFA的78.50%。该结论仅在LS-100、NSynth-100与FSC-89构成的6组跨域对上验证,对真实开放噪声、通道失配与大规模连续增量的外推尚未证明。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/YongjieSi/ACL — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决什么矛盾?
本文的输入是音频波形经对数梅尔谱图表示后的时频特征,输出是对测试音频所属类别的判断。目标读者是刚进入语音、音乐与音频分类的研究生,因此先把任务边界讲清楚。传统的音频分类假设所有类别 1 次给定且每类样本充足,模型训练 1 次即可。现实中智能家居等场景的类别是动态增加的,例如先要识别一批语音指令,后续又要陆续识别环境声和乐器声,而且每种新类只能提供很少的标注样本,这就引出小样本类增量音频分类。
已有小样本类增量方法通常还假设基类和新类来自同一域,即同一分布、同一录音条件。但论文指出,基会话样本来自一个源域,增量会话样本来自另一个目标域时,域偏移与类别增量会同时出现。举例来说,用环境声数据集训练基类,再用语音或乐器数据集做增量,新类的声学特性、背景噪声和录制链路都变了。此时模型既要抵抗灾难性遗忘,又要克服域偏移,还要只用少量样本为新类建立决策边界。
论文把这个问题命名为跨域小样本类增量音频分类,并声明据作者所知这是首次系统处理该问题的工作。必须保留的关键信息是:基会话类别多、每类样本充足,增量会话每会话只有少量类、每类只有少量样本,测试时要在当前及所有历史会话的测试集上评估。本文后续按任务与相关路线、方法全景、组件与计算、训练与推理、实验条件、结果与反证、复现与收束展开,所有事实只来自论文原文证据与本次收到的官方原图像素。
已有路线各解决了什么,没有解决什么?
先把同输入、同目标、同监督下的相关路线放在一起对照。第一类是不考虑跨域的小样本类增量音频分类方法,包括动态小样本学习、基于原型的分类器、随机分类器、线性分类器和岭回归分类器等。
具体到对比基线,动态小样本学习设计了注意力权重生成器来为新类生成分类器权重,持续演进分类器方法用图模型在分类器之间传播上下文信息,自注意力修正原型方法用自注意力修正的原型扩展分类器,自适应缓解遗忘与过拟合方法强调判别性与泛化性兼顾的分类器和嵌入。这些方法处理的是类别增加和样本稀缺,但训练和测试默认同域。第二类是少样本跨域方法与跨域小样本类增量点云识别方法。
论文把任务专用适配器、局部与全局蒸馏原型网络、对抗特征增强、元训练框架分别与增量方法组合,形成可运行的跨域增量对照,另外还引入点云领域的跨域小样本类增量方法作为问题设定相同的参照。需要明确的是,类别差异不能当作同条件胜负,跨域方法原本解决的是少样本泛化,点云方法原本解决的是 3 维点云,只有当它们按本文的跨域音频增量协议重新运行后,才能与本文方法比较。
论文的判断是,上述工作都没有同时处理音频领域的域偏移与类别增量,因此需要一种在基会话就学到域不变且类间可分表示的策略。
跨域小样本类增量是如何形式化定义的?
论文把跨域小样本类增量定义为包含多个会话的过程。设共有 M 个会话,包括一个基会话和 M 减 1 个增量会话。基会话的训练与测试数据来自源域,增量会话的数据来自目标域。基类称为源域类,增量类称为目标域类。每个会话有各自的训练集和测试集,不同会话的标签集合互不相交。
在第 m 个会话中,只能用该会话的训练集训练模型,但测试要在当前及所有历史会话的测试集上进行。基会话类别多、每类样本充足,增量会话每个会话只有 N 个类、每类只有 K 个训练样本,典型取值为 5 路 5 样本。作为例子,这里的 5 路 5 样本是教学例子,表示每个增量会话新增 5 个类、每类 5 个样本,不是论文对所有实验的唯一设定,论文还讨论了 N 与 K 取不同值的影响。评价指标是平均准确率,即所有会话准确率的平均值,数值越高表示全过程整体性能越好。
数据层面,论文使用 LS-100、NSynth-100 和 FSC-893 个公开数据集,它们分别对应语音、乐器与环境声类型,录制环境与设备不同,因此既有类别差异又有域偏移。6 组跨域配对由这 3 个数据集两两组合而成,例如 FS 到 NS 表示基会话用 FSC-89、增量会话用 NSynth-100。这种构造同时满足跨域与跨类的要求,也贴合智能体需要陆续识别语音命令、环境声和乐器声的实际需求。
模型分哪两部分,基会话与增量会话各自做什么?
模型整体分解为编码器和分类器两部分,这是小样本类增量中的常见做法。输入是对数梅尔谱图,编码器把它映射为嵌入向量,分类器基于嵌入与类权重之间的余弦距离做判决。基会话的目标是学到域不变、类内紧凑、类间可分的嵌入。增量会话的目标是在不遗忘旧类的前提下学会新类。具体安排是:基会话同时训练编码器和分类器,增量会话冻结编码器、只更新分类器。
冻结的理由在原文中明确给出,即保留基类知识、缓解对旧类的遗忘。新类的知识通过更新分类器权重来吸收,旧类的知识通过保存旧类嵌入的均值向量来维持。每个训练回合包括生成对抗样本和训练模型两步。第一步冻结模型,基于源域样本最大化特定损失以生成对抗样本。第二步用生成的对抗样本与源域样本一起最小化损失来训练模型。
推理时计算测试样本嵌入与分类器权重之间的余弦距离,距离最近的类即为预测结果。下面这张框架图把上述 2 阶段画在了一起,上半部分是基训练,下半部分是增量训练,值得沿着一个样本走一遍。
看图路径: 1. 先从顶部源域音频到对数梅尔谱图看输入主路径;2. 再对比左侧最大化分支与右侧最小化分支的冻结与激活标记;3. 观察对抗样本如何经拼接进入右侧编码器参与训练;4. 最后看底部增量阶段编码器冻结而分类器更新的连接
论文图 1。原论文 Figure 1:“Framework of our method. In base training, we learn domain-invariant embeddings via adversarial contrastive training using a spectral disruptor.”。
上图上半部分显示,源域音频先变为对数梅尔谱图,一路进入谱扰动器生成对抗样本,另一路与对抗样本拼接后进入编码器。左侧橙色虚线框对应第一步最大化训练,编码器与分类器均标记为冻结,对抗样本标记为激活,反向箭头指向对抗样本,损失记为最大化损失。右侧蓝色虚线框对应第二步最小化训练,编码器、分类器与多层感知机均标记为激活,分类分支产生交叉熵损失,对比分支产生监督对比损失,两者加权求和得到最小化损失。
下半部分显示,增量阶段音频变为对数梅尔谱图后进入冻结的编码器,再进入激活的分类器,分类器同时接收旧类嵌入均值向量与新类样本嵌入,分别产生旧类交叉熵与新类交叉熵并加权求和。这种画法把冻结与更新、生成与训练、旧知识与新知识放在同一张图里,便于核对梯度去向与监督来源。
对抗对比训练的两个部分各自算什么?
对抗对比训练是本文的核心组合,需要先讲清两个术语。白话来说,对抗训练是指故意制造让当前模型难受的样本,再让模型在这些难样本上学得更鲁棒,对应英文为 adversarial training。监督对比学习是指利用标签把同类样本的表示拉近、把异类样本的表示推远,对应英文为 supervised contrastive learning。论文把两者融合为对抗对比训练策略。
对抗训练 × 监督对比学习: 对抗训练的分工是通过最大化损失生成难的对抗样本来模拟未见过的目标域,监督对比学习的分工是把同类嵌入拉近、异类嵌入推远以形成紧凑可分的嵌入空间,二者搭配的理由是只做对抗容易判别性不足、只做对比又难以抵抗域偏移,组合成对抗对比训练后新增作用是得到域不变且类间可分的表示,使少样本也能建立稳定决策边界。
具体计算分两步交替进行。最大化步骤冻结模型参数,优化对抗样本,使交叉熵损失减去源域与伪目标域之间距离惩罚后的目标最大化。距离度量对同标签样本用嵌入欧氏距离,对不同标签样本记为无穷大,以保证语义一致性,即扰动不能改变类别含义。最小化步骤用源域样本与已生成的对抗样本一起训练模型,损失是交叉熵损失与监督对比损失的加权和。监督对比损失在多层感知机输出的投影空间计算,对每个锚样本,把同类正样本的相似度提高、把异类样本的相似度压低,从而预先构造判别性嵌入空间。论文还设计了谱扰动器来增加对抗样本多样性。
谱扰动器 × 对抗样本: 谱扰动器的分工是用两层随机卷积扰动对数梅尔谱图的时频单元以增加多样性,对抗样本的分工是作为伪目标域数据与源域数据一起参与最小化训练,二者搭配的原因是单源域本身看不到目标域,需要可控的扰动来扩大分布覆盖,组合意义是让模型在训练时就暴露于多种扰动分布,从而学到对域变化更鲁棒的嵌入。
谱扰动器包含两层参数相同的随机卷积层,用正态分布初始化并在训练中冻结,卷积核尺寸从候选池随机选择,步长与填充保持谱图形状不变。它作用于对数梅尔谱图的时频单元,而不是直接改波形。编码器与分类器的分工同样需要明确。
编码器 × 分类器: 编码器的分工是把对数梅尔谱图映射为嵌入向量,分类器的分工是基于嵌入与类权重之间的余弦距离做判决,二者搭配的原因是增量学习需要把表示学习与决策更新解耦,组合意义是基会话同时训练两者以学好表示,增量会话冻结编码器只更新分类器,从而保留旧知识又能吸纳新类。
编码器采用残差网络 18,嵌入维度为 512,对数梅尔谱图维度为 128。分类器权重与嵌入之间用带尺度因子的余弦相似度计算得分,再经指数与归一化得到交叉熵损失。增量损失是新类交叉熵与旧类均值向量交叉熵的加权和,权重系数在原文中给出。需要指出,原文没有报告谱扰动器候选池的具体核尺寸列表,也没有给出最大化步骤中距离惩罚系数的搜索过程,这些属于具体缺项,复现时只能按原文已给系数先运行,再自行补验证。
小样本类增量学习 × 跨域: 小样本类增量学习负责解决类别不断增加且每类只有少量样本时的记住旧类和学会新类,跨域负责解决基类数据与新类数据来自不同分布时的域偏移,二者搭配的原因是实际中新增类别往往同时带来新录音设备、新环境和新声源,组合意义是把遗忘和域偏移放在同一个增量流程里联合处理。
基会话与增量会话的训练与推理如何执行?
基会话的训练按回合进行,每个回合先做最大化、再做最小化。操作上,先从基训练集选取音频并提取对数梅尔谱图,对谱图做谱扰动,多轮迭代更新对抗样本,更新方向是增大最大化损失。此时模型参数不动,只有对抗样本在变。然后把源域谱图与对抗样本拼接成联合 batch,前向经过编码器,一路经分类器算交叉熵,一路经多层感知机算监督对比损失,加权后反向更新编码器、分类器与多层感知机。
原文算法表把学习率分为最大化学习率与最小化学习率,回合数为多轮,但具体数值在正文证据中未完整披露,属于缺项。基训练结束后,为每个基类保存嵌入均值向量,计算方式是对该类支持样本的嵌入求平均。增量会话冻结编码器,只更新分类器。输入包括新类少量样本的嵌入和旧类嵌入均值向量,损失是新类交叉熵加旧类交叉熵的加权组合。每个增量会话训练 100 个周期,基会话训练 200 个周期、每周期 50 个回合式训练步。
推理时不对编码器做更新,直接提取测试样本嵌入,计算其与所有已见类权重的余弦距离,取最接近者为预测。这种冻结编码器的做法意味着表示不再随新域漂移,好处是旧类稳定性强,代价是如果目标域与源域差异极大,固定表示可能对新域新类的区分力不足,这正是需要对抗对比预训练来提前补偿的原因。
数据、协议与超参数如何设置,比较是否公平?
实验要回答的核心问题是:在域偏移与类别增量同时存在时,本文方法相对已有可运行方法是否整体更好。为保证公平,所有方法使用相同的编码器结构、相同的增量协议与相同的平均准确率聚合方式。数据源是 3 个公开数据集,基会话用其中一个数据集,增量会话用另一个数据集,从而构成 6 组跨域配对。每个数据集按类别划分为基部分与增量部分,类别无重叠。训练时每个增量会话只能看到当前会话的少量样本,测试时在所有已见会话的测试集上评估。
指标方向是平均准确率越高越好。超参数与训练预算按原文交代,基会话训练量大于增量会话,对数梅尔谱图与嵌入维度固定,损失权重系数固定。下表把原文明确报告的训练预算与表示维度、损失权重整理在一起,便于复现时 1 次性核对,表中数字与单位均来自原文连续原句,裸数值不擅自添加百分号,学习率等系数保持原文精度。
表前说明:该表要回答的问题是复现需要多大的训练开销与哪些固定系数,公平条件是所有方法共享编码器与协议,指标方向不适用于本表,本表只做条件核对。
| 配置组 | 基会话周期数 | 每周期回合步数 | 增量会话周期数 | 谱图与嵌入维度 | 损失权重与学习率 |
|---|---|---|---|---|---|
| 原文报告值 | 200 | 50 | 100 | 128 和 512 | 1,0.2,1,0.6 和 0.1 |
表后解释:基会话 200 周期加每周期 50 步意味着基表示学习成本明显高于增量更新,增量每会话 100 周期则是在冻结编码器下只调分类器的轻量更新。谱图维度 128 与嵌入维度 512 决定了编码器输入输出规模,权重系数分别对应交叉熵、对比损失与新旧类平衡。代价是最大化步骤的多轮内循环会进一步增加基训练时间,原文未报告具体硬件耗时与推理延迟,因此不能从准确率优势推定效率优势。未评测边界包括不同录音信噪比下的稳定性,原文未单独划分噪声条件验证。
六组跨域配对上的主结果支持什么判断?
主结果比较本文方法与 9 组基线在 6 组跨域配对上的平均准确率。基线包括不考虑跨域的动态小样本学习、持续演进分类器、自注意力原型、自适应缓解遗忘与过拟合,以及把跨域少样本方法与增量方法组合后的变体,还有问题设定相同的点云跨域增量方法。所有方法按 5 路 5 样本的典型增量设置运行。下表集中呈现本文方法在 6 组配对上的平均准确率,表中数字与百分号写法保留原文,配对名称保留原文箭头含义,左侧为源域、右侧为目标域。
表前说明:该表要回答的问题是在 6 组跨域方向上本文方法的整体水平如何,公平条件是各方法共享编码器结构与增量协议,指标为平均准确率且越高越好,比较对象是原文实际运行的 9 组基线,细节见正文对基线的描述。
| 方法 | FS 到 NS 平均准确率 | FS 到 LS 平均准确率 | NS 到 FS 平均准确率 | NS 到 LS 平均准确率 | LS 到 FS 与 LS 到 NS 平均准确率 |
|---|---|---|---|---|---|
| 本文方法 | 46.89% | 41.67% | 85.17% | 79.09% | 80.05% 和 79.78% |
表后解释:从报告看,本文方法在 6 组配对上分别为 46.89%、41.67%、85.17%、79.09%、80.05% 和 79.78%,原文表述为高于其他方法同期得分。支持的判断是,对抗对比训练带来的域不变与类间可分表示有助于跨域增量泛化。需要同时看到代价与反例:以 FSC-89 为源域的两组绝对值明显低于以 NSynth 或 LS 为源域的 4 组,说明源域本身的泛化难度不同,总体趋势不等于每组都同样大幅领先。
未胜出项方面,原文表格显示部分组合基线在个别配对上接近本文方法,例如对抗特征增强组合在 FS 到 LS 与 LS 到 FS 上相对较强,说明单靠跨域增强也能在某些方向上缩小差距。此外,平均准确率只反映整体均值,没有给出每会话遗忘曲线、误判分布与统计显著性,因此不能把均值优势直接解读为每一增量步都更优。
监督对比与对抗训练各自贡献了什么,反证是什么?
消融实验在 NS 到 LS 配对上拆解监督对比损失与对抗训练的贡献。论文设置了 4 种情形:不用两者、只用监督对比、只用对抗训练、两者都用。不用两者时相当于只用交叉熵训练基模型,只用其一时分别加入对应机制,两者都用即为完整方法。原文报告完整方法在该配对上取得最高的平均准确率 79.09%,并且从 4 种情形的比较中得出两者都带来增益、合用时最高的结论。扩展实验进一步讨论了 N 路 K 样本的影响。
当 N 固定时,K 越大、每类训练样本越多,平均准确率稳步提升。当 K 固定时,N 等于 5 时达到最大,若 N 小于 5 则会话数增加、模型更容易遗忘旧类,若 N 大于 5 则每会话类别增多、类间混淆加重,因此准确率都会下降。这组分析用的是原文文字描述的趋势,原文未给出每个 N 与 K 组合的完整数字表,因此此处不硬写未见像素的数值。另一项反证来自嵌入可视化。论文用 t-SNE 展示 NS 到 LS 上 5 个源类与 5 个目标类的测试嵌入分布,左图不用对抗对比策略,右图使用该策略。
下面这张图是该可视化的官方原图,需要按图例确认对象后再判断。
看图路径: 1. 先核对顶部图例中源类与目标类的颜色符号划分;2. 再对比左图目标类混叠成团与右图各类别成团分离的差异;3. 观察源类在左右两图中是否保持紧凑可分
论文图 2。原论文 Figure 3:“Distributions of testing embeddings of five source and target classes on the NS→LS (a) without using and (b) using the proposed adversarial contrastive training strategy.”。
上图顶部图例区分了源类 0 到 4 与目标类 5 到 9 的颜色符号,左右两个面板是相同类别集合在不同训练策略下的投影。左图可见目标类点云大面积交叠成团,且与部分源类重叠,表现为跨域判别性不足。右图可见各类别各自成团且几乎无重叠,源类保持紧凑,目标类也被拉开。支持的判断是,对抗对比训练确实改善了未见域上嵌入的类间分离。但需注意,t-SNE 是降维投影,距离不等于原始余弦距离,投影中的分离不能直接等同于分类器决策边界的裕量,也不能推广到全部类别与全部跨域方向,仍属于有限解释而非因果证明。
还有哪些没有验证,不能承诺什么?
首先区分 3 类表述。论文直接报告的是 6 组配对上的平均准确率与 NS 到 LS 上的消融趋势,有限解释的是对抗样本模拟伪目标域与对比损失预构判别空间有助于泛化,未验证推测的是更有效的编码器与分类器会进一步提升准确率,这属于未来工作,不应当前承诺。其次,缺失证据不是技术错误,但复现与选型时必须正视。原文未报告训练硬件、耗时、参数量、推理延迟与输出帧率,因此不能承诺延迟或成本得到改善。
原文未报告误判率按类别的分布、噪声与混响等细粒度域偏移下的表现,也未报告多次随机种子的方差与显著性检验,因此不能把平均值差异直接当作统计显著。再次,方法本身有适用条件。用户友好设定假设基会话来自单一源域,若基数据本身就是多域混合,单源域泛化的公式与谱扰动器是否仍然充分,原文没有验证。增量阶段冻结编码器有利于稳定,但若目标域持续漂移,固定表示可能逐渐过时,原文没有测试长序列持续漂移下的表现。
最后,相关性不是因果。可视化分离与准确率提升同时出现,支持两者相关,但不能证明分离是唯一原因,分类器更新策略与均值向量保留同样在起作用。
要复现这篇工作,先做什么,需要哪些条件?
复现先从数据与代码条件入手。论文给出代码链接,本次资源状态显示可用,因此可以写当前可用,但权重下载与完整可运行状态仍需按链接实际核对,不把代码开源等同于开箱即用。数据需从原文脚注的 3 个数据集地址获取 LS-100、NSynth-100 与 FSC-89,并按原文类别划分构造基与增量部分,再按 6 组跨域方向组织实验。模型侧先实现对数梅尔谱图提取、残差网络 18 编码器、分类器与多层感知机对比分支,再实现谱扰动器的两层随机卷积与对抗样本内外循环。
训练时严格遵守冻结与更新安排:最大化步骤冻结模型只更新对抗样本,最小化步骤用源域与对抗样本联合更新模型,增量阶段冻结编码器、只用新类嵌入与旧类均值向量更新分类器,推理用余弦距离判决。超参数先按原文报告值起步,包括基 200 周期、每周期 50 步、增量 100 周期、谱图 128 维、嵌入 512 维,以及系数 1、0.2、1、0.6 与学习率 0.1,再补做未报告项的验证,例如最大化内循环轮数、距离惩罚系数与不同随机种子的稳定性。
何时值得尝试:如果你的增量新类确实来自不同数据集或不同录制条件,且每类只有少量样本,这种预先做域鲁棒表示的思路值得尝试。如果新增数据与基数据基本同域,传统同域增量方法可能更轻量,不必引入对抗内循环的额外成本。
核心结论与特有误解是什么?
综合全文,论文解决的是域偏移与类别增量共存的跨域小样本类增量音频分类问题,方法是基会话交替做最大化生成对抗样本与最小化训练域不变可分嵌入,增量会话冻结编码器、只更新分类器并保留旧类均值向量。最强证据是 6 组跨域配对上的平均准确率报告,以及 NS 到 LS 上监督对比与对抗训练各自带来增益、合用最高的消融结论,主要代价是基训练的双步交替成本与固定表示对持续漂移的适应上限。需要纠正几个特有误解。
第一,对抗样本在这里不是攻击测试,而是在训练时模拟伪目标域的工具,其语义一致性由同标签距离约束保证。第二,监督对比损失不是替代分类损失,而是与交叉熵并存的塑形项,目的是让少样本也能建立稳定边界。第三,冻结编码器不是不学习,而是把学习放在基阶段做足,增量阶段只调决策。第四,平均准确率高不等于每一步都高,也不等于延迟更低,未测量的量不能默认改善。
对初学者而言,可复述的方法链条是:谱图输入、谱扰动生成伪域、最大化找难分布、最小化学生成紧凑可分嵌入、冻结编码器、用均值向量加少量新样本更新分类器、余弦距离推理。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

