在低秩优化器里加旧任务曲率:CGaLore 如何让 ASR 基座模型记得住又学得进
针对 ASR 基座模型持续适配中的灾难性遗忘,CGaLore 用旧任务 KFAC 曲率先过滤当前梯度再选 GaLore 低秩基,在 L2-Arctic 与 CGN 两组实验上取得最优平均词错误率,代价是需少量旧任务语音估计曲率并增加基更新时的计算。
针对 ASR 基座模型持续适配中的灾难性遗忘,CGaLore 用旧任务 KFAC 曲率先过滤当前梯度再选 GaLore 低秩基,在 L2-Arctic 与 CGN 两组实验上取得最优平均词错误率,代价是需少量旧任务语音估计曲率并增加基更新时的计算。
该研究把持续学习任务收紧到单攻击者加已知真人多样性,用三种检测模型和四种训练策略对比,报告攻击者训练数据与架构影响相当、任务顺序与说话人多样性对不同方法影响不一,而随机回放最稳但需存旧数据。
针对域增量下旧音频不可回访且新专家对旧样本缺特征的问题,该文用冻结追加专家加无数据回放与跨域特征补全,在 DCASE 2026 任务 7 上报告 78.4% 微平均与 78.9% 宏平均,代价是专家数与拼接维度随域数线性增长。
针对新伪造语音出现时微调整个检测器会遗忘旧数据的矛盾,该工作冻结定制 ResNet18 主干、只训练 128 维嵌入后的轻量回溯翻译器做类条件分布对齐,在 FoR、ITW 和中文 ADD22 上保持源域 95.0% AUC 与 9.74% EER 的同时把目标域做到约 95-98% AUC,代价是目标域 EER 比全量重训高约数个百分点。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文在 ESC-50 的 5 任务类增量设置下用 Integrated Gradients 跟踪任务级解释漂移,报告含回放的混合方法同时获得最高平均准确率 0.4400 与最低遗忘 0.3896 并压低解释漂移,而正则化方法遗忘高且漂移大。
针对基座会话与增量会话都只有极少标注音频的全少样本类增量音频分类问题,TAPE 冻结 CLAP 音频编码器并学习任务适配投影与推理期低熵原型演化,在三套音频任务上报告平均准确率与性能下降率的同步改善,代价是每类需维护推理期优先队列并按会话重置原型。
论文把多通道回放检测定义为按声学环境逐个学习的域增量问题,用 ReMASC 全部 24 种顺序对比朴素微调、EWC、GPM 与任务专用波束形成器,最强证据是 TSB 显著降低平均错误率但未减少遗忘,而最后出现的环境主导最终性能。
该文在 FSD50K 与 AudioSet 上以 30 类起步加 4 个 5 类增量任务比较冻结、蒸馏与核级可塑性调制,报告显示冻住卷积特征并只微调动态分类头遗忘最小而核级约束反而更不稳定,但新类学习能力仍低于联合训练。
音频分类 | 7.2/10
语音识别 | 7.0/10
元学习 | 8.1/10
共分析 16 篇语音/AI 论文
语音识别 | 8.2/10
语音唤醒 | 7.1/10
音频检索 | 6.4/10
语音识别 | 6.3/10
语音伪造检测 | 6.0/10
语音识别 | 7.2/10