论文解读

在低秩优化器里加旧任务曲率:CGaLore 如何让 ASR 基座模型记得住又学得进

针对 ASR 基座模型持续适配中的灾难性遗忘,CGaLore 用旧任务 KFAC 曲率先过滤当前梯度再选 GaLore 低秩基,在 L2-Arctic 与 CGN 两组实验上取得最优平均词错误率,代价是需少量旧任务语音估计曲率并增加基更新时的计算。

 · 更新于 2026-09-24 · 约 19 分钟 · 9335 字 阅读 →
论文解读

攻击者数据与架构谁更难:持续学习下伪造音频检测的受控拆解

该研究把持续学习任务收紧到单攻击者加已知真人多样性,用三种检测模型和四种训练策略对比,报告攻击者训练数据与架构影响相当、任务顺序与说话人多样性对不同方法影响不一,而随机回放最稳但需存旧数据。

 · 更新于 2026-09-24 · 约 19 分钟 · 9069 字 阅读 →
论文解读

不覆盖旧参数:为每个域追加冻结专家的全阶增量音频分类

针对域增量下旧音频不可回访且新专家对旧样本缺特征的问题,该文用冻结追加专家加无数据回放与跨域特征补全,在 DCASE 2026 任务 7 上报告 78.4% 微平均与 78.9% 宏平均,代价是专家数与拼接维度随域数线性增长。

 · 更新于 2026-09-24 · 约 17 分钟 · 8131 字 阅读 →
论文解读

冻住检测器、只训练回溯翻译器:持续伪造语音检测里的遗忘与适配矛盾

针对新伪造语音出现时微调整个检测器会遗忘旧数据的矛盾,该工作冻结定制 ResNet18 主干、只训练 128 维嵌入后的轻量回溯翻译器做类条件分布对齐,在 FoR、ITW 和中文 ADD22 上保持源域 95.0% AUC 与 9.74% EER 的同时把目标域做到约 95-98% AUC,代价是目标域 EER 比全量重训高约数个百分点。

 · 更新于 2026-09-24 · 约 16 分钟 · 7753 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

学新声会改旧解释:类增量音频分类中的解释漂移如何被遗忘与竞争推高

该文在 ESC-50 的 5 任务类增量设置下用 Integrated Gradients 跟踪任务级解释漂移,报告含回放的混合方法同时获得最高平均准确率 0.4400 与最低遗忘 0.3896 并压低解释漂移,而正则化方法遗忘高且漂移大。

 · 更新于 2026-09-24 · 约 17 分钟 · 8514 字 阅读 →
论文解读

基座也缺数据时:TAPE 用任务适配空间与推理期原型演化做全少样本音频增量分类

针对基座会话与增量会话都只有极少标注音频的全少样本类增量音频分类问题,TAPE 冻结 CLAP 音频编码器并学习任务适配投影与推理期低熵原型演化,在三套音频任务上报告平均准确率与性能下降率的同步改善,代价是每类需维护推理期优先队列并按会话重置原型。

 · 更新于 2026-09-24 · 约 17 分钟 · 8516 字 阅读 →
论文解读

环境变了就要忘:多通道回放检测的域增量学习基准

论文把多通道回放检测定义为按声学环境逐个学习的域增量问题,用 ReMASC 全部 24 种顺序对比朴素微调、EWC、GPM 与任务专用波束形成器,最强证据是 TSB 显著降低平均错误率但未减少遗忘,而最后出现的环境主导最终性能。

 · 更新于 2026-09-24 · 约 16 分钟 · 7750 字 阅读 →
论文解读

遗忘主要发生在分类头:同分布声音分类中冻住特征只调动态头的对比

该文在 FSD50K 与 AudioSet 上以 30 类起步加 4 个 5 类增量任务比较冻结、蒸馏与核级可塑性调制,报告显示冻住卷积特征并只微调动态分类头遗忘最小而核级约束反而更不稳定,但新类学习能力仍低于联合训练。

 · 更新于 2026-09-24 · 约 19 分钟 · 9238 字 阅读 →
论文解读

别把旧类压成一个点:SPECTRA 用低秩几何给 5-shot 音频增量学习留住记忆

音频分类 | 7.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5815 字 阅读 →
论文解读

On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin

语音识别 | 7.0/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2303 字 阅读 →
论文解读

Versatile On-device Adaptation at the Edge by Unifying Few-shot, Zero-shot, Continual, and In-context Learning

元学习 | 8.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7787 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-03

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 46 分钟 · 22753 字 阅读 →
论文解读

MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond

语音识别 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6955 字 阅读 →
论文解读

Scalable Keyword Spotting via Modular Network Expansion

语音唤醒 | 7.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7687 字 阅读 →
论文解读

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

音频检索 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7023 字 阅读 →
论文解读

Hybrid Continual Learning for Low-Resource Australian Aboriginal Language Identification

语音识别 | 6.3/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7202 字 阅读 →
论文解读

Traceback Translators Against Forgetting in Continual Fake Speech Detection

语音伪造检测 | 6.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7695 字 阅读 →
论文解读

Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6459 字 阅读 →