On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin
📄 On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin 标签:#语音识别 #知识蒸馏 #多语言 #持续学习 #领域适应 7.0/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #知识蒸馏 | #多语言 #持续学习 | arxiv 👥 作者与机构 第一作者:Shuiyuan Wang(Audio, Speech and Language Processing Group (ASLP@NPU), School of Computer Science, Northwestern Polytechnical University, Xi’an, China) 通讯作者:Lei Xie(Audio, Speech and Language Processing Group (ASLP@NPU), School of Computer Science, Northwestern Polytechnical University, Xi’an, China) 作者列表:Shuiyuan Wang(ASLP@NPU,西北工业大学计算机学院)、Bingshen Mu(ASLP@NPU,西北工业大学计算机学院)、Pengshen Zhang(WeNet Community)、Chengyou Wang(ASLP@NPU,西北工业大学计算机学院)、Yujie Liao(ASLP@NPU,西北工业大学计算机学院)、Chengdong Liang(WeNet Community)、Binbin Zhang(WeNet Community)、Qiangze Feng(NEXDATA TECHNOLOGY INC.)、Lei Xie(ASLP@NPU,西北工业大学计算机学院) 💡 毒舌点评 本文抓住了多方言 ASR 中“学会方言、保住普通话”这一真实痛点,并用同一套 refinement 数据下的 Continued SFT vs. OPSD 对照实验给出了相当有说服力的证据:普通话平均 CER 从 4.43% 降到 3.27%,说明最后阶段的目标函数选择确实关键。短板也很明显:OPSD 本身并非新方法,增量主要来自将其搬进 ASR 场景和阶段化工程组合;且论文并未与专门的方言 ASR 系统或 adapter/MoE 方案直接比较,公共方言集合上的提升幅度也偏小,距离突破性贡献仍有距离。CPT 消融虽然证明了先做继续预训练的必要性,但这一结论本身并不意外——把普通话混合数据先跑一圈能缓和后续方言 SFT 的覆盖损伤,属于常规持续学习直觉的验证。 ...