论文解读
谁来打标签、谁来稳住训练:半监督联邦语音识别的在线教师与服务器锚点
该文研究服务器只有少量标注种子、客户端只有无标注语音的半监督联邦 ASR,用每客户端在线教师打伪标签加轮间服务器有监督更新做锚点,最强证据是稳定后在线教师在域内和多数跨域上持平或超过全局教师,代价是必须把服务器增强强度和批量调进稳定区间否则发散。
该文研究服务器只有少量标注种子、客户端只有无标注语音的半监督联邦 ASR,用每客户端在线教师打伪标签加轮间服务器有监督更新做锚点,最强证据是稳定后在线教师在域内和多数跨域上持平或超过全局教师,代价是必须把服务器增强强度和批量调进稳定区间否则发散。
该研究在 316 个按说话人划分的多语联邦客户端上比较四种语音大模型与 FedAvg 和 FedProx,最强证据是 Whisper 加 EuroLLM 在解冻编码器并调低其学习率时取得 0.1170 词错率,而 FedProx 只在该多语解码器上有效,代价是联邦仍远差于集中训练且对编码器预训练类型高度敏感。
论文诊断单池逐层裁剪在语音大模型中的跨组件预算崩溃,提出双池 α-split 在保持联合灵敏度与全局 DP 保证不变下恢复可用词错误率,并以编码器 4.47 倍等效噪声换取语言模型仅 2.6% 开销。
语音识别 | 7.1/10
联邦学习 | 7/10
语音识别 | 6.2/10
音频分类 | 8.5/10
标签分布学习 | 8.0/10
联邦学习 | 7.0/10
语音克隆 | 8.0/10
共 1 篇 ICASSP 2026 联邦学习 方向论文