谁来打标签、谁来稳住训练:半监督联邦语音识别的在线教师与服务器锚点
该文研究服务器只有少量标注种子、客户端只有无标注语音的半监督联邦 ASR,用每客户端在线教师打伪标签加轮间服务器有监督更新做锚点,最强证据是稳定后在线教师在域内和多数跨域上持平或超过全局教师,代价是必须把服务器增强强度和批量调进稳定区间否则发散。
该文研究服务器只有少量标注种子、客户端只有无标注语音的半监督联邦 ASR,用每客户端在线教师打伪标签加轮间服务器有监督更新做锚点,最强证据是稳定后在线教师在域内和多数跨域上持平或超过全局教师,代价是必须把服务器增强强度和批量调进稳定区间否则发散。
针对序列级塔布拉鼓点转录标注稀缺问题,该工作用教师模型生成伪标签、S-CEM 估计每个鼓点可信度、CMW-ATC 在不确定片段上按马尔可夫转移加权候选序列,在三组评测上把序列错误率降到 18.3、33.3 和 12.7,但仍需序列级标注和固定转移矩阵。
共分析 26 篇语音/AI 论文
针对标注少且跨天跨点易失效的动物声音时频框检测,MAST 用域内掩码预训练加适配检测器再加两阶段自训练,在雨林和鸟类两域的分布外评测上提升 F1 与 mAP,代价是第二轮后域内精度波动与更大计算量。
针对蝙蝠被动声学监测中标注稀缺问题,论文固定紧凑 BAT 骨干比较半监督路线与目标构造,报告伪标签在欧洲十分之一标签下闭合至多 61.5% 全监督差距并迁移到南非野外录音,同属加均匀平滑再提升物种宏 F1 达 4.73 个百分点。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对和弦标注稀缺与分布不平衡问题,该工作先用预训练 BTC 教师在 1000 多小时无标注音频上生成伪标签训练学生,再用少量真值标签加选择性知识蒸馏做数据增量持续训练,最强 BTC 学生在七个 mir_eval 指标上超过教师与监督基线,代价是依赖教师质量并需保存完整软目标带来额外显存开销。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对两说话人 Hindi-English 医疗对话的说话人日志任务,论文比较 Diaper、Pyannote 3.1 与 DiariZen 并做域自适应,最强证据是解冻 WavLM 的 DiariZen-large 在 dev2 上达 8.57% DER、六系统融合后达 8.48% DER,代价是半监督策略高度依赖模型且融合增加系统复杂度。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对整段临床对话只有一个会话级标签且病理性表现稀疏不均匀的问题,该工作用会话级聚合、片段级伪标签与帧级一致性三层联合的纯音频半监督框架学习,在中英文抑郁与阿尔茨海默数据上以极少标注逼近全监督,并以消融与伪标签演化分析揭示收益与代价。
针对半监督歌声旋律提取中频域增强敏感与一致性正则化丢弃约半数无标注数据的问题,论文提出分频带扩散增强、全局-类别置信筛选与通道交叉注意力三模块组合,在 ADC2004 等四套测试上相对 MCSSME 的 OA 提升 0.9% 至 7.7%,代价是引入扩散迭代与记忆库等额外结构与调参面。
语音自信度检测 | 6.5/10
共分析 22 篇语音/AI 论文
语音识别 | 8.0/10
歌唱旋律提取 | 7.5/10
音乐信息检索 | 8.0/10
语音识别 | 7.5/10
语音识别 语音翻译 | 7.5/10