SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations
📄 SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations #音频理解 #语音识别 8.4/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.4/10 | 前25% | #音频理解 | #自监督学习 | #语音识别 | arxiv 👥 作者与机构 第一作者/通讯作者:Xiaoyu Yang(Department of Engineering, University of Cambridge) 作者列表:Xiaoyu Yang(University of Cambridge)、Yifan Yang(Shanghai Jiao Tong University)、Zengrui Jin(Tsinghua University)、Ziyun Cui(Tsinghua University, Shanghai Artificial Intelligence Laboratory)、Wen Wu(Shanghai Artificial Intelligence Laboratory)、Baoxiang Li(Shanghai Artificial Intelligence Laboratory)、Chao Zhang(Tsinghua University, Shanghai Artificial Intelligence Laboratory)、Phil Woodland(University of Cambridge) 💡 毒舌点评 SPEAR 用多码本矢量量化(MVQ)这把快刀,把语音和音频两个域的知识剁成离散 token,再让 Zipformer 用掩码预测全吞下去。思路直接有效,在 SUPERB 和 HEAR 上双线刷榜,token mixing 更是让分离任务表现惊艳。但整个框架的命门在于强依赖教师模型质量,训练 pipeline 重得像个工程怪兽,且音频数据仅 13k 小时,想在纯音乐或环境声上压制音频大模型还差火候。说是统一框架,但目前还是个理解专才,生成任务的门都没摸到。 ...