MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond
📄 MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond 标签:#语音识别 #参数高效微调 #低资源 #持续学习 #音频理解 8.2/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #LoRA | #参数高效微调 #低资源 | arxiv 👥 作者与机构 第一作者:Lorenzo Concina(Fondazione Bruno Kessler, Center for Augmented Intelligence; University of Trento, Department of Information Engineering and Computer Science) 通讯作者:未明确说明,但机构邮箱表明主要作者均可联系 作者列表:Lorenzo Concina, Seraphina Fong, Marco Matassoni, Alessio Brutti(均来自Fondazione Bruno Kessler, Center for Augmented Intelligence; 其中第一、二作者同时隶属University of Trento) 💡 毒舌点评 MEUSLI将SLAM风格投影器铺开到28种欧洲语言,低资源引导和数据回放实验戳中了多语言语音LLM的痛点,工程价值扎实。然而,与Whisper的对比存在显著的数据规模和训练范式不对等,作者虽诚实声明却未做控制实验,使得"优于Whisper"的结论更像LLM先验知识的胜利而非投影器设计的优越性。多任务实验的预训练数据泄露削弱了结论可信度,且Table 1中声称的"完全开源"优势在缺乏与SALMONN、Qwen-Audio等模型公平多语言ASR对比的情况下,说服力打了折扣。 ...