Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding
📄 Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding 标签:#语音识别 #强化学习 #参数高效微调 #多模态模型 #说话人日志 6.6/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #强化学习 | #参数高效微调 #多模态模型 | arxiv 👥 作者与机构 第一作者:Pengfei Zhang(机构标为¹,未注明具体名称) 通讯作者:Li Liu(机构标为¹,未注明具体名称) 作者列表:Pengfei Zhang¹、Biao Tian²、Tianxin Xie¹、Minghao Yang¹、Xiangang Li²、Li Liu¹(通讯作者) 注:原文以脚注¹和²标注作者隶属关系,但脚注中未给出机构全称,所有机构均为"未说明" 💡 毒舌点评 论文用一句"Listen, Do Not Copy"干净地暴露了全模态模型在文本线索面前的感知绕过捷径——沉默测试这招虽不复杂但直击要害,迫使研究者正视"高分不等于好听力"的尴尬。然而AGSC的内部化收益呈现出明显的马太效应:弱模型Ming狂降56个百分点,最强Qwen3仅降16点且全链训练中CI包含零,让"通用解决方案"的说服力打了折扣。全链强化训练下门控频繁崩溃、靠额外SFT步骤恢复的应急方案更像工程补丁而非理论突破,离生产级鲁棒仍有一段路。 ...