Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation
📄 Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation 标签:#语音质量评估 #音频大模型 #模型评估 #可解释性 #音频理解 8.2/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音质量评估 | #音频大模型 | #模型评估 #可解释性 | arxiv 👥 作者与机构 第一作者:Joonyong Park(东京大学工学系研究科) 通讯作者:未说明 作者列表:Joonyong Park(东京大学工学系研究科)、David M. Chan(未说明)、Yuki Saito(东京大学工学系研究科)、Hiroshi Saruwatari(东京大学工学系研究科) 💡 毒舌点评 本文精准地刺中了LALM-as-a-judge范式中一个被严重忽视的要害:评估协议本身可能就是最大的“作弊器”。其方法论上的亮点在于,将审计从“模型是否偷懒”提升到“协议是否诱导偷懒”的层面,并设计了针对蓝图、参考、成对比较三种典型协议的成套反事实探针。实验规模扎实,跨模型、跨属性、跨协议的系统性比较令人信服地揭示了“协议级”与“能力依赖”两类快捷方式。然而,本文最大的短板在于“只破不立”。它出色地诊断了病症,但开出的药方(如谨慎选择协议)过于笼统,缺乏对协议设计、提示工程或模型训练的具体、可操作的改进方案。这使得其贡献更像是一份给社区的“风险预警报告”,而非一套“免疫增强方案”,工程落地价值因此大打折扣。 ...