Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs
📄 Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs #多模态模型 #鲁棒性 8.8/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8.8/10 | 前25% | #多模态模型 | #鲁棒性 | arxiv 👥 作者与机构 Hyebin Cho, Suho Yoo, Jaehyuk Jang, Changick Kim, Joon Son Chung School of Electrical Engineering, KAIST 💡 毒舌点评 论文选题精准,击中了多模态大模型“指鹿为马”的痛点。研究方法的“外科手术”式解剖(电路发现与因果消融)很有范儿,得出的“主动抑制”结论比“信息丢失”更有趣。但手术只做了分类手术,没敢在开放式生成的“大活人”身上试刀,说服力打折扣。反向补丁方法简单粗暴但有效,不过像是个急救措施而非根治方案,层选择全靠试,缺乏优雅的理论指导。代码开源“挤牙膏”,只给了个没链接的库名,复现门槛不低。整体看,是一篇扎实的阶段性研究,但离“完全搞清楚”还有距离。 ...