📄 From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs #语音识别 #多模态模型
6.5/10
✅ 6.5/10 | 前50% | #语音识别 | #多模态模型 | arxiv
👥 作者与机构 Wish Suharitdamrong, Muhammad Awais, Xiatian Zhu, Sara Atito。 机构:Surrey Institute for People-Centred AI (PAI), University of Surrey, UK;Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, UK。
💡 毒舌点评 这篇论文在机械可解释性领域做了一个扎实的、系统性的工作,把针对视觉语言模型(VLM)和视频语言模型(VideoLLM)的信息流分析方法扩展到了音频-视觉语言模型(AVLLM)。文章结构清晰,从观察到不可靠的注意力模式入手,到使用因果干预追踪信息流,再到利用新发现提升效率,逻辑链条完整。主要贡献在于填补了AVLLM信息流动机分析的空白,并发现了任务依赖的路由机制。然而,这项工作的“音频”属性略显薄弱。虽然研究对象是多模态,但核心分析方法(注意力消除、token丢弃)和主要发现(顺序流、并行流、汇聚点)在之前的VLM/VideoLLM研究中已有类似报道。论文的增量创新更多体现在应用场景的扩展和验证上,而非方法或理论上的重大突破。此外,结论的普适性受限于所选模型和任务,作者自己也承认开放生成任务可能不同。对于寻求音频领域独有洞见的读者,本文的启发可能有限,其价值更多体现在通用多模态模型的可解释性和效率优化方向上。
📌 核心摘要 本文首次系统研究了音频-视觉大语言模型(AVLLM)内部的信息流动机制。研究者通过注意力消除这一因果干预手段,追踪了音频和视觉信号如何在网络中路由、整合以形成最终预测。主要发现包括:1) 在音频-视觉视频输入中,信息遵循单一的顺序路径:模态信息首先在早中期层进行交互并汇聚到问题token(作为聚合点),随后问题token将信息传递至最后一个token以生成预测,且各模态的贡献比例由任务需求动态调节。2) 在多个交错音视频输入的配置中,信息流动转变为两条并行路径:一条是“候选项+问题->参考项->最后一个token”,另一条是“候选项->选项字母->最后一个token”。3) 后期层的视频注意力尖峰实为由巨大激活值驱动的“视觉注意力池”工件,不传输有用信息。4) 音频、视频及非选项文本token在完成信息传递后,可被丢弃而几乎不影响模型精度,甚至略有提升。这些发现在多个模型(Qwen2.5-Omni, Video-SALMONN2 Plus)和多个数据集(AV-SpeakerBench, WorldSense, AV-Odyssey)上得到验证。基于此,论文提出了一种新的AVLLM效率优化思路:在模型中间层丢弃已传递信息的冗余token。
...