📄 Probing Cross-modal Information Hubs in Audio-Visual LLMs
#音视频理解 #可解释性 #多模态模型
7.2/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1/1.5
✅ 7.2/10 | 前50% | #音视频理解 | #多模态模型 | #可解释性 | arxiv
👥 作者与机构
- 第一作者:Jihoo Jung(KAIST 电气工程系)
- 通讯作者:Joon Son Chung(KAIST 电气工程系)
- 作者列表:Jihoo Jung(KAIST 电气工程系)、Chaeyoung Jung(KAIST 电气工程系)、Ji-Hoon Kim(中央大学 先进影像科学研究生院)、Joon Son Chung(KAIST 电气工程系)
💡 毒舌点评
论文提出了一个有趣的反直觉发现:在音视频大模型中,承载跨模态融合信息的并非承载物体语义的"对象token",而是一类被视为信息盲区的"attention sink token"。这个发现本身对多模态LLM的机制理解有一定价值。但是,作者基于此洞察提出的ASD方法虽然训练免费,却带来了高达3.7倍的推理延迟,这对于一个"即插即用"的工程方案而言,实用价值大打折扣。更致命的是,所有实验仅局限于captioning任务,对更广泛的QA、推理等场景的适用性存疑。此外,AVLLM的可解释性领域整体体量尚小,该工作的实际影响力还有待时间检验。总体来看,洞察有趣但应用路径尚有距离,是一篇典型的"机制分析强但下游应用弱"的论文。
📌 核心摘要
论文对音视频大模型(AVLLM)的内部跨模态信息存储机制进行了探索。文章核心观点是:一个模态的信息被编码在另一个模态的token表示中,且这些信息的存储位置并非均匀分布,而是高度集中于注意力sink token。通过将因果追踪方法适配到AVLLM场景,并构建"单模态支配"筛选框架进行实验,作者发现:1) AVLLM的跨模态信息主要存储在sink tokens中,而非通常认为的对象tokens;2) 基于"模态支配分数"(MDS),可将sink tokens功能性地分为仅对本模态敏感的"单模态sink"和聚合多模态信息的"跨模态sink",后者才是真正的跨模态信息枢纽。基于此发现,论文提出了一种免训练的自适应sink引导解码策略(ASD),通过在生成时动态抑制单模态sink并放大跨模态sink的注意力权重,来缓解AVLLM特有的对象幻觉问题。实验覆盖了Qwen2.5-Omni、video-SALMONN-o1和video-SALMONN2+共三个系列五款模型(包括3B和7B规模),在因果追踪实验中,修补跨模态sink token的IE值大幅领先于修补对象token、随机token或单模态sink token。在幻觉缓解实验中,ASD在VGGSound-Animal数据集上将Qwen2.5-Omni (7B)的CHAIR_S从48.21降至36.91,video-SALMONN-o1 (7B)从37.74降至25.07,并显著提升ALOHa分数,优于PAI和VCD等基线。然而,该方法会使推理延迟增加约3.7倍,且目前仅验证了在caption任务上的有效性。
🏗️ 方法概述和架构
整体方法包含一个用于分析的因果追踪框架和一个基于分析发现的下游应用解码策略。
作者设计此框架旨在精确定位非主导模态中存储的主导模态信息。
样本筛选:构造"单模态支配"样本。对于音频-支配型样本,模型在仅听音频时预测正确(\(\hat{y}_a\)),仅看视频时预测错误(\(\hat{y}_v\)),且联合输入时的预测与音频一致(\(\hat{y}_{av} = \hat{y}_a \neq \hat{y}_v\))。视频支配型反之。这确保了主导模态提供决定性线索。
纯净/损坏/修复三阶段运行:
- 纯净运行:正常输入视频和音频,得到正确输出 \(o_{clean}\) 及其中间隐状态。
- 损坏运行:将主导模态的输入embedding置零,强制模型仅依赖非主导模态,得到错误输出 \(o_{corrupt}\)。
- 修复运行:在损坏运行的基础上,将非主导模态中特定子集 \(S\) 在自注意力层前的隐状态,替换为纯净运行中对应位置的隐状态 \(h_{clean}\)。作者通过实验验证,在自注意力前修补能最有效地传递跨模态信息。
间接效应指标:
- \(IE_{clean}(S) = P_{h_{clean}}[o_{clean}] - P[o_{clean}]\),衡量修补后恢复正确输出的能力。
- \(IE_{corrupt}(S) = P[o_{corrupt}] - P_{h_{clean}}[o_{corrupt}]\),衡量修补后对错误输出的抑制能力。数值越高,说明被修补的token子集 \(S\) 承载了越多的跨模态信息。
全局 Sink Token 定义:观察到AVLLM中sink token的层间变化剧烈,作者提出新的全局定义。对每个token \(j\),统计其在各层被判定为sink的频率 \(s_j = \sum_{l=1}^L \mathbb{I}[j \in \hat{\mathcal{I}}^l]\)。将频率最高的top-\(K\)个token作为全局sink token,其中 \(K = |T|/N\),\(N\) 为控制稀疏度的超参数。sink判定依据其在特定维度上的RMSNorm之后的massive activation是否超过阈值。
模态支配分数(MDS)与功能二分:定义第 \(l\) 层sink token \(i\) 的MDS为 \(MDS^l_i = (\bar{A}^l_{video,i} - \bar{A}^l_{audio,i}) / (\bar{A}^l_{video,i} + \bar{A}^l_{audio,i})\)。MDS显著为正表示其主要聚合视频注意力(视频-单模态sink),显著为负表示其聚合音频注意力(音频-单模态sink)。经过层平均后,将全局sink token按MDS排序并对半分为"跨模态sink"和"单模态sink"。
一个免训练的解码策略,旨在缓解因音视频失配引起的对象幻觉。
- 重校准前向传播:在解码的每一步,除正常前向外,执行一次校准前向。在校准前向中,对注意力权重进行调制:
- 对跨模态sink token \(j\),提升其注意力: \(\tilde{A}_{t,j} = A_{t,j} + \alpha|A_{t,j}|, \forall j \in S_{cross}\)
- 对单模态sink token \(j\),抑制其注意力: \(\tilde{A}_{t,j} = A_{t,j} - \alpha|A_{t,j}|, \forall j \in S_{uni}\) 其中 \(\alpha\) 为调制强度,设为0.6。此操作强制模型更多依赖融合了多模态信息的sink token。
- 动态融合系数:通过两步计算得到自适应校准系数 \(\gamma_t\)。
- 首先计算基础风险系数 \(\gamma^{base}_t = \bar{A}_{t,uni} / (\bar{A}_{t,uni} + \bar{A}_{t,cross})\),该值越高代表对单模态sink的注意力越强,暗示更高的幻觉风险。
- 然后应用带阈值的二次门控和动量平滑得到最终系数 \(\gamma_t\),公式为 \(\gamma_t = \beta \gamma_{t-1} + (1-\beta)\hat{\gamma}_t\)。
- 最终解码分布:在log-probability空间进行加权组合:
\(\log P(y_t|x, y_{
💡 核心创新点
- 首次揭示AVLLM中跨模态信息汇聚于sink token而非对象token,颠覆了在LVLM领域存在的对象中心假设,为多模态模型的可解释性研究提供了关键的新认知。
- 提出sink token的功能性二分法,通过MDS指标将sink token区分为单模态和跨模态两种,并实验证明跨模态sink才是跨模态信息的主要功能承载者,加深了对注意力机制内部功能特化的理解。
- 提出免训练的ASD解码策略,巧妙地利用单模态/跨模态sink的注意力失衡作为幻觉信号,通过注意力重定向实现实时校准,在多个AVLLM和数据集上一致降低了幻觉率。
- 将因果追踪方法成功适配到双向音视频场景,构建的"单模态支配"筛选框架解决了在AVLLM中追踪跨模态信息流动的难题。
📊 实验结果
因果追踪实验 表1证实了在音频和视频两个主导方向下,修补sink token(3种数量设置)对恢复正确预测(\(IE_{clean}\))和抑制错误预测(\(IE_{corrupt}\))的效果均显著优于修补等量的对象token或随机token。
| Modality | Ablation | Qwen2.5-Omni(7B) | Qwen2.5-Omni(3B) | video-SALMONN-o1(7B) | video-SALMONN2+(7B) | video-SALMONN2+(3B) | |||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| IE_clean↑ | IE_corr↑ | IE_clean↑ | IE_corr↑ | IE_clean↑ | IE_corr↑ | IE_clean↑ | IE_corr↑ | IE_clean↑ | IE_corr↑ | ||
| Audio | Object | 5.04 | 2.44 | 3.53 | 1.12 | 16.22 | 15.06 | 3.78 | 3.93 | 0.72 | 1.16 |
| Dominant | Sink(N=2) | 6.24 | 2.94 | 6.99 | 2.70 | 25.33 | 22.73 | 4.79 | 4.20 | 1.33 | 1.38 |
| Random(N=2) | 4.24 | 2.37 | 4.05 | 1.20 | 20.43 | 18.11 | 4.21 | 4.01 | 1.09 | 0.95 | |
| Video | Object | 4.97 | 8.44 | 1.59 | 6.41 | 2.07 | 0.40 | 0.22 | 1.71 | -0.01 | -0.06 |
| Dominant | Sink(N=2) | 5.47 | 8.54 | 2.07 | 6.87 | 3.57 | 3.87 | 0.28 | 2.24 | -0.02 | 0.00 |
| Random(N=2) | 4.56 | 6.83 | 1.22 | 5.29 | 2.86 | 2.22 | 0.21 | 1.77 | -0.02 | 0.01 |
表2通过进一步将sink token二分,证明跨模态sink的修复效果远超单模态sink,且非常接近完整sink set的效果,表明跨模态信息高度集中在跨模态sink上。
| Modality | Ablation(N=2) | Qwen2.5-Omni(7B) | Qwen2.5-Omni(3B) | video-SALMONN-o1(7B) | video-SALMONN2+(7B) | video-SALMONN2+(3B) | |||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| IE_clean↑ | IE_corr↑ | IE_clean↑ | IE_corr↑ | IE_clean↑ | IE_corr↑ | IE_clean↑ | IE_corr↑ | IE_clean↑ | IE_corr↑ | ||
| Audio | Sink | 6.24 | 2.94 | 6.99 | 2.70 | 25.33 | 22.73 | 4.79 | 4.20 | 1.33 | 1.38 |
| Dominant | Unimodal | 0.65 | 0.23 | 0.89 | 0.31 | 7.25 | 6.82 | 2.32 | 3.03 | 0.21 | 0.45 |
| Crossmodal | 5.58 | 2.95 | 6.57 | 2.33 | 21.30 | 19.93 | 4.16 | 3.69 | 1.27 | 1.14 | |
| Video | Sink | 5.47 | 8.54 | 2.07 | 6.87 | 3.57 | 3.87 | 0.28 | 2.24 | -0.02 | 0.00 |
| Dominant | Unimodal | 1.93 | 3.54 | 0.35 | 3.43 | -0.01 | -5.00 | 0.18 | 1.31 | 0.00 | 0.03 |
| Crossmodal | 3.03 | 4.53 | 1.25 | 4.48 | 3.53 | 3.72 | 0.26 | 2.19 | -0.02 | 0.01 |
幻觉缓解实验 表3显示ASD在多个数据集上对两个主模型的幻觉缓解效果。在幻觉问题最突出的VGGSound-Animal数据集上,ASD显著降低CHAIR-S(Qwen模型降低11.3个百分点,SALMONN模型降低12.7个百分点),ALOHa分数也大幅提升。在更通用的VGGSound-All和AudioSet上,ASD同样有效且未显著损害描述丰富度(F1)。相比之下,PAI和VCD等基线方法则表现不稳定甚至加剧幻觉。
| Dataset | Method | Qwen2.5-Omni(7B) | video-SALMONN-o1(7B) | ||||||
|---|---|---|---|---|---|---|---|---|---|
| ALOHa↑ | Cs↓ | Ci↓ | F1↑ | ALOHa↑ | Cs↓ | Ci↓ | F1↑ | ||
| VGGSound-Animal | Vanilla | 40.71 | 48.21 | 37.13 | 55.24 | 36.21 | 37.74 | 32.09 | 53.68 |
| PAI | 39.52 | 51.24 | 38.11 | 55.11 | 36.99 | 35.26 | 31.18 | 53.16 | |
| VCD | 40.27 | 51.52 | 41.28 | 52.43 | 36.40 | 39.39 | 33.40 | 53.37 | |
| ASD | 42.77 | 36.91 | 34.15 | 52.44 | 43.29 | 25.07 | 25.71 | 50.89 | |
| VGGSound-All | Vanilla | 35.02 | 30.70 | 20.67 | 58.69 | 32.74 | 30.63 | 22.39 | 53.40 |
| ASD | 38.89 | 29.65 | 21.74 | 55.81 | 36.63 | 21.11 | 18.42 | 50.10 | |
| Audioset | Vanilla | 38.24 | 8.92 | 10.93 | 69.73 | 36.81 | 11.39 | 14.91 | 67.27 |
| ASD | 38.32 | 8.54 | 10.20 | 72.98 | 39.64 | 6.57 | 9.50 | 67.29 |
此外,消融实验表明ASD对超参数 \(\alpha\) 在0.2-0.8的广阔范围内表现鲁棒。附录中的定性结果和与AVCD、FMD等AVLLM专用解码方法的对比进一步证明了ASD的SOTA性能。一个反事实实验(reverse ASD)证实了抑制跨模态sink、增强单模态sink会恶化性能,验证了ASD逻辑的正确性。
🔬 细节详述
- 数据集:因果追踪样本取自VGGSound测试集,选取了音频/视频各20个主导类,经模型单模态预测一致性筛选后保留有效样本(各模型数量不同,从141到890不等)。幻觉评估使用三个数据集:从VGGSounder衍生的VGGSound-Animal(约360个单标签样本)和VGGSound-All(约1200个多标签样本),以及一个清洗过的AudioSet子集(约680个样本)。使用DETR检测视频帧中的物体以扩展CHAIR所需的ground-truth物体集,并使用GPT-3.5-turbo实现开放词表的ALOHa评估。
- 模型与修补设置:涵盖Qwen2.5-Omni和video-SALMONN系列的3B/7B模型。修补操作统一在自注意力子层之前进行,使用来自纯净运行的同一层全层隐状态。
- Sink Token 识别细节:sink维度 \(D_{sink}\) 基于各个模型基座LLM的BOS token的massive activation维度确定(如Qwen系列多为
{458, 2570})。阈值 \(\tau\) 根据模型设定在20到25之间。全局sink通过 \(K = |T|/N\) 计算,其中 \(N\) 设为2, 3, 4以适应不同序列长度。 - ASD超参数与实现:调制幅度 \(\alpha=0.6\),最大引导系数 \(\gamma_{max}=0.6\),门控阈值 \(\tau=0.6\)(用于基础风险系数)和 \(\rho=0.5\)(用于文本token注意力比例),动量系数 \(\beta=0.7\)。解码步骤需进行两次前向传播,导致约3.7倍的延迟。
- 对比基线:将PAI(Pay Attention to Image)和VCD(Visual Contrastive Decoding)两种图像/视觉领域的免训练方法适配到音视频场景,即同时增强/扰动音频和视频输入。
⚖️ 评分理由
创新性 (1.3/2):研究动机明确,发现了跨模态信息汇集于sink token这一反直觉现象,并创造性地将其分为单向/跨模态两类,为AVLLM的可解释性提供了有价值的洞察。然而,技术方法层面,因果追踪和sink分析均借鉴了NLP和LVLM领域的现有框架,ASD本质上是注意力重分配的解码策略,整体属于机制驱动的高质量增量创新。
技术严谨性 (1.1/1.5):因果追踪的实验设计细致,修补位置的验证具有说服力,MDS的定义清晰。但ASD中的多个超参数(\(\tau\), \(\rho\), \(\gamma_{max}\))仅依赖直觉设定,缺少充分的敏感性分析;对视频主导模式下video-SALMONN2+模型IE值极低的边界情况解释不足。
实验充分性 (1.0/1.5):实验覆盖了近期主流AVLLM和多组对照,证明了核心发现的稳健性。但下游应用仅评估了captioning任务,未测试QA等更广泛场景,严重限制了方法通用性的证明;未进行人工评估,扩展的CHAIR词表的可靠性未经人工验证。
清晰度 (0.8/1):论文行文和主图清晰,但在ASD的核心计算流程(特别是二次门控和动量平滑的细节)上,正文描述过于简略,必须依赖附录才能完全理解。
影响力 (0.6/1.5):为新兴的AVLLM可解释性领域提供了奠基性经验证据,可能为后续模型设计提供启发,但其本身的工程应用(ASD)有严重延迟缺陷,领域也较为小众,影响力有限。奖励原创性高但未来影响路径不清晰。
开源 (1.0/1.5):论文提供了GitHub代码仓库链接,作者承诺公开核心代码。作者与机构非顶尖实验室,未公开模型权重、处理好的数据集或一键式复现脚本。此评分与此描述保持一致性。
可复现性 (0.4/0.5):附录提供了详尽的实现细节(如sink维度、阈值等),结合后续公开的代码,可复现性较高。但部分依赖大模型API(如GPT-3.5-turbo用于ALOHa)的评估可能导致结果略有波动。
工程/实践价值 (1.0/1.5):提供了一种即插即用的AVLLM幻觉缓解方案,训练免费的思路具有工程吸引力。但高达3.7倍的推理延迟是严重的实际部署障碍。对sink token干预这一方法论本身对模型调试和后续优化有参考价值。
🚨 局限与问题
论文已承认的局限:
- 受限于GPU内存,分析仅限于30B参数以下的模型,结论在大模型上的泛化性未知。
- ASD方法当前只针对Captioning任务有效。
- ASD会引入约3.7倍的推理延迟。
审稿人发现的潜在问题与批判:
- ASD实用性的致命伤:虽然论文提及了3.7倍的延迟,但对其影响轻描淡写。对于任何对实时性有要求的应用,这几乎是不可接受的。这严重削弱了ASD作为"免训练插件"的工程价值,使其更像是一个概念验证(Proof of Concept)。
- 任务泛化性严重不足:所有ASD实验均在Captioning任务上进行。论文并未讨论或展示该方法是否能推广到VQA等更开放的任务中,泛化性存疑。很可能是该方法依赖于Captioning任务相对固定的输出格式来检测幻觉。
- 循环验证风险:单模态支配样本的筛选(公式1, 2)和因果追踪结果均基于同一个待分析模型。这可能导致分析发现的"信息存储规律"是该模型特异性偏好的反映,而无法保证其为所有AVLLM的普遍内禀属性。
- 门控机制的模糊:ASD中的超参数 \(\tau\)、\(\rho\) 是基于经验设定的全局值,其在不同模型、数据集和解码步上的泛化能力未经充分论证。特别是,当模型很少犯幻觉时,强行启用门控是否会干扰正常生成,缺少深入分析。
- 评估指标的局限:依赖自动指标和GPT-3.5模型评估语义相似度,缺少严格的人类评估。扩展的CHAIR词汇虽然必要,但其与特定数据集的匹配度和查全率未经人工审核,可能存在系统偏差。
- 深层问题:泛化性是否受限于架构? 该方法的核心依赖于AVLLM中拼接音频/视频token并交给LLM骨干处理的架构。对于未来可能出现的更深度融合架构(如Q-Former等交叉注意力机制),此方法是否仍能直接适用,存有很大的不确定性。