英文题目:Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
会议身份:
conference:interspeech:2026:conference-paper-id:cappellazzo26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#多模态学习 #统计分析 #鲁棒性 #音视频语音识别
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Umberto Cappellazzo:机构信息未能从会议 PDF 纯文本可靠映射
- Stavros Petridis:机构信息未能从会议 PDF 纯文本可靠映射
- Maja Pantic:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频语音识别以带噪语音与唇部视频为输入并自回归生成转写文本,难点是音频易学导致干净时视觉几乎被忽略、噪声下又利用不足。本文提出解码相对模态贡献框架 Dr. SHAP-AV,先为每个生成词元定义期望对数概率特征函数并以置零近似缺失特征,再经置换采样估计输入特征到输出词元的细粒度Shapley矩阵,随后派生全局平衡、生成过程轨迹与输入输出时间对齐三类指标。与仅做分类器或固定条件归因的MM-SHAP不同,该工作同时适配大语言模型拼接输入与编码器解码器交叉注意力结构,并引入信噪比扫描与时序分析以揭示动态加权机制。在LRS2基准评测条件下,Llama-AVSR在-10dB噪声条件的音频贡献指标为46.0%,低于干净条件的音频贡献指标65.4%,说明存在持续音频偏置。该结论限于英语句子级 LRS2 与 LRS3 推理时分析,未验证训练干预或实时部署效果。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
任务是什么:噪声下为什么还要看嘴型?
输入是同步采集的语音波形与说话人唇部视频,目标是输出与语音内容一致的文字转写。评价用词错率,数值越低越好。刚入门容易把这个任务理解成给语音识别模型再加一路视频,但论文要解决的不是把词错率再压低一点,而是回答模型在推理时到底用了多少声音、用了多少嘴型。
干净条件下声音本身分辨率高、信息完整,嘴型帧率低且很多音素看起来相近,所以模型容易只学声音。噪声条件下声音被破坏,嘴型不受声学噪声影响,理论上应接管更多决策。论文先做了一个直接的消融动作:在推理时把全部音频词元或全部视频词元置零,分别退化为纯视觉或纯听觉系统,再与完整音视系统比较。
下面这张消融对比图是理解全文动机的起点,它只测干净条件,横轴是对数刻度的词错率,目的是让相差一到两个数量级的退化同时可见。
看图路径: 1. 先确认纵轴六个模型名称与横轴词错率对数刻度;2. 再对比每个模型内红色音频保留条与青色视频保留条的长度;3. 最后看黄色完整音视条是否紧贴红色条
论文图 1。原论文 Figure 1:“WER comparison (↓) when ablating audio or video modalities across six state-of-the-art AVSR models in clean con- ditions. Note that the x-axis is displayed on a logarithmic scale.”。
从像素可见,每个模型有 3 条横条:红色是保留音频、青色是保留视频、黄色是完整音视。黄色条普遍紧贴红色条,说明干净时只留音频已接近完整系统;而青色条大幅右移,多数模型的纯视觉词错率比完整系统高一到两个数量级。原文指出,只在多任务目标中包含纯视觉任务的 2 个模型保留了相对更强的视觉能力,其余 4 个只做音视任务的模型在去掉音频后几乎崩溃。这个不对称说明不能只看干净词错率就断言融合有效,必须用与正确性无关的归因工具度量内部到底偏向哪一侧。
已有路线解释了什么,还缺哪一块?
音视语音识别经历了手工融合、变换器、自监督预训练、蒸馏标注和互补建模等路线。近期的大语言模型路线把语音表示与大语言模型对齐,在词错率上达到领先。另一条主线是用大规模无标注音视数据做掩码聚类预测,代表是音视自监督模型。
关于模态利用,已有工作分别从缺失视频帧的鲁棒性、人类感知视角的视觉利用不足、以及可解释技术看视素编码等角度切入。论文明确指出这些工作集中在单个模型或经验观察,没有跨 6 个主流模型的统一数学框架。
沙普利归因在多模态已有先例:编码器分类任务的整体模态占比方法,以及扩展到自回归视觉语言解码器和音频大语言模型音乐理解的工作。论文的定位是把该工具扩展到语音识别的自回归解码,并同时覆盖大语言模型拼接与编码器解码器交叉注意力两大家族,而不是只做其中一类。
核心问题如何拆成可测量的三件事?
论文提出的研究问题是:音视模型如何平衡音频与视觉贡献,声学条件、解码过程和输入特性分别如何塑造这种平衡。这个问题被拆成 3 个可计算的子问题。第一是总体平衡随信噪比如何移动,需要一个标量占比。第二是平衡在生成每个词元的过程中是否变化,需要按生成进度分窗的时间序列。第三是输入特征位置与输出词元位置是否存在时序对应,需要输入分箱与输出分箱的联合分布。
举例说明:假设一句话有 6 秒,前 2 秒的口型是否主要影响前几个输出词,这就是第 3 个问题;整句在干净与强噪声下音频占比从多少变到多少,这是第一个问题;而解码到句尾时是否比句首更依赖音频,这是第二个问题。3 个问题共用同一张沙普利矩阵,只是聚合维度不同。
三层分析共用一张什么表?
方法全景可以沿一个样本走一遍。输入是音频特征序列与视觉特征序列,长度可能不同。模型在推理时给定历史词元,逐个生成当前词元的对数概率。对每个输出位置,方法考虑全部输入特征的所有子集,计算加入某个特征前后的预测变化,再按联盟大小加权平均,得到该特征对该词元的沙普利值。全部特征与全部词元构成矩阵,行是输入特征,列是生成词元。
音频特征 × 视觉特征: 音频特征指从语音信号抽取的声学表示,时间分辨率高且直接编码音素;视觉特征指从唇部视频抽取的口型表示,帧率较低且多音素视觉相似。两者分工是音频提供主体判别信息、视觉提供噪声免疫的互补约束,搭配理由是两者在时间上自然同步,组合意义是让解码器在音频退化时仍能维持时序对应。
从该矩阵出发,左路是对所有行列取绝对值求和得到全局音频占比与视觉占比;中路是把列按生成进度切成若干窗口,每个窗口内同样求和得到随解码推进的轨迹;右路是把行按输入时间分箱、列按输出时间分箱,计算每个输入箱的贡献分布到各个输出箱的比例,用对角结构判断时序对齐。下图把 3 路聚合画在一起,颜色深浅表示归因大小,虚线框表示聚合范围。
看图路径: 1. 先沿行看上半音频特征与下半视觉特征如何对应列的生成词元;2. 再看左中右三块虚线框分别是全聚合、分生成窗、分输入输出双向分箱;3. 最后确认箭头指向的音频沙普利与视频沙普利输出位置
论文图 2。原论文 Figure 2:“Overview of the three proposed SHAP-based analyses in Dr.”。
读图后要记住的关键点是:绝对值的使用是因为只关心贡献大小,不关心是增加还是降低概率;音频占比等于一减去视觉占比;0.5 表示平衡,大于 0.5 表示音频主导。后续所有结论都是对这张矩阵的不同切法,不引入新的训练目标。
沙普利值在自回归语音识别中如何计算?
沙普利值的参与者是输入特征,收益是模型对某个已生成词元的期望对数概率。特征函数定义为只观测子集时模型的期望预测,不在子集中的特征被掩码为零。实际实现不做显式边缘化,而是做 1 次掩码后的前向。论文强调该归因与性能无关,只度量模型内部如何利用输入,而不问输出是否正确,这正是它适合诊断偏置的原因。
沙普利值 × 模态贡献: 沙普利值指合作博弈中按所有联盟边际贡献加权平均的公平分配,满足有效性与对称性;模态贡献指音频或视觉全部特征的归因绝对值占比。沙普利值负责给出与正确与否无关的预测行为归因,模态贡献负责把细粒度归因聚合成可比的百分比,两者搭配才能把逐词元概率变化转化为整体音频偏置的诊断量。
精确计算需要评估二的特征数次方个联盟,不可行。论文用两种无偏近似并对比:置换沙普利采样随机排列并估计边际贡献,采样沙普利经蒙特卡洛采样联盟求和。两者都用已有库实现,采样联盟数设为 2000。原文报告减小该数会在低信噪比下方差增大,因此后续主结果用计算更快的置换沙普利呈现。
大语言模型架构 × 编码器解码器架构: 大语言模型架构指把音频与视觉投影为词元并与提示词拼接后送入自回归大语言模型;编码器解码器架构指用独立音视频编码器抽表示再由解码器经交叉注意力读取。前者分工是靠自注意力统一融合,后者分工是靠交叉注意力分别读取,搭配研究的原因是两者掩码位置与融合机制不同,组合比较才能检验结论是否跨架构成立。
掩码位置因架构而异,这是复现时最容易出错的地方。对大语言模型类,在投影层之后掩码送入大语言模型的音频与视频词元;对先融合再编码的模型,在融合前掩码对应模态特征;对用门控交叉注意力分别读取视觉的模型,在解码器消费前掩码被交叉注意的模态特征。由于音频与视频编码分辨率不同,论文对高分辨率音频做了分组掩码,使每个掩码单元覆盖相同时间长度,避免系统性偏向音频。
全局沙普利 × 生成式沙普利: 全局沙普利指对全部输入特征与全部输出词元取绝对归因求和后的模态占比;生成式沙普利指按输出进度分窗后每个窗口内的同样占比序列。全局负责回答总体偏向哪一模态,生成式负责回答偏置在解码初期与末期是否变化,组合意义是避免单标量掩盖解码动态。
全局、生成式与对齐三式的输入都是同一矩阵,只是归一化分母不同:前两者是在模态间归一化得到占比,后者是在输出箱之间归一化使每行和为一,从而突出时序分布而非总量。
本研究训练了什么,没有训练什么?
本研究没有训练任何新的识别模型,6 个模型全部取已有检查点并在推理时计算归因。原文列出的模型包括 3 个大语言模型类与 3 个交叉注意力类,音频编码器多用中等规模语音模型,视频编码器多用大规模音视自监督编码器,大语言模型骨干为 1000000000 参数量级的指令模型,并对音视频特征做了不同倍数的下采样以对齐帧率。
需要补的缺项是:论文未报告归因阶段的梯度更新、参数冻结细节与优化器,因为根本不存在归因阶段的训练;它也未报告从头训练的资源消耗。真实计算过程是推理加掩码重算:对每个样本、每个信噪比条件、每个采样联盟做 1 次前向,取对数概率计算边际贡献并平均。2000 个联盟意味着单样本成本是普通解码的数千倍,这是该方法作为常规诊断的最大代价。论文致谢中提到集成了外部提供的模型权重,实验在高校本地完成,但未给出硬件预算与总耗时,复现时需按自己的卡数重新估算。
数据、噪声与比较条件是否一致?
数据用两个主流基准:取自英国广播节目的二百余小时数据集,以及取自英文演讲视频的四百余小时数据集。主结果在后者上报告,前者用于检验趋势是否跨数据集成立。噪声通过在干净语音上叠加不同类型实现,信噪比从负 10 分贝到干净无穷大覆盖多个档位。原文明确说明不同模型家族用的噪声来源不同:大语言模型类与一个融合模型用噪声库中的巴布尔噪声,另 2 个模型用音乐语音噪声库中的巴布尔噪声,因此跨家族的绝对值比较需谨慎,同家族内的随信噪比趋势更可信。
指标有两个:词错率用于报告识别好坏,方向越低越好;音频占比与视频占比用于报告内部利用,方向无好坏,只是诊断。生成式分析聚焦 20 个最长语句以保证窗口估计稳定,窗口数取五;对齐分析把输入与输出位置归一化为百分比后再分箱,细粒度用 10 乘 10,粗粒度用 3 乘 10。比较的公平条件是同一掩码策略、同一联盟数、同一解码配置,只改变信噪比、噪声类型、语句时长或词错率分组。
信噪比变化时音频占比如何移动?
要回答的核心比较问题是:在输入质量从干净变到严重退化时,各模型的音频占比是否单调下降,下降多少,是否存在完全转向视觉的点。指标方向是音频占比越高表示越依赖声音。下表把原文报告的区间整理为可复述的对照,单位为百分比,数值保留原文写法。表前已说明噪声源跨家族不一致,因此重点看每行自身的跨条件变化,而非行之间的微小差距。
| 模型 | 负 10 分贝音频贡献 | 0 分贝音频贡献 | 干净音频贡献 | 适配形态 |
|---|---|---|---|---|
| 多数模型总体区间 | 39-46% | 未报告单一值 | 63-73% | 随信噪比上升而上升 |
| 门控交叉注意力模型 | 40% | 66% | 干净段趋平 | 负信噪比段快速爬升 |
| 固定权重融合模型 | around 57% 附近 | around 57% 附近 | around 57% 附近 | 几乎水平无适配 |
信噪比 × 词错率: 信噪比指语音与噪声能量比,控制输入声学质量;词错率指转写错误词占比,衡量最终识别好坏。信噪比负责作为可控的输入条件,词错率负责作为输出结果难度分组,搭配分析才能区分模态权重是被输入质量驱动还是被识别难易驱动,论文结论是前者主导。
上表的主要收益是确认了自适应:多数模型在强噪声下音频占比降至 40% 左右,干净时升至六到 70%。但代价与反例同样清楚:即使在负 10 分贝这种应接近全靠视觉的条件下,音频仍占近 40%,存在持续的音频偏置;固定权重融合模型几乎不随信噪比变化,说明其多层感知机融合学的是固定权重,而注意力机制才能动态调节。原文还报告混合专家路由模型在极端噪声下音频最低,约为 39%,而多任务训练的模型在全条件保持相对更高的音频依赖。
下面这张双面板曲线是主证据,左右分别为两种沙普利近似,结果形状一致,支持 2000 次采样的稳定性。
看图路径: 1. 先确认横轴从负 10 分贝到无穷大干净语音的信噪比顺序;2. 再对比左图置换沙普利与右图采样沙普利的曲线形状是否一致;3. 最后找出几乎水平的红色虚线所对应的模型
论文图 3。原论文 Figure 3:“(Left): Global audio/video contributions using Permutation SHAP for six AVSR models under varying acoustic conditions on the LRS3 dataset.”。
读图后可见:紫色虚线模型跨度最大,约 30 个百分点以上;红色水平虚线对应固定融合模型;其余大语言模型轨迹相近,中等幅度约 19 到 25 个百分点。该图不支持把某一模型的绝对高低直接判为优劣,因为噪声源不同,只能说适配斜率与形态存在架构差异。
解码推进与输入时长是否改变平衡?
第二个要回答的问题是:同一个句子从第一个词解到最后一个词,模态权重是否恒定。论文用生成进度百分比为横轴,音频占比为纵轴,分别画干净与负 10 分贝两组曲线。原文报告干净时两个代表模型从约 65% 升至 71%、从约 63% 升至 72%,噪声下呈先降后升的 U 形,中段最低、尾段明显回升。解释是句首噪声下更靠视觉,积累语言上下文后又能更好地利用残余声音。另一自监督模型在两种条件下变化小于 3 个百分点,表现稳定,论文将其归因于掩码音视预测预训练鼓励的均衡融合,但这属于有限解释而非因果证明。
时长效应的结论是模型相关而无统一趋势。门控交叉注意力模型随语句变长音频占比下降,噪声下更明显;自监督模型干净时下降、噪声下反而轻微上升;大语言模型类在两种条件下轻微上升。论文分别用交叉注意可访问更丰富视觉上下文、残余频谱线索累积、以及自注意力中音频词元互增强来假设,但均未做干预验证,应读作待验证的可能机制。
下表用另 1 数据集的逐档数字检验主趋势是否跨数据集成立,表中数字为原文裸值,单位为百分比,表头已注明,比较对象是同模型跨信噪比。
| 模型 | 干净 | 10 分贝 | 0 分贝 | 负 10 分贝 | 数据集 |
|---|---|---|---|---|---|
| Llama-AVSR | 65.4 | 64.5 | 62.2 | 46.0 | LRS2 |
| Omni-AVSR | 59.9 | 59.9 | 57.3 | 42.7 | LRS2 |
| Auto-AVSR | 56.5 | 56.4 | 56.3 | 55.3 | LRS2 |
| Whisper-Flamingo | 94.7 | 94.5 | 93.1 | 88.3 | LRS2 |
表后需要强调未胜出项与边界:固定融合模型在另 1 数据集同样几乎不变,约为 56%;门控模型在另 1 数据集音频偏置更强,高达 88-95%,论文归因于其视觉编码器只在前 1 数据集微调导致的域失配,而非方法本身更优。该表支持模态行为主要由架构决定而非数据集特有,但跨数据集比较时训练数据差异必须一并考虑。
噪声类型、时序对齐与识别难度带来什么反证?
先看噪声类型。比较问题是:同样标称信噪比下,不同噪声是否引起同样程度的视觉转向。指标仍是音频占比,辅助看词错率。原文报告音乐与环境声噪声在负 10 分贝的词错率仅为 2.6-7.8,而巴布尔噪声高达 26.3-40.9,前者引起的视觉转向更小。自监督模型在各类噪声下弹性最大,转向幅度最大。这说明不能只报信噪比数值,必须同时报噪声类型,否则同样的负 10 分贝含义完全不同。
再看时序对齐。问题是早期输入是否主要贡献给早期输出。下图以自监督模型为代表,上排是音频细粒度热图,下排是视频粗分组曲线,左右分别为干净与噪声。
看图路径: 1. 先看上排两张音频热图的横轴输出位置与纵轴输入位置及对角虚线;2. 再看下排视频分组曲线中早期中期间晚期三条峰值错开的位置;3. 最后对比干净与负 10 分贝下对角是否变宽但仍存在
论文图 6。原论文 Figure 5:“Temporal Alignment SHAP for AV-HuBERT.”。
从像素可见,上排热图深色集中在对角虚线附近,下排 3 条分组曲线峰值依次错开,早期箱峰值靠左、晚期箱峰值靠右。噪声下对角变宽、分组曲线更重叠,但对角结构未崩溃。论文报告干净对角得分为 2.90、噪声为 1.70,支持双模态各自独立保持时序对应,而非某一模态主导对齐。这是与持续音频偏置并存的积极结构,说明偏置是总量问题而非对齐完全丢失。
下表把噪声严重程度与识别难度解耦,单位为百分比,数值保留原文区间写法。
| 条件 | 噪声下音频贡献 | 中等噪声下音频贡献 | 词错率分组内变化 | 结论 |
|---|---|---|---|---|
| 代表模型 A | 45-46% | 60-65% | 3-7 个百分点内 | 由信噪比决定 |
| 门控模型 | 38-45% | 67-70% | 无一致趋势 | 与难度无关 |
| 音乐环境声负 10 分贝 | 未转向太多 | 词错率 2.6-7.8 | 低于巴布尔噪声 | 难度低则转向小 |
表后解释是:同一信噪比内按词错率分五档,音频占比几乎持平,组间差异远小于跨信噪比的二十余个百分点差异。因此当前模型不按输入难易自适应加权,信噪比才是主导因素。该结论的限制是只在两个信噪比与 2 个模型上展示分组,推广到全部模型需谨慎。
哪些结论不能推广,缺了哪些测量?
首先是掩码有效性。零向量不完全等于对缺失特征边缘化,论文明确说明关注的是同一掩码下跨模型与跨条件的相对趋势,而非绝对归因量的真值。若掩码本身引入分布外效应,绝对百分比会有偏,但趋势仍具参考性。
其次是噪声源不一致。不同家族用不同噪声库,跨家族的绝对音频占比不能直接排名,只能比较各自随信噪比的斜率与形态。域失配的例子也提醒,视觉编码器的微调数据会影响偏置大小。
第三是成本与统计。联盟数 2000 带来的计算量巨大,论文未报告总耗时与硬件预算,也未给出显著性检验。生成式分析只用最长语句,对齐分析以代表模型展示为主,虽然声称趋势跨模型一致,但正文只详细画出部分模型。未测量的量包括推理延迟、误判率分解与真实部署成本,因此不能承诺该诊断本身能改善延迟或词错率,它只是暴露偏置的测量工具。
复现先做什么,需要哪些信息条件?
复现的第一步是准备推理链而非训练链:下载 6 个模型的已有权重,按各自论文的推理配置解码,确认干净词错率与原文消融量级一致后再做归因。不要从模型名称推定训练细节,归因阶段无需优化器与梯度更新。
第二步是实现掩码位置:大语言模型类在投影后掩码,融合前模型在融合前掩码,门控交叉注意力模型在解码器消费前掩码,并对高分辨率音频做分组以等齐时间覆盖。掩码值用零,保持与原文一致。
第三步是实现采样:置换与采样两种近似任选其一验证一致性,联盟数先用 2000 跑通,再尝试减小以观察低信噪比方差是否增大。信噪比档位、噪声库来源、窗口数与分箱数按原文设置:生成式用长句与五窗,对齐用百分比归一化与十箱。资源状态方面,原文仅给出项目网页,未在本证据中验证代码与权重可达,因此应写本次未能确认代码公开,只能按论文文字重写流程,复现前需自行核对权重许可与下载链接。
何时值得用沙普利诊断,下一步补什么?
当你的音视系统在干净时提升微弱、噪声下不确定是否真用了视觉,或者想比较不同融合机制的动态行为时,值得用该框架做诊断。它与正确性无关,能发现词错率看不到的持续音频偏置、解码尾段的音频回升、以及总量偏置下的对齐保持。
复述方法的关键超参数是 2000 个联盟、绝对值聚合、音频占比与视觉占比互补、生成窗与输入输出分箱的百分比归一化。适用条件是离线分析、小样本深诊断,而非在线加权,因为成本过高。
下一步应补三项验证:一是在同一噪声源下重测全部模型以消除跨库偏差;二是把归因与干预结合,测试按信噪比显式加权或按解码进度调度能否在不损干净性能下降低强噪声词错率;三是报告计算开销与方差,并检验时长效应与对齐分数在更多模型上的稳定性。只有补上这些,才能从诊断走向可部署的模态加权机制。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



