英文题目:Causal Tracing of Audio-Text Fusion in Large Audio Language Models

会议身份:conference:interspeech:2026:conference-paper-id:chen26k_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#评测协议 #音频大模型 #可解释性 #语音 #音频问答

评分:5.4/10 | 创新 1.3/2 | 技术严谨 0.9/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:方法研究

👥 作者与机构

  • Wei-Chih Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Chien-yu Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

大型音频语言模型需以连续音频序列与文本提示为输入,输出短时属性答案,实际难点在于无法定位声学证据在模型深度与序列位置上何时何处汇入文本推理。该方法先做干净运行缓存原始音频下的文本隐状态,再做破坏运行以全段静音替换音频并保持长度与词元数不变以切断声学信息。接着做补丁运行将干净隐状态按层或按位置写回破坏运行,并用恢复率度量因果贡献,从而同时得到深度与位置两维因果图。与仅做投影观察的AudioLens类Logit Lens方法不同,该干预主动隔离声学信息并区分深度与位置,实际意义在于可定位融合层与检索瓶颈以指导架构设计。在SAKURA基准条件下,充分因果补丁位置的恢复率指标为1.0,高于无因果贡献位置的恢复率指标0.0。结论限于结构化短问答与静音基线条件,未验证开放式推理、长音频与噪声条件,未披露训练与推理成本。其适用边界受限于结构化短问答与静音基线,开放式推理与长音频场景尚未验证,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么只看答对还不够?

输入是连续语音或音频加上文本问题,目标是让大音频语言模型输出与声音内容一致的答案。必须保留的信息包括音频编码器如何把波形变成特征、跨模态适配器如何把声学特征映射到语言嵌入空间,以及语言主干在哪些层和哪些文本位置真正使用了这些声学信息。本文的输出不是新模型,而是一套可复述的因果追踪流程与跨模型比较结论。

对于刚进入语音与音频方向的研究生,一个容易产生的误解是把端到端答对等同于听见了。论文指出,现有评测大多只看最终文本,例如识别、描述与问答的总分、偏置与幻觉,而把模型当作黑盒。这种评测能排序,但不能回答融合发生在浅层还是深层,也不能回答模型是在读到选项词时取用音频,还是拖到生成前最后一个位置才取用音频。

因此学习依赖应当先建立任务观,再进入干预观。任务观解决模型被要求做什么,干预观解决哪部分内部状态对答案有因果贡献。本文选择分类式问答作为探针,把生成约束到下一个词的概率分布上,从而可以精确比较干净音频、静音破坏与回填修复 3 种条件下的目标概率。这一步是后文所有层追踪与位置追踪的前提。

相关路线在研究什么,不在研究什么?

第一条路线是语音与音频模型的探测。早期工作分析说话人向量、端到端识别的隐藏表示,以及自监督模型的逐层表示,常用层分析与神经元分析。这类工作擅长回答某一层更偏向音素还是语义,但研究对象多为单模态模型,不直接回答音频特征在语言模型内部的哪一层与文本表示汇合。

第二条路线是大音频语言模型的任务评测。论文列举了识别、描述、多跳推理与多任务理解等基准,以及语义性别偏置、说话人偏置与幻觉评测。这些工作输入相同,都是音频加文本,目标也相近,都是测最终答案质量,但运行阶段停留在输出端,没有在推理过程中替换隐藏状态。类别差异不能当作同条件胜负,本文也不用任务分数证明追踪方法更好,而是用追踪补充任务评测看不见的内部过程。

第 3 条路线是机制可解释性与因果追踪。文本领域的代表是 ROME 框架,通过干预前馈层定位事实回忆;视觉语言领域已有工作把因果追踪用于定位视觉与文本整合的层。音频领域的 AudioLens 则属于观察性方法,用 logit lens 把中间状态投影到词表,看到表示漂移但不能证明因果。本文的定位是把干预式因果追踪系统地搬到音频文本融合,沿用干净、破坏与回填的 3 次运行结构,并同时做深度轴与序列轴两个维度的分析。

本文要回答的何时与何地是什么?

问题可以拆成两个可操作的子问题。何时是指沿 Transformer 深度,语义整合发生在哪个层区间,是逐层渐进,还是长期独立后突然融合。何地是指沿文本序列,模型在哪个功能位置把音频上下文取出来,是分散在全序列,还是集中在某个瓶颈位置。

为使问题可测量,论文把输入固定为音频序列 A、任务文本提示 T 与正确答案 token y,输出固定为下一个词概率分布中 y 的概率。记干净音频为 Aclean,破坏音频为静音 Acorrupt,对应概率为 Pclean 与 Pcorrupted。回填运行是在破坏运行的前向过程中,把选定的破坏隐藏状态换成干净隐藏状态,得到 Ppatched。教学例子是性别判断提示,文本中包含指令、选项 male 与 female,以及结尾的 The speaker’s gender is,模型只需生成 male 或 female,这只是一个帮助理解位置划分的例子,不代表论文只研究性别。

该形式化把何时与何地转化为可比较的恢复程度。若回填某一层后概率大幅回升,则该层携带了足够的跨模态因果信息;若只回填某个位置就能恢复,则该位置是信息路由的关键点。后文的方法全景就是围绕如何选择回填集合展开。

三次运行如何构成一次因果实验?

沿一个样本走完流程有助于建立直觉。输入是一段原始语音与一段文本问题,文本以 The speaker’s gender is 结尾。干净运行正常编码音频与文本,缓存每一层的文本隐藏状态,并记录正确答案的概率。破坏运行把语音波形整体换成静音,保持文本提示、序列长度与音频 token 数不变,再记录概率通常会下降。回填运行从破坏运行出发,在指定层或指定位置贴回干净隐藏状态,然后让后续层继续计算,观察概率回升多少。

下图是理解该流程的关键,它并排画出左右两条路径与中间的回填箭头,蓝色表示整层回填,橙色表示单位置回填,顶部给出概率从破坏值向回填值的变化。读图时应先确认底部输入差异只在音频侧,再确认干预发生在中间层,最后确认顶部输出比较的是同一目标答案的概率。

看图路径: 1. 先从底部向上看左侧干净音频与右侧破坏音频两条并行路径;2. 再看中间第 l 层蓝色整层回填与橙色单位置回填的箭头指向;3. 最后对比顶部干净概率与破坏后回填概率的输出变化

原论文 Figure 1:Illustration of our tracing methodology.

论文图 1。原论文 Figure 1:“Illustration of our tracing methodology.”。

该图显示左侧底层输入干净音频,右侧底层输入破坏音频,两者文本侧相同。中间第 l 层用方块表示隐藏状态序列,蓝色框对应层追踪的整层替换,橙色块对应 token 追踪的单点替换,黑色箭头表示把左侧干净状态复制到右侧破坏路径。顶部左侧为干净概率,右侧为从破坏概率到回填概率的变化, Softmax 符号说明比较对象是下一个词分布。这种画法把深度干预与位置干预统一在一个图中,为后文分别展开层追踪与 token 追踪做了准备。

层回填与单位置回填各自在算什么?

层追踪的操作是固定层号 l,把该层全部文本 token 的破坏隐藏状态替换为干净隐藏状态,记为用 hclean 替换 hcorrupt,然后让后续所有层继续前向。它的计算目标是回答该深度是否已经形成可用的融合表示。若在浅层回填后恢复率仍接近零,说明此时文本表示尚未吸收音频;若到某层后恢复率快速上升并趋稳,说明整合发生在该区间。论文用这种逐层扫描判断架构是独立处理后再融合,还是逐层渐进融合。

token 追踪的操作更细,它只替换第 l 层第 i 个位置的单个隐藏状态,然后同样让后续计算完成。它的计算目标是回答序列中哪个功能段真正路由了音频上下文。论文把性别提示的文本划分为早期指令、对象词、后期过渡词与末 token 4 段。早期指令例如任务说明与选项引导,对象词例如 male 与 female,后期过渡词例如 The speaker’s gender,末 token 例如 is。自回归生成直接用末位置的隐藏状态计算下一个词分布,因此末位置天然是候选瓶颈,但是否真是瓶颈需要干预证据。

因果追踪 × 恢复率: 因果追踪负责做干预,它把干净运行中某层或某个位置的隐藏状态复制到静音破坏运行的同一位置,再让后续层继续前向计算;恢复率负责度量效果,它比较回填后的目标答案概率相对干净概率和破坏概率恢复了多少。两者搭配的原因是只看相关性无法证明某状态真正携带音频信息,而干预加度量可以把贡献换算成可比较的恢复比例,组合后新增的作用是同时回答何时融合与在哪里融合。

层追踪 × token 追踪: 层追踪负责纵向定位,它 1 次回填某一层全部文本 token 的隐藏状态,观察恢复率随层数如何爬升;token 追踪负责横向定位,它只回填某一层某一个文本位置的隐藏状态,观察序列中哪个位置能恢复答案。两者搭配的原因是只看深度不知道信息在哪个词上被取出,只看位置不知道融合发生在浅层还是深层,组合后新增的作用是构成深度乘以位置的完整因果图。

干净运行 × 破坏运行: 干净运行负责提供正确参照,它输入原始音频加文本提示并记录目标答案概率与每层隐藏状态;破坏运行负责移除听觉证据,它把音频整体换成静音但保持提示结构、长度与音频 token 数不变。两者搭配的原因是只有保持文本侧完全相同,才能把概率下降归因于音频缺失而非提示变化,组合后新增的作用是为回填干预提供可替换的藏状态对与可计算的概率上下界。

恢复率的定义是回填概率减破坏概率,再除以干净概率减破坏概率。它度量的是缺口被修复的比例,接近 1 表示回填部分已包含足够因果信息,接近 0 表示没有贡献。为保证分母有效,论文排除 3 类样本,即干净运行答错、破坏运行反而答对,以及干净概率不大于破坏概率的样本。这一步很重要,因为若分母为零或为负,恢复率将失去比较意义。

为什么静音是合适的破坏基线?

破坏基线的选择决定因果结论是否干净。论文选择纯静音,理由是它在移除目标声学属性信息的同时,不引入分布外伪影,并且完整保留提示的结构完整性、序列长度与音频 token 数。这样概率变化可以更可信地归因于多模态信号缺失,而不是因为输入变短或格式被破坏。

从初学者角度看,另一种直觉是用噪声或另一段语音做破坏,但这会带来新的语义,可能诱发模型幻觉或混淆归因。静音被描述为关于被评估声学属性的严格中性零信息,它不提供动物、情感、性别或语言的线索。理解这一点后,就能明白为什么后文的恢复率可以被解释为音频上下文的因果贡献,而不是文本先验的变化。

对象 token × 末 token: 对象 token 负责承载候选项语义,例如性别任务中的 male 与 female,它在中间层被回填时若能恢复概率,说明模型在此处按属性发起了查询;末 token 负责生成下一个词的分布,因为自回归模型直接用序列最后一个位置的隐藏状态计算目标答案概率。两者搭配的原因是查询发起点与答案生成点可能分离,组合后新增的作用是区分中间层的类注意力查询机制与最终位置的信息瓶颈。

渐进融合 × 晚期融合: 渐进融合负责描述恢复率随深度逐渐爬升的模式,代表音频与文本在多层中持续交互;晚期融合负责描述早期恢复率接近零、只在最后三分之一深度突然跃升的模式,代表前段主要处理单模态文本、语义整合被推迟。两者搭配的原因是不同架构家族表现出不同曲线,组合后新增的作用是把架构差异转化为可讨论的部署含义,例如早期层是否可以按纯文本处理以节省计算。

位置划分的教学意义在于把序列从扁平的 token 串变成有功能的 4 段。早期提示主要设定任务,对象词提供候选标签,后期提示承接生成,末 token 直接决定输出分布。论文的假设是模型可能不在全序列持续混合信号,而是在特定位置 decisively 检索音频。因此 token 追踪需要逐层逐位置扫描,再按 4 段聚合解释,而不是只报告单个最大值的坐标。

本研究训练了什么,没有训练什么?

本研究没有训练任何新的音频编码器、适配器或语言主干,也没有更新模型权重。DeSTA2、DeSTA2.5、Qwen、Qwen2 与 Voxtral 都是作为既有模型被调用的对象。论文未报告优化器、学习率、梯度路径、参数冻结与解冻、训练轮数或重置时机,这些缺项应当明确指出,不能从模型名称推定其训练实现。

真实的计算过程是推理期干预而非训练。第一步是对每个样本做干净前向并缓存隐藏状态,第二步是把音频换成静音做破坏前向,第三步是按层或按位置做回填前向并计算恢复率。涉及的计算成本主要来自多次前向与逐层逐位置扫描,而不是反向传播。论文未给出硬件型号、推理延迟与总计算预算,因此不能承诺该方法在延迟或成本上得到改善,只能说它为诊断融合位置提供了可复述的操作。

把无训练等同于确定性求解是错误的。即使参数冻结,生成仍受采样、提示措辞与音频预处理影响。本文通过把输出约束为分类式下一个词概率,并过滤无效样本,来降低比较噪声,但这不意味着系统输出完全确定。复现时应固定解码方式与概率读取位置,并记录被过滤样本的比例。

在什么数据与模型上做比较,条件是否一致?

实验要回答的是融合机制是否随架构与属性变化,因此需要固定任务形式,再变化模型与属性。论文使用 SAKURA 数据集评估 4 种听觉属性,并把输入组织成结构化问答加结尾续写的形式。所有模型的比较条件是同一属性、同一提示模板与同一静音破坏逻辑,指标方向是恢复率越高表示被回填的层或位置对恢复答案越关键。

下表把实验条件整理成可核对的对照,阅读时应先确认任务属性与模型集合,再确认破坏基线与有效性过滤,最后才进入结果曲线的解释。该表不替代结果曲线,它只说明比较是在什么条件下成立的。

实验维度具体设置破坏与参照有效性处理覆盖范围
目标属性animal, emotion, gender, language 共 4 类静音替换原始音频排除干净答错与破坏答对样本4 个属性分别追踪
模型集合DeSTA2, DeSTA2.5, Qwen, Qwen2, Voxtral文本提示与长度保持不变排除干净概率不大于破坏概率样本5 个模型跨家族比较
提示形式问题加选项加结尾续写缓存干净隐藏状态用于回填按恢复率比较层与位置贡献层轴与序列轴双轴
评估目标下一个词目标答案概率比较干净概率与破坏概率缺口恢复比例接近 1 为强因果定位融合深度与瓶颈
报告方式逐层与逐位置扫描后续层继续前向完成计算只解释有效样本上的趋势不承诺延迟与成本改善

上表的主要价值是把公平条件说清楚。它的代价是论文未报告每个属性的样本量、划分方式、聚合方法与统计显著性,也未报告音频时长分布与提示长度分布。因此在引用结论时应限定为在该分类探针与静音基线下观察到的趋势,不能直接推广到开放式描述或长对话。未胜出的细节是早期提示位置在多数情况下恢复率很低,这本身是一个负结果,说明并非全序列都在融合。

不同模型在第几层完成融合?

层追踪要测的是恢复率随层序号的变化,比较对象是 5 个模型,条件是同一属性与同一恢复率定义,指标方向是曲线抬升越早表示融合越早,抬升越陡表示融合越集中。下图按 4 个属性分面板展示了全部曲线,阅读时应先看横轴层序号与纵轴恢复率,再看不同颜色家族曲线的分离点。

看图路径: 1. 先按四个属性面板分别确认横轴层序号与纵轴恢复率;2. 再对比蓝色系 DeSTA 曲线与红色系 Qwen 曲线的爬升位置;3. 最后观察紫色 Voxtral 曲线是否更早抬升

原论文 Figure 2:Layer-wise tracing results for all models across four auditory attributes.

论文图 2。原论文 Figure 2:“Layer-wise tracing results for all models across four auditory attributes.”。

从像素可见,4 个面板的横轴都是层序号,纵轴都是恢复率,曲线总体从低到高爬升。DeSTA 系曲线呈渐进爬升,Qwen 系曲线在前段长期贴近零线后突然跃升,Voxtral 在情感与性别等面板上更早抬升。该视觉对比支持论文的 3 类总结,即 DeSTA 为渐进融合,Qwen 为晚期集中融合,Voxtral 为早期融合。但像素不能精确读出每条曲线的逐层数值,因此不应硬写某一层的具体恢复率小数,只能引用正文明确给出的层区间。

下表把正文明确报告的层区间整理成可核对的对照,阅读时应把模型家族、融合策略与层区间一起看,而不是只记一个数字。该表的数据来自连续原句,不是逐点读曲线的估计值。

模型家族融合策略恢复率变化特征关键层区间同条件比较对象
DeSTA2 与 DeSTA2.5渐进融合随深度逐渐上升后趋稳layer 15 之后趋稳Qwen 与 Voxtral 同属性曲线
Qwen 与 Qwen2晚期集中融合早期接近零后突然跃升layers 18 to 31 附近跃升DeSTA 与 Voxtral 同属性曲线
Voxtral早期融合更早达到最大恢复早于 DeSTA 与 QwenDeSTA 与 Qwen 同属性曲线
跨属性总体策略分化不同面板形态一致分化按属性分别比较4 种属性 Animal Emotion Gender Language
方法含义深度定位回填整层文本隐藏状态后续层继续前向单位置回填的空间定位

上表的主要收益是给出可复述的层区间。DeSTA 在多数属性上层后趋稳,支持持续交互的解释;Qwen 在最后三分之一深度才跃升,支持前段独立处理文本、深层才做语义整合的解释;Voxtral 更早恢复,支持早期融合的解释。具体代价与反例是该结论依赖静音基线与分类探针,若换成噪声基线或开放生成,层区间可能移动。论文未测量每组的显著性与每层的方差,因此总体趋势不等于每一层都严格单调。

音频是在哪个词的位置被取出来的?

位置追踪要测的是同一层内不同文本段的恢复能力,比较对象是早期指令、对象词、后期过渡与末 token,条件是固定模型与属性,指标方向仍是恢复率越高表示该位置越关键。下图用热力图矩阵展示结果,行是模型,列是属性,每个小块内纵轴为功能段、横轴为层序号,颜色越深表示恢复率越高。读图前应先确认图例的完整对象与时间范围,避免把同色块误认为同一数值。

看图路径: 1. 先按行找到五个模型,按列找到四个属性的热力图矩阵;2. 再观察每块图中 Last 行在深层是否出现最深的红色;3. 最后检查 Object 行在中间层是否有次级的红色激活块

原论文 Figure 3:Token-wise tracing results across all models and four auditory attributes reveal the last token…

论文图 3。原论文 Figure 3:“Token-wise tracing results across all models and four auditory attributes reveal the last token as a critical informational bottleneck for audio context retrieval, while object…”。

从像素可见,最一致的模式是每块热力图底部 Last 行在右侧深层出现最深的红色,说明末 token 是跨模型与跨属性的信息瓶颈。其次,部分小块在中间层出现次级红色,例如 Qwen 在动物属性的对象行,以及 DeSTA 与 Voxtral 在语言属性的对象行,说明对象词在中间层触发了类似查询的激活。该图不能精确读出每个格子的恢复率小数,因此解释应停留在瓶颈与次级激活的存在性与位置上,不能把颜色深浅直接换算成性能好坏,也不能把末步结果推广为全程都由末 token 决定。

把该结果与层结果结合,可以得到更完整的机制。深度结果回答融合在哪一段完成,位置结果回答融合经由哪个词取出。末 token 瓶颈与视觉语言模型中报告的末位置瓶颈类似,论文将其表述为可能的 Transformer 通用检索机制,但措辞是提示而非已验证的跨模态定理。对象词的中间层激活则支持注意力式查询的解释,即读到候选项触发模型去声学表示中提取相关特征。若该触发失败,模型可能退回到文本先验猜测,这为幻觉监测提供了思路,但论文未测量误判率与监测精度,因此只能记为待验证的应用方向。

哪些结论还不能下,缺了什么验证?

论文直接报告的是三点可观察趋势,即家族间的融合深度分化、末 token 瓶颈,以及对象词的中间层查询激活。这些是报告与显示级别的结论。论文支持但未完全证明的是早期融合更适合细粒度连续交互、晚期融合可把早期层当作纯文本处理以节省计算,这些属于有限解释,因为节省多少计算、是否影响精度都没有测量。

未验证的推测包括用对象位置激活监测幻觉、通过提示工程引导模型在正确位置取用音频,以及把结论推广到开放描述与多轮推理。相关性不是因果的提醒在这里同样适用,即使某位置回填恢复率高,也只证明该隐藏状态携带足够信息,不证明模型在自然前向中必然经过同一路径。缺失证据不是技术错误,但引用时必须保留限定。

具体缺项包括样本量与划分、聚合与统计方法、硬件与推理开销、输出延迟与成本、人类评价与误判率测量。资源状态方面,本次未发现来源绑定且完成验证的代码、模型或数据资源,因此不得声称代码或系统已公开可用,只能按论文文字复述模型与数据集名称。不同指标的差值不能混放,自动恢复率也不能当作人类听感评价。

要复现这套追踪,先做什么?

复现的第一步是固定可运行的分类探针。选择 SAKURA 中动物、情感、性别与语言 4 个属性,按论文模板构造问题加选项加结尾续写,例如性别任务以 The speaker’s gender is 结尾,并记录目标答案 token 的下一个词概率。必须保留超参数与信息条件,包括提示原文、音频预处理、解码方式与概率读取位置,否则层区间无法对比。

第二步是实现 3 次运行。先跑干净音频并缓存每层文本隐藏状态,再把音频换成静音跑破坏运行并确认目标概率下降,最后按层与按位置分别回填并让后续层继续前向。计算恢复率时要实现 3 条过滤,即去掉干净答错、破坏答对,以及干净概率不大于破坏概率的样本,并记录过滤比例。层追踪 1 次替换整层文本状态,位置追踪 1 次替换单个位置状态,两者不要混在同一次前向中。

第三步是先复现两个定性模式,再核对层区间。先检查末 token 是否在深层成为最强恢复位置,再检查对象词是否在中间层出现次级激活,最后检查 DeSTA 是否渐进爬升、Qwen 是否在深层跃升、Voxtral 是否更早恢复。若要补验证,建议补充不同破坏基线、不同提示措辞与开放生成的对照,并报告多次运行的方差与计算开销。

何时值得尝试这种分析,如何收束?

当研究问题从答对多少分转向声音在何处被使用时,这套方法值得尝试。它适用于怀疑模型依赖文本先验、怀疑不同架构融合位置不同,或需要为剪枝与加速寻找可冻结层区间的场景。它不适用于需要直接提升精度的场景,因为本文没有给出可部署的精度收益表,也没有测量延迟与成本。

收束时应保留 3 条可带走的判断。第一,用静音破坏加隐藏状态回填,可以把融合深度与融合位置分开测量,恢复率是连接干预与结论的桥梁。第二,在本文的探针与基线下,DeSTA 偏向渐进融合,Qwen 偏向深层集中融合,Voxtral 偏向更早融合,末 token 是最一致的瓶颈,对象词提供次级查询信号。第三,所有效率与幻觉监测的含义仍是方向性建议,还需补充统计、开销与误判率验证才能进入部署。

对初学者的常见误解需要最后澄清。曲线向下不一定是性能变差,需要先确认纵轴是恢复率还是原始概率;末位置最强不等于模型只看最后一个词,它说明的是取出点集中,而查询可以在中间层提前发生;早期融合不等于更好,它只表示交互发生得早,是否更好取决于任务是否需要细粒度连续交互。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总