英文题目:TAD: Token-Adaptive Contrastive Decoding with Confidence-Guided Gating for Hallucination Mitigation in Large Audio-Language Models
会议身份:
conference:interspeech:2026:conference-paper-id:chang26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#对比学习 #音频大模型 #鲁棒性 #音频问答
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Heyu Chang:机构信息未能从会议 PDF 纯文本可靠映射
- Nianwen Si:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Wenlin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Dan Qu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型(Large Audio-Language Model,LALM)在二元音频问答中常因语言先验虚报不存在声音,首步是否决策成为幻觉关键点。为此论文提出免训练的令牌自适应对比解码(Token-Adaptive Contrastive Decoding,TAD),先并行计算真实音频与等长全零静音参考下的词表对数几率(logits),再按音频感知对比加权得到去先验表示。接着方法将多种表层形式的肯定与否定子词集合化,并用对数求和指数(log-sum-exp)池化聚合成是否证据,计算音频相对静音的边际增益。仅当首步增益低于阈值时对肯定集合施加固定惩罚,否则保持原对比输出并进入常规解码。与固定强度的音频感知解码(Audio-Aware Decoding,AAD)相比,该决策关键且类别条件的门控避免了证据充分时的过度纠正。在Qwen2-Audio-7B-Instruct的AudioCaps-Hallucination上,TAD相对AAD在随机、流行、对抗三个划分分别将F1从0.736提升至0.853、从0.499提升至0.558、从0.425提升至0.494;在Gemma-3n-E4B-it上对应提升0.025至0.064;在Clotho-AQA是否子集上Qwen2从0.810提升至0.816,Gemma上与AAD基本相当。该结论目前仅限于是否问答与首步干预,对开放式描述及多步推理尚未验证。原文未披露训练、推理延迟或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/Changhy26/TAD — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么研究生要先看幻觉?
本文的输入是一段环境音频加一个关于其中是否含有某类声音的自然语言问句,例如音频里只有雨声,问句是音频里有警笛声吗,目标是让模型只在声学证据支持时回答是,否则回答否。输出是受控格式的是否开头加解释的句子,但判分时只看首词归属的是或否。必须保留的信息是模型、数据集、是否把否当作正类、对比强度与门控阈值的取值,以及首步干预的适用边界。解读的输出是能复述的计算链条与能核对的实验条件,而不是泛泛的性能断言。
大音频语言模型这个术语初学者可以白话理解为给文本大模型外接了一个声音耳朵,英文是 Large Audio-Language Model,缩写为 LALM,后文统一称大音频语言模型。它先把波形编码成声学表征,再与问句词嵌入拼接后自回归生成回答。音频对象幻觉白话理解为耳朵没听到但嘴上说听到了,英文是 audio object hallucination。论文聚焦的例子是当被问不存在的警笛时,模型因训练中警笛常见或与上下文语义相容而习惯性回答是。
大音频语言模型 × 音频对象幻觉: 大音频语言模型负责把音频编码器输出与文本大模型拼接后生成回答,音频对象幻觉是它在声学证据不足时仍沿用语言先验回答是的失效模式,二者搭配的意义在于本文只干预是否型问答的首步决策而不改动主干参数。
沿一个样本走一遍有助于建立学习依赖。输入是真实音频与问句,模型先编码音频,再在首个解码位置对全词表输出对数几率,正常贪心会选最高者,若语言先验把是推得过高,即使音频无警笛也会输出是。目标是把首步的是倾向拉回到声学证据决定的位置。后续章节先讲已有对照路线,再讲本文全景与组件计算,然后讲无训练的推理流程、实验条件、结果与反证,最后讲复现与收束。
已有免训练路线做了什么,固定强度为何不够?
同输入同目标的已有工作主要是免训练的推理期干预,因为重训大主干成本高。第一条路线是音频感知解码,英文是 Audio-Aware Decoding,缩写为 AAD,它用真实音频分支减去无音频分支来突出音频支持的词。第二条路线是自适应向量引导,英文是 Adaptive Vector Steering,缩写为 AVS,它从成对的真实与静音前向中提取层级转向向量并在推理时注入。同运行阶段的共性是都不更新参数,只在前向与解码时做对照。
音频感知解码 × 自适应向量引导: 音频感知解码分工是在输出层用真实音频与无音频分支的对数几率差来放大音频支持的词,自适应向量引导分工是在中间层注入由真实与静音前向差得到的转向向量,二者搭配的理由是同属免训练的对照思想,本文选择前者作为底座是因为它直接作用于首个是否词且易于做类别条件门控。
论文指出固定对比强度在所有步都用同一个加权系数,无法适应音频证据强弱的变化,在证据弱时纠偏不足,在证据已足时又可能过度纠正。另一个动机是二元问答的结局大多在第一个词就已决定,因此需要在首步做决策感知的干预,而不是全局重加权。视觉语言模型中的对比解码也被引用为同类思想,但本文只讨论音频问答任务,不把视觉上的胜负直接搬运为音频结论。
要解决的判别问题如何形式化,评测看什么?
形式化上,给定音频片段与问句,模型生成回答序列,幻觉设置下关注的是目标声音缺席时模型仍生成肯定回答的失效。评测把否当作正类,对应正确拒绝缺席对象的能力,报告准确率、精确率、召回率与 F1,方向是 F1 与召回越高说明越能压住无支持的是,同时要求准确率保持可比。举例来说,若 100 个真否样本中只拒对 26 个,则否类召回很低,即使精确率高,F1 也不会高,这正是默认解码的典型形态。
数据集有两个。音频标题幻觉集由音频标题测试集用 5 个模板生成二元问句,每个模板按随机、对抗、流行 3 种策略采样被问对象,分别产生 30220、31047、31376 个问答对,设计目标是测试对缺席对象的拒绝。对抗与流行更难,因为被问对象是易混淆或高频但缺席的类别。另 1 数据集是环境音频问答集,本文只取其中答案为是或否的 1991 个样本。模型有两个,分别是 7B 规模的指令调优音频语言模型与约 4B 的轻量指令调优多模态模型,后文统一称大模型与小模型以固定简称。
方法全景:两分支对照加首步门控如何串起来?
全景可以按 1 次前向理解。上路输入真实音频加问句,下路输入等长全零静音加同一问句,两路经过同一个冻结模型得到首步全词表对数几率。接着把词表投影到是集与否集并池化为 4 个标量,再算出音频带来的间隔增益。若增益低于阈值,则在已做音频感知的组合对数几率上只对是集减去固定惩罚,否则不做额外惩罚。后续位置只用组合对数几率继续解码,不再触发门控。
下段导读图一有助于把文字链条落地为可见路径,请沿左右两路输入到中间分布再到右侧终局的箭头阅读,重点看加权系数与菱形门的位置分工。该图展示了静音参照对照与置信度引导门在首步是否决策中的协作关系。
看图路径: 1. 先从左侧真实音频与静音参照两条输入沿箭头看到各自经过同一个问句与模型;2. 再看中间是集与否集的柱状分布如何分别送入上方加权与下方门控;3. 确认菱形门只在首步生效并只对是类做减法;4. 最后看右侧终局是否柱谁高谁即为输出
论文图 1。原论文 Figure 1:“Overview of Token-Adaptive Decoding (TAD) with a silent-reference contrast and a confidence–guided gate for first- step YES/NO decisions.”。
从像素可见,上方真实音频框内有波形与英文问句,下方静音参照框内为一条水平直线加同一问句,两路各接一个模型图标后分别得到是集橙色柱与否集蓝色柱。中间灰条算出增益并送入菱形判断,标注仅在首步生效,触发时惩罚是类词。右侧终局柱显示否高于是,终局对数几率在首步形成。这种安排的理由是原文明确的决策关键且类别条件,即只在最关键的一步、只对最易幻觉的一类做修正,以避免弱证据或已足证据下的过度纠正。
组件与计算:词集、池化与门控各自算什么?
先讲是与否词集合的构造。白话说就是把所有写法的是与否都找齐,英文是 YES/NO token sets。做法是枚举多种表面形式,例如带前导空格大小写不同的肯定与否定词,对每种形式按不加特殊词的方式分词,收集子词编号后去重取并集,得到肯定集合与否定集合。这样做是为了对抗子词切分带来的碎片化,若只盯单个编号,测量会随切分抖动。
再讲池化。白话说就是把集合内多个编号的分数合成一个类分数,英文是 log-sum-exp pooling。对某一步的词表对数几率向量,池化是对集合内指数求和再取对数,为数值稳定先减去最大值再加回,数学上保持精确值不变。对真实音频分支得到肯定分与否定分,对静音分支同样得到两个分,共 4 个标量,分别概括了有音频与无音频时对是或否的总体偏好。
静音参照 × 置信度间隔增益: 静音参照分工是构造与原音频等长的全零波形以近似只依赖文本先验的输出,置信度间隔增益分工是计算真实音频下是减否的间隔与静音下间隔之差,二者搭配的原因是只有先估计先验偏置才能判断音频是否真正推高了肯定倾向,组合后形成只在增益不足时惩罚肯定词的门控。
门控的计算目标是判断音频是否真正推高了肯定倾向。先算真实音频间隔等于音频肯定分减音频否定分,静音间隔等于静音肯定分减静音否定分,再算增益等于前者减后者。若增益为正,说明真实音频相对静音更偏向是,若小于等于零,说明音频没有提供支持肯定的证据。原文引入阈值,记为陶,当增益小于陶时认为证据不足,对组合对数几率中属于肯定集合的所有位置减去强度伽马,否则保持不变。该门控只在首步执行,后续解码只用组合对数几率。
对数和指数池化 × 是与否词集合: 是与否词集合分工是枚举 yes、Yes、是等多种表面形式并去重合并子词编号以覆盖分词差异,对数和指数池化分工是对集合内多个词的对数几率做平滑取大以得到类的总体倾向,二者组合的意义是用一个标量稳定度量肯定或否定语义而不受单个编号偶然高低的影响。
组合对数几率本身沿用已有形式,即一加对比强度乘音频分支减去对比强度乘静音分支,其中对比强度记为阿尔法且非负。直觉是真实音频下显著高于静音的词被放大,在静音下依然很高的词因语言先验嫌疑被相对压制。设计上有两个优点,一是音频接地且决策自适应,是否惩罚完全由增益决定,二是任务对齐,只压制无支持的是而保留良构的否。
没有训练阶段时,真实计算过程是什么?
本研究没有训练阶段,没有更新任何模型参数,也没有梯度回传与优化器步骤。两个被评测模型的参数全程冻结,所谓的构造只是推理时构造等长全零静音波形作为参照,不涉及学习先验或拟合标签。真实计算是每次解码做 2 次前向,1 次条件为真实音频加问句与已生成前缀,1 次条件为静音加同样上下文,得到两组词表对数几率后按公式组合并在首步做门控判断。
提示词按原文固定为强调关注给定音频并要求以是或否开头作答的英文指令,不同学科不需要改写。超参数按原文报告,对比强度通常取 0.5 或 1.0,阈值取 0.2 并在 0 到 0.5 范围内,惩罚强度取 2.5 并在 2 到 4 范围内,论文明确说明没有对三者做穷尽消融,而是聚焦整体有效性与稳健性。未报告的缺项是 2 次前向带来的延迟与显存开销、不同采样策略下的最优阈值选择方法,以及除首词外后续解释句的一致性约束,这些不能从模型名称推定实现。
代码链接在正文中给出,但本次收到的资源状态显示该地址返回 404,当前不可用,复现时不能假定可直接下载官方实现,需要按公式自行实现对数几率处理器。权重下载与系统可运行是另一回事,即使有公开权重,2 分支前向的工程对接仍需自行验证。
实验条件:数据、模型、指标与可比性如何固定?
要回答的核心问题是首步门控能否在不重训的情况下减少无支持的是,同时保持总体问答质量。对照包括默认解码、固定强度的音频感知解码、自适应向量引导与本文方法,比较时固定同一模型、同一数据集划分、同一提示词与同一以否为正类的计分口径。指标方向是召回与 F1 越高越能拒绝幻觉,准确率用于检查是否因过度保守而塌陷,精确率用于观察肯定回答的可信度变化。
数据划分已在问题节交代,音频标题幻觉集分随机、对抗、流行三档,环境问答集取是否子集。聚合对象是最终回答的首词映射到是否,而机理分析用的受试者工作曲线只用首步词表对数几率经池化后算出的否概率做阈值扫描,与最终生成文本的解码路径无关,因此不能把曲线下面积直接等同于端到端准确率。硬件预算与统计显著性在原文中未报告,缺失不视为技术错误,但在引用结论时应限定为报告值的比较。
实现细节上,静音构造为与原音频等长的全零波形,门控只看首步增益,惩罚只作用于肯定集合。初学者易误解为每步都惩罚是,实际是首步之后完全回到组合对数几率。另一个易误解是把冻结参数等同于确定性输出,实际解码仍受采样与后续词影响,本文的确定性只体现在给定对数几率下的门控规则是确定的。
主结果:增益出现在哪里,代价是什么?
比较的问题是相对固定强度对照,首步门控是否在三档难度与另 1 数据集上带来可运行的 F1 收益,公平条件是同一模型与同一对比强度下比较,指标方向是 F1 越高越好且需兼看召回与准确率。下表整理论文直接报告的相对提升区间与环境集上的绝对变化,数值保留原文精度,不做四舍五入与单位追加。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 流行、对抗、随机三档 | F1 相对音频感知解码的提升 | 音频感知解码 | 大模型提高 0.059 到 0.117 | 音频感知解码 |
| 流行、对抗、流行三档 | F1 相对音频感知解码的提升 | 音频感知解码 | 小模型提高 0.025 到 0.064 | 音频感知解码 |
| 环境问答是否子集 | F1 绝对值变化 | 0.810 | 0.816 | 大模型上本方法相对音频感知解码 |
表后解释需要同时讲收益与代价。论文报告显示,在大模型上本方法在三档上全面高于固定强度对照,在小模型上提升较小但仍为正,在环境集上大模型从 0.810 升至 0.816 而小模型与对照相当。支持的判断是首步类别条件门控在强语言先验下提供了超出全局加权的抑制能力。限制是小模型上保守与准确率的权衡更明显,对抗档上另一基线曾取得更高 F1,说明本文方法不是在所有采样机制下都最优,未胜出项必须保留。
下段导读混淆矩阵图有助于理解收益来源,请先按真标签行与预测列确认对象,再比较默认与增强后对角线深浅的变化。该图比较了默认、固定对照与本文方法在随机档上的归一化混淆矩阵。
看图路径: 1. 先按行确认真标签为是与否,列为预测是与否;2. 比较默认解码左上深蓝与右下浅色的不对称;3. 再看增强后右下否类召回格如何变深
论文图 3。原论文 Figure 2:“Confusion matrices on AudioCaps-Hallucination for Qwen2-Audio-7B-Instruct under the RANDOM setting: Default (a), AAD ((b) and (c)), and TAD ((d) and (e)).”。
从像素可见,图分上下两排共五块,上排为默认与两种强度的固定对照,下排为两种强度的本文方法,每块横轴为预测是否、纵轴为真标签是否并按真标签归一化。默认块呈现明显的肯定偏置,真否行大量落入预测是列。固定对照已把否类召回拉高,本文方法进一步加深右下格而左上真阳性略变浅,反映更保守且证据依赖的边界。论文报告的具体数字见下表,同样保留原文写法。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 随机档真肯定召回 | 召回 | 0.920 | 0.844 | 默认解码相对本方法 |
| 随机档真否定召回 | 召回 | 0.266 | 0.858 | 默认解码相对本方法 |
| 随机档真否定误判为是 | 错误率 | 0.734 | 0.142 | 默认解码相对本方法 |
| 随机档固定对照真肯定召回 | 召回 | 0.911 | 0.844 | 固定对照相对本方法 |
| 随机档固定对照真否定召回 | 召回 | 0.655 | 0.858 | 固定对照相对本方法 |
表后解释要指出代价与反例。主要收益是把真否召回从 0.266 经 0.655 推高到 0.858,对应幻觉错误降至 0.142。具体代价是真肯定召回从 0.920 降至 0.844,说明部分本应回答是的样本被连带压制。未评测边界是该矩阵只覆盖大模型随机档,不能推广到小模型或对抗流行档的全程表现。
机理与消融:首步证据真的变可分了吗?
要验证的问题是增益是否在首步提供了可分的音频证据,以及对比强度增大是否总是有益。论文用两种互补视角作答,一是用首步池化分数构造的否概率做阈值扫描得到受试者工作曲线,二是可视化增益分布与音频间隔相对静音间隔的散点。条件一致性在于曲线与散点都只用首步对数几率,不掺入后续生成的影响。
下段导读曲线图有助于判断早期可分性,请先确认正类为否,再比较默认曲线与其他曲线的包络关系。该图展示了大模型在随机档与环境集上的首步受试者工作曲线及曲线下面积。
看图路径: 1. 先确认横轴为假正率纵轴为真正率,正类为否;2. 比较默认曲线与其他四条在左下角的抬升幅度;3. 读右下图例中各方法的曲线下面积数值排序
论文图 2。原论文 Figure 3:“ROC curves and AUC values of Qwen2-Audio-7B- Instruct on AudioCaps-Hallucination under the RANDOM set- ting (left) and on Clotho-AQA (right).”。
从像素可见,左右两幅子图横轴均为假正率、纵轴为真正率,对角线为随机基线,深蓝默认曲线在左段明显低于青色与暖色曲线,图例给出各方法曲线下面积,本文方法在两侧均高于默认与固定对照。这支持首步音频接地证据增强、语言先验依赖减弱的解释,但原文未给出面积的统计误差,因此只能表述为报告值上的领先,可能仍待验证。
对比强度 × 肯定惩罚: 对比强度分工是控制真实音频分支与静音分支在式一中加权相减的全局幅度,肯定惩罚分工是门控触发后只对肯定集合中所有词减去固定值,二者搭配的原因是前者全程调节音频 grounding 的力度而后者只在首步且只对是类做修正,组合后避免了在证据已足时因全局增强而过度纠偏。
下段导读证据分布图有助于理解门控阈值为何取小值,请先看增益直方中两色峰的分离,再看散点中静音间隔与音频间隔的偏移。该图对比了 2 数据集上真是否样本的增益分布与间隔散点。
看图路径: 1. 先看左侧增益分布中两色峰的位置与重叠区;2. 再看右侧散点中横轴静音间隔与纵轴音频间隔的偏移方向;3. 对比上下两行在两个数据集上是否呈现同一分离趋势
论文图 4。原论文 Figure 4:“Visual Analysis of Audio Evidence on AudioCaps- Hallucination ((a) and (b)) and Clotho-AQA ((c) and (d)).”。
从像素可见,上行对应音频标题幻觉集,下行对应环境集,左侧直方横轴为增益、纵轴为计数,蓝色真肯定峰偏右、橙色真否定峰偏左但在零附近有重叠,右侧散点横轴为静音间隔、纵轴为音频间隔,真肯定点更集中于上方。这解释了门控行为,即音频带来明显增益时保留肯定,增益弱时选择性压制无支持的肯定倾向。关于对比强度的消融,论文报告在更难的档上增大强度通常提高召回,但在随机档上曾出现 F1 轻微下降,说明过强对照在证据已足时会过度纠正,这是否定固定强度越大越好的反证。
哪些结论不能下,哪些边界尚未评测?
论文直接报告的是在给定提示词、给定阈值与惩罚强度下的 F1 与召回比较,有限解释是首步增益可分性支持了门控的合理性,未验证推测是该机制是否适用于开放式标题生成或多轮对话中的幻觉。缺失证据不是技术错误,但不能把相关性当因果,例如增益分布的分离与最终 F1 提升相关,不等于证明每次触发都因果地纠正了幻觉。
未测量的量包括推理延迟、2 次前向的计算成本、不同音频长度下的静音构造敏感性,以及人工评测的解释句质量。总体趋势不等于每组每步都成立,例如小模型随机档上增大强度并未单调获益,对抗档上另一基线更优。训练资源与输出帧率在此不适用,因为本研究无训练,但推理开销与实际延迟仍需补测才能讨论部署取舍。原文表格与图注之间未发现算术冲突,若后续发现口径差异,应明确标注冲突而不自行编造聚合口径。
复现先做什么,需要哪些信息条件?
复现的第一步是固定提示词与计分口径,把否当正类并只看首词映射,避免把解释句的措辞差异计入错误。第二步是实现词集枚举与池化,对肯定与否定的多种表面形式分词取并集,用带最大值平移的对数和指数求和得到 4 个标量,注意保留原文数值稳定做法而不改变数学值。第三步是实现 2 分支前向,静音为与原音频等长的全零波形,组合时用同一对比强度分别取 0.5 与 1.0 复跑,再在首步计算增益并在小于 0.2 时对肯定集减去 2.5。
关键超参数与信息条件是对比强度、阈值、惩罚强度、模型版本与数据集三档划分,缺一不可。代码开源方面,正文给出的地址本次显示 404,当前不可用,不能写成已公开可用,需要自行实现对数几率处理器并记录随机性来源。权重下载与系统可运行要分开验证,即使模型可加载,2 分支的批处理与首步拦截逻辑仍需单测,例如用全零输入检查静音分支是否退化为先验输出。
还需补的验证是阈值在 0 到 0.5、惩罚在 2 到 4 范围内的敏感性扫描,以及在对抗与流行档上的分档复跑,以确认提升区间是否可重现。若只复跑随机档,不能声称覆盖了全部三档的结论。
何时值得尝试,一句话如何带走?
当问答是二元存在性判断、默认解码呈现高精确低召回的肯定偏置、且允许 2 次前向的推理成本时,值得尝试这种只在首步、只对肯定类做减法的门控。它保留了固定对照的音频接地优点,又用增益判断避免了弱证据或已足证据下的过度纠正。教学例子是雨声中问警笛,若音频未推高肯定间隔,门控会把是压下去而保留否的良构输出,但这只是帮助理解的例子,不附加无源的效果数值。
带走的判断是首步对照加类别条件是抑制音频幻觉的轻量可行路径,证据是相对固定对照在大模型三档上 0.059 到 0.117 的 F1 提升与环境集上 0.810 到 0.816 的保持性增益,代价是更保守的边界与真阳性召回的轻微损失。后续若要用于开放生成,还需验证首步修正能否传导到后续句的一致性,否则不应把是否问答的结论推广到全程生成质量。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



