英文题目:CoRE: Contrastive Evidence-Aware Rescoring for Multiple-Choice Audio Question Answering

会议身份:conference:interspeech:2026:conference-paper-id:zhang26f_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#评测协议 #测试时自适应 #音频大模型 #音频问答

评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Peihong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhixin Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuxuan Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yiqiang Cai:机构信息未能从会议 PDF 纯文本可靠映射
  • Yizhou Tan:机构信息未能从会议 PDF 纯文本可靠映射
  • Shengchen Li:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

多项选择音频问答要求联合音频片段、自然语言问题与候选选项选出最符合声学证据的选项,难点是大型音频语言模型易依赖文本先验而忽视真实声音。该文提出对比证据感知重打分(Contrastive Evidence-Aware Rescoring,CoRE),先将原始波形按40ms分块置换并以0.5概率块内时域反转构造反事实音频,再在统一选项打分协议下对比原始与反事实的长度归一化选项对数似然得到证据增益,最后由基于2为底Jensen-Shannon散度的冲突信号与仅保留正向熵减的置信信号经几何平均构成自适应门控,融合两组打分输出预测。与静音作负条件或词元解码层对比不同,CoRE在选项层保留短时声学统计并破坏长程语义连续性,减少分布外伪影并与选择题决策对齐。在DCASE 2025 Task 5与AIR-Bench SoundQA上,以Kimi-Audio-7B-Instruct为基座时CoRE在生物声学问答子集相对默认推理将准确率从43.3%提升至51.9%,在Qwen2-Audio-7B-Instruct上从30.0%提升至40.7%。该结论目前仅适用于英文选择题与短生物声环境声场景,对生成式问答与高层推理主导问题外推尚未验证。方法为无训练测试时干预,每样本需一次额外反事实前向。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,解读要保留什么?

这篇解读面向刚进入语音与音频语言模型的研究生,目标是把论文方法讲到可核对、可复述。输入是一个音频片段、一个自然语言问题和一组候选答案,模型要从候选项中选出与音频证据最一致的一个。必须保留的信息包括反事实音频如何构造、选项分数如何计算、证据增益如何相减、自适应门如何根据冲突与置信决定融合强度,以及实验在什么数据、什么模型、什么打分协议下比较。输出是测试时直接可运行的重打分预测,不需要重新训练模型。

全文按学习依赖展开,先讲任务与偏置现象,再讲方法全景与组件计算,然后讲构造与推理的真实开销,最后讲实验条件、主结果与反证。教学中举的例子会明确标为例子,不把例子当作论文报告的数值效果。

已有路线为什么分训练时与推理时两类?

缓解多模态问答中模态偏置的已有工作大致分两类。训练时方法通过去偏目标、辅助监督或结构修改来加强接地,但通常需要重训练并付出较大算力,部署时不够即插即用。推理时免训练对比方法通过比较原始输入与扰动输入下的模型行为来估计校正信号,再引导预测更忠实于输入,在视觉语言模型中有视觉对比解码,在指令条件扰动中有指令对比解码,在音频语言模型中有用静音作无音频参照的音频感知解码。

论文把后者视为最接近的概念范式,但指出它在多项选择音频问答中有两个未讲清之处,一是如何构造信息量足够的音频侧对照而不引入强干预伪影,二是如何把对比信号稳定地用于选项级修正而非逐词元解码。教学例子是,如果直接把音频删掉或置零,模型分数变化可能来自分布外移而非证据缺失,这正是论文要避免的对照设计缺陷。

模态偏置在一个样本里如何表现?

论文研究的多项选择音频问答要求联合分析音频信号与文本内容。模态偏置指决策被问题与选项之间的语言先验主导,而不是被音频中的声学证据主导。论文给出的示意是,问题问雷声之后跟着什么声音,录音中实际更支持汽车警报,但模型因为雷与暴雨在文本中共现很强而选择暴雨,结果语言上合理但声学上错误。下面导读图 1 有助于建立这种直观,重点是看时间轴上的事件顺序与模型选择的依据分叉。

看图路径: 1. 先看顶部波形与语谱上标注的雷声与汽车警报出现的时间先后;2. 再看下方问题框中四个选项哪个被标为预测哪个被标为音频支持;3. 最后对比右侧文本捷径框与音频证据框的箭头粗细与文字标注

原论文 Figure 1:Modality bias in multiple-choice AQA.

论文图 1。原论文 Figure 1:“Modality bias in multiple-choice AQA.”。

该图上半部分展示一条随时间展开的波形与语谱,先出现雷声的强脉冲,后面出现汽车警报的周期性结构,下半部分把同一问题下的 4 个选项列出,并用两个分支分别标注文本捷径与音频证据。可以看到文本捷径指向语言共现导致的错误选项,音频证据指向录音中实际出现的事件,模型在两者冲突时错误地跟随了前者。这说明评价不能只看选项文本是否合理,还要检查分数是否随音频时序证据变化,这也是后文构造反事实音频的动机。

模态偏置 × 反事实音频: 模态偏置负责描述故障现象,即模型不听音频而靠问题与选项的语言共现做选择;反事实音频负责提供对照条件,用打乱长时序但保留短时音色的方法去掉可用的时序证据;两者搭配的理由是只有构造出可比的音频对照,才能把原来靠文本先验得到的分数与真正依赖声学证据的分数分开,组合意义是为后续逐选项的证据增益计算提供可减的基准。

CoRE 沿一个样本走完哪五步?

沿一个样本走一遍有助于记住全景。输入是原始音频、问题与候选项列表,先用骨干大音频语言模型在统一选项打分协议下算出每个选项的原始分数向量与概率分布。然后把原始波形切块并做置换与块内反转,合成一条反事实音频,再用同一模型与同一模板算出反事实分支的分数与分布。接着用原始减去反事实得到逐选项的证据增益,用两分布的散度与熵变算出自适应门控系数,最后按该系数在两组分数之间做凸插值得到重打分结果并取最高分。下面导读方法总览图,重点是区分上路构造音频与下路融合分数的分工。

看图路径: 1. 先沿上半部分从分块到反转再到合成反事实音频的主路径看数据流向;2. 再看下半部分自适应门与融合模块如何同时接收两路分数;3. 最后看右下角四个选项的柱状对比中原始与反事实与融合结果的相对高低

原论文 Figure 2:Overview of CoRE.

论文图 2。原论文 Figure 2:“Overview of CoRE.”。

该图上半部分是反事实构造流,从分块经反转操作拼成反事实波形,下半部分是自适应门控重打分,门控系数同时考虑分布冲突与熵下降,再与两路分数一起进入融合公式,右下角用 4 个选项的柱状对比示意融合如何改变排序。可以看到主路径始终是同一模型跑 2 次前向,没有更新参数,新增作用全部来自对照相减与门控加权。这就把免训练即插即用的含义落到具体计算,而不是一句口号。

反事实音频的块操作具体做什么?

先解释术语。白话说,块置换就是把长录音切成很多小段再打乱顺序,块内时间反转就是把某些小段倒着放。英文可记为 chunk permutation 与 random segment reversal。构造时先把波形按固定块长切成互不重叠的块,块长按论文实现取 40 毫秒,对每块独立以 0.5 概率决定是否倒放,再把变换后的块按随机置换拼接,并在拼接边界做 3 毫秒线性交叉淡化以减少咔哒声。短窗的用意是保留短时声学统计而打散长程语义连续性,交叉淡化是工程上减少拼接伪影的手段。

块置换 × 块内时间反转: 块置换负责把波形切成固定时长小块后随机重排顺序,打断跨块的长程语义连续性;块内时间反转负责以一定概率把每个小块在时间轴上倒放,破坏块内局部时序方向但保留频谱能量包络;两者搭配是因为只置换仍可能保留块内可懂片段,只反转则长程顺序还在,组合后既打散全局事件顺序又扰动局部方向,同时短时声学统计仍接近原始音频。

走完这步后,同一问题与选项在反事实音频下再跑 1 次模型,得到对照分数。如果某选项高度依赖真实事件顺序,它在反事实下的分数会明显下降,相减后证据增益为正;如果某选项只是靠文本先验,它在两路下分数都高,相减后增益很小。这种设计避免了用静音作对照,因为静音会带来强分布偏移,分数差可能反映有无音频而非选项间的相对证据。

选项分数与证据增益如何算?

先解释术语。白话说,选项级打分就是不让模型自由生成,而是把每个选项逐词元喂给模型算条件对数似然再按长度平均,英文可记为 option-level scoring;证据增益就是原始分数减去反事实分数的差向量。符号上,原始音频记为小写 a,问题记为 q,候选项集合记为大写 X,模型输出的选项 logits 记为正分支与负分支,softmax 后得到对应分布。计算目标是得到每个选项对真实长时序的依赖度,实现上对每个选项的词元序列做教师强制,条件包括音频、问题与当前排列的候选列表,再取平均对数似然作为该选项分数。

选项级打分 × 证据增益: 选项级打分负责在统一模板下用教师强制长度归一化条件对数似然为每个候选项算分,避免生成时前缀动态和词法不确定性的干扰;证据增益负责用原始音频 logits 减去反事实音频 logits 得到每个选项的差值;两者搭配是因为只有先把多选题变成可比的向量分数,对照相减才有明确含义,组合后得到每个选项对真实时序结构的依赖程度。

需要强调的是,打分模板与排列在两路之间保持一致,论文在评估时还固定反事实采样种子并在同一例子的 8 种选项排列中复用同一条反事实音频,目的是把排序鲁棒性与反事实随机性分开。只有在这种统一协议下,相减得到的差值才更可能反映声学证据而非模板或顺序变化。

门控为什么要同时看冲突与置信?

先解释术语。白话说,分布冲突指两路预测分得有多开,用以 2 为底的 Jensen-Shannon 散度度量,英文记为 Jensen-Shannon divergence;置信提升指真实音频是否让分布更集中,用反事实熵减去原始熵并只保留正的部分再归一化,英文可记为 one-sided entropy reduction。门控系数取两者归一化信号的几何平均开方,只有两者同时较大时才给大权重。

Jensen-Shannon 散度 × 单侧熵减: Jensen-Shannon 散度负责度量原始分布与反事实分布之间的冲突大小,经以 2 为底的指数变换归一到区间内;单侧熵减负责只保留真实音频使分布更集中的确定性提升,过滤掉真实音频引入更多不确定性的情况;两者搭配是因为单独有冲突不能说明真实音频更好,单独变集中也可能是偶然,组合成几何平均后只有冲突且更确定时门控才打开。

搭配理由在原文有明确安排,当两路差异小或真实音频并未降低熵时,小门控可以抑制过校正,避免把随机波动当成证据。融合时用凸插值把最终分数放在两路连线段上,不外推超出原始分支,这与直接加上差值的做法不同。

自适应门控 × 凸插值融合: 自适应门控负责根据当前样本的冲突与置信信号算出 0 到 1 之间的系数贝塔,决定多大程度上信任原始音频;在凸插值融合中负责按该系数在反事实 logits 与原始 logits 之间插值得到最终分数;两者搭配的理由是低冲突或无置信提升时不应大力修正以免过校正,组合意义是把样本级的证据可靠性转化为连续可调的重打分强度,且结果不外推超出两个分支的连线段。

沿样本看,若真实音频确实带来集中且与反事实分歧大,门控接近 1,融合偏向原始分数并放大证据增益的作用;若两路几乎一致,门控接近 0,融合偏向反事实侧从而压住修正幅度。这种样本级自适应是后文消融要验证的核心。

没有训练阶段时真实计算是什么?

本研究没有训练阶段,没有更新任何骨干参数,也就没有优化器、梯度路径与监督损失需要交代。真实计算是测试时推理,包括 1 次原始音频前向、1 次反事实波形合成与 1 次反事实前向,外加门控与融合的轻量数值计算。调用的是已有开源骨干的词元级 logits 接口,用于计算选项条件似然,不做结构修改。

需要补的缺项是原文未报告逐样本延迟与显存占用,只说明需多 1 次前向的适度开销,不能从参数冻结推定输出确定,因为块置换与块内反转本身带随机性,且语言模型解码与采样种子会影响具体分数。复现时应固定反事实种子以分离随机源,并记录重采样到各骨干输入采样率、块长、反转概率与交叉淡化时长的完整配置。

数据、模型与打分协议如何对齐?

实验按问题组织,先讲测什么与条件是否一致。数据用 DCASE 2025 挑战 Task 5 音频问答集的 3 个子集,生物声学问答关注可变时长录音的识别与推理,时序声景问答强调声景中的时间推理,复杂问答源自大规模音频理解基准并需要更高层推断,另加 AIR-Bench 声音问答做跨基准泛化,均沿用官方划分并报告首选准确率。模型用 Qwen2-Audio-7B-Instruct 与 Kimi-Audio-7B-Instruct,两者都提供推理时词元 logits 从而支持统一选项打分接口,无需改结构或更新参数。

打分协议是关键公平条件,所有方法对每个候选项计算长度归一化条件对数似然,预测取最高分,并对每样本采样 8 种答案顺序排列重算预测后报告均值与标准差,以量化顺序鲁棒性。比较对象都是同一骨干与同一协议下实际可运行的免训练策略,包括默认推理、固定音频注意力前缀提示、静音作对照的音频感知解码,以及保留门控与增益但把反事实换成静音的对照,搜索最优或事后最优值未被当作可部署收益。

资源状态方面,本次收到的证据未绑定完成验证的代码与数据链接,因此不能写代码或数据已公开,只能按论文文字复述配置。

主结果在统一协议下支持什么判断?

比较问题是,在同一模型与同一选项打分协议下,反事实对照与自适应门控是否带来一致增益,指标方向是首选准确率越高越好。表前需要说明公平条件是所有方法共享骨干、模板与 8 次选项乱序平均,且反事实种子固定以隔离随机性。下表整理主结果中的关键数字,列为不同子集与跨基准,行保留可运行基线以便判断增益来源。

方法生物声学问答时序声景问答复杂问答声音问答跨基准
默认推理30.0±2.639.2±0.949.6±1.167.2±1.2
音频感知解码33.1±2.145.7±0.852.6±0.971.5±1.0
CoRE40.7±2.249.6±0.853.2±0.973.8±0.9

表后解释是,论文报告 CoRE 在两个骨干的 4 个评测上均为最好,且在生物声学上提升最大,原文解释为细粒度声学线索更关键,而复杂问答增益较小是因为该子集更依赖高层推断而非单纯接地。重要对照是 CoRE 优于把反事实换成静音的版本,支持增益来自信息量足够的对照而不只是对比重打分本身。限制也要同时写出,总体趋势不等于每种子集都大幅提升,复杂问答的绝对增益明显小于前两者,且标准差显示生物声学波动较大,跨基准的提升幅度也需结合原表另一骨干的数字一起看,不能只挑最大的一组宣传。

反事实构造与门控的消融说明什么?

消融按两个问题组织,一是打乱是否真做到破坏长程而保留短时,二是门控是否需要双信号。第一个问题用自相似矩阵的局部与全局相关与对数梅尔均值方差余弦相似度来验证,报告显示完整构造的全局相关下降最多而局部相关保持相对较高,短时统计余弦接近 1,支持扰动集中在非对角长程结构。下面导读自相似可视化,重点是看差值矩阵的亮区位置。

看图路径: 1. 先按行确认生物声学、时序声景与复杂问答三个子集的面板位置;2. 再按列对比原始与反事实与差值矩阵中对角线附近与远离对角线区域的变化;3. 最后观察差值列中亮色集中在非对角区域而近对角带相对稳定的模式

原论文 Figure 3:SSM visualization for BQA, TSQA, and CQA.

论文图 3。原论文 Figure 3:“SSM visualization for BQA, TSQA, and CQA.”。

该图按行给出 3 个子集的原始矩阵、反事实矩阵与差值绝对值,可以看到反事实矩阵出现明显的块状网格,差值在远离对角线的区域更亮而近对角带相对稳定,与定量中全局相关下降而局部保持的趋势一致。这支持原文的安排理由,即短窗置换加反转主要打散长程连续性而非引入大尺度低层分布偏移。第二个问题是门控消融,固定系数的表现跨子集不一致,自适应门整体最好,单用散度或单用熵都弱于双信号,去掉单侧过滤也会掉点,算术平均与乘积也不如几何平均开方。未胜出项要明确写出,固定系数与单信号门控就是反例,说明常数强度与单一冲突信号不足以稳定校正。

为便于复现,把论文明确给出的构造与评估超参数整理成第二张宽表,指标单位按原文保留在同一格内。

配置项块时长反转概率交叉淡化反事实条数选项乱序数
取值40 ms0.53 ms18

表后补充是,这些取值是本研究实际运行的配置,不是搜索最优的声明,改变块长或反转概率会同时影响长程破坏与短时保留的平衡,论文未报告这些超参数的灵敏度曲线,因此复现时先按原值跑通,再补做灵敏度验证。成本方面,每样本多 1 次反事实前向是确定的额外开销,但原文未测量延迟与显存,不能承诺实时性改善。

哪些边界尚未验证?

论文直接报告的是多项选择设置下的准确率提升与构造验证,有限解释是复杂问答增益小与生物声学增益大与任务对接地依赖不同有关,未验证的推测不能当结论。缺失证据不是技术错误,但需要明确列出,生成式问答的扩展只是未来工作,当前门控与增益公式依赖选项级分数,不能直接推广到开放生成。误判率、延迟、显存与输出帧率均未测量,不能说这些量得到改善。

反事实随机性与选项顺序随机性虽在评估中做了分离,但单条反事实是否足够稳定、多次采样平均是否更好,原文只用一条而未报告多次平均的结果。分布偏移的验证只用了对数梅尔均值方差余弦与自相似相关,没有报告人类听感或下游分类器的分布距离,因此只能说低层统计接近,不能说听觉语义完全保留。

复现先做什么,后补哪项验证?

何时值得尝试是,当多项选择音频问答中怀疑模型靠文本先验答题,且骨干能给出词元 logits 以支持统一选项打分时,可以先试这种免训练重打分。

复现先做四件事,一是按原文把音频重采样到各骨干输入采样率后切成 40 毫秒不重叠块,做随机置换与 0.5 概率块内反转并加 3 毫秒交叉淡化,二是固定反事实种子并为每样本生成一条反事实,三是用同一模板分别计算原始与反事实的逐选项长度归一化条件似然,四是按散度与单侧熵减算门控并做凸插值取最高分,同时对每样本做 8 种选项乱序平均。

还需补的验证包括多次反事实采样的方差、不同块长与反转概率的灵敏度、静音对照与本对照在同一门控下的公平对比,以及在新基准与新骨干上的迁移。信息条件上,原文给出关键超参数但本次未确认代码与权重可达,复现应以论文文字为准并记录环境与种子。

如何一句话记住取舍?

记住取舍有助于避免误解,CoRE 用打乱长时序但保留短时音色的反事实音频,把原来混在一起的文本先验分数与声学证据分数分开,再用冲突与置信双信号决定多大程度上跟随原始音频。适用时能提升对细粒度与时序证据的依赖,不适用时在高层推理为主的题目上增益有限,且每样本多 1 次前向是必须支付的成本。重提结果时增加适用条件,生物声学与时序声景上相对收益更大,复杂问答上应降低预期并结合提示工程与门控消融一起判断。

最终判断用论文的措辞是报告与支持,对未测量的延迟、成本与生成式扩展用可能与待验证表达,不把相关性说成因果,也不把免训练等同于确定性求解。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总