英文题目:Investigating Faithfulness in Large Audio Language Models

会议身份:conference:interspeech:2026:conference-paper-id:mousavi26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#评测协议 #音频大模型 #可解释性 #音频问答

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Pooneh Mousavi:机构信息未能从会议 PDF 纯文本可靠映射
  • Lovenya Jain:机构信息未能从会议 PDF 纯文本可靠映射
  • Mirco Ravanelli:机构信息未能从会议 PDF 纯文本可靠映射
  • Cem Subakan:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

大型音频语言模型(Large Audio Language Models, LALMs)能对输入音频生成思维链(Chain-of-Thought, CoT)再给出多选答案,难点在于推理听起来合理却可能不反映真实听觉依据与决策过程。第一步以逐步思考提示让模型同时生成推理链与终答并自动分离推理串,得到干净基线作为后续干预的比较起点。第二步保持提示不变而对同一音频施加全时长高斯白噪声叠加与随机掩蔽与语音引导掩蔽及对抗语音注入后重新生成,用基线对比判定推理是否扎根声学证据。第三步冻结原始音频而对基线推理依次施加填充词与提前回答截断与改写与加错后再续写终答,用终答一致性与外部裁判打分判定是否真正跟随推理。相比仅看准确率的评测,该音频忠实与输出忠实双分支解耦能暴露自洽幻觉与语言压倒听觉的多模态断连,在Audio Flamingo 3-Think与Qwen2.5-Omni上覆盖SAKURA四轨与MMAR与MMAU与JASCO验证。核心发现是多模态断连:文本改写下终答几乎完全一致而加错与截断与填充使一致性单调下降,说明内部文本一致性较好;但强噪声与全静音下仍出现高自洽幻觉推理,且对抗错误语音使 SAKURA-Animal 上 Audio Flamingo 3 准确率从约 75% 跌至约 25%,语言线索可压倒声学证据。结论边界是仅多选题与仅 2 个开源模型,未做开放问答与闭源模型与人工听感校验,未披露训练与推理成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要回答哪两个忠实问题?

本文的输入是一段声音加上一道文字选择题,输出是先写一段逐步推理再给出最终选项。目标是检验这段推理是否可信,同时观察选项是否答对。对于刚进入语音与音频理解的研究生,首先要分清两个忠实方向,这决定了后文所有干预的含义。

第一个方向是推理对音频的扎根程度,也就是推理文字多大程度上源于声学输入,是否描述了声音中真实存在的细节。论文把大音频语言模型解释为音频编码器与预训练大语言模型接在一起的系统,白话说就是先把声音变成模型能读的表示,再让语言模型做问答。思维链就是模型在给出答案前生成的中间推理文字,白话说就是把听到了什么所以选什么写出来。

第二个方向是推理对最终答案的跟随程度,也就是最终答案是否随着推理变化,推理与答案是否走向一致。作者强调,生成推理带来准确率提升,这为观察决策过程提供了线索。忠实在这里指解释反映模型真实决策过程的程度,听起来合理属于可读性评价,忠实属于过程一致性评价。

需要记住的信息是实验条件与评价口径。被测模型是 Audio Flamingo 3-Think 与 Qwen2.5-Omni,评价把推理与答案分开看,用干净音频下的输出做基线。本次收到的证据中展示页链接仅有文字提及,状态验证结果记录为本次未能确认可达,讨论代码模型或数据状态时以该记录为准。后续所有数字都只在原文报告的条件下成立,解读时结合任务类型与干扰强度一起看。

已有路线做了什么,本文的缺口在哪里?

文本大模型已有工作指出思维链与决策过程存在偏离的可能,并提出了 3 种失真解释。事后推理指推理文字形成于答案之后,额外计算量指变好源于多生成了一些词,编码式推理指有用信息藏在措辞变化里而非人类可读逻辑中。围绕这些假设,前人提出了改写截断加错与填充等干预,用来看答案是否跟随推理变化。

音频领域已有工作让大音频语言模型生成思维链并报告准确率提升,也有人测试模型对音频修改和提示扰动的鲁棒性。这些工作回答了推理是否有用以及模型是否稳定,本文在此基础上进一步追问推理是否忠实。声音带来的考察点很有特点,涉及模型是否纳入音频、纳入多长上下文、面对转写文字与声学线索冲突时锚定哪一侧。

本文的增量正在于此。作者把文本领域的思维链干预带到音频模型上,同时新设计了 3 类音频干预,分别对应无幻听整体听与按指令听 3 个听觉要求。同输入的对照是同样做音频问答的行为,同监督的对照是同样用外部大模型做裁判的评价,同运行阶段的对照是同样在推理时提示逐步思考。类别差异反映任务难度与所需模态的差异,例如需要全局上下文的共推理集与单跳分类集适合放在各自的条件下解读。

要检验的四个具体问题是什么?

作者把大问题拆成 4 个可操作的小问题,前 3 个关于音频,第 4 个关于输出。第一问是无幻听聆听,模型是否把音频真正纳入答案,在噪声淹没或全静音时描述的现象与输入是否对应。第二问是整体聆听,模型依赖局部片段还是全段上下文,是否存在只盯着一小段的注意力汇聚行为。

第三问是专注聆听,模型是否按题面听该听的部分,面对语言线索时如何取舍。第四问是思维链对输出的忠实性,改变推理内容后最终答案是否相应变化。这 4 个问题对应两类干预,音频干预改声音不改文字,用来看推理与答案是否还站得住,思维链干预改推理不改声音,用来看答案是否依赖推理。

教学例子可以帮助理解,假如问题是根据动物叫声选身体特征,理想推理应先说听到了猫叫,再说猫有爪子,最后选爪子。该例子用于帮助理解流程,原文的数值效果以后文曲线与表格为准。如果把音频换成强噪声后推理仍说听到了清晰猫叫,这类现象归入幻听讨论。如果在推理中把猫改成狗后答案依然维持原样,那就说明答案跟随推理的程度有限。

两类干预共用干净基线做参照,这是后文所有比较的公平起点。音频侧的基线是原音频下的推理与答案,文本侧的基线是原推理下的答案。解读变化时固定其他条件,把提示与数据本身的波动放在同一基线下观察,这样归因更为清晰。

两条干预流水线如何走完一个样本?

先沿一个样本走完全程。输入是一段原音频加一道选择题,提示要求先逐步思考再作答。模型先生成原推理与最终答案,这是基线。然后进入两条独立流水线。音频流水线保持提示不变,只改音频,重新生成推理与答案,再与基线比较。思维链流水线保持音频与提示不变,只改已生成的推理文字,再让模型基于改后推理给出最终答案,再与基线答案比较。

上半支路的 3 种音频改法分别是加噪声随机掩蔽与对抗语音注入,下半支路的 4 种思维链改法分别是改写填充词提前截断与加入逻辑错误。评价也分成两端,推理端用外部裁判打语义一致分,答案端比选项是否一致。这种分离很有价值,因为它允许出现推理变而答案不变,或者答案变而推理仍自圆其说的情况。

下段是官方原图标记,展示上下两条流水线的结构,阅读时先看主路径再看分支汇合处,重点区分改的是声音还是改的是文字。

看图路径: 1. 先沿原音频到音频干预再到模型的箭头看上半支路;2. 再沿原推理到思维链干预再到模型的箭头看下半支路;3. 对照两条支路末端分别评价推理一致性还是答案一致性

原论文 Figure 1:(top) Audio Intervention Pipeline (bottom)CoT Inter- vention Pipeline.

论文图 1。原论文 Figure 1:“(top) Audio Intervention Pipeline (bottom)CoT Inter- vention Pipeline.”。

上图上半部分显示原音频经过音频干预节点后变成噪声掩蔽与对抗 3 种形态,再与文字提示相加送入大音频语言模型,模型输出原推理与最终答案后分别做两种一致性评价。下半部分显示原推理经过思维链干预节点后变成改写填充提前作答与加错 4 种形态,再与原音频和提示相加送回模型,主要评价最终答案是否跟随变化。该图的作用是把后文所有实验固定到同一流程,让音频效应与推理效应各有归属,例子中的猫叫选项属于教学示意。

评价组件如何把推理与答案分开打分?

评价组件包含两个动作。第一个动作是答案一致性,把加噪或掩蔽后模型的最终选项与干净基线答案比较,看准确率如何随干扰加重而变化。第二个动作是思维链一致性,用外部裁判模型给基线推理与干预后推理的语义相似度打分,分数越高表示理由越稳定。裁判只判断两段文字的语义关系,评价对象是文字之间的对应程度。

这种分工的理由是准确率反映结果对错,一致性反映理由是否还在讲同一件事,两者互补。例如模型在强噪声下猜对了,但理由从听到了猫叫变成含糊其辞,此时答案一致而推理得分走低。反之,推理文字被改写后语义未变,答案应保持不变,此时推理一致而答案也应一致。两端同时看,有助于发现自圆其说但接地程度有限的推理。

大音频语言模型 × 思维链: 大音频语言模型的分工是把声音编码并与文字提示一起生成答案,思维链的分工是把中间判断展开为可读步骤,二者搭配的理由是让声音证据显式化,组合后新增的作用是可分别检验声音是否进入推理以及推理是否进入答案。

答案一致性 × 思维链一致性: 答案一致性的分工是比较干预后最终选项是否与干净基线相同,思维链一致性的分工是用外部模型评价两段推理文字的语义相似度,二者搭配的理由是把结果稳定与理由稳定分开,组合后可区分答案变了还是理由变了。

需要提醒的是裁判本身是文本模型,它给出关于理由稳定性的判断,声音是否被听见还需要结合音频干预下的行为一起看,例如在静音时是否承认听不清,以及在冲突语言线索下是否仍锚定声学证据。

三类音频干预各自改变了什么信号?

加噪声干预在整段音频上叠加高斯白噪声,覆盖多个信噪比,最极端时音频几乎与纯噪声无异。它的操作目标是检验无幻听与鲁棒性,预期是模型在阈值处给出承认听不清或无效回答一类的输出,理由细节与可听证据保持对应。随机掩蔽干预按比例分块遮掉音频,比例从低到全遮,全遮即静音,用来检验整体聆听与无幻听。

引导掩蔽进一步区分语音段与背景声段,分别遮掉一种而保留另一种,用来检验模型依赖哪种模态。对抗注入干预生成与原音频能量相当或更低的语音,反复念出错误答案或正确答案,形成语言与声学冲突。它的操作目标是检验专注聆听,要求模型扎根于题目需要的声学证据,面对转写文字时仍以声音为准。

作者强调采用保持上下文的干预思路,以减少音频编辑工具引入的分布外假象,原文给出该思路的文字说明,信号处理公式层面保持原文口径。4 种思维链干预的含义放在消融节展开,这里先记住音频干预改的是声音证据,思维链干预改的是文字理由,二者各有分工。

幻听 × 对抗注入: 幻听的分工是指在无信号或强噪声下仍描述不存在的声音内容,对抗注入的分工是在原音频上叠加念出答案的语音形成冲突,二者搭配的理由都是检验模型是否在听,组合后可同时看到极端无证据时是否收声以及有冲突线索时是否被带偏。

填充词 × 提前作答: 填充词的分工是用无意义文本替换推理以检验额外计算量是否起作用,提前作答的分工是从尾部截断推理以检验是否为先定答案后补理由,二者搭配的理由是从 2 个方向排除虚假忠实,组合后可判断答案是否真正依赖推理的语义完整性。

理解了信号改法后,后文曲线读起来更为顺畅。噪声与掩蔽让证据逐渐消失,对抗让证据相互打架,前者观察模型何时收声,后者观察模型跟随哪一类证据。

本研究训练了什么,没有训练什么?

本研究的核心动作是调用已有模型做推理,外加构造干预与自动评价。原文报告的安排集中在推理调用、干预脚本、裁判提示与基线对齐上,梯度路径参数冻结与更新优化器或训练轮数方面的安排属于原文未给出的信息,解读时以原文口径为准。从模型名称推定实现细节的做法值得谨慎,观察到的行为适合放在给定条件下描述。

实际计算过程包括用高斯噪声与掩蔽构造退化音频,用语音合成构造对抗语音,用外部大模型改写推理截断推理插入逻辑错误或替换为无意义文本,再用同一外部裁判模型打分。推理提示固定为先逐步思考再作答,并用自动预处理把推理字符串与最终预测分离。

因此复现时把重点放在推理调用干预脚本裁判提示与基线对齐上,环境版本与随机种子如实记录。相同的提示在不同采样与版本下仍可能波动,解码策略与外部裁判都会引入变化,把单次运行结果当作区间中的一个样本更为稳妥。

还可补充的验证包括更换裁判模型报告多次运行的波动,以及公开干预脚本与评价提示以便他人重放。本次证据中代码与数据状态验证结果为本次未能确认可达,复现时按该记录描述即可。下一节说明数据与协议如何保证比较公平,这是理解所有曲线与柱状图的前提。

数据模型与比较条件如何对齐?

基准包括 3 套数据。第一套侧重性别语言情感与动物声音的单跳与多跳推理,每个方向有多道选择题。第二套来自真实视频的三元组,需要对语音音乐与环境声混合做多步推理。第 3 套用人工标注的问题与答案检验专家级多模态理解。引导掩蔽还用到了需要联合音频与语音共推理的数据集,按原评价流程用裁判判断答案来自双模态还是单模态。

被测模型是 Audio Flamingo 3-Think 与 Qwen2.5-Omni,原文描述为高性能且能做结构化推理的开源模型。所有比较的公平条件是同一题目同一提示同一干净基线,只改变音频或只改变推理。指标方向是准确率越高越好,一致性越高表示越稳定,高一致性的含义随干预而定,改写后高一致反映语义保持,填充无意义文本后仍高一致则反映答案对推理的依赖有限。

聚合对象需要小心。噪声与掩蔽曲线按数据集分别画线,每个任务保留自己的趋势。对抗实验只在 4 个方向上报告,因为需要明确的正确与错误提示。裁判分数是语义相似度,准确率是选项命中情况,两者分开解读。硬件预算与统计显著性在现有证据中未报告,延迟或成本方面的讨论以原文为准。实验按问题组织,每组结果都先讲测什么再讲与谁比。

加噪与掩蔽下准确率和理由如何变化?

要回答的问题是模型在声音逐渐消失时是收声还是编造。比较条件是同一模型从干净到极端退化的同一组题目,指标是准确率与推理一致性,方向都是越高越稳定。下表把原文报告的参数组极端取值评价尺度与关键阈值整理在一起,表中数字与单位均来自原文连续原句,阅读时先看参数覆盖范围再看阈值含义。

干预类型参数组原文极端取值评价尺度稳定边界与实例
加噪{−20, −10, 0, 10, 20} dB−20 dB1–50 dB SNR
掩蔽[20%, 40%, 60%, 80%, and 100%]100%1–560% random masking ratio
实例Sakura-Animal∼75% to ∼25% for AF35 Perfectly Consistent1 Contradictory

下段是官方原图标记,展示噪声与掩蔽两组曲线,阅读时先确认横轴与线型再看陡降位置,重点区分准确率曲线与一致性曲线的不同含义。

看图路径: 1. 先确认横轴左侧为信噪比右侧为掩蔽比例;2. 再区分实线与虚线分别代表哪一个被测模型;3. 观察从干净到极端条件曲线的平稳段与陡降段位置

原论文 Figure 2:Quantitative Impact of Audio Interventions.

论文图 2。原论文 Figure 2:“Quantitative Impact of Audio Interventions.”。

该图左侧两幅按信噪比展开,右侧两幅按掩蔽比例展开,实线与虚线区分两个被测模型,不同颜色区分不同数据集。可见的趋势是 2 模型在轻度退化下保持相对平稳,经过阈值后准确率与一致性明显走低,掩蔽在高比例段下降更陡。原文报告 2 模型保持到零分贝信噪比附近,之后下降变剧烈,随机掩蔽在 60% 之前相对稳定,之后显著失败。

动物方向上的退化实例显示一模型从约七成五降到约两成五,这支持声音证据减弱会动摇答案的判断,但不能推广为所有数据集都恰好是该降幅。表后需要解释代价与反例。反例是极端条件下的幻听差异,原文指出一模型在全掩蔽或强噪声下仍可能给出看似连贯但与声音无关的推理,而另一模型更常报告听不到可听信号,因此一致性分更低但幻听更少。这说明高一致分不等于扎根于音频,评价时必须把分数与是否承认无信号结合起来看。

未评测边界是真实环境噪声与混响,本文只用白噪声与分块掩蔽,不能直接推广到所有退化。

对抗语音是否把模型从声音上拽走?

要回答的问题是当音频里混入念出答案的语音时,模型跟声音还是跟文字。比较条件是同一题目下的原始基线注入错误提示与注入正确提示三者,指标是准确率与思维链一致性,方向是看错误提示是否拉低准确率而正确提示是否抬高准确率。下表之外的关键证据是柱状对比,阅读时先看图例再看错误提示柱与基线柱的高低关系。

下段是官方原图标记,展示 2 模型的柱状对比,阅读时先分组再跨模型比较,重点看错误提示是否造成大幅下降。

看图路径: 1. 先确认每组三根柱子分别对应错误提示基线与正确提示;2. 再比较左右两大块分别对应哪一个被测模型;3. 重点看错误提示柱是否显著低于基线柱

原论文 Figure 3:Adversarial Intervention Results (RQ3).

论文图 3。原论文 Figure 3:“Adversarial Intervention Results (RQ3).”。

该图左半块为 Audio Flamingo 3,右半块为 Qwen2.5-Omni,每块内按动物语言情感与性别分组,每组三根柱子分别表示错误提示原始基线与正确提示。可见的模式是错误提示下多组准确率明显低于基线,正确提示下多组高于基线,后者相对更稳但仍被显著改变。原文以动物方向为例指出一模型的表现从约七成五降到约两成五,这支持模型更依赖语言线索而非底层声学信号的解释,但属于有限解释而非因果证明,因为能量相当的语音叠加也可能改变了声学分布。

引导掩蔽的结果进一步支持模态不平衡。原文报告模型不是整体聆听,而是重度依赖语音,遮掉语音后被迫转向背景声,遮掉背景声而保留语音时反而更容易从口语上下文中编造细节。未胜出项是情感方向,2 模型在该方向的基线与抗干扰表现都相对弱,说明全局特征任务不能只靠局部语音线索。未评测边界是不同说话人不同合成音色与不同强度下的对抗曲线,本文只报告相当或更低功率的一组设置,因此不能断言所有对抗强度都如此。

改变推理文字后答案跟不跟,改写与破坏有何不同?

要回答的问题是答案是否真正依赖推理的语义。比较条件是同一音频与同一题目,只改变已生成的推理,再看最终答案是否与基线一致。下表把思维链干预的参数范围评价尺度与数据规模整理在一起,表中数字与单位均来自原文连续原句,先看干预强度覆盖再看数据来源。

干预类型强度范围步长与尺度数据规模数据来源
填充词0–100%5%500 multiple-choice questions per trackSAKURA
改写截断加错0–100%1–51,000 tripletsMMAR
填充与裁判0–100%1 Contradictory1,000 curated clipsMMAU

下段是官方原图标记,展示 4 种思维链干预下的一致性曲线,阅读时先看行列含义再看斜率差异,重点区分改写与破坏的不同走向。

看图路径: 1. 先确认上下两行分别对应哪一个被测模型;2. 再确认从左到右四列分别对应改写截断加错与填充;3. 观察改写列是否近乎水平而破坏列是否随完整性下降而下降

原论文 Figure 4:CoT Interventions. (left) Paraphrasing, (mid-left) Early Answering, (mid-right) Adding Mistakes,…

论文图 4。原论文 Figure 4:“CoT Interventions. (left) Paraphrasing, (mid-left) Early Answering, (mid-right) Adding Mistakes, (right) Filler Tokens”。

该图上下两行分别对应两个被测模型,从左到右依次为改写保留句数无错链比例与替换词比例 4 种干预,纵轴为一致性。可见的模式是改写列近乎水平,说明仅改变措辞而不改变语义时答案几乎不变,这不支持编码式推理的担忧。截断加错与填充列随推理完整性下降而下降,说明语义被破坏后答案确实跟随变化,这支持推理对输出是忠实的判断。

但总体趋势不等于每组都成立,个别数据集在中间比例处有波动,且填充词在高替换比例下仍保留一定一致性,说明额外计算量可能有小幅作用,不能据此承诺推理在所有任务上都不可或缺。该节的失败条件很有教学价值。如果截断后答案仍完全不变,则可能是事后推理,如果填充无意义文本后仍完全不变,则可能是额外计算量在起作用。本文观察到的是随破坏加重而下降,因此更符合答案依赖推理语义的解释。

限制是这些干预只改文字不改声音,不能回答声音是否进入推理,仍需与音频干预结果联合解读。

哪些结论站得住,哪些还只是可能?

站得住的是双向分离的结论。原文报告 2 模型在文本侧大体忠实,改写不改变答案,破坏推理会改变答案。原文也报告 2 模型在音频侧不稳定,强噪声与全掩蔽下出现幻听,对抗语音下准确率被显著改变,引导掩蔽下依赖语音而非整体聆听。这些是原文直接报告的现象,有曲线与柱状图支持,可以复述。

有限解释是多模态断连的机制归因。原文用断连概括内部文本一致但音频接地弱的现象,这是对多组结果的总结性解释,但没有提供注意力权重或梯度归因等内部证据,因此应表述为支持而非证明。可能与待验证的是注意力汇聚与转写优先等更细机制,原文提到相关假设与引用,但本次实验没有直接测量每帧贡献,不能把相关性说成因果。

明确缺项包括统计方法硬件预算推理开销误判率分解与真实噪声泛化。原文表头图注与正文若出现口径不一致,应以数据集模型阶段指标单位与聚合对象逐项核对为准,不自行编造划分来圆成一致。百分点变化与相对百分比变化含义不同,比较时只用原文实际可运行的策略,事后最优值不能代替可部署收益。总体趋势不等于每组每步都成立,阅读曲线时要看分布与例外。

要复现这套检验,先做什么,再补什么?

先固定基线。按原文提示让模型先逐步思考再作答,用自动预处理分离推理与答案,在干净音频上得到每个题目的基线推理与基线答案。所有后续比较都以此为参照,而不是以标准答案为参照,因为忠实性问的是是否跟随自身基线变化。这一步要记录提示原文与解析规则,否则后文的一致性无从谈起。

再做音频干预。按原文参数构造 5 个信噪比的白噪声版本与 5 个比例的随机掩蔽版本,另做全静音版本检验幻听。对抗分支用语音合成生成念出错误与正确答案的语音,以相当或更低功率叠加,保持提示不变重新推理。评价时答案端比选项一致性,推理端用同一裁判模型打一到五分的语义相似度,并记录模型是否明确报告听不到信号。这一记录对区分幻听与保守回答非常关键。

再做思维链干预。对同一基线推理分别做改写按比例截断按比例插入逻辑错误与按比例替换为无意义文本,再送回模型求最终答案并比一致性。还需补的验证包括更换裁判模型报告多次运行的波动补充真实噪声与不同音色,以及公开干预脚本与评价提示以便他人重放。由于本次未能确认代码与数据可达,复现时应把环境版本与随机种子如实记录,不声称已公开资源。先做基线再做干预的顺序不能颠倒。

何时值得尝试这套方法,如何一句话记住结论?

当应用需要模型不仅答对还要说对理由,并且理由必须来自声音时,这套双向检验值得尝试。例如安全与取证场景不能接受模型在静音时编造猫叫,也不能接受一句对抗语音就改变判断,此时应同时跑音频干预与思维链干预,而不是只看准确率提升。只跑一侧会漏掉另一侧的失真。

一句话记住结论是推理多半跟随答案但不总扎根于音频。改写推理不改变答案而破坏推理会改变答案,支持文本侧忠实。强噪声全掩蔽与对抗注入下的行为不支持音频侧忠实,模型常出现幻听并偏向语言线索。这就是原文所说的多模态断连,白话说就是文字上自洽但声音上不接地。

后续工作应补强音频与文本的接地机制,例如让推理显式引用时间段与声学特征,并用可验证的定位任务检验引用是否可回放。阅读时常见的误解是把高一致分等同于听见了声音,纠正方法是同时检查模型在无信号时是否收声,以及在冲突语言线索下是否仍锚定声学证据,只有两端都通过才能说推理既忠实于声音又忠实于答案。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总