英文题目:Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models

会议身份:conference:interspeech:2026:conference-paper-id:ieong26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#测试时自适应 #音频大模型 #少样本 #语音 #音频问答

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Lok-Lam Ieong:机构信息未能从会议 PDF 纯文本可靠映射
  • Chia-Chien Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Chih-Kai Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yu-Han Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • An-Yu Cheng:机构信息未能从会议 PDF 纯文本可靠映射
  • Hung-yi Lee:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为朗读式语音问题加任务指令,输出为逐步推理与最终答案,难点在于大型音频语言模型(Large Audio-Language Model, LALM)经多模态训练后指令跟随弱化,直接思维链(Chain-of-Thought, CoT)提示不能稳定诱发结构化推理,且语音推理弱于文本推理。方法构造带短CoT提示与不带提示的成对输入,抽取最后k层最终提示词位置隐状态之差作为推理方向,再按实例级或外部数据平均得到转向向量,推理时在选定深层全位置以系数缩放注入并做L2范数保持。与直接CoT或多次采样投票相比,该机制在表示层强化CoT相关激活,无需更新参数或多次完整生成。在4个LALM与4个语音推理基准的微平均准确率上,11组12组模型与方法组合超越CoT,Audio Flamingo 3上文本导出向量相对CoT提升4.4个百分点,Voxtral-mini-3B上朴素转向提升4.3个百分点。该结论限于英语数学与科学类朗读语音问答,未验证噪声、自发语音、多轮对话或长音频外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么:为什么语音推理需要单独研究?

这篇论文的输入是语音形式的问题加上文字任务指令,目标是让大音频语言模型输出正确的选择题答案,并在需要时给出分步推理过程。所谓大音频语言模型,就是在文字大模型基础上接入语音编码器,能听懂语音再用文字回答的系统。刚进入语音方向的研究生要先建立判断:语音模型不是把语音转成文字后就结束,口音与噪声以及语音文字对齐方式都会影响理解,而推理还要求模型在听对的基础上做数学换算或科学推断。

论文的背景是,这类模型在感知任务上进步很快,但在需要多步计算的任务上仍然是短板,直接加思维链提示有时能诱发推理,有时又会陷入重复评估或单位换算错误。论文要解决的不是语音识别本身,而是在不训练与不改权重的前提下,让已有的思维链解码更稳定地走向正确答案。输出是可核对的准确率提升和可复述的提取加注入流程,读者学完应能说出向量从哪里来,加到哪里,以多大强度加。

已有路线有哪些,各自在什么条件下成立?

与这项工作同输入与同目标的路线主要有 3 条。第 1 条是直接把文字领域的链式思考提示搬到语音模型,要求模型先听语音问题再逐步思考。这条路线运行阶段与论文一致,都是推理时干预,不需要额外训练,但效果依赖模型的指令跟随能力,论文指出多模态训练后指令跟随可能变弱,提示不一定能充分诱发结构化推理。

第 2 条是用有监督推理数据或强化学习专门训练语音推理能力,这条路线需要标注的逐步推理数据和大量算力,目标相同但监督和运行阶段都更重,论文明确把它作为高成本对照,而不是要复现的路线。第 3 条是模型转向,也就是通过操作隐状态来改变行为,在文字模型中已用于风格控制与安全对齐,在语音模型中已用于属性识别与幻觉缓解,但用于增强推理还很少被验证。

论文的定位是第 3 条路线在推理任务上的延伸,它与第 1 条共享无训练与推理时生效的条件,与第 2 条形成轻量与重量方法的对照。理解这个对照很重要,不能把转向方法与需要训练的方法放在同一成本下比胜负,只能比在无额外监督时能否稳定改善思维链。

1 个样本走完全程:从听错单位到算对答案发生了什么?

论文用 1 道果汁换算的选择题展示问题。输入是语音播报的题目:Erin 做了 12 品脱果汁,每天喝 3 杯,问几天喝完,选项包括 2 天与 4 天与 8 天与 9 天,同时附带思维链提示,要求仔细求解并逐步思考,最后以固定格式给出选项。模型先做常规思维链解码,原答案把 1 品脱误认为 16 杯,算出很大的天数,发现不在选项中就反复说需要重新评估计算,陷入循环而没有收敛到正确选项。 加入转向干预后的答案则先写出 1 品脱等于 2 杯,12 品脱等于 24 杯,再用 24 除以每天 3 杯得到 8 天,直接给出正确选项。

例子要表达的机制是:提示本身已经要求逐步思考,但解码中的隐状态没有持续保持这种推理模式,转向向量相当于把思维链特有的激活方向再推 1 把,帮助模型跳出自我纠错循环。这个例子是教学用的单样本展示,不能当成平均效果,平均效果要看后文 4 个基准上的准确率。 论文图 1 展示了上述果汁题的原始思维链回答与转向后回答的对比,是理解干预前后推理行为差异最直观的材料,阅读时应先区分问题框与提示框,再区分黄色失败框与绿色成功框。

看图路径: 1. 先看顶部语音问题与思维链提示 2 个输入框的文字内容;2. 再对比中间黄色原答案框的反复重算语句与底部绿色转向答案框的换算步骤;3. 最后确认绿色框末尾最终答案选项与打破循环的标注

原论文 Figure 1:Example of reasoning enhanced by steering.

论文图 1。原论文 Figure 1:“Example of reasoning enhanced by steering.”。

图中上部是语音问题框和思维链提示框,中部黄色框是原始回答,可见多次出现不在选项中因而重新评估的红色语句,底部绿色框是转向后回答,给出 2 杯等于 1 品脱的正确换算和 8 天的最终答案,并标注打破了重评估循环。读图时不要把单题的纠错当成所有任务都会纠错,论文后文用超参数和数据量分析说明稳定性是有条件的,该条件涉及缩放强度与层位置的选择。

方法全景:提取与注入 2 个阶段如何分工?

论文把全部 3 种方法统一为提取阶段和注入阶段。提取阶段的任务是从隐状态中算出 1 个转向向量,注入阶段的任务是在正式回答时把该向量加到解码的隐状态上。提取只关心思维链提示带来什么表示变化,注入只关心用多大强度把这种变化重新施加到生成过程。 3 种方法的差别只在提取用的数据不同:普通转向用当前测试样本自身,语音导出通用转向用外部语音辅助集的平均方向,文本导出通用转向用外部纯文本集的平均方向。

注入阶段 3 者相同,都是在选定的最后若干层,对所有解码位置做加法并做范数保持。这种 2 阶段划分的学习意义是:先沿 1 个样本想清楚输入如何变成向量,再想清楚向量如何影响输出,后面看到公式时就不会把提取的差值与注入的缩放混为 1 谈。 下面这张总览图把左侧普通转向与中间通用转向以及右侧注入画在同一流程里,适合先建立整体动作顺序再读细节公式,重点是区分实例级相减与跨样本平均这 2 种提取路径。

看图路径: 1. 先沿左侧普通转向的 2 条输入分支看到最后词元隐状态相减;2. 再看中间通用转向如何对数据集内多个样本差值取平均;3. 最后看右侧注入阶段转向向量在哪些层与解码位置相加

原论文 Figure 2:Overview of our three proposed methods in the extraction phase, along with the subsequent…

论文图 2。原论文 Figure 2:“Overview of our three proposed methods in the extraction phase, along with the subsequent injection phase.”。

图中左侧显示同一语音问题分别接任务指令和思维链提示,取最后词元在高层的隐状态相减得到实例级向量,中间显示外部语音或文本数据先对每个样本求差再跨样本平均得到共享向量,右侧显示共享或实例向量在测试时加到各层解码隐状态上并继续生成。注意图中最后若干层的标注与缩放系数的符号,这是后文调参的对象,也是复现时必须对齐的层集合与强度参数。

组件与计算:向量从哪些隐状态算出来,又加到哪里?

先讲符号与输入。设模型有多个变换层,记第 L 层在某个词元位置的隐状态为该层输出向量。提取时只看最后词元,也就是提示末尾位置的表示,因为该位置汇总了对整个输入的理解。记带思维链提示的输入为语音加指令加短提示,不带思维链的输入为只有语音加指令,二者在同一层最后词元的隐状态之差就是推理方向的候选。 普通转向直接用这个差值作为该层的转向向量,不需要正确答案或外部监督,因此属于无训练的推理时干预。

语音导出通用转向对辅助语音集中每个样本都构造同样的带提示与不带提示输入,分别求差后再按样本数取平均,得到跨样本共享向量,计算 1 次后可复用于整个测试集。文本导出通用转向做法相同,只是输入换成纯文本问题加指令,得到的向量在测试时仍加到语音任务上,用来检验跨模态迁移。

大音频语言模型 × 链式思考提示: 大音频语言模型负责把语音输入编码并生成文字回答,链式思考提示负责在输入末尾附加逐步思考短指令以诱发分步推理,二者搭配的原因是仅靠提示不一定能稳定激活推理路径,因此论文把提示诱发的隐状态差异抽成向量,在解码时再加回去以强化同一种推理行为。

再讲注入。得到向量后乘以缩放系数得到实际加量,对选定的最后 k 层,在解码的每个词元位置都把原隐状态加上该加量,然后把结果重新缩放到与原来相同的二范数,再送入后续计算。这个范数保持步骤是原文明确的实现,目的是提高稳定性。原文解释的安排理由是:语音模型不一定可靠地遵循思维链指令,提示诱发的结构化推理在解码中可能衰减,而注入思维链诱发的状态差可以增强相关激活,鼓励模型产生更结构化的推理。

需要如实指出,原文没有报告梯度路径或参数更新,因为本研究不训练任何权重,也没有给出每个词元级别的因果证明,相关性不等于因果。上述注入覆盖所有解码位置与选定层的设定,是复现时必须逐项核对的细节,不能只加到首个词元或单层。

普通转向 × 语音导出通用转向: 普通转向为每个测试样本单独计算思维链与非思维链隐状态之差,分工是最大化实例适配性,语音导出通用转向则在外部语音辅助集上对多个样本差值取平均得到共享向量,分工是摊薄单样本噪声并复用,搭配理由是前者效果强但每次都要额外前向,后者 1 次计算多次使用,组合意义在于检验通用推理方向是否跨样本可迁移。

文本导出通用转向 × 跨模态迁移: 文本导出通用转向只用纯文本数据按同样差值平均得到转向向量,跨模态迁移指把该文本向量直接加到语音任务的解码隐状态上,分工是前者提供数据易得的估计,后者检验推理方向是否与模态无关,搭配成立时可以用廉价文本样本改善稀缺的语音推理。

缩放系数 × 范数保持注入: 缩放系数控制转向向量加进隐状态的强度,范数保持注入负责把加完后的向量重新缩放到与原来相同的二范数,分工是前者决定干预大小,后者防止模长漂移破坏原有表示,搭配理由是直接相加容易在系数较大时失稳,归一化能在保留方向的同时限制幅度。

综合来看,3 种提取路径共享同一套注入实现,差异仅在于向量估计所用的数据范围与模态来源。理解这 1 点后,就能明白为何通用向量可以预先算好并复用,而实例向量必须在测试时为每个样本重新计算。

没有训练时,真正的计算、搜索与构造是什么?

本研究没有训练阶段,没有更新任何模型权重,也没有优化器与学习率或梯度更新。3 个转向量的计算都是前向推理得到的隐状态的算术运算:普通转向是 1 次减法,通用转向是多次减法再平均。实际发生的计算包括:为每个提取输入做前向得到指定层的最后词元隐状态,为正式回答做 1 次带注入的生成解码,以及在开发集上搜索超参数。

具体搜索是:在与所有评测基准都不重叠的口语化数学开发集上,遍历缩放系数在 0.025 到 0.2 之间,层数在后 1 层到后 5 层之间,选择开发准确率最高的组合,再用该组合去报告测试性能。外部数据的构造也属于本节要交代的真实工作:辅助集取自超越高中奥赛难度的数学推理集合中的 100 个样本,与评测集严格不重叠,其中语音版是把题目转成口语文字再用语音合成模型生成语音并做人工质量检查,文本版直接用原始文字。

不能把无训练理解为确定性求解,生成时仍用贪心解码之外的采样会影响结果,自洽性基线就用了温度采样。也没有证据说明冻结参数能保证输出确定,输出仍受解码策略和注入强度影响,强度过大时普通转向的准确率会明显下降。

实验条件:模型、数据、划分与指标如何保证可比?

模型侧用 4 个先进大音频语言模型,分别是轻量语音模型与 Phi 多模态指令模型以及通义千问语音多模态模型和音频火烈鸟第 3 代模型,除特别说明外都用贪心解码。基线包括常规直接回答与直接思维链提示,以及自洽性基线,后者让每个模型以温度 0.5 生成 3 个输出再多数投票。比较的公平条件是:普通转向同样需要 3 次前向,但只有 1 次是完整生成,提取阶段的前向不做完整生成,因此在同等前向次数下转向的生成开销更小。

数据侧用 4 个口语推理基准:大学与高中与小学 3 个难度的数学题语音版,以及针对口语科学推理的评测集,遵循各自官方评测协议。指标是准确率,方向是越高越好,汇总时用微平均得到总体准确率。超参数选择只在独立的口语数学开发集上完成,不接触测试集。 外部辅助集与所有评测基准严格不重叠,这是判断通用向量是否真正迁移的关键条件。

资源状态方面,本次收到的证据中没有发现来源绑定且完成网络状态验证的资源,因此不得声称代码与模型或数据已公开,只能按论文文字复述构造与评测步骤。

主结果:转向在什么范围内改善了思维链?

要回答的核心问题是转向是否系统性改变思维链结果,以及代价是什么。论文报告在多数设置下转向优于思维链,12 个模型与方法组合中有 11 个在平均准确率上为正增益,最高单项超过思维链 4 个百分点以上。按方法看跨模型平均增益,普通转向与语音通用转向以及文本通用转向分别比思维链高约 1.9 个百分点与 1.4 个百分点和 2.5 个百分点,其中纯文本导出的向量平均增益最大,支持文本中存在的推理方向可以迁移到语音任务的判断。

分模型看,轻量语音模型和音频火烈鸟模型的最大增益分别在 4.3 个百分点和 4.4 个百分点附近,而在能力已经很强的问答模型上增益较小,甚至普通转向在该模型上略低于思维链,这就是必须保留的未胜出项,说明总体趋势不等于每组都成立。下表把方法层面的平均与最高增益放在同一口径下,便于核对百分点与相对百分比的区别,这里百分点指准确率差值,不是相对变化率。

下表比较 3 种转向方法的信息来源与平均增益,指标方向是准确率越高越好,公平条件是都以直接思维链为基线并在同一 4 个基准上取微平均。

方法信息来源是否实例相关跨模型平均提升最高单模型提升
普通转向当前语音样本是1.9 %4.3 %
文本导出通用转向外部纯文本集否2.5 %4.4 %

表后需要说明收益与代价。主要收益是无需训练即可在多数组合上获得正增益,且通用向量避免了每次测试都做实例级提取。

具体代价是普通转向仍需每个样本 2 次额外前向,而通用方法需要事先准备外部辅助数据并在开发集上选好层数与强度。反例是高基线模型上普通转向没有带来平均增益,说明实例级差值在强模型上可能引入噪声。未评测的边界包括延迟与误判率和长推理链的稳定性,原文没有测量这些量,不能承诺它们同步改善。

关于数据效率,论文在轻量语音模型上改变外部样本数并取 5 次平均,文本导出方法用很少样本就接近峰值,而语音导出方法需要更多样本才稳定,支持文本估计更可靠的解释,但这仍是有限解释而非因果证明。下图展示外部数据量对总体准确率的影响,横轴是样本数,纵轴是总体准确率,适合判断饱和点。

看图路径: 1. 先确认横轴样本数与纵轴总体准确率的含义;2. 再比较绿色文本导出曲线在样本数较小时的爬升速度;3. 最后观察橙色语音导出曲线在样本数增大后的走势与饱和位置

原论文 Figure 4:Effect of external dataset size for SGS/TGS on Voxtral.

论文图 3。原论文 Figure 4:“Effect of external dataset size for SGS/TGS on Voxtral.”。

图中绿色文本曲线在样本数很小时快速爬升后趋于平坦,橙色语音曲线随样本数增加稳步上升并在几十个样本后增益变缓,说明通用方向的估计需要适度数据量,但文本路径的数据效率更高。读图时不要把末端单点的微小起伏当成必然趋势,原文强调的是小样本段增益最大与大样本段收益递减,该结论支持优先用少量文本样本启动转向的策略。

超参数与开销:强度和层数如何影响稳定性?

这一节回答 2 个可操作问题:缩放系数选多大,转向加在最后几层。论文在轻量语音模型上固定层数变强度,再固定强度变层数,报告跨基准平均准确率。强度实验显示普通转向对系数高度敏感,在小值处达到峰值后随系数增大快速下降,而 2 种通用方法在较宽区间内相对平稳,原文的解释是实例级向量捕捉了输入相关的表示偏移,放大后容易被过度放大导致预测不稳定,而平均后的方向更平滑。

层数实验显示性能随层数非单调变化,增加层数不一定单调提升,且普通转向的波动大于通用方法,说明有效性同时依赖强度与层位置,未来需要自动选择策略。这些是论文直接报告的趋势,可作为复现时先扫小系数,再扫层数的依据。下图分上下 2 个面板分别展示强度与层数的敏感性,比较对象是同一模型上的 3 种方法,条件一致,指标方向仍是准确率越高越好。

看图路径: 1. 先看上图横轴缩放系数增大时蓝色普通转向曲线的下降幅度;2. 再对比橙色与绿色通用方法曲线在同一横轴区间的平坦程度;3. 最后看下图横轴层数从后 1 层到后 5 层共 3 条曲线的起伏差异

原论文 Figure 3:Hyperparameter sensitivity of the steering methods.

论文图 4。原论文 Figure 3:“Hyperparameter sensitivity of the steering methods.”。

上图中蓝色普通转向曲线随横轴系数增大明显下坠,橙色与绿色通用曲线基本保持水平,下图中 3 条曲线随层数起伏但幅度不同,普通转向在后 1 层与后 5 层较高而中间偏低,文本导出曲线最为平坦。像素不能精确辨别的中间数值不要硬写,关键判断是实例级方法更敏感与通用方法更稳定,该判断直接决定调参时应给哪种方法更大的搜索预算。 另一个对照是与自洽性的成本比较。

两者都用 3 次前向,但自洽性是 3 次完整生成加投票,普通转向是 1 次生成加 2 次只取隐状态的提取前向。下表整理该对照在 4 个基准上的逐项准确率与总体准确率,表中数值均为原文裸值,方向越高越好,成本按生成次数理解。

模型方法ColHSElemRCALL
VoxtralSelf-Con25.036.366.951.050.4
VoxtralVanilla32.043.368.856.055.0
Phi4-mmSelf-Con43.045.265.665.057.3
Phi4-mmVanilla35.047.069.169.559.3
Qwen2.5Self-Con58.074.181.866.573.8
Qwen2.5Vanilla56.079.683.974.077.6
AF3Self-Con27.023.739.447.535.3
AF3Vanilla20.022.237.647.533.4

表后解释:在 4 个模型中有 3 个是普通转向总体更高,支持在匹配前向预算下转向通常更准且生成更少。但音频火烈鸟模型上自洽性更高,这是否定转向万能论的反例,也提醒在弱指令跟随模型上不同增强手段的相对优劣可能反转。

该表不能替代主结果表,主结果表以思维链为基线,这里以自洽性为参照,两者聚合对象与基线不同。

限制与未验证的推测:哪些结论还不能下?

首先区分 3 类表述。论文直接报告的是准确率数字与敏感性曲线,支持的是通用方向可迁移与文本向量数据效率高的判断,可能但待验证的是转向捕捉了模态无关推理模式与平均后表示偏移更平滑等机制解释,这些解释没有独立的因果实验,不能当成已证明的性质。其次,超参数是在开发集上事后选优再报告测试性能,论文明确说明了该流程,因此表中的最优配置是开发集最优而不是部署前已知的固定值,换新模型或新任务时需要重新搜索,不能直接套用。

第 3 点,评测只覆盖选择题准确率,没有测量误判率与延迟以及输出帧率或人工可读性,也没有系统评估开放式生成和长链推理,不能承诺这些量得到改善。第 4 点,通用向量的外部辅助集只有 100 个样本规模,语音版依赖合成语音与人工质检,合成与真实口语的差距未被量化。最后,资源可用性本次未能确认可达,不能写代码或数据已公开,复现需要自己按文字实现提取与注入。

复现先做什么:最小可运行步骤与核对点?

复现的第 1 步是准备独立的开发集与测试集,确保外部辅助数据与评测基准不重叠,并记录语音是真实录制还是合成生成,合成要保留质检记录。第 2 步是实现提取函数:对同一输入分别构造带思维链短提示与不带提示的版本,做前向并取出最后若干层在最后词元的隐状态,求差,通用方法再跨样本平均。第 3 步是实现注入函数:在选定层的解码全位置做加法并做范数保持,再继续标准前向与解码。

第 4 步是在开发集上网格搜索缩放系数与层数,论文的搜索范围是系数 0.025 到 0.2,层数为后 1 层到后 5 层,先扫小系数再扫层数,选开发准确率最高的组合锁定后去测测试集。核对点包括:是否对同一层做提取与注入,是否对所有解码位置注入,是否做了范数归一化,基线是否包含直接回答与直接思维链和同前向预算的自洽性,以及汇总用的是微平均还是宏平均。 常见误解是把通用向量的平均增益当成每个基准都提升,实际上要逐基准核对,也有模型与方法组合未胜出。

另一个误解是把无需训练当成无需搜索,实际上强度与层数仍需搜索,省略这一步容易复现出负结果,尤其普通转向在系数较大时可能严重下降。

何时值得尝试,收束时应带走什么?

当语音模型已经能听懂但思维链时好时坏,且没有预算做监督微调或强化学习时,值得尝试这种表示级干预。优先尝试文本导出通用转向,因为它只需要少量纯文本样本,复用性好且对超参数相对不敏感。如果有一定量质检过的领域语音,再试语音导出通用转向。只有在能承担每个样本额外前向且愿意精细调参时,才试实例级普通转向。

带走的判断是:思维链提示提供方向,转向向量负责在解码中维持该方向,平均后的方向更稳,文本方向可以迁移到语音,但效果随模型与任务而异,强基线上的增益可能很小。还需要补的验证是:在真实口语而非合成语音上的迁移,在开放式问答与长推理链上的稳定性,以及强度与层数的自动选择方法。学完后应能复述:输入如何变成差值向量,向量以什么强度加到哪些层的哪些位置,如何用开发集选参并用微平均报告与思维链和自洽性的对照。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总