英文题目:Step-Audio-R1: Why Audio LLMs Fail at Reasoning — The Trap of Textual Surrogates

会议身份:conference:interspeech:2026:conference-paper-id:zhang26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#知识蒸馏 #强化学习 #音频大模型 #音频问答

评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:模型报告

👥 作者与机构

  • Yuxin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Daijiao Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Haoyang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiangyu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuxin Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Fei Tian:机构信息未能从会议 PDF 纯文本可靠映射
  • Yayue Deng:机构信息未能从会议 PDF 纯文本可靠映射
  • Donghang Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jun Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Liang Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Chengyuan Yao:机构信息未能从会议 PDF 纯文本可靠映射
  • Gaolei Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Quanhai Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Qiquan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Hexin Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
  • Xuerui Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Daxin Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Gang Yu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作处理语音、环境声与音乐波形输入,输出显式思维链与最终答案,难点是既有音频大模型随思维链变长反而退化,因其依赖转写文本替代推理而非声学分析。冷启动先以文本推理、对话与音频数据联合监督微调并结合可验证奖励强化学习建立基础推理能力,其形成的音频思维链能力为后续蒸馏提供起点。模态接地推理蒸馏每轮用上一代模型采样多条候选,经声学接地、逻辑连贯与答案正确三准则筛选后与文本推理数据联合监督微调,将推理锚定到声学特征。多模态可验证奖励强化学习以答案正确加思维格式奖励优化策略并迭代多轮,其维持的长链输出再回流下一轮蒸馏,形成蒸馏与强化交替的闭环。与仅用语言模型评判答案一致性的方法不同,该框架直接筛选声学描述并以格式奖励对抗简答偏好,使长时 deliberation 保留声学分析而非退化为文本捷径。在5个语音理解与推理基准下,Step-Audio-R1的平均得分为83.6%,高于Gemini 2.5 Pro的平均得分81.5%。结论仅在所测 5 个语音推理基准与 Big Bench Audio 实时语音到语音适配上成立,对音乐与环境声细粒度感知、强歧义音频尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

这篇解读的输入是会议论文的正文证据与官方原图像素,目标是让刚进入语音音乐音频方向的研究生能复述方法与实验条件。必须保留的信息包括任务定义、模型结构、训练 2 阶段与迭代框架、数据规模与筛选规则、奖励权重、评测基准与对照条件、关键数字与失败条件。输出是 1 篇可核对的技术讲解,不做营销判断,不补无源数值。

论文研究的不是通用音频生成或纯转写,而是音频语言模型在需要推理的问答上为何加思考反而变差,以及如何让长思考重新变好。作者观察到文本与视觉模型通常受益于思维链与测试时算力扩展,音频模型却出现反常退化。解读先沿着一个样本走完全程,再展开训练与评测细节。

教学中举的例子会明确标为例子,例如把音乐忧伤归因于歌词提到悲伤还是小调进行,这只是帮助理解文本替代与声学接地的说法,效果数字仍以论文表格为准。资源状态方面,本次未发现来源绑定且完成验证的资源,因此不得声称代码模型数据已公开,只能按论文文字讲方法与结果。

此前路线为何只治标,没有触及推理依据错位?

在相关路线里,一类做法是给音频问答做强化学习,用语言模型裁判检查推理链与最终答案是否一致。论文认为这只管了一致性,不管依据错位。模型可以编出自洽但不听声音的理由,裁判若只看文字自洽就放行,错误接地会被保留。

另一类做法是直接从文本模型蒸馏思维链做监督微调。论文指出这正是病根,因为初始推理能力来自文本模型的思维链数据,模型继承了语言接地机制,越长的链越把声音问题翻译成文字问题。还有一类是最小推理或直接回答,在现有音频基准上反而更高分。

论文不否认这个现象,但认为它是训练偏差下的局部最优,不是音频本质上不适合推理。视觉路线能靠空间关系与场景分析受益于 deliberation,音频本应也能靠音色时序音高节奏受益,差别在于推理是否被迫去看听觉证据。教学例子是:问一段音乐为何忧伤,文本替代会写歌词提到离别,声学接地应写小调和声与下行旋律轮廓,前者即使答案蒙对也未使用声音。因此后文方法不是简单加长思考,而是先换依据再加长。

文本替代推理错在哪里,为何越想越差?

论文提出的核心诊断是文本替代推理。白话说就是模型嘴上在想,实际想的是转写稿或文字标题,而不是波形里的证据。英文可记为 textual surrogate reasoning,相对的是声学接地推理 acoustic reasoning。当前音频语言模型多用来自文本模型的思维链做冷启动监督微调,推理习惯天然偏向语言抽象。

当被要求逐步思考时,模型把音乐忧伤归因为歌词提到悲伤,把说话人或事件判断归因为语义联想,而不是去检查调式、音高曲线、混响、节奏型。链越长,这种错位被放大越多,最终答案反而偏离。论文强调这不是推理本身有害,而是在错误的模态上推理。验证思路是构造必须听细节才能答的感知题,若模型仍用文字套话就能看出错位。

后续模态接地蒸馏就是要把每一轮新生成的推理链筛一遍,只留下真正谈论听觉属性且答案正确的链,再拿去训练。

文本替代推理 × 声学接地推理: 文本替代推理指模型不听波形细节而是对着转写或文字描述去编理由,分工是借用语言先验快速给出看似合理的解释;声学接地推理要求理由中的每一步都回指音色、音高走向、节奏与调式等可听属性,分工是提供可验证的听觉证据;二者搭配的原因是冷启动只能从文本推理起步,必须再用蒸馏与强化把依据从文字替换为声音,组合意义是让更长的思考带来更多声学检查而不是更多幻觉。

从学习依赖看,先理解这个错位,才能理解为何后文要加格式奖励与难度筛选。格式奖励是防止模型偷懒不思考,难度筛选是防止模型在无解题上空转,二者都是为了让接地推理有机会被强化。

方法全景:一个样本如何从声音走到回答?

先沿一个样本走完。输入是一段音频波形与一个文字问题,例如问这段音乐的情绪与依据。音频先进入冻结的音频编码器得到帧级表示,再经下采样适配器降到 12.5 赫兹帧率后送入大语言模型解码器,文字问题经分词器也送入同一解码器。解码器先输出包在思考标记里的推理链,再输出最终回答。

结构上论文沿用 Step-Audio 2 的做法,编码器用冻结的 Qwen2 音频编码器,解码器是 Qwen2.5-32B 规模,适配器连接两者。输出是纯文本,但思考段被要求谈论声学。训练全景分两大段。第一段是基础推理初始化,包含监督思维链初始化与带验证奖励的强化学习,让模型先会推理且保持音频理解。第二段是模态接地推理蒸馏的迭代循环,每轮做自蒸馏生成声学推理数据,再做多模态监督精调与多模态强化学习,逐步把推理依据从文字换成声音。实时语音对话版本则在听边想与想边说的设计下适配,目标是在亚秒首包延迟下保留推理。

自蒸馏 × 多模态强化学习: 自蒸馏负责由上一轮模型自己生成候选推理链并按声学接地、逻辑连贯与答案正确筛出可学样本,分工是制造接地数据;多模态强化学习负责在音频与文本任务上按验证奖励继续优化,分工是固化爱推理且答对的行为;搭配理由是只蒸馏会停留在已有能力,只强化会走捷径省掉思考,两者交替才能一轮比一轮更依赖声音。

下面这段导读专门对应迭代框架图,请先把握冷启动到多轮强化的循环方向,再去看图中每个筛选菱形与数据圆柱的含义,这样才能理解数据是动态生成的。

看图路径: 1. 从左侧冷启动模型沿箭头走到多模态强化学习模型的完整主链路;2. 看下方强感知数据与文本验证数据如何汇入通过率与语言模型裁判环节;3. 跟踪顶部迭代精化回路如何把新模型送回下一轮循环起点

原论文 Figure 3:The Modality-Grounded Reasoning Distillation (MGRD) framework.

论文图 3。原论文 Figure 3:“The Modality-Grounded Reasoning Distillation (MGRD) framework.”。

该图显示从冷启动模型到多模态强化学习模型的链条,下方有强感知数据与文本验证数据汇入,经过通过率与语言模型裁判筛出带声学推理的蒸馏集与验证答案集,再进入下一轮强化学习并经迭代精化回路继续循环。图中菱形的通过筛选与柱形的数据存储是关键控制点,说明每一轮学什么不是固定的,而取决于上一轮模型的通过率与裁判结果。这就解释了为何中等难度与接地检查必须放在循环内部,而不是一次性预处理。

结构与表示:冻结了什么,更新了什么?

模型组件分三块。音频编码器负责把波形变成隐特征,论文明确写冻结,不更新。适配器负责下采样与对齐到语言模型输入,帧率降到 12.5 赫兹,目的是兼顾效率与语音音乐细节。语言模型解码器负责生成思考链与回答,是主要更新对象。

数据准备上,冷启动用 5,000,000 样本规模,对应 10 亿文本词元与 40 亿音频词元,混合语音任务、对话与约一成蒸馏的音频思维链。后续强化阶段用 5000 高质量样本,其中 2000 文本逻辑与 3000 音频问答。论文明确给出难度过滤机制,用上一轮模型每题采样 8 次,只保留 3 到 6 次答对的中等难度题,丢掉太易与无解题。

监督目标统一 3 类数据,任务问答带推理链与答案,对话上下文带 deliberation 与回复,音频问答带直接答案且用空思考标记占位以保持格式。强化阶段数学与代码用二值验证奖励,答对得 1 否则 0,用无散度惩罚的近端策略优化自由探索推理策略。原文未报告适配器与编码器在每轮是否解冻的逐层梯度细节,解读不从模型名推定,只能说解码器是推理能力的主要载体,编码器按文字是冻结。

训练如何把依据从文字搬到声音?

基础阶段之后的核心是模态接地推理蒸馏。每轮先挑必须听声学才能答的感知问答,强调音色、时序、音高轮廓、节奏结构等低层属性。然后让当前模型对每题采样多个候选推理与答案,再按 3 条标准过滤:声学接地、逻辑连贯、答案正确,得到带声学思维链的蒸馏集。

接着把该蒸馏集与原文本推理数据联合做监督微调,既锚定声音又不丢文本推理能力。再做多模态强化学习,文本题用标准二值验证,音频题用组合奖励,答案正确占 0.8 权重,生成推理占 0.2 权重,防止模型退回直接回答。总目标是两部分奖励之和。如此重复多轮,最终模型被期望生成真正关注声音的长思考。

实现细节上策略用近端策略优化,去掉散度惩罚系数置零,每提示采样 16 候选,裁剪范围 0.2,折扣因子 1.0,最大序列长度 10240 词元。自我认知纠偏是独立但重要的一环,因为文本主导训练会让模型谎称听不到音频。做法是先在自蒸馏监督中用语言模型裁判滤掉错误自称纯文本的回复,再用 8000 对偏好做直接偏好优化,强制承认多模态能力。

思维格式奖励 × 答案正确奖励: 答案正确奖励判断最终答案是否等于标准答案,分工是保证方向正确;思维格式奖励判断推理段是否真实生成,分工是阻止模型为省词元而退化为直接回答;搭配原因是纯正确奖励会鼓励最短路径,组合后 0.8 与 0.2 的权重让模型必须既思考又答对,从而维持 2300 到 2800 词元的长思考。

下面这段导读专门对应格式奖励消融图,请重点对比有无思维格式约束的两条训练曲线在早期爬升速度与后期抖动上的差别,然后再看推理长度的变化。

看图路径: 1. 对比左侧平均奖励曲线中有无思维格式两条线的早期高度与后期抖动差异;2. 对比右侧平均展开词元数中无格式线在三十轮之后的整体下坠幅度大小;3. 确认两子图横轴均为训练迭代而纵轴分别为奖励均值与词元数量

原论文 Figure 4:Impact of format rewards on audio reasoning training.

论文图 4。原论文 Figure 4:“Impact of format rewards on audio reasoning training.”。

左图纵轴是音频任务平均奖励随迭代的变化,带思维格式的线更早达到约 0.70 并在 30 到 60 轮更稳,不带格式的线需要 35 到 40 轮才追上且后期方差大。右图纵轴是平均展开词元数,不带格式的线从约 3000 词元一路掉到 1500 以下,30 轮后急跌,带格式的线维持在 2300 到 2800。论文报告在音乐多任务基准上加格式奖励从 76.5 提高到 77.7,说明多出的长度不是空话,而是伴随声学分析的增益。

中等难度筛选 × 完全失败样本: 中等难度筛选指每题采样 8 次后只保留 3 到 6 次答对的题目,分工是提供正负信号都有的可学梯度;完全失败样本指 8 次全错的题目,分工上往往对应声学本身含糊或无解;搭配比较的意义是证明不是数据越多越好,而是可学且需推理的数据才维持奖励稳定与推理长度,失败集会导致奖励震荡与长度衰减。

下面这段导读专门对应数据难度选择对比图,请先区分中等难度题目与完全失败题目两条线的颜色与图例,再同时观察奖励均值与展开词元两个子图的变化趋势。

看图路径: 1. 对比左侧中等难度线与失败题目线在奖励高度与五十轮后稳定性的差异;2. 对比右侧两条线的推理长度分叉位置与六十轮附近各自的落点数量区间;3. 注意图注指出的两千三到两千八与一千八到两千两个不同的数量带范围

原论文 Figure 5:Impact of data selection strategies on audio reasoning training.

论文图 5。原论文 Figure 5:“Impact of data selection strategies on audio reasoning training.”。

左图显示中等难度题奖励稳定在 0.75 到 0.80,失败题只有 0.45 到 0.70 且 50 轮后崩塌。右图显示中等难度维持 2300 到 2800 词元,失败题持续衰减到 60 轮时约 1800 到 2000。论文还报告扩到 20 万未过滤样本并无增益,原因是含糊题如靠声音认汽车品牌带来盲目探索,噪声稀释了学习信号。这支持质量优于数量的判断,但注意这是在当前裁判与奖励下的结论,换裁判可能变化。

用什么数据、基线与指标来测,条件是否可比?

评测分语音转文字与语音到语音两类。语音转文字覆盖 MMSU、MMAU、Big Bench Audio、Spoken MQA 与 Wild Speech,报告百分比准确率与平均分。基线包括 Step-Audio 2、Gemini 2.5 Pro 与 Gemini 3 Pro,论文把前者当自家上一代,把后两者当闭源强基线。

语音到语音用 Big Bench Audio 的语音对话基准,报告推理准确率百分比与延迟秒数,基线包括 GPT 实时系列与 Gemini 实时系列,延迟关注首包或端到端秒数,方向是准确率越高越好、延迟越低越好。自我认知用 5000 音频感知样本测错误率。消融围绕格式奖励与数据选择展开,看奖励曲线、推理长度与基准分。

需要提醒的是,不同基准的聚合口径与难度不同,平均分相同不代表能力相同,百分点差与相对百分比也不同。论文未给出每基准的划分细节与统计显著性,也未报告训练硬件预算,复现时只能按文字的采样数与序列长度估算成本,不能把总体趋势推广到每组每步都成立。延迟与推理词元数是不同量,词元多不直接等于延迟高,实时版本的结构优化需单独看。

主结果:长思考何时从负债变成资产?

先提出比较问题:在相同语音理解与推理基准上,接地后的长思考是否真能超过强闭源模型,以及实时版本是否在保住延迟的同时保住推理。公平条件是同基准同指标,指标方向是分数越高越好,延迟越低越好。下表整理语音转文字 5 基准与平均分,数字来自原文表格行,单位为百分比,裸值按原表头理解。

模型平均分Big Bench AudioSpoken MQAMMSUMMAUWild Speech
Step-Audio 268.359.188.864.378.051.1
Gemini 2.5 Pro81.596.194.879.377.460.0
Gemini 3 Pro85.192.195.382.978.976.4
Step-Audio-R183.698.795.275.977.770.6

表后解释需要同时讲收益与代价。Step-Audio-R1 平均 83.6%,报告称显著超过 Gemini 2.5 Pro 的 81.5%,低于 Gemini 3 Pro 的 85.1%。分项看,它在 Big Bench Audio 的 98.7% 与 Wild Speech 的 70.6% 上相对突出,但在 MMSU 的 75.9% 上未胜出 Gemini 3 Pro 的 82.9%,MMAU 的 77.7% 也略低于 Gemini 3 Pro 的 78.9%。这说明接地推理不是全线碾压,而是在重感知与开放语音上增益更明显。未胜出项提示文本逻辑仍有差距,或声学筛选偏向感知题。

下面这段导读专门对应基准总览柱状图,请先确认左右两大面板分别对应语音转文字与语音到语音,再比较同一基准内不同颜色柱子的高低关系。

看图路径: 1. 先看左侧语音转文字分组下五个基准的柱子分组与右侧语音对话的准确率与延迟双轴;2. 再对比蓝色 Step-Audio-R1 系列与两种绿色 Gemini 在同一基准内的高低;3. 最后看延迟柱是否与准确率柱同向变化,判断实时性代价

原论文 Figure 1:Benchmark performance of Step-Audio-R1

论文图 1。原论文 Figure 1:“Benchmark performance of Step-Audio-R1”。

该图左侧为语音转文字 5 基准的性能柱,右侧为语音对话的准确率与延迟双轴柱。可见蓝色 Step-Audio-R1 系列在 Big Bench Audio 与 Spoken MQA 柱最高,在 MMSU 略矮于深绿 Gemini 3 Pro,右侧实时版本的准确率柱最高而延迟柱居中,说明准确率领先并非靠无限放宽延迟换来。但像素不能精确读出每柱小数第二位,细数字仍以表格为准。

实时语音对话:准确率与延迟如何兼得?

这里要回答的比较问题是:在需要直接输出语音的实时对话基准上,推理增强是否必须牺牲首包延迟。公平条件是同一 Big Bench Audio 语音对话集合,准确率越高越好,延迟秒数越低越好。下表整理推理准确率与延迟,准确率单位为百分比,延迟单位为秒。

模型任务形态推理准确率首包延迟对比对象
GPT-4o mini Realtime语音对话690.81实时基线
GPT Realtime 0825语音对话830.98实时基线
Gemini 2.5 Flash Live语音对话740.64实时基线
Gemini 2.5 Flash Native语音对话920.63实时基线
Step-Audio-R1 Realtime语音对话96.10.92本方法实时版

表后解释要讲清收益与具体代价。Step-Audio-R1 实时版报告推理得分 96.1%,超过所列闭源实时系统,延迟 0.92 秒保持亚秒响应。代价是相比 Gemini 原生音频对话的 0.63 秒与 0.64 秒,它慢约 0.3 秒,说明长推理与实时性之间仍有交换。论文将其归因于听边想与想边说的适配,但原文未给出不同网络与解码条件下的延迟分布,复现时需在相同音频长度与服务端条件下重测。未评测边界包括多轮打断与全双工下的稳定性,不能从单轮基准推广到对话全程。

反证:拿掉格式奖励与换成难解数据会发生什么?

消融按问题组织。第一个问题是格式奖励是否必要。测的是训练奖励稳定性、推理长度与 MMAU 分数。与谁比是同模型加与不加思维格式奖励。条件一致指同数据同优化,仅奖励差 0.2 的格式项。

指标方向是奖励高好、长度维持高好、MMAU 高好。关键数字是两者终点奖励都约 0.75 到 0.80,但带格式更早过 0.70 且后期更稳,不带格式的长度从约 3000 掉到 1500 以下,带格式维持 2300 到 2800,MMAU 从 76.5 到 77.7。支持的判断是格式奖励防止推理坍缩,限制是长度本身不是质量,还需结合答案正确看。

第二个问题是数据难度。比较中等难度、持续失败与 20 万未过滤 3 种。失败集奖励仅 0.45 到 0.70 且 50 轮后不稳,长度跌到 1800 到 2000,未过滤扩量无增益。支持的判断是部分成功提供正负梯度信号,失败题多因声学含糊导致盲目探索。第三个是自我认知纠偏,基线错误率 6.76%,迭代蒸馏后 2.63%,再加偏好优化后 0.02%。下表整理该结果,错误率越低越好。

阶段样本量错误率相对基线方法
基础模型5000 音频感知样本6.76%基线未纠偏
迭代自蒸馏5000 音频感知样本2.63%下降语言模型裁判过滤
迭代自蒸馏加偏好优化5000 音频感知样本0.02%大幅下降8000 偏好对直接偏好优化

表后解释要指出,蒸馏只能部分纠偏,最终消除顽固偏差靠偏好学习,但这只测了是否错误自称纯文本,未测纠偏后是否引入过度声称能听的反向误判,也未测开放对话中的保持性。至少就近说明一个负结果:失败题与无过滤扩量都不好,说明暴力扩展在当前管线下无效。

哪些结论还不能下,缺了什么验证?

首先区分 3 层。直接报告的是表格分数、奖励曲线区间与错误率变化,可用报告显示表述。有限解释的是接地推理反转了越想越差的趋势,有奖励与长度曲线支持,但只在所测 5 基准与所用裁判下成立。未验证推测是音频本质上适合长思考或可推广到所有环境声音乐任务,应表述为可能待验证。

缺失证据不是技术错误,但不能承诺未测量的量。例如延迟只在实时基准单点报告,未给分布与硬件条件,不能说全面更快。成本未报告训练卡时与推理帧率,不能说更便宜。统计方法未报告置信区间,不能把 1 到 2 个点的差距当成必胜。

数据方面,强感知筛选依赖语言模型裁判,主观性与阈值未公开,换裁判可能改变接地质量。失败题的例子如靠声音认汽车品牌说明声学本身有信息上限,模型再想也无用,这恰好划出方法的适用边界。总体趋势不等于每组每步都成立,MMSU 未胜出就是反例。

要复现应先做什么,需要哪些超参数与检查?

复现先做三件事。第一,按论文搭出可运行链:冻结音频编码器,接 12.5 赫兹适配器,接 32B 量级解码器,先跑通空思考标记的直接回答,再打开思考标记。第二,复刻冷启动与验证强化,用小规模先验证奖励能升、长度不塌,再进入迭代蒸馏。关键超参数按原文保留:难度筛选每题采样 8 次保留 3 到 6 次答对,强化采样每提示 16 候选,裁剪 0.2,折扣 1.0,最大长度 10240,无散度惩罚,音频奖励 0.8 正确加 0.2 格式。

第三,复刻评测条件:同基准同基线同指标单位,语音转文字看百分比平均与分项,语音对话同时记准确率与秒级延迟,自我认知用 5000 感知样本记错误率。信息条件上,思考链必须能被检查是否谈论音色音高节奏调式,而不只是复述转写。还需补的验证包括换裁判的接地一致性、延迟分布、多轮打断稳定性与误判率。

资源状态必须如实写:本次未发现可验证的公开代码模型数据,不得写当前可用或已公开,复现应从论文文字与自有数据起步。

何时值得尝试这种做法,如何一句话记住它?

当你的音频模型出现加思考反而掉点,且错误理由多为复述转写或标题时,值得尝试把依据先换成声音再加长思考。具体动作是挑必须听细节的题,让模型自采样多条链,用接地加正确双重过滤留下好链,再联合文本推理数据精调并用正确加格式奖励强化,多轮迭代。

预期是奖励更稳、长度维持在两千多词元、感知重基准提升更明显,代价是延迟略增与对裁判的依赖。误解澄清:长思考本身不是解药,不加接地只会放大幻觉;数据量本身不是解药,不筛选只会引入含糊题噪声;平均分领先不是全胜,分项仍有未胜出与边界。记住一句话:先让模型听对地方,再让它多想一会儿。

测试时计算扩展 × 听觉智能: 测试时计算扩展指推理时允许更长的思考链与更多 deliberation,分工是投入算力换取更细的检查;听觉智能指在语音、环境声与音乐问答上的理解与推理得分,分工是衡量是否真听懂;组合意义是论文要反转音频领域越想越差的反常扩展曲线,证明当思考被锚定到声音时更长思考对应更高分数。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总