英文题目:Reducing the Output-Mode Gap in Speech Language Models via Joint-Output On-Policy Distillation

标签:#音频问答 | #知识蒸馏 | #语音 | #语音大模型

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

👥 作者与机构

  • Daxin Tan:机构信息未在 arXiv HTML 中可靠披露
  • Dehua Tao:机构信息未在 arXiv HTML 中可靠披露
  • Chengxi Deng:机构信息未在 arXiv HTML 中可靠披露
  • Hanlin Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Xiao Chen:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

交错式语音大模型以语音输入同时生成文本与声学token,声学历史进入后续文本上下文,使语音到文本与语音模式的内部文本答案准确率显著低于纯语音到文本模式,形成输出模式差距。联合输出在策略蒸馏先从初始学生采样联合轨迹以暴露真实声学条件下的文本预测位置,再将每步学生前缀投影为纯文本历史送入冻结语音到文本教师,经文本词表归一化得到保留相对偏好的软目标。随后学生在完整交错历史下预测文本分布并以交叉熵对齐教师目标,同时以冻结联合模式参考约束声学与控制token预测以保持语音生成行为。与直接在联合轨迹或独立语音到文本回答上做监督微调不同,该方法在学生真实声学前缀上提供教师反馈,并将文本监督限制在文本词表内。在Spoken-MQA基准下,JO-OPD-Soft的输出模式差距指标为16.26,低于Base的输出模式差距指标42.87。该结论的适用边界受限于两款交错架构与数学问答及短推理任务,尚未验证分离式思考说话架构、长程对话与多语言泛化,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是语音,输出为什么还要分两种模式?

这篇论文研究的是语音大语言模型做口语回答的任务。输入是语音提问,输出要求同时给出可读的文本内容和可听的语音波形对应的声学词元。初学者容易以为只要语音理解做对了,后面生成什么形式都一样,但论文的起点恰恰是输出形式本身会改变答案正确率。

要理解这一点,先说白话再给术语。所谓语音到文本,英文是 speech-to-text,缩写为 S2T,意思是模型只输出文本答案,不发声。所谓语音到文本加语音,英文是 speech-to-text-and-speech,缩写为 S2TS,意思是模型交错地生成文本词、声学输出和控制符,一边写文本一边发声。交错生成英文是 interleaved generation,指的是文本和语音不是分两个独立模型先后完成,而是在同一个自回归序列里轮流出现。

论文关注的第二类系统就是全离散交错模型,代表是 Step-Audio-2-mini 和 Baichuan-Audio-Instruct。它的好处是能流式生成语音,并且有显式的文本流去引导声学内容。但代价也很直接:前面生成的声学词元会进入后面文本预测的上下文。也就是说,文本预测不再只看语音输入和前面的文本,还要看自己刚才发了什么音。

沿着一个样本走一遍更清楚。输入是一段语音数学题或语音知识问答。S2T 模式下,模型读入语音编码,直接逐词生成文本答案。S2TS 模式下,模型读入同样的语音,但每生成一两个文本词就要插入一段声学词元和控制符,下一个文本词的条件里就多了这些声学历史。如果声学历史引入了噪声或占用了建模容量,文本就可能走偏。这正是后面要量化的问题。

必须保留的信息是:输入固定、模型固定,只改变是否同时生成语音,比较的就是输出模式带来的差异。论文没有更换语音输入,也没有更换评测题目集合,目标是回答同一个模型在打开语音输出时还能不能保住原来的文本答题能力。

已有工作在修哪一段路,这篇论文补哪一段?

相关工作可以按输入、目标、监督和运行阶段分成 3 组,这样就不会把不同条件下的改进混为一谈。

第一组是文本和语音如何耦合。例子包括 Spirit LM 对文本和语音词元做交错自回归,MiMo-Audio 联合建模文本词和音频块,LongCat-Next 比较并行和串行音频生成下的文本引导准确率,也有把自回归文本和非自回归音频扩散结合的做法,以及给冻结的语音到文本主干外加可训练音频后解码器的做法。这些工作主要探索生成结构和能力保持,本文则固定在已有的交错结构内部,用蒸馏和非文本预测正则去缩小输出模式差异。

第二组是输入侧模态差距。已有观察指出把文本大模型扩展到语音模型可能损伤知识和推理能力,对应做法有用跨模态蒸馏加主动数据选择,有用强化学习加表示和行为对齐奖励,也有通过转写文本加韵律特征来增强输入的做法。它们的输入条件是语音输入相对文本输入,或者语音适配前后对比。本文不同,它保持语音输入和模型都不变,只比较文本回答和联合生成中的内部文本。

第 3 组是跨模态在策略蒸馏。通用思想是在学生自己生成的轨迹上施加教师监督。已有方法有用文本条件教师同时监督语音和文本输入下的学生轨迹,有用内部文本条件教师加加权词元级蒸馏和序列级强化学习,也有扩展到音频 grounding 推理并使用匹配文本输入和参考答案的做法。本文的教师条件不同:语音输入保持不变,教师看到的是学生联合历史的纯文本投影。这样监督就对齐到了学生真实的联合前缀上,而不是另起一条文本输入的轨迹。

输出模式差距到底怎么量?

论文提出的核心概念是输出模式差距,英文是 output-mode gap,缩写为 OMG。白话说,就是同一个模型、同一批语音题,只生成文本时答对多少,边说边写时内部文本答对多少,两者相减。

记号上,输入语音记为语音输入,S2T 产生文本回答,S2TS 产生包含文本词、声学输出和控制符的联合轨迹。文本投影只保留联合轨迹中的文本词并保持原顺序,去掉声学和控制符,得到的内部文本记为 S2TS 的文本部分,重建出的可播放语音回答记为 S2TS 的语音部分。准确率都在同一批语音输入、同一模型、同一答案抽取和评分规则下计算。

下面这张表要回答的比较问题是:在完全相同的语音输入和评分规则下,2 个模型、两个数学和知识基准上的差距有多大。公平条件是模型不变、题目不变、评分器不变,指标方向是差距越小越好,准确率越高越好。

模型基准输出模式差距含义
Step-Audio-2-miniSpoken-MQA42.87 个百分点S2T 减内部文本
Step-Audio-2-mini语音版 GSM8K29.72 个百分点S2T 减内部文本
Baichuan-Audio-InstructSpoken-MQA12.41 个百分点S2T 减内部文本
Baichuan-Audio-Instruct语音版 GSM8K10.39 个百分点S2T 减内部文本

这张表显示报告的差距不是个别现象,两个交错架构、两个基准都出现了正差距,Step-Audio-2-mini 的差距尤其大。论文还报告在人类录制的 VoiceBench-BBH 问题上,要求显式推理会让差距从短答条件下的 8.2 点扩大到推理条件下的 19.0 点,这支持差距与推理长度和声学历史干扰有关,但属于有限解释,还需要更直接的机制验证。未胜出的边界是:这里量的只是内部文本差距,口语语音是否同样差要另用语音识别转写来量,不能把内部文本数字直接当成用户听到的答案质量。

语音到文本 × 语音到文本加语音: 语音到文本只生成文本回答,负责给出模型在不受声学历史干扰时的答案能力;语音到文本加语音要交错生成文本、声学输出和控制符,负责流式语音回复。两者搭配的原因是输入和模型都固定时可以直接比较输出模式的影响,组合意义是把差距定义为前者减后者内部文本的准确率差,从而定位问题在联合生成阶段。

联合输出在策略蒸馏想用哪条更强的路带哪条弱的路?

方法全景可以一句话概括:用模型自己更强的 S2T 策略当教师,去监督它自己在 S2TS 模式下走出来的轨迹。基础模型同时扮演两个角色,一个是冻结的 S2T 教师,提供文本监督,另一个是冻结的 S2TS 参考,提供非文本预测的保持目标,可训练的是从基础模型初始化的学生。

具体动作分 3 步。第一步,固定语音输入,让初始学生在 S2TS 模式下采样一条联合轨迹。第二步,在每个文本预测位置上构造两个上下文:学生看到完整联合历史加 S2TS 模式标记,教师看到同样的语音输入加该前缀的文本投影加 S2T 模式标记。第 3 步,在文本位置上做文本蒸馏,在非文本位置上做保持正则,两项相加作为总目标。

为什么要这样搭配?如果用独立生成的 S2T 回答做监督,监督文本和学生真实的声学条件是对不上的。论文的搭配理由是:监督必须落在学生自己的联合前缀上,这样学到的才是给定声学历史时如何把文本拉回正轨。新增作用是教师不需要外部更强模型,也不需要参考答案,只用模型自身的 S2T 偏好就能提供逐位置的软目标。

需要明确的是,这不是把 Thinke r-Talker 那种分离结构改掉,也不是重新设计交错模式,而是在现有交错架构内部做输出模式对齐。训练只更新语言模型侧的参数并冻结音频编码器等部件,教师和参考全程冻结,这个冻结安排是原文明确给出的,梯度只从学生的文本和非文本预测流向共享参数。

教师看什么,学生看什么,损失又算什么?

这一节沿一个文本位置走完输入到目标的计算。假设学生已经生成了文本词、声学块交替出现的前缀,当前要预测下一个文本词。学生上下文是语音输入、原生联合历史和 S2TS 模式,教师上下文是同一语音输入、该前缀的文本投影和 S2T 模式。两者看到的语义文本相同,但学生多看了声学历史。

差距的形式化定义是下面这条公式,它先说明符号与输入,再给出计算目标。公式中准确率是百分比,输入是共享语音集合,输出是两种模式的准确率之差。

\[\displaystyle\Delta_{\mathrm{OMG}}\]

上式中差值为正表示打开语音输出后内部文本答题能力下降。论文强调 2 次准确率用同一模型、同一评测样本和同一答案评分规则,口语答案准确率则另行用语音识别转写后评分,不混入该定义。

文本蒸馏的计算目标是在文本词表内比较师生分布。学生分布在文本词表上归一化,教师目标有两种做法。软目标做法保留教师前 32 个文本词并重归一化,硬目标做法只取教师最高概率文本词做独热。两种做法最小化的是同一个文本蒸馏目标,即对训练轨迹和采样文本位置求平均的交叉熵。

\[\mathcal{L}_{T}=\mathbb{E}_{z,i}\big[\operatorname{CE}(q_{i},p_{i})\big],\]

上式中期望是对训练轨迹和每条轨迹内采样文本位置求平均,交叉熵只在文本词表内计算,不直接匹配文本相对非文本的总概率质量。这是有意限制,目的是只教文本偏好,不干扰何时输出语音的决策。

非文本保持的计算目标是让学生的声学和控制符预测靠近冻结参考。对 Step-Audio-2 用采样非文本位置上的交叉熵,参考目标是在全输出词表取前 32 重归一化,学生概率在全词表归一化。对 Baichuan-Audio 则分别对控制器和编解码器分布用精确的参考到学生的散度正则,编解码器损失的梯度穿过冻结的语音头回传到共享语言模型。总目标是两项相加。

\[\mathcal{L}=\mathcal{L}_{T}+\mathcal{L}_{\mathrm{pres}}.\]

上式是最终优化目标,前项纠正文本,后项稳住语音。原文明确给出 Step-Audio-2 保持权重为 0.05,Baichuan-Audio 控制器和编解码器保持权重分别为 1 和 10,这些是复现时必须保留的信息条件。

文本投影 × 联合历史: 文本投影只保留学生已生成轨迹中的文本词并维持原顺序,负责给教师构造干净的文本上下文;联合历史保留文本加声学加控制符的完整前缀,负责给学生保留真实的生成条件。两者搭配的原因是让师生在同一语义位置但不同上下文上做预测,组合意义是教师可以在学生走过的每个文本位置上给出如果没有声学干扰应该输出什么。

文本蒸馏 × 非文本保持: 文本蒸馏负责在文本词表内对齐学生和教师的文本偏好,改善联合生成中的文本预测;非文本保持负责用冻结的联合模式参考分布约束声学输出和控制符预测,防止共享参数更新破坏语音生成。两者搭配的原因是一个要改文本能力一个要稳住语音行为,组合意义是总目标同时完成纠偏和保持。

训练数据从哪来,更新谁、冻结谁?

训练构造的真实过程是先采样后训练,主实验用固定轨迹做一轮训练。训练集包含 27847 个来自 Tulu-3 和 NaturalReasoning 的提示,已排除与评测基准的重叠,训练语音用 flite 的 SLT 音色合成。这意味着教师监督不需要人工标注答案,监督信号完全来自模型自身的 S2T 预测,数据侧的重点是提示多样性和与评测不重叠。

参数安排按原文交代。Step-Audio-2 更新完整语言模型,冻结音频编码器和适配器。Baichuan-Audio 更新完整语言模型和文本头,其余部件冻结。教师和保持参考在整个训练中保持冻结。优化器用 AdamW,批量 32,学习率为 2 乘 10 的负 6 次方。

软目标取前 32,Step-Audio-2 保持用前 32 参考目标。这些超参数是复现时要原样保留的。

比较基线也匹配了训练提示和优化步数。Self-SFT 用同样的 S2TS 轨迹做自监督微调,Response-SFT 用独立生成的 S2T 回答做监督。这样的对照能区分改进是来自数据量和训练步数,还是来自在策略投影监督本身。

关于在策略更新的细节,论文还做了轨迹刷新的对照。静态做法始终用初始学生的轨迹,4 阶段共 871 次更新;刷新做法在后 3 个阶段前用更新后的学生重新生成轨迹,提示划分和总更新数相同,优化器和学习率计划每阶段重置。这为后面讨论数据规模和分布偏移做了准备。

软目标 × 硬目标: 软目标保留教师前 32 个文本词并重归一化,负责传递候选之间的相对偏好;硬目标只取教师概率最高的文本词做独热,负责传递单一最优选择。两者搭配比较的原因是轨迹和投影条件固定时可以直接检验偏好信息是否有用,组合意义是论文用对照说明保留分布形状比只学最高词更有效。

评测用什么题、什么解码、什么打分?

评测条件必须先讲清,否则数字无法复述。评测基准包括 Spoken-MQA 共 1402 题,语音版 GSM8K 测试集共 1319 题,另有 1000 道人类录制的 VoiceBench-BBH 题目,分短答和显式推理两种指令条件。数值基准用同一抽取器在不同模型和输出模式下算答案准确率,口语回答先用 Whisper-large-v3-turbo 转写再用同一评分规则,BBH 按任务抽取是非法或选项标签。

解码遵循各模型的原生解码策略,基线和学生比较时匹配输入和生成种子,每种输入和输出模式各生成一个回答。生成预算对 Step-Audio-2 是 4096 个联合词元,对 Baichuan-Audio 是 4096 个文本词元。所有差值都用未舍入准确率计算,百分点和相对百分比是不同量,阅读时不能把差距缩小多少点理解成相对提升百分之多少。

本次没有收到任何 Figure 像素,因此本文不做看图判断,只依据图注和正文描述方法结构。资源状态方面,未发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开,复现只能按论文文字重做。

下面先为训练规模实验交代数据划分口径,表中训练提示数是嵌套子集,评估都是 Spoken-MQA 上的文本答案准确率,单位是百分比,聚合对象是固定评测集上的平均正确率。

主结果把差距缩小了多少,纯文本能力保住了吗?

主结果要回答 3 个问题:差距降了多少,S2T 是否基本不变,是否超过匹配的微调基线。先看 Step-Audio-2 的内部文本结果,比较问题是相同题目下 S2T、内部文本和差距的变化,公平条件是同一模型族、同一题目集和同一评分器,指标方向是内部文本越高越好、差距越小越好。

方法Spoken-MQA 差距变化GSM8K 差距变化S2T 是否基本不变
基线差距42.87 个百分点29.72 个百分点基准
联合输出在策略蒸馏软目标16.26 个百分点13.04 个百分点报告显示基本不变
硬目标对照36.09 个百分点22.59 个百分点有所上升但差距仍大
匹配回答微调44.37 个百分点28.51 个百分点改进很小

这张表支持的判断是软目标蒸馏大幅缩小差距,且主要来自 S2TS 内部文本提升,因为 S2T 准确率保持在 75% 附近。未胜出项也很清楚:Self-SFT 反而降低内部文本准确率,Response-SFT 几乎没有改善,这说明只用 S2T 回答做离线监督不能解决声学条件下的预测问题。

Baichuan-Audio 的差距起点较小,蒸馏后在 Spoken-MQA 上差距从 12.41 降到 9.49,在 GSM8K 上从 10.39 降到 9.78。这里 S2T 也有所提升,因此差距缩小幅度小于内部文本本身的增益,解读时不能把全部增益都归为输出模式对齐。

推理指令的对照进一步支持方法的适用条件。在人类录制题目上,显式推理让基线差距从 8.2 扩大到 19.0,蒸馏后短答和推理条件下的差距分别收窄到 5.0 和 5.8,推理条件下的内部文本提升更大。这支持该方法在推理链更长、声学干扰暴露更充分时更有用,但仍是有限解释,需要更多任务验证。

内部文本准确率 × 口语答案准确率: 内部文本准确率直接对联合轨迹中的文本部分抽取答案评分,负责衡量文本内容是否被纠正;口语答案准确率先用语音识别转写合成语音再评分,负责衡量文本改进是否真正落到可听回答上。两者搭配的原因是内部文本好不等于语音可懂,组合意义是论文同时报告两者以区分内容改进和语音保持是否兼得。

训练规模越大越好吗,轨迹要不要刷新?

这一节专门展开论文特有的训练规模细节,比较问题是固定采样轨迹做一轮训练时,更多提示是否带来更高内部文本准确率。公平条件是同一初始学生轨迹池的嵌套子集、同一优化配置,指标方向是内部文本越高越好,同时观察 S2T 是否漂移。

Training promptsS2TS2TS(T)
0 (Base)75.3232.45
2,00075.8936.95
8,00075.0449.71
27,84775.1858.92

表后解释是:随着训练提示从 2000 增加到 8000 再到 27847,内部文本准确率从 36.95 逐步升到 49.71 再到 58.92,而 S2T 始终在 75% 附近波动。这支持更多数据和更多更新有助于对齐,但原文明确指出一轮训练下更大数据集也意味着更多优化步数,因此趋势是数据和优化的联合效果,不能单独归因于数据多样性。代价是训练成本随规模线性增加,且论文未报告延迟和推理开销的变化。

轨迹刷新的对照条件更严格,4 阶段共 871 次更新,提示划分相同,区别只在后 3 阶段前是否用更新后学生重采样。报告显示刷新比静态在 Spoken-MQA 上高 2.57 点,在 GSM8K 上高 2.73 点,S2T 变化很小。这支持分布对齐的价值,即教师监督跟随学生最新分布时效果更好,但增益远小于从零到全量的主增益,说明初始轨迹已经覆盖了主要问题。

软硬目标和语音保持哪一项真正决定成败?

消融要回答监督形式和正则各自的作用,条件是教师、轨迹和投影固定,只改变目标构造。先看软硬比较,论文报告保留教师候选间相对偏好比只学最高词更有效,尤其在知识问答上差距更大。这支持保留相对偏好的设计选择。

下面这张表要回答的比较问题是:去掉词表限制或去掉非文本保持后,内部文本和口语答案会发生什么。公平条件是同一 Step-Audio-2 主干、同一训练轨迹,指标包括内部文本和语音识别后的口语答案,方向都是越高越好。

方法Spoken-MQA 口语答案Spoken-MQA 变化描述GSM8K 趋势内部文本结论
软目标完整方法36.16%基准同一模式下评估基准
全词表监督11.20%from 36.16% to 11.20%同样下降内部文本在 within 1.8 points 内
去掉保持29.74%降到 29.74%同样模式持续内部文本在 within 1.8 points 内

这张表显示关键反证:两种消融的内部文本均在 within 1.8 points 范围内,但口语答案大幅下降,全词表监督在 Spoken-MQA 上对应 from 36.16% to 11.20%,去掉保持降到 29.74%。这支持把文本监督限制在文本词表并另行正则非文本预测,否则文本改进会以破坏语音生成为代价。未评测的边界是论文没有给出语音自然度和延迟的主观评价,不能把口语答案准确率等同于整体语音质量。

口语答案的主结果也需要同样谨慎。比较问题是内部文本提升有多少落到可听回答上,条件是同一 S2TS 语音输出加同一语音识别和评分,指标方向越高越好,需要区分内容改善和语音同步效果。

模型基准口语答案JO-OPD 后口语答案口语答案变化GSM8K 口语说明
Step-Audio-228.67%36.16%a gain of 7.49 pointsshows little change from Base
Step-Audio-2 对比 Response-SFTResponse-SFT 基准JO-OPD-Soft 结果by 7.85 points限于 Spoken-MQA 的比较
Baichuan-AudioBase 基准JO-OPD 结果improves by 2.92 pointsgains 2.35 points on GSM8K
Baichuan-Audio 对比 Response-SFTResponse-SFT 基准JO-OPD 结果approximately 1.5 percentage points on both benchmarks对两个基准都是温和提升

这组数字支持的判断是内容监督可以改善口语答案的内容,但转化率有限,尤其 Step-Audio-2 在 GSM8K 上 shows little change from Base,可能与语音合成或识别误差有关,属于待验证的推测,不能多度解读为整体语音质量提升。

哪些结论还不能下,缺了哪项验证?

首先区分论文直接报告、有限解释和未验证推测。直接报告的是在给定基准、给定解码预算和给定评分器下,差距缩小、S2T 基本不变、软目标优于硬目标、去掉保持会损伤口语答案。有限解释的是声学历史干扰了文本预测,以及推理越长干扰越明显,这些有对照支持但没有逐位置的因果干预。未验证推测是把口语答案增益完全归为文本内容变好,因为转写误差和语音质量本身也会影响分数。

缺失的证据不是技术错误,但复述时必须点明。论文未测量误判率分解、每步延迟、实时率和训练算力预算,也没有报告人类对语音自然度和可懂度的评价。因此不能承诺该方法改善了延迟或整体语音体验,训练资源和推理开销要分别讨论,总体趋势不等于每组题目或每一步都成立。

另一个限制是差距没有清零。Step-Audio-2 在两个数值基准上仍残留 16.26 和 13.04 点差距,Baichuan-Audio 残留约 9 点以上。这说明在策略蒸馏缩小了问题但没有消除,是否需要多轮刷新、更强教师或显式推理监督仍是开放问题。

最后是适用条件。结果只覆盖两个交错离散架构和语音问答与数学推理类任务,对 Thinker-Talker 这类分离架构是否同样存在差距、同样有效,论文没有给出可运行对照,不能把类别差异当成同条件胜负去推广。

要复现这条路,先做什么、记什么?

复现的第一步是重建输出模式差距的测量,而不是直接训练。固定语音输入和随机种子,分别用 S2T 和 S2TS 各生成一个回答,用同一答案抽取器算准确率并相减。解码预算按原文保留,Step-Audio-2 用 4096 个联合词元,Baichuan-Audio 用 4096 个文本词元,口语部分用同一语音识别模型转写后再评分。先能复现基线差距的数量级,再谈改进。

第二步是重建数据和轨迹。用 27847 个非重叠提示合成训练语音,让初始学生在 S2TS 模式下采样联合轨迹并保存。对每个文本位置保存完整联合前缀,同时计算其文本投影。教师和参考都用冻结的基础模型,教师走 S2T 加文本投影,参考走 S2TS 加联合历史。

第 3 步是实现损失。文本侧只在文本词表内做交叉熵,软目标取教师前 32 重归一化,学生分布也在文本词表归一化。非文本侧按架构区分,Step-Audio-2 在采样非文本位置用前 32 参考目标加权重 0.05,Baichuan-Audio 对控制器和编解码器分别加权重 1 和 10。优化用 AdamW、批量 32、学习率 2 乘 10 的负 6 次方,主实验做一轮固定轨迹训练。

需要补的验证包括:报告 S2T、内部文本、口语答案三者同表,避免只看差距;报告不同随机种子的波动;补充语音质量和延迟测量;若做多阶段训练,明确每次重采样的提示划分和优化器重置时机。代码、权重和数据方面,本次没有可用资源声明,因此只能写按文字重做,不能写已公开或可下载。

什么时候值得试这套蒸馏,什么时候先别用?

值得尝试的信号很具体:模型是交错文本加语音生成,打开语音后文本答案明显变差,而纯文本回答本身较强,且有大量无标注语音提示可以采样轨迹。这时用自身 S2T 做教师的成本低于找更强外部教师或人工标注,也不需要改变生成架构。显式推理任务和长回答场景更值得优先试,因为论文显示那里的差距更大、增益也更大。

先别用的情况也要明确。如果系统是分离的文本生成加语音合成,或者 S2T 本身就不强,教师就没有可蒸馏的优势。如果首要目标是语音自然度或实时延迟,这篇论文没有提供相应证据,不应期待文本蒸馏自动带来这些改进。如果口语答案已经接近内部文本,瓶颈可能在声学建模或识别评估链路上,继续加大文本蒸馏的收益会递减。

回到中心矛盾:交错生成的声学历史既是流式语音的必要条件,也是文本走偏的风险来源。论文的方法没有去掉这个条件,而是让教师在去掉声学历史的投影上告诉学生应该怎么选词,同时用保持项护住语音行为。理解了这一点,就能复述全部关键动作:采样自己的联合轨迹,投影给教师,文本词表内学偏好,非文本位置上学保持,最后用 3 组准确率检验内容是否回来、语音是否还在。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-16 语音/音乐/音频论文速递