英文题目:TS-OPD: Reconciling ASR and QA in Speech Language Models via Task-Specific On-Policy Distillation

标签:#语音识别 | #知识蒸馏 | #音频问答 | #语音 | #语音大模型

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

👥 作者与机构

  • Yujie Guo:机构信息未在 arXiv HTML 中可靠披露
  • Hongjie Chen:机构信息未在 arXiv HTML 中可靠披露
  • Jian Kang:机构信息未在 arXiv HTML 中可靠披露
  • Jie Li:机构信息未在 arXiv HTML 中可靠披露
  • Yongxiang Li:机构信息未在 arXiv HTML 中可靠披露
  • Yong Qin:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音语言模型(Speech Language Models,SLMs)在自动语音识别(Automatic Speech Recognition,ASR)专用化后常丢失语音条件问答能力。输入为连续语音加任务提示,输出为逐字转写或带思维链的问答回答,难点是两类监督在同一策略分布上直接冲突。本文提出任务特定在策略蒸馏(Task-Specific On-Policy Distillation,TS-OPD),流程分三步:先冻结语音编码器与大语言模型(Large Language Models,LLMs)只训练适配器得到问答模型,再以其为起点全参数识别微调得到识别专用模型,前者保留指令跟随风格,后者提供更强识别分布;第三步以问答模型为起点初始化学生,按约 1:1 采样识别与问答实例,在学生自采样轨迹上分别只用对应教师做前向散度蒸馏。与共享轨迹下双教师同时监督同一轨迹相比,任务特定路由(Task-Specific Routing)避免了同一状态上的分布竞争。在 LibriSpeech、GigaSpeech、ContextASR-Bench 英语对话子集与 TELEVAL 三套英语问答集上,500 小时蒸馏的学生问答总体准确率 45.07% 为全表最高,基本识别总体词错率 10.03% 明显优于问答适配器与 8k 小时联合训练基线,并缩小了与全参数识别模型 9.16% 的差距,上下文识别中在转写精度与命名实体召回间取得折中。该结论目前仅在英语 Emilia 派生数据上验证,未覆盖多语、长时对话与开放指令泛化,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要保留什么?

本文解读的对象是标题为 TS-OPD 的语音语言模型研究,输入是同一段英文语音,目标是在两种任务提示下得到两种输出:一种是逐字转写,另一种是基于语音内容的推理问答。论文关心的矛盾是,从一个会问答的语音模型出发再做识别特化,转写变好了,但语音条件下的问答准确率会大幅下降。解读的目标读者是刚进入语音与语言模型交叉方向的研究生,因此优先讲清学习依赖:先理解任务与评价,再理解 3 阶段构造,然后理解在线采样与路由,最后才能看懂实验对照。

需要保留的关键信息包括模型结构、参数冻结方式、老师与学生来源、采样与监督的对应关系、训练数据量与超参数、评价数据集与指标方向。本文只使用论文正文证据写作,不引入外部经验数值。凡是教学举例都会明确标为例子,不作为论文结论。

语音语言模型 × 指令跟随: 语音语言模型负责把语音编码器输出接入大语言模型来同时做转写和理解,指令跟随负责让同一模型按不同提示词在逐字转写和推理回答之间切换行为,二者搭配的原因是转写需要声学忠实而问答需要语义推理,组合意义是同一适配器必须同时保留两种提示条件下的行为,而不是只优化其中一种。

白话来说,语音语言模型就是在语音编码器和大语言模型之间加一个适配器,让语言模型能读懂语音特征。指令跟随就是模型能看懂提示词的区别:看到要求逐字重复的提示就老实转写,看到要求回答问题的提示就做推理。论文用语音条件问答作为指令跟随能力的具体度量,而不是泛泛地说模型变笨了。

已有路线为什么没有直接解决识别与问答的冲突?

论文回顾了 3 类已有思路。第一类是在适配阶段冻结大语言模型主干,或者设计语音文本数据配比,以保留语言能力。第二类是在持续训练中做模型合并、降低低秩适配缩放、回放历史经验。第 3 类是用权重平均和知识蒸馏在识别适配中保留能力,也有人用蒸馏改善语音文本对齐。这些方法的共同点是通过参数约束、数据设计或蒸馏来保留过去的行为。

在线策略蒸馏提供了不同视角。它 originally 在语言模型蒸馏中被研究,做法是让学生生成自己的轨迹,再让老师在学生当前策略实际访问到的状态上给出监督,从而减少蒸馏与自回归推理之间的失配。近期工作把它扩展到语音模型的跨模态能力迁移、推理对齐,以及方言或多语言特化中保留识别能力。论文的判断是,这种在学生访问状态上直接给监督的机制,天然适合把来自不同模型状态的互补行为迁移并保留下来。

与上述路线相比,本文不是只加一个通用正则,而是明确把特化前和特化后的模型当作两个老师,并用任务身份决定哪条轨迹接受哪个老师的监督。理解这一点后,才能明白后文为什么要构造一个共享轨迹的对照版本。

问题如何被具体化为可比较的两个模型状态?

论文把问题固定为一个可操作的起点:先有一个会语音问答的模型,再对它做识别微调。识别微调能提升转写,但会损害问答行为。于是特化前模型保留了较好的指令跟随,适合当问答老师;特化后模型具有更强的识别能力,适合当识别老师。学生从问答模型初始化,目标是学会识别,同时不丢问答。

关键在于,简单地把识别监督和问答监督混在一起,并没有显式解决两个目标的干扰。论文认为干扰来自两个老师的输出分布不同,如果在同一个学生状态上同时拟合两者,就会出现冲突信号。因此需要一个按任务分流的机制:识别轨迹只学识别老师,问答轨迹只学问答老师。

举例来说,例子:同一段语音在识别提示下期望输出是逐字文本,在问答提示下期望输出是包含思考过程的答案。这不是论文的实验样本,只是帮助理解为什么任务提示不同会导致期望的 token 分布完全不同,不能用同一个加权目标在同一位置上硬拟合。

三阶段全景:老师从哪里来,学生向谁学?

论文框架分为 3 个阶段。第一阶段做指令跟随的语音适配,得到问答模型。第二阶段从问答模型出发做识别特化,得到识别模型。第 3 阶段做任务专属在线蒸馏,学生从问答模型初始化,生成任务专属的识别轨迹和问答轨迹,每条轨迹只由对应老师监督。

识别老师 × 问答老师: 问答老师负责锚定模型原来的语音问答行为,识别老师负责提供更强的转写能力,搭配理由是特化前后的 2 个模型状态分别保留了两种能力的较好形态,组合意义是学生从问答模型初始化后,一边向识别老师学习转写,一边被问答老师拉住不偏离原有问答分布。

在参数安排上,第一阶段只训练语音适配器,语音编码器和大语言模型冻结,得到问答老师。第二阶段从问答模型出发做全参数微调,得到识别特化模型即识别老师。第 3 阶段冻结两个老师,只更新学生的语音适配器。这种安排的教学含义是:学生起点保留问答行为,学习过程只允许适配器向识别能力移动,同时被问答老师锚住。

下图是论文给出的 3 阶段总览,阅读时先看阶段划分,再看第 3 阶段内部的学生采样、老师预填与损失合并 3 步。

看图路径: 1. 先从左到右确认三阶段:第一阶段只更新适配器得到问答模型,第二阶段全参数微调得到识别模型,第三阶段冻结双老师只更新学生适配器;2. 再看第三阶段中部学生展开的两条轨迹:识别轨迹与问答轨迹使用不同提示词并分别记录各自的前缀状态;3. 最后看底部损失汇合处:两路前向 KL 损失按加权系数合并,检查箭头是否分别回指到各自对应的老师

原论文 Figure 1:Overview of the proposed TS-OPD framework.

论文图 1。原论文 Figure 1::“Overview of the proposed TS-OPD framework.”。

从像素可见,左侧第一阶段顶部标注问答监督,中间画出语音波形与思考加回答的示意,底部依次是语音大模型、编码器、适配器与语言模型模块,其中适配器标为可更新。第二阶段顶部改为识别监督,提示词为逐字重复,底部模型整体标为可更新。右侧第 3 阶段顶部并排放置问答老师、学生与识别老师,学生下方注明只更新语音适配器且从问答模型初始化;中部左侧为输入语音与两类提示词,中部为识别轨迹与问答轨迹展开,右侧为在学生轨迹上预填的老师分布,底部为两路前向 KL 损失及其加权合并。该图支持的核心判断是:监督信号按任务分流,而不是在同一轨迹上混合。

学生轨迹如何采样,老师在什么状态上给分布?

沿一个语音样本走完流程最清楚。给定语音输入,学生在识别提示条件下自回归采样出一条识别轨迹,在问答提示条件下采样出另一条问答轨迹。两条轨迹的长度可以不同,识别轨迹较短,问答轨迹因为包含思维链而较长。每一步的学生访问状态由任务提示、语音输入和当前已生成的学生前缀共同组成。

在线策略蒸馏 × 离线蒸馏: 离线蒸馏负责在固定文本序列上让学生拟合老师分布,在线策略蒸馏负责先让当前学生自己采样出转写或问答轨迹,再在学生实际访问到的状态上查询老师分布,二者搭配的理由是自回归推理时的状态来自学生自身,组合意义是把监督放在推理时会真正遇到的前缀上,从而减少训练与推理的状态失配。

在任务专属路由下,识别轨迹的每个状态只查询识别老师,得到识别老师分布与学生在同一状态下的分布;问答轨迹的每个状态只查询问答老师,得到问答老师分布与学生在同一状态下的分布。两路都使用前向 KL 散度,即让学生分布去覆盖老师分布。最终目标是两路损失的加权和,系数控制相对贡献。

\[\displaystyle\mathcal{L}_{\mathrm{ASR}}\]

上式是识别分支在一条学生识别轨迹上的平均前向 KL,问答分支形式相同,只是把老师换成问答老师、轨迹换成问答轨迹。符号含义是:分子侧是老师在学生访问状态上的 next-token 分布,分母侧是学生在同一状态上的分布,目标是让学生在自己会走到的前缀上更接近对应老师。

\[\mathcal{L}_{\mathrm{TS\text{-}OPD}}=\lambda\mathcal{L}_{\mathrm{ASR}}+(1-\lambda)\mathcal{L}_{\mathrm{QA}},\]

上式是最终合并目标,加权系数在零到一之间。论文强调该系数在任务专属路由下主要调节 2 个任务目标的相对强度,而不是在同一状态上直接平衡两个老师分布。

任务专属路由 × 共享轨迹蒸馏: 共享轨迹蒸馏负责让同一条学生轨迹同时接受识别老师和问答老师的加权监督,任务专属路由负责按轨迹的任务身份只把识别轨迹送给识别老师、问答轨迹送给问答老师,二者搭配的对比意义是前者在同一状态上混合两个不同分布,后者把两个分布分开到不同任务条件上,从而减少同一位置上的直接竞争。

作为对照,论文构造了共享轨迹版本:无论轨迹来自哪个任务条件,识别老师和问答老师都在同一个学生访问状态上给出分布,并用加权和同时监督同一个学生分布。

\[\displaystyle\mathcal{L}_{\text{ST-OPD}}={}\]

上式即该共享版本的单条轨迹损失,两个 KL 项作用于同一学生分布。这正是后文用来揭示干扰的反证结构:同一位置收到两个不同老师的信号,系数稍有偏向就可能拉偏整体行为。

训练与构造细节:更新谁,冻结谁,采样配比是什么?

论文的语音语言模型采用编码器加适配器加大语言模型的结构。语音编码器为 Whisper-large-v3,大语言模型为 Qwen3-4B,适配器由卷积与线性层组成,把编码器输出下采样 4 倍并投影到语言模型的嵌入空间。这部分是构造细节,不是实验结论。

训练安排按阶段区分。问答适配阶段只更新语音适配器;识别特化阶段做全参数微调;蒸馏阶段冻结双老师,只更新学生的语音适配器。蒸馏时识别样本与问答样本按 1 比 1 采样,并路由给各自对应的老师。

优化使用前 128 个词表项的前向 KL,训练一个周期,余弦调度。最大生成长度识别为 256,问答为 2048。

下表把论文明确报告的蒸馏优化与采样条件整理在一起,便于复现时逐项核对。表前的问题是:蒸馏阶段到底更新哪些参数、采样如何配比、生成长度如何设置?公平性说明是:这些是论文在方法与实验设置中直接给出的实现条件,不是不同方法之间的胜负比较。

条件指标基线本方法比较对象
采样配比识别与问答实例比例未报告1 比 1 采样并路由给对应老师问答老师与识别老师
优化目标蒸馏分布截断未报告前 128 项前向 KL学生访问状态上的老师分布
优化调度学习率与周期未报告1×10−5 学习率训练一个周期并用余弦调度冻结的双老师
生成长度识别与问答最大长度未报告256 与 2048识别轨迹与问答轨迹

表后需要说明,该表只解决实现可核对性,不支持任何性能判断。论文未报告蒸馏阶段的批量大小、硬件耗时与梯度裁剪等细节,这些缺项在复现时必须明确标记为未知,不能从模型名称推定。只更新适配器意味着可训练参数量小,但论文没有测量每步延迟或推理开销,因此不能把训练参数少直接等同于推理更快。

数据、基线与指标:用什么测,转写与问答各看什么?

训练数据从 Emilia 中采样约 81,000 小时英文语音并配有转写,论文把每条转写当作文本查询送给 Qwen3-4B,用其思维链回答作为问答监督,从而得到同一语音输入的配对识别与问答目标。提示格式上,识别用逐字重复提示加空推理段加转写,问答直接用语音输入生成思维链加最终回答。

评价分为三块。基础识别用 LibriSpeech 测试集与 GigaSpeech 测试集,报告词错率,越低越好。上下文识别用 ContextASR-Bench 英文对话子集,把热词表追加到标准识别提示中作额外上下文,报告词错率与命名实体漏检率,都是越低越好。问答用 TELEVAL 中的 3 个英文子集,报告准确率,越高越好。长对话录音会被切分为短句,超过 30 秒的样本被排除以满足编码器输入长度约束。

基础识别 × 上下文识别: 基础识别负责在无额外提示下把语音逐字转写正确,上下文识别负责在提示词中追加热词表后同时保证全文正确和命名实体召回,二者搭配的原因是仅看词错率会掩盖实体词是否被借助上下文纠正,组合意义是同时报告词错率和命名实体漏检率才能判断语言能力是否真的帮助了识别。

基线包括 4 个可运行变体:只做问答适配的模型、从它出发全参数识别微调的模型、随机初始化适配器只做识别的模型、随机初始化适配器同时做识别与问答联合训练的模型。蒸馏学生从问答模型初始化,主结果使用 500 小时蒸馏数据与 0.5 的加权系数。需要提醒的是,原文表格的数字矩阵在本次证据中因表头解析问题无法安全选择绑定,因此后文结果表只使用正文连续原句中逐字出现的数字,不把矩阵裸值逐格转写,避免单位与精度失真。

蒸馏数据从少到多:识别变好时问答是否保住?

本节回答的比较问题是:在任务专属路由固定时,增加蒸馏数据量是否持续改善识别,同时不损害问答?公平条件是同一方法、同一路由与同一优化设置,只改变 Emilia 蒸馏子集的小时数。指标方向是基础识别与上下文识别的词错率越低越好,问答准确率越高越好。

条件指标基线本方法比较对象
100 小时蒸馏基础识别整体词错率11.32%9.82% 在 1000 小时时同一 TS-OPD 随数据扩展
100 小时蒸馏上下文识别词错率7.10%5.88% 在 1000 小时时同一 TS-OPD 随数据扩展
100 到 1000 小时问答准确率约 45% 附近保持稳定约 45% 附近保持稳定识别提升的代价检验
数据来源语音域Emilia 采样Emilia 采样基础识别与上下文识别

表后解释如下。论文报告,随着数据从 100 小时增加到 1000 小时,基础识别与上下文识别一致改善,基础识别整体词错率从 11.32% 下降到 9.82%,上下文识别词错率从 7.10% 下降到 5.88%,而问答准确率始终稳定在约 45% 附近。这支持的判断是:增加蒸馏数据能稳步增强识别能力,且未观察到问答下降。限制是:该趋势是总体平均,不等于每个子集或每一步都单调成立;论文同时指出较少数据已能带来可观增益,更多数据继续带来一致改善,但未给出每档数据的完整方差与显著性检验。

未胜出项是:即使到 1000 小时,论文仍未声称追平全参数识别特化模型的识别上限,主结果文字也只说缩小了与该模型的差距并超过了仅识别适配器基线。

反证是什么:共享轨迹为什么暴露出此消彼长?

本节回答的比较问题是:同样用双老师,把监督放在同一轨迹上混合与按任务分开,哪种更少干扰?公平条件是都从问答模型初始化并使用相同的 500 小时子集与优化设置,区别只在路由。指标方向与上一节相同。

论文报告,只用识别老师蒸馏能得到较强识别但几乎丢失问答;双老师共享轨迹版本在识别与问答之间出现显式权衡,而任务专属版本在基础识别、上下文识别与问答上都更好。机制解释是:共享版本中两个老师在同一学生状态上给出不同分布,同一位置的信号可能冲突;任务专属版本把两个监督分到不同任务条件的轨迹上,减少了直接干扰。

下表用论文正文逐字报告的系数敏感性数字来呈现这种差异,重点不是绝对高低,而是系数微调时的稳定性。表前的问题是:加权系数变化时,两种路由的问答是否同样稳定?条件是共享版本用 500 小时、任务专属版本在部分对比中用 300 小时,因此不做严格的绝对值对照,只看随系数变化的趋势。

条件指标基线本方法比较对象
共享轨迹对称加权系数选择λ=0.5 时相对最平衡λ=0.55 时问答降至 23.97%同一共享路由内比较
共享轨迹偏向识别识别词错率λ=0.5 附近ASR WER 为 10.82% 在 λ=0.55 时问答崩塌的代价
任务专属路由系数区间稳定性λ 在 0.1 到 0.9 之间问答仅变化约 1 个百分点仅 λ=1 去掉问答监督时问答崩塌共享轨迹的敏感性
路由差异系数含义同一状态混合两老师不同轨迹分别对应各自老师干扰来源解释

表后解释如下。论文报告,在共享轨迹下系数从 0.5 增加到 0.55,问答准确率就降到 23.97%,此时识别词错率为 10.82%,说明对系数高度敏感;而任务专属路由在 0.1 到 0.9 之间问答仅变化约一个百分点,只有当系数为 1 即去掉问答监督时问答才会崩塌。这支持的判断是:共享监督把系数变成了同一分布上的直接竞争,任务专属把系数变成了两类任务目标的相对强度。反例与边界是:任务专属并非对系数完全免疫,去掉问答分支仍会丢失问答;论文也明确两组实验的数据量不同,因此不能把 300 小时任务专属的绝对值直接宣称为优于 500 小时共享版本的部署收益,只能说在更少数据下已呈现更有利的权衡趋势。

哪些结论有边界,哪些量根本没有测?

首先区分 3 类表述。论文直接报告的是:任务专属路由在所测条件下改善识别并保持问答稳定,随数据扩展识别持续改善,共享轨迹对系数敏感。有限解释的是:干扰减少来自不同任务轨迹上的监督分离,这一解释与系数敏感性趋势一致,但论文没有在梯度或分布重叠层面做直接测量。未验证推测是:保留的语言能力有助于上下文识别中的实体召回,原文用词是提示有用性,解读时应保留为可能而非因果定论。

未测量的边界包括误判率之外的延迟、吞吐、显存与训练成本,论文没有报告硬件预算与推理开销,因此不能承诺更快或更便宜。评价只覆盖英文识别与 3 个英文问答子集,以及被切分且剔除超长样本的上下文基准,不能推广到其他语言、长音频或真实对话系统。资源状态方面,本次未发现来源绑定且完成验证的代码与模型资源,因此不得声称代码、模型或数据已公开,只能按论文文字复述数据来源与构造方法。

另一个需要保留的冲突说明是:原文表格矩阵因技术原因无法安全绑定,本文结果表只使用正文连续原句中的数字。这意味着主结果中多个基线的完整词错率与问答准确率对照没有被逐格复述,读者若要核对完整主表,必须回到原文表格,而不是依赖本文的趋势表。

要复现先做什么,需要补哪项验证?

复现的第一步是重建 3 阶段流水线:先用问答监督只训练适配器得到问答模型并冻结编码器与语言模型,再从该模型全参数微调得到识别模型,最后冻结双老师、从问答模型初始化学生并只训练适配器。关键超参数与信息条件是:识别与问答 1 比 1 采样、前 128 项前向 KL、一个周期与余弦调度、学习率为 1×10−5、识别与问答最大生成长度分别为 256 与 2048、主结果蒸馏数据为从训练集中采样的 500 小时且系数为 0.5。

第二步是实现采样与路由:学生按任务提示分别采样识别与问答轨迹,识别轨迹只查询识别老师,问答轨迹只查询问答老师,在学生访问前缀上计算前向 KL 并按系数合并。必须同时实现共享轨迹对照版本,即同一轨迹同时接受双老师加权监督,否则无法验证路由的作用。

还需补的验证包括:固定相同数据量下的路由对照、多次随机种子的方差、上下文识别中命名实体改善是否稳定出现、以及去掉问答监督后的崩塌是否可重复。数据构造上要用同一语音配对转写与思维链问答目标,并记录提示词、切分与剔除超长样本的规则,否则评价条件不一致会导致词错率与问答准确率不可比。

何时值得尝试这种双老师分流?

当已经有一个问答行为较好的语音模型,又必须提升转写,但不能接受问答大幅下降时,这种按任务分流的在线蒸馏值得尝试。它的适用条件比较具体:能够获得特化前后的 2 个模型状态,能够为同一语音构造配对的识别与问答目标,并且蒸馏阶段允许学生自己采样轨迹。

不适合的情况是:只有单一任务需求,或者无法承担学生采样与双老师前向计算的开销,或者目标语言与长音频条件与论文英文短句评价差异很大。此时更稳妥的做法是先复现小数据趋势,再决定是否扩展到 1,000 小时量级。

回到中心矛盾,论文的回答不是找到一个万能系数,而是不在同一状态上硬混合两个老师。把识别与问答的监督分到各自任务条件的轨迹上,系数就从直接竞争变成任务强度调节,因而更稳健且随数据扩展仍能保持问答稳定。这也是初学者可以带走的方法直觉:出现多目标冲突时,先问监督是否作用在同一状态上,再决定是调权重还是改路由。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-25 语音/音乐/音频论文速递