英文题目:X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs

会议身份:conference:interspeech:2026:conference-paper-id:cao26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#知识蒸馏 #多模态学习 #语音大模型 #语音 #音频理解

评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Di Cao:机构信息未能从会议 PDF 纯文本可靠映射
  • Dongjie Fu:机构信息未能从会议 PDF 纯文本可靠映射
  • Hai Yu:机构信息未能从会议 PDF 纯文本可靠映射
  • Siqi Zheng:机构信息未能从会议 PDF 纯文本可靠映射
  • Xu Tan:机构信息未能从会议 PDF 纯文本可靠映射
  • Tao Jin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

端到端语音大模型直接以语音指令为输入生成文本推理与答复,但连续声学表征与离散文本逻辑空间错位,导致复杂指令遵循与推理能力存在差距,标准监督微调与强化学习难以完全迁移文本端高质量数据。跨模态同策略蒸馏先构建语义不变的语音文本平行提示对,再让学生在双模态下自主多采样 rollout以覆盖自身分布,接着由冻结文本教师给出token级对数概率作为参考分布,最后以策略梯度联合优化模态内与跨模态两项优势。与依赖静态教师轨迹的离线蒸馏不同,该机制在学生探索轨迹上按KL差异动态分配信用,从而缓解暴露偏差并摆脱对真值答案标注的依赖。在BIG Bench Audio、Audio Multi-Challenge与Voice Bench三项基准任务下,X-OPD的平均语音下降指标为3.43%,低于Qwen3-Omni-A3B-Instruct的平均语音下降指标11.29%。该框架同时收窄文本端差距并在MMAR上保留原有通用推理能力,体现双目标的协同而非折中。其结论限于英文合成朗读指令与三项问答推理基准,尚未验证真实噪声、多口音、情感韵律与多轮长程记忆的外推。原文未披露训练、推理或部署成本

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

这篇解读的输入只有论文正文证据与本次收到的官方原图像素,不引入其他解读或外部评价。目标读者是刚进入语音、音乐与音频方向的研究生,需要能核对步骤并能用自己的话复述方法。必须保留的信息包括任务定义、数据构造方式、采样与打分机制、损失构成、训练冻结与更新范围、评测基准与裁判配置、主结果数字、消融条件与遗忘对照。

输出是 1 篇按学习依赖展开的中文技术解读,先讲端到端语音交互为什么会出现能力落差,再讲已有路线为什么没有补上,最后讲 X-OPD 如何用学生自己采样加教师在线打分来补。全文只讨论论文实际研究的通用指令与推理对齐任务,凡是为帮助理解而举的教学例子都会明确标为例子,不添加无来源的数值或效果断言。

资源状态方面,本次证据清单中没有发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开,只能按论文文字说明数据来源与框架名称。

已有路线在补语音与文本差距时卡在哪里?

论文把背景放在从级联架构向端到端语音大模型的转变上。级联一般是语音识别加文本大模型加语音合成,延迟较高但能直接继承文本模型的推理能力。端到端直接在连续语音信号空间建模,延迟更低,也能保留语调、情感与环境等超语言信息,代表系统包括 GPT-4o、Gemini 2.5、Qwen3-Omni 与 Voxtral。问题是多项经验研究显示端到端模型在复杂指令跟随、逻辑推理与知识密集问答上相对文本模型明显退化,级联在工业中仍因能力稳健而被选用。

论文把退化归因于两点,一是高质量成对语音推理数据稀缺,二是连续声学表示与文本大模型的离散逻辑空间天然不对齐,导致文本侧高质量监督微调与强化学习数据无法完整迁移。相关工作一侧,DeSTA2.5-Audio 用主干模型从音频描述生成答案做监督微调,SALAD 做 2 阶段跨模态蒸馏加主动数据选择,另有双通道 logit 级监督迁移复杂推理能力。论文认为这些方法本质上是离策略的,依赖静态教师轨迹或固定目标,学生学不到偏离后如何纠正自己的推理路径,因此存在暴露偏置。

另一侧是同策略蒸馏,GKD 让学生在自生成序列上接受教师反馈,MiniLLM 用反向 KL 缓解暴露偏置,Qwen3 的强到弱蒸馏与 Thinking Machines Lab 的在线蒸馏也被引用为结合稠密蒸馏奖励与同策略相关性的尝试。

监督微调 × 强化学习: 监督微调负责用高质量成对答案把模型拉向正确输出,强化学习负责用奖励信号在更大轨迹空间中优化策略。论文指出在语音大模型中标准的监督微调加强化学习流程未能弥合与文本模型的差距,原因是高质量语音推理成对数据稀缺,以及连续声学表示与离散逻辑空间本来就不对齐。二者搭配仍不够的理由是静态数据集无法覆盖学生推理时的偏离,组合后 X-OPD 新增的作用是用在线教师反馈替代对静态真值的重度依赖。

教学例子:可以把离线蒸馏想象成只看标准答案抄作业,同策略蒸馏则是自己先做一遍再请老师逐行批改。比喻对应到真实组件时,前者对应固定教师回答的监督微调,后者对应学生当前策略采样出的轨迹与教师的 token 级对数概率反馈,不能把比喻当作性质证明。

要对齐的到底是哪个差距,用什么条件衡量?

论文要解决的不是语音识别字错率本身,而是能力对齐差距。也就是同一个逻辑意图分别以语音和文本输入时,语音大模型的回答质量系统性低于文本模型,甚至在纯文本输入下也低于原始文本基座,说明跨模态学习过程损伤了原有通用能力。衡量方式是成对评测,同一基准同时提供语音指令与文本指令,语音能力模型分别测两种模态,纯文本模型只测文本。3 个代表性基准分别是 BIG Bench Audio、Audio Multi-Challenge 与 VoiceBench。BIG Bench Audio 把 BIG-bench Hard 中的 4 个逻辑任务搬到音频域,共 1000 条合成音频样本,用准确率报告。

Audio Multi-Challenge 测自然多轮交互,包括推理记忆、指令保持、自洽与语音编辑,共 452 段对话上的 1712 条细则,用平均通过率报告。VoiceBench 测通用知识、指令跟随与安全,包含 7 个子集,共 5783 条单轮样本,用全子集平均分报告。论文还用 MMAR 测灾难性遗忘,该基准覆盖声音、音乐与语音的 1000 条精选样本,用总准确率报告保留程度。指标方向都是越高越好,而平均下降越低越好。需要区分的是百分点下降与相对百分比下降不同,论文的平均下降是相对每系列原始基座模型的总体差距,不是单题分数差。

X-OPD 让一个样本走完怎样的输入到输出回路?

先沿一个样本走完全程。输入是 1 对语义不变的平行提示,记为语音 S 与文本 T,二者逻辑意图严格一致。学生是语音大模型,教师是能力更强的文本模型。学生分别在文本条件与语音条件下做自主多采样滚动,生成若干候选回答轨迹。教师在同步文本输入下对这些轨迹的每个 token 给出参考对数概率,用 KL 散度思想做动态信用分配,形成模内与跨模态两路优势信号。

最后用策略梯度风格的加权损失更新学生,使语音条件下的输出分布向教师的文本逻辑靠拢,同时用文本条件下的损失稳住基本功。图前导读:下图是论文给出的 4 段式总览,从左到右依次是平行数据、学生多采样、优势计算与策略优化,重点看数据如何成对、轨迹从哪里采样、两路优势在哪里分叉、损失回路更新谁。

看图路径: 1. 先从左到右沿文本改写到语音合成的箭头确认平行数据是怎样构造出来的;2. 再看中间学生模型同时接收文本与音频两路输入并向外展开多条采样轨迹;3. 接着定位中间优势计算柱中模内与跨模态两段的划分与 KL 引导打分标注;4. 最后看右侧教师文本模型与策略优化损失 L 的回路确认谁打分谁更新

原论文 Figure 1:Overview of the proposed Cross-Modal On-Policy Distillation (X-OPD) framework.

论文图 1。原论文 Figure 1:“Overview of the proposed Cross-Modal On-Policy Distillation (X-OPD) framework.”。

图中可见内容解释如下。最左侧是跨模态对齐数据分支,从文本提示经口语化改写得到精炼文本,再经文本到语音得到音频提示,两处绿色箭头表示改写与合成流程。中间是学生语音大模型,同时接受上方文本与下方音频输入,向右展开多条采样轨迹。第三列是优势计算,用深蓝与橙色柱表示两类 token 级分数,并标注模内与跨模态以及 KL 引导打分。右侧是教师文本模型,上下分别接收文本输入并对中间轨迹打分,最右是策略优化损失与模型更新示意,箭头回路表示只更新学生而不改变教师。这种布局把监督来源明确为在线教师打分,而不是静态真值答案。

多采样滚动与双路优势各自算什么?

第一个组件是跨模态对齐数据。论文要求数据集是成对集合,声学信号与文本指令在逻辑意图上严格对齐。实践中两种做法都被允许,一是由文本指令合成语音,二是对已有音频做语音识别转写。目的是让教师在文本上的打分能迁移到语音上,如果意图不一致,迁移就没有意义。第二个组件是稳健多采样滚动。

单样本滚动随机性大,梯度估计方差高,容易抖动。做法是对每个提示独立采样多条候选轨迹,再对多条路径做梯度平均,扩大对策略空间的覆盖。论文实验中每个提示的滚动数设为 4。第三与第 4 个组件是双路优势函数。记学生策略为当前参数模型,教师策略为文本模型,轨迹中第 t 个 token 为研究对象。

模内优势比较教师与学生在同样文本条件下的对数概率差,跨模态优势比较教师在文本条件与学生在语音条件下的对数概率差。二者共同构成跨模态奖励信号,前者锚定文本熟练度,后者桥接语音输出。最终优化目标是两项策略梯度损失的加权和,权重为 λ,取值在 0 到 1 之间。每一项内部对多条滚动取平均,并对每条轨迹按长度归一化,同时乘以当前策略与采样策略的概率比以做重要性校正。

同策略采样 × 离线蒸馏: 同策略采样负责让学生模型从自己当前分布中生成轨迹,暴露真实推理偏离;离线蒸馏负责复用教师事先写好的固定答案做监督,训练高效但看不到学生自己的错误。二者搭配的理由是只学固定答案会出现暴露偏置,推理时一旦走偏就不会纠正,而 X-OPD 用同策略采样提供待评价的轨迹,再用教师的在线打分替代固定目标,组合后新增的作用是把监督点从静态答案搬到学生实际走过的每一步上。

模内优势 × 跨模态优势: 模内优势负责在文本条件下比较教师与学生的对数概率,稳定学生的文本基本功;跨模态优势负责在教师看文本、学生听语音的条件下比较同一后续 token 的对数概率,把文本逻辑搬到语音表示上。二者搭配的理由是直接做跨模态对齐容易动摇原有文本能力,需要一个文本锚点做参照,组合后新增的作用是形成双路奖励信号,一路保底一路拉齐,权重 λ 在二者之间做平衡。

需要强调的是公式细节以原文为准,当前结构化证据未提供可绑定的原始公式,因此正文不虚构展示公式,只用文字讲清符号输入与计算目标。原文明确的实现包括多条独立滚动、按长度平均、概率比校正与 λ 加权,未报告梯度裁剪阈值或 KL 系数等细节时不做猜测。

训练数据怎样构造,哪些参数更新哪些冻结?

训练集来自文本提示采样,源头是 Tulu 3 与 NaturalReasoning。先用 Gemini-3-Flash-Preview 把原始提示改写为更口语化、更适合朗读的格式,再用 CosyVoice3 以 24 kHz 合成语音。为保证声学保真,用 SenseVoice 做语音识别回译,过滤掉词错率超过 5% 的样本。最终得到两个高质量子集,来自 Tulu 3 的 10934 对约 136.7 小时,来自 NaturalReasoning 的 16913 对约 95.5 小时,合计约 27k 对平行语料。

语音提示 × 文本提示: 语音提示负责提供连续声学信号形式的指令输入,考验模型从波形或声学特征中恢复意图的能力;文本提示负责提供离散符号形式的同一指令,作为教师生成参考分布的同步输入。二者搭配的理由是只有当逻辑意图严格一致时,教师在文本上的打分才能迁移到语音上,组合后新增的作用是构成语义不变的平行数据桥,使 KL 引导的打分可以在两种条件下对齐到同一个 token 序列上。

优化实现上,论文以 Qwen3-Omni-A3B-Instruct 为基座,用 verl 框架做强化学习风格的策略优化,采用纯同策略采样,所有回答都由当前策略生成。对语言模型主干做全参数训练,音频塔与模态适配器在整个优化过程中冻结。优化器为 Adam,学习率为 2 乘 10 的负 6 次方,批量大小为 256,每个提示滚动 4 条。对比基线用 ms-swift 框架实现,包括在原始真值回答上的标准监督微调、在文本对应模型 Qwen3-A3B-Instruct 生成回答上的离线知识蒸馏,以及基于前向 KL 的广义知识蒸馏 GKD,所有基线训练 1 个轮次且超参数与 X-OPD 设置保持一致。论文未报告梯度裁剪、预热步数与重置时机等更细实现,复现时应视为缺项而不从模型名称推定。

评测在什么条件下运行,裁判与重复如何控制?

评测覆盖语音输入与文本输入两种模态,语音能力模型分别测,纯文本模型只测文本。推理遵循官方指南,并用 Qwen3-235B-A22B-Instruct-2507 作为主要的基于大模型的裁判。为缓解随机性,每个基准做 3 次独立推理,每次输出再评测 3 次共 9 次取平均。基座选择上,主实验用 Qwen3-Omni-A3B-Instruct,原因是其在研究社区中被广泛采用且性能稳健,教师默认用同系列的 Qwen3-A3B-Instruct,而不是更大的 Qwen3-A22B-Instruct。消融中会比较教师规模与 λ 取值。

表 1 的比较还纳入 GPT-4o、Gemini-2.5-Flash、Gemini-3-Flash-Preview、Voxtral-Mini-3B、Qwen2.5-Omni 与 Qwen3-Omni 系列,平均下降相对各自系列原始基座模型计算,对 Gemini 则以自身文本模态为基线。需要核对的是不同模型版本与采样条件并不完全一致,因此跨系列比较只能说明普遍存在差距,不能当作同条件胜负。只有 Qwen3-Omni-A3B 上的 SFT、离线蒸馏、GKD 与 X-OPD 使用同一数据集训练,才构成公平对照。

主结果在相同数据下把差距缩小了多少?

比较问题是,在同一训练数据下,在线跨模态蒸馏是否比标准监督微调、离线蒸馏与 GKD 更能缩小语音相对文本基座的差距。公平条件是 Qwen3-Omni-A3B 上的 4 个方法都用相同的 27k 平行语料训练,评测覆盖 3 个基准的语音与文本输入,指标方向为基准分越高越好,平均下降越低越好。下表整理语音侧关键数字与平均下降,文本侧数字见正文论述,表格为 5 列以满足宽表对照要求。

条件BIG Bench Audio 语音分Audio Multi-Challenge 语音分VoiceBench 语音分平均语音下降
Omni-A3B-Instruct 基座85.6723.5789.2211.29%
加 X-OPD93.4128.1489.293.43%

表后解释:主要收益是 X-OPD 把语音平均下降从 11.29% 降到 3.43%,文本平均下降从 5.51% 降到 0.97%,在 BIG Bench Audio 与 Audio Multi-Challenge 上提升最明显,在 VoiceBench 上与基座基本持平,论文表述为已接近性能上限。具体代价与反例是 3 种传统方法反而加剧退化,监督微调的平均语音下降扩大到 22.76%,离线蒸馏为 19.62%,GKD 为 20.23%,说明简单拟合静态答案可能与基座先验冲突。

未胜出项是 VoiceBench 上 X-OPD 没有大幅超越基座,这既是边界也是诚实信号,表明方法主要修复复杂推理与多轮保持,而非在已饱和的通用知识上刷分。

教师更大一定更好吗,λ 两端各发生什么?

消融要回答两个问题,一是教师规模是否越大越好,二是模内与跨模态损失如何分工。条件是基座仍为 Qwen3-Omni-A3B-Instruct,默认教师为 Qwen3-A3B-Instruct 且 λ 为 0.5,对比更大教师 Qwen3-A22B-Instruct 以及 λ 取 1.0 与 0.0 的两端设置。论文报告,更大教师并未带来更好对齐,用 A3B 教师的整体结果优于 A22B 教师,论文引用知识差距文献解释为能力匹配比单纯放大教师规模更重要,更对齐且更易学的轨迹反而有效。λ 的结果显示出互补而非互斥,纯文本蒸馏有助于语音分数,纯语音蒸馏反过来也有助于文本分数,平衡设置取得整体最优。

这支持双目标设计的必要性。未评测边界是论文没有报告 λ 在 0.25 或 0.75 等中间取值的曲线,也没有报告不同滚动数 n 的敏感性,复现时需要补做这些验证才能确认 0.5 的稳健性。

灾难性遗忘对照揭示了什么代价与局限?

比较问题是,对齐训练是否以牺牲原有声学通用能力为代价。公平条件是在 MMAR 基准上比较同一基座经不同方法训练后的总准确率,指标越高越好,下降越小越好。下表为 5 列整理,保留原文写法与精度。

条件MMAR 总准确率相对原始模型下降训练范式是否 X-OPD
原始模型71.3%-未训练否
离线蒸馏59.9%11.4静态教师拟合否

表后解释:主要收益是所有 X-OPD 变体都保持在 69% 以上,λ 为 0.5 时为 69.3% 仅下降 2.0,而传统方法从 71.3% 跌到 59.9% 附近,下降超过 11 个百分点。

论文还报告纯文本蒸馏 λ 为 1 时保留最好为 70.7%,说明模内优化对预训练音频特征干扰最小。具体代价是即使 X-OPD 仍有约 0.6 到 2.0 个百分点的损失,并非完全无损。局限方面,MMAR 只是保留能力的代理指标,不能等同于全部语音、音乐与环境理解能力;论文未测量推理延迟、训练算力与误判率,因此不能声称这些量得到改善。相关性不等于因果,遗忘更轻可能来自在线正则与冻结音频塔的共同作用,不宜单归因于某一个组件。

要复现 X-OPD 先做什么,需要补哪项验证?

复现先做数据闭环。按论文流程采样 Tulu 3 与 NaturalReasoning 文本提示,用口语化改写模型得到精炼文本,再用 CosyVoice3 合成 24 kHz 音频,最后用 SenseVoice 回译并过滤词错率超过 5% 的样本,保留约 10934 对与 16913 对的规模与时长量级。接着搭建学生与教师,学生为 Qwen3-Omni-A3B-Instruct,教师为 Qwen3-A3B-Instruct,冻结音频塔与模态适配器,只训练语言主干。优化侧用 verl 做纯同策略采样,每个提示采样 4 条,Adam 学习率 2 乘 10 的负 6 次方,批量 256,损失按 λ 加权并对轨迹长度归一化。评测侧严格区分语音与文本输入,用同一裁判模型与 9 次平均协议报告 3 个主基准,再用 MMAR 报告保留程度。

还需补的验证包括不同 λ 网格、不同滚动数、不同教师规模的可重复曲线,以及训练耗时与推理开销的实测。论文未提供可验证的公开资源状态,因此只能按框架名称与数据来源描述,不能声称代码权重或数据当前可用,复现者需自行实现采样、打分与损失加权。

何时值得尝试 X-OPD,如何一句话记住它?

当语音模型能转写却在多步推理、多轮记忆与指令保持上明显弱于同源文本模型,且手头缺少大规模高质量语音推理标注时,X-OPD 值得尝试。它的关键假设是能构造语义不变的平行语音文本对,并能负担在线教师打分。如果平行对质量差或教师本身在目标任务上不可靠,对齐收益会打折扣,这属于待验证边界。一句话记住它,学生在自己实际走过的语音与文本轨迹上接受文本教师的逐 token 打分,用双路优势同时保住文本基本功与拉齐语音逻辑。

论文直接报告的是差距缩小与遗忘减轻,有限解释是能力匹配比教师规模更重要,未验证推测是该范式可低成本推广到下一代口语智能体,后者在没有延迟、成本与多语言实测前应表述为可能而非承诺。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总