英文题目:Distilling Structured Reasoning into SpeechLLMs for Spoken Language Understanding
会议身份:
conference:interspeech:2026:conference-paper-id:tsukagoshi26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#知识蒸馏 #多任务学习 #语音大模型 #口语意图与槽位识别
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Toshihiro Tsukagoshi:机构信息未能从会议 PDF 纯文本可靠映射
- Natsuo Yamashita:机构信息未能从会议 PDF 纯文本可靠映射
- Kota Dohi:机构信息未能从会议 PDF 纯文本可靠映射
- Hiroaki Kokubo:机构信息未能从会议 PDF 纯文本可靠映射
- Masaaki Yamamoto:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
口语理解需将带说话人、韵律和噪声变异的语音映射为意图加槽值结构化语义框,难点在于语义相邻意图仅差范围或粒度而常规微调难以拉开决策边界。本文提出推理引导微调 Reasoning-Guided Fine-Tuning / RG-FT,先用 DeepSeek-R1 基于语音转写、真值标签与全量意图槽位定义库生成候选枚举、拒绝论证和标签预测三段式轨迹,再以语音大模型为学生做双指令多任务学习,推理时仅走直接标签分支。为区别于肯定式解释,拒绝论证要求对每个错误候选引用证据说明矛盾,从而把细粒度对比显式语言化为结构正则。在 SLURP 测试集上 Qwen2.5-Omni-7B 经该方法意图准确率达 88.35%,相对直接微调提升 0.57 个百分点且槽填充 SLU-F1 同步改善至 76.88,六模型在英语 SLURP 与法语 Speech-MASSIVE 上均呈一致增益,最大增益出现在 Music-Flamingo 上为意图准确率 +2.40 个百分点、SLU-F1 +2.80。该结论限于 18 领域 60 类意图的同源划分设置,未验证强噪声、开放意图或跨语料迁移下的稳定性。原文未披露训练时长、推理延迟或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,为什么相邻意图最难?
本文的研究对象是端到端口语语言理解。白话说,就是直接听一段语音,然后输出机器能执行的语义框。英文名是 Spoken Language Understanding,缩写为 SLU。语义框里有两个关键部分。
第一是意图分类,英文为 Intent Classification,缩写为 IC,它判断整句话想做什么,例如日历域下的创建事件还是查询事件。第二是槽位填充,英文为 Slot Filling,缩写为 SF,它抽出时间、地点、人名等具体参数。2 个任务联合决定语义框是否完整。
对刚入门的同学,关键是理解输入与目标的对应关系。输入是一段带有说话人、口音、韵律和噪声变化的语音波形,目标是符合任务标签体系的结构化文本。论文聚焦的困难不是听不清字,而是两个意图在文字上只差范围或粒度。
例如同样提到播放音乐,一个是按歌手播放,一个是按歌单播放,声学证据很接近,文本证据也只有一两个词不同。常规做法是收集更多近边界样本让模型学会分界,但这类样本标注成本很高。
口语语言理解 × 意图分类: 口语语言理解负责把语音转成可执行的语义框,意图分类负责判定整句要做什么动作,二者是整体与核心子任务的关系,本文把意图分类作为最难区分相邻类别的主攻点,槽位填充作为联合评估的补充,组合起来才能说明语义框是否完整可用。
因此本文要保留的核心信息是:输入为语音,输出为意图加槽位实体,评价既看意图对不对,也看实体抽得准不准。后续所有方法都是为了在不增加推理开销的前提下,让模型在训练时见过为什么错的候选更差。
这样在测试时才能更少混淆相邻意图,这是全文反复验证的主线。
已有的语音大模型微调路线缺了哪块监督?
先解释语音大模型。白话说,它是能直接处理音频并生成文本的大语言模型扩展,英文为 Speech Large Language Models,缩写为 SpeechLLMs。代表例子包括 SALMONN、Qwen2-Audio、Qwen2.5-Omni 和 Audio-Flamingo。
它们的好处是省掉单独的语音识别加文本理解两段流水线,直接从语音到语义。已有路线大致分两类。一类是零样本与少样本提示,不做任务训练,靠指令泛化。另一类是任务微调,用配对的语音和文本数据把模型对齐到具体标签体系。
论文引用的对照工作显示,即使少量配对数据也能补上大部分文本与语音性能差距,但相邻意图的混淆仍然存在。这说明标签监督只告诉模型正确答案是什么,没有告诉模型错误答案错在哪里。
文本大模型领域有两条相关经验。一是基于理由的监督,让模型输出分类依据。二是推理蒸馏,让小模型学习大模型的中间推理步骤。但这些结论多在纯文本上验证,语音输入多了声学变异性能否迁移并不清楚。
本文的定位就是把文本侧的结构化推理监督搬到语音侧,并验证它是否真的能推开隐空间中的意图簇。这一步决定了后面要用教师生成轨迹来补监督。
语音大模型 × 直接微调: 语音大模型负责直接从声学信号生成结构化文本,直接微调负责用语音到标签的映射对齐任务标签体系,二者分工是底座能力与任务适配,本文指出只做直接微调时相邻意图缺乏足够的近边界样本来拉开距离,因此需要在监督中加入推理过程。
学习依赖上要记住:先有语音大模型提供声学到语义的底座,再有直接微调提供标签对齐,本文在其上加第 3 种监督,也就是结构化拒绝推理,用来补细粒度区分能力的缺口。
要解决的判别问题如何形式化?
把一个样本记为语音输入,记为待识别的语音。模型要输出意图标签和槽位值集合。意图来自固定的几十个类别,槽位类型也有固定词表。难点在于候选集合中往往有语义相邻的干扰项。
论文把正确意图记为真值,把其余候选记为错误集合,把错误槽位类型记为另一错误集合。训练时模型只看到最终标签,就会把所有错误类别同等推开,学不到哪个干扰项最危险。测试时一旦出现近边界表述,模型就容易在两个相邻意图之间摇摆。
论文提出的可核对假设是:如果训练时显式说出每个错误候选为什么与当前话语证据矛盾,就能起到结构正则的作用,迫使表示层放大关键差异。这个假设后面要用隐空间可分性指标来检验。
举一个教学例子帮助理解,但它不是论文实验数据。假设话语是把明天的会改到下午三点,候选中有日历更新和日历创建两个意图。例子中的拒绝解释会写:拒绝创建是因为话语中出现了改到一词,说明已有事件存在。
这个例子只说明拒绝解释的写法,不代表论文报告了该样本的效果。真正的监督来自教师模型对全量训练集生成的轨迹,后文会讲构造与过滤。
推理引导微调的全景:训练走两路,推理走一路
本文提出的方法叫推理引导微调,英文为 Reasoning-Guided Fine-Tuning,缩写为 RG-FT。它的全景可以沿一个样本走一遍。训练阶段,同一段语音会走两个指令分支。
一个分支被要求直接输出标签,另一个分支被要求输出完整推理轨迹。完整轨迹包含 3 段:候选枚举、拒绝论证和标签预测,记为三元组。教师模型事先为训练集生成这些轨迹,学生语音模型同时学习两种输出。
推理阶段,学生只走直接标签分支,不生成候选与解释,因此不增加计算开销。这种训练与推理不对称的设计是全文最需要记住的安排。下图是论文给出的训练与推理总览,上半是训练,下半是推理,理解时先看数据流向再看损失指向。
看图路径: 1. 先沿上半左侧三路箭头看教师输入再看右侧三色轨迹块;2. 再看中部学生双指令分支如何分别输出标签与完整轨迹;3. 最后对照下半推理分支确认只保留直接标签输出
论文图 1。原论文 Figure 1:“Overview of the proposed method.”。
从像素可见,上半左侧有转录文本、真值标签和数据库定义 3 路箭头进入教师 DeepSeek-R1,右侧输出三色块分别对应候选、解释和标签。中部学生有两个输入指令,分别输出直接标签和完整轨迹,并各自接受对应的损失约束。
底部给出加权求和公式,红色火焰与箭头标示可训练的学生,下半推理分支只有一个从语音经训练后模型到标签的箭头。这张图的可复述要点是:教师只在离线构造数据时使用,学生训练时双目标并行,推理时单目标输出。
三段轨迹每段写什么,提示如何约束格式?
先拆开 3 段。第一段是候选空间。白话说,就是从数据库中列出几个最可能混淆的意图候选和槽位候选,槽位还带上候选值。论文设定真值意图一定包含在候选里,这样拒绝解释才有明确靶子。
第二段是拒绝论证。对每个错误候选,生成一句话自然语言解释,说明它为什么与当前话语矛盾,所有解释组成集合。第 3 段是结构化标签。包含预测意图和槽位值对集合,槽位类型与值一一对应。
3 段在实现上不是 3 次调用,而是 1 次生成的结构化序列。约束格式靠教师提示实现,提示要求严格输出三行,分别对应候选、拒绝和标签,并要求引用证据、对照数据库定义比较候选。下图是核心提示结构,阅读时注意它如何把输入条件与输出行数锁死。
看图路径: 1. 先读系统指令中固定输出三行的要求;2. 再看候选行与拒绝行对错误集合的引用方式;3. 最后核对标签行的意图加实体列表格式
论文图 2。原论文 Figure 2:“Core prompt design for structured reasoning trajec- tory generation.”。
从像素可见,顶部灰条标明提示结构,系统指令要求扮演逻辑分析员,给定输入与数据库定义后恰好输出三行并比较候选与引用证据。中间行给出数据库定义与输入的来源,分别是意图槽位定义与转录文本加目标标签。
下面三行分别规定候选行列意图与槽位值候选,拒绝行对错误集合中每个元素说明错误原因,标签行用意图加实体列表的格式输出。这意味着教师生成时已经看到正确答案,目的是降低编出与真值矛盾解释的风险。
论文报告平均每个话语枚举 2.5 个意图候选和 1.2 个槽位类型候选,94.0% 的样本符合 3 段格式,其余丢弃。这个合格率是复现时可对照的自查点。
结构化推理轨迹 × 拒绝式解释: 结构化推理轨迹负责把决策固定为候选枚举、拒绝论证、标签预测 3 段格式,拒绝式解释负责对每个错误候选逐一说明与话语证据矛盾之处,二者搭配的理由是只列候选只能让模型看到竞争者,而说清为什么错才能形成对比式正则,组合意义是逼模型学到范围与粒度等细微差别。
记住依赖顺序:先有候选才能定义错误集合,先有错误集合才能写拒绝解释,先有拒绝解释才能形成完整轨迹,后续损失都建立在这个 3 段表示之上。
三个训练配置如何计算损失,混合比如何采样?
训练部分有 3 个可运行配置,用来分离每种监督的作用。第一个叫直接微调,英文为 Direct-FT。它只学从语音到结构化标签的映射,每个样本的损失是给定标签指令下生成正确标签的负对数似然,在一个批次上取平均。
第二个叫纯推理微调,英文为 Reasoning-FT。它只学从语音到完整轨迹的映射,损失是给定推理指令下生成整个 3 段序列的负对数似然。推理时它必须先生成候选与解释再给标签,因此更慢且有误差传播风险。
第 3 个是本文提出的推理引导微调。它是多任务目标,把前两种损失加权求和,权重记为混合比。具体采样方式值得复述。论文不是在同一个批次内对同一句话算两个损失再相加,而是独立采样两个小批量。
一个批量算推理损失,另一个批量算标签损失,再按权重混合。这种做法让两个目标的梯度来源解耦,便于调节主次。主实验统一取混合比为 0.5,即两边等权。
优化细节按原文交代:全参数微调,BF16 精度,AdamW 优化器,学习率为 4 乘以 10 的负 5 次方,余弦退火,批量大小为 4,梯度累积步数为 4,最多训练 4 轮,按开发集选最优检查点。所有结果在 3 个随机种子上平均。训练时同时用语音与金标准转录文本输入,以帮助学到基本能力。
推理引导微调 × 多任务目标: 推理引导微调负责把教师轨迹作为辅助监督蒸馏给学生语音模型,多任务目标负责同时保留直接标签预测分支与完整轨迹预测分支,二者分工是塑造表示与保证可用输出,搭配原因是纯推理监督会不稳定,组合后训练时双目标塑形隐空间,推理时只走标签分支从而零额外开销。
需要指出的缺项是:论文没有报告教师轨迹的人工质量评分,也没有逐层说明声学特征如何进入拒绝论证,教师看到的是转录文本而非原始音频,因此蒸馏的更多是文本侧的判别逻辑。复现时不要从模型名字推定冻结或更新了哪部分编码器,应按全参数微调来准备显存与时间预算。
在什么数据、指标和模型上测,条件是否对齐?
实验用两个语料。第一个是英文 SLURP,包含 11514 条训练、2033 条开发和 2974 条测试,覆盖 18 个域和 60 个意图类。第二个是多语 Speech-MASSIVE 的法语子集,划分规模与标签体系与 SLURP 相同,用来检验跨语言一致性。
评估沿用 SLURP 协议,报告 4 个指标。场景准确率测域分类对不对,动作准确率测意图动作对不对,意图准确率测两者组合是否全对,槽位指标 SLU-F1 看槽位类型与槽位值文本重叠是否正确。前 3 个越高越好,槽位分数越高越好。
模型覆盖 6 个语音大模型:Qwen2.5-Omni 的 7B 与 3B 版本、Qwen2-Audio 的 7B 与其指令版、Audio-Flamingo-3 和 Music-Flamingo。比较条件是受控的:直接微调复现了已有协议并放在完全相同的实验条件下。
纯推理微调作为消融,推理引导微调作为待测方法,三者在同一划分、同一训练轮数与同一选点规则下比较。隐空间分析取意图生成时刻对应场景与动作词的隐藏状态做池化,得到每句话的意图表示。
再算轮廓系数、费舍尔比率与中心间隔。轮廓系数分余弦与欧氏两种距离,中心间隔定义为到最近竞争类中心的距离减去到真值类中心的距离,正值越大说明离竞争者越远。资源状态需要如实说明。
本次没有发现来源绑定且完成安全验证的代码或数据链接,因此不能声称代码模型或数据已公开。复现应按论文描述自行构造教师轨迹与训练流程,硬件原文为两块 H200,最大新生成词数为 384。
主结果:谁在涨,涨多少,代价是什么?
要回答的核心问题是:在相同数据与模型下,加了推理正则是否稳定优于只学标签,以及纯推理是否可替代。公平条件是同一语料、同一模型、同一划分与 3 种子平均,指标方向都是越高越好。
下表整理 SLURP 上代表性数字与跨语料上限,列为条件、指标、基线、可部署方法与对照,数值保留原文写法,表头单位与裸值按原文呈现。
| 条件 | 指标 | 直接微调基线 | 本文方法 | 对照策略 |
|---|---|---|---|---|
| SLURP Qwen2.5-Omni-7B | 场景/动作/意图/槽位分数 | 91.30 / 88.67 / 87.78 / 76.19 | 91.81 / 89.22 / 88.35 / 76.88 | 纯推理 89.53 / 86.53 / 85.24 / 74.89 |
| SLURP Music-Flamingo | 场景/动作/意图/槽位分数 | 87.63 / 84.07 / 82.81 / 69.36 | 89.81 / 86.23 / 85.21 / 72.16 | 纯推理 86.87 / 82.96 / 81.31 / 69.35 |
表后解释需要同时说收益与代价。论文报告推理引导微调在每个模型、每个指标、每个语料组合上都优于两个基线。基线越弱,提升越大,Music-Flamingo 意图涨约 2.40 个百分点、槽位涨约 2.80 分。
最强的 Qwen2.5-Omni-7B 仍有稳定提升,说明正则不是只补弱模型。代价方面,训练时要多学一个轨迹分支,需要教师生成与过滤成本;推理时只走标签分支,论文称零额外计算开销,但这是指推理步数不变,不代表训练成本不变。
未胜出项也很清楚:纯推理在所有组合上都低于直接微调,小模型掉得更多,例如 Qwen2.5-Omni-3B 在 SLURP 上意图掉约 3.06 个百分点,这支持推理监督适合做辅助正则而不适合替代主目标。
轮廓系数 × 费舍尔比率: 轮廓系数负责衡量单个样本离本类中心近而离竞争类远的程度,费舍尔比率负责衡量类间散度相对类内散度的比值,二者从样本级与整体分布级互补验证可分性,组合起来才能说明准确率提升不是偶然,而是隐空间中意图簇边界确实被推开。
隐空间数字进一步支持机制解释。下表为可分性指标,数值保留原文写法,越高表示类间更分开,最后一列说明该行数值的读法。
| 模型与距离 | 直接微调 | 本文方法 | 指标方向 | 分离性含义 |
|---|---|---|---|---|
| Qwen2.5-Omni-7B 余弦轮廓/欧氏轮廓 | 0.242 / 0.157 | 0.279 / 0.176 | 越高越分开 | 样本更贴近本类 |
| Qwen2.5-Omni-7B 费舍尔比/中心间隔 | 1.133 / 0.174 | 1.276 / 0.194 | 越高越分开 | 类间散度相对更大 |
| Qwen2.5-Omni-3B 余弦轮廓/欧氏轮廓 | 0.299 / 0.195 | 0.332 / 0.219 | 越高越分开 | 两种距离下一致 |
| Qwen2.5-Omni-3B 费舍尔比/中心间隔 | 1.521 / 0.208 | 1.839 / 0.230 | 越高越分开 | 竞争类被推远 |
这组数字显示,推理引导微调在两种模型规模、两种距离下一致推开意图簇,论文据此认为准确率提升来自边界变清晰,而非推理时多想了一步,因为推理时根本没有生成推理。
哪段推理在起作用,混合比偏向哪边会坏?
消融要回答两个操作问题。第一,候选、拒绝、完整轨迹各贡献多少。第二,混合比取多大最稳。实验固定用 Qwen2.5-Omni-3B 在 SLURP 上测意图与槽位,训练都保留直接标签分支,只换辅助监督的内容。
下表保留原文的斜杠写法,意图三项为场景斜杠动作斜杠意图,槽位为分数,最后一列给出相对基线的可运行判断,辅助内容列说明每次新增了哪段监督。
| 监督配置 | 辅助监督内容 | 场景/动作/意图 | 槽位分数 | 相对基线判断 |
|---|---|---|---|---|
| 直接微调无辅助 | 无辅助 | 90.66 / 87.61 / 86.63 | 74.87 | 基线 |
| 标签加候选 | 候选枚举 | 90.95 / 87.96 / 87.03 | 75.57 | 已超基线 |
| 标签加候选到拒绝 | 候选到拒绝 | 91.20 / 88.44 / 87.57 | 75.62 | 继续提升 |
| 标签加完整轨迹 | 完整轨迹 | 91.32 / 88.55 / 87.62 | 75.88 | 最优 |
表后解释是单调递增的含义。只加候选枚举已经超过基线,说明让模型看到竞争者本身就是有效正则。再加拒绝解释又有提升,说明说清为什么错比只列出竞争者更能锐化边界。
完整轨迹最优,说明最后的标签段也补了从解释到输出的衔接。论文称其他架构有类似趋势,但具体数字只给了该模型,因此不要把该表的精确增量推广到所有 6 个模型。混合比的敏感性如下图所示,横轴从直接微调到纯推理,纵轴分意图与槽位两排,阅读时先看峰形再看端点塌陷。
看图路径: 1. 先按列确认六条曲线分属三个模型家族面板;2. 再沿横轴从直接微调经中间混合比看到纯推理端性能回落;3. 最后比较上排意图与下排槽位峰形是否一致
论文图 3。原论文 Figure 3:“Sensitivity of intent accuracy (top) and SLU-F1 (bot- tom) to the mixing ratio α on the SLURP test set across all six SpeechLLM architectures.”。
从像素可见,6 个面板按模型家族分成三列两行,上行为意图准确率,下行为槽位分数,横轴为混合比,左端标直接微调,中间标推理引导微调,右端标纯推理。所有曲线都呈钟形,峰值落在中间附近而非端点。
右端纯推理处普遍快速下跌,小模型与弱基线模型的跌幅更大。左列大模型曲线较平,右列弱模型曲线拱起更高,说明有更大提升空间的模型从推理正则中获益更多。论文据此选 0.5 为无需逐模型调参的稳健默认值,但这是一个经验折中,不是理论最优证明。
哪些结论有边界,哪些量根本没测?
先区分 3 类表述。论文直接报告的是准确率与可分性指标的提升,支持的是边界变清晰的机制解释,待验证的是声学因素如何参与推理。因为教师看到的是转录文本、真值标签与数据库定义。
生成的拒绝解释本质是文本判别逻辑,不能证明模型利用了韵律或噪声等声学线索。论文在结尾也承认轨迹质量评估、教师选择、更多语料泛化与背景噪声影响都留待未来工作。
未测量的量要明确。论文没有报告推理延迟的实测毫秒数、训练时长的增量、误判率的人工复核与统计显著性检验。零额外开销指的是推理时不生成推理序列,不等于训练成本不变,也不等于端到端延迟一定不变。
总体趋势不等于每组都成立,例如强模型的曲线更平,弱模型的峰更偏中间,混合比的最优点在 0.4 到 0.6 之间浮动。另一个边界是标签体系依赖。候选来自固定数据库定义,真值必须在候选内。
过滤掉不符合格式的样本后才训练。这意味着方法适合标签封闭、定义清晰的任务型对话理解,换到开放域或标签频繁变化的场景,构造与维护数据库定义的成本需要重新评估。
要复现,先准备什么,按什么顺序跑?
复现的第一步是准备数据与标签体系。需要 SLURP 的语音、转录文本与场景动作槽位标注,以及法语子集的对应划分。把意图与槽位定义整理成数据库文件,保证每个样本的真值意图能在候选枚举中被覆盖。
第二步是离线生成轨迹。用教师模型读入转录文本、真值标签与数据库定义,按固定三行格式生成候选、拒绝与标签,校验格式并丢弃不合格样本,论文的合格率约为 94.0%,平均每句 2.5 个意图候选与 1.2 个槽位候选可作为自查参照。
第三步是训练学生模型。按全参数微调准备显存,超参数从学习率 4 乘以 10 的负 5 次方、余弦退火、批量 4、累积 4 步、最多 4 轮、最大新词 384 开始,混合比先取 0.5,再在 0.4 到 0.6 附近小范围验证。训练时同时喂语音与金标准转录。
推理时只喂语音并只用标签指令。需要保留的关键信息条件是教师见过真值,学生训练见过轨迹,学生推理见不到轨迹。如果把教师输入换成不给真值,拒绝解释可能与标签矛盾,效果需要重测。
评价时同时看场景、动作、意图与槽位分数,并在 3 种子上平均,不要只看意图单点。硬件原文为两块 H200,换卡后批量与精度可能要调整,但选点规则应保持按开发集最优,以保证与原文可比。
何时值得试这个方法,一句话如何带走?
当你的任务满足 3 个条件时值得尝试。第一,标签是封闭集合且相邻类别只差范围或粒度。第二,直接微调已到瓶颈,错误集中在少数易混对上。第三,能接受离线构造轨迹的成本,但要求上线不增加推理步数。
这时把拒绝式推理当作训练期正则,比在推理期做思维链更符合延迟约束。反之,如果标签开放、定义经常变化,或者错误主要来自语音识别听错而非语义混淆,那么优先补声学鲁棒性与词表覆盖,而不是加文本判别解释。
还需要补的验证是换教师模型、换噪声条件与做人工质量抽查,确认拒绝解释确实引用了话语中的关键证据,而不是套话。带走的一句话是:训练时让模型说清每个错误候选错在哪里。
推理时只让它直接给答案,相邻意图的边界会在隐空间中被推开,而线上成本保持不变。这正是推理引导微调与纯推理微调的本质区别。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


