英文题目:Closing the Modality Reasoning Gap for Speech Large Language Models

会议身份:conference:acl:2026:conference-paper-id:2026.acl-long.857

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#强化学习 #语音大模型 #后训练 #语音 #音频问答

评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Chaoren Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Heng Lu:机构信息未能从会议 PDF 纯文本可靠映射
  • Xueyao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shujie Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yan Lu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jinyu Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhizheng Wu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音大语言模型以语音或文本问句为输入并生成文本回答,难点在于跨层表征漂移与长链行为偏离在语音条件下逐层放大并导致 compounding 错误。先为同一问题并行采样语音与文本轨迹,以任务准确率与格式奖励评估各轨迹正确性,输出带正确性标记的组内轨迹集合,为语音纠偏提供组内参考。再将上一步选出的同组正确文本轨迹作为参照,输入其与语音轨迹的跨层隐状态,随机抽取并计算平均余弦相似度作为表征奖励,同时计算语义一致性作为行为奖励,输出稠密对齐信号,将文本模态作为稳定参照。最后将前两步得到的稠密对齐奖励与基础奖励相加作为总奖励,经模态内分组归一化后以DAPO损失更新语音分支,同时保持文本分支持续进化以避免单边退化。与冻结适配器或离线词元蒸馏强制复述静态目标不同,该在线非对称对齐允许语音自主探索并以稠密相似度动态纠偏,具有避免复合错误的实际意义。在MMSU与OBQA基准下,TARS的平均音频准确率为79.57%,高于标准GRPO基线的73.17%。该结论的适用边界受限于单轮英文选择题与合成语音训练,尚未验证多轮对话与韵律情感等非文本线索。训练成本在4×A100或8×H200硬件上Qwen2.5-Omni约55小时、Phi-4-MM约35小时。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

这篇解读的输入是论文正文证据与 3 张官方原图像素,目标是让刚进入语音与音频方向的研究生能复述方法与实验条件。需要保留的信息包括任务定义、两路奖励的计算对象、非对称优化安排、训练数据构造方式、评估基准与解码设置,以及主结果与消融条件。

输出是 1 篇按学习依赖展开的技术讲解,不做营销式判断,不补充证据之外的数值。读者可以先建立一个样本级心智模型:同一个选择题分别以文本串和合成语音进入同一个语音大模型,模型都要先想后答。文本路径通常更准,语音路径更容易在长链条中走偏。

论文要解决的不是语音识别字错,而是识别之后推理过程的漂移与偏离。后续各节先讲相关路线为何不够,再讲全景如何组织两路对齐,然后讲每个奖励如何计算。最后讲实验如何保证公平、结果支持什么,还有哪些边界没有测。

术语速查:第一次出现先说白话

语音大模型指能直接听语音并用文字回答的端到端模型,英文为 Speech LLM。模态推理鸿沟指语音问比文本问推理更差的现象。模态恢复率是语音得分除以基座文本得分的百分比。

表示对齐是让各层隐状态均值向量更像正确文本路径,英文为 representation alignment。行为对齐是用嵌入模型判断最终答案语义是否一致,英文为 behavior alignment。非对称奖励是语音吃三项、文本只吃基础项的不对称优化。

模态内归一是各自减本模态均值再更新。组相对策略优化是按组比较算优势的强化学习算法,英文为 Group Relative Policy Optimization。在策略是拿当前模型自己采样的数据学习。固定这些简称后,后文不再反复解释英文全称。

同输入同目标的已有路线为什么还留着推理鸿沟?

语音大模型的主流结构是 3 段式:预训练语音编码器提取声学特征,轻量投影器把特征映射到文本嵌入空间,解码端的大语言模型沿用文本预训练的推理能力。开放权重与闭源系统都在这个骨架上扩展交互与感知,但论文指出统一结构并没有消除复杂推理上的差距。

已有缩小差距的努力可以按同输入同目标来对照。第一类是输入端融合,冻结大模型只训练适配器,做法省参数且能保留文本能力。第二类是输出端监督,用提示切换、知识蒸馏或数据选择让语音输出模仿文本输出,做法直接约束终点。第 3 类是通用后训练与稀疏强化学习,如监督微调、偏好优化或只用格式与正确性奖励的推理强化学习。

输入端融合 × 输出端监督: 输入端融合负责把语音表征投到文本嵌入空间,冻结大模型只训练适配器以减少输入差异;输出端监督负责让语音生成模仿文本生成,如提示切换与跨模态知识蒸馏。搭配讨论的原因是前者只做浅层投影无法阻止层间漂移放大,后者用离线词元级硬监督会遭遇分布不一致与暴露偏置,组合审视后论文才提出既管层间表示又管语义行为的在线轨迹对齐。

这组对照的教学意义是明确分工边界:输入投影管入口,输出模仿管终点,而中间多层推理路径本身需要在线引导。论文因此选择不改结构,用强化学习同时约束内部层表示与外部语义行为。

模态推理鸿沟如何定义,恢复率的分母是什么?

论文把问题形式化为语音大模型在同一问题下接受语音表示或文本表示,生成文本回答。尽管经过大规模语音文本对齐训练,语音输入的推理表现仍落后于文本。关键不是单次回答对错,而是分布层面的系统性落后。

为了可比较,论文定义模态恢复率,用当前模型语音生成的推理得分均值,除以基座模型文本生成的推理得分均值,再乘以 100%。分母必须注意:主结果表下划线分数是计算恢复率时用的分母,对应基座文本表现,而不是对齐后文本表现。

模态推理鸿沟 × 模态恢复率: 模态推理鸿沟负责描述现象:同一道题用语音问比用文本问推理准确率系统性更低;模态恢复率负责度量程度:用当前模型语音得分均值除以基座模型文本得分均值再乘以 100%,目标是达到或超过 100%。二者搭配的原因是只有现象无法判断是否闭合,只有标尺无法定位漂移与偏离,组合后论文把优化目标明确为提升恢复率来闭合鸿沟。

对初学者而言,复述时要说清三件事:分子是语音,分母是基座文本,指标方向是越高越好。该指标不直接度量语音识别字错率,字错率在论文中另作诊断指标,用来排除识别变好带来的混淆。

为什么只讲推理任务,不讲纯转写?

论文实际研究的任务是语音条件下的多选推理问答,不是纯语音转写。转写只要求把声音变成文字,推理还要求在文字基础上做知识调用、计算与逻辑排除。证据中用词错率作诊断而非主目标,主目标是选择题准确率与恢复率。

教学例子明确标为例子:比如一道利息计算题,听错数字属于转写问题,听对数字却算错利率与天数换算属于推理问题,论文要修的是后者。相关工作中级联系统把转写与推理拆开,先识别再用文本模型推理,这能隔离字错影响。

端到端系统直接听语音推理,可能避免级联的字错传播,但也更容易出现跨模态漂移。论文选择端到端路线并证明其可超过对应级联,但这不意味着所有语音任务都应端到端。复述方法时必须把指标对象说对:提升的是推理准确率,不是字错率。

TARS 全景:一个样本如何走完输入到更新?

TARS 的全称是面向语音推理的轨迹对齐,核心是用文本轨迹作为移动参考来引导语音轨迹。先沿一个样本走完全程:同一道题准备文本与音频两种提示,送入带 LoRA 的语音大模型。模型对每种模态各采样多条完成,每条完成包含思考过程与答案格式。

文本分支用基础奖励优化并持续变强,同时为语音分支提供参考。语音分支用总奖励优化,总奖励等于基础奖励加表示对齐奖励加行为对齐奖励。随后按模态分别计算优势并用 GRPO 类目标更新参数,音频编码器与投影器冻结,只更新 LoRA 部分。

这种安排的理由是语音推理比文本更难,若全组统一归一,语音会恒为负优势而学不动。分模态归一让语音与自身基线比,保留学习信号。即使一组语音样本任务准确率全零,对齐信号仍可能非零,因为相似度是连续值。

以下导读帮助建立整体因果链,请先看提示分组、采样分组、奖励分组与优势分组的 4 段式布局,再看跨模态连线从哪里引用参考,最后看更新入口在哪里收束。

看图路径: 1. 从左侧同一问题的文本与音频提示出发,沿箭头看到进入同一语音大模型加 LoRA 的主路径;2. 对比上排文本采样与下排语音采样的绿色正确与红色错误方块数量与分组;3. 找到中间奖励列 Rrep 与 Rbeh 的跨模态连线,确认语音如何引用文本参考计算对齐分;4. 再看右侧优势列正负值如何按模态分别归一后送入 GRPO 更新

原论文 Figure 1:Overview of our framework.

论文图 1。原论文 Figure 1:“Overview of our framework. We introduce a reinforcement learning approach for trajectory alignment by optimizing an asymmetric reward function composed of representation…”。

从图中可见左侧同一问题的文本与音频提示分别进入模型,中间采样出上下两组完成,右侧奖励列把表示、行为与准确率相加。绿色表示正确、红色表示错误,语音侧正确样本同时拿到较高的表示分、行为分与准确分。复述时要强调非对称性:文本只吃基础奖励,语音吃三项之和,文本既参训又当老师。

两个对齐信号各自算什么,为何要一起用?

表示对齐奖励管内部几何相似度。做法是对生成推理词元的隐状态做均值池化,排除提示词元,得到每层固定维度向量。对每条语音完成,从同组中随机抽一条正确文本完成作参考,计算所有层余弦相似度的平均值。

若组内没有正确文本完成,则该项置零。论文报告这种回退较少见,约占 5.9 到 10.7 区间,因此多数分组仍有有效梯度。该信号是稠密的,因为即使答案错,隐状态相似度仍连续可导向文本路径。

行为对齐奖励管外部语义一致性。用外部嵌入模型分别编码语音生成结果与文本参考结果,再算余弦相似度。它允许推理路径措辞不同,只要最终语义一致即可学到正信号。基础奖励沿用准确率加格式奖励,准确率由抽取器判断选项是否命中真值。

表示对齐 × 行为对齐: 表示对齐负责管内部:计算语音轨迹与同组正确文本轨迹在各层隐状态均值向量间的余弦相似度均值,抑制层间表征漂移;行为对齐负责管外部:用外部嵌入模型比较语音生成结果与文本参考结果的语义一致性,约束最终输出不偏离正确推理行为。搭配理由是内部相似提供稠密但粗粒度的路径引导,外部一致提供稀疏但语义明确的终点约束,组合后语音既学路径又学终点,形成互补的轨迹对齐。

复述时要区分原始目标与实现:目标是让语音内部路径与外部行为都靠近文本,但实现上内部用层均值余弦,外部用嵌入余弦。未报告梯度是否截断嵌入模型与参考分支,解读时不应猜测,只说监督来源是当前策略的文本采样。

参考从哪里来,失败时梯度会消失吗?

监督来源是同组内当前策略生成的正确文本完成,不是静态人工标注,也不是冻结教师模型。实现细节是每条语音随机配一条同组正确文本算层相似度与语义相似度。若组内无正确文本,则对应奖励置零。

这种设计有两个含义:一是老师随训练变强,语音目标水涨船高。二是早期文本也不完美时仍可能有部分分组回退为零,但论文报告回退比例低,因此整体梯度不断。有人会问语音全错时是否无学习信号,答案是否定的。

因为表示与行为是连续相似度,即使准确率为零仍可比较谁更接近文本路径,这正是稠密奖励的价值。另一个常见误解是以为文本分支不训练,实际上文本分支参与梯度更新并持续改进。

非对称奖励设计 × 模态内归一化: 非对称奖励设计负责分工:语音分支拿基础奖励加表示奖励加行为奖励,文本分支只拿基础奖励并作为移动参考;模态内归一化负责公平比较:文本与语音各自减去本模态组内均值得到优势,避免语音因基础分天然偏低而恒为负优势。搭配原因是前者让语音有追赶目标且文本持续变强,后者保证追赶信号不被组间均值压制,组合后实现语音与文本协同进化的在线优化。

重置时机方面,参考是每组在线采样即时产生,不存在跨轮缓存教师答案的机制。未报告的是嵌入模型是否冻结与参考分支是否截断梯度,复述时应标为待验证,不从模型名推定实现。

训练如何采样、分组与更新,成本是多少?

训练数据以 UnifiedQA 训练集为主,配对语音由两种高质量语音合成系统生成,参考说话人采自英文子集。再用中等规模识别模型以 10% 词错率阈值过滤,最终得到 9953 条样本,约 203 小时。每个提示组大小为 8,语音与文本各占一半。

采样用可探索的随机解码,评估用贪心解码并用抽取器降格式噪声。优化用 DAPO 损失估计器,配合模态内优势归一。实现上通过两个公开仓库分别训练两种基座,冻结音频编码器与投影器,只对全部线性层加秩为 8 的 LoRA。

在策略探索 × 暴露偏置: 在策略探索负责做法:用当前策略同时采样语音与文本多条完成,从自身采样中学习纠偏;暴露偏置负责解释风险:离线强制模仿文本词元时,一个词错就会进入训练未见状态并连锁偏离。搭配理由是只有认识到静态目标不可达且会放大误差,才需要用自身采样暴露错误并用对齐奖励拉回,组合后论文用在线强化学习维持长链推理稳定性。

以下训练曲线导读用于理解自由生成下的改进是否同步发生,请先看横轴步数范围与 3 条线的总体走向,再看抖动带与平滑线的关系,避免把单步噪声当作退化。

看图路径: 1. 确认横轴为训练步数 0 到 2000 以上,三条平滑曲线总体向上;2. 区分橙色高位、绿色中位、蓝色低位三条线的起点与斜率差异;3. 观察浅色原始抖动带与深色平滑线的关系,不把单步毛刺当趋势反转

原论文 Figure 5:Reward curves during training.

论文图 5。原论文 Figure 5:“Reward curves during training.”。

从像素可见 3 条平滑曲线随训练步数总体上行,橙色高位线起点已高且缓慢抬升,绿色中位与蓝色低位线爬升更明显。论文文字把三者归因为基础奖励、表示奖励与行为奖励同步提升,支持语音与文本在表示相似度上同时改善。成本方面,与标准 GRPO 直接基线 27.5 小时相比,对齐奖励只带来 4.4% 额外开销,总计 28.7 小时。

测什么、与谁比、条件是否一致?

评估聚焦口语选择题推理:MMSU 共 3074 例考多域知识与推理,OBQA 共 455 例考小学科学与常识。报告语音与文本两种输入的准确率,并用恢复率衡量语音相对基座文本的恢复程度。另用 LibriSpeech 干净与难测集的词错率诊断识别能力是否变化。

基线分 3 类并共享基座、数据与 LoRA 配置以保证公平。第一类是级联与专有系统,用大语音识别模型转写后再接文本骨干,以及音频专有模型。第二类是跨模态对齐方法,包括数据选择蒸馏、自我生成对齐、冻结骨干适配器调优与知识蒸馏。

第 3 类是通用后训练,包括监督微调、偏好优化与只用基础奖励的标准 GRPO。解码上训练用采样探索,评测用贪心。指标方向是准确率与恢复率越高越好,词错率越低越好。论文还安排泛化检查:用真实口音口语问答与韵律感知基准验证是否保留副语言特征。

主结果支持什么,代价与反例是什么?

比较问题是:在相同基座与数据下,非对称轨迹对齐能否同时提升语音准确率与恢复率,且不牺牲文本。公平条件是共享初始检查点与 LoRA 配置,指标方向是准确率与恢复率越高越好,词错率越低越好。下表整理主结果中的关键行,数值保留原文精度。阅读时先看语音列,再看恢复率列,最后看文本列是否同步提升。

条件MMSU 语音OBQA 语音平均语音恢复率(%)平均文本解释
Qwen2.5-Omni 基线61.5181.0971.3091.7676.17推理鸿沟明显
TARS(Qwen2.5-Omni)67.9685.7176.8498.8978.56语音文本同升
Phi-4-MM 基线54.8171.6563.2379.5978.39语音落后更多
TARS(Phi-4-MM)70.1489.4579.80100.4583.82超过基座文本

表后解释需要同时给出收益与代价。收益是语音平均准确率明显抬升,Qwen 侧从 71.30 到 76.84,Phi 侧从 63.23 到 79.80。恢复率分别到 98.89 与 100.45,后者超过 100 意味着语音已追上基座文本。文本也没有被牺牲,反而同步提升到 78.56 与 83.82。代价是在线强化学习时间与实现复杂度,且残差仍存在:对齐后文本仍略高于语音。

未胜出项也要说明:冻结骨干的对齐方法恢复率接近 99.83,说明在某些基座上差距不大。词错率维持在 4.16 到 4.24 区间,支持收益来自推理对齐而非识别变好。

哪个奖励在起作用,层深与基座如何改变结论?

消融问题是:表示与行为信号是否互补,是否依赖层位置与基座优化程度。条件是同一 Phi 骨干、同一抽取器与同一基础奖励起点,逐项加入表示奖励、行为奖励与两者组合。下表给出平均语音、恢复率与词错率,行为项接近完全恢复,两者组合最优。

条件平均语音恢复率(%)词错率(%)平均文本机制解释
标准 GRPO 只用基础奖励73.1792.214.2481.00稀疏奖励不够
加表示对齐75.8395.564.1882.22层相似度拉升
加行为对齐78.7399.224.2083.59语义约束终点
TARS 两者组合79.57100.284.2083.56互补最优

表后解释要讲机制与边界。表示项把恢复率从 92.21 拉到 95.56,支持层相似度提供稠密信号。行为项进一步到 99.22,支持语义一致性约束终点。组合到 100.28,支持互补而非重复。词错率几乎不动,再次排除识别解释。未胜出项是标准 GRPO 不如偏好优化,说明稀疏结果奖励在语音难题下不够。

以下层相似度导读用于验证内部漂移是否真被缩小,请先按图例确认 3 条线的奖励组合,再比较深层分离幅度,最后结合置信带判断稳健性。

看图路径: 1. 先确认横轴为层深 1 到 32,纵轴为余弦相似度 0.92 到 1.00,左右分别为 MMSU 与 OBQA 面板;2. 比较蓝色基线、橙色加表示对齐、绿色联合对齐三条曲线的上下位置关系;3. 观察曲线随层深下降的大趋势与 20 层附近平台或小幅回升的形态

原论文 Figure 2:Layer-wise Representation Alignment Analysis. Shaded areas indicate 95% confidence intervals.

论文图 2。原论文 Figure 2:“Layer-wise Representation Alignment Analysis. Shaded areas indicate 95% confidence intervals.”。

从像素可见左右两面板中绿色联合曲线全程最高,橙色居中,蓝色基线最低。相似度随层深从约 0.99 降到 0.93 附近,但方法间相对差距在中后层最明显。层分组实验还显示中间层最关键,浅层与末层单独加约束效果较弱。基座相关性是重要边界:在高度优化的 Qwen 上再加层级硬约束会出现过正则,此时只加行为奖励反而最优。

还有哪些没有测到,不该承诺什么?

论文明确报告三项局限。第一,只在约 7B 规模验证,未说明更小或更大模型的奖励行为是否一致。第二,只聚焦单轮推理,多轮交互与对话驱动的语音推理可能引入新动态,当前公式没有覆盖。第三,对齐仍依赖纯文本参考,可能无法充分容纳情感、韵律与意图等无直接文本对应的副语言线索。

缺失证据不是技术错误,但解读必须收敛承诺:未测量每步延迟与误判率时,不承诺延迟改善。总体上行不等于每组每步都上行。恢复率超过 100 不等于语音理解全面超越文本,它只在所测推理准确率口径下成立。错误分析也给出具体边界:高分域多为计算与知识修正,低分域仍有语义陷阱与时间比较错误。

泛化表显示真实口语与韵律任务上对齐未退化,但样本与指标有限,只能说支持保留副语言特征。计算效率测量显示额外开销小,但那是特定硬件与组大小下的测量,不应直接换算到其他集群。训练时间从 27.5 小时到 28.7 小时的变化支持主要代价是时间小幅增加,而非显存翻倍。

复现先做什么,需要哪些数据与代码条件?

复现应先锁定信息条件再跑训练。数据侧需要 UnifiedQA 训练划分,用两种合成语音系统生成配对音频并以 10% 词错率过滤,保留约 9953 条。基座侧需要 Qwen2.5-Omni 官方检查点与内部 Phi 多模态检查点,论文内部 Phi 按官方结构扩到 7B。

外部复现者若无该权重,应先用 Qwen 分支复现。训练侧通过公开仓库执行,Qwen 分支用 ms-swift,Phi 分支用 HuggingFace TRL,两个仓库在本次核验中状态码为 200、可用性为可用,可写当前可用。需要冻结音频编码器与投影器,只训练全部线性层的 LoRA。

评估侧用 VoiceBench 的 MMSU 与 OBQA 划分,贪心解码加抽取器提取选项,报告语音、文本与恢复率。同时报告 LibriSpeech 词错率以排除识别混淆。关键超参数包括表示与行为权重均为 1.0、基础格式权重 0.5、最大补全长度 1024。缺项要明确:内部 Phi 权重与部分合成语音说话人采样的随机种子未完全公开。

何时值得尝试,一句话如何带走?

当语音识别已可用但语音问答推理明显弱于文本,且错误集中在长链条中途走偏而非听错词时,值得尝试这种轨迹对齐。做法是保留现有编码器与投影器不动,用当前策略的正确文本采样作移动老师,给语音加层均值余弦与嵌入语义余弦两项稠密奖励。

并按模态分别归一优势。若基座已高度优化,应先只加行为奖励验证,避免层级硬约束带来过正则。若基座欠优化,再加入表示奖励并用全层平均。还需补的验证是更大规模模型、多轮对话与真实情感韵律场景。

以及报告延迟与误判率后再谈部署收益。带走的一句话是:用文本推理轨迹在线牵引语音轨迹,内部相似保路径、外部语义保终点,才能在不牺牲文本的前提下把语音推理拉回同一条推理线。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 4 页

区域 1 · 查看论文原页

另有 27 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总