英文题目:MoLoRA: Boosting LLM-based End-to-end Speech Translation with Mixture of Low-rank Experts

会议身份:conference:aaai:2026:conference-paper-id:40769

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#LoRA #混合专家模型 #大语言模型 #多语言 #语音翻译

评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.4/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Hao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yaqi Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Nianwen Si:机构信息未能从会议 PDF 纯文本可靠映射
  • XuKui Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenlin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Dan Qu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

端到端语音翻译(End-to-End Speech Translation,E2E-ST)需将英语语音直接生成多语种目标文本,难点在于声学模态对齐与多语言语义竞争同时挤占大语言模型(Large Language Model,LLM)微调容量。该工作先以语音编码器加多粒度表示融合(Multi-Granularity Representation Fusion,MGRF)增强输入,再以低秩适配(Low-Rank Adaptation,LoRA)专家群加稀疏路由实现语言分工,最后经两阶段对齐与翻译微调输出译文。融合模块用句子级全局表示校准帧级局部失真,共享专家建模跨语言共性而路由专家承接语言特性。与单一共享低秩矩阵相比,模块化稀疏激活缓解梯度干扰并保留参数高效性。在MuST-C八个英译多语方向平均以BLEU指标取得32.2分,超越同参数量单LoRA基线约4.3分并小幅超过全量微调约0.3分,在CoVoST-2三个英译方向平均36.3分建立新最优。结论限于英语源TED与朗读域多语言翻译,低资源语言、反向翻译及噪声鲁棒性尚未验证。原文未披露训练、推理或部署成本实测。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么要做端到端?

这篇论文研究的输入是英语语音波形,目标是直接生成德语、法语、西班牙语等目标语言的文本译文,训练时使用语音、源语言转写、目标语言译文三元组,但推理时不要求先输出转写。研究生复述时要先固定这个动作:拿一段 16 比特、16 千赫单通道语音,经过语音编码器和适配器进入大语言模型,再在指令提示下自回归生成译文,损失只对译文部分计算负对数似然。

论文把级联路线作为对照:先用语音识别得到英文文字,再用机器翻译转成目标语言,这种拆分虽然每一步都容易训练,但识别错误会直接进入翻译,且需要维护两套模型和 2 次解码。端到端路线的动机是减少延迟和错误传递,但难点在于语音到另一种语言文字的跨模态映射,以及平行语音翻译数据稀缺,因此论文选择借助已预训练的语音编码器和大语言模型来简化训练流水线。

端到端语音翻译 × 级联系统: 端到端语音翻译负责把输入语音直接生成目标语言文本,中间不输出转写;级联系统负责先做自动语音识别再做机器翻译,分工是把声学到文字和源文到译文拆成两步。两者搭配比较的理由是级联会引入识别错误向翻译的传递,而端到端可以联合优化但需要解决跨模态对齐,组合意义在于用同一数据和主干比较两种路线的误差来源和延迟结构。

需要保留的关键信息是任务方向和评测方式。MuST-C 是基于 TED 演讲的英译多语言数据,包含英译德、法、俄、西、意、罗、葡、荷 8 个方向,用开发集做验证、用测试通用集做测试;CoVoST-2 基于 Common Voice,论文只取英译日、英译中、英译德 3 个方向。翻译质量用区分大小写、去词切分后的 BLEU 并用 sacreBLEU 计算,数值越大越好。论文没有声称代码、模型或数据已公开,本次也没有收到可验证的开源资源状态,因此解读中不写已公开,只能按原文给出的模型结构、训练阶段和超参数来复述方法。

已有路线做到哪里,本文盯住哪个缺口?

在端到端语音翻译内部,已有工作从预训练、多任务学习、对比学习、最优传输、数据增强、知识蒸馏和混合等方面改进表示学习,也有工作用基于连接时序分类的压缩来处理语音长序列的时间对齐。这些方法报告过性能提升,但论文指出它们往往依赖复杂的训练流程和精细的网络设计,向新语言扩展时需要较多适配工作,且模型多从零训练或弱预训练初始化,规模相对较小。

另一条线是把大语言模型作为后端:有用解码器结构直接做语音到文本翻译的尝试,有用多阶段训练改进多语言表现的方案,有用双低秩适配改进参数效率的方案,也有引入思维链、转写辅助输入或压缩蒸馏的方案。论文认为这些工作大多关注训练流水线,而较少处理多语言共用参数高效微调时的任务干扰。

具体缺口是单组低秩适配在多语言下容量不足。论文引用相关分析指出,全参数微调的更新包含大量虽小但非零的奇异值,低秩近似难以完整捕捉,而多语言需要同时建模复杂的跨语言语义和句法差异,共用同一个低维更新空间会导致不同语言的梯度互相干扰,出现参数竞争和负迁移。教学上可以这样理解:低秩是把大改动压缩到小通道里做,单语言时尚可,多语言同时挤一条小通道就会互相覆盖。本文的动作正是把通道拆成多个可选择的低秩专家,再保留共享通道,从而在训练参数量可比的条件下扩大有效容量。

语言增多时单组低秩为什么会掉点?

论文用 MuST-C 英译德方向展示了一个随语言对数量变化的对照:固定评测同一个测试集,只改变训练时混合的语言对数量,观察同一后端在不同干扰强度下的表现。作者报告,随着语言数量增加,标准低秩适配的分数明显下滑,甚至低于只训练单个语言对的设置;而在同样混合 8 个语言对的条件下,全量微调和本文方法明显高于单组低秩。下面的条形图就是这个对照的可视化,横轴是语言对数量,纵轴是 BLEU 分数,最右侧两根柱子分别对应八语言下的全量微调和本文方法。

看图路径: 1. 先看横轴语言对数量从 1 到 8 的变化,再看蓝色 LoRA 柱的升降趋势;2. 对比最右侧绿色全量微调柱与红色 MoLoRA 柱在 8 语言下的高低;3. 核对纵轴是 BLEU 分数且数值越大越好,再读每根柱顶标注的具体分数

原论文 Figure 1:Model performance on the En-De tst-COMMON set with varying numbers of language pairs.

论文图 1。原论文 Figure 1:“Model performance on the En-De tst-COMMON set with varying numbers of language pairs.”。

从像素可见,蓝色低秩柱从 1 个语言对的 27.12 先升到 2 个语言对的 27.66,随后在 4、6、8 个语言对时分别降到 26.53、26.32 和 26.11,呈现先小幅波动后持续下滑的趋势;最右侧绿色全量微调柱标注 29.86,红色本文方法柱标注 30.81,在八语言条件下超过全量微调。论文据此下的判断是语言间干扰导致单组低秩退化,而本文方法缓解了冲突。这个图支持的结论限于英译德测试集和该组训练配置,不能直接推广到所有语言或所有秩设置,后文消融会进一步检验秩与专家数量各自的作用。

低秩适配 × 全量微调: 低秩适配负责冻结大模型主体,只在旁路学习两个小矩阵的乘积来近似权重更新,分工是省显存和训练量;全量微调负责更新全部参数,分工是获得最大表达自由度。搭配理由是前者假设更新具有低内在维度,后者不做该假设,组合意义在于用全量微调的表现上限来检验低秩假设在多语言下是否仍然成立。

整体流水线如何从一段语音走到译文?

沿一个样本走一遍有助于固定结构。输入是一段英语语音波形,同时送入两个冻结或预训练的语音前端:一路是帧级编码器,给出随时间变化的特征序列;另一路是句子级编码器,给出整句的定长语义向量。两路特征先进入多粒度表示融合模块,得到兼顾时间精度和全局语义的语音表示,再经过长度适配器下采样和模态适配器映射到大语言模型的嵌入维度。指令文本经过嵌入层后与语音表示一起进入大语言模型,大语言模型内部的线性层旁挂着混合低秩专家结构,最终自回归生成目标语言译文。训练目标只监督译文,不监督中间的语音特征和指令前缀。

下面是论文给出的总体结构图,左侧是融合模块,中间是主干流水线,右侧是专家结构,阅读时先看中间主路,再看左右两个模块在何处接入。

看图路径: 1. 先沿中间主路从底部语音波形经编码器到适配器再到大语言模型看数据流向;2. 再看左侧融合模块中帧级作为查询、句子级复制后作为键和值的汇合位置;3. 最后看右侧路由如何从输入同时指向多个低秩专家并与共享专家求和

原论文 Figure 2:Overview of the MoLoRA architecture.

论文图 2。原论文 Figure 2:“Overview of the MoLoRA architecture. The left side illustrates the MGRF module for fusing frame-level and sentence- level speech representations; LayerNorm is omitted for…”。

从像素可见,中间从底部语音符号向上分出帧级和句子级两条支路,分别标注常用语音模型名称,经过融合与适配后进入大语言模型,右侧指令经嵌入后也进入大语言模型,顶部输出译文符号;左侧用查询、键、值标注了交叉注意力,句子级向量经过复制后参与融合,并有残差相加;右侧区分了常开的共享专家和按路由选择的路由专家,路由输出标注了取前二的操作。图中雪花与火焰等图标表示冻结与更新的安排,但具体冻结范围以文字部分的训练过程为准,读图时不要把图标当作唯一的冻结证据。原图注还说明为简洁省略了层归一化,复述公式时仍要补回该步骤。

融合模块与专家模块各自算什么?

先讲融合模块的分工。记帧级特征为随时间变化的矩阵,时间步数为序列长度,维度为特征维度;记句子级表示为单个向量,维度可能与帧级不同。原文的动作是:若维度不一致,先用可学习的投影矩阵对齐维度,再把该向量复制与时间步数相同的份数,形成与帧级序列等长的键和值;以帧级特征为查询做交叉注意力,使每 1 帧都能参考全局上下文,得到融合表示。

最后把原始帧级特征与融合表示相加并做层归一化,得到最终输入。公式层面的目标是让时间精度保留下来,同时用全局语义做正则,减轻噪声引起的局部失真。

\[hfusion = Attention(Q\]

上式对应交叉注意力的计算,查询来自帧级,键和值来自复制后的句子级表示,缩放点积后加权求和。研究生实现时要注意键和值在时间维上是重复的同一向量, attention 的重点不是时序对齐,而是把全局信息广播到每 1 帧。

\[hfinal = LayerNorm(hframe + hfusion)\]

上式对应残差与归一化,保留原始帧级的时间保真度,再融入全局语义。论文在消融中报告,去掉句子级表示或把融合退化为简单相加都会掉点,支持该模块不是可有可无的拼接。

再讲专家模块的分工。每个专家本身就是一个低秩模块,由两个小矩阵相乘实现,秩远小于原始矩阵维度。专家分为两类:共享专家对所有输入固定激活,输出直接相加,用于建模跨语言共性;路由专家用可学习的路由矩阵打分,经取前 K 和归一化后稀疏激活,用于建模语言或任务特性。最终输出是共享部分与加权路由部分之和。

\[R(h) = softmax\]

上式对应路由权重的计算,输入先经路由矩阵得到分数,再取前 K 并归一化。论文默认配置是一个共享专家、4 个路由专家、每次激活前二,并用负载均衡损失鼓励专家被均匀使用。实现时要区分固定权重为 1 的共享通路和需要归一化的路由通路,不能把两者混成同一个 softmax。

混合专家 × 低秩适配: 混合专家负责用路由把输入分配给少数专家并加权求和,分工是扩大容量同时保持稀疏计算;低秩适配负责把每个专家实现为低秩旁路,分工是保持每个专家轻量。搭配理由是单组低秩难以同时容纳多语言的差异,多个低秩专家可以分工记忆共性和特性,组合意义是 MoLoRA 用共享专家存跨语言共性、用路由专家存语言特性,从而缓解参数竞争。

帧级表示 × 句子级表示: 帧级表示负责保留随时间变化的细粒度声学信息,分工是提供时间精度;句子级表示负责给出整句的全局语义向量,分工是提供抗局部噪声的正则。搭配理由是帧级特征易受噪声和局部扰动影响,而全局向量更稳定,组合意义是多粒度表示融合让每 1 帧都能参考全局语义,从而减轻局部失真对大语言模型输入的影响。

两阶段训练各更新谁,用什么监督?

论文采用 2 阶段流程,冻结与更新的安排按原文交代复述。第一阶段是模态对齐,目标是缩短语音长度并把语音表示对齐到大语言模型的嵌入空间。为避免语言偏置,该阶段使用自动语音识别数据,指令为转写指令,可训练参数为适配器和融合模块,其余组件冻结,目标是对语音生成源语言转写。第二阶段是下游翻译微调,冻结预训练语音模型和大语言模型主体,训练混合低秩专家、路由以及适配器和融合模块,目标是对语音生成目标语言译文,并加入负载均衡损失,总损失是翻译负对数似然加系数加权的均衡项。

优化器用 AdamW 并用余弦学习率衰减。第一阶段在 LibriSpeech 上训练 6 轮,批量 128,预热比例 0.03,初始学习率 2 乘 10 的负 3 次方,每 1000 步保存 1 次;第二阶段微调 1 轮,学习率 2 乘 10 的负 4 次方,无预热,每 100 步保存 1 次。训练在 16 块 Tesla V100 上用零冗余并行策略完成。论文提到初步研究对超参数选择稳健,但没有给出完整的超参数扫描表,复现时应先按上述默认值跑通,再小范围调整。

推理时只评估每次训练的最后一个检查点,论文观察到平均多个检查点没有带来提升;生成用束宽为 4 的束搜索。负载均衡损失的权重在实现部分给出为 0.001,研究生要把该系数与第二阶段总损失的写法对应起来,不要误用到第一阶段。

数据、模型与指标条件如何固定才可比?

数据方面,MuST-C 用 1.0 版本,取英语到 8 种目标语言的方向,开发集验证、测试通用集测试;CoVoST-2 取英译日、英译中、英译德 3 个方向并混合做多语言训练。语音输入统一为 16 比特、16 千赫单通道波形,译文保留真实大小写并用大语言模型的分词器切分,不做额外预处理。复现时要核对采样率和声道数,因为语音编码器对输入格式敏感,格式不一致会导致长度和特征分布变化。

模型方面,帧级前端考虑用经过连接时序分类微调的大规模语音模型,去掉分类头后取编码器输出,维度为 1024;句子级用支持多语言多模态定长句嵌入的模型。适配器包含长度适配器和模态适配器,前者是两层 1 维卷积做时间下采样,核、步长、填充和隐维度按原文设置,后者是映射到大语言模型嵌入维度的线性层,对应所用模型的 4096 维。低秩部分作用于除输入嵌入和输出头之外的全部线性层,单专家秩为 64,缩放系数为 128;混合结构用 1 个共享专家、4 个路由专家、前 2 路由。

比较公平性的关键是参数量:论文说明单 LoRA 基线用秩 320 跨全部语言对共用,而本文方法每个专家秩 64,通过多个专家使可训练参数总量可比,约为主模型的百分之 7,全量微调则约为 70 亿可训练参数。指标方面统一用 sacreBLEU 的区分大小写、去词切分分数,数值越大越好,聚合时取多语言方向的平均值。论文未报告显著性检验的完整细节和除 BLEU 外的其他指标,解读时不要把 BLEU 平均值当作人工评价。

主结果在什么条件下超过了哪些可运行基线?

主结果要回答 3 个问题:测什么、与谁比、条件是否一致。在 MuST-C 上,测的是 8 个方向混合训练后在各自测试集上的 BLEU 及平均值,对手包括传统端到端方法和基于大语言模型的方法,以及作者自己复现的全量微调和单 LoRA 基线;在 CoVoST-2 上,测的是 3 个方向混合训练后的 BLEU 及平均值,对手包括通用语音大模型和语音翻译专用方法。公平条件是同一混合训练设置、同一评测脚本和同一指标方向,参数量方面单 LoRA 与本文方法总量可比。

下面的原表是 CoVoST-2 部分的宽表呈现,包含多个基线和本文方法在 3 个方向及平均值上的分数,阅读时先确认表头是英译德、日、中及平均,再比较可运行基线与本文方法的相对位置。

Models En-De En-FrEn-Ru En→X DeJaZhAvg
Cascaded SALMONN (Tang et al. 2023)18.622.733.124.8
Qwen2-Audio (Chu et al. 2024)29.928.645.234.5
End-to-end MoLoRA30.131.347.536.3

表后解释需要同时给出收益与代价。从原表像素可见,本文方法在三列上分别取得 30.1、31.3 和 47.5,平均 36.3,高于同表中的通用与专用基线。论文强调该结果没有使用转写信息,支持模型可以直接从原始音频利用语言特征,但这不等于证明转写辅助永远无用,因为部分对手可能用了不同的数据规模或辅助信号。未胜出项也要说明:在 CoVoST-2 的英译中单列上,同期的思维链方法报告了更高的单列分数,说明平均最优不等于每列都最优;MuST-C 部分个别语言的领先幅度很小,平均值的提升不能推广为每个语言都显著提升。

专家与任务的对应关系由下面的分布图提供有限解释。论文分析第 0 层、第 15 层和第 31 层的路由分配,发现浅层分配接近随机,深层出现分化,罗曼语系的分配模式相近。

看图路径: 1. 先按第 0 层、第 15 层、第 31 层三块面板自上而下比较颜色分布是否一致;2. 再在第 31 层比较德语与荷兰语的蓝色占比,以及法语与西班牙语等罗曼语的橙色占比;3. 核对横轴是八个目标语言、纵轴是分配概率,确认深层是否出现语言分化

原论文 Figure 3:Proportion of tokens assigned to each expert in the eight language pairs of the MuST-C dataset at…

论文图 3。原论文 Figure 3:“Proportion of tokens assigned to each expert in the eight language pairs of the MuST-C dataset at layers 0, 15, and 31.”。

从像素可见,顶部第 0 层 8 个语言的四色堆叠高度几乎相同,中部第 15 层开始出现蓝色块的差异,底部第 31 层差异明显:德语和荷兰语的蓝色专家占比显著高于其他语言,而法语、西班牙语、意大利语、葡萄牙语和罗马尼亚语的橙色专家占主导,俄语的分布也更接近后者。论文据此认为深层专家捕捉了语言特性,支持路由缓解干扰的解释,但这属于事后观察而非因果证明,仍待验证的是若强制打乱路由或冻结路由,性能是否必然下降。

MuST-C 八语言平均值如何核对,级联对照说明什么?

MuST-C 的比较问题是:在混合八语言训练下,本文方法是否同时超过可比参数量的单 LoRA 和全量微调,以及是否超过作者自建的级联系统。公平条件是同一八语言混合训练、同一测试集和同一 BLEU 计算,指标方向是越大越好。下面的整理表只使用正文连续原句中逐字出现的数字,不引入原表矩阵之外的数值,列数满足宽表要求,用于核对平均值和差值口径。

条件指标单 LoRA 基线全量微调本方法
MuST-C 八语言混合训练平均 BLEU27.931.932.2
MuST-C 八语言混合训练相对单 LoRA 提升0未报告4.3
CoVoST-2 三语言混合训练平均 BLEU未报告未报告36.3

表后解释要把数字与原文表述对齐。论文报告本文方法在 MuST-C 八方向平均 32.2,从 27.9 到 32.2 超过单 LoRA 基线 4.3,平均超过全量微调 0.3,并超过此前最优约 0.8;论文同时报告在 CoVoST-2 三方向平均 36.3。支持的判断是:在给定配置下,增加专家数量带来的容量分配比单纯增大秩更有效,且混合结构在可比参数量下达到或超过全量微调的平均表现。限制是平均值掩盖了单语言差异,个别语言的领先可能很小,且全量微调的可训练参数约为 70 亿,本文方法约为其百分之 7,训练步数和硬件预算并不完全对等,因此不能把该结果读成任何预算下专家结构都优于全量微调。

级联对照的动作值得单独复述。作者用翻译数据中的识别部分微调语音编码器,用机器翻译部分微调大语言模型,再把两部分串成 2 阶段级联,并与之前报告的级联方法一起比较。论文报告在英译德、法、俄 3 个测试集上,端到端的本文方法高于自建级联,支持端到端避免级间错误传递的解释。但该对照的公平性取决于级联所用的数据划分和微调预算是否与端到端一致,原文没有给出级联的完整超参数表,因此只能说在作者的实现条件下端到端占优,不能推广为所有级联都不如端到端。

拿掉哪个部件会掉多少,容量应该加在哪里?

消融要回答部件必要性和容量扩展方式两个问题。论文在 MuST-C 英译德方向、混合八语言训练下做消融,完整方法为 30.8。去掉句子级表示降到 30.4,把多粒度融合退化为简单相加降到 30.5,去掉共享专家降到 30.6,去掉负载均衡损失也降到 30.6,且论文标注优势在统计上显著。下面的容量实验图进一步区分两种扩容:增大秩与增加路由专家数量,左图固定单专家对应传统低秩,右图固定一个共享专家并改变路由专家数。

看图路径: 1. 先确认左图横轴是秩从 16 到 512、右图横轴是路由专家数量;2. 再观察左图曲线随秩增大是否平缓、右图性能是否先升后趋平或下降;3. 结合图注确认左图单专家对应传统低秩微调、右图固定一个共享专家

原论文 Figure 4:BLEU score on the En→De direction as a function of rank and number of routed experts, under…

论文图 4。原论文 Figure 4:“BLEU score on the En→De direction as a function of rank and number of routed experts, under multilingual training on all eight language pairs of the MuST-C dataset.”。

从本次收到的像素看,该图分辨率较低,只能辨认横轴分别为秩和专家数量、纵轴为 BLEU 分数,左图曲线随秩增大缓慢上扬,右图需要结合正文描述来理解。论文的文字结论是:增大秩带来的增益很小,因为全参数更新的奇异值结构难以用低秩完整近似,多语言下单矩阵更难建模跨语言模式;增加路由专家数量带来更明显的提升,因为不同专家可以分工捕捉不同输入特征,同时稀疏激活保持计算效率,但超过 4 个专家后会出现过细划分导致的过拟合。

像素不能精确辨认每个点的数值,因此解读中不硬写各秩的具体分数,只保留趋势判断和最优阈值的原文报告。未评测的边界是该阈值是否随语言数量、数据量或主干规模变化,原文没有给出跨规模的扫描,复现时应先固定 4 个路由专家再小范围增减。

代价方面,专家结构引入了路由矩阵、取前 K 选择和均衡损失,训练时需要维护负载统计,推理时虽稀疏但仍有路由开销。论文未测量延迟和显存的完整曲线,因此不能承诺推理更快,只能说训练参数量与单 LoRA 可比条件下的平均翻译质量更高。

哪些结论有边界,哪些量没有被测量?

先划清直接报告、有限解释和未验证推测。直接报告的是在给定数据划分、主干、秩和专家配置下的 BLEU 平均值和消融差值;有限解释的是深层路由分布与语言亲缘的对应,以及共享专家存共性、路由专家存特性的分工叙述,这些有分布图支持但属于事后关联;未验证推测是把路由分化直接当作性能提升的因果,以及把平均提升推广到每个语言和更大规模。相关性不是因果,分布相似的罗曼语共用专家可能源于数据量、句长或声学条件的相似,而不一定是句法相似,原文没有做干预实验来分离这些因素。

未测量的量要逐项点名。论文没有报告误判率、解码延迟、吞吐、显存峰值和训练总耗时的完整对比,也没有报告人工评价和多指标一致性,因此不能声称这些量得到改善。训练资源只给出显卡数量和并行策略,没有给出总步数对应的 wall-clock 时间;推理开销只提到束宽为 4,没有给出不同束宽或批量下的延迟曲线。总体趋势不等于每组都成立:平均超过全量微调 0.3 并不意味着 8 个方向每个都超过,单列上也存在对手更高的情况。

此外,公式和实现细节中未交代路由的初始化、均衡损失的预热时机和梯度是否截断,复现时若遇到专家坍缩,应先检查路由温度、取前 K 的实现和均衡系数的量级,而不是直接增大秩。

要复现先固定什么,第一步跑通什么?

复现先固定信息条件。数据用 MuST-C1.0 的 8 个英译方向和 CoVoST-2 的 3 个英译方向,语音统一为 16 比特、16 千赫单通道,译文保留大小写并用所用大语言模型的分词器切分;评测固定为 sacreBLEU 的区分大小写、去词切分分数,束宽为 4,只取最后检查点。模型固定为帧级语音编码器输出维度 1024、句子级嵌入、两层 1 维卷积的长度适配器和映射到 4096 维的模态适配器,低秩作用于除嵌入和输出头外的线性层。训练固定 2 个阶段:先用识别数据只训练适配器和融合模块,再用翻译数据训练专家、路由、适配器和融合模块,同时冻结语音模型和大语言模型主体,均衡系数取 0.001。

第一步建议跑通单语言对的低秩基线,再切到八语言混合,观察英译德是否出现随语言增多而下滑的现象,以此确认干扰基线存在;第二步再接入一个共享专家和 4 个路由专家、每次激活前二,观察平均分是否回升。关键超参数按原文保留:秩 64、缩放 128、共享 1、路由 4、前二、均衡 0.001,第一阶段学习率 2 乘 10 的负 3 次方训练 6 轮,第二阶段学习率 2 乘 10 的负 4 次方训练 1 轮。

若显存不足,不要自行把秩 320 的单 LoRA 基线改成小秩来比较,因为这会破坏参数量可比的前提,应优先用梯度累积或减小批量来保持配置一致。关于可用性,原文未提供可验证的代码、权重或数据链接,本次也未收到可达性验证,因此复现应按论文文字从零搭建,不应假设存在官方可下载产物。

何时值得尝试这种结构,收束时记住什么?

当任务同时满足 3 个条件时值得优先尝试:后端是大语言模型且希望用参数高效微调控制训练成本,训练是多语言或多任务混合且已观察到单组低秩随任务增多而下滑,输入语音存在局部噪声且有可用的整句语义向量可以做正则。此时把低秩拆成共享与路由两类专家的动作有明确分工:共享通路保留跨任务共性,路由通路用稀疏选择隔离特性,融合模块则在进入大语言模型之前先修正帧级失真。论文在 2 个数据集上的平均值支持该组合在可比参数量下优于单组低秩,并在平均意义上达到全量微调的水平。

收束时记住可核对的要点:MuST-C 八语言平均 32.2、相对单 LoRA 提升 4.3、相对全量微调提升 0.3,CoVoST-2 三语言平均 36.3;消融中句子级表示、融合策略、共享专家和均衡损失各自贡献 0.2 到 0.4;容量上增加专家比增大秩更有效,最优路由专家数报告为 4 个。还需补的验证是跨主干规模、跨语言数量和跨数据量的稳定性,以及路由干预实验和延迟显存的完整测量。常见误解是把专家数量等同于语言数量,原文的路由是按输入动态选择的,罗曼语可以共用同一专家,德语与荷兰语也可以偏向另一专家,因此不要为每个语言硬分配一个专家,也不要把深层分布图当作路由必然按语系划分的证明。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总