📄 MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

8.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1/1.5

🔥 8.2/10 | 前25% | #多模态模型 | arxiv

👥 作者与机构

  • 第一作者:Yuxuan Lou(新加坡国立大学计算学院)
  • 第二作者(共同一作):Kai Yang(上海交通大学计算机科学与工程系)
  • 通讯作者:Yang You(新加坡国立大学计算学院,youy@comp.nus.edu.sg)

💡 毒舌点评

本文提出的模态感知路由MoE架构在语音-文本多模态建模上表现出色,工程实现扎实,全开源承诺值得肯定。但方法层面缺乏深度理论支撑(50%硬划分靠直觉),且实验对比存在初始化不公平的嫌疑,使得其SOTA宣称需要打折。消融实验虽有控制变量,但对共享专家的分析仅停留在“有/无”层面,未深入其内部机理,整体贡献更偏向于一次成功的工程整合而非方法论突破。

📌 核心摘要

  1. 论文旨在解决语音和文本两种异构模态在统一大模型中用相同参数处理时导致的表征干扰问题,即忽略了不同模态固有的统计差异。
  2. 核心方法是提出模态感知的混合专家架构(MAMoE),将MoE中的专家显式划分为文本专家组、音频专家组和跨模态共享专家组,并利用模态感知路由器根据token来源(文本/音频)强制将其导向对应专家组。
  3. 与已有方法相比,MAMoE首次在语音-文本MoE中引入模态感知路由,并显式设计了独立于路由、处理所有token的共享专家来促进跨模态信息交互与防止灾难性遗忘。
  4. 主要实验结果:在VoxPopuli-en ASR(6.2 WER)和TTS(10.1 WER)上达到SOTA;音频语言建模平均准确率71.94(SOTA);在多个SQA任务上取得最佳或极具竞争力的结果。控制实验证明MoST-style upcycling显著优于传统MoE upcycling。
  5. 实际意义:验证了模态感知稀疏激活在语音-文本多模态模型中的有效性,并提供了一个仅使用开源数据即可达到顶尖性能的高效训练pipeline,对降低语音大模型研究门槛有重要参考价值。
  6. 主要局限性:50%专家硬划分策略缺乏理论依据,仅为工程直觉;主要实验基于DeepSeek-V2 Lite初始化,与使用不同基座模型的baseline对比不公平;模型规模(约16B)相对较小,其性能优势能否在更大规模上保持未知。

🔗 开源详情

  • 代码:https://github.com/NUS-HPC-AI-Lab/MoST
  • 模型权重:论文声明模型权重随代码一同发布,获取方式见 https://github.com/NUS-HPC-AI-Lab/MoST;未提供独立的HuggingFace或ModelScope链接。
  • 数据集:训练用开源数据集包括 Common Voice (https://arxiv.org/abs/1912.06670)、LibriHeavy (https://arxiv.org/abs/2309.08105)、VoxPopuli (https://arxiv.org/abs/2101.00390)、SmolTalk (https://arxiv.org/abs/2502.02737) 以及 RefinedWeb(论文中未提供具体获取链接);评估基准使用了 LibriSpeech、VoxPopuli、Common Voice、sWUGGY、sBLIMP、sTopic‑StoryCloze、sStoryCloze、Llama Q、Trivial QA、WebQ、MMLU、TriviaQA、GSM8K、HumanEval 等公开数据集。
  • Demo:论文中未提及
  • 复现材料:论文附录 A 和表 2 给出了两阶段训练的详细配置、超参数和任务混合比例;附录C提供了从config_mostc.json提取的完整模型配置。训练、推理代码及数据处理脚本均随GitHub仓库发布。
  • 论文中引用的开源项目:
    • HuBERT (音频编码器):https://arxiv.org/abs/2106.07447
    • HiFi-GAN (声码器):https://arxiv.org/abs/2010.05646
    • DeepSeek-V2 Lite (基础 MoE LLM 骨干):https://arxiv.org/abs/2405.04434
    • Llama 3.2 3B (受控初始化实验):https://arxiv.org/abs/2407.21783
    • 其他基线模型(如 SpiritLM、Moshi、Qwen2-Audio、SeamlessM4T-v2、MinMo、LLaMA-Omni2 等)均为开源工作,论文中均给出了对应的 arXiv 引用。

🏗️ 方法概述和架构

MoST是一个统一的语音-文本多模态基础模型,基于混合专家(MoE)架构构建。其核心思想是将输入音频和文本序列处理后,通过一个带有模态感知路由(MAMoE)的解码器,根据输入模态的不同,将token分配给不同的专家进行处理,从而实现模态专有化和跨模态交互。整体流程:输入音频波形 \(A\) 和文本序列 \(T\) 分别经过音频编码器和文本嵌入层后,形成统一的交错表示 \(H_{input}\) 送入MoST解码器。解码器由多层Transformer组成,其中指定层包含MAMoE模块。MAMoE层根据token的模态来源,通过模态感知路由器将其导向文本专家组或音频专家组,并与共享专家输出相加,最终通过语言模型头(\(P_{text}\))生成文本,通过声码器(\(G_{audio}\))生成语音。

主要组件详解:

  1. 音频编码器:使用冻结的HuBERT模型将原始音频波形 \(A\) 编码为连续特征 \(F_{hubert} \in \mathbb{R}^{L_{audio} \times d_{hubert}}\),然后通过一个线性投影矩阵 \(W_{proj}\) 映射到模型隐藏维度 \(d_{model}\):\(H_{audio} = F_{hubert} W_{proj} \in \mathbb{R}^{L_{audio} \times d_{model}}\)。与离散token化方法相比,连续特征保留了更丰富的声学信息。这些连续嵌入直接替换输入序列中的占位符token(如 [BoA][EoA])。

  2. 文本嵌入层:使用标准文本分词器将文本序列 \(T\) 映射为离散token嵌入,得到 \(H_{text} = E_{text}(T) \in \mathbb{R}^{L_{text} \times d_{model}}\)。

  3. MoST解码器与MAMoE层:解码器由多头自注意力和MAMoE模块构成。MAMoE模块包含四个关键子组件:

    • 文本专家组 (\(E_{text}\)):一组专门处理文本token表示的MLP专家(Gate-Up-Down投影),由总路由专家数的一半组成。
    • 音频专家组 (\(E_{audio}\)):一组专门处理音频token表示的MLP专家,同样占总路由专家数的一半。两组专家互斥:\(E_{text} \cap E_{audio} = \emptyset\),\(E_{text} \cup E_{audio} = E\)。
    • 跨模态共享专家 (\(E_{shared}\)):一个独立于路由机制的MLP块,用于处理所有通过MAMoE层的token。它提供一个“公共通道”,用于模态间信息交换与整合,最终输出与路由专家的输出相加:\(y_{mamoe} = y_{routed} + E_{shared}(h)\)。
    • 模态感知路由器:核心路由机制。根据输入token的内容表示 \(h_t\) 和模态指示器 \(m_t\)(0=文本,1=音频)计算路由分数。具体过程为(见论文Algorithm 1):首先对所有 \(N\) 个专家计算softmax分数 \(s_t\);然后根据模态指示器生成二进制掩码 \(M_{m_t}\)——文本token仅保留文本专家索引,音频token仅保留音频专家索引;通过元素乘法得到掩码后分数 \(s'_t = s_t \odot M_{m_t}\);最后在 \(s'_t\) 上选择Top-K专家进行加权求和,得到 \(y_{routed,t}\)。训练时,基于 \(s'_t\) 计算辅助负载均衡损失(\(\alpha=0.001\)),以促进各模态组内专家利用的均衡。
  4. 音频解码器:使用HiFi-GAN声码器,根据预测的HuBERT token \(C_{audio} = P_{hubert tokens}(H_{output})\) 和说话人嵌入 \(s\) 生成波形:\(\hat{A} = G_{audio}(C_{audio}, s)\)。

训练流程:采用两阶段策略。

  • 第一阶段:跨模态后训练。在策展的ASR和TTS数据上进行训练。ASR数据使用标准格式(语音输入,文本输出);TTS数据通过反转ASR数据的输入输出模态生成(文本输入,语音输出)。同时混入RefinedWeb文本数据防止遗忘。此阶段旨在初始化并专有化模态特定专家,并适配共享专家以进行基本跨模态对齐。
  • 第二阶段:混合指令微调。在构建的语音-文本指令数据集上进行微调。指令数据通过两种方式生成:(1) 中断对话合成:使用LLM在SmolTalk对话数据中插入自然的中断;(2) 文本转语音指令转换:使用第一阶段训练好的MoST模型,将文本指令数据中的回复等转换为语音,以扩充语音指令数据。微调时混合ASR/TTS数据,防止灾难性遗忘。

关键设计选择:选择50%索引划分是基于DeepSeek-V2等模型中专家随机初始化、无预存语义聚类的观察,认为这是一种统计中性的初始化策略。共享专家处理所有token,其设计动机是防止模态专有化过程中的灾难性遗忘,同时促进跨模态知识迁移。

💡 核心创新点

  • 模态感知MoE路由机制:通过引入模态指示器驱动的二进制掩码,强制文本和音频token分别路由至各自专属的专家群体。这突破了此前语音-文本模型使用模态无关路由的范式,能够显式利用已知模态信息组织专家容量,增强模态专有化学习。
  • 显式跨模态共享专家设计:在模态专属专家组之外,增加一个独立处理所有token的共享MLP块,作为模态间信息交互的桥梁。该设计区别于仅使用模态专属专家或模态无关专家的方案,消融实验证实其在跨模态任务(TTS/ASR)和音频理解中至关重要。
  • 全开源语音-文本MoE训练pipeline:构建了从数据策展(ASR/TTS数据反转、中断对话合成、文本转语音指令转换)到两阶段训练的完整流程,且所有训练数据均为开放获取,并承诺开源模型、代码和数据,具有很高的社区价值。

📊 实验结果

语音处理(ASR和TTS)对比:

模型类型S→SLS-Clean ASRLS-Clean TTSLS-Other ASRLS-Other TTSVP ASRVP TTSCV15 ASRCV15 TTS
Qwen2-AudioDense1.83.67.18.6
SpiritLMDense6.06.711.09.514.319.415.422.4
MoshiDense5.57.012.07.28.810.69.414.2
SeamlessM4T-v2Dense3.36.34.25.37.510.310.310.8
MinMoDense1.86.73.97.56.710.98.013.5
MoST (Ours)MoE2.06.0(↓0.3)3.77.26.2(↓0.1)10.1(↓0.2)8.411.5

音频语言建模(部分结果,完整见原文Table 5):

模型sWUGGYsTopic-StoryClozesStoryCloze平均
Phi-4 Multimodal71.8481.5562.3969.00
MinMo68.5975.4361.2965.19
LLaMA-Omni273.2178.2168.5568.39
MoST (Ours)75.28(↑2.1)83.64(↑0.3)65.4371.94(↑2.9)

Spoken Question Answering(SQA)任务结果(基于Figure 3): MoST在多个SQA基准上表现出强劲性能。在Llama Q上,S→T得分为74.8,S→S得分为62.6。在Trivial QA上,S→T为43.5,S→S为32.1。在WebQ上取得最佳结果,S→T为58.2,S→S为44.7。在所有任务上显著优于MinMo和LLaMA-Omni2。

消融实验关键发现(基于Figure 4):

  • MoST vs MoST-VanillaMoE:MAMoE模态感知路由在ASR、TTS、ALM、SQA所有任务上均优于标准模态无关的MoE路由,验证了模态感知路由的有效性。
  • MoST vs MoST-NoShared:移除共享专家后性能全面下降,特别是在ASR和TTS这类跨模态任务上,证实了共享专家对于促进模态间信息交互和防止灾难性遗忘的关键作用。
  • 控制对比(Llama3.2 3B初始化,Figure 5):在相同初始化的严格对比下,MoST-style upcycling在ASR上比传统MoE upcycling高出7.3%,在SQA上高出21.8%,充分证明了MAMoE架构独立于基座模型质量的固有优势。

🔬 细节详述

  • 训练数据:Stage1使用LibriHeavy(60%)、Common Voice(20%)、VoxPopuli(20%)的ASR和TTS数据,TTS数据通过反转ASR数据模态生成。另外混入RefinedWeb文本数据防止遗忘。Stage2指令数据使用SmolTalk合成的中断对话,以及由Stage1的MoST将文本指令转换成的语音指令。所有数据均为开源。数据总量未给出确切的token数或小时数。
  • 损失函数:标准语言模型交叉熵损失 + 负载均衡辅助损失(\(\alpha=0.001\))。负载均衡损失基于模态掩码后的路由分数 \(s'\) 计算,旨在促进模态组内的专家利用均衡。
  • 训练策略:两阶段训练。优化器为AdamW,采用余弦学习率调度,学习率5e-5,权重衰减0.01,warmup步数1000。Stage1:500k步,batch size 512,任务混合比 ASR:0.4, TTS:0.4, Text LM:0.2。Stage2:10k步,batch size 128,任务混合比 Speech Instruct:0.4, Text Instruct:0.4, ASR:0.1, TTS:0.1。附录说明指令与ASR/TTS数据的混合比例为1:1。
  • 关键超参数:基于DeepSeek-V2 Lite初始化。解码器27层Transformer,隐藏维度2048,中间维度10944,采用SiLU激活,RoPE位置编码(YARN type),attention dropout 0.0。音频编码器使用HuBERT Base(25Hz帧率),声码器为HiFi-GAN。文本/音频专家各32个(总路由专家64个),共享专家1个/层。总参数约16B。
  • 训练硬件:48块NVIDIA A100 GPU(6节点×8卡),训练时长未说明。
  • 推理细节:未说明。解码策略(如greedy/sampling/beam search)、温度等关键推理配置均未提及。
  • 正则化技巧:除AdamW的权重衰减外,未额外说明其他正则化方法。

⚖️ 评分理由

  • 创新性 (1.2/2):模态感知路由和共享专家在MoE架构中并非全新概念,在图像-文本等多模态领域已有探索(如MoMA)。本文的主要贡献在于首次将其整合并应用于语音-文本MoE LLM,并通过扎实的工程实现验证了有效性。50%硬划分策略缺乏理论和实验驱动,创新深度一般,属于已知组件在新场景下的成功适配与整合。
  • 技术严谨性 (1.0/1.5):方法描述清晰,负载均衡损失设计合理。主要问题在于:1)专家50%划分的依据仅为“随机初始化无预存语义”的经验观察,缺少对划分比例敏感性或理论最优性的深入分析;2)对共享专家作用机制的分析仅停留在现象层面的消融(有/无),未探究其内部信息交互方式或各层共享专家的贡献差异;3)解决灾难性遗忘的方法(混入文本数据、共享专家)有效但直接,缺乏更深层的设计。
  • 实验充分性 (1.2/1.5):实验覆盖全面,包括ASR、TTS、ALM、SQA和纯文本(附录E)等多个维度,消融实验和控制变量对比(相同初始化)设计合理,有力地支撑了核心论点。不足之处同样明显:1)未报告任何推理延迟或计算开销(如FLOPs),这对于宣称具有效率优势的MoE架构是重大遗漏;2)所有实验结果均未汇报统计显著性检验;3)未对不同模态专家比例(如70%-30%)进行实验探究;4)Stage2仅训练10k步,其收敛性未提供充分证据(如loss曲线)。
  • 清晰度 (0.8/1):论文整体组织结构良好,图1和图2分别清晰展示了架构和训练流程。算法1提供的路由伪代码有助于理解。但存在几处关键信息模糊:1)正文未明确给出总专家数、K值(top-K数量)等核心配置,需查阅代码或附录C;2)音频解码器中预测HuBERT token的具体机制描述不充分;3)两阶段训练数据的具体总规模(token数/hours)始终未公布,仅给出混合比例。
  • 影响力 (1.1/1.5):作为首个将模态感知MoE应用于语音-文本领域并全开源的工作,其在语音多模态模型研究社区具有明确的引领和示范效应,对推动低成本、高性能开源语音大模型的发展有积极意义。然而,该工作仅在语音+文本双模态上验证,其范式和结论能否顺利扩展到视觉等其他模态尚不明确。模型规模(约16B)偏小,其在更大规模下的性能天花板和对主流大模型的冲击仍待观察。
  • 开源 (1.5/1.5):论文声明将完整开源模型权重、训练代码、推理代码和训练数据(GitHub链接已提供),所有依赖数据集均为开放获取。附录提供了详细的config和训练配置。完全满足全开源承诺,具有极高的社区价值。
  • 可复现性 (0.4/0.5):训练阶段的超参数、任务混合比例等配置在附录中详细给出,提高了复现可能性。但复现的最大障碍在于推理配置的完全缺失(解码策略、温度等)以及部分数据处理细节的不透明(如TTS数据反转的具体实现、中断对话合成的具体提示词)。完全复现仍有一定难度。
  • 工程/实践价值 (1.0/1.5):设计了完整且高效的两阶段训练pipeline,特别是数据合成策略(中断对话、TTS指令转换)对实际构建语音-文本系统有很强的参考意义。完全使用开源数据的策略极大降低了复现门槛。然而,缺少推理效率分析、量化方案或部署优化措施的讨论,在工程落地方面的支撑显得薄弱。

🚨 局限与问题

论文明确承认的局限:

  • 承认50%索引划分策略是“相对简单的初始化策略”,可能非理论最优(见Appendix D)。
  • 未来工作包括扩展到视觉模态、扩大参数规模、探索不同的专家划分方法。
  • 承认存在语音伪造(voice spoofing)等潜在社会风险。

审稿人发现的潜在问题:

  • 初始化公平性问题:主要实验的SOTA对比是不公平的。MoST基于强大的DeepSeek-V2 Lite(MoE)初始化,而多数基线模型(SpiritLM、Moshi等)基于不同的、可能更弱的基座模型(如LLaMA系列)。因此,MoST的性能优势有多少源于更强的基座模型、多少源于MAMoE架构本身,无法直接从Table 1中辨别。虽然Llama3.2 3B的控制实验有力地隔离了架构优势,但这无法改变主实验比较基准不统一的事实,导致了“SOTA”的含金量需要谨慎看待。
  • 共享专家分析不足:消融实验仅对比了“有”与“无”共享专家,分析过于粗糙。未回答以下关键问题:共享专家实际学习了何种跨模态知识?是否所有Transformer层都需要共享专家?共享专家的参数量占比对性能有何影响?它可以被路由专家吸收吗?缺少这些分析使得对共享专家作用的理解停留在必要性层面,而非机理层面,削弱了该模块的理论贡献。
  • 训练规模与收敛性问题:Stage2的指令微调仅训练了10k步,总样本量有限。虽然混入了Stage1数据,但在如此少的指令数据上微调,其指令跟随能力的鲁棒性和泛化边界令人担忧,可能过拟合到有限的合成指令格式。作者未提供缩放定律实验或收敛性分析。
  • 推理效率缺失:论文在Introduction中强调了MoE的计算效率优势(“without a proportional increase in inference cost”),但全文未提供任何关于推理延迟、吞吐量或FLOPs的数据。对于评估其实际部署价值,这是一个关键指标缺失。
  • 评测覆盖度:ALM评测高度依赖zr-2021系基准(sWUGGY, sBLIMP),这些基准相对较老且覆盖面窄。对于现代语音大模型,缺少如副语言信息理解、情感识别、嘈杂场景鲁棒性等更能体现“理解”能力的评测。

← 返回 ICML 2026 论文速递