📄 Efficiently Adapting Spoken Language Models for the Singaporean Context
标签:#语音交互 #参数高效微调 #语音识别 #低资源 #音频理解
6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5
✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音交互 | #LoRA | #参数高效微调 #语音识别 | arxiv
👥 作者与机构
- 第一作者:Ng Jia Sheng Jason(Home Team Science & Technology Agency (HTX), Singapore,Language AI R&D)
- 通讯作者:Ng Jia Sheng Jason(Home Team Science & Technology Agency (HTX), Singapore,Language AI R&D)
- 作者列表:Ng Jia Sheng Jason(Home Team Science & Technology Agency (HTX), Singapore,Language AI R&D)
💡 毒舌点评
本文最大亮点在于针对新加坡政府敏感部门的具体需求,扎实地构建了一整套实用的工程流水线,从数据(HTD-multilingual-QA)到适配策略(LoRA + CoBa),最终产出了性能有竞争力的HT-Moonstone模型,对垂直领域的工业落地有明确参考价值。主要短板在于技术上的“组合创新”多于“原生创新”,LoRA、代理数据集、多任务加权等均为成熟技术,且未能开源核心产物,使其影响力大打折扣。
📌 核心摘要
本文解决的是如何将开源口语语言模型(SLM)高效适配到新加坡国土安全(Home Team)具体应用背景下的问题,该背景要求模型能处理新加坡四种官方语言(包括混杂代码)的口语问答等任务,且无法访问原模型训练数据。方法核心是采用LoRA参数高效微调,并创新性地组合了使用代理文本QA数据集防止灾难性遗忘、以及将针对文本任务的CoBa动态任务权重平衡方法适配到多任务语音训练中。与已有研究多聚焦于ASR等单任务不同,本文同时针对ASR、口音/性别识别、口语QA、语音QA共五类任务进行联合适配。主要实验结果表明,适配后的5B参数模型HT-Moonstone在口音识别(72.6%)和性别识别(93.9%)任务上超越所有基线(包括高达35B的模型),在口语QA上仅次于Qwen3-Omni,并将基础模型的ASR错误率从52.4大幅降低至14.6。实际意义在于提供了一种数据与资源受限条件下,通过针对性适配获得高性能领域模型的可行路径。主要局限包括实验仅局限于5B规模模型、任务覆盖有限、未开源代码模型与数据、且存在跨语言数据不平衡问题。
🔗 开源详情
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及
- 数据集:
- HTD-multilingual-QA:论文中描述了该数据集的构建方法(包含文本和口语形式,共504,853个样本),但未提供公开访问链接或开源协议。获取方式未明确说明。
- 用于构建该数据集的先前工作(多轮对话数据集)的博客介绍:
https://medium.com/htx-dsai/how-we-talk-generating-singaporean-conversations-54aea9b6892b - 其他用于训练或评估的第三方数据集(如MNSC, AISHELL-1, SEAME, FLEURS, SLR65, SLR127, Nemotron-SFT-Instruction-Following-Chat-v2等)仅在表2及附录A中列出名称,未提供具体获取链接。
- Demo:论文中未提及
- 复现材料:
- 训练配置:论文第3.4节详细描述了训练HT-Moonstone的配置,包括:硬件(2× NVIDIA H100 NVL GPUs, 每块94 GB显存)、批大小(per-device batch size=1, gradient accumulation=8)、训练步数(62,500 steps, 单epoch)、学习率(\(1 \times 10^{-5}\))、LoRA参数(\(r=32\), \(\alpha=64\), dropout=0.05)、数据量(约100万样本)。
- 评估数据集:附录A列出了所有用于基准测试的具体数据集名称(如MNSC/ASR-Part1-Test, aishell1_mandarin_test等),但未提供这些数据集的下载链接。
- 检查点:论文中未提及是否发布训练好的模型检查点(HT-Moonstone)。
- 论文中引用的开源项目:
- 基础模型:Voxtral-Mini-3B-2507(由Mistral AI开发,论文第3.1节提及)
- 语音合成工具:OmniVoice(用于生成HTD-multilingual-QA的口语形式,论文3.2.1节引用)
- 评估框架:AudioBench(用于模型评估,论文第3.1节提及)
- 多任务学习方法:CoBa(动态权重调整方法,论文第3.3节引用)
🏗️ 方法概述和架构
本文提出了一套针对新加坡背景的口语语言模型适配方法论,整体流程为:基础模型选择 -> 多任务训练数据集构建与混合 -> 基于LoRA的多任务参数高效微调 -> 动态任务权重平衡训练 -> 得到适配模型HT-Moonstone。这是一个典型的多阶段、组件化的领域适配流水线。
下图直观展示了最终适配模型HT-Moonstone所涵盖的多样化目标任务,凸显其作为统一语音语言模型的多任务处理能力。

图中展示了模型在多语言ASR、性别识别、口音识别以及不同交互范式的口语/语音问答等核心任务上的输入与输出示例,这些正是本研究适配工作的目标。
1. 基础模型选择模块:该模块的功能是在多个候选开源SLM中,通过系统性的零样本评估,选定一个最适合新加坡多语言、多任务背景的基座模型。论文在五个关键的感知与认知语音任务上评估了9个模型(如MERaLiON-2-3B, Voxtral-Mini-3B, Kimi-Audio等),这些任务包括:(1) 新加坡英语ASR,用于评估语音识别基础能力;(2) 口音识别(AR),用于识别新加坡说话者的族裔口音;(3) 性别识别(GR);(4) 口语问答(Spoken QA),即输入为音频问题,输出为文本答案;(5) 语音问答(Speech QA),即输入为语音上下文和文本问题,输出为文本答案。选择依据是综合考量模型在这些任务上的零样本性能、模型大小(关乎后续适配的计算成本)以及长音频处理能力(支持40分钟单次输入,契合实际长音频分析需求)。最终,Voxtral-Mini-3B-2507因其在语音QA任务上表现出色(76.4%准确率)、相对较小的规模以及长音频支持能力而被选为基座模型。此模块通过系统评估确保了后续适配工作的起点合理性。
2. 训练数据集构建模块:该模块负责构建两大类训练数据,以支持新任务学习和防止能力遗忘。核心组件包括:
- HTD-multilingual-QA数据集构建:为适配“文本上下文+语音查询”这一核心的口语QA任务,作者在已有的新加坡多轮对话QA数据基础上,通过GPT-4o将用户提问(query)翻译成新加坡其他三种官方语言(与英语进行代码混合)。然后,使用OmniVoice语音合成工具,并以两名新加坡本地说话人(符合语言与族裔特征)的录音为种子进行语音克隆,将文本用户提问转换为语音形式。此过程生成了包含504,853个样本的文本和语音两个版本的多轮QA数据集,覆盖了1,723,693个QA对。
- 代理数据集筛选:为防止模型在适配新任务时遗忘原有的通用指令遵循和QA能力,且因无法获取原训练数据,作者评估了多个公开文本/语音QA数据集作为“代理”。实验通过在一个控制组(不训练)和多个候选数据集上微调模型20k样本,比较其在英文口语QA和语音QA评估集上的性能。结果表明,纯文本数据集Nemotron-SFT-Instruction-Following-Chat-v2在保持模型原语音QA能力上效果最佳,是唯一一个能让两项评估指标同时提升的数据集。该组件的作用是维持模型的通用基础能力。
3. 多任务训练与损失平衡模块:这是适配方法的核心技术组件。由于需同时适配ASR、AR、GR、文本指令遵循(Text-IF)、会话QA(包括文本和语音形式)等多个任务域,面临两个关键问题:(a) 不同任务输出序列长度差异巨大(如GR只需几个token,QA需要长文本),简单的跨所有token的平均损失会系统性压制短任务的贡献;(b) 不同任务在训练过程中的收敛速度不同,导致早收敛任务过拟合而晚收敛任务欠拟合。
- 损失函数设计:为解决问题(a),作者将损失计算从标准的跨样本token平均,改为先对每个样本的输出token计算平均交叉熵损失,再在任务内样本间平均,最后按任务域加权求和。具体地,对于样本 \(x\),其损失 \(\ell(x)\) 为该样本目标答案 \(y\) 中所有token的平均交叉熵;对于任务域 \(i\),其损失 \(\mathcal{L}_{i}\) 为该域一个批次中所有样本损失的平均。总损失为各任务域损失的加权和。
- 动态任务权重(CoBa适配):为解决问题(b),作者引入并测试了CoBa动态权重方案。CoBa根据各任务评估损失的绝对值和相对变化率,自动调低早收敛任务(如AR、GR)的权重,调高晚收敛任务(如Text-IF、会话QA)的权重,从而平衡收敛进度。作者通过一组关键的消融实验(4个256k样本的训练运行)验证了该方法。实验比较了“均匀任务比例”与“重新分配任务比例”(降低AR/GR数据比例,增加Text-IF和会话QA比例)、以及是否使用CoBa动态权重的组合。结果表明,在“重新分配”比例条件下,结合CoBa,能使核心目标“会话QA”任务的评估损失达到最低。
- LoRA微调:采用LoRA对选定的Voxtral-Mini-3B-2507模型进行参数高效微调,具体配置为秩 \(r=32\),缩放因子 \(\alpha=64\),dropout率0.05。训练数据是按一定比例混合了多个任务域数据的多域数据集。
4. 训练执行与推理:基于上述策略,最终训练在2块NVIDIA H100 NVL GPU(每块94GB显存)上完成,总训练样本约100万(包含约3000小时音频和5亿文本token),耗时100小时。训练采用Adam优化器,学习率 \(1 \times 10^{-5}\),单epoch训练62,500步,批大小为每设备1,梯度累积8步。推理时,HT-Moonstone作为一个统一的SLM,能够根据不同的输入格式(音频上下文+文本问题,或文本上下文+音频问题)处理不同的任务。
组件间数据流与设计动机:数据流是清晰的顺序过程:从选定的基准模型出发,使用构建好的、按特定比例混合的多域数据集,通过多任务损失函数(内含根据评估动态调整的CoBa权重)计算梯度,更新模型中的LoRA适配器参数。关键设计选择与动机包括:(1) 选择LoRA而非全参数微调:出于资源效率和避免过拟合的考虑,这在资源受限的政府项目背景下是合理的工程权衡;(2) 使用代理数据集:这是本文一个关键且新颖的洞察,在无法获取原始数据时,通过精选的公开文本数据来“接地”模型,防止其原有能力退化;(3) 采用CoBa并重新分配任务比例:这是基于实验观察的主动训练调度策略,作者观察到AR/GR任务收敛快,因此减少其数据比例,将预算分配给收敛慢的文本指令跟随和会话QA任务,并结合CoBa动态调整,以优化最终核心目标(会话QA)的性能。
💡 核心创新点
- 针对新加坡多语言背景的SLM端到端适配策略:这是本文最核心的贡献。它系统地组合了LoRA、代理数据集和多任务平衡技术,为数据与资源受限的特定领域从零训练SLM提供了一种高效、低成本的替代方案。之前的同类工作多关注单一任务(如ASR)或不同场景。
- HTD-multilingual-QA数据集:构建了一个涵盖新加坡四种官方语言(含代码混合)、同时具有文本和语音形式的多轮问答数据集,专门用于训练SLM处理“文本上下文+语音查询”这一复杂且实用的交互范式,填补了相关资源的空白。
- 使用代理文本数据集防止语音模型灾难性遗忘:创新性地提出并验证了在无法获得原始训练数据时,可以使用一个精选的纯文本QA数据集作为“代理”,来有效保持适配后模型在语音模态上的原有能力。这一方法简单且具有通用参考价值。
- 将CoBa动态权重平衡方法适配到多模态语音任务训练:CoBa原用于文本任务,本文首次将其应用于涵盖感知(ASR)和认知(QA)的语音多任务训练中,并通过消融实验证明了其有效性,特别是结合任务数据比例重新分配的策略。
- 构建完整的评估与适配流水线:论文不仅提出了方法,还呈现了一个从候选模型筛选、数据构建、训练策略设计到最终评估的完整工程流水线,对工业界落地具有明确的实践指导意义。
📊 实验结果
论文主要实验结果如下:
1. 基础模型选择零样本评估(表1):在9个候选模型中,Voxtral-Mini-3B-2507在语音QA任务上表现突出(76.4%准确率),且支持长音频,因此被选为基座。具体评估结果如下表所示:
| 模型 | 参数量(B) | ASR-EN WER↓ | 口音识别 Acc.↑ | 性别识别 Acc.↑ | 口语QA Acc.↑ | 语音QA Acc.↑ |
|---|---|---|---|---|---|---|
| MERaLiON-2-3B | 3.5 | 5.05 | 44.4 | 87.7 | 25.4 | 68.2 |
| Voxtral-Mini-3B-2507 | 5 | 7.25 | 24.7 | 15.7 | 42.2 | 76.4 |
| audio-flamingo-next-hf | 8 | 7.87 | 0 | 74.6 | 33.0 | 68.7 |
| SeaLLMs-Audio-7B | 8 | 114 | 0 | 38.6 | 17.25 | 40.6 |
| Kimi-Audio | 10 | 8.36 | 3.7 | 79.8 | 48.6 | 71.3 |
| MERaLiON-2-10B | 10 | 5.46 | 56 | 75.5 | 45.3 | 73.5 |
| Qwen2.5-Omni | 11 | 188 | 0 | 18.2 | 36.0 | 79.0 |
| Voxtral-Small-24B-2507 | 24 | 7.64 | 8.3 | 0.5 | 42.5 | 80.0 |
| Qwen3-Omni | 35 | 9.85 | 18.6 | 79.1 | 61.6 | 76.5 |
2. 代理数据集筛选(表3):通过20k样本的微调实验,Nemotron-SFT-Instruction-Following-Chat-v2在保持模型原口语QA(64.8% vs 基线的61.8%)和语音QA(79.7% vs 基线的76.4%)能力上表现最佳,是唯一一个能让两项指标同时提升的数据集。具体筛选结果如下:
| 条件/数据集 | 口语QA Acc.↑ | 语音QA Acc.↑ |
|---|---|---|
| Control (no-training) | 61.8 | 76.4 |
| dolphin | 64.3 | 76.0 |
| OpenHermes-2.5 | 55.6 | 74.2 |
| Nemotron-SFT-Instruction-Following-Chat-v2 | 64.8 | 79.7 |
| no_robots | 52.4 | 69.5 |
| ragbench | 61.4 | 75.1 |
| LongAudio (MultiDialog) | 53.8 | 66.8 |
| MNSC (SQA) | 45.0 | 62.8 |
3. HT-Moonstone与各基线模型的核心对比(表4):
| 模型 | 参数量(B) | ASR-EN WER↓ | 口音识别 Acc.↑ | 性别识别 Acc.↑ | 口语QA Acc.↑ | 语音QA Acc.↑ |
|---|---|---|---|---|---|---|
| MERaLiON-2-3B | 3.5 | 5.05 | 44.4 | 87.7 | 25.4 | 68.2 |
| Voxtral-Mini-3B-2507 (基座) | 5 | 7.25 | 24.7 | 15.7 | 42.2 | 76.4 |
| audio-flamingo-next-hf | 8 | 7.87 | 0 | 74.6 | 33.0 | 68.7 |
| SeaLLMs-Audio-7B | 8 | 114 | 0 | 38.6 | 17.3 | 40.6 |
| Kimi-Audio | 10 | 8.36 | 3.7 | 79.8 | 48.6 | 71.3 |
| MERaLiON-2-10B | 10 | 5.46 | 56 | 75.5 | 45.3 | 73.5 |
| Qwen2.5-Omni | 11 | 188 | 0 | 18.2 | 36.0 | 79.0 |
| Voxtral-Small-24B-2507 | 24 | 7.64 | 8.3 | 0.5 | 42.5 | 80.0 |
| Qwen3-Omni | 35 | 9.85 | 18.6 | 79.1 | 61.6 | 76.5 |
| HT-Moonstone | 5 | 6.59 | 72.6 | 93.9 | 52.1 | 75.1 |
HT-Moonstone在口音和性别识别上取得所有模型最佳成绩;在口语QA上仅次于7倍大的Qwen3-Omni;在语音QA上仅比基座模型下降约1.3%。
4. 多语言ASR性能对比(表5):
| 模型 | 参数量(B) | EN WER↓ | ZH CER↓ | ZH-CS WER↓ | MS WER↓ | MS-CS WER↓ | TA CER↓ | 平均错误率↓ |
|---|---|---|---|---|---|---|---|---|
| MERaLiON-2-3B | 3.5 | 5.05 | 7.61 | 16.4 | 11.9 | 35.2 | 8.39 | 14.1 |
| Voxtral-Mini-3B-2507 | 5 | 7.25 | 18.9 | 60.8 | 41.5 | 100.2 | 85.6 | 52.4 |
| MERaLiON-2-10B | 10 | 5.46 | 6.68 | 19.5 | 12.4 | 28.0 | 8.91 | 13.5 |
| HT-Moonstone | 5 | 6.59 | 9.26 | 26.6 | 13.9 | 20.5 | 10.8 | 14.6 |
HT-Moonstone将基座模型的平均错误率从52.4大幅降低至14.6,仅比专门为新加坡构建的10B参数模型MERaLiON-2-10B高1.1个点,并在马来语代码混合ASR上取得最佳结果。
为验证CoBa动态权重与数据比例重新分配策略的有效性,论文进行了关键的消融实验,其训练过程中的验证损失变化如下图所示。

下图对比了四种训练策略在不同任务域上的收敛情况,其中结合CoBa与重新分配比例的策略在收敛较慢的会话QA任务上取得了最低的最终验证损失,是其成功的关键。
🔬 细节详述
- 训练数据:如表2所示,混合了多领域数据。ASR数据包括英语(MNSC ASR,约5M样本)、华语(AISHELL-1/3, SEAME, FLEURS)、马来语(Mesolitica, FLEURS)、泰米尔语(SLR127, SLR65, FLEURS)。感知任务数据包括MNSC的AR和GR数据(各约4.8M样本)。认知任务数据包括Nemotron-SFT-IF-Chat-v2指令跟随数据(约1M样本)以及自建的HTD-multilingual-QA数据(504,853文本样本和对应的语音样本)。实际训练时按固定比例子采样,而非使用全部数据。
- 损失函数:如公式(1)和(2)所示。公式(1)定义了样本级损失 \(\ell(x)\),即对样本 \(x\) 的输出目标 \(y\) 中所有token计算平均交叉熵。公式(2)定义了总训练损失 \(\mathcal{L}(t)\),为各任务域损失 \(\mathcal{L}_{i}\) 的加权和,权重 \(\omega_i(t)\) 由CoBa动态调整。
- 训练策略:使用Adam优化器,学习率 \(1 \times 10^{-5}\),单epoch训练62,500步,总样本约100万。应用了LoRA (\(r=32\), \(\alpha=64\), dropout=0.05)。关键策略是采用CoBa动态任务权重,并配合将AR/GR数据比例调低、Text-IF和会话QA数据比例调高的“重新分配”策略。消融实验(图2)表明此策略组合能使核心目标“会话QA”评估损失最低。
- 关键超参数:基础模型为Voxtral-Mini-3B-2507。LoRA秩 \(r=32\)。训练batch size为每设备1,梯度累积8步。
- 训练硬件:2x NVIDIA H100 NVL GPUs (94 GB显存),训练时长100小时。
- 推理细节:未详细说明解码策略(温度、beam size等)。
- 正则化/稳定训练技巧:使用了LoRA dropout (0.05)。
⚖️ 评分理由
创新性 (1.2/2):针对新加坡多语言垂直领域,系统组合LoRA、代理数据集防遗忘及CoBa多任务动态权重,构建了端到端适配流水线与专用数据集,具有系统级组合创新和明确的实用价值。
技术严谨性 (1.0/1.5):损失函数设计合理,通过样本平均平衡任务输出长度差异;但将CoBa从文本任务迁移到语音多任务的理论依据或适应性分析不足,主要依赖实验证明。
实验充分性 (1.0/1.5):覆盖五类目标任务和四种语言,有基线对比和代理数据集、CoBa策略的消融实验;但消融实验规模较小(如20k样本),未验证方法在不同模型规模的可扩展性,且存在数据不平衡和评估基准公平性风险。
清晰度 (0.8/1):论文结构清晰,图表对理解任务与结果有帮助;但部分技术细节如多任务数据具体混合比例、CoBa权重更新步骤描述不够详尽,且基座模型参数标注(5B vs 3B)可能引起混淆。
影响力 (1.0/1.5):对新加坡国土安全部门等垂直领域的模型适配有直接实践影响力,提供了一套完整的工程方案,对资源受限场景有明确参考价值;但影响主要局限于新加坡特定业务和语言组合。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.3/0.5):提供了主要训练配置(如硬件、批大小、学习率、LoRA参数),但多任务数据混合比例、CoBa动态权重实现细节、评估时使用的GPT-4o提示模板等关键复现信息缺失。
工程/实践价值 (1.2/1.5):展示了从需求分析、数据构建、模型选择、训练策略到评估的完整工业级适配流程,提出的代理数据集防遗忘、基于观察的任务比例调整等策略对垂直领域落地具有很高参考价值。
🚨 局限与问题
论文明确承认的局限:
- 模型规模:仅在5B参数模型上实验,未验证方法在更大规模模型上的有效性。
- 任务覆盖:未涵盖音频场景QA、情感识别等其他有潜力的任务。
- 模型架构:未探索替换SLM的组件(如音频编码器)。
- 超参数搜索:数据混合比例和训练策略的搜索不充分。
- 数据不平衡:泰米尔语和马来语数据远少于英语和华语。
- 评估范围:未评估模型在通用文本基准上的能力保留情况。
审稿人发现的潜在问题:
- 评估基准的公平性与泄露风险:用于评估Spoken QA的数据集是“内部开发”的,其具体内容、难度、与训练数据的重叠情况以及与公开数据集的区分度均未公开,存在潜在的数据泄露风险,影响结果可信度。
- “最佳”声明的边界:论文称HT-Moonstone“matches or outperforms SLMs up to 7× its size”,这主要是在口音/性别识别和口语QA上。在ASR和语音QA上,它并非最佳(ASR-EN WER比MERaLiON-2-3B/10B高,语音QA Acc比Qwen3-Omni低)。这种选择性对比可能给读者带来误导。
- CoBa迁移动机不足:将CoBa从文本任务迁移到语音多任务是本文的一个技术点,但论文仅通过消融证明有效,未深入讨论为何该迁移是合理的,或语音任务与文本任务在收敛动态上有何异同。
- 代理数据集的普适性:Nemotron-SFT-IF-Chat-v2这个特定数据集为何有效,其特征是否可被其他类似数据集替代,缺乏深入分析。这使其更像一个工程发现而非普适方法。
- 语音合成的数据质量:使用OmniVoice合成多语言语音数据可能引入音质和口音上的偏差,但论文未评估合成语音与真实新加坡口语的差异及其对下游任务性能的影响。
- 基座模型参数规模:论文表1和表4中将Voxtral-Mini-3B-2507的“Size (B)”标注为“5”,但模型名称包含“3B”,这可能导致读者混淆。论文未明确说明此“5B”是否包含适配参数或其他组件,需要更清晰的定义。