📄 Aslema at NADI 2026: Augmentation through Fewshot for SLU

标签:#语音交互 #语音大模型 #多语言 #语音克隆

8.0/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5

🔥 8.0/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #语音交互 | #语音大模型 | #多语言 #语音克隆 | arxiv

👥 作者与机构

第一作者:Tajwaar Shafiq(机构未说明) 通讯作者:未说明 作者列表:Tajwaar Shafiq、Hunzalah Hassan Bhatti、Shammur Absar Chowdhury、Firoj Alam(机构信息未在当前正文中完整说明)

💡 毒舌点评

这是扎实的比赛参赛报告,但实验设计与正式评测之间存在结构性错位:消融集中在开发集,盲测只评估最终配置,每个增强环节的独立贡献无从确认;训练与开发集只有 23 个标签而盲测是 60 标签开放集,已知类准确率与开放意图拒识混在同一分数里。合成增强只在 30B 模型上完整验证,小模型能否受益未知;三模型投票过滤了文本问题却没有母语者逐条听审,克隆语音的方言自然度仍存疑。

📌 核心摘要

  1. Aslema 面向 NADI 2026 的突尼斯 Derja 端到端口语理解:系统既要识别意图,也要转写语音并在文本中标出槽位。困难不只是语料只有约 2.8 小时,还包括训练阶段只见到 23 个意图标签、盲测却采用完整 60 标签空间的开放意图落差。

  2. 四个 omni 音频大模型的零样本表现并不理想;在少量真实语音上做 LoRA 微调后,意图准确率集中提升到 80.4%—82.9%,CoER 降到 47.7—57.0。换言之,对低资源方言来说,任务适配比单纯扩大模型更重要。

  3. 数据增强先让 Gemini 生成文化和方言相关的 Derja 句子,再经过规则与三模型投票筛选,最后用 VoxCPM 克隆语音。将 2,677 条真实语音与 22,940 条合成语音混合训练 Qwen3-Omni-30B,dev-test 意图准确率达到 86.8%,CoER 为 36.9,WER 为 34.7。

  4. 正式测试中,系统以 CoER 59.5 获得槽位填充第 1 名;意图识别通过把泛化过度的 general_quirky 映射为 unknown,准确率从 30.4% 提升到 66.1%,最终排 8 队第 4。这个结果也揭示了增强数据无法自动解决未知意图问题。

  5. 增强链的关键不是多造句,而是分三次控制污染:20,937 条文本候选经规则与 LLM 投票剩 12,138 条,克隆成 23,300 条语音后再按时长、削波、活跃度和语速筛到 22,940 条。纯合成训练只有 75.6% 意图准确率和 62.2 CoER,明显不如真实+合成混合,说明低资源场景仍需要真实方言语音作为分布锚点。

  6. 盲测约 40% 样本属于训练标签之外,最终 66.1% 包含规则拒识带来的 35.7 个百分点增益。因此槽位第 1 名是扎实的端到端结果,意图第 4 名则更应理解为领域微调与开放集规则共同组成的系统成绩,而不是模型已掌握全部 60 个意图。

🔗 开源详情

根据论文全文提取的开源资源链接:

  • 代码仓库:https://github.com/hunzed/aslema_nadi2026
  • 模型权重与数据集:论文中未提及额外发布渠道。

🏗️ 方法概述和架构

少样本文本生成。 系统按训练集中各意图的稀缺程度分配合成数量。Gemini 3.1 Pro 负责最稀缺意图,Gemini 3.6 Flash 处理其余意图,每次只使用训练集中的 6 个 few-shot 示例。生成分三类:全新命令、现有表达改写、以及保留意图但去除槽值的困难样本;三类分别贡献 16,387、1,510、3,040 条候选,避免增强只复制一种表达模式。

下图为Figure 1来自论文原文。

Figure 1: Overview of the data augmentation pipeline.

两级文本质量筛选。 20,937 条原始候选先去除重复、格式错误和明显方言不一致,剩 13,876 条;随后 3 个 LLM 分别判断 Derja 自然度、意图一致性与槽位正确性,至少 2 个同意才保留,得到 12,138 条文本。槽位采用内联标记,因此规则还能检查标签边界、值缺失和格式是否能被官方工具读取。

语音合成与过滤。 VoxCPM 基座版和在 SLURP-TN 约 2.8 小时真实语音上做 LoRA 的版本共同生成语音。克隆参考来自 2,330 个 2.5—10 秒训练片段中经 ASR 检查筛出的 152 条零 WER 样本。23,300 条合成语音按时长、电平、削波、有声帧活跃度与语速过滤后保留 22,940 条;其中基座生成 11,946 条、方言适配版生成 11,354 条,最终与 2,677 条真实训练语音组成 25,617 条混合集。

联合 SLU 微调。 四个 omni 模型分别为 Qwen2.5-Omni-3B/7B、Qwen3-Omni-30B-A3B 与 Gemma-4-E4B-it。微调时音频编码器和音频—文本对齐器冻结,同一个 LoRA adapter 联合学习意图与槽位,沿用零样本 prompt 和输出格式以控制比较变量,所有模型训练 2 epoch、使用最终 checkpoint、贪心解码。Whisper-small 则作为小型完整微调基线。

基线与正式提交。 模型统一由 ms-swift/vLLM 在单张 H200 上服务。意图用 accuracy、weighted-F1、macro-F1;槽位用 CoER/CVER,同时去除标记后报告 WER/CER,从而分开检查语言转写和语义标注。真实语音微调、纯合成、真实+合成三组直接比较,确认混合训练的增益不是仅由训练步数增加造成。正式提交先在 23 标签 dev-test 选定 Qwen3 混合方案,再在 60 标签盲测中加入 general_quirky→unknown 的确定性映射;这一层只改变开放意图输出,不改槽位或 ASR。

类别不平衡的处理边界。 训练实际出现 21 个意图,其中 6 类少于 10 条,系统据频次向稀缺类倾斜生成,但并没有为盲测新增的 37 类编造标签数据。因而增强解决的是已知低频类覆盖和方言声学不足,unknown 映射解决的是未见类拒识,两者在架构和评价中保持分离。正式榜单也把意图和槽位分别计分、分别排名,使开放标签失配不会遮蔽模型对已知槽位边界与值的处理能力。

Figure 1: Overview of the data augmentation pipeline. - 图2

💡 核心创新点

  1. 为低资源 Tunisian Derja 构造了从少样本文本生成、三模型筛选到方言语音克隆的完整增强链路,而非只做文本改写。

  2. 用同一 omni 模型和同一 LoRA 适配器联合覆盖意图与槽位任务,并系统比较零样本、真实语音微调、纯合成与真实+合成四种条件。

  3. 将模型大小与领域适配分离验证:3B—30B 模型微调后的意图差距从 23.9 个百分点收窄到 2.5 个百分点。

  4. 对盲测 60 标签开放集失败做了可解释的 unknown 映射,使拒识成为显式系统行为。

  5. 数据增强按‘文本语义正确—方言自然—语音声学合格’三层门禁逐步收窄:20,937 条候选经规则和投票剩 12,138 条文本,23,300 条克隆语音再筛成 22,940 条,便于定位污染发生在哪一层。

  6. 使用同一批 152 条零 WER 参考语音比较 VoxCPM 基座与方言 LoRA 版,把克隆参考差异固定下来,使增强收益更能归因于真实/合成混合而非任意说话人选择。

  7. 同时报告 CoER/CVER 与去标记后的 WER/CER,揭示‘Derja 转写正确但槽位标签错误’和‘槽位结构正确但词形错误’是两种不同失败,避免用单一榜单分数掩盖。

  8. 把已知低频意图增强与未知意图拒识拆成两个独立问题:前者通过频次倾斜生成补样本,后者只在正式测试输出层映射 unknown。这种拆分避免把规则带来的 35.7 点增益误算成训练模型的开放集学习能力。

选择文化相关生成而不是简单回译,意在补足方言语料的语用分布;voice cloning 让增强样本拥有语音形态,但可能引入合成伪影和说话人偏差。作者同时报告零样本、微调和正式榜单,便于区分模型能力与数据增强收益。

devtest intent accuracy 为 86.8%,WER 为 34.7;官方测试 slot filling CoER 为 59.5,意图识别准确率 66.1%,在 8 队中分别排名第 1 和第 4。

数据流是文本/语音输入、意图与槽位联合预测、合成样本扩充和评测排名。语音克隆把新增文本变成可听训练信号,模型同时处理语言内容和声学形式;训练结果用 intent accuracy、WER 与 CoER 等任务指标衡量。该 pipeline 把低资源语言覆盖、合成数据和 omni 模型能力放在一个可复用系统中。

📊 实验结果

训练条件Dev-test 意图准确率 ↑Dev-test CoER ↓
Qwen3-Omni-30B 零样本52.5131.0
Qwen3-Omni-30B 真实语音 LoRA82.947.7
Qwen3-Omni-30B 纯合成语音75.662.2
Qwen3-Omni-30B 真实+合成86.836.9

混合数据相对真实语音微调,意图准确率提升 3.9 个百分点,CoER 降低 10.8 点;纯合成虽优于零样本,却明显落后于真实语音微调,说明合成数据更适合补充真实分布,而不是替代真实分布。

正式盲测指标结果排名
意图准确率66.1%4/8
意图 weighted-F166.9
槽位 CoER59.51
槽位 CVER94.2

约 40% 盲测语音属于训练阶段未出现的意图;模型在盲测中把 56.8% 样本预测为 general_quirky,而 dev-test 只有 20.8%。把该类映射成 accepted unknown 后,意图准确率增加 35.7 个百分点。

使用 Qwen3-Omni-30B、原始与合成数据,任务为 NADI Shared Task 5;合成数据规模、voice cloning 模型、学习率、batch size、训练步数、GPU 和解码设置未完整说明。

🔬 细节详述

数据有多稀缺。 SLURP-TN 训练集为 2,677 条、2.78 小时;dev 为 595 条、0.74 小时;dev-test 为 893 条、1.06 小时;test 为 989 条、1.17 小时。训练中只有 21 个实际出现的意图,其中 6 类少于 10 条,且 3 类在 dev-test 完全缺席。

为什么零样本大模型输给小模型。 四个 omni 模型零样本意图准确率只有 29.2%—53.1%,CoER 为 97.5—150.1;完整微调的 Whisper-small 已达到 67.4% 和 81.4。任务格式、方言声学和槽位边界都需要领域适配,通用模型规模无法自动补足。

合成质量控制。 文本筛选和语音筛选分开进行,避免一句语言上自然的 Derja 因克隆失真直接污染训练;同样,语音听起来清楚也不代表意图与槽位正确。两级过滤是这条链路比普通 TTS 扩增更可信的关键。

开放意图是另一个任务。 dev-test 只覆盖已知的 23 标签空间,正式测试却扩展到 60 标签。general_quirky→unknown 是务实的赛制适配,但它依赖标签设计,不能视作模型已学会真正的开放集意图发现。

⚖️ 评分理由

  • 创新性 (1.4/2):[A_METHOD] 少样本生成、方言语音克隆和端到端 SLU 组合完整,单个组件并非全新,但针对 Derja 的工程闭环有明显增量。

  • 技术严谨性 (1.1/1.5):[A_RIGOR] 真实、合成、混合与零样本对照清楚;合成语音仍缺少人工方言质量评估。

  • 实验充分性 (1.2/1.5):[A_RESULTS] 报告 dev-test、正式榜单、多模型与数据消融,主要不足是增强实验只落在最大模型上。

  • 清晰度 (0.8/1):[A_CLARITY] 数据流和指标定义完整,开放标签映射需要读者特别留意,避免误读 66.1% 的来源。

  • 影响力 (1.0/1.5):[A_IMPACT] 对低资源阿拉伯方言和语音大模型适配有较强示范性,跨方言泛化尚未建立。

  • 开源 (1.0/1.5):[A_OPEN] 实验脚本已提供,合成数据承诺后续发布;核心材料接近可用但未全部到位;按锚点规则对应「核心产物可公开获取」。。

  • 可复现性 (0.3/0.5):[A_REPRO] 模型、硬件、轮次、生成数量与筛选规则披露充分,商业生成模型版本和合成数据状态带来漂移。

  • 工程/实践价值 (1.2/1.5):[A_ENGINEERING] 正式槽位任务第 1 名且链路可拆解复用,unknown 规则与合成成本仍需场景化评估。

🚨 局限与问题

  1. 主要消融集中在 dev-test,正式盲测只评估最终配置,无法确认每个增强环节在 60 标签开放集上的独立贡献。

  2. 训练和 dev-test 只有 23 个标签,而盲测采用 60 标签;这使已知类准确率与开放意图拒识混在同一分数中。

  3. 合成增强只在 Qwen3-Omni-30B 上完整验证,尚不清楚 3B/7B 小模型能否获得同等收益。

  4. 三模型投票能过滤明显文本问题,但没有母语者逐条听审;方言自然度、口音覆盖与克隆说话人偏差仍可能进入训练。

  5. 数据只覆盖 Tunisian Derja 的助手命令,不能直接外推到自由对话、其他阿拉伯方言或长语音。

  6. general_quirky 到 unknown 的确定性映射利用了赛制标签结构,真实产品还需要置信度校准和更细的拒识策略。


← 返回 2026-08-20 语音/音乐/音频论文速递