英文题目:Nuha-Speech: Building General-Purpose Arabic Speech-LLMs

标签:#音频问答 | #指令微调 | #数据集 | #基准测试

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Yingzhi Wang:Elm Company, KSA
  • Reem Alhazzani:Elm Company, KSA
  • Muhammad Alqurishi:Elm Company, KSA

📌 核心摘要

输入为多方言阿拉伯语语音与文本指令、输出为纯文本回复,难点在于方言变异大且情感年龄等副语言标注稀缺。方法先整合MGB-2、MASC、SADA与Common Voice等多源公开语料,并用Qwen3-32B生成翻译与问答对、用ElevenLabs合成情感年龄语音,统一为语音指令输出三元组约150.1万条。接着采用两阶段课程先以约79万条ASR数据建立音频文本对齐,再以20万条ASR加71.1万条多任务数据在冻结音频编码器下以LoRA微调Qwen-Omni大语言模型,前阶段对齐输出直接作为后阶段语义与副语言泛化的基础。最后构建覆盖识别、翻译、问答、方言、情感、年龄与性别的七任务基准,以微调前后对比验证效果。相对仅支持三任务的Octopus,关键差异在于将ASR作为对齐基础后扩展到问答翻译与副语言多任务指令泛化,意义在于补齐可复现的阿拉伯语音指令数据与评测空白。在OUAAL基准测试集下,Nuha-Speech-7B的WER为34.91%,低于Qwen2.5-omni-7B的74.74%。该结论适用边界限于现代标准语与所覆盖方言及合成情感语音,跨方言零样本与真实情感泛化尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决什么学习依赖?

本文的输入是阿拉伯语语音,输出限定为纯文本回答,不做语音合成输出。目标是让一个语音大语言模型能用阿拉伯语听懂并执行多种指令,包括转写、翻译、按语音内容答题,以及判断方言、情感、年龄与性别。初学者可以这样理解学习依赖:语音大语言模型这个术语指能接收语音并调用大语言模型做推理的系统,英文为 Speech-LLM;语音问答式指令微调指把所有任务都改写成语音加文字指令加文字答案的形式再训练。

只有先建立语音到文本的稳定映射,模型才可能在后续步骤中理解更抽象的副语言属性,这就是为什么自动语音识别被设为第一阶段的主要目标。本文共构造约 1,500,000 条训练样本,基线选用 Qwen2.5-Omni-3B、Qwen2.5-Omni-7B 与 Qwen3-Omni-30B 3 个尺度,微调后分别称为 Nuha-Speech-3B、7B 与 30B。评测覆盖同样的 7 类任务,采用词错误率、BLEU 与句子相似度、大模型打分与分类准确率等不同指标。

需要保留的关键信息是数据多为公开集加透明合成策略,训练只更新语言模型侧的低秩参数,评测脚本与测试集宣称将通过 GitHub 公开,但本次核查该链接返回 404 当前不可用,不能写成已公开可用。

已有阿拉伯语语音路线覆盖了什么,还缺什么?

已有路线按同输入同目标对照可分为三支。第一支是 Octopus 家族,明确支持阿拉伯语的自动语音识别、阿拉伯语到英语语音翻译与方言识别,采用语义编码器加声学编码器的 Salmonn 风格架构。原文指出其任务覆盖很窄,缺乏零样本泛化,且依赖私有数据影响复现。第二支是 Qwen2-Audio 与 Qwen2.5-Omni,虽然底座编码器支持多语言,但公开演示与评测集中在英语与中文,阿拉伯语指令跟随能力未经证实。第三支是 Qwen3-Omni,明确把阿拉伯语列为 19 种语音输入语言之一,因此阿拉伯语理解起点更强。

教学例子:同样是听一段阿拉伯语新闻再回答问题,Octopus 路线可能只保证转写正确,通用语音大语言模型路线还要求能按开放式提问做跨句推理。原文强调两层稀缺:一是非转写任务的公开阿拉伯语料极少,情感识别与语音问答尤其明显,真正的阿拉伯语语音指令对几乎不存在;二是缺乏公认的阿拉伯语多任务评测基准,主流基准多源自英语数据。本文的定位不是提出新编码器,而是在有限资源下补齐数据、微调流程与基准三块基础设施。

为什么通用阿拉伯语语音指令跟随难做?

困难来自数据、评测与泛化三方面的耦合。数据侧,可用的阿拉伯语音频多集中在转写任务,年龄标注偏向成年与中年,情感与年龄等副语言标签天然稀少,若直接训练多任务模型会出现任务间样本极不均衡。评测侧,没有统一的阿拉伯语语音多任务基准,不同任务需要不同指标,转写看词错误率,翻译既看词面重叠又看语义相似,开放问答需要大模型裁判,副语言任务用准确率且把越界回答直接判错,指标方向与聚合对象各不相同。

泛化侧,指令措辞若过于单一,模型容易过拟合到固定提示词,原文因此用 GPT-5 为每任务构造多样化指令集以支持零样本调用。另一个隐含约束是可复现性:若训练依赖私有音频或不透明合成,他人无法重走流程,所以原文强调尽量用公开集与透明合成。若把问题简化为只做转写,就无法检验对方言、情感与多轮推理的理解,这正是本文坚持七任务并行训练与评测的原因。

Nuha-Speech 全景:一个样本如何走完输入到输出?

先沿一个样本走完全程。假设输入是一段 1 到 10 秒的阿拉伯语语音与一条文字指令,例如请转写或请判断说话人情绪。语音先进入冻结的音频编码器得到语音表示,文字指令与语音表示一起送入语言模型,语言模型只输出文本答案,不输出音频。训练目标是让输出文本与参考答案一致,所有任务共享这一问答式接口。

语音大语言模型 × 语音问答语料: 语音大语言模型负责把语音输入映射为文本回答并执行指令,语音问答语料负责把自动语音识别、翻译、问答、方言与情感等异构任务统一为{语音,指令,输出}三元组;二者搭配的理由是只有统一语义空间才能让一个模型做多任务指令跟随,组合后新增的作用是让副语言标签任务也能用自然语言指令调用。

全景分为 3 段:先构造约 1501K 三元组语料,再按 2 阶段课程微调 Qwen-Omni 不同尺度,最后用统一多任务基准对比微调前后。自动语音识别样本约 790K 条,来自 MGB-2、MASC、SADA 与 Common Voice 并剔除 1 秒以下与 10 秒以上片段;翻译任务在 CoVoST-v2 阿英小集合外另从识别集抽取 150K 条经 Qwen3-32B 翻译转写得到;问答任务基于 MGB-2 转写生成 150K 条封闭式与 150K 条开放式;方言任务从 ADI-17 抽取 150K 条。

情感用 ElevenLabs 情感转换语音合成 20K 条;年龄与性别结合真实抽取与合成补齐;多轮问答包括基于 SADA 性别年龄转写合并的 5K 条与基于情感转写的 10K 条跨模态推理。评测侧同样 7 个任务,但音频来源与指标独立设计,避免用训练集直接当测试集。

七类任务各自提供什么监督信号?

7 类任务按监督性质可分为语义理解与副语言 2 组。语义组包括自动语音识别、自动语音翻译与单轮语音问答。识别提供最稠密的逐词对齐监督,是后续理解的基础;翻译提供跨语言语义保持监督,英文为目标语言更贴合实际工作流;问答提供事实检索与跨句推理监督,其中封闭式侧重结构化查询与精确定位,开放式侧重表达与推理。

自动语音识别 × 自动语音翻译: 自动语音识别分工是把阿拉伯语语音转写为同语言文本,建立音频到文本的基础对齐,自动语音翻译分工是把阿拉伯语语音映射为英语文本,考验跨语言语义保持;搭配理由是翻译样本部分复用识别转写再经文本翻译得到,组合意义在于先用大规模识别稳定声学映射,再用翻译扩展语义泛化。

副语言组包括方言识别、语音情感识别、年龄识别与性别识别。方言分类覆盖 17 类,年龄分为 18 岁以下、18 到 60 岁与 60 岁以上 3 组,性别为男女 2 分类,情感为愤怒、高兴、悲伤与中性 4 分类。年龄任务从 SADA 与 Common Voice 取出全部可用的年轻与年长样本再补足成年样本至 10K 条真实样本,另用同一语音合成模型为 3 组各合成共 10K 条,每组用 10 个不同说话人;情感合成每类用 8 个说话人并开启风格夸张与说话人相似度控制以减少说话人偏置。

方言识别 × 语音情感识别: 方言识别分工是判断 17 类阿拉伯方言中的类别归属,关注发音与词汇的地域变异,语音情感识别分工是判断愤怒、高兴、悲伤与中性 4 类情感状态,关注韵律与音色;搭配理由是二者同属副语言任务且基线模型在阿拉伯语上都较弱,组合意义是共同检验模型是否真正听懂了文本之外的说话人属性。

多轮任务把孤立标签串成对话。基于 SADA 的 5K 条把性别、年龄与转写合并为语音分析式多轮问答,另 10K 条情感推理先问情感再问转写最后问情感与内容是否一致。

多轮语音问答 × 情感推理: 多轮语音问答分工是把性别、年龄与转写等孤立标签串成连续分析对话,情感推理分工是先识别情感再转写内容最后判断情感与内容的跨模态关联;搭配理由是单轮分类不能考察上下文保持与模态对照,组合后新增的是对复杂口语场景的鲁棒性与可解释的推理链条。

所有样本输出均为文本,副语言任务越界回答按错分类处理,这保证了准确率指标的严格性。

两阶段课程如何安排冻结、数据与超参数?

训练采用 2 阶段课程。第 1 阶段只做自动语音识别,目的是先建立牢固的音频到文本映射;第 2 阶段做全部任务,但把识别样本从 790K 条降为随机抽取的 200K 条子集,其余约 711K 条为其他任务,这样既保持识别能力又平衡任务并节省时间。编码器侧原文明确写出所有基线的音频编码器已能处理阿拉伯语音,因此 2 阶段都冻结编码器,只用低秩适配训练语言模型。Qwen2.5-Omni-3B 与 7B 走完第 1 个阶段 3 轮与第 2 个阶段 2 轮。

Qwen3-Omni-30B 因在阿拉伯语识别榜单上已具竞争力而跳过第 1 个阶段,直接做第 2 个阶段。超参数按原文交代:3B 与 7B 全局批量 16,30B 批量 8,学习率均为 1e-4,30B 的混合专家路由负载均衡损失系数为 1e-3,低秩秩为 8,缩放系数为 32 并作用于所有线性层。需要指出的缺项是原文未报告优化器类型、学习率衰减、预热步数与具体硬件时长,不能从模型名推定这些实现。

冻结音频编码器 × 低秩适配微调: 冻结音频编码器分工是保留基线模型已具备的阿拉伯语音处理能力并不更新其参数,低秩适配微调分工是只在语言模型侧的所有线性层插入秩为 8 的小参数增量进行学习;搭配理由是稳定训练并降低显存与时间开销,组合意义是在不破坏声学前端的前提下让语言模型学会阿拉伯语指令跟随。

下表是原文给出的课程原文结构,阶段、任务、数据、更新模块与轮数一一对应,阅读时先看阶段目标再看数据量变化。

StageTaskDataModule#Epochs
1ASRASR-790KLLM (Lora)3
2AllASR-200K Others-711KLLM (Lora)2

该课程的核心代价是第 2 阶段仍保留 200K 条识别样本以防遗忘,但识别与其他任务的比例仍需权衡;跳过 30B 第 1 阶段的前提是其预训练已足够强,这一判断依赖外部榜单而非本文消融,不能推广为所有大模型都可跳过。

评测测什么、与谁比、条件是否一致?

评测问题是微调前后在同样 7 任务上是否一致提升,以及不同尺度模型的起点与增益有何差异。比较对象是每个尺度的原始基线与对应微调版本,属于同架构同尺度的前后对比,另有一段文字说明曾试过同为 7B 的 Qwen2-Audio-Instruct 做同样微调但全面弱于 Qwen2.5-Omni-7B 微调版,因此未列入最终基准表。指标方向需记牢:转写词错误率与字错误率越低越好,翻译 BLEU 与基于 Gemma 嵌入的句子相似度越高越好,问答大模型打分 0 到 3 分越高越好,方言、情感、年龄与性别准确率越高越好。

问答测试由 SD-QA 阿拉伯语文本问答的上下文经 XTTS-v2 以 58 个说话人合成,再经 Whisper-Large-v3 转写并按字错误率过滤得到 1,237 条高质量语音;翻译用 CoVoST-v2 阿英测试集;转写用开放通用阿拉伯语识别榜单的多方言基准;方言直接用 ADI-17 测试集;情感另合成 1.1K。

年龄混合 Common Voice 测试集与合成;性别取 Common Voice 的 2,000 条均衡样本。下表先提出比较问题:在数据来源与指标各不相同的情况下如何公平读数,答案是只做同任务同测试集的前后对比,不跨任务比绝对值。

TaskData SourceMetric#Samples
ASROUAALAverage WER47K
SQASD-QA-SynLLM as Judge1.2K
ASTCoVoST-v2Blue Sentence-Similarity2.3K
DIADI-17Accuracy12K
SERSynthesized SpeechAccuracy1.1K
ARCommon Voice Elevenlabs-SynAccuracy1.2K
GRCommon VoiceAccuracy2K

该配置表的价值是明确每个数字的聚合对象与样本量,避免把词错误率的下降与准确率的上升混为一谈;限制是问答与情感测试含合成语音,可能与合成训练数据同分布,泛化到真实录音的效果待验证。

测试集规模本身也是复现条件,下表把原文连续句中报告的各任务测试量整理为宽表,便于核对划分是否与训练重叠,阅读时注意单位与精度均按原文保留。

任务数据来源样本量备注
自动语音识别开放通用阿拉伯语识别榜单46,7576 个数据集多方言聚合
自动语音翻译CoVoST-v2 阿英测试集2.3K词面与语义双指标
语音问答SD-QA 合成语音1,23758 说话人合成后过滤
方言识别ADI-17 测试集12,15017 类均匀分布
语音情感识别另合成情感语音1.1K4 类均衡
年龄识别Common Voice 加合成1.2K3 组均匀
性别识别Common Voice 测试集2,000男女均衡

上表把分散在正文中的测试规模集中呈现,主要收益是复现时能快速核对是否拿对划分,代价是合成测试可能高估情感与问答的真实表现,且原文未报告置信区间与显著性检验。

训练语料构成同样需要可核对,下表用原文连续句中的数字整理各任务来源与量级,重点看识别是大头而副语言多靠抽样与合成补齐。

任务组来源与构造训练量级关键处理
自动语音识别4 个多方言公开集790K剔除 1 秒外与 10 秒外
自动语音翻译CoVoST-v2 加识别集翻译150KQwen3-32B 翻译转写
语音问答MGB-2 转写生成150K 封闭加 150K 开放Qwen3-32B 生成问答对
方言识别ADI-17 抽样150K17 类分类
语音情感识别ElevenLabs 合成20K4 类均衡多说话人
性别识别SADA 抽取51K男女均衡
多轮问答SADA 合并加情感推理5K 加 10K跨任务串接与跨模态推理

该语料表的收益是展示了在资源受限下用公开集加透明合成拼出 1501K 的路径,代价是翻译与问答依赖同一文本大模型生成,可能引入模型偏置且未做人工质量审计。

微调前后哪些变了,哪些没变?

要回答的核心问题是 3 个尺度是否都在七任务上超越各自基线,以及语义任务与副语言任务的增益是否对称。原文报告的结论是全部微调模型在全部任务上均优于基线,3B 与 7B 提升更显著,30B 因预训练语义已强而增益较小;从任务看副语言任务的相对增益大于语义任务,提示预训练对阿拉伯语副语言覆盖不足。具体机制上,3B 与 7B 的转写能力大幅改善,30B 保持原有扎实转写;翻译的 BLEU 与相似度均为 30B 微调版最好。

问答平均分基线均超 2 分,微调后 7B 略优;方言与年龄基线接近随机猜测,微调后成倍提升且 30B 仍居首;情感与性别基线已有一定基础,微调后达优秀水平。下表是包含必要基线与实际可运行微调策略的数字结果宽表,阅读时必须同列对比、注意转写越低越好而其余越高越好,不能把不同指标的差值混算。

模型翻译 BLEU 越高越好翻译语义相似度越高越好问答打分 0 到 3 越高越好方言准确率越高越好情感准确率越高越好年龄准确率越高越好性别准确率越高越好
Qwen2.5-Omni-3B 基线39.270.8132.309.7051.9341.7560.55
Nuha-Speech-3B48.320.8842.6057.8388.1483.0098.85
Qwen2.5-Omni-7B 基线42.080.8362.3713.6672.1433.3386.30
Nuha-Speech-7B50.600.8962.6672.6586.6473.0099.50
Qwen3-Omni-30B 基线48.710.8892.5916.7880.2342.6782.25
Nuha-Speech-30B51.730.9082.6276.0284.8885.7594.30

该表的主要收益是副语言任务的多倍提升,例如方言与年龄从接近随机到 70% 以上,代价与反例同样明显:30B 的转写字错误率从 13.67 变为 14.55 出现轻微上升,性别上 30B 微调版 94.30 低于 7B 微调版 99.50,说明总体趋势不等于每项每步都最优;此外 3B 基线的转写缺失以横线报告,不能补算差值。百分点与相对百分比含义不同,阅读增益时应保留原文单位写法。

若换基线或减阶段会怎样,有什么失败条件?

原文没有给出逐任务消融的独立数字表,但提供了两条可复述的对照与失败条件。第一条是基线选择对照:同为 7B 量级,Qwen2-Audio-Instruct 在同样语料上微调后全面弱于 Qwen2.5-Omni-7B 微调版,因此被排除在最终基准之外。这支持选择更新的 Omni 架构而非仅看参数量,但原文未列出具体每任务数值,不能量化差距。第二条是阶段取舍:30B 跳过纯识别第一阶段仍取得最好翻译与方言表现,支持强预训练下可省去第一阶段的判断;反之 3B 与 7B 走完全程才补齐转写,说明弱起点仍需第一阶段打底。

失败条件方面,副语言准确率把越界回答判错,若指令不清晰或模型输出格式漂移会直接拉低分数;问答依赖 LLaMA-3.3-70B 裁判从相关性、正确性与简洁性打分,自动裁判偏好可能与人工判断不一致。训练层面只更新语言模型而冻结编码器,若编码器本身对方言口音覆盖不足,微调语言模型难以完全弥补,这一点原文未做编码器解冻对照,属于待验证的边界。

哪些结论有边界,哪些量没有被测量?

需要区分直接报告、有限解释与未验证推测。直接报告的是七任务前后对比的提升方向与大致幅度;有限解释的是副语言增益更大提示预训练覆盖不足,这只是相关性而非因果证明;未验证的是合成情感与合成问答能否代表真实录音分布。数据边界上,翻译与问答大量依赖 Qwen3-32B 生成,合成情感依赖 ElevenLabs 转换,均未报告人工抽检误判率。

年龄真实样本偏向成年,年轻与年长多靠合成补齐。评测边界上,问答测试经合成与过滤,情感测试与训练同合成策略,可能存在同分布高估;未测量推理延迟、显存占用、输出帧率与实际部署成本,不能承诺这些量得到改善。资源边界上,宣称公开的评测脚本与测试集链接本次核查返回 404 当前不可用,第三方 ElevenLabs 博客与 sacrebleu 链接本次可达,但这不改变主仓库不可用的事实。总体趋势不等于每组都成立,已见 30B 字错误率与性别项的反例,引用时应同时保留未胜出项。

要复现应先做什么,需要保留哪些条件?

复现先做数据核对而非直接训练。第一步按训练语料表找回 MGB-2、MASC、SADA、Common Voice、CoVoST-v2 阿英子集与 ADI-17 的对应划分,并执行 1 到 10 秒过滤;第二步用 Qwen3-32B 复做 150K 条翻译与 300K 条问答生成,记录温度与提示词以便比对;第三步用同一语音合成配置复做情感 20K 条与年龄合成 10K 条,保留说话人数量与风格夸张设置。训练复现需保留冻结编码器、只训练语言模型低秩参数、秩 8 与系数 32 作用于所有线性层、学习率 1e-4、3B 与 7B 批量 16 按 2 个阶段 3 加 2 轮、30B 批量 8 只做第 2 阶段及混合专家负载均衡系数 1e-3 等条件。

评测复现需保留榜单的 46,757 条多方言聚合、CoVoST-v2 的 2.3K、问答的 58 说话人合成加 Whisper 转写过滤得 1,237 条、方言 12,150 条、情感 1.1K、年龄 1.2K 与性别 2,000 条的划分,以及 BLEU 用 sacrebleu、语义相似用 Gemma 嵌入、问答用 LLaMA-3.3-70B 裁判 0 到 3 分的流程。代码开源、权重下载与系统可运行是 3 件不同的事:即使论文给出方法细节,主仓库当前不可用仍意味着不能一键运行,需自行拼接脚本。

何时值得尝试这条路线,还需补哪项验证?

当任务是阿拉伯语多方言转写加翻译加问答加副语言属性的统一指令跟随,且只有公开集加可控合成可用时,这条先识别打底再多任务平衡、冻结编码器只调语言模型的路线值得尝试;若只有单一转写需求或已有强方言编码器,则不必照搬全套多轮问答。复现后还需补三项验证:一是用真实录音重测情感、年龄与问答,检验合成到真实的迁移;二是补人工评测对照大模型裁判,检验问答分数是否虚高。

三是补编码器解冻与指令多样性消融,检验冻结策略与 GPT-5 指令集的真实贡献。记住关键信息条件:输出限文本、指标方向各异、30B 可跳过第一阶段仅适用于强起点。最终判断应表述为报告显示微调在所测七任务上全面改善,支持该数据与课程设计有效,但合成偏置与部署成本可能待验证,不做超出证据的承诺。

📎 论文与评分元数据

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-12 语音/音乐/音频论文速递