📄 Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

标签:#语音识别 #说话人日志 #多语言 #参数高效微调 #强化学习 #语音大模型 #低资源

7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5

7/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音识别 | #语音大模型 | #说话人日志 #多语言 | arxiv

👥 作者与机构

  • 第一作者:Hao Wu(上海期智研究院)、RongQi Han(上海期智研究院)(论文注明二者贡献均等)
  • 通讯作者:Hao Wu(论文中邮箱 wuhao@sqz.ac.cn 对应)
  • 作者列表:Hao Wu(上海期智研究院)、RongQi Han(上海期智研究院)、Zhen Wang(上海期智研究院)、Wei Liang(Megatronix (Beijing) Technology Co., Ltd)、Wei Xu(上海期智研究院)

💡 毒舌点评

亮点在于对Qwen3-ASR-1.7B进行了系统、多阶段的适应(SFT+LoRA+GRPO),特别是利用TTS合成数据增强来提升低资源语言识别,工程实现完整,实验覆盖全面。短板在于创新性以工程组合为主,缺乏对单一组件(如GRPO用于ASR)的深入机理分析,且核心系统完全未开源,限制了其作为领域基准的贡献。

📌 核心摘要

  1. 问题:解决MLC-SLM 2026挑战赛Task 1,即对多语言(21种语言/地区)双说话人对话语音进行说话人日志(SD)和自动语音识别(ASR),并以时间约束的排列混合错误率(tcpMER)进行评估。
  2. 方法核心:采用模块化前端(VAD、CAMPPlus说话人嵌入、光谱聚类)进行说话人日志和分段,后端对Qwen3-ASR-1.7B语音大模型进行三阶段适应:全数据监督微调(SFT)、基于TTS合成语音的LoRA微调、以及基于GRPO的强化学习微调。
  3. 与已有方法的区别:并非提出全新的单一模型,而是针对挑战赛特定场景(多语言双说话人对话),系统性地组合和优化了成熟的开源组件(如3D-Speaker、FunASR、Wespeaker、OmniVoice)和先进的微调技术(LoRA、GRPO),构建了一个完整的端到端处理流程。
  4. 主要实验结果:在官方开发集上,完整系统(SQZ-Qwen-ASR-1.7B)达到平均tcpMER 23.70,相比未微调的基线Qwen-ASR-1.7B(30.53)降低6.83个绝对点,优于Whisper-large-v3(29.94)和Omniasr-LLM-7B-v2(31.52)。在官方评测集上取得17.97的平均tcpMER。消融实验表明SFT贡献最大(30.53→24.3),合成语音LoRA和RL进一步带来提升。 表1:开发集关键对比结果(平均tcpMER,越低越好)
    系统平均 tcpMER
    Qwen-ASR-1.7B (基线)30.53
    Whisper-large-v329.94
    Omniasr-LLM-7B-v231.52
    SQZ-Qwen-ASR-1.7B (本文)23.70
  5. 实际意义:为多语言双说话人对话场景提供了一个经过验证的、可复现的系统构建方案,展示了如何有效地利用语音大模型和合成数据增强来应对低资源语言的挑战。
  6. 主要局限性:系统未开源;说话人日志模块与ASR模块仍是独立的,误差会传播;合成数据的质量和覆盖范围可能仍有局限;GRPO强化学习的收益在部分语言上存在回归;实验评估主要依赖开发集,最终评测集结果缺乏对比分析。

🔗 开源详情

  • 代码:论文中未提及代码链接
  • 模型权重:论文中未提及具体的模型权重(如HuggingFace、ModelScope)链接。论文提及了基础模型Qwen3-ASR-1.7B(参考文献[3]),并描述了其适配过程,但未提供适配后模型的下载地址。
  • 数据集:论文中未提供MLC-SLM 2026 Task 1训练集、开发集及评估集的具体下载链接或开源协议。仅提及该挑战的官方页面为 https://www.nexdata.ai/competition/mlc-slm[1],数据集可能需通过该页面申请。此外,在数据增强中提到了使用了Common Voice数据集[17]。
  • Demo:论文中未提及
  • 复现材料:论文中未提供检查点或附录等材料。但文中给出了详细的训练配置,可作为复现参考:
    • 全量微调(Full SFT):使用AdamW优化器,线性调度,预热比例0.02,权重衰减0,最大梯度范数1.0。训练4轮,峰值学习率 \(2 \times 10^{-5}\),每设备批大小8,梯度累积4,最大音频长度30秒。
    • LoRA微调:在文本解码器的所有28层的自注意力投影(q_proj, k_proj, v_proj, o_proj)中插入适配器(共112个线性模块)。秩r=64,缩放因子α=128,dropout=0.05。解冻音频投影器权重。训练5轮,峰值学习率 \(5 \times 10^{-5}\)。
    • GRPO强化学习:使用Group Relative Policy Optimization,每条语音输入采样K=2个候选转录,温度0.7,top-k=20,top-p=0.95。奖励函数基于WER/CER(自动选择),并包含重复(λr=0.10)和长度偏差(λl=0.10)惩罚。使用AdamW优化器,学习率 \(1 \times 10^{-6}\),无预热,权重衰减0,梯度裁剪1.0。有效批大小为256个提示(×K=2=512次rollout),最大提示长度512。KL正则化系数β=0.005。
  • 论文中引用的开源项目:
    • 3D-Speaker-Toolkit:参考文献[2],arXiv链接:arXiv:2403.19971
    • Qwen3-ASR:参考文献[3],arXiv链接:arXiv:2601.21337
    • LoRA:参考文献[4],ICLR 2022论文。
    • OmniVoice:参考文献[5],arXiv链接:arXiv:2604.00688
    • CAM++:参考文献[6],INTERSPEECH 2023论文。
    • Wespeaker:参考文献[7],ICASSP 2023论文。
    • FunASR:参考文献[8],arXiv链接:arXiv:2305.11013
    • Common Voice:参考文献[17],LREC 2020论文。
    • MLC-SLM 2026 Task 1 Official Baseline:参考文献[18],GitHub链接:https://github.com/alanshaoTT/MLC-SLM-2nd-Task1-Baseline

🏗️ 方法概述和架构

本文构建了一个端到端的模块化语音对话转录系统,整体流程为:原始音频 → 说话人日志与分段 → 基于语言的音频片段分组 → 适应后的ASR模型识别 → 文本后处理与评估。系统主要分为两大模块:说话人日志前端和多阶段适应的ASR后端。

  1. 说话人日志前端 该前端基于3D-Speaker工具包,采用经典的VAD-嵌入-聚类流水线。具体流程为:
  • 语音活动检测(VAD):使用FunASR中的FSMN-VAD模型,参数包括25ms帧长、10ms帧移、200ms窗口,后验阈值0.5,并应用了信噪比校正项(-0.1/0.3)来优化检测。
  • 说话人嵌入提取:使用CAM++模型(基于Wespeaker实践),从1.5秒的子片段(重叠率50%,即hop 0.75秒)中提取192维的说话人嵌入向量(输入为80维Fbank特征)。
  • 说话人聚类:采用光谱聚类算法,并根据挑战赛设定将说话人数量固定为2(min/max/oracle num spks=2)。关键参数包括合并余弦相似度阈值(mer cos = 0.8)、p值(pval = 0.012)、最小聚类大小(min cluster size = 4)。相邻的同一说话人片段在间隔小于0.8秒时可被合并(此步骤在评估中默认关闭)。
  • 结果生成:聚类结果被转换为RTTM格式的时间戳和说话人标签,并驱动后续的音频切割。
  1. 多阶段适应的ASR后端 识别核心基于Qwen3-ASR-1.7B,一个具有1.7B参数的语音-语言模型。其适应过程分为三个循序渐进的阶段:
  • 阶段一:全监督微调(SFT):在官方训练集上进行全参数微调,使模型适应挑战赛的转录风格和对话场景。训练采用AdamW优化器,学习率2e-5,线性预热(预热比例0.02),权重衰减0,最大梯度范数1.0,共4个epoch,每设备batch size 8,梯度累积4,最大音频长度30秒。
  • 阶段二:基于合成数据的LoRA微调:
    • 合成数据生成:设计了一个三管齐下的TTS合成框架,使用OmniVoice零样本语音克隆模型。管道包括:(1)文本扩展:利用LLM生成多轮对话文本,以真实录音为参考音色合成(166,633组);(2)直接说话人注入:用训练集数据生成伪标签,筛选掉与原标签相同的样本(32,700条);(3)相似性引导增强:从外部数据集(如Common Voice)中选取与训练集说话人嵌入余弦相似度(0.76-0.83)匹配的录音作为参考音色,合成对应真实标签的语音(35,000条)。总计产生234,333个合成训练项。
    • LoRA适应:在Qwen-ASR的文本解码器所有28层的自注意力投影(q_proj, k_proj, v_proj, o_proj)上插入LoRA适配器(rank=64, alpha=128, dropout=0.05),同时解冻音频投影器(proj1/proj2)的权重。使用合成数据训练5个epoch,峰值学习率5e-5。
  • 阶段三:GRPO强化学习微调:
    • 动机:进一步减少幻觉、重复等不稳定输出。
    • 奖励设计:设计了基于规则的奖励函数。精度奖励 \(R_1 = 1 - E(\hat{y}, y)\),其中 \(E(\cdot)\) 对空格分隔语言使用WER,对泰、日、韩语使用CER。附加重复惩罚 \(P_r\)(针对3-gram重复,权重 \(\lambda_r=0.10\))、长度偏差惩罚 \(P_l\)(权重 \(\lambda_l=0.10\),长度比容差0.25)。最终奖励 \(R = clip(R_1 - \lambda_r P_r - \lambda_l P_l, 0, 1)\)。当出现严重幻觉(长度比>2.0,唯一词元比<0.5,或重复n-gram/连续重复超限时)直接返回-1.0惩罚。
    • GRPO过程:对每个语音输入,策略模型采样K=2个候选转录(温度0.7, top-k=20, top-p=0.95)。根据计算出的奖励,利用GRPO算法(无评论家)估计优势函数,并更新策略,使用PPO风格的裁剪目标(裁剪率 \(\epsilon=0.2\))和对旧策略的KL散度正则化(\(\beta=0.005\))。训练使用AdamW优化器,常数学习率1e-6,有效batch size 256(K=2,共512个rollout)。

组件间交互:日志前端生成的RTTM标签驱动音频切割,切割后的音频按语言/地区分组后,由适配后的ASR后端进行批量识别。ASR后端的三个训练阶段是顺序进行的,前一阶段的结果作为后一阶段的起点。

关键设计选择:采用模块化而非端到端的日志识别耦合,便于独立优化和调试;选择Qwen3-ASR-1.7B作为基座,是利用其强大的多语言音频-语言建模能力;三阶段适应策略(SFT -> LoRA -> RL)遵循从粗到细、从对齐到优化的逻辑,旨在稳定且有效地提升性能。

💡 核心创新点

  1. 系统性的多阶段语音大模型适应框架:针对多语言双说话人对话这一特定且复杂的场景,设计了“全数据SFT -> 合成数据LoRA -> 强化学习微调”的三阶段递进式适应策略。SFT用于基础对齐,LoRA用于利用合成数据扩展覆盖,RL用于输出稳定性增强。这种分阶段、有侧重的策略比单一微调更精细。
  2. 面向多样性的三管齐下TTS合成数据增强:构建了文本扩展(增加词汇多样性)、直接说话人注入(增加已知领域说话人多样性)和相似性引导增强(引入外部说话人多样性)三个互补的合成数据生成管道,共产生超过23万条训练项,系统性地缓解了低资源语言和长尾场景的数据稀缺问题。
  3. 针对ASR输出稳定性的GRPO强化学习:创新性地将GRPO算法应用于ASR后处理阶段,并设计了包含精度、重复、长度和幻觉的复合规则奖励函数。这直接针对语音识别中常见的退化模式(如复读、幻觉输出)进行优化,而不仅仅是追求低错误率。
  4. 完整的模块化端到端系统构建:系统详细整合了多个开源组件(FunASR, CAM++/Wespeaker, 3D-Speaker, OmniVoice),并公开了其工程参数和流程。这提供了一个可参考的、落地性强的多语言对话系统实施方案。

📊 实验结果

本系统在 MLC-SLM 2026 Challenge Task 1 的官方开发集上进行了全面评估,采用官方评估协议下的时间约束排列混合错误率 (tcpMER) 作为主要指标。对于日语、韩语和泰语,使用字符错误率 (tcpCER);对于其他语言,使用词错误率 (tcpWER)。所有系统共享相同的说话人分离输出,差异仅体现在 ASR 模型部分。

下表(表2)展示了本文提出的完整系统 SQZ-Qwen-ASR-1.7B 与官方基线及其他对比模型在开发集上的详细对比结果。

表2:在开发集上的详细对比结果 (tcpMER,越低越好)

语言BaselineWhisper-large-v3Omniasr-LLM-7B-v2Qwen-ASR-1.7BSQZ-Qwen-ASR-1.7B
English-American77.3927.0628.5124.5523.64
English-Australian81.5019.5321.2216.4514.12
English-British67.6026.0327.9724.3222.99
English-Filipino63.3617.8321.3617.3716.18
English-Indian72.1215.7817.6615.3914.21
French-Canada78.5643.0948.4241.4639.70
French83.3941.2739.3632.7829.15
German84.2332.5041.4731.3829.37
Italian78.1624.7022.2718.4116.58
Japanese81.4641.7141.9230.4329.21
Korean81.3331.5833.2527.1725.14
Portuguese-Brazil73.0219.2622.7418.0913.07
Portuguese75.6434.5239.6535.9633.29
Russian83.8423.8722.4120.1918.27
Spanish-Mexico78.8113.4013.9910.078.46
Spanish82.5121.3121.3018.9517.76
Tagalog81.0932.9946.7549.4933.90
Thai83.6721.9119.9116.4614.38
Turkish92.9755.9861.4859.9956.02
Urdu89.6344.3634.18102.8419.77
Vietnamese71.8140.1636.0229.4122.52
tcpMER (Avg)79.1529.9431.5230.5323.70

下表(表3)展示了通过消融实验研究各 ASR 模型适应阶段对系统平均性能的贡献。

表3:在开发集上的消融实验结果 (tcpMER,越低越好)

系统tcpMER
基础 Qwen-ASR-1.7B30.53
+ 在官方数据上全监督微调 (Full SFT)24.3
+ 合成语音 LoRA 微调23.78
+ 强化学习精调23.70

关键结论分析:

  1. 整体性能:本文提出的完整系统 SQZ-Qwen-ASR-1.7B 在开发集上取得了 23.70 的平均 tcpMER,相较于未经微调的基线模型 Qwen-ASR-1.7B (30.53) 绝对降低了 6.83 个百分点,同时显著优于官方挑战赛基线 (79.15) 以及 Whisper-large-v3 (29.94) 和 Omniasr-LLM-7B-v2 (31.52) 等官方提供的对比系统。
  2. 语言表现:该系统在多数语言上都取得了最优或接近最优的成绩,尤其是在 乌尔都语 (Urdu) 上取得了巨大改进(从基线的 102.84 降至 19.77),表明合成数据增强对于极低资源语言效果显著。系统在 土耳其语 (Turkish) 上的表现 (56.02) 与 Whisper-large-v3 (55.98) 持平,仍是主要的难点语言。
  3. 训练阶段贡献:消融实验表明,全监督微调 (Full SFT) 是性能提升的主要驱动力,将平均 tcpMER 从 30.53 降至 24.3。合成语音 LoRA 微调 带来了一致的进一步提升(降至 23.78),尤其在基础模型表现较弱的硬语言上改善明显。最终的 GRPO 强化学习 阶段带来了边际但稳定的收益(降至 23.70),其主要作用是提升模型输出的稳定性,抑制长音频或噪声片段中的幻觉和重复。
  4. 最终评估集表现:根据任务排行榜,本系统在最终评估集上取得了 17.97 的平均 tcpMER。(论文未给出各语言在最终评估集上的具体数值。)

🔬 细节详述

  • 训练数据:
    • 官方数据:MLC-SLM 2026 Task 1训练集,约1500小时,涵盖21种语言/地区,录音为16kHz安静室内对话,提供神谕分段和说话人标签。
    • 合成数据:共234,333项,由OmniVoice模型生成。包括文本扩展(166,633组)、直接说话人注入(32,700条)、相似性引导增强(35,000条)。
  • 损失函数:
    • SFT和LoRA阶段:标准的交叉熵损失。
    • GRPO阶段:PPO风格的策略梯度损失(公式2),结合KL散度正则化。公式为:\(L_{PG} = -E_t [\min (\rho_t A_t, \text{clip}(\rho_t, 1-\epsilon, 1+\epsilon) A_t)]\),其中 \(\rho_t = \exp(\log \pi_\theta (a_t | s_t) - \log \pi_{\theta_{old}} (a_t | s_t))\)。
  • 训练策略:
    • SFT:AdamW优化器,学习率2e-5,线性预热(ratio 0.02),权重衰减0,最大梯度范数1.0,4个epoch,每设备batch size 8,梯度累积4,最大音频长度30秒。
    • LoRA:rank 64, alpha 128, dropout 0.05,仅LoRA适配器和音频投影器可训练,学习率5e-5,5个epoch。
    • GRPO:AdamW优化器,常数学习率1e-6,梯度裁剪1.0,有效batch size 256(K=2,共512个rollout),最大提示长度512,最大响应长度256,PPO裁剪率 \(\epsilon=0.2\),采样温度0.7,top-k=20, top-p=0.95,KL正则化系数 \(\beta=0.005\)。
  • 关键超参数:ASR模型基于Qwen3-ASR-1.7B,具有28层解码器;CAM++提取192维嵌入;光谱聚类固定为2个说话人。
  • 训练硬件:未说明。
  • 推理细节:ASR解码使用贪心解码(温度0),最大输出长度256 token。日志前端参数如前文所述。

⚖️ 评分理由

  • 创新性 (1.2/2):针对多语言对话场景系统性地集成并优化了现有组件(SFT+LoRA+GRPO)和合成数据增强,体现了工程组合创新。

  • 技术严谨性 (1.2/1.5):系统设计逻辑清晰、参数详细,但GRPO奖励函数权重(如λr、λl)及阈值依赖经验设定,缺乏原理分析或敏感性实验。

  • 实验充分性 (1.2/1.5):实验覆盖多语言基线对比和训练阶段消融,但缺少对关键子系统(如不同日志前端、合成数据管道)的单独消融及GRPO稳定性定量证据。

  • 清晰度 (0.9/1):论文结构清晰、图表有效,但TTS合成数据生成流程和GRPO奖励值分布等细节描述可以更详细。

  • 影响力 (1/1.5):直接解决多语言语音识别重要问题,在权威挑战赛取得竞争力成绩,对工程实践有参考价值,但方法通用性待验证。

  • 开源 (0/1.5):核心系统(代码、模型、数据)完全未开源且无承诺,仅依赖外部开源组件,严重限制社区验证和贡献。

  • 可复现性 (0.3/0.5):超参数设置详细,但缺少训练硬件环境(GPU型号、数量)和合成数据生成完整脚本,复现存在部分障碍。

  • 工程/实践价值 (1.2/1.5):构建了完整的端到端模块化系统,详细描述了从数据准备到推理部署的全流程和工程参数,具有高实践参考价值。

🚨 局限与问题

  1. 论文明确承认的局限:
    • 说话人日志(SD)和ASR模块仍然是独立的,日志错误会传播到识别阶段。
    • 合成语音数据的质量和在极低资源语言上的覆盖面可能仍有不足。
    • GRPO强化学习在某些语言(如土耳其语)上带来了轻微的性能回归。
    • 未尝试使用纯文本LLM进行ASR后纠错,因为担心过度纠错和幻觉。
  2. 审稿人发现的潜在问题:
    • 系统未开源:这是最大的问题,严重限制了论文结果的可验证性和对社区的直接贡献。在强调开放科学的今天,一个声称有竞争力的系统却不提供代码和模型,使其参考价值大打折扣。
    • 消融不完整:缺少对关键子系统的消融,例如:(1)不同说话人日志前端(如使用EEND等端到端模型)的影响;(2)三个TTS合成数据管道中,哪一个贡献最大?去掉一个会怎样?
    • GRPO作用分析不足:GRPO在平均tcpMER上仅带来0.08的微小提升,但论文声称其主要收益是“输出稳定性”。然而,论文并未提供定量证据来证明这一点,例如重复率、幻觉发生率在RL前后的对比。
    • 评估局限性:所有详细实验均在官方开发集上进行。虽然报告了在最终评测集上的数字(17.97),但没有相应的对比和分析,无法判断系统在未见过数据上的真实表现。
    • 合成数据细节模糊:尽管描述了三个管道,但“相似性引导增强”中对外部数据集的具体使用方式(是否直接使用音频?如何筛选?)描述不够清晰,可能影响对数据增强有效性的理解。

← 返回 2026-07-10 语音/音乐/音频论文速递