📄 Large Audio Language Models for Spoofing-Aware Speaker Verification
标签:#音频大模型 #语音伪造检测 #参数高效微调 #多任务学习 #音频理解
6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5
✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音伪造检测 | #音频大模型 | #参数高效微调 #多任务学习 | arxiv
👥 作者与机构
- 第一作者:Sofya Savelyeva(Applied AI Institute)
- 通讯作者:Dmitrii Korzh(AXXX, MTUCI)
- 作者列表:Sofya Savelyeva(Applied AI Institute)、Mariia Perunova(MIRAI)、Evgeny Kushnir(AXXX, HSE; Applied AI Institute)、Artem Dvirniak(MIRAI)、Dmitrii Korzh(AXXX, MTUCI)、Oleg Y. Rogov(AXXX, Applied AI Institute; MTUCI)
💡 毒舌点评
本文首次将大型音频语言模型系统性地引入欺骗感知说话人验证(SASV)这一重要安全领域,框架设计周密,实验消融详实,展示了通过组合多项损失和训练策略来平衡ASV与CM任务的有效路径。然而,论文在影响力上稍显克制——尽管在受控协议下取得了有竞争力的结果,但未与当前最优的强基线在官方基准上进行直接对比,且全部闭源,使得其宣称的“有前景的基石”难以被社区快速验证和跟进。此外,对模型生成推理链质量的“可解释性”声称,因缺乏系统的人类评估而略显空洞。
📌 核心摘要
本文解决的核心问题是:大型音频语言模型(LALMs)是否能被有效适应,以执行欺骗感知说话人验证(SASV)这一需要同时判断说话人身份和语音真实性的复杂任务。现有SASV系统主要是级联的ASV-CM融合管线,而LALMs虽然展示了在相关音频任务上的潜力,但其在SASV上的应用尚未被探索。本文提出的方法核心是:将SASV表述为配对音频推理任务,并对LALMs进行系统性的适应评估,包括零样本提示、监督微调(SFT)、带有AAM和反欺骗头的多任务损失优化、硬样本挖掘以及链式思维(CoT)推理监督和GRPO优化。与已有方法相比,新点在于首次系统研究LALMs用于SASV,并提出通过组合任务特定损失来优化ASV与CM之间的权衡。主要实验结果是:预训练的LALMs在零样本设置下接近随机水平(准确率~28-44%),但经过LoRA SFT和引入辅助损失后,SALMONN-7B模型在ASVspoof 5评估集上达到了89.30%的总体准确率和0.19的最低a-DCF,性能与强融合基线(如ECAPA2+W2V2-AASIST)相当或更优。实际意义是,LALMs经过适当适应可以成为统一的、可提供可解释推理痕迹的SASV系统基础。主要局限性是:1)论文完全闭源,未提供代码、模型或数据;2)与当前SOTA(如WildSpoof挑战赛中的顶尖系统)的直接对比不足;3)推理痕迹的质量未经人类验证;4)计算成本高昂。
关键实验结果表格
表I:LALMs在ASVspoof 5 SASV上的零样本与适应后性能对比
| 模型 | 设置 | 准确率 (%) |
|---|---|---|
| Qwen-Audio | 零样本 | 27.71 |
| Qwen-Audio | LoRA SFT | 85.45 |
| SALMONN | 零样本 | 43.75 |
| SALMONN | LoRA SFT | 85.84 |
表II:SALMONN-7B的适应策略消融及与基线的对比
| 配置 | 准确率 (%) | ASV准确率 (%) | CM准确率 (%) | EER ↓ | a-DCF ↓ |
|---|---|---|---|---|---|
| LoRA SFT ℒ1 | 85.84 | 80.52 | 96.47 | 0.13 | 0.26 |
| + ℒ2 (AAM Head) | 59.82 | 95.50 | 21.00 | 0.18 | 0.29 |
| + ℒ3 (Spoof Detection Head) | 86.73 | 90.10 | 80.01 | 0.16 | 0.20 |
| + Hard-sample mining | 89.30 | 86.53 | 97.19 | 0.22 | 0.19 |
| ECAPA2 + WavLM score fusion (基线) | 79.78 | 81.47 | 77.72 | 0.14 | 0.41 |
| ECAPA2 + W2V2-AASIST (决策树) | 86.67 | 84.07 | 88.46 | 0.13 | 0.32 |
| ECAPA2 + W2V2-AASIST (阈值) | 86.40 | 87.56 | 85.15 | 0.14 | 0.31 |
表III:在相同9K训练对上,传统融合、硬标签与推理导向SALMONN训练的对比
| 方法 | 准确率 (%) | ASV准确率 (%) | CM准确率 (%) |
|---|---|---|---|
| 传统融合 (ECAPA2 + W2V2-AASIST) | 72.00 | 83.19 | 61.19 |
| SALMONN 硬标签 | 86.02 | 93.83 | 86.78 |
| SALMONN CoT-SFT | 83.92 | 93.95 | 72.55 |
| SALMONN GRPO | 84.73 | 90.05 | 89.04 |
🔗 开源详情
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及具体的模型权重下载链接(HuggingFace/ModelScope等)。论文中提到了使用的基础模型为
SALMONN-7B和Qwen2-Audio-7B,但未提供其权重的直接获取链接。 - 数据集:论文中使用了以下数据集,但未提供具体下载链接或详细说明其开源协议。
ASVspoof 5(训练和评估集)VoxCeleb 2(用于补充真实语音数据)- 基于上述数据集构建的约180万对的训练样本集
- Demo:论文中未提及
- 复现材料:论文中未提及具体的训练代码、检查点或附录的链接。文中详细描述了模型架构(LoRA配置、损失函数、优化策略)和实验设置,但未提供可用于直接复现的材料。
- 论文中引用的开源项目:论文中引用了以下开源项目/工具,但未在文中给出其具体URL链接。
WavLM(用于特征提取/前端)Dasheng(通用音频编码器)ECAPA-TDNN(说话人验证模型)Wav2Vec2-AASIST(反欺骗/计数器措施模型)CoLMbo(说话人画像)emotion2vec(情感识别)Parselmouth(韵律描述符提取)RawBoost(数据增强)Step-Audio R1(用于生成推理标注的强推理模型)
🏗️ 方法概述和架构
本文提出一个将欺骗感知说话人验证(SASV)表述为配对音频推理任务,并系统性地适配大型音频语言模型(LALMs)的端到端方法框架。整体流程是:输入一对音频(注册音频和测试音频),经过LALM处理,输出三分类决策(目标/非目标/欺骗)以及可选的推理链,并通过监督学习、多任务损失和强化学习进行优化。
主要组件/模块详解:
- 音频编码与输入处理:系统使用两种不同的LALM架构:SALMONN-7B和Qwen2-Audio-7B。对于SALMONN,采用序列拼接法,将注册和测试音频波形中间插入1秒静默,合并为单个波形输入。对于Qwen-Audio,则利用其原生的多音频处理能力,将两个音频作为独立输入。音频统一重采样至16kHz,并应用了包括加噪(概率0.1,SNR 9-15 dB)、加混响(概率0.07)和RawBoost(概率0.07)在内的多种数据增强,且注册和测试音频的增强独立施加。
- 模型适配核心:LoRA微调与多任务损失:为了在保留模型通用音频知识的同时适应SASV任务,采用参数高效的LoRA(秩128, α=256, dropout 0.05)对注意力层进行微调。核心创新在于复合损失函数,由三项组成:
- ℒ1:标准的SASV三分类交叉熵损失,用于优化模型直接输出“目标”、“非目标”、“欺骗”决策的能力。
- ℒ2:用于增强说话人区分能力的Additive Angular Margin(AAM)损失,定义为 \[ \mathcal{L}_{2}=-\log\frac{e^{s\cos(\theta_{i,y_{i}}+m)}}{e^{s\cos(\theta_{i,y_{i}}+m)}+\sum_{j\neq y_{i}}e^{s\cos\theta_{i,j}}} \]。该损失作用于从音频条件化的QFormer特征中提取的说话人嵌入,仅对真实(bona fide)样本计算,以避免将欺骗样本拉入说话人流形。其作用是提升模型对同一说话人不同样本的识别能力。
- ℒ3:用于增强欺骗检测敏感性的二分类交叉熵损失,作用于一个独立的线性头,对嵌入进行“真实/欺骗”分类。 总损失为三项的加权和:\(\mathcal{L}=\lambda_{1}\,\mathcal{L}_{1}+\lambda_{2}\,\mathcal{L}_{2}+\lambda_{3}\,\mathcal{L}_{3}\),权重设置为\(\lambda_{1}=1.0\), \(\lambda_{2}=0.5\), \(\lambda_{3}=1.0\)。论文通过实验证明,仅使用ℒ1时欺骗检测能力强但说话人验证弱;加入ℒ2大幅提升说话人验证但严重损害欺骗检测;再加入ℒ3后恢复了欺骗检测能力,从而平衡了任务。
- 硬样本挖掘:在训练过程中,动态地聚焦于最具挑战性的样本对:困难阳性对(同一说话人但嵌入相似度低)、困难阴性对(不同说话人但相似度高)和困难欺骗对(嵌入最接近注册说话人的合成样本)。这迫使模型持续学习决策边界上的困难案例。
- 推理链监督与GRPO优化:为了利用LALM的生成和推理能力,论文构建了带推理链(CoT)的监督数据。使用更强的推理模型(Step-Audio R1)为训练样本生成推理痕迹,并通过严格筛选(要求模型正确预测且多次推理的理据一致)得到约90K条可靠数据。推理内容被设计包含由传统模型提取的可解释特征,如说话人画像(CoLMbo)、情感(emotion2vec)和韵律(Parselmouth)。在此数据上,分别进行了标准的链式思维SFT(CoT-SFT)和基于群组相对策略优化(GRPO)的强化学习训练,后者鼓励生成正确且格式规范(``,
<reasons>,<answer>)的答案。
下图展示了论文中为大型音频语言模型设计的不同提示变体。

图中从上至下分别展示了用于直接决策的单序列拼接提示、区分注册与查询音频的多音频提示,以及引导模型生成推理链的增强提示。
组件间数据流与交互:注册和测试音频经过预处理后,输入LALM的音频编码器(如SALMONN中的Whisper+BEATS编码器组合通过QFormer适配器)。编码得到的特征被送入语言模型主干。对于SFT模型,语言模型直接输出分类token的logits,用于计算ℒ1;同时,音频特征也被路由到两个辅助头(AAM头和欺骗检测头)分别计算ℒ2和ℒ3。所有损失反向传播更新整个模型(包括编码器和LoRA适配器)。对于CoT模型,语言模型输出包含推理链和最终答案的文本序列。
下图展示了本文提出的基于SALMONN的欺骗感知说话人验证模型整体架构。

图中清晰展示了注册和查询音频的输入处理流程、基于Whisper和QFormer的特征提取、用于辅助训练的AAM说话人头和欺骗检测头,以及最终输出三分类概率和可选推理链的完整数据流。
关键设计选择及动机:采用LoRA微调是为了高效适应大模型,避免全参数微调可能带来的过拟合和通用能力丧失。设计多任务损失是基于对SASV本质的理解——它是一个需要同时优化两个竞争性目标(说话人相似性 vs. 骗过检测器)的联合任务,单一的三分类损失难以同时达到最优。引入AAM损失是为了将说话人验证领域成熟的有效监督信号(角度间隔)注入生成式模型。构建CoT数据是为了探索LALM超越硬标签预测、提供可解释决策依据的潜力,但通过严格的过滤来对抗模型幻觉。
💡 核心创新点
- 首次系统性评估LALMs用于SASV:此前的研究分别探索了LALMs用于说话人验证(ASV)和欺骗检测(SDD),但从未专门针对需要联合决策的SASV任务进行系统评估。本文填补了这一空白,并明确指出了零样本LALMs在SASV上的无能,以及经过适应后的潜力。
- 提出面向SASV的复合多任务损失函数:针对SASV中ASV和CM两个子任务的竞争性,创新性地设计了由三分类决策损失、AAM说话人损失和二分类欺骗检测损失组成的复合目标。通过实验消融清晰地展示了各损失项的作用以及它们如何相互影响,最终通过组合解决了单一损失带来的性能不平衡问题。
- 将链式思维推理引入SASV并评估其效用:超越传统的硬标签分类,尝试让LALM为SASV决策生成自然语言推理依据。创新性地利用外部模型和传统特征(如说话人画像、情感、韵律)来构建和过滤推理监督数据,以减少幻觉。这是首次在SASV中系统研究显式推理监督的影响。
- 结合强化学习优化LALM的SASV推理:在推理监督的基础上,进一步应用GRPO进行策略优化,鼓励模型生成正确且格式规范的推理链,这是将强化学习应用于SASV任务的一次新颖尝试。
📊 实验结果
论文主要在ASVspoof 5评估集上进行实验,遵循其Track 2协议,并对比了多种基线。实验结果分别从零样本与适应后性能、适应策略消融、与强基线的对比以及推理监督的效果四个方面展开。
1. 零样本与适应后性能
表 I: 零样本与适应后LALM在ASVspoof 5 SASV上的表现
| 模型 | 设置 | 准确率 (%) |
|---|---|---|
| Qwen-Audio | 零样本 | 27.71 |
| Qwen-Audio | LoRA SFT | 85.45 |
| SALMONN | 零样本 | 43.75 |
| SALMONN | LoRA SFT | 85.84 |
2. 适应策略消融
表 II: SALMONN-7B的适应策略消融实验及与基线的对比
| 配置 | 准确率 (%) | ASV准确率 (%) | CM准确率 (%) | EER ↓ | a-DCF ↓ |
|---|---|---|---|---|---|
| LoRA SFT ℒ1 | 85.84 | 80.52 | 96.47 | 0.13 | 0.26 |
| + ℒ2 (AAM Head) | 59.82 | 95.50 | 21.00 | 0.18 | 0.29 |
| + ℒ3 (Spoof Detection Head) | 86.73 | 90.10 | 80.01 | 0.16 | 0.20 |
| + Hard-sample mining | 89.30 | 86.53 | 97.19 | 0.22 | 0.19 |
| ECAPA2 + WavLM score fusion [2] | 79.78 | 81.47 | 77.72 | 0.14 | 0.41 |
| ECAPA2 + W2V2-AASIST (decision tree) | 86.67 | 84.07 | 88.46 | 0.13 | 0.32 |
| ECAPA2 + W2V2-AASIST (threshold) | 86.40 | 87.56 | 85.15 | 0.14 | 0.31 |
3. 推理监督的效果
为确保公平评估推理监督,论文在更小、数据匹配的训练集(90K对)上进行了比较。
表 III: 在相同90K对上,传统融合、硬标签和推理导向SALMONN训练的测试结果对比
| 方法 | 准确率 (%) | ASV准确率 (%) | CM准确率 (%) |
|---|---|---|---|
| 传统融合 | 72.00 | 83.19 | 61.19 |
| SALMONN硬标签 | 86.02 | 93.83 | 86.78 |
| SALMONN CoT-SFT | 83.92 | 93.95 | 72.55 |
| SALMONN GRPO | 84.73 | 90.05 | 89.04 |
关键结论
- 任务特定适应至关重要:如表I所示,Qwen-Audio和SALMONN在零样本设置下性能接近随机水平。经过LoRA监督微调后,性能大幅提升,证明了将通用音频语言模型适配到SASV特定任务的必要性。
- 多任务损失成功平衡竞争目标:表II的消融实验表明,仅使用SASV三分类损失(ℒ1)时,模型在欺骗检测(CM)上表现优异,但在说话人验证(ASV)上较弱,存在任务不平衡。加入增强说话人区分能力的AAM损失(ℒ2)后,ASV准确率大幅提升,但CM准确率急剧下降,证实了任务间的竞争关系。进一步加入专门的欺骗检测损失(ℒ3)后,CM准确率得到恢复,同时保持了较高的ASV准确率,成功平衡了这两个竞争性子任务。
- 硬样本挖掘进一步优化:在平衡损失的基础上,结合硬样本挖掘策略,SALMONN系统达到了89.30%的最佳总准确率和0.19的最低a-DCF,在整体决策质量上优于重新实现的强融合基线。
- 传统基线在特定指标上仍具优势:尽管LALM系统在准确率和a-DCF上表现出色,但传统融合基线在等错误率(EER)指标上更优(0.13-0.14 vs. 0.22),表明其基于阈值的说话人区分能力更强。
- 推理监督未能一致提升硬标签性能:如表III所示,在数据量更少的设定下,硬标签训练的SALMONN取得了最高的总准确率。CoT-SFT获得了最高的ASV准确率,但CM准确率较低。GRPO在推理模型中提供了ASV与CM任务间最佳的平衡。所有SALMONN变体均显著优于同等数据上训练的传统融合基线。论文指出,推理监督的主要优势可能在于可提供可解释的决策痕迹,而非直接提升性能。
🔬 细节详述
- 训练数据:主要使用ASVspoof 5训练集。为增加真实语音数据,加入了VoxCeleb 2中的不重叠说话人。最终构建了约180万对注册-测试音频,涵盖500个说话人。音频预处理包括16kHz重采样、VAD裁剪、归一化,以及随机裁剪/填充至6-7秒(评估时使用前8秒)。
- 损失函数:如前述,复合损失\(\mathcal{L}=\lambda_{1}\,\mathcal{L}_{1}+\lambda_{2}\,\mathcal{L}_{2}+\lambda_{3}\,\mathcal{L}_{3}\)。权重设置为\(\lambda_{1}=1.0\), \(\lambda_{2}=0.5\), \(\lambda_{3}=1.0\)。ℒ2(AAM损失)仅应用于真实语音样本,其输入是音频条件化的QFormer特征经过均值池化后得到的说话人嵌入。
- 训练策略:使用AdamW优化器,学习率1e-5, warmup步数1000, 有效批大小1024, 训练10-20个epoch。LoRA秩128, α=256, dropout 0.05。音频编码器默认设为训练模式。
- 关键超参数:模型基于7B参数的LALMs(SALMONN-7B, Qwen2-Audio-7B)。LoRA秩、损失权重等如上。
- 训练硬件:未说明。
- 推理细节:评估时,将模型输出的“target”、“non-target”、“spoof”三个token的概率重新归一化,取“target”概率作为SASV分数\(s_{\mathrm{sasv}}=p_{\mathrm{target}}\),用于计算EER和a-DCF等阈值指标。对于推理导向模型,由于最终答案强烈依赖于前序推理链,其概率分布不适合作为校准分数,因此仅报告准确率。
- 评估协议差异:论文明确指出,与ASVspoof 5官方协议相比,本研究使用单条注册音频(而非三条),且由于LALM计算成本高,评估在原始评估集的20K对分层抽样子集上进行,这影响了结果与其它系统的直接可比性。
⚖️ 评分理由
创新性 (1.2/2):首次系统评估大型音频语言模型用于欺骗感知说话人验证,提出复合多任务损失平衡ASV与CM任务,并探索链式思维推理监督,方法新颖。
技术严谨性 (1.0/1.5):方法设计合理,但存在分数校准问题:将生成模型输出概率用作验证分数未经充分分析,可能影响阈值指标计算,构成算法逻辑漏洞。
实验充分性 (1.0/1.5):实验包括消融和基线对比,但评估协议与官方不同(单条注册音频、2万对子集),基线公平性存疑,泛化性未在野外数据测试,推理痕迹质量未验证。
清晰度 (0.9/1):论文结构清晰,方法描述详细,图表和符号使用合理,但可解释性推理链缺乏具体案例展示,影响部分理解。
影响力 (0.8/1.5):为SASV任务引入新范式,展示LALMs的适应潜力,可能推动统一音频验证系统发展,但实际部署受限于计算成本。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.3/0.5):论文描述了模型架构、训练配置、超参数和优化策略,但未说明训练硬件、完整复现步骤,评估协议差异影响可比性。
工程/实践价值 (1.0/1.5):系统设计端到端,集成多任务损失和硬样本挖掘,但计算成本高昂,未评估推理速度,限制实际应用效率。
🚨 局限与问题
论文明确承认的局限:
- 计算成本高:LALM系统需要的计算资源远高于传统融合模型。
- 推理痕迹未验证:生成的可解释性推理链未经系统的人类评估,其忠实度和有用性未知。
- 训练数据局限:推理监督数据量有限,可能限制了推理能力的进一步提升。
- 评估协议差异:使用了单条注册音频和2万对子集进行评估,与官方协议不同,影响了与其它系统的直接可比性。
审稿人发现的潜在问题:
- 分数校准问题:将LALM输出的分类token概率(\(p_{\mathrm{target}}\))直接用作连续验证分数,其统计特性(如分布、校准性)与传统ASV/CM分数截然不同。论文未分析这种分数分布对基于阈值的指标(EER、a-DCF)计算的影响,也未探讨可能的校准方法。这是将生成模型用于判别任务的一个根本性挑战。
- 基线公平性:虽然重新实现了基线,但训练数据规模(1.8M对 vs. 原始竞赛系统可能使用更多数据)和实现细节的差异可能使对比不完全公平。
- 泛化性存疑:实验集中在ASVspoof 5(主要反映特定TTS算法的攻击),未考察模型对录音条件、信道、说话人情绪等其他变异因素的鲁棒性,也未在“野外”数据上测试。
- CoT价值不明:推理监督和GRPO训练未能一致提升硬标签性能(表III),其主要价值可能仅在于可解释性。但论文未提供定性案例来展示这些推理链的实际质量,使其“可解释性”声称流于表面。