英文题目:Mixture of Spectral Experts for Audio Deepfake Detection

会议身份:conference:interspeech:2026:conference-paper-id:qiu26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#混合专家模型 #参数高效微调 #时频分析 #语音 #音频深度伪造检测

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yaxuan Qiu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhe Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Mieradilijiang Maimaiti:机构信息未能从会议 PDF 纯文本可靠映射
  • Zunwang Ke:机构信息未能从会议 PDF 纯文本可靠映射
  • Wushour Silamu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音频深度伪造检测需从波形判别真实与合成语音,难点在于神经声码器生成的赝品听感自然而仅残留细微幅度与相位畸变,预训练表征易忽略此类底层物理线索。该框架先由频率音频编码器(Frequency Audio Encoder,FAE)从短时傅里叶变换(Short-Time Fourier Transform,STFT)提取对数幅度与正余弦相位并经卷积压缩为物理线索序列,再以频谱专家混合(Mixture of Spectral Experts,MoSE)在冻结奇异基下对主干前馈矩阵中间矩阵做低秩门控适配,最后经交叉注意力(Cross-Attention)将物理线索与聚合后的主干上下文融合判决。相对直接微调或原始权重空间低秩适配,该设计将适配约束在预训练奇异方向的组合调制上并以输入相关路由分配专家。在ASVspoof 2019 LA评估设置下,Ours(MoSE-WavLM-FAE)的等错误率为0.29%,低于XLSR-53+ASP的等错误率0.31%。结论限于4秒英文朗读式欺骗与信道压缩场景,未验证多语种、长时对话与最新扩散式声码器的外推能力。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,哪些信息必须保留?

这篇解读的输入是论文正文与官方原图像素,目标是让刚进入语音与音频方向的研究生能复述方法并核对实验条件。输出必须保留任务定义、数据划分、模型分支、冻结与更新规则、融合方式、指标方向与关键数字,不做无源推断。

任务是音频伪造检测,也就是二分类:输入一段波形,输出它是真实录制还是合成或转换生成的假语音。这里的假不是加噪或压缩意义上的失真,而是神经语音合成与声码器生成的高度自然波形,人耳难辨,但生成管线可能留下低层物理痕迹。评价用等错误率与最小串联检测代价,前者是误接受与误拒绝相等时的错误率,越低越好,后者是结合说话人验证与反欺骗的串联代价,越低越好。

学习时只需记住一条主线:一个样本进来,先变成两种表示,再经适配与融合,最后得到一个分数。两种表示分别是预训练主干给出的高层上下文表示,和频率编码器给出的幅度相位低层表示。适配是指只动谱中间矩阵的低秩部分,不动预训练奇异基。融合是指用跨注意力把两类表示对齐。判决由分类器完成。后续各节按依赖展开,先讲已有路线缺口,再讲全景与组件计算,再讲训练与实验条件,最后讲结果、反证与复现。

已有路线在同输入同目标下做了什么,还缺什么?

在相同输入与相同二分类目标下,已有工作可分为 3 条路线。第一条是自监督预训练模型路线,用 wav2vec 2.0、XLS-R、WavLM 等提供鲁棒语音表示,再做微调、特征融合或混合专家。论文点名这类表示偏上下文语义,可能欠表示幅度不规则与相位失真等低层伪影。

第二条是频率特征路线,用线性频率倒谱系数、常数 Q 变换等频域特征捕捉频域伪影,或把 RawNet2 这类波形编码器与预训练模型融合。这条路线补了频域信息,但论文指出两点局限:相位建模不足,以及显式频域线索与高层上下文嵌入之间存在表示鸿沟,直接拼接不易有效利用。

第 3 条是参数高效微调路线,包括适配器与低秩适配等做法,在原始权重空间做加性更新,不显式控制预训练奇异方向的贡献。论文的安排理由正是对着这三点缺口:用显式幅度相位编码器补低层线索,用谱域混合专家在奇异值域做受控适配,用跨注意力弥合表示鸿沟。理解这层对照很重要,否则容易把该工作误读为又一个更大的预训练模型。它的增量不在主干规模,而在输入端补什么线索、在适配端动哪部分参数、在融合端如何对齐。

为什么幅度与相位值得单独建模?

从语音生成管线看,很多合成与转换系统先产生中间声学表示,再经声码器或波形生成模块重建波形,而准确的相位重建仍然困难,容易引入相位不一致。同时幅度谱的谐波结构也可能被平滑或模糊。论文用一张真假对比图把这种差异可视化:真样本的谐波更清晰,假样本出现模糊;瞬时频率模式上假样本更不规则。教学上可以把幅度理解为每个时频点有多大能量,相位理解为波形在该点的相对位置与连续性。只看幅度会丢掉连续性线索,直接用相位角又会遇到卷绕引起的不连续跳变,因此论文用正弦与余弦两个分量表示相位。

幅度 × 相位: 幅度分工是记录每个时频点的能量包络,用对数幅度刻画谐波模糊等能量异常;相位分工是记录声波到达时刻与波形连续性,用正余弦避免卷绕不连续;搭配理由是声码器从声学特征重建波形时两类失真常同时出现,组合意义是把 3 通道堆叠后联合编码,提供互补的伪造证据。

为确认上述动机不是空话,需要先看真假样本的谱图与瞬时频率对照,再进入方法细节与建模选择。

看图路径: 1. 先看上排左右梅尔谱图谐波纹理的清晰与模糊差异;2. 再看下排瞬时频率图中语音段内条纹规则与紊乱差异;3. 对照左右列同一时间轴确认可听自然但视觉纹理不同;4. 把模糊谐波与不规则模式记为幅度相位建模动机

原论文 Figure 1:Comparison of real (left) and fake (right) audio.

论文图 1。原论文 Figure 1:“Comparison of real (left) and fake (right) audio.”。

该图左侧为真实音频,右侧为伪造音频,上排为梅尔谱图,下排为瞬时频率模式。按图注与像素可见,上排假样本谐波纹理更模糊,下排假样本在语音段内出现更不规则的条纹。这支持论文把幅度与相位作为互补证据的判断,但它只是单样本示例,不能当作全数据集统计结论。后续频率编码器正是把这种观察变成可计算的 3 通道输入,并与主干表示互补。

一个样本如何走完输入到判决的全流程?

沿一个 4 秒音频样本走一遍。同一波形同时送入 3 条逻辑路径。中间偏左是冻结的 WavLM-Large 主干,先经卷积编码器得到帧表示,再逐层经过 Transformer 编码器,每层输出一个隐状态,最后对所有层做可学习加权求和得到主干聚合表示。右侧是频率音频编码器,对波形做短时傅里叶变换,算出对数幅度与相位的正余弦,堆叠后经 1 维卷积与深度可分离卷积编码,再投影到与主干相同的隐维度,得到频率表示。

中间是融合与分类器,以主干聚合表示为查询,以频率表示为键和值做跨注意力,融合后再经分类器输出真实或伪造。左侧细节是适配机制:每个 Transformer 层的前馈网络权重被谱混合专家并行调制,每相邻若干层共享同一组专家实例,以控制可训练量。

层分组共享 × 跨注意力融合: 层分组共享分工是让相邻若干 Transformer 层共用同一组谱专家低秩矩阵与门控参数以压缩参数;跨注意力融合分工是以主干层加权表示为查询、以频率编码器表示为键值做注意力加权;搭配理由是前者控制适配成本、后者弥合低层谱线索与高层上下文的表示鸿沟,组合意义是以较少可训练量完成对齐后再分类。

为建立整体位置感,下面先看总体架构图再拆解各个组件的计算细节与参数更新规则。

看图路径: 1. 从顶部同一波形输入出发追踪主干融合与频率三条分支;2. 确认左侧共享谱专家组如何嵌入前馈网络旁路;3. 观察中间融合分类器如何接收主干与频率两个输入;4. 核对右侧从变换到堆叠再到卷积的编码顺序

原论文 Figure 2:Overall architecture of the proposed audio deepfake detection framework.

论文图 2。原论文 Figure 2:“Overall architecture of the proposed audio deepfake detection framework.”。

该图顶部为同一波形输入,向下分出预训练主干、融合分类器与频率编码器三大框,左侧虚框显示共享谱专家组并联在前馈分支上,主干内部标出层加权求和得到最终表示,融合框标出双输入与分类输出,说明频率线索独立编码后再对齐。这种布局说明频率线索不是简单拼接到输入波形,而是独立编码后再在高层对齐。记住这条主路径后,再看频率编码器的具体计算与谱专家的参数规则就不会迷路。

频率编码器与谱专家各自算什么,如何配合?

频率编码器的计算分 4 步。第一步对输入波形做短时傅里叶变换,得到复数时频系数,记频率与时间索引下的复数值。第二步算幅度特征,取模长加小常数后取对数,保证数值稳定并压缩动态范围。第三步算相位特征,取相位角并在训练时加逐点随机扰动以提高鲁棒性,再分别取正弦与余弦,避免直接使用角度时的卷绕不连续。对所有时频点应用上述定义,得到幅度矩阵与两个相位矩阵。

第 4 步把三者沿通道堆叠成联合表示,经 1 维卷积压缩,再经深度可分离卷积捕捉通道内局部模式与跨通道融合,最后线性投影并转置到与主干一致的时间步与维度,供跨注意力使用。原文实现细节包括 25 毫秒窗、10 毫秒跳、512 点傅里叶变换,音频统一截断或补齐到 4 秒。

频率音频编码器 × 预训练语音模型: 频率音频编码器分工是显式拆出幅度与相位正余弦并做局部卷积编码,提供低层物理线索;预训练语音模型分工是提供高层上下文语音表示;搭配理由是前者补后者预训练中欠表示的生成伪影,后者提供鲁棒语义上下文,组合意义是经跨注意力把两类表示对齐融合后再判决。

谱专家的计算围绕前馈权重展开。对某层的前馈权重矩阵做完全奇异值分解,得到左基、中间矩阵与右基。微调时左右基冻结,只更新中间矩阵的专家相关低秩调制。具体做法是中间矩阵乘以单位阵加上低秩 2 矩阵乘积,其中低秩矩阵按层分组共享,同组内各层共享可训练矩阵与门控参数,但各层保留各自冻结的奇异基。给定某层的隐序列,单个专家的变换是先乘左基,再乘调制后的中间矩阵,再乘右基转置。门控是对隐序列做时间平均得到序列级向量,再经可学习门控向量与温度参数算 softmax 权重,最后把多个专家输出加权求和作为该层适配后的输出。

谱专家 × 路由器: 谱专家分工是各自学习对奇异值中间矩阵的一组低秩调制,刻画不同方向的伪造相关谱偏移;路由器分工是对输入序列做时间平均后计算每个专家的选择权重;搭配理由是单一低秩更新容量有限,组合意义是按输入动态加权多个专家的输出,实现输入相关的自适应谱适配。

奇异值分解 × 低秩适配: 奇异值分解分工是把前馈网络权重拆成左奇异基、中间奇异值矩阵和右奇异基,显式分离预训练方向;低秩适配分工是只用小瓶颈矩阵更新中间矩阵而不动两侧基;搭配理由是要保留声学先验又要控制可训练量,组合意义是在冻结基上学习奇异方向之间的任务相关交互。

为看清门控与冻结基的位置,下面先看谱专家模块图再回到融合侧的整体计算。

看图路径: 1. 先看底部输入如何同时送入专家与池化加路由器;2. 再看虚线权重如何指向顶部求和节点控制混合;3. 放大右侧虚框确认冻结基夹住中间低秩调制;4. 沿输入到专家再到加权输出走完一次前向过程

原论文 Figure 3:Architecture of the MoSE module.

论文图 3。原论文 Figure 3:“Architecture of the MoSE module. Spectral experts adapt the SVD middle matrix with low-rank updates while keep- ing the singular bases (Ul, V ⊤”。

该图底部输入同时进入多个谱专家与全局平均池化,池化后经路由器产生虚线权重指向顶部求和节点,右侧虚框放大显示左基、中间矩阵、低秩调制与右基的乘法顺序。这张图教学价值在于明确两件事:可训练的只是中间的低秩部分,两侧基不动;最终输出是多专家按输入相关权重的混合,而不是单专家硬选择。融合侧的计算是层加权聚合加跨注意力:先对各层输出做可学习加权求和,再以该聚合表示为查询、频率表示为键值做缩放点积注意力。原文只给出投影函数与维度的符号说明,未报告注意力头数与后续分类器层数等细节,这部分属于缺项,不从模型名推定。

哪些参数更新,监督信号从哪里来?

训练只在 2019 逻辑接入训练集上进行,不在跨数据集上再微调。冻结的是 WavLM-Large 主干的原始权重,包括经奇异值分解后的左右奇异基。可训练的包括谱专家的分组共享低秩矩阵、分组共享门控向量、路由温度在可学习设置下的标量、各层聚合权重、频率编码器的卷积与投影、跨注意力投影与分类器。论文报告完整模型约含 480 万可训练参数,专家数默认 4,分组大小为 2,即每相邻两层共享一个谱专家实例。

优化用 AdamW,学习率 10 的负 4 次方,权重衰减 10 的负 4 次方,余弦退火调度,训练 50 轮,批量 32。为处理类别不平衡,用加权交叉熵,真实类权重 0.9,伪造类权重 0.1。监督来源是训练集的真实与伪造标签,梯度经分类损失回传到融合模块、频率编码器与谱专家的可训练矩阵,不进入冻结基。相位扰动只在训练时施加,属于数据侧增强。

原文未报告所用硬件、训练时长、早停规则与随机种子,这是复现时的缺项。推理时音频同样定长到 4 秒,依次经主干、频率编码器、跨注意力与分类器得到判决分数,不需要额外的搜索或后处理。

在哪些数据与协议上测,条件是否一致?

训练集是 ASVspoof 2019 逻辑接入训练集。域内测试是 2019 逻辑接入评测集。跨数据集泛化测试直接用同一模型不经再微调,在 3 个更难的基准上测:2021 逻辑接入、2021 深度伪造与 In-the-Wild,覆盖信道变化、有损压缩与真实社交媒体场景。指标是等错误率与最小串联检测代价,两个都是越低越好。

比较对象包括传统谱特征与图注意力、原始波形与状态空间模型,以及基于自监督的混合专家、低秩适配与多层融合等系统。论文在主表与泛化表中列出这些基线的已报告数字,但未说明是否在同一代码与同一预处理下重跑,因此跨系统比较的公平条件只能按原文已报告值为准,不能视为严格同条件复跑。频率编码器的短时傅里叶参数、定长策略与主干冻结方式在实现细节中交代清楚,这是核对复现条件的关键。

资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,只能按论文文字复现结构与超参数。

主结果测什么,与谁比,数字支持什么判断?

本节对应原文第 7 节参考文献部分,整理支撑音频深伪检测框架的已有工作来源,包括自监督预训练模型、频率域特征与参数高效微调方法。原文引用了 wav2vec 2.0、WavLM、XLS-R 等预训练表示,以及线性频率倒谱系数、恒 Q 变换、RawNet2 等频率与波形编码器,还引用了适配器与低秩适应等参数高效微调工作,为频率音频编码器与谱专家混合机制提供背景依据,不新增原文之外的事实主张。

拿掉每个部件会怎样,专家数与温度如何选?

消融回答每个部件是否必要,以及专家数、分组与温度如何权衡。比较问题是在同一 2019 评测集与同一训练条件下,依次去掉频率编码器、谱专家或两者后,等错误率与串联代价如何变化,指标越低越好。下表按论文文字整理完整模型与 3 类移除条件的数字,另附基线模型以定位表示起点。

条件与指标完整模型去掉频率编码器去掉谱专家去掉两者与基线
2019 LA,等错误率0.29%0.51%0.45%0.72% 与 1.46%
2019 LA,最小串联代价0.00810.01440.01400.0238 与 0.0377
含义两者互补幅度相位线索有贡献冻结主干适配有贡献频率与适配缺一不可
跨集提示2021 LA 上 2.68%未单独报告未单独报告未单独报告
边界需结合超参数需结合专家数需结合分组大小基线为香草 WavLM

表后解释需要同时讲收益与代价。去掉频率编码器后错误率从 0.29% 升至 0.51%,串联代价从 0.0081 升至 0.0144;去掉谱专家保留频率编码器与冻结主干后错误率升至 0.45%;同时去掉两者后升至 0.72%,而单独的香草 WavLM 基线为 1.46%。这支持两者互补,但也说明代价是必须同时维护频率分支与谱适配分支,任一缺失都会损失。

超参数方面,专家数从 1 增至 4 在域内与 2021 逻辑接入上持续改善,增至 8 略有下降,提示 4 在该设置下权衡更好。分组大小从 2 增至 4 或 6 时域内退化,说明更激进的参数共享会压缩适配容量。

超参数对照需要回答专家数、分组与温度在什么条件下最优,指标方向仍是越低越好。下表把专家数、分组与温度放在同一框架下比较,便于 1 次看清权衡。

条件与指标专家数 1专家数 4专家数 8分组与温度对照
2019 LA 等错误率高于 0.29%0.29%略高于 0.29%分组 4 时 0.32%,分组 6 时 0.38%
2021 LA 等错误率高于 2.68%2.68%略高于 2.68%分组 4 时 3.24%,分组 6 时 3.47%
路由温度固定值0.1 时 3.01%1.0 时 2.77%5.0 时 2.93%可学习约 0.9831 时 2.68%
趋势专家过少容量不足当前权衡点专家过多略退化共享过多退化
适用条件仅在报告设置下默认 4 与分组 2需防过拟合可学习温度最优

路由温度的测试在 2021 逻辑接入上比较固定 0.1、1.0、5.0 与可学习温度,指标越低越好。为理解 U 形趋势与最优点,下面先看温度影响图再解释其适用边界。

看图路径: 1. 先确认横轴为路由温度纵轴为等错误率且向下为好;2. 比较固定温度三点折线的 U 形走势与最低点;3. 找到红色星形可学习温度点确认其低于折线;4. 读出各点旁标注百分比数值支撑温度选择结论

原论文 Figure 4:Impact of routing temperature τ on ASVspoof 21 LA.

论文图 4。原论文 Figure 4:“Impact of routing temperature τ on ASVspoof 21 LA.”。

该图横轴为路由温度的对数刻度,纵轴为等错误率百分比,向下为好。像素可见三点虚线折线呈 U 形,左侧 0.1 处标注 3.01%,中间 1.0 处标注 2.77%,右侧 5.0 处标注 2.93%,红色星形可学习温度约 0.9831 处标注最优 2.68%,位置低于折线最低点。这支持学习温度比所测试的固定值更能平衡专家贡献,但只在该数据集与该三点对照下成立,不能推广为温度越接近 1 越好。

哪些结论尚未验证,哪些边界没有测?

论文直接报告的是错误率与串联代价数字,支持的是幅度相位编码与谱适配互补的判断,未验证的推测需要分开表述。可能但待验证的是模糊谐波与不规则瞬时频率在多大比例的合成器上稳定出现,以及可学习温度接近 1 是否在其他信道下同样最优,这些都需要补分布级统计与多数据集重复。

未评测的边界包括推理延迟、内存占用、输出帧率与实际部署成本,原文未测量这些量,因此不能承诺该方法更快或更省。训练资源缺硬件型号与用时,统计方法缺方差与显著性检验,跨系统比较缺统一重跑条件,这些缺项不是技术错误,但限制了结论强度。相关性不等于因果:消融显示去掉部件后变差,支持部件有贡献,但不能反推拿掉后必然在所有数据上以同样幅度变差。

总体趋势不等于每组都成立的提醒在这里同样适用,2021 深度伪造上未胜出 MoLEx 就是具体反例。阅读时应把最强证据定位为域内与两个跨集上的最低已报告错误率,把最弱环节定位为跨集公平性与成本缺失。

要复现应先做什么,需要保留哪些超参数?

复现先做数据与预处理对齐。把音频统一到 4 秒,不足补齐、超长截断,短时傅里叶变换用 25 毫秒窗、10 毫秒跳、512 点。对数幅度加小常数,相位用正余弦双通道并在训练时加随机扰动,3 通道堆叠后经 1 维卷积、深度可分离卷积与投影到主干维度。主干用冻结的 WavLM-Large,对每层前馈权重做奇异值分解并冻结左右基,只训练分组共享的低秩矩阵与门控。

默认专家数 4,分组大小 2,可训练总量约 480 万,加权交叉熵权重真实 0.9、伪造 0.1,AdamW 学习率与权重衰减均为 10 的负 4 次方,余弦退火,50 轮,批量 32。融合侧保留层加权聚合与跨注意力投影的符号与维度对应,不自行补头数。先在 2019 训练集上训练,在 2019 评测集上核对 0.29% 与 0.0081 附近,再不经微调直测 2021 逻辑接入、2021 深度伪造与 In-the-Wild,核对 2.68%、3.89% 与 9.25% 附近。

若偏差大,优先检查定长策略、相位扰动开关、分组共享是否跨层错位,以及层聚合权重是否参与训练。代码与权重方面,本次没有可用资源状态依据,因此只能说按论文文字重建结构,不能声称官方代码或模型已公开可下载。

何时值得尝试这个方案,还需补哪项验证?

当主干已是强预训练语音模型但怀疑漏掉低层生成痕迹时,这个方案值得尝试。它的适用条件是能拿到复数谱并可算相位正余弦,且能接受额外频率分支与多专家门控的复杂度。若任务更偏语义或信道鲁棒而非声码器伪影,显式相位建模的收益可能变小,应先做小规模消融再决定。

复现后还需补三项验证:一是在统一预处理下重跑关键基线并报告多次运行方差,二是补充延迟与参数量的实测成本,三是在更多真实场景与新合成器上检验温度与分组选择的稳定性。常见误解是把冻结基误认为输出确定或训练更少就一定泛化更好,实际上冻结只限制更新子空间,泛化仍取决于线索是否跨分布稳定,2021 深度伪造的相对弱势已经提示了这一点。

记住这套分工:频率编码器负责补线索,谱专家负责受控适配,跨注意力负责对齐,分类器负责判决,缺一不可但各自代价不同。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总