📄 Teffic-Audio: Tell Fact from Fiction
标签:#语音伪造检测 #对抗训练 #鲁棒性 #基准测试 #模型比较
6.8/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5
✅ 6.8/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音伪造检测 | #对抗训练 | #鲁棒性 #基准测试 | arxiv
👥 作者与机构
- 第一作者:Wan Lin(未说明)— 根据原文,作者列表为“Amphion Team”,具体为:Wan Lin, Li Wang, Jindong Wang, Kunyu Feng, Zhizheng Wu。机构均未明确说明。
- 通讯作者:未说明
💡 毒舌点评
这篇报告用一个"朴素"的Conformer架构,靠着一套精心设计的"数据食谱"(多源数据整合、攻击源平衡采样、多样音频增强),在Speech-DF-Arena排行榜上拿下了第一。它有力地证明了在语音伪造检测中,好的训练数据分布有时比花哨的模型架构更重要。然而,短板同样致命:系统完全闭源,代码和模型权重一概欠奉,仅有一个demo页面供人"瞻仰",这让1.454%的EER看起来更像是一个诱人但无法检验的广告。训练超参数等关键细节的大量留白,使得独立复现几乎成了"不可能完成的任务",削弱了其作为公共基线的价值。
📌 核心摘要
论文提出了Teffic-Audio,一个面向通用语音深度伪造(Deepfake)检测的系统。其目标是在一个由14个异构测试集组成的综合评估环境(Speech-DF-Arena)中实现稳定的泛化能力,这些测试集覆盖了语音合成(TTS)、语音转换(VC)、声码器重建、神经编解码重合成等多种攻击。方法核心并非提出新架构,而是采用了一种"强训练配方驱动"的思路。系统架构本身是标准的:由w2v-BERT 2.0初始化的Conformer编码器、多头部注意力统计池化(MHASP)和一个二分类器组成。其性能提升主要归功于训练策略的设计,包括:整合多源公开语音深度伪造数据集与真实语音数据集、以攻击生成器为单位进行平衡采样以均衡数据分布、以及引入一套涵盖录音、声学环境、传输和平台压缩的多样音频增强方案。在Speech-DF-Arena排行榜上,该系统仅使用开源数据训练,便以1.454%的pooled EER位列所有已公开系统第一名,并在5个单独测试集上取得了最低EER。消融实验证实,多样音频增强是实现性能跃升的最关键因素,尤其是在处理复杂信道和编码场景时。该工作为构建强泛化能力的语音深度伪造检测器提供了"标准架构+强训练配方"的实证范本。其主要局限是完全闭源,且训练细节披露不足,影响了结果的可验证性和直接复现性。
🔗 开源详情
- 代码:论文未提及,也未提供任何代码仓库链接。
- 模型权重:论文未提及,也未提供任何权重下载链接。
- 数据集:论文使用了大量公开的语音深度伪造检测数据集用于训练和评测,但这些数据集均非作者发布。论文未提供数据集下载链接。
- Demo:https://tefficlabs.com/teffic-audio
- 复现材料:无。论文中未提供预训练模型检查点、详细的训练配置文件或任何可直接用于复现的物料。论文描述的系统架构和训练配方可供参考。
- 论文中引用的开源项目:
- Speech‑DF‑Arena:https://huggingface.co/spaces/Speech-Arena-2025/Speech-DF-Arena
- w2v‑BERT 2.0(仅提及模型名)
- RawBoost, Conformer, WavLM, XLS‑R 等方法或模型(仅作为基线或组件在文中提及,未提供链接)
🏗️ 方法概述和架构
Teffic-Audio 采用了一个端到端的话语级检测流程,输入原始波形,直接输出一个连续的伪造概率分数,无需任何后处理步骤。系统由三个核心模块串联组成。
下图直观展示了Teffic-Audio的整体系统架构和训练流程概览。

图中左侧描绘了训练配方,包括多源语料整合、攻击与源平衡采样以及多样音频增强;右侧展示了由Conformer编码器、多头部注意力统计池化和MLP分类器组成的端到端检测架构。
语音编码器:该模块是系统的骨干,使用预训练的w2v-BERT 2.0模型进行初始化。其结构包括一个基于CNN的特征提取器,后接24层Conformer block,每个block的模型维度为1024。编码器的作用是将输入波形转换为富含上下文信息的帧级语音表征,这些表征能够捕捉从干净语音到经过编解码压缩、信道退化等不同条件下的声学线索。
池化层——多头部注意力统计池化(MHASP):为了将变长的帧级表征聚合为固定维度的话语级表征,系统采用了MHASP。它使用4个注意力头,每个头独立地沿时间轴计算注意力权重,并据此估计帧级特征的加权均值与加权标准差。所有头的统计量被拼接起来,形成一个2048维的初步话语表征,随后经由一个MLP(维度变换:2048→1536→1024)投影至1024维。这种方法能从多个表征子空间聚合信息,相比简单的均值/单头注意力池化,能更稳健地捕捉不同攻击类型的细微差异。
二分类器:一个包含单个隐藏层(维度512)的MLP,将1024维的全局话语表征映射为二分类logits。经过sigmoid激活后,输出的后验概率即作为最终的检测分数。整个模型使用二元交叉熵(BCE)损失函数进行端到端的联合优化。
训练配方的构建是系统设计的核心,旨在从三个方面构造更全面监督分布:
多源训练语料构建:系统整合了14个公开的语音深度伪造数据集(如ASVspoof系列、ADD系列、SpoofCeleb、MLAAD、CodecFake等),覆盖TTS、VC、神经声码器重建和神经编解码重合成四大主要攻击类别。同时,为了扩大真实语音的覆盖范围,还引入了LibriSpeech、GigaSpeech、CommonVoice等5个补充数据集,以增加语言、说话人、录音环境等方面的多样性。
攻击与源平衡采样:为解决多源数据集中样本数量和攻击类型严重不均衡的问题,系统在每个epoch构造训练数据时,以攻击生成器(若无标注则以数据集本身)为单元,每个单元采样M=1000条伪造语音。随后采样等量的真实语音,并均匀分配至不同的真实数据源。此策略旨在防止模型被某个大尺度数据集或高频攻击支配,从而提升跨数据集的泛化稳定性。
多样音频增强:这是训练配方的关键部分。系统对每个训练样本以0.5的概率随机选用1~2种波形级增强。增强算子被分为两大类:第一类是声学和录音相关增强,包括RawBoost(模拟非线性、脉冲噪声和色噪声)、房间脉冲响应(RIR)卷积、MUSAN加性噪声/语音/音乐、音高微调(±1 半音);第二类是传输和平台相关增强,包括各种滤波(低通、高通、带通)、时间掩蔽、多种编解码压缩(MP3、Opus、AAC、GSM、G.711、Encodec等)和VoIP丢包模拟。这些增强迫使模型学习对传输信道和平台处理不变的核心伪造线索,而非依赖于干净的训练条件。
整个设计理念是"以丰富且均衡的训练数据分布提升泛化性,而非依赖复杂的网络结构"。这在深度消融实验中得到印证,即便将编码器深度削减至4层(106.4M参数),在该训练配方下仍能获得3.346%的pooled EER,表现优于同等参数规模的其他SSL编码器。
💡 核心创新点
- 面向数据分布均衡的攻击与源平衡采样策略:针对多源异构数据中生成器和语料规模严重失衡的问题,提出以攻击生成器为单元的等量采样并配平等量真实语音的策略。这使得模型的训练过程不被少数大尺度源主导,提升了跨数据集的泛化稳定性。消融实验显示,该策略将简单随机混合基线的pooled EER从7.159%降至6.456%。
- 面向物理传播链的多样音频增强方案:该方法超越了仅在训练中使用RawBoost的常规做法,系统性地引入了覆盖录音环境、空间混响、背景噪声、传输滤波、平台编解码压缩及网络丢包等一系列增强,模拟了完整的音频传播链。这是系统性能提升的最大驱动力,尤其是在应对ASVspoof 2024-Eval等对编码/信道敏感的数据集时,EER从17.814%急剧下降至1.405%。
- “简单架构+强训练配方"范式的系统性实证:论文没有提出任何新的网络模块或复杂融合机制,而是通过详尽的实验证明,一个精心设计的训练配方足以让一个标准的Conformer-MHASP模型(590M参数)在综合榜单上击败规模更大(3B, 1B)的系统。这种"重数据分布,轻架构"的思路和证据,为该领域提供了极具价值的实践参考。
- 全面的性能-复杂度权衡分析:作为一项系统级工作,论文在统一基准协议下,对编码器主干网络、池化层和编码器深度进行了全面的控制变量消融。尤其是对不同深度编码器的分析,为社区在计算资源与检测性能之间寻求平衡提供了明确的量化参考。
📊 实验结果
表1给出了Teffic-Audio与Speech-DF-Arena当前公开排行榜上所有系统在14个测试集上的等错误率(EER)对比。
表1:Speech-DF-Arena上的EER(%)性能对比(节选自原文Table 3)
| 系统 | 参数量(M) | Pooled EER(%) | Avg EER(%) | ASV19 | ASV21-LA | ASV21-DF | ASV24-E | ITW | CF | ADD22-T1 | ADD22-T3 | ADD23-R1 | ADD23-R2 | DFADD | LSV | SONAR |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Teffic-Audio | 590.0 | 1.454 | 1.236 | 0.242 | 2.038 | 0.262 | 1.405 | 1.321 | 0.748 | 7.031 | 0.837 | 0.356 | 1.836 | 0.000 | 0.000 | 0.251 |
| Modulate-VELMA-2 | 316.0 | 1.586 | 1.104 | 0.299 | 1.330 | 0.331 | 0.384 | 1.271 | 1.538 | 5.059 | 1.174 | 1.041 | 1.742 | 0.000 | 0.265 | 0.888 |
| Resemble-Detect-3B | 3000.0 | 2.099 | 2.570 | 2.531 | 3.017 | 0.579 | 0.453 | 1.347 | 2.689 | 9.958 | 1.549 | 3.390 | 7.360 | 0.100 | 0.000 | 1.139 |
| Hiya-Auth-Multi-v1 | 1000.0 | 2.324 | 2.113 | 0.301 | 1.006 | 1.318 | 0.787 | 0.667 | 5.733 | 12.099 | 1.188 | 1.976 | 4.006 | 0.017 | 0.003 | 0.481 |
| DLMSL-SpeakSure-v0.1 | 658.6 | 6.142 | 3.954 | 0.042 | 0.081 | 0.013 | 12.894 | 1.278 | 6.828 | 15.140 | 2.373 | 5.654 | 8.280 | 0.133 | 0.120 | 0.074 |
| Whispeak | 98.9 | 8.060 | 3.049 | 0.394 | 3.578 | 3.235 | 9.924 | 1.268 | 0.856 | 11.942 | 2.310 | 2.618 | 5.007 | 0.000 | 0.044 | 0.533 |
| DF-Raptor | 100.0 | 8.350 | 8.390 | 7.695 | 12.865 | 9.288 | 8.036 | 3.191 | 12.731 | 28.882 | 3.493 | 6.452 | 9.178 | 1.867 | 3.442 | 7.784 |
| DF_Arena_1B_V_1 | 1000.0 | 9.524 | 5.919 | 1.139 | 4.657 | 1.749 | 17.250 | 0.906 | 8.369 | 22.210 | 2.204 | 5.082 | 11.544 | 0.000 | 0.151 | 1.087 |
| Momenta | 350.0 | 9.763 | 7.057 | 1.208 | 4.880 | 1.419 | 14.346 | 4.629 | 8.756 | 25.471 | 3.475 | 10.551 | 11.098 | 2.940 | 1.704 | 5.445 |
关键结论:仅使用开源数据训练的Teffic-Audio以1.454%的Pooled EER排名第一,相较于Resemble-Detect-3B(2.099%)和Hiya-Auth-Multi-v1(2.324%)分别相对降低约30.7%和37.4%。系统在CodecFake、ADD 2022 Track 3、ADD 2023 R1、DFADD和LibriSeVoc共5个测试集上取得最低EER,同时在ASV2024-Eval和ADD 2022 Track 1等困难测试集上也保持了较低的错误率。结合仅590.0M的参数量,Teffic-Audio展现了良好的性能–复杂度权衡。
训练配方消融
在固定前端为w2v-BERT 2.0编码器和MHASP池化层的条件下,逐步加入训练配方各组件,结果见表2。
表2:训练配方消融实验的EER(%)对比(节选自原文Table 4)
| 配置 | 参数量(M) | Pooled EER(%) | Avg EER(%) | ITW | ASV19 | ASV21-LA | ASV21-DF | ASV24-E | FoR | CF | ADD22-T1 | ADD22-T3 | ADD23-R1 | ADD23-R2 | DFADD | LSV | SONAR |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Baseline(简单多源合并+随机采样) | 590.0 | 7.159 | 3.693 | 1.445 | 0.600 | 5.825 | 1.619 | 19.650 | 0.345 | 0.097 | 14.885 | 1.915 | 1.185 | 3.655 | 0.017 | 0.000 | 0.459 |
| + 攻击与源平衡采样 | 590.0 | 6.456 | 3.539 | 1.173 | 0.243 | 6.822 | 0.540 | 17.840 | 0.216 | 0.144 | 14.730 | 1.352 | 1.502 | 4.603 | 0.000 | 0.000 | 0.377 |
| + 补充真实语音语料 | 590.0 | 5.435 | 3.289 | 1.242 | 0.598 | 7.972 | 1.304 | 13.630 | 0.193 | 0.235 | 14.038 | 1.557 | 0.581 | 3.509 | 0.000 | 0.000 | 1.183 |
| + 仅RawBoost增强 | 590.0 | 5.896 | — | — | — | — | — | 17.814 | — | — | 13.794 | — | — | — | — | — | — |
| + 多样音频增强(最终方案) | 590.0 | 1.454 | 1.236 | 1.321 | 0.242 | 2.038 | 0.262 | 1.405 | 0.972 | 0.748 | 7.031 | 0.837 | 0.356 | 1.836 | 0.000 | 0.000 | 0.251 |
关键结论:单一的随机采样基线Pooled EER高达7.159%。逐步引入攻击与源平衡采样(6.456%)和补充真实语音(5.435%)均带来稳定下降。仅使用RawBoost增强反而使ASV24-E的EER飙升至17.814%,表明单一增强策略在困难信道条件下可能损害泛化性。最终融合多样音频增强后,Pooled EER大幅降至1.454%,且ASV24-E(1.405%)和ADD22-T1(7.031%)的EER得到显著抑制,说明多样音频增强是实现跨场景鲁棒性的最关键组件。
架构消融
在最优训练配方下,系统地对编码器骨架、池化层和编码器深度进行消融,结果汇总于表3。
表3:模型架构消融实验的EER(%)对比(节选自原文Table 5)
| 配置 | 参数量(M) | Pooled EER(%) | Avg EER(%) | ITW | ASV19 | ASV21-LA | ASV21-DF | ASV24-E | FoR | CF | ADD22-T1 | ADD22-T3 | ADD23-R1 | ADD23-R2 | DFADD | LSV | SONAR |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 编码器对比 | |||||||||||||||||
| AASIST | — | 15.668 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| Res2Net+MHASP | — | 15.023 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| WavLM Base+MHASP | — | 9.446 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| WavLM Large+MHASP | — | 4.332 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| XLS-R 300M+MHASP | — | 6.079 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| XLS-R 1B+MHASP | — | 4.419 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| w2v-BERT 2.0+MHASP (Teffic-Audio) | 590.0 | 1.454 | 1.236 | 1.321 | 0.242 | 2.038 | 0.262 | 1.405 | 0.972 | 0.748 | 7.031 | 0.837 | 0.356 | 1.836 | 0.000 | 0.000 | 0.251 |
| 池化层对比(固定w2v-BERT 2.0) | |||||||||||||||||
| Mean Pooling | — | 2.269 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| ASP | — | 2.339 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| MHASP (Teffic-Audio) | 590.0 | 1.454 | 1.236 | 1.321 | 0.242 | 2.038 | 0.262 | 1.405 | 0.972 | 0.748 | 7.031 | 0.837 | 0.356 | 1.836 | 0.000 | 0.000 | 0.251 |
| 编码器深度消融(w2v-BERT 2.0 + MHASP) | |||||||||||||||||
| N=3 | 82.2 | 4.735 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| N=4 | 106.4 | 3.346 | — | — | — | — | — | 6.744 | — | — | 10.734 | — | — | — | — | — | — |
| N=6 | 154.8 | 2.839 | 2.005 | 0.922 | 0.515 | 3.134 | 0.484 | 5.306 | 2.633 | 0.937 | 9.640 | 0.918 | 0.526 | 2.153 | 0.000 | 0.000 | 0.910 |
| N=12 | 299.9 | 2.317 | 1.965 | 1.030 | 0.565 | 3.307 | 0.455 | 3.769 | 4.057 | 1.279 | 8.754 | 0.826 | 0.576 | 2.324 | 0.000 | 0.000 | 0.564 |
| N=24 (Teffic-Audio) | 590.0 | 1.454 | 1.236 | 1.321 | 0.242 | 2.038 | 0.262 | 1.405 | 0.972 | 0.748 | 7.031 | 0.837 | 0.356 | 1.836 | 0.000 | 0.000 | 0.251 |
关键结论:
- 编码器选择至关重要:从传统模型AASIST(15.668%)到SSL预训练大模型,Pooled EER逐步降低,w2v-BERT 2.0+MHASP取得最优的1.454%,表明不仅参数量,预训练目标和声学表征能力共同决定泛化性能。同时在相同训练配方下,各骨架性能均大幅超越对应排行榜版本,证明训练配方的通用增益。
- 多头部注意力统计池化更优:MHASP(1.454%)显著优于均值池化(2.269%)和单头注意力池化ASP(2.339%),说明多子空间统计聚合能更好地捕捉伪造线索。
- 适度削减深度仍可保持强竞争力:4层配置仅106.4M参数即达到3.346%的Pooled EER,超越同参数量级的WavLM Base方案;6层配置(2.839%)已接近排行榜上Resemble-Detect-3B等大系统,展现了优异的性能–效率折衷。深层模型的额外收益主要体现在ASV24-E(4层6.744%→24层1.405%)和ADD22-T1(4层10.734%→24层7.031%)等困难测试集上。
此外,在所有数据集上,Teffic-Audio在准确率(ACC)和F1-score上也取得了最优的池化(pooled)成绩。完整的ACC和F1-score排行榜对比分别列于附录表4和表5。
附录表4:Speech-DF-Arena上的ACC(%)性能对比(节选自原文Table 6)
| 系统 | 参数量(M) | Pooled ACC(%) | Avg ACC(%) | ITW | ASV19 | ASV21-LA | ASV21-DF | ASV24-E | FoR | CF | ADD22-T1 | ADD22-T3 | ADD23-R1 | ADD23-R2 | DFADD | LSV | SONAR |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Teffic-Audio | 590.0 | 98.546 | 98.759 | 98.682 | 99.761 | 97.961 | 99.738 | 98.595 | 99.006 | 99.251 | 92.969 | 99.162 | 99.645 | 98.163 | 99.973 | 99.995 | 99.721 |
| Modulate-VELMA-2 | 316.0 | 98.414 | 98.897 | 98.726 | 99.702 | 98.670 | 99.667 | 99.616 | 99.890 | 98.463 | 94.940 | 98.825 | 98.958 | 98.257 | 99.973 | 99.730 | 99.139 |
| Resemble-Detect-3B | 3000.0 | 97.901 | 97.430 | 98.656 | 97.469 | 96.984 | 99.421 | 99.547 | 97.637 | 97.312 | 90.043 | 98.453 | 96.611 | 92.641 | 99.947 | 99.995 | 98.835 |
| Hiya-Auth-Multi-v1 | 1000.0 | 97.680 | 97.880 | 99.330 | 99.700 | 98.990 | 98.680 | 99.210 | 99.800 | 94.270 | 87.900 | 98.810 | 98.020 | 96.000 | 99.950 | 99.990 | 99.540 |
| DLMSL-SpeakSure-v0.1 | 658.6 | 93.858 | 96.043 | 98.726 | 99.959 | 99.920 | 99.986 | 87.105 | 99.757 | 93.173 | 84.859 | 97.627 | 94.347 | 91.721 | 99.840 | 99.870 | 99.899 |
| DF-Raptor | 100.0 | 92.330 | 92.080 | 96.523 | 95.870 | 93.890 | 98.025 | 93.140 | 96.952 | 84.447 | 69.436 | 96.215 | 92.974 | 93.335 | 97.870 | 92.311 | 88.222 |
| Whispeak | 98.9 | 91.953 | 96.947 | 98.729 | 99.604 | 96.420 | 96.766 | 90.075 | 99.006 | 99.144 | 88.057 | 97.689 | 97.381 | 94.994 | — | 99.995 | 99.476 |
| DF_Arena_1B_V_1 | 1000.0 | 90.476 | 94.156 | 99.093 | 98.861 | 95.339 | 98.248 | 82.750 | 97.124 | 91.631 | 77.789 | 97.795 | 94.917 | 88.455 | 99.973 | 99.812 | 98.807 |
| Momenta | 350.0 | 90.238 | 92.910 | 95.370 | 98.792 | 95.118 | 98.580 | 85.653 | 97.064 | 91.244 | 74.529 | 96.524 | 89.448 | 88.902 | 97.001 | 98.243 | 94.470 |
| AASIST (排行榜) | 0.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| RawGatST | 0.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| RawTFNet | 0.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| Hubert ECAPA | 102.0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| Rawnet2 | 17.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
附录表5:Speech-DF-Arena上的F1-score性能对比(节选自原文Table 7)
| 系统 | 参数量(M) | Pooled F1 | Avg F1 | ITW | ASV19 | ASV21-LA | ASV21-DF | ASV24-E | FoR | CF | ADD22-T1 | ADD22-T3 | ADD23-R1 | ADD23-R2 | DFADD | LSV | SONAR |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Teffic-Audio | 590.0 | 0.969 | 0.973 | 0.989 | 0.989 | 0.906 | 0.955 | 0.966 | 0.990 | 0.988 | 0.884 | 0.975 | 0.998 | 0.987 | 0.999 | 1.000 | 0.998 |
| Modulate-VELMA-2 | 316.0 | 0.966 | 0.976 | 0.990 | 0.986 | 0.937 | 0.943 | 0.991 | 0.999 | 0.975 | 0.915 | 0.965 | 0.993 | 0.988 | 0.999 | 0.991 | 0.993 |
| Resemble-Detect-3B | 3000.0 | 0.955 | 0.949 | 0.989 | 0.888 | 0.865 | 0.905 | 0.989 | 0.976 | 0.957 | 0.838 | 0.954 | 0.976 | 0.949 | 0.999 | 1.000 | 0.990 |
| Hiya-Auth-Multi-v1 | 1000.0 | 0.950 | 0.954 | 0.990 | 0.990 | 0.950 | 0.810 | 0.980 | 1.000 | 0.910 | 0.810 | 0.960 | 0.990 | 0.970 | 1.000 | 1.000 | 1.000 |
| DLMSL-SpeakSure-v0.1 | 658.6 | 0.874 | 0.938 | 0.990 | 0.998 | 0.996 | 0.998 | 0.733 | 0.998 | 0.893 | 0.763 | 0.931 | 0.960 | 0.942 | 0.996 | 0.995 | 0.999 |
| DF-Raptor | 100.0 | 0.840 | 0.836 | 0.972 | 0.807 | 0.691 | 0.605 | 0.840 | 0.969 | 0.785 | 0.612 | 0.886 | 0.950 | 0.955 | 0.944 | 0.787 | 0.907 |
| Whispeak | 98.9 | 0.834 | 0.925 | 0.990 | 0.981 | 0.843 | 0.625 | 0.787 | 0.990 | 0.994 | 0.809 | 0.933 | 0.982 | 0.966 | 0.999 | 0.998 | 0.995 |
| DF_Arena_1B_V_1 | 1000.0 | 0.812 | 0.886 | 0.993 | 0.947 | 0.804 | 0.758 | 0.662 | 0.971 | 0.870 | 0.668 | 0.936 | 0.964 | 0.919 | 0.999 | 0.995 | 0.990 |
| Momenta | 350.0 | 0.749 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
| XLSR Mamba | 319.0 | 0.637 | 0.780 | 0.946 | 0.980 | 0.955 | 0.744 | 0.708 | 0.933 | 0.528 | 0.524 | 0.577 | 0.836 | 0.854 | 0.771 | 0.926 | 0.782 |
| Whisper Mesonet | 7.6 | 0.596 | 0.596 | 0.775 | 0.769 | 0.515 | 0.721 | 0.583 | 0.523 | 0.534 | 0.480 | 0.509 | 0.671 | 0.648 | 0.559 | 0.612 | 0.448 |
| Wav2Vec2 ECAPA | 324.0 | 0.527 | 0.460 | 0.739 | 0.328 | 0.356 | 0.161 | 0.640 | 0.377 | 0.467 | 0.398 | 0.539 | 0.724 | 0.718 | 0.118 | 0.417 | 0.388 |
| AASIST (排行榜) | 0.3 | 0.483 | 0.514 | 0.625 | 0.961 | 0.607 | 0.173 | 0.425 | 0.784 | 0.368 | 0.384 | 0.397 | 0.610 | 0.754 | 0.358 | 0.318 | 0.461 |
| WavLM ECAPA | 102.0 | 0.475 | 0.573 | 0.703 | 0.964 | 0.737 | 0.227 | 0.537 | 0.767 | 0.415 | 0.420 | 0.335 | 0.778 | 0.759 | 0.490 | 0.379 | 0.615 |
| RawGatST | 0.4 | 0.474 | 0.512 | 0.532 | 0.951 | 0.636 | 0.155 | 0.376 | 0.469 | 0.378 | 0.433 | 0.407 | 0.701 | 0.797 | 0.564 | 0.272 | 0.528 |
| RawTFNet | 0.2 | 0.395 | 0.536 | 0.665 | 0.915 | 0.790 | 0.216 | 0.335 | 0.635 | 0.362 | 0.424 | 0.360 | 0.693 | 0.771 | 0.580 | 0.405 | 0.487 |
| Hubert ECAPA | 102.0 | 0.375 | 0.519 | 0.666 | 0.951 | 0.582 | 0.258 | 0.471 | 0.662 | 0.415 | 0.387 | 0.338 | 0.592 | 0.653 | 0.432 | 0.377 | 0.632 |
| Rawnet2 | 17.6 | 0.348 | 0.363 | 0.565 | 0.295 | 0.230 | 0.075 | 0.368 | 0.344 | 0.376 | 0.371 | 0.265 | 0.533 | 0.448 | 0.385 | 0.235 | 0.605 |
Teffic-Audio在所有评价指标(EER、ACC、F1-score)上均取得最优pooled结果,印证了其在异构测试条件下的稳定检测能力。
🔬 细节详述
- 训练数据:整合了14个公开的语音深度伪造数据集(ASVspoof2015, ASVspoof2019LA, ASVspoof5, ADD2022, ADD2023 Track1, FakeOrReal, SpoofCeleb, ReplayDF, DFADD, MLAAD, LibriSeVoc, SpeechFake, Wavefake, CodecFake)以覆盖TTS, VC, NV, NC攻击,并引入5个补充真实语音数据集(LibriSpeech, AISHELL3, GigaSpeech, CNCeleb, CommonVoice)。采样超参数M=1000。
- 损失函数:二元交叉熵(BCE),公式为\(\mathcal{L}_{\mathrm{BCE}}=-\frac{1}{N}\sum_{i=1}^{N}\left[y_{i}\log p_{i}+(1-y_{i})\log(1-p_{i})\right]\),端到端联合优化所有模块。
- 训练策略:攻击-源平衡采样构建每个epoch数据。每个样本以0.5概率随机选用1~2种波形级增强,算子覆盖RawBoost、RIR、MUSAN、音高偏移、滤波、时间掩蔽、多种编解码压缩及丢包模拟。
- 关键超参数:w2v-BERT 2.0编码器 (24层Conformer, dim=1024),MHASP (4 heads, 投影MLP: 2048→1536→1024),分类器(隐藏层dim=512),采样数M=1000。具体优化器、学习率、warmup策略、batch size、训练轮数均未说明。
- 训练硬件:未说明。
- 推理细节:推理时sigmoid输出直接用作检测分数,无后处理。
- 正则化/稳定训练技巧:未特别提及。
⚖️ 评分理由
创新性 (1.2/2):通过‘强训练配方’而非新架构在Speech‑DF‑Arena取得pooled EER 1.454%排名第一(A_SUMMARY),其中攻击‑源平衡采样与多样音频增强的组合带来了明确的性能跃升,消融证实多样增强是关键组件(A_RESULTS Table 4),为‘标准架构+强训练配方’范式提供了系统性实证。
技术严谨性 (1.1/1.5):系统结构与训练流程描述完备(A_METHOD),使用Conformer+MHA统计池化与BCE损失端到端优化,方法无逻辑推导错误;数据配比、采样和增强方案的设计合理,未见不合理假设或算法漏洞。
实验充分性 (1.0/1.5):主榜对比与训练/架构消融详细(A_RESULTS),但作为系统技术报告严重缺失延迟、吞吐、内存等端到端系统性能指标(A_LIMITS);数据泄露风险缺少定量审计,部分消融表未给出所有测试集的完整数值,限制了结论的全面性。
清晰度 (1.0/1):报告结构清晰,方法模块和训练配方分步阐述(A_METHOD),损失函数给出明确公式;表格呈现主榜与消融结果(A_RESULTS),符号与图示规范,整体可读性强。
影响力 (1.0/1.5):在综合评测Speech‑DF‑Arena上超越多个大模型系统取得第一(A_RESULTS Table 3),为通用语音深度伪造检测提供了‘标准架构+强训练配方’的实证范本(A_SUMMARY),对社区训练策略设计有参考价值。
开源 (0.2/1.5):论文目前只提供可访问的在线演示页面,未发布核心代码、模型权重或训练数据。
可复现性 (0.1/0.5):架构与数据配方虽有描述(A_METHOD),但优化器、学习率、batch size、训练硬件等关键超参数全部未披露(A_LIMITS及方法概述末尾),复现所需配置大量缺失。
工程/实践价值 (1.2/1.5):仅用开源数据训练,在排行榜上以590M参数取得最优结果且浅层变体(N=4)仍保持3.346% pooled EER(A_RESULTS深度消融),训练配方对多种编码器骨架有通用增益,具备较强的实用工程参考价值。
🚨 局限与问题
论文明确承认的局限:
- 训练数据全部来自公开语料,可能仍无法覆盖所有现实世界的bonafide或攻击分布。
- 未针对不同语言和声学环境下的性能进行细分分析。
- 未对模型的可解释性和分数校准进行研究。
审稿人发现的潜在问题:
- 开源与复现鸿沟:这是该工作最致命的短板。代码和模型权重的完全缺失,加之训练超参数的空白,使得1.454%的EER成为一个无法被独立检验的孤立数字,其作为领域内公共基线的价值大打折扣。
- 缺乏系统级性能指标:作为系统技术报告,不应仅汇报检测精度。缺乏推理延迟、吞吐量、峰值内存占用等指标,无法评估其在真实流式场景或资源受限设备上的实用性。
- 增强策略的敏感性与脆弱性分析缺失:多样增强是性能提升的关键,但论文未探讨其潜在的负面影响。例如,过多的增强操作是否会意外抹除某些特定类型的、微弱的伪造痕迹?增强算子的选择和组合是否存在过拟合特定排行榜的风险?缺乏对此类失败案例的讨论。
- 潜在的测试集信息泄露风险:训练语料中包含了部分测试集的官方训练分区。尽管论文声称训练集和测试集在攻击类型、生成模型等方面存在明确分布差异,但未提供任何定量的数据重叠分析或防泄漏审计,无法完全打消读者对“跨集泄漏”贡献性能增益的疑虑。