英文题目:Évaluation de la robustesse des modèles de fondation pour la détection de deepfakes audio : Influence de la diversité linguistique des données de pré-entraînement

会议身份:conference:jep:2026:conference-paper-id:tran26c_jep

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#SFT #鲁棒性 #多语言 #音频深度伪造检测

评分:6.5/10 | 创新 0.8/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Hoan My Tran:机构信息未能从会议 PDF 纯文本可靠映射
  • Damien Lolive:机构信息未能从会议 PDF 纯文本可靠映射
  • Aghilas Sini:机构信息未能从会议 PDF 纯文本可靠映射
  • David Guennec:机构信息未能从会议 PDF 纯文本可靠映射
  • Arnaud Delhay:机构信息未能从会议 PDF 纯文本可靠映射
  • Pierre-François Marteau:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音频深度伪造检测以原始波形为输入,输出真假二分类结果,难点在于未知合成算法与真实信道失真下泛化急剧下降。本文以语音基础模型为可微特征提取器,先经卷积前端将 16 kHz 波形压缩为约 20 ms 帧级隐变量,再由深层 Transformer 编码器输出上下文表示,随后全局时间平均得到定长向量,最后经线性层与 Softmax 完成欺骗判定,全链路在 ASVspoof 2019 LA 训练集上微调。与既有反欺骗工作依赖单语 wav2vec 2.0 或 HuBERT 不同,本文将预训练语言多样性作为核心变量,对比单语系与覆盖数十至上千语言的多语系基础模型,揭示了语言广度带来的声学不变性收益。在 In-the-Wild 外域测试上多语模型 XLS-R-128-0.3B 取得 4.97% 等错误率,显著优于单语模型普遍高于 10.79% 的水平,证明适度多语预训练已足够实现鲁棒检测。该结论目前仅在英语训练加英语为主测试的短句场景验证,未覆盖中文等多语攻击、重放攻击与对抗样本。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

要解决的现实问题是什么?

这篇论文研究的是音频伪造检测,也就是判断一段语音是真实人声还是由机器生成的假语音。作者在摘要和引言中把动机写得很直接:文本转语音和声音转换已经能生成高度自然的语音,可用于虚拟助手和辅助发声困难人群交流,但同样可能被用于冒充身份和欺诈,甚至同时欺骗人耳和说话人验证系统。因此需要反欺骗对策,即能够区分真实语音和伪造语音的检测器。

论文把困难点放在泛化上:现有对策在遇到训练时没有见过的攻击方法,或者在训练分布之外的数据上,往往性能下降明显。特别是当测试数据带有真实信道、压缩和背景变化时,检测器容易把信道差异误认为真假差异,或者只记住了训练集中几种合成器的痕迹。理解这一点很重要,后面所有关于单语还是多语预训练的比较,都是围绕表示是否足够通用、能否在未知攻击下保持区分能力展开的,而不是比较谁能把训练集本身拟合得更好。

语音基础模型 × 伪造检测: 语音基础模型负责把原始波形变成保留声学和语言结构的上下文表示,伪造检测负责判断该表示来自真实人声还是合成或转换语音,二者搭配的理由是检测器不直接学习波形分类,而是复用自监督预训练已经学到的通用语音结构,再用一个小分类头学习真与假的边界,组合新增的作用是把表示的通用性转化为对未见攻击的区分能力。

论文的中心判断在摘要中已经给出:更好的检测不一定来自预训练语言数量最多的模型,只要语言多样性足以产生稳健表示,就能达到有效的检测效果。这句话是全文需要用实验支撑的核心,初学者可以把它记为待验证的假设,而不是默认结论。后续方法把所有模型放在同一微调数据和同一分类头下比较,正是为了让性能差异主要反映基础模型本身表示的差异,而不是分类器或训练流程不同带来的差异。

已有路线是如何从手工特征走到基础模型的?

论文用两小节梳理背景。第一是语音合成:现代文本转语音一般是多阶段流水线,先把文字变成语言表示,再映射为梅尔谱等声学特征,最后用声码器合成波形;声音转换则保留语言内容,借助目标说话人的参考语音改变说话人特征。随着大规模数据和神经网络结构的发展,这两类方法生成的语音越来越难用人耳区分,这直接提高了伪造检测的难度。

文本转语音 × 声音转换: 文本转语音负责从文字生成对应语言内容和声学特征再经声码器合成波形,声音转换负责保留一句话的语言内容但替换说话人特征,分工不同但都会留下合成痕迹,放在同一检测任务下比较的理由是两者都属于逻辑接入场景中的假语音来源,组合意义是要求检测表示同时对两种生成路径的伪影敏感,而不是只记住某一种合成器的缺陷。

第二是反欺骗对策的演变。早期方法依赖人工设计的声学特征,例如梅尔频率倒谱系数和恒 Q 倒谱系数,后来转向自监督学习。常见做法是把 wav2vec 2.0 一类预训练模型作为前端特征提取器,后面接一个可训练的后端分类器。后端结构有很多选择,包括长短时记忆网络、图模型和变换器,变换器目前因建模能力强而占主导,也有工作尝试用选择性状态空间模型和门控多层感知机降低自注意力计算开销。

论文没有把这些后端作为变量,而是固定一个尽量简单的后端,把研究焦点留给前端基础模型的预训练语言多样性。初学者容易误以为后端越复杂越好,但本文的逻辑是:先控制后端和训练条件,再看前端表示本身是否更具不变性。

本文到底要验证哪个具体问题?

论文要回答的问题可以表述为:在同样的微调数据和同样的简单分类器下,预训练时见过的语言多少是否决定音频伪造检测的稳健性。领域内存在一种流行假设:语言多样性和数据规模越大,学到的表示就越通用,性能就会系统性提高。作者想检验这个假设在伪造检测任务上是否成立。

具体做法是选取覆盖单语到大规模多语的代表性基础模型,从中等规模单语模型一直到参数量从 0.1 B 到三 B 的多语模型,然后在同一训练集上微调,并在域内和域外基准上测试。需要强调的是,这里的多语不是指测试多语语音内容,而是指预训练阶段接触过的语音在语言和音系上的多样性。论文认为这种多样性可能帮助模型学到与语言无关的通用声学线索,从而对合成痕迹更敏感。

反过来,如果只是增大单语模型的容量或单语数据量,而语言覆盖仍然受限,那么对未见合成方法的泛化可能仍然有限。这个问题界定决定了后面的实验组织:先看域内已知条件,再看压缩和信道变化,最后看完全野外采集的数据。

方法全景:一个样本如何走完检测流程?

可以沿着一个待测音频样本走一遍全文流程。输入是一段采样率为 16 千赫兹的原始波形。第一步是特征提取:卷积前端把波形映射为帧级潜表示序列,每帧对应约 20 毫秒的有效时间分辨率;预训练阶段会随机掩蔽其中一部分帧,并用类似掩蔽预测的对比目标学习上下文表示。第二步是编码:多层变换器把潜表示序列变成上下文表示序列,保持帧数不变但融入更长上下文。

第三步是时间聚合:对所有帧的上下文向量做全局时间平均,得到与音频时长无关的定长向量。第四步是投影与分类:定长向量经过一个线性层得到 2 个类别的打分,分别对应伪造和真实,再经归一化函数得到每个类别的概率。训练时用加权交叉熵处理类别不平衡,测试时用等错误率评价区分能力。整个流程中唯一随基础模型变化的是前端和编码器输出的表示质量,聚合、投影和训练协议对所有模型保持一致。

这样的设计让初学者容易复述:输入波形到帧表示,到上下文表示,到整句向量,到二分类概率,比较的是哪一段表示更能把真假分开。

前端、聚合与分类头各自承担什么计算?

论文明确使用基于 wav2vec 2.0 架构的基础模型,结构分为卷积特征提取器和深层变换器编码器。卷积部分负责把高采样率波形降采样为帧序列,捕捉局部声学结构;变换器部分负责在帧之间建立长距离依赖,输出上下文相关的表示。作者指出这些模型不仅提取声学特征,也包含语言维度的信息,这对伪造检测可能是双刃剑:如果表示过度绑定某种语言的音系,就可能在新攻击或新信道下失效;如果表示学到跨语言共享的声学结构,就更可能抓住合成器共有的伪影。

wav2vec 2.0 × 全局平均: wav2vec 2.0 负责把 16 千赫兹波形先经卷积得到约 20 毫秒 1 帧的潜表示,再经多层变换器得到上下文表示,全局平均负责把变长帧序列在时间维求平均得到定长向量,二者搭配的理由是分类器需要与时长无关的输入,组合新增的作用是把逐帧的局部伪影信息压缩为整句级判别向量,再送入线性层做二分类。

聚合部分采用最简单的全局平均,不引入可学习注意力或复杂池化,目的是避免分类头本身带来额外差异。分类头只有一个线性矩阵和偏置,输出两个打分,再用归一化得到概率。这种极简后端是刻意选择:它把建模压力全部留给基础模型表示,实验差异更容易归因于预训练。初学者不要把简单后端理解为论文推荐的最佳检测器,而应理解为为了公平比较而固定的测量尺。模型选择覆盖 wav2vec 2.0、HuBERT、UniSpeech-SAT、WavLM 等单语系列,以及 XLS-R、MMS、Omnilingual、W2v-BERT 2.0 和 XEUS 等多语系列,规模从中等到数十亿参数,目的是形成从单语小模型到多语大模型的渐进对照。

微调时更新什么、用什么损失和增强?

论文的训练不是从零训练基础模型,而是在已有预训练权重上做微调。所有模型都在 ASVspoof 2019 逻辑接入训练集上训练,该训练集包含文本转语音和声音转换生成的伪造语音,模型选择在说话人互不重叠的开发集上进行。优化使用 Adam,学习率设为原文给出的较小值,权重衰减也按原文设置,目的是在适配真假边界的同时不过度破坏预训练表示。每个批次内的音频按批次中最长音频做动态补齐,以处理变长输入。

微调 × 加权交叉熵: 微调负责在伪造检测训练集上继续更新预训练模型和分类头的参数,加权交叉熵负责在真假样本数量不平衡时给真实类更大权重而给伪造类更小权重,二者搭配的理由是既要让通用表示向真假边界适配,又不让多数类淹没少数类,组合新增的作用是在保持表示能力的同时纠正类别先验带来的决策偏置。

由于训练集中真假样本数量不平衡,论文采用加权交叉熵,对真实类赋予更高权重,对伪造类赋予更低权重。这一步很关键:如果不加权,模型可能偏向多数类,导致等错误率对应的阈值偏移。为了进一步提高稳健性,论文还使用了数据增强,包括线性和非线性卷积噪声、与信号相关的脉冲加性噪声、平稳加性噪声和随机有色噪声。原文列出增强的种类,但没有给出每种增强的具体信噪比、施加概率和随机种子,因此严格复现增强分布存在缺项。所有实验在一块 NVIDIA A100 上进行,论文没有报告每模型训练时长和显存占用,这部分成本信息是缺失的,不能从模型参数量直接推定实际训练时间。

在哪些数据上训练、验证和测试?如何度量好坏?

训练和模型选择固定为 ASVspoof 2019 逻辑接入的训练集和开发集,开发集说话人与训练集不重叠。域内评估使用 2019 评估集,以及 ASVspoof 2021 的逻辑接入分区和深度伪造分区。2021 逻辑接入在 2019 基础上加入编解码和传输效应,2021 深度伪造进一步引入多种有损压缩伪影,因此测试条件越来越接近现实。域外评估使用 In-the-Wild 数据集,该数据集从网络收集名人与公众人物语音,包含真实背景噪声、不可控录音条件和真实压缩伪影,是最苛刻的泛化检验。论文声明训练、开发和评估的域内统计见图 1,读者应先确认类别比例和数据规模,再理解为什么需要加权损失和增强。

域内评估 × 域外评估: 域内评估负责在与训练同源的录音室数据和已知编解码条件下检验区分能力,域外评估负责在网络采集的名人语音和真实噪声压缩条件下检验泛化,分工是前者看拟合与已知攻击的分离,后者看未知信道和未知攻击下的稳健性,搭配理由是只有两类评估同时通过才能说明表示具有不变性,组合意义是揭示单语模型在域内尚可但在野外明显退化的边界。

下图是论文给出的域内数据统计,阅读时不要只看柱子高低,还要同时看总量和伪造占比。

看图路径: 1. 先从横轴确认五组柱子依次为训练集开发集评估集和两个新评估集;2. 再看纵轴为对数刻度并读出每根柱顶的总量标注;3. 对比蓝色真实段与红色伪造段的相对高度和黑色标签中的伪造占比;4. 注意从左向右总量明显增大但伪造占比始终接近九成

原论文 Figure 1:Statistiques des jeux de données intra-domaines.

论文图 1。原论文 Figure 1:“Statistiques des jeux de données intra-domaines.”。

从像素可见,横轴 5 组分别为训练、开发、评估和两个新评估条件,纵轴为对数刻度。柱顶标注总量从左向右约为 25k、24k、71k、148k 和 533k,说明评估数据规模逐级增大。蓝色为真实语音,红色为伪造语音,每根柱内黑色标签给出伪造占比,均接近 90% 左右。这意味着训练和评估都存在明显类别不平衡,也解释了为什么训练要用加权损失。初学者容易只记住总量变大,而忽略占比信息。

实际上占比决定了分类阈值和评价解释,评价指标采用等错误率,即误接受率等于误拒绝率的工作点,等错误率越低表示区分能力越好。该指标对阈值选择不敏感,适合比较不同模型,但在实际部署中还需要结合具体误接受代价选择工作点,不能只看等错误率。 论文给出的数据链接状态是当前可用,已公开的 4 个资源分别对应上述数据集,复现时应按原文链接获取对应版本,而不是用同名但划分不同的数据替代。

主结果:多语模型在哪些条件下更稳健?

论文报告的主趋势是多语模型在全部基准上一致优于单语模型。域内部分,单语模型在 2019 评估集上多数能达到较低等错误率,但在 2021 逻辑接入上明显上升,说明对信道和攻击场景变化敏感;在 2021 深度伪造上退化更严重,说明学到的表示更依赖微调时见过的攻击分布。增大单语模型容量或单语数据量在 2019 上有一定改善,但在新攻击下难以保持。

多语模型在 2019 上可达到极低等错误率,在 2021 逻辑接入上多个模型接近或低于 1% 量级,在 2021 深度伪造上与最优单语模型的差距被描述为可达数倍。野外数据上单语模型等错误率常处高位,而多语模型系统性更低,最优折中出现在中等以上容量且语言覆盖充分的模型上,继续增大到两 B 参数并未带来系统性增益。

下表把原文中以文字形式报告的关键区间整理为可对照的陈述,阅读时注意指标方向都是等错误率越低越好,比较条件是同一微调数据和同一简单分类头。

评测条件指标与方向单语模型原文报告多语模型原文报告比较含义
野外采集等错误率越低越好常常高于 11 %系统性低于 6 %未知信道下多语更稳健但仍有误差

表前的问题是:在控制微调数据和分类头后,预训练语言多样性是否转化为更低的等错误率,公平条件是所有模型共享训练集、开发集选择和评价指标,指标方向为等错误率越低越好。 表后需要同时看到收益与代价。

多语的收益是在域内和域外同时降低等错误率,尤其在野外数据上把高位误差拉回到个位数区间;代价是需要更大规模多语预训练和更大模型容量,且论文未报告推理延迟和显存占用,不能把检测精度改善直接等同于部署成本可接受。未胜出的例子也很明确:单语大模型和超大模型并未靠参数量弥补语言覆盖不足,在新合成方法和真实压缩面前仍然退化,这是否定单纯堆参数路线的反例。

原文对具体最优模型名称有描述,但本表只保留原文以连续句子给出的区间数字,不把表格矩阵中的孤立数值当作可引用证据,以避免在表头单位不明时误读。

哪些对照说明增益不是单纯来自模型变大?

论文做了两组隐含的消融式对照。第一组是单语内部的容量对照:从 Base 到 Large 再到 Extra Large,2019 评估上有适度改善,但在 2021 上改善不系统,甚至出现大模型与 Base Plus 相当或更差的情况。这支持容量不是主要瓶颈的判断,尤其当预训练仍局限于单一语言时。第二组是多语内部的规模对照:从 0.3 B 到一 B 左右性能提升较明显,但超过一 B 后增益趋于平缓,两 B 模型没有系统性超越。这提示存在由预训练性质决定的性能平台,而不是参数越多越好。

下表把训练与评价协议中的可复现条件整理出来,用于说明比较的公平性和缺项,表中数字均来自原文连续句子中的逐字表述。

环节训练来源优化与损失评价指标待补的运行细节
微调19LA 训练集学习率 2, 5 × 10−6,Adam,衰减 1 × 10−4等错误率增强参数与训练步数未完全报告
协议逻辑接入场景加权交叉熵误接受等于误拒绝处阈值选择与统计显著性未报告

表前要问的是:比较是否在同一训练来源、同一优化设置和同一指标下进行,表中信息表明训练来源和指标一致,但增强细节和重复实验设置不完整。 表后应指出支持与限制。

支持的是容量对照与语言对照方向一致:单语内部加容量效果有限,多语内部超过一定规模后收益递减,因此语言多样性比单纯容量更可能是关键;限制是论文没有做冻结与解冻的对照,也没有报告去掉增强后的性能变化,所以不能说增强无用或微调必须全参数更新。未评测的边界包括对抗攻击、跨语言测试和实时推理开销,这些都不能从现有等错误率外推。

这项研究的边界和不能外推的结论有哪些?

首先,论文固定了训练数据为 2019 逻辑接入,因此结论严格适用于从该分布微调出发的比较。如果更换微调数据,例如加入更多压缩或野外数据,单语与多语的差距可能缩小或改变,不能直接外推。其次,分类头极简是为了公平,但不代表这是最优检测器;换用更强的后端可能改变相对排序,论文没有验证这种交互。第三,评价只用等错误率,没有报告误接受与误拒绝在不同阈值下的代价曲线,也没有做多次随机种子的方差和显著性检验,因此小幅差异应谨慎解读。

第四,资源与成本缺项明显:训练时长、推理延迟、显存占用和输出帧率均未报告,不能声称多语大模型在实际部署中更高效。第五,数据方面野外数据集规模相对小且以名人语音为主,可能存在说话人、内容和采集偏差,不能把野外结果等同于所有真实场景。最后,论文的相关性发现不等于因果证明:多语预训练与稳健表示相关,但原文没有定位到具体哪一层、哪种音系覆盖或哪类合成伪影起决定作用,后续需要分层探针或受控预训练才能进一步验证。

要复现这篇论文,先做什么、保留什么?

复现的第一步是按原文链接获取 4 个数据集的对应版本,确认训练、开发、评估划分与论文一致,特别是说话人不重叠和伪造占比接近 90% 的分布特征。第二步是准备基础模型权重,保持原文的模型家族划分:单语侧包括 wav2vec 2.0、HuBERT、UniSpeech-SAT 和 WavLM 的不同容量版本,多语侧包括 XLS-R、MMS、Omnilingual、W2v-BERT 2.0 和 XEUS。第三步是实现固定流程:16 千赫兹输入、上下文表示、时间平均、线性二分类,并用加权交叉熵处理不平衡。优化器选 Adam,学习率和权重衰减按原文数值设置,批次内按最长音频动态补齐。

第四步是加入原文列出的增强种类,但由于具体参数缺失,应先记录无增强基线,再逐步加入增强并固定随机种子,以便区分增益来源。第五步是评价:先在 2019 评估集上确认域内性能,再依次测试 2021 逻辑接入、2021 深度伪造和野外数据,统一报告等错误率。复现时应保留的关键超参数是学习率、权重衰减、加权损失和同一分类头,缺失项要如实记录为待补验证,而不是用默认值假装与原文一致。

何时值得尝试多语基础模型?

当任务面临未知合成方法、压缩和真实信道变化,且已有域内数据不足以覆盖这些变化时,优先尝试多语预训练的语音基础模型是合理的,因为本文在同一微调条件下观察到多语表示更具不变性。当计算预算有限或需要低延迟部署时,不应直接选择参数最大的模型,论文显示超过一定规模后增益有限,中等容量但语言覆盖充分的模型可能是更好的起点。

当只有单语数据和单语模型可用时,应预期在野外条件下的退化,并通过增强、更多样化的微调数据和阈值调优来弥补,而不是指望增大单语容量自动解决泛化。未来还需补的验证包括:冻结不同层与全参数微调的对照、去掉增强的对照、多次运行的统计检验,以及延迟与显存的实测。只有补齐这些,才能把等错误率上的优势转化为可部署的结论。记住本文的核心不是语言越多越好,而是足够的语言多样性足以产生稳健表示,超出后的堆规模收益递减。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 4 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 4 页

区域 2 · 查看论文原页

原文数学表达区域 3,PDF 第 4 页

区域 3 · 查看论文原页

另有 3 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 jep-2026 论文汇总