英文题目:BForSec-L1.2: ANCHORING THE UNKNOWN: OPEN-SET MODEL ATTRIBUTION VIA PROXY-ANCHOR LEARNING
会议身份:
conference:eusipco:2026:conference-paper-id:0000736
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#对比学习 #自监督学习 #多语言 #音频深度伪造检测
评分:8.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Neamtu, Cristian-Teodor:机构信息未能从会议 PDF 纯文本可靠映射
- Mihalache, Serban:机构信息未能从会议 PDF 纯文本可靠映射
- Smeu, Stefan:机构信息未能从会议 PDF 纯文本可靠映射
- Oneata, Dan:机构信息未能从会议 PDF 纯文本可靠映射
- Cucu, Horia:机构信息未能从会议 PDF 纯文本可靠映射
- Burileanu, Dragos:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频来源追溯以待测语音为输入,输出其所属文本到语音系统并在开放集中拒绝未见系统,难点在于同架构多版本高度相似且新系统不断涌现。方法先冻结在大量多语无标注语料上预训练的Wav2Vec2-BERT编码器并取其中间层输出,以保留判别性声学表征并送入后续度量学习。接着单层线性投影头将高维特征映射到同维度量空间并做归一化,将嵌入约束在单位超球面上,为原型比较提供几何基础。然后以代理锚损失学习每类可学习原型,使同源样本向本类原型紧凑聚集而远离异类原型,学到的原型相似性直接支撑后续判断。推理分为分布外检测与分布内归属两阶段,先以最大代理距离等分数判断是否属于已知系统,再对已知样本做最近原型归属,使判别与不确定性估计共享同一原型几何。在MLAAD v9合并架构评测设置下,Proxy-Anchor方法的准确率为99.76%,高于Logistic Regression基线的准确率99.59%。与直接分类相比,关键机制差异在于判别边界与拒绝分数均源于同一原型相似性结构,因而在架构合并后开放集分离更显著,具有取证中降低误报的实际意义。结论适用边界受限于MLAAD采集分布与保留划分,尚未验证野外压缩信道后处理与跨数据集迁移下的稳定性;训练成本涉及在六块NVIDIA Tesla T4硬件上训练100个周期且批量为256的计算量。
🔗 开源与复现资源
- 代码相关资源:https://github.com/neamtucristian26/panda — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪一步?
本文的输入是一段待查音频,目标是回答它是由哪一个语音合成系统生成的,并在系统未见过时明确说不知道。读者需要先区分 2 个任务。第一是二分类深伪检测,只判断真或合成。第二是来源追溯,也就是在已确认为合成的前提下进一步归属到具体生成系统。本文只研究第二步,不研究真假二分类。
目标读者是刚进入语音与音频方向的研究生,因此先固定学习依赖。后续所有方法、实验与指标都围绕多分类归属加开放集拒绝展开。开放集的意思是测试时会出现训练阶段从未见过的 TTS 系统,模型不能把它们硬分到已知类,而要先拒绝。论文在 MLAAD v9 上用 140 个 TTS 系统、51 种语言、678.3 小时合成语音验证这 1 流程,并在 MLAAD v5 官方划分上与已有方法对比。
输出形式是 2 阶段判决。第一阶段给出开放集分数并与阈值比较,超过阈值判为未知系统。第二阶段仅对判定为分布内的样本给出 K 选一的系统标签。本文的全部改进都服务于让第一阶段误报更低、第二阶段归属更准,同时减少同一架构不同版本之间的混淆。
已有路线做了什么,本文站在哪条线上?
已有工作可以按输入、目标与监督方式对照。第一条线是属性级来源追溯。Klein 等人先检测是否为伪造,再分类声学模型与声码器等属性,并在 ASVspoof 2019 与 MLAAD 上评估,后续把能量分数改造为 softmax energy 用于开放集,在增强策略下报告 FPR@95 为 8.3%。Falez 等人做多属性开放集辨识与验证,强调需要统一本体来描述生成系统或其部件。
第二条线是度量学习与验证范式。Koutsianos 等人在 MLAAD v5 上比较基于分类与基于度量学习的方法,发现 ResNet 加度量学习可以达到或超过自监督 backbone 系统。Negroni 等人提出来源验证,判断测试音频是否与一组参考音频来自同一模型,并考察说话人多样性、语言失配与后处理。Stan 等人的 TADA 完全免训练,用预训练自监督嵌入做 k 近邻,报告归属 F1 为 0.93、开放集 F1 为 0.84。Xuan 等人建立多语言来源追溯基准,比较数字信号处理特征与自监督特征,并测试对未见语言与说话人的泛化。
Doan 等人用变分信息瓶颈加有监督对比学习做预加重,在 MLAAD v5 上比基线提升约 10%。本文的差别在于明确使用 Proxy-Anchor 损失学习每个类的代理原型,并引入按架构合并版本的类别设计,再用训练后分数做开放集检测。理解这一点后,就能明白后文为什么同时比较逻辑回归、k 近邻与 Proxy-Anchor,而不是只比二分类检测器。
为什么闭集分类不够,还要显式处理未知系统?
闭集分类假设测试时的类别集合与训练时完全相同。只要出现新 TTS 系统,这个假设就被打破。此时分类器仍会输出 K 个已知类中分数最高的一个,造成把未知系统错误归属到已知系统。在取证场景中,这种错误比直接说不知道更危险,因为它会给出错误的溯源指向。
因此问题被写成非二分类加开放集检测。训练时模型把音频映射到 K 个已知合成系统之一。测试时先判断样本是否属于任何已知类,再决定是否进入归属。论文把阈值设定为在保留的开放集校准集上使真阳性率为 95% 时的取值,这意味着允许 5% 的已知或校准分布样本被误判为未知,以换取对未知系统的检出能力。
另一个现实困难是版本混淆。许多 TTS 系统只是同一架构的不同版本,差异仅在模型大小、训练数据或版本号。若把每个版本当作独立类,类间距离很小,分类器容易混淆。论文因此提出第二种协议,把共享底层架构的系统合并为一类,从 140 个系统变为 130 个类,再扣除保留的开放集系统后分别形成 120 类与 110 类的分布内任务。
来源追溯 × 开放集检测: 来源追溯负责把已知合成语音分到 K 个已知 TTS 系统之一,开放集检测负责判断输入是否来自训练时未见过的新系统;二者搭配的理由是新系统不断出现,单独做闭集分类会在遇到未知系统时被迫错分,因此该文把开放集检测放在归属之前,先用不确定性分数与阈值分流,只有判定为分布内才做最近代理归属。
跟着一个样本走完输入到输出的全景
先沿一个样本走完流程。输入是一段波形。第一步用冻结的 Wav2Vec2-BERT 提取帧级特征,取第 4 层共 24 层中的输出,因为原文引用已有发现,靠前层对深伪检测更具判别性。帧级特征经时间平均池化得到 1024 维 utterance 级向量,记为音频表示。
第二步经过可训练投影头。投影头是一个线性层,把 1024 维映射到 1024 维,并做 L2 归一化,把嵌入约束在单位超球面上。每个已知类同时维护一个可学习的 1024 维代理向量,可理解为该类的原型。推理时计算投影嵌入与每个代理的余弦相似度,记为类别分数,取最高分对应的类为预测标签。
第三步是开放集分流。对同一组相似度计算不确定性分数,例如 softmax 能量、香农熵或到最近代理的余弦距离。若分数大于预先在校准集上标定的阈值,则直接判为开放集未知,不再归属。若分数不超过阈值,则进入归属阶段,输出最近代理的类别。训练只优化投影头与代理,特征提取器保持冻结。评估是分层的,先测拒绝能力,再对判定为分布内的样本测归属准确率。
表示与代理如何分工,相似度如何变成类别分数?
表示部分的分工是提供跨语言、跨系统的通用语音表征。Wav2Vec2-BERT 在原文描述中训练于 4,500,000 小时无标注数据、覆盖 143 种语言,结构基于 Conformer,结合卷积与 Transformer 建模局部与全局依赖。论文还试过 WavLM-Large 与 HuBERT-Large,报告结果相近,但 Wav2Vec2-BERT 在分布内问题上略好,因此全部实验固定用它。特征提取器来自 HuggingFace 的 facebook/w2v-bert-2.0,推理时只取固定层并做均值池化,不参与梯度更新。
代理部分的分工是给每个类一个全局代表。训练时输入样本的投影嵌入与对应类代理拉近,与其他类代理推远。预测时类别分数定义为投影嵌入与代理的余弦相似度,最高者胜。这种设计避免了样本对样本的大规模配对采样,用代理作为锚获得对每个生成架构的整体视图,使同类更紧凑。原文明确指出,紧凑的嵌入空间对后续检测开放集攻击很关键。
Wav2Vec2-BERT 嵌入 × 代理: Wav2Vec2-BERT 嵌入负责把音频变成 1024 维 utterance 级表示,提供可分的初始特征,代理负责为每个类别维护一个可学习的类原型;搭配理由是直接比较样本对开销大且不稳定,用代理作锚可以把同类拉拢、异类推远,组合后预测简化为计算投影嵌入与哪个代理余弦相似度最高。
需要提醒初学者,代理不是测试时的参考音频集合,而是训练学到的参数向量。测试时不需要为每个类保留大量样本,只需保留学好的代理矩阵即可做最近邻归属,这也是该方法部署时较轻的原因之一。
三种开放集分数各算什么,阈值如何定?
论文试验 3 种训练后分数。第一是 softmax energy,对相似度做 softmax 归一化后再做 log-sum-exp 聚合后取负。第二是香农熵,对 softmax 归一化后的分布计算不确定性,分布越平坦熵越大。第三是最大代理距离,即 1 减去与最相似代理的余弦相似度,距离越大表示越远离所有已知类。原文规定分数越大越可能是开放集样本。
阈值不是在测试集上现调的。做法是在保留的 10 个开放集校准系统上选择阈值,使真阳性率为 95%,再冻结阈值去测另外 10 个开放集测试系统。这种校准与测试分离的设计很重要,它避免了用测试未知系统调参带来的乐观偏差。指标中的 FPR@95 就是在该工作点下,把分布内误判为未知的比例之外的另一侧误报,越低越好。
Softmax 能量 × 最大代理距离: Softmax 能量与香农熵负责度量归一化相似度分布的不确定性,最大代理距离负责直接度量嵌入与最近代理的余弦距离;前者依赖分类分布的峰值形态,后者依赖度量空间的几何结构,搭配比较的理由是不同类数与合并程度下最有效的拒绝信号不同,该文报告未合并时熵更优、合并后最大代理距离更优,组合意义是阈值法需要按协议在校准集上选择分数函数。
对初学者而言,关键是区分分数来源。熵与能量看的是 K 个分数的分布形状,适合类别多、分布内样本通常很确信的情形。最大代理距离看的是几何距离,直接利用 Proxy-Anchor 学出的簇结构。论文在合并架构后发现后者最好,说明类别设计会改变哪种分数更有效,不能默认一种分数处处最优。
训练更新什么、冻结什么,超参数如何设置?
训练只更新两部分参数,一是线性投影头,二是 K 个代理向量。Wav2Vec2-BERT 特征提取器冻结,不更新。优化目标是 Proxy-Anchor 损失,原文选择的超参数为间隔 0.1 与缩放因子 32。优化器为 AdamW,初始学习率为千分之一,权重衰减为万分之一,批量大小为 256,共训练 100 个轮次,用验证集准确率最高的检查点做测试。硬件为 6 块 16 GB 显存的 NVIDIA Tesla T4。
损失的作用可以这样理解。每个代理作为锚,把同类嵌入拉向自己,把异类嵌入推开。因为代理代表整类,模型不易过拟合到个别样本,学出的空间整体更紧凑。训练结束后得到优化后的投影头与代理集合,推理时直接复用,不再更新。
Proxy-Anchor 损失 × 投影头: 投影头负责把冻结的 1024 维特征线性映射到 1024 维单位超球面上的度量空间,Proxy-Anchor 损失负责同时优化投影头与全部代理,使每个代理成为吸引同类、排斥异类的锚;二者搭配使训练只更新轻量映射与原型而不动大 backbone,组合意义是既保留自监督特征的判别力,又得到更紧凑的类簇以便后续用距离或不确定性做开放集拒绝。
未报告的缺项要明确指出。原文没有给出 Proxy-Anchor 损失中正负样本采样的具体细节,也没有报告学习率调度、早停 patience 或多次随机种子的方差。复现时应先按上述固定超参数跑通,再考虑补做种子重复与学习率消融。代码与数据协议在资源状态为 available 的代码链接中公开,当前可用,已公开,链接为论文给出的 GitHub 地址,这为核对划分与分数实现提供了依据。
数据如何划分,基线条件是否一致?
实验主战场是 MLAAD v9,包含 140 个 TTS 系统、51 种语言。两种协议都要先拿出 20 个系统做开放集,其中 10 个用于校准阈值,10 个用于测试,剩余系统做分布内。实验 1 把每个系统当作独立类,分布内为 120 类。实验 2 先按架构手动合并版本,140 个系统变为 130 个类,再扣除 20 个开放集系统,分布内为 110 类。分布内再按 14 比 3 比 3 分层随机分为训练、验证、测试,为防类别不平衡,每个 TTS 系统至多取 2000 条,以中位数为上限。
比较公平性方面,逻辑回归与 k 近邻基线使用相同的 Wav2Vec2-BERT 嵌入作为输入。逻辑回归用基于熵的开放集分数,k 近邻取 k 为 21,用到 21 个最近邻的平均余弦距离定阈值。评估分两段,开放集用 AUROC、精确率、F1 与 FPR@95,归属用对正确判定为分布内样本的分类准确率。
下表整理划分条件,提出的问题是合并前后分布内类数与开放集保留数是否一致,公平条件是同一嵌入与同一保留策略,指标方向是后续用准确率越高越好、FPR@95 越低越好。
| 划分条件 | 分布内类数 | 开放集校准系统数 | 开放集测试系统数 | 总系统数 |
|---|---|---|---|---|
| 实验 1 独立系统 | 120 | 10 | 10 | 140 |
| 实验 2 合并架构 | 110 | 10 | 10 | 130 |
该表显示合并把总类从 140 降到 130,分布内从 120 降到 110,而开放集校准与测试各 10 个保持不变。代价是合并依赖人工按版本归组,原文未给出自动化规则。若复现时合并标准不一致,110 类的具体构成会变化,直接对比准确率需要先对齐名单。未胜出项在后文体现,k 近邻在同样嵌入下开放集表现明显更差,说明只用原始距离不够。
闭集归属谁更准,合并带来了什么?
闭集归属测的是已知系统之间的分辨能力。比较问题是同样嵌入下分类器与度量学习是否有差别,公平条件是三者都用冻结的 Wav2Vec2-BERT 特征,指标方向是准确率越高越好。下表为论文报告的分布内准确率。
| 评估协议 | k 近邻准确率 | 逻辑回归准确率 | Proxy-Anchor 准确率 | 类数条件 |
|---|---|---|---|---|
| 实验 1 独立系统 | 92.58% | 98.16% | 98.23% | 120 |
表后解释需要同时看收益与代价。收益是合并后三者全部提升,Proxy-Anchor 从 98.23% 升到 99.76%,提升 1.53 个百分点,逻辑回归与 k 近邻也有类似增益,支持分组降低了版本间混淆这一判断。代价是 Proxy-Anchor 与逻辑回归在闭集上几乎相同,说明冻结表示本身已高度线性可分,度量学习的优势不在闭集,而在开放集。未胜出项是 k 近邻,即使合并后也只有 95.15%,明显低于另两者,表明简单的最近邻投票不足以处理细粒度系统差异。
初学者易误把闭集准确率当作整体性能,实际上开放集误报才是取证部署的关键,后两节将证明闭集相近的方法在开放集上差距很大。
开放集拒绝哪种分数有效,差距有多大?
开放集检测测的是把未知系统推出去的能力。比较问题是在 Proxy-Anchor 空间中哪种分数更有效,公平条件是同一投影头与代理、阈值都在独立校准集上按真阳性率 95% 标定,指标方向是 AUROC 越高越好、FPR@95 越低越好。下表整理论文报告的最佳分数。
| 评估协议 | 最优分数方法 | AUROC | FPR@95 | 适用条件 |
|---|---|---|---|---|
| 实验 1 独立系统 | 熵 | 97.98% | 9.59% | 120 |
| 实验 2 合并架构 | 最大代理距离 | 99.35% | 2.04% | 110 |
表后解释要给出机制与限制。实验 1 类别多达 120,分布内样本的 softmax 分布通常很尖,熵能有效捕捉不确定性,因此熵最优。实验 2 合并后代理更紧凑且彼此更分散,到最近代理的几何距离直接反映是否属于已知架构,因此最大代理距离最优,FPR@95 仅 2.04%,AUROC 达 99.35%。限制是这是在保留的 10 个测试系统上测得的,未覆盖野外信道压缩、混响或对抗处理,推广到全未知空间仍待验证。
跨方法对比进一步拉开差距。在实验 1 中 Proxy-Anchor 的 FPR@95 为 9.59%,优于逻辑回归的 13.73%,k 近邻则高达 54.63%。在实验 2 中 Proxy-Anchor 为 2.04%,逻辑回归为 16.51%,k 近邻为 66.90%。这支持度量学习同时保留判别力并结构化不确定性的判断,也说明原始嵌入距离未经学习投影时开放集判别力不足。
在 MLAAD v5 官方划分上与已有方法如何对比?
为公平对比已有最优结果,论文还在 MLAAD v5 官方划分上评估。比较对象是 Kulkarni 等人与 Klein 等人,指标包括闭集准确率、开放集准确率与 FPR@95。论文报告自身闭集准确率为 98.57%,高于 Kulkarni 的 95.61% 与 Klein 的 95.80%。开放集准确率为 89.20%,接近 Kulkarni 的 44.82% 的 2 倍。FPR@95 为 3.36%,相对 Klein 的 8.30% 降低约 60%。
这些数字支持该方法在闭集与开集上同时强,而不是以牺牲一方换另一方。但要注意指标口径差异。Klein 等人未报告开放集准确率,Kulkarni 等人未报告 FPR@95,因此不是所有格子都有对照。百分点与相对百分比也要区分,例如 FPR@95 从 8.30% 到 3.36% 是下降 4.94 个百分点,相对降幅约 60%,不能说成准确率提升 60%。
另一个细节是 MLAAD v5 与 v9 的系统集合与划分不同,v5 上的 3.36% 与 v9 合并协议上的 2.04% 不能直接比大小,只能各自在其协议内与基线比。论文同时给出两套结果的意义在于,既证明在更大更新的 v9 上可扩展,也证明在旧版本官方划分上超越已有可运行基线。
合并架构是不是关键变量,证据有多强?
合并架构是本文除损失函数外的关键设计消融。操作是把共享底层架构的版本手动合并,类数从 140 降到 130,分布内从 120 降到 110。结果上,Proxy-Anchor 的 FPR@95 从 9.59% 降到 2.04%,下降约 7.55 个百分点,原文总结为降低约 4.7 倍。AUROC 从 97.98% 升到 99.35%。闭集准确率从 98.23% 升到 99.76%。三者一致指向合并减少了类间混淆。
架构合并 × 类间混淆: 类间混淆指同一架构的不同版本如不同参数量或训练数据版本被当作独立类时彼此过近而难以区分,架构合并负责按底层架构把这些版本手动归为一类;搭配理由是法医更关心架构家族而非版本号,合并后代理更少且类中心更分散,组合意义是在该文实验中同时提升闭集准确率并大幅降低开放集误报。
但要区分直接报告与有限解释。论文直接报告的是合并后指标更好,支持合并有效的判断。可能的机制是版本间差异小、代理彼此过近会导致未知样本也容易靠近某个代理,合并后类中心更分散,最大代理距离更有效,但这属于基于几何直觉的解释,未做代理间距离分布的定量验证。未评测的边界是自动合并规则,若新架构命名不规范或版本差异本身包含取证价值,手动合并可能掩盖细粒度溯源需求,这一点原文未展开。
哪些条件没测,哪些结论不能推广?
首先是开放集覆盖有限。每种协议只用 10 个系统校准、10 个系统测试,相对 140 个系统的全集只是小样本。不同未知架构的难度差异很大,换一组保留系统,结果可能波动。论文未报告多次随机划分的方差,因此 2.04% 应理解为在该划分下的点估计,而非对所有未来系统的保证。
其次是鲁棒性缺项。结论提到未来要处理野外条件与对抗攻击,说明当前未系统评估编解码、重采样、加噪、混响、剪辑或对抗扰动的影响。t-SNE 可视化显示投影后分布内更紧凑、开放集被推开,但原文只给了图注层面的定性描述,本次没有收到图像像素,不能据此断言簇的具体形状或距离数值。
第三是合并的人工依赖与语言泛化。合并依据模型版本人工完成,没有可复用的自动规则。数据集虽覆盖 51 种语言,但划分是按系统分层随机,未按语言或说话人做交叉验证,不能直接推出跨语言、跨说话人的泛化强度。训练成本只给了硬件与轮次,未报告总时长、显存峰值与推理延迟,部署开销需另行测量。
要复现这篇工作,先做什么、参数如何保留?
先准备数据与划分。获取 MLAAD v9,按论文协议保留 20 个开放集系统,校准与测试各 10 个,分布内按 14 比 3 比 3 分层划分,每个系统上限 2000 条。若做合并协议,需先复刻从 140 到 130 的手动映射,否则 110 类的标签与论文不一致。MLAAD v5 对比需用官方划分,不能混用 v9 的随机划分。
再固定特征与模型。安装 HuggingFace 的 facebook/w2v-bert-2.0,冻结全部参数,取第 4 层输出做时间平均得到 1024 维向量。投影头为单线性层 1024 到 1024,加 L2 归一化。代理数为分布内类数,实验 1 为 120,实验 2 为 110。用 AdamW 训练,学习率千分之一,权重衰减万分之一,批量 256,100 轮,以验证准确率选检查点,损失用间隔 0.1、缩放 32 的 Proxy-Anchor。基线用同样嵌入跑逻辑回归与 k 近邻 21,以保证公平。
最后做 2 阶段评估。先在校准集上定阈值使真阳性率为 95%,再在测试集上报告 AUROC、精确率、F1 与 FPR@95。对判定为分布内的样本报告归属准确率。代码当前可用,已公开,可对照数据协议与分数实现。常见误解是把阈值在测试集上调到最优,这会高估性能,必须保持校准与测试分离。
何时值得尝试这种方法,还需补哪项验证?
当任务是已知 TTS 家族的溯源且必须拒绝未知系统时,这种方法值得尝试。特别是同一架构存在多个版本、闭集准确率已很高但开放集误报仍高的场景,架构合并加 Proxy-Anchor 的组合在该文报告中同时改善两端。若只有二分类真假检测需求,则不需要引入这套多类代理机制。
复现后建议补三项验证。一是多次随机保留未知系统的重复实验,给出 FPR@95 的均值与区间。二是后处理鲁棒性,至少测 MP3 或 AAC 压缩、重采样与加噪下的阈值漂移。三是跨语言与跨说话人划分,检验代理是否过度绑定特定说话人。若这三项仍保持低误报,才能更放心地用于取证分流。
回到中心判断,该文的贡献不是证明 Proxy-Anchor 处处优于分类器,而是在固定表示下用轻量投影与代理重塑空间,使归属与拒绝互补,并用类别设计放大这一效果。理解阈值依赖校准集、合并依赖人工规则这两个前提,就能正确复述方法边界,而不会把 2.04% 当作开箱即得的通用保证。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
另有 6 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

