英文题目:ADD-DINO: A Two-Stage Self-Distillation Framework for Audio Deepfake Detection

会议身份:conference:interspeech:2026:conference-paper-id:sun26g_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#知识蒸馏 #自监督学习 #鲁棒性 #低资源 #音频深度伪造检测

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zhaorui Sun:机构信息未能从会议 PDF 纯文本可靠映射
  • Yihao Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Qiao Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Minqiang Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Sian Fang:机构信息未能从会议 PDF 纯文本可靠映射
  • Lin Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jianbo Zhan:机构信息未能从会议 PDF 纯文本可靠映射
  • Yan Song:机构信息未能从会议 PDF 纯文本可靠映射
  • Guoping Hu:机构信息未能从会议 PDF 纯文本可靠映射
  • Lirong Dai:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音频深度伪造检测输入为原始语音波形,输出为真假二分类,难点在于标注稀缺且合成算法快速演进导致跨域泛化差。第一阶段在100万无标签音频上做非对比教师-学生自蒸馏,教师编码全局长片段、学生编码加噪局部分片段并对齐分布学习全局-局部一致表示,教师参数由学生指数滑动平均更新。第二阶段丢弃投影头,将教师编码器接新二分类头,仅用ASVspoof 2019 LA少量标注以加权交叉熵微调实现检测,前阶段表示直接作为后阶段初始化输入。与掩码预测类自监督方法不同,该机制显式建模长短视图对应关系,更适合捕捉局部伪造痕迹并保留全局语义。在跨域6数据集评测下,ADD-DINO的平均错误率(EER)为12.25%,低于XLS-R+AASIST的平均错误率(EER)15.31%。在ASVspoof 2019 LA有限标注评测下,ADD-DINO的等错误率(EER)为0.55%,高于全量监督基线的等错误率(EER)0.23%。结论适用边界受限于英语为主的公开评测与所选8种新合成器,对中文多口音与强压缩信道的稳定性尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

这篇解读的输入是会议论文的正文证据与一张官方框架图,目标是让刚进入语音与音频方向的研究生能复述方法、核对实验条件并判断适用边界。解读必须保留的关键信息包括 2 阶段划分、全局长段与加噪局部短段的构造、教师与学生分支的参数更新关系、骨干构成、预训练与微调的数据量与长度、评估协议与指标方向。

输出按学习依赖组织,先讲伪造检测任务与现有路线,再走完一个样本的输入到输出,然后讲训练细节、实验条件、主结果与反证,最后给出复现清单。音频伪造检测的输入是原始波形,输出是该音频为真实还是伪造的二分类判定。白话说,系统要听出合成与转换留下的不自然痕迹,而不是识别说了什么或是谁说的。评价常用等错误率,等错误率越低越好;在只有伪造样本的新合成器测试上则用准确率,准确率越高越好。

初学者容易把说话人识别、语音识别与伪造检测混淆,这里明确区分:前两者关注内容与身份,后者关注真实性。伪造手段多样,文本转语音与声音转换不断更新,信道、噪声与压缩也变化,因此模型在训练分布内好用,不代表换一批合成器或真实场景录音仍然好用。论文要解决的正是标注稀缺与跨域脆弱:在真实应用中高质量标注贵且耗时,而未见攻击类型会让监督模型过拟合。

后续各节围绕这一矛盾展开,不引入证据之外的合成器效果数字,所有教学举例都会标明是例子。

已有路线走到哪里,为什么还缺这一步?

现有音频伪造检测通常分为前端特征与后端分类两部分。传统做法用手工特征或端到端网络直接训练,优点是流程简单,缺点是对未见伪造与信道变化敏感。另一条更强路线是把自监督语音模型与后端分类器结合,例如把 XLS-R 这类跨语言自监督表示与后端结合,在多个基准上取得更好成绩。白话解释 XLS-R:它是在大量无标注语音上预训练的通用特征抽取器,英文名可记为跨语言语音表示。

AASIST 则是音频反欺骗用的谱时图注意力网络,英文名为音频反欺骗的集成谱时图注意力网络,擅长对频谱与时间维度的伪造结构建模。论文把这两者作为骨干组合,属于继承而非新发明前端。已有方法的共同局限是仍依赖大量标注监督训练,获取高质量标注既贵又慢。数据增强如加噪、变速或声码器重采样能部分缓解,但不能解决标注瓶颈。

另一类自监督思路如掩码预测让模型补局部被遮挡内容,论文明确与之区分:掩码路线强调局部信息恢复,而本文强调同一音频全局与局部信息的一致性,认为这更直接对应伪造痕迹在长短上下文中的稳定性。相关工作还包括视觉领域的自蒸馏与说话人表示的自蒸馏原型网络,论文引用它们说明教师学生与原型思想的来源,但本研究的运行阶段与目标不同,是在音频伪造检测的 2 阶段流程中落地。

同输入同目标的对照是同样用 XLS-R 加 AASIST 但只做监督训练的基线,同运行阶段的对照是不同标注比例下的微调,这样才能把增益归因于预训练表示而非增强或后端差异。理解这一点后,才能读懂为什么论文要在第 1 阶段用 100 万无标注样本做非对比自蒸馏,而不是直接加大监督数据。

问题如何形式化,少标注与跨域难在哪里?

形式化上,设输入波形为样本,模型输出为真实概率,阈值化后得到真伪判定。训练时有两类数据:大量无标签音频与少量有标签真伪音频。测试时分 3 种情况:与训练同分布的域内测试、换数据集与信道的跨域测试、换全新合成器的未见攻击测试。少标注的难点在于监督信号不足以约束大骨干,模型容易记住训练集的合成器指纹。跨域的难点在于合成器、说话人、语言、信道与压缩同时变化,局部伪影分布漂移,全局韵律也可能被新模型做得更自然。

举例说明,这只是例子:若训练集多为某类声码器的金属感伪影,模型可能学会检测该伪影,遇到扩散与流匹配类新合成器时伪影形态变了,判定就失效。论文因此提出两个可检验的预期:第一,用 20% 标注微调应接近全量监督的域内性能;第二,在跨域与未见合成器上应明显优于同骨干监督基线。判断标准是等错误率相对下降与准确率提升,且比较时增强策略保持一致。需要注意,论文的预训练数据明确与后续跨域评估数据无重叠,这是跨域结论可信的前提。

若预训练偷看了测试分布,跨域增益会被高估。另一个前提是基线与方法用相同的增强,避免把增强红利算到表示学习头上。带着这两个核对点去看实验,才能区分表示本身的贡献与数据处理的贡献。

两阶段全景:一个样本如何走完预训练到检测?

先沿一个样本走完全程。第 1 阶段输入一条无标签波形,系统从中裁出一个全局长段与一个局部短段,短段加噪声以增加多样性,长段保持不变。全局长段送入教师分支,局部短段送入学生分支,2 分支结构相同但参数独立。2 分支各自由 XLS-R 加 AASIST 编码器抽取嵌入,再经多层感知机投影、全连接与 Softmax 得到概率分布,训练目标是让学生的分布逼近教师的分布,从而学到全局与局部一致的表示。学生用反向传播更新,教师用学生的指数移动平均同步,保持目标稳定。

第 2 阶段丢弃第 1 阶段的多层感知机投影头,把第 1 阶段学到的教师编码器取出,新接一个二分类头,在少量有标签数据上用加权交叉熵微调,输入长度与第 1 阶段全局段相同,输出为真实或伪造概率。下面这张官方框架图把上述 2 阶段画在同一版式中,上半是自蒸馏预训练,下半是微调检测,阅读时先看数据分叉再看参数同步方向。

看图路径: 1. 先看上半 Stage1 两路输入:同一波形分出长段与加噪短段,分别进教师与学生;2. 再看中间 EMA 箭头方向:确认只有学生反传、教师是滑动平均同步;3. 接着看右侧 Softmax 后两组分布与交叉熵回路:确认对齐的是概率分布;4. 最后看下半 Stage2 虚线继承关系:确认微调复用的是教师侧 XLS-R 加 AASIST 编码器并新加分类头

原论文 Figure 1:Overview of the ADD-DINO framework.

论文图 1。原论文 Figure 1:“Overview of the ADD-DINO framework. In Stage 1, a single audio sample is cropped into a global long segment and a noise-augmented local short segment, which are fed into the…”。

从像素可见,上半左侧同一波形分出两路,上路标注随机裁剪与数据增强后进入学生,下路长段进入教师;中部学生与教师框内均含 XLS-R、AASIST 与多层感知机模块,中间有从学生指向教师的指数移动平均箭头;右侧经全连接与 Softmax 得到学生与教师分布并用交叉熵回路对齐;下半用虚线把教师编码器继承到微调流程,依次经卷积与 Transformer 构成的 XLS-R、图模块组合的 AASIST、最大图操作与全连接输出真实与伪造。这种画法对应的真实计算是同一内容在不同截断与噪声下的分布对齐,不是两条无关音频的对比。理解全景后,下一节拆开骨干与分支的具体计算,再讲损失与优化的冻结更新关系。

骨干如何把波形变成可判真伪的嵌入?

骨干由 XLS-R 与 AASIST 串联组成。XLS-R 先把原始波形变成通道、频谱与时间维度的特征张量,记为特征,维度分别对应通道、谱维与时间维。AASIST 再对该特征做图建模。白话说,图建模是把频谱帧与时间帧看成节点,用注意力学节点间依赖,伪造留下的谱间不连续或时序抖动就表现为图上的异常连接。

具体做法是沿时间取最大得到谱图分支,沿谱维取最大得到时域图分支,分别经图注意力与图池化,再用跨边连成跨域异构图,经异构堆叠图注意力计算注意力权重,最后对两并行分支输出做逐元素最大融合与读出,得到高维嵌入供下游分类。论文给出注意力权重的计算形式与图合并形式,解读时抓住输入与目标即可:输入是 XLS-R 特征的绝对值经池化后的图节点,目标是融合谱与时互补信息。

需要核对的实现细节是特征先取绝对值再建图,这与直接用带符号特征不同,复现时不应省略。骨干在 2 分支中结构相同,这是全局局部对齐可比的前提。

全局视图 × 局部视图: 全局视图指从同一波形裁出的 64600 点长段、不加噪声送入教师分支,负责提供完整上下文与稳定目标;局部视图指裁出的 32300 点短段、加噪声送入学生分支,负责在缺失与扰动下猜出同一内容。两者搭配的理由是伪造痕迹既可能是全局韵律异常也可能是局部拼接失真,只看一端容易漏检;组合后用分布对齐逼学生以小见大,从而学到全局-局部一致的表示。

全局与局部的长度在证据中是明确的:全局段为 64600 个采样点,局部段为 32300 个采样点,只有局部加噪。这种不对称设计的教学含义是教师看得多且干净,学生看得少且脏,学生必须学会从残缺线索还原与全局一致的判断,这正是细粒度伪造特征的训练压力来源。

教师与学生分支各做什么,为何能防止坍缩?

2 分支编码器分别记为教师编码器与学生编码器,输入分别为全局段与局部段,输出经投影与分类层变为概率表示。训练用 DINO 损失,即对全局集合与局部集合上的教师分布与学生分布求交叉熵并最小化。白话说,损失要求学生看到的短片段与教师看到的长片段在真伪语义上说法一致。关键在参数更新:学生经梯度更新,教师经指数移动平均从学生同步,不直接接受梯度。

这种设计让教师成为学生历史的平滑平均,目标不会随当前批次剧烈抖动,从而在没有负样本的非对比框架下维持稳定。论文在第 2 阶段为防止坍缩的表述是给教师模型分配新的分类头再微调,实际动作是丢弃第 1 阶段投影头、保留教师骨干并新接二分类头。复现时要区分冻结与更新:证据明确学生反传、教师滑动平均;微调阶段学习率与损失权重有交代,但未逐层说明是否冻结 XLS-R 部分层,因此不应默认全部冻结或全部更新,缺项应在复现记录中标明待核对。

另一个易误解点是教师与学生不是分别学真与假,而是在预训练阶段都不见标签,只学一致性,真伪判别力留到第 2 阶段才用标签激发。

教师网络 × 学生网络: 学生网络负责经反向传播更新,快速试错局部表示;教师网络负责用学生参数的指数移动平均缓慢同步,提供稳定一致的软目标。两者搭配的原因是非对比框架没有负样本,若两边同时快变易坍缩;组合意义是教师成为学生的平滑集成,使全局-局部对齐有可追踪的稳定锚点。

从计算路径看,梯度只流经学生编码器、投影与分类层,教师侧不产生梯度,只做前向提供目标与滑动平均更新。若把教师也直接梯度更新,两目标会快速趋同到平庸解,这是非对比方法需要慢教师的根本原因。

两阶段如何训练,超参数与数据动作是什么?

第 1 阶段为自监督预训练。数据动作是从公开数据集中均匀随机采样 1,000,000 条音频,不用任何标签,且与后续跨域评估集无重叠。音频被裁或拼接为固定长度,全局 64600 点,局部 32300 点,仅局部加噪。模型用 0.3B 参数的 XLS-R,优化器为 Adam,1 阶与 2 阶动量系数分别为 0.9 与 0.999,XLS-R 骨干学习率为 1 乘 10 的负 6 次方,分类器部分为 1 乘 10 的负 3 次方,权重衰减为 5 乘 10 的负 5 次方,单卡批量 32,在 4 张 4090 上训练 180 轮。第 2 阶段为监督微调。

动作是取第 1 阶段教师骨干,丢弃投影头,新接二分类头,输入长度与全局段相同。数据为 ASVspoof2019 LA 的训练与开发集的子集,重点报告 20% 条件。优化用固定学习率 1 乘 10 的负 6 次方,单卡批量 16,加权交叉熵对真实与伪造的权重分别为 0.9 与 0.1。增强包括 MUSAN、房间脉冲响应、RawBoost 与编解码增强,微调时加 0.9 到 1.1 倍速扰动。公平性动作是基线与方法用相同增强,使差异可归因于方法本身。

需要指出的缺项是滑动平均的动量系数与投影维度、温度系数在证据中未给出具体数值,不能从模型名推定,复现时需先按常规值试跑并记录为待验证。

非对比自蒸馏 × 交叉熵一致性: 非对比自蒸馏指不构造真假负对、只让同一音频的两视图输出趋同的训练范式,分工是避免依赖大规模标注与负采样;交叉熵一致性指把教师与学生经多层感知机、全连接与 Softmax 后的概率分布用交叉熵拉近的具体目标。两者搭配是因为伪造检测更需要同一内容在长短截断下保持真伪判断一致,而交叉熵给出可优化的分布对齐手段,组合后即论文的 DINO 损失。

非对比与交叉熵的组合意味着训练不需要负样本队列,批量内只有同一音频的不同视图,这降低了对大批量的依赖,但也要求增强与裁剪足够多样,否则一致性任务太简单而学不到伪造结构。

数据划分、基线与指标如何保证可比?

预训练数据为 100 万无标签样本,微调数据为 ASVspoof2019 LA 训练与开发集,主测试为 2019 LA、2021 LA 与 2021 DF,跨域测试包括 In-the-Wild、DFADD、FoR、ADD2023 第一轮与第二轮及 HABLA。未见合成器测试自建 8 种方法各 1000 条伪造,包括 Udio、AudioBox、CosyVoice、F5-TTS、FireRed-TTS、MaskGCT、Kokoro-TTS 与 Oute-TTS。基线是同骨干的监督训练,例如 XLS-R 加 AASIST、WavLM-Large 加 AASIST 等,比较时标注比例取 10%、20%、50%、100%,骨干与后端保持一致。指标方向要记牢:等错误率越低越好,准确率越高越好;在只有伪造样本的新合成器集上用准确率表示判为伪造的比例。

聚合口径按数据集分别报告,不混平均。硬件与成本按原文交代预训练用 4 卡 4090 训练 180 轮,微调用小批量与低学习率,但推理延迟与参数量未系统报告,因此不能声称推理更快。初学者常犯的错误是把不同指标的差值混为一列,或把相对百分比与百分点混淆。这里明确:相对改善是差值除以基线,百分点是直接相减,两者不可互换。另一个核对点是 20% 指 2019 LA 训练加开发集的 20%,不是预训练数据的 20%,引用时必须带定语。

资源状态方面,本次未发现完成验证的开源链接,因此不得声称代码模型或数据已公开,复现只能按论文文字重写流程。

少标注下能否逼近全量监督?

要回答的核心问题是:在只给很少标注时,预训练表示能否补足监督不足,且条件是否公平。公平条件是同骨干同后端同增强,只变是否经过第 1 阶段自蒸馏与微调标注比例。指标方向是等错误率越低越好。下表整理论文正文连续句中可逐字核对的关键数字,比较 20% 微调的 ADD-DINO 与 100% 全量监督的同骨干基线,以及 10% 下的相对改善,避免引用无法逐字核对的表格单元格。

条件指标基线本方法比较对象
10% 微调,三集平均等错误率相对下降基线监督下降约 55.9%XLS-R 加 AASIST 同条件
20% 微调,19LA等错误率0.230.55100% 全量监督
20% 微调,21LA等错误率0.841.25100% 全量监督
20% 微调,21DF等错误率2.852.95100% 全量监督

表后解释要同时讲收益与代价。收益是只用 20% 标注就在三集上接近全量监督,尤其在 10% 时三集平均相对基线下降约 55.9%,说明全局局部一致性在低标注区贡献最大。代价是仍有差距,19LA 上 0.55 高于 0.23,21LA 上 1.25 高于 0.84,21DF 上 2.95 略高于 2.85,不能说已超越全量监督。论文还报告随微调比例升到 50% 与 100% 增益收窄,说明有足够标签时监督主导,预训练红利饱和。未胜出项也要指出:在部分骨干与高比例下 ADD-DINO 的等错误率略高于基线,例如证据中 100% 下个别设置出现 0.74 高于 0.64,这提示预训练不是每格必胜,总体趋势不等于每组都成立。

域内评估 × 跨域泛化: 域内评估指在 ASVspoof2019 LA 训练分布内测等错误率,分工是检验少标注下能否逼近全量监督;跨域泛化指到 In-the-Wild、DFADD、ADD2023 与全新合成器上测等错误率与准确率,分工是检验未见攻击与信道下的鲁棒性。两者搭配的原因是只看域内会高估过拟合模型的实用价值,组合后才能判断全局-局部预训练是否学到可迁移的真伪线索而非数据集偏置。

域内接近全量监督支持表示有效,但不能外推到跨域,需看下一节跨域与未见合成器的独立证据。

跨域与未见合成器是否真更稳?

第二个问题是换分布后是否更稳。比较对象是全量训练的 XLS-R 加 AASIST 与只用 20% 微调的 ADD-DINO,指标仍是等错误率越低越好、准确率越高越好。其中预训练量对比为 350,000 到 1,000,000,本节只保留这 1 次写法,下表条件列只写数据集名以避免粘连复写。下表只用正文连续句与原表行中出现的数字,保证每个数字可回溯,不自行计算差值或补单位,预训练裸值保留原表头单位。

条件指标(EER,%/ACC,%)基线本方法比较对象
19LA等错误率0.710.55同方法不同预训练量
21LA等错误率2.891.25同方法不同预训练量
21DF等错误率4.042.95同方法不同预训练量
跨域平均等错误率15.31%12.25%全量监督基线
未见合成器平均准确率66.5%81.6%同骨干监督基线

表后解释需分层。第一层是预训练量效应:从 350,000 增至 1,000,000 时三集相对下降分别为 22.5%、56.8% 与 27.0%,三集平均改善为 35.4%,支持更多无标注数据能增强表示。第二层是跨域:在只用 20% 标注下跨域平均等错误率从 15.31% 降到 12.25%,相对改善为 19.99%,且在 In-the-Wild、FoR、DFADD 等多集上一致优于全量基线。第三层是未见合成器:平均准确率从 66.5% 升至 81.6%,提升幅度从 0.60% 到 37.20% 不等,对 Udio 与 AudioBox 等低基线集提升大,对 Kokoro 与 Oute 等高基线集提升小。具体代价是跨域绝对值在难集上仍高,说明难集上仍不可用。限制是未见合成器集每种只有 1000 条伪造且无真实样本,准确率只反映检出伪造的能力,不反映误杀真实的代价,不能当作整体等错误率来宣传。

换骨干与换预训练量时规律还成立吗?

消融要检验规律是否依赖特定骨干。论文在 4 个自监督前端上重复实验:WavLM-Large、XLS-R、XLSR-53 与 Whisper-Medium,后端均为 AASIST,比较各基线与其 ADD-DINO 变体在不同标注比例下的等错误率。报告的定性结论是多数设置下 ADD-DINO 降低等错误率,且趋势跨骨干一致。以 XLS-R 为例,10% 下三集平均相对下降约 55.9%,20% 下已接近全量监督。反例是增益随标注量增加而收窄,到 50% 与 100% 趋于稳定,这符合预训练在低标签区贡献最大的解释。

另一个反证是骨干本身强弱影响绝对值:Whisper-Medium 基线在 19LA 上等错误率高达 6% 以上,即使加预训练仍在 6% 以上,说明预训练不能弥补前端与任务的不匹配。预训练量消融已在上表给出,35 万到 100 万单调改善,但论文未报告超过 100 万或更小量的曲线,不能外推为无限增大必增。需要补的验证是滑动平均系数、投影维度、温度与增强开关的消融,证据中未给出,因此不能声称拿掉某增强必然怎样。教学上要记住:消融的价值在于证伪,若只挑最优骨干与最优比例,会高估方法的普适性。

XLS-R × AASIST: XLS-R 负责从原始波形抽取通道、频谱与时间维度的通用语音特征 F,解决前端表达力问题;AASIST 负责把该特征经谱图与时域图建模、跨域异构图与注意力融合为高层真伪嵌入,解决谱-时伪造结构建模问题。两者搭配的原因是自监督前端缺检测归纳偏置、图后端缺大规模语音先验,组合后形成既懂语音又懂伪造结构的骨干,供 2 阶段复用。

XLS-R 与 AASIST 的分工解释了为何 XLS-R 组合最强:通用语音先验与谱时图归纳偏置互补,而在不匹配前端上只做一致性预训练不足以扭转表示差距。

哪些结论不能下,边界在哪里?

首先区分 3 类表述。直接报告的是 20% 接近全量、跨域平均相对改善 19.99%、未见平均准确率从 66.5% 到 81.6%;有限解释的是全局局部一致性有助于捕捉伪造痕迹,这有跨骨干与跨数据支持但仍是相关性而非因果证明;未验证推测是该表示必然降低误判率或延迟,论文未测延迟、算力与误杀率,不能承诺。其次看失败条件与边界。

难跨域集上绝对等错误率仍高,说明方法缩小差距但未解决问题;高标注区增益饱和,说明数据充足时不必支付大规模预训练成本;未见合成器测试无真实样本,准确率不能代替等错误率。原文表述与算术如有冲突应标注冲突而非圆场,例如摘要的 22.7% 准确率提升与正文平均准确率变化的口径需按原文各自条件理解,不自行换算。证据缺项包括滑动平均动量、投影细节、逐层冻结策略、统计显著性与推理开销,这些缺失不是技术错误,但复现时必须列为待验证。

最后是资源边界:本次未发现可验证的开源链接,不得写当前可用或已公开,任何复现都应从文字重建而非假设能下载权重。

要复现应先做什么,需要哪些超参数?

复现分两步。第一步重建预训练:准备 100 万无标签音频并确保与跨域评估无重叠,统一裁剪或拼接为全局 64600 点与局部 32300 点,仅局部加噪;搭建 XLS-R 加 AASIST 双分支,结构相同参数独立,学生反传、教师滑动平均;经多层感知机、全连接与 Softmax 得分布并用交叉熵对齐;用 Adam 训练,骨干学习率 1 乘 10 的负 6 次方,分类器 1 乘 10 的负 3 次方,权重衰减 5 乘 10 的负 5 次方,单卡批量 32,4 卡训练 180 轮。

第二步重建微调:取教师编码器,丢弃投影头,新接二分类头,输入长度与全局段相同;在 2019 LA 训练加开发集的 20% 上微调,学习率固定 1 乘 10 的负 6 次方,单卡批量 16,加权交叉熵权重 0.9 与 0.1;增强与基线保持一致,包括 MUSAN、房间脉冲响应、RawBoost、编解码与 0.9 到 1.1 倍速扰动。先跑通 20% 与 100% 基线的对照,再跑 35 万与 100 万预训练量的对比,最后才跑跨域。记录时保留随机种子、划分方式、阈值选择与聚合口径,等错误率保留原文精度。

何时值得尝试:当标注只有全量的 20% 左右且测试含未见合成器时值得试;当标注充足且分布稳定时,优先加监督数据而非先做百万级预训练。还需补的验证是滑动平均系数敏感性、冻结策略与真实场景误杀率,这些决定了方法能否从论文基准走到可用系统。

一句话收束:何时用它,何时不用?

综合全部证据,ADD-DINO 的判断是:在标注稀缺且需跨域的音频伪造检测中,用全局长段带局部加噪短段的非对比自蒸馏先学一致表示,再用少标签微调教师骨干,能以 20% 标注逼近全量监督的域内水平,并把跨域平均等错误率从 15.31% 降到 12.25%、未见合成器平均准确率从 66.5% 提到 81.6%。适用条件是能负担 100 万级预训练与一致增强,且接受难集上绝对性能仍高的现实。不适用条件是标注充足、分布稳定或对延迟与误杀有硬约束而又无测量时,不应默认该方法更省或更稳。

初学者复述时抓住三句:同一音频一长一短两视图,学生追教师的分布而教师慢跟学生,微调只用教师骨干加新头。记住指标方向与口径,相对百分比不等于百分点,纯伪造集准确率不等于等错误率。下一步若要深化,可在保持基线增强一致的前提下补做增强开关、动量系数与冻结策略的对照,并在含真实样本的跨域集上报告等错误率与误杀率,这样才能把一致性表示的贡献从相关性推向更可靠的因果解释。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总