英文题目:Hard Positive-targeted Training for Robust Audio Deepfake Detection under Neural Codec Processing

会议身份:conference:interspeech:2026:conference-paper-id:seo26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据增强 #对比学习 #鲁棒性 #语音 #音频深度伪造检测

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jiwon Seo:机构信息未能从会议 PDF 纯文本可靠映射
  • Inho Kim:机构信息未能从会议 PDF 纯文本可靠映射
  • Seongkyu Han:机构信息未能从会议 PDF 纯文本可靠映射
  • Thien-Phuc Doan:机构信息未能从会议 PDF 纯文本可靠映射
  • Souhwan Jung:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理音频深度伪造检测(Audio Deepfake Detection,ADD)在神经编解码器(Neural Codec,NC)重建后鲁棒性骤降问题,输入为原始或NC重建波形,输出为真实(bonafide)与伪造(spoof)二分类,难点是NC伪影使真语音嵌入向伪造区域偏移并模糊边界。方法链分4步:先以干净真语音为锚构建包含2个NC真正样本与3个伪造负样本的小批量,持续暴露边界混淆对;再挖掘离锚最远的难正样本(hard positive)聚焦易错真语音;随后用引导损失(guidance loss)推远难正样本与负样本并用三元组损失(triplet loss)约束锚与负样本距离;最后与交叉熵联合优化以稳定分类。相比仅做NC数据增强,该机制显式塑造难例周围的嵌入几何而非期望模型自行学到分离。在包含BigCodec与SpeechTokenizer等条件评估中,SSL-Conformer总体等错误率(Equal Error Rate,EER)从24.36%降至10.93%,未见NC条件下从30.19%降至11.83%。结论限于4种低比特率语音编解码器与短句评测集,未验证高压缩音乐、实时流式及对抗自适应伪造的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,先把任务边界说清楚

这篇解读的输入是会议论文正文与两张官方原图像素,目标是让刚进入语音伪造检测的研究生能复述方法与实验条件。必须保留的信息包括任务定义、编解码处理方式、小批量组成、两个辅助损失的分工、训练与评测用的编解码器划分,以及等错误率与分类别准确率两类指标。本文输出按学习依赖展开,不做超出证据的推广。

先说任务。音频伪造检测用白话讲就是判断一段语音是真实录音还是合成转换语音。英文是音频深伪检测,常用缩写是 ADD。论文沿用语音自动说话人验证欺骗竞赛的标注协议,其中假的英文是 spoof,指文本转语音与声音转换算法生成的语音,真的英文是 bonafide,指真实录制语音。这个区分很重要,因为后面所有真假划分都按此执行。

再说干扰。神经音频编解码的英文是 neural audio codec,简称 NC。它不是合成新语音,而是把输入波形经过编码器再经过解码器重建一遍,目的是低码率压缩。论文把这种操作称为编解码处理或编解码重建,处理后标签保持不变,真还是真,假还是假。研究生容易误以为编解码改变了内容类别,原文明确说明重建的是同一句话,只是引入失真。

为什么编解码会伤害检测。直觉是编解码重建会抹掉部分判别线索,同时引入类似声码器的伪影。声码器是合成语音常用模块,它的痕迹本是检测器判断为假的依据之一。当真语音过一遍编解码也带上类似痕迹,检测器就容易虚警。虚警的白话是把真判成假,英文涉及误接受与误拒绝的权衡,后文用等错误率统一度量。

已有路线走到哪里,为什么只加数据不够

相关工作可以按同输入、同目标、同运行阶段来对照。输入都是原始波形,目标都是真假二分类,运行阶段都包含真实部署中可能出现的压缩传输。传统路线用信号处理编解码做稳健性测试,近期路线转向神经编解码,因为神经编解码在低码率下听感更好,已进入语音链路。已有报告显示编解码处理会明显拉低检测性能,原因被归结为伪影混淆。

另一条路线是数据增强,也就是把编解码后音频直接加入训练。它的操作简单,期望模型见多识广后自然鲁棒。论文的对照显示这条路线效果有限:在总体等错误率上只有小幅下降,而且在原始加已见编解码分组上甚至变差。这说明见过失真不等于学会边界,模型可能记住了失真风格,却没有重塑真假之间的几何关系。

神经音频编解码处理 × 音频伪造检测: 神经音频编解码处理负责把波形先编码再解码重建,追求低码率下保持听感,它的分工是引入压缩与重建伪影;音频伪造检测负责区分真实录音与合成转换语音,它的分工是捕捉声码器痕迹等判别线索;两者搭配的理由是编解码伪影与合成伪影相似,会把真语音推向假的一侧,组合意义在于必须把编解码鲁棒性作为检测训练的显式目标,而不是只做干净条件分类。

第 3 条路线是判别式度量学习,例如人脸识别中的三元组损失。它的思路是在嵌入空间里规定谁该离谁远。论文借鉴了主动批量采样的思想,但不是照搬通用度量学习,而是把采样与损失都收紧到编解码后真语音这个高危子群。这一定位决定了后文小批量必含干净真锚点与编解码后真正例,而不是随机组三元组。

退化到底发生在哪一侧,可视化与数字如何互相印证

要回答的第一个问题是编解码处理后,是真判错多了还是假判错多了。论文先用可视化给出趋势,再用分类别准确率量化,最后在两个检测器上检查是否一致。这种先看分布再算数字的顺序值得学习,因为总指标下降不能告诉你哪一侧在拖后腿。

可视化对象是用在逻辑访问 2019 训练集上训练好的自监督 Conformer 模型的嵌入,再用降维方法展示。自监督 Conformer 的英文是 SSL-Conformer,前端用语音自监督表示,后端用结合注意力与卷积的 Conformer。左图只放原始真与假,中图加入编解码后真,右图加入编解码后假。阅读时必须先按图例确认颜色与条件,再比较三幅图的覆盖关系。

看图路径: 1. 先看左图原始真与假是否分成粉绿两团,确认基线可分性;2. 再看中图蓝色编解码后真点是否大面积压住绿色与粉色交界;3. 对比右图编解码后假点是否仍留在粉色团内,判断偏移不对称;4. 结合图例确认每种颜色代表的四类条件,避免把同色误认同对象

原论文 Figure 1:t-SNE visualization of SSL-Conformer embeddings under original and NC-processed conditions.

论文图 1。原论文 Figure 1:“t-SNE visualization of SSL-Conformer embeddings under original and NC-processed conditions.”。

从像素看,左图粉色假团在左,绿色真团在右,中间有交界但大体可分。中图加入蓝色编解码后真点后,蓝色大面积铺在中部交界区,明显压住绿色并侵入粉色边缘。右图加入编解码后假点后,新增点基本仍落在粉色假团内部,没有大范围外扩。三幅并排读出的趋势是真嵌入偏移更明显,假嵌入相对稳定,两类重叠增加主要由真一侧驱动。原文也用文字确认了这一不对称趋势,但像素本身已足够支撑复述。

数字对照进一步锁定结论。对 SSL-Conformer,真准确率从 70% 多掉到 40% 多,假准确率只从 90% 多掉到 90% 出头。对另一后端 SSL-AASIST,真准确率从 60% 多掉到 30% 多,假准确率仍维持在 90% 以上。2 个模型方向一致,说明这不是某个后端的偶然现象。下面的整理表把这种不对称摆在一起看,阅读重点是真列的跌幅远大于假列。

为公平比较,编解码条件用同批语音的原始版与编解码版对照,编解码器选训练中也用的大码率编解码与语音分词器。指标方向是准确率越高越好。下面表格的单位是百分比,数值保留原文 2 位小数,不做四舍五入。

条件SSL-Conformer 真准确率SSL-Conformer 假准确率SSL-AASIST 真准确率SSL-AASIST 假准确率
原始77.10%97.20%66.28%97.73%
编解码处理后49.27%92.63%34.11%94.87%

表后需要点出代价与边界。该表显示退化主要由真一侧错误主导,假一侧只小幅下降。这支持后文专门拉开编解码后真与假距离的设计。但它只覆盖两种编解码与 2 个模型,不能推广到所有编解码器。未胜出项在这里是假类别,它本身退化不大,意味着后续方法若以牺牲假检出换真虚警下降,就需要警惕,这个权衡在主结果中还要再检查。

方法全景:一个样本走完全程

先沿一个样本走完输入到输出,再展开组件。取一段干净真语音作为锚点,输入是原始波形。前端用跨语言自监督模型提取语音表示,后端输出嵌入向量与真假分类分数。训练时同一小批量里还有它的编解码版本作为正例,以及若干假语音作为负例。优化目标同时做三件事:保持分类正确,把难正例周围的假推开,把锚点周围的真拉近假推远。推理时仍是常规二分类打分,没有额外检索步骤。

为什么要这样组织。因为问题集中在编解码后真向假漂移,所以锚点固定为干净真,正例固定为编解码后真,负例同时放干净假与编解码后假。这样每次梯度更新都能看到边界相邻的真假对,而不是随机抽到的容易对。表示的英文是 embedding,指模型倒数第二层左右的向量,距离用平方欧氏距离度量。

下图把这种思想画成优化前后对比,左为优化前,右为优化后,顶部图例给出 4 类点的颜色。阅读时先沿输入到输出的主路径看点的身份,再看虚线距离与分界线的变化,不要把颜色相同的点误认成同一条件。

看图路径: 1. 先看顶部图例区分锚点、正例、难正例与负例的颜色含义;2. 再沿左到右箭头看难正例如何从远离锚点变为优化的中心支点;3. 观察虚线距离与黑色虚线边界,确认推拉的是难正例与负例关系

原论文 Figure 2:Illustration of hard-positive selection and the result- ing mini-batch optimization under the…

论文图 2。原论文 Figure 2:“Illustration of hard-positive selection and the result- ing mini-batch optimization under the proposed objective.”。

从像素看,左框中深蓝难正例离绿色锚点最远,且与红色负例混在虚线边界附近。右框中深蓝难正例成为 3 条虚线的汇聚支点,3 个红色负例被推到边界外侧,浅蓝普通正例与绿色锚点留在内侧。箭头表示从左到右的优化方向,不是数据流向。该图对应的方法动作是先选出离锚点最远的正例作为难正例,再围绕它施加分离约束,同时用三元组约束维护锚点几何,防止表示整体漂移。

难正例如何选,两个损失各管什么

组件部分先讲选择规则,再讲两个损失。难正例的英文是 hard positive,指与锚点同类但嵌入最远的样本。形式化说,给定锚点,在其正例集合中取使锚点到正例距离最大的那个样本。距离函数记为嵌入向量的平方欧氏距离。实现上每个小批量只有两个正例,取最大就是二选一,计算量很小。

难正例 × 锚点: 锚点分工是提供干净真语音的参考位置,固定每个小批量的坐标原点;难正例分工是指出离锚点最远的那个编解码后真样本,也就是最容易越界的样本;搭配理由是只盯住最危险的正例才能持续暴露边界混淆,组合意义是后续两个损失都围绕这个难正例组织推拉方向,避免被容易样本平均掉梯度。

选出难正例后,引导损失负责把它与负例分开。它的约束是难正例到任一负例的距离,要大于锚点到难正例的距离再加一个间隔。优化时用柔性正部函数把违例程度转成可微损失,再对小批量内所有负例取平均。间隔记为小写字母,控制推开的强度。直觉是难正例已经是最危险的真点,如果连它都能与假拉开,普通正例更安全。

但只推难正例周边不够,因为锚点本身仍可能离假太近。所以第二个损失用经典三元组损失补上锚点视角。它要求锚点到任一正例的距离加上间隔后,仍小于锚点到任一负例的距离,否则用合页函数惩罚。间隔记为另一希腊字母,与引导损失的间隔分开调节。它的作用是把编解码后真拉回锚点附近,同时把假推远,维护整体真假边界。

引导损失 × 三元组损失: 引导损失分工是把负样本从难正例身边推开,约束难正例到负样本的距离大于锚点到难正例的距离加间隔;三元组损失分工是把锚点与正例拉近、把锚点与负样本推远,维护以锚点为中心的整体几何;搭配理由是前者只管难正例周边,后者补上锚点与负样本的关系,防止表示漂移,组合意义是两者加交叉熵联合优化,既保分类稳定又拉开真假边界。

总目标是分类交叉熵加两项加权辅助损失。两个权重分别控制引导损失与三元组损失的相对贡献。论文没有报告权重取值的消融,只在等错误率表中扫描两个间隔的组合。复述时不要编造权重数值,缺失即缺失。梯度路径按原文可确认的是嵌入函数参与距离计算,分类头参与交叉熵,前端是否冻结原文未明确说明,不能从模型名称推定冻结还是微调。

损失组合为什么不是重复用力

这节专门解释两个损失不是重复。引导损失的比较基准是难正例,它回答难的真点离假够不够远。三元组损失的比较基准是锚点,它回答干净真点是否同时靠近真、远离假。前者是局部清障,后者是全局定锚。如果只用前者,锚点与负例仍可能纠缠,边界整体不稳。如果只用后者,平均 over 两个正例会稀释最危险样本的信号,难例仍可能漏网。

从实现看,两者都用同一批负例,但距离的起点不同,一个从难正例出发,一个从锚点出发。这种双起点设计是论文针对编解码后真漂移的特化,而不是通用度量学习的堆砌。消融实验也显示去掉任一项后总体等错误率都上升,支持两者互补的判断,但具体上升幅度留到消融节用数字讲。

教学例子可以帮助理解,但明确标为例子。假设锚点是干净朗读,两个正例是两种编解码重建,其中一个带更强金属感而漂得更远,它就被选为难正例。引导损失把它身边的假播客合成语音推开,三元组损失同时确保干净朗读不被假包围。这个例子不添加任何数值效果,只说明分工。

小批量如何构造,训练数据如何组成

训练流程按原文可复述的部分包括数据组成与批量结构,优化器细节未报告。基线训练集是逻辑访问 2019 的训练集。增强版在此基础上加入两种编解码处理后的版本,这两种编解码在评测时称为已见编解码。提出的方法同样使用这些增强数据,但额外改变批量构造与优化目标。

小批量构造 × 数据增强: 数据增强分工是把编解码后语音加入训练集,让模型见过失真;小批量构造分工是规定每个小批量必含一个干净真锚点、两个不同编解码的真正例和 3 个假负例,其中含干净假与编解码后假;搭配理由是只加数据不控制共现,难的真假对不一定同批比较,组合意义是每次优化都强制呈现边界相邻的真假对,使分离约束真正被触发。

每个小批量的具体组成是原文明确给出的可复现细节:一个干净真锚点,两个编解码后真正例且各用不同编解码器,3 个假负例其中两个是干净假、一个是编解码后假。正例数记为 2,负例数记为 3。这种固定配比保证每次更新都有边界相邻的编解码后真假对。原文没有说明采样器如何保证说话人与攻击类型均衡,也没有报告学习率与训练轮数,复现时需先按默认配置跑通再补这些缺项。

监督来源有两路:类别标签提供交叉熵监督,同批样本的真假身份提供度量监督。重置时机方面,难正例是每批按当前嵌入动态选择的,不是预先固定的困难集,因此训练越往后,选择标准随表示变化而变化。原文未给出梯度截断或停止梯度的说明,不猜测哪条路径被截断。

评测条件如何划分,指标方向是什么

实验按问题组织,先讲条件划分。训练只见过两种编解码,评测分成 3 组:原始加已见编解码、未见编解码、全部条件总体。未见编解码用另外两种流式与频域编解码器,检验泛化。数据源覆盖多个外部集:真语音从 3 个公开语音集各抽 5000 条,假语音从两个竞赛评测集与野外集各抽 5000 条,再分别过 4 种编解码生成评测版。这种设计同时引入说话人、录音环境与采集差异。

模型用两个广泛使用的检测器,区别只在后端,一个用 Conformer,一个用图注意力网络,前端同为跨语言自监督表示。指标用等错误率与准确率。等错误率的英文是 equal error rate,简称 EER,定义在误接受率等于误拒绝率的工作点,越低越好。准确率按真假分别报告,越高越好,用于定位虚警还是漏检。

需要保留的关键超参数是两个间隔的扫描组合,原文表格给出多组取值,最优点在三元组间隔 0.3、引导间隔 0.2 附近。聚合口径是总体等错误率在全部条件下计算,分组等错误率在对应子集计算。硬件预算与统计显著性原文未报告,不能声称有多次随机种子平均。资源状态方面,本次未发现来源绑定且完成验证的开源代码模型数据,不得声称已公开可用。

主结果:增强基线与提出方法差在哪里

要测的核心问题是提出的方法是否比只加数据更能恢复编解码下的性能,且是否保持对假的检出。比较对象必须保留原文实际可运行的策略:只用原始训练的基线、加编解码数据的增强基线、以及加新批量与新损失的提出方法。搜索最优间隔另行标明,不能把事后最优当成默认可部署收益,复述时注明最优组合。

等错误率 × 类别准确率: 等错误率分工是报告误接受率等于误拒绝率时的工作点,反映阈值无关的整体混淆;类别准确率分工是把真与假分开计数,能定位是哪一侧在犯错;搭配理由是编解码退化主要在真一侧,只看总指标会掩盖虚警上升,组合意义是论文同时用两者证明改进主要来自真语音虚警下降,而假语音检出保持在可比水平。

先看总体与分组等错误率。增强基线相对原始基线只有小幅总体下降,且在原始加已见分组上反而上升,说明简单增强不可靠。提出方法在多组间隔下一致下降,最优总体等错误率降到约 10% 左右,未见编解码分组从约三成降到约 10% 二到 10% 三。下面整理表聚焦可运行策略与最优间隔的对比,单位是百分比,方向是越低越好。

模型训练策略总体等错误率原始加已见编解码未见编解码
SSL-Conformer基线24.36%21.21%30.19%
SSL-AASIST基线29.01%24.59%35.11%

表后解释主要收益与代价。收益是两个后端在已见与未见编解码上都大幅下降,且未见编解码的下降幅度更大,支持显式拉开嵌入距离比单纯见过失真更重要。代价与反例是增强基线在原始加已见分组上变差,提示只加数据可能损害原始条件。未胜出项也要点明:原文未报告每种编解码的细粒度错误与阈值选择,不能把总体趋势推广到每条语音都变好。

再看类别准确率,回答虚警是否下降。增强基线在编解码后真准确率上仍明显偏低,而提出方法把真准确率从约五成与三成多拉回到约 80%,同时假准确率维持在 90% 以上。下面是与问题节对应的恢复情况对照,重点看真列回升、假列不塌。

评测条件方法
原始增强基线
编解码后增强基线
原始本文方法
编解码后本文方法

该表报告显示改进主要由真一侧错误减少驱动,假一侧保持可比水平。但需注意原始条件数字也同时上升,可能与训练数据与批量变化共同作用有关,不能单独归因于某一个损失。原文讨论也承认有效性可能依赖难正例选择方式,推广到更多编解码仍待验证。

去掉一项会怎样,间隔扫描说明什么

消融要回答两个损失是否都必要,以及间隔是否敏感。实验固定最优间隔组合,只去掉三元组或只去掉引导损失,用同一检测器重训。结果是任一去掉都使总体等错误率上升,去掉三元组后未见编解码恶化更明显,去掉引导后原始加已见分组更高。这支持两者互补,但原文只报告一组间隔下的消融,不能推广到所有间隔都如此。

间隔扫描覆盖三元组间隔 0.1 到 0.3、引导间隔 0.1 到 0.3 的多组组合。2 个模型的最优不在同一格,但提出方法在所有列出的组合上都明显优于基线与增强基线,说明收益对间隔有一定鲁棒性。原文未做权重灵敏度与细粒度误差分析,讨论部分明确列为未来工作。复述时用可能待验证表达,不把 1 次消融当成因果证明。

从成本看,消融没有报告训练时长与推理开销。小批量固定为一锚二正三负,度量损失只增加批内距离计算,不改变推理结构,因此推理延迟理论上不变,但原文未测量延迟与计算量,不能承诺效率改善。总体趋势不等于每组都成立,个别间隔组合在未见编解码上略有波动,阅读原表时应同时看总体与分组。

哪些还没测,哪些不能承诺

先说已验证的边界。训练只见过两种编解码,评测扩展到 4 种,仍属于有限集合。真实链路中码率配置、级联压缩与信道噪声更多,原文未覆盖。数据集以英文朗读与竞赛语音为主,语种与场景泛化未验证。指标只报告等错误率与准确率,未测量误判率随阈值的变化、推理延迟与训练成本,因此不能承诺误报成本或实时性得到改善。

再说方法假设。难正例定义为离锚点最远的正例,每批只有两个候选,这个最远是否总是最有信息量,原文讨论提出疑问。当前证据只显示联合优化优于单项缺失,没有证明该选择规则是最优的。间隔与权重的敏感性也未系统报告,换后端或换前端时最优点可能移动。

相关性不是因果。可视化显示真嵌入偏移更大,数字显示真准确率掉得更多,两者一致支持真一侧主导的解释,但没有证明编解码伪影在信号层与声码器伪影相同。复述时用报告显示支持等分级措辞,对未测量部分明确说缺项,而不是当成技术错误。

要复现先做什么,需要哪些固定条件

复现第一步是固定数据与标签。训练用逻辑访问 2019 训练集及其两种编解码重建版,评测按原文从外部集各抽 5000 条再过 4 种编解码。标签规则是编解码重建不改变真假标签。抽样随机性会影响结果,原文未给随机种子,复现应先记录自己的采样清单,保证原始与编解码版是同条语音的配对。

第二步是固定模型与批量。前端用跨语言自监督表示,后端分别搭 Conformer 与图注意力网络。每个小批量按一锚二正三负构造,正例来自两种不同训练编解码,负例含两种干净假与一种编解码后假。距离用平方欧氏距离,损失按交叉熵加两项加权实现。间隔先从原文最优附近开始,再小范围扫描。

第三步是固定评测分组。分别计算原始加已见、未见与总体等错误率,再补分类别准确率,确认提升来自真一侧。不要只看总体等错误率,因为增强基线总体微降却在分组上变差的反例说明分组必看。代码与权重方面,本次没有验证可用的公开链接,复现应按论文描述自行实现批量构造与损失,不声称官方代码已公开。

何时值得尝试,一句话收束

当你的检测器在干净集上表现尚可,但一过压缩就出现大量把真判成假的虚警,且可视化或分类别准确率显示退化集中在真一侧,这套难正例训练值得尝试。它的适用条件是训练时能拿到编解码器做重建,并能按固定配比组批量。如果只能拿到离线增强数据而不能控制同批共现,预期收益会打折扣,这正是增强基线效果有限的教训。

还需要补的验证包括更多编解码与码率、难正例选择规则的对比、间隔与权重的敏感性,以及阈值相关的误报成本与延迟测量。教学上记住三句话:先定位哪一侧在错,再让难例同批现身,最后用双起点距离把边界拉开。论文的直接报告是总体与分组等错误率下降且真准确率回升,有限解释是嵌入几何被显式重塑,未验证的是最优选择规则与广泛泛化,这些区分决定了复述的严谨性。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总