英文题目:BForSec-P1.9: TRACEBACK TRANSLATORS AGAINST FORGETTING IN CONTINUAL FAKE SPEECH DETECTION
会议身份:
conference:eusipco:2026:conference-paper-id:0000796
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#持续学习 #领域适应 #跨语言 #语音伪造检测
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Gottardis, Enrico:机构信息未能从会议 PDF 纯文本可靠映射
- Tamiazzo, Mattia:机构信息未能从会议 PDF 纯文本可靠映射
- Milani, Simone:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为静音到浊音跃变点附近截取的多段语音梅尔频率倒谱系数谱图,输出为真伪二分类的音频级判定,难点在于新生成器与新语言持续到来时微调会引发灾难性遗忘且旧数据常不可复用。先在源域训练定制残差网络得到冻结编码器与分类头,再在嵌入层后插入带瓶颈与残差连接的轻量回溯翻译器以重映射新特征空间到原空间,随后以分类损失联合相关对齐与原型一致约束驱动适配,音频级决策由多谱图多数投票聚合得到。相对全量微调与仅调归一化层的域自适应,冻结主干加翻译保留了源域决策边界而只学习跨域残差映射,因而源域精度完全不变且待训练参数大幅减少。在FakeOrReal评测设置下,域翻译方法在源域ASVspoof 2019测试集上的EER为9.74%,低于全量微调的EER 43.2%。该结论适用边界受限于单源到三个单目标的独立适配验证,尚未验证多任务序列累积、开放攻击与强压缩信道下的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
本文解读的对象是持续伪造语音检测任务。输入是一段待判定的语音,输出是真或假的二分类判决,必要时还要区分伪造子类型。学习依赖是先在一个源数据集上训练好检测器,再只用新到达的目标数据集做延续更新,且更新时不能再访问旧数据。目标是在学会新伪造类型与新采集条件的同时,不丢失在旧数据上的判别能力。
解读必须保留的关键信息包括数据预处理与聚合口径、主干与翻译器的冻结与更新边界、3 个损失的组合方式、4 个评测库与 3 种延续策略的对照条件、以及参数量与精度的代价。输出按学习依赖展开,先讲任务与相关路线,再讲方法全景与组件计算,然后讲训练与推理流程,最后讲实验条件、结果、消融、局限与复现清单。凡是教学用的举例会明确标为例子,不把例子当作论文报告的数值。
资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,只能按论文文字复述方法与条件。
已有路线在解决什么,留下了哪个缺口?
论文把已有工作分成迁移学习与域自适应一路,以及持续学习一路。迁移与自适应一路的做法包括基于低秩自适应的微调、跨语言知识迁移、无监督域自适应处理分布偏移,目标是把预训练模型搬到新分布。持续学习一路包括用自适应学习改变梯度方向保留旧知识、用模型蒸馏约束、用真样本表示跨域对齐相似性约束,以及用混合专家把不同数据集知识分散到多个专家再用门控融合。
另一项对照研究把检测器分成编码器与分类模块,比较整体延续训练与只动其中一段的效果,报告指出重训编码器而冻结分类器能在学新与保旧之间取得更好平衡。本文的缺口定位是,在冻结分类器的思路上再往前一步,不再微调主干本身,而是在嵌入之后插入一个轻量回溯翻译器,只训练该翻译器来把新特征空间映射回原特征空间。论文自述据其所知,这种简单的适配器式结构此前未被用于音频伪造检测中的分布对齐。
理解这一点很重要,后文所有冻结与更新的判断都以此为基准,不能从模型名字推定实现。
为什么只用新数据微调会同时带来学会与遗忘?
问题可以沿一个样本走一遍。取一条新伪造语音,先在静音到浊音的显著时刻附近截取 42 帧,算出 128 个梅尔频率倒谱系数,得到一张 128 乘 42 的语谱图,送入定制残差网络得到 128 维嵌入,再经全连接头得到真假分数。如果把整个网络在新库上重训,梯度会同时改动特征提取与分类边界,新域误差下降很快,但旧域对应的特征位置与边界也被搬动,旧域精度随之下滑,这就是灾难性遗忘。论文的持续学习设定更苛刻,更新时只有新域数据可用,不能把旧数据拿回来联合训练。因此评价必须看两端,新域是否学会,旧域是否保住。只看一端会误判方法好坏。
灾难性遗忘 × 持续学习: 灾难性遗忘指只用新伪造数据微调后模型在旧库上大幅掉点,持续学习则是要求只见新域数据仍同时保住旧域与新域判别力的任务设定,二者搭配的原因是伪造语音检测中旧数据常不可得,组合意义在于把评价从只看新域好坏改为同时考核新域增益与旧域保持。
为初学者举一个例子,例子,不是论文数值,假设旧库是英文高质量合成语音,新库是中文低质量部分伪造语音,两者的信道、语言、伪造痕迹都不同,直接微调会让模型把旧的真假分界面挪去迁就新数据,旧库上的等错误率随之上升。论文用 4 个库来具体化这种偏移,源域是英文的 ASVspoof 2019,目标域包括英文的 FakeOrReal 与 In-The-Wild,以及中文的 ADD 2022,语言变化最大的一组也带来最大的遗忘压力。
冻结检测器加翻译器的方法全景是什么?
方法全景分 3 条延续策略对照。第一条是全量重训,把整个网络在新数据集上重训,性能上限高但遗忘严重。第二条是域自适应,只重训批量归一化层而冻结其余部分,有时被称为持续归一化,优点是只需新数据集且可学习参数极少、训练更快。第 3 条是本文提出的域翻译,冻结整个主干,在嵌入层之后加一个轻量翻译器,只训练该翻译器做真或假的类条件对齐。推理时目标域样本先走冻结的特征提取得到 128 维向量,再经翻译器搬运后送入冻结的全连接分类头。
训练时翻译器的监督来自三部分,分类损失保证搬运后仍可分,相关对齐损失拉齐源与目标的均值与协方差,原型一致性损失拉近两类各自的类均值。两个正则系数的取值为 0.05 与 0.01。
域自适应 × 域翻译: 域自适应在本工作中指只重训批量归一化层而冻结其余主干,域翻译指冻结整个主干并在嵌入后加一个带残差的小网络把目标域特征搬回源域分布,二者分工不同在于前者改归一化统计去凑新域,后者显式做类条件对齐,搭配比较的理由是都要只用新域数据且只更新极少参数,组合意义是看出保留源域精度需要哪种程度的干预。
沿样本再走一遍可以帮助记忆,先取一张新域语谱图,经冻结卷积得到 128 维嵌入,此时新域真假簇的位置与源域不一致,翻译器学习一个残差映射,把真簇搬向源域真原型,把假簇搬向源域假原型,然后冻结的分类头按源域边界判决。这样旧域样本不受影响,因为旧域推理可以不经过改变主干的更新,而新域样本被显式搬回旧空间。
主干、嵌入与翻译器各自算什么?
分类主干是定制残差网络 18。论文说明第一卷积层冻结,分类头由两个全连接层加归一化与丢弃构成。图注与正文把结构描述为从输入经多层卷积到 128 维嵌入,再经全局池化与线性层到 7 类输出,这里的 7 类对应源域训练时的多分类设置,而延续到目标域时标签为真或假的二分类。嵌入是全连接头之前的 128 维向量,是翻译器的工作点。翻译器结构是带瓶颈的全连接模型,瓶颈维度为 32,后接层归一化与残差连接,形式可理解为输出等于输入加一个对归一化后输入的非线性变换。参数量很小,论文报告翻译器可训练参数为 21 千,域自适应为 10 千,全量重训为 11095 千。
CORAL 损失 × 原型一致性损失: CORAL 损失负责拉齐源域与目标域特征的均值与协方差,原型一致性损失负责拉近真与假两类各自的类均值即原型的类内距离,二者搭配的原因是只对齐整体分布仍可能混淆真假边界,组合意义是在翻译器训练目标中同时约束分布形状与类别中心,使翻译后的真假簇分别落回源域对应位置。
嵌入 × 翻译器: 嵌入指定制 ResNet18 在全连接分类头之前输出的 128 维向量,翻译器指作用于该向量上的瓶颈为 32 的全连接加层归一化与残差连接的小模块,二者分工是嵌入提供待分类的声学表示而翻译器只改表示不改分类器,搭配理由是冻结分类器才能保住源域决策面,组合意义是用极少参数实现跨域的特征搬运。
损失的具体分工需要分开讲。分类损失是在加权交叉熵加标签平滑的基础上,再对把真样本误判为第 6 类合成的情况加额外惩罚,权重向量取 6、1、1、1、1、1、1,惩罚系数取 5.0,平滑系数取 0.08,目的是抑制模型把真样本判成某一特定合成类的倾向。验证时用标准交叉熵。相关对齐损失同时约束均值差的平方范数与协方差差的矩阵弗罗贝尼乌斯范数,原型一致性损失约束源与目标两类原型差的一半平方范数。最终训练损失是三者加权求和。原文未给出梯度是否截断到源特征的细节,因此不猜测源分支是否参与反向传播,只按文字说明翻译器是被训练的轻量模块而主干冻结。
数据怎么做出来,模型怎么训练与推理?
训练分源模型训练与翻译器训练两段。数据层面,每条音频在显著时刻附近可抽出多张语谱图,某些类别的可用样本少导致真假不平衡,论文用基于 2 维 U 型网络去噪核心的扩散模型生成语谱图样本,保持输入表示的空间结构与尺寸,再配合经典数据增强与非平衡采样器缓解不平衡。源模型在 ASVspoof 2019 训练子集上训练,训练单元是单张语谱图。推理时对同一音频 excerpt 抽出的多张语谱图做多数投票,得到音频级结果。
这一点决定了指标聚合对象是音频 excerpt,不是单张谱图,复述时不能混淆。翻译器训练时需要源特征与目标特征成批出现,批量计算真假类均值即原型与协方差,再算上述 3 个损失。论文未报告优化器类型、学习率、批量大小取值的完整清单,这是复现时的具体缺项,只能按已给的损失权重与瓶颈维度先搭流程,再补超参数搜索。
多数投票 × 语谱图: 语谱图指从静音到浊音的显著时刻附近取 42 帧、128 个梅尔频率倒谱系数构成的 128 乘 42 矩阵,是训练与推理的基本单元,多数投票指同一音频 excerpt 抽出的多张语谱图各自判决后再投票得到音频级结果,二者分工是前者解决变长音频的定长输入问题而后者聚合局部判决,组合意义是训练在谱图级做而评价在音频级做,需要明确聚合口径才能复述指标。
需要提醒的是,扩散增强带来源模型精度的提升在消融中有定量报告,但增强样本的生成数量、采样比例与筛选标准在现有证据中没有完整交代,因此只能说论文报告了增益方向与幅度,不能复述出完整的生成配比。
在哪些库、按什么协议、用什么指标比?
评测库共 4 个。ASVspoof 2019 是英文合成与语音转换的常用基准,分训练、开发与评测三部分,本文基线模型的训练用其训练子集。FakeOrReal 是英文真与合成语音,合成来自多种文本转语音系统,真语音来自公开语音数据。In-The-Wild 收集自名人与政客的真实场景英文音频,覆盖多样的录制条件与生成方法,适合测鲁棒性。ADD 2022 是中文真与合成音频,覆盖低质量与部分伪造等条件,适合测跨语言适应。
主干选择阶段在 ASVspoof 2019 开发集上比较,指标是开发集准确率与开发集损失,外加训练轮数。延续学习阶段在 3 个目标库上分别做延续,再回测 ASVspoof 2019 评测集看保持情况。指标用接收者操作特征曲线、等错误率与曲线下面积。等错误率越低越好,曲线下面积越高越好。比较的公平条件是 3 种延续策略都只用新域数据更新,不再使用旧数据,全量重训更新全部参数,域自适应只更新批量归一化层,域翻译只训练翻译器。
论文还与基于轻量卷积网络的延续学习对照方法比较,但该对照的训练细节需回到原文献核对。
主干选型与延续策略的主结果是什么?
先看主干选型问题,在相同开发集上哪个架构更适合做后续冻结。公平条件是都在 ASVspoof 2019 开发集上报告准确率与损失,指标方向是准确率越高越好、损失越低越好。下表整理论文报告的对照,定制残差网络 18 与音频谱图变换器同为最高准确率,但后者参数与训练成本明显更高,因此论文选择前者做后续延续。
| 架构 | 开发集准确率 | 开发集损失 | 训练轮数 | 成本说明 |
|---|---|---|---|---|
| 定制 ResNet18 | 0.994 | 0.112 | 240 | 约 11 million 参数 |
| 音频谱图变换器 AST | 0.994 | 0.193 | 324 | 约 86 million 参数 |
| ConvNeXT-Tiny | 0.904 | 0.329 | 296 | 准确率低于前两者 |
| ResNet18 多分类 | 0.883 | 0.269 | 148 | 低于定制版本 |
| ResNet18 二分类 | 0.860 | 0.398 | 110 | 低于定制版本 |
表后解释需要同时讲收益与代价。定制版本的收益是开发集准确率最高且损失最低,代价是仍需 240 轮训练才能收敛。未胜出项中,音频谱图变换器准确率持平但损失更高且参数约 86 million、训练更长,在资源受限时不占优。轻量卷积系列表现更低,说明在此预处理与损失配置下并非越大越好。
需要指出,该表只是开发集上的选型依据,不能直接当作 4 个库上的最终检测能力。 再看延续学习的主问题,3 种可运行策略在只见新域数据时,新域增益与旧域保持如何折中。下表用论文文字中的平均变化与保持点来概括,数值方向是目标域等错误率越低越好、源域曲线下面积越高越好。
| 策略 | 目标域平均表现 | 源域平均变化 | 源域保持 AUC | 源域保持 EER |
|---|---|---|---|---|
| 域自适应 | 平均下降 2.3% AUC | 源域损失明显 | 未保住 | 上升约 30.8% |
| 域翻译 | 平均损失 3.4% AUC | 基本保住 | 95.4% AUC | 9.74% EER |
表后解释要讲清反例。全量重训在目标域最好,但在源域遗忘最严重,语言差异最大的中文库上损失最大。域自适应比全量重训更稳健,目标域平均只降 2.3% AUC,但源域仍有约 38% AUC 损失与约 30.8% 等错误率上升。域翻译在目标域平均损失 3.4% AUC,略大于域自适应,但源域保持在 95.4% AUC 与 9.74% EER,与基线基本一致,且只更新 21K 参数。
这是论文主张的折中,报告显示它能处理跨语言适应,但可能、待验证的是这种保持是否能推广到更多未测的伪造类型,原文只测了 3 个目标库。
翻译器里两个对齐项与扩散增强各自贡献多少?
消融要回答两个问题,第一是扩散生成的数据增强是否真带来源模型增益,第二是相关对齐与原型一致性是否都需要。论文报告只用 ASVspoof 2019 训练集时分类准确率为 81.9%、曲线下面积为 91.5%,加入原始与生成样本后准确率升到 83.7%、曲线下面积升到 95.0%,支持增强有效的判断,但生成配比未完全交代是限制。第二是损失组合的对照,只用原型一致性时 3 个目标库的等错误率分别为 10.75%、11.87%、7.34%,只用相关对齐时分别为 11.84%、9.05%、7.72%,论文称二者组合平均更有效。
下表把这两组对照放在同一口径下,指标方向是等错误率越低越好、准确率与曲线下面积越高越好。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 源模型是否加生成样本 | 准确率 | 81.9% | 83.7% | 仅原始训练集 |
| 源模型是否加生成样本 | AUC | 91.5% | 95.0% | 仅原始训练集 |
| 翻译器只用原型一致性 | FoR、ITW、ADD 的 EER | 组合更优 | 10.75%、11.87%、7.34% | 只用 CORAL 时 11.84%、9.05%、7.72% |
| 翻译器只用 CORAL | FoR、ITW、ADD 的 EER | 组合更优 | 11.84%、9.05%、7.72% | 只用原型一致时 10.75%、11.87%、7.34% |
表后解释要指出未胜出项。
单用任一项都不如组合平均更有效,但分库看各有胜负,例如只用相关对齐在 In-The-Wild 上为 9.05%,优于只用原型一致性的 11.87%,说明总体趋势不等于每组都成立。负结果或边界是论文未报告拿掉分类损失后的表现,也未报告翻译器瓶颈维度取 32 之外的敏感性,因此不能补写拿掉后必然怎样。训练与部署成本方面,论文只给了可训练参数量,全量重训 11095 千、域自适应 10 千、域翻译 21 千,对照文献的 3 组为 5556 千、521 千、5035 千,但推理延迟、内存占用与实际训练时长未系统测量,不能承诺延迟得到改善。
哪些结论有边界,哪些量根本没测?
先区分 3 类表述。论文直接报告的是 4 个库上的曲线下面积与等错误率、参数量、开发集选型数字与上述消融数字。有限解释是域翻译在跨语言上可用,因为中文库上仍保持源域精度且目标域达到 98.1% AUC 与 6.96% EER 量级,但这只是一个中文库的证据。未验证推测是扩展到更多数据集的规模化能力与对不同域偏移的鲁棒性,论文在结论中明确列为未来工作。
未测量的量包括误判率分布、推理延迟、输出帧率、实际训练耗时与硬件预算,总体参数量小不等于每步推理都快,训练资源与推理开销需要分开讨论。数据层面的缺项包括每个目标库的划分、采样数、增强样本占比、显著时刻检测的具体阈值与实现,以及翻译器训练的优化器与学习率。评价层面的缺项是统计显著性与多次随机的方差,现有数字是单次报告还是平均值在证据中没有明确口径。
相关性不等于因果,例如目标域好而源域保持好,不能直接推定是某一损失单独导致的,组合更优的结论来自平均,具体到单库仍有波动。
要复现这套流程,第一步先做什么?
复现先做数据与口径对齐。第一步按论文描述实现显著时刻附近的 128 乘 42 语谱图抽取,明确每条音频抽几张谱图、训练时以谱图为单元、推理时以音频 excerpt 为单元做多数投票,并固定 4 个库的训练、开发与评测划分。第二步复现定制残差网络 18,冻结第一卷积层,分类头用两个全连接层加归一化与丢弃,用加权交叉熵加标签平滑与针对第 6 类的额外惩罚训练源模型,权重取 6、1、1、1、1、1、1,惩罚系数取 5.0,平滑系数取 0.08,验证用标准交叉熵,并记录开发集准确率与损失。
第三步冻结主干,在 128 维嵌入后实现瓶颈为 32 的残差翻译器,用分类损失加 0.05 的相关对齐与 0.01 的原型一致性训练,只更新翻译器。第四步按 3 种策略分别只用新域数据更新,再回测源域。何时值得尝试这种方案,当旧数据不可得且必须保住旧域精度、同时可接受目标域比全量重训低几个点时更合适。当目标是只追求新域最高精度而不顾旧域时,全量重训仍是更直接的选择。
还需补的验证包括更多语言与伪造类型的扩展、瓶颈维度与损失权重的敏感性、以及延迟与内存的实测。由于本次未确认代码与权重可达,复现应从文字与公式出发自行实现,不假设有公开仓库可用。
学完这篇应该带走哪几条可操作的判断?
第一条是评价口径,持续伪造语音检测必须同时报告目标域增益与源域保持,只报一端会掩盖遗忘。第二条是冻结边界,全量重训、只动批量归一化、只训翻译器三者的区别不在名字而在哪些参数参与梯度更新,复述时要指明更新集合。第 3 条是翻译器的工作点,它不在波形也不在分类头,而在 128 维嵌入之后做类条件搬运,监督来自分类、均值协方差对齐与类原型对齐三部分。
第四条是代价观,21K 参数换来源域基本不掉点,但目标域平均比全量重训差约数个点,这是有源证据的折中,不是免费的午餐。第 5 条是跨语言的适用条件,论文在英文源到中文目标上显示了可行性,但仅凭一个中文库不能推广到所有语言与信道,扩展验证仍待补充。
把这 5 条放回开头的问题,方法选择是冻结检测器加回溯翻译器,最强证据是源域保持在 95.0% 量级的同时目标域保持在 95% 以上,主要代价是目标域精度略低于全量重训且部分超参数与统计口径缺项,需要后续补齐。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
区域 3 · 查看论文原页
区域 4 · 查看论文原页
另有 11 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



