英文题目:Does Fine-tuning by Reinforcement Learning Improve Generalization in Binary Speech Deepfake Detection?

会议身份:conference:interspeech:2026:conference-paper-id:wang26k_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#强化学习 #SFT #鲁棒性 #音频深度伪造检测

评分:7.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Xin Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Wanying Ge:机构信息未能从会议 PDF 纯文本可靠映射
  • Junichi Yamagishi:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音深度伪造检测以波形为输入并输出真或假二值判决,核心难点是向目标域微调后在未见攻击与声学条件下泛化严重急剧退化。本文沿预训练加后训练加微调链条展开,先用大规模真实语音自监督预训练与含声码器伪造数据的后训练得到表征,再在小规模目标域数据上比较监督微调与强化微调,最后用分布漂移工具佐证泛化差异。与仅用真值对数似然的监督微调不同,组相对策略优化对每个输入采样多个人工判决并以组内归一化优势同时利用正负奖励加参考模型约束更新。在Deepfake-Eval-2024微调后的多测试集评测下,纯组相对策略优化的In-the-Wild等错误率为2.19%,低于监督微调的等错误率6.35%。结论限于后训练初始化的自监督语音鉴伪器与4个域外集,对无后训练流水线已被证伪,对流派外攻击与阈值外推性未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,输出是什么,为什么泛化难?

本文输入是一段待判定的语音波形,输出是一个二选一标签,即真人说的话还是合成或转换生成的假话。研究生复述时要先固定这个动作:模型对每条测试语音算出判为真的概率或分值,再与阈值比较,高于阈值判真,否则判假。

评价用等错误率,白话就是漏报和误报相等时的错误率,数值越低越好。难点在于攻击类型、说话人、信道和背景噪声一直在变,训练时见过的伪造方法到部署时可能完全没出现过。过去十年常见做法是精心收集真假配对数据直接训练,但新攻击一出现,固定数据集训练的模型就容易失效。

于是领域转向先用大规模真实语音做自监督预训练得到语音基础模型,再用小规模标注数据做微调。预训练解决通用听觉表示,后训练和微调解决伪造判别,但微调阶段用错方法会把通用能力洗掉。本文要回答的正是微调算法本身是否影响泛化,而不是换更大的前端就能自动解决。

语音基础模型 × 后训练: 语音基础模型指用大量真实语音经自监督学习得到通用表示的前端,负责提供可迁移的声学特征;后训练指在基础模型和正式微调之间,再用大量真实、伪造和声码器模拟伪造数据把表示调得更贴近伪造检测,搭配理由是直接从通用表示跳到小规模目标域容易偏科,组合意义是让微调起点已经具备伪造相关的判别结构。

论文给出的 3 段规模对比很直观:预训练用约 500,000 小时真实人声,后训练用约 7 点 50,000 小时真实加声码器模拟加伪造数据,而目标域微调只用约 54 小时。这种数量级落差决定了学习依赖:大阶段定表示,小阶段只应做对齐,不能把大阶段的知识覆盖掉。代码当前可用,已公开,地址指向 AntiDeepfake 项目,复现时先确认该仓库可达再谈权重下载。

同任务同阶段的已有路线差在哪里?

同输入同目标的工作主要沿两条线走。第一条是语音伪造检测自身的预训练加微调线,从语音自监督前端加全局平均池化加线性层和 Softmax,到近期加入后训练阶段,用大量多域真假和模拟假数据先把前端调得更适合检测,再在目标域小数据上做监督微调。

第二条是大语言模型的多阶段训练线,即预训练学通用模式,可选中期训练,再用监督微调和强化学习做对齐,其中组相对策略优化被用来只做强化微调也能提升跨任务表现并更好地保留预训练知识。本文明确把自己放在第二条线的启发下,但研究对象仍是第一条线的主流结构,即语音自监督前端加二分类后端,而不是基于大语言模型的语音检测器。

已有把强化用于大语言模型式检测器的工作与本文对象不同,不能直接当同条件基线。相关工作的对照点因此是同运行阶段的微调算法:同样从后训练检查点出发,同样只用目标域小数据,比较只做监督、只做强化、先监督后强化等实际可运行策略。论文还引用了灾难性遗忘和持续学习的讨论,说明微调偏向目标域而偏离旧域是两边领域的共性问题,这为后文用正则项和漂移分析埋下依据。

论文把哪个具体问题拿来做实验?

论文把范围收得很窄:假设前端和后端组成的参数已经经过后训练,只研究用特定域的小训练集做微调这一步。举例来说,目标域是 2024 年社交网络采集的评测训练集,含真假语音,时长有限且背景复杂,测试时既测同分布的该数据集评测切分,也测声学条件不同的域外集。教学例子仅为帮助理解流程,不代表论文报告了该例子的数值效果。

问题形式化为:给定波形,调参得到条件概率分布,训练时调参,测试时取判真的概率或分值做阈值判决。关键约束是微调数据量小、时长被截到 15 秒以内,而评测覆盖 4 秒到 50 秒多种切分和 4 个域外库,因此任何只记住目标域细节的捷径都会在域外暴露。

论文不研究如何从零预训练基础模型,也不重新设计后端结构,后端固定为取最后一层特征做平均池化,再经线性变换和 Softmax 得到两类概率,推理时用真的分值打分。

监督微调 × 灾难性遗忘: 监督微调指只用目标域标注的真假标签最小化负对数似然,负责把模型拉向当前数据分布;灾难性遗忘指微调后在其他任务或域上性能下降的现象,负责解释为何域内变好不等于泛化变好,搭配原因是小数据强监督容易覆盖后训练学到的宽分布知识,组合意义是本文把域外退化作为必须测量的代价。

从学习依赖看,必须先理解二分类判决动作,再理解预训练、后训练、微调 3 段的数据与目标差异,最后才能讨论强化微调为何可能比监督更保泛化。

三段流水线里本文动的是哪一段?

论文研究的是 3 段流水线最后一段的算法选择。第一段预训练用海量真实语音学通用表示,第二段后训练用多域真假和模拟数据把表示调向伪造检测,第 3 段微调只用目标域小数据做最终对齐。

本文固定前两段已完成的检查点,比较第 3 段的不同做法,包括只做监督微调、只做强化微调的两种实现,以及先监督后强化的混合做法,还有强化内部去掉正则或去掉负样本的变体。图前导读如下:下图把 3 段的数据桶、小时数和微调候选项画在同一流程里,适合 1 次看清本文的实验边界与数据规模落差,请按焦点顺序观察主路径与分支含义。

看图路径: 1. 先从左到右看预训练到后训练再到微调三段箭头,注意虚线旁路;2. 再看每段下方数据桶标注的数据类型与小时数差异;3. 最后看右侧灰底微调框内并列的监督微调与强化微调选项

原论文 Figure 1:Illustration of multi-stage training pipeline for speech deepfake detection models.

论文图 1。原论文 Figure 1:“Illustration of multi-stage training pipeline for speech deepfake detection models.”。

该图显示从左到右的主箭头是预训练指向后训练再指向微调,另有一条虚线旁路表示也可以从预训练直接微调。下方 3 个数据桶分别标注真实人声、真实加声码器加伪造、目标域小数据,右侧灰底微调框内并列写着监督微调、强化微调和先监督后强化等选项。像素细节表明本文只动灰底框内部,不重训前两段,这与正文只微调后训练模型的声明一致。记住这个边界,后文所有域内域外对比都是同一流水线末段的不同算法之争,而不是换前端或换数据的胜利。

监督与强化的计算各在算什么?

先沿一个样本走完流程。输入一条波形,前端输出帧级特征,平均池化压成定长向量,再经线性层和 Softmax 得到判真和判假的概率。监督微调的动作是直接拿真值标签算负对数似然,也就是让真值对应概率越高越好,损失只看真值那一项。

强化微调的动作不同:先用旧参数的模型对同一输入采样多个候选标签,对二分类器就是多次采样真或假,再按奖励判断每个采样是否与真值一致,一致给 1 否则给 0,然后在组内算优势,最后按优势加权推高好采样的概率、压低差采样的概率,同时用正则项把新模型拽住不让它远离冻结的参考模型。论文还考虑了简化版强化,即每批采样后直接更新、不单独维护旧参数集,并去掉裁剪,用法接近同策略强化。

组相对策略优化 × 优势函数: 组相对策略优化指对同一输入采样一组输出再按组内相对好坏更新策略的强化算法,负责提供更新框架;优势函数指用单个采样奖励减组均值再除以组标准差得到的相对得分,负责判断这次采样比同组平均好多少,搭配原因是二分类输出只有真或假,单样本奖励过于稀疏,组合意义是用组内正负样本的对比信号同时推高答对概率和压低答错概率。

论文特别列出两个可能影响泛化的差异。第一是正则项,形式上是新旧模型的近似距离,权重默认较小,实验还试了去掉和加大两种取值。第二是优势函数同时利用答对和答错的采样,而监督只用真值项。

为分离影响,论文设了无正则、大正则和去掉负样本 3 种变体,其中去掉负样本后优势退化为只有答对才有信号,性质接近加正则的监督,详细推导见补充材料但正文已给出结论方向。

奖励 × 正则项: 奖励指采样标签与真值一致时为 1 否则为 0 的指示函数,负责告诉模型什么算答对;正则项指约束微调后模型与冻结参考模型之间距离的近似 KL 惩罚,负责把模型拽回后训练起点附近,搭配原因是奖励管学新域,正则管别忘旧域,组合意义是论文用不同权重来分离两者对域内拟合与域外保持的不同贡献。

复述时不要从模型名字推定梯度是否经过前端:原文说参数集包含前后端并一起调,但未逐层报告冻结细节,缺项就应标缺,不猜哪层停梯。

微调真正跑了什么,超参数如何定?

训练部分只做微调,不重做预训练和后训练。起点有两类:一类是后训练好的检查点,前端为不同规模的多语模型,后端已适配检测;另一类是对照用的纯预训练前端加随机初始化后端,用于检验强化是否必须站在后训练肩膀上。

微调数据是目标域训练集,为适配显存按最长 15 秒切分。优化预算统一为最多 10 个轮次,每 20,000 步做 1 次早停验证,选验证集等错误率最低的检查点评测,整个微调加评测循环做 3 轮并报告平均等错误率,硬件为单张高算力显卡。强化超参数沿用已有数学推理做法,组内采样数为 64,正则权重默认较小,混合流程中监督和强化各最多跑 10 轮。

推理动作不变,仍取判真的分值打分。这种设计保证比较公平:同一前端、同一数据划分、同一轮次上限和同一选点规则,差别只在损失是监督负对数似然还是组相对优势加权加正则。论文未报告学习率、优化器细节和每步采样开销,复现时需以公开代码为准,不能从前端名称推定训练实现。

用什么数据和指标才能谈泛化?

实验按目标域与非目标域组织。目标域内评测用目标评测切分的 5 个按时长截断版本,最长分别为 4 秒、10 秒、13 秒、30 秒和 50 秒,用于看微调是否学会当前分布。域外评测用 4 个声学条件不同的库,包括挑战评测集、合成语音检测集、切分后的语音库和野外采集库,用于看是否保住后训练的宽分布能力。

原后训练检查点见过很多库的评测切分,因此常用早期欺骗库不能再当域外集用,这是一个必须遵守的评估边界,否则会把见过的数据当没见过。指标方向统一为等错误率越低越好,域内域外分开平均,不混算。漂移分析另用早期开发集做参考集,对每个测试集的假语音取池化后向量并算分布间距离,距离越小表示表示层越没飘走。

纯强化微调比纯监督好在哪里,代价是什么?

主结果围绕后训练大模型展开,并用另两个前端验证趋势。首先确认监督的代价:不做微调的后训练模型在野外集上等错误率较低,而监督微调后域内下降但域外多数库上升,说明学了目标域却丢了部分旧知识。纯强化微调的作用是把域外拉回来,同时域内保持与监督相当。

简化版强化与完整版趋势相近,说明裁剪和单独维护旧参数不是关键。混合流程先监督后强化并未超过纯强化,域内相当但域外更高,尤其在两个域外库差距明显。把强化直接用在无后训练的预训练前端上则域外明显更差,说明强化是保知识而不是无中生有。表前比较问题如下:在同一后训练起点和同一目标域数据下,纯监督与纯强化谁能在域内持平的同时保住域外,公平条件是同前端同数据同轮次上限,指标为等错误率越低越好,原表单位在表头为百分比,数据格为裸值。

微调方式DFE24 平均ADD23DVItW
SFT10.266.098.756.35
GRPO9.935.342.762.19

该表显示纯强化在域内平均略好或持平,而域外三列全面低于监督,尤其后两列下降幅度大,主要收益是缓解监督带来的域外退化。具体代价是强化并未把域内推到远低于监督,在另两个前端上甚至略高,因此不能承诺强化同时大幅优化域内。未胜出项是监督在域内个别切分仍有竞争力,但其域外代价更大,复述时必须同时讲收益与代价。图前导读如下:下图用漂移距离从表示层解释上述错误率变化,横轴是 9 个测试切分,纵轴是对数刻度的距离,请重点看监督与强化相对灰色后训练基线的上下移动。

看图路径: 1. 先确认横轴九个测试切分与纵轴对数刻度的漂移距离含义;2. 再对比上图中灰粗线与黑虚线和黑实线在左侧与右侧的高低变化;3. 最后看下图中不同正则强度曲线在域内段的分叉

原论文 Figure 2:Drift values measured on different test sets

论文图 2。原论文 Figure 2:“Drift values measured on different test sets”。

上子图显示灰粗线代表只到后训练的模型,在左侧 5 个目标域切分上漂移较高,在右侧域外较低;监督微调把左侧拉低但把部分域外抬高,而强化微调把左侧拉低的同时没有把右侧推高。下子图显示不同正则强度的强化变体在左侧目标域段分叉,无正则与默认在左侧都很低,强正则在左侧明显偏高,支持正则过强会欠拟合目标域的判断。该图报告的是分布距离变化趋势,像素不能精确读出每点数值,复述时只讲相对高低,不硬写坐标值。

数据漂移 × Wasserstein 距离: 数据漂移指测试集嵌入分布相对参考集的偏离程度,负责量化域差异;Wasserstein 距离指衡量两组嵌入分布之间搬运代价的距离,负责给出漂移数值,搭配原因是只看错误率不知道是表示飘了还是阈值偏了,组合意义是用同一后训练前端的池化向量算距离,为监督微调与强化微调谁更保表示提供第三方证据。

正则和负奖励各自起了什么作用?

消融按强化内部两处改动组织。第一处是正则权重,默认较小,对比去掉和加大。去掉正则后域内与默认相近,但域外部分库明显升高,说明完全不要约束会丢一部分保持能力。把权重放到很大后域内大幅变差,呈现欠拟合,而域外个别库反而低,这种好不能当胜利,因为目标域都没学会。

与大语言模型文献中正则不重要或可去的结论不同,本文在二分类检测器上不能得出正则无用的结论,漂移图下半部分也显示强正则在目标域段偏高。第二处是负奖励,即是否保留答错采样的负优势。去掉负样本后所有测试集都比默认强化差,论文据此推测负奖励可能是关键差异,因为监督只看真值项,而强化同时用对错对比信号。表前比较问题如下:在固定纯强化框架下,改变正则强度或去掉负样本是否还能保住域内域外平衡,公平条件仍是同起点同数据,指标越低越好,原表单位在表头为百分比,数据格为裸值。

强化变体DFE24 平均ADD23DVItW
SFT 后接 GRPO9.815.787.045.89
GRPO 无正则10.214.436.502.71
GRPO 强正则15.834.021.661.13
GRPO 去掉负样本11.416.693.093.14

该表的主要信息是混合流程域外差于纯强化,去掉负样本全面变差,而强正则虽在部分域外数字低但域内从约 10 量级恶化到约 15 量级,属于欠拟合的反例。未胜出项很多,例如无正则在个别域外仍可用,但综合不如默认,这支持论文用可能、待验证的语气谈机制,而不是断言负奖励必然是唯一原因。论文还报告另两个前端上纯强化同样缓解域外退化,但幅度与主前端不同,说明趋势跨前端成立但每组数值不保证同等提升。

哪些结论还不能下,边界在哪里?

论文直接报告的是等错误率和漂移距离的变化,有限解释是负奖励可能关键、正则强度需适中,未验证推测是为何对比信号能保表示的具体机理,留待未来工作。缺失证据不是技术错误,但复述时要用词区分:用报告或显示讲数字,用支持讲漂移与错误率一致,用可能或待验证讲因果。

边界有 4 条。第一,未测误判以外的延迟、算力、存储和阈值稳定性,不能承诺这些量也改善,组采样较大的训练开销与推理开销要分开谈。第二,只试了 3 个语音自监督前端和一个目标域,换目标域或换后端结构后结论是否成立待验证。第三,后训练检查点见过很多库,评测排除了常用库,换评测集可能改变排序。第四,混合流程只试了各最多 10 轮的顺序训练,未穷举交替或联合训练,不能说任何混合都不好。

相关性不等于因果:漂移低与错误率低同时出现,支持但不证明是表示保持导致错误率下降。总体趋势也不等于每组每步成立,个别切分上监督仍可能略好。

要复现先做什么,需要哪些条件?

复现先做三件事。第一,确认代码当前可用并取到后训练检查点,包括不同规模前端对应的文件,论文给出数字对象标识和仓库路径,权重下载与系统可运行是两回事,要分别验证。第二,按论文协议准备目标训练集并做最长 15 秒切分,评测准备 5 个时长切分和 4 个域外集,注意不要把后训练见过的库误当域外。

第三,固定最多 10 轮、每 20,000 步验证、3 轮平均的流程,先跑纯监督基线,再跑默认小权重、组采样 64 的纯强化,接着跑无正则、强正则、去负样本和先监督后强化,用同一选点规则比较。关键超参数只有组采样数和正则权重是论文明确给出的,其余优化器细节以代码为准,缺项不猜。

硬件参考是单张高算力卡,换卡要重调批量与步数,但比较公平性要求各方法同预算。生成式工具声明只说用于改语法,不影响方法复现。

何时值得尝试强化微调,何时不值得?

当你已经有后训练好的检测器,又必须用小目标域数据微调,且担心域外退化时,值得尝试纯强化微调,因为论文显示它在域内持平而域外回升,且混合流程并未更好。当你没有后训练起点,只有预训练前端加随机后端时,不值得直接指望强化创造泛化,论文显示此时强化域外更差,应先做后训练或先保证表示质量。

当计算预算只够跑监督时,要意识到代价可能是域外漂移增大,上线前必须加域外集和漂移监控,而不是只看目标域验证集。论文特有的误解有三:其一,把强正则在个别域外的低数字当成更好,实际上目标域已欠拟合;其二,把去掉负样本后的变差当成证明因果,原文只是说可能是关键;其三,把大语言模型中正则不重要的结论搬到二分类器,本文明确说不能照搬。

还需补的验证是更多目标域、更多前端、阈值稳定性与实际延迟,以及负奖励机制的直接测量。记住一句话:小数据微调的目标不是记住新域的每个细节,而是在学会新域的同时不把旧本领忘掉,强化在这里的价值是提供对错对比和适度约束,而不是替代数据与评估。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总