英文题目:Soft-Gating Score-Level Fusion for Spoofing-Aware Speaker Verification

会议身份:conference:interspeech:2026:conference-paper-id:han26e_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#模型集成 #语音 #说话人验证 #语音伪造检测

评分:5.6/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Seongkyu Han:机构信息未能从会议 PDF 纯文本可靠映射
  • Yowon Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Thien-Phuc Doan:机构信息未能从会议 PDF 纯文本可靠映射
  • Thien An Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
  • Souhwan Jung:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

防欺骗说话人验证(Spoofing-Aware Speaker Verification,SASV)需在一次判决中同时拒绝零努力冒充试次和合成伪造试次,难点是自动说话人验证(Automatic Speaker Verification,ASV)与反欺骗对策(Countermeasure,CM)目标冲突且分数尺度漂移。所提方法先将ASV余弦相似度经线性映射归一到[0,1],将CM真伪Logits经Softmax转为真实语音后验概率,再在开发集上估计各自等错误率(Equal Error Rate,EER)阈值并计算分数与阈值之差作为置信度边距,最后按CM门控(CM Gating)、ASV门控(ASV Gating)与双门控(Double Gating)三种解析式逐试次加权求和得到融合分。与固定求和与固定加权融合相比,该机制让置信高的子系统主导判决,无需额外训练即可即插即用。在ASVspoof 2019 LA评测下,CM门控融合的a-DCF为0.0178,低于简单求和基线1的a-DCF 0.1738。在四组ASV-CM组合与两个基准语料上的对比显示双门控在多数配置下最优,且无需训练的动态加权可超越需训练的深度神经网络后端嵌入融合基线。其失败条件是CM的EER阈值接近0或1时边距失真会导致ASV区分力或CM拒伪能力被压制,故适用边界受限于阈值居中且需按阈值位置选择门控类型,极端阈值下的稳定融合尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,哪些信息必须保留?

本文面向刚进入语音与音频方向的研究生,目标是把 1 篇防欺骗说话人确认融合论文讲到可核对、可复述。输入是论文正文证据与两张官方原图像素,不引入外部解读。必须保留的信息包括任务定义、3 个门控公式的计算动作、归一化与阈值来源、4 种模型组合与 2 个数据集的实验条件、主结果的比较对象与失效条件。输出是 1 篇按学习依赖展开的中文技术解读,术语首次出现先给白话再给英文。

防欺骗说话人确认,英文为 Spoofing-Aware Speaker Verification,简称 SASV,要求系统同时回答两个问题:说话人是不是目标本人,以及语音是不是真实语音。自动说话人确认,英文为 Automatic Speaker Verification,简称 ASV,只回答前者。伪造对策,英文为 Countermeasure,简称 CM,只回答后者。1 次试验通常包含一条注册语音和一条测试语音,ASV 比较两者的说话人嵌入,CM 只看测试语音是否为合成、转换或重放。只有当身份匹配且为真实语音时才应接受,其余目标与非目标、目标与欺骗的组合都应拒绝,这就是后文所有融合与指标的前提。

已有融合路线走了多远,为什么还不够?

论文把已有工作放在分数级融合这条线上梳理。最简单的是直接相加,把归一化后的 ASV 分数与 CM 分数相加得到 SASV 分数,不需要额外训练。更灵活的是加权融合,用在开发集上调好的固定权重控制两者比例。近期还有分数感知的门控集成,例如 ATMM-SAGA 把 CM 分数作为乘性门控去抑制可疑的 ASV 嵌入。论文指出静态规则的两个局限:第一,ASV 与 CM 分工不同,欺骗试次更需要 CM,非目标试次更需要 ASV,固定权重无法按试次切换。

第二,当某个子系统分数尺度占优或跨数据集分布漂移时,融合判决会被拉偏。ATMM-SAGA 虽然引入门控思想,但需要额外的联合训练与交替优化,且只是用单个 CM 分数去乘嵌入,没有显式建模两个分数之间的逐试次相对贡献。本文的定位因此很明确:保留分数级融合可直接复用独立预训练模型的优点,但把固定权重换成逐试次的软门控,且不引入可学习参数。

要解决的具体矛盾是什么?

具体矛盾是同一套固定融合权重要同时处理两种性质不同的错误。举例说明,这里的例子是教学用,不是论文报告的新数值:若测试语音是冒充者的真实语音,CM 会给出高真实分,此时应主要听 ASV 的身份判断;若测试语音是目标音色的合成语音,ASV 可能给出高相似分,此时应主要听 CM 的真实性判断。固定求和或固定加权对这两种试次使用同一套系数,必然顾此失彼。更隐蔽的问题是分数分布偏移,例如某个 CM 在新数据上输出普遍偏高,固定融合会系统性高估真实性。

论文因此把问题形式化为如何为每个试次动态分配 ASV 与 CM 的贡献,且分配依据必须来自本次输出自身的可信程度,而不是全局统一的超参数。

方法全景:一个样本如何走完输入到输出?

先沿一个样本走完全流程。输入是注册语音与测试语音,ASV 子系统输出原始相似分,CM 子系统输出原始欺骗检测分。接着两者分别做归一化,ASV 余弦相似度从区间映射到 0 到 1,CM 的真实与欺骗逻辑值经 Softmax 转为真实后验概率。然后在开发集上估计各自的等错率阈值,用归一化分数减阈值得到边距,边距绝对值大表示远离分界、可信,边距小表示贴近分界、模糊。最后按所选门控类型把分数与边距组合成最终 SASV 分数,再与判决门限比较得到接受或拒绝。下图是论文给出的系统框图,左侧双输入、中部分数、右侧门控的结构与上述流程一一对应,阅读时可先看输入如何分叉再看分数如何汇入同一个门控框。

看图路径: 1. 先从左侧注册语音与测试语音两个输入出发,确认哪一路同时进入两个子系统;2. 再看中间两个矩形输出的两个分数符号如何汇入右侧大框;3. 确认右侧大框内置信度模块与三种门控输出的分支关系;4. 对照正文确认该图没有训练回路,只是前向分数计算

原论文 Figure 1:Diagram of SASV with the proposed fusion gate.

论文图 1。原论文 Figure 1:“Diagram of SASV with the proposed fusion gate.”。

从本次实际收到的 FIGURE_1 像素看,该图左侧有两个波形图标分别标注 Enrollment utterance 与 Test utterance,箭头显示 Test utterance 同时进入 ASV 与 CM 矩形框,Enrollment utterance 只进入 ASV 框。中间输出两个符号,分别为 s_ASV 与 s_CM,共同进入右侧标有 Dynamic Soft Gating 的大框,框内还有 Confidence delta 小框。右侧大括号引出 3 个输出分支,像素文字分别为 s_CM-gate、s_ASV-gate 与 s_SASV-gate。这个布局说明融合发生在分数层,不改动嵌入网络,也不增加训练回路,部署时只需在原有管线上加一个按公式计算的分数变换,执行顺序是先归一化再算边距最后选门控分支。

三个门控如何计算,符号与目标是什么?

论文先定义符号。记归一化后的 ASV 分数为 sasv,越大越支持目标说话人;归一化后的 CM 分数为 scm,越大越支持真实语音。记开发集等错率阈值为 τasv 与 τcm。置信度边距定义为分数减阈值,即 δasv 等于 sasv 减 τasv,δcm 等于 scm 减 τcm。

计算目标是让可信子系统的分数在最终结果中占更大比重。CM 门控的计算是 CM 分数乘其边距,加上 ASV 分数乘一减 CM 边距绝对值。当 CM 远离阈值时,第一项放大,第二项缩小,融合更听 CM;当 CM 贴近阈值时,第二项保留更多 ASV。ASV 门控对称,把控制权交给 ASV 边距,CM 分数乘一减 ASV 边距绝对值,ASV 分数乘其边距。

双门控则各自乘各自边距,两路独立缩放, confident 时都可强贡献。论文说明 CM 门控更适合欺骗试次但仍保留 ASV 区分目标与非目标的能力,ASV 门控更适合非目标试次但仍保留 CM 抑制欺骗的能力,双门控允许两侧同时自信。需要提醒的是公式中边距可正可负,负值会改变符号含义,实际使用时最终分数的排序方向与判决门限需与实现保持一致,论文未另设归一化到非负权重的步骤。

下表对照 3 种门控由谁控制权重、两路各乘什么系数以及论文给出的更适用试次,读表时先看控制边距再看系数组合原因。

门控类型控制边距CM 分数系数ASV 分数系数论文所述更适用试次
CM 门控CM 边距CM 边距一减 CM 边距绝对值欺骗试次兼顾目标与非目标区分
ASV 门控ASV 边距一减 ASV 边距绝对值ASV 边距非目标试次兼顾欺骗抑制
双门控各自边距CM 边距ASV 边距两侧同时自信时独立放大

该表把分工讲清楚了:谁可信谁主导,另一路用一减绝对值保留兜底,双门控则两路各自按自身边距缩放。

组合原因是 ASV 负责目标与非目标区分、CM 负责真实与欺骗区分,试次类型决定此刻更需要哪种分工,因此用本次分数与阈值的距离逐试次切换比重,而不是用全局固定权重一刀切。

自动说话人确认 × 伪造对策: 自动说话人确认负责区分目标说话人与非目标说话人,伪造对策负责区分真实语音与合成转换等欺骗语音,二者目标不同所以单一分数无法同时处理零努力冒充和欺骗攻击,组合意义在于让每次试验都同时保留身份证据和真实性证据,再由门控决定谁主导。

分数级融合 × 软门控: 分数级融合的分工是把已训练好的两个子系统输出的标量分数映射到同一量纲后相加或加权,软门控的分工是按每次试验的置信度连续调节权重,搭配理由是固定权重无法应对试次类型和分数尺度变化,组合后形成无需联合训练的逐试次动态加权。

等错率阈值 × 置信度边距: 等错率阈值是在开发集上使误接受与误拒绝相等的分界点,置信度边距是归一化分数减去该阈值的差值,搭配理由是远离阈值意味着判决明确而靠近阈值意味着模糊,组合意义是把边距的绝对值直接当作权重,让可信子系统在本次试验中说话声音更大。

CM 门控 × ASV 门控: CM 门控用伪造对策边距控制融合权重,ASV 门控用说话人确认边距控制融合权重,前者分工是欺骗可疑时压住身份分数,后者分工是身份模糊时保留伪造检测能力,搭配双门控一起构成 3 种可直接切换的策略,论文用它们分别应对欺骗主导和非目标主导的试次。

有没有训练阶段?真实计算过程是什么?

本研究没有为融合本身设置训练阶段,也没有引入可学习参数,这是论文反复强调的部署优点。真实计算过程分为已有模型的复用与免训练的推理计算两部分。ASV 模型在 VoxCeleb2 上训练,CM 模型在各数据集对应的训练集与开发集上训练,论文使用的 ASV 为 ECAPA-TDNN 与 ReDimNet,CM 为 AASIST 与 Conformer-TCM,共组成 4 种 ASV 与 CM 组合。融合阶段不更新这些网络,只做 3 步计算:按公式做分数归一化,在开发集上估计等错率阈值,在评估试次上按所选门控公式算出融合分。

执行顺序上,先完成两个子系统的独立训练与分数输出,再冻结全部网络参数,最后在开发集定阈值、在评估集做逐试次门控计算。由于没有梯度路径、优化器与损失函数,也就不存在冻结与更新之分。缺项在于论文未报告阈值估计的具体搜索粒度与分数归一化在极端分布下的裁剪细节,复现时需按常规等错率计算流程自行实现,并记录所用开发集划分,否则阈值微小差异会直接改变边距,进而改变门控系数的相对大小。

实验在什么数据、模型与指标下进行?

论文在 ASVspoof 2019 LA 与 ASVspoof 5 两个基准上实验,遵循各自官方评估协议,ASVspoof 5 按第二赛道封闭条件进行,结果报告在评估集上。数据层面,前者是经典的逻辑访问合成与转换攻击集合,后者是更大规模、含众包与对抗攻击的更难集合,两者攻击类型与信道条件不同,正好检验跨数据集稳定性。模型层面,4 种组合覆盖两种说话人嵌入与两种伪造检测器的搭配,可以观察某种 CM 分数尺度异常时融合是否仍稳定。

指标层面,论文同时报告说话人等错率、欺骗等错率、综合 SASV 等错率与架构无关的代价指标 a-DCF。说话人等错率越低表示目标与非目标区分越好,欺骗等错率越低表示真实与欺骗区分越好,a-DCF 越低表示在给定先验与代价下的期望代价越小,论文按 ASVspoof 5 官方协议设置先验与代价。比较条件上,基线包括简单分数相加与需要额外训练的深度网络嵌入后端融合,门控方法与基线共享同一套子系统分数,区别只在融合公式,因此性能差异可归因于融合策略。

资源状态方面,本次未发现来源绑定且完成验证的代码、模型或数据链接,不得声称已公开。

说话人等错率 × 欺骗等错率: 说话人等错率只考核目标与非目标真实语音的区分能力,欺骗等错率只考核真实与欺骗语音的区分能力,二者分工不同所以论文还要报告综合的 SASV 等错率与代价指标 a-DCF,搭配使用才能看出门控是改善了身份区分还是改善了防欺骗,以及综合代价是否下降。

主结果测了什么,谁与谁比,支持什么判断?

主结果要回答的是免训练的逐试次门控能否同时打败简单相加与需训练的嵌入后端融合,以及在更难数据上是否依然有效。比较是同子系统、同评估集、同指标下的直接比较,指标方向均为越低越好。下表把论文报告的总体结论整理为可运行策略的对照,数值只保留原文明确写出的相对改进表述,不自行填入原宽表的逐格数字以避免拼写与精度误差。

数据集对比基线融合策略报告的相对改进是否需额外训练
LA19 与 ASVspoof5简单分数相加CM 门控、ASV 门控、双门控最高约 90% 的 a-DCF 相对改进否
LA19 与 ASVspoof5深度网络嵌入后端融合CM 门控、ASV 门控、双门控总体优于该需训练基线否
ASVspoof5 更难条件上述两基线3 种门控多数组合仍降低 a-DCF否

该表的比较问题是免训练动态权重是否带来综合代价下降,公平条件是共享子系统与评估协议,指标方向是 a-DCF 越低越好。

表后解释如下:论文报告在 LA19 上 4 种组合总体明显优于简单相加,平均约 90% 的 a-DCF 下降,且多数情况下也优于需训练的嵌入后端融合,说明有效融合不一定需要额外训练,逐试次按边距调整贡献已能改变排序质量;在 ASVspoof5 上多数组合仍能降低 a-DCF,支持方法在更难条件下的有效性,执行比较时仍保持同模型组合与同官方协议以保证可比。

但总体趋势不等于每组都成立,论文明确列出反例,例如 LA19 上两种含 Conformer-TCM 组合的 CM 门控,以及 ASVspoof5 上两种含 Conformer-TCM 组合的双门控未能跑赢基线,这些反例留到局限一节用阈值机制解释。未胜出项的存在提醒读者不能把平均改进推广为所有搭配必然改进,选择门控类型时需结合阈值位置判断。

三种门控各在何时占优,代价是什么?

论文没有做去掉某模块的传统消融,而是把 3 种门控互为对照。在 LA19 上,双门控在 4 个组合中的 3 个上取得最优,说明两侧各自按自信缩放通常最充分;在含 AASIST 的组合上,CM 门控与 ASV 门控也表现稳定。在 ASVspoof5 上,最优门控随组合变化,没有一种门控在全部组合上垄断,这本身就是重要发现:门控选择应看阈值位置与分数分布,而非固定推荐某一种。具体代价是当阈值极端时,某种门控会系统性失衡。

例如阈值贴近 0 时 CM 边距恒为大的正值,CM 门控会过度放大 CM 而压缩 ASV,导致说话人区分退化;阈值贴近 1 时双门控对目标与非目标的缩放过弱,又对误判的高分欺骗限制不足,导致欺骗等错率上升。这些代价不是随机波动,而是与公式中边距乘分数的结构直接相关,因此下一节用分布图进一步验证。

阈值极端时为什么会失效?

本节聚焦论文明确承认的局限:当等错率阈值极端靠近 0 或 1 时,基于边距的动态加权会被扭曲。下表把两种极端情形的机制整理出来,数值仅保留原文明确写出的 0 或 1,不补充像素中难以精确辨认的计数。

条件阈值位置主导子系统受损指标文中定位
TCM 分数极端偏置情形一靠近 0CM 主导并压缩 ASV说话人等错率与 a-DCF 上升LA19 两种 TCM 组合的 CM 门控
TCM 分数极端偏置情形二靠近 1ASV 主导并弱化 CM欺骗等错率与 a-DCF 上升ASVspoof5 两种 TCM 组合的双门控

表前已提出比较问题:在相同 TCM 子系统下,不同阈值位置如何改变主导方与受损指标。表后解释如下:阈值近 0 时多数真实分数位于阈值之上,CM 边距恒大,CM 门控按公式放大 CM 分数而缩小 ASV 权重,由于 CM 对目标与非目标都给高分,身份区分信息被淹没。

阈值近 1 时目标与非目标分数距阈值近而缩放弱,误判为高分的欺骗因边距小被限制,远低于阈值的欺骗又因分数本身小而影响弱,最终融合被 ASV 主导而漏检欺骗。论文据此建议按阈值位置选择门控,阈值合理时边距才能在试次间有效变化。以下两幅分布图直观展示了这种极端偏置,阅读时先看阈值虚线位置,再看 3 类颜色的堆叠。

看图路径: 1. 先对比上下两幅直方图的横轴分数范围与虚线阈值位置;2. 再看上图中靠近 1 处蓝色与绿色堆叠与下图中靠近 0 处红色高柱的含义;3. 核对图例中目标、非目标、欺骗三类的样本计数差异;4. 结合正文判断阈值极端时哪一类边距被系统性放大或压缩

原论文 Figure 2:TCM score distributions under extreme thresholds.

论文图 2。原论文 Figure 2:“TCM score distributions under extreme thresholds.”。

从像素看,上图虚线靠近 0,左侧红色欺骗高柱集中在阈值附近,右侧靠近 1 处蓝色非目标与少量绿色目标堆叠,说明真实类分数远高于阈值而边距恒大;下图虚线靠近 1,左侧红色欺骗拖出长尾,右侧蓝色与绿色集中在 0.7 到 1.0 之间但仍低于虚线,说明真实类边距整体偏小。两图图例还给出 3 类样本量,上图量级为数千到数万,下图量级达数十万,反映 ASVspoof5 评估规模更大。这种分布形态与正文的机制解释一致:边距直接依赖阈值,阈值极端会使权重失去试次间的区分度。

复现应先做什么,需要补哪项验证?

复现时先准备四件事。第一,复用或训练好两类子系统,ASV 用余弦相似度并线性映射到 0 到 1,CM 用真实与欺骗逻辑值经 Softmax 转为真实后验概率,保证分数方向为越大越支持目标或真实。第二,在开发集上按标准流程计算等错率阈值并保存,供评估时计算边距使用,不要在评估集上重新估计阈值。第三,实现 3 种门控公式,注意边距带符号与绝对值的用法,保持与论文一致的分支逻辑。

第四,用同一套子系统分数分别跑简单相加、嵌入后端基线与 3 种门控,在 LA19 与 ASVspoof5 评估集上计算 4 种指标。还需补的验证包括阈值敏感性扫描,例如人为平移阈值观察 a-DCF 变化,以确认极端阈值下的失效边界;以及跨数据集的阈值迁移实验,检验开发集阈值在新分布下是否仍合理。由于论文未公开代码与权重链接,复现者需自行实现上述流程并记录随机种子与开发集划分。

推理开销方面,融合本身只是逐试次的标量运算,相对嵌入提取可忽略,但论文未测量延迟与内存,部署时需单独实测。

何时值得尝试,如何一句话记住它?

当已有可用的 ASV 与 CM 预训练模型,又希望不做联合训练而改善综合代价时,值得尝试这种软门控分数融合,尤其适合试次类型混合且分数尺度可能漂移的场景。若开发集阈值落在中间合理区间,双门控常是首选;若已知欺骗占比高且 CM 可信,可偏向 CM 门控;若非目标试次为主且 ASV 可信,可偏向 ASV 门控。一句话记住它:用离分界有多远来决定这次听谁的,远者多听,近者少听。

需要警惕的误解有三点:第一,免训练不等于确定性求解,阈值估计与子系统本身仍有统计不确定性;第二,平均 90% 量级的相对改进不等于每个组合都改进,阈值极端时可能反而不如基线;第三,a-DCF 下降不代表延迟下降,论文未报告推理成本。未来工作可探索对极端阈值更鲁棒的归一化或有界权重,这也是论文结尾指出的方向。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总