英文题目:Temporal Ensembling Threshold and Neighbor-Aware Label Mixup for Speaker Verification with Open-Set Noisy Labels

会议身份:conference:interspeech:2026:conference-paper-id:fang26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#弱监督学习 #鲁棒性 #语音 #说话人验证

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zhihua Fang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shumei Tao:机构信息未能从会议 PDF 纯文本可靠映射
  • Liang He:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

说话人验证需从试听提取判别性声纹并判定是否同人,大规模采集混入闭集与开放集错误标注,开放集真值不在标签集内使单标签纠错仍误导训练。方法分三步衔接:先在全集预热训练获得基础判别力与初始嵌入,再计算样本嵌入与类原型的余弦相似度并拟合双组分高斯混合模型取交点为单轮阈值。接着对历轮阈值做指数滑动平均得到时间集成阈值以划分干净集与噪声集,干净集只用原始标签训练增强判别力,划分结果直接决定噪声集的后续监督方式。噪声集由均值教师输出选Top-K近邻类别并加权混合为软监督,高置信样本只取单个近邻,从而避免强行指定单一错误身份,相对单轮阈值与单标签纠错以时序平滑抑制波动、以分布混合容纳不确定性。在 VoxCeleb1对称50%噪声下 Vox-O 评测中 TET-LM 等错误率(Equal Error Rate,EER)为4.04%,相对基线 Standard 的13.71%大幅下降并优于最强基线 ES-GMM 的4.66%,平均 EER 相对 Standard 下降54%、最小检测代价(minimum Detection Cost Function,minDCF)下降42%。该结论限于人工对称与非对称同性别翻转噪声及 VoxCeleb 系列,在 Vox-E/Vox-H 部分条件下优势收窄或反转,未在真实网络噪声和跨信道场景验证。原文未披露完整训练时长与推理部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么噪声标签值得单独处理?

本文的输入是带说话人标注的语音训练集,目标是说话人确认,也就是判断两段语音是否属于同一说话人。学习依赖是先从语音中提取具有区分性的说话人嵌入,再用分类损失训练嵌入提取器与分类器,测试时用嵌入相似度做验证。必须保留的信息是噪声类型、数据构造方式、模型与损失配置、评估指标与基线条件,输出是可复述的方法步骤与可核对的实验结论。

说话人确认的核心困难不在于分类器本身,而在于大规模在线收集的语音标注不可避免地混入错误标注。错误标注会让模型把不属于该说话人的语音也拉向同一中心,从而破坏嵌入空间的类内紧致与类间分离。研究生常误以为加大模型或加大学习轮数就能覆盖标注错误,但原文的动机是标注错误是监督信号错误,容量越大反而记忆噪声越快,因此需要显式的选择或纠正机制。

闭集噪声 × 开集噪声: 闭集噪声指语音的真实说话人仍在训练标签集合内,只是标注错贴到另一个已知说话人,纠正还有可能指对;开集噪声指语音来自标签集合之外的未知说话人,真身份根本没有对应类别,任何单类别纠正都只能是近似。论文的矛盾正在于此,传统纠正方法默认闭集可纠,而开集下必须用混合标签做软化处理。

举例来说,假设训练集标有 1000 个说话人编号,某条语音真实说话人是第 1001 个未收录的人,却被标成第 5 号,这就是开集噪声的例子。若按闭集思路把它硬纠成第 7 号,仍然是错的。论文要解决的正是这种真身份不在集合内的情况,方法必须避免给出过度自信的单一纠正。

已有路线如何处理噪声标签,各自的边界在哪里?

按原文归纳,已有路线可分为样本选择、标签纠正和先选后纠 3 类。样本选择只用判定为干净的样本训练,代表做法包括用嵌入与说话人质心余弦相似度加固定阈值过滤,或用双分量高斯混合模型得到动态阈值,或用排序机制取高置信样本。标签纠正在训练中自动调整错误标签,例如在目标中加入纠正损失并用阈值动态平衡原始标签与纠正标签的权重。先选后纠则迭代地选干净样本并纠正噪声样本,把学习、选择与纠正结合起来。

原文指出这些方法大多默认闭集噪声,即真标签仍在已知集合内。对于开集噪声,纠正后的标签仍可能对模型产生负面影响,因为未知说话人无法被正确识别。教学上要区分的是,选择类方法的代价是丢弃数据,纠正类方法的风险是指错方向,开集下后者风险更大。论文因此把重点放在为开集设计更稳健的纠正方式,而不是只改进选择阈值。

同输入同目标的对照包括 LNCL、OR-Gate、CEC、LESS 和 ES-GMM,以及直接在噪声集上训练的 Standard 基线。这些基线覆盖了纠正、选择和先选后纠的不同取舍,后文主结果在相同噪声构造与相同评估表下比较,等错率越低越好,最小检测代价越低越好。

论文把开集噪声形式化成什么问题?

论文给定包含 C 个说话人与 N 条语音的数据集,每条语音有语音数据与说话人标签,但标签可能标错。说话人模型由嵌入提取器与分类器组成,分别输出嵌入、逻辑输出与概率分布,损失通常是加性边距 softmax 或加性角度边距 softmax。开集噪声的定义是某条噪声语音的真实身份在标签集合之外,因此任何从集合内挑选单一类别的硬纠正都无法命中真值。

样本选择 × 标签纠正: 样本选择负责把可能是干净的语音挑出来只用干净监督训练,避免噪声直接污染模型,标签纠正则负责给判为噪声的语音重新分配监督信号以保留数据量;二者搭配的原因是只选会丢数据,只纠正在开集噪声下会纠错,论文把先选后纠做成多阶段流程,让选择为纠正提供更可靠的表示基础。

学习依赖是先建立可靠的干净与噪声划分,再对噪声给出不那么武断的监督。论文的操作顺序是每轮计算样本嵌入与对应说话人中心的余弦相似度,用分布建模得到阈值并做时间平滑以划分集合,再对噪声样本用教师模型的输出构造邻居混合标签。这种安排把表示质量、划分稳定性与纠正柔和度串成一条链,任何一环抖动都会传导到损失上。

TET-LM 的全景流程如何把选择与纠正串起来?

从一个样本的角度走一遍,输入语音先经编码器得到嵌入,再经全连接分类器得到逻辑输出。训练模型负责产生当前轮的嵌入与预测,均值教师模型负责用动量平均后的参数产生更平稳的预测分布。全部数据先经过时间集成阈值分成干净数据与噪声数据,干净数据用原始标签计算干净损失,噪声数据用邻居混合标签计算混合损失,两部分损失相加作为第 3 阶段的总损失。

下图把 3 个面板放在一起,左侧是总体训练框架,右上是阈值选择分支,右下是混合纠正分支,阅读时先看主路径再看两个分支如何回接到损失上。

看图路径: 1. 先沿左侧全部数据经时间集成阈值分成干净数据与噪声数据的两条分支走一遍;2. 再看上方训练模型与下方均值教师模型之间标为 EMA 的箭头方向;3. 对照右上阈值分支中相似度计算到高斯混合建模再到样本选择的顺序;4. 对照右下纠正分支中教师输出取前 K 邻居再做权重归一化的顺序

原论文 Figure 1:The overall framework of our proposed TET-LM.

论文图 1。原论文 Figure 1:“The overall framework of our proposed TET-LM.”。

结合像素可见内容解释,面板甲显示全部数据经纵向阈值模块分叉,干净分支进入上方训练模型的干净损失,噪声分支同时送入下方均值教师模型并经右侧纵向混合模块形成混合损失回送到上方训练模型,上下 2 个模型之间标有指数滑动平均箭头。面板乙显示同标签嵌入的散点经相似度计算进入高斯混合建模,横轴为余弦相似度,纵轴为密度,曲线呈现双峰并标出当轮阈值与平滑公式,再输出噪声与干净样本的分组。

面板丙显示教师模型输出的柱状分布经取前 K 邻居筛选出深色保留类别,再经权重归一化得到混合权重向量。这一结构说明选择与纠正不是并列开关,而是共享同一表示与同一教师分布的上下游关系。

时间集成阈值如何从相似度得到稳定的划分?

第一步是构造说话人原型。原文在训练过程中收集每个说话人下预测正确的样本的归一化嵌入,取平均作为该说话人的类中心。随后计算每个样本嵌入与所标注类别原型的点积作为相似度分数,干净样本通常相似度更高,噪声样本相似度更低。对全部样本的相似度集合拟合双分量高斯混合模型,取两个分量的交点作为当轮阈值。

时间集成阈值 × 双分量高斯混合模型: 双分量高斯混合模型负责在每一轮对嵌入与说话人中心的余弦相似度分布拟合出干净与噪声两个峰并取交点为当轮阈值,时间集成阈值负责用指数滑动平均把历史阈值与当轮阈值加权平均;搭配原因是单轮拟合易受训练波动影响,平滑后阈值更稳定,从而减少干净与噪声集合在轮次间的反复横跳。

第二步是时间集成。原文用指数滑动平均聚合历史阈值,当前集成阈值等于平滑系数乘以上一轮集成阈值加上剩余权重乘以当轮阈值,平滑系数取 0.5。划分规则是相似度大于等于集成阈值为干净集,小于则为噪声集。白话讲就是不让某一轮偶然的分布抖动直接决定划分,而是让阈值带有记忆。

余弦相似度 × 说话人原型: 说话人原型负责把该说话人下预测正确的归一化嵌入取平均,得到这一轮的类中心表示,余弦相似度负责度量每个样本嵌入与所标注类别原型的点积接近程度;搭配原因是干净样本通常更靠近本类中心,相似度分布因此呈现可分的双峰,为后续高斯混合建模提供 1 维可阈值化的依据。

需要注意的边界是原型只用预测正确的样本构造,这意味着早期模型判别能力弱时原型本身带噪,阈值划分也更不可靠,这正是论文用暖机阶段先让模型获得基本判别能力的原因。原文未报告高斯混合的具体初始化与拟合迭代细节,复现时应指出这一缺项,不要从模型名称推定实现。

邻居感知标签混合如何给开集噪声分配监督?

均值教师模型的参数在每轮用动量系数更新,原文取 0.9,即教师参数等于动量系数乘以旧教师参数加上剩余权重乘以当前训练模型参数。样本的预测分布基于教师模型得到,用于生成更可靠的伪标签分布。这一设计沿用半监督学习中的常见做法,目的是让纠正信号比单轮学生预测更平滑。

均值教师模型 × 邻居感知标签混合: 均值教师模型负责用参数动量平均给出更平稳的预测分布作为伪标签来源,邻居感知标签混合负责从该分布中取前 K 个类别作为邻居标签并按归一化权重计算加权损失;搭配原因是开集噪声的真说话人不在标签集内,单一硬标签必然指错,而教师分布的前 K 邻居混合可以把监督分散到相近说话人上,降低纠偏偏差。

邻居混合的具体动作是把教师逻辑输出按值从大到小排序,取前 K 个类别作为该噪声样本的邻居标签集。考虑到高置信样本更可能是闭集噪声,原文对高置信样本只取一个邻居做纠正,低置信样本取 K 个邻居,置信度用学生概率最大值是否超过阈值判断,阈值取 0.4,邻居数取 10。然后对邻居集合内的教师逻辑值做 softmax 式归一化得到混合权重,再对噪声样本计算按权重加权的分类损失之和。白话讲就是不再强迫开集语音属于某一个已知人,而是让它按相近程度分摊到多个相近说话人上。

原文明确指出硬标签与软标签都不是开集下的最优解,混合是受 mixup 启发的折中。实现上梯度路径只写明损失加权形式,未给出是否对教师分布做停止梯度的显式说明,解读时不应脑补,复现时按教师只提供权重与类别、不回传梯度的常规理解操作并记录假设。

三阶段训练如何安排,参数何时冻结何时更新?

训练分为 3 个阶段并设有停止轮次。第一阶段是暖机,利用深度模型的记忆效应先在全部数据上训练,使模型获得基本说话人判别能力,暖机结束时用当轮阈值初始化时间集成阈值,用训练模型参数初始化教师模型参数。VoxCeleb1 的 3 个停止轮次分别取 5、40、80,VoxCeleb2 取 5、60、100。

第二阶段只用干净集训练,进一步提升判别能力,干净损失是干净集合上分类损失的平均。第 3 阶段停止样本选择,对噪声样本用教师模型计算的混合标签做监督,总损失等于干净损失加上混合损失。按原文描述,第二阶段阈值仍在起作用,第 3 阶段不再做选择划分,但教师模型与混合权重仍随训练演进。原文未报告各阶段学习率是否重置或冻结编码器等细节,只报告初始学习率为 0.001 并每轮衰减 0.97,优化器为 Adam,因此复现时应保持该调度并明确记录未报告项。

这种分阶段的理由是早期表示不可靠时不宜过早纠正,中期表示可用时先做选择提纯,后期分离较好时再引入混合监督。若把 3 阶段压缩为单阶段同时选择与混合,阈值抖动与教师不稳会互相放大,这是理解多阶段必要性的关键。

数据、噪声构造、模型与指标条件是否一致?

数据集用 VoxCeleb1 与 VoxCeleb2,前者包含 1211 个说话人与 148642 条语音,后者包含 5994 个说话人与 1092009 条语音。为评估不同噪声条件,原文从 VoxCeleb1 随机选 1000 个说话人加入对称与非对称噪声,剩余说话人的标签随机翻转到这 1000 个说话人的标签集内,VoxCeleb2 选 5000 个说话人并用同样流程。对称噪声如 30% 指每条样本以 30% 概率随机翻转到另一说话人标签,非对称 20% 指以 20% 概率翻转到下一个说话人标签,末位翻转到首位。为增加识别难度,被选噪声样本只翻转到同性别说话人标签。评估用 Vox1-O、Vox1-E、Vox1-H 的干净版本。

输入特征为 80 维对数梅尔滤波器组,说话人嵌入提取器为 1024 通道的 ECAPA-TDNN,嵌入维度 192,损失为加性边距 softmax,边距 0.2,尺度 30。批量 256,在单张 GeForce RTX 3090 上训练,超参数取平滑系数 0.5、动量 0.9、置信阈值 0.4、邻居数 10。指标用等错率与最小检测代价,代价目标先验概率取 0.01,两个指标都是越低越好。基线包括 Standard、LNCL、OR-Gate、CEC、LESS 和 ES-GMM,比较时训练数据与评估表相同。资源状态方面,本次未发现来源绑定且完成验证的开源资源,因此不得声称代码、模型或数据已公开,复现只能按论文文字重写流程。

主结果在多大噪声范围内成立,代价是什么?

比较的问题是相同噪声构造与相同评估条件下,哪种可运行策略的等错率与最小检测代价更低。公平条件是同训练集、同噪声比例与翻转规则、同评估表,指标方向为两者越低越好。下表整理 VoxCeleb1 上干净与对称非对称噪声下的关键数字,重点看 Standard 直接训练、此前较强的 ES-GMM 与本文 TET-LM 的差距。

条件指标Standard 直接训练ES-GMM 基线TET-LM 本文方法
VoxCeleb1 干净等错率%3.163.212.98
VoxCeleb1 对称 30%等错率%10.094.103.63
VoxCeleb1 对称 50%等错率%13.714.664.04
VoxCeleb1 非对称 40%等错率%9.884.974.26
VoxCeleb1 全部条件平均等错率%8.834.113.71

表后解释是 TET-LM 在 VoxCeleb1 的平均等错率与平均最小检测代价上优于 Standard 与最强基线,原文报告相对 Standard 降低 54% 等错率与 42% 最小检测代价,相对最强基线也有优势,尤其在对称 50% 与非对称 40% 等高噪声下差距拉大。代价是方法引入多阶段调度与教师模型,需要维护两套参数并计算相似度分布与前 K 邻居,训练复杂度高于单阶段直接训练。未胜出项需要指出,在 VoxCeleb2 的 Vox-E 与 Vox-H 评估上 TET-LM 的优势收窄,部分噪声点与 ES-GMM 接近,这说明总体趋势不等于每组都大幅领先,跨评估集的泛化幅度有限。

为核对更大训练集上的表现,下表整理 VoxCeleb2 在 Vox-O 评估下的对应数字,条件与指标方向与上表一致。

条件指标Standard 直接训练ES-GMM 基线TET-LM 本文方法
VoxCeleb2 干净 Vox-O等错率%1.271.191.15
VoxCeleb2 对称 30%Vox-O等错率%3.271.471.37
VoxCeleb2 对称 50%Vox-O等错率%8.121.731.61
VoxCeleb2 非对称 40%Vox-O等错率%2.531.781.59
VoxCeleb2 全部条件平均 Vox-O等错率%3.241.451.38

表后解释是 VoxCeleb2 上直接训练在对称 50% 下等错率恶化到 8.12%,而 TET-LM 控制在 1.61%,说明选择加混合在大数据集高噪声下仍有效。但干净条件下三者差距很小,TET-LM 相对 ES-GMM 的平均增益也小于 VoxCeleb1 上的增益,因此不能把小数据集上的大幅下降直接推广为所有规模与所有评估表上的同等提升。原文未报告显著性检验与多次随机种子的方差,判断时应表述为单次报告显示而非已验证的稳定因果。

拿掉时间平滑与混合标签后性能如何变化?

消融要回答两个机制各自的贡献与超参数敏感性。比较条件是 VoxCeleb1 上的干净、对称 10%、对称 30%、对称 50%、非对称 20% 与非对称 40%,指标为等错率,越低越好。下表整理完整方法、去掉时间集成阈值、去掉标签混合三行的数字。

方法干净对称 10%对称 30%对称 50%非对称 20%非对称 40%
TET-LM 完整2.983.563.634.043.704.26
去掉 TET3.133.593.654.113.724.32
去掉 LM3.213.654.024.563.714.91

表后解释是完整方法在所有噪声场景下最优,去掉时间集成后各噪声比下小幅变差,说明平滑主要提升选择的可靠性,去掉混合后高噪声下变差更明显,对称 50% 从 4.04% 升到 4.56%,非对称 40% 从 4.26% 升到 4.91%,支持混合在纠正开集噪声中的关键作用。反例是去掉混合后非对称 20% 变化很小,说明在该中等非对称噪声点上混合的增益有限,不应表述为拿掉后必然在所有点大幅恶化。

超参数层面需要在 30% 噪声下看邻居数 K 与置信阈值的曲线,下图左为 K 的影响,右为阈值的影响,阅读时先定位最低点再看两端恶化。

看图路径: 1. 先看左图横轴 K 从 1 到 C 变化时等错率先降后升的拐点位置;2. 再看右图横轴置信阈值从 0.0 到 1.0 变化时等错率的最低点位置;3. 对比两端极端取值处等错率抬升的幅度差异

原论文 Figure 2:Ablation study on hyperparameters K and μ under 30% noisy labels on VoxCeleb1.

论文图 2。原论文 Figure 2:“Ablation study on hyperparameters K and μ under 30% noisy labels on VoxCeleb1.”。

结合像素可见内容解释,左图横轴为 K 取 1、2、3、5、10、20 与全类别,纵轴为等错率,曲线从 K 等于 1 时的 3.99% 逐步下降到 K 等于 10 时的最低约 3.65%,K 等于 20 时回升到 3.79%,K 取全类别时跃升到 4.61%。右图横轴为阈值取 0.0、0.3、0.4、0.5 与 1.0,纵轴为等错率,起点 0.0 处为 4.21%,0.4 处降到最低约 3.65%,0.5 处回升到 3.82%,1.0 处为 3.73%。这支持原文结论,过少邻居不足以提供可靠混合,过多邻居引入噪声,阈值为 0 时全部按硬标签处理性能最差,阈值过高则浪费高置信样本。像素不能精确辨别的小数点后第二位应以正文报告的 K 等于 10 与阈值等于 0.4 为准,不要硬读曲线像素自创新数值。

还有哪些边界、缺项与不能承诺的量?

首先是噪声构造的边界。原文的开集是通过把剩余说话人标签翻转到选定说话人集合内来模拟,并限制同性别翻转,这是一种可控的人工翻转,不能等同于真实爬取数据中的缺失、切分错误、重名与多说话人混杂。未评测的边界包括真实噪声分布、标签缺失与开放说话人数连续增长的情况,因此开集下的结论应限定为该翻转协议下的显示,而非所有现实噪声都成立。

其次是实现缺项。高斯混合的初始化、相似度分布的拟合频率、教师分布是否停止梯度、各阶段学习率是否重置等均未在证据中给出,复现时必须记录为缺项。训练资源只报告单卡与批量大小,未报告总时长、显存占用与推理延迟,推理开销、输出帧率与实际延迟应分别讨论,不能因等错率下降就承诺延迟或成本也改善。统计方法上未报告多次运行方差与显著性,平均值的相对下降是单次报告的算术结果,百分点变化与相对百分比变化含义不同,引用时应保留原文精度而不自行四舍五入。

复现应先做什么,需要保留哪些关键设置?

第一步按原文重建噪声协议,先固定随机种子与说话人抽取方式,再实现对称翻转与非对称到下一说话人的翻转,并加入同性别约束,否则基线强度不可比。第二步实现 3 阶段调度,暖机 5 轮后再启用时间集成阈值,第二阶段只用干净集训练,第 3 阶段停止选择并加入混合损失,3 个停止轮次在 VoxCeleb1 取 5、40、80,在 VoxCeleb2 取 5、60、100。第三步实现原型与相似度计算,只用预测正确的归一化嵌入做平均,再拟合双分量高斯混合取交点并用系数 0.5 做滑动平均。第四步实现教师动量 0.9、前 K 取 10、置信阈值 0.4 的混合逻辑,高置信只取一个邻居,低置信取 10 个邻居并归一化加权。

模型侧保留 80 维对数梅尔滤波器组、1024 通道 ECAPA-TDNN、192 维嵌入、加性边距 softmax 边距 0.2 尺度 30、初始学习率 0.001 每轮衰减 0.97、Adam 优化器与批量 256。评估固定用干净版 Vox1-O、Vox1-E、Vox1-H 并报告等错率与最小检测代价。由于本次无可用开源声明,应把代码、权重与数据视为未公开,先做最小可运行的单噪声比复现,再扩展到全表,避免 1 次铺开所有条件导致无法定位问题。

何时值得尝试这种组合,还需补哪项验证?

当训练集疑似混入大量未知说话人且无法清洗时,这种先用平滑阈值保住干净子集、再用邻居混合软化噪声监督的组合值得尝试,尤其在对称高噪声下原文显示出较明显的稳健性。当噪声比例很低或评估更看重跨场景泛化时,增益可能收窄,此时更简单的选择方法或许已够用,应先在自己的噪声比例上做小规模对照。

还需补的验证包括真实噪声数据上的表现、多次种子的方差、阈值与邻居数在新数据集上的敏感性,以及训练时长与推理成本的实测。常见误解是把混合标签理解为找到了真说话人,实际上它只是把监督分散到相近已知说话人上以减小单点指错的伤害,真身份仍在集合之外。另一个误解是把时间平滑理解为阈值不再变化,实际上它仍随轮次更新,只是变化更平缓。记住这两点,就能更准确地复述方法而不夸大结论。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总