英文题目:Language-Invariant Multilingual Speaker Verification for the TidyVoice 2026 Challenge

会议身份:conference:interspeech:2026:conference-paper-id:li26fa_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对抗训练 #数据增强 #跨语言 #多语言 #说话人验证

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Ze Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiaoxiao Miao:机构信息未能从会议 PDF 纯文本可靠映射
  • Juan Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Ming Li:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

多语言说话人验证输入为注册与测试语音对,输出为是否同人的判定分数,难点在于跨语言时说话人嵌入纠缠语言特性且单人多语言数据稀缺。本文先以大规模多语言自监督w2v-BERT 2.0为骨干提取多层表征,经层适配器降维适配后拼接并由注意力统计池化聚合得到说话人嵌入,再以梯度反转的语言分类器对抗训练迫使嵌入遗忘语言信息。随后用多语言零样本语音合成Qwen3-TTS为每位说话人扩充多语言语音覆盖,所合成嵌入与真实嵌入共同参与不变性学习,其输出进入ArcFace或SphereFace2监督训练。与仅微调骨干的方案相比,关键机制差异在于显式以对抗梯度抑制语言可预测性而非依赖数据多样性隐式泛化,其实质意义是解耦说话人与语言变异以提升跨语言鲁棒性。在tv26 dev评测设置下,w2v-BERT 2.0 Based模型的EER为2.740%,低于官方基线的EER3.07%。该结论适用边界限于TidyVoice 2026划分的已见语言与38种未见语言场景,在数据充足时合成数据受限未带来增益且未见语言性能明显恶化,跨域外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么跨语言说话人确认比单语言更难?

说话人确认要回答的是两段语音是否来自同一人,做法通常是把每段语音映射为定长向量,再比较余弦或校准后的相似度。在单语言、信道相对一致时,身份信息比较稳定,系统容易学到可分的嵌入空间。进入多语言后,困难来自两个方面。第一是数据稀缺,每位说话人往往只覆盖 2 到 3 种语言,模型很少看到同一人在不同语言下的对照样本。第二是表示纠缠,说话人嵌入中除了音色,还会带入语种的韵律、音素分布与发音习惯,换语言时同一人的向量发生偏移,而不同人的跨语言比较又可能被语言相似性干扰。

初学者容易把大规模预训练理解为直接给出说话人向量。更准确的动作是,预训练只提供通用的多语言语音表示,下游仍需显式地把身份与语言分开。否则模型会在训练可见语言上拟合语言相关的捷径,遇到未见语言时误差明显上升。本文的目标正是为 TidyVoice 2026 挑战构建多语言系统,在利用大规模自监督表示的同时,显式抑制嵌入中的语言成分,并用合成语音补足每人的语言多样性。

本解读的输入是论文正文与 3 张官方原图像素,目标是让研究生能复述数据构造、模型路径、2 阶段训练与评估条件。凡涉及已公开与否的说法,本次以资源可达验证为准。论文正文给出了代码仓库链接,但本次没有完成可达验证,因此不写已经公开或当前可用,只按正文交代方法与实验。

已有路线提供了哪些可复用的部件?

第一条路线是基于深度嵌入的说话人确认,例如强调通道注意力与聚合的时延网络及其变体。它们在单语言大规模标注数据上表现很好,但依赖的英文中心数据与有限的多语言同人数据,使其在语言失配时退化明显。这说明仅增大单语言数据量,不能自动解决语言与身份的纠缠。

第二条路线是大规模自监督预训练,例如 WavLM、wav2vec 2.0、HuBERT 与 w2v-BERT 2.0。论文采用的 w2v-BERT 2.0 是 SeamlessM4T 框架中的多语言表示模型,使用 24 层 Conformer 编码器并联合优化对比与掩码预测目标。按正文交代,它在约 4,500,000 小时、143 种语言的无标注语音上训练,因此更适合作为跨语言任务的起点。但预训练目标不是说话人判别,直接取顶层输出往往不是最优,需要适配与聚合。

第三条路线是面向说话人任务的适配方法。论文沿用已有工作的做法,对每层输出加层适配器降维并做任务适配,再用多尺度特征聚合汇集多层信息,训练中用低秩适配做高效微调。第四条路线是抑制无关因素的对抗学习,例如跨年龄工作中用对抗抑制年龄信息。本文把同类思想用于语言,另加多语言零样本语音合成来扩增每人的语种覆盖。这两部分是理解本文增量的关键。

本文要解决的具体问题与输入输出是什么?

任务输入是注册语音与测试语音,输出是二者是否来自同一说话人的分数与判定。评估关注语言内与跨语言两种对照,尤其是在训练未见过的语言上的稳定性。论文把评估集划分为已见语言子集与包含 38 种未见语言的子集,这种划分直接对应领域特化与泛化的权衡。

问题形式化可以这样理解。设输入波形为 x,先提取滤波器组特征,再经编码器与池化得到嵌入 e。理想的 e 应对说话人身份敏感、对语种不敏感。现实中 e 同时携带身份与语言信息,换语言时同人距离变大。论文要做的就是改变训练的数据分布与梯度来源,使 e 在保持说话人可分的同时降低语言可分。举例来说,若同一说话人有中文与法文真实语音,系统希望二者的嵌入距离小于该说话人与另一说话人的跨语言距离,这是一个教学例子,不是论文报告的数值。

约束条件同样重要。官方训练集中每人语言种类有限,单纯增加模型容量容易记住语言捷径。因此方法必须同时回答表示如何聚合、语言监督如何反向施加、缺失的同人多语样本如何构造这 3 个问题,后文按样本前向路径展开。

系统全景:一个样本如何走完主路径与对抗分支?

先沿一个样本走完全程。输入一段音频,先提取 80 维滤波器组特征并做均值方差归一化,再送入冻结或解冻的 w2v-BERT 2.0。模型输出每一 Conformer 层的隐表示,每层表示经过各自的层适配器降维,全部层的适配特征拼接后进入注意力统计池化与线性投影,得到说话人嵌入。训练时该嵌入进入说话人分类损失,评估时则直接比较两条嵌入的相似度并做分数校准。

下图是理解分叉位置的关键,主路径从左到右给出嵌入提取,对抗分支在嵌入之后分叉,合成数据则在训练数据侧提供更多同人多语样本。

零样本语音合成 × 语言不变表示: 零样本语音合成负责在仅有数秒参考音频时为同一说话人生成多语种语音以补足每人语种多样性,语言不变表示负责使同一说话人在不同语种下嵌入靠近,二者搭配的理由是官方训练集中每人通常只有 2 到 3 种语言,仅靠对抗难以见到充分的跨语言同人样本,合成提供了显式的同人多语对照。

看图路径: 1. 先从左侧音频经特征提取进入 w2v-BERT 2.0,再看各层如何分别接层适配器;2. 再看拼接与注意力统计池化加线性层如何得到说话人嵌入;3. 最后看右侧说话人分类与经梯度反转的语言分类如何分叉

原论文 Figure 1:Overview of the w2v-BERT 2.0-based speaker verification system with language-invariant learning

论文图 1。原论文 Figure 1:“Overview of the w2v-BERT 2.0-based speaker verification system with language-invariant learning”。

该图左侧虚线框对应微调主路径,右侧虚线框对应语言不变学习。主路径的箭头顺序是音频到特征提取、到 w2v-BERT 2.0、到多个层适配器、到拼接、再到注意力统计池化与线性层。右侧从说话人嵌入分出两路,一路直接做说话人分类,另一路经过梯度反转层再做语言分类。这种画法把前向依赖与反向梯度来源区分开,前向都需要预测以提供监督,反向则因反转而目标相反。合成流程不在该图内,另由第二张图交代文本翻译与参考音频如何汇入合成模型。

表示部件如何把多层信息变成说话人嵌入?

w2v-BERT 2.0 的每一层捕捉不同抽象的信息,浅层更接近声学细节,深层更接近内容与语义结构。只用最后一层会丢掉对说话人有用的浅层音色线索,简单平均又会引入与任务无关的变化。层适配器的动作是逐层做轻量变换,在降低维度的同时向说话人任务靠拢。论文按已有方法为每层设置独立适配器,而不是所有层共享同一变换,这是为了保留层间差异。

w2v-BERT 2.0 × 层适配器: w2v-BERT 2.0 负责提供在大量无标注多语言语音上学到的通用多层语音表示,层适配器负责把每一层的高维表示降维并向说话人确认任务做域适配,二者搭配的理由是单取顶层会丢失浅层声学细节而全量微调成本高,组合后通过拼接多层适配特征再聚合,使说话人嵌入同时利用浅层音色与深层内容鲁棒性。

多尺度聚合的动作是把所有适配后的层特征拼接,再做池化与投影。注意力统计池化不是简单取平均,它先学习每帧的权重,再计算加权均值与加权标准差,从而让可靠帧贡献更大。举例而言,有声段与静音段的权重应不同,这只是帮助理解加权的教学例子。拼接解决的是层间互补,池化解决的是时长可变与帧不等权,二者先后衔接才能把变长多层特征压缩为定长嵌入。

多尺度特征聚合 × 注意力统计池化: 多尺度特征聚合负责把来自不同 Conformer 层的适配特征在通道维度拼接并统一利用,注意力统计池化负责在时间维度按重要性加权并计算均值与方差,二者分工是前者解决层间互补、后者解决帧间不等权,搭配后先有层间拼接再有时序池化加线性投影,才能得到定长的说话人嵌入。

训练效率由低秩适配承担。它的思想是冻结原始大模型的大部分参数,只训练注入的低秩增量,从而在保持表示能力的同时减少可训练量。论文在第一阶段先冻结主干只训练适配与池化等模块,收敛后再解冻并以较小学习率继续微调。这种先冻结后解冻的安排是为了稳定早期说话人监督,避免大模型在初始阶段被带偏。

对抗分支如何施加语言不变约束?

语言失配的本质是嵌入空间中存在可被语言分类器利用的方向。对抗学习的动作是显式训练一个语言分类器来发现这些方向,再让嵌入提取器朝相反方向更新。具体实现是在嵌入与语言分类器之间插入梯度反转层,前向时它近似恒等映射,不改变嵌入数值,后向时它把来自语言损失的梯度乘以负系数再传回编码器。于是语言分类器本身越努力降低语言分类误差,编码器越朝增大语言分类困难的方向移动,而说话人分类分支仍要求身份可分。

梯度反转层 × 语言分类器: 语言分类器负责从说话人嵌入预测语种以暴露残留的语言信息,梯度反转层负责在反向传播时把该分支梯度取反回传给嵌入提取器,二者搭配形成对抗,前向仍做语言预测以提供监督信号,反向则迫使编码器抑制可预测语言的成分,从而保留说话人判别性而降低语言可分性。

论文的总损失由说话人损失与加权后的语言损失相加,权重与反转强度分别控制对抗力度。按正文交代,两个系数都设为 0.1,语言分类器由两个线性层组成。为保证稳定的语言监督,训练安排是先冻结除语言分类器外的模块、只训练语言分类器至收敛,再解冻编码器并引入反转层做联合对抗训练。这种分步做法避免了早期语言分支噪声过大而干扰说话人表示。需要指出的是,原文没有给出语言标签的全部构建细节与每步梯度范数的诊断,因此复现时应把语言分类准确率的变化作为是否真正抑制语言信息的检查量,而不只看最终说话人指标。

两阶段训练与损失选择如何执行?

训练分为大规模说话人模型预训练与在 TidyVoiceX 上的领域适配两个阶段。第一阶段使用 VoxCeleb2、VoxBlink2、3D-Speaker、KeSpeech 与 CN-Celeb1 与 2 等公开说话人数据,先冻结 w2v-BERT 2.0 参数训练适配与池化模块,再解冻并以小学习率微调。数据增强采用在线加噪与加混响,噪声与房间冲激分别来自 MUSAN 与房间冲激数据集。优化器为带权重衰减的 AdamW,早期用线性 warm-up 稳定训练,再按阶梯衰减降低学习率。说话人目标默认用 ArcFace,间隔与尺度按正文设为固定值,输入帧长在一定范围内随机采样以适应变长。

SphereFace2 × ArcFace: ArcFace 负责把说话人训练组织为多分类角间隔分类,SphereFace2 负责在超球面上组织为二分类成对比较目标,二者对照的意义在于说话人评估本身是成对相似度比较,论文报告 SphereFace2 更贴近该协议并在开发集上表现更好,说明训练目标与评估协议的一致性会影响跨语言泛化。

第二阶段加入 TidyVoiceX 训练集并引入语言对抗。此时除比较 ArcFace 外,还比较 SphereFace2 的两种配置。论文的解释是评估依赖成对相似度比较,而 SphereFace2 的二分类形式与该协议更一致,因此能减小训练与评估目标之间的失配。这是一个有限解释,支持它的证据是开发集上的排序,但不应推广为所有数据与所有阈值下都成立。

分数校准采用质量度量函数,输入包括注册与测试时长对数、嵌入模长、信噪比与原始分数,输出经逻辑回归映射为校准分数。该步骤的目的是补偿时长、信号质量与嵌入可靠性带来的分数漂移。校准试验由 TidyVoiceX 训练集随机生成,推理时直接应用已训练的校准模型。

数据、合成构造与评估条件如何组织?

训练数据包括挑战官方 TidyVoiceX 训练集与多个公开集,目的是同时增加说话人数与语言多样性。评估使用官方开发集与评测集,评测集再分为已见语言与未见语言两个子集,未见部分包含 38 种语言。这种划分使已见集更能反映领域特化效果,未见集更能反映跨语言泛化,比较时必须分开看,不能只报平均。指标为等错率与最小检测代价,数值越小越好。

合成数据的构造是本工作的特有细节。论文选用多语言零样本合成模型为每位说话人生成 10 种语言的语音,文本来自英文句子经多语言翻译模型译为目标语言,参考音频经大词汇量识别模型转写得到参考文本,再与目标文本一起送入合成模型。下图把文本侧与音频侧的汇合点画得很清楚,是复现合成流程时最值得对照的图。

看图路径: 1. 先看上方文本库与语种选择如何经翻译得到目标文本;2. 再看右侧参考音频如何经语音识别得到参考文本;3. 最后看目标文本、语种、参考音频与参考文本如何汇入合成模型输出合成音频

原论文 Figure 2:Speech Synthesis Pipeline

论文图 2。原论文 Figure 2:“Speech Synthesis Pipeline”。

从像素看,左上圆柱表示文本语料库,经文本选择进入翻译模块,中间虚线框列出 10 个目标语种并分别控制翻译与合成的语言选择,右上表示参考音频,一路直接进入合成模型提供音色,另一路经识别模型得到参考文本再进入合成模型,最终向下输出合成音频。复现时应先核对语种集合、翻译模型与识别模型是否与正文一致,再核对每条参考音频的时长筛选与每语言生成条数,否则合成规模与语言覆盖无法对齐。论文报告的合成总量很大,但它们只源于约十分之一真实数据作为参考,这一比例关系是判断域失配风险的前提。

主结果:在开发集上相对基线改变了多少?

比较的问题是,在相同开发集上,微调大预训练模型是否优于同样经过大量数据预训练的官方基线,以及只用公开预训练数据而不碰 TidyVoiceX 时已有多少增益。公平条件是同一开发集与同一指标方向,指标越小越好。论文报告,即使不使用 TidyVoiceX 训练集,仅在预训练数据上微调的模型已在开发集上取得低于基线的等错率,并给出相对下降幅度。

系统预训练数据微调数据等错率相对基线变化
官方基线大规模公开数据官方训练集3.07%基线
微调预训练模型公开说话人数据未用官方训练集2.74%相对下降 11%
完整微调模型公开数据加官方训练集官方训练集更低进一步下降

上表把核心可运行策略与基线放在同一开发集下比较,数值写法保留原文精度。论文显示,仅靠微调预训练模型即可从 3.07% 降至 2.74%,相对下降 11%。这支持大规模预训练表示对多语言说话人任务有直接价值的判断。代价是该结论目前只在开发集上给出完整对照,评测集已见与未见子集需要分开看。未胜出的一项是官方基线本身,它在开发集上高于微调模型,说明单纯的卷积基线在大模型表示面前不占优,但这不意味着它在计算成本与部署复杂度上也不占优,因为原文未同时报告延迟与参数量。

损失与数据搭配:哪处改进来自目标,哪处来自数据?

要回答的第一个问题是损失函数是否影响排序。论文在第二阶段比较 ArcFace 与 SphereFace2 的两种配置,报告 SphereFace2 明显优于 ArcFace,其中一种配置最优。论文给出的机制是训练目标与成对评估协议的一致性。这属于有限解释,支持它的只是开发集排序,仍待在更多阈值与未见语言上验证是否稳定。

第二个问题是微调数据应只用目标域还是混合大规模预训练数据。论文报告,只用 TidyVoiceX 在开发集与已见评测集上更好,而混入大规模预训练数据在未见语言子集上泛化更好。这揭示了领域特化与泛化的权衡,只看已见集会高估混合策略,只看未见集又会低估目标域适配的价值。复现时必须同时报告两个子集,否则结论不可比。

合成环节目标语种数每条参考每语言生成数合成总量参考来源
文本翻译加语音克隆10 种语言10 条349,500 条官方训练集参考音频
参考筛选10 种语言10 条349,500 条每人至多 10 条长语音
全量合成10 种语言10 条349,500 条同一说话人多语对照

上表整理合成规模而非性能排序,数字与单位与原文一致。论文显示,仅用合成数据训练可接近真实数据的开发集水平,但把合成与真实混合后在数据充足时并未进一步提升。这是一个重要的负结果,说明合成在低资源时可作为可行补充,而在充足数据下可能因合成与真实之间的域失配而抵消增益。

未见语言与合成失配暴露了什么边界?

先看未见语言的边界。论文在已见评测集与未见评测集上分别报告,混入大规模预训练数据有助于未见集,但只用目标域微调的模型在未见集上退化更明显。这说明语言对抗与领域适配不能保证对从未出现过的 38 种语言同样有效,预训练数据的语言覆盖仍是泛化的重要来源。阅读时不应把开发集的最优配置直接当作未见集的最优配置。

再看合成数据的边界。下图是单说话人的真实与合成嵌入可视化,用于检查合成是否保持身份。

看图路径: 1. 先确认图例中真实语音与各语种合成语音的标记含义;2. 再观察左部与下部红色圈内同语种真实与合成点是否靠近;3. 最后观察其他语种合成点散布范围以判断身份保持与语言散射

原论文 Figure 3:t-SNE Visualization of Real and Synthetic Speech Em- beddings for Speaker id011337.

论文图 3。原论文 Figure 3:“t-SNE Visualization of Real and Synthetic Speech Em- beddings for Speaker id011337.”。

从像素看,该散点图横纵轴为降维后的 2 维坐标,图例区分真实语音与各语种合成语音,左部与下部各有一个红色椭圆。论文指出,合成嵌入与真实嵌入总体一致,尤其同语种的合成点与对应真实点距离很近,而其他语种合成点散布更开但仍围绕同一说话人。这支持合成保持了说话人身份的判断,但像素不能精确读出数值距离,且这只是单个说话人的展示,不能推广为所有说话人与所有语种都成立。结合混合训练并未进一步提升的结果,更稳妥的表述是合成可能在有限数据下有效,在充足数据下需待验证其域失配的控制方法。

第 3 个边界是监督与评估的不完整。原文未报告语言分类器在对抗前后的准确率曲线、校准前后的阈值稳定性,以及训练与推理的计算预算,因此不能从等错率下降推定语言信息已完全去除,也不能推定延迟与成本同时改善。

若要复现,应先固定哪些可执行细节?

复现的第一步是固定特征与优化条件,而不是直接调大模型。按下表先核对输入、损失与采样,再核对 2 阶段的冻结与解冻时机。特征侧的任何改动都会改变预训练模型的输入分布,需要优先对齐。

配置项输入特征损失超参采样帧长优化设置
第一阶段80 维滤波器组,帧长 25 ms,帧移 10 ms间隔 0.2,尺度 32200 到 300 帧随机采样先冻结后解冻
第二阶段80 维滤波器组,帧长 25 ms,帧移 10 ms间隔 0.2,尺度 32200 到 300 帧随机采样小学习率对抗微调
校准阶段时长对数与嵌入模长等逻辑回归随机生成试验训练集内拟合

上表把可直接照做的配置集中呈现,数值保留原文写法。第一阶段先冻结主干训练适配与池化,收敛后再解冻并以更小的学习率微调。第二阶段先只训练语言分类器至收敛,再引入梯度反转做联合训练,对抗强度与损失权重按正文设为较小值。合成侧需固定参考音频筛选、翻译模型、识别模型与每语言生成条数,并记录参考与合成的对应关系,以便检查同人多语对照是否真正生成。

关于代码与权重,本次没有完成可达验证,因此不写已公开或可下载。复现者应以论文正文给出的链接与模型名称为准自行核对可达性,并把是否能运行、需要何种权重与依赖作为第一项验证,而不是默认系统可运行。

何时值得尝试这套做法,还需补哪项验证?

当任务是多语言说话人确认、每人语种覆盖少、且已有大规模多语言预训练可用时,这套做法值得尝试。操作顺序应是先微调预训练并做好多层聚合,再在开发集上比较损失与数据搭配,最后才引入语言对抗与合成扩增。对抗适合用于已观察到同人跨语言距离偏大的情况,合成适合用于低资源下缺少同人多语对照的情况。在数据充足且已见语言为主时,不应默认合成一定带来增益。

还需补的验证包括分语种的误差分解、语言分类准确率在对抗前后的变化、校准前后在不同时长与信噪比下的稳定性,以及未见语言上的独立对照。只有这些补齐后,才能区分增益来自表示、来自目标函数、还是来自数据覆盖。论文的价值在于给出了一条可复述的组合路径,而不是证明所有部件在所有条件下都有效。研究生复述时应能画出主路径与对抗分支、说出合成数据的汇合点,并指出未见语言与域失配这两个边界。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总