英文题目:When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus

会议身份:conference:interspeech:2026:conference-paper-id:borodin26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #评测协议 #跨语言 #低资源 #语音伪造检测

评分:7.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Kirill Borodin:机构信息未能从会议 PDF 纯文本可靠映射
  • Vasiliy Kudryavtsev:机构信息未能从会议 PDF 纯文本可靠映射
  • Maxim Maslov:机构信息未能从会议 PDF 纯文本可靠映射
  • Mikhail Gorodnichev:机构信息未能从会议 PDF 纯文本可靠映射
  • Grach Mkrtchian:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作针对欺骗检测器在多语言部署中遭遇语言失配时性能不可预测的难题,输入为多语言合成语音,输出为固定工作点下的伪造拒绝能力诊断。方法链分为4步:先以24个开源文本到语音(Text-to-Speech,TTS)系统在66种语言上按默认配置生成2732.17小时纯伪造语料,再在6个外部真伪基准上混合校准每个检测器的等错误率(Equal Error Rate,EER)阈值,随后将阈值零样本迁移到新语料计算伪造拒绝率(Spoof Rejection Rate,SRR),最后在固定检测器与合成器下对比语言对以分离语言效应。与已有语料相比,关键差异是显式控制(语言,合成器)正交变化并采用无目标域真人语音的诊断协议。在LRLspoof语料评测设置下,w2v2 300在英语上的伪造拒绝率指标为62.27%,高于其在波兰语上的伪造拒绝率指标30.78%。该诊断的适用边界受限于无目标域真人语音的零样本迁移条件,尚未验证跨信道与压缩后处理下的外推范围。该结论仅适用于伪造拒绝端,不刻画误拒真人语音的风险,且依赖外部校准域的选择。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,输出受什么限制?

本文的输入是一段待判定的语音波形,目标是判断它是真人说话还是合成伪造,输出是一个连续得分与一个二值判定。研究面向刚接触语音安全的研究生,因此先把任务链条说清楚:检测器先给每条语音打分,分数越高越倾向真人,再与一个阈值比较,低于阈值判为伪造。本文只研究伪造语音检测器在跨语言条件下的表现,不研究说话人确认本身,也不研究如何合成更自然的语音。

必须保留的关键信息是语料规模与评估方式:语料包含 2732 小时合成语音,覆盖 66 种语言和 24 个开源语音合成系统,其中按文中的操作性定义有 45 种低资源语言;评估使用 11 个公开可得的检测器,采用阈值迁移而非在目标语言上重新调阈值。

输出的限制同样重要:因为语料中只有合成语音,没有配套的真人语音,本文报告的是欺骗拒绝率,也就是在固定阈值下有多少合成语音被正确拒绝,它数值越高越好,但它不是完整的安全工作点,因为目标域真人被误拒的比例没有被测量。后续所有关于好坏的判断都要在这个限制下理解,不能把拒绝率高直接等同于系统可部署。

已有评测路线解决了什么,还缺哪一块对照?

已有的伪造检测评测路线主要解决可复现比较问题。自动说话人确认欺骗与反制评测以及音频深度合成检测挑战等工作,把训练集、测试集、攻击类型和指标固定下来,让不同队伍在同一规则下比较对未知合成器、信道变化、压缩失真和后处理的泛化能力。这一路线的长处是协议标准、攻击演进可追踪,短处是语言覆盖集中在少数高资源语言,检测器可能学会的是某种语言的发音或音节搭配规律,而不是伪造本身的痕迹。

另一条路线是近年出现的多语言语料,例如覆盖 51 种语言的 MLAAD、覆盖 12 种印度语言的 IndicSynth、覆盖 20 种语言的 MLADDC、覆盖 46 种语言的 SpeechFake 等,它们扩大了语言数量和总时长,但在实验控制上各有取舍:有的合成器种类很少,有的低资源语言按本文口径并不多,有的语言与合成器纠缠在一起,难以固定合成器只改变语言。

本文的定位不是再做一个更大的通用伪造库,而是做一个受控的跨语言诊断集:用同一套开源合成器的上游实现生成语音,覆盖尽量宽的语言谱系,使得研究者可以固定检测器和合成器,只让语言变化,从而把语言失配从合成器失配中分离出来。教学上可以这样理解:如果把合成器比作打印机型号,语言比作纸张纹理,过去的测试多是换打印机,本文要回答的是同一台打印机换了纸张后,鉴伪方法是否还有效。

语言为什么会成为独立的域偏移?

问题可以表述为:当检测器在一个语言分布上定好阈值,到另一个语言上直接使用时,伪造拒绝能力是否保持稳定。本文强调语言是独立的域偏移来源,含义是即使攻击生成器完全相同,仅仅因为文本语言、音素序列和韵律结构变了,检测器的得分分布就会移动。

举一个教学例子:假设用同一个合成器分别合成英语和波兰语句子,合成器的声码器痕迹本应相似,但两种语言的元音分布、辅音丛长度和语速节奏不同,检测器若在训练时过度依赖英语特有的静音段长度或特定频带能量,就可能在波兰语上把合成语音打高分而漏过。这不是说语言本身有真假,而是检测器学到了与语言相关的捷径特征。

操作上的困难在于实际部署中攻击工具日益多语言化,而防守方往往没有目标语言的真人语音来重调阈值,因此需要一种不需要目标域真人语音也能暴露问题的评估。本文把低资源语言单独划出,是因为这些语言在公开数据中更少被检测器见过,更可能触发捷径失效,但划分标准必须冻结为文中的操作性定义,即在 Common Voice 24.0 中有声文稿不足 100 小时,否则不同论文的低资源口径无法比较。

语料与评估全景:先做什么,再测什么?

方法全景分为两段。第一段是语料构造:收集多来源的自然文本提示,控制为适合合成与评测的短句,对每个合成器与语言组合,用该合成器对该语言的默认配置和已发布的预训练权重生成语音,不修改上游代码。合成器覆盖 4 类:经典参数合成如 eSpeak NG、RHVoice 和 AhoTTS;固定音色的神经监督合成如 Silero、SpeechT5、FastPitch、Matcha-TTS、Parler-TTS、Piper 和 MeloTTS;多语言与低资源专项如 MMS-TTS、Indic-TTS、TurkicTTS、IMS Toucan 和 QirimtatarTTS。

生成式零样本与克隆类如 XTTS、XTTS2、OuteTTS、Chatterbox、F5-TTS、CosyVoice、Zonos、Fish-Speech 和 Kokoro。第二段是评估:对 11 个公开检测器,先在包含真人与伪造的外部混合基准上算出等错误率阈值,再把该阈值原样搬到语料的每个语言子集上,只统计合成语音被拒绝的比例。下面的图先帮读者建立对合成器分布不均衡的直观认识,再回到文字理解为何需要同时报告平均与池化两种聚合。下图是按合成器聚合的语料时长分布,横轴为合成器名称,纵轴为时长,柱高差异直接反映各合成器在总时长中的贡献不同。

看图路径: 1. 先看横轴合成器名称顺序与纵轴时长刻度,确认这是按合成器聚合的总时长;2. 再比较最左侧 Piper 与 Silero 柱高与最右侧小合成器柱高的落差;3. 最后确认该图只显示合成器一侧分布,不能从中读出任一语言的时长

原论文 Figure 1:Dataset duration distribution across languages (left) and TTS models (right).

论文图 1。原论文 Figure 1:“Dataset duration distribution across languages (left) and TTS models (right).”。

从可见像素看,该柱状图只展示了合成器一侧的分布:左侧 Piper 和 Silero 的柱子最高,均超过 300 小时量级,中间 Indic-TTS、MMS-TTS 和 eSpeak NG 依次降低,右侧大量零样本合成器的柱子明显更矮。这种不均衡意味着若只看池化拒绝率,大合成器的语言会主导结论;若看每语言平均,则小合成器覆盖的语言也能平等发声。原文用图 1 的左右两幅分别展示语言侧与合成器侧的时长分布,教学上应把该图理解为聚合口径的提醒,而不是检测性能曲线,不能从柱高读出任何检测好坏。

得分、阈值与拒绝率是如何衔接的?

沿一条样本走完流程有助于固定概念。输入一条合成语音,检测器输出得分,得分越高越像真人。给定阈值,若得分低于阈值则计为 1 次正确拒绝。把某个语言子集内所有合成语句的拒绝指示取平均,就得到该语言的欺骗拒绝率。原文明确该语料只含合成语音,因此不能在该语料上直接算等错误率,必须从外部搬运阈值。

外部阈值的定法是把多个外部基准的全部试验混合在一起,算出使误接受率等于误拒绝率的点,记为该检测器的迁移阈值。每个检测器只搬运一个阈值,而不是每个语言各调一个,因为每个语言单独调阈值需要该语言的标注真人与伪造,这正是零样本设定要避免的监督。本文评估的 11 个检测器跨越经典谱时序结构与大自监督编码器两大家族,包括 aasist3、df arena 1b、df arena 500、res2tcn、rescapsguard、sls、ssl aasist、tcm add、nes2net、w2v2 1b 和 w2v2 300。

伪造对策 × 欺骗拒绝率: 伪造对策负责给每条语音打出真人得分,得分越高越像真人;欺骗拒绝率负责在固定阈值下统计有多少条合成语音被判为假。二者搭配的原因是本语料没有目标域真人语音,无法直接算等错误率,只能先在外部数据上定阈值,再到本语料上只看拒绝一侧,组合意义是把跨语言泛化拆成可迁移的操作点问题来诊断。

阈值迁移 × 等错误率操作点: 等错误率操作点指在外部混合基准上使误接受率等于误拒绝率的阈值位置;阈值迁移指把这个阈值原样搬到 LRLspoof 的每个语言子集上不再调整。二者搭配是因为要模拟部署时没有目标语言标注、不能重调门限的情形,组合后才能看出门限在语言变化下是否还站得住。

语言失配 × 合成器失配: 合成器失配指训练时没见过的声码器或合成系统带来的分布变化;语言失配指音素库存、韵律和发音习惯变化带来的分布变化。二者搭配的理由是过去评测多固定语言而换合成器,容易把语言带来的退化误归为合成器,固定合成器只换语言的对照才能把语言确立为独立的域偏移来源。

低资源语言 × 操作性定义: 低资源语言在本文中不是社会语言学判断,而是操作性定义指在 Common Voice 24.0 中有声文稿不足 100 小时的语言;该定义只用于统一内部比较。搭配的原因是只有先冻结计数口径,才能比较 45 种低资源语言与全集的平均拒绝率差异,而不把定义争议带入结果解读。

平均拒绝率 × 池化拒绝率: 平均拒绝率指先算每种语言的拒绝率再平均,每种语言权重相等;池化拒绝率指把所有语句混在一起再算总数占比,语句多的语言权重更大。二者搭配是因为语料各语言时长极不均衡,只看池化会被大语言主导,只看平均会被小语言放大,同时报告才能判断退化是普遍存在还是被时长分布掩盖。

需要强调的是,高拒绝率只说明合成语音被拦下,不说明真人语音不被误伤,缺失的另一半必须在局限节中继续讨论。

本研究训练了什么,没有训练什么?

本研究没有训练任何新的伪造检测器,也没有微调任何合成器,这是一个必须先说清的事实。真实的计算过程分为构造计算与评估计算两类。构造计算是调用:对每个合成器与语言条件,用上游开源实现的默认配置和已发布权重,把预先准备的多来源文本合成为波形,记录总时长与支持的合成器数量。

评估计算是推理加统计:把 11 个公开检测器的已有权重原样加载,对外部混合基准和本语料分别前向推理得到得分,在外部混合数据上搜索使两类错误相等的阈值,再把该阈值应用到本语料的每个子集统计拒绝率。原文未报告检测器的训练超参数、梯度路径、参数冻结与更新细节,因为这些属于被评估模型的各自原始论文,而非本文的贡献。本文也没有在目标语言上做任何阈值搜索或自适应,因此不存在用目标标签泄漏来美化结果的优化步骤。

若读者要复现,关键不是调优化器,而是保证合成调用的默认音色与权重版本一致,以及外部混合基准的拼接方式与等错误率搜索实现一致,否则阈值会有系统性偏移。

在什么数据和协议下比较,指标方向是什么?

实验条件按证据交代如下。被测对象是 11 个公开检测器,测试语料是 LRLspoof 的 66 种语言子集,每个子集标注总时长与支持合成器数量。阈值标定数据是包含真人与伪造的外部混合基准,包括 ASVspoof5、ASVspoof2021 的 LA 与 DF 子集、In-the-Wild、DFADD 和 ADD2022。协议是阈值迁移:每个检测器在混合外部数据上定一个等错误率阈值,然后固定该阈值评估所有语言子集,不做逐语言调整。指标是欺骗拒绝率,方向是越高越好,但它是单侧指标,不含目标域误拒。

聚合方式有两种:跨语言平均与跨语句池化,并分别在全集与低资源子集上报告,以暴露时长不均衡与低资源退化的不同侧面。受控对照的公平条件是固定检测器与合成器,只改变语言,例如同样用 Indic-TTS 生成印地语与奥里亚语,或同样用 Parler-TTS 生成英语与波兰语,此时拒绝率差异才能归因于语言。资源状态方面,文中给出两个发布地址,其中 Hugging Face 地址在本次核验中未能确认可达,应写为本次未能确认可达,ModelScope 地址返回可用,可写为当前可用。

第三方合成器的仓库地址在本次核验中可用,但这只说明链接可达,不说明权重版本与本文完全一致。

跨语言差异有多大,哪些模型在哪些语言上失效?

核心问题是阈值迁移后的拒绝率是否随语言剧烈变化,比较的公平条件是同一检测器使用同一个外部标定的阈值,指标方向是拒绝率越高越好。下表整理原文直接报告的代表性语言差异,同一检测器在不同语言上的拒绝率可以直接对比,因为阈值没有重调。表前需要明确:该表不是完整排名,而是用来说明模型相关的跨语言不均,完整逐语言数值见原文大表。

条件与指标检测器语言 A 拒绝率语言 B 拒绝率差异含义
同一迁移阈值下欺骗拒绝率aasist3英语 93.33%车臣语 99.86%该模型在这两种语言上均保持高拒绝
同一迁移阈值下欺骗拒绝率w2v2 300英语 62.27%波兰语 30.78%同一模型换语言后拒绝率明显走低
同一迁移阈值下欺骗拒绝率df arena 500马拉地语 94.83%尼泊尔语 4.69%同一模型在不同语言上从高拒绝跌至极低

表后解释如下:该表支持的判断是跨语言差异具有模型相关性,同一语言对不同检测器难度不同,同一检测器换语言后行为也不同。

代价与反例必须同时指出:aasist3 在英语与车臣语上表现稳健,不能推广为在所有语言上稳健,原文大表显示它在其他语言上也有波动;w2v2 300 在波兰语上的走低不能单独解读为波兰语更难,因为换一个检测器排序可能变化。未胜出项的例子是多个基于自监督的模型在部分语言上拒绝率跌至个位数,说明依赖语言相关线索的模型在阈值迁移下尤为脆弱。

该结果的适用条件是固定迁移阈值,若允许每个语言重调阈值,差距会缩小,但那需要目标语言的标注数据,已偏离零样本诊断的初衷。

固定合成器后,语言还能造成多大差距?

要回答语言是否为独立偏移来源,需要固定合成器与检测器,只让语言变化。原文用受控语言对来做这组对照,条件是同一合成器生成两种语言,同一检测器使用同一迁移阈值,指标仍是拒绝率,差距以百分点报告。下表汇总原文明确给出的受控差距,百分点与相对百分比含义不同,此处均为百分点差值,不能理解为相对提升。

受控条件语言对与合成器检测器差距结论方向
固定合成器与阈值印地语与奥里亚语经 Indic-TTSres2tcn 差距 59.22pprescapsguard 差距 75.38pp相同生成条件下语言切换带来数十百分点变化
固定合成器与阈值英语与波兰语经 Parler-TTSdf arena 500 差距 82.06ppw2v2 300 差距 94.46pp同一合成器在不同语言上可被可靠拒绝或大面积漏过
固定合成器与阈值丹麦语与威尔士语经 Piperaasist3 差距 99.51pp覆盖丹麦语与尼泊尔语等其他对照语言与合成器存在交互效应

表后解释如下:主要收益是这组对照排除了合成器不同的解释,差距只能主要归因于语言带来的分布变化,支持语言是独立域偏移的判断。

具体代价是这些极端差距多出现在特定三元组上,不能直接推广为任意语言对都有如此大差距,原文也报告了其他合成器与语言对的较小差距。未胜出或边界情况是部分对照只报告了少数检测器的差距,空白不代表该检测器无差距,而是原文选择最具说明性的对照呈现,复现时应补全同一语言对上的全部检测器以避免挑选性解读。

该分析的限制是仍依赖外部标定的单一阈值,若外部混合数据的语言与信道覆盖不足,阈值本身可能偏向某些语言,此时差距是阈值偏差与语言偏移的叠加。

单侧评估与外部标定带来哪些不可推论?

第一个局限是单侧评估。语料 deliberately 只含合成语音,原文明确不加入来自现成数据集的真人语音,理由是直接拼入的真人语音会引入域混杂,检测器可能学会区分两个数据来源而非真假本身。一个合理的目标语言基准需要配套收集同语言、同说话人分布、同文本风格与同信道条件的真人录音,而这超出了本文的诊断定位。

因此本文只能说某个检测器在某种语言上拒绝伪造的能力变化,不能说它在该语言上的整体安全工作点变好或变坏,更不能承诺误拒、延迟或部署成本得到改善。第二个局限是对外部标定的依赖。迁移阈值在混合外部基准上确定,若这些基准的语言、合成器与信道不能覆盖部署条件,阈值本身就有偏,跨语言差距会被放大或缩小。第三个局限是合成调用的版本敏感性。

原文强调使用上游实现与默认配置和已发布权重,但开源仓库与权重会更新,若复现时版本不同,时长分布与伪造痕迹都会漂移。相关性不等于因果:观察到低资源子集平均拒绝率更低,支持低资源条件更脆弱的判断,但不能直接推断语言资源量因果导致检测失败,因为低资源语言往往也对应特定的合成器覆盖与文本来源,仍需受控对照来分解。

要复述方法并复现诊断,先做什么?

复现应按学习依赖排序。第一步是取数与版本冻结:从当前可用的 ModelScope 地址获取 LRLspoof,记录语料版本与每个语言子集的时长和合成器数量,对 Hugging Face 地址按本次未能确认可达处理,不默认其可下载;同时冻结 11 个检测器的权重来源与推理代码版本,以及各合成器的上游提交版本。第二步是重建阈值标定:将 ASVspoof5、ASVspoof2021 LA 与 DF、In-the-Wild、DFADD 和 ADD2022 按原文方式拼接为一个试验池,对每个检测器前向推理得到得分,搜索使误接受率等于误拒绝率的阈值,每个检测器只保留一个阈值。

第 3 步是迁移评估:用该阈值对 LRLspoof 每个语言子集的全部合成语句统计得分低于阈值的比例,得到逐语言拒绝率,再分别按语言平均与语句池化汇总全集与低资源子集。第四步是受控对照:选取原文的语言对与合成器组合,例如 Indic-TTS 上的印地语与奥里亚语、Parler-TTS 上的英语与波兰语、Piper 上的丹麦语与威尔士语,在固定检测器与阈值下复算百分点差距。还需补的验证包括:补充目标语言的匹配真人语音以测量误拒与完整等错误率;在同一语言对上补全全部检测器而非仅极端项。

报告推理开销与阈值搜索的计算成本,因为原文未系统报告这些量。

何时值得用这套诊断,还需补哪项验证?

当研究问题是检测器换语言后阈值是否还可用,且手头没有目标语言真人语音时,这套语料与阈值迁移协议值得尝试。它把评估动作简化为 3 步:外部定阈值、原样搬阈值、分语言看拒绝率,特别适合在模型发布前做 1 次低成本的跨语言压力扫描。若目标是直接得到可部署的工作点,则不应停留于此,还需收集匹配的目标语言真人数据并重调阈值,否则单侧高拒绝可能掩盖高误拒。

复现时应优先保证阈值标定池与原文一致,因为阈值差之毫厘,跨语言差距就会系统性偏移;其次保证合成器版本一致,因为痕迹变化会改变结论。未验证的推测应以可能与待验证表达:某些检测器在特定语言上崩溃可能与自监督预训练的语言覆盖有关,但原文未做因果分解,仍待通过控制预训练语言与冻结层面的对照来验证。

总体趋势不等于每组都成立:平均拒绝率走低不代表每个低资源语言都更难,逐语言大表中的反例提醒读者必须同时看分布与受控对,而不只看一个汇总数字。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总