英文题目:Exploring the Scale and Diversity of Speech Anti-spoofing Datasets: Experiments and Analysis

会议身份:conference:interspeech:2026:conference-paper-id:yi26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集构建 #鲁棒性 #语音 #语音伪造检测

评分:6.1/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Zhuolin Yi:机构信息未能从会议 PDF 纯文本可靠映射
  • Jun Xue:机构信息未能从会议 PDF 纯文本可靠映射
  • Yanzhen Ren:机构信息未能从会议 PDF 纯文本可靠映射
  • Yihuan Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yi Chai:机构信息未能从会议 PDF 纯文本可靠映射
  • Daixian Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Guanxiang Feng:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiajun Liu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音伪造检测(speech spoofing detection)需从波形中区分真实语音与合成或转换语音,难点在于未知生成方法持续涌现导致的跨域泛化失效。本文以受控实验解耦训练规模与生成方法多样性,先在固定攻击种类下按1%、5%、10%、20%、50%、100%比例随机抽样以观察规模效应,再跨库按每个生成方法抽取1000条伪造样本并统一真实来源构建高多样性小规模组合集以检验多样性效应。两阶段均采用固定XLS-R 300M前端结合AASIST(Audio Anti-spoofing using Integrated Spectro-temporal graph attention networks)后端与RawBoost(raw data boosting)增强进行训练与跨数据集评测。与规模优先假设不同,该设计揭示多样性通过覆盖更广伪造痕迹分布来抑制对特定领域的过拟合,而单纯增量仅重复已知分布。在VoiceWukong全集上组合训练集以19.46%的等错误率(Equal Error Rate, EER)显著优于规模达1982小时的Spoofceleb训练集的23.58%。结论仅适用于所测英语与中英双语场景及固定容量的自监督模型,尚未验证更大容量模型或未见语种与编解码攻击下的外推性。原文未披露训练、推理或部署成本,动机部分引用的AntiDeepfake联合训练需8卡NVIDIA H100且74000小时规模仅比次优提升约1个百分点。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么要读这篇?

本文的输入是语音反欺骗研究中过去十年公开数据集的训练数据,目标是判断检测模型能否把真人语音与合成、转换、重放等假语音分开。白话说,反欺骗就是给每段语音判真假,英文是 speech anti-spoofing。初学者容易以为只要把声音丢给大模型并堆更多训练语音就能持续变好,本文要核对的正是这个假设。作者先做了一个跨十年的 survey,发现训练时长呈指数增长,同时生成方法数也在变化,但不同数据集在说话人分布、采集管线等混杂因素上并不一致,因此观察到的规模与性能关系只是初步线索。

要理解动机,需要同时看时长与种类两个维度。时长指训练集总小时数,种类指覆盖的生成方法数。原文报告最早的标准化集只有十几小时与少数几种方法,而近年数据集达到上 1000 小时与几 10 种方法,多数据集联合训练甚至达到数万小时量级。关键问题是建库与训练成本是否与泛化收益相称,特别是在面对未见过攻击时的跨域泛化能力。

下面这张动机图把上述 survey 与初步性能对比放在一起,左纵轴与右纵轴方向不同,读数前要先确认箭头。上面板展示年份、时长与方法数的关系,下面板展示不同规模训练集在同一个真实场景基准上的表现与各自时长,红色性能柱越高越好,蓝色时长柱为对数刻度。

看图路径: 1. 先看上面板横轴年份与纵轴训练时长小时,确认时长随年份呈指数上升;2. 再看颜色条代表的生成方法数,比较早期蓝点与后期绿黄红点的颜色差异;3. 再看下面板左侧反等错误率与右侧时长小时的双纵轴,比较红色性能柱与蓝色时长柱的增长幅度;4. 最后定位文中点名的三个数据集在两面板中的相对位置

原论文 Figure 1:Motivations for this work.

论文图 1。原论文 Figure 1:“Motivations for this work. (a) presents our survey results on the scale and diversity of training sets from repre- sentative speech anti-spoofing datasets over the past decade.”。

上图显示的要点是时长增长远快于性能增长。原文指出最大规模的联合训练比较次优只高约一个百分点,尽管训练规模相差几十倍;时长不到一半但方法数多 3 倍的数据集反而在跨域上更好。这支持了一个待验证的假设:在固定生成方法下无差别扩大规模可能是次优的,提高方法多样性可能是更有效的策略。但作者明确指出跨数据集比较存在混杂,因此后文设计了两组受控实验来分离规模与多样性的影响。本解读的输出是可复述的实验条件、受控比较与限制,不做超出证据的因果承诺。

已有路线做了什么,本文与它们如何对照?

检测路线方面,早期工作围绕判别特征展开,用谱系数、基频子带、情感特征、呼吸静音相关性等捕捉真假差异,代表性端到端方法直接从原始波形学习表示,包括 RawNet2、RawGAT 与 AASIST。白话说,AASIST 是音频反欺骗用的谱时图注意力网络,英文是 Audio Anti-spoofing using Integrated Spectro-temporal Graph Attention Networks,负责同时建模局部细节与全局结构。近年自监督学习模型如 Wav2Vec、HuBERT 与 WavLM 成为主流范式,前端预训练表征加后端分类器显著改善泛化,例如 Wav2Vec-AASIST 把 AASIST 的 sinc 层换成 Wav2Vec 前端。

数据集路线方面,早期进展由 ASVspoof 系列挑战推动,从逻辑与物理接入攻击覆盖到深伪;FMFCC-A 与 ADD 系列补上了中文数据集的空缺。任务专用数据集则针对扩散模型、神经编解码器、名人模仿、社交媒体真实采集以及真实部署环境等目标分别建库。近年趋势是更大规模与更高多样性,例如覆盖多语言与上 100 个合成模型、百万级样本与上千说话人、数 10 种生成方法与约 1000 小时音频。这些工作为泛化提供了数据基础,但也带来了样本冗余与成本问题。

本文与近期一项研究形成互补对照。同输入都是异构语音深伪数据,同目标都是改善跨域泛化,同监督都是真假二分类,同运行阶段都是训练前的数据组织。那项工作研究源与生成器多样性对泛化的影响并提出数据混合策略,本文则设计两组对照实验分别固定多样性改变规模、固定小规模提高多样性,重点揭示已有数据集中的样本冗余。因此不能把类别差异当成同条件胜负,本文的贡献是受控分离而非提出新检测器。

要回答的两个问题是什么,混杂在哪里?

第一个问题是:在生成方法固定的条件下,单纯增加训练数据量能否持续改善性能。操作定义是随机抽取同一训练集的不同比例子集,保持生成方法集合不变,只改变每个方法的样本重复次数,然后同时看域内测试与跨数据集测试的变化。如果性能随比例单调上升,则支持规模优先;如果先升后降,则说明存在过拟合与冗余。

第二个问题是:在总规模更小的条件下,提高生成方法多样性是否更能改善跨域泛化。操作定义是从 4 个常用数据集各取每种生成方法固定条数构成混合训练集,真语音统一取自其中一个数据集,然后与各原始全量训练集在完全未参与混合的外部测试集上比较。例子:假设每个方法取 1000 条,30 个方法就是 30000 条,这种构造保证种类多而总量小,便于与百万级单源大数据集对照。

混杂因素是跨数据集比较天然存在说话人、真实数据来源、采集管线与语言差异。本文把多样性窄化为生成方法种类的多样性,不对真实数据来源与说话人多样性做同等分解,这是一个明确的范围限定。另一个混杂是模型容量,容量决定能记住多复杂模式的能力,本文通过固定模型来消除其影响,但也因此不能回答容量与数据因素的交互。理解这两个限定,才能正确复述结论的适用边界。

两组实验的全景流程是怎样的?

全景上本文没有提出新模型,而是做两组数据对照。第一组是规模探索,第二组是多样性探索,两组共用同一个检测模型与训练策略,只有训练数据的组织方式不同。沿一个样本走一遍:一段原始波形先进入自监督前端得到帧级表征,再进入后端分类器得到真假分数,训练时叠加波形增强,验证时用开发集选模型,测试时分别计算域内与跨域的等错误率。

规模分支的做法是从完整训练集按比例随机采样出多个子集,比例覆盖从 1% 到 100% 的多个档位,每个子集独立训练一个模型,再做趋势分析。多样性分支的做法是从多个原始训练集按每种生成方法取固定条数并聚合为混合集,真语音只取自单一来源以控制真实分布,再与原始全量集做跨域对比分析。两条分支的评估都不只看域内,都强调跨数据集的迁移。

下图把两条分支的输入到输出箭头画了出来,上半为规模探索,下半为多样性探索,方框颜色只区分阶段,不代表性能高低。

看图路径: 1. 先沿上面板从随机采样到不同比例子集再到训练与域内加跨域测试的箭头走一遍;2. 再沿下面板从多个原始训练集经采样聚合到混合训练集再到跨域测试的箭头走一遍;3. 比较上面板的趋势分析与下面板的对比分析在输出环节有何不同

原论文 Figure 2:Overview of our research pipelines.

论文图 2。原论文 Figure 2:“Overview of our research pipelines. (a) and (b) illus- trate the design of our exploratory experiments on training data scale and diversity respectively.”。

从图中可以执行的核对是:规模分支的起点是否包含完整集与多个比例子集,是否经过同一训练框再到域内加跨域测试;多样性分支的起点是否为多个原始训练集,是否经过采样聚合得到混合训练集再只做跨域测试。两者的终点分别是趋势分析与对比分析,前者看随比例变化的曲线形状,后者看小而多样是否打败大而单一。这种全景设计把规模与多样性解耦,是全文方法可复述的关键。

模型与多样性定义各负责什么?

模型组件上,本文固定使用 Wav2Vec-AASIST,预训练骨干为官方 XLS-R 300M。白话说,自监督预训练指先在大量无标注语音上学通用表示再用于下游任务,英文是 self-supervised learning。前端负责把波形映射为具有上下文的表征,后端负责从中抽取伪造痕迹并输出真假判断。训练时采用 RawBoost 数据增强,英文是 RawBoost data augmentation,负责在原始数据层面做扰动以提高鲁棒性。固定架构、超参数与训练策略的理由是消除混杂,让性能差异只能归因于训练数据。

语音反欺骗 × 跨域泛化: 语音反欺骗负责区分真实语音与合成转换语音,其分工是学到真假之间的可判别痕迹;跨域泛化负责要求这种判别在未见过的生成方法、说话人与采集通道上仍然成立,二者搭配的原因是实验室内的同分布准确率不能代表部署安全,组合意义是把评估重心从域内等错误率转向跨数据集等错误率。

多样性定义上,本文承认多样性本是多面概念,涉及生成方法、真实数据来源甚至说话人可变性,但为研究可行将其窄化为生成方法种类的多样性。不同数据集间即使方法名重叠,也因参考语音与生成管线不同而被视为不同方法,这是一个需要记住的计数口径。规模则以总时长、总话语数以及假与真话语数分别统计。

生成方法多样性 × 训练数据规模: 生成方法多样性指训练集中覆盖的不同合成与转换管线种类数,其分工是提供不同的伪造痕迹分布;训练数据规模指总时长或话语条数,其分工是提供每种痕迹的重复观测,二者搭配的原因是只有在多样性固定时才能看清规模的边际效应,组合意义是把建库策略从无差别堆量转向先补种类再补数量。

组合机制的意义在于:当多样性固定时改变规模,可以检验重复采样是否带来新信息;当规模受限时提高多样性,可以检验新痕迹类型是否带来迁移。这种先固定 1 维再改变另 1 维的搭配,是全文因果表述克制但对照清晰的原因。

训练如何组织,哪些参数与监督需要交代?

训练组织上,每个规模子集都使用对应数据集的原始开发集做模型选择与训练监控,不混用其他数据集的开发集。规模实验在 2 个数据集上并行展开,一个是中英双语且规模大、方法多,另一个是中等规模且仅英文,两个都是近期代表性基准。多样性实验则从 4 个数据集的训练集采样构成混合集,假语音按每种生成方法取 1000 条,真语音只取自双语大数据集的训练集,混合集总量为 63000 条、生成方法数为 53 种。

Wav2Vec-AASIST × RawBoost: Wav2Vec-AASIST 中 XLS-R 300M 前端负责从原始波形抽取自监督表征,AASIST 后端负责捕捉局部与全局的谱时伪造结构;RawBoost 负责在原始波形层面做增强以模拟通道与噪声扰动,二者搭配的原因是固定强前端加标准增强可以排除模型与增强差异对规模和多样性结论的干扰,组合意义是让不同训练子集的比较只反映数据因素。

监督来源是真假二分类标签,优化目标是标准的检测分类训练,原文未给出损失公式、学习率、批量大小、训练轮数与早停阈值的具体数值,也不说明前端预训练参数是冻结还是全量微调,只说明架构、超参数与训练策略固定。因此复述时只能说固定了模型与策略以消除混杂,不能从模型名称推定冻结方式、梯度路径或更新范围。增强方面明确使用了 RawBoost,但其具体扰动参数与应用概率未在证据中展开,属于缺项。

需要区分的是,本文的训练指下游检测器的训练,不是自监督前端的预训练,也不是生成模型的训练。每个子集独立训练一个模型,而不是增量续训,因此不同比例之间的比较是独立训练结果的比较,不存在跨比例的参数继承。这一点对理解先升后降不是训练曲线抖动而是不同数据量模型的泛化差异很重要。

数据划分、采样、指标与评估条件是什么?

数据划分上,规模实验的训练子集按 1%、5%、10%、20%、5% 十与 100% 随机采样,保持生成方法集合与全集一致。测试分为域内与跨域,域内用同数据集的测试集,跨域扩展到其他数据集的测试集以及真实场景全集,包括 In-the-Wild 与 VoiceWukong 的全集。多样性实验的训练集是混合集与 4 个原始全量训练集,测试为了公平只在未参与混合的外部集上做跨域比较,包括 In-the-Wild、VoiceWukong 与社交媒体采集集的测试集,因为混合集与 4 个来源分布重叠,不能再把它们当作严格跨域。

域内测试 × 跨数据集测试: 域内测试指用与训练集同源的测试集评估,其分工是检验对已知攻击的拟合程度;跨数据集测试指用其他数据集与真实场景集评估,其分工是检验对未知攻击的迁移能力,二者搭配的原因是规模扩大可能同时改善拟合并损害迁移,组合意义是只有两类测试并列才能发现过拟合式下降。

指标上,主结果用等错误率报告,英文是 Equal Error Rate,数值越低越好;动机图用反等错误率展示,定义为一减等错误率,数值越高越好。聚合对象是每个训练条件在每个测试集上的错误率,原文未报告置信区间与显著性检验,因此不能把小幅差异说成统计显著。硬件预算方面,原文只在动机部分提到大规模联合训练需要八块特定图形处理器,自身对照实验的硬件与耗时未报告,属于缺项。

等错误率 × 反等错误率: 等错误率指误接受率与误拒绝率相等时的错误率,数值越低越好,其分工是统一报告判别门限无关的性能;反等错误率在本文动机图中定义为 1 减等错误率,数值越高越好,其分工是把柱状对比的方向统一为越高越好,二者搭配的原因是不同图表方向不同容易误读,组合意义是读数前必须先确认箭头方向。

公平条件上,两组实验共用同一模型、同一增强与同一选择逻辑,差异只在训练数据的规模或来源构成。随机采样未引入基于熵或难度的样本选择策略,这既是控制,也是作者在讨论中承认的局限。复现时必须保留按方法分层定量采样的口径,以及真语音单一来源的口径,否则混合集的多样性与真实分布都会走样。

规模固定种类时性能如何变化,多样性何以胜出?

先看动机层面的数量级对照,它提出比较问题但不是受控结论:在相近评估下更大规模是否带来相称收益,公平条件并不一致因为说话人与管线不同,指标方向在动机图中是越高越好。下表整理原文直接报告的量级事实,用于核对指数增长与边际收益的背景,不代替后文受控结果。

数据集训练时长生成方法数训练规模量级原文观察
ASVspoof201516 hours5 generation methods小规模早期基准首个公开标准化集
Speechfake1,163 hours30 generation meth1000 小时多方法时长不到竞品一半但跨域更好
AntiDeepfake 联合训练74,000 hours未在证据中单独给出数万小时86-fold increase 仅换约一个百分点
规模对比背景跨数据集存在混杂颜色代表方法数时长指数增长观察性发现仍属初步

上表的主要收益是帮初学者建立量级感:从十几小时到上 1000 小时再到数万小时,性能柱的抬升远慢于时长柱的抬升。具体代价是这种跨数据集比较不能排除说话人与采集差异,因此不能直接当作规模无用的证明;未胜出项是时长最大的方案并未拉开差距,这提示后文必须做固定方法的比例实验。

受控的规模结果由热图报告。以下导读帮你按行列读图:行是测试集,首行为域内其余为跨域,列是训练比例从小到大,格内数值为等错误率越低越好,加粗为每行最优。

看图路径: 1. 先确认横轴训练比例与纵轴测试集名称,区分首行为域内其余行为跨域;2. 再逐行找加粗的最优格,观察最优多落在中间比例而非百分之百列;3. 比较左右两幅热图在跨域行的颜色深浅变化趋势是否一致

原论文 Figure 3:Evaluation EER (%, ↓) of models trained on varying proportions of the (a) Speechfake-BD and (b)…

论文图 3。原论文 Figure 3:“Evaluation EER (%, ↓) of models trained on varying proportions of the (a) Speechfake-BD and (b) ASVspoof5 training sets.”。

对可见内容的解释是:左侧双语大数据集的域内最优落在 5% 十附近而非 100%,5% 十与 100% 几乎相同甚至前者略好;跨域多行最优落在 20% 附近,继续加量反而变差。右侧中等规模英文集的最优多落在 10% 或 20%,也不是全量。这种先改善后下降的形状在多个跨域行重复出现,报告支持固定方法下过度重复采样会过拟合训练分布、削弱对未见攻击的检测。像素不能精确辨别的个别小数不必硬记,关键是记住最优不在最大列的模式。

多样性对照的比较问题是:更小但种类更多的混合集能否在严格跨域上打败更大但种类少的单一集,公平条件是同一模型与同一增强且只在外部集上比,指标方向是等错误率越低越好。下表按原文行整理 5 个训练条件的规模与跨域结果。

训练集时长小时生成方法数平均等错误率In-the-WildVoiceWukong
Composite945313.032.0619.46
CD-ADD278521.659.8325.20
ASVspoof5604827.9217.2032.52
Speechfake-BD8593017.522.6326.28
Spoofceleb19821019.673.5723.58

上表显示混合集在所有外部评估上最优,尽管其时长远小于其他集;最大的单源集时长近 2000 小时但方法仅 10 种,泛化仍不如时长八百多小时、方法 30 种的双语集与混合集。具体代价是混合集的真语音单一来源可能限制真实分布覆盖,且其方法计数把跨数据集同名方法视为不同,种类数存在口径红利。未胜出项是中等规模英文集在平均与各外部集上都偏弱,说明在方法少时堆时长不能弥补种类缺失。综合两组结果,原文的判断是多样性对泛化的贡献大于无差别扩量,但这仍是有限解释而非跨一切条件的因果定律。

哪些反例与边界防止把结论推得太远?

第一个反例是域内与跨域的最优比例不一致。域内最优偏向中等偏大比例,跨域最优偏向更小比例,这说明拟合已知分布与迁移未知分布对数据量的需求不同。如果只看域内,会误以为更大总是更好;只有并列跨域,才能看到过量重复的损害。复述时必须同时给出两类测试,不能只引域内。

第二个边界是数据集身份的影响。双语大数据集的跨域基线本身就优于中等英文集与小方法集,这与语言覆盖、方法数量与采集多样性都有关,不能把全部差距归因于方法数。混合集的成功也依赖从多个来源各取定量样本,真实语音却只取自单一来源,因此它证明的是假语音方法多样性的价值,没有证明真实分布多样性不重要。

第 3 个未评测边界是采样策略与模型容量。全文只用随机采样,没有比较基于熵、难度或去重的选择方法,因此不能说随机采样的最优比例就是信息最优;全文只用固定容量的 300000000 参数级模型,没有测试更大或更小容量下规模曲线的形状是否移动,因此不能把先升后降推广到一切容量。训练与推理成本也未系统报告,不能承诺小混合集一定省时省钱,只能说它在数据量上更小。

原文承认了哪些不足,还缺哪些验证?

原文在讨论中承认模型容量是重要决定因素,大容量能学更复杂模式但在有限数据下易过拟合,直接影响向未见域的迁移。本文用统一固定容量来聚焦数据本身,但也因此限制了对数据与容量关系的深入考察,未来可在不同容量下看规模收益的上限如何移动。这是一个明确的待验证方向,不是技术错误。

原文也承认采样策略的不足,构建不同规模与多样性子集时主要依赖随机采样,没有引入更有效的样本选择策略,例如基于熵的方法。作者指出在规模不带来稳定增益的观察下,如何在有限预算内选出信息量更大、互补性更强的样本,是重要的未来方向。这意味着当前的最优比例可能被更好的选择策略改变。

从证据缺项看,还有三处需要补验证:一是未报告多次随机采样的方差与统计检验,小幅差异可能来自采样噪声;二是未报告自身实验的计算开销、训练时长与推理延迟,不能把数据量小直接等同于部署便宜;三是多样性只分解了生成方法 1 维,真实来源与说话人多样性的作用未分离,跨语言与跨通道的贡献仍待验证。相关性不是因果,这些缺项决定了结论的适用条件。

要复现这两组对照,先做什么?

先准备 4 个训练集与 3 个外部测试集,并保留原始划分。规模复现的第一步是按比例随机采样,保持生成方法集合不变,比例覆盖 1% 到 100% 的六档;第二步是用同一模型与同一增强独立训练每个子集,用各自原始开发集选模型;第三步是同时计算域内与跨域等错误率,按行找最优并观察最优是否落在中间列。关键超参数在证据中未完全公开,复现时应固定自己选定的一套配置并全程不变,同时记录随机种子以评估方差。

多样性复现的第一步是按每种生成方法取 1000 条从 4 个训练集采样,跨数据集同名方法按不同方法计数,真语音只从双语大数据集取 10000 条,构成总量 63000 条、五十三方法的混合集;第二步是用同样模型训练混合集与各原始全量集;第三步是只在未参与混合的外部集上比较跨域等错误率。信息条件上要保留方法计数口径与真语音单一来源,否则结果不可比。

资源状态方面,本次收到的证据中没有发现来源绑定且完成网络状态验证的资源,不得声称代码、模型或数据已公开。复现应从公开数据集的官方渠道与预训练模型页面自行获取,并核对版本与划分;不要继承其他解读对开源状态的说法。输出帧率、延迟与误判率若未测量,就明确写未测量,不做改善承诺。

何时值得尝试多样性优先,如何一句话记住?

当你的检测器在域内已经不错但一到真实场景就掉点,且训练集方法种类少而重复样本多时,值得尝试多样性优先:先从多个来源按方法分层补种类,控制总量,再看跨域是否改善;当你的场景是已知攻击的封闭评测且不关心迁移时,适度增加同方法样本仍可能有小幅收益,但要警惕超过中等比例后的回落。本文特有的误解是把动机图的大规模微弱优势当成规模无用或规模有害,正确理解是观察性对比存在混杂,受控结论只说固定方法下无差别扩量收益有限且可能损害跨域,而小而多样的混合在受控跨域上胜出。

另一个特有误解是把方法数多直接等同于一切多样性。本文的多样性窄指生成方法种类,不包括真实语音来源与说话人多样性,真语音单一来源的混合集仍有分布局限;把同名跨库方法计为不同也放大了种类数,引用五十三这个数字时必须同时说明口径。记住一句话:先补新痕迹类型,再补重复观测,评估必须域内加跨域并列,读数前先确认指标箭头方向。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总