英文题目:Domain-Adaptive Dual-Gating Mixture of Experts for Generalizable Speech Deepfake Detection

会议身份:conference:interspeech:2026:conference-paper-id:qin26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#混合专家模型 #鲁棒性 #语音 #语音伪造检测

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Siqing Qin:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhe Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Man-Wai Mak:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音深度伪造检测(Speech Deepfake Detection,SDD)输入为待验语音波形,输出为真实或伪造二分类判决,难点在于训练未见的合成算法、声学环境与编解码器会显著偏移特征分布。第一步由波形门控分支负责低层伪影感知,对原始波形施加可学习截止频率的Sinc带通滤波器组,再经一维卷积与全局平均池化得到波形嵌入。第二步由SSL特征分支负责高层不一致建模,对XLSR中间序列施加深度可分离Sinc滤波与残差网络,再经注意力池化得到SSL嵌入。第三步由原型引导路由与仿射专家负责自适应精炼,将两路嵌入拼接投影得内容logits、将SSL嵌入与可学习域原型做余弦相似得原型logits,两者经可学习系数与温度融合后Softmax得路由权重,再以Top-k选择BN专家对SSL序列做缩放平移,精炼特征送AASIST分类。与通用前馈门控MoE不同,该门控显式参数化频带与时序滤波,并用原型锚定隐式伪造模式以实现无域标签路由。在ASVspoof 2019 LA(19LA)训练、ASVspoof 2021 DF(21DF)、In-the-Wild(ITW)、Fake-or-Real(FoR)评测下,相对XLSR-AASIST基线等错误率(Equal Error Rate,EER)从3.69%/10.46%/7.47%降至2.54%/6.35%/4.42%,ADD 2023 R1/R2从27.74%/21.93%降至23.85%/21.61%。该结论未验证强压缩、真实电话信道与最新扩散声码器下的稳定性,原文未披露推理延迟与部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

这篇解读的输入是论文正文与本次收到的官方原图像素,目标是让刚进入语音与音频方向的研究生能复述方法并核对实验条件。解读必须保留的信息包括任务定义、数据划分、模型输入输出、选通与专家的计算安排、训练超参数、评测指标方向和关键数字,输出是一套按学习依赖展开的中文技术说明。

语音伪造检测的输入是一段待判定的语音,输出是真语音还是伪造语音的判定,难点在于训练时只见过有限的合成与转换算法,测试时却会遇到新的攻击类型、新的声学环境和新的编解码器。初学者容易把这个问题理解成在同一分布上做二分类,但论文强调不同生成方法和多语言数据本质上形成不同域,检测器要在未见域上保持稳定。白话说,模型不能只记住训练集中某种 vocoder 的痕迹,而要学会把不同痕迹分流处理。

本文后续先讲已有路线为何不够,再沿一个样本走完波形到判定的全过程,然后讲训练与评测如何组织,最后讲结果、反证与复现要点。关于资源可用性,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,只能按论文文字讨论方法与实验。

已有路线在同输入同目标下做了什么,为何还缺一块?

在相同输入与相同真假判定目标下,已有工作大致分两条线。一条是强自监督后端路线,例如用多语言自监督模型抽取表示再接分类后端,论文以 XLSR 接 AASIST 作为强基线。这种路线的好处是表示能力强,在受控条件下表现好,缺点是单一后端要用同一组参数拟合所有伪造痕迹,遇到未见攻击时容易失效。另一条是混合专家路线,例如 XLSR-MoE 与 2 阶段层次专家融合等工作,用多个专家分担不同输入特性,概念上更适合处理多变输入。

论文指出,已有音频混合专家的选通多用通用前馈网络,直接把表示映射成权重,没有显式利用语音特有的声学与时序伪影。这些伪影可能从底层物理失真延伸到高层韵律不一致,通用选通看不见频带结构,也难以形成域层面的分流依据。因此论文的切入点不是简单增加专家数量,而是重做选通,让它能同时读原始波形与高层表示,并用可学习的域锚点指导路由。理解这层对照很重要,后面所有设计都是为了解决通用选通看不见伪影、分不清域的问题。

要解决的泛化问题如何界定,成功标准是什么?

论文把问题界定为在未见攻击类型与声学条件下的域泛化。训练只用 ASVspoof 2019 LA 训练集,其中包含真语音与 6 种语音转换和语音合成算法生成的伪造样本。测试则换到明显不同的集合,包括 ASVspoof 2021 Deepfake、In-the-Wild、Fake-or-Real 以及 ADD 2023 的两个测试集,用来代表不同的攻击、信道与真实场景偏移。成功标准是等错误率越低越好,等错误率是误接受率与误拒绝率相等时的错误率,数值下降代表真假区分能力提升。

举例来说,这里的例子只是帮助理解指标方向,不代表论文数据:如果阈值放宽会放进更多伪造,放严又会误杀真语音,等错误率就是取二者平衡点的那一个值。论文还要求效率可接受,即新增参数不能过大,否则多专家就失去轻量意义。后续方法部分会说明,论文用极轻的仿射专家控制增量,用双路选通与原型提升跨域分流能力。

跟着一个样本走完输入到输出的全路径

先跟着一段原始波形走完全程。输入是一段待测语音的原始波形,同时它会被前端自监督模型转成帧级表示。双选通网络同时拿到原始波形与自监督表示,分别抽出面向底层物理伪影的嵌入与面向高层不一致的嵌入,再融合成对每个专家的路由权重。与此同时,自监督表示的主干特征被送给多个并行的轻量仿射专家,每个专家做 1 次分布适配变换。

路由权重经 top-k 筛选后只保留最相关的少数专家,把它们的输出加权求和得到精炼后的特征序列,最后送入 AASIST 后端得到真假预测。这个安排的关键是分工明确:选通只负责看痕迹并决定分给谁,专家只负责对分来的分布做归一化与仿射调整,后端只负责基于精炼特征做最终判定。下面的示意图展示了这种主路径,值得先建立整体印象再进入组件细节。

上图把主干、选通、专家与后端放在同一框架下,读图时先看输入分叉再看加权汇合,能避免把选通误当成分类器。

看图路径: 1. 先沿最左侧原始波形箭头看它如何同时送往前端与双选通网络;2. 再看中间多个仿射专家与上方路由权重的交叉连线;3. 观察加权求和得到 refined 特征后送入后端分类器的位置;4. 确认最终输出为真假二分类

原论文 Figure 2:Overview of the proposed DADGMoE framework.

论文图 2。原论文 Figure 2:“Overview of the proposed DADGMoE framework.”。

从图中可见,原始波形一方面进入 XLSR 前端得到自监督表示,另一方面与该表示一起进入双选通网络。选通输出的路由权重指向多个仿射专家,每个专家对同一份自监督特征做变换,只有被选中的专家的输出参与加权求和,得到精炼特征后再进入 AASIST 后端输出真假。这种设计把泛化压力分解为路由是否分得准与专家是否调得准两个子问题,后续两节分别讲选通如何看伪影、专家为何可以用批归一化实现。

双路选通如何分别读波形与自监督表示?

双路选通包含波形分支与自监督分支。白话说,波形分支是看波形本身的频带痕迹,自监督分支是看高层语义时序中的异常。波形分支先用 Sinc 层实现可学习的带通滤波器组,每个滤波器只学上下截止频率,再经 1 维卷积与全局平均池化得到固定维嵌入。Sinc 层的含义是把首层卷积核约束为带通脉冲响应,每个滤波器只用两个频率参数决定通带,而不是无约束地学整个核长,这样参数少且频带可解释。

自监督分支先用 1 维卷积做通道混合,再用深度 Sinc 层对每个通道独立做带通滤波,然后经两个残差块建模时序上下文,最后用注意力池化得到嵌入。深度 Sinc 层的扩展意义在于,它把原本用于原始波形的思想搬到自监督特征序列上,对高层动态再做 1 次频率选择。两路嵌入都得到后,一路用于内容分支,一路同时用于原型分支。

下图是双选通网络的内部结构,重点看左右两路的滤波器类型差异与下方两类分支的汇合方式。

看图路径: 1. 先从顶部两个输入箭头看左路波形与右路自监督特征分别进入哪些方框;2. 再看右侧圆形域原型与自监督嵌入之间有一条回连箭头;3. 接着看下方特征融合与线性层如何汇出内容分支与原型分支;4. 最后看底部经 Softmax 与 top-k 得到路由权重

原论文 Figure 1:Illustration of the proposed dual-gating network, highlighting the novel Sinc layer-based artifact…

论文图 1。原论文 Figure 1:“Illustration of the proposed dual-gating network, highlighting the novel Sinc layer-based artifact filtering on both raw waveforms and SSL features, and the end-to-end learned…”。

从像素可见,左侧波形输入依次经过 Sinc 层、1 维卷积与平均池化得到波形嵌入,右侧自监督输入依次经过 1 维卷积、深度 Sinc 层、残差块与注意力池化得到自监督嵌入。两路嵌入先做特征融合再经线性层得到内容分支,自监督嵌入另有一条连线进入域原型集合得到原型分支,2 分支汇合后经 Softmax 与 top-k 得到路由权重。这种双路加双分支的安排使选通既有底层谱证据又有高层语义证据,这是理解后面消融中拿掉任一路都会变差的基础。

混合专家 × 选通网络: 混合专家负责把不同伪造模式的变换能力拆给多个轻量仿射专家各自承担,选通网络负责看当前样本更像哪种模式并给出路由权重,二者搭配的理由是单一分类器难以同时拟合多域统计,组合后选通做分流、专家做适配,才让未见域可以被送到统计最兼容的专家。

Sinc 层 × 自监督学习特征: Sinc 层负责用上下截止频率参数化的带通滤波器约束卷积核去提取频带意义明确的伪影,自监督学习特征负责提供经过大量语音预训练后的高层语义与韵律上下文,二者搭配的原因是前者看物理层失真、后者看语义层不一致,组合后选通能同时感知低层谱瑕疵和高层时序动态。

域原型与轻量仿射专家如何完成分流与适配?

得到两路嵌入后,路由分两条对数路径计算。内容对数是把波形嵌入与自监督嵌入拼接后经线性投影得到,代表当前样本内容支持哪些专家。原型对数是把自监督嵌入与每个可学习的域原型算余弦相似度,代表当前样本更靠近哪个已发现的伪造模式。最终门控对数是二者的凸融合,用一个可学习标量经 Sigmoid 加权,并带温度系数,再经 Softmax 得到路由权重。

域原型的含义是一组端到端学习的向量锚点,不依赖已见域标签,训练中自动去占据不同的伪造模式位置,测试时靠相似度把未见样本送到统计最兼容的专家。仿射专家的含义是每个专家就是一个批归一化层,带有各自的缩放、偏置与运行均值方差,对输入的自监督特征序列做通道级的归一化与仿射变换。选择批归一化的理由是它的仿射参数天然编码域统计,轻量且适合做分布适配。

推理时采用 top-k 策略,只取权重最大的 k 个专家加权求和,既省计算又促使专家分化,太多专家同时激活反而会削弱 specialization 并引起缩放冲突。

域原型 × 仿射专家: 域原型负责在选通嵌入空间中自动学出若干可端到端更新的模式锚点,用与自监督选通嵌入的余弦相似度给出先验路由,仿射专家负责用各自批归一化的缩放与偏置及运行统计去适配被分来的分布,二者搭配使路由不依赖已见域标签,组合后原型指路、专家做分布对齐。

内容对数 × 原型对数: 内容对数负责把波形嵌入与自监督嵌入拼接后经线性层映射为基于当前内容的专家偏好,原型对数负责把自监督嵌入与域原型的相似度转为基于域先验的专家偏好,二者再经可学习系数做凸融合,搭配理由是只看内容易过拟合训练域、只看原型又缺样本细节,组合后才兼顾即时证据与跨域锚点。

训练如何组织,哪些更新哪些没有说清?

训练阶段使用交叉熵损失与 Adam 优化器,论文明确报告学习率为 1e-6、权重衰减为 1e-5。音频被裁剪或拼接成约 4 秒,对应 64600 个采样点,批量大小为 20,并使用 RawBoost 做数据增强。如果验证集交叉熵损失连续 7 个轮次不改善就早停,最终检查点是对验证集上最好的前 5 个模型取平均,实验在单张 Nvidia 4090 上运行并固定随机种子。论文把 XLSR 作为特征提取器并与 AASIST 后端一起微调,混合专家模块接在自监督骨干之后,对中间表示做变换。

需要如实指出缺项:论文没有单独说明域原型、选通卷积与专家批归一化统计的具体冻结与更新细节,也没有给出梯度是否截断或分阶段训练的安排,因此不能从模型名称推定哪些参数冻结。监督来源是真假二分类标签,没有使用域标签去监督原型,原型是靠分类损失端到端带动的。复现时应先按上述已报告的优化与早停条件搭建训练循环,再把原型与选通当作普通可学习参数参与优化,若需验证冻结策略的影响,要额外补做对照实验。

数据、基线与指标条件是否一致?

数据方面,训练统一用 ASVspoof 2019 LA 训练集,评测用多个代表域偏移的集合,包括 21DF、ITW、FoR 与 ADD 2023 的两个测试集。论文的主比较在相同训练数据下进行,基线是 XLSR 接 AASIST,本方法是在该基线后加入混合专家模块,因此主结果的公平性来自同一前端与同一后端,只看新增模块带来的变化。指标统一用等错误率,数值越低越好,相对改善用百分比表示,绝对变化用百分点理解,二者不能混用。参数量方面,基线约 317.84M,本方法约 318.01M,增量约 0.17M,用来说明轻量设计。

论文还与 XLSR-MoE、XLSR-SLS、2 阶段专家融合等外部系统比较,但那些系统的训练细节与数据增强不完全一致,只能作为参考对照,不能当成严格同条件胜负。下表把训练与优化的关键可复现条件整理在一起,数字都来自正文连续原句,便于按图索骥。

下表提出一个可核对的问题:在相同优化框架下,哪些训练预算与停止条件是论文明确固定的,复现时必须先对齐它们才能谈结果差异,表中每列对应一类预算,指标方向是越一致越可比。

环节音频长度学习率权重衰减批量与早停
训练输入与优化约 4 秒,64600 个采样点1e-61e-5批量 20,验证损失 7 轮不改善早停,前 5 最优平均

表后需要解释这些条件的意义与代价。固定音频长度保证批量内时序可比,但裁剪或拼接会改变长语音的上下文,复现时要保留相同的截断逻辑。较小的学习率配合微调有助于稳定自监督前端,但训练步数会变长,早停与模型平均则用来抑制过拟合。论文未报告训练时长与推理延迟,因此不能承诺效率之外的速度收益,后续结果表只讨论精度与参数增量,不外推延迟结论。

主结果测了什么,相对基线改善多少?

主结果测量的是同一训练条件下,在未见域上的等错误率高低。比较对象是实际可运行的 XLSR-AASIST 基线与加入本方法的完整系统,条件一致,指标方向为越低越好。论文报告,在标准 21DF 上等错误率从 3.69% 降到 2.54%,在更难的 ITW 上从 10.46% 降到 6.35%,在 FoR 上从 7.47% 降到 4.42%,在 ADD 2023 的两个测试集上也有下降。摘要强调在挑战性跨数据集上最高有 40.8% 的相对下降,正文对 FoR 给出同样口径,ITW 的相对下降为 39.3%,21DF 的相对下降为 31.2%。关键代价是参数增量很小,论文称只增加 0.17M 参数,说明改善主要来自路由与适配机制而非堆参数。

下表把 3 个主要数据集上的基线、本方法与相对改善放在一起,比较问题是新增模块是否在多个未见域上一致带来收益,公平条件是同一训练集与同一前后端,指标方向为等错误率越低越好。

数据集指标基线 XLSR-AASIST本方法 DADGMoE相对变化
21DF等错误率3.69%2.54%相对改善 31.2%
ITW等错误率10.46%6.35%相对下降 39.3%
FoR等错误率7.47%4.42%相对下降 40.8%

表后解释主要收益与限制。收益是 3 个集合全部下降,且难度越大的真实场景集合下降幅度越大,支持双选通与原型路由有助于跨域泛化的判断。代价与限制是论文同时报告参数从 317.84M 到 318.01M 的增量虽小,但没有测量推理延迟与误判分布,因此不能把等错误率改善直接等同于线上误拦改善。还有一个未胜出边界需要保留:与外部最优系统的比较中,本方法在 21DF 上并非全面最低,例如部分外部系统在该集合上报告更低数值,论文的优势更集中在 ITW 与 FoR 这类跨域集合,这与方法面向未见域的设计目标一致。

拿掉哪一路选通或原型会变差,top-k 为何取 2?

消融按去掉一个部件后看等错误率如何变化来组织。被测对象包括去掉原型、去掉自监督选通分支、去掉波形选通分支,以及改变 top-k 的取值。论文报告,去掉波形选通后在 FoR 上等错误率上升 8.25%,说明只靠高层表示会漏掉底层伪影。去掉自监督选通后在 ITW 上上升约 1.71%,说明只靠波形又缺语义上下文。去掉域原型后在跨域 ITW 上上升 2.11%,支持原型作为语义锚点帮助路由泛化的解释。

关于 top-k,论文比较了 1 到 5 的取值,k 为 2 时在 3 组数据上取得 specialization 与多样性的最佳折中,k 为 1 时容量不足,k 过大时多个仿射归一化同时作用会削弱 specialization。下表把 3 类消融的增量与完整模型基准放在一起,便于 1 次看清哪一路更关键。

下表要回答的比较问题是:在完整模型已经对齐的条件下,移除不同部件造成的绝对增量有何差异,公平条件是同一训练与评测流程,指标方向为增量越小说明该部件越可替代,反之越关键。

被移除部件ITW 等错误率变化FoR 等错误率变化完整模型 ITW完整模型 FoR
去掉域原型增加 2.11%有所上升6.35%4.42%
去掉自监督选通增加 1.71%有所上升6.35%4.42%
去掉波形选通有所上升增加 8.25%6.35%4.42%

表后解释主要发现与反例。最大反例是去掉波形选通在 FoR 上的 8.25% 上升,说明双路不是可有可无的装饰,而是跨域精度的关键来源。另一个细节是去掉原型在 21DF 上几乎无变化,但在 ITW 上变化明显,说明原型的作用在域偏移更大时才充分显现,不能只看单一集合下结论。top-k 的结论也需谨慎,论文只在 5 个专家的设置下比较 k 值,没有证明换专家数后最优 k 仍为 2。

下面两张图从路由行为上为上述数字提供佐证,先看训练集上真假样本的专家分工,再看跨数据集的专家激活条带。

看图路径: 1. 先确认横轴为专家编号 0 到 4、纵轴为平均门控权重;2. 比较蓝色真语音柱在 2 号和 3 号专家上的高度;3. 比较橙色伪造柱在 0、1、4 号专家上的高度;4. 观察同一专家上两色柱的明显不对称

原论文 Figure 3:Expert specialization in DADGMoE.

论文图 3。原论文 Figure 3:“Expert specialization in DADGMoE. Average gate weights for bonafide and spoof samples from the training set across experts, demonstrating clear roles (e.g., Expert 2 for bonafide…”。

上图是训练集上按真假分组的平均门控权重柱状图,可见真语音在 2 号专家上明显更高,伪造样本则分散在 0、1、4 号专家上,3 号专家也承接部分真语音。这种不对称支持轻量仿射专家已形成类别层面的分工,但它只说明训练域内的分化,不能单独证明跨域有效,需要结合下一张跨数据集热图一起看。

看图路径: 1. 先确认横轴为专家序号、纵轴为按数据集分段的样本序号;2. 观察 21DF、ITW、FoR 三段各自在哪几列更亮;3. 比较 ITW 段第 0 列与 FoR 段第 1 列的纵向条带;4. 结合右侧颜色条确认亮色代表更高门控概率

原论文 Figure 4:The heatmap visualizes the gating probability for each expert across samples from 21DF, ITW, and…

论文图 4。原论文 Figure 4:“The heatmap visualizes the gating probability for each expert across samples from 21DF, ITW, and FoR datasets.”。

上图是跨数据集的门控概率热图,横轴为专家序号,纵轴为按数据集分段的样本。可见 21DF 样本更偏向部分专家,ITW 样本在第 0 列形成更亮的纵向条带,FoR 样本在第 1 列形成更亮的条带,深浅差异代表门控概率高低。这种按数据集呈现的垂直条带支持路由具有域 specialization,但热图不能读出精确到小数点的概率值,解读应停留在条带位置与相对亮暗层面。

还有哪些没有测、不能承诺、需要谨慎的地方?

首先,论文直接报告的是等错误率与参数增量,没有报告误接受与误拒绝在阈值变化下的分布,也没有测量延迟、吞吐与内存占用,因此不能承诺误拦率或实时性得到改善,训练资源与推理开销要分开讨论。其次,总体趋势不等于每组都成立,例如原型在 21DF 上几乎无增量、top-k 取 4 时在 21DF 上甚至略好,这些局部反例说明最优配置与数据集有关。

再次,外部系统比较存在条件不一致,部分外部结果引自其他文献,数据增强与训练轮次未完全对齐,只能作为参考,不能当成同条件排名。最后,方法依赖自监督前端与后端分类器的质量,若换前端或换后端,选通嵌入的分布会变化,原型与专家的适配效果需要重新验证。缺失证据不是技术错误,但复现与选型时要把这些边界当作待验证项,而不是默认成立。

复现先做什么,需要保留哪些超参数与信息条件?

复现的第一步是对齐数据与指标。训练用 ASVspoof 2019 LA 训练集,评测用 21DF、ITW、FoR 等集合,指标用等错误率且越低越好,比较时保留基线与本方法的成对数字,不要只记相对百分比。第二步是按原文搭建输入处理与优化条件,包括约 4 秒的裁剪拼接、RawBoost 增强、Adam 优化、学习率 1e-6、权重衰减 1e-5、批量 20、验证损失 7 轮不改善早停以及前 5 最优平均。

第三步是实现双选通与混合专家,波形分支用 Sinc 层加 1 维卷积与平均池化,自监督分支用 1 维卷积加深度 Sinc 层再加残差与注意力池化,路由用内容与原型两路融合后做 Softmax 与 top-k,专家用批归一化实现并取 k 为 2、专家数为 5 作为起点。关于开源状态,本次没有可用资源证据,因此应按无公开代码处理,自己实现时要记录随机种子与单卡环境。常见误解是把仿射专家当成大前馈网络,实际上它只是带各自统计的归一化加仿射,容量很小,泛化收益来自选通分流而非专家变大。

另一个误解是把原型当成域标签监督,实际上它是不依赖已见域标签的可学习锚点,靠分类损失带动。

何时值得尝试这个方法,一句话如何记住它?

当你的检测器在训练域上很好但一到真实采集或新合成器就掉点,且你怀疑不同伪造痕迹需要不同归一化时,这个方法值得尝试。它的记忆点是先用两只眼睛看伪影,一只看波形的频带,一只看高层语义的时序,再用几个学出来的原型决定把样本送给哪个轻量归一化专家,最后只让最相关的两个专家说话。支持它的最强证据是跨域集合上的一致下降,尤其是 ITW 从 10.46% 到 6.35% 与 FoR 从 7.47% 到 4.42%,且只增加约 0.17M 参数。

主要代价是引入选通结构与路由超参数,需要调专家数与 top-k,并承担自监督微调的训练成本。下一步值得补的验证是测量实际延迟与阈值下的误判分布,以及在更换前端或后端后重新检验原型与专家的稳定性。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总