英文题目:BiMamba2 Masked Discrete-Unit Prediction for Multilingual Speech Representation for Unsupervised Speech in the Wild Challenge

会议身份:conference:interspeech:2026:conference-paper-id:subedi26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#自监督学习 #状态空间模型 #多语言 #语音 #说话人识别

评分:5.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Prakriti Subedi:机构信息未能从会议 PDF 纯文本可靠映射
  • Howard Prioleau:机构信息未能从会议 PDF 纯文本可靠映射
  • Saurav Aryal:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

无监督野外语音挑战(Unsupervised Speech in the Wild, UPS)要求在无标注多语言语音上学习冻结表征,并支撑语言识别、语音识别与说话人聚类三类探测。第一步负责离线目标构造,将长语音按10秒切块并离线提取80维对数梅尔特征,再用小批量K均值对原始梅尔帧聚类生成200类离散伪标签,为掩码预测提供监督信号。第二步负责表征学习,将带掩码的特征送入12层双向Mamba2(Bidirectional Mamba2, BiMamba2)编码器,以前向与反向状态空间路径加线性跳连构建双向上下文,并联合掩码伪标签预测、方差不变协方差正则(VICReg)与语言识别损失联合训练。第三步负责探测适配,将编码器输出经起、中、末三段平均与L2归一化形成话语嵌入,供官方Dynabench探测调用。与掩码自编码Transformer路线相比,该方案以状态空间对偶(Structured State Space Duality, SSD)实现双向上下文,保持线性复杂度。在官方评测中,主检查点step 19.5k说话人聚类调整兰德指数(Adjusted Rand Index, ARI)为0.735,超过全部四个基线,而语言识别宏F1为0.073、字符错误率(Character Error Rate, CER)为0.870,明显落后于Whisper与HuBERT-large。该结论仅适用于约250小时67语言小规模训练与冻结嵌入探测设置,无法外推至大语种覆盖或微调场景。原文未披露训练时长、推理延迟与部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么?为什么野外无标注多语言表示难?

这篇解读的输入是 2026 年 Interspeech 无监督野外语音挑战赛的 1 篇投稿,目标是让刚进入语音领域的读者能复述它的方法与实验条件。必须保留的信息包括数据来源与规模、模型尺寸与结构、3 个损失的组成、训练超参数、官方 3 个探针指标的方向与关键数字,以及本地与官方不一致的分析。本文输出即按学习依赖展开的中文技术解读。

任务本身是无监督语音表示学习:只给无标注、多语言、声学条件杂乱的野外音频,不给任何转写或说话人标签,要求学出的冻结表示能直接用于下游探针。白话说,模型要像听过很多电台杂音后,自己总结出能区分谁在说、说哪种语言、大致说了什么声音特征的向量。难点在于语言极不均衡,英语约占过滤后话语的 40%,而很多语言只有很少样本;同时野外音频有静音、噪声与长短不一的片段,若不做语音活性检测过滤,模型会把大量精力花在非语音上。

挑战赛把这种现实困难固定下来:训练只能用 MLCommons 无监督人们语音数据集,评测是 3 个不做任务微调的探针,语言识别看宏平均 F1 越高越好,语音识别看字符错误率越低越好,说话人聚类看调整兰德指数越高越好。理解这 3 个方向,是后面读懂为何说话人聚类强而语言识别弱的基础。

已有路线如何走到掩码离散单元与状态空间模型?

要定位本文,先区分 3 条相关路线。第一条是自监督语音表示的主流做法,以 wav2vec 2.0、HuBERT、WavLM、XLSR 为代表。白话说,它们都是先自己造目标再预测:wav2vec 2.0 学连续表示的对比区分,HuBERT 则把语音先聚成离散单元再做掩码预测,类似文字领域的 BERT 把词遮住再猜回来。本文明确跟随 HuBERT 风格,即掩码离散单元预测,英文为 masked discrete-unit prediction。第二条是多语言扩展路线,以 XLSR 与 FLEURS 评测为代表,强调在语言覆盖更均衡的大规模数据上训练才能改善低资源语言。

本文只有约 250 小时 67 个语言,与基线的大规模均衡数据形成对照,这直接解释了后文语言识别上不去的原因。第 3 条是序列建模 backbone 的路线,从 Transformer 转向状态空间模型。白话说,状态空间模型英文为 state space model,用可选择的递推状态沿时间压缩传播信息,对长语音有线性时间复杂度优势。Mamba 与 Mamba2 是其中的高效实现,本文用的是双向 Mamba2,英文为 bidirectional Mamba-2,缩写为 BiMamba2。作者说明不用 Hydra 或 Vision Mamba 等双向替代,是因为 BiMamba2 设计更精简,去掉了序列移位并利用了优化过的 Mamba2 核,吞吐更快。

同输入同目标的对照是同样做无监督表示的 wav2vec 2.0、HuBERT-large 与 XLSR,同运行阶段的对照是同样冻结表示做探针的 Whisper。Whisper 本身是有监督弱监督训练,这里只作为表示基线出现,不能理解为同监督条件下的胜负。

挑战赛要模型解决什么?允许吃什么数据?

用一句话界定问题:给定 MLCommons 无监督人们语音的官方挑战数据源,在不使用任何外部数据与标注的条件下,学出一个冻结后可直接取嵌入的多语言语音编码器。开放过滤子赛道允许参与者自己做过滤,但数据源必须来自官方。数据规模在过滤后约为 87400 个话语块,分布在 438 个预计算分片中,总时长约 250 小时,其中英语约 100 小时,非英语约 150 小时,共 67 个语言。语言代码按话语数降序排列,英语、西班牙语、德语、葡萄牙语、阿拉伯语等排在前面。

关键的实验条件是语音活性检测时间戳与语言标签直接消费 MLCommons 预计算元数据,不在本地运行语音活性检测或语言识别推理。举例说明过滤动作:假设一条原始剪辑含大量静音,系统先看它的语音占比是否达到 0.30、最长语音段是否达到 10 秒、按 10 秒对齐切分后可提取语音是否达到 30 秒,任一不满足就丢弃;被标为无语音、缺时间戳或单个压缩包超过 200 条的也丢弃;在数据加载时还要再查 1 次语音占比不低于 0.25 且至少能凑出一个完整 10 秒块。

这种两道过滤保证进入模型的几乎都是可用的语音。资源状态方面,本次收到的第三方资源 MLCommons unsupervised 链接当前不可用,状态为 401,因此不能写该数据集当前可公开下载,只能说论文声明的数据源与访问时间点。

整体方法如何让一个样本走完输入到目标?

先沿一个 10 秒样本走完全程。输入是 16 千赫兹重采样后的波形,离线算成 80 维对数梅尔谱,英文为 log-mel spectrogram,快速傅里叶变换点数 400、跳长 160 个采样点即 10 毫秒 1 帧,每个块固定 10 秒共 1001 帧。白话说,对数梅尔谱就是把声音按人耳敏感的频率刻度压缩成的时频图。特征已提前存成每个最多 200 条的.pt 分片,训练时只读分片,不重复算特征。进入编码器前,按有效非填充帧的 75% 做掩码,用 3 到 5 个连续块跨度遮住,被遮帧替换为一个可学习的掩码嵌入。

编码器是由 12 层 BiMamba2 堆成的 backbone,白话说就是双向的状态空间编码器。输出不接单独解码器,直接用线性头投到 200 个伪标签的 logits,只在被掩码位置算交叉熵主损失。伪标签来自离线小批量 k 均值,英文为 MiniBatch K-Means,簇数 200,直接对逐维缩放后的 80 维对数梅尔帧聚类,不用任何预训练模型。与此同时,把整段隐状态平均池化成一个向量,分别算方差-不变性-协方差正则化与语言识别交叉熵,前者权重按方差项 5.0 与协方差项 1.0 计,后者权重 0.05,总损失是三者相加。

提交时,取编码器最后层归一化后的帧级输出,按时间切成前中后 3 段非重叠区间分别平均再做 L2 归一化,得到 Dynabench 要的嵌入;音频前端同样重采样到 16 千赫兹、提 80 维特征并补齐或裁到 10 秒。

掩码离散单元预测 × 双向 Mamba2 编码器: 掩码离散单元预测负责给出自监督目标:把部分语音帧遮住,要求模型从上下文恢复对应的离散簇编号;双向 Mamba2 编码器负责提供表示能力:用前向与后向两条状态空间路径同时看到过去和未来。两者搭配的理由是评测时冻结表示做非因果探针,需要双向上下文,而掩码恢复正好强迫模型利用双向上下文;组合后新增的作用是以线性时间复杂度学到对说话人结构敏感的多语言表示。

BiMamba2 层内部三条路径各自算什么?

BiMamba2 层的设计是本方法的核心组件,需要先读文字再看图。给定输入张量形状为批量乘序列长乘维度,每层并行走 3 条路径再逐元素相加。第一条是前向路径,直接把 Mamba2 状态空间算子作用于原序列,捕捉从左到右的时间依赖;第二条是后向路径,先沿时间轴翻转序列,作用同样的状态空间算子,再翻转回来,从而捕捉从右到左的上下文;第 3 条是跳连路径,用一个可学习的对角矩阵直接线性变换输入,保留原始信号并稳定梯度。

三者相加得到层输出。Mamba2 算子内部先把模型维度 768 线性投到扩展内维 1536,再过宽度为 7 的 1 维深度卷积注入局部上下文,接着用状态维度 16 的选择性离散递推沿序列传播,经均方根层归一化与门控调制后再投回 768 维。每层外包预层归一化与加性残差。提交模型用 768 维 12 层,共 47.88M 参数。下面的图把上述 3 路求和画了出来,读图时先看主数据流,再对照公式符号。

读图导读:这张 BiMamba2 单层示意图是理解双向与跳连如何组合的唯一像素依据,请按从下往上、从分支到汇合的顺序观察,不要先跳到顶部公式下结论。

看图路径: 1. 从底部输入形状沿三条支路向上追踪到顶部加号与输出;2. 对比左侧直接前向 SS 与右侧先翻转再翻转回来的后向 SS 的标注;3. 确认中间虚线 D 跳连的位置与底部汇聚点的连接方式;4. 核对顶部公式与三条支路颜色标注是否一一对应

原论文 Figure 1:1

论文图 1。原论文 Figure 1:“1”。

图中底部是相同形状的输入,同时分给左中右 3 路;左侧蓝色 SS 块标注前向状态空间模型,右侧经过下方黄色翻转块反转序列再进蓝色 SS 块、上方再经黄色翻转块恢复顺序,中间绿色 D 块为对角跳连并用虚线表示;3 路在顶部黄色加号汇合输出相同形状,顶部公式与三色标注与正文求和式一致,左上角乘 n 表示该层重复多次。可见的关键是双向并非两套独立参数的拼接,而是同一 SS 算子在原序与逆序上各跑 1 次,再加一条保留原信号的线性通路,这种精简是作者选择它而非更重双向变体的原因。

掩码、伪标签与两个辅助目标如何配合?

掩码策略只在有效帧上操作,总量取有效长度的 75% 向上取整且至少 1 帧,用连续块覆盖,避免随机散点让模型只靠局部平滑猜测。伪标签用离线小批量 k 均值对原始对数梅尔帧聚类,簇数 200,默认初始化,不用预训练模型参与,这意味着目标本身没有音素标注,只是声学相似性的粗划分。主损失是在被掩码帧集合上对伪标签的交叉熵,符号上是对每个被掩码时刻预测其簇编号的负对数似然平均。

两个辅助目标都作用于平均池化后的隐状态:方差-不变性-协方差正则化要求各通道方差不塌缩且通道间去相关,语言识别损失用预计算的统一语音数据集语言标签做交叉熵。白话说,主损失逼模型听清局部声音细节,方差正则防止所有向量挤到一起,语言损失轻轻把同语言拉近。原文明确给了权重,语言损失权重 0.05 远小于主损失,说明它只是弱监督,不能指望它解决语言覆盖不足。

k 均值伪标签 × 语言识别辅助损失: k 均值伪标签负责提供主要的掩码位置分类目标,它由原始对数梅尔帧直接聚类得到,不依赖外部标注模型;语言识别辅助损失负责在平均池化后的隐状态上注入语言可分信号,权重仅为 0.05。搭配原因是伪标签本身不含语言标注,单靠掩码恢复难以形成语言结构;组合后主损失学声学细节,辅助损失轻轻约束表示的语言组织,但原文指出它无法弥补低资源语言覆盖不足。

方差-不变性-协方差正则化 × 平均池化隐状态: 方差-不变性-协方差正则化负责防止表示坍缩,通过惩罚方差过小和通道间协方差过大来保持嵌入的信息量与去相关;平均池化隐状态负责给出正则与语言识别损失的作用对象,即把一整段的帧级隐状态平均成一个向量。搭配原因是掩码分类损失只作用于被掩码帧,容易让整体表示退化;组合后在 utterance 级别维持表示的分散性与稳定性。

训练按什么顺序、什么超参数推进?

训练用 AdamW 优化器,英文为 AdamW,学习率 0.0001,梯度裁剪最大范数 0.5。学习率调度是先 2000 步线性热身,再余弦衰减到基础学习率的 0.1 倍。用 bfloat16 混合精度,批量 128,随机种子 42,无梯度累积。训练从同配置的 10500 步检查点恢复,一直跑到 48000 步,每 1500 步存检查点并做留出验证。硬件是单张英伟达 RTX A6000。

为数值稳定,输入帧钳到负 20 到 20,隐状态过非数转数值处理,池化后用于方差正则的嵌入钳到负 100 到 100。数据侧每轮重排分片与片内顺序,采样按 70% 语言均衡加 30% 均匀分片混合,且每批英语硬上限 10%,这是对抗英语主导的具体动作。还有一个小模型对照,用同样目标与流水线但 512 维 8 层、批量 64、跑到 49000 步,用于看规模效应。

语言感知批量采样 × 分片预计算流水线: 分片预计算流水线负责把特征提取与模型训练解耦,离线算好 80 维对数梅尔谱并存成最多 200 条的.pt 分片;语言感知批量采样负责在训练时对抗英语约占 40% 的主导,每批 70% 来自语言均衡采样、30% 来自均匀分片采样且英语硬上限 10%。搭配原因是多语言数据天然不均衡,直接均匀采样会被高频语言淹没;组合后既保证吞吐,又让低频语言在每批中持续出现。

官方评测与本地诊断的條件有何不同?

官方评测通过 Dynabench 提交模型控制器接口完成,参与者接触不到探针训练细节与测试标签。3 个探针分别是语言识别宏平均 F1 越高越好、语音识别字符错误率越低越好、说话人聚类调整兰德指数越高越好。所有官方分数来自最终修复后的提交,基线是 Whisper、HuBERT-large、XLSR 与 wav2vec 2.0。本地诊断有两套,都在与训练同源的 45 语言切分上做:一是每 1500 步跑 1 次的留出验证共 6646 条,二是事后在预计算嵌入上训练探针的线性探针评测。

本地切分按整个压缩包留出,即训练用的压缩包列表之外的包才用于评测,由于同一录音只属于一个包,这种包级排除保证了训练与评测在录音层面无重叠,因此不需要额外去重。必须强调,本地指标只是分析用,不能当作官方性能的代理。提交时的嵌入生成、特征参数与检查点加载的保守回退、以及 BiMamba2 需要 CUDA 后端推理,都是复现时必须对齐的运行条件,否则会出现能训练但评测时加载失败的情况。

官方主结果显示什么收益与代价?

比较的核心问题是:在冻结表示、不做任务微调且训练数据远小于基线的条件下,新表示在 3 个探针上相对 4 个可运行基线各有何收益与代价?公平条件是同一 Dynabench 探针流程取嵌入,指标方向为宏平均 F1 与调整兰德指数越高越好、字符错误率越低越好。下表按官方结果整理,主检查点为 768 维 12 层 19500 步,另有两个对照检查点与小模型。

系统语言识别宏平均 F1 越高越好语音识别字符错误率越低越好说话人聚类调整兰德指数越高越好检查点说明
Whisper0.9500.7900.560公开基线
HuBERT-large0.6900.5700.600公开基线
XLSR0.2600.9000.100公开基线
wav2vec 2.00.2500.9800.630公开基线
小模型 512 维 8 层0.0520.9960.29149000 步
主模型 768 维 12 层0.0700.9980.71048000 步
主模型 768 维 12 层0.0730.8700.73519500 步

表后解释:主要收益在说话人聚类,19500 步检查点以 0.735 超过全部 4 个基线,比 wav2vec 2.0 高 0.105,比 XLSR 高 0.635,这是论文最强的直接报告证据。具体代价是语言识别与语音识别均落后,宏平均 F1 仅 0.073,远低于 Whisper 的 0.950 与 HuBERT-large 的 0.690,字符错误率 0.870 介于 HuBERT-large 的 0.570 与 XLSR 的 0.900 之间。

未胜出项必须正视:小模型在三项上全面垫底,说明小容量在该数据量下三项皆弱;48000 步检查点字符错误率恶化到 0.998,几乎失去可懂度,说明训练更久并未带来全面提升。

本地留出验证 × 官方 Dynabench 探针评测: 本地留出验证负责在开发阶段用同源的 45 个语言 6646 条数据做快速诊断,包括线性探针与余弦聚类;官方 Dynabench 探针评测负责在不公开探针细节与测试标签的 held-out 音频上测语言识别、语音识别与说话人聚类。搭配本意是用本地分数预测官方排序;组合的教训是两者分布与探针方法不一致,本地语言重叠导致语言识别被高估、说话人聚类被低估,且本地更优的检查点在官方反而更差。

本地诊断为何与官方排序相反?

第二个比较问题是:本地留出分数能否预测官方检查点排序?公平条件是同一 45 语言同源切分,指标同样看宏平均 F1 与调整兰德指数,并附类内余弦、类间余弦与可分比。下表对比 19500 步与 48000 步的本地几何。

检查点本地宏平均 F1本地调整兰德指数类内余弦相似度类间余弦相似度可分比
19500 步0.3420.2250.7860.004208.98
48000 步0.3950.2320.747-0.002-366.84

表后解释:本地看 48000 步略强,宏平均 F1 从 0.342 升到 0.395,调整兰德指数从 0.225 升到 0.232,但官方恰好相反,19500 步在三项上全面更好,尤其字符错误率 0.870 对 0.998 差距巨大。

事后线性探针在同一切分上宏平均 F1 高达 0.915,进一步虚高,因为可训练探针在同分布数据上表达力更强。几何上 48000 步类内相似度从 0.786 微降到 0.747,类间从微正 0.004 变为微负负 0.002,导致可分比从正的 208.98 变为负的负 366.84。白话说,后期表示把不同语言推到弱反相关,看似更分开,但可能破坏了语音识别需要的音素相似结构。论文把这种双向背离归因于三点:本地 45 语言全在训练中出现过,语言识别测的是同分布;包级排除虽保证无录音重叠,但语言仍重叠。

本地余弦聚类方法与官方说话人聚类探针方法与评测集都不同,且本地的高可分比对应的是语言簇而非说话人簇,因此本地语言识别高估、说话人聚类低估同时出现。

规模与训练步数带来哪些可验证的变化?

论文没有做逐组件消融,这是明确缺项,不能脑补拿掉某一损失会怎样。但有两个可验证的规模与步数对照。从 512 维 8 层到 768 维 12 层,官方收益最显著的是调整兰德指数从 0.291 到 0.735,字符错误率从 0.996 到 0.870,宏平均 F1 仅从 0.052 到 0.073 微升,支持语言识别主要受数据覆盖限制而非容量的判断。但必须加限制:两配置批量大小 64 对 128 与总步数不同,因此不能把收益完全归因于规模。从 19500 步到 48000 步,官方调整兰德指数相对稳定 0.735 对 0.710,但字符错误率从 0.870 急剧恶化到 0.998,本地几何同步出现类间转负。

论文提出一个待验证的假设:余弦衰减后期学习率趋近最小值,固定 k 均值目标让编码器过度特化于原始对数梅尔帧的粗簇边界,丢了更广的音素泛化,迭代精炼伪标签可能缓解。原文明确说这是事后解释,未做消融证实,措辞上只能用可能。训练与部署成本方面,原文只报告单卡 A6000、批量与步数,未报告 wall-clock 时间、推理延迟与帧率,因此不能承诺效率改善,总体趋势也不等于每步都单调。

哪些结论是直接报告、哪些只是假设?边界在哪?

直接报告的是:主检查点说话人聚类超过 4 个基线,语言识别与语音识别落后;19500 步优于 48000 步;本地排序与官方排序不一致。有限解释的是:掩码恢复可能保留说话人韵律与声道特征因而聚类好,而语言识别需要每种语言音系覆盖充分,250 小时分给 67 语言难以泛化到测试集,这得到大规模均衡多语言模型观察的支持,但未做消融,属于有依据的解释而非因果证明。未验证推测的是后期几何重组与固定伪标签过特化的因果链,需对照实验确认。

边界有 4 条:无组件消融,单次运行无方差估计,训练语料远小于基线,伪标签只算 1 次无迭代精炼。指标口径上注意百分点与相对百分比不同,不同指标差值不能混放,自动指标不能当人工评价。原文表头与算术若冲突应标注,但本解读整理的两表均来自原文连续句与行,单位为无量纲分数,未自行添加百分号或四舍五入,千分位如 19500 步中的逗号按原文步数写法保留语义而不改数值精度。

要复现应先对齐什么?还缺什么验证?

何时值得尝试:如果你的场景也是无标注野外多语言、冻结表示做聚类类探针,且能接受语言识别弱,双向状态空间编码器加掩码离散预测是一个可跑的起点;如果目标是低字符错误率或小语种语言识别,本文条件显示单靠 250 小时与弱语言损失不够。复现先做五件事。第一,按论文 3 条过滤复刻数据:语音占比、分片时长与每包上限,并直接用官方预计算的语音活性与语言元数据,不自己跑检测。第二,离线算 80 维对数梅尔谱,参数为变换点数 400、跳长 160、16 千赫兹、10 秒 1001 帧,存成分片。

第三,离线跑小批量 k 均值 200 类得伪标签,再按 75% 有效帧、3 到 5 连续块做掩码。第四,用 768 维 12 层、状态 16、卷积宽 7、扩展 2 的配置,以学习率 0.0001、热身 2000 步加余弦衰减、批量 128、种子 42 从 10500 步跑到 48000 步,每 1500 步存盘。第五,提交时按前中后 3 段平均加 L2 归一化取嵌入,并确保 CUDA 后端可用。第三张表把可运行的配置对照集中,方便核对。

配置模型尺寸与批量训练步数与调度关键超参数官方对应结果
小模型512 维 8 层批量 64到 49000 步同目标同流水线同损失权重语言损失 0.05三项均低

表后解释:该表的代价是两配置批量与步数不一致,规模收益不能单独归因;好处是所有数字与动作都可直接执行。

还需补的验证是:语言不相交的留出集、与官方探针同方法的本地探针、组件消融与多次运行方差、迭代伪标签是否挽回后期字符错误率。代码与权重方面,原文未声明开源与下载链接,只能按论文参数复写,不能写已公开。

这篇工作留给新手的核心方法论是什么?

回到全文,核心矛盾是同源诊断与野外泛化的脱节:同分布上语言可分性越练越好,野外语音识别反而崩了。方法上,掩码离散预测加双向状态空间以线性复杂度利用双向上下文,适合冻结表示的非因果探针;数据上,分片预计算加语言感知采样解决吞吐与英语主导,但解决不了绝对覆盖不足;目标上,主损失加弱语言损失加方差正则能维持表示不塌缩,但固定粗簇目标在学习率衰减后期可能让表示过度贴合簇边界。

实验证据最硬的是说话人聚类超过 4 个基线,最软的是对为何聚类强而识别弱的因果解释。给新手的可执行总结是:做多语言挑战先建语言不相交、方法对齐的本地代理,否则会被同分布分数误导选错检查点;报告时区分直接报告、有限解释与待验证假设,不把相关性说成因果,不把总体趋势推广到每组每步;复现时先对齐数据过滤、特征参数、掩码与采样这些信息条件,再谈模型改动。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总