英文题目:Kiwano: A Cutting-Edge Open-Source Toolkit for Speaker Verification
会议身份:
conference:odyssey:2026:conference-paper-id:rouvier26_odyssey
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#开源工具 #基准设计 #语音 #说话人验证
评分:8.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:系统技术报告
👥 作者与机构
- Mickael Rouvier:机构信息未能从会议 PDF 纯文本可靠映射
- Pierre Michel Bousquet:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
说话人验证需将变长语音映射为固定维说话人嵌入并在信道与语言失配下保持稳定可分,复现常受训练配置与评测协议不一致严重困扰。Kiwano以PyTorch为底座先做数据管理,用列表式元数据按需加载并经在线噪声混响增强、变速扰动与特征切分输出训练段,其输出直接进入前端嵌入提取。前端以fwSE-ResNet-200等编码器加池化与分类头学习256维嵌入并用AM-Softmax约束角裕度,嵌入再进入后端打分校准完成判决。与仅关注嵌入提取的工具箱不同,其后端统一集成余弦相似度与PLDA、AS-Norm与QMF及CORAL系域适应,使模型平均、LM-FT与分数校准形成可比闭环。在VoxCeleb1-O评测设置下,叠加完整管线的fwSE-ResNet-200的EER为0.34%,低于仅余弦打分基线fwSE-ResNet-200的EER 0.50%。该结论适用边界受限于近场英文训练语料,跨域CN-Celeb上仍显著退化且深至600层后收益饱和,尚未验证远场会议与多语混合部署的外推范围,全量训练成本在相应硬件上约79小时与706.3 kWh。
🔗 开源与复现资源
- 代码相关资源:https://github.com/kiwano-toolkit/kiwano/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
本文解读的对象是发表于 Odyssey 2026 的 Kiwano 工具包论文,作者来自法国阿维农大学。输入是论文正文与本次收到的官方原图像素,目标是让刚进入语音、音乐与音频领域的研究生能够核对事实并复述方法。必须保留的信息包括任务定义、数据管理与前后端模块划分、训练调度、评估协议、主要数字结果与计算代价,以及代码公开状态。输出是 1 篇按学习依赖展开的中文技术解读,不做超出原文的推断。
说话人确认的任务可以白话理解为判断两段语音是否来自同一个人。系统先把注册语音变成一个向量,再把测试语音变成另一个向量,然后比较两个向量给出接受或拒绝的决定。用白话说,向量就是说话人身份证,比较就是看两张身份证照片像不像。论文研究的正是如何用统一、可复现的工具链完成从数据准备到打分校准的全部环节,而不是只提出单个新网络。
本解读先讲任务与已有工具路线,再讲 Kiwano 的全景与 3 个组件,接着讲训练策略与实验条件,然后用两张数字表组织主结果与可复现性证据,最后说明局限与复现步骤。文中例子会明确标为例子,数字只引用原文报告的值。工具包公开信息以资源核验为准,当前核验显示代码链接可用,地址为https://github.com/kiwano-toolkit/kiwano/,许可证为 Apache 2.0。
已有工具各自解决了什么,为什么还需要 Kiwano?
早期框架如 ALIZE 与 Kaldi 提供了从数据准备、特征提取到模型训练的完整基础设施。Kaldi 最初围绕 i-vector 范式,后来扩展到 x-vector,至今仍被广泛使用。但原文指出其基于 C++ 的架构不太适合快速原型与现代深度学习工作流,这是 PyTorch 新一代工具出现的重要动机。
新一代工具包括 SpeechBrain、ESPnet-SPK 与 WeSpeaker。SpeechBrain 是通用语音处理框架,同时支持说话人确认、语音识别、语音合成与 diarization,包含 ECAPA-TDNN 与 ResNet 实现并提供 VoxCeleb 配方,但多任务取向会给专注说话人确认的实验带来额外复杂度。WeSpeaker 采取面向生产的角度,专注说话人嵌入学习,用统一输入输出管理大规模数据,支持 TDNN、ResNet 与自监督学习系统,并提供 VoxCeleb、CN-Celeb 等配方。ESPnet-SPK 则在 ESPnet 上扩展出完整说话人确认流水线,集成 WavLM 等自监督前端,保持与其他模块的互操作。
原文认为这些工具降低了入门门槛,但在 3 个方面仍有缺口。第一,许多工具优先通用语音任务而非说话人确认专用需求;第二,缺少最新架构或生产特性如高效后端与域自适应;第三,训练动态、架构扩展与可复现性对现代性能的影响仍缺乏统一分析。不同论文在不同训练设置下报告提升,难以公平比较。Kiwano 的定位因此不是再做一个通用框架,而是做说话人确认专用的统一实验框架,把最新前端、完整后端与可复现配方放在同一套流程里。
论文要回答的三个可控问题是什么?
论文把大问题拆成 3 个可控的实证问题。第一个是全局批量大小如何影响优化稳定性与泛化,第二个是网络深度增加是否持续带来收益,第 3 个是相同超参数下重复训练的波动有多大。除此之外,论文还检验模型平均、大间隔微调、一致性校准、自适应分数归一化与质量校准等精修手段的叠加效果,并与其他开源工具包做同训练数据的横向比较。
举一个教学例子帮助理解问题设定。假设固定用 VoxCeleb2-dev 的 5994 个说话人、约 1,000,000 条语音训练,只改变全局批量或只改变 ResNet 层数,其他数据增强与评估都不变,那么性能差异就可以归因于被改变的因素。论文正是用这种控制变量思路组织第 4.3 至 4.5 节。例子中数字为假设,仅用于说明逻辑,不代表论文结果。
需要强调的是,论文同时承担工具介绍与实证研究两项职责。工具部分要说明数据、前端、后端如何协同,实证部分要说明在相同评估协议下不同选择的代价与边界。后文将先走完一个样本的完整路径,再展开各组件细节。
Kiwano 把一次验证拆成哪三段流水线?
Kiwano 把端到端说话人确认分为数据管理、前端说话人嵌入模块与后端打分模块,三者通过配方层协调,保证跨数据集与跨实验设置的可复现性。先沿一个样本走完全程。输入是一条变长语音波形,数据管理模块负责组织元数据、在线做增强、重采样与切块、提取声学特征并做倒谱均值方差归一化;前端模块把特征送入编码器网络、池化层与分类头,输出 256 维的说话人嵌入向量;后端模块对嵌入做中心化、白化、长度归一化与线性判别分析降维,再用余弦相似度或概率线性判别分析打分,必要时做域自适应、分数归一化与校准,最后输出是否同一人的分数。
说话人嵌入 × 余弦相似度打分: 说话人嵌入负责把变长语音压缩为定长向量,保留说话人身份特征而抑制内容与信道变化;余弦相似度打分负责度量注册向量与测试向量的夹角相似性,给出是否同一人的分数。两者搭配的理由是前端只管表示学习,后端只管判决,前端输出的 256 维向量直接成为后端输入,组合后形成从波形到验证分数的完整可复现链路。
工具包完全基于 PyTorch 构建,强调轻量可扩展。前端集成 Xi-Vector、ECAPA2 与 ReDimNet 等最新架构,后端则提供余弦与概率线性判别分析打分、对称归一化与自适应分数归一化、CORAL 系列与特征分布适配器等域自适应方法,以及一致性度量因子与质量度量函数等后处理。配方覆盖 VoxCeleb、CN-Celeb、CommonBench、VoxTube、VoxBlink、DiPCo 与 3D-Speaker,包含数据下载与准备过程。
下图是本次收到的官方原图像素,对应论文图 1。它不是系统结构图,而是工具包标识,提前说明可以避免误读。后文涉及的真实模块关系以文字描述为准。
看图路径: 1. 先看卡通角瓜果形象下方的两行英文标题,确认这是工具包标识而非系统框图;2. 再看果实拟人化表情与尖刺轮廓,理解论文以坚韧水果比喻多环境鲁棒性的命名意图;3. 最后确认图中没有模型结构箭头或性能曲线,避免把装饰性标识误读为方法流程
论文图 1。原论文 Figure 1:“Kiwano is an open-source framework for speaker ver- ification research and evaluation.”。
上图显示一个橙色带刺的卡通角瓜果实,面带笑容,下方写有 KIWANO 与 SPEAKER VERIFICATION TOOLKIT 字样。论文正文说明命名取自坚韧的角瓜果,象征多变环境下的鲁棒性。该图没有给出数据流、网络层或评估曲线,因此方法结构仍需回到 3 段流水线的文字定义去复述,不能从该标识推断模型连接方式。
数据如何组织,前端有哪些网络,后端如何打分?
数据管理采用基于列表的元数据系统,做法是把每条语音的路径、说话人标识与时长存在列表里,训练时按需打开文件而非预先全部载入内存。这种设计使数据规模可以从几小时扩展到数百万条语音而不易内存溢出,也便于并行加载。特征准备全部在线完成,不需要预存特征,从而节省磁盘并让每个轮次看到略有不同的输入,增强鲁棒性。具体步骤包括说话人映射、增强、特征提取、重采样与切块、归一化。
增强分为信号级与特征级。信号级包括加噪声、混响、变速、空气吸收、编解码模拟、混叠、削波失真与符号翻转;特征级包括 SpecAugment 掩蔽,并纠正训练与测试数据的均值偏移。特征提取计算对数梅尔滤波器组或语谱图,重采样调整采样率,切块把训练语音切为固定长度,例如 350 帧,短语音做补齐,最后按条做倒谱均值与方差归一化。
前端由编码器、池化层与分类头组成。编码器选项包括 fwSE-ResNet-200、ReDimNet、ECAPA2 与 Xi-Vector。fwSE-ResNet-200 是 200 层残差网络,块配置为 4、30、30、4,每残差块含 3 层 2 维卷积并用 SiLU 激活,只在前两个残差阶段加入特征压缩激励模块,用加性间隔 Softmax 训练并用 Jeffreys 损失优化。ReDimNet 通过 1 维与 2 维形态重塑交替处理语音,兼顾时序分析与频谱空间处理,用残差连接融合输出。ECAPA2 是混合 1 维与 2 维卷积的结构,含局部特征提取器与全局特征提取器两条通路,分别捕捉窄频细节与全频上下文。
Xi-Vector 是在 fwSE-ResNet-200 主干上增加不确定性分支的贝叶斯扩展,用线性高斯模型在池化阶段融合可靠帧与不可靠帧。池化支持统计池化、注意力统计池化与多头注意力池化,损失支持加性角间隔、加性间隔与子中心损失等。
后端是 Kiwano 区别于许多只做嵌入提取工具的关键。打分支持余弦相似度与概率线性判别分析;嵌入预处理支持中心化、白化、长度归一化与线性判别分析降维;域自适应支持 CORAL、CORAL+ 与特征分布适配器,对齐跨域协方差统计;分数归一化支持对称归一化、自适应分数归一化与 D 归一化;校准支持一致性度量因子与质量度量函数,利用分数一致性与试验质量信息精修分数。
自适应分数归一化 × 质量度量函数校准: 自适应分数归一化负责用冒名者队列估计当前试验的分数偏移并做归一,削弱信道与域失配带来的整体漂移;质量度量函数校准负责利用原始相似度与注册和测试端幅值等质量线索做逐试验校准。两者搭配的原因是前者纠正群体层面的分布偏移,后者纠正单次试验的质量差异,组合后在保持余弦后端不变的情况下进一步降低等错误率。
学习率、间隔与大批量如何协同训练?
Kiwano 的训练调度分为 3 个阶段。预热阶段为前 5 个轮次,学习率从 1e-5 线性升到 0.1,间隔保持为 0,让模型先稳定优化动态;平台阶段为随后 25 个轮次,学习率固定为 0.1,间隔从 0 线性升到 0.2,逐步加大说话人之间的角度分离;衰减阶段在间隔达到最大值后,学习率每 10 个轮次乘 0.5 指数下降,促进收敛与精细优化。L2 权重正则设为 1e-4。
所有嵌入为 256 维,训练 51 个轮次,批量大小默认 512 并用余弦后端评估。除 ECAPA2 用加性角间隔 Softmax 外,其余模型用加性间隔 Softmax,间隔 0.2,尺度 30。
大间隔微调是训练后的附加阶段,用更大的间隔例如 0.5 与更长的输入段例如 5 秒继续训练,论文报告能带来一致的性能提升。分布式训练通过 PyTorch 分布式数据并行与 HuggingFace 加速库支持多节点多卡,并兼容 Slurm 作业调度。数据方面用 MUSAN 生成加性噪声,用模拟房间冲激响应加混响,每条训练语音只加噪声或混响中的一种,不同时施加;变速用 0.9 或 1.1 倍,因音调变化视为新说话人。多数系统用 80 维对数梅尔特征,25 毫秒窗、10 毫秒移。
ReDimNet 用 72 维特征,ECAPA2 用 256 维语谱图,以保持与各自原文最佳配置一致。训练数据切为 350 帧块并做无方差归一化的倒谱均值归一化,再加 SpecAugment。
大间隔微调 × 模型平均: 模型平均负责把最后 10 个检查点取平均,用平均权重抑制优化末期的随机抖动;大间隔微调用更大的角度间隔和更长的 5 秒输入段继续训练,增强类间分离。两者分工是前者稳定已学到的解,后者推动解向更具判别性的方向移动,组合后先稳住再精修,是论文中从基础模型走向最终 0.34% 等错误率的关键步骤。
需要如实指出未报告项。原文没有给出优化器类型、动量、梯度裁剪、混合精度或检查点重置时机等细节,也没有说明子中心数与 Top-K 惩罚的具体取值,因此不能从模型名称推定这些实现。复现时应先按已报告的 3 阶段学习率与间隔、批量与轮次搭建,再通过代码核对缺失的优化器细节。
在哪些数据上测,用什么指标,在什么硬件上计时?
训练集为 VoxCeleb2 开发集,含 5994 个说话人、约 1,000,000 条语音。评估分为域内与域外。域内用 VoxCeleb1 的 O、E、H 3 个协议,条件与训练数据相近;域外用 CN-Celeb、DiPCo 与 CommonBench,检验泛化与跨域鲁棒性。CN-Celeb 是大规模中文真实场景数据,强调跨域与多语言变化。
DiPCo 是远场会议风格数据,含多说话人远距离麦克风录音;CommonBench 是聚合多种开源语音数据的多语言基准。
等错误率 × 最小检测代价: 等错误率负责报告误接受与误拒绝相等时的错误水平,直观反映区分能力;最小检测代价负责在目标概率为 0.01 且漏检与误检代价均为 1 的设定下报告加权代价,反映实际应用偏好。两者搭配的原因是前者只看平衡点,后者引入应用先验,组合后既能比较模型排序,又能判断代价敏感场景是否真正可用。
评估指标为等错误率与最小检测代价,代价中目标概率为 0.01,漏检与误检代价均为 1。等错误率越低越好,最小检测代价越低越好。硬件方面,除网络深度实验用 80 GB 显存的英伟达 H100 外,其余实验在 Jean Zay 超算的 32 GB 显存英伟达 Tesla V100 上进行。能耗、中央处理器与图形处理器占用用 CEEMS 平台从节点硬件传感器采集。论文同时报告训练小时数、参数量、显卡数、显存占用与千瓦时能耗,便于联合分析精度与效率。
比较公平性方面,主架构比较不做大间隔微调与自适应归一化;与其他工具包比较时只选同样用 VoxCeleb2 训练、在余弦打分下评估且不用分数归一化的系统,避免把后处理增益误算为前端优势。
哪个前端最均衡,跨域退化有多大?
要回答的主问题是 4 种前端在域内与域外是否一致排序,以及精度与计算代价如何折中。比较条件是同一 Kiwano 流程、同一 VoxCeleb2 训练、无大间隔微调与无自适应归一化,指标方向为等错误率与最小检测代价越低越好,能耗与训练时间越低越好。
| 模型 | 全局平均等错误率 | 全局平均最小检测代价 | 训练时间 | 能耗 |
|---|---|---|---|---|
| fwSE-ResNet-200 | 3.16% | 0.193 | 79 小时 | 706.3 千瓦时 |
| ECAPA2 | 4.49% | 0.261 | 316 小时 | 2835.9 千瓦时 |
| ReDimNet-B6 | 4.09% | 0.243 | 65 小时 | 536.1 千瓦时 |
| Xi-Vector | 3.53% | 0.206 | 79 小时 | 706.3 千瓦时 |
上表整理自原文连续报告,fwSE-ResNet-200 在全局平均上最优,同时域内在 3 个协议上均为最好,域外在 3 套跨域集上的平均也最稳健。ECAPA2 是明确的反例,它在域内 VoxCeleb1-O 可达 0.66% 等错误率,但在 CN-Celeb 退化到 14.68%,全局最差且训练最贵。ReDimNet-B6 参数仅 15M、训练 65 小时、能耗 536.1 千瓦时,效率最高但全局精度低于前两者,尤其在域失配下退化明显。Xi-Vector 域内接近 fwSE-ResNet-200,但域外鲁棒性稍弱,全局为 3.53% 与 0.206。综合看,增加精度不能只看域内,跨域与能耗必须同时核对。原文还报告完整精修流水线后 fwSE-ResNet-200 在 VoxCeleb1-O 可达 0.34%,ECAPA2 为 0.46%,ReDimNet 为 0.41%,Xi-Vector 为 0.36%,但该组数字含模型平均、大间隔微调、一致性校准、自适应归一化与质量校准,不能与上表基础条件直接混比。
批量、深度与重复训练分别改变了什么?
批量实验固定 fwSE-ResNet-200,只改变全局批量。全局批量 256 用 16 卡训练 150 小时,域外平均为 5.40% 等错误率与 0.315 最小检测代价,为总体最优;全局批量 512 把训练压缩到 79 小时,域内等错误率最优为 0.74%,域外接近 256;全局批量 1024 用 32 卡进一步压缩到 47 小时,但性能一致下降。原文指出类似趋势在其他架构上也观察到,因此只报告该架构以保持清晰。
全局批量大小 × 分布式数据并行: 全局批量大小负责定义所有显卡本地批量之积,决定每次参数更新看到的说话人多样性与梯度噪声;分布式数据并行负责把数据分到多卡并行计算再同步梯度,实现大批量的高效训练。两者搭配的理由是并行机制提供算力,批量大小决定优化动态,组合后论文才能在 256、512、1024 等配置下系统比较性能与训练时间的折中。
深度实验比较 100、200、400、600 层。域内最优是 100 层,平均 0.73% 与 0.065;域外最优等错误率是 400 层的 5.48%,域外最优代价是 200 层与 400 层并列的 0.319;600 层不再提升,反而显著增加训练代价,说明深度收益在某点后饱和。精修叠加实验显示模型平均、大间隔微调、一致性校准、自适应归一化与质量校准依次降低等错误率,完整流水线在 3 个域内协议上相对降低约 30%、11% 与 15%。与其他工具包同训练数据同余弦协议比较时,Kiwano 的 0.46%、0.64%、1.13% 低于 3D-Speaker、ESPnet-SPK 与 WeSpeaker 的最佳配置,尤其在最难的 H 协议上相对降低约 13%。
可复现性需要单独用数字表呈现,因为它是判断差异是否来自随机波动的依据。下表问题是相同数据、架构、优化与增强下重复训练 4 次的波动有多大,指标方向为均值越低越好,标准差与变异系数越小越稳定。
| 评估范围 | 平均等错误率 | 平均最小检测代价 | 等错误率标准差 | 代价标准差 |
|---|---|---|---|---|
| 域内平均 | 0.7725% | 0.0695 | 0.022 | 0.0019 |
| 域外平均 | 5.7125% | 0.3265 | 0.167 | 0.0057 |
上表显示域内 4 次运行均值约 0.77% 与 0.07,域外约 5.71% 与 0.327,变异系数在 0.017 到 0.029 之间,离散相对均值很小。论文据此认为其他实验的差异主要来自架构或训练变化而非随机波动。但需注意这只是 4 次重复在固定流水线下的证据,不能推广到更换数据、更换硬件或改变随机种子策略后仍有同样稳定性,未胜出项是 600 层与 1024 大批量的负结果,复现时应优先验证这两个边界。
哪些结论有边界,哪些代价没有被承诺?
直接报告的是在给定 VoxCeleb2 训练与给定评估协议下的排序与代价,支持的是 fwSE-ResNet-200 综合最均衡、深度与批量存在饱和点、重复训练波动小等判断。可能或待验证的是把这些排序推广到未评测的语言、信道与远场会议之外的场景,原文没有提供相关证据,不能直接承诺同样成立。
缺失证据不是技术错误,但必须明确。原文未测量推理延迟、实时因子、内存峰值随音频时长的变化,也未报告误判率随阈值的完整曲线,因此不能承诺精度提升同时带来更快或更省的部署。训练能耗与训练时间有报告,但推理开销与输出帧率是另一回事,需要分开讨论。ECAPA2 在 CN-Celeb 上的大幅退化提醒总体趋势不等于每组都成立,域内 competitive 不代表域外同样可用。
另一个边界是后处理依赖。最终 0.34% 等错误率依赖模型平均、大间隔微调、一致性校准、自适应归一化与质量校准的完整链路,其中自适应归一化用训练集 200 个说话人做冒名者队列,质量校准用与冒名者队列的平均相似度定义幅值。更换队列来源或规模后增益可能变化,复现时应固定队列构造再比较前端。
要复现应先准备什么,按什么顺序跑?
先确认可运行条件。资源核验显示代码链接当前可用,论文称以 Apache 2.0 发布并配有文档与可复现实验。复现前应先下载代码与配方,核对 VoxCeleb2、MUSAN 与房间冲激响应的获取路径,再核对 PyTorch 分布式与加速库版本是否支持多卡与 Slurm 调度。权重下载与系统可运行是两回事,有代码不等于有预训练权重,跑通应以能否从配方重走数据准备到评估为准。
建议按论文顺序先跑通基础链路。第一步用默认 51 轮次、批量 512、350 帧切块、80 维特征与 3 阶段学习率间隔调度训练 fwSE-ResNet-200,不加大间隔微调与归一化,核对域内与域外基线是否接近 3.16% 与 0.193 附近。第二步固定其他条件只改全局批量为 256 与 1024,核对训练时间与域外代价的变化方向。第三步比较 100 层与 400 层,核对域内稍优而域外更受益的交叉现象。第四步再叠加最后 10 个检查点平均、大间隔微调与三项分数处理,核对是否逼近 0.34% 附近。每次只改一处,并记录 CEEMS 能耗与显卡小时数。
还需补的验证包括更换冒名者队列规模、更换测试分段长度、报告多次运行的区间而非单点,以及在自有跨域数据上重测 ECAPA2 与 ReDimNet 的退化幅度。这些是原文未完全覆盖但影响部署判断的环节。
何时值得尝试 Kiwano,还应如何理解它的贡献?
当研究目标是公平比较说话人确认的前端、后端与训练动态,而非只追求单点精度时,Kiwano 值得尝试。它的价值在于把数据列表管理、在线增强、多种编码器、池化与损失、余弦与概率线性判别分析、域自适应与分数校准放在同一套配方里,并用统一协议报告精度与能耗。直接做产品部署前,仍需补测延迟、内存与目标域数据,因为论文的优势主要在可复现研究流程,而非已验证的部署收益。
回到中心矛盾,现代说话人确认的提升常常混杂训练设置差异,Kiwano 通过控制批量、深度与随机波动,把哪些是架构增益、哪些是训练与后处理增益分开。记住 3 个可复述的要点。第一,基础条件下 fwSE-ResNet-200 全局最均衡,但能耗与时间不可忽略。第二,批量 512 是效率与性能的折中,深度超过 400 层后收益饱和。第三,最终精度依赖完整精修链路,换条件需重测。按此顺序复述,既能讲清方法,也能讲清代价与边界。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 2 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
