英文题目:WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion
会议身份:
conference:interspeech:2026:conference-paper-id:liu26o_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#流匹配 #变分自编码器 #低资源 #语音转换
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Dong Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Ju:机构信息未能从会议 PDF 纯文本可靠映射
- Yao Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Ming Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
耳语转正常语音转换(Whisper-to-Normal,W2N)需从缺失声带振动的耳语恢复可懂且自然的有声波形,难点是频谱失配大、韵律时序不一致且平行语料稀缺。该方法先以在耳语正常语料上微调的Whisper-large V3内容编码器抽取语义表征,再经双编码器连续变分自编码器(Variational Autoencoder,VAE)加软动态时间规整(Soft Dynamic Time Warping,Soft-DTW)做耳语到正常域对齐,接着由前馈Transformer粗梅尔生成器恢复全局结构并经最优传输条件流匹配(Optimal-Transport Conditional Flow Matching,OT-CFM)对残差精修细节,最后以在生成梅尔上微调的HiFi-GAN合成波形;正常输入经门控路由绕过对齐以兼容常规语音转换(Voice Conversion,VC)。与单阶段联合映射相比,差异在于将跨域对齐与正常域生成解耦且生成模块仅在正常语音上训练。在普通话AISHELL6-Whisper耳语测试集上,相对耳语输入字符错误率(Character Error Rate,CER)由22.937%降至16.932%,感知质量DNSMOSovrl由1.102升至3.072。该结论限于有目标语言训练数据的重训设置,未验证跨语言零样本、真实病理语音与强噪声稳定性。原文未披露训练推理部署成本。
🔗 开源与复现资源
- 演示资源:https://demo-whispervc.github.io/demo-whispervc/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/rkmt/wesper-demo — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/tan90xx/distillw2n — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,哪些信息不能丢?
输入是一段耳语音,特点是说话时声带不振动,因此波形中缺少基频对应的周期性激励,能量偏低,共振峰位置相对正常音发生偏移,听感嘶哑且在噪声下更难听清。目标是生成同一句话、尽量同一说话人的正常有声音频,采样率在论文中定为 22.05 kHz 波形,中间以梅尔谱为声学表示。必须保留的信息有两类,一是语言内容,即音素序列和语义不能被改写,二是说话人音色,即转换后仍能听出是谁在说话。不能丢的原因很直接,耳语转正常的应用包括术后声带患者康复、需要安静说话的隐私通信以及无声交流,如果内容错了就失去可懂度,如果音色漂了就失去身份一致性。
沿一个样本走一遍有助于建立全貌。假设有一句普通话耳语,先经 16 kHz 内容编码器得到帧级语义特征,再经跨域对齐模块把耳语特征搬到正常语音的表示空间,接着由声学模型结合目标说话人嵌入生成 22.05 kHz 对应的梅尔谱,最后由声码器合成波形。论文把这条链拆成 3 个顺序组件,刻意让对齐只用少量配对耳语与正常数据学习,让声学生成只用正常语音学习,从而降低对大规模平行耳语语料的依赖。
耳语转正常 × 语音转换: 耳语转正常负责把缺少声带振动的耳语恢复为带浊音的正常音,分工是补基频、能量和谐波结构;语音转换负责在正常音之间更换音色而保留内容,分工是解耦内容与说话人。搭配理由是两者都需要保留语言内容并重建声学细节,WhisperVC 用门控路由让耳语走对齐分支、正常音直通生成分支,组合意义是在同一套生成器里同时支持两种输入而不互相污染。
初学者常误以为这只是降噪或增强。区别在于降噪假设干净语音的激励结构还在,只是被噪声掩盖,而耳语的激励结构本身缺失,需要重建原本不存在的浊音和谐波。因此模型必须补信息而不是只去干扰,这也是论文强调谱失配大、时长不一致、平行语料稀缺的原因。
已有路线在同一输入输出下各解决了什么?
在相同输入输出下,数据驱动路线直接学耳语声学特征到正常声学特征的映射。论文提到的例子包括注意力引导的生成对抗网络、改进 Transformer 预测梅尔谱再接神经声码器,以及比较研究证实生成对抗框架的有效性。这类方法在有平行数据时重建自然度较好,但严重依赖严格平行,且单阶段同时学对齐、说话人条件和声学生成,在数据少时对耳语与正常的大谱和时间差异不稳定。
为摆脱严格平行,非平行方法引入辅助分类变分自编码器和循环一致生成对抗网络,把问题看作跨域风格迁移。近期轻量与零样本路线利用自监督语音表示,例如零样本实时系统与基于自监督特征蒸馏的轻量模型,试图用更少配对或 1 次样本完成转换。另一支是模型驱动路线,显式利用语音产生机理,例如梅尔倒谱系数逆变换和基于源滤波器的激励重建,可解释性强,但论文指出要准确恢复自然浊音和韵律仍然困难。
对照的关键是运行阶段和监督条件是否一致。通用语音转换模型在正常到正常上很强,但论文在耳语输入下零样本调用它们,内容错率明显更高,说明类别差异不能当作同条件胜负。WhisperVC 的定位不是再做一个单阶段映射,而是把跨域对齐与正常语音生成解耦,使耳语转正常与常规语音转换能共用同一生成器。
难在哪里,为什么要拆成对齐与生成两段?
难有 3 层。第一是信号层缺失,基频完全没有,模型无法从输入直接估计音高,只能借助语言内容和说话人先验去 hallucinate 合理的浊音结构。第二是表示与时间失配,耳语与正常的内容特征在数值分布和帧长上都不对齐,若强行让生成器同时纠正域偏差又生成高保真声学,优化目标互相牵制。第三是数据层稀缺,高质量配对耳语与正常语料少,单阶段大模型容易过拟合说话人或文本。
拆分的教学直觉是分而治之。对齐阶段只解决从耳语表示到正常表示的搬运,不负责音色细节和波形质量。生成阶段只解决从正常化表示到正常梅尔的重建,可以全部用丰富的正常语音训练,因而见过更多音色、韵律和文本。这样耳语侧只需要少量配对数据把输入拉回生成器熟悉的分布,生成器本身不需要见过大量耳语。论文进一步用门控路由实现统一,当输入已是正常语音时跳过对齐,避免对正常表示做多余变换。
三段式链路如何从输入走到波形?
全景按推理顺序是 3 段。第一段是耳语专用域对齐,输入 16 kHz 波形经冻结的内容编码器得到特征,再经门控决定是否过基于 Conformer 的变分自编码器,最后经长度通道对齐器得到与梅尔等长的特征。第二段是由粗到精的梅尔生成,先由确定性解码器预测粗梅尔,再由残差条件流匹配补出细节,两者相加得到最终梅尔。第 3 段是神经声码器,把预测梅尔合成 22.05 kHz 波形,且在预测梅尔上做过微调以缩小训练与测试分布差。
下面这张总览图值得对照正文慢慢看,它把 3 个虚线框、两条输入支路和加号汇合画得很清楚,是理解解耦思想的最短路径。
看图路径: 1. 先从最左侧语音梅尔沿箭头向右追踪三个虚线框的先后关系;2. 观察内容编码器后门控路由分出的上下两条支路分别标注了哪种输入;3. 对比组件二中粗生成器与残差流匹配如何汇入同一个加号再输出转换后梅尔;4. 确认组件三中声码器输入是预测梅尔、输出是波形
论文图 1。原论文 Figure 1:“Overview of the proposed whisper-to-normal voice conversion framework.”。
看完图再回扣公式含义。最终梅尔写成粗预测加残差预测之和,粗部捕全局结构,残差部补精细声学细节。推理时耳语先对齐再生成,正常输入经门控直通生成。这种安排让组件二始终工作在正常语音空间,训练时可以只用正常语音,这正是低资源设计的核心。内容编码器用耳语与正常语料微调过的 Whisper-large 第三版,说话人嵌入用在 VoxBlink2 预训练并在 VoxCeleb2 微调的 SimAM 残差网络抽取,维度为 256 维。
对齐模块怎样把耳语特征搬到正常空间?
先看这张对齐模块细节图,它展示了配对内容如何进入双编码器与共享解码器,以及两种损失各自监督哪条支路,读懂它就读懂了组件一的监督来源。
看图路径: 1. 先确认左侧配对耳语与正常语音共用同一个冻结内容编码器;2. 再看中间双编码器加共享解码器结构以及中间标注的均值方差与标准正态约束;3. 区分底部图例中均方误差损失与软动态时间规整损失各自回连到哪一条特征
论文图 2。原论文 Figure 2:“Overview of the proposed Conformer-based VAE module.”。
图中左侧上下两条梅尔分别对应配对的耳语与正常语音,它们共用同一个冻结内容编码器,输出 1280 维特征。之后进入基于 Conformer 的连续变分自编码器,包含两个编码器和一个共享解码器。给定配对特征,两个编码器各自输出隐后验分布,从中采样隐变量再经共享解码器重建为对齐特征。训练目标由三项组成,对两个后验分别加与标准正态的散度约束,对正常支路用均方重建误差,对耳语重建支路用软动态时间规整损失去对齐到正常特征。软动态时间规整允许时间弹性,鼓励耳语重建向正常空间靠拢,从而容忍语速与时长差异。
内容编码器 × Conformer 变分自编码器: 内容编码器分工是从 16 kHz 音频抽取 1280 维语义表示,尽量保留说了什么;Conformer 变分自编码器分工是把耳语和正常的内容特征映射到同一隐空间并重建为正常侧特征。搭配理由是直接用耳语特征驱动生成器会有域偏差,组合后下游生成器只看到对齐后的正常化特征,新增作用是为低资源下的稳定生成提供统一输入。
需要提醒的是原文未报告散度权重、重建权重与规整权重的具体数值,也未给出优化器、学习率与隐变量维度的完整设置,因此复现时只能确定损失组合形式,不能确定权重配比。门控路由是一个轻量 sigmoid 分类器,用配对耳语与正常监督训练,输出域指示,耳语走变分自编码器分支,正常直接保留原特征。这种选择性对齐既纠正跨域失配,又保护正常表示不被损伤。
生成器如何先定骨架再补残差,音色从哪里来?
生成从长度失配处理开始。内容编码器工作在 16 kHz,而梅尔按 22.05 kHz 提取,两者帧数不一致。长度通道对齐器不做显式时长建模,而是对编码器特征做线性插值到梅尔长度,再经卷积投影到声学解码器维度,得到长度对齐特征。教学例子是,若编码器输出每秒 50 帧而梅尔每秒约 86 帧,插值就是按比例拉伸对齐,卷积再把通道数映射到解码器需要的宽度。这一步只解决形状对齐,不改变语言内容。
粗梅尔生成器 × 残差流匹配: 粗梅尔生成器分工是用前馈 Transformer 确定性地预测全局声学骨架 Mc;残差流匹配分工是用最优传输条件流匹配学习真实梅尔与粗预测之差 R。搭配理由是直接生成完整梅尔方差大、跨域不稳定,先定骨架再补细节更易学,组合意义是把全局结构建模与随机细节精修解耦,公式上形成 Mˆ=Mc+Rˆ。
粗梅尔生成用前馈 Transformer 声学解码器,以对齐特征与说话人嵌入为条件,确定性输出粗梅尔,训练用重建绝对误差。残差定义为真实梅尔减粗预测,流匹配不直接建模完整梅尔,而是把高斯噪声沿直线插值路径输运到残差,网络预测速度场,条件同样包括插值状态、时间步、对齐特征与说话人嵌入,训练最小化速度匹配误差。这种由粗到精把全局结构与随机细节分开,在跨域失配下更稳定。论文报告残差形式优于直接建模完整梅尔。
长度通道对齐器 × 说话人嵌入: 长度通道对齐器分工是把编码器帧率插值到 22.05 kHz 梅尔帧率并经卷积映射到解码器维度,解决不引入显式时长模型的长度失配;说话人嵌入分工是提供 256 维音色条件,控制像谁在说话。搭配理由是内容决定说什么、音色决定听感归属,两路在粗生成器和流匹配网络中共同作条件,组合后实现内容保留下的可控音色生成。
软动态时间规整 × 门控双路径路由: 软动态时间规整分工是在训练时允许时间弹性地把重建耳语特征拉向配对正常特征,处理语速与时长不一致;门控双路径路由分工是在推理时用轻量 sigmoid 分类器判断输入是否为耳语,决定是否经过变分自编码器对齐。搭配理由是一个管训练对齐目标、一个管推理是否执行对齐,组合意义是训练学到跨域映射而正常语音转换时不被多余变换损伤内容。
声码器采用 HiFi-GAN,并在预测梅尔上微调。理由是声码器若只在真实梅尔上训练,测试时见到生成器的预测梅尔会有分布差,微调让合成更鲁棒。原文未给出微调轮数与数据配比细节,只说明用了正常语音与生成梅尔,这是复现时需要补验证的缺项。
三个组件按什么顺序训练,各自用什么数据?
训练是顺序进行的,3 个组件分开优化,推理时联合使用。普通话主评估全部在 AISHELL6-Whisper 上,该库含约 30 小时配对耳语与正常普通话语音。组件一学耳语与正常特征间的跨域对齐,需要配对监督。组件二做正常语音声学建模,用粗预测器加基于最优传输的条件流匹配做残差精修,训练只用正常语音。组件三微调 HiFi-GAN 以适应重建梅尔分布。
英语泛化实验换了语料以验证解耦训练策略。组件一在配对耳语与正常语料 wTIMIT 上训练,组件二只在 LibriTTS 干净子集的正常语音上训练,组件三用 LibriTTS 干净子集加 wTIMIT 正常语音共同优化以提高对域变化的鲁棒性。wTIMIT 按说话人严格划分为不相交的训练、验证与测试集,验证与测试说话人在训练中完全不可见,形成未见说话人零样本评估协议,且数据组织为配对正常与耳语话语以保持对齐训练与评估的一致监督。
原文未报告各组件的批量大小、训练步数、学习率与硬件预算,也未说明内容编码器微调与说话人编码器微调的具体冻结范围,除组件一的内容编码器明确冻结外,其余参数更新范围需要回到代码或补充材料核对。推理时门控分类器决定是否经过变分自编码器,耳语走对齐,正常直通。
用什么数据、基线和指标来保证比较公平?
普通话评估在 AISHELL6-Whisper 测试集上进行,任务分两种。耳语转正常以耳语测试话语为输入衡量重建质量,正常到正常语音转换以正常语音为输入并给定目标说话人嵌入,检验统一框架是否保留标准转换功能。由于此前没有在该库上报告的耳语转正常系统,论文选用通用语音转换代表 Seed-VC 作基线,耳语评估时直接把耳语喂给 Seed-VC 以反映失配,正常转换评估时按标准协议喂正常语音,并明确 Seed-VC 不是为耳语转正常训练的。英语评估在 wTIMIT 耳语测试集上进行,对比耳语专用系统与通用转换模型在零样本下直接处理耳语的局限。
指标分 4 类,方向需记清。自然度用 DNSMOS 系列、UTMOS、WVMOS 与 NISQA 估计感知质量,数值越大越好。内容用字符错率衡量,以 Whisper-large-V3-turbo 识别计算,数值越小越好。说话人相似度用 Resemblyzer 余弦与 WavLM 余弦,越大越好。语义一致性用 SpeechBERTScore,越大越好。
论文还报告训练与测试文件在演示页发布,wTIMIT 文件列表也在演示页可查。资源状态方面,演示页当前可用,两个第三方基线仓库当前可用,但它们是原作者仓库而非本论文代码,不能当作本方法可运行的证据。
公平性上要注意基线运行条件不同。耳语专用基线在英语上用官方预训练模型在自建测试集上重测,通用基线以零样本方式直接处理耳语,这能说明通用模型不适配耳语,但不能说明在同等耳语训练数据下谁更优。普通话部分缺少其他耳语专用基线,因此主结论应表述为优于耳语输入与零样本通用模型,而非优于所有耳语方法。
普通话主结果比耳语输入和通用模型好在哪里?
比较问题是,在同一普通话测试集上,WhisperVC 相对原始耳语输入与零样本通用模型,是否同时改善感知质量、可懂度与说话人相似度。公平条件是同一测试划分与同一指标计算,指标方向为质量与相似度越大越好、字符错率越小越好。下表整理主结果中的关键数字,更多质量子项见正文表格。
| 条件 | 指标 | 耳语输入 | 通用基线 Seed-VC | 本方法 WhisperVC |
|---|---|---|---|---|
| 普通话耳语转正常 | DNSMOS 总分 | 1.102 | 2.868 | 3.072 |
| 普通话耳语转正常 | 字符错率 | 22.937% | 46.423% | 16.932% |
| 普通话耳语转正常 | WavLM 说话人相似度 | 0.784 | 0.952 | 0.945 |
| 普通话耳语转正常 | 语义一致性 | 0.673 | 0.758 | 0.785 |
表后解释需要同时看到收益与代价。主要收益是可懂度与感知质量相对耳语输入大幅提升,DNSMOS 总分从 1.102 升到 3.072,字符错率从 22.937% 降到 16.932%,语义分升到 0.785,说明浊音重建有效且内容保留较好。相对 Seed-VC 零样本处理耳语,通用模型字符错率恶化到 46.423%,虽然其 WavLM 相似度 0.952 略高于 WhisperVC 的 0.945,但这是以内容严重损伤为代价的相似,不应单独解读为音色更好。未胜出项也要点明,WhisperVC 的说话人相似度并未全面超过 Seed-VC,且部分质量子项与真值仍有差距,真值 DNSMOS 总分 3.141 高于 3.072,说明自然度仍有提升空间。正常到正常转换上字符错率从 4.392% 降到 3.331%,支持统一框架保留了常规转换能力,但该表未报告此处的主观听感边界。
拿掉对齐、残差或声码器微调会发生什么?
比较问题是,3 个组件各自是否必要,以及残差形式是否比直接生成完整梅尔更稳定。公平条件是同一普通话测试集与同一对齐表示输入,只切换生成方式或是否保留对齐与声码器微调。下表聚焦消融行的关键数字。
| 条件 | 指标 | 仅粗生成器 | 加完整梅尔流匹配 | 加残差流匹配 | 去掉对齐后加残差 | 本方法加声码器微调 |
|---|---|---|---|---|---|---|
| 普通话耳语转正常 | DNSMOS 总分 | 2.716 | 2.548 | 2.652 | 1.830 | 3.072 |
| 普通话耳语转正常 | UTMOS | 2.797 | 2.170 | 2.795 | 1.729 | 2.831 |
| 普通话耳语转正常 | WavLM 相似度 | 0.943 | 0.930 | 0.944 | 0.898 | 0.945 |
表后解释要按证据归因。仅用确定性粗生成器已能把字符错率降到 18.729%,说明对齐表示本身恢复了正常结构,但感知质量受限。残差流匹配进一步把字符错率降到 18.266%,而完整梅尔流匹配为 19.576%,支持残差修正比直接建模完整轨迹更稳定的判断。去掉变分自编码器对齐后字符错率骤升到 40.155%,质量全面下降,证明跨域对齐是可靠生成的必要前提。声码器微调带来最后一段增益,DNSMOS 总分从 2.652 升到 3.072,字符错率从 18.266% 降到 16.932%,说明缩小预测与真实梅尔分布差改善了波形合成。限制是消融未报告多次运行方差与显著性,也未测量延迟与参数量,因此不能把质量增益直接等同于部署成本可接受。
英语泛化与门控的证据强在哪里,边界在哪里?
比较问题是,同一框架换到英语训练数据后是否仍改善可懂度,以及门控路由对正常转换内容保留是否有帮助。公平条件是英语部分在 wTIMIT 测试集上重测所有基线,正常转换部分在同一普通话库上按标准协议比较。下表整理论文直接报告的关键数字。
| 条件 | 指标 | 最强对比基线 | 本方法 WhisperVC | 差距含义 |
|---|---|---|---|---|
| 英语耳语转正常 | 字符错率 | 16.709% | 11.389% | 本方法最低 |
| 英语耳语转正常 | 通用 FreeVC 字符错率 | 26.534% | 11.389% | 通用模型失配 |
| 普通话正常转正常 | 字符错率去掉门控 | 4.333% | 3.331% | 门控有助于内容 |
表后解释需区分直接报告与有限解释。英语上 WhisperVC 字符错率 11.389% 为所有对比中最好,优于 Seed-VC 的 16.709% 与 FreeVC 的 26.534%,也明显低于耳语专用基线的 30% 以上,支持对齐加声学生成框架跨语言可迁移的判断,但前提是已在目标语言数据上重新训练,不是零样本跨语言。门控消融显示去掉门控后感知质量相近而字符错率从 3.331% 升到 4.333%,支持门控通过自适应路由稳定生成的解释。未评测边界包括未报告主观听感、未测量误判门控后的最坏行为、未报告英语感知质量全面对比与推理延迟,因此不能承诺实时性与每组都成立。表格中普通话正常转换自然度数值单位沿用原文写法,百分号为原文字符错率单位,不混入相似度列。
要复现应先准备什么,按什么顺序检查?
先准备数据与评估工具。普通话需 AISHELL6-Whisper 配对数据,英语需 wTIMIT 配对与 LibriTTS 干净子集正常语音,并按说话人不相交划分出未见说话人测试集。内容编码器用在普通话耳语与正常语料上微调过的 Whisper-large 第三版,说话人编码器用 VoxBlink2 预训练并在 VoxCeleb2 微调的 SimAM 残差网络,输出 256 维嵌入。声学特征注意双采样率,编码器侧 16 kHz,梅尔与声码器侧 22.05 kHz,长度对齐用线性插值加卷积投影。评估需 DNSMOS、UTMOS、WVMOS、NISQA、Whisper-large-V3-turbo 算字符错率、Resemblyzer 与 WavLM 算说话人余弦、SpeechBERTScore 算语义分。
再按组件顺序检查。第一步训练双编码器共享解码器的 Conformer 变分自编码器,监督为散度约束加正常支路均方误差加耳语支路软动态时间规整,同时训练门控分类器,内容编码器保持冻结。第二步只用正常语音训练粗生成器与残差流匹配,粗部用绝对误差,残差部用速度匹配。第三步在预测梅尔上微调 HiFi-GAN。检查点包括门控是否把正常输入直通、残差是否优于完整梅尔、去掉对齐是否复现大幅退化。
论文演示页当前可用并发布训练与测试文件列表,可用于核对划分,第三方基线仓库当前可用但只代表基线可运行,不代表本方法代码已公开。原文缺失权重、学习率、步数与硬件预算,复现时应先补这些超参数记录再谈效率。
何时值得尝试,还需补哪项验证?
当任务是耳语到正常且只有少量配对数据,同时又有较多正常语音可用时,这套解耦思路值得尝试。它把最难的跨域搬运压缩到一个小对齐模块,让数据 hungry 的生成器继续吃正常语音,因而在普通话与英语上都把字符错率降到对比中最低。当系统还需同时支持正常到正常转换时,门控双路径让同一生成器兼顾两种输入,普通话正常转换字符错率从 4.392% 降到 3.331% 就是证据。
还需补的验证很具体。一是补超参数与训练成本,包括三项损失权重、优化器设置、参数量与推理耗时,否则无法判断实时耳语转正常的未来工作是否可行。二是补主观听感与误判分析,包括门控错分耳语与正常的比例及其对可懂度的影响。三是补跨说话人与跨噪声条件的鲁棒性,因为当前英语评估是目标语言重训而非零样本跨语言,普通话也未报告噪声下表现。理解这三项边界后,才能把论文报告的客观增益转化为可部署的收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

