英文题目:Dual-Stream DNN-KAN Networks with Bangla-Specific Features for Speech Emotion Recognition
会议身份:
conference:interspeech:2026:conference-paper-id:hasan26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#注意力机制 #评测协议 #统计分析 #语音 #语音情感识别
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Kazi Reyazul Hasan:机构信息未能从会议 PDF 纯文本可靠映射
- Muhammad Abdullah Adnan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理孟加拉语语音情感识别,输入为单句孤立语音,输出为离散情绪标签,难点在于频谱与韵律线索交织且说话人无关泛化困难。方法链首先对候选声学特征做判别性统计筛选,输出多尺度韵律描述子与频谱描述子,分别送入专用分支建模。随后频谱分支经因式化深度神经网络建模纹理,韵律分支经共享基函数网络学习平滑非线性,再经早期与晚期双向交叉注意力交换互补信息。接着情绪自适应门控依预测情绪分布动态加权两流并经瓶颈融合分类输出标签。与直接处理原始波形的大型自监督模型相比,该设计以统计优选的语言适配特征替代大规模预训练,并为异质特征分配专用归纳偏置。在SUBESCO评测设置下,加入韵律KAN分支后模型的准确率为87.37%,高于仅MFCC的基线模型的准确率79.83%。其适用边界受限于表演式数据的优选特征尚未验证会话式场景的外推。该推理开销对应的延迟在中央处理器上为亚秒级,训练成本原文未披露。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么不能直接套用英语模型?
这篇论文的输入是单条孤立语音片段,每条片段只对应一个情绪标签,输出是该片段属于 7 类或 6 类情绪中哪一类的判断。研究目标限定在孟加拉语语音情感识别,重点解决在计算资源有限、语料规模不大的条件下,如何获得对未见说话人仍然有效的分类器。作者开场交代的信息包括:使用的数据是 SUBESCO 和 BanglaSER 等孟加拉语语料,模型总参数量控制在 1.1M,评测必须保留说话人无关条件下的准确率,输出是可复述的特征选择流程加双流网络结构。
初学者容易误以为把英语上训练好的大模型直接拿来用就能解决问题。论文明确指出,英语语料上训练的系统在孟加拉语说话人上表现不好,而简单放大通用模型对该地区多数课题组而言成本过高且难以部署。孟加拉语有送气辅音、卷舌音等音系特点,其韵律模式在情绪表达中的作用尚未被充分研究,这意味着只用梅尔频率倒谱系数这类标准谱特征会遗漏语言相关的韵律信息。
因此,任务不是把声音丢给模型就结束,而是要先回答哪些韵律量真正区分情绪,再为谱信息和韵律信息分别选择合适的处理器,并在融合时考虑不同情绪对两类信息的依赖不同。
已有路线做了什么,为什么评测方式会改变结论?
语音情感识别已有 3 条常见路线。第一条是卷积加循环结构,例如 1 维卷积处理时序再接长短期记忆网络,或者卷积与双向长短期记忆网络融合梅尔频率倒谱系数与梅尔谱,优点是能同时捕捉局部谱模式和长时依赖,缺点是特征仍是通用声学量。第二条是把语谱图当图像处理的视觉变换器,以及 wav2vec2 和 emotion2vec 这类自监督预训练模型,优点是表示能力强,缺点是参数量达到 25M 到 326M,且没有针对孟加拉语的归纳偏置。
第 3 条是孟加拉语本地工作,多为直接迁移通用结构,论文指出其中多数只报告说话人相关结果。说话人相关指同一说话人的样本同时出现在训练集和测试集,模型可以通过记住音色获得高分;说话人无关指测试说话人完全没有参与训练,测的是真正的情绪泛化。两者的数字不能直接比较,这是理解后续所有表格的前提。论文还梳理了科尔莫戈罗夫-阿诺德网络和融合方法。
科尔莫戈罗夫-阿诺德网络把可学习的激活函数放在边上,早期已用于多模态情绪和语音伪造检测,但在语音情感识别中仍较少见。以往融合多用静态拼接或加权平均,近期才出现用交叉注意力处理谱流与韵律流的工作。论文的定位是做语言适配设计,而不是简单换一个更大的骨干网络。
要解决的具体问题如何形式化,需要保留哪些信息?
形式化地说,每个训练样本是一条语音波形及其情绪标签,模型需要学习从波形到情绪后验概率的映射,推理时对未见说话人的新波形输出预测类别。必须保留的信息包括说话人标识、语料来源、划分方式和是否使用数据增强,因为这些决定了准确率数字是否可比。论文特别强调,数据增强如果在划分之前施加,会让测试语音的增强变体泄漏到训练中,从而虚增准确率。为避免这种争议,作者在主比较中完全不使用数据增强。
另一个必须保留的信息是特征构造条件。谱特征来自 40 个帧级低层描述子,包括 13 维梅尔频率倒谱系数及其 1 阶差分、2 阶差分和对数能量,再按整条语音取均值和标准差,得到 80 维。韵律特征来自统计筛选后的 15 个量,在 3 种时间窗尺度下计算并加上全局基频轮廓描述子,共 51 维。两者拼接成 131 维输入向量。初学者常把准确率当作唯一标准,论文提醒还要记录参数量、是否说话人无关、有无增强、基线是否在相同条件下重跑,否则跨论文比较不可靠。
举例来说,同样是 90% 以上的数字,一个是在说话人相关下得到,另一个是在说话人无关下得到,它们的难度完全不同。
双流结构如何让一个样本从波形走到情绪标签?
先沿一个样本走完全流程。原始波形进入特征抽取,得到 131 维向量,其中 80 维谱描述子与 51 维韵律描述子分别投影到 128 维,再进入各自的专用流。谱流经过因子化深度神经网络块,韵律流经过轻量科尔莫戈罗夫-阿诺德网络模块。2 流在早期 128 维和晚期 256 维各做 1 次双向交叉注意力交换,交换后的特征按 0.5 权重与原始特征相加保留。随后拼接成的 512 维向量经过瓶颈融合与情绪自适应门控,最后经多层映射输出 7 类情绪的预测。
这样的安排理由在原文中有明确解释:谱模式适合用深度神经网络处理,连续平滑且情绪结构化的韵律轮廓更适合用可学习样条建模;早期注意力负责低层定位,即让谱查询知道音高事件发生在频谱流的哪里,晚期注意力负责高层整合,即让韵律上下文修正谱类别边界;门控则处理唤醒度相关的声学侧重,高唤醒情绪更依赖韵律变化,细微情绪更需要谱细节。下图是论文给出的整体结构,阅读时先看主路径再看汇合点。
看图路径: 1. 从最左侧原始波形出发,沿箭头区分上路语谱变换与下路 131 维输入向量的去向;2. 对比紫色 KAN 分支与黄色 DNN 分支在第一层和第二层的标注,确认可学习与固定的差异;3. 找到中间早期交叉注意力的绿色块与加权系数,再找到右侧晚期交叉注意力的蓝色块;4. 观察最右侧情绪专用门控与 512 维融合特征如何汇聚到最终分类输出
论文图 1。原论文 Figure 1:“Proposed dual-stream hybrid architecture processing 131-dimensional input through specialized pathways: MFCCs flow through DNN blocks while prosodic features pass through KAN…”。
从像素可见,最左侧是蓝色波形与橙色分帧示意,向上引出彩色语谱变换,向下进入 131 维输入处理框。中间两列分别是紫色科尔莫戈罗夫-阿诺德网络分支与黄色深度神经网络分支,每列各有两层,层间有早期交叉注意力的绿色块与加号节点。右侧第二级处理后进入晚期交叉注意力的蓝色竖条与加号节点,最右侧是粉色底的情绪专用门控、特征加权方块与 512 维最终特征条。早期标注为 4 头、晚期标注为 8 头,加权系数均标注为 0.5。这一布局支持了方法全景的叙述:两条流独立加工后再交互,而不是一开始就拼接,避免了谱特征淹没低维但判别力强的韵律特征。
谱流、韵律流与融合各自做了什么计算?
谱流的计算是带残差的因子化前馈块。输入 128 维向量先经第一层线性映射到约 181 维,做批量归一化和线性整流激活,再经第二层映射到 256 维并做高斯误差线性单元激活,最后加上输入经线性投影的残差。中间维度取 128 与 256 乘积的平方根,约为 181。原文报告这种因子化比等宽的两层 128 到 256 再到 256 的多层感知机节省约 29% 的权重,从约 98.3K 降到约 69.5K。白话解释是,梅尔频率倒谱系数(一种把人耳敏感的频率刻度与倒谱压缩结合的音色表示)维度高且变化快,用两段窄而深的映射加残差可以在保留容量的同时减少参数。
梅尔频率倒谱系数 × 深度神经网络块: 梅尔频率倒谱系数负责把短时频谱包络压缩成紧凑的音色纹理表示,深度神经网络块负责对这类高维、局部相关的谱向量做非线性映射与降噪;二者搭配的原因是谱特征维度高且帧间变化快,需要参数效率高的前馈映射先提炼出类别相关的谱模式,再交给后续的跨流交互,而不是直接与缓慢变化的韵律特征混在一起处理。
韵律流的计算是共享基函数的轻量科尔莫戈罗夫-阿诺德网络。传统多层感知机把固定激活放在节点上,该网络把可学习的 2 次 B 样条基函数放在边上。实现上所有输入共享同一组基函数,但每个输出神经元保留自己的一组控制点系数,再加一条线性直通项。原文称这把样条参数从 51 乘 128 乘 3 的规模压缩到 128 乘 3,样条参数减少约 98%,首层总参数减少约 73%,同时保留了可学习非线性的核心优点,即音高变化对愤怒神经元和悲伤神经元的激活方式可以不同。
韵律特征 × 科尔莫戈罗夫-阿诺德网络: 韵律特征指基频均值与分位数、升降段比例、能量均值方差、谐噪比等随时间连续平滑变化的量,科尔莫戈罗夫-阿诺德网络把可学习的样条激活函数放在网络边上而不是固定在节点上;搭配理由是固定激活难以拟合音高轮廓这类渐变形状,而边上的可学习样条能为不同输出神经元保留不同的非线性,从而更省参数地刻画高唤醒与低唤醒情绪的轮廓差异。
融合部分包括双向交叉注意力和情绪自适应门控。早期注意力在 128 维做低层协调,晚期注意力在 256 维反转查询与键值的角色做高层整合,每次都以 0.5 权重保留原始特征。门控网络把拼接后的谱韵律向量映射到 14 维,经激活后重塑为 7 乘 2,用于 7 种情绪各自的双流权重。训练时门控按辅助分类头给出的情绪概率加权平均,整个门控端到端训练,没有使用教师强制、预热或梯度截断。原文报告愤怒的韵律平均权重约为 0.87,谱权重约为 0.31,而悲伤与恐惧更偏向谱流,这与高唤醒靠音高能量、低唤醒靠谱纹理的预期一致。
交叉注意力 × 情绪自适应门控: 交叉注意力负责让谱流查询韵律流或反向查询,以定位音高事件在频谱流中的位置并细化类别边界,情绪自适应门控负责根据预测的情绪概率动态加权两条流;二者组合的意义是先做细粒度的信息交换,再做粗粒度的流权重分配,使高唤醒情绪更依赖韵律、低唤醒情绪更依赖谱细节,这种分工在消融中分别带来可测量的增益。
三者的搭配逻辑是先分治再协作:谱流提炼音色纹理,韵律流刻画轮廓形状,交叉注意力解决定位与修正,门控解决情绪相关的侧重分配。
特征如何选出来,网络如何训练,哪些细节被冻结或省略?
特征选择先于网络训练,是该工作的关键步骤。作者用开源音频特征抽取工具抽取 80 个常用声学量,包括 13 维梅尔频率倒谱系数及其导数、基频统计、过零率、谱滚降和能量度量。每个特征按说话人取平均后,以情绪为分组做单因素方差分析,计算 eta 平方(组间平方和占总平方和的比例)与 p 值。筛选阈值为 eta 平方大于 0.94 且 p 小于 10 的负 15 次方。举例来说,谱通量标准差达到 0.976,音高分位数达到 0.956,表明区分力很强。
最终选出 15 个特征:基频均值、标准差、25 分位数、75 分位数、极差、上升段比例、下降段比例、谱通量标准差、均方根能量均值与标准差、谐噪比、浊音帧比例、过零率均值、谱滚降均值和第 1 维梅尔倒谱均值。每个特征在 10 毫秒、25 毫秒和 50 毫秒 3 种窗尺度下计算,得到 45 个数,再加 6 个全局基频轮廓描述子,共 51 维。为防止过拟合,特征分析只用 SUBESCO 训练数据的 10%。
eta 平方 × 方差分析: eta 平方负责度量组间平方和占总平方和的比例,反映一个声学特征能解释多少情绪类别差异,方差分析的 F 检验负责给出该差异在统计上是否显著的 p 值;二者搭配使用时,先用 eta 平方大于 0.94 筛选强判别特征,再用 p 小于 10 的负 15 次方排除偶然波动,共同决定哪 15 个候选特征进入多尺度韵律描述子。
网络训练使用 PyTorch,随机种子固定为 42,硬件为英伟达 P100。超参数经网格搜索确定:学习率 0.0005,权重衰减 0.015,丢弃率 0.3,批量大小 16,最大 200 轮,早停耐心 50 轮。作者刻意不使用数据增强,理由是许多已发表工作未说明增强在划分前还是划分后进行,存在泄漏风险,不用增强可以使比较更保守可复现。原文未报告梯度是否在门控的辅助分类头处截断,也未报告学习率衰减 schedule 与权重初始化细节,这些属于具体缺项,复现时需要按常规做法补齐并记录,不能从模型名称推定实现。参数更新方面,两条流、注意力与门控均为端到端联合训练,没有冻结预训练权重,因为本方法不依赖外部预训练模型。
数据、划分、指标与基线如何保证条件一致?
论文共使用 5 个语料。SUBESCO 有 20 名说话人、7 类情绪、7000 条孟加拉语表演语音;BanglaSER 有 34 名说话人、6 类情绪、1979 条表演加会话语音;另有英语 RAVDESS、德语 EmoDB 和意大利语 EMOVO 用于跨库检验。所有数据均为孤立语句,每条只有一个标签,类别轻微不平衡小于 8%,作者保留原分布以反映真实部署。
主要指标是说话人无关准确率,指标方向为越高越好。SUBESCO 采用 16 名训练、4 名测试的说话人划分,BanglaSER 采用 25 名训练、9 名测试的划分,并在 SUBESCO 上做说话人维度的五折交叉验证,得到 92.07% 正负 0.91%,成对 McNemar 检验显示与所有基线的差异在 0.01 水平显著。说话人相关结果仅为对照已有文献而报告,明确标注不可与说话人无关结果直接比较。
说话人无关评测 × 说话人相关评测: 说话人无关评测要求训练集和测试集的说话人集合不相交,测的是对未见说话人的泛化,说话人相关评测允许同一说话人同时出现在训练与测试中,容易奖励对音色的记忆;论文把前者作为主指标、后者仅作对照的原因是多数已有孟加拉语工作只报告后者,数字不可直接比较,必须分开才能判断提升来自情绪建模还是说话人记忆。
基线包括传统支持向量机、卷积、双向长短期记忆、卷积长短期记忆集成,以及作者在无增强条件下重跑的 emotion2vec 与 wav2vec2-xlsr。重跑时统一了无增强条件,因此提升不能归因于训练数据膨胀。3 秒语音在中央处理器上的端到端推理小于 1 秒,说明小模型适合端侧部署。资源状态方面,本次收到的证据中没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,复现需按论文文字自行实现特征流水线与网络结构。
主结果在相同条件下比过了谁,跨语言检验说明了什么?
主结果是在说话人无关、无增强条件下比较的。模型以 1.1M 参数在 SUBESCO 达到 92.12%,在 BanglaSER 达到 82.79%,在 SUBESCO 上超过 25M 参数的 emotion2vec 约 2.70 个百分点,超过 326M 参数的 wav2vec2-xlsr 约 1.07 个百分点,参数量仅为对方的二十三分之一到三 1%。下表把核心数字放在同一条件下对照,指标方向均为越高越好。
比较的问题是:在不使用增强、测试说话人未见过的前提下,小参数统计特征模型能否匹配大预训练模型。公平条件是双方均在相同划分下重跑且无增强。表后解释见下段。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 92.12% | 82.79% | — | — |
| 来源句二 | 14 | 4 | 2 | 2.70%;32;1.07% |
表后需要解释主要收益与具体代价。收益是统计选出的韵律特征加专用建模可以用极小成本达到大模型水平,且特征权重可直接检查,可解释性更好。代价与反例同样明确:SUBESCO 到 BanglaSER 下降约 9.33 个百分点,原因是后者混合表演与会话、说话人更多、韵律变异更大,控制条件下有效的基频轮廓特征在会话中更 noisy。
跨库方面,孟加拉语训练的韵律特征在西方语料上下降明显,仅用韵律时在 RAVDESS 降到 52.3% 左右,而仅用梅尔倒谱时下降小得多,这支持韵律特征调谐到了孟加拉训练数据的分布,而非通用声学模式。为验证方法是可迁移的,作者把同一选择流水线用在 EmoDB 训练数据上,准确率从 87.85% 回升到 93.92%,说明跨语言下降更多是域偏移而非结构缺陷。下图展示了支撑特征选择的韵律模式,阅读时注意分布、动态与聚类三者的分工。
看图路径: 1. 在面板 a 中对比七种情绪下均值、分位数基频柱的高度与误差线长度;2. 在面板 b 中对比每种情绪上升段与下降段两根柱子的相对高低;3. 在面板 c 中观察横轴平均能量与纵轴能量标准差构成的散点聚类位置;4. 确认高唤醒情绪点与中性点在能量平面上的分离方向
论文图 2。原论文 Figure 2:“Prosodic patterns in Bangla emotional speech.”。
从像素可见,面板 a 为 7 种情绪下 3 组柱形,蓝色均值、橙色 25 分位数、绿色 75 分位数,高兴与惊讶的柱更高且误差线更长,中性最低;面板 b 为每种情绪上升与下降两根柱,下降普遍高于上升, disgust 与 surprise 的上升柱相对更高;面板 c 横轴为平均能量、纵轴为能量标准差,愤怒与惊讶聚在右上方,中性孤立在左下方,高兴悲伤等聚在中部。这与正文描述一致:高兴惊讶音高方差大,升降比具情绪特异性,高唤醒情绪靠均值方差关系与中性分离。需要注意纵轴是原始统计量而非改善量,不能把柱高低直接读作模型性能好坏,它只是特征可分性的证据。
每个组件贡献了多少,拿掉统计选择会怎样?
为说明各组件的增益来源与代价,以下先汇总消融实验与跨数据集验证的关键量化结果,再结合来源证据逐项解释。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 93.92% | — | — | — |
| 来源句二 | 1.64% | 0.81% | — | — |
| 来源句三 | 2 | 96.63 | 91.70 | 84.18;82.43;97.12;+12.29% |
| 来源句四 | +3.31% | 4 | — | — |
| 来源句五 | 92.75 | 85.32 | 73.29 | 62.16;91.23;4;+1.22% |
表后解释主要收益与代价。最大单项来自统计特征选择:去掉它而喂入全部 80 个候选会损失 3.58 个百分点;把科尔莫戈罗夫-阿诺德网络换回普通深度网络处理韵律会损失 1.27 个百分点,说明该组件有独立但温和的贡献。交叉注意力与门控分别贡献 1.64 与 0.81 个百分点,全模型相对基线共提升 12.29 个百分点。未胜出项也应说明:科尔莫戈罗夫-阿诺德网络的独立增益较小,原文承认需要与其它非线性做更严格的对照才能充分证明结构选择的必要性。
此外,仅用韵律在西方语料上大幅落后,仅用梅尔倒谱反而更稳,表明当前选出的子集、阈值与多尺度编码是针对孟加拉数据优化的,直接搬运到其它语言并非最优。
哪些结论有直接证据,哪些只是有限解释?
论文直接报告的是:在给定划分与无增强条件下,小模型在两个孟加拉语料上的说话人无关准确率,以及消融中的增量数字,这些有表格与显著性检验支持。有限解释的是语言特异性表述。作者澄清,所选的基频、谐噪比、能量等量本身跨语言普遍有用,所谓针对孟加拉语优化指的是具体子集、eta 平方大于 0.94 的阈值与多尺度编码是在孟加拉数据上确定的,换到其它语言的最优配置不同,EmoDB 重跑实验支持了这一区分。
未验证的推测包括跨库下降的域偏移解释,作者承认缺乏形式化的分布分析,留作未来工作。另一个局限是特征判别分析仅在 SUBESCO 上进行,到 BanglaSER 的差距提示语料自适应选择会更好。还有,门控权重虽然符合唤醒度预期,但相关性不等于因果,不能据此断言模型真正理解了情绪机制。训练资源、推理开销与延迟是分开讨论的:训练用 P100,推理在中央处理器上小于 1 秒,但总体趋势不等于每条语音都如此,实际部署仍需按设备实测。
要复现这篇工作,第一步先做什么?
复现应按学习依赖排序。第一步复现数据划分:按说话人切分 SUBESCO 为 16 训练 4 测试、BanglaSER 为 25 训练 9 测试,确保测试说话人未出现在训练中,并记录类别分布不做平衡处理。第二步复现特征:用相同工具抽取 80 个候选量,按说话人平均后计算 eta 平方与方差分析 p 值,只保留通过阈值的 15 个量,再在 10 毫秒、25 毫秒和 50 毫秒三尺度下计算并拼接 6 个全局基频描述子,得到 51 维韵律向量;谱侧按 40 个低层描述子取均值标准差得到 80 维。特征分析只用训练数据的 10%,避免泄漏。
第三步复现网络:谱流用因子化前馈加残差,韵律流用共享 2 次 B 样条基的轻量科尔莫戈罗夫-阿诺德网络,2 次交叉注意力分别用 4 头与 8 头并以 0.5 保留原始特征,门控输出 7 乘 2 权重并用辅助头概率加权。训练时固定种子 42,学习率 0.0005,权重衰减 0.015,丢弃率 0.3,批量 16,早停 50 轮,全程不用增强。第四步复现评测:主指标用说话人无关准确率,辅以五折说话人交叉验证与 McNemar 检验,说话人相关结果单独存放不混比。
由于本次没有可验证的公开代码与权重链接,应将本研究视为需自行实现,不默认存在可下载的系统。
何时值得尝试这条路线,还需补哪项验证?
当目标语言资源少、计算预算小、需要可解释特征时,这条先统计筛选再分流建模的路线值得尝试。它的可迁移部分是方法而非具体特征:在新语言上重跑同样的 eta 平方筛选与多尺度编码,而不是直接套用孟加拉语选出的 15 个量。当已有大预训练模型且算力充足时,大模型仍可能是更省事的选择,论文的结论仅是在已知目标语言与有限算力下统计特征可以替代大规模预训练。
还需补充的验证包括:在更多会话语音上做语料自适应选择,与其它非线性对照科尔莫戈罗夫-阿诺德网络的必要性,以及对跨库域偏移的形式化度量。常见误解是把说话人相关的高分当作可部署性能,正确做法是始终以说话人无关为第一指标,把说话人相关仅作文献对照。对初学者而言,复述方法时应能说清 131 维的构成、两条流的分工、2 次注意力的方向差异与门控的加权来源,并能指出原文未报告的学习率 schedule 与初始化等缺项,而不是只背诵 92.12% 与 82.79% 两个数字。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

