英文题目:SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training
标签:#语音情感识别 | #对抗训练 | #自监督学习 | #说话人验证
评分:6.3/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
👥 作者与机构
- Eunseo Choi:机构信息未在 arXiv HTML 中可靠披露
- Hyunku Kang:机构信息未在 arXiv HTML 中可靠披露
- Chanwoo Kim:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
针对未见说话人上情感识别易受说话人差异干扰的问题,论文用 wav2vec 2.0 做编码器、ECAPA-TDNN 做说话人判别器并以熵最大化做对抗,在 IEMOCAP 测试集报告 60.63% UA,代价是交替训练更复杂且存在原文内部数字不一致与未验证的跨库边界。
🔗 开源与复现资源
- 代码相关资源:https://github.com/slp-lab-research/siser.git → https://github.com/slp-lab-research/siser — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:为什么换个说话人情感识别就变差?
这篇论文研究语音情感识别。输入是一段原始语音波形,输出是这段话属于愤怒、高兴、中性、悲伤中的哪一类。学习过程中必须保留的是情感可分性,试图改变的是表示中混入的说话人可分性。同一情感由不同人说出时,音色、语速和基频实现可以差很多,模型若记住训练说话人的捷径,遇到新说话人就会失准。
白话先说第一个术语。自监督表示(self-supervised representation)指不靠情感标签、只靠大量无标注语音的掩码预测等任务学到的通用语音特征。论文用它缓解标注少的问题,因为情感标注耗时且昂贵。但原文明确指出,只微调这类编码器做情感分类,并不能保证说话人信息被减弱,所以还需要对抗分支施加额外压力。
自监督表示 × 说话人不变表示: 自监督表示指 wav2vec 2.0 从大量无标注语音学到的通用帧级特征,负责在标注少时提供可迁移的起点;说话人不变表示指从中减少能猜出是谁说的成分后仍保留情感可分性的 utterance 表示,负责在未见说话人上保持稳定。二者搭配的原因是前者只解决数据少,后者才针对说话人域偏移,组合后编码器既有起点又有明确要减弱的干扰方向。
可以做一个教学示例帮助定位。假设训练集里某位女声说高兴时语速快,某位男声说悲伤时基频低,模型可能学会用语速和基频猜情感。测试换成新说话人后,这种对应关系不再成立。这只是帮助理解域偏移的示例,不是论文的实验产品。论文的实际验证只在 IEMOCAP 的说话人无关划分上进行,所有结论都要回到该划分来核对。
已有路线走到哪里:预训练与对抗各补了哪块短板?
第一条路线是用自监督预训练做情感识别。白话说,这条路线负责给模型一个更好的起点。原文回顾 wav2vec 2.0 处理原始波形、学习掩码段的对比预测,并引用已有工作说明其特征优于手工声学特征、微调能取得较强情感性能、不同层编码互补信息。论文继承这条路线,把 wav2vec 2.0 作为特征编码器。
第二条路线是域对抗训练(domain adversarial training)。白话说,这条路线负责减弱干扰因素。原始框架来自 Ganin 等人的域不变表示学习,后被用于语音识别、说话人自适应和情感识别中的说话人抑制。常用做法是梯度反转(gradient reversal),让编码器在说话人分类上变差。
梯度反转 × 熵最大化: 梯度反转指让编码器在说话人分类上表现变差但不规定差成什么样,负责提供较弱的去说话人压力;熵最大化指明确要求说话人后验接近均匀分布,负责规定失败的目标形状。二者搭配比较的意义在于论文要说明只变差不够,均匀才更符合彻底混淆的意图,组合对比后选择熵最大化作为 SISER 的目标。
论文的位置很明确。它不只换编码器,也不只换目标,而是同时强调判别器容量。原文指出已有框架多用浅层分类器做说话人判别器,没有认真考察判别器能力对解耦质量的影响。ECAPA-TDNN 本来是说话人验证中的强模型,带多尺度时序聚合与通道注意力,论文把它放进基于熵的情感对抗框架做判别器。这就是与 Li 等人熵最大化工作的直接差别。
论文把任务形式化成什么:保留情感、减弱说话人如何衡量?
论文把目标写成学一个固定维度的 utterance 嵌入。输入是语音 Xi,附带情感标签 ei 和说话人标签 ki。输出是情感类别分布,同时要求说话人后验接近均匀。衡量分两面。情感面用交叉熵保证有用,说话人面用熵鼓励难分。
关键假设是说话人与情感在声学层面深度纠缠。只做情感微调时,编码器输出仍可能保留说话人可分维度。浅层判别器查不出这些维度,对抗压力就不足。论文因此提出用更强的判别器施加更丰富的梯度信号,意图是减少说话人可分信息,而不是已经证明彻底消除或无法推断。
另一个要固定的概念是说话人无关评估。论文报告的是留出未见说话人上的性能。这意味着在训练说话人上有效但在新说话人上失效的表示,会在该协议下暴露。具体的折数与每折人数写法在原文中存在不一致,留到实验设置节专门说明,此处不提前拼凑解释。
全景:一段语音走过哪三个模块、哪两步更新?
先看整体数据流。底部是原始波形,进入黄色的编码器 ENC,也就是 wav2vec 2.0,输出帧级上下文表示序列,直接作为 utterance 表示 v。v 同时送往两个头。右边粉色是情感分类器 EC,由堆叠全连接层映射到情感类别。左边绿色是说话人分类器 SC,由 ECAPA-TDNN 加线性输出层映射到每折训练说话人数。
wav2vec 2.0 × ECAPA-TDNN: wav2vec 2.0 是处理原始波形的特征编码器,负责输出帧级上下文表示并交给下游;ECAPA-TDNN 是带多尺度时序聚合与通道注意的说话人判别器,负责从该表示中尽可能找出残留的说话人线索。搭配的原因是弱判别器可能漏掉深层残留,强判别器才能给出更严格的对抗梯度,组合后编码器被施加更强的减少说话人信息的压力。
现在看为什么要在此时看结构图。红蓝两色箭头不是装饰,而是两种冻结模式。红色是第一步,只更新 SC;蓝色是第二步,只更新 ENC 与 EC。理解这一点才能读懂后面的 4 个公式,否则会把两个损失当成同时优化同一组参数。
看图路径: 1. 从底部原始波形沿黑色箭头进入 CNN 与 Transformers,确认主干是 wav2vec 2.0 编码器;2. 沿红色箭头看第一步:编码器输出进入 ECAPA-TDNN 与线性层再到说话人交叉熵,此时编码器与情感头冻结;3. 沿蓝色箭头看第二步:同一编码器输出同时进入情感三层全连接与说话人熵分支,此时说话人判别器冻结;4. 对照右侧图例颜色块与冻结标注,确认交替时谁更新谁不动

论文图 1。原论文 Figure 1::“Overview of the proposed framework. Red and blue arrows denote the two alternating training steps: red for Step 1 (SC update with ENC and EC frozen) and blue for Step 2 (ENC and…”。
这张图改变判断的地方在于冻结关系可视化。底部波形上方是 CNN 加 Transformers 的主干,其中上两层红色火焰表示微调时解冻的最后两个 Transformer 层,其余青色雪花表示冻结。红色路径从编码器到 ECAPA-TDNN 再到线性层,最后到说话人交叉熵,图例明确写着此时编码器与情感头冻结。蓝色路径从同一编码器输出分叉,一路到情感 3 层全连接与情感交叉熵,另一路到说话人熵最大化,图例明确写着此时说话人判别器冻结。两步交替才构成完整的对抗循环,部署时只用编码器加情感头。
三个模块各自吃什么、吐出什么?
编码器 ENC 吃原始波形,吐出 768 维的帧级表示。原文把 wav2vec 2.0 base 作为编码器并在 IEMOCAP 上微调,只解冻最后两个 Transformer 层。输入维度调整在判别器侧完成,ECAPA-TDNN 的输入维设为 768 以对齐编码器输出。这样的部分解冻既保留预训练的通用性,又让顶层适配情感任务。
情感分类器 EC 吃编码器表示,吐出 4 类情感分布。它由 3 层全连接加 PReLU 构成,设计上故意保持简单。原文说有意用简单分类头,是为了把性能变化归因于表示层面的说话人不变学习,而不是靠更复杂的情感头取胜。
说话人分类器 SC 吃同一表示,吐出训练说话人上的分布。它由标准 ECAPA-TDNN 加线性输出层构成,输出维度等于每折训练说话人数。ECAPA 内部的挤压激励残差块、多尺度上下文与通道注意力,使它能捕捉浅层线性头可能漏掉的说话人模式。这正是论文主张更强对抗信号的落点,但强信号只意味着训练时压力更大,不等于已证明表示中说话人信息被彻底删除。
两步交替如何写成损失:谁冻结、梯度流向哪里?
跟着一个样本走一遍。第一步冻结 ENC 与 EC,只训练 SC。给定样本的真实说话人 ki,SC 要把该说话人的概率推高,损失是说话人交叉熵。此时梯度只更新 SC 参数,编码器不动,相当于先把判别器练准,让它能指出当前表示中残留的说话人线索。
\[L_{D\_Spk}=-\vskip-5.69054pt\sum\vskip-5.69054pt_{(X_{i},e_{i},k_{i})\in\mathcal{D}}\log P(k_{i}\mid\text{enc}(X_{i}))\]第二步冻结 SC,联合训练 ENC 与 EC。情感分支仍用交叉熵,要求给定表示能猜对真实情感 ei,梯度同时更新编码器与情感头,保证表示对情感有用。
\[L_{D\_Emo}=-\vskip-5.69054pt\sum\vskip-5.69054pt_{(X_{i},e_{i},k_{i})\in\mathcal{D}}\log P(e_{i}\mid\text{enc}(X_{i}))\]同一时刻编码器还收到来自说话人熵的反向压力。该损失是说话人后验分布的熵,目标是让分布越均匀越好。均匀意味着从表示中难以可靠推断说话人,这比只要求分类错误更严格,因为它试图堵住把所有样本坍缩到某一个错误说话人也能满足目标的漏洞。但这仍是优化意图,论文没有提供说话人分类准确率或熵值的独立测量来证明已达到不可推断。
\[\displaystyle L_{H_{\text{Spk}}}=-\vskip-5.69054pt\sum_{(X_{i},e_{i},k_{i})\in\mathcal{D}}\sum_{k_{j}\in\mathcal{K}}\vskip-5.69054ptP(k_{j}\mid\text{enc}(X_{i}))\log P(k_{j}\mid\text{enc}(X_{i}))\]两项按权重合成总目标。λ 在 0 到 1 之间,越大越重情感,越小越强压制说话人但可能损伤情感信息。论文取 0.5 并沿用前人设置。由于 SC 已冻结且是 ECAPA 结构,回传到编码器的梯度携带多尺度与通道注意信息,这是论文认为比浅层头更丰富的训练信号。
\[\mathcal{L}(\theta_{\text{ENC}},\theta_{\text{EC}})=\lambda\cdot L_{D\_Emo}-(1-\lambda)\cdot L_{H\_Spk}\]情感分类损失 × 说话人熵损失: 情感分类损失是对情感标签的交叉熵,负责把表示拉向情感可分;说话人熵损失是对说话人后验分布的熵参与加权的目标,负责把表示推向说话人难分。二者必须用权重 λ 搭配是因为只保留前者可能保留说话人捷径,只强调后者可能损伤情感信息,组合后才形成保留什么与减弱什么的显式权衡。
训练与部署要分开。训练需要说话人标签来练 SC 和算熵,部署时不再需要说话人标签,也不再更新 SC,只用编码器加情感头做前向预测。误把熵分支当成测试时需要的模块,是初学者常见的误解。
数据、划分与训练预算如何固定公平条件?
数据集是 IEMOCAP,包含 5 个会话的剧本与即兴双人对话,每会话 1 女 1 男共 10 个说话人。论文把兴奋与高兴合并,得到 4 类共 5,531 条,愤怒 1,103 条、高兴 1,636 条、中性 1,708 条、悲伤 1,084 条。这种合并是该领域常见做法,目的是让标签更均衡。
未加权准确率 × 加权准确率: 未加权准确率是对每类情感准确率再平均,负责反映小类是否被忽视;加权准确率是对全部样本直接平均,负责反映总体命中情况。在 IEMOCAP 4 类样本不均衡时二者搭配才能看清是整体变好还是只靠大类拉高,论文因此同时报告 UA 与 WA。
划分写法需要如实指出一处内部冲突。原文一处称遵循 10 折留 1 会话交叉验证,另一处称每次 8 个说话人训练、一个验证、一个测试。若按 5 个会话、每会话 2 人计算,留 1 会话应是 8 人训练、2 人验证测试,与八一一的文字不能直接对齐。原文没有给出能同时满足两种说法的划分细节,因此此处不自行补造一套自洽划分,复现时应以代码实际划分与论文报告的未见说话人评估为准。
训练配置需要逐项核对。优化器用 Adam,学习率 1×10−4,批量 64,训练 300 轮,λ 取 0.5。wav2vec 2.0 base 只解冻最后两层 Transformer。ECAPA 输入维调为 768,输出到每折训练说话人数。硬件为单张 NVIDIA A100。复现时应先对齐这些条件,再比较判别器与目标的改动,否则增益无法归因。
下表把样本构成与关键训练预算放在一起,方便复现时逐项勾选。它不是性能表,不回答谁更好的问题,只回答在什么条件下测得。表前已说明它只固定数据与预算条件,表后仍需回到性能表看净收益。
| 项目 | 数值 1 | 数值 2 | 数值 3 | 单位说明 |
|---|---|---|---|---|
| 愤怒 / 高兴样本 | 1,103 | 1,636 | 5,531 总量 | 条 |
| 中性 / 悲伤样本 | 1,708 | 1,084 | 4 类合计 | 条 |
| 学习率 / 批量 / 轮数 | 1×10−4 | 64 | 300 | 轮 |
| 权重 λ / 解冻 / 硬件 | 0.5 | 最后 2 层 | A100 单卡 | 配置 |
| 会话 / 总说话人 / 合并后类别 | 5 | 10 | 4 | 个 |
表后要强调两点。第一,样本不均衡是同时看 UA 与 WA 的原因,复现时应保留两类指标。第二,基线复现去掉速度扰动增强,原文明确说不用增强是为了分离编码器与判别器设计的贡献,也更贴近增强不一定可用的实际设置,因此公平比较基准是无增强基线,而不是带增强的原始数字。
十折稳定性报告存在什么内部不一致?
在看主结果前,先把稳定性数字的矛盾讲清楚,避免把不同聚合方式混为一谈。论文给出 SISER 均值 62.73% 正负 1.72,基线 54.20% 正负 3.55,vanilla 59.22% 正负 2.68。方差更小支持在不同说话人组合下更稳定的有限解释,但稳定不等于每折都赢。
此处必须报告一个无法从原文解决的不一致。原文逐折表中列出的 10 个 Ours 值按算术平均约为 59.56,与同一位置报告的均值 62.73 存在明显差距。原文没有证明这是聚合集合、验证测试口径或折汇总不同造成的,因此删去任何虚构的解释。阅读时保留论文报告值,同时明确存在内部不一致、无法从原文确定原因,不用该均值差值作为额外证据。
同样,原文称第二折最接近三系统 10 折均值并以此做消融代表折,但给定上述均值矛盾,该代表性说法也应谨慎对待。后文消融只把第二折当作控制折内说话人组成后的相对比较,不把它直接当成整体性能。跨折结论仍需回到主结果表的测试集聚合为准。
主结果:在相同无增强条件下谁涨了、谁没涨?
这张表要回答的核心问题是,在都不用数据增强、都在未见说话人上测试时,换编码器、换判别器、换对抗目标各自带来多少净收益。统一条件是 IEMOCAP 说话人无关交叉验证,指标是验证集与测试集的 UA 与 WA,数值越高越好。基线是 CNN 加 GRU 配全连接说话人头与熵目标但无增强,vanilla 是 wav2vec 2.0 只加情感头而不做解耦,另有 GRL 与熵两种对抗变体。
表前需要强调公平性。带增强的原始基线测试 UA 为 59.91%,但那是用 4 种速度比把训练集扩到 5 倍的结果,不能与无增强方法直接比性能高低。论文的比较基准是无增强基线的 51.15% UA,只有在这个条件下才能分离结构贡献。
| 系统 | 验证 UA % | 验证 WA % | 测试 UA % | 测试 WA % |
|---|---|---|---|---|
| CNN+GRU 加增强基线 | 60.24 | 58.85 | 59.91 | 58.62 |
| CNN+GRU 无增强基线 | 54.51 | 54.20 | 51.15 | 50.14 |
| wav2vec 2.0 vanilla 无解耦 | 59.22 | 59.17 | 56.46 | 54.45 |
| wav2vec 2.0 加 ECAPA 加 GRL | 58.93 | 58.69 | 56.95 | 56.01 |
| wav2vec 2.0 加 ECAPA 加熵 SISER | 62.37 | 61.64 | 60.63 | 58.53 |
表后先看最公平的净收益。SISER 测试集 60.63% UA 与 58.53% WA,相对无增强基线提升 9.48 个百分点的 UA,相对 vanilla 提升约 4.17 个百分点。这说明预训练带来一部分提升,对抗与强判别器又带来另一部分提升。值得注意的是 SISER 无增强已接近带增强基线的 59.91% UA,论文据此认为说话人不变学习可以在一定程度上补偿增强带来的数据扩张,但这只是单数据集上的并列比较,不是因果替代证明。
再看一个未胜出项。同样用 ECAPA 但用 GRL 的系统测试 UA 为 56.95%,略高于 vanilla 的 56.46% 但明显低于熵版本的 60.63%,验证集上甚至低于 vanilla。这支持原文判断,即梯度反转不限定目标分布,解耦不够稳定彻底。这张表不能推出跨库泛化,也不能推出增强与 SISER 叠加一定更好,因为论文没有报告二者组合。
可视化证据只能作为辅助。论文用 t-SNE 展示第一会话两个说话人的 utterance 嵌入,颜色表示情感,形状区分说话人。基线嵌入重叠大,vanilla 有所改善但仍混合,SISER 的情感类别分离更清晰。原文据此称对抗训练带来更具情感判别性的表示。但该图只展示两个说话人且是降维可视化,不能证明说话人信息已被彻底删除,判断解耦仍需回到主表的交叉验证与独立的说话人可分性测量,而后者在原文中缺失。
消融:判别器变强与编码器变强谁贡献更大?
这张表要回答的是论文的中心主张,即说话人分类器结构是否至少与编码器选择同等重要。实验固定在第二折,因为原文称该折最接近三系统 10 折均值。比较维度是编码器取 CNN 加 GRU 还是 wav2vec 2.0,判别器取 3 层全连接还是 ECAPA-TDNN,指标是该折 UA。统一条件是控制折内说话人组成后看相对增益,跨折结论要回到稳定性讨论核对。
表前必须先说明数字矛盾的处理方式。原表两处作者报告的增益与同表端点相减不一致,此处优先保留原端点和作者报告值,不把矛盾的作者增益作为精确收益证据,复算验证请读者用同表端点相减自行核对。下表只收录原表端点与作者报告增益,不另立复算值单元格。
| 编码器 UA in % | FC | ECAPA-TDNN | 作者报告增益 |
|---|---|---|---|
| CNN+GRU | 55.09 | 61.64 | +7.13 |
| wav2vec 2.0 | 56.24 | 62.73 | +6.49 |
| 作者报告编码器增益 | +1.73 | +1.09 | 判别器增益更大 |
表后解释相对大小时只用端点与文字说明。原文文字称把判别器从全连接换成 ECAPA 在两种编码器下分别提升 7.13 与 6.49 个百分点,把编码器从 CNN 加 GRU 换成 wav2vec 2.0 在两种判别器下分别提升 1.73 与 1.09 个百分点,并据此认为判别器容量的影响至少不小于编码器升级。但由于其中两处作者报告值与同表端点相减不一致,此处不引用矛盾增益作为精确收益,结论只保留方向性判断,即判别器更换带来的差值大于编码器更换带来的差值。
反例与边界也要交代。第二折中 ECAPA 下的编码器差值只有作者报告的 1.09,说明强判别器部分补偿了初始表示差异,但不能反推编码器不重要,因为主结果中 vanilla 相对基线仍有明显提升。这张表也不能推出 ECAPA 在任何数据与任何折上都稳定增益,逐折波动提醒需要结合稳定性节的内部不一致谨慎解读。
训练开销与部署成本要分开表述。训练需要交替更新 ECAPA 判别器与编码器,计算与显存开销高于只微调情感头。部署时只用编码器加情感头,不再运行说话人分支。原文只报告单张 A100 与 300 轮等预算,没有给出推理延迟、帧率或参数量测量,因此不能从方法名称推定部署成本高低。
边界:哪些结论不能从当前证据推出?
第一个边界是数据增强的缺席。论文主动去掉速度扰动增强以分离结构贡献,因此 SISER 与带增强基线的接近只是并列数字,不能推出增强无用或二者叠加无效。要回答叠加问题,需要补做 SISER 加增强的对照,而原文没有这组实验。
第二个边界是评估范围。所有结果都在 IEMOCAP 内部的说话人无关划分上,没有跨语料、跨语言或噪声信道测试。10 折方差虽小,但仍是同一采集条件下的说话人组合变化,不能外推到完全不同的录音与人群。划分文字本身存在 10 折与八一一的冲突,更不能外推到其他划分。
第 3 个边界是机制测量的间接性。论文用情感准确率提升与 t-SNE 分离来支持解耦,但没有报告对抗前后说话人分类器准确率从多少降到多少,也没有报告熵值变化曲线。因此更彻底删除的说法,目前是结合消融端点差值的有限解释,不是直接的信息论证明。情感头故意保持简单,也意味着实际部署时仍有改进空间,但那部分增益尚未被测量。
复现先做什么:最小可运行链路与待核对变量?
建议按论文链路先跑通无增强基线。第一步复现 CNN 加 GRU 配全连接判别器与熵目标的 51.15% UA 附近结果,确认划分、合并标签与评估代码一致。第二步只把编码器换成 wav2vec 2.0 base 并解冻最后两层,不加对抗,核对能否达到 56.46% UA 附近。第三步再引入 ECAPA-TDNN 与熵目标,核对能否接近 60.63% UA。每一步只改一个变量,否则无法归因。
超参数先固定为 Adam、学习率 0.0001、批量 64、300 轮、λ 为 0.5。ECAPA 输入维设为 768,输出到每折训练说话人数。硬件参考为单张 A100,换硬件时应先固定随机种子与批量再比较,避免把吞吐差异误读成方法差异。
若结果偏离预期,优先核对 3 个变量。划分是否严格做到测试说话人未见,标签是否合并兴奋与高兴,验证与测试的 UA 聚合是否与论文同口径。尤其注意原文逐折均值与报告均值的不一致,以及划分文字冲突,复现时应记录实际代码划分并分别报告验证与测试聚合。论文称代码已公开,但开源代码不等于可下载权重或可运行系统,复现时应区分三者并以实际仓库状态为准。
收束:什么条件下值得尝试 SISER?
当任务同时满足 3 个条件时,SISER 的思路值得优先尝试。标注情感数据少,需要借助预训练表示;测试会遇到未见说话人,需要显式减弱说话人捷径;有说话人标签可用于训练对抗分支,但测试时不需要该标签。此时用强判别器加熵目标,比只微调情感头更符合论文证据。
需要纠正两个常见误解。其一,ECAPA 强不代表越大越好,它的价值在于训练时提供更严格的梯度,部署时并不增加情感推理分支。其二,熵最大化不是让模型乱猜情感,而是让说话人后验均匀,同时用情感交叉熵守住情感可分性,λ 正是二者的权衡杆。把减少说话人信息直接说成已证明无法推断身份,是超过证据的表述。
下一步最值得补的验证是直接测量说话人可分性下降幅度,以及在保持 SISER 不变的情况下补做增强组合与跨库测试。只有补上这两组对照,才能判断该方法是从数据扩张中独立出来的增益,还是特定语料与划分下的局部最优。在此之前,应保留论文报告的主结果数值,同时记住逐折均值与划分文字的内部矛盾尚未解决。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses