标签:#语音交互 | #统计分析 | #语音 | #韵律
评分:4.9/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.3/1.5
👥 作者与机构
- Cy Gorman:机构信息未在 arXiv HTML 中可靠披露
- Yihang Yao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是从四人会议头戴麦克风语音建模关系层面情感组织,输入为重采样至16kHz的60秒无重叠窗口多通道语音与发声活动掩膜,输出为交互场是否构成方向性表达耦合的判断,难点在于短时序列易致自回归滞后选择尺寸膨胀且个体能量同步会混淆关系动态。方法分三步:先用WavLM-Base+连续隐状态保留韵律副语言信息并构造跨层激活离散度表达性指标与能量等对齐代理,输出逐帧表达序列进入下一步。接着按重叠共现与独占发声划分交互机制并在机制连续片段内对表达性做能量残差化以剥离响度混淆,输出净化后片段进入检验。最后在片段上做多说话人条件向量自回归Granger因果检验并用循环移位零假设校准超额拒绝与方向性支持得分,得到机制与尺度条件化的耦合证据。与趋同式具身同步研究将耦合操作化为特征相似不同,本文以场涌现与方向性为对象并以独占语音下机制崩塌作为关系性证据,具有交互结构可证伪性意义。在AMI会议语料60秒窗口评测下,Window-BH校正下微观重叠Tier A的方向性支持得分DSS=+1窗口占比为23.9%,高于Global-FDR校正条件的21.7%。结论适用边界仅限正式四人AMI会议内亚秒级声音互动,宏观尺度效应暂稳且跨语料外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:为什么个人情绪标签不够用?
这篇论文的输入是多人会议的近距离麦克风语音,目标不是给每个人打一个高兴或悲伤的标签。初学者容易以为情感计算就是声音分类,作者要纠正的正是这个默认动作。传统管线的做法是把声学、文本、生理信号映射到离散情绪类别或者唤醒度和效价值两个连续维度上,这种做法在单人表达判断上是有效的。但在多人对话里,情感是在你来我往中被组织起来的,事后给每个人单独打分会丢掉互动本身的结构。论文引用了相关讨论,指出领域缺少情感行为如何在关系中随时间展开的模型。也就是说,任务从判断人变成了刻画关系。
情感共振 × 活力情动: 情感共振分工是给出关系本体:情感不是先有个体内在状态再传给别人,而是在互动场的相互牵动中涌现;活力情动分工是给出可观测的质料:声音的起伏、增强、消退、爆发等时间强度形态。两者搭配的理由是前者若无后者会落为空洞哲学,后者若无前者会被误读为个人韵律特征。组合后新增的作用是把场级假设变成声音时间轮廓上可检验的耦合预测。
对研究生来说,关键动作是换单元。以前的单元是说话人加时间窗,输出是标签。现在的单元是互动场,也就是在一段时间内由多人发声配置共同维持的关系结构。论文把场落实到声音动力学上,因为声音是连续的、可测量的,并且在语义被理解之前就已经携带了紧张和动势的变化。这不是说文本和表情不重要,而是说先把声音这个可处理的通道做扎实。
学习时要记住,场不是把多个人的标签平均一下,而是看配置变了,耦合是否跟着变。如果重叠说话时耦合强,拆成各说各话时耦合消失,那就支持场在起作用。
相关路线在测什么:趋同、对话情绪识别与单特征因果有何不同?
要理解这篇工作的站位,需要把 3 条相近路线分开。第一条是声音夹带研究,它测量的是两个说话人声音特征随时间越来越像,比如基频或能量轨迹的相似度上升,也包括由简短回应词触发的趋同。这类工作通常把耦合操作化为特征值相似,回答的是像不像。第二条是对话情绪识别,它把多人场景扩展了,但做法多是把每个人的状态推断汇总起来,回答的是每个人是什么情绪,没有建模说话人之间的关系动态。第 3 条是少量的语音格兰杰因果尝试,多是双人单特征,没有结合多说话人条件模型和互动条件分解。
论文的差异在于 3 个动作同时做。第一是方向性,不只问是否相似,还问谁的过去能预测谁的现在。第二是条件性,用四说话人条件向量自回归控制另外 2 人的共同影响,减少由集体大笑、房间事件或话题突变带来的虚假双人耦合。第三是分条件比较,把同一语料切成重叠、混合非重叠和按方向拆分的独占,用语料内部的对照来检验结构的作用。教学上可以这样记:趋同路线看距离缩小,本文路线看预测增益是否依赖共在配置。
例子是两个人同时说话时互相牵引,与一个人说完另一个人再说,这两种配置在趋同指标上可能都显示相似,但在方向耦合和零校准下表现会分开。论文明确说,据作者所知,此前没有把条件多说话人模型和互动条件分解结合起来的工作。
要回答的问题是什么:耦合是否由互动结构决定?
论文把理论预测写成可证伪的形式。如果情感组织的主要场所在互动场,那么方向性表达耦合应该在相互朝向的说话人构成场时出现,在抽掉该条件时减弱。具体化为 3 层。层级甲是同时共在,对应重叠语音。层级乙是把非重叠的单人发声混合起来,可能包含轮流接话。
层级丙是把非重叠按谁在说话拆成 2 个方向,作为语料内部的经验控制。预期是甲最强,乙较弱,丙趋近于零假设。
这里的方向不是声源定位,而是统计预测方向。时间尺度也被明确切分,小于等于 1 秒称为微观,大于 1 秒称为宏观。论文假设与活力轮廓相关的前语义共振发生在亚秒级,与神经证据中情绪韵律约 200 毫秒先于语义加工的时序一致。因此主检验放在微观滞后。如果宏观也一样强,反而不好解释为活力动力学。
失败条件也预先想好:如果耦合只是能量同步,那么在对能量做残差化后效应应消失;如果只是短序列滞后选择带来的显著性膨胀,那么在循环移位零假设下观测与零假设应一样高,校准差应为零。这种把理论、条件、尺度和反证一起写清楚的做法,是复述时必须保留的骨架。
方法全景:一个样本如何走完输入到判断?
先沿一个 60 秒窗口走一遍。输入是 4 人会议的 4 路近距离语音,重采样到 16 kHz。按说话人做语音活动检测,再映射到语音表征模型的特征帧网格上,帧跳长约 20 毫秒。接着用预训练的语音自监督模型提取连续隐状态,不做量化或聚类,保留稠密的声学、韵律和副语言信息。然后从跨层动态算出表达性标量,以及对齐的能量代理、高层语义幅度和帧间话题漂移等多维代理。所有序列共享同一帧轴、同一分窗和同一条件分解。
关键一步是按双人语音活动掩码切出条件。重叠段进入层级甲,非重叠单人段混合进入层级乙,再按发声方向拆开进入层级丙。对每个条件内的最长连续片段,先在片段内把表达性对能量做残差化,目标是去掉只由响度同步带来的部分,留下时间动态的丰富度。随后在片段上跑双变量和四说话人条件的向量自回归格兰杰检验,做滞后选择,再与匹配的循环移位零假设比较,报告零分位数校准后的超额拒绝率。窗口级的方向性用方向支持分数汇总,取值为负一、零或正一,并做错误发现率控制。
下图把 3 类条件的切法和预期画了出来,是理解后文表格的前提。图中用 2 位说话人示意,同时发声、交替发声和按方向拆分的独占在时间轴上长什么样,右侧给出预期耦合从高到低的变化。实际实验都是 4 人同时参与,不要把示意的 2 人当成数据规模。
看图路径: 1. 先看最左列三行的条件定义:重叠、混合非重叠、按发声方向拆分的独占;2. 再看中间时间轴上绿色与蓝色发声块是同时出现还是交替出现;3. 最后看最右列预期耦合可见度从高到低的图标变化;4. 注意底部注释:示意用两人,实际实验用四人同时说话
论文图 1。原论文 Figure 1::“Interaction conditions and expected coupling visibility.”。
看完图要抓住搭配逻辑:重叠对应高可见度、混合非重叠对应较低可见度、按方向拆分的独占对应最小可见度并作为对照,中间时间轴上绿色与蓝色发声块的同时或交替正好对应左侧的条件定义。
互动场 × 方向性耦合: 互动场分工是确定分析单元:由多人同时发声配置共同构成的关系结构;方向性耦合分工是给出操作化检验:一个说话人的过去是否线性帮助预测另一个说话人的现在。搭配理由是只有把场切成重叠、混合非重叠、按方向拆分的独占 3 类条件,才能看耦合是否随共同在场而起落。组合意义是把哲学上的场变成可比较的格兰杰拒绝率差异。
记住这个顺序:输入波形到连续表征,到表达性残差序列,到分条件片段,到方向检验,到零校准,再到窗口汇总。任何复述若跳过残差化和零校准,就会误把能量同步和显著性膨胀当成关系发现。
表示与组件:连续表征和表达性统计量在算什么?
表示部分用的是 WavLM 基础增强版的 12 层变换器隐状态。论文特别说明,接口还会返回一个初始嵌入状态,记法上只把隐状态的第一到第十二项当作变换器层。重点动作是不量化。离散语音单元为了语音素不变性,会压掉韵律相关性,而活力要的恰恰是连续的时强形态。因此保留浮点隐状态,让音色、共振峰、谐波比、抖动闪烁等声音质料与语调、重音、节奏、音高轮廓的组织方式纠缠在一起,作为追踪活力动态的基底。
活力轮廓 × 连续隐状态表征: 活力轮廓分工是定义目标信号:前语义的紧张、波动和动势的连续变化;连续隐状态表征分工是保留这种变化的载体,不做聚类量化。搭配理由是离散语音单元倾向于语音素不变性,会压掉韵律相关性。组合意义是让跨层激活离散度这类表达性统计量能追踪细粒度时间形态,而不是还原为能量大小或情绪类别。
表达性是跨层激活离散度统计量,直觉是声音表达在时刻间的丰富度和复杂度,不只是整体响度大不大。能量代理是标量对照,高层语义幅度和话题漂移用来检查耦合是否只是话题或语义同步。为了检验表达性是否只是能量的影子,论文在每个条件连续片段内先对能量回归取残差,再做方向检验和零校准。这个顺序很重要:残差化在片段内做,保持了条件特异性;若在全窗统一回归,会把不同互动配置混在一起。
论文还说明,格兰杰检验只评估线性预测依赖,不声称情感互动本身是线性的,非线性的转移熵是未来方向。双变量检验看两两方向,四说话人条件检验在检验 1 对时把另 2 人作为条件变量,以减少群体层面混杂。
有没有训练:本研究训练了什么、冻结了什么?
本研究没有训练新的神经网络,也没有微调 WavLM。WavLM 是外部预训练好的自监督语音模型,在这里只做前向推理抽特征,参数冻结。没有分类器训练,没有用离散情绪标签做监督,没有最小化分类误差的优化器步骤,也没有梯度回传到语音模型。论文未报告任何学习率、轮数或冻结之外的更新规则,复述时必须明确说缺这些项,不能从模型名字推定实现。
格兰杰因果 × 循环移位零假设: 格兰杰因果分工是在向量自回归框架内检验线性预测依赖,给出观测拒绝率;循环移位零假设分工是给出同数据、同短序列、同滞后选择下的基线拒绝率,暴露小样本的尺寸膨胀。搭配理由是短的 regime 连续片段做滞后选择时名义显著阈值不可信。组合意义是得到零分位数校准后的超额拒绝率,用观测减零假设的百分点差来判断耦合是否真实超出偶然。
真实的计算过程是统计检验而非网络训练。对每个 60 秒窗内的条件连续片段,拟合向量自回归模型并做滞后选择,得到观测拒绝行为;再构造匹配的循环移位零假设,得到基线拒绝行为;两者相减得到校准超额拒绝率,单位为百分点。窗口级再经错误发现率控制得到方向支持分数。
论文比较了窗内校正和更保守的全局错误发现率控制,并说明分数依赖于错误发现率和最小连续比例等参数,保守校正只提供部分稳健性。没有报告训练资源消耗,因为没有训练;推理开销、输出帧率和实际延迟也未测量,不能声称改善。初学者常把无训练误解为确定性求解,这里要纠正:冻结参数只说明表征固定,检验仍有随机性、滞后选择和多重比较,结果是统计判断而非解析解。
实验条件:数据、划分、指标与聚合口径是什么?
数据只用 AMI 会议语料,是正式的 4 人会议互动,全部结果都是仅 AMI,跨语料泛化留给未来工作。音频用近距离头戴通道,重采样 16 kHz,按 60 秒不重叠窗口处理。语音活动检测按说话人做,并映射到特征帧网格,窗口长度到帧数的映射保证精确同步,还对短暂的说话人内部间隙做了轻微时间平滑以桥接断裂。双人掩码定义 3 类条件,重叠为甲,混合非重叠为乙,按发声方向拆分的非重叠为丙。条件连续片段指在窗内使选定双人掩码持续为真的最大不间断帧序列。
指标有两层。片段级是零校准超额拒绝率,即观测拒绝率减循环移位零假设拒绝率,单位为百分点,负值表示比零假设更少拒绝。窗口级是方向支持分数,每个窗口每个方向检验经错误发现率控制后取负一、零或正一,聚合为某条件下取各值的窗口 100 分比。滞后按小于等于 1 秒为微观、大于 1 秒为宏观,确切滞后网格和门控是实现细节,论文说完整实现留给后续工作。样本量用评估窗口数表示,微观甲有 502 窗,宏观甲 282 窗,微观乙 71 窗,宏观乙仅 18 窗,微观丙 62 窗,宏观丙 87 窗。
宏观乙的 18 窗直接决定了该格的统计效力不足,解读时必须降权。资源状态方面,未发现来源绑定且完成安全验证的资源,不得声称代码模型数据已公开。
主结果:耦合在哪里出现、在哪里消失?
先看窗口级方向支持的分布,它回答在相互朝向时方向性是否稀疏但有结构。下表按微观与宏观、甲乙丙三档,给出窗内校正和全局保守校正下取负一、零、正一的窗口 100 分比。比较问题是:在公平的同语料分条件下,哪个条件的非零支持最多,哪个趋向于零。指标方向是:非零质量越高表示方向性越可见,零比例越高表示越弱或缺失。所有数字共享同一 AMI 4 人会议、同一 60 秒窗和同一错误发现率流程,只是条件和尺度不同。
| Scale | Tier | nn | WB−1-1 | WB0 | WB+1+1 | GF−1-1 | GF0 | GF+1+1 |
|---|---|---|---|---|---|---|---|---|
| micro | A | 502 | 23.7 | 52.4 | 23.9 | 17.3 | 61.0 | 21.7 |
| micro | B | 71 | 14.1 | 66.2 | 19.7 | 9.9 | 88.7 | 1.4 |
| micro | C | 62 | 0.0 | 98.4 | 1.6 | 3.2 | 95.2 | 1.6 |
表后解释要同时说收益与代价。微观重叠甲的非零支持最多,窗内校正下负一占 23.7,正一占 23.9,零占 52.4,2 个方向近乎对称,说明不是单一主导方向的驱动,而是双向都可能出现方向胜利。在更保守的全局校正下仍保留 17.3 与 21.7 的非零质量。相比之下,微观乙的零比例升到 66.2,微观丙的零比例高达 98.4,几乎没有方向支持,符合预期中抽掉共同在场后耦合消失的模式。宏观甲的零比例也升到 74.1 以上,说明效应集中在亚秒尺度。
必须指出的未胜出项是宏观乙,它只有 18 个门控窗口,窗内校正下负一占 22.2 而正一为 0.0,这种不对称在小样本下不可信,论文已标为效力不足。宏观丙在窗内校正下出现 12.6 与 16.1 的非零值,但在全局校正下大幅回落,提示宏观格对多重比较参数敏感。
再看校准后的显著性超额,它回答膨胀修正后还有没有真信号。横轴是观测减零假设的百分点,零线是基线,实心为双变量,空心为四说话人控制。下图展示了代表性工作点的偏离,重点是重叠微观行明显右偏,而独占微观行贴近零线。
看图路径: 1. 先确认横轴是校准超额显著性,单位为百分点,零线为零假设基线;2. 再区分实心点为双变量检验,空心点为四说话人条件控制;3. 重点比较第二行重叠微观尺度的正向偏离与其他行的接近零或负值;4. 观察宏观重叠行回到零线附近,说明效应集中在亚秒尺度
论文图 2。原论文 Figure 2::“Calibrated excess significance (OBS - NULL, q=5%, percentage points) across representative operating points.”。
读图时先确认横轴不是原始拒绝率,而是校准差值,向右为好,向左表示比零假设更少拒绝。重叠微观的双变量约加 6.6 个百分点,能量控制的条件分析约加 7.4 个百分点,说明耦合不能还原为能量代理的同步。混合非重叠微观仍有约加 3.7 至加 4.0 个百分点,但弱于重叠。独占微观两方向只有约加 0.7 至加 1.5 个百分点或更低,接近零假设。宏观重叠回到零线附近,与窗口级结论一致。
图上独占宏观某方向出现加 8.0 的孤立点,不能当成主效应推广,因为对应窗口数少、宏观格本身不稳定,且论文主结论明确限定在微观尺度,宏观效应是暂定的。像素上能辨别的数值应以正文原句为准,不要硬读坐标估算。
反证与对照:能量、零假设和多维特征各排除了什么?
论文做了 3 类反证,分别对应 3 个误解。第一类是能量同步的误解。对照动作是在每个条件连续片段内把表达性对能量残差化后再检验。如果表达性只是响度的影子,残差化后超额应消失。结果是重叠微观在能量控制的条件分析下仍有约加 7.4 个百分点,甚至略高于双变量的约加 6.6 个百分点,支持耦合超出单一标量能量机制。论文还提到跨特征的小而有结构的效应是双变量检验的,支持活力的多维解释,但细节未完全展开,复述时不能编造具体特征名。
第二类是短序列显著性膨胀。论文用完整移位零假设网格说明,在名义阈值下零假设本身就会大量拒绝,因此必须校准。下表把校准逻辑浓缩为可运行的数字对照,比较对象是观测与零假设的差值,基线是循环移位,指标是百分点差。
| 条件与尺度 | 指标与口径 | 双变量观测超额 | 能量控制的条件分析超额 | 比较对象 |
|---|---|---|---|---|
| 重叠微观 | 校准超额拒绝率,百分点,显著水平 5% | 约加 6.6 个百分点 | 约加 7.4 个百分点 | 循环移位零假设基线 |
| 混合非重叠微观 | 校准超额拒绝率,百分点,显著水平 5% | 约加 3.7 个百分点 | 约加 4.0 个百分点 | 同上 |
| 独占微观与更严阈值 | 定性 regime 特异,显著水平 1% | 层级甲最强 | 层级乙较弱,层级丙趋近于零 | 同上 |
| 宏观乙 | 门控窗口数 | 18 个窗口 | 效力不足 | 不做主效应解读 |
表后解释要讲清代价。更严的 1% 工作点下效应衰减但 regime 特异保留,甲最强、乙较弱、丙趋近于零,这说明结论不依赖单一阈值,但幅度对阈值敏感。宏观乙只有 18 窗,任何正负偏离都可能是噪声,不能与微观甲的 502 窗并列比较。未评测的边界是格兰杰只给线性预测依赖,不区分趋同与发散耦合,论文指出向量自回归系数符号是下一步的原则性方向。非线性扩展如转移熵明确留给未来,不能把线性结果外推为完整的情感动力学。第 3 类是群体混杂的误解,四说话人条件模型在检验 1 对时控制另 2 人,结果仍保持 regime 特异,说明不是共享笑声或话题突变单独驱动的。
限制是什么:哪些结论不能下?
首先是表达性代理的含义。它测量的是潜在发声动态的调制,不是效价或离散情绪,这是刻意为之。不能把加 6.6 个百分点读成识别出高兴或悲伤,也不能把方向支持分数当成谁影响谁的因果证明。论文用格兰杰一词指线性预测依赖,不声称情感互动本身是线性的。
其次是泛化边界。结果仅 AMI,正式 4 人会议互动,跨语料分析已完成但全文未报告,只能说在该语料内建立了条件与尺度限定的耦合,不能声称跨场景成立。宏观分析整体偏弱,宏观乙 18 窗效力不足,方向支持分数依赖错误发现率和最小连续比例参数,保守的全局校正只提供部分稳健性。滞后网格和门控等实现细节未公开,完整实现留给后续工作,复现时必须把这些记为缺项,而不是猜默认值。
最后是未测量的量。误判率、延迟、成本、帧率都没有测量,不能承诺这些得到改善。总体趋势不等于每组每步都成立,独占宏观的孤立高值就是反例。相关性不是因果,缺失证据不是技术错误,论文把宏观效应写为暂定是诚实的做法,解读时应保留同样的限定词:报告用显示,机制用支持,未验证用可能或待验证。
复现先做什么:按什么顺序搭出最小可运行链路?
第一步拿 AMI 4 人会议近距离音频,重采样 16 kHz,切 60 秒不重叠窗。按说话人做语音活动检测,映射到约 20 毫秒跳长的特征帧网格,对齐掩码时用窗长到帧数的映射保证同步,并桥接短暂的说话人内部间隙。第二步调已有的 WavLM 基础增强版做前向推理,取 12 层变换器隐状态的连续浮点值,不做量化聚类,注意接口返回的初始嵌入不计入层计数。第三步在同一帧轴上算表达性跨层离散度、能量代理、语义幅度和话题漂移,并按双人掩码切出重叠、混合非重叠和按方向拆分的独占 3 类条件连续片段。
第四步在每个片段内把表达性对能量做残差化,再跑双变量和四说话人条件向量自回归格兰杰检验并做滞后选择。第五步构造匹配的循环移位零假设,报告观测减零假设的百分点差,显著水平先看 5% 再看 1% 是否保持 regime 排序。第六步做窗口级错误发现率控制得到方向支持分数,同时跑窗内校正和全局保守校正,看微观甲是否保持最高的非零质量而微观丙是否趋近于零。若宏观乙窗口数很少,应直接标注效力不足而不做结论。
关键超参数和信息条件中,只有微观小于等于 1 秒、宏观大于 1 秒、60 秒窗、四说话人、AMI 这几项是确定的,滞后网格、门控阈值和最小连续比例未完全公开,需要自己做敏感性分析并记录。代码模型数据方面,本次未发现可验证的公开资源,只能按无公开复现链处理。
何时值得尝试:从场建模到系统设计的取舍是什么?
当你的任务是多人互动中的响应质量而非单人标签准确率时,这个框架值得尝试。典型例子是会议助听、社交机器人或协同语音界面,系统需要在亚秒级感知紧张与动势的变化,而不是等一句话说完再分类。论文提出的设计区分是:情感共振动态本体作为评价标准,问方法建模的是上游共振动态还是下游类别接口;人工情感共振智能作为架构方向,让合成语音作为场内贡献参与共享共振场,而不是在场外做诊断再回应。
情感共振动态本体 × 人工情感共振智能: 情感共振动态本体分工是评价标准与建模对象:建模上游的共振动态而非下游的固定情绪标签;人工情感共振智能分工是系统架构方向:在场内参与并调节活力轨迹,而非在场外做诊断再回应。搭配理由是本体不直接规定怎么做系统,架构不直接回答何为情感组织。组合意义是把实证中 regime 特异的耦合发现转化为训练目标和输出形式的约束:维持不对称的响应性调谐,而不是最小化分类误差。
取舍也很清楚。收益是能利用个体管线结构上无法利用的配置信息,重叠与独占的对比就是证据。代价是放弃类别监督带来的明确优化目标,改用关系耦合质量这类更难定义的目标;还要承担短序列检验的膨胀、多重比较的敏感性和宏观尺度的不稳定。
论文提到声音与音乐表演共享情绪声学线索,紧张释放、协和不协和等音乐结构工具原则上可用于多人声音轮廓,预训练的音调结构内化模型为无类别监督学习活力轮廓结构提供了先例,但这些都表述为工作假设或设计方向,不是已验证的系统效果。复述时要保留这种分寸:已显示的是 regime 特异且时间局域的耦合,支持关系解释;待验证的是跨语料、非线性、多模态以及生成式人机闭环是否真的维持更好的调谐。
📎 论文与评分元数据
排名:后50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses

