英文题目:Activation Steering for Accent Adaptation in Large Audio Language Models
会议身份:
conference:interspeech:2026:conference-paper-id:sun26h_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#测试时自适应 #音频大模型 #可解释性 #语音 #语音识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jinuo Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Sung Kyun Chung:机构信息未能从会议 PDF 纯文本可靠映射
- Qiuchi Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Eun-Jung Holden:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Dang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为带地域或非母语口音的英语语音,输出为转写文本,难点在于音素实现与韵律偏移导致共享基座模型出现系统性识别落差与公平性问题。该方法先用文本匹配的跨口音与同口音内话语对提取各编码器层的均值偏移方向,再将该方向单层注入并经由多模态投影仪测量余弦对齐增益,从而得到去说话人混杂的层敏感性画像。画像指导的推理时口音转向将抽取集估计的单位化方向以前向钩子加到选中层隐藏状态,使评测语音向标准英语表示漂移而无需更新权重。与直接调参相比,该机制把适应约束在口音敏感子空间,避免在无关层扰动语义表示。在平衡抽样评测中,加拿大口音词错率相对基线下降33.80个百分点,北爱尔兰口音下降29.63个百分点,阿拉伯口音下降8.06个百分点。结论仅适用于所测的8种英语口音与Qwen2-Audio-7B编码器中间层窗口,未验证跨语言、强噪声或流式部署的外推性。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
本文解读的输入是题为激活转向用于大音频语言模型口音适配的论文正文与本次收到的官方原图像素,目标是让刚进入语音与音频语言模型领域的研究生能够核对关键做法并用自己的话复述完整方法。必须保留的信息包括任务定义、模型对象、逐层分析与推理时干预的计算流程、数据划分与评测协议、主结果数字及其适用条件,以及明确的失败边界。
输出按学习依赖展开,先讲口音为什么难,再讲已有路线为何不够,再进入方法全景、组件计算、构造与推理过程、实验条件、结果与反证,最后给出复现清单与判断。阅读时请把白话解释当作脚手架,把英文术语当作与原文对照的锚点,后文简称固定,不再反复展开。教学中举的例子会明确标为例子,不代表论文报告过的数值或效果。
论文研究的任务是自动语音识别中的口音鲁棒性。输入是一段英文朗读语音,输出是对应的英文文本转写。难点在于不同地区和非母语口音会系统性改变音素实现、韵律和音位组合规律,导致某些人群的识别错误不成比例地升高。作者把这种差异看作隐藏表示空间中一个大致呈线性结构的可解释子空间,问题于是变成能否先找到它在哪些层最集中,再直接在激活空间里把它拨回去。
研究对象是问答式大音频语言模型中的音频编码器,具体为具有 32 层类耳语结构编码器加多模态投影器的 7000000000 参数级模型,干预只发生在编码器隐藏状态,效果在投影器输出处度量,最终反映为词错误率的变化。
附录:术语速查与符号阅读顺序
大音频语言模型指同时处理音频与文本的大模型,本文只动其音频编码器。均值偏移方向指两组 utterance 平均表示之差,用于刻画簇间平移。口音对齐分数指扰动前后源与目标在投影器空间余弦相似度的差,正值代表拉近。特异性分数指跨口音对齐减去组内对照对齐,用于扣除说话人效应。敏感性分数指特异性取正部,用于层排序。
转向强度指归一化方向前的乘子,控制拨动幅度。阅读符号时先看样本与层的下标,再看方向的源与目标箭头,最后看扰动是加在编码器层而度量在投影器空间,避免把发生位置与观测位置混淆。
已有路线做了什么,为什么本文换一条路?
传统口音适配路线包括有监督微调、口音相关建模和数据增强。在小模型时代这些做法有效,但在大模型时代全参数适配计算昂贵,还可能损害跨口音和跨任务的泛化。作为折中,参数高效微调和瓶颈适配器只在冻结主干上加少量可训练参数, representative 的做法包括低秩适配及其多口音混合专家扩展。原文指出这类方法仍然是启发式地优化新增参数,没有显式定位哪些层和哪些子空间对口音最敏感,因此可能在口音不敏感区域做无用适配,甚至把口音补偿与高层语义表示纠缠在一起,既影响效率也影响可控性。
另一条思想来自大语言模型中的表示工程与激活加法。已有工作显示情感、风格或安全等高层属性在激活空间中近似对应线性方向,通常用对比概念间的平均激活差构造转向向量,加到选定层隐藏状态上即可在不改参数的情况下调节行为。本文把这一思想迁移到语音,提出核心问题是口音变化在大音频语言模型中是否也对应一个结构化且可控的子空间。如果答案是肯定的,那么轻量、可解释的表示级干预就可能替代参数密集型微调。理解这种几何组织方式因此兼具解释与控制双重意义,前者揭示模型把口音信息分布在何处,后者决定能否直接调整。
附录:与相邻路线的同条件对照要点
与全参数微调对照时,同输入是口音语音,同目标是降低词错误率,不同监督是全量更新需要大量标注,同运行阶段是离线训练加在线部署,本文转向在运行阶段免更新。同参数高效微调对照时,同输入同目标同运行阶段,但监督效率不同,本文在少样本下占优而在大样本下可能落后。与数据增强对照时,增强改变训练分布而转向改变推理表示,前者需要重训,后者即插即用。
与表示工程对照时,同属激活加法家族,但本文把对比概念从情感风格换成标准与口音语音,并引入说话人对照与双向平均以适应语音的说话人混杂。类别差异不能当作同条件胜负,任何胜负表述都应带上样本量、层位与强度条件。
要解决的口音问题如何被形式化为可测量的表示差距?
作者把问题形式化为标准英语表示簇与口音英语表示簇之间的差距。为了把语言内容的影响剥离,构造的是文本完全相同的语音对。举例来说,例子:同一句朗读文本分别由标准英语说话人和苏格兰口音说话人读出,内容相同而声学实现不同,二者在隐藏空间的距离就主要归因于口音而非文本。若再构造同口音内不同说话人的配对作为对照,就能进一步把音色等一般说话人差异与口音系统性差异分开。
基于这种配对,逐层分析要回答哪一层的隐藏状态最支持把两簇对齐,推理时转向要回答用提取集估计的方向能否让未见说话人、未见文本的口音语音在识别上更接近标准语音。两个阶段共享同一个均值偏移直觉,但用途不同,前者是诊断工具,后者是可部署的干预手段。评价统一落到词错误率的变化上,向下为好,向上为坏。需要强调的是投影器输出仍随时间变化,度量前要做时间维平均得到 utterance 级表示再算余弦相似度,否则不同长度无法直接比较。
附录:常见误解辨析
误解一是把敏感性高直接等同于转向增益大。敏感性来自投影器空间的余弦拉近,而增益来自词错误率下降,二者相关但不等同,晚期敏感性虽高却因表示固定而难以转化为稳定增益。误解二是把冻结参数等同于输出确定。冻结只说明权重不变,前向仍受采样解码与钩子实现影响,未测量不能断言确定性。误解三是把平衡集上的大幅下降当作自然分布收益。
平衡集放大了困难样本,绝对数字不可直接外推。误解四是把相关性当因果。中部改善与中部敏感性共现支持可控子空间假说,但未证明口音信息只存在于中部,也未排除其他层以非线性方式编码口音的可能。
方法全景:一个样本如何走完输入到输出?
先沿一个样本走完全程。输入是一段口音语音波形,进入 32 层音频编码器逐层变换为 token 级隐藏激活。在选定层,方法把预先估计的归一化口音方向按强度系数加到该层所有时间步的隐藏状态上,然后让被扰动的激活继续经过剩余编码器层和多模态投影器,得到最终语音表示并送入下游语言模型生成转写文本。若不干预,则是原模型的前向过程;若干预,则只有这一层的加法不同,其余参数和结构完全冻结。
编码器中间层 × 多模态投影器: 编码器中间层负责变换声学隐藏状态,分工是承载干预的发生位置;多模态投影器负责把编码器输出映射为送入语言模型的最终语音表示,分工是承载效果的观测位置;二者搭配的原因是口音主要表现为声学模式差异,适合在编码器内动手,但在投影器空间度量才能反映下游可用的差距,组合后新增的作用是形成干预在前、度量在后的因果链。
全景包含两个先后阶段。第一阶段是口音子空间分析,用跨标准口音对和同口音内对照对在每一层估计均值偏移并做受控扰动,通过投影器空间的对齐增量排出层敏感性。第二阶段是推理时口音转向,用严格隔离的提取集重新估计通用转向向量,再在敏感层上对评测集做单层扫描与强度扫描。两个阶段的方向公式形式相同,但数据来源、归一化处理和用途不同,分析阶段用单位偏移探测敏感性,转向阶段用单位范数方向乘以可调强度实现控制。
方向如何算,扰动如何加,对齐如何度量?
组件从表示池化开始。对每个语音样本,取第层 token 级隐藏激活并在时间维做平均,得到该样本在该层的 utterance 级向量。给定源口音样本集与目标口音样本集,方向定义为两组平均向量的差,即目标簇中心减去源簇中心。原文采用双向设计,标准到目标与目标到标准分别计算再平均,以减少方向性偏置。分析阶段的扰动是把该方向按系数加到该层全部时间步上,系数取为一个单位的均值偏移扰动,扰动后的激活继续向后传播。
口音均值偏移方向 × 激活 steering: 口音均值偏移方向负责刻画同一文本下标准英语与口音英语在某一编码器层 utterance 级表示的簇间差向量,分工是定位口音从哪里偏了以及偏向哪里;激活 steering 负责在推理时把该方向以可控强度加回隐藏状态,分工是执行拨动而不改权重;二者搭配的原因是方向提供了可解释、可复用的几何目标,steering 提供了免训练的执行机制,组合后新增的作用是把原本需要微调的口音补偿变成 1 次前向钩子操作。
度量发生在投影器空间。对源与目标语音对,先算未扰动时两者的投影器输出余弦相似度,再算在第层扰动后源表示与目标表示的余弦相似度,两者之差定义为口音对齐分数。若为正,说明该层扰动把源表示推向了目标。对跨标准口音对和同口音内对照对分别计算平均对齐分数,前者减后者得到特异性分数,只保留正部作为层敏感性分数用于排序。归一化与排除处理也很关键,各口音组独立归一化以减少尺度差异,紧邻投影器的第三十一层因直接前接线性映射而被排除在敏感性排序之外。
口音对齐分数 × 特异性分数: 口音对齐分数负责度量在某层注入偏移后源表示与目标表示在投影器空间余弦相似度的增量,分工是回答这一层拨动有没有拉近两簇;特异性分数负责用跨口音对的对齐分数减去同口音内说话人对照对的对齐分数,分工是扣除音色和韵律等一般说话人差异;二者搭配的原因是只看拉近会把说话人效应误当口音效应,组合后新增的作用是得到只归因于口音的层敏感性排序依据。
转向阶段复用均值偏移思想但做了两处改变。第一,方向只用提取集计算,避免说话人与文本泄漏到评测集。第二,注入前把方向归一化为单位范数,使强度系数在不同层之间可比。推理时用前向钩子实现加法,不修改任何权重。作者假设从部分数据估计的口音方向能泛化到未见说话人和未见语句,是否成立由评测部分的识别增益来检验,而不是由假设本身保证。
本研究训练了什么,没有训练什么,真实计算是什么?
本研究没有训练主干语音模型,也没有训练转向向量本身。需要明确说明的未训练项包括音频编码器 32 层权重、多模态投影器权重和下游语言模型权重,全部冻结且无梯度更新。转向向量不是通过反向传播学到的参数,而是通过前向激活的统计计算得到的确定性向量,计算过程是分组平均再相减,必要时做单位范数归一化。
提取集 × 评测集: 提取集负责提供估计均值偏移方向的语音对,分工是沉淀可迁移的口音方向;评测集负责提供未见说话人和未见文本的识别测试,分工是检验方向的泛化;二者搭配的原因是若说话人或文本重叠,方向可能记住内容或音色,严格隔离后组合新增的作用是证明一个子集学到的向量能直接用于另一批人另一批句子。
真实计算分为分析计算与推理计算。分析计算需要对每个目标口音构造 1000 个跨标准口音对和 500 个同口音内对照对,逐层提取隐藏激活、算方向、做扰动、经剩余层传播到投影器、算余弦相似度增量并聚合为敏感性。推理计算需要先在提取集上随机采样 1000 个语音对估计方向,再在评测集上对 32 层逐层、4 个强度逐个独立测试,每个配置都是 1 次带钩子的前向推理加词错误率统计。论文未报告优化器、学习率、训练轮数与硬件预算等训练要素,因为不存在梯度训练;也未报告推理延迟与吞吐,因此不能从冻结参数直接推定系统输出确定或延迟必然更低。
数据、划分、基线与指标如何保证比较公平?
数据分为原生与非原生共 2 条线。原生线采用高保真多说话人语料,选取苏格兰、南非、加拿大、爱尔兰和北爱尔兰口音,以该语料内部的标准英语子集为对照。非原生线采用带人工音素标注的第二语言语料,选取印地、阿拉伯和西班牙口音,因其内部无母语参照,改用朗读脚本相同的另一母语合成用语料作为匹配参照。脚本相同是关键,它让跨组差异更可能来自口音而非文本。
划分上分析与转向严格区分。子空间分析为每个口音构造固定数量的跨组与组内对,不需要划分。推理时转向采用说话人 8 比 2 划分,80% 说话人进提取集,20% 进评测集,并强制提取对与评测语句无文本重叠,每个口音从提取集随机采样 1000 对估计方向。评测集构造采用难度平衡采样,先用原模型试跑候选语句,一半选词错误率为零的简单样本,一半选词错误率大于零的困难样本,默认每组各采 100 条共 200 条,转向结果与微调对比都用同一平衡子集。
评测协议是单层扫描。每一层与每个转向强度独立测试,强度覆盖 0.5、1、2、5 共 4 个量级,指标是词错误率(%)及其相对基线的变化量,下降为好。微调基线是参数高效微调,在相同子集上比较,训练对数量随口音可用数据而变化,从几十对到约 800 对不等,这为后文讨论样本量效应埋下条件。
主结果:转向在何处稳定增益,在何处崩溃?
在进入数字之前,先说明本图要回答的比较问题与公平条件。图 1 上下 2 行分别对应原生与非原生口音,左列是归一化层敏感性,中列是固定较强强度下的逐层词错误率变化,右列是多强度平均效应的强度敏感性。公平条件是同一平衡评测集、同一单层独立干预、同一词错误率变化方向,纵轴在中右列是变化量而非原始错误率,负值代表改善,不能把曲线向下直接读成绝对性能,也不能把末层崩溃推广为全程无效。
看图路径: 1. 先看上面一行原生口音三张子图与下面一行非原生口音三张子图的横轴层序号与纵轴含义是否一致;2. 再对比子图 a 与子图 d 的敏感性曲线在早期层 0 至 14、中部 15 至 19 与晚期 20 至 30 的起伏位置;3. 接着看子图 b 与子图 e 在中间层附近的平均词错误率变化是否为负向凹陷而在 30 至 31 层是否急剧上翻;4. 最后看子图 c 与子图 f 中不同转向强度曲线的分层,确认强度增大时晚期崩溃是否提前并放大
论文图 1。原论文 Figure 1:“Layer-wise accent subspace analysis and steering results with an alpha sweep. Top row: VCTK; bottom row: L2-ARCTIC.”。
像素显示的规律高度一致。敏感性在早期 0 至 14 层普遍较低,中部 15 附近出现小峰,21 层之后急剧上升至全局最大,非原生线的全局波动更强。转向效应则呈现中间凹陷:早期层几乎无响应,中部 15 至 19 出现稳定改善,原生线部分口音改善可达约 30% 变化量,非原生线改善约 5% 量级但位置同样集中。晚期层不稳定且经常有害,终端 31 层在原生与非原生中都引起数个点的错误率暴涨,图注框中标注的该层增量在原生线约为 1.5 至 5.8,在非原生线约为 3.7 至 4.2。强度扫描显示强度增大带来更大波动与更高峰值,但也让晚期崩溃提前并放大,中部仍是跨口音共享的最适窗口。
参数高效微调 × 无参数 steering: 参数高效微调负责用少量可训练参数拟合特定口音的训练对,分工是靠梯度更新改模型;无参数 steering 负责冻结全部权重只在前向时加向量,分工是靠几何平移改表示;二者搭配比较的原因是同为轻量适配路线但更新机制完全不同,组合对照新增的作用是揭示样本量决定路线取舍:大样本时微调占优,少样本时 steering 更稳且不损伤原能力。
下表整理原生 5 个口音在平衡子集上的基线、转向后与微调后词错误率及转向变化,指标方向均为越低越好,变化为负代表改善。表前比较问题是:在相同评测子集上,免更新的转向能否达到与参数高效微调可比的绝对错误率,公平条件是同一 200 条平衡语句与同一基线模型。
| 口音 | 训练对数 | 基线词错误率 | 转向后词错误率 | 转向变化量 |
|---|---|---|---|---|
| 苏格兰 | 197 | 26.72% | 6.80% | -19.92% |
| 南非 | 44 | 29.86% | 4.35% | -25.51% |
| 加拿大 | 51 | 37.27% | 3.47% | -33.80% |
| 北爱尔兰 | 49 | 36.27% | 6.64% | -29.63% |
| 爱尔兰 | 87 | 31.91% | 6.41% | -25.50% |
表后解释需要同时看到收益与代价。收益是转向在少样本原生口音上把 20 多至 30 多百分比的基线错误率压到个位数,绝对降幅达 19.92 至 33.80 个百分点,且无需任何权重更新,保留了原模型能力。代价与边界是该表只报告平衡子集上的单点最优层与最优强度结果,不是全量自然分布上的期望,也未同时给出置信区间;微调列被暂时省略以聚焦转向绝对值,完整与微调的胜负留待下一张表,未胜出项将在那里明确出现。
强度与位置的消融揭示了什么权衡?
强度消融回答强度越大是否越好。原生与非原生的平均效应都显示,随强度增大,逐层效应的波动幅度增大,改善峰值升高,但晚期崩溃也更剧烈且起始层前移。原文在强度五已观察到深层明显不稳定,因此停止继续增大强度。具体而言,原生线在强度二时晚期呈现随深度递进的趋势但中部表现平平,强度五时中部大幅反超晚期并达到更高峰值,晚期则振荡加剧。非原生线整体更一致,中部始终是全局最优窗口,晚期崩溃随强度单调加重。这支持中部十五至十九是共享可控窗口,而非靠蛮力推高强度。
位置消融回答为何不是越早或越晚越好。早期零至十四处理低抽象声学信息,原生口音在此敏感性弱,非原生因低层声学偏离更大而有较高小峰,但干预可控性差。晚期表示逐渐固定,可供重组的剩余层太少,注入方向难以稳定传播,原生线增益不超过中部,非原生线频繁出现表示坍塌。终端第三十一层因紧邻投影器而不适合注入,一致地造成灾难性退化。这一空间分工与已有层分析中低层声学、中层音素、高层语义的直觉相容,但本文的证据只到对齐分数与词错误率层面,未直接证明语义纠缠的发生机制。
下表转向非原生三口音并补上微调对照,用于同时检验可部署收益与样本量条件。表前比较问题是:在训练对充足与不足两种条件下,转向与微调谁更优,公平条件仍是同一平衡子集与越低越好的词错误率。
| 口音 | 训练对数 | 基线词错误率 | 转向后词错误率 | 微调后词错误率 |
|---|---|---|---|---|
| 阿拉伯 | 802 | 18.13% | 10.07% | 7.20% |
表后解释必须点名未胜出项。非原生线上转向依然带来约 4.04 至 8.06 个百分点的绝对下降,但微调因拥有约 800 个训练对而反超,微调后错误率比转向低约二至三点。结合上一张表,规律是训练对少于一百的南非、加拿大、北爱尔兰和爱尔兰口音上微调显著落后,而训练对充足时微调占优。原文还报告转向在 8 个口音上实现 4.04 至 33.80 的下降,相对降幅约二成至 90%,但该相对数是跨口音汇总表述,不能当作每个口音的承诺。失败条件同样明确:晚期大强度干预与终端层注入是已知反例,不能作为可运行策略。
哪些结论有边界,哪些验证还没有做?
已验证的结论限定在朗读式英文、8 个目标口音、特定 7000000000 参数音频语言模型与平衡采样评测集上。平衡集刻意放大困难样本比例,其绝对词错误率高于自然分布,直接把表内数字当作线上期望会高估错误率,也会高估改善幅度。方向估计依赖文本匹配的提取对,若换为自发对话或强噪声场景,内容与信道差异可能污染均值差,本文未评测该边界。
未验证的推测需要用可能与待验证表达。中间层更可控的解释是表示尚未固定因而扰动能稳定传播,这得到曲线支持但未做因果干预证明。公平性改善的表述应理解为特定口音错误率下降,而非已测量跨人群误判率、延迟或部署成本,原文未报告推理开销、输出帧率与实际延迟,因此不能承诺这些量同步改善。资源状态方面,未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开,本次解读也不把权重可下载当作系统可运行。
另一个边界是单层独立干预。所有扫描每次只动一层,未探索多层联合或自适应强度,晚期不稳定是否可通过组合缓解仍待验证。统计方面未报告显著性检验与随机种子方差,跨层最优值的选择带有事后最优性质,实际部署应固定验证集选定的层与强度再报测试集,否则会把搜索最优误当可部署收益。
若要复现,先做什么,需要哪些关键超参数?
复现先做数据隔离。按口音准备文本匹配的跨标准对与同口音内对照对,分析用 1000 跨组加 500 组内,转向用说话人 8 比 2 划分加无文本重叠,并从提取集采样 1000 对估计方向。评测集按难度平衡构造,每组 100 条简单加 100 条困难共 200 条,固定随机种子以便与基线对齐。模型侧冻结全部权重,用前向钩子在目标编码器层加向量,分析阶段用单位偏移探测,转向阶段先归一化方向再乘以强度,强度扫描 0.5、1、2、5,层扫描 0 至 30 并排除 31 或将其作为已知负例。
关键信息条件包括 32 层结构、投影器前平均池化、余弦相似度增量、双向平均、特异性取正部、逐口音独立归一化。度量时先确认纵轴是变化量还是原始值,再按下降为好解读。建议先复现敏感性曲线的中部小峰与晚期大峰,再复现中部转向凹陷与终端层崩溃,最后才做与参数高效微调的样本量对比。若缺少官方代码,需自行实现钩子注入与 utterance 级池化,并保留层号、强度、说话人划分与文本无重叠的日志,否则无法判断增益来自口音还是泄漏。
何时值得尝试这种转向,如何一句话记住它?
当部署的是共享大音频语言模型、目标口音数据稀少且不允许频繁改权重时,这种推理时转向值得尝试。它用很少的配对语音估计一个可复用方向,在中部 15 至 19 层以中等以上强度干预,往往能在平衡集上把原生口音错误率大幅压低,同时保留原模型能力。当目标口音有数百对训练数据且追求极限错误率时,参数高效微调可能更优,此时可把转向当作冷启动或与微调互补的手段。
需要避开的用法包括在早期层期望大增益、在晚期尤其是终端层做强干预、以及把事后选出的最优层直接宣传为部署收益。一句话记住:先用对照对找到口音真正集中的中间层,再用隔离数据估计的方向在推理时轻轻拨动表示,增益在中部,风险在尾部,样本量决定与微调的取舍。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
