英文题目:De-Speakerizing Accented ASR: Measuring and Mitigating Speaker Entanglement for Fair, Reliable Recognition
会议身份:
conference:aaai:2026:conference-paper-id:42326
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#对抗训练 #公平性 #低资源 #语音识别
评分:3.8/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.2/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究
👥 作者与机构
- Jiaen Sun:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向带口音自动语音识别,输入为多说话人、多口音语音,输出为文本转写,难点在于口音表征易记住说话人身份,导致说话人宽松划分下分数虚高,而在未见说话人与未见口音上失效并放大口音间公平性差距。第一步负责诊断纠缠程度,比较说话人不相交划分与宽松划分的性能膨胀,并以轻量探针预测说话人标识、说话人验证等错误率及与强说话人表征相似度量化信息泄漏。第二步负责剥离说话人信息,在冻结的Whisper骨干池化编码状态上学习连续口音嵌入,并以梯度反转层对抗抑制其中说话人可分性,从而输出去说话人化的干净口音向量。第三步负责安全条件注入与语料指导,将干净口音向量经有界特征线性调制注入解码器交叉注意力键值以辅助识别,并以固定总时长下说话人广度与每人深度配比指导低资源采集。与已有连续口音条件方法相比,关键机制差异是先显式去说话人化再做条件注入,实际意义在于保留口音收益的同时提升跨说话人泛化与公平性。在固定总时长语料设计任务条件下,Low-resource B的说话人数指标为80,高于Low-resource A的说话人数指标为20。结论的适用边界在于去纠缠收益与广度优先采集假设尚未验证,跨语言与高低资源外推及未见口音鲁棒性仍需实证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?要解决的语音识别任务是什么?
这篇研究陈述讨论的输入是带口音的语音音频,目标输出是对应的文本转写。应用背景包括字幕、会议记录和语言学习工具。作者首先交代,现代系统如 Whisper 在平均性能上已经很强,但多项审计报告显示,在英语和其他语言中,不同口音之间的词错误率差距依然存在。词错误率是语音识别常用指标,含义是识别错的词占参考文本总词数的比例,越低越好。公平性差距在这里指不同口音分组上的词错误率差异。
对刚入门的研究生来说,关键动作是先把任务拆成两层:一是系统能不能听懂说什么,二是这种能力是否对不同口音的说话人都成立。原文把第二层的不成立与表示层问题联系起来,而不是只归因于数据量不够或解码器不够强。本文是研究计划性质,提出先度量再缓解再指导数据采集的 3 步安排,尚未报告完整的实验数字,因此阅读时要把计划主张和已验证结论分开。
本次解读只依据论文原文证据,不引入外部实验结论,遇到原文未给出的实现细节会明确指出缺项。
已有路线为什么帮了忙却没解决公平性?
原文回顾了 3 条相关路线。第一条是给语音识别模型显式加入口音信息。早期端到端工作用多任务训练和口音嵌入报告了相对常规基线可观的词错误率改进,后续工作把自监督学习编码器与口音相关特征结合,在 2020 年带口音英语语音识别挑战赛上进一步获得增益,再往后的方法从独热口音编号转向连续口音空间与适配器,强调连续条件控制的价值。
白话说,独热编号是给每个口音一个固定开关,连续空间是给每个口音学一个可渐变的向量,适配器是插在主干旁的小模块。第二条路线是对抗不变性,即让学到的特征对主任务有用但对干扰属性无用,代表方法是域对抗神经网络,用梯度反转层实现,曾用于计算机视觉、鲁棒语音识别和说话人无关训练。第 3 条是开放基准与强主干带来的可行性,包括挑战赛数据、Common Voice 与 CommonAccent 的口音元数据,以及 Whisper 作为冻结主干。
原文的判断是:已有口音条件方法很少剥离连续空间中的说话人成分,而大范围审计显示仅靠条件控制还没有解决公平性差异。这为后文先测泄漏再做去说话人化提供了动机。需要核对的是,原文对已有工作的增益描述引用了前人报告,没有在本研究中重新复现这些数字,因此不能把引用过的改进直接当作本方法的收益。
什么是说话人纠缠?它如何造成虚高分数?
说话人纠缠是本文的核心诊断概念。先用白话解释:口音表征本应回答说话人怎么发音,说话人身份回答是谁在说话;纠缠指前者无意中记住了后者。英文对应为 speaker entanglement 与 accent representation。作者认为,这种记忆会带来两类后果。
在宽松划分下,同一说话人同时出现在训练与测试中,模型靠嗓音捷径就能得分,分数被抬高;在严格的说话人互斥划分或未见说话人与未见口音条件下,捷径失效,词错误率上升且口音间差距拉大。学习依赖上,必须先理解划分卫生:训练集、验证集与测试集是否按说话人严格分开,直接决定成绩是否可信。
作者还提到一个现实动机:在新加坡面向当地医务人员与学生的普通话学习辅助项目中,评估 Mandarin 音频时出现部分说话人片段被转写成其他语言文本的现象,作者将其视为与 Whisper 已有文献中类幻觉输出一致的行为,并作为表示层问题的动机,但原文明确把它当作待度量的表示问题而非单一系统缺陷来处理。
说话人纠缠 × 口音表征: 说话人纠缠指口音表征中混入了能识别是谁在说话的线索,口音表征本应只保留发音方式等群体性特征;两者搭配讨论的原因是如果口音向量能被用来认人,说明它没有做到只表征口音,组合意义在于把公平性与泛化失败归因到表示层泄漏,而不是单纯归因到声学模型不够强。
沿一个样本走一遍有助于建立直觉:输入是一段带口音的语音,先经冻结编码器得到声学状态,再池化并经口音识别头得到口音向量,最后该向量以条件方式影响解码器输出文本。如果口音向量中混入说话人线索,那么在已见说话人上解码会显得顺利,换一个新说话人即使口音相同也可能变差。教学例子明确标为例子:比如同一口音的 2 位新说话人,理想的口音向量应接近,而纠缠的向量会相距很远。本文没有给出这个例子的数值,只是用它说明为什么要先做诊断探针。
方法全景:先度量再去纠缠再指导采集
全文方法可以分为三块,编号为 A1、A2、A3。A1 是度量纠缠,用诊断探针与划分对比量化口音向量中泄漏了多少说话人信息,并把泄漏程度与未见说话人或未见口音的词错误率联系起来。A2 是缓解纠缠,在池化编码器状态上加一个小的口音识别头得到连续口音嵌入,同时用说话人分类器经梯度反转层惩罚该嵌入中的说话人信息,再用特征线性调制把干净的口音线索接入冻结主干的解码器交叉注意力。特征线性调制可理解为按条件对特征做缩放与平移,英文为 feature-wise linear modulation,缩写为 FiLM。
A3 是把表示层发现转化为语料设计建议,在固定总时长下比较说话人数量与每人时长的不同配比,观察未见说话人词错误率与嵌入的说话人验证等错误率变化,从而讨论低资源时优先广度、高资源时先保广度再加深度的采集策略。3 个部分的学习依赖是:只有先接受纠缠的度量定义,才能理解对抗分支为什么必要;只有理解对抗分支去掉了什么,才能理解有界条件控制为什么还要限制作用强度。
只有理解前两步的因果链条,才能理解语料设计为什么强调人数而不是每人时长。原文明确 Whisper 保持冻结,只训练小头与适配器,以控制计算量并聚焦表示设计。
度量组件:四种探针各自在测什么?
A1 提出了 4 种可用的度量操作。第一,对比在说话人互斥划分与宽松划分下训练的模型性能,用分数膨胀暴露记忆说话人的程度。第二,从任意口音嵌入训练一个轻量探针预测说话人编号,若宏观 F1 很高则说明泄漏,宏观 F1 是对每个说话人类别求 F1 后再平均,越能认出是谁说明嵌入越不干净。第三,直接在嵌入上做说话人验证并计算等错误率,等错误率是误接受率与误拒绝率相等时的 operating 点,越低表示越容易区分说话人,也就意味着泄漏越多。
第四,把该嵌入与强说话人表示如 X 向量和 ECAPA-TDNN 对比,计算余弦相似度或中心核对齐相似度,若相似度高则说明口音向量与说话人空间接近。白话总结:前两种看能不能认出人,第三种看验证有多容易,第 4 种看几何上像不像说话人向量。原文说将在后续实验中量化这些效应的幅度并与未见说话人与口音的词错误率关联,但没有在本稿中给出具体数值与阈值,因此目前只能复述度量清单与判断方向,不能复述任何泄漏量结论。
域对抗学习 × 梯度反转层: 域对抗学习负责定出让主任务可用但对干扰属性不可知的优化目标,梯度反转层负责在反向传播时把说话人分类器的梯度取反传给口音编码器;搭配理由是只靠口音识别损失会保留说话人捷径,而反转梯度能直接惩罚泄漏,组合意义是得到去说话人化的连续口音嵌入。
缓解组件:对抗分支与有界条件如何分工?
A2 的缓解设计包含两个配合部件。第一个是去说话人化的口音嵌入:对池化后的编码器状态加口音识别头产生连续口音嵌入,同时训练说话人分类器去猜说话人,但经过梯度反转层把梯度反向传给嵌入产生器,目标是让嵌入对口音识别有用而对说话人识别无用。第二个是安全条件接入:用特征线性调制在解码器交叉注意力处经键与值施加条件,并强调有界约束以避免条件分支重新引入强说话人影响。白话说,对抗分支负责清洗,说话人信息越少越好。
条件分支负责使用,口音帮助解码但作用幅度受限。原文称这种做法意在保留连续条件的优点同时去掉嗓音记忆,并引用了对抗训练与多口音连续条件的前人工作作为依据。需要核对的实现边界是:原文没有给出池化方式、口音识别头的层数与维度、说话人分类器的类别数与损失权重、梯度反转强度、有界的具体上下界或归一化方式,也没有说明梯度是否截断、优化器与学习率安排,因此不能从方法名称推定具体网络实现。
连续口音嵌入 × 特征线性调制: 连续口音嵌入负责把口音表示为稠密向量以保留细粒度差异,特征线性调制负责用该向量对解码器交叉注意力的键与值做缩放和平移式条件控制;搭配原因是离散口音编号表达能力有限而连续向量若直接接入仍可能带入说话人噪声,组合意义是在保留连续条件优势的同时用有界调制把条件作用限制在安全范围内。
再沿样本走一遍缓解路径:同一段语音先经冻结编码器得到帧级状态,池化为定长向量后进入两条监督,一条是口音识别监督让向量保留口音差异,另一条是说话人对抗监督让向量丢掉身份差异,清洗后的向量再经有界调制影响解码器交叉注意力,最终输出文本。判断是否成功的标准不是训练集词错误率更低,而是未见说话人与公平性差距是否改善,这一点在后文评估问题中有对应安排。
训练与冻结:哪些参数更新,监督从哪里来?
原文的训练安排是参数高效思路:Whisper 主干保持冻结,只训练小的口音头与适配器类模块。监督来源包括三处:口音识别分支的口音标签监督、说话人对抗分支的说话人编号监督、语音识别主任务的文本转写监督。对抗分支的梯度路径按域对抗学习的常规写法理解,即说话人分类器本身按正常梯度学会认人,而传回嵌入产生器的梯度经反转层取反,使产生器学会让分类器认不出人。
但原文没有报告损失加权系数、反转强度是否随训练调度、是否对某分支停止梯度、批次如何按说话人与口音分层采样、训练轮数与早停指标,因此复述时只能讲清监督分工与冻结范围,不能补写具体的优化步骤。
说话人无关训练 × 冻结 Whisper 主干: 说话人无关训练负责提供用对抗方式去除说话人信息的方法先例,冻结 Whisper 主干负责固定大模型参数以降低算力并聚焦表示设计;搭配原因是全文不从零训练声学模型,只训练小口音头与适配器,组合意义是让去纠缠实验可以在公开基准上低成本复现和对照。
还需要区分训练与推理:训练时需要口音标签与说话人编号才能驱动两个辅助头,推理时理想情况是直接从音频算出干净口音向量再条件解码。原文没有说明推理时若缺少口音标签如何处理,也没有说明是否缓存说话人无关的口音向量或如何重置状态,因此这部分属于具体缺项。计算资源方面,原文只定性说可使用公开数据与适度算力,没有给出 GPU 型号、显存、训练时长或推理延迟,复现时应先做小规模试点再确定预算。
评估设什么问题?数据与划分条件是什么?
评估围绕两个问题组织。E1 问方法是否降低说话人纠缠并改善公平性,在 AESRC-2020 上报告;E2 问在低资源与高资源下应如何设计语料,在 Common Voice 与 CommonAccent 上分析。共同条件是所有模型使用说话人互斥的训练、验证与测试划分,以避免宽松划分带来的分数膨胀。AESRC-2020 支持已见与未见研究,Common Voice 与 CommonAccent 提供更广的口音元数据,但原文提醒要注意自报告标签与划分卫生问题。
指标方向需要先讲清:词错误率越低越好,未见说话人词错误率用于看泛化;说话人探针的宏观 F1 越高表示泄漏越多;说话人验证等错误率越低表示越容易区分说话人,也对应泄漏越多;公平性差距越小越好。
说话人 disjoint 划分 × 宽松划分: 说话人 disjoint 划分要求训练、验证与测试说话人不重叠,宽松划分允许同一说话人出现在训练与测试两侧;搭配比较的原因是宽松划分下模型可以靠记住嗓音拿高分,从而暴露分数虚高,组合意义是用两种划分下的性能差作为纠缠导致泛化失败的诊断证据。
E1 的对照设计是理解公平比较的关键。控制组完全不用口音线索,用于给出基线词错误率与公平性;连续嵌入但不用梯度反转,用于看完整连续表示本身的效果;连续嵌入加梯度反转,用于分离出去说话人化的作用;再加有界调制则是完整方法,用于看干净线索加安全条件的组合效果。
E2 的设计是在固定总时长下改变说话人数与每人分钟数,再在共享测试集上测未见说话人词错误率与公平性差距,精确数值将在试点后确定。下表是 E1 的对照总览,阅读时重点看每一行相对上一行只改了什么。
对照总览:E1 的四个设置只差在哪里?
下面这张表提出的问题是:在保持冻结主干与说话人互斥划分一致的前提下,口音线索、有无对抗去说话人化、有无有界条件分别带来什么可分离的变化。公平条件是同一基准与同一测试协议,指标方向是词错误率与公平性差距越小越好,纠缠类探针按上节方向解读。表中 B0 是无口音线索的对照,B1 是连续嵌入但无对抗,B2 在 B1 上加入梯度反转,B3 在 B2 上再加入有界调制。复述时不要把 B1 到 B3 的递进当作已验证的增益顺序,它只是待验证的消融链条。
| 条件 | 口音线索 | 是否用梯度反转 | 接入识别器方式 | 设立目的 |
|---|---|---|---|---|
| B0 | 无 | 否 | 无 | 基线词错误率与公平性 |
| B1 | 连续嵌入 | 否 | 无 | 看完整连续表示本身 |
| B2 | 连续嵌入 | 是 | 无 | 分离出去说话人化的作用 |
| B3 | 连续嵌入 | 是 | 有界特征线性调制 | 干净线索加安全条件的完整方法 |
表后需要说明代价与未胜出项。B0 的代价是完全放弃口音帮助,若口音差异大则可能基线本身较差;B1 的风险是连续向量表达力强但可能同时记住嗓音,若纠缠严重则在未见说话人上可能不胜出;B2 若对抗过强可能连口音信息一起削弱,需要权衡;B3 增加了条件模块复杂度,若有界约束设置不当可能限制增益。原文没有报告这 4 个设置的具体数字,因此本表只能承担对照逻辑,不能承担结果比较,任何关于谁更好的判断都待验证。
语料配比:固定总时长下人数与深度如何取舍?
这张原表要回答的比较问题是:当总时长固定时,把时间分给更多说话人还是分给每人更长时间,对未见说话人泛化与公平性有何不同。公平条件是总时长相同并在共享测试集上比较,指标方向仍是未见说话人词错误率越小越好、公平性差距越小越好。表头单位保留原文写法,总时长单位为小时,说话人数为人数,每人时长单位为每人分钟数,数据格为裸值。阅读时先看低资源三行总时长相同但人数从少到多,再看高资源两行总时长更大且人数更多,最后思考广度与深度的取舍假设。
| Setting | H (hours) | S (speakers) | M (min/spk) |
|---|---|---|---|
| Low-resource A | 20 | 20 | 60 |
| Low-resource B | 20 | 80 | 15 |
| Low-resource C | 20 | 200 | 6 |
| High-resource A | 200 | 200 | 60 |
| High-resource B | 200 | 400 | 30 |
表后解释主要收益与代价需要回到原文假设。原文假设低资源下优先增加每预算小时的说话人数以避免纠缠,高资源下先保持广泛覆盖再增加每人深度以支持可选个性化。但这只是待验证的假设,不是已报告的结论。代价也很具体:人数多而每人极短时,每人样本可能不足以稳定估计口音,标注与调度成本也可能上升;人数少而每人很长时,模型更容易记住少数嗓音,纠缠风险上升。原文还说精确取值将根据试点运行确定,因此不能把表中的小时数与人数当作最终采集规范,只能当作探索广度与深度权衡的实验网格。
度量清单:四个诊断信号如何联合判读?
由于本文是研究陈述,没有报告定量主结果,因此本节不做胜负判断,只讲若按计划执行应如何联合判读 4 个诊断信号。比较问题是:口音向量到底泄漏了多少说话人信息,以及泄漏是否与下游未见说话人词错误率相关。公平条件要求探针与验证都在说话人互斥划分下进行,避免用已见说话人评估泄漏。指标方向已在前文交代:探针宏观 F1 高意味着泄漏,说话人验证等错误率低意味着容易认人,几何相似度高意味着接近说话人空间,宽松与严格划分的性能差大意味着分数虚高。下表把 4 个操作整理为可执行的检查清单,便于复现时逐项落实。
| 检查项 | 输入 | 输出指标 | 指标方向含义 | 在本文中的作用 |
|---|---|---|---|---|
| 划分对比 | 同一模型与数据 | 宽松与严格划分性能差 | 差大表示膨胀严重 | 暴露分数虚高 |
| 轻量探针 | 口音嵌入 | 说话人预测宏观 F1 | 高表示泄漏 | 量化身份可解码性 |
| 直接验证 | 口音嵌入 | 说话人验证等错误率 | 低表示易区分 | 量化可验证性 |
| 几何对比 | 口音嵌入与说话人向量 | 余弦或中心核对齐相似度 | 高表示接近说话人空间 | 定位表示几何原因 |
表后必须说明限制与反例。即使探针 F1 很高,也只能支持嵌入中含有身份信息,不能直接证明公平性差距就是由它因果导致,还需结合 B1 到 B2 的对照与未见说话人词错误率变化一起看。反例包括:探针太强可能夸大泄漏,探针太弱可能漏检泄漏;等错误率受验证对构造影响大;几何相似度高不等于下游一定变差。
若 4 个信号方向不一致,应优先检查划分卫生与标签质量,而不是直接宣布方法有效。原文明确说将量化幅度并关联未见说话人与口音的词错误率,但未给出数字,因此本节所有判断都停留在方法层面。
若做消融:B0 到 B3 每一步在分离什么?
原文的 E1 本质上是一组待执行的消融。B0 到 B1 分离的是连续口音表示本身是否有帮助,预期要看在说话人互斥划分下词错误率与公平性差距是否变化,若 B1 在已见说话人上好但在未见说话人上差,则支持纠缠解释。B1 到 B2 分离的是梯度反转去说话人化的作用,需要同时看 3 类变化:口音嵌入的说话人探针指标是否下降、与说话人向量的几何相似度是否下降、未见说话人词错误率与公平性差距是否改善,只有三者同向才算干净的证据。
B2 到 B3 分离的是有界条件接入的增量价值,需要确认在纠缠已降低的前提下,条件控制是否进一步改善解码而不重新引入泄漏。原文还提到 Whisper 保持冻结,只有小头与适配器被训练,这意味着消融比较的是表示与条件设计,而不是主干容量。需要指出的缺项是:原文没有说明每个消融的随机种子、重复次数、统计显著性做法,也没有说明是否固定同一数据采样顺序,因此即使未来出现数字,也要先核对这些条件是否一致再谈胜负。
目前只能复述消融逻辑,不能复述任何增益大小。
哪些结论现在还不能下?边界在哪里?
首先是证据边界。本文没有报告主结果数字、消融数字、训练与部署成本、延迟与误判率测量,因此不能承诺词错误率改善、公平性改善、数据采集规则有效或推理开销可忽略。讨论部分对去说话人化降低差距与广度优先采集的表述都是预期与假设,应读作可能或待验证,而不是报告或显示。其次是标签与划分边界。
原文自己提醒 Common Voice 与 CommonAccent 存在自报告标签与划分卫生方面的谨慎事项,口音标签噪声、说话人编号错误、同一说话人跨划分泄漏都会直接影响纠缠度量的可信度。再次是方法边界。对抗去说话人化可能在去除身份信息的同时削弱口音信息,有界调制的界如何选、是否对所有口音都合适,原文均未给出;若口音本身与说话人分布高度相关,完全解耦在概念上也可能受限。最后是资源声明边界。
资源状态证据显示未发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开,只能说本计划基于公开数据集与冻结主干,具备可行性但尚无可运行产物。把这些边界讲清,恰恰是这篇研究陈述对研究生的价值:先学会不被宽松划分的高分误导,再谈改进。
要复现这个计划:先做什么再做什么?
复现应从划分卫生开始。第一步,按说话人互斥原则重做训练、验证与测试划分,并保留一份宽松划分仅用于诊断对比,记录两种划分下同一模型的词错误率差异。第二步,实现口音嵌入提取管线:用冻结编码器得到状态并池化,加小口音识别头输出连续向量,同时保存该向量用于后续探针。第 3 步,实现 4 个诊断:轻量说话人探针、直接说话人验证、与强说话人表示的几何对比、划分对比汇总,确保探针容量固定且评估说话人未在探针训练中出现。
第四步,再实现对抗分支与有界条件,按 B0 到 B3 顺序逐个加入并固定随机种子与采样顺序,每一步同时记录下游词错误率与上游泄漏指标,避免只看一端。第五步,按原语料网格探索说话人数与每人时长的配比,注意原文说精确值待试点确定,因此先用小网格验证趋势再扩大。关键超参数与信息条件在原文中缺失较多,包括池化方式、头维度、损失权重、反转强度、有界范围、优化器与学习率、硬件预算,复现时应把每次选择都记录为待验证假设,而不是当作原文默认值。
何时值得尝试:如果已观察到已见说话人好而未见说话人差,或口音向量能轻易认出人,那么这个去纠缠路线值得一试;如果问题主要来自语言模型或标注错误,则应先修其他环节。
带走什么?一句话复述与后续验证
带走的核心判断是:把带口音识别的不公平先当作表示泄漏问题来测,再用对抗清洗加有界条件来缓解,最后把人数与深度的权衡做成可验证的采集建议。复述方法时应能说清样本路径:语音经冻结编码器池化为连续口音向量,对抗分支去掉说话人可识别性,有界调制把干净线索送入解码器交叉注意力,评估同时看未见说话人词错误率与泄漏探针是否同向改善。支持的依据目前只有方法设计与前人路线 grounding,没有本研究的数字证据。
待验证的是对抗强度与有界范围的选择、低资源广度优先是否普遍成立、自报告口音标签噪声对结论的影响。后续验证至少要补三项:在说话人互斥划分下报告 B0 到 B3 的完整数字与重复统计,在未见口音上单独报告公平性差距变化,在固定总时长下报告不同人数配比的双端指标。常见误解需要澄清:冻结主干不等于输出确定,推理仍受解码策略与输入影响;无训练的诊断部分不等于确定性求解,探针与验证本身也有估计误差。
相关性不等于因果,泄漏下降与词错误率下降同时出现才能更强地支持主张。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses