英文题目:Adaptive Multimodal Expert Specialization by Meta-Learning for Spoken English Assessment
会议身份:
conference:interspeech:2026:conference-paper-id:vu26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#教育 #元学习 #混合专家模型 #音视频 #语音属性识别
评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Cong-Thanh Vu:机构信息未能从会议 PDF 纯文本可靠映射
- Candy Olivia Mawalim:机构信息未能从会议 PDF 纯文本可靠映射
- Hung Le:机构信息未能从会议 PDF 纯文本可靠映射
- Chee Wee Leong:机构信息未能从会议 PDF 纯文本可靠映射
- Guy Sivan:机构信息未能从会议 PDF 纯文本可靠映射
- Shogo Okada:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为青少年升学面试的同步音频、视频与转写文本,输出为口语评价 Spoken English Evaluation(SEE)框架下5维20项分数,难点是样本仅427人且隐私受限难以大规模标注。方法链分4步推进:先将长视频按单话轮步长切分为200秒至250秒重叠片段以构造元任务,再用DisVoice、Qwen3-Embedding-0.6B、OpenFace与轮次统计抽取韵律、语义、面部动作与会话特征,随后经Transformer编码器与注意力池化建模模态间交互,最后由Top-2路由的混合专家模型 Mixture of Experts(MoE)分发给多头打分器并以FOMAML学习可快适应的初始化。与每目标独立LightGBM基线相比,统一主干通过专家分工缓解多评分标准冲突,并以少量梯度适配新口径而非固定模式匹配。在ETS Vericant评测5折交叉验证3次重复设置下,MetaSEE的F1为84.88%,高于基线的F1 81.78%,其均方误差MSE为0.225,低于基线的MSE 0.333。该结论限于短片段分数可代表整段的假设及9岁至16岁非母语面试场景,向成人对话或零样本新题型的外推尚未验证。原文未披露训练、推理或部署成本,代码已在GitHub公开。
🔗 开源与复现资源
- 代码相关资源:https://github.com/cngthnh/meta_see — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
本文解读对象是会议论文自包含正文与本次收到的两张官方原图像素,目标读者是刚进入语音、音乐与音频方向的研究生。解读要做到可核对与可复述:每个关键数字都能回到原文句子,每一步操作都能说清输入输出。论文研究的不是通用语音识别或通用情感计算,而是口语英语自动评分:在学习者语音至关重要但标注稀缺且涉及隐私的条件下,如何给出与人工量规一致的分数。原文明确提出要把系统变成自适应倾听者,而不是一套参数打所有人。
输出包括分类判别与回归分值两类预测,评价围绕 5 个维度展开。代码当前可用,地址为公开仓库链接,本次资源状态显示可用,因此可以写已公开,但权重与数据是否可运行还需按复现节核对。本文不引入证据之外的效果断言,教学举例会明确标注为例子。
要复述全文,先抓住一条样本主线:一段面试视频进来,先被切成小段,再抽声学、文本、轮转与视觉特征,接着进统一投影与编码器做跨模态交互,然后由混合专家路由与多头评分器输出各维度分数,训练时用元学习学初始化,测试时用少量梯度步适配新评分任务。后续各节按学习依赖展开:先讲任务与路线,再讲方法全景与组件计算,然后讲数据构造与训练推理,接着讲实验条件、结果与反证,最后讲复现与收束。术语首次出现会先给白话再给英文名,后文简称固定,便于回指。
背景再确认:为什么不用单一模型打所有人?
补充一个教学例子帮助理解,明确标注为例子而非论文数值。设想 2 位学习者:1 位语速快但填充词多,1 位语速慢但用词准,单一整体模型易被平均梯度拉向中间,对前者高估流利度、对后者低估交互。混合专家的想法是让不同子网络分别记住快语速与准用词的模式,门控按样本选最相关的两个加权,既共享发音共性又保留个性。元学习再解决新老师新量规的问题:不从零训练,而是从一个学过多种评分任务的起点出发,只看少量样本就调好阈值。本文篇幅用于上述计算过程、比较条件与复现细节,不重复摘要与泛泛背景。
术语固定:混合专家后文简称专家结构,模型无关元学习简称元学习,多模态融合简称融合,注意力池化简称池化,准则引导特征简称准则特征。前置概念先于依赖它的结论,例如先讲切段与特征再讲编码器,先讲内外循环再讲适配步数,确保每个指代都能唯一回指。
此前路线走到哪里,为什么还缺一块?
口语能力评估早先依赖人工考官,成本高且等待长。自动评估先定义了发音、流利度与韵律等客观指标,并被证明能表征词汇使用与句式结构等高层语言特征。随后研究向多任务与多场景扩展:在公开演讲中看眼神接触、面部表情与手势控制,在求职面试等对话场景中看发言轮次、身体语言与韵律变化,以预测性格特质与可雇佣性。建模方法上,研究从简单特征拼接转向基于注意力的融合,以刻画复杂的跨模态交互。
另一条线是元学习:在低资源机器翻译与面向任务对话的低资源生成中,元学习通过学任务无关的初始化实现向未见域的快速迁移。论文把这两条线拼起来:隐私敏感的音视频对话严格限制大规模数据可用,传统深度模型在小数据上易失效,因此用增强的元任务学最优初始化,再用混合专家结构对多模态线索做专门化,以在极少训练数据下保持高精度评估。需要区分的是,相关工作只是说明同输入同目标下的演进,不能直接当作同条件胜负,真正的可比性要看后文实验是否固定数据划分与特征集合。
同输入同目标的对照应怎么读?
同输入同目标的对照应锁定音视频面试评分。基线方法对每目标独立训练轻量模型,用多输出包装处理多维度,这在小数据下易割裂维度间联系。新方法用单一主干共享参数,显式建模潜在交互,再用快速适配应对未见任务,因此在总分与各维度上同时领先。同监督方面,两者都用人工量规分数监督,没有引入无监督伪标签。同运行阶段方面,比较都在测试适配后做预测,而非用搜索最优或事后最优代替可部署收益。
另一组对照是特征路线:从拼接走向注意力融合,本文沿后者走,先自注意力交互再池化压缩。教学上可以这样记:拼接是把各模态向量粘在一起,融合是让它们先对话再投票。对话指编码器自注意力,投票指池化加权。类别差异不能当同条件胜负,例如把文本生成任务的元学习增益直接套到评分任务,需重新在评分数据上验证。
要解决的矛盾是什么,研究问题如何表述?
中心矛盾是评分精细度与数据稀缺的冲突:一方面评分量规要求区分范围、准确性、流利度、交互与连贯等细粒度能力,另一方面学习者音视频因隐私难以大规模收集,单一整体模型又难以同时拟合音高、口音、语速与面部动作的多样分布。论文把矛盾拆成两个可检验的研究问题。第一个问题问混合专家结构能在多大程度上捕捉多样特征并给出准确预测,对应结构表达能力。第二个问题问元学习如何在该领域数据稀缺下实现快速适应,对应学习效率。
评价基础采用口语英语评价框架,即与欧洲语言共同参考框架对齐的体系。该体系把能力拆成 5 个核心维度共 20 条细则:范围看话题广度、词汇、迂回表达与语言精确性;准确性看句式、主谓一致、代词、时态与变位介词;流利度看口音、 tempo 与停顿、语调流畅与自由表达;交互看参与、交谈自如、澄清与会话提示。
连贯看会话规划、细节提供与是否跑题。理解这套量规很重要,因为后文多头评分器的每个头正好对应一类评分目标,特征设计也要对齐量规。
问题形式化:输入输出与评价口径是什么?
输入是切段后的多模态特征集合,输出是各评分维度的分类标签与分值。分类标签按阈值 2 分,主数据以 4 为界,面试数据以中位数为界;分值是离散档位,回归按软离散分布预测。评价口径分清聚合对象:主结果是五折平均再做 3 次重复平均,泛化是六折分层平均再做 3 次重复平均,指标是宏平均 F1 与均方误差。数值相同不是同一指标的证据,例如分类 0.849 与回归 1 减均方误差 0.775 量纲不同,不能并列比较。
数据划分与采样按原文交代:切段时长、步长、年龄范围与样本量均已给出,指标聚合如上,统计显著性未报告,因此只能说显著优于基线是数值上的持续领先,不能断言统计显著。硬件预算只给卡型,未给时长与显存占用,复现时需自记。
方法全景:一个样本如何走完输入到输出?
先沿一个样本走全程。输入是一段包含同步音频、视频与转写的面试记录。系统先把长视频切成重叠小段,要求每段包含至少 1 次受访者发言并落在时长范围内,假设切段仍能反映整段质量。接着对每段抽 4 组特征:韵律声学、文本嵌入、轮转与准则引导统计、面部动作直方图,经拼接与标准化后进入模型。
模型先把各模态经线性层加层归一化映射到统一维度,再沿模态维堆叠送入变换器编码器做自注意力交互,然后用注意力池化压成向量,接着由混合专家做加权表征,最后由多头评分器按评分维度分别输出。训练时把每个评分维度看作任务族,用模型无关元学习学共享初始化;测试时在新任务上做少量梯度更新得到适配后模型再预测。
混合专家 × 元学习: 混合专家负责把不同音质、口音和视觉线索分给不同子网络去专门表征,元学习负责学出一组适合快速微调的初始参数,二者搭配的理由是单一参数难以同时拟合相互冲突的评分维度,组合后共享主干保留共性、专家保留个性、初始化保证新评分标准下只用少量梯度步就适配。
下面这张图是理解初始化与适配分工的关键,左半是元训练找最优初始化,右半是在新任务上适配与预测,读者应先看懂箭头主路径再看分支细节。
看图路径: 1. 先沿左侧橙色区到右侧蓝色区的箭头看主路径:多任务找初始化再到新任务适配;2. 再看 theta 与 theta1 撇到 thetan 撇的分支关系,确认谁是共享谁是任务特化;3. 接着看 Grading model 到 Adapted grading model 之间 theta 撇标注的传递含义;4. 最后看底部回流箭头,确认新任务数据如何回送到评分模型
论文图 1。原论文 Figure 1:“Illustration of the learning and rapid adaptation process of the proposed method.”。
从像素可见,左半橙色区画出评分模型经模型无关元学习展开到多个任务特化参数的分支,中间经圆圈参数汇成共享初始化,右半蓝色区从该初始化进入评分模型,再经适配得到适配后评分模型并输出预测,底部还有一条回流箭头表示用新任务数据回送适配。这一布局支持论文的说法:共享部分学可迁移的共性,任务特化部分保留个性,测试时只做少量更新。需要注意,图本身不给出学习率与步数,具体超参数要到实验设置节核对。
组件与计算:特征、编码器与专家各做什么?
特征抽取全部使用已有预训练模型加统计描述,不在本文从零训练声学前端。声学特征用韵律工具抽取 103 维关键韵律特征,包括音高、时长与能量,例子是同一句话用不同停顿与重音会改变能量包络与基频走势,这正是流利度判断的信号。语言特征用轻量文本嵌入模型从转写抽文本向量,用于捕捉词汇与句式。轮转与准则引导特征是统计描述子:发言轮次计数与时长均值、标准差、偏度、峰度刻画对话动力学,词数、独特词比、功能词比、填充词比与语速对齐评分量规。
视觉特征用面部分析工具抽面部动作单元并转成动作单元直方图,例子是微笑与皱眉对应的单元分布不同,可辅助交互判断。
轮转特征 × 准则引导特征: 轮转特征负责统计发言轮次数量与时长分布以刻画对话动力学,准则引导特征负责统计词数、独特词比、功能词比、填充词比和语速以对齐评分量规,二者搭配是因为只看谁说了多久不够,还要看说了什么复杂度,组合后一起构成 Turn 集合,同时支撑交互与流利度判断。
编码器与专家的计算分 3 步。第一步是模态对齐:每个模态表示先过线性层加层归一化,映射到统一维度,目的是让数值尺度与语义空间可比。第二步是交互与压缩:堆叠后的多模态序列送入变换器编码器,用自注意力显式建模模态间关系,再用注意力池化突出最有信息的特征。第 3 步是专家路由与多头输出:采用 16 个专家与取前二的门控路由,每个样本只选最相关的两个专家加权求和,既保留跨评分标准的共性又保留专家个性,也避免每次优化全部权重。专家输出送入多头评分器,每个头专攻一个评分维度,共享主干提供凝练知识,各头做维度特化预测。
多模态融合 × 注意力池化: 多模态融合负责把声学、文本、轮转与视觉表示放到统一语义空间并建模跨模态交互,注意力池化负责在编码器输出中挑出对当前评分最有信息的特征加权求和,二者搭配是因为简单拼接无法表达模态间协同,组合后先用自注意力显式交互再用池化压成紧凑评分向量。
训练与推理:损失、元学习与适配如何衔接?
训练分分类与回归两条损失线。分类用二元交叉熵,这是标准的 2 分类目标。回归不用常规均方误差直接连值,而是用软离散回归:因为英语成绩是整数或 1 位小数的离散档位,模型输出表示各档概率的对数,再组合成损失。回归总损失由四项加权构成:散度项、专家负载均衡项、均方误差项与间隔惩罚均方误差项,其中间隔项惩罚损失超过 0.5 的样本,原文给出权重为 0.01、0.1 与 0.3。分类消融中只用分类损失,回归特有损失在分类表中省略,这是原文表格注释明确说明的,不能把两类指标混在同一列比较。
分类任务 × 回归任务: 分类任务负责把分数按阈值 2 分为低高两类并用二元交叉熵训练,回归任务负责直接预测离散档位的分数分布并用软离散回归损失训练,二者分工是因为教学既需要达标判断也需要精确分值,搭配后同一主干接多头评分器,分类看判别边界、回归看拟合精度,互为对照。
元学习采用 1 阶模型无关元学习以省去 2 阶导数。做法是把每个评分标准看作任务族,先在多个元任务上学共享初始化,使任务特化参数能快速专门化并复用公共表示,元优化时忽略 2 阶导但保持可比性能。推理时分 2 个阶段:先用学到的初始化装配评分模型,再在新任务的少量样本上做梯度适配得到适配后模型,最后输出预测。原文未报告每层参数是否冻结、梯度是否截断与适配时是否重置门控,因此不能从模型名推定这些实现,只能说适配步数与学习率区间由贝叶斯优化在测试阶段搜索,缺项在复现时需补记。
实验条件:数据、划分、指标与调参如何固定?
主数据集是包含 427 名 9 至 16 岁非母语者的大学入学面试集合,含同步音频、视频与转写,覆盖远程与现场会话,采用上述评分量规,并经说话人日志与隐私脱敏处理。为构造元任务,视频被切成 200 至 250 秒片段并以一个话轮为步长滑动,选择该时长是因为 3 分钟片段相对完整视频的信度系数可达 0.95。泛化验证用 138 个模拟面试的求职推荐数据集,片段为 120 至 200 秒,反映回答更短的特点。主实验用五折交叉验证重复 3 次,面试泛化用六折分层交叉验证重复 3 次,分类用宏平均 F1 以平衡不均衡类别,回归用均方误差,误差越小越好。
分类标签按数据集阈值划分:主数据集以 4 分为界,4 分及以上为高组,以下为低组;面试数据集按雇佣推荐中位数 2 分。硬件为单卡,超参数用贝叶斯优化搜索,搜索范围包括内循环学习率、外循环学习率、测试适配学习率区间、每元任务样本数与原始数据训练步数,先做中心点加 8 次拟随机探索,再做 11 次基于代理模型的序列优选,分类最大化 F1、回归最小化均方误差,并用训练集中 10% 留出验证。
内循环学习率 × 外循环学习率: 内循环学习率控制每个元任务上从共享初始化出发走几步多远,外循环学习率控制把多个任务的适应后误差汇总起来更新共享初始化的步长,二者搭配是因为只调其一会要么任务特化不足要么初始化震荡,组合后用贝叶斯优化在给定区间内联合搜索以平衡适应速度与稳定性。
特征组合在结果中记为 4 种配置:韵律加文本、韵律加轮转、面部动作加轮转、韵律加面部动作加轮转,其中轮转集合已包含轮转与准则引导两类。比较公平性要求固定同一特征组合再看结构与学习策略差异,后文雷达图正是固定韵律加轮转后比较基线与新方法,避免把特征增益误记为结构增益。
主结果:在固定特征下提升来自哪里?
主结果要回答在相同多模态配置下,新方法是否同时提升判别与拟合。比较对象是此前对每目标独立训练轻量梯度提升机的方法,新方法用单一混合专家主干共享参数并捕捉潜在交互,再用元学习快速适配。下表聚焦主要目标总分,先看分类:总分从基线到新方法有明确上行,方向是 F1 越高越好;再看回归在下一张表,方向是均方误差越小越好。表前已说明公平条件为同数据划分与同特征集合,指标方向如上,表后会解释收益与代价并点出未胜出项。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 总分同特征同划分 | 分类 F1 | 81.78% | 84.88% | 原文基线方法 |
上表显示总分分类 F1 从 81.78% 提升到 84.88%,支持混合专家加元学习在判别边界上有增益。但总体趋势不等于每组都同幅提升,后文雷达图显示各维度增幅不一,且该表只覆盖总分,不能推广到范围与准确性等细则。未胜出项在原文多配置比较中可见:仅用韵律加文本的配置明显弱于加入轮转的配置,说明文本嵌入 alone 不足以替代对话动力学与复杂度统计,这是具体代价与边界。
| 条件 | 指标 | 基线 | 本方法 | 相对变化 |
|---|---|---|---|---|
| 总分同特征同划分 | 回归 MSE | 0.333 | 0.225 | 下降 32.4% |
上表显示总分回归均方误差从 0.333 降到 0.225,相对下降 32.4%,支持拟合精度大幅收紧。结合摘要大于 84% 的 F1 与 0.225 的均方误差,可复述为分类与回归双线达标。但需注意百分点与相对百分比不同:分类提升约 3.1 个百分点,回归是相对误差缩小约 30%,二者不能直接比大小。不同指标差值也不能并列到同一模型列下,自动指标更不能当成人评。
下面这张雷达图把 6 个维度同时展开,左为分类右为回归,读者应先确认标题与轴名再判断内外圈归属。
看图路径: 1. 先对照左右两幅雷达图的标题,确认左为分类 F1、右为回归 1 减 MSE;2. 再沿 SEE、Range、Accuracy、Fluency、Interaction、Coherence 六个轴逐个比较虚线与实线;3. 重点看右图 Fluency 与 Interaction 轴上两条线的开口差距,判断回归提升是否大于分类;4. 最后核对图例中 Baseline 与 Proposed 颜色线型,避免把内外圈归属看反
论文图 2。原论文 Figure 2:“Performance comparison between the baseline and the proposed model (both using the Prosody-Turn variant).”。
从像素可见,左图六轴数值外圈多在 0.72 至 0.84 区间,右图外圈多在 0.60 至 0.77 区间;黑色虚线为基线,蓝色实线为新方法,蓝色圈在所有分类轴上包住黑色圈,在回归轴上包得更开,尤其流利度与交互轴差距拉大。这支持论文的判断:回归精度优势比分类优势更明显。但像素不能精确读出每步训练曲线,右图纵轴是 1 减均方误差,向上越大越好,不能把数值向下直接读成变差,也不能把末步结果推广为全程最优。
反证:拿掉哪一块会掉多少?
消融要验证每个组件是否必要,比较问题是固定总分目标后,逐个移除或替换会损失多少。公平条件是同数据与同评价,分类看 F1 越高越好,回归看均方误差越小越好。下表整理原文明确用连续句报告的两处反证:去掉元学习与把混合专家换成稠密层,表后解释各自代价并指出未评测边界。
| 条件 | 指标 | 完整方法 | 消融后 | 说明 |
|---|---|---|---|---|
| 去掉元学习同划分 | 分类 F1 与回归 MSE | 84.88% 与 0.225 | 83.93% 与 MSE 上升 | 需元学习捕捉细微评分差异 |
上表显示去掉元学习后 F1 回落到 83.93% 且均方误差上升,支持快速适应对细微评分差异的贡献。另一处反证是把混合专家换成稠密层会显著退化,支持专家结构对复杂多模态模式的建模优势。原文还报告去掉准则引导特征会导致大幅退化,去掉间隔损失、负载均衡与散度项会分别带来不同程度的回归误差上升,但这些数值在本次证据中没有完整连续句覆盖,因此本表不硬写具体小数,只定性转述方向,避免编造精度。未评测边界是推理延迟与标注成本均未测量,不能承诺这些量同步改善。
面试数据集的泛化结果显示,在单次六折分层验证下 F1 可超 70%,但严格评估取 3 次重复平均后仍与专用求职面试方法可比。原文明确该模型并非为求职面试设计,能适配已说明通用性,但平均后数字低于单次最优,报告时应以平均为准,不能用单次最优代替可部署收益。
哪些结论有边界,什么还没有被证明?
先区分 3 类表述。论文直接报告的是总分分类与回归数字、多配置排序与消融方向,这些有证据,可用报告或显示来复述。有限解释是混合专家捕捉多样特征与元学习实现快速适应,这有多组对照支持,可用支持来表达,但仍受特征集合与切段假设限制。未验证推测是向低资源域无缝部署与学习者中心教育的推广,这属于可能或待验证,不能当成已测量的延迟、成本或教学效果。
具体限制有三点。第一,方法依赖预训练特征,原文讨论节明确这是瓶颈,可能限制域敏感性与细粒度特征捕获,后续想引入自监督与大语言模型来补。第二,切段能反映整段的假设基于信度系数,但长时依赖与跑题等连贯问题在短段中可能被截断,适用条件需补做不同段长敏感性分析。第三,训练资源只报告单卡类型,未报告时长、参数量与推理开销,输出帧率与实际延迟分别缺失,因此不能从总体趋势推定每组每步都成立,也不能承诺误判率已测。相关性不是因果,分数拟合好不等于教学反馈有效。
要复现,先做什么,需要哪些信息条件?
复现先做三件事。第一,取公开代码仓库并核对提交版本,按环境文件装韵律工具、面部分析工具与文本嵌入模型,确认转写与说话人日志管线可运行,因为特征是后续一切的输入。第二,按原文切段规则复刻元任务:主数据 200 至 250 秒、一步长一话轮且含受访者发言,面试数据 120 至 200 秒,并固定五折与六折划分种子与 3 次重复,否则数字无法对齐。第三,先跑韵律加轮转这一最强可比配置的基线,再切到 16 专家前 2 路由加 1 阶元学习,对比总分 F1 与均方误差是否复现从 81.78% 到 84.88% 与从 0.333 到 0.225 的变化。
关键超参数保留原文区间:内循环、外循环与测试适配学习率区间、每元任务样本数与训练步数,以及回归损失中 0.01、0.1 与 0.3 的权重。信息条件上,代码开源不等于权重可下载与系统可一键运行,数据因隐私不太可能完全公开,需用自有面试数据或公开面试数据替代并重新定阈值。还需补的验证是不同段长、不同阈值与跨年龄段的稳定性,以及去掉准则引导特征后的回落是否复现,以确认增益来源。
何时值得尝试,一句话如何记住它?
当你的任务也是小数据多维度评分,且输入同时有声音、文本与面部线索时,这套组合值得尝试:用专家分工解决多样性,用元初始化解决样本少。但若数据已充足或只需单一总分,16 专家与双层优化可能带来不必要的调参与计算负担,不如先试单主干加多头。常见误解是把注意力池化当成性质证明,其实它只是加权选择,真正的效果来自跨模态编码与专家路由的配合;另一个误解是把切段假设当成定理,它只是为构造元任务的工作假设,需用信度与敏感性分析支撑。
记住一句话:把长面试切成可比小段,用统一编码加前二专家做出多维度分数,再用元学习学一个好起点,新标准下只走几步就适配。复述时沿输入到表示到组件到目标到输出的顺序讲,先说样本经历什么,再说公式与损失要优化什么,最后用固定特征下的对照数字收束,不把比喻当证明,不把单次最优当平均收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

