英文题目:How Frequency Band Importance Affects Neural Network Predictions and Human Perception for Speech Quality Assessment
会议身份:
conference:interspeech:2026:conference-paper-id:lamba26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#主观评测 #模型比较 #可解释性 #语音 #语音质量评估
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Ada Lamba:机构信息未能从会议 PDF 纯文本可靠映射
- Donald S. Williamson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音质量评估以预测平均意见分逼近人类感知为目标,输入为含噪与增强语音的频谱特征,输出为 utterance 级质量分,难点在于深度模型在未见数据上常与人类判断失配且根因不明。本文先用沙普利加性解释计算各50Hz频带的局部贡献并聚合为全局平均趋势,再用部分依赖图刻画平均幅度与预测的全局响应关系以上一步趋势进入对比,然后用单频带幅度缩放扰动验证预测变化方向是否一致。听音实验将原始与扰动语音配对呈现,收集质量打分、偏好选择与噪声量等四因素归因,从而对照人与模型的敏感频带。与已有单模型单方法解释相比,该链条同时覆盖局部归因、全局平均与扰动验证,并引入200人人类对照,具有实际对照意义。在IUCOSINE测试集扰动评测下,SCOREQ的Pearson相关系数为.998,高于DNSMOS的Pearson相关系数.951。结论仅适用于卷积与 wav2vec 2.0 类质量模型在窄带幅度扰动下的行为,未验证混响、编解码与真实增强失真等外推场景。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
语音质量评估要解决什么问题,为什么只看准确率不够?
输入是一段可能带噪声、失真或增强处理残留的语音,目标是输出一个接近人类平均打分的分数。论文研究的任务是自动语音质量评估,也就是预测平均意见分。平均意见分白话是请很多人听同一段语音,每人给 1 分很差到 5 分很好,再把所有人的分数平均。自动评估的价值在于评价语音增强与噪声抑制系统时不用每次都做昂贵的人工听音。
论文开篇指出的问题是深度网络在新数据上预测与人类评分经常对不上,尤其在未见过的数据上相关性偏低。如果只看误差下降就部署,开发者不知道模型依据哪些频率成分做决定,也不知道偏差来自决策方式不同还是工程参数不同。因此论文把可解释性当作诊断工具,先找出对预测影响最大的频率带,再用同样扰动去问人是否敏感。
平均意见分 × 语音质量评估: 平均意见分分工是请多人听同一段语音后取平均,给出人类感知的真值;语音质量评估分工是让模型自动预测这个平均分,替代昂贵的人工打分。搭配理由是自动评估只有逼近人类平均感知才有使用价值,组合意义在于本文所有解释与听音都要回到预测变化方向是否与平均意见分一致来判断。
本解读的输入是论文正文证据与官方原图像素,目标是让刚入门的研究生能复述方法与实验条件。必须保留的信息包括 3 个模型名称与输入表示、161 个 50 赫兹频带的划分、评估集构成、3 种解释方法的操作、听音实验的配对与量表。输出是 1 篇按学习依赖展开的技术解读,不做超出证据的效果承诺。资源状态方面,本次未发现来源绑定且完成安全验证的资源,因此不得声称代码、模型或数据已公开,只能按论文文字说明原实现与权重来源。
已有的解释方法走哪几条路线,本文为何选这三种?
论文把全局解释分成数据驱动与模型驱动。数据驱动解释输入如何影响预测,模型驱动关注权重与激活等内部机制。梯度类方法用偏导数给神经元分配相关性,层间相关性传播与谱相关性分析在反向传播中把相关性画成热力图,但需要人工判读。扰动类方法做最小改动看输出变化,激活最大化找让某神经元最兴奋的输入模式。
聚合局部解释得到全局解释的代表有 SP-LIME 与全局归因分析,但需要对每个输入训练局部近似模型,计算贵且对样本选择敏感。沙普利值用博弈论给每个参与者分配贡献,已用于音频预测网络的数据价值评估,但多用于筛选数据而少用于分析输入特征行为。论文选择沙普利加性解释、部分依赖图与扰动分析的理由在正文写得很明确,两者易于解释且定量。
研究空白是此前语音可解释工作多局限于一个模型或一种方法,少有结合人类听音。本文的对照思路是多个网络乘以多种方法再乘以人类感知,只有三者同向才能说趋势通用,否则只能说是某种方法或某个网络的特例。这种设计把方法比较与模型比较放在同一频带操作下,避免把方法差异误读为模型差异。
要回答的具体问题是什么,比较的公平条件是什么?
具体问题有两个。第一,3 个质量评估模型做预测时最依赖哪些频率带,依赖方向是推高还是拉低分数。第二,人类在同样频带被同样缩放时评分是否同向变化,以及人自述的影响因素分布是什么。要让比较公平,论文做了三处统一。输入统一为 161 个频带、每带宽 50 赫兹,MOSNet 为此重训练以与其他网络对齐,作者报告重训练未带来实质性能变化。
评估数据统一用与 3 个模型训练集都不重叠的 IUCOSINE 测试集中随机抽的 100 条,且保持与原测试集相同的真值分布。讨论的频带统一先取有感知依据的 6 个带,再按每个模型平均沙普利幅度最大的带补足到 9 个,避免只挑对自己有利的带。指标方向需要先讲清,沙普利值为正表示纳入该带会抬高平均预测,为负表示拉低预测,幅度绝对值越大表示影响越强。
扰动实验中缩放因子大于 1 表示放大该带功率,小于 1 表示衰减,纵轴是预测或人评的平均意见分,1 到 5 为有效区。例子是把 40 带的功率乘以 10 后看预测上升还是下降,如果模型上升而人下降,就说明两者决策方向不一致,不能简单说模型学会了人类感知。
三条解释路线如何组成一条可复述的证据链?
先沿一个样本走完全程。取一条 IUCOSINE 语音,算幅度谱得到 161 个频带随时间变化的表示。模型给出一个整句平均意见分预测。第一步用沙普利加性解释估计每个频带对这个预测的贡献,正值记为推高,负值记为拉低,对 100 条样本平均后得到每个频带的平均贡献与平均幅度。
第二步用部分依赖图固定要考察的频带取不同幅度值,对数据集中所有其他特征取平均,画出预测随该带幅度变化的全局曲线。第三步做扰动验证,只把某一个频带在每 1 帧的功率乘以给定因子之一,保持原始相位转回时域,再看模型预测如何变。第 4 步把同样逻辑搬给人听,选 8 条源信号覆盖不同真值与男女声,对选定频带做缩放,与原声组成随机顺序的配对,让被试对每段打 5 分制质量分并选偏好。
扰动分析 × 听音研究: 扰动分析分工是只缩放一个频带的功率后重合成时域信号再看预测如何变,属于主动因果探针;听音研究分工是把同样原始与扰动配对交给人打分并标注影响因素,属于人类感知对照。搭配理由是只看模型曲线无法知道人是否同向变化,组合意义在于用相同频带与可比缩放因子实现人与网络在同一操作下的直接比较。
这 4 步的衔接理由是局部归因提出假设,全局曲线检验稳定性,扰动检验因果方向,听音检验人类是否同向。缺少任何一步都会留下缺口,只看归因不知道因果,只看模型不知道人类。只有 4 步同向才能支持网络与人类关注相同频带,否则需要回到架构或数据找原因。
三个组件各自算什么,输入输出与实现细节是什么?
沙普利加性解释的输入是模型预测函数与一条样本的 161 个频带特征,输出是每个频带的分值。计算目标是加权平均所有不含该频带的子集加入该带前后的输出差,满足局部准确、可缺失与一致性。论文强调分值本身绝对数值不重要,重要的是符号与相对大小。部分依赖图的输入是指定频带的不同取值与数据集中其余特征的经验分布,输出是一条预测随该带幅度变化的曲线。实现是把其余特征在数据集上平均,相当于对边缘分布积分。
SHAP × 部分依赖图: SHAP 分工是对单个样本解释每个频带把平均预测推高还是拉低,属于局部归因;部分依赖图分工是固定某频带取值后对所有其他特征取平均,属于全局趋势。搭配理由是局部归因可能受样本特异性影响,需要全局平均核对方向是否稳定,组合意义在于论文用两者趋势线是否一致来检验频带重要性结论是否可信。
扰动分析的输入是选定的频带编号与缩放因子,操作是逐帧缩放该带功率后用原相位逆变换回时域,输出是新预测与新的人评分。1 次只改一个带,保持其他带不动。这种朴素单带扰动会破坏频带间天然相关,因此听感上可能引入额外失真,这一点在解释人类评分下降时必须记住。
MOSNet × DNSMOS: MOSNet 分工是 17 层卷积回归网络从幅度谱预测整句平均意见分,本文用 161 频带的重训练版本;DNSMOS 分工是 14 层卷积回归模型,本文只取总体质量预测。搭配理由是两者都是卷积路线且都以频谱带为输入,便于在同一频带划分下比较,组合意义在于一个行为异常而另一个相对稳定时可以定位是架构与训练数据差异而非输入划分差异。
模型侧的实现需要如实记录。MOSNet 是 17 层卷积回归网络,输出整句平均意见分,中间层可取帧级分,本文用原实现重训练以接受 161 带输入。DNSMOS 是 14 层卷积回归模型,原输出三项,本文只取总体质量,用原实现与原权重,输入为对数功率谱。
SCOREQ × wav2vec 2.0: wav2vec 2.0 分工是先用多层卷积编码器加 Transformer 从波形学习表示,提供自监督语音表征;SCOREQ 分工是在此基础上先用三元组对比损失训练编码器与投影头再冻结主干训练线性平均意见分预测头,把对比表示转成质量分数。搭配理由是其输入不是直接的 161 带谱特征但解释仍映射回频带扰动,组合意义在于检验基于大模型表征的质量头是否仍表现出与卷积模型相似的低频依赖。
SCOREQ 是 wav2vec 2.0 变体,先用三元组对比损失训练编码器与投影头,再冻结编码器与 Transformer 用均方损失训练线性预测头,用原实现与原权重。论文未报告三者在 IUCOSINE 上的再训练超参数,因为除 MOSNet 输入适配外并未在 IUCOSINE 上训练,这是需要指明的缺项,不能从模型名推定训练细节。
本研究有没有训练,权重与数据到底怎么来的?
本研究没有在 IUCOSINE 上训练新的质量预测权重,这是必须先说清的一点。3 个模型的权重都来自原实现。MOSNet 在 VCC-2018 上训练,DNSMOS 在 DNS 挑战数据上训练,SCOREQ 在 NISQA 训练仿真集上训练。唯一的例外是 MOSNet 为了对齐 161 带输入做了重训练,论文报告性能没有实质变化,但未给出学习率、轮数与优化器细节。
因此复现时只能按原仓库默认流程并记录自己使用的配置,不能把本文当作提供了完整训练配方。IUCOSINE 本身的来源是把麦克风固定在人口、肩、喉与胸部记录日常对话,再由前人工作做众包质量标注,得到 14400 条训练与 3600 条测试。本文的 100 条评估集是从测试集中按真值分布随机抽取,8 条听音源信号再从这 100 条中按真值与性别分层抽取。
听音实验不更新任何模型参数,只是收集人类评分。计算环境为 48 核双路至强或英伟达 V100,论文未报告 3 类解释各自的耗时与内存,因此不能承诺推理开销或延迟改善。把无训练等同于确定性求解是误解,模型推理仍依赖权重与输入分布,换数据就可能换行为。
评估集、频带选择与听音流程如何保证可重放?
数据划分上,所有解释与扰动曲线都基于同一 100 条评估集,部分依赖曲线按正文说法在整个 IUCOSINE 数据集上计算,听音只用其中 8 条源信号。每条源信号对应 60 个配对,来自 15 个频带乘以多种呈现,含原声对原声的锚定题。每位被试随机分到 4 个块共 16 对,顺序随机,先对每对中两段分别打 1 到 5 分再选偏好,最后对 4 个因素标注帮助、中性或伤害。
被试经 Prolific 招募,要求英语流利、在美居住至少 5 年且自报听力正常,用 Qualtrics 施测,平均用时 17.9 分钟,标准差 7.5 分钟,男女各约一半,年龄多在 30 到 49 岁。下表要回答的比较问题是不同频带的选择依据是否一致,公平条件是通用感知依据与模型特异依据分开标注,指标方向是频带编号越小对应频率越低,缩放因子大于 1 为放大。
| 分组 | 频带编号 | 频率范围 | 选择依据 | 适用对象 |
|---|---|---|---|---|
| 通用低频 | 3–5 | 150–300 Hz | 覆盖青年男女基频均值范围 | 全部模型 |
| 通用中频 | 31 | 1550–1600 Hz | 被引为辅音重要带 | 全部模型 |
| 通用高频 | 40–41 | 2000–2500 Hz | 被引为元音重要带 | 全部模型 |
| 模型特异 | 14,15,26 | 按平均沙普利幅度最大选取 | 经验分析决定 | DNSMOS |
| 模型特异 | 6,12,17 | 按平均沙普利幅度最大选取 | 经验分析决定 | MOSNet |
| 模型特异 | 2,20,21 | 按平均沙普利幅度最大选取 | 经验分析决定 | SCOREQ |
表后解释需要同时说收益与代价。通用带的好处是 3 模型可在相同感知锚点上比较,避免各说各话,代价是可能错过每个模型真正的峰值带。模型特异带的收益是抓住平均沙普利幅度最大的位置,代价是选择本身依赖解释结果,存在循环论证风险。扰动网络侧用 0.25 到 1000 六档,人侧用 0.5、10 与 1000 三档,依据是网络曲线形状主要由这三档决定。未胜出项是小于 1 的衰减扰动对模型预测影响很小,说明衰减方向区分度不足,不能只用衰减做对照。
网络更依赖哪些频带,扰动方向与人类是否一致?
基线性能先给出可比口径。论文在 IUCOSINE 测试集上报告均方误差越低越好、线性相关与斯皮尔曼相关越高越好。下表把 3 模型在同一数据集、同一指标下的基线放在一起,比较问题是脱离训练集后谁还保持与人类排序一致,公平条件是都不在 IUCOSINE 上训练,指标方向按表头箭头理解。
| 模型 | 数据集 | 均方误差越低越好 | 线性相关越高越好 | 斯皮尔曼相关越高越好 |
|---|---|---|---|---|
| DNSMOS | IUCOSINE 测试集 | 0.3890 | 0.2317 | 0.1981 |
| MOSNet | IUCOSINE 测试集 | 0.5248 | 0.1877 | 0.1981 |
| SCOREQ | IUCOSINE 测试集 | 0.4624 | 0.6283 | 0.6249 |
表后解释需要同时说收益与代价。SCOREQ 的排序相关优势支持其对比表示在未见数据上仍保持单调性,但其均方误差不是最低,说明绝对分值仍有偏差。DNSMOS 误差最低但相关偏低,说明分值靠近均值但排序能力弱。MOSNet 两项都弱且后文出现无效分数,是未胜出项,提示其窄带低频依赖可能是原因之一,但这属于有限解释而非因果证明。
以下导读针对平均沙普利随频带变化图。该图有 3 个子图,每个横轴是频带编号,纵轴是平均沙普利值,蓝色柱为方向,橙色虚线为幅度,横轴标注每带宽 50 赫兹。
看图路径: 1. 先看横轴频带编号与每带 50 赫兹含义,再看蓝色平均 SHAP 柱高于零还是低于零;2. 再看橙色虚线平均幅度在低频段是否明显高于高频段;3. 比较三个子图中高频段蓝色柱是否趋平或转负
论文图 1。原论文 Figure 1:“Average SHAP values and average magnitude of SHAP values by frequency band for DNSMOS, MOSNet, and SCOREQ across 100 randomly selected test files.”。
该图显示三者都更依赖低频,但集中程度不同。MOSNet 在 40 带之后几乎无影响,低频少数带幅度极高,高频趋平。DNSMOS 低频多为正向、高频多为负向,分界最清晰。SCOREQ 几乎所有带都有非零影响,低频正向更强,高频仍有小正向。论文据此推测 DNSMOS 的低正高负分工可能是其基线相对较好的原因,但明确这是其他工作提示而非本文因果检验。
以下导读针对扰动随缩放因子变化图。左侧三块是网络平均预测,右侧三块是对应人类平均评分,横轴为缩放因子,纵轴为平均意见分并标出有效区,图例区分不同频带。
看图路径: 1. 先看左侧三块网络曲线随缩放因子从小到大的变化方向是上升还是下降;2. 再看右侧三块人类曲线是否都随放大而下降;3. 注意 MOSNet 左侧曲线是否冲出有效区而右侧人类曲线仍在有效区内下降
论文图 3。原论文 Figure 3:“Effect of perturbation on DNSMOS, MOSNet, and SCOREQ network behavior (left; 3a, 3c, 3e) and human ratings (right; 3b, 3d, 3f).”。
该图显示 DNSMOS 最稳定,预测多在 2 到 3 分之间,放大总体拉低分数,仅高频带在 10 倍处略有回升。SCOREQ 同向但更激进,到 1000 倍时跌到 1 分附近。MOSNet 除个别低带外随放大而上升,甚至冲出 5 分上限,出现无效预测。右侧人类三块形状基本一致,任何单带扰动都让评分低于原声,说明朴素单带扰动本身引入可感知的失真。论文报告 DNSMOS 与 SCOREQ 多带与人类强正相关,MOSNet 多带为负相关,这支持前两者与人类同向而后者反向的判断。
局部归因与全局曲线是否互相印证,哪里出现分歧?
本节把沙普利散点与部分依赖曲线当作互检。做法是对 40 带画出 100 条样本的沙普利值随带平均幅度的散点并拟合趋势线,同时画出固定该带不同幅度时平均预测的曲线,再算两者相关。理想情况是趋势线斜率与曲线走向一致。论文选择 40 带讨论是因为它在 MOSNet 与 SCOREQ 上有最强正或负相关,而 DNSMOS 最强相关在 15 带,后者也是沙普利影响最强的带。
以下导读针对该对照图,每行对应一个模型,左侧散点颜色表示预测分数,右侧曲线纵轴为预测分数,横轴为平均幅度,右侧文字给出趋势线方程与相关系数。
看图路径: 1. 先看左侧散点横轴平均幅度与纵轴 SHAP 值,再看黑色虚线趋势线斜率;2. 再看右侧部分依赖曲线随幅度增大是上升还是先升后降;3. 对照右侧文字给出的趋势线与曲线相关系数的正负
论文图 2。原论文 Figure 2:“SHAP values (scatter points, left side of figure, colored by predicted MOS of the file) of 100 randomly-selected test files and PDP curves (right) for DNSMOS, MOSNet, and SCOREQ.”。
该图显示 MOSNet 一致性最好,散点趋势与曲线都随幅度增大而上升,但论文指出其散点多为零导致拟合较弱。DNSMOS 与 SCOREQ 的趋势线与曲线呈负相关,原因是大量沙普利值为零使趋势线拟合不佳,但在负 20 到 0 分贝区间内 DNSMOS 散点多为负且曲线下行,方向仍可对应。SCOREQ 曲线在负 20 分贝以上明显下行,与扰动中放大导致降分的结论一致。反证意义在于不能只看相关系数的正负就否定方法,零膨胀与非线性都会拉低线性相关,需要结合扰动因果探针再下结论。未评测的边界是只详细讨论了 40 带,其他 8 个带只说趋势相似而未逐一展示数值,因此不能把 40 带的强相关推广到所有带。
人类自述因素与分数如何对应,有哪些解释限度?
人类定量对照之外还有定性自述。被试在打分后对噪声量、语音相对噪声响度、失真与噪声类型 4 个因素标注是帮助、伤害还是无影响。论文直接报告的数字是失真伤害占比最高,信噪比帮助占比最高但伤害与帮助分布最均匀。所有因素的帮助都是少数,伤害时平均分都低于中性与帮助时,这支持人与网络都对拉低因素更敏感。
具体而言,论文报告失真有 59.8% 的被试报告伤害了质量评分,信噪比有 35.8% 的被试给出积极回应,失真伤害时平均意见分为 2.75,信噪比伤害时平均为 2.64 且为最低。这些数字支持负向敏感,但论文也提醒这可能是措辞效应,被试把噪声与失真天然理解为负向词,缺少噪声被记为中性而非帮助。平均分最高出现在噪声与失真被标帮助时,最低出现在信噪比被标伤害时,中性到负向的落差大于中性到正向的升幅,进一步支持负向敏感,但不能当作因果证明。
以下导读针对因素响应堆叠柱状图,横轴为 4 个因素,纵轴为计数,柱内标注百分比,颜色区分伤害、中性与帮助。
看图路径: 1. 先看横轴四个因素分别对应噪声、信噪比、失真与噪声类型;2. 再看每根柱内伤害段与帮助段的相对高度;3. 注意信噪比柱的帮助段是否明显大于其他三根柱
论文图 5。原论文 Figure 4:“Frequency of response type by factor.”。
该图可见失真柱的伤害段最大,信噪比柱的帮助段明显大于其他柱,噪声类型柱的中性段最大。像素细节支持正文百分比,失真伤害与信噪比帮助的标注可直接读出。限度在于单带扰动破坏了频带间天然相关,被试听到的很可能是新增的失真而非干净的频带增强,因此人类评分下降不能等同于该频带本身不重要。架构限度是 MOSNet 只用了无双向长短时记忆的卷积版本,未来换回卷积加双向长短时记忆版本可能改变窄带依赖结论。方法限度是只解释输入频带,未用白盒梯度与激活解释内部机制。
要复现这条证据链,先做什么、记什么?
先准备数据与权重。按论文文字用原仓库与原权重获取 DNSMOS、MOSNet 与 SCOREQ,记录提交哈希与权重来源,不声称已公开可下载。MOSNet 需改为 161 带输入并记录重训练配置,论文未给超参数时用原仓库默认并如实注明。将 IUCOSINE 测试集按真值分布抽 100 条,固定随机种子并保存文件清单,再从中按真值与性别分层抽 8 条听音源信号。
然后跑 3 类计算。对 100 条算每带平均沙普利值与幅度,画出随频带变化图。对关注的 9 个带算部分依赖曲线并与沙普利趋势线算相关,注意零膨胀会导致线性拟合差。对 100 条做六档单带缩放并用原相位重构,记录平均预测随缩放因子的曲线。听音侧用三档生成配对,随机顺序呈现,收集 5 分制分数、偏好与四因素三分类标注。
统计时先算扰动前后均值,再算模型曲线与人类曲线的皮尔逊相关并报告显著性。还需补的验证是多带联合扰动、真实噪声类型对照与卷积加双向长短时记忆版 MOSNet 的重复实验,否则不能把单带结论推广到实际增强系统。复现报告应明确区分论文直接报告、有限解释与待验证推测,不把相关高写成因果对齐。
何时值得借用这套做法,什么误解要避开?
当你的质量模型在新数据上排序相关偏低且怀疑其只看局部频段时,值得借用先局部归因、再全局平均、再单带扰动、最后小规模听音对照的流程。它成本低于重训大模型,又能定位是决策频带不同还是单纯分数偏移。本文证据支持的判断是 DNSMOS 与 SCOREQ 放大扰动降分与人类同向,MOSNet 放大反而升分且可冲出有效区,三者都集中用低频但 MOSNet 最窄。
可能的后续是给 MOSNet 加回时序建模或拓宽有效输入,以及在数据集构建时关注低频保真。需要避开的误解有 3 个。第一,沙普利幅度大不等于该频带感知上最重要,它只说对该模型平均预测影响大。第二,人类评分下降不证明被放大的频带无用,单带破坏相关性本身就是一种失真。第三,相关高不等于因果对齐,只有扰动同向加自述因素一致才能说支持对齐,仍需多带与真实场景验证。
最终收束是统一解释框架的价值。对开发者而言,多网络多方法的趋势加人类对照可以指导改架构还是改数据。对语音听觉研究者而言,知道模型关注低频而人也对失真敏感,可以更有针对性地设计数据集与评价基准。本文是第一步而非终点,白盒解释与多带真实扰动仍是缺项。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



