英文题目:Orthogonal Feature Projection and Manifold-Constrained Neural PLDA for the TidyVoice2026 Cross-Lingual Speaker Verification Challenge
会议身份:
conference:interspeech:2026:conference-paper-id:du26c_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#模型融合 #自监督学习 #跨语言 #说话人验证
评分:7.0/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前50% | 文档类型:系统技术报告
👥 作者与机构
- Yuxuan Du:机构信息未能从会议 PDF 纯文本可靠映射
- Xing He:机构信息未能从会议 PDF 纯文本可靠映射
- Jingwen Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Xupeng Jia:机构信息未能从会议 PDF 纯文本可靠映射
- Yankai Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Weili Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Boyu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Rong Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Deng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言说话人验证(Speaker Verification,SV)需判断注册与测试语音是否属同一说话人,难点在于训练语言不平衡使模型将语言线索与身份纠缠,导致跨语言目标误拒与同语言非目标误收。所提系统先以冻结的残差网络(Residual Network,ResNet)提取监督说话人向量并以自监督模型(Self-Supervised Learning,SSL)WavLM Base+提供补充表示,经线性对齐与格拉姆施密特正交分解剥离冗余平行分量并保留互补正交分量。然后零初始化门控瓶颈网络将正交分量非线性滤噪后残差注入主向量,形成语言无关增强嵌入。接着单线性变换矩阵将嵌入映射至对角化空间,仅学习特征值向量以解析生成计分矩阵并保持对数似然比形态,再以跨语言难目标与单语言难非目标挖掘做判别微调。与官方基线相比,该融合系统在TidyVoice2026评测集Track 1上等错误率(Equal Error Rate,EER)达1.39%,相对基线9.06%大幅下降。结论限于Common Voice衍生多语言短语音验证,未验证信道剧变、时长极短或未见语系的外推能力。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
跨语言说话人确认难在哪里?
输入是本解读的依据与目标。依据只有论文原文证据与本次收到的官方原图像素,不引入其他解读。目标是让刚进入语音领域的研究生能复述方法、核对实验条件与结果。本文必须保留的信息包括模型结构、训练阶段划分、数据规模、打分流程与关键性能数字,输出是 1 篇可核对的技术解读。
说话人确认要回答的问题很具体:给一段注册语音和一段测试语音,判断是否为同一人。白话说,系统先把每段语音变成固定维度的向量,即说话人嵌入,然后在后端计算两段向量是否来自同一人的分数。英文称为 automatic speaker verification,简称 ASV。常规做法在训练语言与测试语言一致时尚可,但当注册与测试语言不同时,模型容易把语言特点当成身份特点。例如同一人说中文和英文时韵律与音素差异很大,模型可能误判为 2 人;而不同人说同一种语言时共享的语言特征又可能让模型误判为同一人。
本次挑战的背景是 TidyVoice2026 跨语言说话人确认挑战,英文为 TidyVoice2026 Cross-lingual Speaker Verification Challenge。论文报告其使用源自 Mozilla Common Voice 的大规模多语言语料,目标是鼓励语言无关的系统。评价指标是等错误率,英文为 equal error rate,简称 EER,以及最小检测代价,英文为 minimum detection cost function,简称 minDCF。EER 越低越好,它对应误接受与误拒绝相等时的工作点。理解这一点后,才能看懂后文为什么要专门构造跨语言正样本对和单语言负样本对。
已有路线为什么不够用?
论文把已有工作分成前端特征提取与后端打分两条路线。前端方面,自监督模型例如 WavLM 和 w2v-BERT 2.0 通过掩码预测与对比学习从大量无标注数据学到丰富声学与语言内容,显著提升了泛化。白话说,自监督是指不靠人工说话人标签,而是靠遮住一部分语音再预测、或拉近拉远样本对来学习表示。后端方面,余弦相似度仍是主流,即直接算两个嵌入向量的夹角余弦。为了超过余弦,近年工作把概率线性判别分析融入深度学习,英文为 Probabilistic Linear Discriminant Analysis,简称 PLDA。
论文指出两类神经 PLDA 的局限。第一类是 Neural PLDA,它把传统统计参数包括核心打分矩阵 P 和 Q 变成神经网络中相互独立的可学习权重。白话说,原来 P 和 Q 之间有协方差推导出的代数关系,直接当独立矩阵学习就切断了这种联系,论文认为这偏离了有效的概率生成流形,在有限数据上容易过拟合。第二类是 PLDA-diag,它通过约束类内协方差在现代特征上超过余弦,但主要关注信道补偿,跨语言性能受限。也就是说,已有后端更擅长处理设备与信道差异,没有专门压制语言干扰。因此本文的前端要做语言无关的解耦,后端要在保持生成式约束的前提下做判别优化。
本文要解决的具体问题是什么?
论文要解决的是模型过度依赖语言相关特征的问题。训练数据存在语言不平衡,模型会把语言线索与说话人身份纠缠,导致跨语言泛化严重受限。举例说明时需要标明这是教学例子:例如注册语音是中文,测试语音是英文,即使是同一人,语言切换带来的变化也可能压过身份相似性;反之两个不同人都说英文,共享的语言特征可能抬高相似度分数。这正是后文难样本挖掘要针对的两种情形。
论文把任务拆成 3 个可操作的子问题。第一,前端如何利用自监督表示的泛化能力,同时丢弃其中的语言干扰。第二,后端如何在判别优化打分性能的同时,不破坏 PLDA 作为高斯假设下对数似然比的可解释性。对数似然比英文为 log-likelihood ratio,简称 LLR,它比较同一说话人假设与不同说话人假设下观测到两个嵌入的概率比。第三,训练时如何让模型显式学会忽略韵律与音素变化、并严惩因共享语言导致的误接受。后文的 3 阶段前端、2 阶段后端与动态难样本挖掘分别对应这 3 个子问题。
系统全景:一个样本走完全流程
先沿一个样本走完输入到输出。输入是一段语音波形,前端同时走两条分支:冻结的 ResNet 分支提取有监督说话人向量,冻结的 WavLM Base+ 分支提取自监督向量。自监督向量先经可学习线性层对齐到与监督向量相同维度,再做正交分解,只保留与监督向量垂直的互补分量。该分量经非线性瓶颈变换与门控系数加权后,以残差方式加回监督向量,得到最终融合嵌入。后端把注册与测试的融合嵌入先做仿射变换到对角化空间,再由当前特征值向量生成打分矩阵 P 和 Q,计算 2 次型分数,最后经自适应分数归一化与逻辑回归分数融合得到校准后的对数似然比。
这个全景包含 3 个阶段的依赖关系。前端依赖大规模说话人数据先练好 ResNet,再冻结双分支只训练融合模块;后端依赖前端提好的嵌入先用期望最大化算法估计生成式 PLDA,再迁移到流形约束的神经 PLDA 做判别微调;训练样本组织依赖语言标签构造对抗性样本对。理解这个顺序很重要,因为后文的消融是按此顺序逐项叠加的,不能把后端的提升归因于前端,也不能把融合的提升归因于单个系统。
前端如何只取互补信息?
前端的核心动作是正交特征投影融合,英文为 orthogonal feature projection fusion。白话说,投影是指把一个向量往另一个方向上做影子分解;正交是指两者垂直、不重叠。记监督向量为 eres,自监督向量为 ewavlm。对齐后的自监督向量记为 ewav。
方法先算 ewav 在 eres 方向上的平行分量,记为 epara,它代表 ResNet 已建模的冗余说话人信息;再用 ewav 减去 epara 得到正交分量 eorth,它与监督特征严格垂直,代表监督模型忽略的互补深层表示,论文认为这对跨语言场景至关重要。
为帮助理解图 1 的像素内容,先做导读。该图只显示了局部,但可见左侧正交分解框、中间瓶颈变换框与右侧加法和乘法符号构成的融合路径,需要沿输入到输出的箭头看清哪条是直连、哪条是加权支路。
看图路径: 1. 先沿左侧正交分解框找到平行分量与正交分量的两条分支;2. 再看中间瓶颈变换与下方门控系数如何相乘后与顶部直连相加;3. 最后确认输出标记为最终融合嵌入
论文图 1。原论文 Figure 1:“Architecture of the orthogonal feature projection fusion method.”。
从收到的像素看,左侧橙色框内可见平行分量公式与正交分量公式,箭头向下表示相减得到互补分量;中间浅色框标注瓶颈变换,框上有一个火焰状可训练标记;右侧有一个乘法符号接收下方门控系数的输入,再与顶部直连的监督向量在加法符号处相加,输出标记为最终融合嵌入。下方旋钮标记为门控系数。论文正文补充说明,瓶颈变换先压缩去噪并用双曲正切激活过滤语言噪声,再乘以可学习标量门控系数。门控初始化为 0,保证训练起点恰好等于基线 ResNet 输出,网络再根据梯度逐渐引入跨语言互补信息。
正交特征投影 × 说话人嵌入: 正交特征投影负责做几何解耦,把对齐后的自监督向量分解为与监督说话人嵌入平行的冗余分量和严格垂直的互补分量;说话人嵌入负责提供已学到的身份方向作为基准。两者搭配的理由是直接拼接会重复建模同一身份信息并带入语言噪声,而只取正交分量再残差加回,可以在保留基线输出的基础上逐步加入跨语言互补信息。
WavLM × ResNet: WavLM 负责提供大规模无标注预训练得到的丰富声学与语言表征,ResNet 负责提供有监督说话人判别训练得到的身份嵌入。两者搭配的原因是前者泛化能力强但混杂语言内容,后者身份指向明确但跨语言互补信息不足,组合后用投影对齐维度再做正交分解,既利用自监督的表示能力又丢弃语言干扰。
需要核对的实现细节是:在第三前端训练阶段,WavLM 与 ResNet 分支参数均冻结,只训练投影与融合部分。论文未报告瓶颈中间维度与 WavLM 层选择等细节,这部分属于缺项,不能从模型名称推定。
后端如何在约束下学习打分?
后端的核心是流形约束神经 PLDA,英文为 manifold-constrained neural PLDA。白话说,流形是指满足概率约束的参数集合所在的曲面;约束是指不允许参数随意离开这个曲面。传统 PLDA 假设观测向量由隐说话人变量与高斯信道噪声线性组合生成,验证任务是假设检验,计算对数似然比。由于隐变量服从高斯分布,对数似然比化简为 2 次打分函数,包含注册与测试向量的自项与交叉项,以及常数偏置。
其中 P 是交叉项打分矩阵,衡量两个不同特征间的联合分布相关;Q 是自项打分矩阵,衡量单个特征在观测空间的方差惩罚。
现有神经 PLDA 把 P 和 Q 当独立权重用反向传播更新,忽略了它们经由协方差矩阵建立的代数约束。本文改为只学习参数集合,包括全局均值、联合对角化矩阵与对角化后的类间特征值向量。白话说,对角化是指找一个线性变换同时把类内与类间协方差变成对角形,使各维度解耦;特征值向量刻画各维度的信噪比。输入向量先经仿射变换投影到对角化空间,再完全由当前特征值向量按标准对角化 PLDA 推导动态生成 P 和 Q。
论文强调现代嵌入经 margin 损失训练已具角度可分性,不再叠加多层仿射与长度归一化,只用单个线性矩阵做空间去相关,避免破坏几何结构。这样打分矩阵自由度从平方级降到线性级,网络可用二元交叉熵端到端优化,同时严格保持概率生成流形。
流形约束 × 神经 PLDA: 神经 PLDA 负责把打分矩阵做成可反向传播的判别模型,流形约束负责把自由矩阵退回到由对角化矩阵与特征值向量生成的合法概率流形上。前者提供面向确认指标的优化能力,后者保留生成式高斯假设下的对数似然比解释,组合后自由度从平方级降到线性级,在判别训练时仍维持概率解释。
论文还说明传统生成式 PLDA 用期望最大化算法估计固定参数,英文为 Expectation Maximization,简称 EM,难以直接优化验证指标,因此需要第二阶段的判别迁移。原文未给出 P 和 Q 随特征值变化的具体逐维公式以外的完整矩阵组装代码,实现时只能按对角化 PLDA 标准推导复现,不能猜测额外的非线性。
训练样本与优化顺序如何组织?
训练组织是本文跨语言能力的关键。论文提出动态难样本挖掘,英文为 dynamic hard sample mining。它包含两个维度。第一是难跨语言目标挖掘:挑选同一说话人跨语言 utterance 对中当前得分最低的那些,强迫网络忽略韵律与音素变化。第二是难单语言非目标挖掘:挑选不同说话人单语言对中当前得分最高的那些,严惩因共享语言特征导致的误接受。
白话说,前者是把最难认成同一人的正样本拉近,后者是把最容易认错的负样本推远。每轮生成 3 倍所需的候选对,只选最难的子集训练,每轮使用 500,000 个平衡样本对。
为理解后端示意图,先做导读。图 2 把样本构造与打分生成画在同一流程中,左侧是样本选择,中间是变换与可学习参数,右侧是矩阵生成与打分,需要区分样本流与参数流。
看图路径: 1. 先看左侧虚线框内两种难样本对的语言与说话人关系标注;2. 再沿注册与测试两条仿射变换箭头找到变换后的嵌入;3. 最后看中间可学习参数如何同时生成交叉项与自项矩阵并汇入打分
论文图 2。原论文 Figure 2:“Schematic of the manifold-constrained neural PLDA and the hard sample mining strategy.”。
从像素看,左侧虚线框标注难样本挖掘,上方是相同说话人不同语言的单人与双向箭头示例,下方是不同说话人相同语言的双人与双向箭头示例;中间两条纵向向量分别代表注册与测试输入,经仿射变换得到变换后嵌入;中央橙色大框标注可学习参数集合;右侧两个浅色框分别生成交叉项矩阵与自项矩阵,最终汇入粉色打分框,框下可见 2 次型公式。这种画法把判别训练的监督来源讲得很直白:困难程度由当前模型分数决定,语言标签只负责限定候选范围。
难样本挖掘 × 跨语言目标试次: 难样本挖掘负责按当前得分主动挑选对抗性样本对,跨语言目标试次负责提供同一说话人不同语言但得分最低的正样本对。两者搭配的原因是随机采样难以暴露语言干扰,专门强迫模型在韵律和音素变化下仍拉近同一人,从而把语言内容与身份信息分开。
自适应分数归一化 × 分数融合: 自适应分数归一化负责用开发集冒名者分数对单个系统的 PLDA 分数做校准,分数融合负责用逻辑回归在开发集上学权重把多个系统分数映射为最终对数似然比。前者降低信道与语言带来的分数偏移,后者利用不同方法的互补性,组合后进一步提升鲁棒性。
优化顺序按论文分为前端 3 阶段与后端 2 个阶段。前端第一阶段用 20 万说话人预训练,输入 80 维滤波器组特征,帧长 25 毫秒、帧移 10 毫秒,每样本 200 帧,随机梯度下降动量 0.9,权重衰减 1e-4,学习率从 0.01 指数衰减到 5e-5, margin 从 0 渐增到 0.1,共 60 轮。第二阶段用 60 万说话人课程学习微调,帧长增至 600, margin 增至 0.2,学习率从 1e-4 衰减到 2.5e-5,共 5 轮,并平均多个最优检查点。第 3 阶段冻结双分支,只训练正交投影融合,学习率从 1e-4 衰减到 2.5e-5,共 10 轮, margin 保持 0.2。
后端第一阶段用提好的嵌入训练生成式 PLDA,期望最大化迭代 5 次,每次最大化步骤强制类内协方差只保留对角;第二阶段同时对角化类内与类间协方差求变换矩阵与特征值向量,用全局均值、变换矩阵与对数参数化特征值初始化,再用 Adam 与二元交叉熵微调 10 轮,学习率为 1e-4。打分阶段用开发集前 200 个冒名者分数做自适应分数归一化,再做分数融合。
数据、增强与评价条件是什么?
数据按论文分成 3 类。基础集约 20 万说话人,包括 VoxCeleb、VoxBlink、CN-Celeb 等开源语料与内部数据,用于建立初始特征空间。扩展集扩至 60 万说话人,加入合规商业许可与公开平台的专有说话人,经清洗去重覆盖多设备与信道。多语言集结合官方 TidyVoice 训练集与自采 2000 人专有集,再用语言与方言识别模型从扩展集筛选,最终得到 1 万多语言说话人。论文未公开具体语种分布与每语种时长,这属于复现时的缺项。
增强与优化配置按原文交代。训练时用房间脉冲响应数据集模拟混响,用 MUSAN 数据集加噪。前端使用 ResNet221 骨干,4 阶段块分布为 6、16、48、3,用多查询多头注意力池化聚合变长序列,用角度 margin 损失结合子中心与 Inter-topK 惩罚优化。多查询多头注意力池化英文为 multi-query multi-head attention pooling,简称 MQMHA;角度 margin 损失英文为 AAM-Softmax loss。论文未报告增强比例与信噪比采样范围,不能自行补充。
评价条件包括开发集与两个测试集。论文给出系统 S0 为官方基线,S1 为第二阶段前端训练得到的强基线,后续系统逐项叠加。打分归一化使用 TidyVoice 开发集,最终权重用开发集拟合逻辑回归得到。资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。论文致谢提到基础科研业务费项目,但这不改变可复现性判断。
主结果:在什么条件下比谁好多少?
比较问题是:在相同的 TidyVoice 开发集与两个测试集上,逐项叠加正交投影、流形约束 PLDA、难样本挖掘、自适应归一化与融合后,等错误率是否单调下降。公平条件是同一前端嵌入与同一评价协议,指标方向是 EER 越低越好。下表整理了论文报告的系统级 EER,单位为百分比,数值保留原文精度。
| 系统 | 方法 | 开发集 EER | 测试集 1 EER | 测试集 2 EER |
|---|---|---|---|---|
| S2 | S1 加正交特征投影 | 1.07% | 未报告 | 未报告 |
| S3 | S2 加流形约束 PLDA | 0.79% | 未报告 | 未报告 |
| S4 | S3 加难样本挖掘 | 0.72% | 未报告 | 未报告 |
| S5 | S4 加自适应分数归一化 | 0.64% | 1.55% | 2.22% |
| S6 | 分数融合 | 0.56% | 1.39% | 1.95% |
该表显示从官方基线到强基线的跃升主要来自数据清洗、课程学习与多样化数据,开发集 EER 从 3.07% 降到 1.29%。正交投影进一步降到 1.07%,流形约束 PLDA 降到 0.79%,难样本挖掘降到 0.72%,自适应归一化在开发集降到 0.64% 并在测试集得到 1.55% 与 2.22%,最终融合在开发集降到 0.56% 并在测试集得到 1.39% 与 1.95%。论文同时报告任务 1 最小检测代价为 0.10,任务 2 为 0.06,并在 42 支队伍中列第一。需要指出的代价是中间系统 S2 到 S4 未报告测试集结果,不能把开发集的单调下降直接推广为测试集的单调下降;未胜出项是官方基线 S0 在两条测试赛道上明显落后,说明仅靠通用基线无法处理跨语言纠缠。
语言条件细分是否支持去语言化判断?
比较问题是:在目标与非目标试次的语言关系不同时,最终融合系统是否仍保持跨语言优势。公平条件是同一融合系统与同一测试划分,只按语言关系切分试次,指标包括 EER 与最小检测代价,方向均为越低越好。下表按论文的 4 种条件整理,数值保留原文写法。
| 目标与非目标条件 | 任务 1 EER | 任务 1 最小检测代价 | 任务 2 EER | 任务 2 最小检测代价 |
|---|---|---|---|---|
| 不同语言与相同语言 | 1.40% | 0.10 | 1.87% | 0.05 |
| 相同语言与相同语言 | 1.49% | 0.10 | 2.45% | 0.06 |
| 总体 | 1.39% | 0.10 | 1.95% | 0.06 |
该表支持论文的有限解释:跨语言目标加单语言非目标的 EER 为 1.40% 与 1.87%,低于纯单语言条件的 1.49% 与 2.45%,出现了常规说话人确认中跨语言更难的预期被反转的现象。论文将其解释为严惩共享语言特征迫使网络学习语言不变表示。限制是这仍是相关性证据,不是因果证明;论文未报告各条件下的试次数量与置信区间,不能判断差异是否统计显著;任务 2 中纯单语言条件 EER 高达 2.45%,说明单语言非目标仍是相对弱点,存在未评测的边界,例如未见语种或方言下的表现未在证据中交代。
还有哪些不能承诺的地方?
首先是证据缺项。论文未报告 WavLM 的具体层聚合方式、瓶颈变换维度、逻辑回归融合的系统数量与权重,也未报告训练硬件、耗时与推理延迟。因此不能承诺该方法在计算受限设备上同样有效,训练资源与推理开销需要分开讨论,总体 EER 趋势不等于每组语言对都成立。
其次是评价局限。主结果依赖大规模私有数据,从 20 万扩至 60 万说话人,并用语言识别模型筛选多语言子集。若没有同等规模与清洗流程,复现者可能无法达到相同数字。论文未测量误判率随阈值的变化细节,也未做统计显著性检验,相关性不能当作因果。
最后是方法假设。流形约束依赖高斯假设与对角化推导,若嵌入分布严重偏离高斯,约束可能不再最优;正交分解假设监督嵌入方向已足够可靠,若基线本身偏差较大,垂直分量也可能带偏。这些属于待验证的推测,不能写成已证明的性质。缺失证据不是技术错误,但复现时必须补上对应验证。
要复现应先做什么?
复现的第一步是重建数据与基线。按论文用基础集训练 ResNet221,块分布取 6、16、48、3,80 维滤波器组特征,配合混响与加噪增强,验证开发集 EER 是否接近 1.29% 量级。若基线差距过大,不应继续调后端,因为后文所有提升都建立在该强基线之上。
第二步是冻结双分支,只训练正交融合模块。检查门控系数是否从 0 开始逐渐增大,融合嵌入在初期是否等于基线输出;再检查正交分量是否确实与监督向量垂直,可用余弦值做数值核对。第三步是后端迁移:先用期望最大化训练 5 轮生成式 PLDA 并强制类内协方差对角化,再求联合对角化矩阵与特征值向量,用二元交叉熵与难样本挖掘微调。难样本挖掘需保留语言标签,每轮生成 3 倍候选对并只取最难子集,每轮 50 万平衡对。打分时用开发集前 200 个冒名者分数做自适应归一化,再在开发集上拟合逻辑回归融合权重。
关于可用性,本次未发现完成验证的开源资源,因此不能写当前可用或已公开。如需补验证,应补充各语言条件下的试次量、置信区间、未见语种测试,以及训练与推理的耗时统计,才能判断收益是否可部署。
何时值得尝试这种组合?
当任务中语言切换是主要误差来源,且已有较强的监督说话人基线时,值得尝试正交投影加流形约束 PLDA 的组合。前者解决表示层面的重复建模与语言噪声,后者解决打分层面的判别优化与概率解释的矛盾,难样本挖掘则把优化压力集中到语言干扰最大的样本对上。论文在 TidyVoice2026 两条赛道上报告的 1.39% 与 1.95% 是在大规模数据与多阶段训练下取得的,应理解为特定数据与流程下的结果,而非任何数据上都可直接获得的收益。
对初学者的特有误解需要澄清。正交不是简单丢弃自监督特征,而是有监督地只保留垂直部分;流形约束不是不让学习,而是把学习限制在合法的生成曲面上;难样本挖掘不是越难越好,而是用当前分数动态定义困难并保持正负平衡。若计算资源有限或语言标签缺失,该流程的复现成本会显著上升,此时应先验证强基线与数据清洗的收益,再决定是否引入后续模块。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

