英文题目:Learning Global Key Knowledge for Federated Speaker Recognition via Fisher Information
会议身份:
conference:interspeech:2026:conference-paper-id:meng26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#联邦学习 #隐私保护 #语音 #说话人验证
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Ying Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Zhihua Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Liang He:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
联邦说话人识别任务输入为各机构私有的语音波形或声学特征,输出为用于验证的说话人判别嵌入与身份判定,实际难点在于说话人分布与地域信道异构导致本地更新保留冗余漂移特征并持续污染全局模型。该方法先以全局与本地嵌入提取器对同批语音分别编码得到全局嵌入与本地嵌入,再将全局嵌入送入新初始化临时分类器以交叉熵损失求对嵌入梯度并取逐元素平方,经批量平均得到费舍尔信息对角近似并按比例筛选高信息维度索引。接着仅对筛选后子向量做L2归一化并以余弦距离约束本地关键维度向全局对齐,最后将该对齐损失与AM-Softmax分类损失直接相加经多轮本地训练与联邦聚合更新全局模型,相比MOON类整体嵌入模仿只传递高Fisher维度从而过滤异构冗余而非全盘模仿。在VoxCeleb2四客户端划分并以Vox-O评测时本地模型等错误率(Equal Error Rate,EER)为2.06%、1.91%、2.18%、1.98%,优于同设置FedAvg与FedFSS基线;在VoxCeleb1联合CN-Celeb1两客户端异构下Vox侧为3.01%而CN侧为12.58%,CN侧略逊于FedFSS的12.35%。结论限于按说话人ID均匀划分与双客户端跨语种封闭评测,未验证狄利克雷非独立同分布、信道突变或开放集注册场景。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
本次解读的输入是标题为 Learning Global Key Knowledge for Federated Speaker Recognition via Fisher Information 的会议论文正文,以及随文收到的两张官方原图像素。目标读者是刚进入语音、音乐与音频领域的研究生,需要能核对实验条件、能复述方法步骤。必须保留的信息包括任务定义、联邦训练与聚合方式、费雪重要性计算与维度选择、对齐损失构成、数据集划分与评估协议、主结果与消融条件。输出是 1 篇按学习依赖展开的中文技术解读,不做超出原文的营销式判断。
说话人识别的输入是一段语音,目标是判断语音属于哪位说话人或两段语音是否来自同一人。白话说,系统先把可变长的语音变成固定长度的说话人嵌入,再比较嵌入的相似度。英文是 speaker recognition,常用嵌入提取器是时延神经网络的变体。当前高性能系统依赖大量高质量语音集中训练,数据越多、覆盖的说话人和信道越广,验证错误通常越低。
但集中收集原始语音代价很高。一是隐私风险,用户不愿把语音上传;二是经济与合规成本,机构之间直接交换语音往往不可行。联邦学习是 federated learning,白话说就是数据不动、模型动。每个客户端用私有数据在本地训练,只把模型参数传给服务器做加权平均,再把新的全局模型发回下一轮。这种方式避免了原始语音传输。
联邦学习 × 说话人识别: 联邦学习分工是只传模型参数不传原始语音,在服务器做加权聚合;说话人识别分工是从语音中抽取区分说话人的嵌入并做验证。两者搭配的理由是说话人识别需要大量多方语音但又不能集中传输隐私语音,组合意义是让多个持有私有语音的客户端协同训练出更好的嵌入提取器。
这篇论文只研究组织级或设备级数据分布不一致时的联邦说话人识别,不研究单机集中训练的新网络结构,也不研究语音增强或 diarization。教学例子仅为例子:例如 4 个客户端分别存了不同说话人的语音,服务器每轮收集 4 个本地嵌入提取器做平均。例子不附带任何效果数值,效果以原文表格为准。
已有路线把联邦说话人识别做到了哪一步?
按同输入、同目标、同运行阶段对照,已有路线可分为 3 类。第一类是直接套用通用联邦平均。联邦平均是 FedAvg,白话说就是按各客户端数据量占比对模型参数加权平均。原文把它作为最基础的比较对象,说明只做参数平均可以在一定程度上抵消异质性的不利影响,但全局模型仍会保留各客户端的异质特征信息。
第二类是在本地优化或聚合时加约束。代表是联邦近端优化 FedProx 和模型对比联邦学习 MOON。FedProx 的思路是限制本地模型不要偏离全局模型太远,MOON 的思路是用对比方式让本地表示靠近全局表示、远离上一轮本地表示。原文引用这类工作说明表示对齐是缓解异质性的常用手段,但它们大多是全维度对齐,没有进一步过滤哪些维度值得学。
第 3 类是针对说话人或跨轮差异的改进。原文比较了 FedCDA 和 FedFSS。FedCDA 关注跨轮差异感知的聚合,FedFSS 关注特征空间分离。原文报告显示 FedFSS 在多个测试上强于 FedAvg 和 MOON,是该论文之前在同一划分思路下最强的可运行基线。理解这一点很重要,后文判断新方法的增益必须以 FedFSS 为参照,而不是只与不做联邦的本地训练比。
相关工作对照的边界是:类别差异不能当成同条件胜负。例如通用图像领域的联邦改进不能直接等同于说话人任务的结论,只有在相同语音数据、相同嵌入提取器和相同评估集下比较才有意义。原文的比较满足这一条件,后文实验条件节会逐项核对。
数据不一样时,本地模型到底学错了什么?
论文指出的问题链条是 3 步。第一步,客户端数据分布不一致。不同客户端的说话人来自不同个体、地区和国家,信道和口音也不同,这就是数据异质性 data heterogeneity。第二步,服务器聚合只能部分抵消这种差异。加权平均让全局模型见过更广的知识分布,但不可避免地保留了各客户端的冗余特征信息。第 3 步,如果本地训练不加过滤地向全局模型对齐,就会把其他客户端引入的漂移参数也学进来,后续更新持续受干扰,增加陷入局部最优的风险。
数据异质性 × 冗余知识: 数据异质性分工是描述各客户端说话人、地域和信道分布不同;冗余知识分工是描述全局模型聚合后残留的不利于当前客户端判别的分布偏置和漂移参数。搭配理由是异质分布经参数平均进入全局模型后会变成干扰,组合意义是把问题从笼统的分布不一致收窄为需要过滤哪些嵌入维度。
需要区分两个易混概念。全局模型知识广不等于全局模型全对,广是指覆盖的说话人更多,对是指对当前客户端的判别真正有用。论文的方法动机正是只学全局中有益的关键部分,而不是全盘复制全局表示。原文没有承诺解决通信效率或隐私攻击问题,也没有测量延迟与算力,解读时不能把识别精度的提升外推为系统开销的改善。
方法全景:一个样本如何走完三步?
先沿一个样本走完流程。输入是一批本地语音和对应说话人标签。第一步,同一批语音分别送入冻结的全局嵌入提取器和正在训练的本地嵌入提取器,得到全局嵌入和本地嵌入,维度都是 512。第二步,全局嵌入送入自定义的费雪重要性计算器,算出每个维度的费雪信息值并排序,取出前 t 个维度索引,再用该索引同时截取全局嵌入和本地嵌入并做归一化,得到两个短向量。第 3 步,计算两个短向量之间的余弦距离作为对齐损失,再与本地分类损失相加,用总损失只更新本地模型,本地训练结束后把本地参数上传聚合。
以下导读帮助对照原图理解上述 3 步的分工,重点看数据分叉、重要性计算与损失汇合的位置。
看图路径: 1. 先从左下私有数据集出发,确认同一批语音同时送入全局提取器和本地提取器得到两条嵌入;2. 再看上方黄色区域中全局嵌入如何进入黑色计算块并分出重要性分数和维度索引两条线;3. 接着核对索引同时作用于全局嵌入和本地嵌入,再各自归一化得到待比较的短向量;4. 最后看右下绿色区域中两个短向量之间的对齐损失与送入分类器的分类损失是两条独立监督
论文图 1。原论文 Figure 1:“Schematic diagram of local training for our pro- posed method.”。
上图是本地训练示意图,可分为下、中、上三块。下部蓝色区域是步骤一,左侧圆柱表示私有数据集,同一数据分两路进入全局提取器和本地提取器,分别输出全局嵌入和本地嵌入。中上部黄色区域是步骤二,黑色块是费雪重要性计算器,输入全局嵌入,输出重要性分数和维度索引,索引同时用于截取全局嵌入和本地嵌入,截取后的全局短向量经过归一化向右下传递。
右下绿色区域是步骤三,上下两个短向量计算对齐损失,本地嵌入另有一条线经本地分类器计算分类损失。两类损失共同监督本地提取器,图中全局提取器在本地训练阶段不更新,只作为参考。像素中不同颜色块不代表不同说话人,橙绿粉等色只是示意被选中的重要维度与未选中的普通维度。
费雪信息如何算出哪些维度重要?
费雪信息矩阵是 Fisher Information Matrix,白话说就是衡量每个参数或每个表示维度对预测结果影响有多大。原文先给出概率模型下对数似然梯度外积的期望定义,说明梯度平方越大,该参数越关键。由于深度模型参数量巨大,存完整矩阵不现实,原文采用只保留对角线的常用近似,也就是每个维度独立看梯度平方。
费雪信息矩阵 × 关键维度: 费雪信息矩阵分工是用对数似然梯度平方衡量每个嵌入维度对判别的影响大小;关键维度分工是费雪值排序靠前的那部分维度索引。搭配理由是全维度对齐会把有害信息也学进来,组合意义是用重要性排序只保留判别贡献大的维度再做对齐。
具体到本方法,计算对象不是网络权重,而是全局嵌入。做法是把全局嵌入送入一个临时分类器,用交叉熵损失求对全局嵌入的梯度,再取平方得到每个维度的费雪值。临时分类器是 temporary classifier,白话说就是为了算重要性而临时初始化的分类头,不作为最终说话人分类器。原文算法显示每个本地训练周期会初始化临时分类器,重要性按批次计算。对一个批次,先算出形状为批量乘以嵌入维度的费雪矩阵,再在批量维度上平均,得到每个维度的平均重要性,最后排序取前 t 个。
全局嵌入 × 本地嵌入: 全局嵌入分工是提供见过更多客户端分布的参考表示;本地嵌入分工是当前客户端正在优化的表示。搭配理由是全局视野更广但混有偏置,本地更贴合私有数据但视野窄,组合意义是在选出的关键维度上用余弦距离把本地表示拉向全局表示的关键部分。
选出索引后,方法用同一索引截取全局嵌入和本地嵌入,再沿维度做归一化,得到等长的关键向量。对齐损失是 1 减去两个关键向量的余弦相似度。余弦相似度只看方向是否一致,不看长度,这意味着本地模型要学的是关键维度的相对模式,而不是绝对幅度。比例参数 s 控制选择多少维度,满足 t 等于 s 乘以嵌入维度。主实验取 0.2,对应 512 维中选约 102 维。原文未给出临时分类器的具体初始化分布与是否参与梯度更新之外的细节,复现时应按算法字面理解为每次本地训练阶段重新初始化,且只用它求费雪梯度。
本地更新什么、冻结什么,梯度从哪里来?
训练分为中央聚合阶段和本地训练阶段。中央聚合阶段由服务器发起,初始化全局嵌入提取器,每轮把全局参数发给各客户端,回收本地参数后按数据量占比加权平均,公式为各客户端参数乘以各自数据量除以总数据量后求和。共进行 20 轮聚合,每轮本地训练 5 个周期。
分类损失 × 表示对齐损失: 分类损失分工是用本地标签监督说话人判别;表示对齐损失分工是用全局关键向量约束本地关键向量的方向。搭配理由是只用分类损失会过拟合本地偏置,只用对齐损失会丢失判别力,组合意义是相加形成本地总损失,让本地模型既会分类又不偏离全局关键知识。
本地训练阶段的参数状态需要分清。全局嵌入提取器在本地训练时作为参考,不更新;本地嵌入提取器和本地分类器用总损失更新。监督来源有两条:一条是本地语音标签经 AM-Softmax 得到的分类损失,另一条是全局关键向量经余弦距离得到的对齐损失。计算费雪时用的交叉熵损失只用于求对全局嵌入的梯度以得到重要性,不直接更新本地模型。原文明确写了用 Adam 优化器、批量 128、初始学习率 0.001 且每轮衰减 0.97,输入是 80 维对数梅尔谱,嵌入提取器是通道数为 1024 的 ECAPA-TDNN。
未报告的缺项要指出。原文没有说明批量归一化统计量如何处理,没有说明各客户端是否同步、掉线如何处理,也没有给出每轮通信量与本地训练时长。梯度路径方面,对齐损失对本地嵌入可导、对全局嵌入应视为停止梯度,但原文未用停止梯度一词表述,解读时只按全局冻结这一事实陈述,不猜测额外的截断实现。
数据怎么分、用什么测、条件是否一致?
数据与划分按原文交代。主实验用公开说话人数据集 VoxCeleb1、VoxCeleb2 和 CN-Celeb1。划分方式是按说话人编号均匀切分为多个子数据集,模拟客户端各存不同说话人的情形。VoxCeleb 系列切为 4 个客户端,VoxCeleb1 与 CN-Celeb1 的跨域实验是两个客户端各存一种数据集。评估时,在 VoxCeleb1 或 VoxCeleb2 上训练的本地模型用 Vox-O 评估,在 VoxCeleb2 上训练的还加测 Vox-E 和 Vox-H,在 CN-Celeb1 上训练的用 CN-Celeb.Eval 评估。
指标有两个。等错误率是 Equal Error Rate,简称 EER,数值越低越好;最小检测代价是 minimum detection cost function,简称 minDCF,数值越低越好,原文取目标概率为 0.05。比较的公平条件是所有方法用相同的嵌入提取器、相同的本地损失配置、相同的聚合轮数与本地周期,以及相同的划分与评估集。基线包括只用私有数据训练的 Standard、不做联邦对齐的 FedAvg、加近端约束的 FedProx、做模型对比的 MOON、跨轮差异聚合的 FedCDA 和特征空间分离的 FedFSS,都是实际可运行的策略,没有用事后最优或 oracle 替代。
资源状态需要如实说明。本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。复现只能依据论文文字与算法框重写,数据集需自行按公开版本获取,划分随机种子原文未报告,这是复现不确定性的来源之一。
主结果:在相同条件下谁更好,代价是什么?
要回答的问题是:在相同划分与相同评估集下,关键维度对齐是否一致优于全维度或无过滤的联邦方法。指标方向是 EER 和 minDCF 越低越好。以下先看在 VoxCeleb1 上训练、在 Vox-O 上评估的四客户端结果,比较对象包括不联邦、联邦平均、最强基线与本方法。
| 条件 | Standard 的 EER(%) | FedAvg 的 EER(%) | FedFSS 的 EER(%) | 本方法的 EER(%) |
|---|---|---|---|---|
| 客户端 1 在 Vox-O 上评估 | 6.68 | 4.93 | 4.72 | 4.15 |
| 客户端 2 在 Vox-O 上评估 | 6.83 | 4.90 | 4.65 | 4.19 |
| 客户端 3 在 Vox-O 上评估 | 6.33 | 4.91 | 4.52 | 4.15 |
| 客户端 4 在 Vox-O 上评估 | 6.99 | 5.42 | 5.07 | 4.47 |
上表显示本方法在 4 个客户端上都取得最低的等错误率。相对不做联邦的本地训练,错误率(%)从约 6 到 7 降到约 4 到 4.5;相对联邦平均也有约 0.7 到 0.9 的下降;相对之前最强的 FedFSS 仍有约 0.3 到 0.6 的下降。对应的最小检测代价也同步下降,原文同行给出本方法四客户端分别为 0.2769、0.2902、0.3021 和 0.3176,均低于各基线。代价是每批都要为全局嵌入额外求 1 次梯度并排序选维,原文未量化这部分时间与显存。
为检验更大训练集与更难测试集下的表现,以下看在 VoxCeleb2 上训练、在 Vox-O 上评估的结果,条件与基线保持一致,指标方向不变。
| 条件 | Standard 的 EER(%) | FedAvg 的 EER(%) | FedFSS 的 EER(%) | 本方法的 EER(%) |
|---|---|---|---|---|
| 客户端 1 在 Vox-O 上评估 | 3.66 | 2.69 | 2.47 | 2.06 |
| 客户端 2 在 Vox-O 上评估 | 3.37 | 2.52 | 2.48 | 1.91 |
| 客户端 3 在 Vox-O 上评估 | 3.86 | 2.73 | 2.64 | 2.18 |
| 客户端 4 在 Vox-O 上评估 | 3.41 | 2.57 | 2.23 | 1.98 |
上表支持同样的判断:本方法在更大训练集下依然领先,4 个客户端的等错误率都降到约 2 左右,最小检测代价降到 0.1341、0.1277、0.1551 和 0.1456。原文还报告在 Vox-E 和 Vox-H 上的结果,本方法同样最好,例如 Vox-H 上四客户端为 4.29、4.08、4.22 和 4.12,均低于 FedFSS 的 4.74、4.67、4.82 和 4.59。但要说明限制:跨域的 VoxCeleb1 与 CN-Celeb1 实验中,本方法在 CN-Celeb1 上为 12.58,不如 FedFSS 的 12.35,这是一个未胜出项,说明在语言与信道差异更大的场景下优势会缩小。总体趋势不等于每组都最优,解读时应保留这一反例。
拿掉费雪选择或维度选择会发生什么?
消融要回答两个问题:重要性排序是否必要,维度截取本身是否必要。原文做了两组对照。第一组是有费雪信息与无费雪信息,无费雪信息时按相同比例随机选维度生成待比较向量。第二组是有特征选择与无特征选择,无特征选择时让本地嵌入直接向全局嵌入学习,即全维度对齐。以下导读先看比例参数的敏感性,再看消融数值。
看图路径: 1. 先确认左图纵轴是等错误率、右图纵轴是最小检测代价,横轴都是比例参数;2. 再对比四个客户端曲线在 0.2 附近是否都出现明显的低点或拐点;3. 最后观察比例增大到 1.0 时各曲线是否回升,判断全维度对齐是否带来波动
论文图 2。原论文 Figure 2:“Trend chart of each client’s EER (%) and minDCF as a function of scale parameter s.”。
上图左为等错误率随比例参数变化,右为最小检测代价随比例变化,横轴都是比例参数,图例区分 4 个客户端。可见像素是等错误率在 0.1 到 0.2 之间普遍快速下降,在 0.2 附近达到首个低点,之后随比例增大缓慢回升或趋平;最小检测代价波动更大,在 0.9 附近出现低点但在 1.0 处明显回升。原文文字总结为等错误率首个峰值在 0.2,最小检测代价峰值在 0.9,但总体随参数变化趋于稳定,证明方法对参数选择较为稳健。读图时不能把纵轴向下直接等同于单调变好,也不能把某客户端末步结果推广为全程结论,应结合原文的稳定表述理解。
以下看在 VoxCeleb1 上的消融等错误率,单位为百分比,数值越低越好,比较问题是随机选维与全维度学习是否不如费雪选维。
| 条件 | 客户端 1 的 EER(%) | 客户端 2 的 EER(%) | 客户端 3 的 EER(%) | 客户端 4 的 EER(%) |
|---|---|---|---|---|
| 有费雪信息选择 | 4.15 | 4.19 | 4.15 | 4.47 |
| 无费雪信息随机选维 | 4.21 | 4.26 | 4.15 | 4.57 |
| 有特征选择 | 4.15 | 4.19 | 4.15 | 4.47 |
| 无特征选择直接对齐 | 4.32 | 4.42 | 4.22 | 4.67 |
上表报告显示费雪选择能有效识别重要维度,随机选维在 3 个客户端上更差,客户端 3 持平;去掉维度选择后全部变差,客户端 2 从 4.19 升到 4.42,客户端 4 从 4.47 升到 4.67。原文据此判断不过滤的冗余知识容易被学到,导致性能下降。该判断是有限解释,支持但不证明因果,因为随机选维只做了 1 次比例对照,未报告多次随机的方差,也未测量学到了哪些具体冗余维度。
哪些结论还没有被验证?
首先是统计与划分的不确定性。原文按说话人编号均匀划分,但未报告随机种子、重复次数与显著性检验,也未给出置信区间。4 个客户端的划分是 1 次性结果,不能直接推广为任意异质程度下都成立。百分点差值与相对百分比不同,解读时只陈述原始差值,不换算为相对提升。
其次是跨域边界。VoxCeleb1 与 CN-Celeb1 的组合更接近真实场景,原文报告本方法在 VoxCeleb1 侧为 3.01 优于 FedFSS 的 3.14,但在 CN-Celeb1 侧为 12.58 差于 FedFSS 的 12.35,且原文说明本方法避免了额外信息传输。这意味着在语言、采集设备差异大时,关键维度过滤可能过滤不足或过度,需要补做更多跨域组合与不同客户端数量的验证。
最后是成本缺项。原文未报告通信轮数压缩、本地训练时长、显存占用与推理延迟,也未测量误判率之外的公平性或隐私泄露指标。因此不能承诺该方法降低了通信或计算成本,只能说它在给定 20 轮聚合、每轮 5 个本地周期的预算下取得了上述精度。缺失证据不是技术错误,但复现与选型时必须把成本验证列为待办。
要复现这篇工作,先做什么?
先准备数据与评估。获取 VoxCeleb1、VoxCeleb2 与 CN-Celeb1 的公开版本,按说话人编号均匀切分,VoxCeleb 系列切为四份,跨域实验按数据集自然分为两份。评估用 Vox-O、Vox-E、Vox-H 与 CN-Celeb.Eval,指标用等错误率与目标概率 0.05 下的最小检测代价。划分代码要固定随机种子并保存客户端说话人列表,否则无法与原文数字严格对齐。
再搭建模型与训练循环。嵌入提取器用通道数 1024 的 ECAPA-TDNN,输入 80 维对数梅尔谱,嵌入维度 512,本地分类用 AM-Softmax。优化器用 Adam,批量 128,初始学习率 0.001,每轮乘 0.97,本地周期 5,聚合轮数 20,比例参数主实验取 0.2。本地训练时冻结全局提取器,每个批次用全局嵌入经临时分类器求交叉熵梯度平方得到费雪值,按批量平均后排序取前 t 个索引,同时截取全局与本地嵌入并归一化,计算 1 减余弦相似度,与分类损失相加后更新本地模型。
先跑通 FedAvg 与 Standard,再加入对齐与费雪选择,这样出问题时能定位是聚合、分类损失还是选择逻辑。复现时要记录每次聚合后的各客户端指标,而不是只看最后一轮,避免把中间波动当成最终结论。由于原文未公开代码与权重状态,本次解读按不可用处理,所有细节以正文与算法框为准。
何时值得尝试这种关键维度对齐?
当多个机构各有不同说话人的语音、不能集中传输,且服务器聚合后仍观察到本地模型被其他分布带偏时,值得尝试这种先选维再对齐的思路。它的适用条件是全局模型确实见过更广的分布,且判别信息集中在部分嵌入维度上。此时用费雪值排序只学关键维度,可以减少全维度对齐带来的干扰。
不适用或需谨慎的情形包括客户端数量很少、域差异极大,或对训练时长与显存敏感的任务。因为每批都要为全局嵌入求梯度并排序,比例参数也需要在 0.1 到 1.0 之间扫描,原文显示 0.2 在等错误率上较好,但最小检测代价的最优点不同,实际选型要按自己的验证集同时看两个指标。
常见的误解是把全局模型当成正确答案。原文的立场是全局模型知识更广但混有冗余,只有经费雪过滤后的关键维度才值得学;另一个误解是把随机选维的差距当成费雪必然最优,原文只在相同比例下做了 1 次随机对照,还需补方差与更多比例的验证。收束一句话:该工作报告显示关键维度对齐在同域划分下一致领先,在跨域一侧存在未胜出项,复现应先固定划分与评估,再验证精度与成本。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

