标签:#说话人识别 | #自监督学习 | #状态空间模型 | #多语言 | #语音
评分:5.5/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Prakriti Subedi:机构信息未在 arXiv HTML 中可靠披露
- Howard Prioleau:机构信息未在 arXiv HTML 中可靠披露
- Saurav K Aryal:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
无监督野外多语言语音表示要求在无标注、多语言、声学多样条件下,仅从原始音频学习可直接用于语言识别、语音识别与说话人聚类的冻结嵌入,难点在于语言覆盖极不均衡且官方探针分布与训练分布未知。方法链分为四步:先对 MLCommons 无监督语音使用预计算语音活动检测过滤与 80 维对数梅尔分片并做语言感知采样以抑制英语主导,再用 MiniBatchKMeans 从原始声学帧构造离散伪标签,随后以双向 Mamba2 编码器对掩码帧预测伪标签并辅以语言识别与 VICReg 约束学习表示,最后将帧级输出分三段平均与归一化后提交 Dynabench 探针。与单向状态空间模型及 Transformer 掩码预测相比,关键差异是前后向共享状态空间算子求和加对角残差,以线性复杂度获得非因果上下文。官方评估中主检查点在说话人聚类上调整兰德指数达到 0.735,超过全部 4 个基线,而语言识别宏平均 F1 仅为 0.073,字符错误率为 0.870。该结论仅适用于所用数据子集与冻结三段平均嵌入协议,晚期检查点已出现语音内容泛化退化,未验证迭代精炼伪标签或更大规模语料下的外推。原文披露训练使用单张 NVIDIA RTX A6000,未披露完整训练时长与推理吞吐成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么野外无监督表示很难?
这篇解读的输入是论文原文给出的确定性证据,目标是让刚进入语音方向的研究生能复述方法与实验条件,输出是一套可核对的流程说明。必须保留的信息包括数据来源与规模、模型配置与损失权重、训练硬件与优化设置、官方三项指标及其方向、两个主检查点的对照结果。
挑战任务设定为完全无标注训练,只能使用 MLCommons 无监督人类语音数据集,评测时冻结表示,不做任务微调。输入是原始野外音频,输出是可用于下游探针的嵌入向量。论文报告训练集经过滤后约 250 小时 67 语种,约 87400 个语音块分布在 438 个预计算分片中,其中英语约 100 小时,非英语约 150 小时。评测输出 3 类分数:语种识别宏平均 F1 越高越好,语音识别字符错误率越低越好,说话人聚类调整兰德指数越高越好。
难点在于野外数据信道多样、语种分布极不平衡,且探针测试集与训练分布不一致。监督预训练在大规模精标语料上有效,但多数语言没有标注,直接套用高资源模型会出现跨语言性能鸿沟。自监督从原始音频学习是更可扩展的路线,但如何用小规模多语言无标注数据学到同时保留说话人、语种与音素结构的表示,是本文要验证的核心矛盾。
已有路线提供了哪些工具,本文选择了哪条分支?
语音自监督已有 3 条成熟路线。第一条是对比预测类,以 wav2vec 2.0 为代表,通过掩码上下文预测量化单元学习表示;第二条是掩码离散单元预测类,以 HuBERT 为代表,用聚类伪标签做掩码位置分类并可迭代精化;第 3 条是大规模弱监督与多语言扩展类,以 Whisper 与 XLSR 为代表,依赖更大规模或更均衡的多语言数据。论文明确跟随 HuBERT 风格,但把 Transformer 编码器换成双向 Mamba2 状态空间模型。
选择 Mamba 的原文理由是线性时间建模序列信号,选择双向形式的理由是挑战评测冻结表示,非因果探针能同时利用过去与未来上下文得到更丰富的嵌入。在双向实现上,作者比较了 Hydra 与 Vision Mamba,报告 BiMamba2 设计更精简,去掉序列移位并利用优化的 Mamba2 核提升吞吐。这一选择不是精度上的同条件胜负结论,原文没有给出三者对照实验,只是设计取舍说明。
与基线的关系需要按同运行阶段理解。官方基线为 Whisper、HuBERT-large、XLSR 与 wav2vec 2.0,均在更大或更精标数据上预训练。本文 47.88M 参数模型仅用约 250 小时训练,因此任何比较都受数据规模与覆盖差异限制,不能解读为架构本身全面超越基线。论文最强的可核对证据是说话人聚类一项超过全部 4 个基线,而另两项落后,这是后文要解释的分化现象。
挑战要求模型解决的具体问题是什么?
无监督野外语音挑战的形式化定义是:训练阶段完全不用标签,在官方语音源上学习通用表示;评测阶段由 Dynabench 提供探针,参与者看不到探针训练细节与测试标签。提交物不是识别器本身,而是一个模型控制器接口,能把任意输入音频转成固定维度的嵌入。
以一个 10 秒样本为例,流程是先重采样到 16 千赫,提取 80 维对数梅尔特征,补齐或裁剪到固定 10 秒窗口,再送入编码器得到帧级输出。提交实现把帧级输出按时间分成前中后 3 段非重叠区间分别平均,再做 L2 归一化,得到最终嵌入。这种分段平均保留了粗略时序结构,又避免直接全局平均抹掉变化。
问题难度还来自开放过滤子赛道的数据约束。论文声明未使用外部数据,语音活性检测时间戳与语种标签直接消费 MLCommons 预计算元数据,本地不运行语音检测与语种识别推理。这意味着数据清洗质量完全依赖上游元数据,任何元数据偏差都会进入采样与辅助损失。
方法全景:一个样本如何走完输入到损失?
沿一个 10 秒样本走完全程有助于建立整体依赖。输入波形先变成 1001 帧的 80 维对数梅尔谱,快速傅里叶变换点数为 400,跳长为 160 个采样点,对应 10 毫秒帧移。掩码阶段只在有效非填充帧上操作,按有效长度的 75% 选择掩码帧,用 3 到 5 个连续块跨度遮盖,并替换为可学习嵌入。编码器为 12 层双向 Mamba2 堆叠,模型维度 768,最终线性头直接把编码器输出映射到 200 类伪标签对数。
目标由三部分组成。主损失是在掩码位置预测离线小批量 K 均值聚类标签,聚类直接对按维度缩放的对数梅尔帧向量进行,不用预训练模型。辅助损失包括对均值池化隐状态的 VICReg 方差与协方差惩罚,以及用预计算语种标签计算的语种识别交叉熵,权重为 0.05。总损失是三者相加,没有单独解码器。
输出阶段与训练阶段解耦。训练时优化掩码分类与正则目标,推理时取最后层归一化后的编码器输出做 3 段平均。这种安排使训练只见掩码重建任务,评测却考验语种、音素与说话人 3 种泛化,训练目标与评测目标之间存在天然错位,这是理解后期检查点分化的关键。
编码器层如何同时看到过去和未来?
双向 Mamba2 层是本文的表示核心。白话说,状态空间模型是一种用递推状态压缩历史信息的序列模型,Mamba2 版本通过结构化状态空间对偶实现高效计算;双向则指同时跑从左到右和从右到左 2 个方向,再把结果合并,使每 1 帧都能融合双侧上下文。
下图展示了单层的 3 路并行结构,图中顶部公式与底部输入输出维度标注了计算契约,左侧蓝色块为前向状态空间路径,右侧橙色块为翻转加状态空间再翻转的后向路径,中间绿色块为可学习对角残差。
看图路径: 1. 先从底部输入箭头看三路分叉:左侧直送 SS、中间送可学习对角矩阵 D、右侧先经过下方 flip 再送 SS;2. 再看顶部黄色加号节点如何把三路输出相加得到 y,并注意输出维度仍为 B 乘 S 乘 D;3. 对照顶部公式确认右侧支路经历两次翻转,第二次翻转把逆序结果恢复为原时间顺序;4. 注意中间虚线标注的 Skip connection 与 D,对应保持原信号与稳定梯度的残差作用
论文图 1。原论文 Figure 1::“BiMamba2 encoder layer (repeated n times).”。
从像素可见,底部输入先分叉为 3 路,左侧直接进入 SS 模块得到前向表示,右侧先经过下方翻转模块反转序列再进入 SS 模块,最后经过上方翻转模块恢复原顺序,中间一路经过 D 矩阵做线性跳连,3 路在顶部黄色加号处逐元素相加后输出。外框左上角标注重复 n 次,表明该层堆叠 12 次构成主干。每个完整块还包裹预层归一化与整体加性残差,SS 内部则包括向 1536 维的扩展投影、宽度为 7 的 1 维深度卷积、状态维度 16 的离散递推、均方根归一化、乘性门控与回投影。
掩码离散单元预测 × 双向 Mamba2 编码器: 掩码离散单元预测负责给出自监督目标,把被遮住帧的声学内容变成 200 类伪标签分类问题;双向 Mamba2 编码器负责给出表示结构,用前向与后向状态空间路径同时看过去和未来上下文。二者搭配的理由是冻结表示评测需要非因果上下文,而离散预测需要长时建模能力,组合后编码器在无标注条件下学会可用于聚类和识别的帧级表示。
\[\mathbf{y}=\mathrm{SS}(\mathbf{x})+\mathrm{flip}\big(\mathrm{SS}(\mathrm{flip}(\mathbf{x}))\big)+D\mathbf{x}.\]该公式中 x 为批量乘序列长度乘维度的输入张量,SS 为 Mamba2 状态空间算子,flip 为时间轴反转,D 为可学习对角矩阵,y 为同形状输出。计算目标是把双向上下文与原始信号相加,得到保留细节又融合长时的层输出。原文未报告门控与卷积的消融,因此不能断言某一子部件必然带来多少增益。
掩码目标与正则项各自计算什么?
掩码与伪标签模块决定了监督信号从哪里来。掩码只作用于有效帧,掩码量取有效长度乘 0.75 后下取整,至少掩 1 帧,用多个连续块而非随机散点,目的是迫使模型利用上下文恢复整段声学事件。伪标签由离线小批量 K 均值得到,类别数为 200,对 80 维对数梅尔帧向量按维度缩放后聚类,默认初始化且只做 1 次,不做迭代精化。
k 均值伪标签 × 对数梅尔特征: 对数梅尔特征负责提供输入声学描述,每 10 秒切块提取 80 维谱帧;k 均值伪标签负责把这些连续谱帧离线聚成 200 类,作为掩码位置的预测目标。搭配原因是避免依赖外部预训练分词器,直接从原始谱帧自发现离散目标,组合后掩码损失可以在无标注多语言数据上直接训练。
\[\mathcal{L}_{\text{mask}}=-\frac{1}{|\mathcal{M}|}\sum_{t\in\mathcal{M}}\log p_{\theta}(c_{t}\mid\tilde{x}),\]该公式中 M 为掩码帧集合,ct 为 t 时刻伪标签,带波浪线的 x 为掩码后输入,theta 为模型参数。计算目标是在掩码位置做 200 分类交叉熵,只在被遮住帧上求平均,未被遮住帧不贡献梯度。教学例子是:若某段元音被遮住,模型需从左右辅音与韵律上下文推断其所属聚类,错误分类即产生梯度,这只是帮助理解的例子,不代表原文报告过该音素实例的效果。
VICReg 正则 × 语种识别辅助损失: VICReg 正则负责防止表示坍缩,对均值池化后的隐状态施加方差与协方差约束,使嵌入保持信息量和去相关;语种识别辅助损失负责注入多语言结构,用预计算语种标签做交叉熵,权重为 0.05。搭配原因是主掩码损失只关心局部帧恢复,组合后表示空间同时保留区分性与语种结构。
\[\mathcal{L}=\mathcal{L}_{\text{mask}}+\mathcal{L}_{\text{VICReg}}+\lambda_{\text{lid}}\,\mathcal{L}_{\text{lid}}.\]该公式中掩码损失权重为 1,VICReg 项包含方差权重 5.0 与协方差权重 1.0,语种损失权重 0.05。计算目标是联合优化:主项学离散声学结构,正则项防坍缩,语种项注入多语言可分性。原文明确三项都作用于均值池化隐状态的只有后两项,主损失作用于帧级输出,这 1 位置差异在复现时必须保留。
数据如何过滤、采样与优化?
训练流水线的真实计算过程分为离线与在线两段。离线先按语音活性检测元数据过滤:语音时长占比不低于 0.30,最长语音段不低于 10 秒,按 10 秒对齐块累计可提取语音不低于 30 秒,标记无语音、缺时间戳或单压缩包超过 200 条目的丢弃。对数梅尔特征离线存为分片文件,每片最多 200 样本,固定每块 10 秒 1001 帧。在线加载时再加一道过滤,要求语音占比不低于 0.25 且至少有一段语音能填满整块。
语言感知采样 × 分片预计算流水线: 分片预计算流水线负责把特征计算与模型训练解耦,离线生成最多 200 样本每片的特征分片并做语音活性检测过滤;语言感知采样负责在训练时纠正英语约占四成的不平衡,每批 70% 来自均衡采样器并限制英语不超过 10%。搭配原因是多语言无监督训练既要吞吐效率又要覆盖长尾语种,组合后小批量仍能看到多样语言。
优化使用 AdamW,学习率为 0.0001,梯度裁剪最大范数为 0.5,先线性热身 2000 步再余弦衰减到 0.1 倍基础学习率。精度为 bfloat16 混合精度,批量 128,随机种子 42,无梯度累积。训练从同配置的 10500 步检查点恢复,一直跑到 48000 步,每 1500 步保存检查点并做留出验证。硬件为单张英伟达 RTX A6000。数值稳定措施包括输入帧截断到负 20 到 20,隐状态过非数处理,池化后 VICReg 嵌入截断到负 100 到 100。
小规模对照模型采用模型维度 512、8 层、批量 64、训练到 49000 步,其余目标与流水线相同。原文指出两配置在批量与步数上也不同,因此规模效应不能单独归因于参数量,复现时若要验证规模作用,需要固定采样与步数的受控消融,而原文未做该消融。
评测条件如何设置,指标方向是什么?
实验按 3 个问题组织:官方探针测什么、本地诊断测什么、两者条件是否一致。官方评测通过 Dynabench 进行,参与者不能接触探针训练细节,3 个指标方向为语种识别宏平均 F1 越高越好、字符错误率越低越好、说话人聚类调整兰德指数越高越好。提交了大模型的 19500 步与 48000 步两个检查点,以及小模型 49000 步检查点,最终以 19500 步为主要结果。
下表整理了官方证据中可逐字核对的核心数字,比较问题是主要检查点是否在聚类上超过基线而在另两项落后,公平条件是同一次官方探针下的冻结嵌入评测,指标方向按上述升降判断。表中横线表示该单元格数值未在连续原句中出现,不做猜测填充。
| 系统 | Macro-F1 越高越好 | CER 越低越好 | ARI 越高越好 | 可核对要点 |
|---|---|---|---|---|
| 本文主检查点 12 层 19500 步 | 0.073 | 0.870 | 0.735 | 聚类超过全部基线 |
| 本文同模型 48000 步 | 0.070 | 0.998 | 0.710 | 字符错误率明显升高 |
| Whisper 基线 | 0.950 | — | — | 语种识别大幅领先 |
| HuBERT-large 基线 | 0.690 | 0.570 | — | 识别两项均领先 |
| XLSR 基线 | — | 0.900 | — | 字符错误率与本文接近 |
| wav2vec2 与 XLSR 的 ARI 差距 | — | — | 0.105 与 0.635 | 本文领先幅度来源句 |
表后解释需要同时看到收益与代价。主要收益是主检查点聚类指标超过全部基线,原文报告比 wav2vec 2.0 高 0.105,比 XLSR 高 0.635。具体代价是语种识别远低于 Whisper 的 0.950 与 HuBERT-large 的 0.690,字符错误率 0.870 介于 HuBERT-large 的 0.570 与 XLSR 的 0.900 之间,且 48000 步的字符错误率恶化到 0.998。未胜出项是小模型在三项上全面低于大模型,以及 48000 步在三项官方指标上均不如 19500 步,这说明训练更久不等于探针更好。
官方主结果显示了什么分化?
主结果的核心分化是聚类强而语种与识别弱。19500 步检查点取得 ARI 0.735、宏平均 F1 0.073、字符错误率 0.870。论文报告聚类超过 4 个基线,语种识别明显落后,字符错误率居中。这种分化在两种模型尺度下都成立,暗示掩码帧恢复可能保留了韵律、声道与说话风格等说话人相关结构,而语种识别需要每个语言音系库存的充分覆盖,250 小时分布在 67 语种上难以保证。
本地诊断与官方结果的对照进一步揭示了评估错位。本地留出验证用 45 语种 6646 样本,全部语种都出现在训练语料中,且按压缩包级别排除训练包以避免录音重叠。本地计算基于均值池化嵌入的余弦相似聚类,而官方说话人探针方法与评测集不同,因此两者数值不可直接比较。
| Metric | Step 19.5k | Step 48k |
|---|---|---|
| Macro-F1 | 0.342 | 0.395 |
| ARI | 0.225 | 0.232 |
| Intra-class sim. | 0.786 | 0.747 |
| Inter-class sim. | 0.004 | −-0.002 |
| Separability ratio | 208.98 | −-366.84 |
表前比较问题是本地诊断能否预测官方检查点排序,公平条件是同一 45 语种留出集上的两种检查点对照,指标方向仍为宏平均 F1 与 ARI 越高越好,类内相似越高越好,类间相似需结合可分比率理解。表中可分比率定义为类内相似除以类间相似,48000 步类间均值为微弱负值导致比率为负。
表后解释显示本地与官方呈双向错位。本地 48000 步在宏平均 F1 上 0.395 对比 0.342 略优,ARI 上 0.232 对比 0.225 略优,但官方却是 19500 步全面更好,尤其字符错误率 0.870 对比 0.998 差距显著。本地语种分数高估了官方语种泛化,本地聚类分数低估了官方说话人聚类。事后线性探针在同一分布上达到宏平均 F1 0.915,進一步显示可训练探针在分布内数据上的膨胀效应,不能作为野外泛化的证据。
检查点对比与规模对比支持什么,不支持什么?
若把 19500 步与 48000 步看作训练时长的对照,测的是后期训练是否持续改善探针泛化,条件是同架构同数据同目标,仅步数与学习率阶段不同。官方显示聚类相对稳定 0.735 到 0.710,但字符错误率从 0.870 恶化到 0.998,宏平均 F1 从 0.073 微降到 0.070。本地几何视角补充为类内相似从 0.786 降到 0.747,类间相似从 0.004 变为负 0.002,可分比率从 208.98 变为负 366.84。
下表聚焦这一后期退化与本地官方排序反转,比较问题是本地更优是否等于官方更优,公平条件是同留出集与同官方探针下的配对比较,指标方向为字符错误率越低越好,其余越高越好。
| 对照维度 | 19500 步 | 48000 步 | 本地与官方关系 | 方向判断 |
|---|---|---|---|---|
| 本地 Macro-F1 | 0.342 | 0.395 | 本地 48000 步更高 | 越高越好 |
| 本地 ARI | 0.225 | 0.232 | 本地 48000 步更高 | 越高越好 |
| 官方 CER | 0.870 | 0.998 | 官方 19500 步更好 | 越低越好 |
| 类间余弦相似 | 0.004 | −-0.002 | 由正转负 | 几何重组信号 |
| 可分比率 | 208.98 | −-366.84 | 符号翻转 | 不可直接比大小 |
表后解释需区分报告与推测。报告层面是后期字符错误率退化与嵌入几何重组同时发生,类内仍连贯而类间变为弱反相关,本地可分但可能丢失音素相似结构。推测层面是作者提出余弦衰减后期学习率接近最小值时,固定 K 均值目标使编码器过度特化于原始谱帧聚类边界,损害更广泛的音素泛化,迭代精化可能缓解,但原文明确这是假设,需受控实验确认。规模对照显示从 512 维 8 层到 768 维 12 层,聚类从 0.291 到 0.735,字符错误率从 0.996 到 0.870,语种仅从 0.052 到 0.073,但因批量与步数不同,不能单独归因于规模,且未做方差估计。
哪些结论尚未被验证,边界在哪里?
论文在讨论中明确标注了多处未验证推测,复述时必须保留这种限定。说话人聚类强于语种识别的解释是事后解读,掩码预测通过 utterance 内帧恢复保留说话人特征只是可能机制之一,未做消融确认。后期几何重组导致字符错误率退化的解释同样是假设,固定伪标签与衰减学习率的交互需要控制学习率 schedule 与目标更新频率的实验才能确认。
方法边界包括单次运行无方差估计、训练语料远小于基线、伪标签只算 1 次未迭代精化、缺少部件消融。这些缺项不是技术错误,但限制了因果断言。例如不能说去掉 VICReg 必然怎样,因为原文没有该对照;不能把总体趋势推广到每组语言,因为原文未按语种分组报告误差;不能承诺延迟或成本改善,因为未测量推理开销与输出帧率。
评估边界是本地诊断的三点偏差。第一是语言重叠,45 个本地语言全部见过训练,高频语言也在其中,分布内语种分数必然乐观。第二是探针方法失配,本地用余弦聚类而官方用不同说话人探针,且本地高可分对应的是语种簇而非说话人簇,这解释了本地宏平均 F1 高而 ARI 低的现象。第三是检查点排序失灵,本地更优不对应官方更优。作者给出的教训是有效本地代理需要留出语言集与训练 disjoint、按压缩包构造不重叠、探针方法与官方对齐,三者缺一不可。
要复现这套流程,第一步先做什么?
复现应按学习依赖排序,先数据后模型再评测。第一步是获取 MLCommons 无监督人类语音官方源与预计算元数据,按原文 3 条过滤规则复刻 250 小时子集,核对约 87400 块、438 分片、67 语种的量级,并保留训练压缩包列表以便按包排除构造留出集。特征按 80 维对数梅尔、傅里叶点数 400、跳长 160、16 千赫、固定 10 秒 1001 帧离线生成分片,避免在线提取引入差异。
第二步是复刻伪标签与采样。离线对按维度缩放的谱帧跑小批量 K 均值,类别数 200,默认初始化,只做 1 次。训练采样实现 70% 均衡采样加 30% 均匀分片采样,每批英语硬上限 10%,每轮重排分片与片内顺序。模型按 768 维 12 层、状态 16、卷积宽 7、扩展倍数 2 搭建,参数量核对 47.88M,掩码按有效长度 75% 用 3 到 5 连续块,损失权重按 VICReg 方差 5.0、协方差 1.0、语种 0.05 设置,优化按 AdamW 学习率 0.0001、热身 2000 步、余弦衰减到 0.1 倍、批量 128、种子 42、单卡 A6000、bfloat16 执行。
第三步是评测对齐。不要用分布内留出分数选择检查点,应构造与训练语言 disjoint 的留出语言集,并尽量复刻官方 3 段平均加 L2 归一化的嵌入生成与固定 10 秒前端。若只能做本地诊断,需同时报告语种与说话人两项,并检查类内类间相似与可分比率的符号变化。资源状态方面,本次收到的证据未绑定完成 HTTPS 验证的开源资源,因此不能声称代码模型或数据已公开,复现前需自行确认可达性。
何时值得尝试这条路线,还需补哪项验证?
当任务是野外无标注多语言表示且评测冻结嵌入时,这条路线值得尝试:双向状态空间编码器提供线性时间长时建模,掩码离散预测提供无需分词器的自监督目标,VICReg 与弱语种信号提供防坍缩与多语言结构。若下游更依赖说话人区分而非细粒度音素识别,本文证据支持优先验证该组合;若下游是语种识别或低字符错误率识别,则需先解决语言覆盖与伪标签音素对齐问题,否则可能重现本文的强聚类弱识别分化。
还需补的验证按优先级排序。首先是迭代伪标签精化对照,检验后期字符错误率退化是否缓解;其次是固定步数与批量下的规模消融,分离参数量与训练预算的影响;再次是留出语言 disjoint 的本地代理,检验检查点排序是否恢复与官方一致。每项都需多次运行给出方差,避免单点比较。
回到中心矛盾,小数据多语言无监督学习可以在说话人结构上取得可核对的官方增益,但语种与音素泛化受覆盖与目标偏差限制,本地诊断的乐观或悲观都不能直接推广到野外探针。记住 19500 步优于 48000 步的反直觉结果,以及本地 0.915 线性探针分数与官方 0.073 之间的鸿沟,是避免把分布内分数当成野外能力的具体警示。
📎 论文与评分元数据
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses
