英文题目:Content is What Remains: Invariant Speech Tokenization from Parallel Utterances
会议身份:
conference:interspeech:2026:conference-paper-id:wagner26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#数据增强 #对比学习 #向量量化 #语音 #语音编码
评分:7.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Laurin Wagner:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为不同说话人、口音、情感、语速与信道条件下的语音波形,输出为保留帧级时间对齐的内容离散序列,难点在于胡伯特模型等自监督特征仍泄漏说话人与韵律干扰并抬高条件熵与破坏可压缩性。方法为两阶段并行不变标识化:第一阶段微调编码器,以序列级软动态时间规整拉齐同转录平行对的帧轨迹,以词级对比损失聚集同词并排斥低重叠词,以音素解码器守住内容。第二阶段在编码器上接线性离散头,由指数滑动平均教师对锚定发音逐帧取最大值并去重生成组共享目标,学生以联结时序分类将组内全部发音对齐到该目标并以均匀与正交损失防止坍缩。与蒸馏或双编码器编解码器不同,该设计把平行组共有因素直接作为监督并端到端协同优化连续表示与离散划分,保留帧级接地而非转写为文本。在LibriLight上相同85M参数解码器语言模型取得测试困惑度1.95,相对HuBERT第9层2.78与WavLM第12层2.67下降约27%到30%,约1400步即达到WavLM最终水平,约减少23倍迭代。结论限于英语及合成平行补充场景,多语言、编解码器端到端重建与强情感保留尚未验证,原文未披露优化器、学习率、批量、步数与硬件成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/nyrahealth/PINT — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么:为什么语义标记总是不干净?
本文输入是原始语音波形,目标是输出帧级对齐的离散语义标记序列,供语音语言模型和神经音频编解码器直接使用。读者需要先保留两个关键信息:基线做法是把 HuBERT 或 WavLM 中间层特征经蒸馏或聚类变成码本编号;论文要解决的是这些编号里仍然能解码出说话人身份,并且在声学扰动下标记序列变化超过 40%。也就是说,内容之外的因素抬高了给定内容下标记的条件熵,既让序列难压缩,也让下游模型被迫先解开缠结再学习语言。
论文把好标记定义为双重标准:内容捕获要充分,携带足够的音素信息; nuisance 不变性要彻底,丢掉其余一切。前者保证语音识别和最小对区分能力不下降,后者保证相同词在不同人、不同条件下映射到一致的标记序列。只有同时满足这两点,游程编码和字节对编码才能合并重复帧,自回归模型才能把精力放在真正的语言结构上。
语义标记 × 声学残差: 语义标记负责承载语言内容,分工是把每 1 帧映射为可预测的离散内容单元;声学残差负责补足说话人、韵律和通道等剩余信号,分工是重建波形细节。二者搭配的理由是生成式语音语言模型需要可分解的表示,否则内容预测会被风格变化干扰;组合意义在于让自回归模型只在干净的内容序列上学习语言结构,而把可变细节留给声学层。
本文面向刚入门的研究生,输出是 1 篇可核对、可复述方法的技术解读。所有事实只来自论文原文证据与本次收到的官方原图像素,不引入外部评价。代码当前可用,地址为论文声明的开源仓库,本次解读会说明哪些结论是论文直接报告的,哪些是有限解释,哪些仍待验证。
附录:术语速查与阅读顺序建议
白话速查:语义标记指只表意的编号;声学残差指表人、表情绪、表通道的剩余;平行话语指同文多读;软动态时间规整指可微的序列对齐距离;词级对比指同词拉近异词推远。
音素解码指看编码猜音素;联结时序分类指允许伸缩的序列对齐;条件熵指给定内容下标记的不确定性;可压缩性指编码后每秒比特数;探针指在冻结特征上训练的小分类器看泄漏多少。
阅读顺序建议先看方法全景再看组件计算,再看训练数据构造,最后看实验条件与结果反证。遇到英文缩写先想白话分工,再记缩写,后文简称固定为 PINT、HuBERT、WavLM、RLE、BPE、CTC、DTW、ABX、CER、WER。所有教学例子已明确标为例子,不携带论文数值,论文数值只出现在结果表与原文连续句引用中。
同输入同目标的前人走了哪几条路?
第一条路是显式追求说话人不变的标记器。论文点名的 ContentVec 和 DC-Spin 分别用对比或聚类目标去除说话人信息,Gat 等人与 NAST 针对增强鲁棒性,StableToken 用多分支投票实现噪声不变但不处理说话人和韵律变化。这些工作与 PINT 输入相同、目标相近,但论文报告它们没有同时解决说话人、韵律和通道 3 类泄漏。 第二条路是编解码器侧的语义与声学解耦。SpeechTokenizer、Moshi 使用的 Mimi、DualCodec、XY-Tokenizer 和 SAC 通过蒸馏、双编码器或分流矢量量化改进解耦,但论文指出它们继承的语义目标本身仍是 HuBERT、WavLM、Whisper 或 w2v-BERT 特征,没有清理这些特征里已有的杂质。
PINT 的定位是正交的:不重新设计编解码结构,而是把上游编码器洗干净,输出可直接替换的语义目标。 教学上可以这样理解:前人要么在标记器内部加不变性,要么在编解码器结构上分流,而 PINT 把平行话语当作天然监督,在编码器微调阶段同时优化连续与离散表示。这种选择意味着它可以与上述编解码框架叠加,而不是互斥替代。
附录:相关路线对照表阅读指引
为避免把类别差异当同条件胜负,这里给出对照维度:同输入指是否都以波形进自监督编码器;同目标指是否都追求内容与风格解耦;同监督指用平行、对比、聚类还是增强;同运行阶段指在标记器内部、编码器上游还是编解码结构。按此 4 维再读相关工作节,会发现 PINT 与 ContentVec 共享不变目标但监督不同,与 SpeechTokenizer 共享解耦目标但阶段不同,与 StableToken 共享鲁棒目标但覆盖的变化类型不同。
这种对照的实用意义是选型:若已有编解码器且不想改结构,优先试上游清洗;若只有噪声问题而无说话人问题,轻量噪声鲁棒方案可能足够;若无任何平行数据,先验证合成增强在你的语言上能否复现编辑距离不恶化,再决定是否投入真实平行采集。
问题如何形式化:什么叫内容是剩下的东西?
论文用符号区分语言内容与标记序列。记语言内容为内容变量,标记序列为编码器加离散化后的输出。当同一内容的不同实现得到不同标记时,给定内容的条件熵远离零,泄漏的根源就是非语言变化。理想的语义标记应让该条件熵趋近于零,即相同内容映射到相同标记序列。 举一个教学例子:同一个单词由 2 位说话人各读一遍,例子本身不携带论文数值。
如果 2 位输出的去重后编号序列完全一致,说明说话人因素已被去除;如果编号序列差异很大,则说明条件熵被说话人撑高,后续的压缩与建模都要为这种差异付费。论文强调这不是修辞,而是可测量的:平行语料上的动态时间规整距离、编辑距离、探针准确率和噪声熵都是该思想的操作化。 与文本标记不同,语音标记必须保留帧级时间 grounding,才能接入现代音频编解码结构。因此论文明确不走语音识别转文本的路线:文本虽然干净,但丢掉了时长与对齐信息。
PINT 要在保留帧率的前提下,让内容成为平行实现中唯一的共享残差。
方法全景:一个样本如何走完输入到输出?
从一个波形样本出发,流程分为两个阶段。第一阶段称为平行不变训练,起点是 HuBERT-base 编码器。波形进入编码器得到帧级连续特征,一路送入两层 Transformer 音素解码器做教师强制交叉熵,保证内容捕获;另一路在小批量内与同转录组其他话语计算序列级软动态时间规整损失和词级对比损失,保证不变性。
第二阶段称为离散标记训练,在编码器上加线性头输出包含空白符的离散码本逻辑值,教师用指数滑动平均副本处理锚点话语,经逐帧取最大值加去重得到组共享目标,学生用联结时序分类把组内每条话语对齐到该目标,同时联合微调整个语义编码器。 关键安排是 2 阶段都保留第一阶段损失占主导,离散损失权重相对下调,避免离散分区破坏已学到的连续不变性。论文还引入空白符禁用、批量级均匀分布促进项与原型向量正交项来防止坍缩与码本塌陷。
最终推理时取最后一层线性头的逐帧取最大值输出作为标记编号,无需额外聚类。 该全景的教学要点是先沿单样本理解表示流,再理解组级目标:平行组提供监督来源,对齐损失提供梯度路径,音素解码提供内容锚点,三者缺一不可。
三个损失各自算什么,为什么必须组合?
序列级软动态时间规整损失处理时长不一的帧序列。它对小批量内每个转录组相同的正例对计算软动态时间规整距离,并按最大序列长度归一化后平均。由于平行对只共享语言内容而在说话人、风格和录音条件上不同,最小化该距离会迫使编码器输出一致表示并抑制杂质。但论文明确指出只用该损失会导致平凡坍缩,即输出常数也能获得低距离。
平行话语 × 软动态时间规整损失: 平行话语提供同一文本在不同说话人、口音、速度和情感下的多实现,分工是保证语言内容是唯一的共享因子;软动态时间规整损失负责拉近同一转录组内帧级特征序列的距离,分工是吸收时长和语速差异。搭配理由是只有在平行对上施加序列级一致性约束,编码器才被迫丢弃非常值变化;组合意义是把内容不变性从假设变成可优化的目标。
词级对比损失用蒙特利尔强制对齐器得到的词边界,把每词跨度内的编码帧平均为词表示。同词位置跨平行话语构成正例,音素集合杰卡德相似度低于阈值的词构成负例,损失为一减去正例持续时间加权的平均余弦相似度,再加负例相似度加权项。这种吸引与排斥既防止坍缩,又鼓励词级对齐。杰卡德门控的作用是避免音素相近的负例给出矛盾梯度。
词级对比损失 × 音素解码器交叉熵损失: 词级对比损失负责在强制对齐给出的词边界上吸引相同词位置、排斥音素集合差异大的词,分工是防止序列级对齐坍缩到常数解并强化词级可分性;音素解码器交叉熵损失负责用转录本音素化目标做教师强制解码,分工是保证内容捕获不丢失。搭配理由是只讲不变会丢内容,只讲内容会留杂质;组合意义是同时满足论文提出的双重标准:充分携带音素信息且丢弃其余因素。
解码器交叉熵损失是两层 Transformer 经交叉注意力 attending 编码器输出,在音素化转录本上做教师强制预测。它的计算目标是原始的音素分类目标,不是近似或停止梯度。原文给出的权重为序列规整项 0.5、词级项 2、负例项 1、交叉熵项 10,说明内容捕获项权重最大。消融中只用自回归解码或只用联结时序分类都会在最小对任务上变差,支持多损失组合的必要性。
训练分哪两步走,数据平行性从哪里来?
第一阶段训练使用真平行语料、非平行语料、合成平行样本和噪声 4 类数据。真平行语料包括 ARCTIC、CSTR-VCTK 等同一文本多人录制的语料,覆盖口音、语速、风格和情感变化;非平行语料包括 LibriSpeech 和 Tedlium-3,因缺乏共享转录本而在同一话语上施加加性噪声、混响、变速变调和通道失真,现场构造伪平行对;合成部分用 Kokoro 合成器为这些数据集生成多平行样本;噪声被当作空转录本的平行数据参与训练。所有语料都经强制对齐得到词级时间戳,评估用数据严格排除训练重叠,转录本归一化后相同文本划入同一划分以防泄漏。
连续表示 × 离散标记序列: 连续表示是编码器输出的帧级向量,分工是保留可微的细粒度内容结构;离散标记序列是经线性头加精简去重得到的码本编号序列,分工是作为可压缩、可建模的语言模型输入。搭配理由是事后聚类目标与序列一致性无关,不能保证平行话语输出相同编号;组合意义是第二阶段用联结时序分类把全组话语对齐到同一教师目标,让连续不变性和离散一致性联合优化。
第二阶段的构造细节是:教师为学生的指数滑动平均副本,处理锚点话语得到逻辑值,经逐帧取最大值解码再去重形成组公共离散目标;学生对组内每条话语用联结时序分类对齐到该共享目标。因联结时序分类允许多对 1 对齐,时长与语速差异被吸收而不惩罚,推动不同说话人走向同一离散输出。与引用方法冻结编码器不同,本文端到端联合更新,离散损失权重为 0.6,均匀与正交项为 0.3,连续不变训练仍是主导学习信号。原文未报告优化器类型、学习率与硬件预算的具体缺项,本解读不从模型名称推定实现。
实验测什么、和谁比、条件是否一致?
评估沿双重标准组织为三轴。内容捕获轴测语音识别字错率与字符错率、最小对可分性与音素归一化互信息;不变性与鲁棒性轴测说话人与情感探针准确率、平行话语一致性与噪声鲁棒性;压缩效益轴测去重、游程编码和字节对编码后的每秒标记数与比特率,以及相同结构语言模型的困惑度。指标方向为:识别错误率、探针准确率、动态时间规整比、编辑距离、熵与均方根标准差越低越不变,噪声集中度越高越好,比特率与困惑度越低越好。
基线为 HuBERT-base 第九层与 WavLM-base 第十二层,论文说明这两层最接近音素。离散比较统一用 200 类,基线用 TIMIT 拟合的 k 均值,PINT 用最后一层线性头输出。消融包括只用自回归解码、只用联结时序分类、只用合成数据、合成增强与去掉噪声 5 种,用于分离数据与损失的贡献。语言模型比较用完全相同的 85M 参数解码器 Transformer,在 LibriLight 子集的原始编号流上训练,上下文 3072,权重绑定,保证架构与数据一致。 数据划分上 CSTR-VCTK 留出 10% 说话人,TIMIT 与 LibriSpeech 用标准非重叠划分,无官方划分的语料按归一化转录本划分。
探针在冻结表示上训练时延神经网络分类器,分别测说话人身份与情感加强度。噪声鲁棒性用训练未见的两类噪声测离散编号分布熵与使用编号数,连续侧测噪声与语音嵌入的逐维标准差均方根比。
内容保住了吗,不变性与压缩又带来什么?
内容捕获上论文报告 PINT 在连续与离散模式下语音识别均优于基线,且最小对错误率更低,说明不变训练没有牺牲内容。合成增强变体表现接近全量,支持用合成平行扩展到无平行语料语言的可能性;而纯合成训练在识别与可分性上退化,说明真实数据对真实场景不可或缺。具体识别与可分数字见原文表 2,本解读不复述未在连续原句中逐字出现的表格裸值,只强调方向与机制。
不变性上需要先提出比较问题:在冻结表示与相同探针条件下,谁更难被猜出说话人与情感,谁在平行话语上更一致。下表整理探针与一致性结果,公平条件是同一 CSTR-VCTK 留出集与同一 RAVDESS 情感集,指标方向均为越低越不变。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 93.1 | 55.4 | 0.1609 | 0.2275;0.499;139;0.9051 |
| 来源句二 | 78.9 | 54.6 | 0.1218 | 0.2096;0.642;191;1.0010 |
| 来源句三 | 1.2 | 32.1 | 0.0092 | 0.0659;0.000;1;0.0049 |
| 来源句四 | 93.1% | 1.2% | 42% | 19;20;21 |
| 来源句五 | 55 % | 32 | 33 % | — |
表后解释:PINT 把说话人探针从 90% 以上压到 1.2% 附近,相对降低 98.7%,显示近乎完全的说话人不变;情感准确率从五成中段降到三成出头,但仍高于随机,说明部分情感信号残留。平行语料动态时间规整距离相对 HuBERT 缩小约 20 倍,离散编辑距离也明显更低。代价是纯合成变体编辑距离偏高,表明仅靠合成变化虽能去说话人信号,却不足以保证离散序列一致,至少需要部分真实数据。
未胜出项是去掉噪声变体在情感泄漏上最低,却在噪声集中度与规整距离上变差,证实噪声增强对鲁棒性不可替代。 压缩与建模效益是最终检验。导读如下:下图比较相同 85M 模型在 3 种标记流上的训练困惑度曲线,横轴为训练步数 1,000 步,纵轴为训练困惑度,3 条实线为训练过程,3 条虚线为最终测试困惑度,标注点显示 PINT 多早追平基线。
看图路径: 1. 先看横轴训练步数与纵轴训练困惑度,确认三条实线分别是橙色 HuBERT、蓝色 WavLM 和绿色 PINT;2. 再看三条水平虚线对应的最终测试困惑度,比较绿色线明显低于橙蓝线的位置;3. 找到约 1.4 千步处的竖虚线与箭头标注,确认 PINT 多早达到基线最终水平;4. 观察训练后期三条曲线是否继续拉开差距,判断优势是全程保持还是仅在早期
论文图 1。原论文 Figure 1:“Training perplexity on LibriLight for an identical 85 M-parameter transformer LM on HuBERT L9, WavLM L12, and PINT L12 (k=200) tokens.”。
图中可见绿色 PINT 曲线从起点就明显低于橙色 HuBERT 与蓝色 WavLM,并快速下降到两条基线虚线以下;约 1.41,000 步处的竖线与箭头标注表明 PINT 用约少 23 倍的迭代达到 WavLM 最终水平,且继续下探到更低位置。这与压缩表一致:PINT 去重率更高,字节对编码后接近文本水平。论文报告测试困惑度为 1.95 对 2.78 与 2.67,降低 27% 到三十。下表把困惑度与比特率放在同一可运行比较下,条件是相同模型结构与相同 LibriLight 数据。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 29 | 9.6 | 56 | 42 %;27;30 %;1.95;2.78;2.67;30;82.5;8;13615;2;31;30.4;1;2273 |
| 来源句二 | 8.2 | 107 | 8.3 | 108;4.3;56;1.5 |
| 来源句三 | 400 | 31 | 116 | — |
| 来源句四 | 2022 | 2212.04356 | 29 | 3451;3460;2021;23;8 |
表后解释:PINT 游程编码达到 152 比特每秒,相对原始 400 比特每秒压缩约 2.6 倍,仅比原始文本 116 比特每秒高约 31%,同时保留帧级对齐;字节对编码去重后达到 56 比特每秒,接近文本字节对编码 48 比特每秒,而基线停在 107 到 108 比特每秒。机制在于 PINT 让相同内容更可靠地映射到相同编号序列,字节对编码能发现稳定模式,而基线因条件变化产生不同序列,打碎了可合并模式。限制是总体趋势不等于每组每步都成立,且困惑度改善不自动等于延迟或误判率改善,原文未测量这些量。
条件熵 × 可压缩性: 条件熵指给定语言内容下标记序列的不确定性,分工是量化非语言变化泄漏了多少;可压缩性指经去重、游程编码和字节对编码后的每秒标记数与比特率,分工是检验这种不确定性是否真的影响存储与建模。搭配理由是泄漏的每一比特都会打断重复模式,使压缩算法无法合并;组合意义是把抽象的解耦质量转化为可测量的比特率和困惑度下降。
附录:数字阅读注意事项
读数时先确认数据集、模型层、实验阶段、指标与聚合对象 5 个要素。同一数值在不同指标下含义不同,不能因数值相同认定为同一指标;百分点与相对百分比不同,论文报告的 98.7% 相对降低对应从 93.1 到 1.2 的绝对变化,不可混读。不同指标差值不能放入模型列下比较,自动指标不能当人工评价。 若发现表头、图注或正文算术冲突,应明确标注冲突而不编造划分或聚合口径。本解读中表格数字全部由原文连续句逐字覆盖,千分位与小数精度保留原文写法,叙述数量用阿拉伯数字并在数字与拉丁单位间留空格,确保可核对与可复述。
拿掉哪一块会怎样,失败条件说什么?
消融围绕损失与数据 2 维展开。只用软动态时间规整而无词级损失会导致坍缩,这是论文明确的失败条件;只用自回归解码的变体保留约 20.1% 的说话人准确率,约为完整 PINT 的 16.8 倍,说明序列级对齐不可少;只用联结时序分类的变体在探针与编辑距离上都更差,支持连续与离散联合优化的价值。 数据侧,纯合成训练说话人泄漏低但编辑距离高达约 0.25 对 0.06,表明合成变化去除了说话人但未带来真实序列一致性。
去掉噪声训练情感泄漏最低但噪声熵与编号使用数恶化,均方根标准差显著升高,证实噪声作为空转录本平行数据的独特作用。合成增强即真实样本只与合成样本交互而不与真实样本交互的变体,在内容与不变上接近全量,这是向无平行语料语言扩展的关键证据。 这些反证共同说明每个组件与数据类型贡献不同:规整损失给一致性,词级对比防坍缩,音素解码保内容,真实数据保泛化,噪声增强保鲁棒。
缺少任一环节都会在某一轴上暴露代价,而不是均匀下降。
边界在哪里,哪些结论不能推广?
首先是残留与未评测边界。情感探针从约 55% 降到约 32%,但仍远高于随机,说明韵律与情感未被完全去除;论文未测量误判率、推理延迟、输出帧率与实际部署成本,因此不能承诺这些量得到改善。训练资源与推理开销在原文中未报告具体硬件预算,本解读明确标注该缺项。 其次是数据与对齐依赖。
词级对比依赖强制对齐的词边界质量,若对齐错误,词表示平均会混入邻词;平行分组依赖转录本归一化与划分策略,若划分不当会发生转录本泄漏。原文通过同划分隔离缓解,但跨语料的口音与情感覆盖仍限于英语,合成扩展到其他语言属于可能而待验证的推测。 最后是指标冲突与聚合口径。原文表头、图注与正文算术在个别百分比表述上存在舍入差异,叙述数量时应以原文连续句为准,不自行四舍五入或换算相对百分比与百分点。
不同指标的差值不能混入同一模型列下比较,自动指标也不能当作人工评价。
复现先做什么,需要保留哪些条件?
第一步是准备数据与对齐。按论文表 1 收集真平行、非平行、合成与噪声 4 类数据,用蒙特利尔强制对齐器生成词级时间戳,并按归一化转录本划分保证评估文本不进训练。对非平行数据现场施加白噪声、粉噪声、棕噪声、混响、变速变调与通道失真构造伪平行对;对噪声数据视为空转录本参与训练。评估严格使用 CSTR-VCTK 留出说话人、RAVDESS 情感集与 LibriSpeech 标准划分。
第二步是 2 阶段训练。先从 HuBERT-base 出发,按权重 0.5、2、1、10 组合三损失训练连续不变表示;再加线性离散头,用指数滑动平均教师生成去重共享目标,用联结时序分类对齐组内话语,离散权重 0.6,正交均匀项 0.3,保持连续项主导。离散词表取 200,基线 k 均值在 TIMIT 上拟合以保证可比。 代码当前可用,仓库地址为论文声明的开源链接,本次未能逐行验证脚本可运行性。
复现时应先跑说话人探针与噪声熵作为不变性冒烟测试,再跑识别与最小对任务确认内容未丢,最后跑压缩与小语言模型困惑度确认端到端收益。若缺少某类平行数据,优先用合成增强替代并观察编辑距离是否恶化。
何时值得尝试,一句话如何记住它?
当你的语音语言模型被说话人与通道变化拖累、压缩率上不去,且你能构造平行或伪平行数据时,值得尝试 PINT 式上游清洗。它把内容定义为平行实现中剩下的东西,用对齐损失蒸馏出共享残差,再用离散一致性锁定为可建模的编号流。记住 3 个数字方向:说话人可解码性大幅下降、相同内容序列一致性大幅上升、相同模型困惑度与比特率大幅下降,而情感残留与对齐依赖是主要代价。
未来工作包括经合成数据的多语言扩展、与编解码架构的集成,以及利用游程可压缩性的时长解耦生成方案。对于初学者,复述时应沿输入波形到连续特征到组目标到离散编号再到压缩与建模的链条讲述,每一步都回指平行监督的来源与作用,避免把比喻当作性质证明。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
