英文题目:In-Context Adaptation of Encoder-Decoder Models in Speech Recognition
标签:#语音识别 | #测试时自适应 | #语音 | #少样本
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Yen Meng:机构信息未在 arXiv HTML 中可靠披露
- Sharon Goldwater:机构信息未在 arXiv HTML 中可靠披露
- Hao Tang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动语音识别需将目标语音转写为文本,难点在于面对新说话人、口音与自发语音偏移时在推理时无参数更新实现快速适应。方法链先用基于词频逆文档频率的词法相似度为目标语音检索同说话人的k个示范语音文本对,相似度排序结果决定后续示范的词法与说话人相关性。接着拼贴示范将全部示例音频与目标音频拼接后统一编码,并将全部示例文本作为解码器前缀拼贴,形成长音频部分转写待续写上下文。然后冻结的编码器解码器对该上下文做续写补全式解码,直接生成目标转写,使检索输出经由拼贴格式进入解码条件。与之相比交错示范将语音嵌入与文本交替排列并附加指令提示,其依赖全能模型保留的大语言模型示例学习能力,因而仅适用于特定模型而拼贴适用于交叉注意力与解码器两类架构。在L2-Arctic同说话人4示例检索设置下,Qwen2.5-Omni拼贴示范首遍转写检索的WER为4.5,高于甲骨文转写检索的WER4.1。上下文长度与检索质量构成明确外推边界,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
要解决的是推理时适应,不是重新训练一个模型吗?
输入是已经训练好的英语语音识别模型与一段待识别的目标语音,目标是在不更新参数的前提下,利用少量同领域语音文本对作为示范,在推理时降低新说话人、新口音或新领域的词错误率。必须保留的信息是示范的组织方式、示范与目标的相关性条件以及可复述的解码流程,输出是按词错误率衡量的适应增益与适用边界。本文只讲论文实际研究的英语读写与会议语音上的适应,不扩展到翻译或合成等其他任务。
举例来说,如果目标说话人带有非母语口音,传统做法可能需要收集该说话人数据做微调,而本文的做法是在解码目标语音时,把该说话人或相似词汇的几段已转写语音一并提供给模型,让模型在本次解码中自行偏向正确的发音与用词。
上下文学习 × 上下文自适应: 上下文学习指推理时给示例标签对让模型完成未见过的新任务,上下文自适应指对训练时已见过的语音识别任务,用推理时示例让模型适应新说话人、口音或领域,二者分工是前者强调任务泛化,后者强调同任务的分布偏移,搭配理由是若模型能从示例推断新任务规则,也应能从示例推断同任务的发音与用词偏好,组合意义是把语音识别的口音适应和词汇偏置统一为一种推理时示范利用问题。
论文把这种能力称为上下文自适应。判断标准很直接,给示范后性能是否比不给示范更好。研究动机是已有工作多关注用上下文学习做新任务,或只在某个特定模型上验证语音识别的示范效果,缺少跨架构的对照,也没有说清示范中到底是语音信息有用还是文本信息有用。因此论文要回答两个学习依赖问题,第一是现代编码器解码器模型是否开箱即用就具备这种适应能力,第二是示范的语音相似、词汇相似与说话人一致分别贡献多少。
已有路线为什么只盯着交错示范与特定模型?
同输入同目标的已有工作包括在 Whisper 上拼接长音频做上下文偏置,以及在 Phi-4 多模态指令模型等大语言模型语音模型上交错排列语音与文本做示例学习。这些工作与本文的运行阶段相同,都是推理时提供示范且不更新参数。差异在于监督与构造条件,已有工作往往依赖特定模型的训练配方或指令微调来激发交错理解,或只研究如何检索到更好的示范,而缺少用真实文本控制的上限实验。
论文明确指出,语音识别的示范不一定需要交错排列,拼接全部语音再拼接全部文本是一种更自然且对所有编码器解码器模型都可用的替代。同运行阶段的对照因此是,拼接方式是否能在不改提示词、不加训练的条件下达到或超过交错方式,以及小型的传统注意力模型是否也能像大型多模态模型一样适应。
论文没有把类别差异当成同条件胜负,而是按模型是否在训练中见过交错模态来划分预期,只有保留大语言模型能力的多模态模型才被预期能处理交错输入。
示范与目标之间要控制哪些相关性?
论文把问题形式化为,给定目标语音与目标文本,解码时额外可见 k 个示例语音与示例文本。需要控制的相关性有 3 类,语音相似、词汇相似与说话人是否相同。为了可控比较,论文在 L2-Arctic 上做文章,该数据集由非母语英语朗读组成,句子做过音素平衡且同一套句子被多人朗读,因此能分离词汇相同与说话人相同的影响。随后把结论推广到朗读但更不干净的 LibriSpeech 测试集与其他口音混合集,以及自发会议语音 AMI,以检验读写到自发的泛化。
评估统一用词错误率,并用 Whisper 规范器对假设与参考做归一化,保证跨模型比较的一致性。示范排序规则是按相似度把最相似的放在最后,即最靠近待解码语音的位置。除金色文本设置外,论文保证示范中不包含与目标完全相同的文本,避免直接复制的平凡解。金色文本同说话人设置甚至直接把目标语音与其真实文本作为示范,用来做复制能力的上限检查。
两种示范在数据流上有什么不同?
从一个样本走完全程有助于理解。假设要识别一段目标语音,系统先准备好 k 段示例语音与对应的示例文本。拼接示范的做法是把示例语音与目标语音在波形或特征层面连成一段长音频送入编码器,把示例文本在解码器侧作为已给前缀,再让解码器续写目标文本。交错示范的做法是把每段示例语音单独编码,把编码结果与对应文本交替排成提示序列,最后接上目标语音编码,再让解码器生成目标文本。前者本质是续写一段部分转写的长音频,后者本质是按示例对回答问题。下图展示了两种组织在注意力模型与解码器专用模型中的箭头走向,是理解后续公式的前提。
下面导读图 1 的 3 个面板,重点是看音频在哪里拼接、文本在哪里拼接,以及解码器看到了什么。
看图路径: 1. 先看上方面板编码器把示例音频与目标音频连成一段长音频的箭头走向;2. 再看下面板解码器同时接收长音频编码与示例文本前缀的位置;3. 最后对比交错面板中示例音频编码与示例文本交替进入解码器的顺序
论文图 1。原论文 Fig. 1::“Two demonstration approaches for in-context adaptation of encoder-decoder models: (a) Collated demonstration for AED models (top) and for decoder-only/LLM-based models (bottom)…”。
图 1 上方面板显示传统注意力模型的拼接路径,示例音频与目标音频共同进入编码器,示例文本进入解码器作为前缀,目标文本从解码器上方输出。中方面板显示基于解码器专用模型的拼接路径,长音频编码、文本提示与示例文本共同进入解码器,同样输出目标文本。下方面板显示交错路径,每段示例音频编码与其文本交替进入解码器,目标音频编码放在末尾。可以看到拼接只形成一个长音频上下文,而交错形成多个音频文本交替块,这解释了为什么拼接不需要特殊指令而交错通常需要指令提示。
编码器、解码器与拼接位置如何配合?
白话先讲术语。编码器指把语音变成向量表示的模块,解码器指根据这些向量与已给文本逐词生成后续文本的模块。注意力编码器解码器指解码器通过交叉注意力读取编码器输出的传统结构,解码器专用模型指解码器是自回归大语言模型、语音编码作为其输入记号的结构。
注意力编码器解码器 × 大语言模型解码器: 注意力编码器解码器用交叉注意力把编码后语音送入专用解码器,大语言模型解码器则把语音编码作为前缀记号送入通用自回归语言模型,分工是前者结构专为语音到文本对齐设计,后者保留文本指令与交错输入理解能力,搭配理由是两类模型都满足编码器加解码器的通用形式,组合意义是可以在同一示范框架下检验自适应能力是否必须依赖大语言模型。
通用识别可以写成编码后解码的形式,符号含义是 x 为目标语音,Enc 为语音编码器,Dec 为解码器,y 为输出文本。
\[\displaystyle y=\text{Dec}(\text{Enc}(x))\]该公式的计算目标是说明所有模型都遵循先编码再解码的主路径,区别只在解码器还看到什么额外上下文。拼接示范对传统注意力模型的实现是,把示例语音与目标语音连起来编码,把示例文本作为解码器前缀。
\[\displaystyle y=\text{Dec}(\text{Enc}([x_{1};\ldots;x_{k};x]),[y_{1};\ldots;y_{k}]),\]其中方括号与分号表示向量拼接,x1 到 xk 为示例语音,y1 到 yk 为示例文本。希望是解码器在生成目标时能通过注意力兼顾示例语音与示例文本。拼接示范对解码器专用结构的实现类似,只是最后的拼接位置不同,长音频编码与示例文本共同作为解码器输入序列,必要时再加简短文本提示。
\[\displaystyle y=\text{Dec}\Big(\Big[\text{Enc}([x_{1};\ldots;x_{k};x]);y_{1};\ldots;y_{k}\Big]\Big).\]交错示范的实现是每段示例语音单独编码,再与对应文本交替排列。
\[\displaystyle y=\text{Dec}([\text{Enc}(x_{1});y_{1};\ldots;\text{Enc}(x_{k});y_{k};\text{Enc}(x)]).\]该方式要求解码器理解交错格式与文本指令,因此论文指出除非模型在训练中见过交错模态或保留大语言模型能力,否则不应预期其能处理这种输入。
拼接示范 × 交错示范: 拼接示范把多段示例语音与目标语音先在音频侧连起来,把多段示例文本在文本侧连起来再让模型续写,交错示范把每段示例语音编码与其文本交替排列再接目标语音,分工是前者把任务变成一段部分转写长音频的续写,后者把任务变成按语音文本对提示的问答,搭配理由是前者不依赖指令理解,后者依赖大语言模型的交错理解,组合意义是区分广适用的续写机制与依赖训练与提示的指令机制。
实现细节上,论文为稳定生成在所有模型的第一个解码步抑制结束符,确保至少为目标音频产生一个输出记号。交错实验沿用已有工作的指令提示词,且发现去掉提示词后适应明显变弱,单示例时尤为明显,这支持了交错依赖提示工程的判断。
本研究训练了什么,没有训练什么?
本研究没有训练任何语音识别模型,所有 6 个模型都是直接调用开源权重做推理,没有更新参数,没有计算梯度,也没有为上下文自适应设计新的损失函数。因此不存在参数冻结与更新的对比、梯度路径的选择或训练轮次的重置时机,论文也未报告这些缺项,不能从模型名称推定其训练细节。真实的计算过程是构造示范与运行解码。
构造示范包括按音素三元组词频逆文档频率计算语音相似,按去停用词后的词词频逆文档频率计算词汇相似,按说话人标识控制同人与不同人,再按相似度排序取前 k 个。第二遍实用流程中,用第一遍识别假设代替真实文本计算词汇相似,但示范中仍使用示例的真实转写。推理计算是把拼接后的长音频与文本前缀送入模型做 1 次前向解码,得到目标假设后按规范文本计算词错误率。
长音频长度受模型训练时见过的时长限制,论文通过实验确定在 L2-Arctic 上 30 秒内放 4 个示范是可行范围,超出则部分模型会退化。
模型、数据与示范条件如何对齐才能公平比较?
要回答是否都能适应的问题,需要模型覆盖两种架构与两种训练预期。下表总结了 6 个模型及其架构与是否预期支持交错输入,是后续解释交错成败的关键条件。比较的问题是,在相同示范数量与相同说话人控制下,不同架构的增益是否一致。公平条件是同一数据集、同一检索与排序规则、同一词错误率规范化,以及同一示范数量。指标方向是词错误率越低越好,相对下降越大表示适应越强。
| Model | Architecture | ICL |
|---|---|---|
| Whisper [25] | AED | not intended |
| Canary [26] | AED | not intended |
| Canary-Qwen [27] | LLM-based (ASR-only) | not intended |
| Qwen3-ASR [28] | LLM-based (ASR-only) | not intended |
| Phi-4-MM [29] | LLM-based (Omni) | intended |
| Qwen2.5-Omni [30] | LLM-based (Omni) | intended |
上表显示 Whisper 与 Canary 为传统注意力结构且不预期支持交错,Canary-Qwen 与 Qwen3 语音识别虽用大语言模型但仅作语音识别用途也不预期支持交错,只有 Phi-4 多模态与 Qwen2.5-Omni 作为多模态模型在训练中接触交错模态而被标为预期支持。这一划分直接对应后文交错实验只在这 2 个模型上有效。数据方面,L2-Arctic 用于受控的音素、词汇与说话人分析,LibriSpeech 测试集用于朗读域的词汇偏置检验,AMI 用于自发会议语音的泛化检验。示范设置共 8 种,随机、语音相似、词汇相似、金色文本分别乘以同说话人与不同说话人。
语音相似基于音素三元组词频逆文档频率,词汇相似基于去停用词后的词词频逆文档频率。示范按相似度排序,最相似的放在最后。金色文本不同说话人指用其他人朗读的相同句子,相同说话人指直接用目标语音与其真实文本,这种设置只用于上限检查而非可部署收益。
开箱即用的适应增益有多大,哪里是上限?
测的是有无示范的词错误率变化,与谁比是无示范基线与随机示范基线,条件一致指同一模型同一测试集同一示范数量。先看极端检查,给一个随机不同说话人示范时各模型词错误率接近无示范基线,说明能忽略无关示范,给目标语音与其真实文本时各模型接近完全正确,说明能复制已给答案,两项都通过才能声称具备适应能力。下表把论文直接报告的相对增益放在同一框架下比较,区分甲骨文上限与实际可运行的第二遍流程,指标方向都是相对下降越大越好。
| 场景 | 示范类型 | 对照基线 | 相对变化 | 可部署性 |
|---|---|---|---|---|
| 甲骨文上限 | 词汇加同说话人 | 无示范基线 | up to 30% relative improvement in the oracle experiments | 需真实文本检索不可直接部署 |
| 第一遍假设检索 | 词汇加同说话人 | 无示范基线 | up to 23% using first-pass hypotheses | 可用第一遍假设实际运行 |
| 跨域词汇策略 | 同说话人词汇相似 | 无示范基线 | at least 20% relative WER reduction with collated demonstration | 在朗读域可运行 |
| 第二遍相对随机示范 | 词汇相似 | Random setting | 3% to 12% relative WER reduction over the Random setting | 可运行且保留大部分增益 |
| 第二遍相对甲骨文差距 | 词汇相似 | oracle gap | closing 25% to 60% of the gaps against the oracle | 衡量检索误差吃掉多少 |
上表的主要收益是甲骨文条件下最大约 30% 的相对改善,用第一遍假设检索仍保留约 23% 的相对改善,第二遍相对随机示范还有 3% 到 12% 的相对下降,相当于闭合了相对甲骨文差距的 25% 到 60%。代价与限制是甲骨文数字依赖目标真实文本检索,属于事后最优不能代替可部署收益,实际收益要看第一遍假设的质量。在 L2-Arctic 上词汇相似加同说话人是最佳策略,随机同说话人也有小而一致的增益,而随机不同说话人基本无增益。
甲骨文示范 × 第二遍检索: 甲骨文示范指用目标真实文本去检索最相似的示范,第二遍检索指用第一遍识别假设去检索示范,分工是前者测量能力上限与信息来源,后者测量实际可部署流程的收益,搭配理由是只有先确认上限存在,才能判断检索误差吃掉多少增益,组合意义是把理想条件下的适应潜力与无真实文本时的实用增益连接起来。
下面导读图 3 的柱状对比,重点是看拼接条件下各模型的基线与词汇示范差异。
看图路径: 1. 先按模型分组找到基线灰色柱与各示范条件柱的相对高低;2. 再对比同说话人与不同说话人条件下词相似示范的下降幅度;3. 最后查看最右侧金色文本示范柱接近零的位置以确认复制能力
论文图 3。原论文 Fig. 3::“WERs of in-context adaptation on L2-Arctic for different demonstration settings. We use 4 demonstrations for all settings except the Gold text, which only has 1 demonstration.”。
图 3 左侧拼接部分显示 6 个模型在 4 个示范下的一致趋势,词汇同说话人柱明显低于基线与随机不同说话人柱,语音相似次之,金色文本柱接近零。右侧交错部分只显示两个多模态模型,同样呈现词汇示范优于随机的趋势,但柱间差异与拼接部分不完全相同。可以看到较小的传统模型与较大的语言模型解码器模型获得的相对下降幅度相近,这支持了适应能力不必然依赖预训练大语言模型解码器的判断。
词汇、语音与说话人哪个更重要,示范越多越好吗?
测的是信息来源的分离贡献,与谁比是随机示范、语音相似示范与词汇示范在同人与不同人条件下的交叉对比,条件一致指同一目标集与同一示范数量。论文报告显示,不含重复文本的条件下,随机同说话人带来小而一致的增益,语音相似与词汇相似带来更大增益,其中词汇相似略优于语音相似,且叠加同说话人时增益最大,范围在拼接示范下达到 25% 到 30% 的词错误率下降。
这支持词汇与说话人信息都参与适应的解释,但属于有限解释而非因果证明,因为词汇相似示范可能同时携带相近的音素序列。未胜出项是随机不同说话人,基本不带来改善,说明无关示范虽能被忽略但也不能指望其带来增益。示范数量从 1 增加到 4 时,总体词错误率下降,但前两个示范带来大部分改善,后续边际递减。
词汇相似 × 说话人一致: 词汇相似指示范文本与目标文本在词层面重叠高,说话人一致指标范语音与目标语音来自同一人,分工是前者提供输出偏好与语言模型偏置,后者提供发音与声学归一化线索,搭配理由是语音识别错误既有听不清也有用词习惯问题,组合意义是论文通过交叉控制发现两者叠加时增益最大,说明声学与语言信息都参与了自适应。
上下文长度是另一类消融。测的是在示范与目标之间插入不同时长静音后金色文本设置的词错误率,目的是检验模型处理长音频的能力。比较的问题是哪些模型能在拉长输入后仍保持复制能力。公平条件是同一金色文本示范与同一静音插入位置。指标方向仍是词错误率越低越好。下面导读图 2 的曲线对比,重点是看长静音下谁先上升。
看图路径: 1. 先确认横轴是示范与目标之间插入的静音时长纵轴是词错误率;2. 再观察各模型曲线在短静音段保持低位而在长静音段分化的位置;3. 最后比较保持平稳的模型与快速上升的模型之间的耐受差异
论文图 2。原论文 Fig. 2::“WERs when separating the demonstration and the target speech with silence in the Gold text setting on L2-Arctic.”。
图 2 横轴为静音时长秒数,纵轴为词错误率百分比。可见短静音段各模型都保持低位,随着静音拉长到 20 秒以上,部分模型曲线快速上升,其中传统模型与某个多模态模型的上升更早更陡,而另一些模型在 40 到 50 秒仍保持平稳。这显示拼接示范虽广适用但受模型上下文长度限制,论文因此在后续实验中按模型能力装入尽可能多的示范,在 L2-Arctic 上通常为 4 个。像素不能精确辨别的中间数值不硬写,趋势判断以曲线的升降方向与分化位置为准。
跨域与交错方式在哪里失效?
在 LibriSpeech 测试集上,总体改善小于 L2-Arctic,仅给同说话人随机示范的效果变弱,但同说话人加词汇相似仍是最佳策略,在拼接示范下至少达到 20% 的相对下降。在 AMI 自发会议语音上,适应更弱,论文报告 Phi-4 多模态在交错示范下完全失效,表现为严重复制示范文本导致词错误率崩溃,而 Qwen2.5-Omni 仍能适应。有趣的是,在词汇设置下传统 Whisper 的边际增益最大,几乎追平基于大语言模型的语音识别模型,这再次支持适应不必然需要大语言模型的判断。
交错示范的限制是只适用于特定模型,Canary-Qwen 与 Qwen3 语音识别虽基于大语言模型但不预期支持交错,实验中也未观察到适应效果,且交错对提示词措辞敏感,去掉指令提示后适应明显变弱。拼接示范的限制是长音频敏感与示范数量边际递减,论文未测量延迟与计算开销的定量对比,因此不能承诺增加示范在推理成本上一定划算。总体趋势不等于每组都成立,跨数据集比较时交错的波动大于拼接,待验证的是更好的检索方法与更长的上下文建模能否稳定跨域增益。
要复现需要准备什么,按什么顺序跑?
先准备模型权重与数据划分。模型用论文列出的 6 个开源模型,数据用 L2-Arctic、LibriSpeech 测试集与 AMI 开放语音识别榜单测试划分,评估用词错误率加 Whisper 规范器。资源状态是正文开源声明的唯一依据,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开,只能按论文描述的模型名称与数据集名称自行准备。再准备示范检索。
第一步对目标做第一遍识别得到假设,第二步用词频逆文档频率计算假设与候选池的词汇相似,语音相似则用音素三元组词频逆文档频率,第三步按说话人过滤为同人与不同人两组,第四步按相似度排序并把最相似的放在最后,第五步取前 k 个,保证除金色文本检查外不放入与目标相同文本。然后运行解码。拼接流程把示例语音与目标语音连成 30 秒内的长音频,把示例文本作为前缀,第一个解码步抑制结束符后生成目标假设。
交错流程只在多模态模型上跑,需加上论文沿用的指令提示词,把示例语音编码与文本交替排列。关键超参数与信息条件是示范数量 L2-Arctic 上为 4 个,长音频控制在 30 秒内,排序为最相似靠近目标,指标为规范化后的词错误率。复现先做两个极端检查,随机不同说话人应接近基线,金色文本同说话人应接近完全正确,否则说明拼接或解码实现有误。
还需补的验证是第一遍假设质量对检索的影响、不同随机种子的波动,以及推理时长与显存开销的测量,因为原文未报告这些成本。
什么时候值得尝试这种免训练适应?
当已有同说话人或同词汇的已转写语音可用,且目标域与训练域存在口音或用词偏移时,值得尝试拼接示范的第二遍流程。具体动作是先跑一遍基线识别,用假设检索同说话人中词汇最相似的 4 段示范,再跑一遍拼接解码,预期在朗读域能看到明显相对下降,在自发会议语音上预期增益变小,需检查是否出现复制示范文本的崩溃。
何时不值得尝试是示范完全随机且跨说话人,或输入拉长后超出模型耐受,或只能用交错但模型并非多模态且无合适提示词,此时增益可能很小甚至为负。论文特有的误解需要澄清,第一是交错不是必需,拼接对所有编码器解码器模型都可用且更稳定,第二是大不等于一定更会适应,小型传统模型在词汇加同说话人条件下相对改善与大模型相近,第三是甲骨文数字是上限而非承诺,实际收益要看第一遍假设与检索质量。
未来工作按论文所列包括分离文本与音频贡献的机制实验、更好的检索方法,以及噪声鲁棒与低资源语音的扩展。下表把可运行策略与上限策略分开,便于对照论文直接报告与待验证推测。
| 策略 | 信息条件 | 报告性质 | 相对变化 | 代价 |
|---|---|---|---|---|
| 拼接加词汇同说话人甲骨文 | 需目标真实文本 | 报告显示上限 | up to 30% relative improvement in the oracle experiments | 不可部署 |
| 拼接加词汇同说话人第二遍 | 需第一遍假设 | 报告显示可运行 | up to 23% using first-pass hypotheses | 需 2 次解码加检索 |
| 拼接随机同说话人 | 需说话人标识 | 支持小幅改善 | 未给统一百分比待验证 | 需说话人聚类 |
| 交错加词汇相似 | 需多模态与提示词 | 部分模型支持 | 跨域波动大待验证 | 需提示工程 |
| 增加示范到 4 个 | 需 30 秒内装入 | 支持边际递减 | 30 seconds are sufficient to fit 4 demonstrations | 长音频风险 |
上表区分了直接报告与有限解释,甲骨文与第二遍的百分比是论文直接报告的相对改善,随机同说话人与交错跨域的表述是趋势支持而非统一承诺,30 秒放 4 个示范是论文给出的可行配置而非所有模型的安全上限。复现时保留这些信息条件,才能把增益归因到示范相关性而非解码偶然。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses

