英文题目:The Trade-off Was in the Labels: Causal Supervision for Turn-Aware Streaming ASR
标签:#轮次切换 | #LoRA | #流式处理 | #严格因果 | #基准测试
评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
👥 作者与机构
- Bojie Li:机构信息未在 arXiv HTML 中可靠披露
- Noah Shi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音代理需在连续单通道音频流上逐块输出递增转写,并在语义完整加短暂静音时一次性提交不可撤销的轮次结束触发,难点是轮内停顿与轮间间隙在时长上几乎完全重叠。方法链分三步推进:先以因果规则统一标注,仅当转写启发式判定语义完整且波形中已观测到足够静音才允许触发,接着用最小对偶与停顿对偶把可观测差异变成唯一监督信号,最后把触发标记作为普通词表标记与转写同解码输出并辅以能量门与确认视界做部署裁决。与阈值滑动曲线的关键机制差异是模型读完整性而非读时长,因而能同时做到对未完成数字串耐心等待与对已完成短句快速响应。在 25 段 AMI 复播基准上因果模型达到边界召回 0.969,中位延迟 0.39 s,每语音分钟误触发 0.3 次,全面进入任何静音超时都到不了的角落。结论限于单说话人单通道英语会议复播与合成听写实体场景,一词命令与超长枚举等完整性判断仍不可靠。训练为单 GPU 数小时的轻量适配,流式 serving 在部分 GPU 切片上满足实时预算。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要保留什么?
本文解读的对象是 1 篇做语音智能体轮次判断的论文,输入是单通道连续音频流与可选的用户画像或热词前缀,目标是逐块输出递增转写并在说话人真正讲完的时刻给出不可撤回的触发信号。解读必须保留的关键信息包括实验条件是否与部署一致、标签能否在决策点前算出、比较是否用了相同的音频与检测器与计分、指标方向与代价。输出是一套可在单卡数小时复现的标注规则与评测协议,而不是更大的模型结构。
学习路径按依赖展开:先看为什么静音时长分不开轮内停顿与轮间间隔,再看把决策搬进识别器的系统形状,接着走完一个样本从分块到标记的完整计算,然后讲因果标注与两组对偶构造如何生成训练数据,再讲回放基准与探针的划分与指标,最后看主结果、反证干预与复现边界。例子在下文会明确标为例子,帮助理解但不代表论文测过该数值。
同输入同目标的路线有哪些,本文与它们如何对照?
在相同输入与相同目标下,经典路线是语音活动检测加静音超时,声学改进包括从声音预测查询结束、把端点器与识别器联合训练或蒸馏微型声学轮次模型。部署中的开放检测器多在识别器之外运行,例如声学方案与基于独立转写的文本分类器。开放权重识别器中已有语义语音活动头与轮次标记,但论文指出它们没有公开标注过程与数据构造,也不测量上下文偏置。商业系统已把决策做进识别器前向,例如从前向直接给出轮次事件或对完整句与拖尾语气词等待不同时长,但同样不公开训练细节。
本文的对照点不在结构更大,而在给出缺失的训练配方与可复现基准。论文还在同一协议下原样运行了开放轮次系统并扫描其公开阈值而不重训,报告没有一个达到因果模型的延迟与误触发角落。需要强调这是按原样测量的对照,不是各系统的最佳可达性能,因为这些系统并未针对近讲麦克风的会议音频调优。另一条相关线是轮次预测与同时传译中的读写决策,论文区分了预测未来分布的因果诚实目标与把未来量当作确定性标签的做法,后者正是本文诊断的对象。
为什么一个静音阈值同时造成打断与迟答?
论文用 3 个日常轮次界定问题。例子一是读电话号码,6 位数字的模式预示还有 4 位要来,组间停顿必须忍住。例子二是长技术提问,从句之间的停顿坐在同一个未完成想法内部,也必须忍住。例子三是已经说完的完整句子,需要在静音刚开始就回答,因为人类轮间中位间隔接近 200 ms,而部署超时常在 500 ms 到 1000 ms。论文报告在其会话基准上轮内停顿与轮间间隔的长度分布几乎完全重叠,且轮内停顿反而更长,因此只看时长无法区分,真正区分的是到目前为止的词是否构成完整想法,而词恰好是识别器为转写而计算的东西。
下面这张示意图把三行的不同读法放在同一时间轴上,前两行要求穿过静音保持,第三行要求在近零静音触发,固定超时在前两行过早触发、在第三行过晚等待。
看图路径: 1. 先看三行各自的蓝色词块与红色超时叉号位置,确认前两行要忍耐、第三行要抢答;2. 再看每行灰色小字给出的保持或触发理由,核对是否只用当前词与已观测静音;3. 最后对比绿色星形与红色叉号的先后,读出固定阈值为何顾此失彼
论文图 3。原论文 Figure 3::“The three turns that define turn-aware endpointing, and the read each demands.”。
这张图可见三行蓝色词块代表已说出的内容,红色叉号代表固定超时触发点,绿色星形代表本文模型触发点。第一行显示 3 位与 6 位数字后都标注不完整因而保持,到 10 位完整加静音才触发。第二行显示从句与疑问中段都标注仍在提问内部因而保持,到问题完整加静音才触发。第三行显示完整加 0.3 s 静音即触发,而 1.0 s 超时仍在计数。像素细节支持论文的核心判断:决策信号在词义而不在静音长度,阈值只能在打断与迟答之间滑动。
系统全景:音频块如何变成转写段与结束事件?
系统输入是每 0.5 s 一块的音频流,先过能量门,静音块跳过语言模型以免在静音上幻觉标记。通过的音频与已提交转写前缀一起送入合并后的 Qwen3-ASR-0.6B 加 LoRA 模型,模型在同一解码中延续转写并可输出两个新增的轮次标记。系统槽中可放一段用户画像或热词前缀,在整个会话中保持可见。模型之后还有两个策略旋钮:确认视界等待若干静音块再执行触发,最大分段强制刷出限制一段转写能增长多久。输出是转写段与结束事件。
下面这张真实逐块运行图对比了决策位置不同的两条路,上路是独立识别器加下游计时器,下路是识别器内联输出标记。
上方面板可见波形上方有两个黄色暂停块,识别器只输出纯词序列,响应型超时在暂停内触发,长超时则滞后,图注明确时钟看不见数字含义。下方面板可见每 0.5 s 1 次解码的蓝色三角标记,解码输出在暂停处标注保持并继续输出数字,在末位数字后输出结束标记。底部两个放大的解码框分别显示暂停时刻只延续数字而不加标记、结尾时刻因完整加已观测静音而加标记,转写词本身在两路完全相同,差别只在何处做决定。这解释了为什么下游分类器只能从更损的视图晚一拍重算识别器已算过的完整性。
组件与计算:标记、门与旋钮各自做什么?
基础模型是能准确转写但从不宣布讲完的开放语音模型,本文只做最便宜的增量:在词表中占用两个未用条目作为结束标记,并用低秩适配微调教会模型在正确时刻于转写内联输出它们。端点实验用秩 16,统一模型用秩 32 以容纳更多行为。训练数据由 LibriSpeech 与 AMI 会议录音合成,单卡数小时完成。推理时采用已提交前缀的增量解码,文字一旦输出保持固定并作为提示重喂,同时回滚最后 5 个词以允许修正,触发时间记为标记首次出现的块边界。
回合感知流式识别 × 端点检测: 回合感知流式识别负责逐块延续转写并在同一解码中给出是否结束,端点检测负责在不可撤回的时刻宣布可以回答,二者搭配的理由是完整性判断本就是解码预测下一个词时的副产品,把端点放在识别器内部可以直接读语义而不必在下游重算,组合后新增的作用是 1 次解码同时产出词与回合结束标记。
因果标签 × 先知标签: 因果标签的分工是只用决策点之前的可观测输入计算监督目标,先知标签的分工是无意中用了决策点之后的切分或下一说话人信息,二者搭配比较的理由是同一可观测前缀会得到相反要求,组合意义在于用前缀检验和最小对暴露哪一侧偷看了未来。
最小对 × 反事实孪生: 最小对负责在时间轴上固定完整话语只改变有无静音尾,使静音成为必须观察的信号,反事实孪生负责在上下文轴上固定音频只改变前缀是否匹配并让目标跟随音频,二者搭配的理由是时间泄漏与上下文复制是同一类不可信信号问题,组合后把语义完整加静音与听音频而非抄前缀装进同一检查点。
能量门 × 确认视界: 能量门负责在纯静音块跳过语言模型以免在静音上幻觉标记,确认视界负责在触发后再等若干静音块才执行以压住误触发,二者搭配的理由是一个管输入是否值得解码一个管输出是否值得执行,组合意义是把策略旋钮留在模型之外而不改变权重已经学到的短语与回合区分。
上下文偏置 × 复制捷径: 上下文偏置负责把用户画像或热词表放在系统槽中帮助识别罕见实体,复制捷径指当训练前缀恒与音频一致时模型不听音频直接抄前缀,分工上前者是先验后者是泄漏,搭配理由是只有加入 disagree 的反事实才能保留增益而去掉抄写,组合后上下文成为先验而非替代聆听。
能量门的作用在论文中有定量依据:只在语音起始样本上训练的模型在静音上约每秒误触发约 1.9 次,且误触发数与每段的静音含量几乎完全相关,因此所有比较都在门后运行,因果配方还把静音模式直接写进训练。确认视界在因果模型上只取消 3 个候选触发,而在混合池模型上取消 241 个,说明短语与轮次的区分已从推理策略移入权重。最大分段强制刷出则用于截断长独白的重复循环造成的词错率与计算长尾。
训练与构造:因果规则与两组对偶如何生成标签?
全部轮次能力来自标签。一条规则生成所有端点样本:当且仅当到目前为止的词在语义上完整且自上次语音后已观测到至少 0.3 s 静音,才输出结束标记。2 个条件都可只用前缀检验:完整性用转写启发式判断,以填充词或连词结尾、词中截断或过短非应答都算不完整,静音从合成波形本身读取。8 个模板实例化该规则,包括完整话语加 0.3 s 到 1.2 s 静音尾的触发样本、同一话语尾部不超过 0.1 s 的保持样本、截断语音、完整与不完整前缀加间隔的暂停对、长静音、纯静音与前导静音。
最小对把同一完整话语呈现 2 次,有尾则触发、无尾则保持,唯一差别是可观测静音,因此完整 alone 不能触发,必须看到静音。暂停对把间隔前的词是否完整作为唯一触发依据,完整则触发、不完整则保持,即使说话人之后继续。口述模式把未拨完的号码标保持,完整号码加已观测静音才触发。上下文部分先用拼读的罕见名与邮箱合成匹配前缀样本,再加入三分之一冲突前缀的反事实孪生,上下文命名一个身份、音频拼出另一个身份,目标跟随音频。统一池约 20k 样本并混入约 20% 纯转写回放以锚定离线词错率。
下面这组真实暂停说明为何必须如此构造,两段暂停长度仅差 90 ms,决策点前缀不可区分,标签差异只来自之后发生了什么。
看图路径: 1. 先读上下两条暂停的长度与文本,确认仅相差 90 ms 且在决策点前几乎相同;2. 再看右侧蓝色保持与橙色触发标签,确认标签差异来自之后是否有人接话;3. 回到中间决策点竖线,理解为何该标签函数依赖未来输入
论文图 6。原论文 Figure 6::“Clairvoyant labels. Two real pauses, 90 ms apart in length, from held-out AMI stretches of the replay benchmark (texts and gaps verbatim); the label is decided by the future.”。
上行暂停后在 1.92 s 处恢复因而应保持,下行暂停后继续静音因而应触发,右侧分别标注延续与轮终。中间竖线为决策时刻,两侧前缀在该时刻看起来相同,因此该分类是决策点之后音频的函数,正是先知标签的定义。论文据此提出因果原则:流式决策的每个训练标签与评测目标都必须能从决策点之前的输入算出。
实验条件:用什么音频、怎么划分、指标方向是什么?
端点评测用流式回放:录制音频按块经由真实系统,与部署交付方式一致。材料是留出 AMI 会议的连续单通道片段,每段 30 s 到 60 s,保留目标说话人的真实时间偏移与之间静音,复现直播通道永不在语音边界结束的条件。每个话语结束边界按该通道可观测信息分类:同说话人间隔至少 2 s 为轮终应触发,间隔在 0.3 s 到 2 s 且同说话人恢复为延续,触发计为可测量的切分代价而非错误,话语内部停顿或语音后不足 0.3 s 为内部,触发计为误触发。
指标包括在真值结束前后特定窗口内的边界召回越高越好、每语音分钟误触发越低越好、延迟分位数越低越好、触发后恢复率、流式词错率与每块计算量。开发集 25 段,开发结束后另抽 2 倍大的确认集,统一模型再用 100 段留出集。
口述探针回放 10 位电话号码并计每号码过早触发数、终边界召回与数字准确率。拼写实体探针解码拼读的罕见名与邮箱,分别测无前缀、有匹配前缀与错误用户画像下的精确匹配与侵入率。自然语音偏置在 Earnings-22 上测实体召回,实体由大模型抽取并过滤为真正专有名词。离线词错率在 LibriSpeech 官方全量划分上测,服务在原生 vLLM 而非模拟器上测。论文还自查了基准本身的第一版按他说话人穿插提升为轮终的做法,指出在单通道上那段他人语音就是静音,要求在该处触发同样是先知,已按清单修正并报告修正前后召回变化很小但结论不变。
主结果:因果模型是否同时更快更准更少误触发?
要回答的问题是,在相同音频、相同检测器与相同计分下,因果监督是否逃出超时曲线的延迟与误触发权衡。公平条件是所有比较都在能量门后运行,指标方向为召回越高越好、中位与 95 分位延迟越低越好、每语音分钟误触发越低越好。论文报告因果模型加门在开发集达到高边界召回与亚半秒中位延迟,同时误触发低于混合池加确认的水平,且不再依赖推理期压制。下图把超时家族与外部原样系统放在同一延迟与误触发平面上进行公平比较,横轴为中位轮终延迟纵轴为误触发的对数坐标系需要仔细辨认各曲线位置。
看图路径: 1. 先确认横轴为中位延迟、纵轴为每语音分钟误触发且纵轴为对数并含零点特殊标记;2. 再沿黄色与紫色超时曲线看阈值只能沿曲线滑动,读出各点的召回标注;3. 最后定位左下角绿色与蓝色菱形星形,确认其同时更低延迟更少误触发
论文图 2。原论文 Figure 2::“The causal model escapes the timeout curve.”。
该图横轴为中位轮终延迟纵轴为每语音分钟误触发且为对数轴,黄色与紫色折线分别为两种检测器加不同超时阈值的滑动曲线,阈值增大则延迟上升而误触发下降但召回在 1.5 s 附近塌缩。左下角绿色星形与蓝色菱形分别为因果端点与统一发布点,处于全部超时曲线内侧兼具低延迟低误触发与高召回,灰色菱形等历史监督点与棕色叉号外部系统均未进入该角落。像素支持论文的结构性判断:超时只能沿曲线滑动,因果模型因读完整性而同时做到穿过 1.4 s 句中暂停保持与在完整想法后约 0.39 s 触发,该视觉证据与下表数字相互闭合。
下表把可部署策略放在一起比较,基线保留实际可运行的超时档与历史最强监督,另行标注的离线最优不在此充当可部署收益,表头单位与裸值写法保留原文可重放形式。
| 条件 | 指标 | 超时基线 | 因果模型 | 历史监督 |
|---|---|---|---|---|
| 部署一致回放 | 边界召回 | 0.969 需长等待 | 0.969 | 0.927 |
| 部署一致回放 | 中位延迟 | 1.15 s | 0.39 s | 0.68 s |
| 部署一致回放 | 每语音分钟误触发 | 1.4 | 0.3 | 3.2 |
表后需要说明主要收益与具体代价。收益是因果模型在同一音频上同时实现高召回、低延迟与低误触发,且新鲜测试集上复现为 0.924 召回、0.42 s 中位延迟与 0.2 误触发,延迟与误触发保持而召回小幅波动在抽样变异范围内。代价是统一多行为检查点在开发集的误触发升至 0.97,而纯端点检查点为 0.3,加一格确认视界可清零误触发但中位延迟升至约 0.89 s。未胜出项是长超时档虽然误触发低但召回塌缩至 0.208,短超时档虽然召回高但每分钟多次误触发,论文保留了这些不利基线而不是只展示最弱超时。
上下文与口述是否在不抄前缀的前提下变好?
要回答的第二个问题是,热词前缀能否提升实体召回而不扭曲转写,以及错误画像是否会被抄进转写。条件是同一音频分别在无前缀、相关前缀与干扰前缀下解码,指标为实体召回越高越好、错误画像侵入率越低越好。论文报告基模型上相关前缀把实体召回从 66.7% 提升至 95.6% 且词错率略降,即使前缀与目标词之间插入多达 12 s 无关语音优势也不衰减,这正是会话第五分钟仍需账号实体帮助的性质。下表集中呈现自然语音与拼写实体两条探针的可重放数字,百分号与数值写在同一格内,裸小数保留原文写法。
| 条件 | 指标 | 无前缀 | 相关前缀 | 错误画像 |
|---|---|---|---|---|
| 自然语音实体 | 实体召回 | 66.7% | 95.6% | 干扰幻觉 3.7% |
| 拼写实体 | 邮箱精确匹配 | 4% | 0.93 | 匹配训练侵入 40% |
| 拼写实体 | 错误画像侵入 | 11.3% | 40% | 反事实降至 0.8% |
表后解释收益与反例。收益是相关前缀带来 28.9 个百分点的实体召回提升,对应从 66.7% 到 95.6% 的变化,且统一池中的自然语音反事实把干扰幻觉从基模型的 3.7% 降至 2.0%,而仅拼写反事实仍残留 6.3% 幻觉。代价与反例是仅用匹配前缀训练时,模型学会复制前缀,会话端点纯模型在口述上每号码过早触发约 4.96 次、邮箱无前缀精确匹配仅 4%,错误用户画像把错误邮箱写进转写,侵入率随训练从 11.3% 升至 40%。
加入音频与上下文故意不一致且目标跟随音频的反事实后,侵入率在训练探针清零、在扩大后开发探针为 0.8%,同时口述过早触发降至 0.16、终边界召回 0.88、数字准确率 0.998,扩大探针中带上下文邮箱为 0.93。百分点是召回差值的绝对变化,不是相对百分比,不能与相对提升混读。
反证与消融:标签一变,假权衡是否消失?
要检验的核心反事实是,如果把评测改成部署真实条件,历史模型的召回轴是否坍缩。干预只改评测不改任何模型:给离线基准的每个片段追加 1.0 s 静音后重打分。公平条件是同一批完整单话语、同一触发定义,指标为触发召回。下表呈现追加静音前后的触发召回变化,离线标注对照保持不变而历史池大幅回升。
| 模型监督组成 | 原片段触发召回 | 追加 1.0 s 静音后 | 变化 |
|---|---|---|---|
| 离线标注 | 1.00 | 1.00 | 0.00 |
| 混合池 | 0.82 | 0.98 | +0.16 |
| 对立池 | 0.10 | 1.00 | +0.90 |
表后说明该干预支持的判断与限制。支持的判断是召回与精度的前沿是标签矛盾制造的假象:完整但尚无尾随静音的前缀在一池标触发、在另一池标保持,对立池中该矛盾达约一半,训练在触发模式与不触发模式间整程振荡,且概率探针显示权重在两种确信模式间循环而非阈值抖动。限制是该干预只证明完整话语轴的人工性,不直接证明所有暂停标签都可区分,论文另用间隙分布重叠与合成实验补足机制。合成实验用约 30k 参数两层变换器、无声学无预训练,可调先知比例从 0 单调收敛到高比例出现反相关与模式翻转,支持机制可迁移。
另一组消融固定数据量逐个移除构造,下表呈现移除最小对与静音模式后的门后误触发与确认取消数变化,裸值保留原文写法以保证可重放。
| 移除构造 | 召回 | 门后误触发 | 确认取消数 | 静音标记数 |
|---|---|---|---|---|
| 完整池基线 | 0.948 | 1.08 | 10 | 8 |
| 移除最小对 | 0.906 | 5.28 | 34 | 5 |
| 移除静音模式 | 0.969 | 1.94 | 12 | 1458 |
表后解释该消融的真实代价。移除最小对使静音再次可选,门后误触发从 1.08 升至 5.28 且确认视界取消数从 10 升至 34。移除静音模式使无门时在静音上的标记从 8 暴涨至 1458,门掩盖了该问题但训练仍缺静音能力。移除暂停对的不完整一半并未增加误触发,只是略保守至 0.906 召回与 0.43 误触发,说明暂停区分主要由完整间隔样本覆盖。这些是真实的容量与分布代价,与已溶解的假前沿不同。
边界与代价:哪些结论不能推广?
论文明确报告会话端点证据完全来自留出 AMI 会议,单说话人单通道英语,因此跨语料泛化与多说话人混合通道是未来工作。口述能力零样本迁移到更短枚举但不迁移到更长卡号,在 16 位卡号上模型在其学到的 10 位完整点触发而转写不受影响,说明通用机制仍需学到的完整性判断而非固定模式。短端存在对称边缘:完整性启发式把不足三词的话语标为不完整以避免在应答词上触发,因此真正的一词命令如停止不保证近瞬时触发,区分祈使与应答是同一学习问题而非新问题。
成本方面,端点微调在 LibriSpeech 官方划分上增加约 1.1 个百分点与 2.7 个百分点离线词错率,解码时禁用标记不改变词错率,说明回归来自窄合成分布漂移而非标记截断,统一模型中 20% 纯转写回放收回大部分差距。流式词错率即部署相关数字不受影响。统一适配器把多行为装进同一容量带来精度代价,只需轮次的部署可运行纯端点检查点。并发数字是在共享 GPU 争用下测得的下界,形状而非常数是结论。
复现先做什么,需要哪些超参数与信息条件?
复现应先重建因果标注器与回放基准,而不是调大模型。标注侧实现触发当且仅当词完整且已观测至少 0.3 s 静音,完整性按填充词与连词结尾、词中截断与过短非应答判断,静音从合成波形读取。数据侧按八模板合成约 12k 端点样本,LibriSpeech 与 AMI 各半,暂停对混合同说话人与不同说话人以免键控说话人身份,统一池扩展至约 20k 并加入冲突前缀反事实与约 20% 纯转写回放。模型侧在注意力查询键值输出投影与两个标记嵌入行上加 LoRA,端点用秩 16、统一用秩 32,缩放因子为秩的 2 倍,批量 8,统一模型固定权重衰减对冻结词表行的泄漏并用余弦退火。
评测侧用 0.5 s 块、已提交前缀增量解码并回滚最后 5 词,触发记在标记首次出现的块边界,召回窗口为真值结束前 0.25 s 到后 1.5 s 并在下一话语起始处截断。所有比较在能量门后运行,另扫确认视界与最大分段强制刷出。先用追加 1.0 s 静音的重打分验证历史召回轴是否为人工条件,再在新鲜片段上确认延迟与误触发是否保持。代码与基准已发布,检查点是研究原型而非生产系统,生产化需按同一配方扩大生产级数据并补跨语料与多通道验证。
何时值得尝试这套配方,还需补哪项验证?
当流式决策的监督来自离线切分或离线转写,且训练出现触发与不触发模式间振荡或看似基本的召回精度前沿时,值得用四问清单检查:标签在决策时刻能否仅用此前输入算出,是否存在因果相同但标签不同的孪生前缀,评测是否要求部署永不出现的条件,训练是否在满足部分数据的模式间弹跳。若命中,应构造最小对与反事实孪生,让唯一一致策略键控可观测信号,而不是加损失项或调阈值。
对于语音智能体,若需同时做端点、口述保持与画像偏置,可先跑纯端点秩 16 检查点验证延迟与误触发,再用秩 32 统一池加入口述与上下文反事实,注意保留匹配与冲突两类前缀以免复制捷径。尚未验证的是跨会议语料、噪声与远场、多说话人重叠下的完整性判断,以及一词紧急打断的近零延迟触发。论文的持久贡献是配方、代码与基准,而非权重本身,复现时应以部署一致回放的重排为准,而不是以离线片段上的冠军为准。
📎 论文与评分元数据
排名:前25% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses


