英文题目:I’ll Keep an Ear Out: Teaching AudioLLMs Proactive Audio Assistance
会议身份:
conference:interspeech:2026:conference-paper-id:yadav26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#SFT #音频大模型 #流式处理 #环境声 #音频事件检测
评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.9/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Amit Kumar Singh Yadav:机构信息未能从会议 PDF 纯文本可靠映射
- Ritvik Shrivastava:机构信息未能从会议 PDF 纯文本可靠映射
- Xuan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Seungwhan Moon:机构信息未能从会议 PDF 纯文本可靠映射
- Shashank Jain:机构信息未能从会议 PDF 纯文本可靠映射
- Pinar Donmez:机构信息未能从会议 PDF 纯文本可靠映射
- Babak Damavandi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
主动式音频辅助(Proactive Audio Assistance)以单条自然语言守望意图(watch-out intent)与连续音频流为输入,在每个时刻因果决策打断通知或保持沉默,难点在于区分首次出现、持续相关、无关输入与已通知重复。方法为打断与沉默建模(Interrupt and Silent Modeling,ISM):先做反应式监督微调建立声音分类能力,再按已知事件边界构造起始打断、持续相关、无关沉默与去重沉默四态样本,在自回归解码中引入 `<interrupt>` 与 `<silent>` 两个特殊词元并以平衡交叉熵联合优化。与固定类别持续告警及纯反应式音频大模型相比,关键差异是将意图与交互历史作为解码条件,使抑制重复成为一等建模目标而非后处理规则。在ESC-50五折主动评测中,PALLM相对反应式微调将打断F1从79.8%提升至99.6%,去重召回从10.1%提升至100.0%。该结论外推受限:在未训练的Epic-Sounds厨房音频上打断F1仅67.5%,无关沉默召回10.1%、持续召回41.2%,且流式验证仅用固定位置拼接样本。训练使用6张NVIDIA H100,流式平均延迟3.5秒。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么听见声音不等于知道何时提醒?
这篇论文的输入是一个用户用自然语言写下的一句话守候意图,例如听到有人敲门就提醒我,目标是让音频大语言模型持续监听音频流并自主决定每一刻是打断提醒还是保持沉默。必须保留的信息是 4 种决策状态的划分、打断与静默两种特殊标记的训练范式、以及在干净环境与噪声厨房环境下的不同表现。输出是 1 篇能让研究生复述方法的解读,而不是效果宣传。
初学者容易把声音分类当成提醒,认为分类准了自然会提醒。论文指出这是两回事。分类回答的是这段音频是什么,而主动辅助回答的是现在要不要打扰用户。传统助听思路是固定监听几十类声音,每次检测到就报警,结果是同一段持续的声音被反复报警,用户很快疲劳。论文把动机锚定在听障用户的可穿戴场景:用户只说 1 次在乎什么,系统要处理首次出现、持续出现、无关声音和已提醒过的持续声音。
沿一个样本走一遍更直观。假设意图是听到鸟叫告诉我鸟种,音频流先是风声和脚步声,中间第 1 次出现鸟鸣,之后鸟鸣持续一段时间。理想行为是风声阶段沉默,第 1 次鸟鸣时打断并说听到鸟鸣像是麻雀,之后持续鸟鸣阶段因为已经提醒过而沉默。被动模型做不到这一点,因为它每次都需要用户先问现在有鸟吗,它才会回答。主动模型则要在没有新提问的情况下自己跨过从听到到判断是否值得说的门槛。
本节的教学任务是建立问题意识:主动不是更快地分类,而是增加一层与意图和历史有关的决策。后续各节按学习依赖展开,先对照相关路线,再看任务形式化与整体架构,然后拆解标记与数据构造,接着讲训练与评测条件,最后用结果与反例收束到复现建议。
同输入同目标下,已有路线缺了哪一块?
环境声音分类路线与本文同输入,都是音频波形,但目标不同。论文回顾了从手工谱特征到深度学习的进展,提到音频谱变换器在 ESC-50 上的强准确率,以及 BEATs 等自监督方法达到 98.1%。这类工作只关心一段截好的音频属于哪一类,不处理连续流中的何时开口与是否重复。教学例子是给模型一段 5 秒狗叫让它输出狗叫,这与让模型在 15 秒长流中只在狗叫第 1 次出现时开口完全不同。
音频大语言模型路线与本文输入相近,都是音频加文本,但运行阶段不同。论文以 Qwen2-Audio 为例,说明它用 Whisper-large-v3 做音频编码再接 7,000,000,000 参数量级语言模型,能做开放式理解与推理,GAMA 等模型还加强了复杂推理。它们的共同缺口是每次回答都需要显式提示,缺少意图感知的自主监听机制。也就是说,它们能回答听到了什么,但不会自己决定现在该不该说话。
听障声音感知路线目标最接近,都是提醒用户,但监督与交互不同。以往可穿戴系统持续监听固定类别,每次检测都报警,不能表达用户意图,也不能利用交互历史去重。论文把去重视为一等建模目标,这正是区别所在。主动对话与视频在线模型提供了灵感,例如在线视频大模型主动叙述关键活动,但论文明确指出此前没有针对音频大语言模型的主动辅助工作。
对照的公平性在于不能把分类准确率直接当成主动能力。论文后文用实验证明,只做分类微调的模型在去重上几乎失效,而零样本提示的模型则过度打断。这说明缺的不是声学表征,而是决策结构。本节为方法部分铺垫:需要在不改架构的前提下,把决策放进解码过程。
一次意图持续监听,模型每一步要回答什么?
任务形式化可以这样复述:给定守候意图 q 和连续音频流,模型在每个时刻输出打断或沉默。论文定义 4 种状态。打断一型是起始检测,音频从与 q 无关变为相关,模拟流中第 1 次出现目标声音。打断二型是持续相关,整个观察窗都是相关内容且没有前置无关上下文,用于模型错过起始后仍需触发的兜底。静默一型是无关沉默,音频与 q 无关。静默二型是去重沉默,音频相关但对话历史显示已经提醒过。
四态划分的教学价值在于把时间推理与历史推理拆开。起始与持续都要求打断,但输入的上下文结构不同;无关与去重都要求沉默,但依据不同,前者依据声音内容,后者依据历史。这种拆分让训练可以针对性构造样本,也让评测可以分别报告起始召回、持续召回、无关沉默召回与去重召回,而不是混成一个准确率。
论文还区分 3 类主动触发:显式请求、隐式线索与语义驱动。本研究只做第一类,即显式守候意图,作为基础情形。这意味着论文不处理从用户犹豫语气中推测需求,也不处理从机场登机场景中推断用户可能需要广播提醒。明确边界很重要,复现时只需准备意图文本与带起止时间的音频,不需要对话情绪标注或场景知识。
因果性与实时性是硬约束。模型只能用过去和现在做判断,不能偷看未来,且要在延迟可接受范围内触发。论文用流式协议验证这一点,后文会讲到平均 3.5 秒延迟的测量条件。理解这一点才能明白为什么打断二型必要:如果只训练起始,错过起始的窗口就没有任何监督信号。
不改架构如何让模型学会主动?
整体思路是模型无关的打断与静默建模,简称 ISM。做法是在词表里增加两个特殊标记,分别是打断标记与静默标记,让主动决策成为标准自回归解码的第一步。 backbone 选用 Qwen2-Audio-7B,包含 Whisper-large-v3 音频编码器与约 7,000,000,000 参数语言模型,总量约 8,000,000,000 参数。音频重采样到 16 千赫,转为 128 维梅尔谱,窗长 25 毫秒、帧移 10 毫秒,经过步长为 2 的池化后每个标记约 40 毫秒时间分辨率。文本侧的守候意图与交互历史直接用原分词器编码,不需要独立文本编码器。
论文强调故意使用标准 backbone,以证明主动行为来自 ISM 而非结构创新。ISM 只要求词表扩展与自回归解码,这是当前音频大语言模型共有的属性,因此可以直接搬到其他模型。训练分 2 个阶段,先做被动监督微调学分类,再做主动监督微调学打断与静默。这种先后关系对应学习依赖:先有声学理解,再学何时开口。
显式守候意图 × 对话历史: 显式守候意图负责说明用户在乎什么声音,例如听到狗叫就提醒,对话历史负责记录已经提醒过什么,两者搭配的理由是只靠意图无法判断重复提醒,只靠历史不知道目标,组合后模型在解码时同时以意图衡量相关性、以历史决定是否需要再次开口,从而实现首次提醒与重复抑制的分工。
下图对比了被动与主动的时间线,上方是已有模型,下方是本文的主动模型,理解该图是理解任务差异最快的方式。
看图路径: 1. 先看上下两条时间线的用户输入次数差异;2. 再看波形下方蓝色框标注的负例与鸟鸣位置;3. 对照上支的每次追问与下支的静默与打断标记;4. 确认主动模式只需一次守候意图
论文图 1。原论文 Figure 1:“Reactive vs. proactive audio assistance. Existing Au- dioLLMs (top) require a query for every event.”。
该图上半显示用户说听到鸟鸣告诉我鸟种后,模型只在被问时回答没听到鸟,用户必须自己把握追问时机;下半显示同一意图下模型在负例处输出静默标记,在鸟鸣处输出打断标记并生成听到鸟鸣像是麻雀。图中波形只是示意,蓝色框标出负例与鸟鸣段,关键教学点是主动模式把多次提问压缩为 1 次意图加多次自主决策。像素细节显示上支为灰色长条的已有模型,下支为浅黄色长条的主动模型,对话框颜色也有区分,但结论不依赖颜色,而是依赖标记与时机。
两个标记与四种样本如何分工?
先沿一个样本走完输入到输出。输入包括三部分:显式意图文本、对话历史文本、音频序列。音频序列带有事件边界起止时间。模型连续编码音频,语言模型在每一步先解码一个决策标记,若为静默则停止,若为打断则继续生成提醒文本。例如无关风声加无提醒历史对应静默一型,相关鸟鸣加无历史对应打断,相关鸟鸣加已有提醒历史对应静默二型。历史的作用只在去重时关键,无关沉默时历史无关紧要。
主动音频辅助 × 被动响应: 被动响应分工是每次都等用户提问再回答,主动音频辅助分工是拿着一句话意图持续监听并自主决定开口时机,两者搭配的原因是可穿戴助听场景无法让用户逐次追问,组合意义在于把判断何时协助从用户侧搬到模型解码侧,用同一个音频流同时完成理解与决策。
打断标记 × 静默标记: 打断标记分工是宣布此刻应提醒并随后生成提醒文本,静默标记分工是宣布此刻应保持沉默,搭配理由是两者共享同一个自回归解码通道,不需要额外分类头,组合后 4 种状态都被编码为先输出一个决策标记再决定是否继续生成,使主动决策成为语言模型原生行为。
训练数据构造完全围绕四态。每个带边界的样本都要造出 4 类实例。打断一型把边界前的无关音频与边界后的相关音频拼接,模拟流中起始。打断二型只取边界内的相关音频,没有前置无关上下文。静默一型采样完全在边界外的音频,每个原始样本可采多个以训练持续沉默。
静默二型用相关音频但附带一条已提醒过的对话历史,训练压住重复。损失上打断实例目标是打断标记加回答词,静默实例目标是单个静默标记,分别用交叉熵计算后求和,并通过下采样使打断与静默总数平衡,不再加额外权重。微调用 LoRA 秩为 8。
下图左侧为架构,右侧为四态构造,放在此处是因为它同时出现编码路径与样本组合,需要对照阅读。
看图路径: 1. 先看左图从显式意图与对话历史到音频序列再到大模型的输入路径;2. 再看右图上半打断建模与下半静默建模的四格划分;3. 对照粉色相关与黄色无关菱形块的组合方式;4. 确认去重静默格带有已提醒历史的标注
论文图 2。原论文 Figure 2:“(a) PALLM takes a single watch-out intent and continuously encodes audio, decoding either <interrupt> or <silent>.”。
左图可见底部为意图与历史文本、音频序列,中部为文本与音频编码器与大语言模型,顶部为随时间输出的静默一型、打断、静默二型等标记序列,粉色代表相关、黄色代表无关。右图上半为打断建模,下半为静默建模,四格分别对应起始、持续、无关、去重,标注了是否带有打断历史。教学动作是先确认颜色图例,再看每格的块组合:起始是黄加粉且无历史,持续是全粉且无历史,无关是全黄,去重是全粉且有历史。
两阶段训练真正更新了什么?
第一阶段被动监督微调是序列到序列的分类学习,给定音频与分类问句,模型生成正确类别标签,目标是建立声学理解。论文未报告冻结细节中音频编码器是否更新,只明确微调使用 LoRA 秩 8、缩放系数 32、丢弃率 0.1,优化器为 AdamW,学习率 5e-4 带余弦调度与 5% 预热,权重衰减 0.1,共 10 轮,有效批量 384,最大序列长度 2048,在 6 张 H100 上训练并固定随机种子。复现时应保留这些超参数,缺项是编码器与语言模型各部分的具体可训练范围,原文未给出逐模块冻结说明,不应从模型名称推定。
第二阶段主动监督微调是 ISM 核心。监督来源是带起止时间的事件标注加上人工拼接与历史拼接构造出的四态实例,不是新的手工文本标注。打断损失对整个目标序列计算,静默损失只对第一个标记计算,总损失为两类实例损失之和,并通过数量平衡代替加权。梯度路径原文未展开,复述时只说按标准自回归交叉熵优化,不猜测是否对音频编码器停止梯度。
起始检测 × 去重抑制: 起始检测分工是发现无关音频之后首次出现的相关声音,去重抑制分工是在相关声音延续且已提醒过时压住重复提醒,搭配原因是真实监听中同一事件会持续多个窗口,只做检测会导致通知疲劳,只做抑制会漏掉新事件,组合后模型必须同时看音频内容与交互历史才能选择正确的静默或打断。
论文报告增加打断二型训练可将持续召回提升约 10 个百分点,机制解释是若只训练起始,模型在全相关窗口上没有训练信号,错过起始后就不知道该触发。这一细节说明数据构造即监督,缺哪类构造就缺哪类能力。训练成本方面,论文只给出硬件与批量配置,未报告总时长与显存占用,复现预算需自行测量,不应把批量与卡数当成速度承诺。
在什么数据与协议下测量主动?
数据集分两块。ESC-50 包含 2000 个 5 秒片段,50 类环境声,覆盖动物、自然、人声非语音、室内家用与室外城市五大类,论文指出这些类别直接对应听障用户日常感知需求。采用标准五折交叉验证做被动分类,并构造平衡的主动评测集,覆盖 4 种决策类型。Epic-Sounds 提供 44 类第一视角厨房音频,特点是自然发生的目标声叠加烹饪背景噪声,且标签同时包含目标事件与主要前景活动。关键条件是 Epic-Sounds 只做评测不做训练,用于检验零样本迁移。
评测指标是主动专用指标。打断精确率衡量打断决策的正确性,静默精确率衡量沉默决策的正确性,召回按类型拆为起始打断召回、持续打断召回、无关静默召回与去重静默召回。打断 F1 用打断精确率与起始召回计算,因为起始检测是流式运行中最关键的能力,持续召回单独报告。ESC-50 指标为五折平均,Epic-Sounds 为单评测集。
流式协议单独构造。用 400 个样本覆盖 50 类,每类 8 个,每个 15 秒复合样本由 0 到 5 秒无关段、5 到 10 秒相关段、10 到 15 秒无关段拼接,段间做淡入淡出避免时间伪影。流式时维护 5 秒滑动音频窗,保留完整对话历史并在每次打断后更新,模型逐标记因果预测,不能看未来音频。该协议同时测延迟与跨窗去重。比较对象固定为三者:零样本基线、只做分类微调的被动模型、加 ISM 的主动模型,条件一致才能判断主动结构是否带来增益。
干净环境下谁真正学会了沉默?
比较问题是三者在相同 ESC-50 主动集上谁能同时做到该说就说、该沉默就沉默。公平条件是同一 backbone 与同一四态评测分布,指标方向是精确率、召回与 F1 越高越好,去重召回尤其反映通知疲劳是否解决。表前需要明确这一点,否则只看打断召回会误判过度打断为优秀。
| 条件 | 指标 | Zero-Shot | Reactive SFT | PALLM (ISM) |
|---|---|---|---|---|
| ESC-50 主动集 | 去重召回 RS2 | 0.2% | 10.1% | 100.0% |
| ESC-50 分类 | 准确率 | 未报告 | 未报告 | 94.7% |
表后解释是主动模型的主要收益与代价。零样本基线起始召回虽为 100.0%,但无关召回仅 59.9%、去重召回仅 0.2%,论文称之为肯定偏置,即不管相关与否都打断,无法用于真实监听。只做分类微调的模型改善了沉默,但去重仅 10.1%,恰恰是防止疲劳的关键能力缺失。主动模型达到 99.4% 打断精确率、100.0% 去重召回与 99.6% 打断 F1,论文认为去重是四态训练涌现出的历史感知抑制。同时被动分类准确率 94.7% 与专用 PANN 持平、接近 AST 的 95.7%,说明增加主动能力没有明显牺牲分类。未胜出项是零样本与被动微调在去重上的失败,它们构成反证:分类能力不等于主动能力。
换到噪声厨房后,什么迁移了、什么掉了?
比较问题是零样本迁移到 Epic-Sounds 时,谁能在不做领域训练的前提下保持起始检测而不陷入过度触发或过度抑制。公平条件是三者都未在 Epic-Sounds 上训练,指标方向仍是打断 F1 越高越好,但需同时看精确率与召回的平衡,因为单看 F1 会掩盖行为差异。去重项在该协议中不评,因为样本间不携带对话历史。
| 条件 | 指标 | Zero-Shot | Reactive SFT | PALLM (ISM) |
|---|---|---|---|---|
| Epic-Sounds 零样本 | 打断精确率 PI | 50.8% | 92.9% | 51.9% |
| Epic-Sounds 零样本 | 起始召回 RI1 | 98.3% | 50.2% | 96.7% |
| Epic-Sounds 零样本 | 无关召回 RS1 | 3.9% | 96.1% | 10.1% |
| 流式延迟 | 平均响应延迟 | 未报告 | 未报告 | 3.5 seconds |
表后解释需拆开看。主动模型 F1 最高为 67.5%,略高于零样本的 66.9% 与被动微调的 65.2%,但行为完全不同。零样本靠几乎全打断换 F1,精确率 50.8%、起始召回 98.3%、无关召回仅 3.9%,会造成严重疲劳。被动微调走向另一极端,精确率 92.9% 但起始召回仅 50.2%,漏掉一半起始。主动模型是唯一保持高起始召回 96.7% 且 F1 最好的,论文据此提出分解:与时间结构有关的起始决策迁移稳健,与声音清晰度有关的无关沉默与持续召回更敏感,持续召回掉到 41.2%、无关召回仅 10.1%。
论文明确这不是框架局限而是训练数据局限,因为训练只见过干净孤立片段。被动分类在 44 类上仅 34.5%,远低于音频最优的 53.8%,反而衬托主动决策结构在细粒度分类失效时仍能迁移。消融还显示增加打断二型训练可提升持续召回约 10 个百分点,支持兜底设计的必要性。
延迟与噪声短板在哪里?
流式评测的教学价值是把因果与延迟放在可控条件下测量。每个样本相关段固定在 5 到 10 秒,滑动窗 5 秒,模型只能看过去。这种固定起始的设计便于测量,但也限制了推广,论文自己指出未来需随机化起始时间与时长,并探索更短训练片段带来的延迟与幻觉权衡。当前报告的平均延迟 3.5 秒是从相关事件起始算起,几乎所有打断都落在相关窗内,验证了实时可行性,但不应理解为每类声音都是 3.5 秒,总体趋势不等于每组都成立。
下图是流式中断时间的分布汇总,横轴为秒,纵轴为频次,颜色越深代表中断计数越高,阅读时先确认坐标再判断好坏。
看图路径: 1. 先看横轴 1 到 15 秒的中断时间与纵轴频次含义;2. 再看 5 到 10 秒绿色相关区间的颜色变深趋势;3. 对照 6 到 10 秒各列数字从 47 上升到 107 的变化;4. 确认 11 秒之后数字迅速回落到接近零
论文图 3。原论文 Figure 3:“Streaming evaluation on 400 samples across 50 sound classes.”。
像素可见 1 秒处有 33 次中断,2 到 5 秒接近零,6 秒 47 次、7 秒 43 次、8 秒 63 次、9 秒 100 次、10 秒 107 次,11 秒后迅速回落到 1 次及零。绿色 5 到 10 秒相关区间的确集中了绝大多数打断,9 到 10 秒最深,说明模型需要累积一定相关证据才触发,这解释了平均延迟的来源。1 秒处的 33 次值得注意,可能是初始窗的误触发或历史残留,论文未单独解释,复述时应标为待验证,不应编造原因。11 秒后接近零则支持跨窗去重与无关沉默在该协议下成立,但该协议的无关段是人工拼接的干净片段,不能推广到厨房噪声下的沉默能力。
噪声短板已在上一节量化:无关召回 10.1% 意味着大量无关厨房声仍会触发,而被动微调的高无关召回是以牺牲一半起始为代价的保守沉默。论文建议用领域多样训练或校准决策阈值弥补,但未给出阈值实验,因此不能承诺调阈一定两全。未评测边界还包括隐式与语义意图、真实听障用户研究,这些都列在未来工作。
要复现先准备什么、后验证什么?
复现的第一步是准备带起止时间的音频与意图文本。ESC-50 可用标准五折划分,被动阶段按分类问答微调,主动阶段按四态构造拼接样本。构造时注意打断一型必须包含边界前无关加边界后相关,打断二型只取边界内相关,静默一型采边界外,静默二型在相关音频上附加一条已提醒历史。保持打断与静默总数平衡,论文用下采样使两者相等,不加额外损失权重。超参数保留 LoRA 秩 8、缩放 32、丢弃 0.1、学习率 5e-4、余弦调度、5% 预热、权重衰减 0.1、10 轮、有效批量 384、最大长度 2048。
第二步是按三基线组织验证。先跑零样本提示,再跑只做分类微调的模型,最后跑加 ISM 的模型,分别报告打断精确率、静默精确率、4 类召回与打断 F1。注意打断 F1 按论文定义用起始召回计算,不要自行改成平均召回。Epic-Sounds 只做评测,检查起始召回是否保持高位,同时检查无关召回是否偏低,避免只看 F1 得出迁移完美的结论。
第三步是流式验证。按 0 到 5 秒无关、5 到 10 秒相关、10 到 15 秒无关拼接 400 个样本,段间淡入淡出,5 秒滑动窗,因果预测并维护历史,统计中断时间分布与平均延迟。资源状态方面,本次未发现来源绑定且完成验证的资源,不得声称代码模型或数据已公开,复现应基于公开数据集与自实现构造脚本。常见误解是把高起始召回当成整体优秀,实际上必须同时看去重与无关沉默,否则过度打断也会得到高召回。
何时值得尝试这种主动建模?
当任务满足 3 个条件时值得尝试:用户只能给 1 次意图、音频是连续流、重复提醒代价高,例如听障提醒、厨房安全监听或门铃看护。此时 ISM 的价值在于把决策放进解码,不改架构即可获得起始检测与去重。论文显示干净环境下接近完美,噪声环境下起始仍稳健,这是支持尝试的直接证据。
不值得盲目照搬的情形是噪声域对误报零容忍且无领域数据时。论文在 Epic-Sounds 上的无关召回仅 10.1%,说明干净训练的模型在重叠厨房声下会过度触发。若应用要求极低误报,需要补充领域多样的主动训练数据或校准阈值,并重新测量延迟与幻觉,不能假设 3.5 秒延迟在更短窗口下不变。
收束到方法记忆点:1 次意图加历史决定开口,四态数据即监督,两标记解码即决策。被动分类解决听到了什么,ISM 解决现在要不要说。复现先做四态构造与三基线对比,再做流式延迟测量,最后补领域数据与用户研究。论文的贡献不是更大的编码器,而是用最小的词表扩展把主动行为变成可训练、可评测的解码任务。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


