英文题目:Enhancing Audio Reasoning via Semantic Summary Prediction
会议身份:
conference:interspeech:2026:conference-paper-id:bonzi26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#正则化 #音频大模型 #零样本 #音频问答
评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Francesco Bonzi:机构信息未能从会议 PDF 纯文本可靠映射
- Pooneh Mousavi:机构信息未能从会议 PDF 纯文本可靠映射
- Cem Subakan:机构信息未能从会议 PDF 纯文本可靠映射
- Mirco Ravanelli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大型音频语言模型以音频与问题文本为输入并生成分步推理与结论,难点在于长思维链使注意力由声学输入漂向已生成语言词元而产生幻觉,形成显式推理反低于直接作答的推理鸿沟。先在音频提示之后、思维链之前插入寄存器令牌,以问题音频选择题上下文为输入承担前瞻锚点职责,输出一个仅关注上文且对后续不可见的潜状态,该潜状态随序列进入后续解码位置。再以结论段文本为输入经冻结句嵌入器提炼职责得到目标语义嵌入,将其作为下一步对齐监督信号,使上一步寄存器潜状态有明确语义终点可对齐。最后以寄存器末层隐状态与目标嵌入的余弦距离为输入承担语义筛职责,与交叉熵联合优化输出声学聚焦的模型参数,迫使早期自注意力过滤无关背景并锚定全局语义目标。与预测局部偏移的多令牌预测不同,该方法直接对齐终点语义而非中间片段,形成自上而下的语义筛以保证全局一致性。原文未提供可核对的关键定量结果。该结论适用边界受限于特定骨干与两套音频推理基准,尚未验证向高资源模型规模与开放声场景的外推,失败条件包括对齐权重过大时方差增大。推理开销上原文明确训练后丢弃寄存器与投影头且推理无需额外参数,计算量与标准微调解码保持一致。
🔗 开源与复现资源
- 代码相关资源:https://github.com/FrancescoBonzi/SPARE — 链接可访问(HTTP 200)
- 演示资源:https://my-demo-hub.github.io/spare/ — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,模型要解决什么音频理解问题?
本文的输入是声音加文字问题。声音包括环境声、语音和音乐等混合场景,文字包括问题本身和候选选项。目标是让大音频语言模型先听懂声音,再给出需要多步推断的答案,而不是只做简单的声音分类或转写。举例来说,模型需要先概括听到了什么,再描述细节,然后给出推理过程,最后得出结论,这是一个例子,用来帮助理解 4 段式推理的结构。
论文指出当前大音频语言模型已经能较好地做复杂问答,但在要求显式写出思维链时反而出现推理差距,也就是写了推理过程的准确率低于直接给答案。这种差距是本文的起点。作者假设的原因是推理序列变长后,自注意力逐渐偏向已经生成的文字标记,对音频输入的关注被稀释,模型变得更依赖语言先验而产生流畅但不贴合音频的回答。理解这个背景很关键,因为后续所有设计都是为了在推理开始前就把模型拉回音频。
思维链推理 × 音频漂移: 思维链推理负责把回答拆成摘要、描述、推理和结论多个步骤逐步生成,以提高可解释性和复杂问答能力;音频漂移负责描述生成越长模型越依赖已生成的文字而忽略原始音频的现象。两者搭配的关键在于步骤变长会放大自注意力对文本历史的偏好,组合意义是必须在推理起点加入锚定音频的约束,否则推理越详细反而越容易脱离声音。
本解读的输入是论文原文证据与 3 张官方原图像素,目标是让刚入门的研究生能复述方法、训练条件和实验结论。必须保留的信息包括基座模型、数据来源、序列组织、损失形式、推理行为和主结果数字。输出按学习依赖展开,先讲任务与相关路线,再讲方法全景与组件计算,然后讲训练与推理,最后讲实验条件、结果反证与复现要点。
已有路线为什么没有直接解决注意力偏离音频?
论文把相关工作分成 3 类。第一类是大音频语言模型本身,例如作为基座的 SALMONN,以及数据和算力规模更大的 Audio Flamingo 3 和 Qwen-2.5-Omni。原文明确说明后两者用了大量指令和推理数据,性能更强但属于黑盒式扩大规模,不是本文要走的路线。第二类是音频推理的改进尝试,包括用大规模监督数据集或强化学习框架的做法。原文认为这些方法依赖海量数据或计算密集的强化学习,没有从结构或训练期正则的角度解决推理问题。
第 3 类是文本领域的下一词预测扩展,例如 MuToR 用可学习的寄存器标记去预测不同偏移的未来目标,以培养规划表示,以及用辅助头预测长期未来标记紧凑表示的工作。原文从这两类获得启发,但指出它们主要做局部短程预测,没有处理多模态音频推理中长音频序列的注意力漂移。本文的差异是把寄存器放在输入之后、推理之前,并让它对齐最终结论的全局语义,而不是预测局部下一个词。
多标记预测 × 潜在结论对齐: 多标记预测负责用寄存器去预测未来不同偏移位置的词,以增强规划能力,但关注的仍是局部词层面;潜在结论对齐负责直接把序列开头的寄存器与最终结论的语义向量对齐,关注的是全局目标。两者搭配的对比意义在于前者学的是中间片段的句法延续,后者学的是终点语义,组合理解说明了为什么本文不预测中间词而直接对齐结论能获得更强的全局一致性。
这种对照说明了本文的定位。它不是要与工业级大规模模型比绝对分数,而是要在受控数据集上验证一种轻量微调正则是否能改善零样本推理和早期音频关注,且推理时不增加成本。后续方法部分需要记住这个定位,才能正确理解为什么基座选择没有经过推理数据训练的 SALMONN 13B。
推理差距具体指什么现象,如何度量?
推理差距指同一个模型在直接回答和显式思维链回答两种提示下的准确率差异。直接回答是让模型立即给出结论,思维链是让模型先生成摘要、描述和推理再给结论。论文在 SALMONN 13B 零样本条件下报告了这种差距,思维链反而大幅低于直接回答。这说明结构化推理的假设在音频模态上不自动成立。度量方式是零样本准确率,单位为百分比,在 MMAU 和 MMAR 两个基准上分别计算。
MMAU 侧重需要高层理解和多步演绎的复杂音频任务,要求整合语音、环境声和音乐等线索。MMAR 专门考察逻辑一致性和思维链能力,要求从初始音频到最终结论保持连贯推理路径而不出现音频漂移或幻觉推理。两个基准都超越了简单声音识别,因此适合检验模型是否真的在听。论文还通过自注意力图做机制性分析,比较生成答案和寄存器对音频帧与文本标记的注意力偏移,以验证模型是否更早地关注音频。
这个问题定义决定了后续实验必须同时报告主准确率和注意力分析,不能只看单一分数。
SPARE 全景:一个样本如何从声音走到结论?
沿一个样本走完全流程有助于建立整体感。输入序列按顺序组织为问题、音频、选项,然后是一个特殊的寄存器标记,接着是思维链,最后是结论。思维链按原文包括摘要、描述和推理 3 个块,结论是最终答案所在的块。模型在训练时需要预测整个文本序列,同时寄存器位置产生一个最终层隐状态。这个隐状态经过一个对齐用投影头,与结论文本经冻结句子编码器得到的语义向量做余弦相似度对齐。
总训练目标是标准交叉熵损失加权对齐损失。推理时寄存器和投影头被完全丢弃,模型按标准自回归解码运行,不需要额外参数。这样的安排让训练期的语义目标在推理期沉淀为模型内部更贴合音频的表示。
下面这张总览图把上述双分支结构画了出来,阅读时先看主路径再看对齐分支,有助于理解正则发生在何处。
看图路径: 1. 先看底部从音频提示到寄存器再到思维链和结论的 token 排列顺序;2. 再看紫色主干内从 Layer1 到 Head 的纵向路径与右侧绿色对齐分支在哪里汇合;3. 对照左侧图例确认黄色是寄存器、浅紫是推理、蓝色是结论;4. 观察雪花标记表示冻结、火焰标记表示可训练的位置
论文图 1。原论文 Figure 1:“Overview of the SPARE training framework.”。
这张图显示底部是按位置排列的标记,紫色大框是 SALMONN 13B 主干,从第一层到第 N 层再到输出头,顶部是交叉熵损失分支,右侧绿色分支是冻结的句子编码器与余弦相似度计算。图中用颜色区分了音频提示、寄存器、思维链和结论,用雪花表示冻结部分,用火焰表示可训练的低秩适配部分。关键动作是寄存器的隐状态被引出到对齐头,再与结论嵌入比较。这个图对应的文字说明强调,对齐发生在推理开始之前,目的是让模型提前编码语义目标,从而在早期就从音频中提取相关特征。理解这张图后,再进入组件细节就不会迷失在符号里。
寄存器放在哪里,它能看到谁又不被谁看到?
寄存器是本文的核心组件。白话说,它是一个插入序列中的占位标记,不对应自然语言词,但有一个可学习的嵌入和贯穿各层的隐状态。英文常称 register token,本文记为[REG]。它的位置固定在音频和问题与选项之后、思维链之前。原文给出的序列格式是问题、音频、选项、寄存器、思维链、结论。
这种放置的理由是让它成为序列初始的语义瓶颈,在解码推理词之前就形成对最终目标的表示。如果把它放到每个章节之前,模型会被迫学习多个局部目标,原文实验显示这会降低性能并带来不稳定。
寄存器标记 × 句子语义嵌入: 寄存器标记负责在推理开始前占住一个可学习的位置去汇总输入,它能看到前面的音频和问题但不被后续推理词直接利用;句子语义嵌入负责把最终结论文本压缩成一个与措辞无关的目标方向。两者搭配的理由是让模型在还没有生成推理词时就先知道要往哪个语义终点走,组合后寄存器成为语义桥,在早期就被迫从音频中挑选能支撑结论的特征。
寄存器的可见性由定制的因果注意力掩码控制。寄存器可以看到它之前的上下文,包括音频和问题,但后续的思维链和结论标记不能看到寄存器。原文强调这种设计保证了推理动力学与标准监督微调一致,训练时的额外标记不会在推理时改变依赖关系。下图把这种掩码画成矩阵,值得逐格对照。
看图路径: 1. 先看顶部列标签与左侧行标签的 token 类型对应关系;2. 再逐行检查绿色可访问格与红色屏蔽格的分界如何移动;3. 重点观察寄存器所在行和列的绿色与红色分布差异
论文图 2。原论文 Figure 2:“Custom Causal Attention Masking. The [REG] to- ken attends to preceding context, but subsequent tokens cannot attend to it.”。
这张图顶部是作为键的标记类型,左侧是作为查询的当前标记,绿色表示允许访问,红色表示屏蔽。可以看到寄存器所在行对前面的音频提示是绿色,对自身也是绿色,但对后面的思维链是红色。而后续思维链所在行对寄存器列是红色,说明它们不能回看寄存器。结论行同样不能看到寄存器。这种不对称是理解零推理开销的关键。
因果注意力掩码 × 推理时丢弃: 因果注意力掩码负责规定谁能看到谁,本文让寄存器能看到前文但后续词不能看到寄存器,保证训练期正则不改变自回归依赖;推理时丢弃负责把寄存器和对齐投影头完全去掉,直接用标准解码。两者搭配的理由是训练时需要额外的语义分支但不能污染推理动力学,组合后实现了训练有约束而推理零额外参数和零延迟。
另一个组件是句子语义嵌入。白话说,它是把结论文本送入冻结的 Sentence-BERT 编码器得到的向量,代表结论的语义方向。原文使用的编码器链接在本次未能确认可达,需要按暂时不可达处理,不能写成已验证可用。冻结意味着它的参数不更新,只提供稳定的监督目标。寄存器的最终隐状态与这个目标做余弦距离优化,迫使早期表示向终点语义靠拢。论文把这种机制比喻为语义筛,实际对应的操作是自注意力被引导去忽略无关背景声、挑选支撑结论的声学特征。
训练时优化什么,哪些参数更新哪些冻结?
训练目标由两项组成。第一项是标准交叉熵损失,负责逐词预测思维链和结论序列。第二项是对齐损失,定义为一减去寄存器隐状态与目标语义向量之间的余弦相似度。符号含义是分子为两个向量的点积,分母为各自范数的乘积,损失越小表示方向越一致。计算目标是让寄存器在最终层的表示在方向上接近结论语义,而不是预测下一个具体词。
总目标是交叉熵加权重 λ 乘以对齐损失,原文通过经验验证选择 λ 等于 2.0 为最佳平衡。需要区分的是原始目标是语言建模,近似或正则项是对齐项,优化步骤同时更新主干中的低秩适配参数和对齐头,句子编码器保持冻结。
交叉熵损失 × 余弦对齐损失: 交叉熵损失负责让模型逐词预测正确的推理和结论序列,保证语言流畅和局部正确;余弦对齐损失负责让寄存器最终隐状态的方向与结论语义嵌入方向一致,不关心向量长度只关心语义朝向。两者搭配的理由是一个管局部文字正确,一个管全局语义朝向,组合后总目标同时优化文字预测和早期语义 grounding,权重 λ 控制后者的强度。
数据方面,训练标签来自 AF-Think 标签应用于 YouTube8M 子集,共 16 万训练样本和 4 万验证样本。目标按摘要、描述、推理和结论 4 个连续章节组织,作为简洁思维链。基座是 SALMONN 13B,它采用 Whisper 处理语音、BEATs 处理非语音音频,经 Q-Former 和线性投影接入 Vicuna 大语言模型主干。原文选择它的理由是它没有在推理丰富的 AF-Think 数据集上预先暴露过,便于干净地评估推理微调的效果。
关于梯度路径和参数冻结,原文明确提到低秩适配和对齐头可训练、句子编码器冻结,但没有报告优化器类型、学习率、批量大小和训练轮数等细节,这些属于缺项,复现时需要参考开源代码补齐,不能从模型名称推定。辅助参数在训练后丢弃,重置时机是推理开始前,这保证了部署时结构与标准微调模型一致。
在什么条件下比较,结果数字才可比?
实验比较了 5 种可运行配置,都以 SALMONN 13B 为基座。第一是零样本直接给出结论,第二是零样本思维链,第三是在 YouTube8M 上标准监督微调,第四是适配音频的 MuToR 多标记预测基线,第五是本文的 SPARE。评估是零样本准确率,指标方向是越高越好,单位为百分比并附带多次随机种子的均值与方差。注意力分析部分用了 6 个独立随机种子,以减少单次运行的偶然性。数据集是 MMAU 和 MMAR,分别考察多任务音频理解与深度推理。
公平条件的关键是后 3 种微调方法使用相同的受控训练数据,而不是与用了大规模指令数据的 Audio Flamingo 3 和 Qwen2.5-Omni 直接比规模。原文也报告了这两个高资源模型的分数,但明确说明目标不是通过规模竞争,而是验证高效方法的增益。复现时必须保持基座、训练数据子集和零样本评估协议一致,否则数字不可比。硬件预算和统计检验方法在原文中没有详细报告,这限制了对成本结论的强度判断。
主结果显示什么增益,未胜出项表现如何?
在回答主结果前,先明确比较问题。在相同基座和受控数据下,加入全局结论对齐的 SPARE 是否比标准微调和局部多标记预测更能提升零样本推理准确率。指标方向是准确率越高越好,条件一致性来自同一 SALMONN 13B 和同一 YouTube8M 微调数据。下表整理了零样本准确率的主要数字,阅读时先看 SPARE 与最强基线的差距,再看零样本思维链的低分以理解推理差距的严重性。
| 方法 | MMAU (%) | MMAR (%) | 训练数据 | 推理额外开销 |
|---|---|---|---|---|
| Zero-shot | 36.02 ± 1.02 | 33.28 ± 0.75 | 无微调 | 无 |
| Zero-shot (CoT) | 18.03 ± 0.36 | 12.32 ± 2.31 | 无微调 | 推理更长 |
| SFT | 54.65 ± 0.34 | 38.15 ± 0.37 | YouTube8M | 无 |
| Audio MuToR | 53.02 ± 1.23 | 38.40 ± 0.53 | YouTube8M | 无 |
| SPARE | 58.03 ± 1.50 | 40.32 ± 0.57 | YouTube8M | 无 |
表中数字显示 SPARE 在两个基准上都是最高,MMAU 上达到 58.03%,MMAR 上达到 40.32%。与标准微调相比,MMAU 提升约 3.38 个百分点,与 Audio MuToR 相比提升约 5.01 个百分点。未胜出项值得关注。零样本思维链在 MMAU 只有 18.03%,在 MMAR 只有 12.32%,远低于直接回答,证实了推理差距的存在。Audio MuToR 在 MMAU 上甚至略低于标准微调,说明局部未来词预测没有解决全局一致性问题。
高资源模型分数更高,但它们依赖大规模数据和工业级算力,不能作为同条件胜负的依据。表后需要强调代价。SPARE 的增益来自训练期额外的对齐分支和结论标签依赖,推理期确实零额外开销,但训练期仍有超参数选择和语义编码成本。总体趋势是全局语义锚定优于局部预测,但不等于每组音频都成立,原文没有按音频类型细分胜负。
下面这张注意力分析图为上述增益提供了机制性证据,阅读时注意区分首层与末层的不同含义。
看图路径: 1. 先确认左右两幅分别对应第一层和最后一层,纵轴是相对均匀基线的注意力偏移;2. 再对比每个分组下粉色 SPARE 圆点与蓝色 SFT 圆点的上下位置;3. 重点观察第一层回答对音频的关注与最后一层回答对文本的关注变化
论文图 3。原论文 Figure 3:“We computed an attention score for SPARE (pink) and the SFT baseline (blue) across the First (a) and Last (b) layers.”。
这张图左右两幅分别对应第一层和最后一层,纵轴是相对均匀基线的注意力偏移,高于零表示比平均更关注,低于零表示相对不关注,横轴是回答对音频、回答对文本、寄存器对音频、寄存器对文本 4 种组合。可以看到在首层 SPARE 的粉色点在回答对音频上略高于蓝色基线,而在末层 SPARE 的回答对文本关注更强。原文解读为寄存器在首层优先提取声学内容,带动整个序列更早地听音频,到末层再转入语言域整合。这种从声学到文本的过渡符合接地推理的目标。
像素不能精确读出每个点的数值,因此这里只讲相对高低而不硬写具体偏移量。结合定性例子,原文报告 SPARE 在要求仔细听时能生成更长、更详细且更贴合音频的描述,这支持了注意力发现,但属于有限解释而非因果证明。
拿掉或改动关键选择后性能如何变化?
消融要回答两个问题。对齐强度是否敏感,寄存器放一个还是放多个。下表整理了不同 λ 和不同放置方式以及 MuToR 变体的结果,便于在同一指标下比较稳定性与失败条件。
| 方法配置 | MMAU (%) | MMAR (%) | 对齐权重 λ | 寄存器放置 |
|---|---|---|---|---|
| SPARE λ=1.0 | 57.73 ± 1.77 | 39.72 ± 1.09 | 1.0 | 序列初始单个 |
| SPARE λ=2.0 | 58.03 ± 1.50 | 40.32 ± 0.57 | 2.0 | 序列初始单个 |
| SPARE λ=3.0 | 57.60 ± 2.83 | 39.92 ± 1.04 | 3.0 | 序列初始单个 |
| Multi-conclusion | 55.43 ± 0.12 | 38.60 ± 0.25 | 同 λ | 每章节前多个 |
| Chapters summary | 52.18 ± 8.95 | 38.62 ± 2.18 | 同 λ | 每章节对齐各自嵌入 |
| MuToR dmax=4 | 52.87 ± 0.56 | 38.25 ± 1.56 | 0.1 | 多寄存器预测未来 |
| MuToR dmax=20 | 53.02 ± 1.23 | 38.40 ± 0.53 | 0.1 | 多寄存器预测未来 |
表前已经提出比较问题,这里直接解释收益与代价。对齐权重在 1.0 到 3.0 范围内都优于非 SPARE 基线,峰值在 2.0,说明方法对 λ 相对稳健。但 λ 等于 3.0 时 MMAU 方差增大到正负 2.83,提示过强正则可能带来隐空间不稳定,这是具体代价。寄存器放置的反例更明显。在每个章节前都放寄存器并对齐各自嵌入的两种变体分别掉到 55.43% 和 52.18%,后者方差高达正负 8.95,出现严重训练不稳定。
这支持了单个序列初始瓶颈更优的判断,即模型被迫在解码前提取统一的接地声学表示。MuToR 方面,增大预测距离并应用 λ 衰减能改善稳定性,但最高仍不及 SPARE。原文解释为 MuToR 预测中间片段的句法细节,而 SPARE 直接监督推理起点与终点目标,保证了全局一致性。这个解释是有限支持,不是严格因果,还需更多干预实验验证。
哪些结论还没有被验证,不能直接推广?
首先,原文没有测量推理延迟、吞吐或训练算力的具体数字,只说明推理时丢弃辅助参数因而零额外计算开销。这是一个结构性质,不是实测延迟,因此不能承诺实际部署延迟一定改善。其次,注意力分析显示早期音频关注增强,但相关性不等于因果,不能说注意力提升必然导致准确率提升,也不能把末步结果推广到每一步都成立。第三,超参数 λ 的选择基于经验验证,但优化器、学习率和训练轮数等细节未在正文中报告,复现需要依赖代码。
第四,评估只覆盖 MMAU 和 MMAR 两个基准,没有按语音、环境声和音乐细分,也没有报告误判率或幻觉率的直接度量,因此不能推断所有音频类型都同等受益。第五,句子编码器链接本次未能确认可达,语义目标的版本和冻结细节需要以代码为准。第六,高资源模型的比较不是同条件比较,不能理解为 SPARE 超越了工业规模模型。这些限制不是技术错误,而是证据边界,使用时需要补做相应验证。
要复现这篇工作,先准备什么再跑什么?
复现的第一步是准备基座与数据。基座是 SALMONN 13B,包括 Whisper、BEATs、Q-Former 和 Vicuna 主干。数据是 YouTube8M 子集上带 AF-Think 标签的 16 万训练和 4 万验证样本,目标按四章节组织。代码当前可用,地址是官方仓库,演示页面当前可用,可以先看演示理解输入输出。句子编码器地址本次未能确认可达,需要在运行前单独确认版本一致性。
第二步是实现序列组织与掩码。按问题、音频、选项、寄存器、思维链、结论的顺序拼接,寄存器只能 attending 前文,后续词不能 attending 寄存器。可以用小批量先验证掩码矩阵与图二一致,再开始训练。第三步是实现损失。总损失为交叉熵加 λ 乘以余弦距离,λ 先设 2.0,再在 1.0 和 3.0 附近做敏感性检查。
句子编码器冻结,只更新主干低秩适配和对齐头。第四步是评估。保持零样本协议,在 MMAU 和 MMAR 上报告均值与方差,并用多个随机种子重复注意力分析。需要保留的关键超参数是 λ 等于 2.0 和单个序列初始寄存器。还需补的验证包括分音频类型的细分、训练时长与显存记录,以及去掉对齐项后是否退回基线水平。
区分代码开源与系统可运行。仓库公开不等于权重可直接下载运行,需要检查依赖和权重说明。
什么时候值得尝试这种语义前置对齐?
当任务需要长推理且输入是长音频序列,同时观察到写推理反而比直接回答差时,这种在推理起点预置语义目标的正则值得尝试。它的适用条件是训练时有结论文本可用于构造语义目标,且能接受训练期额外的编码与调参成本。如果任务本身是短回答或音频很短,注意力漂移不严重,增益可能有限。复现时先做单寄存器与 λ 等于 2.0 的基准,再尝试多寄存器或不同 λ 作为反证。还需补的验证是分场景的稳定性、实测推理延迟和对不同基座的迁移性。
论文特有的误解需要澄清。寄存器不是在推理时提供额外知识的提示词,它在推理时根本不存在,它的作用是在训练时塑造模型更早听音频的习惯。多标记预测也不是不好,而是在本文的音频推理设定下,预测中间词不如直接对齐最终结论更能保持全局一致。总体上,SPARE 报告了一种轻量且推理零开销的改进,但其因果链条仍属有限解释,值得在受控条件下复现后再推广。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


