英文题目:Common Cause, Not Cross-Attention: Blocking Visual Shortcuts in Audio-Video Generation
标签:#视频到声音生成 | #数据增强 | #音视频 | #鲁棒性
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
👥 作者与机构
- Jian Xu:RIKEN iTHEMS;RIKEN AIP
- Delu Zeng:South China University of Technology
- John Paisley:Columbia University
- Qibin Zhao:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
联合音频视频生成以视频与场景为输入、以相符声音为输出,难点是外观与事件在训练中高度耦合导致模型走视觉捷径。作者先构建事件与干扰外观解耦的结构因果模型并定义反事实测试,再用直接预测与共享隐变量基线暴露捷径,接着施加对干扰干预不变的反事实一致性约束并只保留事件路径。该机制与仅重塑表示的瓶颈或解耦做法本质不同,前者限定假设类而后者仍可编码外观代理。在Colored-MNIST真实模态评测设置下,CC+CF方法的事件准确率为0.930,高于直接模型的事件准确率0.160。真实像素与运动时间线索上的验证进一步表明共享先验与瓶颈均无法阻断捷径,而干预一致性能保持因果路径稳定,该外推在大规模真实联合生成器上尚未验证。结论仅在已知且可忠实干预全部混杂干扰时成立,未知干扰与大规模真实联合生成器仍未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么分布内做对不算学会?
这篇论文研究联合音频视频生成中的一个具体任务:给定视频和场景,生成或预测与视频中事件对应的声音。输入是视频与场景变量,输出是音频,学习目标是在训练分布上拟合声音,同时在外观与事件解耦的反事实分布上仍生成正确事件的声音。必须保留的关键信息是数据的因果结构:事件和场景是视频与音频的共因,外观只影响视频而不影响声音,但在训练中外观与事件被人为混杂。输出是一套可复述的方法与证据链,而不是一句架构更好。
初学者容易把分布内均方误差降到接近零理解为模型读懂了事件,论文的起点正是打破这种等价:当颜色完全预测数字时,读颜色与读数字在训练损失上完全相同,只有反事实测试能区分。
事件 × nuisance 外观: 事件指决定声音内容的原因变量,如数字类别、形状排布或运动方向,它同时生成视频中的因果线索和音频;nuisance 外观指只影响视频的材料、纹理和颜色,不决定声音;二者搭配的意义是训练集中外观与事件高度相关时模型可以用外观代理事件,分布内与真理解不可区分,只有在 do 干预解耦后才能暴露错误。
沿一个样本走一遍有助于建立依赖:事件决定了视频中的形状或运动,也决定了音频的音高或频谱;nuisance 决定了渲染颜色;场景决定了响度等与事件正交的因素。模型看到的是颜色与形状叠加后的像素,需要输出频谱。如果训练中数字 3 恒为红色,模型输出 3 的音调既可以解释为认出了 3 的字形,也可以解释为认出了红色。
教学例子是杯子落地:撞击事件同时产生视觉冲击与声音,而杯子材质纹理只改变外观;若训练中某种材质恒对应某种撞击,模型用材质预测声音在分布内同样正确,换材质就会合成错的声音。这个例子只说明混杂逻辑,不附带任何数值效果。
同输入同目标的已有路线为何仍留下捷径?
同输入同目标的已有工作分为两支。第一支是直接跨模态注意力或共享主干的联合扩散模型,目标是同步性,让音频分支读取视频特征。第二支是显式共享时空先验,让双分支都对齐到同一个先验,动机之一正是避免伪跨模态耦合。物理常识基准报告现有视频到音频与联合模型对本应忽略的视觉因素敏感,这为捷径在实践中存在提供了外部间接证据。论文与它们的区别不是提出更大的同步架构,而是给出因果解释:耦合方式决定了信息通路,但不决定模型选择哪条通路。
直接模型 × 共享隐变量: 直接模型指音频分支直接读取完整视频表示,类似跨注意力耦合,分工是保留全部视觉信息用于预测声音;共享隐变量指双模态对齐到同一个共因编码再生成音频,分工是用瓶颈或共享码压缩信息;搭配理由是后者曾被期望自动过滤跨模态伪相关,组合意义在于论文证明当外观可完全预测事件时共享码同样编码外观,因此换架构不等于阻断捷径。
在同监督同运行阶段上,论文还对照了不变风险最小化、方差惩罚、分组优化与对抗去 nuisance 等域泛化方法。它们的共同要求是多个具有不同伪相关的训练环境,而论文的方法要求一个已知且忠实的 nuisance 干预。两类要求不可直接比较优劣,论文的论点是音频视频场景恰好能构造重上色与重渲染这类反事实,因此干预路线在此任务中可用。相关不等于因果的提醒在此适用:基准上观察到的外观敏感与受控实验中隔离的捷径是不同强度的证据,前者只支持症状存在,后者才支持机制归因。
视觉捷径在因果图上是哪一条多余的边?
论文把问题形式化为结构因果模型。事件与场景生成视频与音频,nuisance 只进入视频生成,音频在给定事件与场景下与 nuisance 独立。训练分布让 nuisance 以一定概率等于事件,否则独立;测试分布强制 nuisance 与事件独立,但事件与场景边缘分布不变。预测器可以走因果路径,即从视频读出事件再生成声音,也可以走捷径,即从视频读出 nuisance 并以它代理事件。
命题 1 指出在完全混杂下二者训练风险相等,测试差距等于事件解释的音频方差,因此经验风险最小化无法识别因果预测器。命题 2 进一步指出瓶颈与共享私有分解在同样条件下把编码 nuisance 作为风险最优且压缩率最优的解之一,共享本身不能排除捷径。这与无监督解耦不可能性的已知结论一致。理论是总体与精确可实现意义上的陈述,没有给出有限样本、有限权重或非凸优化的保证,论文对此有明确限定。
方法全景:干预放在哪里,架构保持什么不变?
方法全景很简单:保持原有生成或预测主干不变,额外要求生成音频对 nuisance 干预不变。具体做法是对同一事件场景固定,只重采样外观得到反事实视频,然后惩罚 2 次生成音频的差异,总损失是原生成损失加权加上该一致性项。当 nuisance 可识别且可增强时,反事实视频由重上色或重渲染产生,损失可直接计算;当 nuisance 未知时没有增强可用,只能退回表示学习,论文证明并实证这条退路目前失败,并将其列为开放问题。论文强调一致性损失本身不是新机制,贡献是把干预确立为划分线:所有干预外观的方法都关闭差距,仅重塑表示的方法都不关闭。
下面这张图把干预具体化为同一数字换颜色的一行,同一行音频目标应保持不变,这是理解后续所有实验的锚点,图前导读已说明观察顺序。
看图路径: 1. 先看第一行数字 3 在六种颜色下的字形是否保持同一事件;2. 再看第二行数字 7 的对照,确认干预只换颜色不换字形;3. 沿每一行想象音频目标应保持不变,对应一致性损失的约束方向
论文图 2。原论文 Figure 2::“The counterfactual intervention do(n:=n^\prime) made concrete (Colored-MNIST): the event—the digit—is fixed, the nuisance—its colour—is resampled.”。
该图显示两行数字 3 与数字 7,每行从原始颜色到 5 种干预颜色字形保持不变,只有颜色变化。一致性损失正是惩罚沿着这样一行的生成音频变化。像素细节支持方法直觉:干预忠实意味着只改变 nuisance 而不破坏事件,若重上色改变了字形或运动,则干预不再忠实,理论保证不再适用。后续从特征向量到像素视频到真实图像的迁移,都是把同一行逻辑换成不同的渲染方式。
反事实一致性 × do 干预: do 干预指固定事件和场景只重采样外观生成反事实视频,分工是提供因果定义上的对照样本;反事实一致性指惩罚原视频与反事实视频生成音频的差异,分工是把不变性写成可优化损失;搭配原因是只有干预能指明要不变的是哪一个因子,组合后模型被限制到只用事件路径,从而在训练和反事实测试上同时最优。
组件与计算:符号、目标与损失如何对应到代码?
先定义符号与输入。视频记为事件与 nuisance 经渲染函数加噪声得到,音频记为事件与场景经声学函数加噪声得到,且音频在给定事件场景下与 nuisance 独立。模型是视频与场景到音频的函数,可分解为经由事件与 nuisance 的复合函数。因果预测器定义为给定事件场景下的音频条件均值。训练风险是在混杂分布下的均方误差,测试风险是在解耦分布下的均方误差。引理表明最小化风险等价于拟合该条件均值,与模型无关的噪声项可分离。
\[x_{\mathrm{v}}=g_{\mathrm{v}}(\mathrm{e},\mathrm{n})+\epsilon_{\mathrm{v}},\qquad x_{\mathrm{a}}=g_{\mathrm{a}}(\mathrm{e},s)+\epsilon_{\mathrm{a}},\qquad x_{\mathrm{a}}\perp\mathrm{n}\mid(\mathrm{e},s).\]上式是结构因果模型的生成假设原文,左边是视频生成,中间是音频生成,右边是条件独立。它说明声音的真值来源不含外观,为后续不变性提供依据。实现上视频维度、音频维度与场景缩放在附录中有具体采样设置,初学者复述时应先说清谁生成谁,再说独立性,最后说混杂只出现在训练采样。
\[\mathcal{L}_{\mathrm{cf}}=\mathbb{E}_{\mathrm{n}^{\prime}}\,\big\|f(x_{\mathrm{v}},s)-f\big(x_{\mathrm{v}}^{\,\prime},s\big)\big\|^{2},\qquad\mathcal{L}=\mathcal{L}_{\mathrm{gen}}+\lambda\,\mathcal{L}_{\mathrm{cf}}.\]上式是方法损失原文,前项是原视频与场景到真实音频的生成误差,后项是对反事实视频的预测级一致性期望。计算目标是让同一事件在不同外观下输出同一声音。原文明确的实现是反事实批量通过固定事件场景重采样 nuisance 得到,一致性项不引用音频标签,因此可用于无标签视频。表示级一致性在论文中被单独测试并证明不足,只有输出级预测一致才能完全阻断,这一点在消融节有定量对照。
定理 1 表明在已知且忠实干预、可恢复与可实现假设下,不变类上的训练最优即因果预测器,且训练测试无差距;必要性部分说明全局测试最优本身就落在不变类中。论文同时声明这是接近定义的推论,价值在于把失败与修复系于同一个可检验条件。
训练与构造:优化什么,冻结什么,干预何时产生?
训练过程按原文交代复述。特征向量实验使用多层感知机或小编码器解码器,优化器为 Adam,学习率与批量在附录中按实验分别给出,反事实权重默认取 1 并在宽范围扫参显示无需精调。像素视频实验用步进卷积编码器,直接模型用较宽编码,瓶颈用窄编码,解耦模型另加图像解码器做重建,干预通过重渲染同一灰度形状为随机颜色实现。
真实模态实验使用冻结的 ImageNet 预训练 ResNet18 只训练音频头,图像来自染色 MNIST,音频是按数字设定基频的合成乐音的对数梅尔谱,干预是把同一数字重染为随机调色板颜色。流匹配生成实验训练速度场并用欧拉步数采样,干预项匹配原视频与 nuisance 重采样视频条件下的速度场。真实大模型部分只做轻量微调,在少量 held-out 视频上用重上色一致性加蒸馏锚定,评估在公共 held-out 集上严格配对。
有监督反事实增强 × 无标签一致性: 有监督反事实增强指把反事实视频连同原音频标签一起加入训练,分工是用标签直接告诉模型反事实样本的声音不变;无标签一致性指只约束 2 次前向输出彼此接近而不引用音频标签,分工是利用未标注视频扩大干预覆盖;搭配原因是二者共享同一个干预来源,组合意义是标签充足时可互换,标签稀缺时一致性仍能从无标签视频学习而保持优势。
需要明确指出的缺项是论文未报告某些大模型内部梯度路径的全部细节,复述时不应从模型名称推定实现;凡原文未给出的冻结范围与重置时机都应标为未报告。训练资源为单卡,每次运行在分钟级,种子协议与均值标准差报告方式在附录中有说明。干预的产生时机是每个训练批量内同步构造反事实,而非事先扩充固定数据集,这保证了事件场景严格配对。
实验条件:数据、划分、指标与聚合如何保证可比?
实验按问题组织而非按数据集罗列。核心协议是报告分布内与反事实解耦两种条件下的音频均方误差,方向是越小越好,并辅以事件准确率判断生成的是哪个事件的声音。特征向量设置事件与 nuisance 各 8 取值,视频由事件独热经弱几何强度与 nuisance 独热拼接经随机矩阵加噪得到,音频由事件频谱经场景距离缩放加噪得到,训练以概率控制混杂强度,测试均匀解耦。分片实验一半事件类别完全混杂一半干净,评估按分片分别聚合。
像素与时序视频通过程序化渲染保证真值已知,时序中起始位置随机使单帧无法识别方向,只有跨帧位移决定事件。真实模态用真实像素与真实谱表示但音频仍为合成,混杂完全构造。真实大模型用真实视频与预训练检查点,度量改为 CLAP 空间的距离与零样本声类翻转率,编辑在固定生成种子下比较以归因于编辑本身。
分布内误差 × 反事实测试误差: 分布内误差指保持训练期外观事件相关结构下的音频均方误差,分工是检验模型是否拟合了训练分布;反事实测试误差指外观与事件解耦后同一模型的误差,分工是检验模型用的是因果路径还是捷径;搭配原因是二者差距定义了捷径的危害,组合后论文用两者的比值和分片差距判断方法是真去捷径还是仅拟合更好。
下图是真实模态的数据构造,上行训练每个数字固定颜色,下行测试随机颜色,初学者应先看懂这种构造为何能把捷径从一般脆弱性中分离出来。
看图路径: 1. 先看上行训练行每个数字固定一种颜色的对应关系;2. 再看下行测试行同一数字换成随机颜色的解耦方式;3. 对照上下同一列,理解颜色预测声音在测试时会错位
论文图 4。原论文 Figure 4::“The real-modality setting. In training every digit always wears its own colour (perfect confounding); at test the colour is resampled independently of the digit.”。
该图上行标注训练混杂颜色等于数字,下行标注解耦随机颜色,同一数字上下颜色不同而字形相同。聚合方式上受控实验多用多种子均值标准差,真实大模型用自助置信区间,复述数字时必须同时核对数据集、模型、阶段、指标与聚合对象,数值相同不代表指标相同。
主结果:捷径有多灾难,干预恢复了多少?
最 sharp 的证据是混杂强度扫描。直接模型在所有混杂强度下分布内几乎完美,但反事实误差随混杂趋近 1 而跃升约 140 倍,瓶颈模型同步崩溃,一致性模型全程平稳低位且仅有小额分布内开销。下图在对数纵轴上显示这种相变,导读要求先看坐标再看分叉。
看图路径: 1. 先确认横轴是训练混杂强度,纵轴是对数刻度的反事实音频误差;2. 比较红色直接模型与橙色瓶颈模型在右端接近 1 处的陡升;3. 观察蓝色一致性曲线在全横轴范围保持平稳低位
论文图 3。原论文 Figure 3::“Out-of-distribution audio error vs. training confounding strength (log scale; same data as Table 1).”。
像素可见 3 条曲线:直接与瓶颈在横轴 0.95 之后陡升至顶端,一致性保持水平。这种跃升支持命题 1 的不可识别解释:少量去相关样本足以学因果路径,完全混杂则无激励。分片实验进一步显示失败只出现在被混杂的事件类别上,直接模型在混杂分片误差远高于干净分片,而一致性在两分片都低,说明修复无连带伤害。真实模态与生成模型中直接模型把错误事件的声音合成出来,频谱图对照使失败可听化。
下图每行展示一个穿着他色数字的输入,直接模型输出谱图匹配所见颜色对应数字的音调而非真值数字的音调,一致性恢复正确音调。
看图路径: 1. 先看第一列输入数字与所穿异色,明确事件与 nuisance 的冲突;2. 比较第二列真值谱图与第三列直接模型输出的谐波位置差异;3. 再看第四列颜色对应音调与第五列一致性模型恢复的正确音调
论文图 9。原论文 Figure 9::“The failure, made audible. Each row shows a digit wearing another digit’s colour.”。
该图三行分别对应数字 3 穿 7 色、数字 5 穿 1 色、数字 8 穿 2 色,每行五列为输入、真值、直接输出、颜色参照与一致性输出。直接输出的谐波亮带位置与颜色参照对齐而非与真值对齐,这是捷径的定性铁证。重提结果时新增的对照是共享先验与解耦基线同样失败,说明问题不在瓶颈宽度或是否显式分共享私有,而在是否干预。
下面两张表是达到选择条件的原表绑定,分别承担分片定位与共享先验失败的宽表要求。第一张表提出比较问题:在一半类别混杂一半干净时,误差是否只出现在混杂分片且修复是否伤害干净分片,公平条件是同一反事实测试按分片分别聚合,指标方向是均方误差越小越好。
| Model | OOD-cf (confounded slice) | OOD-cf (clean slice) |
|---|---|---|
| Direct | 0.0488 | 0.0012 |
| CC+CF (ours) | 0.0015 | 0.0016 |
该表显示直接模型在混杂分片误差显著高于干净分片,而一致性在两分片都保持低位。主要收益是精准修复混杂分片,代价在该表中几乎不可见,未胜出项是直接模型在干净分片本身已完美,说明干预没有损害未混杂事件,这是保险式方法的关键性质。第二张表提出比较问题:忠实共享先验是否同样无法阻断,公平条件是同一特征向量分布与同一训练预算,指标为分布内与反事实均方误差。
| Model | IID MSE | OOD-cf MSE |
|---|---|---|
| Direct | 0.0010 | 0.1816 |
| Shared-prior (JavisDiT-style) | 0.0016 | 0.1515 |
| CC+CF (ours) | 0.0019 | 0.0020 |
该表显示共享先验分布内与直接模型相当但反事实误差同样高出近两个数量级,而一致性保持低位。主要收益与代价是架构对齐双模态仍继承外观信息用于重建,音频分支随之走捷径;未评测边界是该先验只是小编码解码器替身,不能推广为所有大规模联合扩散必然失败,论文对此有明确限定。
真实大模型检验:症状存在但归因为何谨慎?
在预训练视频到音频模型上的检验目标不同:无法构造混杂,只能检验对声音无关编辑的不变性这一必要条件。实验在真实视频上比较灰度、颜色旋转与微小亮度参照及时间反转因果参照,并加入同等信噪比的高斯噪声作为通用分布外对照。结果是外观编辑远比最小编辑更改变生成声音,但幅度匹配的噪声同样或更强烈地改变声音,因此效应是广泛输入脆弱而非孤立颜色捷径。
微调实验用重上色一致性加蒸馏在少量视频上训练,多种子在公共 held-out 集上配对评估,灰度翻转率下降但颜色旋转几乎不变,噪声与因果敏感性也同幅下降,说明只是 broadly 降低敏感而非手术式去除外观捷径。论文对此保持诚实:受控合成提供捷径的干净隔离,真实模型只确认症状在规模上存在。
下表整理真实模型的翻转率对照,比较问题是外观编辑是否特殊,公平条件是固定生成种子与按视频匹配信噪比的噪声对照,指标方向是翻转率与距离越低越不变。
| 编辑类型 | 本编辑翻转率 | 最小编辑参照 | 距离变化倍数 | 判断 |
|---|---|---|---|---|
| 灰度 | 62% | 22% | 约 5–6 倍 | 非不变但非特异 |
| 颜色旋转 | 54% | 22% | 约 5–6 倍 | 噪声对照同样高 |
该表数字由外观编辑翻转率与最小编辑对比的原句覆盖,主要收益是确认已部署模型远非不变,代价与反例是噪声对照推翻颜色特异归因,未评测边界是仅覆盖全局颜色编辑与单一模型,材质背景与多模型的调查仍缺失。
反证与消融:是干预而非损失形式在起作用吗?
最锋利的反证是有监督反事实增强。在标签充足时,它与预测级一致性在统计上不可区分,而表示级一致性差约 12 倍,瓶颈与无监督共享私有分解同样失败。分界线因此在是否干预 nuisance,而非两种损失谁更精巧。标签稀缺时二者分化:一致性无需反事实的音频标签,可用于整批视频,增强只能用于有标签样本的子集,随着标注比例下降到 0.02,一致性保持约 1.5 倍优势。部分增强实验显示当每个 nuisance 各自充分决定事件时,遗漏任一混杂因子都保留完整捷径,全部覆盖后误差才坍缩。
当每个 nuisance 仅部分可预测事件时,部分增强已带来 graded 改善。深度消融显示输入层与浅层一致性只能部分帮助,只有输出级预测一致完全阻断。线索难度扫描显示因果线索易读时直接模型已稳健,干预几乎免费,说明方法是可默认开启的保险。
下表整理标签充足时的等价性比较,比较问题是损失形式是否必要,公平条件是同一编码器头划分与同一反事实来源,指标方向是反事实均方误差越小越好。
| 条件 | 指标 | 有监督增强 | 一致性本方法 | 结论 |
|---|---|---|---|---|
| 完全标注 | OOD-cf MSE | 0.0012 | 0.0011 | 可互换,关键是干预 |
该表数字来自标签充足时二者无显著差异的原句,主要收益是澄清贡献不在损失新颖性,代价是标签充足时一致性并无额外优势,未胜出项是表示级一致性在此条件下仍失败,支持输出级约束的必要性。容量扫描作为另一反例显示直接模型从数 1000 到 1000000 参数反事实误差不降,说明捷径不是欠拟合,可扩展性不能替代可识别性。
什么条件下结论成立,什么是明确的开放问题?
论文用单独章节限定适用条件。第一,干预决定性主要在近乎完全的混杂下成立,可能是分片局部的,真实语料是否存在此类分片需实证,前提是基准只提供间接鼓励证据。第二,捷径仅当因果线索相对 nuisance 难读时被采取,运动明显时直接模型已稳健,干预此时既不帮助也不伤害。第三,实用配方假设每个混杂 nuisance 都可识别且可增强,部分增强在各自充分时无用,遗漏一个即保留完整捷径。
最重要的是未知 nuisance 机制:没有增强可用时表示学习退路失败,如何发现未知混杂并对全部干预是核心开放问题。理论限定包括总体分布、精确可实现、忠实干预与条件独立假设,任一失效保证不迁移;生成分布的扩展仅以严格正常评分规则论证框架,实证用流匹配支持而非定理覆盖。缺失证据不是技术错误,相关性不是因果,未测量延迟成本时不应承诺效率改善。
复现先做什么,需要哪些超参数与信息条件?
复现应从特征向量因果模型开始,因为真值与混杂完全已知。按附录构造事件与 nuisance 各 8 取值,视频经随机矩阵加噪,音频经场景缩放,训练混杂概率设为 1,测试均匀解耦,评估 4000 新样本。模型用指定宽度的多层感知机与编码器,优化器 Adam,反事实权重取 1,反事实批量固定事件场景重采样 nuisance。验证通过标准是分布内三者相近而反事实直接与瓶颈高出两个数量级、一致性保持低位。
随后复现分片、像素重上色与时序运动三档,每档确认干预忠实:重上色不改变形状,时序重上色不改变位移,起始位置随机。通过后再做真实模态:冻结预训练编码器只训音频头,染色与合成谱参数按附录设置,事件准确率用最近邻谱分类。资源声明为单卡分钟级,多种子报告均值标准差。资源状态方面,本次未发现来源绑定且完成验证的公开资源,不得声称代码模型或数据已公开,复现应以论文附录参数为准并记录种子与聚合口径。
何时值得尝试这套干预,还需补哪项验证?
当怀疑训练中外观与事件高度相关且因果线索较难读取时,值得尝试预测级反事实一致性,尤其是有可行的重上色、重材质或重渲染手段且无标签视频充足时。做法是先做分片诊断:按疑似混杂因子切分评估,看误差是否集中在混杂分片;再对全部疑似因子构造忠实反事实并施加输出级一致性,保留分布内对照以确认代价小额。若因果线索已很明显或混杂远非完全,预期收益小但保留开启也无妨。
还需补的验证是真实大规模联合生成器的端到端去偏,需要真实音频监督或从头训练,并扩展到材质背景编辑与多模型,以及建立外观保持而事件反事实的真实基准。最终判断应表述为报告显示干预在受控条件下关闭差距,支持架构不足的论点,而未知 nuisance 下的部署效果可能待验证。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses


