英文题目:Cross-Modal Knowledge Distillation for Acoustic Pedestrian Detection
标签:#音频分类 | #知识蒸馏 | #环境声 | #音视频
评分:6.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
👥 作者与机构
- Yonghyun Kim:机构信息未在 arXiv HTML 中可靠披露
- Chaeyeon Han:机构信息未在 arXiv HTML 中可靠披露
- Sancho Gatungay:机构信息未在 arXiv HTML 中可靠披露
- Subhrajit Guhathakurta:机构信息未在 arXiv HTML 中可靠披露
- Alexander Lerch:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
声学行人检测以单通道环境音频为输入,逐秒判定记录器附近6米内有无行人,难点在于脚步声微弱且易被城市噪声掩蔽,同时标签重度不平衡。先由冻结Mask2Former视觉分支以同区域视频裁剪为输入,抽取最高分行人查询并经按折拟合的二分类头输出教师软目标,为跨模态监督提供来源。再以单通道音频为输入,经冻结VGGish编码器与单层多头Transformer及二分类头生成学生预测,并将上一步教师软目标与学生预测共同送入蒸馏加加权交叉熵训练目标,且该音频分支为唯一的推理通路。最后以真值与教师多数类概率质量为输入,由条件门控按阈值决定是否保留行人样本蒸馏项,幸存项经重归一化后与加权交叉熵加权相加,从而改变训练目标构成。相对无条件蒸馏,该少数类选择性监督的实际意义在于分离操作点漂移与排序判别增益,避免将多数类准确率上升误读为检测能力提升。在ASPED留一会话5折交叉验证设置下,LogitKDTFD的宏准确率为73.7%,高于基线的宏准确率72.9%。结论仅适用于重度不平衡下的视频到音频存在性检测,未验证其他不平衡比例与多轮统计稳定性。该结论的适用边界受限于单校园ASPED与单轮运行,尚未验证其他不平衡比例与多折统计稳定性下的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/yonghyunk1m/cmkd-ped-detect — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么只用声音很难?
本文的输入是城市步行区同步采集的音频与视频,目标是对每 1 秒判断记录器附近是否有行人。部署时只允许用音频,视频只在训练时出现。论文研究的是音频行人检测,也就是只听声音做存在性二分类。白话说,模型要从脚步声这类微弱线索里听出是否有人。英文是 acoustic pedestrian detection。
难点首先是信号弱。脚步声能量低,容易被城市噪声掩盖,视频能直接看到人形,声音只能听到间接振动。其次是类别极不平衡。所用 ASPED v.a 数据集中无行人占 91.5%,行人只占 8.5%。多数类压倒少数类时,模型只要偏向预测无行人就能获得不错的总准确率,但少数类召回会塌。
因此作者把问题框定为跨模态知识蒸馏能否在这种条件下带来可复述的增益。白话说,就是训练时让看得见的视频老师带一带只听得见的音频学生,测试时学生独自上场。英文是 cross-modal knowledge distillation。需要先建立的判断是,准确率上升不等于听得更准,可能是判定阈值相对数据分布移动了。后文所有比较都围绕这一点展开。
同输入同目标的已有路线与本文的对照位置是什么?
在同输入同目标上,已有工作是 Seshadri 等人引入同步音频视频与行人标签的音频行人检测,Kim 等人扩展到车辆噪声场景。两者的共同做法是用加权采样与加权损失对抗不平衡,但报告音频单独准确率仍然有限。本文沿用同样的学生结构与不平衡对策,把增量放在系统比较蒸馏的作用,而不是提出新的音频编码器。
在同监督不同模态上,SoundNet 开创了用视觉识别输出监督音频网络,C2KD 按教师与学生软预测的排序一致性选择蒸馏样本,XKD 在音频与视频特征之间加域对齐目标,MM-DistillNet 把视觉教师蒸馏给只做声音的目标检测器。这些工作都承认模态差异会限制迁移,监督错配可能带来负迁移。本文的不同是只做存在性二分类,并且不平衡更极端,因此更关注操作点移动。
在同蒸馏机制上,logit 蒸馏匹配软化预测,FitNets 匹配中间特征,对比蒸馏与关系蒸馏分别保持对比结构与样本间关系。另一条线把 logit 蒸馏解释成类似标签平滑的正则化,并讨论其对校准的影响。本文继承标签平滑视角,但只对行人类做真值条件门控。已有的选择性蒸馏包括按校准准则切换教师与真值、按信任分数过滤、屏蔽多数类 logit 维度等,本文的信任过滤蒸馏明确结合样本级门、真值指导与少数类豁免,这是与前人对照的关键点。
要回答的具体问题与必须固定的信息条件是什么?
本文要回答的不是蒸馏能否提高某个绝对分数,而是 3 个可检验的问题。第一,在严重不平衡与视频音频模态差距下,10 种蒸馏配置是否提升排序能力,还是只移动操作点。第二,按样本关掉部分教师监督是否改变上述效果。第三,预测概率与观测频率更一致是否意味着检测能力变强。
必须固定的信息条件是教师在训练时可见,测试时不可见。教师分支与蒸馏损失只在训练时存在,推理是纯音频学生。教师头是在每折的 4 个训练会话上拟合的,没有见过被留出的测试会话,学生的测试每个秒只被非重叠窗口预测 1 次。这一点决定了复现时不能把教师预测当作测试输入。
另一个信息条件是教师信号并非独立真值。教师头本身拟合自真值标签,其 logit 是对真值的不完美读出。论文还报告教师在行人样本上的平均正确类概率约 0.75,在无行人样本上约 0.85。这是一个被观测到的监督不对称,作者明确只把它当作观测性质,不直接断言为因果。
训练与推理两条路径如何分工?
沿一个 10 秒音频样本走一遍流程最清楚。训练时有两条分支。音频分支把 10 秒 16 kHz 波形送入冻结的 VGGish 编码器得到 512 维表示,再经过可训练的单层四头 Transformer 与二分类头,输出学生 logit。视频分支把覆盖同样六米地面区域的矩形裁剪送入冻结的 Mask2Former,取分数最高的人查询嵌入并拼接置信度与人数通道,再经过冻结的多层感知头输出教师 logit。真值标签来自另一套检测器在每秒的判定。
训练目标是加权交叉熵加蒸馏项,推理目标只有音频分支。虚线箭头代表只在训练时存在的教师分支与蒸馏损失,实线箭头代表训练与推理都存在的音频学生路径。信任过滤蒸馏的掩码根据真值与教师输出计算,只对蒸馏项起门控作用,不改变交叉熵分支。
跨模态知识蒸馏 × 音频行人检测: 跨模态知识蒸馏负责在训练时把视频教师的软预测作为额外监督传给音频学生,音频行人检测负责在部署时只用声音判断 1 秒内 6 米内是否有人,两者搭配的理由是训练时可以看视频而测试时只能听,组合意义是学生不增加输入模态,只改变训练目标的形状。
这种安排的教学意义是,学生容量、优化器与采样都不变,只有损失与门控变化,因此性能差异可以归因到监督方式,而不是编码器变强。复述时必须保留冻结与可训练的划分,否则会误以为教师与学生联合学到了新特征。
蒸馏损失与信任过滤门如何计算?
先讲 logit 蒸馏。记学生与教师 logit 为 2 维向量,真值为零表示无行人、一表示行人,温度为 T。对教师与学生分布做软化后求 KL 散度,再乘以温度平方并在批量内平均,就得到每批的蒸馏损失。总损失是交叉熵加权重系数乘蒸馏损失。混合变体在此基础上再加教师与学生嵌入之间的余弦对齐项,门控同时作用于所用的蒸馏项。
\[\mathcal{L}_{\mathrm{KD}}\;=\;\frac{T^{2}}{N}\sum_{i=1}^{N}\mathrm{KL}\!\left(\sigma(\mathbf{z}_{t}^{(i)}/T)\,\big\|\,\sigma(\mathbf{z}_{s}^{(i)}/T)\right),\]该公式的输入是教师与学生的 logit 与温度,计算目标是让学生在软化分布上靠近教师。每样本梯度正比于学生软化概率减教师软化概率,因此同时依赖两个网络。论文强调正权重只缩放梯度,而二值门可以直接去掉选中样本的蒸馏贡献,这是引入门控的动机。
信任过滤蒸馏用一个二值指示变量决定每个样本是否参与蒸馏。分子是保留样本的蒸馏项之和,分母是保留样本数,相当于对幸存样本重新平均。若一批中没有样本被保留,则该项置零。
\[\mathcal{L}_{\mathrm{KD}}^{\mathrm{TFD}}\;=\;\frac{\sum_{i=1}^{N}m^{(i)}\,\ell_{\mathrm{KD}}^{(i)}}{\sum_{i=1}^{N}m^{(i)}},\]门的规则只看少数类。当真值为行人且教师赋给无行人类的概率超过阈值时取零,否则取一。默认阈值 0.4,未在折上调参。在 0.5 时门只关掉教师判错的行人样本,在 0.4 时还会关掉教师判对但行人概率低于 0.6 的样本。多数类样本永远不受影响。
\[m^{(i)}\;=\;\begin{cases}0&\text{if}\ y_{i}=1\ \text{and}\ \sigma(\mathbf{z}_{t}^{(i)})_{0}>\tau,\\ 1&\text{otherwise,}\end{cases}\]logit 蒸馏 × 标签平滑: logit 蒸馏负责让学生的软化分布去拟合教师的软化分布,标签平滑负责把独热标签与一个平滑分布混合以降低过确信,两者搭配的原因是数学上教师加权的交叉熵可以并入标签系数,组合意义是在共享温度下信任过滤蒸馏可读成条件式教师依赖的标签平滑,屏蔽样本退回硬标签。
信任过滤蒸馏 × 类别不平衡: 信任过滤蒸馏负责按真值与教师多数类概率做样本级二值门控,只在行人样本且教师无行人概率超过阈值时关掉蒸馏,类别不平衡负责解释为何少数类监督更脆弱且教师在行人样本上平均正确类概率更低,两者搭配的原因是作者观察到教师目标本身不对称,组合意义是选择性地让可疑少数类样本只保留加权交叉熵。
需要注意重归一化的副作用。分母变小会把幸存样本的有效蒸馏权重放大为批量大小除以保留数,因此门控同时改变了样本选择与有效权重。论文明确指出没有随机掩码对照,所以不能把后续更强的操作点移动完全归因于选择本身。
优化目标在共享温度下等价于什么平滑标签?
把每样本目标写成未归一化的交叉熵加门控蒸馏项,可以得到条件标签平滑解释。在温度为一时,该目标在相差一个与学生无关的常数与正缩放的意义下,等价于用混合目标对学生预测求交叉熵。混合目标是独热标签与教师分布的凸组合,混合系数由蒸馏权重与门控决定。被屏蔽样本的系数为零,退回硬标签,未被屏蔽样本使用标签与教师分布的混合。
\[\tilde{\mathbf{y}}^{(i)}\;=\;(1-\lambda^{(i)})\,\mathbf{y}^{(i)}+\lambda^{(i)}\,\sigma(\mathbf{z}_{t}^{(i)}),\qquad\lambda^{(i)}=\frac{\alpha\,m^{(i)}}{1+\alpha\,m^{(i)}},\]该命题的输入是独热标签、教师分布、蒸馏权重与门,计算目标是把两项损失合并成一项交叉熵。证明思路是把蒸馏项展开成教师加权的交叉熵加常数,再合并学生对数概率的系数并归一化。温度大于一时,只要交叉熵与蒸馏共享同一温度,同样恒等式在软化分布上成立,混合系数中的权重需乘以温度平方。
必须说明适用范围。原文实验的任务损失在温度一处计算,蒸馏项在温度三处计算,因此该恒等式刻画的是共享温度情形,而不是对实验目标的精确复现。实验用的是加权交叉熵,混合系数还会依赖类别权重与归一化方式,混合变体的余弦项也不在该恒等式覆盖之内。复述时不能把这一数学解释说成实验完全等价。
数据、模型、比较对象与度量如何固定?
数据是 ASPED v.a,5 个户外会话,音频视频同步,场景为禁行车的城市步行区。真值由 Mask2Former 在每秒生成,1 秒内若有被检测到的人位于记录器六米内则标为行人。标签分布为无行人 91.5%,行人 8.5%。训练窗口按 1 秒步长滑动,存在 90% 重叠,每个 10 秒窗口产生 10 个秒级预测,测试会话用非重叠 10 秒窗口评分,保证每个测试秒恰好被预测 1 次。
模型方面,学生遵循已有工作,VGGish 冻结,Transformer 单层四头可训练,二分类头可训练。所有配置含基线都用同样的不平衡对策,即逆频率批量采样与类别加权二元交叉熵,正类权重 3.28。教师处理同一六米区域并外推到两米高度,取最高分的人查询嵌入加置信度与计数通道,送入冻结的多层感知头。教师头按折拟合,保证不看测试会话。
比较对象共 10 种蒸馏配置加无蒸馏基线。logit 类包括默认权重与权重 0.3,不平衡感知类包括按指数移动平均归一化、logit 调整与焦点加权,特征与关系类包括余弦相似、对对比蒸馏与关系蒸馏,提议方法为信任过滤的 logit 版与再加余弦项的混合版。所有配置共享优化器、调度与学生结构,只有损失与门不同。优化器为 Adam,学习率 5 乘 10 的负 4 次方,权重衰减 0.01,批量六十四,最多两轮,早停看训练会话中随机 10% 划分上的宏准确率。
度量分阈值与无阈值 2 类。宏准确率为两类在 0.5 阈值下准确率的平均,行人 F1 为少数类精确率与召回的调和平均,也在 0.5 阈值下计算。PR-AUC 用平均精度计算,越高越好,用作排序能力的探针。期望校准误差分标准 top1 版本与正类版本,后者把预测的行人概率分 10 个等宽箱后与经验频率比较。Brier 分数进一步分解为可靠性减分辨率加数据固有项,分箱数为十,作者明确分辨率只作为 PR-AUC 的佐证而不替代它。
主比较显示增益来自哪里,代价是什么?
主协议是 5 折留 1 会话交叉验证,每折用 4 个会话训练 7.7–8.4M 标注秒,指标报告 5 折均值。作者先提醒 2 点。第一,没有任何配置的宏准确率增益超过 1 个百分点,而折间标准差为 1.6 至 2.1,因此只看均值会误导,必须按折配对比较。第二,基线行人准确率 82.3 与行人 F1 28.6 分歧很大,因为在极不平衡下中等误报数也会淹没少数类,使精确率从而 F1 保持很低。
比较的问题是,在公平的采样加权与同一学生下,蒸馏是否带来排序增益。公平条件是只有损失与门不同,指标方向为宏准确率、F1 与 PR-AUC 越高越好。下表把基线、普通 logit 蒸馏与信任过滤蒸馏放在同一操作点语言下对照,重点不是复述全部 10 行,而是看清无行人准确率(%)上升与行人召回下降同时出现。
| 条件 | 指标 | 基线 | LogitKD | LogitKDTFD |
|---|---|---|---|---|
| 同一留会话验证 | 无行人准确率 | 63.5 | 70.8 | 更偏向多数类 |
| 同一留会话验证 | 行人准确率 | 82.3 | 76.4 | 更低 |
| 同一留会话验证 | 行人 F1 | 28.6 | 31.2 | 31.8 |
| 同一留会话验证 | PR-AUC | 0.328 | 0.332 | 0.330 |
| 同一留会话验证 | 宏准确率效应 | 基线 | 小幅上升 | 配对效应更大但阈值敏感 |
表后需要把收益与代价说透。主要收益是宏准确率小幅上升与 F1 数值上升,但代价是行人召回下降。以 LogitKD 为例,无行人准确率从 63.5 到 70.8,行人准确率从 82.3 到 76.4,表头单位为 100 分制、数据格为裸值,此处保留裸值写法。2 个信任过滤配置的标准化配对宏准确率效应最大,但直接比较加门与不加门时,5 折下宏准确率与 F1 差异均不显著,且门同时改变有效权重,因此不能说选择本身优于不加门蒸馏。未胜出的例子是 LogitKDAdj,它向行人方向过度校正,无行人准确率掉到 53.7,行人准确率升到 89.0,但 F1 反而最低为 25.9。
宏准确率 × PR-AUC: 宏准确率负责在 0.5 阈值下平均两类准确率,反映当前操作点的取舍,PR-AUC 负责在所有阈值下度量把行人排在无行人之前的能力,反映判别力,两者搭配的原因是类别极不平衡时阈值移动即可改变宏准确率,组合意义是区分操作点移动与真正的分辨能力增益。
判别力的证据很弱。PR-AUC 全配置在 0.324 至 0.333 之间,基线为 0.328。LogitKD 的最大平均增益约 0.004,信任过滤配置的自助区间包含 0。把基线沿每折 ROC 移到 LogitKD 的误报率,大部分召回变化可被复现,只剩约 1.5 的召回与 0.4 的 F1 残差,ROC-AUC 从 0.808 到 0.813 至 0.815。因此多数 F1 上升是操作点效应,而不是少数类检测变强。
\[\mathrm{BS}_{\mathrm{binned}}\;=\;\mathrm{REL}-\mathrm{RES}+\bar{y}(1-\bar{y}),\]期望校准误差 × Brier 分数分解: 期望校准误差负责把预测概率分箱后比较预测均值与经验频率,Brier 分数分解负责把平方误差拆成可靠性减分辨率加数据固有项,两者搭配的原因是单一校准数可能混合过预测与排序变化,组合意义是确认校准改善来自过预测下降而分辨率未变。
校准部分同样要区分概率校准与排序。预测的行人概率分箱后,正类期望校准误差从 0.366 到 0.316,Brier 可靠性从 0.163 到 0.110,看似改善,但平均预测概率从 0.45 降到 0.40,分辨率停在 0.011 不变。正类校准误差紧贴平均预测与每折先验的距离,可靠性的大部分可由该距离的平方下界解释。标准 top1 校准误差几乎不变,基线 0.076 对比蒸馏后 0.073,因为行人预测过确信而无行人预测欠确信,按置信度分箱时两者抵消。这支持校准增益主要来自过预测减少与操作点移动,而不是更好排序。
教师更强为何没有转化为学生排序更强?
教师评估是第 2 个实验,问题是视频教师的优势能否被蒸馏传递。条件是同一留会话划分,教师只在训练会话拟合。指标方向同样越高越好。下表把教师与学生的绝对水平对照起来,教学价值在于看到任务性能差距很大而排序传递很小。
| 条件 | 指标 | 音频学生基线 | 视频教师 | 蒸馏后学生排序 |
|---|---|---|---|---|
| 同一留会话验证 | 宏准确率 | 72.9 | 89.9 | 小幅移动 |
| 同一留会话验证 | 行人 F1 | 28.6 | 53 | 约 31.8 |
| 同一留会话验证 | PR-AUC 与分辨率 | 0.328 | 未直接传递 | 0.330 附近且分辨率 0.011 不变 |
| 同一留会话验证 | 平均预测概率 | 0.45 | 行人样本置信更低 | 0.40 |
| 同一留会话验证 | 校准可靠性 | 0.163 | 教师为不完美读出 | 0.110 |
表后解释是,教师宏准确率 89.9、F1 53,远高于学生的 72.9 与 28.6,表头单位为 100 分制、数据格为裸值,此处保留裸值写法,但学生 PR-AUC 只在窄带 0.324 至 0.333 内波动。这与模态聚焦假说一致,即迁移取决于跨模态共享信息而非教师准确率本身。但作者明确限定,单一管线不能把模态差距与教师校准、学生容量、优化效应分离,因此只能说一致而不能说证明。
另一个常被误读的点是采样。训练采样在期望上平衡 2 类,因此操作点移动不是批量 prevalence 造成的。论文把它与教师目标不对称联系起来,教师在行人样本上的正确类平均概率约 0.75,在无行人样本上约 0.85,并指出信任过滤只在行人样本上关掉蒸馏,幸存集合与有效权重都向无行人倾斜,这与更强的移动一致,但同样未确立因果。复述时应保留这种谨慎措辞。
换权重、换对齐方式与加门各改变了什么?
把蒸馏权重从 1.0 降到 0.3,宏准确率(%)仍小幅上升,无行人准确率 70.3,行人准确率 77.2,PR-AUC 回到 0.326。这说明小权重没有扭转方向,只是移动幅度不同。按指数移动平均归一化、不平衡感知的 logit 调整与焦点加权三者中,前者与基线差异方向与其他 logit 方法一致,后两者分化,焦点加权接近基线,logit 调整则反向偏向行人。
特征与关系类中,余弦对齐、对比蒸馏与关系蒸馏的宏准确率都在基线附近小幅波动,PR-AUC 分别为 0.327、0.329、0.327。它们的共同点是都没有带来超过一个百分点的宏准确率增益,也都没有把 PR-AUC 带出 0.324 至 0.333 的窄带。这支持作者的判断,即在该模态差距下,不同蒸馏形式的主效应相似。
加门的效果需要单独读。信任过滤的两个配置行人 F1 同为 31.8,PR-AUC 分别为 0.330 与 0.331,无行人准确率进一步升到 72.6 与 72.9,行人准确率进一步降到 74.7 与 74.3。也就是说,门强化了向多数类的移动,但平均 PR-AUC 没有改善。论文还报告学生的预测行人比例从 40.4% 降到 33.2%,与教师在行人样本上置信更低的观测一致,但没有随机掩码对照,因果链条留白。
哪些结论有边界,哪些验证还没有做?
论文明确列出多项边界。证据只限于 ASPED 一个校园、5 个折、二分类、单次运行,且未对多重比较校正。10 个检验中两个名义显著,但无一通过 Bonferroni 阈值 0.005。五折下精确双侧符号翻转检验的最小 p 值为 0.0625,因此作者优先看效应量与按折一致性,配对 t 检验只作补充。
方法边界包括门阈值 0.4 为实现默认值,未在折上调参;门的最优性在其他类别比例下未知;门的选择性与重加权没有分离;混合变体的余弦项不在标签平滑恒等式内;实验用加权交叉熵与不同温度,恒等式只是共享温度情形的刻画。这些缺项不是技术错误,而是复现与推广时必须补的验证。
推断边界是相关性不等于因果。教师在行人样本上置信更低、学生预测行人比例下降、操作点向多数类移动,三者一致,但没有随机掩码对照与因果干预。校准改善不等于检测改善,分辨率不变是关键反证。总体趋势也不等于每折每步都成立,论文用按折 ROC 与匹配误报率比较来避免把末步均值推广为全程结论。
要复现先固定什么,再跑什么?
先固定数据与划分。获取 ASPED v.a 5 个会话,用留 1 会话交叉验证,每折 4 个会话训练,一个会话测试。训练窗口 1 秒步长滑动,测试用非重叠 10 秒窗口,保证每个测试秒恰好预测 1 次。早停用训练会话内随机 10% 窗口划分上的宏准确率,报告指标只用留出会话。
再固定模型与损失。学生为冻结 VGGish 加单层四头 Transformer 加二分类头,逆频率批量采样加类别加权交叉熵,正权重 3.28。教师为冻结 Mask2Former 加冻结多层感知头,教师头按折只在训练会话拟合。蒸馏温度三,默认权重 1.0,信任过滤阈值 0.4,被屏蔽样本只保留交叉熵,空保留时蒸馏项置零。比较时只改损失与门,不改优化器、调度与结构。
代码可用性方面,论文给出仓库链接,资源状态显示当前可用,已公开。但可用不等于权重可下载或一键可运行,复现前应核对仓库中的数据准备、教师 logit 生成与按折脚本是否完整。若要补验证,优先加随机掩码对照以分离选择与重加权,再扫阈值与类别比例,最后报告匹配误报率下的召回与 F1,而不只报告 0.5 阈值下的均值。
何时值得尝试这种选择性监督,何时不必?
当任务极不平衡、教师在少数类上系统性不够确信、而你更在意多数类准确率与 F1 数值而非少数类召回时,这种向多数类移动的操作点可能有用。但若目标是把行人排在前面、提高 PR-AUC 或在固定误报率下提高召回,本文证据不支持抱太高期望。信任过滤更适合作为控制教师噪声的保守开关,而不是提升判别力的手段。
初学者容易产生的误解有三。其一,把宏准确率上升读成听得更准,实际上大部分可由阈值移动解释。其二,把概率校准改善读成检测改善,实际上分辨率未变意味着排序未变。其三,把教师高分读成学生理应高分,实际上跨模态共享信息、教师校准与学生容量都会截断传递。记住这三点,就能复述本文的中心判断,即选择性跨模态监督澄清了操作点移动与判别增益的区别,而没有证明更好的检测。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses