📄 video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

#音视频问答 #测试时自适应 #流式处理 #基准测试 #多模态模型

7.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5

7.3/10 | 前50% | #音视频问答 | #测试时自适应 | #流式处理 #基准测试 | arxiv

👥 作者与机构

  • 第一作者:Guangzhi Sun(清华大学、剑桥大学)
  • 通讯作者:Chao Zhang(清华大学,cz277@tsinghau.edu)
  • 作者列表:Guangzhi Sun(清华大学、剑桥大学)、Yixuan Li(剑桥大学)、Xiaodong Wu(剑桥大学)、Yudong Yang(剑桥大学)、Wei Li(字节跳动)、Zejun Ma(字节跳动)、Chao Zhang(清华大学)

💡 毒舌点评

这篇工作将Test-Time Training首次引入流式视频理解做长期记忆增强,确实聪明且有效,TTT_MEM在极低内存预算下碾压了传统token合并方法。但作为ICML投稿,实验规模偏小、训练和推理细节多处模糊,作者对ELViM基准的创建过程讳莫如深(人工审核标准、过滤比例等一概不提),这让整个benchmark的可信度打了折扣。

📌 核心摘要

  1. 该论文旨在解决流式长视频理解中,由于固定内存预算导致的累积信息丢失问题,特别是模型在长时间跨度上难以保持对早期内容的记忆。
  2. 核心方法是首次在流式视频LLM中引入Test-Time Training作为长期记忆机制,提出TTT_MEM层,通过快速权重更新将短期多模态表征持续转化为内嵌于模型参数的长期记忆。
  3. 与现有token合并或丢弃的流式方法不同,TTT_MEM新增了长跨度预测目标以强化长距依赖建模,辅以两阶段训练策略和模态感知的记忆读取机制,在不增加显存的同时保留了更完整的历史信息。
  4. 主要实验结果显示,在16k内存token设定下,video-SALMONN S在Video-MME长视频集上达71.3%(超过非流式基线的69.6%),在LVBench上达55.4%,在VideoEvalPro上达55.8%;在自建ELViM基准上,以46.7%的绝对准确率相比非流式基线提升14.2%,相比PEMF流式基线提升8.5%。消融实验中TTT_MEM在2k内存token时即达到与普通merging在16k token时相当的精度水平。
  5. 实际意义在于为需要长期连续运行的视频AI代理(如智能监控、教学辅助、远程协作)提供了更有效的记忆机制,同时不突破显存限制,为端侧部署长期视频理解提供了一种新范式。
  6. 主要局限性包括:ELViM基准仅包含约1000个目标视频,规模偏小且类别集中在生活技能类,泛化性存疑;训练和推理配置细节缺失较多,复现门槛较高;TTT_MEM目前仅处理视觉token,音频信息完全绕开,尚未充分利用多模态互补性。

🔗 开源详情

  • 代码:https://github.com/bytedance/SALMONN/tree/video-salmonn-S-MEM

  • 模型权重:论文中未提及

  • 数据集:论文提出的 ELViM 基准的问题与代码一同提供在代码仓库中;训练与评估所用其他数据集(如 LibriSpeech、CommonVoice、WavCaps、AudioCaps、FineVideo、CinePile、LLaVA-Video-178k、Video-MME、LVBench、VideoEvalPro、StreamingBench)均为已有公开数据集,论文中未提供新的下载链接。

  • Demo:论文中未提及

  • 复现材料:详细的训练配置(两阶段训练、学习率、GPU 数、批次大小、帧率设置等)在论文第 5 节和第 6 节中给出;补充材料中提供了代码与 ELViM 问题。

  • 论文中引用的开源项目:

    • Qwen3-VL:https://github.com/QwenLM/Qwen3-VL(模型基座)
    • Whisper-Large-v3:https://github.com/openai/whisper(音频编码器)
    • TTT(Test-Time Training):https://github.com/test-time-training/ttt(TTT-MLP 参考实现)
    • Mamba-2:https://github.com/state-spaces/mamba(对比实验)
    • ReTaKe / AdaReTaKe:https://github.com/ReTaKe(KV-cache 压缩基线)
    • MovieChat 及相关相似度合并、Flash-VStream、Dispider、StreamForest 等论文中的方法均引用原工作,但未提供新的项目级链接。
  • 补充链接(自动提取):

    • 代码仓库:https://github.com/bytedance/SALMONN/tree/video-salmonn-S-MEM),并在补充材料中提供代码和ELViM问题,这是一个明确的积极信号。然而,目前(基于论文文本判断)未见模型权重、训练配置文件、ELViM数据集下载链接、README或文档的描述,无法判断开源完整度。根据评分规则,有代码链接但文档完整性无法判断,给予0.5分(承诺部分开源或已开源但文档未知)。

🏗️ 方法概述和架构

video-SALMONN S的整体架构是一个流式处理系统,基于Qwen3-VL 8B构建。输入视频以固定帧率(如1 FPS)逐帧进入,首先经过视觉编码器和预训练的模态对齐模块投影到文本空间,得到视觉编码 \(X_t\)。随后,\(X_t\) 被送入核心的TTT_MEM层进行长期记忆整合,该层通过快速权重更新将历史信息内化到模型参数中。TTT_MEM的输出 \(Z_t\) 与历史内存token拼接后,经余弦相似度丢弃策略保持恒定内存占用,最终送入大语言模型生成响应。整个系统仅训练TTT_MEM层参数和LoRA适配器(秩128),其余部分冻结。对于文本和timestamp token等非多模态token,则绕过TTT_MEM并维持其原始相对位置。音频由Whisper-Large-v3编码器处理,经窗口级Q-Former对齐后,直接进入token丢弃阶段,不经过TTT_MEM层。图1展示了完整的系统流程。

TTT_MEM层是整个方法的核心。它包含一个以快速权重 \(W_t\) 参数化的MLP(2层全连接 + GeLU激活),配置为8个头,每头512维,对应16个512×512的快速权重矩阵。输入序列被划分为固定大小的mini-batch(每batch约12-16帧),按时间顺序依次处理。每收到一个新mini-batch \(X_t\),TTT_MEM执行两步操作:首先基于联合损失函数用梯度下降更新快速权重 \(W_{t-1} \rightarrow W_t\),然后利用更新后的权重生成输出token \(Z_t = f(\theta_Q X_t; W_t)\)。图2详细说明了这一权重更新与输出生成的过程。

快速权重的更新通过SGD单步更新完成(学习率 \(\eta\) 可训练),最小化一个联合损失函数 \(l(X_t, X_{t-T}; W_{t-1}) = l_{recon}(t) + l_{long-span}(t)\):

  • 多视图重建损失 \(l_{recon}(t) = \|f(\theta_K X_t; W_{t-1}) - \theta_V X_t\|^2\):将输入 \(X_t\) 投影到不同的key-query空间,要求MLP从key表示重建出value表示,强制模型学会保留当前输入的核心信息。
  • 长跨度预测损失 \(l_{long-span}(t) = \|f(\theta'_K X_t; W_{t-1}) - \theta'_V X_{t-T}\|^2\):要求MLP从当前输入 \(X_t\) 的key表示预测 \(T\) 步之前(默认 \(T=2\),对应2048 token间隔)的输入 \(X_{t-T}\) 的value表示,作为时间一致性正则项防止记忆覆盖。其中 \(\theta_K, \theta_V, \theta'_K, \theta'_V, \theta_Q\) 均为可训练的投影矩阵。

Token丢弃与内存管理:TTT_MEM输出 \(Z_t\) 后,将其与历史内存token \(\tilde{Z}_{t-1}\) 拼接得到 \(Z'_t \in \mathbb{R}^{(N+K) \times d}\)。然后丢弃 \(K\) 个与相邻token余弦相似度最高(\(\cos(Z'_{t,n}, Z'_{t,n+1})\))的token,保留 \(N\) 个token作为新的内存 \(\tilde{Z}_t\)。作者明确选择丢弃而非合并,以避免超长视频中的过度平滑问题,同时依赖TTT_MEM的快速权重状态保留已丢弃token的摘要信息。

两阶段训练方案:针对长序列训练导致GPU显存爆炸的问题设计。第一阶段(冷启动):TTT_MEM参数随机初始化,4 FPS采样率,最多1024帧,与LLM联合训练3个epoch(学习率 \(2 \times 10^{-5}\)),建立基本的快速权重更新机制。第二阶段(扩展):冻结TTT_MEM的所有静态参数 \(\theta\) 但保持快速权重更新规则,将上下文长度扩展到2048帧并增加内存token数量,训练额外1个epoch,进一步优化LLM从更大记忆中提取信息的能力。两阶段均使用FineVideo、CinePile和LLaVA-Video-178k视频数据。第一阶段耗时48小时,第二阶段16小时,均在32块H800 GPU上完成。

模态感知的记忆读取机制:将内存token \(\tilde{Z}\) 分割为大小为 \(m\) 的chunk(默认 \(m=8k\)),每层Transformer中迭代式地选择与问题最相关的KV对。每个chunk与prompt token拼接后送入self-attention,计算prompt对chunk内每个位置的平均注意力分数作为重要性指标。每层仅保留top-k(\(k=m\))个多模态token的KV对,非多模态token的KV对原样添加回来。最终LLM基于压缩后的KV缓存生成响应。此机制在少量额外推理时间(0.4秒)下显著提升了结果。

💡 核心创新点

  1. 首次将TTT用作流式视频LLM的长期记忆机制:此前TTT主要用于序列建模本身或在线适应局部变化,从未被用作视频理解中跨数小时的记忆整合工具。video-SALMONN S利用TTT将流式输入持续压缩进模型参数,为一个视频LLM提供了不依赖外部存储、不增加推理显存的长期记忆能力,本质性地改变了流式视频记忆的设计思路。

  2. 长跨度预测损失:标准TTT仅最小化当前输入的重建损失,难以在数千次更新后保留早期信息。提出的长跨度预测损失让模型在更新时不仅要记住当前内容,还要能预测较远过去的内容(\(T=2\) 为默认,对应2048个token间隔),作为时间一致性正则项有效防止记忆覆盖,实验证明在LVBench上相比无长跨度预测的TTT提升了约1个百分点。

  3. 两阶段训练策略:识别出长序列训练中TTT_MEM参数更新与显存之间的矛盾,通过第一阶段建立快速权重更新基础,第二阶段冻结静态参数仅训练LLM适配器来扩展上下文长度和记忆容量,使得在有限硬件上能扩展到2048帧训练,同时保持了快速权重更新的有效性。

  4. ELViM基准:不同于现有长视频QA基准(如LVBench、VideoEvalPro),ELViM首次显式评估流式视频LLM的“情节学习”能力——模型需在数十分钟前观看教学视频,之后在精确时间点回答“下一步做什么”之类的问题,更贴近真实AI代理的需求。其严格的数据创建流水线(问题过滤确保不可通过常识回答)为长期记忆评估提供了更有意义的测试基准。

📊 实验结果

主实验(16k内存token设定,所有模型使用相同Qwen3-VL 8B基座和训练数据):

模型Video-MME (S/M/L)LVBenchVideoEvalProELViMStreamingBench (R/O/C)
Qwen3-VL 8B (非流式)69.7 (80.7/68.3/60.1)47.454.928.161.8 (76.9/42.5/37.5)
video-SALMONN 2+ (非流式)75.6 (81.6/75.7/69.6)52.753.532.566.4 (77.7/57.5/41.0)
Similarity Merging (流式)75.8 (82.0/76.2/69.4)51.651.838.566.8 (78.1/59.5/39.2)
PEMF (流式)75.8 (82.7/76.1/68.6)49.550.438.267.1 (79.1/57.1/40.8)
AdaReTaKe (流式)76.1 (81.9/76.3/70.2)54.354.541.567.0 (78.9/57.0/40.8)
video-SALMONN S (无读取)76.4 (82.7/75.2/71.3)55.455.843.966.8 (78.4/57.5/40.9)
video-SALMONN S (有读取)76.9 (82.5/76.8/71.3)55.658.946.767.1 (78.9/57.5/41.5)

[表1]

video-SALMONN S在所有长视频基准(LVBench、VideoEvalPro、ELViM)上均取得最高,其中ELViM上相比最强流式基线AdaReTaKe提升5.2%,相比非流式基线的video-SALMONN 2+提升14.2%。在Video-MME长集上相比相似度合并提升1.9个百分点,在VideoEvalPro上相比AdaReTaKe提升4.4个百分点。在不需要长期记忆的StreamingBench上性能与基线持平,说明TTT_MEM不损害短期感知能力。

大内存设定(32k-128k内存token):

设定Video-MME长LVBenchVideoEvalProELViM
32k Mem w/o reading72.057.759.247.1
32k Mem w/ reading72.157.961.049.4
128k Mem w/o reading72.459.662.053.2
128k Mem w/ reading72.159.862.354.9

[表2]

随内存增长,所有基准持续提升,128k时ELViM达到54.9%,相比16k时提升8.2个百分点,展现了TTT_MEM的强扩展性。

消融实验(16k内存,无读取机制):

配置Video-MME长LVBenchVideoEvalProELViM
Similarity Merging69.451.651.835.4
K-means Clustering67.849.850.733.8
Similarity Discarding69.251.151.536.8
+ Mamba-270.353.554.839.6
+ TTT-video70.054.354.942.3
+ TTT_MEM w/o Stage 271.355.155.543.6
+ Stage 2 Training (完整版)71.355.455.843.9

[表3]

TTT-video相比Mamba-2性能更优,TTT_MEM在此基础上进一步提1-2%(主要来自长跨度预测),第二阶段训练主要提升长视频性能0.2-0.4%。Token丢弃与合并性能相当(69.2 vs 69.4),但TTT_MEM在相同丢弃方案下大幅领先(71.3 vs 69.2)。

内存效率对比:TTT_MEM在2k内存token时即在ELViM上达到约44%,与Merging在16k时的38.5%相当,内存效率提高8倍。在LVBench上,TTT_MEM在4k token时(~36%)即超过Merging在16k时的性能(32%),内存效率提高4倍。图3更直观地展示了这一内存效率优势。

长跨度预测的时序分析:在LVBench上,将查询与证据的时序距离分组后发现,有长跨度预测的TTT_MEM在各距离段均优于无预测版本,且差距在>5000秒时仍然显著(约48% vs 45%)。图4展示了该时序距离分析的结果。

推理效率:在1 FPS、最大3600帧设定下,video-SALMONN S(含读取)推理耗时10.9秒/样本(其中TTT_MEM仅占0.1秒,读取机制占0.4秒),峰值显存24.4GB,与Similarity Merging的24.1GB/10.4秒基本持平。

🔬 细节详述

训练数据:音频对齐器训练使用LibriSpeech 960小时、CommonVoice、WavCaps、AudioCaps。整个AV模型微调使用FineVideo、CinePile、以及LLaVA-Video-178k中采样的约100k视频。ELViM数据集从上传于2025年中后期的1000+教程视频中构建,涵盖15个类别,共1021个目标视频、1849个问题。图5展示了ELViM中的一个典型多模态问答示例,模型需要根据视觉和语音信息理解烹饪步骤。

损失函数:TTT_MEM层使用联合损失 \(l = l_{recon} + l_{long-span}\),其中 \(l_{recon} = \|f(\theta_K X_t; W_{t-1}) - \theta_V X_t\|^2\)(多视图重建损失),\(l_{long-span} = \|f(\theta'_K X_t; W_{t-1}) - \theta'_V X_{t-T}\|^2\)(长跨度预测损失,\(T\) 默认=2)。LLM的微调使用标准语言建模损失。

训练策略:第一阶段采用4 FPS采样率,最多1024帧,学习率 \(2 \times 10^{-5}\),训练3个epoch,耗时48小时(32×H800 GPU)。第二阶段扩展至2048帧,额外训练1个epoch,耗时16小时。每GPU每mini-batch仅1个样本。TTT_MEM使用SGD单步更新,学习率 \(\eta\) 可训练。LoRA秩设为128。图7展示了训练过程的loss曲线。

关键超参数:TTT_MEM MLP为2层FC+GeLU激活,8个头,每个头512维,16个512×512快速权重矩阵。内存token预算默认16k(其中1k用于实时感知),单chunk大小 \(m=8k\) 用于读取机制。长跨度预测 \(T=2\),对应2048个token间隔。视频处理1 FPS,360p分辨率,音频用Whisper-Large-v3编码。

训练硬件:32块H800 GPU,总计64小时(第一阶段48小时+第二阶段16小时)。

推理细节:流式处理,无beam search,未提及温度参数。PEMF对比使用原论文默认惩罚系数(0.4,0.4,0.2)。非流式模型使用最多10 FPS采样率和16k token上限。128k内存为单块H800 GPU上限。

正则化与稳定训练:未特别说明,TTT_MEM的LN和残差连接继承自(Dalal et al., 2025)的实现。

⚖️ 评分理由

  • 创新性 (1.5/2):将TTT引入流式视频LLM做长期记忆是个非平凡的insight——TTT此前从未被用于视频理解中的跨数小时记忆整合,论文清晰地阐述了它相比token丢弃/合并在保留长期信息上的本质优势(用参数状态保存摘要而非硬丢弃)。长跨度预测作为一个简单但有效的正则项,也体现了对记忆覆盖问题的深刻理解。不过,TTT_MEM的架构本身基本复用了已公开的TTT-MLP实现和标准的多视图投影,创新更多在于应用方式而非方法论本身的突破。
  • 技术严谨性 (1.0/1.5):方法推导基本正确,TTT_MEM的梯度更新过程描述清楚,长跨度预测作为正则项的理由充分。但存在若干技术与写作严谨性问题:(1)论文中关于内存token实际对应的视频时长/帧数的映射关系模糊,16k token对应215帧的描述过于简略,未见token数与视频持续时间的精确对应表;(2)余弦相似度丢弃策略的数学描述有不一致——公式说“选择余弦相似度最高的token丢弃”,但正文说“保留低相似度的”,虽然逻辑一致但表述需要统一;(3)deepstack embeddings的处理(附录E)缺乏深入理论解释,仅靠一次简单的对比实验就做了设计决策。
  • 实验充分性 (1.0/1.5):实验覆盖多个标准长视频基准(Video-MME、LVBench、VideoEvalPro)和流式专用基准(StreamingBench、ELViM),与多个流式和非流式基线做了公平对比(相同基座、相同训练数据),这一点值得肯定。消融实验系统地隔离了各种设计选择(TTT-video vs Mamba-2、有/无长跨度预测、有/无第二阶段训练、不同丢弃/合并策略)。主要缺陷:(1)ELViM缺少除论文作者外的第三方验证,且数据创建流水线的关键节(人工审核标准、过滤比例、合并视频中distracting内容的控制等)信息不足;(2)缺少在其他基座LLM(如LLaMA-Video)上的实验,无法判断TTT_MEM是否对特定LLM架构过拟合;(3)没有统计显著性检验或置信区间报告。
  • 清晰度 (0.8/1):整体组织结构合理,图1和图2对系统架构和TTT_MEM工作流有较好的可视化。但存在影响可读性的问题:(1)方法部分多处引用了其他工作(TTT-MLP、门控机制)的实现细节而不展开,增加阅读障碍;(2)内存token预算的表述不够严谨——16k token究竟对应多少秒/帧的信息需要读者自行推算;(3)ELViM基准创建的“人工校对”步骤描述极简,难以评估其质量控制水平。
  • 影响力 (1.0/1.5):作为多模态/音视频领域的工作,该论文直接面向音频-视频一体化理解场景(虽然音频处理的深度有限),在LVBench和ELViM上的显著提升有潜力推动流式视频LLM中记忆机制的研究方向。来自清华大学和字节跳动的作者阵容也增强了该工作的实际影响力。但存在限制因素:(1)ELViM作为自建基准,还需要时间被社区广泛接受;(2)方法主要是“将已知的TTT应用于视频LLM”而非开辟一个全新范式,对其他领域的直接推力有限;(3)论文缺乏在更实际场景(如监控、自动驾驶、远程医疗)的案例研究或demo,影响了实际应用的置信度。
  • 开源 (0.5/1.5):论文在脚注中提供了一个GitHub链接(https://github.com/bytedance/SALMONN/tree/video-salmonn-S-MEM),并在补充材料中提供代码和ELViM问题,这是一个明确的积极信号。然而,目前(基于论文文本判断)未见模型权重、训练配置文件、ELViM数据集下载链接、README或文档的描述,无法判断开源完整度。根据评分规则,有代码链接但文档完整性无法判断,给予0.5分(承诺部分开源或已开源但文档未知)。
  • 可复现性 (0.3/0.5):有些关键细节可从论文中提取(1 FPS、360p、16k token、TTT_MEM的8头512维、两阶段训练epoch数、学习率 \(2 \times 10^{-5}\)),但大量超参数未提供或模糊:(1)TTT_MEM中每个mini-batch的具体大小仅在正文说“约12-16帧”,且未解释在不同帧率/分辨率下如何处理;(2)余弦相似度丢弃的K值如何确定未说明;(3)长跨度预测的T值消融仅出现在附录表10,且只有最终准确率,无训练稳定性或其他指标的探讨;(4)ELViM数据过滤中使用的prompt、人工审核细则、合并视频构建算法细节等完全未公开。虽然有代码链接,但即使考虑代码公开,这些实验细节的缺失也会让独立复现变得困难。
  • 工程/实践价值 (1.2/1.5):该工作建立了一个完整的流式视频理解pipeline,从编码、记忆(TTT_MEM)、token管理、到最终解码的端到端设计清晰。TTT_MEM与现有工业级LLM(Qwen3-VL)的整合方式合理,不改变基座模型架构,仅增加轻量LoRA和TTT_MEM层,对工程部署友好。作为来自字节跳动的工作,其工程价值得到一定背书。扣分主要在于:(1)缺少推理速度、吞吐量、端侧适配的详细分析;(2)音频处理完全绕过TTT_MEM,音视频联合记忆的实际工程价值被削弱;(3)未深入分析不同硬件配置下的内存-精度tradeoff,缺乏工程上的全面优化指导。

🚨 局限与问题

论文明确承认的局限:

  1. 作者指出TTT_MEM目前仅处理视觉token,音频token绕过TTT_MEM直接进入token丢弃阶段,原因是音频token数量远少于视觉token(约1/75),但未深入分析这种设计可能丢失的跨模态长距记忆。
  2. 第二阶段训练的效果“modest”(0.2-0.4%提升),作者也承认其主要贡献在中长视频,但未解释为何在长视频上提升也有限。

审稿人发现的潜在问题:

  1. ELViM基准的领域偏差:ELViM的15个类别集中在生活技能类教程(烹饪、手工、园艺、汽车维修等),缺少需要专业长期记忆的场景(如医学手术、工业操作、科学研究流程),泛化性过于局限。图5中的示例正体现了这种偏向生活场景的特点。
  2. 音频完全绕开TTT_MEM的设计缺陷:在ELViM这类需要理解教学语言场景中,音频往往包含“关键步骤”、“注意事项”等核心信息,绕过TTT_MEM意味着这些信息在长期记忆中可能被严重压缩或丢失。论文未提供音频参与记忆的对比实验,难以证明“音频token数量少所以不需要TTT”这一假设的合理性。
  3. 长跨度预测T值的确定性过大:论文默认 \(T=2\) 并称其“最佳”,但表10显示 \(T\) 在1-32区间内准确率差异极小(Video-MME长:70.6-71.3,LVBench:54.5-55.4),几乎在噪声范围内,无法有力证明 \(T=2\) 的优越性。这个消融实际说明的是“跨步预测有一定帮助”而非“\(T=2\) 是最优的”。
  4. 两阶段训练的必要性质疑:如果第二阶段仅带来0.2-0.4%的提升,为什么要设计复杂的第二训练阶段?是否可以用更大的第一阶段直接到2048帧?论文未对比“只有第一阶段但扩展到2048帧”的结果,使得整个两阶段策略的性价比存疑。
  5. 与外部记忆方法的不公平对比:论文的流式基线选择了token合并/丢弃方法,但缺少与显式外部记忆检索方法(如ReKV、StreamMem)的对比。虽然ReKV在2.2节被提及,但6.1节基线只包含Similarity Merging和PEMF,排除了这条重要的基线轴线。
  6. 计算FLOPs对比不充分:附录D仅给了“TTT_MEM增加0.000235 TFLOPs”的对比,但对于推理延迟的实际影响(每帧处理速度、批处理能力、不同帧率下的扩展性)没有分析,这对流式系统的实际可行性至关重要。
  7. 推理时快速权重更新的数值稳定性:论文未讨论在数千步梯度下降下快速权重 \(W_t\) 是否会发散或收敛到平凡解,也没有展示 \(W_t\) 的范数或梯度范数随时间的统计信息。

← 返回 ICML 2026 论文速递