📄 Attend to Anything: Foundation Model for Unified Human Attention Modeling

8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1/1.5

🔥 8.2/10 | 前25% | #音视频理解 | #多模态模型 | arxiv

👥 作者与机构

  • 第一作者:Wenzhuo Zhao(四川大学计算机学院)
  • 通讯作者:Keren Fu(四川大学计算机学院,国家合成视觉重点实验室)
  • 作者列表:Wenzhuo Zhao(四川大学计算机学院)、Ronghao Xian(四川大学计算机学院)、Keren Fu(四川大学计算机学院,国家合成视觉重点实验室)、Qijun Zhao(四川大学计算机学院,国家合成视觉重点实验室)

💡 毒舌点评

本文以双曲空间层级蕴含与Fokker-Planck动力学统一图像、视频、音视频注意力建模,思路新颖且物理可解释性较强,在16个基准上刷出均6%的提升,并承诺开源代码和数据集,为该领域首个统一基础模型做出了有意义的尝试。然而,音频-视觉融合模块本质上是一个“视觉特工”,仅在语义相关时对视觉特征进行调制,对纯音频领域的借鉴价值极其有限;尽管有聪明的条件交换实验,但文本条件的设计仍依赖人工构建的数据集级提示,模型对真实开放世界中未见文本组合的泛化能力仍缺少系统压测,整体离“Attend to Anything” 的宏大叙事还有距离。

📌 核心摘要

论文旨在解决人类注意力建模(saliency prediction)因场景、模态、任务割裂而缺乏通用基础模型的问题。核心方法是将注意力差异定义为一种从通用倾向到具体任务的层级蕴含关系,并在双曲空间(Lorentz模型)中通过文本提示实现层级嵌入约束;视频动态则用Fokker-Planck方程统一为静态注意力的扩散演化,以物理驱动取代传统滑窗时空建模。相比现有参数隔离或多头微调方案,AAM在几何空间中显式编码层次语义,并通过算子分裂实现逐帧高效推断。实验在16个数据集上覆盖图像、视频、音视频,平均相对提升约6%,视频推理速度提升约4倍。主要实验结果如下:

DatasetMethodCC↑KLD↓AUC↑SIM↑NSS↑
MIT1003(图像)AAM0.8310.4460.9230.674
CAT2000(图像)AAM0.9060.2350.8900.769
SALICON(图像)AAM0.9250.1630.8760.819
DIEM(音视频)AAM0.7100.9192.88
Coutrot2(音视频)AAM0.8870.9717.46
DHF1K(视频)AAM0.5630.9190.4213.272
Hollywood2(视频)AAM0.7420.9440.5994.055

实际意义在于为注意力预测提供了第一个能跨模态、跨场景、跨任务统一迁移的基础模型,且推理高效。主要局限性是音频输入在模型中仅为轻量调制,未深度挖掘复杂声学场景,且文本条件依赖数据集级描述,对通用情况的泛化能力有待验证。训练数据存在显著的静态图像占比过高(88%)及由此可能引入的数据集偏差。

🏗️ 方法概述和架构

AAM整体是一个多模态基础模型,输入为图像/视频帧序列、可选音频流和文本条件提示,输出为注意力热图。其架构可概括为三阶段:编码→层次化约束与动态建模→解码。

编码部分:视觉编码器采用冻结的DINOv3(ViT-L)通过LoRA适应,输出视觉特征 v_img;文本编码器用冻结的CLIP ViT-L/14 得到文本嵌入 v_txt;音频编码器用Wav2CLIP将原始音频映射至与CLIP对齐的语义空间,得到 F_a。音频与视觉在空间上通过多头交叉注意力(MHCA)对齐,经由一个含可学习相关性门控的残差Tanh-FiLM机制进行特征级线性调制,并辅以“负样本攻击”策略(30%概率替换音频为噪声)和系数 L1 稀疏正则化,增强模型对无关音频噪声的鲁棒性。

层次化注意力建模:文本嵌入 v_txt 和视觉特征 v_img 被分别指数映射至Lorentz双曲空间 L^n_κ,得到 z_txtz_img。引入一个可学习的通用注意力锚点 z_anc,要求满足偏序关系 z_img ⪯ z_txt ⪯ z_anc。通过双曲蕴含锥定义角度约束,让特定条件(z_txt)的锥角被限制在通用锚点(z_anc)的锥内,从而将注意力从通用到具体的层级专化转化为可训练的几何约束。损失函数包含阈值化的蕴含角残差 L_ent*,推动子节点位于父节点的锥内。此设计将认知科学中由通用到具体的层级调制过程,实现为显式的几何约束。

Fokker-Planck Dynamics(FPD)模块:视频上,将每帧视觉编码器输出视为观察分布 u^obs_t,用Fokker-Planck方程 ∂u/∂t = −∇·(vu) + ∇·(D∇u) + λ(u^obs − u) 建模连续时空演化。其中,漂移项由双向时序自注意力参数化的 Markov 核实现,在全部时间维度上进行信息聚合;扩散项通过二阶中心差分平滑高频噪声,扩散强度可学习;校正项以可学习门控 λ_t 结合原始观测,类似卡尔曼增益,最后通过投影算子 P_proj 回到单形,保证概率性质(质量守恒)。整个动态过程采用Lie–Trotter算子分裂,顺序执行漂移、扩散、校正、投影,实现逐帧预测,支持任意长度视频,且在理论上证明了离散方案的数值稳定性。

解码部分:设计了一个几何感知的双曲解码器,将双曲空间中的条件深度(文本条件距原点测地距 r_txt)与方向信息映射回欧几里得注意力图。具体步骤为:(1) 利用测地距离 d_L(z_txt, o) 计算“专化深度”,通过Softplus函数得到调制强度 α(r_txt);(2) 通过一组多尺度算子 {S_k} 与可学习尺度锚点 µ_k,基于 z_txtµ_k 的距离进行加权融合,实现专化深度驱动的尺度调制;(3) 计算图像与文本嵌入在原点切空间的相对测地方向 ,以此引导像素级空间聚焦,文本条件锥角 ω(z_txt) 则调控聚焦温度;(4) 最终经残差调制与高斯偏置头生成注意力图。整个解码过程将双曲空间中的层级关系显式转换为对底层视觉特征的精细调制。

💡 核心创新点

  1. 注意力层级蕴含的双曲建模:将注意力差异从数据集偏差重定义成通用到具体的层级蕴含关系,使用Lorentz双曲空间中的蕴含锥进行几何约束。相比于过往的参数隔离或高斯先验隔离,引入了认知动机更明确的语义可解释、几何可优化的层级调节,并通过条件交换实验证实了模型对语义条件的高度敏感性。
  2. 基于Fokker-Planck方程的连续视频注意力动态:用漂移-扩散-校正的连续物理演化替代传统的固定窗口3D卷积或光流,算子分裂使得可进行任意长视频的逐帧高效推理(速度提升约4倍),并从理论上证明了离散方案的鞅不变性和稳定性,提供了更强的物理可解释性。
  3. 多模态统一的注意力基础模型框架:首次将图像、视频、音视频三种模态的注意力预测统一于一个端到端模型,并配备大规模标准化训练语料 Attention-1.75M,在各基准上平均提升6%,验证了统一训练带来的跨模态泛化增益。
  4. 鲁棒可学习音频-视觉门控融合:通过结合残差Tanh-FiLM、学习型模态门控(Sigmoid MLP)与负样本攻击及稀疏正则化,让音频仅在语义相关时自适应调制视觉特征,有效抑制无关噪声,在多音视频基准上取得显著提升。

📊 实验结果

论文在图像、视频、音视频三大类共16个数据集上对比了大量SOTA模型,均取得最佳综合性能。关键数字如下:

图像注意力(部分数据集):

DatasetMetricUNISALTransalNetSUMAAM (Ours)
MIT1003CC↑0.7340.7220.7680.831
SIM↑0.5970.5920.6300.674
CAT2000CC↑0.8420.8770.8820.906
SIM↑0.7210.7440.7540.769
SALICONCC↑0.8790.8900.9090.925
SIM↑0.7750.7830.8040.819
U-EYECC↑0.6960.7310.743
SalECICC↑0.7890.797

视频注意力:

DatasetMetricUNISALVSSMTFS-NetAAM
DHF1KAUC↑0.9010.9150.9120.919
SIM↑0.3900.3830.4120.421
Hollywood2AUC↑0.9340.9390.9340.944
CC↑0.6730.7290.7250.742
UCFAUC↑0.9170.9360.9300.943

音视频注意力:

DatasetMetricCASPDAVSTAVDiffAAM
DIEMCC↑0.6550.5800.6700.710
Coutrot2CC↑0.7880.7340.7980.887
SumMeCC↑0.4990.4230.5000.550

消融实验表明:层级双曲约束(+Hyp+Dec)相较单纯联合训练在多个数据集上提升显著(例如SALICON CC: 0.907→0.924),FP动态模块逐帧替代固定窗口持续提升DHF1K上的SIM等指标,全模态联合训练(AV+Video+Image)也优于单模态或双模态联合训练,验证了统一框架的增益。

归纳分析(以SALICON等例):

  • 条件交换:性能严格遵循 Correct > Generic > Wrong 的层级,证明模型对语义条件高度敏感。
  • 释义不变性:不同措辞的释义输入下,性能方差极小(CC标准差 < 0.01),表明模型捕获了语义而非词汇。
  • 文本粒度:随着文本提示从通用(G1)细化到详细上下文(G4),多数数据集性能单调提升,但任务驱动型数据集(如UCF)提升有限,符合其任务目标主导注意力的认知特性。

🔬 细节详述

训练数据:Attention-1.75M,整合8个图像、4个视频、6个音视频数据集,总量超175万注视点;图像分辨率统一重采样至448×448。数据集级文本提示按各自采集协议构建,分为四个粒度级别(通用→模态→意图→细节上下文),并提供了详细的标注质量控制和一致性分析。数据集存在严重的模态不均衡(静态图像占88%)和场景偏倚。

损失函数:综合损失 L_total = L_KLD − L_CC − L_SIM + L_HAE,其中 L_KLD 为KL散度,L_CC 为线性相关系数,L_SIM 为直方图交叠,L_HAE 为双曲层级蕴含损失:L_ent(z_anc, z_txt) + λL_ent(z_txt, z_img),蕴含损失基于角度残差的阈值形式。

训练策略:分阶段训练,前10轮仅用图像和视频数据(采样比4:6),之后加入音视频数据;优化器为AdamW,基础学习率5e-4,余弦退火至1e-5;batch size 32,BF16混合精度;LoRA秩r=32,alpha=64,作用于最后24个Transformer块;未使用梯度裁剪。

关键超参数:DINOv3 ViT-L为冻结backbone;双曲空间维度未指定;蕴含阈值因子η未公开具体数值;音频融合门控初始偏置-3.0;负样本攻击概率0.3。推理速度对比(img/s):TASED 17, STSANet 28, TMFI-Net 30, AAM 111。

训练硬件:华为Ascend 910B3 NPU ×4,64GB HBM,CANN 6.3.2,MindSpore框架。

推理细节:视频采取逐帧预测,FPD仅需当前帧及历史帧即可(实际支持任意长度),无需滑窗;图像/视频输入尺寸448×448;推理速度111 img/s,约4倍于固定窗口方法。

技术稳定性:FPD的投影操作强制输出为概率分布,保证了数值稳定和概率语义。附录C给出了离散FP动态的质量守恒和稳定性证明。

⚖️ 评分理由

  • 创新性 (1.5/2):将注意力差异提升为双曲空间中的层级蕴含关系,并引入Fokker-Planck方程统一静动态注意力,想法新颖、物理可解释,相比参数隔离类方法有本质突破。尽管各组件(双曲蕴含、FP动态)本身已有先例,但首次将它们有效组合于注意力建模并验证了跨模态统一增益,构建了首个统一基础模型,创新性显著。
  • 技术严谨性 (1.2/1.5):给出了FP离散化的质量守恒与稳定性证明,论述逻辑清晰。但双曲蕴含锥的阈值 η 等敏感超参数缺乏讨论和敏感性分析,音频融合模块的设计虽好但对其超参数(如门控初始偏置)的敏感度未作分析。
  • 实验充分性 (1.3/1.5):覆盖16个基准、多种模态,消融实验从联合训练、backbones、时间模块到双曲组件均较完整,还提供了条件交换、释义不变性、文本粒度等极具洞察力的归纳分析。但除了释义不变性外,未进行统计显著性检验或多次seed的误差分析,且对未见文本组合的泛化仅测了零样本和去文本情况,覆盖面略显不足。
  • 清晰度 (0.8/1):整体结构合理,图文并茂,核心公式解释基本充分。但部分符号定义(如某些场景下的 z)在不同模块间略有混淆,解码器中模块的数据流描述可以更精炼,附录信息量大但稍显冗长。
  • 影响力 (0.5/1.5):对视觉注意力预测社区是一个强有力的推动,其统一基础模型的理念和几何/物理驱动的范式对该领域未来发展有参考价值。然而,对语音/音乐/音频领域的直接影响极为有限,音频模块仅为辅助调制,难以成为该领域后续工作的核心支撑。
  • 开源 (1.5/1.5):论文在摘要和结论部分均明确承诺将公开代码、数据集及复现细节,并提供了GitHub仓库地址(https://github.com/wz-zhao/Attend-to-Anything),符合“承诺开源代码和数据集”的最高标准。虽然论文未提及公开预训练权重,但已承诺内容足以支持社区复现和持续研究,因此给予满分。
  • 可复现性 (0.4/0.5):训练超参数、数据集构成、分阶段训练策略、硬件平台及框架等关键细节均详细列出,附录提供了大量实现细节。少数核心超参数(如 η)未披露数值,但不影响整体复现,给该分数。
  • 工程/实践价值 (1.0/1.5):统一框架降低了多任务部署复杂度,仅21M可训练参数、约4倍视频推理加速,具备良好落地潜力。但论文未实际部署或测试其在真实应用(如人机交互)中的表现,且核心受益方主要在视觉领域,工程完整度尚待现实世界任务检验。

🚨 局限与问题

  1. 论文明确承认的局限:论文在“未来工作”中坦诚,文本条件目前主要依赖固定数据集标签或粗粒度描述,未来希望利用LLM生成更细粒度的开放词汇描述。
  2. 审稿人发现的潜在问题:
    • 音频部分深度严重不足:音频-视觉融合模块的设计虽然精巧,但其本质作用是作为视觉特征的“辅助调制器”。论文未探索音频自身如何独立驱动听觉注意力(如多声源定位),这严重削弱了其对音频/语音社区的吸引力,也使得“Attend to Anything”的标题在音频维度上显得言过其实。
    • 标题与模型能力脱节:“Attend to Anything”暗示了对任意条件、任意场景的强泛化能力。然而,模型严重依赖预定义的、与数据集协议紧密耦合的文本提示。文中并无实验证明模型能接受纯粹自由形式的、未见的长尾查询并产生合理注意图,这与其宏大愿景之间存在真实差距。
    • 训练数据偏差与公平性问题隐现:论文在附录中自我剖析了Attention-1.75M的数据偏差(88%静态图像、年龄/文化背景集中),但正文中没有将这些量化偏差与模型在特定人群、特定场景下的性能关联起来,未进行任何形式的公平性或偏差放大分析。
    • 计算与比较的公平性:AAM使用了强大的、冻结的DINOv3 ViT-L骨干,而对比的某些旧方法(如TASED)骨干网络更弱、更小。虽然论文在消融实验中包含了不同backbone的对比,但在主实验中,性能增益有多少仅仅来自更强大的预训练视觉骨干,与AAM方法论本身的贡献度需要更清晰地区分。
    • 长时间运动建模的潜在弱点:FP动态模块中的“校正项”直接混合了最初的静态特征 u_obs,这可能使得模型在剧烈镜头切换或长时间运动依赖的场景中,过度依赖单帧图像特征,而未能完全发挥FPD物理动态的潜力。该设计偏保守,更像一个智能的卡尔曼滤波器,而非纯粹的物理模型。

← 返回 ICML 2026 论文速递