📄 Constrained Hebbian Learning Supports Efficient Representational Allocation under Structural Constraints

标签:#音视频理解 #多模态模型 #自监督学习 #理论分析 #音频理解

6.7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5

6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #多模态模型 | #自监督学习 #理论分析 | arxiv

👥 作者与机构

  • 第一作者:Patrick Inoue(KEIM Institute, Albstadt-Sigmaringen University, Germany; Department of Computer Science, Chemnitz University of Technology, Germany)
  • 通讯作者:Patrick Inoue(标注 ∗)
  • 作者列表:Patrick Inoue(KEIM Institute, Albstadt-Sigmaringen University, Germany; Department of Computer Science, Chemnitz University of Technology, Germany)、Florian Röhrbein(Department of Computer Science, Chemnitz University of Technology, Germany)、Andreas Knoblauch(KEIM Institute, Albstadt-Sigmaringen University, Germany)

💡 毒舌点评

本文引入了一个受约束的赫布学习框架来探讨神经表征的成本-性能权衡,这在概念上是值得肯定的。然而,其核心实验设置存在一个根本性问题:将预训练的大规模深度学习模型(MAE)提取的固定高维嵌入作为“高阶感官输入”来模拟生物神经系统的早期处理,这种模拟与真实生物系统“边学习边表征”的动态过程存在本质差异。论文将这种设置解释为“剥离低层特征提取的复杂性”,但在批评者看来,这更像是在一个已经被深度学习模型“咀嚼”和“结构化”过的、高度抽象的空间里进行局部学习的演练。其论证的核心——Hebbian规则在固定嵌入上能产生更高效的表征——能否推广到从原始感官流中学习,仍然是一个巨大的问号。此外,评估指标(VIB)本身的假设和局限(如高斯近似)也可能影响结论的普适性。总体而言,文章提供了一个精心设计的对比实验,但其生物合理性和现实意义有待商榷。

📌 核心摘要

本文研究了一种严格局部、兴奋性竞争性的赫布学习规则,能否在模拟神经解剖和代谢约束(如稀疏连接、非负权重)下,实现高效的突触资源分配。核心方法论创新在于提出一个两阶段评估协议:第一阶段,使用待评估的学习规则(赫布、反向传播BP、目标传播DDTP)训练多层感知机(MLP)编码器,并施加约10%的稀疏连接约束;第二阶段,冻结编码器,附加一个变分信息瓶颈(VIB)模块来评估所学表征的任务相关信息和压缩效率。实验在三个音视频基准(AVE, Kinetics-Sounds, VGGSound100)上展开,使用预训练的AudioMAE/VideoMAE模型提取固定嵌入作为输入。主要发现是,受约束的赫布学习规则所训练的表征,在保持与稀疏BP和DDTP具有竞争力的功能性分类准确率的同时,实现了更低的任务信息成本(CTI),即以更少的输入相关信息保留了相当水平的任务相关信息。这表明赫布学习改变了表征成本与预测性能之间的权衡关系,使其向更符合局部突触资源分配的方向移动,而非一味追求最高准确率。

🔗 开源详情

  • 代码与数据:论文本身未提供可执行的代码仓库。但论文提到,其所用数据预处理流程、预提取特征和数据划分来自参考文献[40]的项目仓库:https://github.com/weiguoPian/AV-CIL_ICCV2023。VIB模块的实现参考了[16]的演示代码:https://github.com/alexalemi/vib_demo。作者声称“所有其他组件、程序和分析都是独立开发的”。因此,完全重现本文实验需要基于公开的数据和VIB代码自行实现核心的学习规则、训练协议和分析流程,可复现性存在较高门槛。
  • 模型与数据集:未发布新的预训练模型。使用的是公开的AVE、Kinetics-Sounds、VGGSound数据集及其预处理后的特征。

🏗️ 方法概述和架构

本文的核心方法论框架旨在隔离并评估不同学习规则(尤其是受约束的赫布学习)在神经结构与代谢约束下,如何影响表征资源分配的效率。其整体架构设计基于一个受控的、两阶段的实验协议,旨在将表征学习过程与后续的信息瓶颈评估过程严格分离,从而清晰地揭示学习规则本身的内在特性。

整体流程概述 整个系统的处理流程可概括为:原始音频或视觉输入 → 预训练的上游特征提取器(生成固定嵌入) → 第一阶段:确定性MLP编码器训练(应用待评估的学习规则) → 稀疏化处理 → 冻结编码器 → 第二阶段:附加的变分信息瓶颈模块与新分类器训练(仅在冻结的表征上进行) → 最终输出:预测标签及表征效率指标。数据流清晰分为两个独立阶段:第一阶段关注在结构约束下如何学习表征,第二阶段则独立地评估该表征保留了多少任务相关信息以及其压缩效率。

核心组件详解

预训练的上游特征提取器 * 功能:为下游的表征学习实验提供统一的、高阶的感官输入。此设计固定了早期感官处理的影响,确保观察到的差异可归因于下游的学习规则本身,而非前端特征提取的偏差。 * 内部结构/实现:对于音频模态,使用预训练的AudioMAE模型提取512维嵌入;对于视觉模态,使用预训练的VideoMAE模型提取768维嵌入。原始音频/视频序列被分割成片段,每个片段独立通过对应编码器,最后在时间维度上进行平均池化,为每个样本生成固定的单向量表征。 * 输入输出:输入为原始音频波形或视频帧序列,输出为每个样本的定长特征向量,作为后续多层感知机的输入。

受约束的赫布学习规则 * 功能:作为核心的本地学习机制,在前馈的MLP隐层中实现突触可塑性,其目标是形成稀疏、非负、任务相关的表征,模拟生物神经元在代谢与结构约束下的资源分配。 * 内部结构/实现:该规则是Oja神经PCA规则的扩展。其权重更新公式为:Δw_ij = η z_j (x_i - Σ_k z_k w_ik)。此更新包含三个关键部分: * 输入项η z_j x_i,这是经典的赫布项,当预突触活动x_i与后突触激活z_j共同出现时增强突触权重w_ij。 * 竞争项-η z_j Σ_k z_k w_ik,该项实现了活动依赖的竞争与归一化。其中Σ_k z_k w_ik代表预突触神经元i的所有输出连接在后突触群体活动下的加权和,这引入了神经元间的侧抑制,迫使表征趋向去相关和低维。 * 非负约束:为模拟兴奋性神经元(遵循Dale定律),在每次权重更新后,将所有权重投影到非负象限:W ← max(0, W)。 * 关键设计选择与动机: * 非负性:直接对应于生物神经元的基本约束,即兴奋性神经元只释放兴奋性神经递质,从而限制网络的表征空间,促进稀疏性。 * 标准化:在输入隐层前,对预突触活动进行基于Z-score的标准化(公式8),确保输入零中心化,这对PCA类收敛至关重要。隐层激活则通过min-max重缩放至[0,1]区间,确保非负性和有界性,同时保持赫布更新的动态。 * 竞争机制:通过公式中的减法项引入竞争,这是实现表征高效分配(如主成分分析)的核心,驱使网络学习输入数据的主要方差方向,同时抑制冗余表征。 * 输入输出:输入为前一层的非负激活值x_i,输出为权重增量Δw_ij,用于更新突触权重。

多层感知机编码器 * 功能:作为表征学习的骨架,由多个隐层堆叠而成。在第一阶段,其权重根据特定的学习规则(赫布、BP或DDTP)进行更新。 * 内部结构/实现:采用标准的全连接前馈结构。实验中测试了两种架构:浅层网络(如两个隐层)和深层网络(如五个隐层)。在训练期间,每一层都应用前述的标准化、激活重缩放、以及特定于该层的学习规则更新。 * 输入输出:输入为上游提取的嵌入向量,输出为最后隐层的激活值h。在第一阶段结束时,此输出被冻结,作为第二阶段评估的对象。

变分信息瓶颈模块 * 功能:作为事后评估工具,附加在冻结的MLP编码器之后,用于量化所学表征中保留的任务相关信息量(I(Z;Y))以及表征成本(以I(Z;H)代理)。 * 内部结构/实现: * 随机编码器:将确定性表征h映射为一个对角高斯分布的后验q(z|h) = N(μ(h), diag(σ(h)^2))。其中均值μ(h)和尺度ρ(h)由一个可训练的线性层输出。标准差通过σ(h) = softplus(ρ(h) - 5.0)获得,初始偏移-5.0确保初始标准差较小,稳定训练。 * 重参数化技巧:通过z = μ(h) + σ(h) ⊙ ε(其中ε ~ N(0,I))进行采样,使得梯度可以通过随机节点反向传播。 * 解码器:通常是一个线性分类器,将采样得到的潜变量z映射到类别概率。 * 损失函数L_VIB = (1/N) Σ_n E_{z~q(z|h_n)}[-log q(y_n|z)] + β E_h[KL(q(z|h) || r(z))]。第一项是分类损失,第二项是信息瓶颈惩罚项,用KL散度近似互信息I(Z;H)。超参数β控制压缩与保留信息之间的权衡。 * 输入输出:输入为冻结的MLP最后隐藏层表征h,输出为采样的潜变量z,并由此产生预测ŷ

组件间的数据流与交互方式 系统的交互严格遵循两阶段隔离协议(如论文图1所示):

  1. 第一阶段(表征学习)

    • 输入数据(音频/视觉嵌入)流入MLP编码器。
    • 在每一隐层内,数据依次经过:标准化 → 线性变换 → 激活函数(并重缩放至[0,1])。
    • 基于该层的输入和输出,按照指定的学习规则(赫布/反向传播/DDTP)计算权重更新。
    • 对权重施加非负约束(对于赫布规则)。
    • 训练完成后,对网络连接进行稀疏化(如随机保留10%的连接)。
    • 最终,丢弃原始的分类头,冻结整个MLP编码器的权重。
  2. 第二阶段(信息瓶颈评估)

    • 将冻结的MLP编码器的输出h作为输入,馈送到新附加的VIB模块。
    • VIB模块的随机编码器将h转换为潜变量分布,并采样得到z
    • z被送入新的解码器(分类器)产生最终预测。
    • 在此阶段,仅更新VIB编码器和解码器(分类器)的参数,以最小化VIB损失L_VIB。MLP编码器的所有权重保持不变。

关键设计选择及其动机

  • 两阶段评估协议:这是方法论的核心创新。其动机在于彻底分离“如何学习表征”与“如何评估表征”两个问题。通过将学习规则用于第一阶段的表征形成,而将全局的、基于梯度的VIB优化仅用于第二阶段的固定表征评估,可以确保对赫布等本地规则的评估是公平且无混杂的。Top-1准确率和CTI指标均来自第二阶段,直接反映了所学表征的质量。
  • 固定上游嵌入:使用预训练的AudioMAE/VideoMAE生成固定嵌入,是为了创造一个受控的“高阶感官输入”环境,剥离低层特征提取的复杂性,从而更纯粹地研究下游联想可塑性机制。
  • 10%稀疏性约束:此设定基于大脑皮层连接密度的经验估计(约10%),旨在模拟生物神经系统的解剖约束。它迫使学习规则在极度有限的突触资源下工作,是检验其分配效率的关键条件。
  • 使用VIB而非直接熵计算:直接计算表征的熵或互信息通常是不可行的。VIB提供了一个可计算的、基于变分推断的上界,使得在实践中量化信息压缩和任务相关信息成为可能。将β作为可调节的超参数,允许系统性地探索压缩-性能权衡曲线。
  • 兴奋性约束与归一化:严格的非负权重和输入/激活的归一化是赫布学习规则稳定、收敛并产生有意义表征的必要条件。这些操作共同确保了学习动态类似于生物启发的Hebbian/PCA机制,而非普通的无约束神经网络训练。

💡 核心创新点

  1. 受约束赫布学习规则的提出与评估:将Oja的神经PCA规则扩展,并严格施加非负权重(模拟Dale定律)和竞争性归一化,形成一种用于在解剖和代谢约束下进行表征资源分配的局部学习机制。
  2. 两阶段隔离评估协议:创新性地将表征学习(第一阶段)与表征效率评估(第二阶段)分离。第二阶段使用变分信息瓶颈(VIB)对冻结的表征进行评估,确保了对不同学习规则(尤其是局部规则)评估的公平性和无混杂性。
  3. 任务信息成本(CTI)指标:引入并应用信息论指标CTI = I(Z;H) / I(Z;Y)作为表征成本的代理。该指标量化了在保留一定任务相关信息时,表征中冗余输入信息的比例,为在生物合理约束下比较学习规则提供了新的视角。
  4. 系统性控制变量实验设计:在严格匹配的架构(浅层/深层)、稀疏性(~10%连接)和评估流程下,将所提出的赫布规则与反向传播(BP)和目标传播(DDTP)进行比较,清晰地揭示了不同学习规则在成本-性能权衡空间中的不同位置。

📊 实验结果

本节在匹配的架构、稀疏性和评估约束下,对学习规则进行受控的机制比较。目标并非识别最强的音视频分类器,而是检验一种严格的局部可塑性规则是否改变了功能性能与表征成本之间的权衡。

下图展示了不同学习规则在任务相关信息与表征成本之间的核心权衡关系。

Figure 2: Task-relevant information I\u200b(Z;Y)I(Z;Y) versus representational cost I\u200b(Z;H)I(Z;H) for networks trained with DDTP, BP, and the Hebbian rule under study. Points are connected within each learning-rule trajectory according to increa

图中可见,Hebbian学习在更低的表征成本下实现了与BP和DDTP可比的任务相关信息,体现了更高效的资源分配。

为了实施这一研究,我们采用两阶段协议。第一阶段,根据待评估的相应学习规则训练MLP。第二阶段(后续阶段),在冻结的表征之上附加一个VIB模块。该阶段量化了当所学特征受到明确信息瓶颈约束时,能保留多少预测性能,而这独立于原始MLP训练。因此,Top-1准确率受限于冻结表征中可用的信息。我们将每个模型的结果解释为预测性能(以Top-1准确率量化)与表征成本(以CTI量化)之间的权衡空间中的一个点。这里,Top-1准确率提供了功能可行性的度量,而CTI量化了归一化的输入信息保留量,作为表征成本的代理。关键问题是,在匹配的架构和稀疏性约束下,一种严格的局部可塑性规则能否相对于参考模型改变这种成本-性能权衡。

为此,我们将Hebbian规则与两种参考模型进行基准测试:(1) DDTP [26],它实现了基于局部目标的无层级信用分配,无需对称权重传递。选择DDTP是因为它(i)提供了生物学启发的、逐层的学习规则,(ii)可扩展到适度深度的前馈架构并在生物启发算法中具有竞争力,(iii)其局部更新规则与稀疏化兼容,并采用重建损失以提高前向权重更新与逐层目标的一致性,使其可直接与本文研究的受控、可扩展训练协议进行比较;(2) 一个在相同MLP编码器和随机潜层(如第3.2节所述)上使用标准BP训练的参考模型,提供了预测性能的无约束上界。

下图进一步展示了Top-1准确率随层式幅度稀疏性的变化。

Figure 3: Top-1 accuracy after the Phase-2 VIB readout versus layer-wise magnitude sparsity for networks with five hidden layers trained with BP, DDTP, and the Hebbian rule. Each point corresponds to post hoc removal of the smallest absolut

图中显示,在较高稀疏性下,Hebbian模型对权重移除的敏感性较低,性能保持更稳定。

为了在更广泛的Hebbian学习背景下(包括Oja的归一化Hebbian规则及相关子空间学习变体)设定这些基准,已报道了多种扩展和相关方法。这些方法包括结合Hebbian突触和结构可塑性的无监督前馈模型[63],以及在深度反流联想网络中的有监督Hebbian学习[64]。经典的两阶段方案使用广义Hebbian规则来初始化内部表征,随后进行有监督训练[65]。更近期的混合方法将Oja规则与BP或相关误差驱动更新相结合,以稳定在线学习、保持激活范数并在更深的前馈或循环网络中维持更丰富的激活子空间[66]。这些研究表明,Oja相关学习可以支持多层有监督优化,无论是作为后续基于梯度微调的无监督初始化过程,还是作为误差驱动更新的辅助项。本工作研究的是一个不同的问题。我们并未将Hebbian规则用作后期基于梯度微调的预训练初始化器,也未将其与BP结合作为混合有监督更新。相反,我们将受约束的局部Hebbian规则作为主要的表征学习机制进行评估,然后应用事后VIB读出来量化任务相关信息和表征成本。

其他扩展包括包含卷积层的深层Hebbian架构,如FastHebb [67]、用于浅层网络的经典和赢者通吃(WTA)Hebbian规则[33, 68],以及现代自监督、对比和自蒸馏方法[69, 70, 71, 72]。总体而言,这些方法提供了相关背景,但它们并未提供用于隔离所研究机制的受控基线,因为它们要么将Oja相关学习用作初始化,要么将其与有监督的误差驱动更新相结合,依赖于卷积或自监督的架构先验,或者在相同的VIB读出下忽略了明确的表征成本分析。因此,我们使用一个定义明确的MLP骨干作为分析设计。这种有意简化的设置隔离了学习规则对突触资源分配的影响,同时最小化了额外架构先验的混杂因素。它实现了对突触资源分配和网络动力学的系统性机制研究,独立于架构复杂性。为了进行严格评估,除非另有说明,所有模型都在大约10%的突触连接率下进行评估,这与皮层连接的估计一致[3, 73]。我们还报告了一个密集BP模型,作为原始预测性能的无约束参考上界。

图2:由DDTP、BP和所研究Hebbian规则训练的网络的任务相关信息I(Z;Y)与表征成本I(Z;H)。各学习规则轨迹内的点根据增加的瓶颈强度连接。对于每条轨迹,点从上到下按β=0, 10⁻³, 10⁻², 10⁻¹排序,其中β=0表示没有VIB压缩惩罚的设置。y轴采用对数刻度。

图2总结了深度网络中任务相关信息I(Z;Y)与表征成本之间的权衡。具体来说,我们绘制了I(Z;Y)与表征成本代理I(Z;H)(Z与冻结MLP表征H之间的互信息)的关系图。这些量使用第3.2节中描述的基于KL的I(Z;H)代理和I(Z;Y)的变分下界进行估计。结果显示了在AVE、Kinetics-Sounds和VGGSound100数据集上音视频输入的结果。我们仅展示深度配置,因为它们在不同学习规则的压缩行为中表现出最清晰的分离。浅层网络遵循相同的定性趋势,为清晰起见被省略。非负约束BP仅针对VGGSound100包含在内。

在不同数据集和β值下,BP和DDTP通常达到更高的I(Z;Y),但这种性能伴随着更高的I(Z;H),表明它们的预测信息依赖于保留了更多输入相关信息的表征。相比之下,Hebbian训练的表征通常在更低的I(Z;H)下达到可比的I(Z;Y)水平,这意味着在相同架构和稀疏性约束下,具有更有利的信息效率权衡。最后,AVE和Kinetics-Sounds在所有方法中表现出更高的I(Z;Y)绝对值,这与这些任务相对于深度架构容量更简单一致,这降低了即使在更强的瓶颈正则化下丢弃任务相关信息的压力。

有趣的是,I(Z;Y)在中等瓶颈值(β)下最初会增加,然后在更强的压缩下下降。这种瞬态增加表明网络可以丢弃冗余或噪声信息,这与先前的观察一致,即中等瓶颈能改善泛化能力[16]。β的进一步增加,对应更强的瓶颈,导致DDTP和BP的性能迅速下降,因此这些操作点被排除在展示之外。

表1通过报告Phase-2 VIB读出后的Top-1准确率以及对应的任务信息成本CTI(跨数据集、架构和学习规则,在中间瓶颈设置β=10⁻²下),对图2进行了补充。选择此设置作为主要表格比较是因为它代表了感兴趣的压缩区间,同时为下游读出保留了足够的任务相关信息。密集BP通常具有较强的预测性能,但往往以更高的CTI为代价,尤其是在深度架构中。稀疏BP和DDTP在多个设置中仍具竞争力,尽管其信息成本在不同数据集和网络深度下变化相当大。相比之下,Hebbian训练的表征并不总是最大化Top-1准确率,但它们在浅层和深度架构中始终占据低CTI区间。这表明所提出的受约束Hebbian学习规则主要改善了表征成本概况,而非提供均匀的准确率优势。

表1:在AVE、Kinetics-Sounds和VGGSound100数据集上,使用浅层和深度架构,在β=10⁻²下,Phase-2 VIB读出后的Top-1准确率 [%] 和任务信息成本(CTI,无量纲)。结果报告为五次独立种子的均值 ± 标准差,除非以†特别指出。Hebbian方法遵循[22],DDTP遵循[26]。

AVEKinetics-SoundsVGGSound100
方法架构Top-1 [%]
标准 BP *浅层64.1±0.5
深层62.5±0.9344±21
BP浅层65.7±1.0
深层54.2±1.6344±25
DDTP浅层66.5±1.0
深层52.9±0.8161±10
BP (非负)浅层58.9±0.4
深层8.0±0.0
Hebbian浅层58.7±0.7
深层58.9±1.122±0
BP (非负)深层*
Skip Con.深层
*密集连接;所有其他方法使用稀疏连接。缺少的条目表示不可用或未定义的结果。†仅有一个有效运行;不报告标准差。

非负约束BP在浅层架构中显著降低了相对于标准BP的表征成本,并达到了与Hebbian规则相同的低CTI区间。然而,这种降低伴随着在Kinetics-Sounds和VGGSound100上更低的Top-1准确率,并且对应的深层非负BP配置产生随机水平的性能和未定义的CTI。因此,非负性可以在浅层网络中减少信息保留,但无法复现受约束Hebbian规则在不同架构中观察到的稳定准确率-成本概况。在评估的瓶颈设置中,Hebbian训练的模型因此在预测信息I(Z;Y)和编码器表征I(Z;H)的压缩之间表现出比标准BP、稀疏BP和DDTP更有利的权衡,同时其表征成本与浅层非负约束BP相当。

配对的种子级CTI分析支持了这一模式。在表1中数据集-架构条件匹配且CTI值有定义的情况下,稀疏BP和DDTP的CTI高于Hebbian模型,几何CTI比率分别为5.37和6.73。使用双侧Wilcoxon符号秩检验,两个对比在Holm校正后均显著(N=30, pHolm=3.73×10⁻⁹)。

表2:在VGGSound100数据集上,针对视觉(Vis)、听觉(Aud)和双模态(Bi)模态,使用深层MLP变体(五个隐藏层),在β=10⁻³, 10⁻², 10⁻¹下,Phase-2 VIB读出后的Top-1准确率 [%] 和任务信息成本(CTI,无量纲)。结果报告为五次独立种子的均值 ± 标准差,除非以†特别指出。Hebbian方法遵循[22],DDTP遵循[26]。

VisAudBi
方法Beta (β)Top-1 [%]
标准 BP *1×10⁻³37.5±0.4
1×10⁻²37.6±0.5382±16
1×10⁻¹35.6±0.5433±37
BP1×10⁻³33.2±0.4
1×10⁻²33.9±0.4206±5
1×10⁻¹31.6±0.5171±9
DDTP1×10⁻³34.3±1.0
1×10⁻²34.5±0.395±5
1×10⁻¹30.7±0.549±1
BP (非负.)†1×10⁻³33.2
Skip Con.1×10⁻²31.6
1×10⁻¹24.66
Hebbian1×10⁻³31.1±0.5
1×10⁻²31.5±0.331±1
1×10⁻¹29.9±0.216±1
*密集连接;所有其他方法使用稀疏连接。†仅有一个有效运行;不报告标准差。

这种模式在Top-1准确率在各方法间相似的配置中最为明显。在浅层VGGSound100设置中,密集BP、稀疏BP和DDTP分别达到紧密匹配的Top-1准确率62.8±0.7%、62.8±0.6%和62.7±0.5%,但在CTI上差异很大。密集和稀疏BP分别在26±2和25±2下运行,而DDTP需要100±6。Hebbian训练的表征在同一设置下达到60.7±0.4%的Top-1准确率,并保持在低CTI区间(CTI为21±2)。这些结果表明,几种学习规则可以支持可比的读出性能,但与该性能相关的表征成本存在显著差异。深层非负约束BP模型显示Top-1准确率严重下降,表明这种约束组合在相应的深层设置中不稳定。

表2提供了对深层VGGSound100设置中模态和瓶颈级别的对应分析。在不同β值下,双模态读出通常提供最强的Top-1准确率,而纯视觉和纯听觉条件则标识了每个感觉流的相对贡献。更高的双模态Top-1准确率并未伴随着在所示配置中CTI的均匀增加。在若干方法-β条件中,联合音视频读出在比单模态替代方案更低或可比的CTI下保留了任务相关的性能。这表明,组合表征可以利用互补的音视频信息,而不一定导致表征成本的成比例增加。

图2、表1和表2共同支持一个一致的解释。BP和DDTP可以保留高任务相关信息,但这通常伴随着更高的表征成本。Hebbian训练的模型倾向于在更低的CTI下保留任务相关信息,Top-1准确率的剩余差异取决于数据集、架构、瓶颈强度和输入模态。

表3:在β=0下,针对三个数据集(AVE、Kinetics-Sounds、VGGSound100)和两种神经网络架构(浅层和深层)具有密集或稀疏连接,在每种学习规则下评估的视觉(Vis)、听觉(Aud)和双模态(Bi)模态的Phase-2 VIB读出后的Top-1准确率 [%]。Hebbian方法遵循[22],DDTP遵循[26]。

方法架构AVE VisAVE AudAVE BiK-S VisK-S AudK-S BiVS100 VisVS100 AudVS100 Bi
标准 BP *浅层46.647.365.654.244.165.139.345.161.7
深层46.947.261.749.841.361.236.846.062.2
BP浅层49.047.563.952.342.959.538.643.361.9
深层35.936.853.347.441.961.333.442.457.9
DDTP浅层46.645.162.855.844.268.140.745.261.7
深层40.538.052.949.838.763.234.338.157.2
BP (非负.)浅层45.947.659.250.738.463.333.834.758.1
深层8.05.02.0
BP (非负.)深层*39.746.759.1
Skip Con.深层33.041.248.9
Hebbian浅层42.144.858.551.439.462.337.541.460.6
深层37.342.758.846.237.759.331.237.255.6
*密集连接;所有其他方法使用稀疏连接。缺少的条目表示不可用或未定义的结果。

图3: 在不同稀疏水平下,Phase-2 VIB读出后的Top-1准确率。所有模型在β=10⁻²下评估。虚线表示当前实验中应用的主要稀疏水平(约10%连接)。

论文给出了关于图3的分析:Hebbian训练的网络在高稀疏区间(连接率低于~10%)对后期权重移除的敏感性低于BP和DDTP,且无需重新训练。这种模式与以下解释一致:BP和DDTP更强烈地依赖于全局协调的突触配置来在权重稀疏化下保持预测性能。相比之下,Hebbian规则为将任务相关信息I(Z;Y)与一组高效的、局部分配的连接耦合提供了直接的局部机制。

表4:消融和控制实验。报告Phase-2 VIB读出后的Top-1准确率和任务信息成本(CTI,无量纲),除非另有说明,否则报告为五次独立种子的均值 ± 标准差。MNIST实验评估不使用预训练音视频嵌入的学习。VGGSound100 (VS100) 控制将受约束Hebbian模型与经典子空间学习基线、消融变体和一个10隐藏层深度缩放控制进行比较。

方法数据集稀疏Beta (β)Top-1 [%]CTI
BPMNIST1×10⁻²96.5±1.69.3±0.3
BP (非负.)MNIST1×10⁻²92.0±0.117.0±0.8
DDTPMNIST1×10⁻²94.4±0.39.4±0.4
Hebbian (Ours)MNIST1×10⁻²91.7±0.212.1±0.7
广义Hebbian算法 (GHA) [81]VS1001×10⁻²62.0±0.338.6±1.5
经典Oja子空间规则 [32]VS1001×10⁻²61.3±0.520.0±0.9
PCA-to-readoutVS1001×10⁻²67.8±0.8334.6±7.7
受约束Hebbian 无归一化/缩放VS1001×10⁻²59.6±1.022.3±1.2
BP (非负.) 带跳跃连接VS1001×10⁻²44.5†20.8†
深度缩放控制;Hebbian (Ours), 10 隐藏层VS1001×10⁻²7–10‡论文未给出具体数值
†仅有一个有效运行;不报告标准差。‡对于10隐藏层深度缩放控制,未获得稳定的多种子估计;该条目报告观察到的近似Top-1范围。

由于我们对AVE、Kinetics-Sounds和VGGSound100采用了[40]的预处理流程,他们报告的结果提供了自然的参考基准。在这些音视频数据集上基于准确率的比较很少,因为它们主要用于评估检索、字幕生成或对比表征学习,而不是严格的分类性能。遵循[40],我们将跨多种音视频类增量学习基线观察到的性能范围作为参考点。这些范围总结在[40]的表1中,包括LwF、iCaRL、SS-IL和AFC,准确率跨越42.4–74.04%(AVE)、41.18–73.06%(Kinetics-Sounds)和26.21–72.8%(VGGSound100)[82, 83, 84, 85]。[40]还报告了使用全数据集训练获得的理论上界,分别为76.85%、80.43%和78.63%。[86]提供了补充参考点,他们报告在VGGSound上使用大规模对比预训练,准确率从46.6%到75.4%不等。

我们的结果落在这些基准范围内,尽管它们仍低于全数据集上界。这与视觉和音频嵌入的时间聚合一致,后者减少了序列特异性信息,并且与稀疏化和局部学习施加的额外约束一致。然而,单模态和双模态的趋势在各数据集间得以保持,表明这些分析捕获了稳定的模态依赖结构,而非孤立的读出效应。

表4报告了额外的消融和控制实验,分离了预训练上游嵌入、经典子空间学习规则、归一化和缩放操作以及增加网络深度的影响。MNIST控制使用原始像素输入而不是预训练的音视频嵌入来评估相同的Phase-2 VIB读出流程。此实验测试当输入尚未被预训练的VideoMAE或AudioMAE编码器结构化时,是否也能获得紧凑的、任务信息丰富的中间表征。在此设置中,BP和DDTP达到了最高的Top-1准确率(分别为96.5%和94.4%)并产生了最低的CTI值(分别为9.3和9.4)。受约束的Hebbian模型也从原始像素形成了紧凑的任务信息表征,达到91.7%的Top-1准确率,CTI为12.1。非负约束BP达到了可比的Top-1准确率(92.0%),但CTI更高(17.0)。因此,MNIST控制表明,Hebbian规则可以在没有预训练上游特征提取器的情况下产生压缩的、任务相关的表征,而主要的音视频实验仍然集中在基于固定预训练嵌入的下游关联可塑性上。

VGGSound100控制将受约束Hebbian设置与经典子空间学习基线和消融变体进行了比较。广义Hebbian算法(GHA)[81]和经典Oja子空间规则[32]达到了有竞争力的Top-1准确率,表明经典子空间学习为此任务提供了强大的无监督参考点。PCA-to-readout基线在没有受约束Hebbian隐藏层学习规则的情况下,在相同的下游读出之前应用了显式的线性PCA投影。因此,它作为一个控制组,用于检验观察到的性能是否可以仅由经典的方差保持子空间压缩来解释。PCA-to-readout在这些控制组中达到了最高的Top-1准确率,但代价是大得多的任务信息成本。这表明,通过保留显著更多的表征信息,可以获得更高的预测性能。没有归一化和激活缩放的受约束Hebbian变体被评估为浅层网络消融,因为移除这些稳定操作在超过一个隐藏层时未能产生稳定的深层网络估计,这与先前的观察一致,即在没有稳定归一化机制的情况下,受约束Hebbian动力学对深度越来越敏感[22]。在这种浅层比较中,消融变体仍处于低CTI区间,但显示Top-1准确率略有下降。这表明归一化和缩放操作有助于在稀疏性和非负性约束下实现稳定的预测性能,而不仅仅是解释低任务信息成本。

10隐藏层深度缩放控制评估了受约束Hebbian设置是否可扩展到更深的架构。此配置未产生稳定的多种子估计,仅产生了低Top-1性能。此结果与先前的工作不同,后者表明当不施加明确的信息压缩目标时,相关的Hebbian机制可以可靠地扩展到10个隐藏层[22]。目前的控制因此表明,增加深度、随机编码器-解码器读出和基于VIB的瓶颈正则化的组合可以在读出之前逐渐移除任务相关信息。我们将此解释为当前压缩实现的一个限制,并证明当与明确的表征压缩结合时,显著更深的受约束Hebbian网络需要额外的稳定或架构机制。由于10隐藏层配置未能产生稳定的VIB读出且仅略高于随机水平,因此未对此控制解释CTI。

关键结论

综合表1、表2、表3和表4的数据,可以得出以下关键结论:

  1. 低表征成本:受约束的赫布学习规则在多个数据集(AVE, Kinetics-Sounds, VGGSound100)和架构(浅层、深层)下, consistently 实现了最低或接近最低的任务信息成本(CTI)。其CTI值显著低于稀疏BP和DDTP,并与浅层非负约束BP相当。
  2. 可接受的功能性能:尽管Hebbian学习并不总是产生最高的Top-1准确率,但在大多数评估设置下,它维持了功能性(通常远高于随机水平)的分类性能。其性能与稀疏BP和DDTP具有竞争力,在某些深层配置(如深层AVE)中甚至超过它们。
  3. 明确的权衡关系:结果并非显示Hebbian学习在所有情况下都提升准确率,而是表明它改变了表征成本与预测性能之间的权衡关系。在达到可比预测性能的同时,它倾向于使用更少的输入相关信息(更低的CTI)。
  4. 与非负约束的比较:非负约束BP在浅层架构中也能达到低CTI,但通常伴随着更低的准确率,并且在深层架构中性能崩溃。相比之下,Hebbian学习在评估的浅层和五层深度架构中保持了稳定的性能-成本概况。
  5. 模态与瓶颈效应:双模态(音视频联合)输入通常比单模态输入支持更高的准确率,且不一定导致CTI的成比例增加。随着信息瓶颈强度(β)的增加,所有方法的预测信息(I(Z;Y))先略微增加后下降,而Hebbian学习在强压缩下仍能保持相对较低的表征成本。
  6. 机制解释:Hebbian学习产生低CTI的表征,其机制与逐层的PCA-like表征重组和竞争性资源分配一致,这导致了稀疏、去相关且任务聚焦的潜码。

这些结果共同支持将Hebbian学习解释为一种用于突触资源分配的局部机制,而非一种最大化音频视觉分类准确率的通用策略。

🔬 细节详述

  • 预处理细节:采用[40]的特征提取流程,使用预训练的VideoMAE(768维)和AudioMAE(512维)模型。每个视频片段被处理为时序嵌入序列,并通过时间平均池化(公式7)聚合为定长的片段级表征。双模态输入通过在特征维度上拼接音视频嵌入得到(1536维)。
  • 训练超参数:Hebbian网络学习率5×10⁻⁵,BP网络1×10⁻³,DDTP网络1×10⁻²,均使用余弦衰减,训练500个epoch。Hebbian和非负BP网络使用1000个样本的类平衡批次,其他网络使用类大小两倍的批次。
  • VIB模块细节:随机潜变量维度K=256。标准差通过σ(h) = softplus(ρ(h) - 5.0)获得,初始偏移确保训练稳定。损失函数(公式6)中,分类项使用蒙特卡洛采样(S=12次)近似期望。解码器为线性分类器。
  • CTI统计检验:使用双侧Wilcoxon符号秩检验对log变换后的CTI比率进行配对比较,并使用Holm方法进行多重比较校正。几何CTI比率(公式11)报告为效应大小。

⚖️ 评分理由

  • 创新性 (1.5/2):提出受约束赫布学习规则和两阶段隔离评估协议,并引入CTI指标,在生物启发表征学习方法论上具有创新性。

  • 技术严谨性 (1.2/1.5):方法公式推导清晰且约束设计合理,但CTI作为生物成本代理的假设未经实验验证,存在一定理论简化。

  • 实验充分性 (1.0/1.5):在三个音视频基准上进行了系统实验,包含基线对比、消融和统计检验,但评估任务局限于分类且依赖预处理特征。

  • 清晰度 (0.9/1):论文结构清晰,方法描述详尽,图表和表格支持理解,但部分技术细节可能对非专业读者较难。

  • 影响力 (1.0/1.5):研究受生物启发的表征学习,对音视频理解有参考价值,但核心贡献偏向计算神经科学,对音频工程直接应用有限。

  • 开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。

  • 可复现性 (0.3/0.5):论文披露了关键超参数和训练协议,但硬件配置和完整代码实现细节未提供,可复现性一般。

  • 工程/实践价值 (0.8/1.5):研究强调生物合理性,但未与主流工程方法比较,对实际音视频系统部署的指导意义不明确。

🚨 局限与问题

  1. 模拟与生物现实的脱节:将预训练的深度神经网络(MAE)提取的嵌入作为“高阶感官输入”,是一种高度工程化的抽象,可能无法反映生物系统在发育和学习过程中同时进行特征提取和表征分配的真实情况。
  2. 评估范围的局限:所有实验均在音视频分类任务上进行,且依赖预处理好的特征。其结论在其他模态(如文本、本体感觉)或更复杂的行为任务上的泛化性未被验证。
  3. 深度扩展性问题:论文自身承认,所提赫布规则在10层深度的VIB评估下性能崩溃,表明其与明确的信息压缩目标结合时,深度扩展性不佳。
  4. 指标的生物相关性:CTI是一个信息论代理指标,其与真实生物代谢能量消耗的直接关联是理论性的、未经实验验证的。它忽略了神经计算中许多具体的生物物理成本。
  5. 与工程前沿的对比缺失:未与当前主流的模型压缩技术(如量化、剪枝、知识蒸馏)或高效架构(如MobileNet)进行比较,使得其在工程实践中的实际效用不清。
  6. 赫布规则的生物学简化:虽然考虑了非负性,但更新规则中的全局竞争项(求和 Σ_k z_k w_ik)的生物可实现性仍需更严格的论证,尽管论文讨论了可能的局部近似方案。

← 返回 2026-07-20 语音/音乐/音频论文速递