📄 SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation

标签:#音视频理解 #多模态模型 #模型评估

7.7/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5

7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #多模态模型 | #模型评估 | arxiv

👥 作者与机构

  • 彭凯(Kai Peng):大连理工大学,happypk@mail.dlut.edu.cn
  • 申云哲(Yunzhe Shen):大连理工大学
  • 张淼(Miao Zhang):大连理工大学
  • 刘雷野(Leiye Liu):大连理工大学
  • 纪伟(Wei Ji):耶鲁大学
  • 李晶晶(Jingjing Li):卡内基梅隆大学
  • 朴永日(Yongri Piao):大连理工大学
  • 卢湖川(Huchuan Lu):大连理工大学

注:论文模板中包含对应作者标记,但正文未将标记映射到具体姓名,按“未明确标注”处理。

💡 毒舌点评

将Mamba动态步长调制与带时序/位置先验的最优传输匹配结合,是针对AVIS中模态状态突变和跨模态结构差异的一次有效“对症下药”,消融实验也较扎实地证明了各组件贡献。但方法过度依赖单数据集(AVISeg)验证,且仅50k步、batch size 1的训练设定与缺乏跨数据集的泛化佐证,使其SOTA声明的普适性仍需打上问号——尤其摘要中的+3.76/+2.75/+2.58是相对旧基线AVISM而非最强基线ACVIS(后者增益仅+1.70/+2.15/+0.94)。

📌 核心摘要

本文提出SAMOT,一个面向音频-视觉实例分割(AVIS)的端到端框架,核心贡献在于两个模块:(1)自适应动态步长调制(ADSM),利用时序变化量、跨模态差异量和历史上下文动态调节Mamba的步长,以平衡长序列建模的稳定性与模态状态突变时的快速响应;(2)基于最优传输的匹配调制(OT-MM),将音频查询与视觉查询的实例级关联显式建模为带相对位置先验(RPP)与时间一致性先验(TCP)的熵正则化最优传输问题,并用对数域Sinkhorn求解,同时引入MMD多核正则化约束跨模态特征分布。在AVISeg基准上,标准设置下较AVISM提升+3.29 FSLA、+0.85 HOTA、+2.28 mAP;在MS-COCO预训练设置下较AVISM提升+3.76 FSLA、+2.75 HOTA、+2.58 mAP,较最强基线ACVIS提升+1.70 FSLA、+2.15 HOTA、+0.94 mAP。论文提供了定性可视化、模块消融与效率分析,验证了ADSM与OT-MM在长视频、多实例和复杂模态状态变化场景中的有效性。

🔗 开源详情

论文明确声明“The code and model are available at https://github.com/happylife-pk/SAMOT”。

  • has_code: 是
  • has_model: 是
  • has_dataset: 未说明(使用第三方公开的 AVISeg 基准,具体获取方式见原基准论文)
  • 代码语言、框架版本:未披露
  • 模型权重:已声明提供模型,但具体权重文件格式与下载方式未披露
  • 许可证:未披露
  • 复现所需数据:需通过原 AVISeg 基准论文渠道获取,作者未在本文中打包发布

🏗️ 方法概述和架构

本文提出的 SAMOT 框架以端到端可微的方式联合解决音频-视觉实例分割(AVIS)中的两大核心挑战:一是长视频序列中复杂模态状态变化对长期建模的干扰,二是音频与视觉模态之间固有的结构性与分布性差异所导致的实例级关联不精确问题。如图 2(a) 的整体架构所示,模型的输入为一段包含 \(T\) 帧的 RGB 视频序列 \(V \in \mathbb{R}^{T \times 3 \times H \times W}\) 以及同步对应的音频片段,输出为视频中正在发声的目标实例的像素级分割掩码、语义类别标签以及跨帧的实例轨迹。整个处理链路可划分为“双流特征提取 → 帧级定位 → 视频级跨模态匹配 → 层次化时序追踪”四个主要阶段,下面逐层展开。

下图展示了SAMOT的整体架构。

Figure 2. Overall architecture of SAMOT, including ADSM step modulation, OT-MM audio-visual matching, and hierarchical temporal tracking.

图中详细呈现了双流特征提取、帧级定位、视频级跨模态匹配和层次化时序追踪的完整流程。

(一)双流特征提取与输入表示

在视觉流中,每一帧图像首先被送入一个以 ResNet 为骨干网络的视觉编码器,以提取多尺度空间特征。骨干网络产生层次化的特征图后,进一步由一个像素解码器(Pixel Decoder)进行细化,最终生成高分辨率的分层视觉嵌入 \(F_v = [f_v^1, f_v^2, f_v^3, f_v^4]\),其中 \(f_v^i \in \mathbb{R}^{T \times C \times H_i \times W_i}\) 表示第 \(i\) 个尺度阶段的特征张量,\(H_i \times W_i\) 为该阶段的空间分辨率。这四个尺度的特征分别承担不同粒度的语义信息:低层特征包含丰富的空间细节和高频边界信息,适合精确的掩码预测;高层特征具有更大的感受野和更强的语义抽象能力,适合目标定位与实例判别。

在音频流中,原始音频信号首先被转换为单声道 mel 频谱图(Mono Mel-Spectrogram),随后由一个在 AudioSet 上预训练的 VGGish 模型编码为音频特征序列 \(f_a \in \mathbb{R}^{T \times C_a}\),其中 \(C_a\) 为音频特征的通道维度。VGGish 作为在大型音频语料上预训练的固定特征提取器,能够提供鲁棒的音频语义表示,其输出按时间步与视频帧对齐,从而支持后续的跨模态时序建模。

(二)帧级定位:双分支协同与 ADSM 动态步长调制

基于 \(F_v\) 和 \(f_a\),帧级定位器沿两个互补分支并行工作。第一个分支处理视觉侧的模态条件化:将音频特征注入到较低三个视觉尺度 \([f_v^1, f_v^2, f_v^3]\),使视觉特征携带声音线索,从而得到音频条件化的视觉特征 \([f_{av}^1, f_{av}^2, f_{av}^3]\)。这些音频条件化特征并非简单拼接,而是经过本文提出的核心组件之一——自适应动态步长调制(ADSM) 处理后输出的。具体地,音频特征 \(f_a^t\) 与第 \(i\) 个尺度的视觉特征 \(f_v^{i,t}\) 通过下式融合:

\[ f_{av}^{i,t} = f_v^{i,t} \odot \left[1 + \tanh\left(\mathrm{CrossAttn}(f_v^{i,t}, f_a^t)\right) \cdot \alpha\right] \]

其中 \(\odot\) 表示逐元素乘法,\(\alpha\) 为控制跨模态融合强度的可学习缩放参数。ADSM 的引入基于一个关键观察:传统的 Mamba 模型采用固定的步长(step-size)来更新状态空间,这无法适应视频中目标发声状态随时可能发生变化(例如说话人切换、目标移出画面又返回、静音片段与多声源片段交替出现等)的动态特性。固定步长在状态稳定时容易造成冗余计算,在状态突变时又因反应迟钝而导致跟踪漂移。

ADSM 的内部机制如图 2(b) 所示。首先将音频线索融入视觉特征,形成融合后的跨模态状态表示;然后通过一个状态感知分支来估计两个关键信号——时序变化量 \(s_{\text{modality}}\) 和跨模态差异量 \(s_{\text{diff}}\)。时序变化量刻画当前帧与历史帧之间在视觉外观和声音特征上的变化剧烈程度,用于判断当前片段是处于稳定状态还是正在经历模态状态转换;其计算采用 Max 范数形式:

\[ s_{\text{modality}} = \frac{\max\left(\|f_{av}^t - f_{av}^{t-1}\|_\infty, \|f_v^t - f_v^{t-1}\|_\infty\right)}{\max\left(\|f_{av}^t\|_\infty, \|f_v^t\|_\infty\right)} \]

跨模态差异量则度量音频线索与视觉线索在同一时间步上的语义一致性,因为当发声目标变化时,音频与视觉的对应关系通常会发生显著偏移。这两个信号共同构成对当前模态状态的判断依据。在此基础上,Delta 门控路由器(Delta Gating Router, DGR) 被用来自适应地融合来自当前视觉特征、音频特征和历史上下文信息的三种线索,从而输出一个步长偏移量。DGR 首先由视觉分支 \(\delta_v\)、音频分支 \(\delta_a\) 和历史分支 \(\delta_h\) 分别计算各自线索,其中历史分支的输入来自上一帧的音频条件化视觉特征与音频特征之和;然后通过 softmax(MLP([s_diff, s_modality])) 得到三个分支的权重 \(\lambda_v, \lambda_a, \lambda_h\),最终加权融合得到偏移量 \(d = \lambda_v \delta_v + \lambda_a \delta_a + \lambda_h \delta_h\),并调制基础步长:

\[ \Delta = \Delta_0 + d \]

调整后的 \(\Delta\) 被直接注入选择性状态空间机制的离散化步骤中,从而调节 Mamba 状态更新速率。在模态状态稳定时步长较大、状态更新平缓,以维持长程建模的稳定性;在检测到状态突变时步长减小、状态更新加速,使模型能够迅速响应发声目标的切换。经过 ADSM 处理后的输出即音频条件化视觉特征 \([f_{av}^i]_{i=1}^3\),这些特征对模态状态变化具有更高的敏感性。ADSM 的一个关键设计动机在于:在长视频序列中,既不能为了追求响应速度而牺牲全局建模的稳定性,也不能为了保持稳定而忽略对短时突变的感知。传统的 Transformer 采用固定步长的注意力计算,Mamba 系列也默认使用固定步长,二者都无法根据输入内容动态调整信息更新的粒度。ADSM 通过引入数据依赖的步长调制机制,使模型能够在单一框架内同时实现“稳定长程传播”和“快速状态响应”这两个看似矛盾的目标。

第二个分支处理音频侧的查询构造与高层视觉语义关联:音频特征 \(f_a\) 被投影为查询嵌入(query embeddings),并与最高层视觉 token \(f_v^4\) 进行关联,从而形成音频查询 \(q_a \in \mathbb{R}^{T \times N_a \times C}\),其中 \(N_a\) 为音频查询的数量。高层视觉特征 \(f_v^4\) 具有最丰富的语义信息,将其与音频查询关联可以为每个潜在声源实例生成相应的查询表示。随后,Transformer 解码器以音频条件化视觉特征 \([f_{av}^1, f_{av}^2, f_{av}^3]\) 和音频查询 \(q_a\) 作为输入,通过标准的多层交叉注意力机制和自注意力机制迭代细化查询表示,最终输出实例级的视觉查询 \(q_v \in \mathbb{R}^{T \times N_v \times C}\),其中 \(N_v\) 为帧查询的数量。这些视觉查询 \(q_v\) 可以被理解为“每个潜在目标实例在当前帧的语义位置编码”,它们将通过后续的追踪模块被关联为跨帧的实例轨迹。这里采用 Mask2Former 风格的查询学习范式,使得查询能够显式编码实例级的语义信息,为 AVIS 所要求的实例区分提供基础表征。

(三)视频级跨模态匹配:OT-MM 最优传输调制

在获得音频查询 \(q_a\) 和视觉查询 \(q_v\) 后,模型面临的关键问题是如何在实例级别准确地建立二者的对应关系。由于音频特征和视觉特征来自异构模态,二者的特征分布存在显著差异——音频查询更倾向于编码声学属性(如音色、音高、节奏),而视觉查询更倾向于编码空间外观(如颜色、形状、纹理),这种分布差异导致简单的余弦相似度或点积注意力无法可靠地完成匹配。为此,本文提出第二个核心组件——基于最优传输的匹配调制(OT-MM),其结构如图 2(c) 所示。

下图展示了OT-MM处理前后的跨模态特征分布。

Figure 5. Cross-modal feature distributions before and after OT-MM; the matched audio and video embeddings show stronger overlap after matching.

处理前,音频与视频特征分布存在明显差异;处理后,匹配后的音频特征与视频特征在分布上高度重叠,表明OT-MM有效缩小了模态间隙。

OT-MM 将跨模态匹配形式化为一个最优传输问题。具体而言,设 \(q_a^t \in \mathbb{R}^{N_a \times C}\) 和 \(q_v^t \in \mathbb{R}^{N_v \times C}\) 分别表示时间步 \(t\) 的音频和视频嵌入,目标是寻找一个软传输计划 \(M^t \in \mathbb{R}^{N_a \times N_v}\),使音频查询到视觉查询的分配总代价最小。与传统最优传输仅使用成对匹配代价不同,OT-MM 创新性地在代价矩阵中融入了两个先验约束。

第一个先验是相对位置先验(Relative Positional Prior, RPP)。在实例级关联中,空间位置信息是极其重要的线索——同一个发声目标在相邻帧中往往出现在相近的空间位置,因此音频查询与视觉查询之间的相对位置偏差应该被纳入匹配代价的考量。具体地,假设特征经过 \(\ell_2\) 归一化后,代价矩阵 \(C^t \in \mathbb{R}^{N_a \times N_v}\) 的第 \(i\) 行第 \(j\) 列元素定义为:

\[ C^t_{i,j} = (1 - \langle q_a^t[i], q_v^t[j] \rangle) + \beta \frac{|i - j|}{\max(N_a, N_v)} \]

其中 \(\langle \cdot, \cdot \rangle\) 表示内积相似度,第一项度量特征间的语义差异(通过余弦距离衡量),第二项则通过查询索引之间的归一化距离施加位置惩罚,超参数 \(\beta\) 控制位置先验的强度。RPP 的核心作用是:当两个候选匹配在语义特征上相近但在空间位置上相距甚远时,模型会更倾向于选择空间位置上更合理的匹配,从而有效防止音频信号被错误匹配到视觉上嘈杂或同质化的背景区域。

第二个先验是时间一致性先验(Temporal Consistency Prior, TCP)。AVIS 中的目标身份在时间维度上具有连续性——当前时刻建立的匹配关系应与相邻时刻保持一致,而非随机跳变。TCP 通过在相邻时间步之间传递和约束传输计划的相似性来实现这一目标,具体方式为:在时序上逐步迭代执行最优传输,使每一步的传输计划都以相邻帧的传输计划为先验参考,从而建立起局部到全局的时间一致性。这一设计确保建立的实例级对应关系在时间维度上是平滑的,避免了因单帧匹配错误而导致的身份切换或轨迹碎片化。

在求解方面,OT-MM 采用对数域 Sinkhorn 算法(log-domain Sinkhorn algorithm)对带熵正则的最优传输问题高效求解。具体地,给定代价矩阵 \(C^t\) 和熵正则化参数 \(\epsilon\),构造对数域核矩阵:

\[ \log K^t = -\frac{C^t}{\epsilon} \]

随后交替迭代更新音频侧和视觉侧的双重缩放变量 \(f_i\) 和 \(g_j\),经过 \(L=10\) 次迭代后得到收敛的对偶变量 \(f_i^{(L)}\) 和 \(g_j^{(L)}\),最终通过:

\[ M^t_{i,j} = \exp\left(f_i^{(L)} + g_j^{(L)} + \log K^t(i,j)\right) \]

将对数核映射回概率单纯形,得到最终的软传输计划 \(M^t\)。选择对数域 Sinkhorn 而非原始 Sinkhorn 的关键原因是数值稳定性:当熵正则参数较小时,原始域的指数运算容易出现数值溢出或下溢,而对数域迭代通过加法替代乘法、通过对数-指数运算的等价变换来保证中间变量的范围可控,从而确保整个优化过程数值稳定且梯度可以连续回传。最终的匹配后音频表示通过一个可微的传输操作得到:

\[ \tilde{q}_a^t = (M^t)^{\mathsf{T}} q_a^t \]

即音频查询按传输计划加权投影到视频嵌入域,形成与视觉查询在语义和结构上对齐的匹配后音频查询 \(\tilde{q}_a\)。这一操作的意义在于:传输计划矩阵 \(M^t\) 本质上是一个软对应关系矩阵,它不只选择单一最佳匹配,而是以概率分配的方式将每个音频查询的信息分散到多个相关的视觉查询上,这比硬匹配更加鲁棒,也更适合多实例场景中音频与视觉并非严格一一对应的实际情况。

然而,即使经过最优传输匹配,跨模态的特征分布差异仍然可能存在残余。为了进一步压缩模态间隙、增强分布层面的一致性,OT-MM 引入最大均值差异(Maximum Mean Discrepancy, MMD)正则化。MMD 是一种基于再生核希尔伯特空间(RKHS)的分布距离度量,其核心思想是:如果两个分布相同,则它们在 RKHS 中的均值嵌入也相同。具体而言,MMD 损失定义为:

\[ \mathcal{L}_{\mathrm{MMD}} = \frac{1}{N_a^2}\sum_{i=1}^{N_a}\sum_{i'=1}^{N_a} k(\tilde{q}_a^t[i], \tilde{q}_a^t[i']) + \frac{1}{N_v^2}\sum_{j=1}^{N_v}\sum_{j'=1}^{N_v} k(q_v^t[j], q_v^t[j']) - \frac{2}{N_a N_v}\sum_{i=1}^{N_a}\sum_{j=1}^{N_v} k(\tilde{q}_a^t[i], q_v^t[j]) \]

其中核函数 \(k(x, y)\) 采用多核高斯函数:

\[ k(x, y) = \frac{1}{|S|}\sum_{\sigma \in S} \exp\left(-\frac{\|x - y\|_2^2}{2\sigma^2}\right) \]

多核带宽集合设为 \(S = \{0.1, 1.0, 10.0\}\),分别捕捉不同相似度尺度下的分布差异:小带宽对局部细节差异敏感,大带宽对全局分布偏移敏感,多核组合能够在多个尺度上同时约束分布对齐。这一设计使 OT-MM 在最优传输显式匹配的结构层面之上,又增加了隐式的分布对齐约束,形成一个完整的“显式对应 + 隐式分布”双通道对齐机制。MMD 正则化在整个训练过程中与主损失协同优化,确保匹配后的特征分布不仅在语义上对齐,在统计分布上也趋于一致。

OT-MM 的设计动机源于以下考量:传统跨模态匹配方法多为隐式对齐——通过交叉注意力或对比学习在网络的深层隐式地学习模态间的对应关系。这些方法虽然在缓解语义鸿沟上取得了一定进展,但它们并未显式地对齐两个模态各自的实例化结构关系,忽略了结构性和时序相关性。例如,交叉注意力虽然能够根据相似度加权聚合信息,但当模态差异较大时,其注意力权重可能被噪声主导;对比学习则侧重于拉近正样本对、推开负样本对,缺乏对空间结构和时间结构这些几何先验的建模。相比之下,最优传输天然是一个分配问题:它显式地寻找一个最小代价的匹配方案,天然适合实例匹配的场景。在此基础上融入 RPP 和 TCP 两个先验,使得匹配不仅考虑了特征相似性,还兼顾了空间位置关系和时间连续性,从而在多实例、复杂背景的长视频场景中实现更精确的实例级跨模态关联。

(四)层次化时序追踪器(Hierarchical Temporal Tracker)

完成跨模态匹配后,模型需要将帧级实例查询关联为跨帧的实例轨迹。为此,本文设计了层次化时序追踪器,如图 2(d) 所示。其结构分为两级:局部窗口精炼和全局序列建模。

在局部精炼阶段,追踪器采用滑动窗口机制,窗口大小设为 \(w=3\)。每个局部窗口覆盖帧区间 \([t, t+w-1]\),提取对应的视觉查询 \(q_v^{t:t+w-1}\) 和匹配后的音频查询 \(\tilde{q}_a^{t:t+w-1}\)。在窗口内部,首先通过双向扫描的 Mamba 块对序列进行局部时序建模:定义 \(M_v\)、\(M_a\)、\(M_{av}\) 分别为作用于视觉查询、音频查询和融合查询的 Mamba 块。局部精炼的计算过程为:

\[ q_{av}^{t:t+w-1} = M_v(q_v^{t:t+w-1}) \odot M_a(\tilde{q}_a^{t:t+w-1}) \]

\[ \hat{q}_{av}^{t:t+w-1} = M_v(q_v^{t:t+w-1}) + M_a(\tilde{q}_a^{t:t+w-1}) \]

\[ \tilde{q}_v^{t:t+w-1} = \sigma(\mathrm{GAP}(M_{av}(q_{av}^{t:t+w-1}))) \odot \hat{q}_{av}^{t:t+w-1} + q_v^{t:t+w-1} \]

其中 \(\odot\) 表示逐元素乘法,\(\sigma\) 为 Sigmoid 函数,\(\mathrm{GAP}\) 为沿时间维度的全局平均池化。这个融合机制的设计思路是:首先通过逐元素乘法捕获视觉和音频模态在局部窗口内的共享“一致激活”信号(两个模态都活跃的帧),再通过逐元素加法捕获“互补激活”信号(至少一个模态活跃的帧),然后将二者组合,用一个由门控信号(来自平均池化后的 Mamba 融合输出)加权的残差连接聚合到原始查询上。这种设计一方面通过双向扫描增强了对局部时序模式的双向感知能力——既能利用过去的信息来维护当前帧的状态,也能利用未来的信息来消除歧义;另一方面通过多模态门控融合实现了跨模态信息的精细交互,有效抑制了单模态的噪声干扰。局部精炼的核心目的是保持短时一致性,防止因外观变化或声音短时中断而导致的追踪漂移。

在全局建模阶段,局部精炼后的查询被送入一个作用于完整序列的 Mamba 层,对整段视频进行全序列的状态空间建模。与局部窗口中的双向扫描不同,全局 Mamba 建模的目标是捕捉目标的长期运动模式、发声连续性和跨帧的长程依赖关系。全局建模输出的时序查询嵌入被最终用于分割掩码的预测和实例轨迹的输出。层次化设计体现了“局部细节 + 全局结构”互补的建模理念:局部窗口精炼擅长处理短时突变和局部外观变化,但视野有限,难以建模跨越数十帧的长程依赖;全局 Mamba 建模虽然具有完整的序列视野,但对短时局部细节的敏感性不足。将二者组合,追踪器能够在保证短期关联精度的同时,充分利用视频级的上下文信息,从而在长达数十秒的 AVIS 视频序列中维持稳定的目标身份关联。

(五)数据流整合与整体交互关系

综合上述四个阶段,SAMOT 的完整数据流和组件间交互关系可以归纳为:原始视频和音频分别经 ResNet 视觉编码器与 VGGish 音频编码器得到多尺度视觉特征 \(F_v\) 和音频特征 \(f_a\);视觉特征中较低的三个尺度与音频特征在 ADSM 模块中进行跨模态融合和动态步长调制,产出声敏感性增强的音频条件化视觉特征;音频特征同时被投影为音频查询并与最高层视觉特征关联;Transformer 解码器以音频条件化视觉特征和音频查询为输入生成实例级视觉查询;OT-MM 模块对音频查询和视觉查询执行带 RPP 和 TCP 约束的 Sinkhorn 最优传输匹配,并通过 MMD 损失进行分布正则化,得到匹配后的音频查询;最后,层次化时序追踪器对视觉查询和匹配后的音频查询执行滑动窗口局部精炼和全序列 Mamba 建模,输出最终的分割掩码与追踪结果。训练时,模型以 Mask2Former 风格的查询学习目标函数为基础,联合优化分割、分类、追踪和 MMD 分布对齐损失,各损失权重均设为 1.0。整个框架的设计体现了“帧级定位、视频级关联、时序追踪”三级递进的架构逻辑,三个核心组件(ADSM、OT-MM、Hierarchical Temporal Tracker)分别对应解决模态状态动态变化、跨模态结构性匹配、时序一致性建模三个关键难题,且三者之间以查询向量为统一接口进行数据传递,形成了一个信息无损的端到端可微系统。值得强调的是,ADSM 与 OT-MM 之间存在深层的互补协同关系:ADSM 通过动态步长调制确保帧级特征在时序上对模态状态变化具有敏感性,从而为 OT-MM 提供质量更高的实例查询输入;而 OT-MM 通过显式跨模态匹配为后续的时序追踪器提供更精确的跨模态实例关联,二者的联合优化使得整个框架在长视频 AVIS 场景中能够同时保持对变化的响应能力与对全局稳定的建模能力。

💡 核心创新点

  1. 状态感知的动态步长调制(ADSM):针对长视频中发声状态频繁切换对固定步长模型的挑战,ADSM 通过时序变化量 \(s_{\text{modality}}\) 和跨模态差异量 \(s_{\text{diff}}\) 联合感知模态状态,并利用 Delta 门控路由器(DGR)融合当前视觉线索、音频线索与历史上下文,以数据依赖的方式动态调节 Mamba 的离散化步长 \(\Delta\)。该机制使模型在状态突变时快速响应、在稳定片段保持长程传播稳定,解决了Transformer固定步长注意力与Mamba固定步长状态更新无法兼顾“响应速度”和“全局稳定性”的矛盾。图4的可视化验证了有效步长在模态状态切换时显著上升、在稳定段保持低位的行为模式。

下图可视化了ADSM中有效步长Δ在帧级的变化。

Figure 4. Visualization of the effective step size Δ in ADSM, alongside adjacent-frame predictions from AVISM and SAMOT.

当模态状态发生变化时(如说话人切换),有效步长显著增大;在稳定状态下,步长保持较小值,这验证了动态调制机制的有效性。

  1. 带时空先验的最优传输匹配(OT-MM):将音频查询与视觉查询的实例级关联显式建模为熵正则化最优传输问题,并通过相对位置先验(RPP)和时间一致性先验(TCP)约束代价矩阵,使匹配过程同时考虑特征语义相似性、空间位置合理性和时间连续性。相比传统交叉注意力与对比学习等隐式对齐方法,OT-MM 直接求解分配关系,可有效缓解异构模态间的结构性差异。对数域 Sinkhorn 迭代(\(L=10\))保证了数值稳定性和端到端梯度回传;匹配后的音频表示通过可微传输操作 \(\tilde{q}_a^t = (M^t)^{\mathsf{T}} q_a^t\) 投影到视频域,支持软分配而非硬匹配。

  2. 基于多核 MMD 的分布级对齐正则化:在显式最优传输匹配之外,OT-MM 进一步使用多带宽高斯核(\(S=\{0.1, 1.0, 10.0\}\))的 MMD 损失,在 RKHS 中约束匹配后音频特征与视觉特征的整体分布趋于一致,弥补最优传输在分布级对齐上的不足。该损失与主损失联合优化,权重为1.0,形成“显式结构匹配 + 隐式分布对齐”的双通道机制。论文正文未单独给出MMD损失的消融数字,其在补充材料中提供了OT与MMD正则化的额外消融分析。

  3. 层次化时序追踪器:结合滑动窗口(\(w=3\))内的双向 Mamba 局部精炼与全序列 Mamba 全局建模,采用逐元素乘法捕获跨模态一致激活信号、逐元素加法捕获互补激活信号,并经门控残差融合聚合到视觉查询上。该设计在保持短时关联精度的同时建模长程时序依赖,有效抑制了单帧匹配错误导致的身份切换与轨迹碎片化。

📊 实验结果

数据集与设置:在 AVISeg 基准上评估,该数据集视频平均时长61.4秒。统一使用 ResNet-50 视觉骨干、相同输入分辨率与训练协议;音频编码器为 AudioSet 预训练的 VGGish。模型训练50,000轮次、batch size 1、AdamW 优化器与阶梯式学习率调度,在 NVIDIA RTX 4090 上完成。

总体性能对比(表1):

下图提供了在不同音频场景下与基线方法AVISM的定性比较。

Figure 3. Qualitative comparison between AVISM and Ours across diverse audio scenarios with varying sound sources.

在多个复杂场景中,SAMOT能够更准确地分割和追踪发声实例,减少了漏检和误检。

方法参考FSLAHOTAmAP
AVISMCVPR’2542.7861.7340.57
ACVISICASSP’2642.8762.0942.14
Ours46.0762.5842.85
AVISM*CVPR’2544.4264.5245.04
ACVIS*ICASSP’2646.4865.1246.68
Ours*48.1867.2747.62

注:表示使用 MS-COCO 预训练视觉骨干。标准设置下,本文方法较 AVISM 提升 +3.29 FSLA、+0.85 HOTA、+2.28 mAP;较 ACVIS 提升 +3.20 FSLA、+0.49 HOTA、+0.71 mAP。MS-COCO 预训练设置下,较 AVISM 提升 +3.76 FSLA、+2.75 HOTA、+2.58 mAP;较最强基线 ACVIS* 提升 +1.70 FSLA、+2.15 HOTA、+0.94 mAP。在标准设置下,本方法在 FSLAn(37.81 vs ACVIS 21.16)和 FSLAm(55.81 vs ACVIS 52.34)上提升显著;但在预训练设置下,单声源准确率 FSLAs(32.87)低于 ACVIS*(34.45),FSLAn(36.73)则显著高于 ACVIS*(10.74)与 AVISM*(20.62)。

消融实验

  • 表2:以配备层次化追踪器、无 ADSM/OT-MM 的复现框架为基线,逐步加入 ADSM、OT-MM 及其组合。完整模型取得最优结果,验证了两个模块的互补性。与标准 Mamba+OT-LA(线性注意力)、SS2D+OT-LA 等替代方案相比,ADSM+OT-MM 在 FSLA、HOTA、mAP 上均最优,说明仅做基础传输对齐或仅替换骨干扫描机制不足以充分建模时空先验。
  • 表3(ADSM内部消融):单独启用状态感知分支(SP,由 \(s_{\text{modality}}\) 和 \(s_{\text{diff}}\) 联合实现)或 Delta 门控路由器(DGR)均能带来增益,二者组合最强;图6显示 Max 范数与 Cosine 距离分别优于 L1/L2 范数与 Euclidean/Pearson 备选。
  • 表4(OT-MM内部消融):单独引入相对位置先验(RPP)带来 FSLA +0.42、HOTA +0.32、mAP +0.19;单独引入时间一致性先验(TCP)带来 FSLA +0.25、HOTA +0.88、mAP +0.14;二者组合效果最佳,验证了两个先验的互补作用。OT 与 MMD 正则化的额外贡献消融在补充材料中给出。

效率与在线/离线分析:图7的性能-效率对比显示,本文方法在参数规模、GFLOPs 与推理速度上取得更优的权衡,ADSM 与 OT-MM 带来的额外开销有限。图8显示窗口大小 \(w=3\) 在 FSLA、HOTA、mAP、GFLOPs 与 FPS 间取得最佳平衡。图9对比了离线设置与移除未来帧依赖的在线设置,在线变体仍具竞争力,但与离线版本之间存在明显差距。

🔬 细节详述

数据集与评估指标:AVISeg 为首个音频-视觉实例分割基准,平均视频时长61.4秒。评估指标包括均值平均精度(mAP)、高阶跟踪准确率(HOTA)和帧级声源定位准确率(FSLA),细分为 FSLAn(静音)、FSLAs(单声源)和 FSLAm(多声源)。

训练配置:输入分辨率与 ResNet-50 骨干与基线一致;VGGish 在 AudioSet 上预训练并固定;查询学习协议遵循 Mask2Former 与 VITA。训练50,000次迭代、batch size 1、AdamW 优化器、阶梯式学习率调度、NVIDIA RTX 4090 GPU。

关键超参数:\(\alpha=0.2\)、\(\beta=0.1\)、\(\epsilon=0.01\)、\(\gamma=0.1\)、Sinkhorn 迭代次数 \(L=10\)、\(\eta=10^{-8}\);其余 Mamba 设置遵循 VMamba。注意:方法部分将 \(\alpha\) 定义为可学习缩放参数,训练细节写“set \(\alpha=0.2\)”,正文未明确说明是初始值还是固定值,存在轻微歧义。总损失函数沿用 AVISM 目标并额外加入 \(\mathcal{L}_{\mathrm{MMD}}\),所有损失权重均为 1.0。

推理细节:采用离线全序列处理;层次化追踪器滑动窗口大小 \(w=3\);在线设置下移除未来帧依赖、转为因果推理,性能略降但保持竞争力。未披露 beam search、温度参数或测试时增强策略。

OT-MM 求解细节:使用对数域 Sinkhorn 而非原始 Sinkhorn 以避免小熵正则下的数值溢出/下溢;对偶变量通过交替缩放迭代更新,输出传输计划直接参与可微传输操作 \(\tilde{q}_a^t = (M^t)^{\mathsf{T}} q_a^t\)。MMD 采用三带宽高斯核(0.1/1.0/10.0)平均,用于约束匹配后音频与视觉特征分布一致。

消融基线说明:表1中 AVISM 为官方基准基线,而表2及后续消融中的基线为作者复现的“配备层次化追踪器但无 ADSM/OT-MM”框架,二者数值不完全相同,对比时不能混用。

⚖️ 评分理由

  • 创新性 (1.4/2):[A_METHOD] 将Mamba的固定步长改为由时序变化量、跨模态差异量和历史上下文共同调制的ADSM,并把跨模态实例匹配显式构建为带RPP/TCP先验及MMD约束的最优传输问题,两个组件级创新具体且具有互补性。

  • 技术严谨性 (1.0/1.5):[A_METHOD] 公式推导、对数域Sinkhorn求解和MMD分布对齐整体自洽,但ADSM的步长作用解释存在矛盾:正文称稳定时步长较大、突变时步长减小,而[SCORING_SOURCE_17/22]图4显示稳定段Δ低、状态切换时Δ显著上升,内部逻辑不一致削弱了机制可信度。

  • 实验充分性 (1.0/1.5):[A_RESULTS] 在AVISeg上给出了官方基线对比、ADSM/OT-MM模块消融、内部组件消融及效率/在线分析,证据面较全;但[A_LIMITS]明确指出全部实验仅AVISeg单基准,无跨数据集泛化、统计检验或误差分析,OT与MMD的单独贡献仅在补充材料,证据链仍不完整。

  • 清晰度 (0.8/1):[SCORING_SOURCE_15/22] 论文在对比协议中说明主表AVISM是官方基线、消融表基线是复现框架,但两套数值体系需要读者依赖正文说明才能区分,易将消融增益与主表增益混用;整体结构和公式组织虽较清楚,这一表达带来误读风险。

  • 影响力 (1.0/1.5):[A_SUMMARY] 面向音频-视觉实例分割这一与音频社区直接相关的任务,在AVISeg上取得SOTA并发表于ACM MM’26,方法以音频驱动的查询匹配和声源实例追踪为核心,对音视频听觉场景分析具有实际参考价值。

  • 开源 (1.2/1.5):[A_OPEN] 论文明确提供GitHub代码与模型链接,核心产物已开放;但[A_OPEN]显示许可证、代码语言/框架版本及权重文件格式均未披露,文档不完整,按固定锚点给1.2。

  • 可复现性 (0.3/0.5):[A_RESULTS] 已披露ResNet-50/VGGish、50k迭代、batch size 1、AdamW、RTX 4090及主要超参数,复现基础较完整;但[A_LIMITS]指出学习率具体数值未给出,α被描述为可学习又写set α=0.2,存在少量关键歧义,按大部分充分但有少量缺失给0.3。

  • 工程/实践价值 (1.0/1.5):[A_RESULTS] 效率分析给出了与AVISM/ACVIS相比的参数、GFLOPs、FPS权衡,并对滑窗w=3做了性能与效率平衡测试,具备实践参考;但[A_LIMITS]未披露训练总时长和显存占用,在线变体与离线存在明显差距,部署约束分析不足,工程价值证据未完全闭合。

🚨 局限与问题

  1. 单基准验证:全部定量实验仅在 AVISeg 上完成,未在 AVS、VIS 或其他长视频多模态基准上验证泛化性,SOTA 结论的外推范围有限。
  2. 最先进基线增益有限且不一致:预训练设置下相对最强基线 ACVIS* 的 HOTA 增益(+2.15)显著低于摘要强调的相对 AVISM* 增益(+2.75);FSLAs 分项(32.87)甚至低于 ACVIS*(34.45)。摘要中的提升幅度具有选择性,需谨慎解读。
  3. 在线与离线差距:图9显示在线变体仍与离线版本存在明显性能差距,论文未深入分析哪些模块在因果推理下失效,也未提出针对性缓解策略。
  4. 固定窗口局限:层次化追踪器采用固定窗口 \(w=3\);论文在讨论中承认最优时序感受野可能随模态状态变化,快速变化片段可能更适合短窗、稳定片段可能受益于长窗,但未给出动态窗口方案。
  5. α表述歧义:方法部分将 \(\alpha\) 描述为可学习缩放参数,训练细节写“set \(\alpha=0.2\)”,未明确它是初始值还是固定常量,影响精确复现。
  6. MMD消融证据不足:正文未直接报告单独移除 MMD 正则化后的指标变化,仅说明补充材料提供OT与MMD的额外消融,削弱了该设计在正文中的实证支撑强度。
  7. 训练效率未充分讨论:50k步、batch size=1 的配置在RTX 4090上的实际训练时间未披露,长视频(平均61.4秒)下的内存占用与序列长度处理策略也未说明。

← 返回 2026-08-11 语音/音乐/音频论文速递