📄 UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization
#鲁棒性 #高效推理
4.8/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.5/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1/1.5
📝 4.8/10 | 后50% | #音视频理解 | #多模态模型 | #鲁棒性 #高效推理 | arxiv
👥 作者与机构
- 共同第一作者:Cangjin Qiu(苏州大学)、Quan Zhang(清华大学)
- 通讯作者:Ke Zhang(苏州大学)
- 其他作者:Dan Jiang(清华大学)
💡 毒舌点评
本文的频域分析和统一序列融合为AV-TFL提供了有价值的视角,在大规模基准上取得了亮眼的SOTA成绩。然而,所谓的Skip-Scanning“Nyquist频率”理论包装过度,本质上是一种基于经验归纳偏置的软正则化,作者对此进行了信号处理理论上的强行拔高。此外,论文缺失了损失函数等关键训练细节,且在开源、统计显著性检验和与核心竞品VideoMamba的对比上存在明显缺失,这严重削弱了其结论的可信度与可复现性。
📌 核心摘要
- 解决问题:音频-视觉时间伪造定位(AV-TFL),即精确定位视频中音视频被篡改的时间段。现有方法不加区分地处理所有频率成分,导致过拟合高频噪声且在真实场景数据降质下鲁棒性不足。
- 方法核心:提出UniSkip-Mamba框架,包含三个关键创新:(1) 统一多模态序列融合(沿时序拼接音视频特征),打破传统通道拼接的刚性帧对齐限制;(2) Skip-Scanning Mamba块(S-Mamba),通过Group-Scan-Merge机制以步长
p进行分组扫描,实现频率感知的结构化正则化;(3) 层次化Mamba骨干网络,逐步下采样以捕获多尺度时序伪造模式。 - 创新点:首次从频域角度系统分析AV-TFL,发现判别性信息集中在归一化频率0–0.15的低/中频段,而高频(>0.15)主要为噪声。基于此提出Skip-Scanning作为软低通正则化策略。统一序列融合也为Mamba架构的跨模态长程依赖建模提供了新的思路。
- 主要实验结果:在LAV-DF上达到63.4% AP@0.95(+9.8% over UniCaCLF),在AV-Deepfake1M上达到63.58% mAP(+14.32% over DiMoDif),推理速度比Transformer基线(UMMAFormer)快6倍,并在多种数据退化条件下展现优越鲁棒性。
- 实际意义:为大规模视频取证提供了一种高效(线性复杂度)且鲁棒的解决方案,可处理长视频。其频域分析为伪造检测的特征学习提供了新视角。
- 主要局限性:Skip-Scanning可能削弱对极短时、纯高频伪造的检测能力;步长
p需手动选择;未提供代码/模型开源,损失函数未提及,降低了可复现性。
🔗 开源详情
- 代码:论文中未提及代码仓库链接。
- 模型权重:论文中未提及。
- 数据集:
- LAV-DF: 引用文献 [8],文中未提供直接下载链接。
- AV-Deepfake1M: 引用文献 [7],文中未提供直接下载链接。
- Demo:论文中未提及。
- 复现材料:
论文在Section IV-B提供了详细的实现细节,包括:
- 特征提取:详细说明了LAV-DF和AV-Deepfake1M使用的具体预训练模型和特征维度。
- 模型配置:给出了Mamba backbone配置
[2,2,5],隐藏维度C=512,步长p∈{1,2,4}。 - 训练配置:PyTorch 2.1.2, CUDA 11.8,AdamW(lr=1e-4, weight decay=0.05),cosine annealing schedule,50 epochs,batch size 16,NVIDIA Tesla V100-SXM2 32GB GPU。 论文未提及损失函数,也未提供附录或补充材料的获取链接。
- 论文中引用的开源项目:
- ActionFormer, TriDet, Mamba, Mamba2, VMamba, Video Mamba Suite, BYOL-A, AudioSet, VideoMAE V2, Wav2Vec 2.0 (XLS-R-300M) 等。论文仅提及项目名称和引用,未提供具体代码链接。
🏗️ 方法概述和架构
UniSkip-Mamba是一个端到端的AV-TFL框架。其数据流为:预训练编码器提取音视频特征 → 统一多模态序列融合 → 层次化Skip-Scanning Mamba骨干网络 → 检测头输出定位边界。

特征提取:使用预训练模型(如在AV-Deepfake1M上使用VideoMAE V2-Small和Wav2Vec 2.0 XLS-R-300M)分别提取视频特征 \(F_v \in \mathbb{R}^{B \times C_v \times T}\) 和音频特征 \(F_a \in \mathbb{R}^{B \times C_a \times T}\)。视觉特征通过线性投影层对齐到音频特征维度 \(C_a\)。
统一多模态序列融合:这是方法的核心架构创新之一。与传统的通道维度拼接 [V_t; A_t] 不同,UniSkip-Mamba将对齐后的视觉和音频特征沿时序维度拼接为统一序列 [V_1, ..., V_T, A_1, ..., A_T],形成 \(F_{unified} \in \mathbb{R}^{B \times C_a \times 2T}\)。随后,加入可学习的模态嵌入(Modality Embedding)以显式标识序列中每个token的来源(视频或音频)。这一设计将跨模态的异步相关性(如唇音不同步)转换为了状态空间模型(SSM)所擅长的长程依赖建模问题,理论上可以捕获任意时间偏移的跨模态失配。
Skip-Scanning Mamba块(S-Mamba):核心在于Group-Scan-Merge机制。给定步长 \(p\),该机制通过 Reshape 和 Permute 操作将输入序列 \(X \in \mathbb{R}^{B \times L \times C}\) 重塑为 \((B \cdot p) \times (L/p) \times C\),将其分成 \(p\) 组并行的较短的子序列(Grouping)。各组子序列被送入一个共享的双向Mamba(DBM)模块进行并行处理(Scanning),最后将结果重新排列合并,恢复原始序列顺序(Merging)。这一过程保留了所有token,并未真正丢弃任何帧信息,但通过改变扫描拓朴,对状态空间中的高频动态实现了指数级衰减(\(\bar{A}^p\) 效应),从而作为一种软结构正则化,使模型偏向学习低/中频判别模式。

层次化骨干网络:骨干网络由Stem(无下采样)和多个Branch阶段组成,配置为 [2, 2, 5]。Stem在原始分辨率上操作,旨在捕获精细的局部伪造特征(如微表情不一致);Branch阶段末尾使用 \(2\times\) 下采样,逐步将序列长度从 \(2T\) 压缩至 \(T/16\),以扩大有效感受野,建模长程伪造模式。
检测头:基于层次化骨干网络输出的多尺度特征图进行密集预测和时序边界回归,输出伪造片段集合 \(S = \{(s_j, e_j, c_j)\}\)。
设计动机:论文通过频域消融实验(图1)发现,移除归一化频率大于0.15的高频成分后,模型(stride=4)性能甚至提升了1.4%,这揭示了现有方法过拟合高频噪声的问题,并直接驱动了Skip-Scanning的频域感知设计。
💡 核心创新点
频率感知的Skip-Scanning正则化:通过量化频域消融实验,首次揭示AV-TFL任务中判别性信息集中在0-0.15归一化频段,而高频成分主要贡献噪声。基于此提出的Skip-Scanning是一种软正则化,而非硬性滤波,其通过调整状态空间衰减速率实现频率选择偏向。论文从Nyquist理论出发,论证了stride=2(有效Nyquist频率~0.25)是能完整覆盖判别性频段并有效衰减高频噪声的最优选择。

统一多模态序列融合与Mamba的协同:打破传统通道维度融合的范式,将多模态融合问题转化为纯时序长程依赖问题。此方法不仅理论上能检测异步伪造,更在实验中证明与Mamba的线性复杂度和位置无关的状态传播机制深度协同。消融实验(Table III)中一个强有力的负结果是:将统一序列融合应用于Transformer(UMMAFormer),性能反而下降了3.0%,这验证了两者结合的必要性。
Mamba在AV-TFL任务的深度适配:首次系统性地将SSM架构应用于视频伪造定位,通过统一序列融合和Skip-Scanning两大创新,解决了Transformer的二次复杂度瓶颈和传统Mamba的密集扫描过拟合问题,实现了在精度、速度和鲁棒性上的全面突破。
软正则化范式:区别于丢弃高频信息的硬滤波,Skip-Scanning保留了全部token的表达能力,通过修改扫描拓扑引入归纳偏置。该范式在面对数据降质时,理论预测并实验证实了其卓越的鲁棒性。
📊 实验结果
| 方法 | 模态 | AP@0.5 | AP@0.75 | AP@0.95 | Avg. | AR@100 | AR@50 | AR@20 | AR@10 |
|---|---|---|---|---|---|---|---|---|---|
| BA-TFD+ (基线) | AV | 96.3 | 85.0 | 4.4 | 61.9 | 81.6 | 80.5 | 79.4 | 78.8 |
| TriDet | V | 96.3 | 86.8 | 23.6 | 68.9 | 91.0 | 90.4 | 89.7 | 88.7 |
| ActionMamba | V | 97.6 | 94.6 | 39.1 | 77.1 | 85.1 | 85.0 | 84.9 | 84.5 |
| UMMAFormer | AV | 98.8 | 95.5 | 37.6 | 77.3 | 92.4 | 92.5 | 92.5 | 92.1 |
| DiMoDif | AV | 95.5 | 87.9 | 20.6 | 68.0 | 94.2 | 93.7 | 92.7 | 91.4 |
| UniCaCLF | AV | 97.8 | 93.1 | 53.6 | 81.5 | 94.6 | 94.0 | 93.8 | 93.2 |
| UniSkip-Mamba (stride=1) | AV | 98.5 | 96.7 | 63.0 | 86.0 | 94.3 | 93.6 | 92.9 | 92.3 |
| UniSkip-Mamba (stride=2) | AV | 98.6 | 97.1 | 63.4 | 86.2 | 93.7 | 92.6 | 91.7 | 91.3 |
AV-Deepfake1M数据集结果
| 方法 | 模态 | AP@0.5 | AP@0.75 | AP@0.9 | AP@0.95 | Avg. | AR@50 | AR@20 | AR@10 | AR@5 |
|---|---|---|---|---|---|---|---|---|---|---|
| UMMAFormer | AV | 51.64 | 28.07 | 7.65 | 1.58 | 22.24 | 44.07 | 43.45 | 42.09 | 40.27 |
| DiMoDif | AV | 86.93 | 75.95 | 28.72 | 5.43 | 49.26 | 81.57 | 80.25 | 78.84 | 76.64 |
| UniSkip-Mamba (stride=1) | AV | 87.2 | 75.3 | 43.7 | 22.0 | 57.1 | 78.1 | 75.9 | 73.7 | 69.7 |
| UniSkip-Mamba (stride=2) | AV | 90.60 | 81.80 | 52.70 | 29.20 | 63.58 | 80.90 | 79.30 | 77.50 | 74.70 |
| UniSkip-Mamba (stride=4) | AV | 90.50 | 80.70 | 50.60 | 27.60 | 62.35 | 78.80 | 77.20 | 75.50 | 72.80 |
关键消融实验 (LAV-DF, AP@0.95)
- 融合策略与Mamba骨干的协同性:
- UMMAFormer (Transformer) + 统一序列:34.6 %(较其原版37.6% 下降3.0%)
- UniSkip-Mamba (Mamba) + 统一序列 + 无模态嵌入:43.3%
- UniSkip-Mamba + 统一序列 + 有模态嵌入 (full-scan): 63.0%
- UniSkip-Mamba + 统一序列 + 有模态嵌入 + stride=2: 63.4%
- 通道拼接在Mamba上的表现:
- ActionMamba (通道 + 无skip): 39.1%
- 通道拼接 + 有skip (stride=2): 36.7% (性能下降),说明Skip与通道拼接不兼容。
频域分析 (AV-Deepfake1M, 移除特定频带后mAP@0.95的相对变化)
| 模型 | 移除低频(0-0.05) | 移除中频(0.05-0.15) | 移除高频(>0.15) |
|---|---|---|---|
| Stride 1 | -81.3% | -92.8% | -20.3% |
| Stride 2 | -56.3% | -72.4% | -0.7% |
| Stride 4 | -72.4% | -79.7% | +1.4% |
Stride=4在移除高频后性能提升1.4%,直接证明了高频成分引入了噪声。Stride=2对高频移除不敏感(-0.7%),但对中低频移除敏感,验证了其恰好覆盖了0-0.15判别性频段的理论分析。值得注意的是,Stride=4在移除中频时性能下降(-79.7%)比Stride=2(-72.4%)更严重,这与其有效Nyquist频率(0.125)低于0.15的判别性频段上界,导致信息损失的预测相符。
鲁棒性评估 (AV-Deepfake1M, mAP@0.95)
在10种数据退化(7种视觉、3种音频)的5个强度级别下,stride=2和4模型在所有条件下均比stride=1模型稳定高出5-8%的绝对mAP。在极端遮挡(级别5)下,stride=4保持22.4%而stride=1降至15.9%;在强烈音频噪声(级别5)下,stride=2保持9.76%而stride=1降至4.43%。

效率分析
- 推理延迟:在序列长度9216帧时,UniSkip-Mamba stride=1延迟97.4ms,而UMMAFormer需要600ms,实现6倍加速。
- 训练效率:在序列长度4608帧时,UniSkip-Mamba(前向+反向)耗时138ms,UMMAFormer耗时983ms。
- 批处理可扩展性:将序列长度固定为2304,UMMAFormer在batch size 32时OOM,而UniSkip-Mamba stride=1/4可扩展至batch size 56,并行处理能力提升3.5倍。

🔬 细节详述
- 训练数据:LAV-DF(136,304视频)、AV-Deepfake1M(1,091,420训练/56,907验证视频,排除了无声视频)。未提及数据增强策略。
- 特征提取:LAV-DF使用TSN (RGB + Optical Flow) + BYOL-A;AV-Deepfake1M使用VideoMAE V2-Small + Wav2Vec 2.0 XLS-R-300M。特征维度已对齐。
- 损失函数:全文未明确说明所使用的具体损失函数及其形式。
- 训练策略:AdamW优化器,初始学习率1e-4,权重衰减0.05,采用带warmup的余弦退火调度,batch size 16,训练50个epoch。
- 关键超参数:隐藏维度
C=512,S-Mamba骨干网络结构配置为[2, 2, 5](分别对应embedding/stem/branch的块数),扫描步长p∈{1,2,4}。 - 训练硬件:NVIDIA Tesla V100-SXM2 32GB GPU。具体使用的GPU数量未明确说明。
- 推理细节:未说明解码策略或后处理步骤。
- 正则化技巧:在S-Mamba的残差连接中使用了Dropout。Skip-Scanning本身被视为一种结构化正则化策略。
⚖️ 评分理由
- 创新性 (1.0/2):频域分析引导AV-TFL任务是新颖且有洞察力的,统一序列融合与Mamba的协同设计也有实质创新。但Group-Scan-Merge机制本身是将分组扫描思想迁移到Mamba,并非颠覆性创新。其所谓的“Nyquist频率”理论包装存在过度宣称,本质上更接近于一种带有经验性归纳偏置的正则化设计。
- 技术严谨性 (0.8/1.5):状态空间衰减推导(\(\bar{A}^p\))是正确的。但将跳过扫描等价于Nyquist限制的理论分析缺乏严格性,因为该操作并非真正下采样。更重要的是,全文未提及损失函数,这是一个重大技术细节缺失,严重影响了方法论层面的完整性。
- 实验充分性 (0.8/1.5):在两大基准上取得了SOTA,消融实验有力地证明了融合策略与骨干网络的协同效应,频域和鲁棒性实验设计详尽。但存在明显缺陷:(1) 所有结果未报告标准差或置信区间,缺乏统计显著性检验;(2) 在AV-Deepfake1M上使用验证集而非官方测试集进行评估,SOTA宣称的可比性存疑;(3) 缺少与VideoMamba等核心Mamba视频变体的直接对比,仅对比了ActionMamba(纯视觉)和Transformer基线;(4) 超参数如骨干网络结构
[2,2,5]的选择缺乏灵敏性分析。 - 清晰度 (0.5/1):整体结构清晰,图表丰富。但方法论部分缺失损失函数这一核心组件。此外,模态嵌入的具体维度等实现细节也未交代。频域分析的滤波实现细节需依赖未公开的补充材料。重大缺失降低了全文的可理解性。
- 影响力 (0.5/1.5):该工作显著推进了AV-TFL的性能,其频域洞察可能启发后续的伪造检测研究。但作为一篇聚焦于多媒体取证/CV的论文,虽然使用了音频模态,但其核心方法和实验聚焦于视频伪造的频域特性,对语音/音乐/音频信号处理的直接贡献有限,因此对相关细分领域读者的影响力受限。
- 开源 (0.0/1.5):论文未提供代码、模型权重或公开数据集的直接链接,也无开源声明。
- 可复现性 (0.2/0.5):提供了详细的训练配置、优化器和超参数。但损失函数的完全缺失是全完复现的主要障碍。缺乏特征提取详细的预处理步骤和推理后处理细节,也增加了复现难度。
- 工程/实践价值 (1.0/1.5):效率分析部分数据详实,展示了6倍加速、3.5倍批处理吞吐和O(T)复杂度带来的实际工程优势,具有很好的参考价值。但未涉及模型量化、边缘端部署等工业级讨论,且闭源降低了直接工程复用价值。
🚨 局限与问题
论文明确承认的局限:
- Skip-Scanning可能削弱对仅存在于高频段的极短时伪造(如单帧篡改)的检测能力。
- 步长 \(p\) 需手动选择,无法根据数据自适应调整。
- 未来工作:可探索自适应步长或多尺度融合策略,并将该框架扩展到其他音视频理解任务。
审稿人发现的潜在问题:
- 损失函数完全缺失:全文未提及训练所用的损失函数,这是一个关键的方法论缺失,使方法描述严重不完整,直接导致不可复现。
- Nyquist类比的理论过度包装:“有效Nyquist频率 \(f_{Neff}(p) \approx 1/(2p)\)” 的说法缺乏严格数学定义。Group-Scan-Merge并非下采样,所有token的时序位置被保留,组内递归深度的降低不等同于频谱混叠。这是一个基于经验观察设计的归纳偏置,不应被抬高到采样定理的直接推演。
- 缺乏统计显著性检验与微小提升质疑:在LAV-DF数据集上,stride=2(63.4%)相对于stride=1(63.0%)的AP@0.95提升仅0.4%,在未报告标准差的情况下,这一微小优势很可能在统计上不显著,难以确证stride=2的最优性。
- 测试协议不一致导致SOTA对比失准:论文明确说明在AV-Deepfake1M上使用验证集进行测试。由此产生的SOTA宣称与使用官方测试集的方法之间不具备直接可比性。
- 基线选择存在重大遗漏:论文在摘要和相关工作中多次提及并引用了Video Mamba Suite,但在实验对比中,仅比较了纯视觉的ActionMamba,未将直接且相关的多模态视频Mamba基线(如VideoMamba的扩展)列入对比,这使得其SOTA宣称的含金量下降。与Mamba2、H3等更现代的SSM变体也缺乏对比。
- 与Transformer对比的局限性:消融实验证明了统一序列与Transformer不兼容,但未探索在Transformer中解决该问题的方法(如不同的位置编码),使得对比不够公平,无法完全归因为架构的根本差异。
- 超参数选择的合理性论证不足:骨干网络结构
[2,2,5]等关键超参数的选取依据未通过消融实验论证其灵敏度。