英文题目:DeformTrace: A Deformable State Space Model with Relay Tokens for Temporal Forgery Localization
会议身份:
conference:aaai:2026:conference-paper-id:40928
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#状态空间模型 #高效推理 #音视频 #音频伪造检测
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Xiaodong Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Suting Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanming Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Junqi Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Yangxu Liao:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhong Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Weiping Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Zhongyuan Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
时间伪造定位以时间对齐的音视频流为输入,需输出伪造片段中心与时长及整视频真伪标签,难点在于边界模糊、伪造稀疏易被真实帧淹没以及长序列状态衰减。DeformTrace先用冻结的Raven视听编码器抽取多尺度融合特征并经下采样构建时间金字塔,为编码器提供细粒度上下文。随后可变形自状态空间模块按参考时间点预测偏移并插值采样,再做双向状态传播,周期插入的中继令牌划分序列并搭接长程信息流。解码器中可变形交叉状态空间模块以查询为中心检索编码器上下文并迭代修正候选框,同时输出分类标签。相对固定扫描Mamba与全局注意力Transformer,该设计以查询相关的子空间划分抑制非伪造累积并动态扩展感受野,提升稀疏伪造敏感性。在AV-Deepfake1M基准下,DeformTrace的mAP指标平均值为52.9,高于DiMoDif的49.3。该结论适用边界受限于谈话人脸伪造的两个基准,尚未验证跨操纵类型与跨语言泛化,重度块损伤与强音频噪声下仍明显下滑。在硬件为单张RTX 3090评测时其推理开销为每视频约104 ms、计算量为212.4 G FLOPs,训练成本涉及8张RTX 3090。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
要定位的是什么伪造?
输入是一段未剪辑的说话人视频,包含时间对齐的视频流与音频流。目标不是只回答整段视频是真是假,而是输出伪造片段集合与整段真伪标签。每个伪造片段用中心时间戳与持续时长表示,论文记为多个二元组。
这类时间伪造定位任务要求帧级精度。早期基于卷积或多尺度变换器的方法逐帧分类,精度低且推理慢;后来的多模态方法引入预训练特征与特征金字塔,精度提升但模型庞大。对刚入门的研究生,关键是区分两个输出:片段级定位用于解释伪造发生在何时,视频级分类用于快速筛查。论文同时评估两者,但方法重心在前者。
本解读只讲论文实际研究的音视频时间伪造定位,不扩展到纯图像换脸或纯文本检测。后续所有组件、损失与实验都围绕如何更准、更快地找到稀疏且边界模糊的伪造段展开。
已有路线卡在哪里?
状态空间模型路线以 Mamba 为代表,通过选择性机制实现线性复杂度的长序列建模,在分割与时间动作检测中已有成功尝试。论文指出其视觉可变形变体只做单序列建模,且普遍存在长距离衰减,固定阈值过滤难以自适应。
时间动作检测路线从固定锚框发展到无锚框再到基于查询的集合预测,TadTR 与 TE-TAD 去掉了后处理,Mamba 系结构进一步增强时序建模。伪造定位借用了这条路线的查询与金字塔思想,但动作边界相对清晰,伪造边界常因生成与压缩而模糊,不能直接照搬。
时间伪造定位路线已有 BA-TFD、BA-TFD+、UMMAFormer、DiMoDif 等音视频方法,依赖注意力与特征金字塔。论文的对照选择了其中公开可用的音视频方法,并自建把全部状态空间模块换成变换器块的 FullFormer 作为同条件基线,用于分离结构收益。
三个难点如何转化为设计约束?
第一个难点是边界模糊。普通状态空间模型按固定步长更新状态,相邻帧被平滑,伪造与真实过渡处容易定位漂移。设计约束是采样位置必须可学、能跳出固定窗口,去找语义相关的上下文。
第二个难点是伪造稀疏。大部分帧是真实的,递推更新会被非伪造模式主导,对短伪造不敏感。设计约束是不能让全局状态无差别累积所有帧,需要按查询划分出子空间做针对性检索。
第 3 个难点是长距离衰减。论文明确其机理是 token 间作用依赖控制矩阵幂,矩阵值小于 1 时随距离指数衰减。在多尺度展平序列中,首尾语义对齐 token 的距离可达 2 倍首层长度,首层长度在 2 个数据集上都超过 100,因此远端交互几乎消失。设计约束是必须插入稀疏中继结构来缩短有效传播距离。
整体链路如何走通一个样本?
拿一个 8 秒样本为例,视频按 25 帧每秒采样,音频转成梅尔谱图,分别送入冻结的视觉与音频骨干,得到分类 token 与特征序列。两路特征拼接并线性投影为融合特征,再经多次 2 倍下采样得到多尺度特征。编码器对展平后的多尺度特征做上下文增强,解码器用重复多次的全局多模态特征初始化查询,并用多层感知机生成初始中心与时长提议,逐层修正得到最终伪造段与视频级分数。
下图把 3 个创新放在同一视图下,有助于先建立直觉再读细节。左上是普通扫描的固定窗口,左中是带偏移的可变形采样,右侧是中继令牌扩大感受野的注意力对比,左下是每个查询独立划分状态空间的交叉扫描。
看图路径: 1. 先看左上普通状态空间模型的等距扫描框,确认目标帧只能看到固定邻域;2. 再看左中可变形自扫描的红色偏移框,观察采样位置如何偏离蓝色参考虚线框;3. 再看右侧隐注意力热图,对比无中继与有中继时对角线外亮斑的扩展;4. 最后看左下交叉扫描,确认每个上方查询点如何连出多条虚线指向下方不同片段
论文图 1。原论文 Figure 1:“Overview of our main contributions (we take the video sequence for illustration).”。
该图报告的内容是:可变形自扫描通过学习时间偏移实现灵活局部采样;中继令牌把受限感受野扩展为可跨段传播的感受野;可变形交叉扫描让每个查询 token 把全局状态空间切分为子空间。理解这三者的分工后,再看总体结构图中的编码器与解码器位置就不会混淆。
编码器如何实现可变形自扫描?
编码器输入是各尺度特征,输出是上下文增强序列。它由可变形自状态空间模块、可变形自注意力与前馈网络组成。论文强调前者提供高效状态更新,后者保留稀疏位置的自适应注意力,两者互补。
总体结构如下图所示,左侧是双路骨干与融合,中部是时间参考点与多尺度特征,右侧是带中继令牌的编码器,下方是带交叉扫描的解码器。建议按箭头先走主路径,再看偏移预测与插值分支。
看图路径: 1. 先沿左上视觉与音频骨干到融合再到多尺度特征的主箭头走一遍输入路径;2. 再看中上时间参考点与时间线如何为每个尺度生成归一化位置;3. 再看右中编码器内可变形自扫描到双向状态空间模块再到前馈网络的横向链路;4. 最后看下方解码器从查询初始化经交叉扫描与交叉注意力到伪造段输出的循环更新
论文图 2。原论文 Figure 2:“Illustration of the overall scheme of DeformTrace.”。
该图显示的关键计算是:每个特征先经多层感知机预测多尺度偏移,与重复后的时间参考点相加得到可变形点,再用双线性插值从多尺度特征中采样并经另一多层感知机聚合。采样后的序列送入双向状态空间模块,同时从过去与未来捕捉上下文,最后经前馈网络精炼。
时间参考点的计算把特征索引换算为视频秒数再归一化,论文给出帧率默认 25、步长与视频时长等符号的含义。沿样本走一遍就是:帧索引转秒、除以时长得归一化位置、加偏移得采样位置、插值取特征、聚合得新表示。
\[forgery segments A = {(ti, di)}Nf i=1,\]上式定义了伪造段集合的表示形式,每个元素包含中心与时长。编码阶段尚未输出该集合,但所有采样与更新都是为后续解码器更准地回归这两个量服务。
\[and Nl = N1/2l−1\]上式给出多尺度长度的折半关系,说明尺度越深序列越短。这也是长距离衰减分析中距离估计的基础,展平后首尾距离会被放大。
状态空间模型 × 可变形自扫描: 状态空间模型负责按时间顺序递推更新隐状态,适合长序列高效建模但采用固定采样与固定更新;可变形自扫描负责为每个时刻预测时间偏移并到多尺度特征上重采样输入。两者搭配的原因是伪造边界模糊且语义相关帧不在固定邻域内,组合后状态空间模型的递推对象从等距帧变为语义对齐帧,从而在保持线性复杂度的同时获得动态感受野。
中继令牌如何缩短传播距离?
中继机制的动作很具体:在做状态空间更新之前,把可学习的全局 token 均匀插入输入序列。序列因此被切成多个子空间,每个子空间内的局部状态先把信息传给邻近中继 token,中继 token 再向其他子空间广播。这样远端 token 不再依赖一步步递推,而是经由中继点中转。
论文用无线通信中的中继节点作类比,但随后对应到真实计算:子空间内是密集局部传递,子空间之间是经由中继的稀疏序列到令牌流。隐注意力可视化显示,无中继时能量集中在对角线附近,有中继后出现跨段亮斑与纵向传播条带。
超参数选择上有明确证据:平均视频约 9 秒时,中继数为 1 或 2 几乎无收益甚至更差,因为每个子空间仍太长;增至 8 时达到峰值,与解码查询数的分布较匹配;继续增大则因过度切分阻碍全局信息流且增加复杂度而下降。
中继令牌 × 长距离衰减: 长距离衰减指状态空间模型中 token 间作用随距离按控制矩阵幂指数衰减,远端信息难以保留;中继令牌指均匀插入序列的可学习全局 token,负责在子空间内汇聚局部信息再向其他子空间广播。搭配的原因是直接增大状态维度代价高,而稀疏中继点可以切断过长递推链,组合后形成序列到令牌再到序列的稀疏信息流,扩大有效感受野。
解码器如何让每个查询只看相关片段?
解码器每层包含可变形交叉状态空间模块、多头自注意力、可变形交叉注意力与前馈网络。查询初始化来自融合后的视听分类特征重复多次,提议初始化来自融合特征经多层感知机生成,目的是给集合匹配一个较好的起点以帮助收敛。
可变形交叉扫描的动作是:每个查询用自己的锚框中心与时长作参考,经多层感知机预测多尺度偏移,按中心加偏移乘时长一半得到可变形点,再用双线性插值从编码器输出采样,展平后拼接一个可学习空 token,送入前向状态更新,只保留最后的聚合 token 作为查询的新特征。随后多头自注意力建模查询间关系,可变形交叉注意力再让查询关注音视频上下文,前馈网络更新查询并预测中心与时长的修正量。
这种设计与普通交叉注意力的区别在于检索后多了 1 次状态压缩:不是直接加权求和,而是让采样序列经过递推聚合,用末尾 token 携带查询相关的子空间记忆。论文讨论部分指出该模块可推广到音频与视频两条独立序列的对应学习,但本文只用于伪造查询与特征之间的建模。
伪造查询 × 可变形交叉扫描: 伪造查询指解码器中每个代表一个潜在伪造段的向量,携带中心与时长先验;可变形交叉扫描负责以该先验为参考预测多尺度偏移并从编码器输出中插值采样相关特征。搭配的原因是大部分帧为真实帧,若对全序列做无差别递推会被非伪造信息淹没,组合后每个查询只划分出自己关心的子状态空间做前向聚合,从而提高对稀疏伪造的敏感度。
可变形交叉注意力 × 可变形交叉状态空间: 可变形交叉注意力负责让查询在参考点周围做稀疏加权求和,擅长全局相关性建模但计算量较高;可变形交叉状态空间负责让查询对应的采样序列经过前向状态更新并只保留末尾聚合 token,擅长时序递推压缩。搭配的原因是前者提供显式 token 到序列的检索灵活性,后者提供线性复杂度的时序记忆,论文在解码器每层同时保留两者以兼顾检索精度与效率。
训练用什么信号约束定位与中继?
任务相关损失沿用集合预测做法,包含匈牙利匹配损失与视频级交叉熵损失。前者对匹配后的提议计算分类与回归损失,后者对最终查询经分类器得到的视频级分数计算真伪损失。最终提议用作伪造段预测,最终查询用作视频级分数。
中继相关的两个辅助损失各有分工。增强损失计算每个中继 token 与其邻近非中继子序列平均表示的余弦相似度并取负,鼓励汇聚局部信息。协同损失鼓励中继 token 间相似矩阵逼近缩放单位矩阵,以最小化互信息近似并减少冗余,目标自相似系数设为 1。
\[Lenh = −1\]上式为增强损失的定义形式,符号含义是中继数归一化后的邻域相似度平均。优化方向是最大化中继与其邻域的一致性。
\[Lcoop = min\]上式为协同损失的近似形式,符号含义是相似矩阵与缩放单位矩阵的平方误差,包含非对角线去相关与对角线逼近目标两项。
总损失是四项加权组合,论文在实现细节中给出两项辅助权重的取值为 0.5 与 0.2。训练时特征骨干冻结,只有融合、编码、解码与偏移预测等部分更新。论文未报告梯度是否截断到插值坐标的具体路径,因此复现时应按双线性插值的标准可微实现处理,不做额外推定。
增强损失 × 协同损失: 增强损失负责拉近每个中继令牌与其邻近非中继子序列平均表示的余弦相似度,使中继点真正汇聚局部信息;协同损失负责让中继令牌间的相似矩阵逼近缩放单位矩阵,降低令牌间互信息与冗余。搭配的原因是只增强汇聚会导致多个中继点 collapse 为相同表示,只强调多样性又会使中继点脱离局部内容,两者联合才能同时保证局部代表性与全局分工。
在什么数据与条件下比较?
数据集为两个音视频深度伪造基准。LAV-DF 包含 78K 训练、31K 验证、26K 测试样本;AV-Deepfake1M 更大更难,含 746K、57K、343K 样本且伪造更细粒度。评估指标为不同交并比阈值下的平均精度与不同提议数下的平均召回,视频级检测用曲线下面积。指标方向都是越高越好。
实现条件交代较完整:采用在 VoxCeleb2 与 LRS3 上预训练的 Raven 视听编码器;视频采样为 25 fps、音频采样为 16 kHz、帧尺寸为 224×224 pixels、80-bin 梅尔谱、40 ms Hamming 窗与 40 ms 跳长;每次输入 8 秒,对应 200 帧与 256 维;6 个特征层级、3 个解码层、每尺度采样 6 点、查询数 60、中继数 8;批量 32,AV-Deepfake1M 训练 30 轮、LAV-DF 训练 100 轮,优化器为 AdamW 加余弦调度与 5 轮热身,学习率 2e-4,8 卡 RTX 3090。
比较条件上,效率对比把特征提取计入计算与推理时间,并区分总参数与可训练参数,以照顾特征提取器不同的情况。鲁棒性测试从 2 个数据集中抽 2500 条视频,施加 6 种视觉与 4 种音频退化各 5 档强度,共 125000 条退化视频,用平均精度比较。
主结果与效率 trade-off 是什么?
要回答的问题是:在同为音视频输入的条件下,新结构是否同时带来定位精度与效率收益。公平条件是与公开音视频方法及同骨干的纯变换器基线比较,指标方向为平均精度与平均召回越高越好,计算量与延迟越低越好。
下表截取原文效率矩阵中的 3 条可运行基线,用于说明模型规模与推理代价的相对位置。表头单位保留原文写法,时间列为每视频推理时间。
| Method | Total[M] | Train[M] | FLOPs[G] | Time[ms] # DS-SSM DC-SSM Lenh Lcoop mAP mAR AUC |
|---|---|---|---|---|
| BA-TFD | 5.5 | 5.5 | 948.1 | 605 |
| BA-TFD+ | 152.9 | 152.9 | 218.2 | 681 |
| UMMAFormer | 165.9 | 49.72 | 1563.9 | 857 |
表后解释需要同时看到收益与代价。论文报告该方法可训练参数比 UMMAFormer 与 BA-TFD+ 分别少 28.92M 与 132.1M,计算量约为前者的六分之一,速度数倍领先;相比自建的 FullFormer,参数略增但计算与推理时间明显下降。代价是查询与中继等超参数需要调参,且效率统计包含特征提取,具体占比与硬件有关,换硬件后绝对毫秒数会变化。
定位精度的关键数字放在第二张整理表中,全部来自原文连续句中的逐字数字,数字与百分号及指标表述写在同一格,避免把不同阈值与不同提议数的差值混入模型列。
| 比较对象 | 指标组 | 基线说明 | 提升数字与指标同格 | 平均提升 |
|---|---|---|---|---|
| DiMoDif | 平均精度 | 次优模型 | by 5.1%, 2.7%, 2.5%, and 4.15% in mAP@{0.5, 0.75, 0.9, 0.95} | average improvement of 3.6% |
| DiMoDif | 平均召回 | 次优模型 | of mAR under 50, 30, 20, 10, and 5 proposals, achieves gains of 4.6%, 3.3%, 1.1%, and 1.4% | averaging a 2.2% improvement |
| 普通状态空间基线 | 三指标 | Line 1 | improves mAP by 28.4%, mAR by 19.1%, and AUC by 9.9% | 全模块叠加总增益 |
| 仅双可变形无中继损失 | 三指标 | Line 4 | surpassing Line 4 by 3.1% mAP, 3.6% mAR, and 1.1% AUC | 双中继损失再增益 |
表后解释是:第一组数字支持在更难的 AV-Deepfake1M 上对次优模型的全面超越,平均提升 3.6%,平均召回平均提升 2.2%;第二组数字支持可变形与中继模块的叠加有效性,相对普通状态空间基线提升显著,而两个中继损失在双可变形基础上再带来数个百分点的增益。限制是这些是相对提升的报告,未给出每阈值绝对值的方差与显著性,且 LAV-DF 上部分阈值只排第二,说明优势与数据分布有关。
鲁棒性曲线如下图所示,实线为加扰后精度,虚线为干净基线,颜色区分方法。
看图路径: 1. 先确认每子图横轴为扰动强度 1 到 5,纵轴为平均精度百分比;2. 再区分每子图中实线为加扰后精度,虚线为干净视频基线;3. 先横向比较上排五种视觉扰动下四条曲线的相对高低;4. 再纵向比较下排音频高斯噪声与音高偏移子图中绿色与粉色曲线的分叉
论文图 3。原论文 Figure 3:“Robustness evaluation under various compression and degradation scenarios.”。
该图显示:新方法在干净视频上起点最高,在颜色对比、高斯模糊、音高偏移与 3 类压缩下保持稳定;在强噪声等退化下所有方法都下降,但新方法仍高于基线。像素不能精确读出每档数值,因此只做趋势判断,不硬写具体百分点。未胜出项是部分高强度噪声下差距收窄,说明声学与视觉严重失真仍是边界。
拿掉哪个部件会怎样?
消融在 AV-Deepfake1M 全测试集上进行,基线是把全部可变形状态空间换成普通状态空间并去掉中继损失。逐项加入可变形自扫描与可变形交叉扫描都提升性能,其中交叉扫描增益更大,论文给出的有限解释是无中继时自扫描受长距离衰减影响更重,而交叉扫描直接增强查询与特征序列的交互,对提议精修更关键。两者结合进一步提升,两个中继损失各带来中等增益,同时使用时最好。
中继数与视频时长的关系如下图所示,左为令牌数消融,右为时长泛化。左图灰色虚线为无中继基线,橙色为有中继;右图橙色为有中继,蓝色为无中继。
看图路径: 1. 先看左子图横轴中继令牌数与纵轴平均精度,确认 8 处星标为峰值;2. 再看左子图灰色虚线代表的无中继基线,比较 1 到 2 处是否低于基线;3. 再看右子图横轴视频时长从 5 秒到 35 秒,确认两条曲线的差距随长度变化;4. 最后对比右子图 5 秒处两点几乎重合而长视频处橙色持续高于蓝色
论文图 4。原论文 Figure 4:“(a) Ablation study on the number of relay tokens (avg. video length: 9s). (b) Performance vs. video duration.”。
该图支持两个判断:中继数存在峰值,最优为 8,过少不能缩短子空间,过多数导致过度切分;视频越长,有中继的衰减更慢,短视频上无中继反而略好,长视频上差距拉大。这与中继用于缓解长距离衰减的机理一致,但也表明短视频场景下中继并非必要,存在额外开销与调参代价。
哪些结论还不能下?
论文直接报告的是精度、召回、曲线下面积、参数量、计算量与推理时间的相对优势,有明确数据集与硬件条件。有限解释包括中继数与查询数对齐、交叉扫描更关键等机理解释,有消融趋势支持但未做因果干预之外的验证。
未验证的推测不应视为承诺:未测量误判率分布、每步延迟抖动与实际部署帧率,不能从平均推理时间直接推出实时性;未报告偏移预测的稳定性与插值越界处理,不能推定所有视频长度下都无额外截断;资源状态方面,未发现来源绑定且完成验证的开源资源,因此不能声称代码、模型或数据当前可用,复现需按论文文字重写。
另一个边界是特征骨干冻结且为特定预训练,换骨干或解冻后结论是否成立待验证;鲁棒性只覆盖 10 种传输扰动,未覆盖对抗攻击与跨数据集迁移。
复现“可变形状态空间如何盯住稀疏而模糊的伪造边界”前要核对哪些细节?
先按实验条件固定数据划分、采样与特征:25 帧每秒、8 秒窗口、200 长度、256 维、6 层金字塔、60 查询、8 中继、每尺度 6 采样点、损失权重 0.5 与 0.2、AdamW 与余弦调度。先复现冻结骨干下的 FullFormer 基线,再逐个替换为可变形自扫描、可变形交叉扫描与中继损失,用平均精度、平均召回与曲线下面积三指标核对。
实现时注意时间参考点的归一化公式、偏移与参考相加后的双线性插值、交叉扫描中拼接空 token 后只取末尾聚合 token 的细节。评估时保持交并比阈值集合与提议数集合与原文一致,区分百分点与相对百分比,同一数值在不同指标下不可混用。
还需补的验证是多次随机种子的方差、不同视频时长分桶的绝对精度、以及去掉任一解码器注意力分支后的对照,以确认收益确实来自状态空间改造而非查询初始化或后处理差异。
何时值得尝试这个方案?
当任务是长视频中的稀疏伪造定位、边界模糊且对推理效率敏感时,该方案值得尝试:可变形采样解决边界附近的上下文选择,中继令牌解决长序列记忆,查询相关的交叉扫描解决稀疏检索,三者分别对应论文提出的 3 个挑战。
当视频很短、伪造占比很高或计算预算极度受限时,应先评估必要性:短视频上中继收益小,中继数与查询数需要联合调参,偏移预测与多尺度插值会增加实现复杂度。总体上,这是一种用少量可学习偏移与稀疏全局 token 换取精度与效率平衡的思路,其最强证据是困难数据集上的相对提升与效率矩阵上的参数量和计算量下降,主要代价是超参数敏感与对冻结特征的依赖。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



