📄 Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

标签:#多模态模型 #自监督学习 #音频伪造检测 #音频理解 #Transformer

7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5

7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频伪造检测 | #多模态模型 | #自监督学习 #音频理解 | arxiv

👥 作者与机构

  • 第一作者:Jielun Peng(Harbin Institute of Technology)
  • 通讯作者:Xiaopeng Hong(Harbin Institute of Technology)
  • 作者列表:Jielun Peng(Harbin Institute of Technology)、Yabin Wang(Harbin Institute of Technology)、Yaqi Li(Harbin Institute of Technology)、Jincheng Liu(Harbin Institute of Technology)、Xiaopeng Hong(Harbin Institute of Technology)、Athanasios V. Vasilakos(University of Agder)

💡 毒舌点评

论文找到了通用AIGC音视频检测中的真问题——跨模态对齐假设的失效,且用实验数据有力地证伪了它。但方法层面的回应,尤其决策级融合,过于简单粗暴,max规则与独立性假设几乎是把问题本身又当成了答案,复杂度全压在双塔的单模态设计上,却对“如何更好地融合”这一核心后续问题几乎交白卷。

📌 核心摘要

本文针对通用AIGC音视频伪造检测,指出传统多模态检测器所依赖的音视频内容对应假设在一般场景下不再成立,甚至会产生低于0.5 AUC的误导效果。为此提出DAV-Det,采用完全解耦范式,独立提取音频与视觉的鉴伪线索,以决策级融合做最终判断。视觉检测器基于DINOv3,构建全局、块级、片段级多粒度表征,辅以多重实例学习弱监督与退化-原始一致性学习;音频检测器基于PEAV,设计门控时频双分支结构分别捕获时间动态与频谱异常,以交叉注意力融合得到统一表征。在IJCAI-ECAI 2026 DDL 2.0通用AIGC音视频检测挑战赛中排名第一,最终得分0.8460,二分类AUC达0.9617。在FakeAVCeleb上以0.998 ACC/0.999 AUC超越现有音视频方法。消融实验证实了多粒度表征、弱监督损失、DOCL策略以及时频双分支设计的有效性。

主要实验结果表:

FakeAVCeleb对比实验:

方法ACCAUC
VFD0.8150.861
AVoiD-DF0.8370.892
MCL0.8600.896
MRDF-CE0.9410.924
AVFF0.9860.991
PIA0.9870.998
FoVB0.9850.997
DAV-Det0.9980.999

DDL 2.0挑战赛Top-5结果:

团队最终得分二分类得分四分类得分二分类AUC二分类ACC四分类F1四分类AP
HIT VIRLAB (Ours)0.84600.93790.78470.96170.91900.68730.7274
ZJSU0.84380.93950.78000.94900.92170.68470.7149
VeriLens0.84260.92880.78510.92880.91060.68560.7096
AIGVDete0.84060.93960.77460.94800.91870.67260.7191
MVADetection Team0.83490.92780.77290.94470.90000.65300.7167

该方法为通用AIGC音视频检测提供了简洁且有效的范式,解耦思路对场景适应性强。主要局限在于未利用视频帧间时序信息,且融合策略为人工启发式,缺乏自适应性。

🔗 开源详情

  • 代码:https://github.com/tuffy-studio/DAV-Det
  • 模型权重:论文中未提及
  • 数据集
    • MVAD 数据集 (Hu et al., 2025):DDL-GAV 挑战赛基准,论文未直接给出下载链接或协议
    • FakeAVCeleb 数据集 (Khalid et al., 2021):论文未直接给出下载链接或协议
  • Demo:论文中未提及
  • 复现材料:论文提供了详细的训练配置(视觉检测器 DINOv3 ViT-L/16, AdamW, lr=1e-4, cosine schedule, 20 epochs, 8×L20 GPU;音频检测器 PEAV-base, AdamW, lr=1e-4, 4×L20 GPU, batch size 512 等),但未明确提到是否提供模型检查点文件或附录中的详细配置文件。
  • 论文中引用的开源项目
    • DINOv3 (Siméoni et al., 2025):未直接给出链接
    • LoRA (Hu et al., 2022):未直接给出链接
    • PEAV (Vyas et al., 2026):未给出链接
    • FaceX-Zoo (Wang et al., 2021):用于人脸裁剪,未给出链接

🏗️ 方法概述和架构

DAV-Det采用完全解耦的双塔结构,不对音视频做任何特征层面的交互。整体流程分为预处理、视觉AIGC检测器、音频AIGC检测器以及决策级融合四部分。

下图展示了所提出的DAV-Det的整体架构,该架构完全解耦地处理音频和视觉流。

Figure 2: DAV-Det decouples visual and audio forgery detection into modality-specific branches.

图中清晰地展示了视觉检测器的多粒度表征构建(全局、块、片段)、音频检测器的门控时频双分支结构以及最终的决策级融合流程。

预处理:将 MVAD 数据集拆分为音频数据集 \(\mathcal{D}_a\) 和图像数据集 \(\mathcal{D}_v\)。\(\mathcal{D}_a\) 直接提取波形,标签为真实或伪造。\(\mathcal{D}_v\) 为平衡类别,从真实视频均匀采样8帧,从伪造视频均匀采样16帧,所有采样图像继承视频级标签。

视觉AIGC检测器

  1. 特征提取:以 DINOv3 ViT-L/16 为主干,应用 LoRA(秩32,alpha 16)进行参数高效微调,提取 CLS 全局令牌 \(c \in \mathbb{R}^{D}\) 和所有块令牌 \(\{p_i\}_{i=1}^N\)(\(D=1024\))。
  2. 多粒度表征构建:构建三层表征以捕获不同空间粒度的伪造痕迹。
    • 全局表征:直接使用 CLS 令牌 \(c_v\)。
    • 块级表征:通过一个两层 MLP 评分网络 \(Q_p(\cdot)\) 估计每块的伪造 logit,经温度 softmax(\(\tau=0.07\))归一化得权重 \(w_i^p\),加权聚合所有块令牌得到 \(p_{agg}\)。
    • 片段级表征:先对所有块令牌做凝聚聚类(余弦相似度阈值0.9),得到 \(K\) 个空间互斥的片段;每个片段平均池化得片段令牌 \(s_k\),经另一两层MLP评分网络 \(Q_s(\cdot)\) 得伪造 logit,同样经温度 softmax 归一化后加权聚合得到 \(s_{agg}\)。
  3. 弱监督机制:因缺乏块/片段级标签,采用多重实例学习。对真实图像,选取 top-k 比例(块 0.05,片段 0.1)的实例伪造 logit 取平均,得到图像级预测,应用 focal loss(\(\mathcal{L}_{\text{MIL}}\))。同时引入 margin loss(\(m=0.6\)),鼓励 top-k 实例与其余实例的 logit 差距大于预设 margin(\(\mathcal{L}_{\text{margin}}\))。两者构成弱监督损失 \(\mathcal{L}_{\text{weak}}\)。
  4. 分类器网络:主分类器为三层 MLP,输入为拼接的多粒度表征 \([c_v, p_{agg}, s_{agg}]\)。同时引入三个辅助分类器分别作用于单一粒度,均用 focal loss 监督(\(\mathcal{L}_{\text{sup}}\)),迫使各层级学习有效鉴别特征。推理时仅用主分类器。
  5. 退化-原始一致性学习:对同一原始图像 \(x_v^{ori}\),施加几何变换、噪声、模糊、色彩失真、JPEG 压缩等扰动生成退化版本 \(x_v^{deg}\)。要求原始图像与退化图像的多粒度表征(\(c_v\), \(p_{agg}\), \(s_{agg}\))余弦相似度尽量高,通过停止梯度操作使梯度仅向前传播至退化侧(\(\mathcal{L}_{\text{con}}\))。总视觉损失 \(\mathcal{L}_v\) 为原始图、退化图上的监督与弱监督损失,加上权重 0.05 的一致性损失。

音频AIGC检测器

  1. 特征提取:以 PEAV-base 音频编码器为主干,应用 LoRA(秩32,alpha 64),提取 CLS 令牌 \(c_a\) 和帧令牌序列 \(\{f_t\}_{t=1}^T\)。
  2. 门控时频双分支架构:先通过一个两层MLP门控网络 \(G(\cdot)\) 产生与帧序列同尺寸的软掩码 \(W\),逐元素调制帧特征得到 \(\{\tilde{f}_t\}\)。
    • 时间分支:对调制特征使用自注意力建模帧间依赖得 \(F_{\text{temp}}\),然后输出平均池化、最大池化和可学习查询池化三种时间表征。
    • 频谱分支:对相同调制特征施加通道注意力强调谱相关模式得 \(F_{\text{spec}}\),同样产出三种谱域表征。
  3. 统一表征与分类:CLS 令牌 \(c_a\) 通过交叉注意力自适应聚合上述时间/频谱多尺度信号,得到统一音频表征 \(m\)。将 \(m\) 与六个池化表征拼接为 \(\mathbf{r}\),送入三层 MLP 分类器,训练采用 focal loss。

决策级融合

  • 推理时,视觉侧均匀采样16帧,取帧级 logit 平均得视频级伪造概率 \(p_v^{Fake} = \sigma(\bar{l}_v)\)。
  • 音频侧以3秒窗口、3秒步长滑动,取窗口级 logit 平均得音频级伪造概率 \(p_a^{Fake} = \sigma(\bar{l}_a)\)。
  • 二分类:以 \(\max(p_a^{Fake}, p_v^{Fake})\) 为最终伪造概率。
  • 四分类:在独立性假设下计算联合概率分布 \((p_{RR}, p_{FF}, p_{FR}, p_{RF})\),取最大概率类别。

💡 核心创新点

  • 音频-视觉对应假设的实证证伪:在 FakeAVCeleb 和 MVAD 上使用 PEAV 特征量化音画相似度分布与 AUC,明确展示通用 AIGC 场景下,伪造样本相似度甚至高于真实样本,导致传统检测 AUC 仅为 40.28%(低于随机猜测)。这为解耦设计提供了坚实动机。
  • 完全解耦的音视频AIGC检测范式:系统性将音频和视觉鉴伪完全独立建模,以决策级融合替代特征级交互,规避了通用场景中弱对应引入的跨模态噪声。
  • 视觉多粒度表征与MIL弱监督:在全局、块、片段三个层级同时建模,并以 MIL 提供块/片段级弱监督,使得模型能定位多种空间尺度的伪造伪影。
  • 门控时频双分支音频检测:通过门控机制自适应调制特征,再分别从时间动态和频谱异常两个维度抽取多池化表征,以交叉注意力融合,能更完整捕获合成音频的时频差异。
  • 退化-原始一致性学习:在训练时迫使同一图像的原始版与多重扰动版的多粒度表征保持一致,提升了检测器对真实世界图像退化的鲁棒性。

下图直观展示了传统跨模态对齐假设在通用AIGC场景下的失效,为本文的解耦设计提供了动机。

Figure 1: Audio-video feature similarity distributions across real and generated samples.

图中可见,在通用MVAD数据集上,真实与伪造样本的音视频相似度分布发生逆转,导致基于该相似度的检测AUC低于0.5,这直接证伪了传统假设。

📊 实验结果

主要实验在两个基准上进行:

DDL-GAV 挑战赛(基于 MVAD):DAV-Det 在 IJCAI-ECAI 2026 DDL 2.0 Workshop 竞赛中排名第一,最终得分 0.8460。其包含二分类得分 0.9379 和四分类得分 0.7847。二分类 AUC 0.9617(领先第二名 1.27%)、ACC 0.9190;四分类 F1 0.6873、AP 0.7274。

FakeAVCeleb 对比实验:DAV-Det 取得 0.998 ACC 和 0.999 AUC,超越 AVFF、PIA、FoVB 等现有音视频方法。


DDL-GAV 挑战赛 Top-5 结果

排名团队最终得分二分类得分四分类得分二分类 AUC二分类 ACC四分类 F1四分类 AP
1HIT VIRLAB (Ours)0.84600.93790.78470.96170.91900.68730.7274
2ZJSU0.84380.93950.78000.94900.92170.68470.7149
3VeriLens0.84260.92880.78510.92880.91060.68560.7096
4AIGVDete0.84060.93960.77460.94800.91870.67260.7191
5MVADetection Team0.83490.92780.77290.94470.90000.65300.7167

表 2:AIGC 音视频检测挑战赛前五名团队结果。最优结果以粗体标出,次优结果以下划线标出。本文方法(HIT VIRLAB)以最高最终得分位列第一,并在二分类 AUC 和四分类 F1、AP 上取得领先,展现出在二分类伪造检测和细粒度四分类任务上的综合优势。


FakeAVCeleb 对比实验

方法ACCAUC
VFD0.8150.861
AVoiD-DF0.8370.892
MCL0.8600.896
MRDF-CE0.9410.924
AVFF0.9860.991
PIA0.9870.998
FoVB0.9850.997
DAV-Det (Ours)0.9980.999

表 3:在 FakeAVCeleb 上与现有音视频方法的比较。DAV-Det 达到了最优的 ACC 和 AUC,表明即使在以人为主体的传统深度伪造场景中,解耦检测范式依然能有效捕获各模态的独立鉴伪线索,实现优于强基线方法的检测精度。


消融实验(在重新划分的验证集上)

视觉侧多粒度设计消融

全局分支块级分支片段分支ACCAPAUCF1
0.97420.96950.98950.9181
0.97570.97060.99160.9228
0.98360.98790.99690.9482

表 4:视觉检测器中多粒度表征的消融实验。依次引入块级和片段分支后,所有指标均持续提升,完整模型取得了最高的 ACC、AP、AUC 和 F1,验证了同时利用全局、局部块级和空间片段级信息对捕获不同层次伪造痕迹的有效性。

视觉侧策略消融

方法ACCAPAUCF1
去除弱监督损失0.97640.97730.99200.9252
去除辅助分类器0.98030.98560.99510.9437
去除 DOCL 策略0.97500.97490.99250.9210
完整模型0.98360.98790.99690.9482

表 5:视觉检测器中弱监督损失、辅助分类器和退化-原始一致性学习(DOCL)的消融实验。移除任一组件均导致性能下降,其中去除 DOCL 策略或弱监督损失带来的降幅更为明显,说明保持多粒度表征在退化视图下的一致性以及对块级、片段级评分网络施加弱监督对整体性能至关重要。

音频侧时频双分支消融

时间分支频谱分支ACCAPAUCF1
0.97000.97590.99140.9302
0.97360.97830.99170.9387
0.97240.97730.99040.9358
0.97910.98290.99420.9435

表 6:音频检测器中时频双分支设计的消融实验。仅使用 CLS 令牌的分类基线已表现良好,但单独加入时间分支或频谱分支均可进一步提升性能;同时结合两者达到了最优的 ACC、AP、AUC 和 F1,表明时间动态与频谱异常为音频 AIGC 检测提供了互补的伪造线索。


关键结论

  1. 解耦范式在通用场景中具备更强的鲁棒性:在包含多种视觉域和内容类别的 MVAD 挑战赛上,DAV-Det 以完全独立的双塔结构实现了最高的最终得分,尤其在二分类 AUC 和四分类 F1/AP 上大幅领先,验证了避免特征级音视频交互、转向决策级融合在面对音视频内容不对应问题时的优势。
  2. 多粒度视觉表征是捕获伪造痕迹的关键:从全局到局部块再到空间片段的分层设计在消融实验中持续带来性能增益,完整三粒度模型的 AUC 达到 0.9969,表明不同粒度的线索在伪造检测中具有互补性。
  3. 视觉训练策略的有效性:弱监督损失、辅助分类器和 DOCL 策略均对最终性能有正向贡献,尤其是 DOCL 通过强制原始图与退化图在多粒度表征上保持一致,显著提升了模型的鲁棒性。
  4. 时频双分支音频分析提供互补鉴别力:在音频侧,同时建模时间动态和频谱异常比单一分支或仅用 CLS 令牌的方法更优,ACC 提升至 0.9791,说明两类声学伪影对于音频伪造检测的必要性。
  5. 跨域泛化能力得到初步验证:在面向人脸深度伪造的 FakeAVCeleb 上,解耦方法仍取得最优的 0.998 ACC 和 0.999 AUC,表明独立挖掘单模态鉴伪线索的策略具有良好的场景迁移能力。

🔬 细节详述

  • 训练数据:MVAD 数据集,视频侧构建图像集时真实视频采样8帧、伪造视频采样16帧以平衡类别;音频侧直接提取波形。消融实验所用训练/验证集按 9:1 随机划分。
  • 损失函数:视觉侧包括原始图像与退化图像上的监督损失 (focal loss, 主分类器+三个辅助分类器)、弱监督损失 (focal loss + margin loss),以及 DOCL 余弦一致性损失(权重 0.05)。音频侧仅 focal loss。
  • 关键超参数:视觉主干 DINOv3 ViT-L/16,LoRA rank=32, alpha=16;MIL top-k 比例 patch 0.05, segment 0.1;margin loss margin=0.6;softmax 温度 \(\tau=0.07\);聚类余弦相似度阈值 0.9。音频主干 PEAV-base,LoRA rank=32, alpha=64。
  • 训练策略:视觉检测器用 AdamW(权重衰减 5e-2),学习率 1e-4,余弦衰减,warmup 2 epoch,总 epoch 20,总 batch size 112(8张 NVIDIA L20 GPU),梯度累积间隔 16。音频检测器同样 AdamW,学习率 1e-4,batch size 512(4张 NVIDIA L20 GPU),warmup 2 epoch,20 epoch。
  • 退化扰动参数:论文以表格形式列出了几何变换(水平翻转、旋转、平移、缩放)、噪声(高斯、脉冲、散斑、泊松)、模糊(高斯、镜头散焦、均值)、色彩失真(饱和度、灰度、量化)、光度变换(增亮、变暗、对比度)及 JPEG 压缩等具体方法。
  • 推理细节:视觉采样16帧取平均 logit;音频滑动窗口 3s/3s 取平均 logit。二分类 max 融合,四分类假设独立性取最大联合概率。
  • 正则化/稳定技巧:LoRA 微调,DOCL 一致性约束,停止梯度操作。未提及 dropout。

⚖️ 评分理由

  • 创新性 (1.2/2):实证证伪了传统音频-视觉对应假设,提出完全解耦范式,并将视觉多粒度表征(全局/块/片段)与MIL弱监督、门控时频双分支音频检测及退化-原始一致性学习相结合,组件新颖;但决策级融合仅依赖max规则和独立性假设,创新高度受限。

  • 技术严谨性 (1.0/1.5):视觉多粒度设计与MIL、DOCL一致性约束技术推导较严谨,但融合策略采用启发式max和四分类独立性假设且未验证其合理性,未考虑联合生成场景的可靠性,也缺乏单模态失效时的纠错机制,视觉侧缺失时序建模,整体严谨性较弱。

  • 实验充分性 (1.0/1.5):在DDL-GAV和FakeAVCeleb上取得领先,消融实验系统验证了多粒度、时频分支等组件;但跨数据集泛化评估局限于两个基准,缺少真实通路退化鲁棒性测试、融合策略消融、音频可解释性分析及对强相关伪造场景的验证,实验深度不足。

  • 清晰度 (0.8/1):文章结构清楚,方法与实验描述具体,图表(如架构图和消融表)辅助理解;但未充分讨论四分类独立性假设的动机与影响,音频门控与交叉注意力的可解释性分析缺失,使部分设计理解深度受限。

  • 影响力 (1.0/1.5):在IJCAI-ECAI 2026 DDL挑战赛排名第一,FakeAVCeleb上达到最优,提出的解耦范式为通用AIGC音频视频检测提供了新视角;但通用场景检测仍处早期,社区影响有待后续工作验证。

  • 开源 (1.0/1.5):代码已在GitHub公开,但未提供预训练模型权重,仅开放部分核心产物,降低了完整可用的开源程度。

  • 可复现性 (0.3/0.5):论文详细记录了训练超参数、GPU数量、优化器配置和数据预处理,但未提供模型检查点或完整的配置文件,复现仍需额外工程投入,存在关键部件缺失。

  • 工程/实践价值 (1.2/1.5):解耦双塔结构避免跨模态交互,实现简单、易部署,在竞赛中以最高得分获胜体现出明确的实用价值;但缺少延迟、吞吐等工程指标,且简单融合规则可能限制复杂场景的可靠性。

🚨 局限与问题

论文明确承认的局限

  • 视觉检测器未显式建模帧间时序依赖,无法捕获运动不一致等动态伪造痕迹。
  • 决策级融合依赖启发式规则(二分类max、四分类独立性假设),未发挥自适应融合的潜力。
  • 实验主要在单一竞赛基准上进行,跨数据集的泛化性尚未验证。

审稿人发现的潜在问题

  1. 视觉检测的动态能力缺失:仅用静态图像训练,面对仅视频生成模型伪造的纯动态纹理或对象运动失真将完全无能为力,这是该设计在视频伪造检测场景中根本性的能力短板。
  2. 四分类独立性假设过于理想且无验证:在真实场景中音视频伪造经常联合出现(例如 AI 全生成视频 FF),独立性假设可能严重低估 \(p_{FF}\),导致四分类失准。论文未通过消融或对比实验验证该假设的合理性,也未观察其对 \(p_{FF}\) 召回的影响。
  3. 未讨论单模态失效时的纠错机制:max 融合策略意味着任何一方的误报都将直接导致最终假阳性,在单一模态存在强噪声或域外分布时鲁棒性堪忧,且设计上没有置信度校准或基于阈值/置信度的表决机制来缓解此问题。
  4. 音频检测分支的可解释性缺失:门控与交叉注意力的输出缺乏可视化或归因分析(例如,频谱分支是否真在关注高频 artifact?),难以判断该复杂设计是否按照预期运行。
  5. 缺少对真实世界通路退化的鲁棒性测试:虽然训练中增加了 DOCL,但推理时未评估在不同视频编码比特率、音频压缩格式、传输丢包等实际通路失真下的性能退化情况,仅用训练时的数据增强不足以证明实际鲁棒性。
  6. MVAD上的动机验证不够彻底:图1显示MVAD上真实样本相似度有时甚至更低,作者仅用“内容无关”解释。如果AI生成的视频恰好配了更“和谐”的音频,这是否意味着解耦范式在遇到此类“强相关伪造”样本时反而是弱势?对此未作讨论。

← 返回 2026-07-30 语音/音乐/音频论文速递