英文题目:Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection

会议身份:conference:cvpr:2026:conference-paper-id:Li_Omni-Fake_Benchmarking_Unified_Multimodal_Social_Media_Deepfake_Detection_CVPR_2026_paper

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #强化学习 #音视频 #音频深度伪造检测

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Tianxiao Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhenglin Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Haiquan Wen:机构信息未能从会议 PDF 纯文本可靠映射
  • Yiwei He:机构信息未能从会议 PDF 纯文本可靠映射
  • Xinze Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Bingyu Zhu:机构信息未能从会议 PDF 纯文本可靠映射
  • Wuhui Duan:机构信息未能从会议 PDF 纯文本可靠映射
  • Congang Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Zeyu Fu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yi Dong:机构信息未能从会议 PDF 纯文本可靠映射
  • Baoyuan Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiangtai Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Guangliang Cheng:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

社交媒体深度伪造检测需同时处理图像、音频、通用视频与音视频说话头四类输入,并统一输出真伪标签、篡改定位与自然语言解释,难点在于生成器快速迭代、跨平台压缩破坏痕迹与部分篡改的细粒度歧义。该工作先构建覆盖四模态的大规模同分布与异分布基准,再以课程监督微调引入各模态并用回放保留旧能力,最后用组序列策略优化统一对齐检测定位解释奖励。相比单模态专用检测器与仅做二分类的视觉语言模型,其差异在于单一全模态大模型输出结构化三元组并显式优化空间与时间交并比。在 Omni-Fake-Set 图像验证集上统一模型检测准确率达到 91.92%,在 Omni-Fake-OOD 音频子集上准确率为 83.85%,均超越同表最强基线。结论仅适用于论文所列生成器家族与社交媒体退化范围,对未见操纵语义与强对抗自适应攻击的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么?为什么社交媒体伪造需要四个模态一起评?

这篇论文的输入是社交媒体时间线上真实混杂的 4 类内容:图像、音频、通用视频和带声音的讲话头视频。目标不是只给一个真假分数,而是对任意输入输出结构化三元组:全局真假标签、篡改位置、自然语言解释。必须保留的信息是标签空间的划分:对图像、音频和通用视频采用真实、部分篡改、完全合成三分类;对讲话头视频采用真实与完全合成二分类,局部编辑的讲话头归入通用视频设置以支持细粒度定位。

输出还要求可解析的格式,包含思考段与答案段,以及需要时出现的框标记与区间标记。 论文要解决的矛盾是生成侧已经是多模态与多平台混合,而评测侧仍是单模态、二分类、无位置。社交媒体样本经过重编码、编辑与跨平台转发,分布偏移严重,模型若只记住某种生成器的纹理或频域痕迹,换一个生成器就会失效。因此论文把检测、定位与解释放在同一协议下,要求模型既能判对,又能指对,还能讲清依据。

部分篡改 × 完全合成: 部分篡改指在真实载体上只改动局部区域或局部时间段,负责考验细粒度定位;完全合成指整张图像、整段音频或整个视频都由生成模型产生,负责考验全局真假判断。二者搭配的理由是社交媒体同时存在两种造假,论文把它们与真实样本放在同一三分类标签空间下,组合意义是让一个模型必须同时回答是全假还是局部假,并为局部假给出位置。

现有框架常把 3 个任务拆给不同模块,检测只管二分类,定位只做图像掩膜,解释只给粗粒度文本,彼此没有一致性检查。论文的判断是这种拆分在内容审核与取证中价值有限,因为审核员需要知道哪块区域或哪段时间被改,以及为什么判定为假。统一协议的意义在于用同一批标注同时约束 3 个输出,避免标签对但位置错、位置对但理由错的情况。

下面这张框架对比图把上述差距画得很直接,左侧是 3 种典型的单模态旧流程,右侧是统一处理 4 个模态并同时输出 3 类结果的新流程。初学者可以把它当作全文地图:左边的分支越往下越多,但始终缺定位或解释;右边的关键是底部 4 个模态汇入同一个模型,顶部 3 个输出同时产生。

看图路径: 1. 先看左侧三行单模态框的输入箭头与输出分支数量变化;2. 再看右侧 Omni-Fake-R1 下方四个模态输入框如何汇入同一模型;3. 最后对照右侧上方三类输出:三分类标签、掩膜与区间、细粒度解释

原论文 Figure 1:Framework comparison. Existing non-Omni meth- ods like CnnSpot \\[81\\], SIDA \\[39\\], VideoLISA \\[6\\],…

论文图 1。原论文 Figure 1:“Framework comparison. Existing non-Omni meth- ods like CnnSpot [81], SIDA [39], VideoLISA [6], and Fake- Sound [88] usually handle only single-modality inputs.”。

从像素看,左侧上方面板是单模态二分类检测器,只分真实与伪造,下方标注只有二分类、无定位、无解释;中间面板是定位检测器,多了一个部分篡改加掩膜分支,但标注说明常限于图像且无解释;下面板是可解释检测器,多了文本解释,但定位弱或缺失且解释粗。右侧面板底部虚线框内并排放置图像、视频、音频与讲话头 4 个输入示例,箭头向上汇入 Omni-Fake-R1,上方分出 3 路:三分类标签、细粒度解释、图像视频掩膜与音频区间。这种从多输入到单模型再到多输出的汇聚结构,正是后文课程学习与统一奖励要训练的对象。

同输入、同目标、同监督下已有路线差在哪里?

在同输入的基准层面,早期人脸伪造数据集奠定了真假配对评测,但只覆盖人脸与有限操作。扩散与 Transformer 生成器出现后,图像侧扩展到多样合成图像,社交媒体 grounding 数据集开始捕捉真实转发中的伪造,但仍以视觉为主。视频基准分析时间篡改却很少建模音画一致性,多模态基准虽结合视听线索,但标注分散,缺少检测、定位与解释的统一标注。

论文把 Omni-Fake 定位为可训练的大规模 4 模态语料加像素级与时间级标注,再加完全不相交的大规模分布外划分,这是与仅作评测集的问答式基准的直接区别。 在同目标的方法层面,早期检测器依赖纹理、混合边界、颜色偏移与频域痕迹等手工或卷积线索。视觉语言模型兴起后,借助语义先验区分真实与合成,视频方法建模运动异常与时间不一致,音频方法捕捉频谱痕迹与说话人韵律失配,多模态方法检测口型同步与语义错位。

但论文指出这些方法通常只给稀疏掩膜、证据不足、推理浅,且没有跨模态统一框架。相关路线是学习视觉、听觉与语言共享语义空间的大型多模态模型,论文沿此路线显式要求结构化跨模态对齐,使推理在空间、时间与语义维度 1 致。 在同监督与同运行阶段层面,训练范式分为大规模多模态预训练与结合监督微调加可验证奖励强化的后训练。与偏好优化不同,可验证奖励用客观任务信号直接反馈。

论文采用组序列策略优化,把文本、空间与时间维度的结构化奖励统一起来,促进跨模态一致性。初学者要记住的对照是:监督微调教会格式与表示,强化阶段把检测、定位与解释的任务指标直接对齐,二者不是替代关系。

要测什么?三分类与分布外划分如何定义成功?

论文把任务定义为统一多模态社交媒体伪造检测。输入是 4 个模态中任意一个样本,输出是全局标签加位置加解释。成功标准有 3 条:分类准确率与宏平均 F1 要高,定位的交并比与定位 F1 要高,解释的 ROUGE-L 与语义相似度以及专家评分要高。方向都是越高越好,定位指标只在有空间或时间标注的 3 个模态上计算,讲话头视频在本文主设置中不计算细粒度定位。 标签定义需要仔细区分。

图像、音频与通用视频的三分类中,真实是没有伪造,完全合成是整体生成,部分篡改是局部被改。讲话头的二分类聚焦身份驱动与口型驱动的人脸生成,因为这类伪造与冒充欺诈最相关。局部编辑的讲话头被放在通用视频下评测,以便仍能要求空间与时间定位。这种划分避免把不同难度的篡改混为一谈,也让分布外评测能分别考察对全假与局部假的泛化。

分布外划分的定义是内容、说话人、数据分布、操作流水线与生成模型族都与训练集严格不相交,没有任何伪造方法同时出现在两个划分中。语义上两边保持真实、部分篡改与完全合成的比例大致对齐,避免因类别不平衡带来虚假提升;生成器族则刻意错开,使性能下降能归因于未见合成技术与后处理,而非标签偏移。这是后文所有泛化结论的前提条件。

方法全景:一个样本如何走完输入到三元组输出?

沿一个样本走一遍最有助于建立依赖关系。假设输入是一段通用视频,模型先在统一任务提示下构建多模态表示,把视觉帧与音频流映射到共享空间;接着共享的多模态伪造推理模块比较帧内痕迹、帧间时间一致性与音画同步;最后结构化决策生成模块输出三部分:全局标签为真实、完全合成或部分篡改之一,定位为边界框或时间区间,解释为自然语言依据。

整个路径是输入到表示到推理到结构化输出,定位与解释不是事后外挂,而是同一解码过程的不同槽位。 数据侧的全景是 5 阶段流水线,先多源收集,再按模态构造伪造,然后统一标签空间、定位格式、任务协议与样本结构,接着构造参考答案并插入定位目标与细粒度解释,最后做质量控制并分出训练集与分布外基准。这个顺序保证了先有多样伪造,再有统一标注,最后才有可训练与可评测的划分。

训练侧的全景是 2 个阶段:先课程监督微调逐步引入模态并用回放防止遗忘,再用统一奖励的组序列策略优化直接对齐检测、定位与解释。 下面这张数据流水线图把方法的数据基础讲清,阅读时不要把它当装饰,要对照后文的数据量表理解每个阶段的产物。

看图路径: 1. 沿 Stage1 到 Stage5 自左向右看数据如何从多源收集走向统一协议;2. 比较 Stage2 中四个模态各自的构造动作有何不同;3. 确认 Stage4 的结构化回答与 Stage5 的两个基准分支

原论文 Figure 4:Data pipeline of Omni-Fake.

论文图 4。原论文 Figure 4:“Data pipeline of Omni-Fake. Our pipeline not only unifies four modalities under a common protocol, but also builds high-quality training data and a dedicated OOD benchmark for…”。

从像素看,该图自左向右分为五列。第一列多源收集按音频、图像、视频与讲话头分四行列出示例来源;第二列按模态构造分别写明伪造音频生成合并、继承三分类标签、篡改掩膜生成合并、去除重复片段合并;第三列是黄色大框,内含统一标签空间、统一框与区间定位格式、统一检测定位解释协议、对齐多模态样本结构;第四列是参考答案构造、定位目标插入、细粒度解释附加与结构化回答格式。

第五列分出训练集与分布外基准,并有去除低质量与无效样本的虚线分支。这说明统一不是简单合并文件,而是标签、位置格式与回答结构的三重对齐。

组件与计算:奖励四项各算什么?什么没说清?

模型基座是 Qwen2.5-Omni-7B,论文没有报告对其预训练权重的修改细节,也没有给出冻结与更新的逐层说明,复现时应把基座视为起点,具体可训练参数以官方代码为准。组件分工是:多模态表示负责对齐视听与语言,共享推理负责跨模态不一致判断,结构化生成负责按格式输出标签、框区间与解释。组合机制是同一提示驱动同一模型产生 3 个相互约束的输出,使解释必须与位置一致,位置必须与标签一致。

监督微调 × 组序列策略优化: 监督微调负责用下一词似然教会模型输出结构化三元组的基本格式与跨模态表示;组序列策略优化负责用检测、定位与格式构成的标量奖励直接优化任务指标。搭配理由是似然训练不对准交并比与分类准确率,强化阶段补上任务对齐,组合意义是先学好格式与表示,再把标签正确性、框与区间准确性联合推高。

奖励设计是组件计算的核心,由四项加权求和得到标量奖励。格式奖励用确定性解析器检查是否恰有 1 对思考标记与 1 对答案标记,并能从答案块中提取合法标签与合式框或区间标记,通过得 1 否则得 0。检测奖励比较答案块中的标签与真值,对更难的部分篡改给予更大的正确奖励,对真实与完全合成给予较小奖励,错误得零,以避免优化被容易类别主导。论文称权重在附录报告,正文未给出具体数值,这是明确缺项,解读时不应猜测权重。

空间定位 × 时间定位: 空间定位负责对图像与视频篡改输出边界框并与掩膜导出的真值框算交并比;时间定位负责对音频与视频篡改输出伪造区间并在时间轴上算 1 维交并比。搭配理由是图像篡改多在空间,音频篡改多在时间,视频两者兼有,组合后统一奖励能同时约束在哪里被改和何时被改,使解释与位置相互印证。

空间奖励对有像素级掩膜的图像与视频,先从掩膜导出真值框,再与预测框算交并比;部分篡改按交并比给分,真实与完全合成只有在预测无框时给 1,否则给 0。时间奖励对有伪造区间的音频与视频,解析预测区间并与真值区间在时间轴上算 1 维交并比,经二分匹配后对匹配对取平均;同样,篡改样本奖励区间精度,真实与全假样本只在无虚假区间时给分。这种对称设计使模型不敢为刷分而乱报位置。

解释质量在奖励中的具体项在正文描述较简略,只在消融中提到去掉解释相关项会明显降低语义相似度而检测几乎不变,说明强化主要塑造依据文本而非标签,初学者不应把解释得分当成检测得分。

训练如何组织?顺序、回放比例与强化步骤是什么?

训练分两大步。第一步是 4 阶段课程监督微调,顺序为音频,然后图像,然后视频,最后讲话头视频。每学一个新模态,就用该模态全量训练集混合之前每个已见模态的 15% 回放子集。这种安排的理由是同时混合 4 个模态会导致数据量大的模态覆盖早期技能,而逐步解锁加回放能让后学模态复用先学表示。论文报告在回放比例扫描中,低于 5% 不能防止遗忘,30% 虽保留早期模态却妨碍新模态学习并可能带来负迁移,10% 到 15% 是折中,因此全实验采用 15%。

第二步是在课程微调 checkpoint 上做统一组序列策略优化强化。对每个输入采样多个回答,用检测定位解释奖励打分,再用组内相对优势与贴近监督模型的散度惩罚更新策略。直观目标是鼓励标签正确、掩膜或区间准确且格式合法的回答,同时保持词元级更新稳定。论文称具体优势与重要性比重的定义沿用组序列策略优化原文,没有在正文展开公式细节,因此不应自行补写梯度路径。

下面这张训练流水线图把两步的衔接画出,重点看课程链、奖励块与评测块三者的箭头方向。

看图路径: 1. 先看上半部分从基础模型经音频到讲话头的纵向课程链与回放箭头;2. 再看中间统一奖励块中格式、分类、框与区间奖励的层级关系;3. 最后看下半部分统一提示如何驱动共享推理并分出三个输出头

原论文 Figure 5:a) Training pipeline with SFT and GSPO.

论文图 5。原论文 Figure 5:“a) Training pipeline with SFT and GSPO. (b) Architec- ture of Omni-Fake-R1 producing detection, localization, and ex- planation outputs.”。

从像素看,上半部分左侧是基础模型向右进入纵向堆叠的音频、图像、视频与讲话头 4 个绿框,每级之间标注回放箭头,整体框为课程监督微调;中间虚线框为统一奖励策略优化,自下而上是格式奖励、分类奖励,再分出边界框奖励与区间奖励,最后向右指向 Omni-Fake-R1;右侧是评测框,内含验证集与分布外基准。下半部分左侧是 4 个模态图标与统一任务提示,中间是多模态表示、共享推理与结构化决策生成 3 层,右侧是检测、定位与解释 3 个输出头,分别标注标签、掩膜示例与思考加答案标记。这张图说明训练不是单次混合,而是先纵向课程打基础,再横向统一奖励对齐任务。

课程微调 × 模态回放: 课程微调负责按音频、图像、视频、讲话头的顺序逐个引入模态,避免 1 次混合导致大模态淹没小模态;模态回放负责在学新模态时混入之前模态约 15% 的数据,巩固已学表示。二者搭配是因为顺序学习易遗忘,回放提供低开销的记忆锚点,组合后模型能逐步扩展覆盖范围而保持跨模态共享表示。

实验条件:数据量、生成器划分、基线与指标方向是什么?

数据量按原文交代,训练分布与分布外分布在内容与生成器上严格不相交。图像、音频、通用视频采用三分类,讲话头视频在主设置中用二分类。生成器多样性通过开源与商业合成编辑流水线组合实现,尽量把不相交的生成器族分给两个划分。每个模态的代表性来源与生成器在论文表格中列出,复现时应以该表为准选择对应家族,而不是用同族不同版本代替不相交性。

感知质量用自动距离、无参考质量分、平均意见分与人类真假辨别准确率验证,训练集距离低且意见分高,分布外集质量相当但在多数模态更具挑战性。 下面先看数据质量表的比较问题:在自动距离越低越好、感知与可懂度越高越好的前提下,两个划分的质量是否可比?表前需要明确公平条件是同一模态内比较同一指标,方向是距离与失真越低越好,质量与意见分越高越好。该表达到五列,承担宽表要求。

ModalitySplit Automaticquality / syncHumanevaluation
ImageFID↓BRISQUE↓MOS↑HDA↑
Set13.621.94.180.79
OOD19.226.73.930.72
Set13724.84.110.83

该表按图像、视频、音频与讲话头分块报告训练集与分布外集的质量与同步指标。总体趋势是训练集的距离更低、意见分更高,分布外集略差但仍接近,说明分布外难度的增加主要来自未见生成器与内容,而非质量崩坏。代价是视频与讲话头的距离绝对值较大,跨模态直接比较距离数值没有意义;未胜出项是分布外集在个别感知分上并未全面落后,说明质量控制保留了高真实感伪造,这对检测是更难的设置。

基线按模态分别选择,每类都包含检测专用模型、定位导向模型与视觉语言模型,并在训练集上用各自推荐超参数微调。图像侧包括卷积检测器、通用伪造检测器与多模态大模型,视频侧包括 3 维卷积、掩膜自编码器、生成视频检测器与视频语言模型,音频侧包括反欺骗图注意力模型与局部篡改模型,讲话头侧包括唇伪造与音画对齐模型。指标为检测准确率与宏平均 F1,定位为掩膜或区间交并比与定位 F1,解释为 ROUGE-L 与余弦语义相似度加 10 位专家的五点量表评分。

所有比较都应在同一划分与同一指标下进行,不同指标的差值不能混入模型列。 下面这张代表性样本图帮助确认标注形态,阅读时重点看三分类列与附件位置标记。

看图路径: 1. 先按左上、右上、左下、右下四个面板确认图像、视频、音频与讲话头分区;2. 观察每类中真实、完全合成、部分篡改三列的标注与掩膜或区间附件;3. 对比 Set 与 OOD 行在内容与生成痕迹上的分布差异

原论文 Figure 2:Representative samples from Omni-Fake across modalities, highlighting the diversity, high quality…

论文图 2。原论文 Figure 2:“Representative samples from Omni-Fake across modalities, highlighting the diversity, high quality, and multimodal nature of forgeries in social media scenarios.”。

从像素看,该图分四区:左上图像集与左中图像分布外各有真实、完全合成、部分篡改三列,篡改列右侧附黑色掩膜;右上视频集与视频分布外每行给 4 帧连续画面,篡改行右侧附小掩膜;左下音频区给波形与文本,篡改行用红色区间标出被改时间段;右下讲话头集与分布外各给 4 帧人脸序列,只分真实与完全合成。这种布局说明定位监督的形态是图像视频用空间掩膜、音频视频用时间区间,复现时必须按模态解析对应槽位。

主结果测什么?统一模型与单模态基线在同条件下差多少?

主结果要回答 4 个问题:单模态验证集上统一模型是否不输专用模型,分布外集上是否更稳,常见损坏下是否保持定位,以及解释是否与位置对齐。比较的公平条件是同一模态、同一划分、同一指标,检测看准确率与 F1,定位看交并比与定位 F1。

论文报告统一模型在 4 个模态的验证集上取得最佳平衡,在图像上匹配或超过细粒度伪造基线的检测并进一步改善空间定位,在通用视频上超过片段级检测器与视频语言模型的检测 F1 与时间定位,在音频上取得三分类准确率与区间定位最佳,在讲话头上取得伪造检测 F1 最佳,同时保持统一标记输出。 分布外比较显示从训练分布到分布外分布所有模态性能都下降,反映生成器、内容源与后处理偏移。检测专用基线下降最多,尤其在部分篡改上。

视觉语言模型更稳但仍损失大量定位性能;统一模型在各模态保持最高的分布外准确率、F1 与交并比,在音视频任务上增益尤其明显。论文把这种增益解释为统一协议与多模态课程使模型更依赖语义与跨模态不一致,而非生成器特有痕迹,这属于有限解释,支持但不证明因果。 下面这张数据规模表先把比较基数固定,避免把样本量差异误读为模型能力差异。

表前问题是两个划分的样本量与模态构成是否足以支撑泛化结论,公平条件是按划分与模态分别计数,指标方向是数量越大覆盖越广,但数量本身不是性能。

划分图像样本视频样本音频样本讲话头样本
训练分布790K 图像210K 视频120K 音频15K 讲话头视频
分布外基准100K 图像3K 视频100K 音频8K 讲话头视频

表后解释是训练分布总量超百万,分布外总量超二十万,且生成器族完全不相交,因此分布外下降更可能来自未见合成技术。代价是视频分布外仅 3K,统计不确定性大于其他模态。

未评测边界是社交媒体的压缩与转发的具体参数未完全公开,复现时应保留原始评测脚本的损坏设置。 另一张规模与方法数表把生成器多样性与样本量放在一起,防止只看样本量忽略方法覆盖。表前问题是多样性是否足以称为跨生成器泛化,条件是同一划分内多家族相对均匀采样,方向是家族越分散结论越可信。

划分模态覆盖样本量级方法数量生成器关系
训练分布图像音频视频讲话头超过 1M 样本超过 30 种生成与操作方法与分布外完全不相交
分布外基准图像音频视频讲话头超过 200K 样本未见合成技术族与训练分布完全不相交

表后解释是方法数与不相交性共同支撑泛化 claim,单纯样本量大不能替代生成器错开。反例是即使家族不相交,若内容主题仍有重叠,仍可能高估泛化,论文用内容与说话人不相交来缓解,但未报告主题分布的定量审计,这是待验证项。

拿掉课程、回放与强化后哪部分先变差?

消融要回答监督策略与强化各自的作用。比较 3 种监督策略:单模态独立训练 4 个模型,全量混合从头训练一个模型,以及按音频到图像到视频再到讲话头的课程训练。论文报告单模态检测强但没有统一模型,全量混合受模态不平衡拖累,课程训练匹配或略超单模态检测并取得最佳定位与分布外性能。这支持渐进解锁加回放有助于跨模态共享,而不是简单数据堆叠。 回放比例扫描比较 0%、5%、10%、15% 与 30% 五档。

很小比例减缓遗忘但不能防止,大比例保留早期模态却妨碍新模态学习并可能负迁移,10% 到 15% 是折中。强化比较三变体:无强化的纯监督、无线课程直接强化、课程加全量多项奖励的默认模型。纯直接强化在检测与定位上明显差于任何监督模型,说明没有课程打底时奖励优化不稳;默认组合在各模态一致提升检测与定位,证实检测定位解释联合奖励的价值。解释消融显示去掉解释相关奖励项会明显降低语义相似度而检测几乎不变,说明强化主要塑造依据文本。

下面这张训练配置表把课程顺序与回放比例的实际可运行策略固定下来,表前问题是复现时应按什么顺序与比例启动训练,公平条件是同一基座与同一数据,方向是回放比例在防止遗忘与学习新模态之间权衡。

训练阶段新模态数据回放来源回放比例顺序
阶段一音频全量无无回放先音频
阶段二图像全量音频子集15% 回放再图像
阶段三视频全量音频图像子集10% 到 15% 折中再视频
阶段四讲话头全量音频图像视频子集采用 15%最后讲话头

表后解释是该表是实际可运行的默认策略,全量混合与零回放作为对照只用于诊断,不应作为部署选择。代价是 4 阶段流程比单次混合更耗时,且 15% 是经验折中而非每模态最优。

未胜出项是 30% 回放在早期模态保留上可能更好,但论文报告其妨碍新模态,因此不选。鲁棒性方面,论文对分布外集施加压缩、模糊、噪声、裁剪缩放与编码器重编码,统一模型在各损坏下保持较高检测 F1 与定位交并比,但具体每种损坏的数值只在原文鲁棒表中给出,正文未以连续句子逐一报告,复现时应直接运行官方损坏脚本而非引用二手数字。

哪些结论不能下?缺项与边界在哪里?

首先区分 3 类表述。论文直接报告的是数据集规模与不相交划分、课程加回放的训练流程、四项奖励的构成、以及统一模型在验证与分布外上优于所选基线的趋势。有限解释是跨模态语义不一致带来泛化,这得到分布外优势的支持,但没有因果干预实验证明。未验证推测是把这种优势推广到未来未见平台与全新生成器,论文没有测量这些未来分布,不应承诺必然成立。 缺项需要具体点名。

统一奖励的四项权重只说在附录报告,正文没有数值;组序列策略优化的词元级优势与重要性比重的确切定义沿用原文,没有在本文展开;基座的冻结与更新细节、优化器超参数、训练硬件预算与推理延迟均未在所给正文中报告,不能从模型名称推定实现。相关性不是因果,总体趋势不等于每组每步都成立,自动语义相似度高不等于专家可用性高,尽管论文报告二者相关良好,仍应分别讨论。 边界包括:讲话头主设置只做二分类,局部编辑讲话头归通用视频评测。

定位指标只在有标注的 3 个模态上平均,跨模态平均时分母不同;视频分布外样本量较小,统计波动更大;人类评分为 10 位专家的五点量表,样本抽样与一致性细节在补充材料中,引用时应说明抽样范围。未测量误判率、延迟与成本时,不承诺这些量得到改善。

复现先做什么?按什么顺序核对数据与训练?

第一步核对数据划分与标签。按训练分布与分布外基准分别统计图像、音频、视频与讲话头的真实、部分篡改与完全合成数量,确认生成器族完全不相交,确认讲话头二分类与通用视频三分类的归属。不要用同族不同版本代替不相交性,也不要把不同指标的差值混入模型列。百分点与相对百分比不同,引用提升时保留原文单位与精度。 第二步核对标注与格式。

图像与视频检查掩膜导出的真值框,音频与视频检查伪造区间的 1 维交并比计算与二分匹配平均,答案块检查思考标记与答案标记各 1 对,以及框与区间标记的合式性。复现定位时先沿单样本走完输入到表示到推理到输出,再展开奖励计算,避免把掩膜交并比与区间交并比混用。 第三步按顺序复现训练。先跑音频到图像到视频再到讲话头的 4 阶段课程监督微调,每阶段混入之前模态 15% 回放,再在课程 checkpoint 上加统一奖励强化。

先验证格式奖励为 1 的比例,再看检测准确率,最后看定位交并比与解释语义相似度。资源状态方面,当前可用性以正文开源声明为准:本次收到的资源检查显示部分第三方生成器链接可用、部分暂时不可达或不可用,复现生成器侧时应以论文附录的家族列表与本地可用模型为准,不把链接可达当成数据可得。 第四步复现评测。验证集与分布外基准分开报告,检测看准确率与宏平均 F1,定位看交并比与定位 F1,解释看 ROUGE-L、余弦语义相似度与专家评分。

损坏鲁棒性用同一组压缩、模糊、噪声、裁剪缩放与重编码脚本,报告模态平均时注明定位只平均有标注的 3 个模态。何时值得尝试统一模型:当应用需要同时给出标签、位置与理由,且输入模态混杂时;若只需要单模态二分类,专用检测器可能更轻量,还需补延迟与成本验证。

收束:这篇论文给初学者的可复述要点是什么?

可复述的方法是:数据上用 5 阶段流水线把 4 模态统一到同一标签、同一位置格式与同一回答结构,并分出生成器完全不相交的分布外基准;模型上用同一多模态大模型输出标签、框区间与解释;训练上先按音频、图像、视频、讲话头顺序做课程监督微调并以 15% 回放防止遗忘,再用格式、检测、空间与时间四项奖励做组序列策略优化,直接对齐任务指标。

实验上按模态、划分与指标分别比较,统一模型在验证与分布外上保持最佳平衡,尤其在音视频任务上更稳,损坏下仍保持定位,解释与位置对齐更好。 需要保留的代价与条件是:4 阶段加强化比单次混合更耗时,回放比例是折中而非最优,奖励权重与优化细节依赖附录与原算法论文,视频分布外样本较少,讲话头主设置不做细粒度定位。复现时先核划分与格式,再跑课程与回放,最后加统一强化与损坏评测。

引用数字时保留原表头单位与裸值写法,不逐格追加百分号,不四舍五入,不把自动指标当成人评。论文的价值在于把检测、定位与解释放进同一基准与同一模型,使审核员能同时知道判什么、在哪里、为什么,这正是社交媒体取证最需要的闭环。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 6 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 6 页

区域 2 · 查看论文原页

另有 6 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 cvpr-2026 论文汇总