英文题目:AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs
会议身份:
conference:cvpr:2026:conference-paper-id:Xia_AVFakeBench_A_Comprehensive_Audio-Video_Forgery_Detection_Benchmark_for_AV-LMMs_CVPR_2026_paper
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#基准测试 #基准设计 #多模态模型 #音视频 #音频伪造检测
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Shuhan Xia:机构信息未能从会议 PDF 纯文本可靠映射
- Peipei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Xuannan Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Dongsen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xinyu Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Zekun Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
AVFakeBench以含声视频片段为输入,输出真伪二判、七类组合分类、细节选择与开放解释,难点在于主体从人脸扩展到自然风光、动物等通用场景,且真实、编辑、合成在音频与视频上交叉耦合易致语义时序错位。其构建先由专有模型做伪造意图规划,输出动态描述或编辑规范以确定场景与篡改组合。接着专家生成与编辑模型执行视频合成或局部词级增删改,并用视频到音频模型补齐声音,保持跨模态一致。最后重组真实与伪造流形成七类组合,再由多模态标注器基于帧、运动热图与频谱图生成细节与解释标注并经人工校验,形成三千片段与万级问答。与仅做人脸二分类的前代基准相比,关键差异在规划与执行解耦并引入四级问答,使评测从检测准确率延伸到细粒度感知与推理,实际意义是暴露通用场景与音频模态短板。在AVFakeBench多选伪造分类任务下,Gemini-2.5-Pro的F1为19.2%,高于GPT-4o的F1 12.2%。该结论适用边界受限于所覆盖场景与特定生成器分布,对未见生成器与强对抗样本尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://chatglm.cn — 链接可访问(HTTP 200)
- 第三方资源:https://app.klingai.com/cn → https://klingai.com/app — 链接可访问(HTTP 200)
- 第三方资源:https://www.midjourney.com/ — 链接不可用(HTTP 403)
- 第三方资源:https://chatgpt.com — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:要给研究生讲清的任务起点是什么?
这篇解读的输入是论文原文证据与 4 张官方原图像素,目标是让刚进入语音、音乐与音频方向的研究生能核对事实并复述方法。必须保留的信息包括数据规模与来源、7 种伪造组合的取舍理由、3 阶段构造流程、4 层标注与四项评测任务、被测模型名单与指标方向,以及关键定量结论与适用边界。输出是 1 篇按学习依赖展开的中文技术解读,不做无源推断。
白话先讲任务。音视频伪造检测要判断一段同时有画面与声音的短片是否经过人工智能改动。英文叫音频视频伪造检测,Audio-Video forgery detection。以前的基准多只看人脸说话,做法是给整段打一个真或假标签。新威胁是灾难、动物、交通、音乐演出等通用场景也会被配上同步环境音来误导公众,攻击手法同时混用局部编辑与整体合成。只会看人脸、只会答真假的评测就不再够用。
学习这篇论文要先建立 3 个依赖。第一是语义依赖:人类主体指人说话场景,通用主体指除人脸之外的 10 类真实世界场景。第二是类型依赖:每个模态先分真实、编辑、合成 3 种内容态,再跨模态配对。第三是粒度依赖:从整段真假到类型归因,再到证据定位与文字解释,一层比一层需要更细的感知与推理。后面各节按这个顺序展开,例子会明确标为例子。
已有路线走到哪里:同输入同目标的工作缺了什么?
按同输入、同目标、同监督与同运行阶段对照,已有音视频伪造基准可分三批。早期以视觉为主的人脸基准只用画面线索,监督是二分类标签。中期多模态基准开始同时用声音与画面,并引入跨模态组合,例如全流程合成人脸音视频,或对口语句做插入、删除、替换的时间编辑。但原文指出这些工作仍聚焦人类主体,且 1 次只覆盖编辑或合成一种手法,缺少细粒度或可解释标注。
同期视频生成检测把主体扩到多场景,引入多种图生视频模型与局部视频编辑工具,但仍停留在视频单模态,没有探索多场景音频伪造与跨模态组合,也没有统一的解释性内容。另一条线是音视频大模型,Audio-Visual Large Multimodal Models,简称 AV-LMMs。这类模型能联合处理视觉与听觉信号并生成自然语言,因此有可能同时做检出、定位与解释,超越只输出二分类标签的专用检测器。论文要回答的正是这类模型作为统一伪造检测器到底行不行。
教学上要避免一个误解:类别更多不等于条件相同。把只看人脸的专用检测器与看全场景的大模型直接比绝对分,只能说明跨域稳健性差异,不能证明某一类方法在同分布下必然更优。后文实验会强调人类主体与通用主体分开报告,以及编辑类最难的反证。
论文到底要解决什么:三个维度的缺口如何定义?
论文把缺口定义在 3 个互补维度。第一是丰富的伪造语义,Rich Forgery Semantics,指同时覆盖人类主体与通用主体,通用主体再细分为自然景观、动物、社会活动、音乐、交通、生活、体育、工业、告警信号与科学 10 类,加上人类说话共 11 类场景。第二是多样的伪造类型,Various Forgery Types,指把真实、编辑、合成 3 种单模态状态交叉,形成 7 种语义一致的多模态组合。第三是多层标注,Multi-Level Annotations,指在二元真伪之外再做类型分类、细节选择与解释推理。
下图把传统基准与新基准并排对比,传统侧只有人脸、单一手法与二分类,新侧沿三轴扩展,阅读时注意中部 7 类组合与右侧 4 层设问的对应关系。
看图路径: 1. 先看左列人类主体与通用主体两条胶片,确认评测对象从人脸扩展到自然与生活场景;2. 再看中列视频红框与音频波形下的真实、编辑、合成三态标注;3. 最后看右列从二分类到分类、细节选择与解释推理的四层设问如何逐层加深
论文图 1。原论文 Figure 1:“Comparison between traditional AV Deepfake benchmarks and the proposed AVFakeBench.”。
该图上半是传统基准,下半是新基准。左列用两条胶片区分人类主体与通用主体,并列出十一场景图标。中列上方用红框标出视频被改区域,下方给出音频波形,二者都标真实、编辑、合成三态,最下方列出 7 种跨模态配对。右列从上到下是 4 层设问,从是否实拍无人工智能介入,到归属 7 类中哪一类,再到五选一细节与开放解释。像素细节显示二分类用是否两选项,类型分类用 7 个字母选项,细节选择与解释分别用省略号占位与海滩小图示意。理解这张图就理解了全文的任务全景。
方法全景:一个样本如何走完输入到输出?
先沿一个通用场景样本走完流程。输入是一段真实音视频与它所属的场景标签。第一步由专有模型做规划,输出动态描述或编辑指令。第二步由专家生成模型按指令改画面或重生成声音。第三步把真实与伪造的音频流、视频流重组成 7 类中的一种,并附上 4 层问答标签。输出就是可直接用于评测的片段加题目。
专有模型规划 × 专家生成模型执行: 专有模型规划负责写出动态描述或编辑指令,包括目标区域、时间窗与操作,专家生成模型执行负责按指令调用图生视频、视频编辑与视频转音频模型落地;规划解决场景多样性与可控性,执行解决时空一致性与音画同步,二者分离后人工可在中间检查以保真与多样。
总体框架分合成与编辑两支,每支 3 个阶段。下图展示两支的并行结构,上支为合成框架,下支为编辑框架,每支都标出规划、专家执行与伪造组合 3 段。
看图路径: 1. 沿上支合成链看首帧到伪造计划再到视频生成与音频生成的箭头;2. 沿下支编辑链看八帧条带到伪造计划再到掩码视频与编辑后视频的路径;3. 对比两支第三阶段如何把真实与伪造音视频流重组成不同跨模态类型
论文图 2。原论文 Figure 2:“Overview of the multi-stage hybrid forgery framework.”。
上支合成链的像素路径是左侧首帧与火车照片提示进入规划框,生成火车穿过山村等动态描述,再进入含视频生成与音频生成的中间框,右侧输出真实与合成视频条带及绿与红两条波形。下支编辑链的像素路径是左侧 8 帧条带进入规划框,生成移除中间木桩等指令,中间经视频时间裁剪、分割模型掩码与编辑后视频框,右侧输出真实与编辑视频条带及绿与红两段波形。两支第 3 阶段都列出 4 种组合文字,合成侧偏重整体重生成,编辑侧偏重局部改动加回填。关键是规划与执行分离,人工在关键处检查准确性、真实感与多样性。
两支各做什么:合成与编辑的组件与计算是什么?
合成支要生成语义连贯、动态合理且音画同步的内容。第一阶段有两种条件策略。帧驱动规划以真实视频首帧为视觉锚点,预测其合理时间演化。场景驱动规划先按 10 类场景之一生成静态描述,再经文生图模型得到首帧,然后扩展为结构化动态说明。原文把这种做法归因于直接生成真实世界场景易出现不稳定或不符合物理的运动,需要文本先约束演化。
第二阶段以首帧为锚、动态描述为运动提示,调用图生视频模型合成视频,再经视频转音频模型生成时间对齐的环境音。第 3 阶段重组出 3 种基于合成的伪造类型。
编辑支要做局部时空改动并保留全局真实感。第一阶段均匀采样 8 帧短带,交由专有模型提出合理改动并转成含目标区域、时间窗与操作的结构化说明。第二阶段有两条互补路径。生成式编辑把片段与指令送入闭源视频到视频编辑模型,并人工约束编辑区域。基于掩码的编辑先用分割模型得到目标掩码,再交由视频编辑模型执行精确操作。
为保持跨模态一致,编辑后视频片段会再经视频转音频模型生成时间对齐的编辑后音频。第 3 阶段把编辑后片段插回原流,再重组成 3 种基于编辑的伪造类型。
编辑 × 合成: 编辑指在真实音视频流上做局部时空改动并保留全局真实感,合成指从提示或首帧重新生成整段音视频;二者搭配的理由是真实攻击常一端局部篡改、一端整体伪造,组合后才能形成 7 种跨模态配对并考验模型区分局部痕迹与全局生成痕迹的能力。
类型取舍需要讲清。理论上三态交叉有 9 种组合,实践中一端为合成、另一端为编辑的两种混搭易出现明显语义与时间错位,难以做到高保真自然,因此舍去,只保留 7 种语义一致的代表性攻击模式。人类主体部分不走上述生成链,而是从已有数据集系统重组,保证口语句插入、删除、替换等编辑类型与合成类型的覆盖。
没有模型训练时:标注与问答是如何构造出来的?
本研究没有训练新的检测模型,该节讲清无训练阶段的真实计算过程。数据构造侧,人类主体共 1500 段,含 500 段真实、500 段合成与 500 段编辑,分别精选自已有语音与深度伪造数据集并按 7 类重组。通用主体共 1500 段,含 500 段真实、550 段合成与 450 段编辑,真实段精选自大规模音视频数据集,伪造段经上述两支框架生成。合计 3000 段配对音视频,这是全文复述必须记住的规模。
4 层标注中,第一层二元判断与第二层类型分类在构造时直接由已知真假态与分类体系决定,无需另行推断。第三层细节选择与第 4 层解释推理走多模态标注器流程。输入给标注大模型的上下文包括均匀采样视频帧、运动热图、梅尔谱图与放大的高频图,分别补空间外观、时间运动、频域异常与混合痕迹证据,同时给定真值类型标签,让模型聚焦解释如何伪造而非猜类别。先生成自然语言解释,再从中抽最显著证据为正确项并生成 4 个语义相关但错误的干扰项,形成五选一题目,最后经人工校验合理性、正确性与清晰度。最终 4 层标注共 12000 对问答。
伪造类型分类 × 伪造细节选择: 伪造类型分类负责判断音频与视频各自处于真实、编辑、合成哪一态并组成 7 类标签,伪造细节选择负责从 5 个候选中挑出与视觉或听觉证据最吻合的一条;前者分工是粗粒度归因,后者分工是细粒度定位,二者搭配才能把答对二分类但说不清位置的模型筛出来。
下图用 4 个格子举例 4 层标注的写法,左上问是否被人工智能操纵并标真实,左下问属哪类并标真实音频加编辑视频,右上给出五选一细节,右下给出同时引用画面与声音的长解释。
看图路径: 1. 先读左上二分类与左下类型分类两格的设问与标注写法;2. 再读右上细节选择的五个候选,确认正确项指向草地过平滑等具体证据;3. 最后读右下解释推理格,看文字如何同时引用路面纹理与 1 至 6 秒音频音高
论文图 3。原论文 Figure 3:“Examples of forgery annotations. AVFakeBench has 4-level annotations, including Binary Judgment, Forgery Types Classifi- cation, Forgery Detail Selection and Explanatory Reasoning.”。
像素上左上格是停车场行走 3 帧加脚步声波形,标注为真实。左下格是桌上鸭子 3 帧加鸡鸣波形,红框标被改物体,标注为真实音频与编辑视频。右上格是日落城镇 3 帧加风声波形,正确项指向中间草地过平滑。右下格是火车 4 帧加汽笛波形,文字指出下方路面重复纹理、车窗静态反射,以及 1 至 6 秒音频音高音色几乎不变。读图时把红框位置、波形红框段与文字指称逐 1 对齐,就能复述标注器如何把多模态证据转成题目。
实验条件:测谁、怎么问、指标方向是什么?
被测对象包括 5 个开源音视频大模型与 6 个专有音视频大模型,另加 2 个专用检测模型做对照。开源侧覆盖不同类型与规模,专有侧包括主流对话与多模态系列。专用检测器为针对合成音视频设计的开源方法,且训练集与新基准不重叠,以降低数据污染风险。评测框架含四项任务,从易到难为二元真伪判断、多选类型分类、细节选择与开放解释。
指标上前三项报告准确率与宏平均 F1,兼顾总体正确与类别不平衡。准确率越高越好,宏平均 F1 越高越好。由于部分开源模型指令跟随差,采用稳健解析流程,先看是否显式输出选项字母,若文字解释与字母矛盾则按选项内容裁决,必要时用中立解析模型抽取意图,无有效选项记为缺失。开放解释用模型打分,满分 100 越高越好。另算归一化偏差指数,用不同伪造类型的召回差异量化系统性偏好。硬件与超参数等部署成本原文未报告,这是复现时要补记的缺项,不能从模型名推定实现。
比较公平性上,人类主体与通用主体分开报告,以检验跨域稳健性。专用检测器只参与二元判断,不参与后三项需要语言生成与细粒度归因的任务。教学例子:若把只会答真假的检测器与会答 4 层的通用模型混在同一平均分里比较,就混淆了任务能力边界,正确做法是按任务分表呈现。
主结果:谁在二分类上稳、谁在细粒度上掉?
按问题组织结果。先测基础检出。专用检测器即使在人类主体上也表现差,到通用主体进一步下滑,报告指出这支持它们依赖人脸伪造痕迹、难以泛化到更广场景的判断。多数音视频大模型更强更稳,其中较强的专有模型在人类主体与通用主体上都保持相对高位,显示跨域稳健性。
二元真伪判断 × 解释性推理: 二元真伪判断只问整段是否经人工智能介入,解释性推理要求用自然语言说清位置、被改内容与可见可听异常;前者测基础检出,后者测证据链,二者搭配的意义是揭示大量在前者得分尚可、在后者崩溃的模型,说明检出不等于理解。
下图是类型分类任务的模型偏差评估,横轴为模型,纵轴为 7 类标签,颜色越暖越偏向横轴标签,方块越大偏差幅度越大。
看图路径: 1. 先确认横轴为 11 个被测模型、纵轴为七种音视频配对标签;2. 再看第一行偏红偏大的方块,判断哪些模型集中预测全真实类;3. 最后对比蓝色大块集中的行,观察编辑类被系统性回避的模式
论文图 4。原论文 Figure 4:“Model bias assessment. Warmer colors (closer to red) indicate a stronger tendency to predict the label on the horizontal axis, while cooler colors (closer to blue) indicate the…”。
像素上第一行全真实类在多个模型列呈现大红块,说明多数模型在不确定时回落到统计上最安全的全真实选项。中间编辑行多为深蓝或空白,右侧开源列出现个别深红大块,说明少数模型坍缩到一两个主导类别而非按输入分布预测。读图要先按图例确认颜色与尺寸含义,再区分分布性偏好与单样本标记,不能把同色直接当同对象。
下表比较二元判断与类型分类的总体表现,公平条件是同一基准划分,指标方向均为越高越好,表后解释会指出稳健与崩溃并存。
| 条件 | 指标 | 专用检测器基线 | 较强音视频大模型 | 未胜出或崩溃对象 |
|---|---|---|---|---|
| 人类主体二元判断 | 宏平均 F1 | 45.0% 与 51.7% 2 个模型 | 63.3% | 部分开源模型接近随机 |
| 通用主体二元判断 | 宏平均 F1 区间 | 18.9-34.3% 区间 | 54.3% | 专用检测器大幅下滑 |
| 全体多选类型分类 | 宏平均 F1 | 不参评 | 19.2% | 多数模型更低 |
表后解释如下。收益是通用大模型在二元判断上超越专用检测器,并在通用主体上保持相对稳定,代价是从二分类到类型分类出现约七成量级的性能落差,即使最强模型也仅一成多,说明细粒度感知不足。反例是部分开源模型在类型分类上接近失效,边界是专用检测器未参与后三项,不能据此断言它们在解释任务上必然更差。原文用报告显示的措辞给出上述判断,未测量延迟与成本时不承诺部署收益。
| 条件 | 指标 | 开源上限 | 专有代表 | 比较对象 |
|---|---|---|---|---|
| 细节选择 | 宏平均 F1 | 17.8% | 27.5% | 开源最佳与专有代表 |
| 开放解释 | 推理分满分 100 | 21.4/100 | 29.0 | 同上 |
| 编辑类分类 | 宏平均 F1 | 接近 0 | 7.5% | 最强模型仍极低 |
该表聚焦细粒度与推理,公平条件仍是同一基准,指标方向越高越好。表后解释是绝对分普遍低,专有好于开源但仍远未可用,编辑类因改动局部、低可见而最难,这支持当前模型缺乏可靠细粒度多模态线索、决策多靠预训练先验的有限解释。待验证的是把先验偏差纠正后能否恢复编辑检出,原文未做因果验证。
反证与拆分:偏差与模态差距如何量化?
本节按反证组织。先看模型偏差,用归一化偏差指数衡量不看输入内容而偏向某选项的程度。热图显示几乎所有模型都有明显偏差,大量子集偏向全真实音视频类。原文的有限解释是模型未学到可靠多模态操纵线索,不确定时回落到语义最安全或统计最常见的选择。这仍是相关性观察,不是因果证明。
音频伪造 × 视频伪造: 音频伪造分工是改口语句、环境声或整体重合成,视频伪造分工是改物体、运动或整体重生成;把二者拆开单模态评测的理由是联合评测会掩盖听觉短板,拆开后才能量化视觉主导偏差并指出跨模态对齐不足。
再看模态差距。基准的跨模态分类体系允许直接比较纯音频伪造与纯视频伪造。多数模型在纯视频上明显更好,在纯音频上几乎崩溃,呈现视觉主导模式。即使先进闭源模型也有可观差距。这支持听觉感知不足与跨模态对齐弱的判断,也说明联合评测会掩盖短板。
下表比较单模态拆分表现,公平条件是同一类型分类任务下的音频、视频子集,指标为宏平均 F1 越高越好。
| 条件 | 指标 | 音频子集 | 视频子集 | 音视频联合 |
|---|---|---|---|---|
| 代表 A | F1 | 8.0 | 21.7 | 3.2 |
| 代表 B | F1 | 0.0 | 18.8 | 0.0 |
| 代表 C | F1 | 0.0 | 14.7 | 0.0 |
表前问题是视觉主导是否存在,公平条件是同任务同指标下的子集划分,指标方向越高越好。表后解释是收益方为视频子集,代价方为音频子集与联合集,多数组合在音频侧归零,说明不可靠的听觉与对齐使细粒度与解释性检测更难。未胜出项是多个开源模型在三列同时为零,边界是原文未报告逐场景与逐信噪比拆分,不能把总体趋势推广到每组每步都成立。
边界在哪:哪些结论不能推广?
先划定已验证与未验证。已验证的是在该基准、该题目写法与该解析流程下,大模型二分类更稳、细粒度与解释崩溃、编辑最难、听觉弱于视觉。有限解释是偏差与先验有关、对齐不足导致跨模态失败,这些是支持性分析而非因果证明。未验证的是真实部署中的误判率、延迟、成本与对抗适应性,原文未测量这些量,不能承诺改善。
数据边界包括人类主体来自已有数据集重组,通用主体真实段精选自大规模音视频库,合成与编辑经特定生成与编辑模型落地,因此结论随生成器换代可能漂移。标注边界是高层解释经大模型辅助生成再经人工校验,主观性与覆盖度仍受提示与校验标准影响。评测边界是开放解释依赖模型打分,打分者自身偏差会影响绝对分,跨版本比较需固定打分流程。资源状态方面,文中引用的第三方工具链接状态不一,本次核对为部分可用、部分不可用或本次未能确认可达,复现时应以正文开源声明与实际可达性为准,不默认全部公开可用。
复现先做什么:按原文重走需要哪些步骤?
复现先做数据核对。按人类 1500 段与通用 1500 段的划分清点规模,再按真实、编辑、合成三态与 7 种配对核对标签,确认舍去的两种混搭未被误加入。通用真实段核对场景分布,合成段核对帧驱动与场景驱动两种规划路径,编辑段核对生成式与掩码两条执行路径及回填位置。人类部分核对口语句插入、删除、替换的覆盖。
再做标注核对。第一层与第二层直接由构造状态推导,第三层核对五选一正确项是否来自长解释中最显著证据,第 4 层核对是否同时描述位置、被改内容与视听异常,并检查人工校验记录。评测时固定四项任务的设问模板与稳健解析规则,缺失答案记为缺失而非猜对,前三项同时看准确率与宏平均 F1,开放解释固定打分者版本。模型侧区分代码开源、权重下载与系统可运行三件事,只报告原文实际可运行的策略,搜索最优与事后最优另行标注。
还需补的验证包括分场景、分信噪比与分编辑面积的拆分,音频单独增强后的对比,以及换用新一代生成器后的稳定性测试。关键超参数与信息条件要保留题目模板、采样帧数、谱图参数与解析阈值,缺失项如实记录为缺项,不从模型名推定实现。
收束:何时值得尝试这个基准?
当研究目标是从人脸二分类走向全场景、可解释的音视频伪造检测时,该基准值得尝试。它提供从整段真假到类型、证据与解释的递进考题,能同时暴露跨域稳健性、细粒度感知与跨模态对齐 3 类短板。复用时可先用二元判断筛出可用模型,再用类型分类与细节选择定位编辑盲区与听觉短板,最后用开放解释检查证据链是否自洽。
不适合的场景包括只关心单帧人脸真假、只需要二分类部署指标,或无法承担长文本解析与模型打分成本的研究,此时应另选更轻的基准。总体判断是音视频大模型已显现统一检测器的潜力,但在细粒度感知、音频视频对齐、偏差控制与解释推理上仍有根本局限,未来工作应朝感知增强、可解释与稳健评测方向推进。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



