从人脸二分类到十一场景四层追问:AVFakeBench 如何考住音视频大模型
该研究针对真实世界音视频伪造超越人脸、混用编辑与合成的问题,构建含 3000 片段与 12000 问答的 AVFakeBench 并评测 11 个音视频大模型与 2 个专用检测器,报告显示大模型在二分类上更稳但在细粒度分类与解释上大幅下滑且存在视觉偏向与编辑盲区。
该研究针对真实世界音视频伪造超越人脸、混用编辑与合成的问题,构建含 3000 片段与 12000 问答的 AVFakeBench 并评测 11 个音视频大模型与 2 个专用检测器,报告显示大模型在二分类上更稳但在细粒度分类与解释上大幅下滑且存在视觉偏向与编辑盲区。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
问题是弱监督时间伪造定位中训练只做整段二分类而推理要输出边界,方法选择两阶段分类回归加隐属性分解与时序图精炼,最强证据是在两个基准上平均 mAP 分别提升约 8% 和 4%,代价是定位阶段引入约 45M 回归参数与伪标签噪声管理。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对音视频时间伪造定位中边界模糊、伪造稀疏和长距离衰减问题,DeformTrace 用可变形自扫描、中继令牌与可变形交叉扫描改造状态空间模型,在 LAV-DF 与 AV-Deepfake1M 上取得精度与效率优势,但依赖冻结特征与固定超参数组合。
针对一段音频里同时含真实与伪造、跨时间与跨声源的混合真实性检测,ToolDF 用音频大模型做编排器按结构调用分离与四个领域专家并执行早失败汇总,在复合类型上取得最高的 C-Avg. 81.89,代价是依赖外部工具的可靠性。
音频伪造检测 | 6.3/10
音频伪造检测 | 5.8/10
音频伪造检测 | 7.7/10
音频伪造检测 | 9.6/10
音频伪造检测 | 5.6/10
音频伪造检测 | 6.3/10
音频伪造检测 | 6.8/10
音频伪造检测 | 8.3/10
音频伪造检测 | 7.2/10
音频伪造检测 | 8.0/10
音频伪造检测 | 7.5/10
音频伪造检测 | 8.3/10
音频伪造检测 | 6.5/10
语音伪造检测 | 6.4/10