英文题目:Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes
会议身份:
conference:eacl:2026:conference-paper-id:2026.findings-eacl.102
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#对比学习 #大语言模型 #音视频 #音频深度伪造检测
评分:7.0/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Gautam Siddharth Kashyap:机构信息未能从会议 PDF 纯文本可靠映射
- Harsh Joshi:机构信息未能从会议 PDF 纯文本可靠映射
- Niharika Jain:机构信息未能从会议 PDF 纯文本可靠映射
- Ebad Shabbir:机构信息未能从会议 PDF 纯文本可靠映射
- Jiechao Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Nipun Joshi:机构信息未能从会议 PDF 纯文本可靠映射
- Usman Naseem:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理音频、视频与音视频输入到真伪二分类的检测任务,难点在于模态碎片化导致各模态孤立预测冲突,以及浅层融合难以捕捉唇动与言语行为等细粒度跨模态语义矛盾。方法第一步分别用XLS-R、VideoMAE与VATLM提取模态特定嵌入,并经模态特定投影映射至共享隐空间。第二步对共享嵌入做对比学习,拉近真实跨模态对并推远伪造对,输出对齐后的音频、视频与音视频嵌入。第三步将对齐嵌入送入GPT式Transformer以自注意力精炼模态间语义依赖,再拼接经Sigmoid分类头判决。与过早融合或孤立建模的已有方法不同,该设计将特征提取与语义集成显式分离,先保留模态信号再做跨模态推理,因而更敏感于语义不一致。在ASVSpoof 2019 LA基准下,ConLLM w/ GPT Weights的等错误率为0.21%,低于MiO的0.41%。该结论适用边界限于六个基准官方划分内的验证,对未知生成器与开放场景的泛化尚未验证,且原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 数据相关资源:https://www.asvspoof.org/index2019.html — 链接可访问(HTTP 200)
- 数据相关资源:https://zenodo.org/records/7603208 — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/OpenTAI/wild-deepfake → https://github.com/xingjunm/wild-deepfake — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/DASH-Lab/FakeAVCeleb — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
这篇解读的输入是会议论文的正文文字与官方原图像素,目标是让刚进入语音、音乐与音频方向的研究生能够核对实验条件并复述方法。解读必须保留的信息包括任务定义、2 阶段结构的分工、每个组件的输入输出、训练与评估的数据划分、指标方向与关键数字,以及消融证明了什么、没有证明什么。输出按学习依赖组织,先讲伪造检测为何需要跨模态,再讲全景与组件计算,再讲训练与评估条件,最后讲结果、反证与复现动作。
任务是二值真伪判决,输入可以是纯音频、纯视频或音视频同时出现,输出是整段判为真实还是伪造。用白话说,等错误率是指误报率与漏报率相等时的错误水平,数值越低越好;准确率是指判对的比例,越高越好;曲线下面积是指跨阈值区分能力,越高越好。初学者常把准确率高直接等同于系统可用,论文的评估提醒要同时看区分能力与错误对称点,尤其在音频防欺骗中更常用等错误率。
需要提前固定简称。预训练模型指在大规模语音或视频数据上先训练好的特征抽取器,后文简称预训练模型;对比学习指拉近正对、推远负对的表示学习方法;大语言模型推理在此特指受 GPT 风格启发的变换器精炼模块,不是调用公开聊天模型做问答。模态碎片化指音频与视频特征各自为政、难以联合判决。
浅层模态间推理指只做表面融合而漏掉语义矛盾。后文沿一个样本走完全流程,再展开公式与数字。
同输入同目标的前人路线卡在哪里?
按同输入、同目标、同监督与同运行阶段对照,前人可分为 3 条路线。第一条是单模态伪造检测,输入是人脸动作或合成语音痕迹,做法是找视觉抖动或声学伪影。这条路线在跨模态伪造面前不足,因为伪造者会刻意保持音画表层一致,单看一路容易被逼真的一路误导。
第二条是对比表示学习,做法是让语义相近的样本在向量空间更近、不相似的更远,已在语音欺骗与图像伪造的单模态任务中见效。但论文指出这类工作多停留在单模态内部,没有解决音频向量与视频向量如何对齐,因此不能直接搬到多模态判决。
第 3 条是多模态融合,早期用手工设计的音视频不一致特征,近期用神经网络做跨模态学习。论文认为这两类仍常出现两个问题,一是特征抽取后没有显式对齐,二是融合停留在浅层加权,缺少对言语内容与视觉行为是否语义一致的高层推理。教学例子是逼真人脸配机械语调,若只看脸会判真,若只听声音会判假,浅融合则可能折中为不确定,这正是后续 2 阶段要处理的对象。
论文把哪两种失败定义为要解决的问题?
论文把失败归纳为两种可操作的情形。第一种是模态碎片化,表现为视觉分支判真、音频分支判假,联合时冲突或不确定。原因是各模态独立处理,特征不在同一空间,矛盾线索无法比较。第二种是浅层模态间推理,表现为唇形与音频对齐但言语内容违背已知行为,模型仍输出为真。原因是融合只看表层同步,没有推理语义。
下面这张图把两种失败并排展示,上半是预测冲突,下半是语义漏检,阅读时先区分几何未对齐与语义未理解。
看图路径: 1. 先看上半部分视觉判真而音频判假的冲突框,确认孤立判决如何矛盾;2. 再看下半部分模型输出判真而真值是伪造的对照,确认语义漏检;3. 对比两处 Why 框,区分特征未对齐与语义未推理两种失败;4. 记住两个多模态例子:逼真人脸配机械音与唇形对上但言行矛盾

论文图 1。原论文 Figure 1:“Illustration of common failure modes in multi- modal deepfake detection.”。
从像素看,上半部分用 3 个框分别标出视觉判为真实、音频判为篡改、音视频联合为不确定或冲突,并用文字说明孤立处理产生矛盾线索,例子是逼真人脸但语调机械。下半部分用模型输出判真对照真值为篡改,说明忽略跨模态语义不一致,例子是唇形对上但言语与已知行为矛盾。初学者复述时要能说清,第一种失败需要对齐来解决,第二种失败需要语义精炼来解决,这直接对应后文第二阶段的两个子步骤。
两阶段全景如何让一个样本走完输入到输出?
全景分为两个阶段。第一阶段是嵌入抽取,输入按模态分流,音频走语音预训练模型,视频走视频掩码自编码器类模型,音视频联合走视听文本统一预训练模型。每路输出高维向量,再经各自的投影函数映射到同一维度的共享隐空间,保证后续可以比较与拼接。原文强调先独立抽取、不提前融合,目的是保留模态特性。
第二阶段是跨模态精炼,先做对比学习对齐,再用类 GPT 变换器精炼,最后把 3 路精炼向量拼接后送入带激活的分类头,输出零或一。沿一个样本走一遍,假设输入是一段人物讲话视频,先得到音频向量、视觉向量与联合向量并投影到同一空间,对比步骤让真实样本的 3 路更近、伪造与真实更远,变换器再建模 3 路间的语义依赖,拼接后分类器综合判决。
下图展示了从数据集到 3 路模型再到共享空间、再到对比与变换器、最后拼接输出的主路径。
看图路径: 1. 从左侧数据集箭头进入第一阶段,确认三路预训练模型与投影位置;2. 沿共享隐空间箭头进入第二阶段,确认对比学习在变换器之前;3. 观察变换器后指向拼接再指向输出的箭头,确认先精炼后融合的顺序;4. 核对阶段标注,区分特征抽取与跨模态精炼的职责边界

论文图 2。原论文 Figure 2:“Overview of the ConLLM architecture. Modality-specific embeddings are extracted using PTMs (XLS-R, VideoMAE, VATLM) and projected into a shared latent space.”。
从像素看,左侧数据集箭头进入包含 3 个图标的第一阶段框,下方标出投影与共享隐空间,箭头折返进入右侧第二阶段框。第二阶段框内先是对比学习框,箭头指向两列向量与连线,再旁注类 GPT 变换器云形框,下方箭头指向拼接与输出柱状图。复述时要指出顺序不可颠倒,对齐发生在精炼之前,拼接发生在分类之前,这与消融中去掉任一步都会下降的报告相互呼应。
第一阶段如何抽取并投影到可比空间?
第一阶段的计算可写成两步。记输入集合包含音频、视频与音视频 3 类,每类经对应预训练模型得到维度可能不同的向量,再经模态专属投影得到同一维度向量。投影的作用是把异构维度统一,使余弦相似度与注意力计算有意义。论文选用的具体模型是语音用跨语言语音表示模型,视频用视频掩码自编码器,音视频用视听统一变换器,选择依据是语音通用基准上的表现与各自领域中的时空建模能力。
预训练模型 × 模态碎片化: 预训练模型负责在第一阶段为音频、视频各自保留本模态的细粒度特征而不提前混合,模态碎片化是指这些特征若停留在各自空间就会尺度与语义不一致、难以联合判决,二者搭配的理由是先用大规模语音与视频预训练得到可比性强的起点,再经投影到共享隐空间,才让后续对比学习有可对齐的对象,组合意义在于把隔离的特征变为可联合推理的输入。
初学者容易误以为投影只是降维,实际它是跨模态可比性的前提。若跳过投影直接拼接,不同量纲与语义粒度的向量会被同等对待,后续对比损失的距离也就失去可比性。原文未报告投影是线性层还是多层感知机、是否冻结预训练主干,这些缺项在复现时需要按自己的基线明确记录,不从模型名称推定冻结与否。
对比对齐与注意力精炼各自算什么?
对比步骤的目标是最小化真实样本跨模态距离、最大化篡改与真实的距离。实现上以余弦相似度度量向量接近程度,以温度系数控制分布锐利度,正对是跨模态的真实样本组合,负对包含篡改样本。分母对负对求和,分子取正对,取负对数后求和即为对比损失。训练时该损失与分类损失共同优化表示,使音画不一致成为可度量的距离信号。
\[k∈N exp(sim(hi,hk)/τ)\]精炼步骤把对齐后的 3 路向量一起送入变换器,用查询、键、值线性投影与缩放点积注意力建模依赖。查询、键、值均由输入向量经可训练矩阵得到,注意力权重决定每路在精炼时参考其他路的程度。核心缩放因子保证点积量级稳定。
\[√dk\]精炼后的 3 路向量拼接为一个长向量,再经分类头得到最终预测,预测取值为零或一。
\[nal prediction: ˆy = fcls(hconcat)\]对比学习 × 跨模态对齐: 对比学习负责拉近同源真实样本的音频与视频表示、推远真实与伪造的表示,跨模态对齐是指让不同模态的同一事件在共享空间中位置一致,二者搭配的原因是仅靠分类损失难以显式约束模态间距离,而对比目标直接以余弦相似度与温度系数定义正负对距离,组合后模型对音画不一致更敏感,为语义精炼提供已对齐的底座。
大语言模型推理 × 浅层模态间推理: 大语言模型推理在此指用 GPT 风格的多头自注意力变换器对已对齐的音频、视频与音视频向量做上下文建模,浅层模态间推理是指仅做拼接或加权而忽略唇形对上但言语行为矛盾这类语义矛盾,搭配理由是注意力能建模 3 路向量间的依赖与上下文,组合意义是把几何上的对齐进一步提升为语义一致性判断。
拼接融合 × 分类头: 拼接融合负责把精炼后的音频向量、视频向量与音视频联合向量首尾相连保留完整信息,分类头负责把长向量映射为真或假的二值预测,二者搭配的原因是非拼接的加和或平均会提前压缩并稀释模态特有线索,而拼接让分类器同时看到 3 路证据,组合意义是保留可追溯的模态分工再做联合判决。
复述时要区分原始目标与实现细节,对比是几何对齐,注意力是语义依赖建模,拼接是信息保留。原文未给出对比损失与分类损失的加权系数、温度取值的搜索过程与梯度是否截断,这些缺项需在复现笔记中标为待确认,不猜测优化路径。
训练如何组织,哪些更新规则是原文明确的?
训练配置在原文中是跨数据集固定的,学习率为千分之一,批量为三十二,共 50 轮,动量为 0.9,权重衰减为万分之一,丢弃率为 0.5,激活为线性整流,优化器为自适应矩估计,并采用每 10 轮乘 0.1 的阶梯衰减。固定超参数的目的是保证跨基准比较的一致性,初学者复现时应先照抄该组配置再做单变量改动,并记录随机种子与早停规则,原文未报告种子与早停,需自行补齐。
监督来源是各数据集自带的真伪标签,对比步骤的正负对由标签与模态归属构造,分类头由二值标签监督。论文比较了两种初始化,一种载入受 GPT 风格启发的预训练变换器权重,另一种从零训练,以此分离容量增大与预训练知识的贡献。结果显示载入权重的一版在各模态上持续更好,支持预训练知识有增益的判断,但原文未披露权重来源的训练语料与冻结层数,因此不能把增益归因到某一语料,只能说在该实现下初始化有帮助。
需要明确没有训练的环节是第一阶段所用的大规模预训练主干,本研究未重新训练它们,而是调用其抽取能力。真正的训练发生在投影、对齐、精炼与分类部分。若把未训练等同于确定性求解是误解,即使参数冻结,数据增强、丢弃与批量顺序仍会带来随机性,复现时要固定这些因素才能比较。
数据、划分、指标与基线条件是什么?
数据覆盖 3 个模态共 6 个基准。音频用欺骗语音评测集的逻辑访问划分与多语言集的英文与中文子集,视频用名人伪造集与野外伪造集,音视频用音视频名人伪造集与深度伪造检测挑战集。原文声明遵循各数据集官方的训练与评估划分,跨语言实验把中文训练英文测试与反向各做一组。资源状态方面,本次核对的 4 个数据集链接当前可用,包括欺骗语音评测、多语言集、野外伪造与音视频名人伪造,其余 2 个数据集的链接状态本次未逐一确认,复现前需按官方页核对版本与许可。
指标按模态固定,音频报告等错误率,越低越好;视频与音视频报告准确率与曲线下面积,越高越好。表头用向上与向下箭头标明方向。计算代价另用推理时间、内存占用与浮点运算量衡量,分别对应延迟、显存与算力,总体趋势不等于每组都成立,需分数据集看。
比较条件上,主结果把完整方法与各自模态的代表性基线放在同一划分下比较,消融把去掉某组件的对照与完整方法在同一配置下比较。公平性的关键是划分一致、指标一致与超参数固定,原文明确超参数跨数据集固定,这一点支持比较的可读性。但原文未报告显著性检验与多次运行的方差,阅读时应把单点数字当作 1 次报告而非分布结论。
主结果在什么条件下比谁好多少,有何代价?
先看视频单模态的比较问题,在相同名人伪造与野外伪造划分下,完整方法能否同时在准确率与跨阈值区分能力上超过卷积与伪造挖掘类基线。指标方向是两项越高越好。下表保留了代表性基线与完整方法的两版初始化,可运行的策略是载入预训练权重的一版。
| Method | CDF | CDF | WD | WD |
|---|---|---|---|---|
| Xception (Chollet, 2017) | 97.90 | 99.73 | 77.25 | 86.76 |
| RECCE (Cao et al., 2022) | 98.59 | 99.94 | 83.25 | 92.02 |
| ConLLM w/ GPT Weights | 98.75 | 99.98 | 85.00 | 94.50 |
| ConLLM w/o GPT Weights | 96.50 | 99.20 | 81.00 | 90.00 |
表后解释显示,载入权重的一版在名人伪造上达到较高的准确率与接近上限的曲线下面积,在更难的野外伪造上仍保持领先,但未胜出项也值得注意,去掉预训练权重的一版在野外伪造上回落明显,说明野外光照与压缩变化对初始化更敏感。代价是该表只给判别指标,未同时报告延迟与内存,不能据此承诺部署更快,部署结论需另看代价表。
再看音视频的比较问题,在音视频名人伪造与检测挑战集上,完整方法能否超过失同步、情感线索与联合音视频基线。指标同样越高越好。下表保留了从早期融合到近期自监督对齐的基线,以及完整方法的两版初始化。
| Method | FAVC | FAVC | DFDC | DFDC |
|---|---|---|---|---|
| AVAD (Feng et al., 2023) | 94.2 | 94.5 | 93.2 | 96.7 |
| PVASS (Yu et al., 2023) | 95.7 | 97.3 | 96.3 | 98.9 |
| ConLLM w/ GPT Weights | 98.75 | 99.98 | 96.50 | 98.92 |
| ConLLM w/o GPT Weights | 95.00 | 98.00 | 90.00 | 94.00 |
表后解释显示,完整方法在两个音视频集上均报告了更高的准确率与曲线下面积,近期对齐类基线已接近高位但仍被超过。反例是去掉权重的一版在检测挑战集上下降更多,说明大规模多主体数据的语义精炼更依赖初始化。边界是原文未评估全新生成器与实时流条件,跨生成器的泛化仍待验证。
音频主结果在正文中报告为在欺骗语音集上等错误率 0.21%、在英文子集上 0.01%,优于所列的混合损失与多模型基线。跨语言泛化报告为中文训练英文测试 1.5%、反向 2.0%,远低于所列的跨语言对照。热图进一步展示不同预训练模型在 7 个数据集上的等错误率分布,阅读时先看行列定义再看颜色方向。
看图路径: 1. 先确认横轴七个数据集与纵轴三类预训练模型的网格范围;2. 比较同一列内不同行的等错误率数值,判断哪类模型在该数据上更低;3. 观察右侧颜色条方向,确认深色对应更低的等错误率;4. 注意视频模型在纯音频列为空格,不做跨模态外推

论文图 3。原论文 Figure 3:“Heatmap of Equal Error Rate (EER %) across different PTMs and datasets”。
从像素看,热图横轴为 7 个数据集,纵轴为 3 类预训练模型,格内数字为等错误率,右侧颜色条标明数值越小颜色越深。第一行在纯音频列有数而后两行在纯音频列为空,说明视频与视听模型未在纯音频上评测,不能跨格比较。格内可见视听统一模型在视频与音视频列数值更低,语音模型在全列更平稳。初学者应把该图当作模型与数据匹配关系的提示,而非完整方法的最终成绩,最终成绩以主结果表为准。
拿掉哪一块会怎样,融合方式有何差异?
消融按 4 个问题组织。第一,预训练特征对比传统卷积特征,报告显示在音频上等错误率从较高降到较低,在视频与音视频上准确率与曲线下面积同步提升,支持大规模预训练带来更抽象的时序与语义特征的解释,但该解释是有限解释而非因果证明。第二,对比学习开关的比较显示加入后音频等错误率减半,视频与音视频准确率提升数个百分点,支持对齐增强了对跨模态不一致的敏感性。
第三,大模型精炼开关的比较显示在已对齐基础上再精炼仍有稳定增益,音频与视频均小幅提升,支持高层语义带来额外判别力。第四,拼接对比非拼接的比较显示拼接在各集上均更好,原因是拼接保留了模态特有信息,而加和或平均会提前稀释。
下图四行分别对应上述 4 个主题,每行左侧为音频等错误率、中部为准确率、右侧为曲线下面积。
看图路径: 1. 按行确认四个消融主题:预训练对比卷积、对比学习开关、大模型精炼开关、拼接对比非拼接;2. 每行内先看左侧音频等错误率柱,再看中部准确率与右侧曲线下面积柱;3. 核对图例颜色,确认哪根柱是完整方法、哪根是去掉某组件的对照;4. 比较同一数据集上完整方法柱与对照柱的高度差方向是否一致

论文图 4。原论文 Figure 4:“Ablations to evaluate the impact of (i) modality-specific embedding extraction using PTMs, (ii) contrastive learning for cross-modal alignment, (iii) embedding refinement via…”。
从像素看,第一行图例区分预训练与卷积,第二行区分带对比与不带对比,第三行区分带大模型与不带大模型,第四行区分拼接与非拼接。每行内完整方法的柱在音频上更矮、在准确率与曲线下面积上更高,方向一致。但要注意纵轴起点并非零,视觉高度差会被放大,复述时应引用格内趋势而非目测比例,且未胜出项是各对照柱,它们在部分数据集上差距较小,说明单靠一处改动不能解决全部失败。原文对消融未报告方差,差距较小的格应表述为支持而非证明。
哪些结论不能下,哪些边界尚未评测?
论文明确承认三点局限。第一,性能依赖训练数据的质量与多样性,对未见过的生成技术泛化可能受限。第二,多模态训练与推理的计算需求给实时与资源受限部署带来挑战。第三,虽在多个流行基准上表现强,仍需在更广泛的真实数据上评估稳健性、可扩展性与可解释性。
从证据看,未测量的量不能承诺改善,包括误判率的人群分布、真实直播延迟与端侧功耗。总体趋势不等于每步都成立,例如代价表显示完整方法比大模型更快更省,但这是跨模型比较,不是消融中每加一个组件都更快。相关性也不是因果,预训练权重伴随的增益可能来自更好的优化起点而非语义理解,原文未分离这两条路径。伦理上论文主张用于打击误信息并提醒隐私、知情同意与滥用风险,要求透明使用与保护敏感信息,初学者在复现人脸与语音数据时应遵守许可与去标识要求。
要复现应先做什么,需要准备什么?
先按官方划分准备 6 个基准的数据与标签,核对采样率、帧采样与切分方式是否与官方脚本一致,再固定超参数为学习率千分之一、批量三十二、50 轮、动量 0.9、权重衰减万分之一、丢弃率 0.5 与每 10 轮乘 0.1 的衰减。第一阶段调用语音、视频与视听预训练模型抽取向量并投影到同一维度,第二阶段先优化对比损失再经变换器精炼,最后拼接并训练二值分类头。
先跑通载入权重与从零训练两个版本,确认初始化增益是否在本地复现,再依次做 4 个消融,去预训练特征、去对比、去精炼、换非拼接融合,每次只改一处并记录划分、指标聚合对象与单位。代码层面论文给出仓库地址,但本次解读不把地址当作可达承诺,实际克隆前需确认分支与依赖可用。若仓库不可达,仍可用公开的语音与视频预训练模型按上述步骤重搭流程,但需明确标注为重实现而非原代码复跑。
还需补的验证包括多次随机种子的方差、跨生成器的留一测试、不同压缩与噪声下的稳健性,以及推理时间与内存的端到端测量。记录时区分代码开源、权重下载与系统可运行三件事,有代码不等于有权重,有权重不等于能在目标硬件上达到所需帧率。
何时值得尝试这个方案,如何一句话记住它?
当任务同时出现音画两路且失败既有特征对不上又有语义看不懂时,值得尝试先投影对齐再用注意力精炼的方案。若只有单模态或数据极少,优先验证预训练特征本身是否已足够,不必 1 次上全套。记住一句话,先让各模态说同一种向量的语言,再让变换器检查它们讲的故事是否一致,最后拼接判决。
对音频研究生的启示是,等错误率的降低往往来自表示可比性而非分类器复杂度,对比损失的正负对构造与温度选择值得单独调参。对视频与音视频方向的启示是,野外数据的提升更依赖初始化与对齐,拼接虽简单但能保留证据,适合作为强基线。未来工作可沿论文指出的方向补齐真实场景评估、轻量化部署与可解释定位,把真伪判决进一步做到时间维度的伪造定位。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses