英文题目:Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

会议身份:conference:acl:2026:conference-paper-id:2026.findings-acl.1379

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#文献综述方法 #模型评估 #隐私保护 #音视频理解

评分:6.3/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:综述

👥 作者与机构

  • Nobin Sarwar:机构信息未能从会议 PDF 纯文本可靠映射
  • Shubhashis Roy Dipta:机构信息未能从会议 PDF 纯文本可靠映射
  • Zheyuan Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Vaidehi Patil:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该综述面向多模态基础模型的目标遗忘,输入为图像文本视频音频及跨模态关联,输出为抹除遗忘集影响且保留保留集效用的模型,难点在于跨模态残留关联易导致单模态遗忘失效且遗忘与效用权衡缺乏统一度量。方法链先按遗忘目标域划分为实例级遗忘与概念级遗忘以界定删除粒度,其输出进入按干预阶段的五路划分,分别负责数据侧扰动与清洗、训练时梯度掩码蒸馏编辑、架构冻结与层域约束、免训练权重空间投影以及解码时引导与条件通路控制。最后汇总身份版权语音安全与类别等多类数据集、统一基准套件与六维评测框架,将遗忘质量安全隐私效用鲁棒性与环境成本映射为可操作指标。与既往按优化目标的算法分类相比,该管线分类强调作用点可逆性延迟与删除强度的工程权衡,对部署选型更直接。在MLLMU-Bench基准下,虚构名人身份的规模指标为500,高于公开名人身份的153。上述结论适用边界限于文献综合与选型参考,跨模态泛化与对抗条件下的删除强度尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 第三方资源:https://github.com/bedapudi6788/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文输出什么?

本文输入是这篇发表于 ACL 2026 Findings 第 27702 至 27730 页的综述原文与本次收到的官方原图像素,目标读者是刚进入语音音乐音频方向的研究生。必须保留的信息是方法按干预阶段的划分、遗忘目标按实例级与概念级的划分、数据集与基准的规模与任务类型、评估指标的定义方向,以及开放挑战与复现条件。本文输出是 1 篇可核对的技术解读,按学习依赖从任务到方法再到评估与复现展开,不做营销式判断。

多模态遗忘要解决的问题是,在不从头重训的前提下,去掉指定遗忘集的影响,同时保住保留集在各单模态与共享表示上的效用。原文把学习算法记为 A,训练数据记为图像文本对集合,原始模型为训练所得,重训参考为去掉遗忘集后重训所得,遗忘操作是从原始模型与数据得到遗忘后模型。理想要求是遗忘后分布与重训分布在联合预测与参数空间上接近,并用对称的近似准则刻画,零参数时回到精确等价。

教学例子是,假设要忘掉一张特定人脸与名字的配对,实例级做法是让该配对不再被答对,概念级做法是让该身份在任何新图与问法下都不再被认出,前者是点删除,后者是类删除。

对音频方向的新生而言,关键是把图像文本对的写法推广到视频与音频。原文明确说明用图像文本对简化书写,形式可推广到视频与音频,音频实例可以是说话人话语,视频实例可以是动作片段。学习顺序是先理解遗忘与保留的两项目标,再看视觉语言模型与扩散模型各自的绑定位置,最后看数据训练结构免训练与解码 5 类动手点,这样后文的基准与指标才有落点。

已有路线讲了什么,本文为何换成系统视角?

已有机器遗忘工作先形式化了从已学模型中去掉训练影响的目标,后续扩展到多模态与生成系统,包括扩散模型与视觉语言模型,支持实例级或概念级删除并保留效用。原文指出,既有综述常偏向文本或图像单模态,或只覆盖窄的文本图像系统,且多采用按优化目标组织的算法中心分类,这会遮住在端到端多模态流水线中真正重要的干预点。因此文献缺少连接视觉语言视频音频机制的统一阐述。

本文的差异是采用系统优先的分类,按干预阶段与控制点组织方法,并以遗忘目标范围作为顶层切分。原文声明的贡献有三项,一是综合图像文本视频音频的机制理论与评估,二是提出按阶段与通路的分类以便跨模型类比较,三是梳理评估对抗鲁棒与部署约束等前沿。对研究生而言,同输入同目标的对照是,若只看损失函数族,很难回答该在数据训练还是解码动手;按阶段看,则能把删除强度效用保留效率与可逆性放在同一张图上比较。

相关工作的边界也需要交代。原文把偏置与隐私护栏、上下文缓解等放在遗忘相邻控制中,前者通过重加权与隐私编辑在数据通路动手,后者通过插入少量多模态演示在提示时引导冻结模型。它们不是本文主线的遗忘方法,但在部署中常被混用,学习时应区分改权重与只改输入的差异。

任务如何形式化,实例与概念如何区分?

问题设定是,给定遗忘集与保留集,保留集为全集去掉遗忘集,目标是遗忘后模型接近去掉遗忘集后重训的模型。单图像遗忘对应遗忘集为单个图像文本关联,要求去掉该关联而保住保留集效用。优化目标写成两项之和,一项压制遗忘集关联,一项保持保留集效用,系数平衡两者。原文还给出近似重训等价的对称界,用随机性上的概率描述重训与遗忘分布的互相接近。

视觉语言模型遗忘针对绑定视觉与语言的部件,支持实例级与概念级去除,同时保持单模态能力。模型被抽象为视觉编码器文本编码器与融合头,目标在视觉与融合参数上平衡抑制与效用。概念铰链通过惩罚遗忘对相似度超过阈值的违反来解耦语义,一致性或描述项保持保留集性能,选择性更新用显著性掩码对梯度加权。扩散模型遗忘聚焦条件去噪路径,教师引导损失让目标条件对齐无条件或安全教师,保留损失稳定保留集生成质量,表示编辑通过修改交叉注意力键值实现,采样时还可用降低引导强度或负提示偏转目标。

对音频的映射是直接的,把图像换成波形或频谱,把文本换成转录或提示,把融合换成音频语言对齐,遗忘集可以是特定说话人或授权音乐片段,保留集是其余语音与音乐。原文在未来方向中明确提到音频视觉耦合与说话人生物特征,以及流式与持续删除的部署保证尚未解决,这提示音频遗忘不能只看单条样本准确率,还要看跨提示的身份一致性是否被切断。

五类动手点如何覆盖从数据到解码的全链路?

全文把方法按干预阶段分为数据侧干预、训练时编辑、结构约束、免训练与解码时 5 类,每类再按控制通路细分。顶层还有实例级与概念级的范围切分,同一阶段的方法可服务不同范围。理解时先沿一个样本走完输入到表示到组件到目标再到输出,输入是多模态对,表示是编码器与融合或去噪条件,组件是掩码剪枝投影或引导器,目标是压遗忘保保留,输出是遗忘后模型或受控采样。

下图给出从多模态基础模型到遗忘后模型的干预点总览,阅读时先看主路径再看分支回路,有助于把后文大量方法名放回流水线。

看图路径: 1. 先从左侧四种输入图标沿箭头看到中间的多模态基础模型节点;2. 再看中间模型经增量变换到右侧遗忘后模型的箭头与下方五类干预点;3. 对比训练后模型变白的节点与解码时分支的回路差异;4. 确认免训练分支标注的闭式编辑符号与重训路径的区别

原论文 Figure 1:Unlearning intervention points for a Mul- timodal Foundation Model (MFM).

论文图 1。原论文 Figure 1:“Unlearning intervention points for a Mul- timodal Foundation Model (MFM).”。

该图显示左侧文本图像视频音频 4 种输入进入中间基础模型,中间模型经增量变换得到右侧遗忘后模型,下方按顺序列出数据侧、训练时、结构约束、免训练与解码时 5 个干预点。免训练分支用闭式参数或表示编辑直接变换模型而不重训,解码时分支在输出端形成回路而不改基座权重。对音频新生而言,这张图的作用是定位,若目标是阻止受保护样本被学到则看数据侧,若目标是去掉已学说话人则看训练时或结构分支,若只能动线上服务则看解码时。

数据侧含数据路径扰动与数据卫生两条通路,前者编辑输入以降低目标簇或对的可学性,后者通过加权或规范化减轻后门与触发效应。训练时含直接梯度、约束更新、掩码驱动与蒸馏 4 条通路,都是定位后遗忘但在如何约束漂移上不同。结构约束含结构编辑与层范围更新,免训练含权重空间线性编辑与表示投影,解码时含引导路径与条件路径控制。原文强调该组织可跨视觉语言视频音频比较共享通路,并澄清删除强度效用保留效率与可逆性的权衡。

各组件算什么,掩码剪枝投影如何分工?

训练时直接梯度把遗忘写成在保留集与遗忘集上的目标风险最小化,含保留效用项、遗忘抑制项、可选重定向项与偏离参考模型的正则项。扩散模型用偏好对齐去噪锚点重定向或不确定性目标实例化该模板,视频变体对共享文本编码器做类似更新,音频音乐系统用任务损失降低说话人身份证据、压制记忆转录或去掉授权内容。约束更新把权衡显式化为带遗忘有效性与模型完整性约束的风险最小化,不同方法在约束实例化与梯度调和上不同。

下图是按阶段与通路展开的分类树,阅读时把方法名挂回 5 类动手点,可避免被大量缩写淹没。

看图路径: 1. 先沿最左列确认五大干预阶段再向右展开到控制通路;2. 对照训练时编辑下的四个子类各自列出的代表方法名;3. 比较免训练与解码时两类方法在是否改权重上的划分;4. 记录音频与视频相关方法出现在哪两个分支以便后文核对

原论文 Figure 2:Taxonomy of multimodal unlearning methods, organized by intervention stage and control pathway,…

论文图 2。原论文 Figure 2:“Taxonomy of multimodal unlearning methods, organized by intervention stage and control pathway, with representative approaches in each category.”。

该图从左到右依次展开数据侧两类、训练时 4 类、结构约束两类、免训练两类与解码时两类,每类右侧列出代表方法。训练时分支下可看到直接梯度、约束更新、掩码驱动与蒸馏的并列关系,结构分支下可看到剪枝冻结与层定位的区分,音频遗忘出现在结构编辑分支,视频遗忘出现在权重空间分支。结合像素观察,同一阶段内方法共享定位后遗忘的流程,区别在于改损失、改支持集还是改计算图。

实例级遗忘 × 概念级遗忘: 实例级遗忘负责删除指定的图像文本对或说话人样本等具体数据的关联,分工是切断记忆点;概念级遗忘负责压制某一类语义如风格有害概念或身份在所有提示下的表达,分工是切断语义通道;二者搭配是因为多模态模型同时存具体关联和共享表示,只做其一会从另 1 通道泄漏,组合意义是顶层先定范围再选干预点。

掩码驱动把更新限制在显著性注意力或结构定位的支持集上,参数级掩码来自梯度或 Fisher 显著性,激活或空间掩码压制触发对齐的注意力,扩散时间掩码只更新部分去噪步以稳定多概念遗忘。蒸馏用教师学生把学生引向安全目标,含自蒸馏对齐条件与无条件预测、数据无关蒸馏与注意力引导蒸馏,优势是不需原始训练数据而控制相对参考模型的漂移。

结构编辑通过剪枝冻结或可控 regrow 直接改计算图,模态感知剪枝加轻微调、双层剪枝加抑制目标、冻结适配关键张量、音频剪枝后恢复容量再在保留集微调,都强调定位精度与剩余容量决定成败。层范围更新只改概念集中的层以限制附带损伤。

视觉编码器 × 融合头: 视觉编码器负责把图像变成可比的向量,文本编码器负责把提示变成向量,融合头负责把两者对齐打分;视觉语言模型遗忘把更新限制在视觉参数与融合参数,是因为绑定关系多集中于此,搭配理由是保留单模态能力,组合后可在压低遗忘对相似度的同时维持保留集问答。

条件去噪路径 × 交叉注意力: 条件去噪路径负责在每一步按条件预测噪声从而生成目标概念,交叉注意力负责把概念词映射到键值以控制生成内容;前者用教师引导损失把目标条件拉向无条件或安全教师,后者把目标键值映射到中性替代,搭配可同时改目标与通路,新增作用是减少采样时绕过单一改动的可能。

多模态遗忘的通用目标可写成遗忘项加保留项的形式,符号含义是模型参数为优化变量,遗忘集与保留集分别为抑制与保持对象,系数控制强度。原文实现是在视觉语言模型中加概念铰链与掩码更新,在扩散模型中加教师损失与注意力编辑。

\[in _ { \theta }\; J( \ t heta ) \;= \; F_{\text {forget}}(\theta ; D_f) \;+\; \lambda \]

遗忘操作是从原始模型与数据得到遗忘后模型的映射,符号中原始模型为起点,遗忘集为删除范围,操作为具体方法,输出为遗忘后模型。该式只定义接口,不规定用梯度还是投影实现。

\[to obtain Mu = U(Mo, D, Df).\]

对音频复述而言,记住组件分工即可,选择性更新管在哪里改,教师损失管向哪里拉,注意力编辑管哪条通路被中性化,投影管哪组方向被滤掉。

训练时改什么,免训练与解码时如何不改权重?

训练时编辑的真实计算是定位后更新。直接梯度先用策展数据或词元信号确定要去掉的行为,再更新参数使遗忘集响应退化而保留集稳定。约束更新在目标中保留保留集风险加稳定性先验,并用不等式约束遗忘有效性与模型完整性,优化时调和遗忘与效用梯度。掩码驱动在上述目标上再乘显著性支持集,只改最编码遗忘信号的参数特征空间区域或去噪步。蒸馏不直接最小化原始损失,而是让学生在遗忘提示上模仿安全教师,在保留提示上保持能力。原文未对每种方法的冻结层、学习率与重置时机逐一报告,复现时应回到原方法论文核对,不从模型名推定实现。

权重空间线性遗忘 × 表示投影遗忘: 权重空间线性遗忘在参数空间做减法或合并,分工是不迭代直接得到编辑后模型;表示投影遗忘在激活空间做正交投影,分工是不改权重只滤掉遗忘子空间分量;搭配理由是两者都免重训且可逆,前者适合快速事后控制,后者适合精确定位表示,组合意义是按定位精度在参数或表示层选择改动。

引导路径控制 × 条件路径控制: 引导路径控制改采样器用的分数,在去噪每一步加转向与局部抑制,分工是保持基座权重不动而改变轨迹;条件路径控制改输入的条件向量如文本嵌入或检索向量,分工是让采样器在更弱或更安全的条件下工作;搭配理由是推理时可逆且延迟影响小,组合后可按需选改分数还是改条件。

免训练权重空间线性遗忘用参考 checkpoint 的线性运算压制不想要的行为,如任务向量相减、符号一致聚合与权重取反、低秩抑制更新、排除遗忘分片的 checkpoint 平均。形式上是参考模型的线性变换,方向与幅度编码要去掉的行为,可组合可逆,适合无法重训或需快速事后控制。表示投影遗忘用正交投影去掉与遗忘子空间对齐的分量,作用于中间表示或注意力输出,基的估计来自注意力特征分解或联合嵌入统计。

解码时引导路径在每步调整预测分数,含时变转向、可选替代引导与掩码局部抑制,基座 checkpoint 固定。条件路径构造变换后的条件向量再送入条件分数,含向安全子空间投影、策略感知改写、隐藏键门控与检索混合删除,标量控制干预强度。

解码时分数调整的通用写法涉及当前隐变量、条件信号、基座预测器、时变转向与掩码方向向量,目标是在保持视觉质量与风格连贯的同时压制目标概念。

\[}_t = \ epsilon _ \t\]

该节没有新训练一个统一模型,本文是综述而不训练视觉语言视频音频模型,实际计算是整理与比较已有方法的干预点与评估。因此不能把免训练等同于确定性求解,也不能从冻结参数推定线上输出确定,解码随机性与检索覆盖仍会影响结果。

用什么数据与基准测遗忘,指标方向如何读?

数据集按应用设置与模态组织。身份情感与视频部分含人脸表情与动作数据,个性化与版权部分含主体驱动与授权内容,知识问答与指令探针含视觉问答与科学问答,分割与图像到图像部分含像素级概念,推荐部分含用户物品交互,语音部分含说话人特征与语言内容,安全鲁棒部分含越狱提示与拒绝一致性,网络规模数据卫生部分关注去噪与敏感对齐。评估维度按遗忘质量、安全内容遗忘、攻击隐私、效用保真、对抗鲁棒与计算环境 6 组组织,细节在附录中给定义与流程。

下图汇总评估维度与代表指标,阅读时先分清遗忘侧与效用侧再看攻击与成本。

看图路径: 1. 先看左侧六个评估维度再向右对齐每行列出的代表指标;2. 区分遗忘质量与安全内容遗忘两行指标的不同指向;3. 确认攻击隐私行与对抗鲁棒性行分别用的成员推断与攻击成功率;4. 核对计算与环境行是否同时列出时间显存与能耗碳排放

原论文 Figure 3:Evaluation dimensions and representative met- rics for multimodal unlearning. Details in App. B.

论文图 3。原论文 Figure 3:“Evaluation dimensions and representative met- rics for multimodal unlearning. Details in App. B.”。

该图左侧列出遗忘质量与安全、安全与内容遗忘、攻击隐私、效用保真、对抗鲁棒、计算与环境 6 个框架,右侧分别列出遗忘准确率与 CLIP 下降、拒绝率与不适当内容率、成员推断与身份匹配、检索问答与生成质量、攻击成功率、运行时间显存与碳排放。像素显示效用行指标最多,覆盖分类检索语言生成与人工判断,说明保留能力需多面验证。对音频而言,说话人相似度与零重训遗忘等语音隐私指标位于攻击隐私行,不应与通用问答指标混读。

遗忘准确率定义为遗忘集准确率的补集,数值越高表示忘得越彻底,但需与保留集准确率同看,否则可通过破坏整体能力刷高。

\[\ math r m {UA} = 100\% - \mathrm {Accuracy}(D_f)\]

分布变化的遗忘程度用遗忘前后概念分数分布与参考分布的 1 阶 Wasserstein 距离之比度量,比值刻画相对参考的搬移程度。

\[= \fr ac {W_1(A,B)}{W_1(B,R)},\]

指标方向是,遗忘侧的分类下降相似度下降与拒绝率越高越好,不适当内容率与攻击成功率越低越好,效用侧的检索召回语言分数与生成保真越稳定越好,成本侧的时间显存与能耗越低越好。原文强调需联合报告遗忘效用鲁棒与效率,单一指标不能证明遗忘彻底,分类器置信崩塌而 CLIP 相似度仅小幅下降的案例说明需同时报告离散与连续信号。

基准规模与主结果支持什么判断,有何限制?

比较问题是,在公平的多任务与多模态条件下,不同基准能否同时检验遗忘有效性与效用保留。公平条件要求同一基准内任务类型与删除范围一致,指标方向按遗忘越高越好、效用越稳越好、攻击越低越好来读。下表整理统一基准与身份隐私基准的规模与评估目标,均为原文报告的实际可运行基准,不是事后最优值。

基准模态与任务规模评估目标适用条件
MU-Bench多模态多任务9 个数据集 20 架构统一评估有效性效用效率跨实例数据集与模态
MLLMU-Bench视觉语言问答500 虚构 153 公众名人 20.7K 问答隐私遗忘泛化与效用虚构与真实身份
PEBench视觉语言多任务200 身份 8K 图像 16K 问答隐私事件可控范围审计合成身份事件
CLEAR视觉语言身份问答200 合成身份 3.7K 图像 4K 问答身份泄漏降低保问答精度合成身份
UnSLU-BENCH音频说话人意图分类多说话人 4 个语言说话人擦除保意图精度多语言语音

表后解释是,统一基准的收益是覆盖多数据集与多架构,代价是删除顺序与架构选择敏感;身份基准的收益是可审计合成身份,代价是合成分布与真实部署有差距。未胜出项是,任 1 基准都不能单独证明跨模态泄漏已消除,文本中对齐的安全在视觉或音频中不一定成立,需跨基准联合看。原文报告的定量规模支持可比性判断,但不支持跨表直接排名,因为任务与聚合对象不同。

内容与知识遗忘基准的比较问题是,生成模型的概念删除是否在保持质量的同时可测。公平条件是同一概念家族内比较生成前后,指标用分类下降与相似度下降同报。下表整理生成侧基准的规模。

基准模态与任务规模评估目标适用条件
CPDM扩散生成2.1K 锚点 18.9K 生成图版权相似降低保质量风格肖像
UnlearnCanvas扩散生成60 风格 20 对象高分辨率风格图风格遗忘保真多样性艺术风格
Holistic扩散生成33 目标概念每概念 16k 提示保真对齐鲁棒效率混合概念
MMUBench视觉语言问答20 概念每概念 50 个图概念视觉遗忘保多模态效用视觉识别
SafeEraser视觉语言问答3K 图像 28.8K 问答有害回答降低保问答效用有害知识

表后解释是,生成侧基准的主要收益是可同时看到擦除信号与保真信号,具体代价是代理指标如 CLIP 与 Inception 分数在不同架构间不易比较,且强遗忘常扭曲邻近风格或降低视觉保真。反例是,分类器置信可崩塌而相似度仅小幅下降,说明残余表示仍在,需把离散判断与连续相似度结合读。音频音乐侧的对应代价是,单模型单数据集结论难推广到多语言口音与流派,原文明确指出该局限。

哪些对照揭示失败条件,消融支持什么取舍?

原文没有统一的消融数字表,但用多处对照揭示失败条件。第一类是表示残余对照,分类下降大而相似度下降小,支持表面行为被压制而底层表示未全删的判断,适用条件是生成模型的概念擦除必须双指标同报。第二类是跨模态泄漏对照,文本中实现的安全对齐不能可靠泛化到视觉音频或联合推理,支持需用多模态攻击与基准显式探测泄漏通路。第三类是持续删除对照,多轮删除后性能与遗忘行为漂移,下游微调后被忘概念可能重现,支持 1 次遗忘不等于长期保证,需持续协议。

效用权衡的对照是,编码器硬化对级删除与细粒度遗忘会降低干净精度与跨数据集迁移,小删除比也可引起可测的多模态退化;生成侧更强遗忘会扭曲相关风格或降低保真,安全控制可能过度压制良性内容。计算对照是,许多方法需重训大骨干、维护多 checkpoint 或依赖辅助模块与重复采样,推理时控制引入额外激活或多次去噪延迟。原文未报告统一的延迟与误判率改善承诺,复述时不应承诺这些量得到改善。

未评测边界包括时间序列、表格、传感器等结构化或流式数据不在范围,音频视频遗忘相对欠探索,前沿规模模型的泛化结论受限于小骨干窄概念与单架构评估。对音频新生而言,至少需补两类特有细节,一是说话人相似度在遗忘与保留说话人上的分开报告,二是提示有无说话人条件下的身份分布差异,前者看对齐是否下降,后者看是否与提示解耦。

理论保证与评估可靠性缺在哪里?

原文把开放挑战归纳为理论保证、跨模态泛化、评估可靠性、对抗鲁棒、效用权衡与统一基准六项,强调多数方法仍是启发式,缺少可证删除隐私或合规保证。对比与视觉语言设置中,对级去除单实例删除与安全训练近似遗忘但未可证消除影响;扩散与生成模型多为压制而非证明擦除,归因与影响估计只提供近似诊断。评估可靠性问题是代理信号窄实验与不稳定指标,自动法官检测器输出与小合成基准使结论对评估设计敏感,检测器偏置可能漏掉间接线索或损伤良性生成。 下图列出 6 个开放挑战,阅读时把每一项映射到前文的证据缺口。

看图路径: 1. 先自上而下读出六个开放挑战的文字标签;2. 观察左侧插图中的奖杯清单与放大镜靶心强调评估含义;3. 对比理论保证与跨模态泛化在排序上的先后关系;4. 确认效用权衡与统一基准位于末尾两项的位置

原论文 Figure 5:Key open challenges in multimodal unlearning across theory, generalization, evaluation,…

论文图 5。原论文 Figure 5:“Key open challenges in multimodal unlearning across theory, generalization, evaluation, robustness, efficiency, and benchmarking. Details in App. F.”。

该图自上而下依次为理论保证、跨模态泛化、评估可靠性、对抗鲁棒、效用权衡与统一基准,左侧插图用清单与放大镜强调评估主题。对研究生而言,前两项对应能否从 CLIP 或单扩散骨干推广到大基础模型与多语言口音,中间两项对应代理指标与自适应攻击是否会让遗忘看起来成功,末两项对应删除强度与保真成本如何量化。该图未给出数值曲线,只能作为研究地图,不能当作性能证明。

对抗鲁棒的局限是,后门越狱与其他攻击可带回或绕过被忘内容,对比学习中的擦除关联可能潜伏在隐表示,文本图像模型的红队提示或下游微调可绕过安全遗忘,黑盒与迁移攻击进一步揭示残余痕迹。统一基准的局限是,视觉语言与语音基准多用合成身份静态图像或重训金参考,结果对模型选择数据构造与删除顺序敏感;扩散基准多围绕选定概念家族与特定架构并依赖代理分数,跨方法可复现性受限。资源状态方面,原文唯一给出的第三方链接经核验当前可用,状态码为 200,地址为床铺迪相关仓库,可作为 nudity 检测相关资源的核对起点,但不代表全部代码权重与系统可运行。

复现先做什么,需要哪些数据划分与计算?

复现第一步是定范围,先写下遗忘集与保留集的划分与聚合对象。实例级复现需列出要删的图像文本对或话语编号,概念级复现需列出目标概念的提示模板与邻域提示。数据方面,身份部分可用人脸数据的图像数核对规模,语音部分需核对说话人数与时长,安全部分需核对提示数与标注来源,网络规模部分需核对图文对数量。原文组织了 4 张数据集表,覆盖身份情感视频、个性化版权、知识问答分割推荐、语音安全卫生与类别遗忘,复现时按模态与设置选表,不混用不同条件的数字。

下表整理身份与语音数据的规模核对点,用于复现前的数据准备检查。

数据模态规模代表用途复现检查
CelebA图像202,599 图像身份遗忘划分与身份数
CelebA-HQ图像30K 高质量图像身份遗忘分辨率 1 致性
VoxCeleb1音频150K 话语 1.3k 说话人说话人遗忘说话人划分
Speech Commands音频64.7K 与 105.8K 两版话语语音遗忘版本与词表
LibriSpeech音频文本1000 小时 2.5K 说话人内容与说话人转录对齐

表后解释是,该表只解决数据规模核对,不替代结果表;主要收益是快速发现版本与划分错误,具体代价是仍需补采样聚合与统计方法。原文对划分采样聚合与硬件预算的交代分散在附录,复现时需记录随机性来源、评估采样数与阈值,并记录运行时间峰值显存与浮点运算,环境部分还需记录千瓦时与按约 0.4 千克二氧化碳当量每千瓦时换算的排放。未报告项应明确写缺项,不编造划分或聚合口径。

第二步是选干预点与指标。若只能动线上服务,选解码时引导或条件路径;若可改模型但不能重训,选权重线性或表示投影;若可训练,选直接梯度或掩码蒸馏并固定参考 checkpoint。指标至少同时报遗忘侧与效用侧,再加攻击成功率与成本,语音加报说话人相似度与零重训遗忘。第三步是做反证,跑改写提示、跨模态提示与下游微调后的重现测试,检查被忘内容是否回来。

何时值得尝试,还需补哪项验证?

当任务是明确的删除请求、版权下架或安全对齐,且能写出遗忘集与保留集并接受效用小幅损失时,值得尝试多模态遗忘。数据侧适合预防性保护,训练时与结构分支适合已学内容的去除,免训练适合快速事后控制,解码时适合可逆的部署控制。音频场景中,说话人退出与私有话语删除对应实例级,授权音乐与风格压制对应概念级,选择时先看能否动权重再看是否需跨提示泛化。

复现优先级是,先复现划分与指标方向,再复现一条可运行基线与一条本文方法,最后补对抗与跨模态反证。关键超参数与信息条件包括遗忘保留权衡系数、相似度阈值、掩码支持集、投影子空间估计方式、引导强度与条件混合系数,缺失时回原方法论文核对。代码权重与系统可运行要区分,本文核验的第三方资源当前可用不等于全部方法可一键运行。

还需补的验证有三项,一是跨架构与跨模态的泛化测试,避免单骨干结论外推;二是自适应攻击下的鲁棒测试,避免静态威胁假设下的虚假成功;三是长期多轮删除与下游微调后的稳定性测试,避免 1 次评估代替全程。对初学者最常见的误解是把曲线向下直接当变差,或把末步结果推广全程,正确做法是先核对纵轴是原始指标还是改变量,再结合方向判断好坏,像素不能精确辨别的数值不硬写。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总