Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks
📄 Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks 标签:#多模态模型 #基准测试 #数据集 6.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:综述 | 评分置信度:高 | #多模态模型 | #多模态模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Nobin Sarwar(University of Maryland, Baltimore County) 通讯作者:未说明 作者列表:Nobin Sarwar(University of Maryland, Baltimore County),Shubhashis Roy Dipta(University of Maryland, Baltimore County),Zheyuan Liu(University of Notre Dame),Vaidehi Patil(University of North Carolina at Chapel Hill) 💡 毒舌点评 亮点在于提出了一个“系统导向”的统一分类法,将方法按“干预阶段”和“控制路径”组织,为跨模态比较提供了一个清晰稳定的脚手架,比算法导向的综述更贴近实际部署考量。短板是作为一篇标题涵盖“视频和音频”的综述,其对音频和视频模态的覆盖深度明显弱于视觉和语言,大量篇幅仍聚焦于图像-文本系统,对新兴的音频和视频遗忘方法梳理不够充分,有些“综述其名,视觉为主”。此外,虽提供了分类框架,但缺乏对不同类别方法在相同任务或基准上的性能对比分析或元分析洞察,降低了其指导具体技术选择的直接效用。 ...