📄 有害不在一处:当声音与画面由多模态共同拼出
英文题目:Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation
一句话:面向文本、图像、音频、视频共同决定音视频生成的场景,该工作用因子化的基准把攻击方式与证据分布拆开检验,并在 LTX-2 上以 91.7% 的总体攻击成功率与四模态下仅 52.6% 至 61.2% 的防护召回,揭示出跨模态与跨时序的组合风险感知仍是主要瓶颈。
标签:#音视频生成 #多模态模型 #内容审核 #基准测试
评分:7.3/10 | 创新 1.7/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Kaichao Jiang:University of Science and Technology of China
- Changtao Miao:Independent Researcher
- Baiqi Wu:Zhejiang University
- Zhiyuan Lu:Hefei University of Technology
- Kang Yang:Hefei University of Technology
- Peiwei Zhao:Hefei University of Technology
- Junchi Chen:University of Science and Technology of China
- Yunfeng Diao:Hefei University of Technology
- He Liu:Independent Researcher
- Qi Chu:University of Science and Technology of China
- Tao Gong:University of Science and Technology of China
- Nenghai Yu:University of Science and Technology of China
💬 毒舌点评
亮点在于首次将音频-视频生成的安全评测从单一文本提示扩展到全部 11 种 T/I/A/V 非单例组合,并用 k 与 ρ 显式解耦攻击机制与证据分布,提出了 Composed Harm 与 Diluted Harm 这一具有解释力的双失效模式。短板在于验证闭环过于单薄,仅在 LTX-2 单一生成器上测 ASR 且防护端仅覆盖 4 个 guard,对抗攻击因迁移失败直接缺席 I/V 载体,所谓“全覆盖”在最难的对抗维度上仍是空缺。
📌 核心摘要
多模态条件音频-视频生成中,有害意图不再局限于单一提示,而是分散在文本(Text, T)、图像(Image, I)、音频(Audio, A)、视频(Video, V)的组合与时序中,现有以提示为中心的安全基准无法系统度量此类组合风险。Multi2AV-Safety 构建了因子化基准框架,将每个实例形式化为 \((s, S, \{u_m\}, a, e, h)\),其中 \(S\) 覆盖全部 11 种非单例 T/I/A/V 组合,\(a\) 区分 Direct / Jailbreak / Adversarial / Temporal 四种攻击机制,\(e = (C, k, \rho)\) 刻画有害证据是局部可归因、跨模态联合涌现还是时序涌现。与仅覆盖 T 或 T+I 的既往基准相比,该工作首次实现四模态全组合覆盖与证据结构显式标注,并配套有害-良性配对构造以控制组合语义。基于 LTX-2 的评测显示,11 种配置上攻击成功率 ASR 均高达 83.7% 至 99.1%,总体 ASR 为 91.7%(10,104/11,024),但全模态防护召回在四模态下仅 52.6%(Qwen3-Omni-30B-A3B-Instruct)与 61.2%(GuardReasoner-Omni-3B),揭示组合风险感知是核心瓶颈。该基准为多模态生成 guard 的跨模态证据整合能力提供了可归因的压力测试,但当前验证依赖单一生成器与有限 guard,且对抗样本的图像/视频载体缺失限制了外推。
🔗 开源与复现资源
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及
- 数据集:论文中未提及公开下载链接,文中描述基准包含 11024 个攻击实例,其中双模态 8849 个、三模态 1500 个、四模态 675 个,计划以研究导向许可证发布并对高风险媒体限制访问,未给出 HuggingFace 或 ModelScope 链接
- Demo:论文中未提及
- 复现材料:论文中未提及训练配置与检查点,评估部分说明使用 LTX-2 作为目标音视频生成器,由 3 名领域专家进行目标感知评审并以多数投票判定,采用 ASR 与 RHR 作为指标,未提供具体配置文件或附录链接
- 论文中引用的开源项目:论文中引用以下第三方项目与工具,均未在正文片段中提供具体 URL 链接
- I2P
- T2ISafety
- SafeGen-Bench
- Multimodal Pragmatic Jailbreak
- SceneSplit
- T2VSafetyBench
- T2I-RiskyPrompt
- GenBreak
- DiffZOO
- AdvWave
- LTX-2
- Qwen3-Omni-30B-A3B-Instruct
- GuardReasoner-Omni-3B
- GuardReasoner-VL-7B
- GuardTrace-VL-3B
🧭 深度解读
为什么多模态条件下的安全比单句提示更难判断?
想象一个生成请求:文字写着“公园里的家庭聚会”,配图是普通的草坪,音频是一段轻松的对话,视频片段则是人群走动。单看任何一个输入,都挑不出明确的有害词或画面,但把四者放在一起,模型却可能拼出一个带有暴力或歧视意味的完整事件。
这种风险的难点在于证据不再集中。过去以文本提示为中心的安全评估,习惯在单句里找关键词或显式指令,而多模态条件生成中,有害语义可以被拆散、稀释或延迟出现。判断者既要看懂每个模态在说什么,又要把它们合起来理解意图,还要在时间轴上把分散的片段连起来。
Multi2AV-Safety 正是为这种“分散式有害”设计的压力测试。它不把安全看作对单条提示的过滤,而是把文本(Text, T)、图像(Image, I)、音频(Audio, A)、视频(Video, V)当作 1 个条件集合来考察,系统性地追问:当有害证据不在一处时,生成器会不会实现它,防护又会不会漏掉它。
已有基准在测什么,这篇工作补上了哪一块拼图?
此前的生成安全基准大多围绕固定的输入接口展开。面向图像的 I2P、T2ISafety,面向视频的 SafeSora、T2VSafetyBench,都在检验有害或越狱提示是否会导致不安全输出,但条件基本锁定为文本。
另一条线开始关注组合风险。SafeGen-Bench 与多模态语用越狱(Multimodal Pragmatic Jailbreak, MPJ)指出跨模态组合可能涌现新含义,SceneSplit 则展示了把有害事件拆到时序片段中的做法。这些工作各自揭示了一种组合形态,却往往只覆盖一到两种模态,难以在统一空间里比较不同组合、不同攻击与不同证据分布的贡献。
Multi2AV-Safety 的位置在于把上述分散的现象放进同一个因子化坐标系。它覆盖全部 11 种非单例 T/I/A/V 组合,并把攻击如何引入与证据在何处可得拆成两个正交维度,从而让“是攻击更强,还是证据更难整合”这类归因问题变得可检验。
如何把一次多模态攻击说清楚?
论文把每个评测实例形式化为一个五元组,用来固定讨论对象。形式上记为
\[x=\bigl(s,S,\{u_{m}\}_{m\in S},a,e,h\bigr),\]其中 s 是与模态无关的目标语义场景,S 是活跃的条件集合,{u_m} 是各模态的具体载体,a 是攻击机制,e 是有害证据结构,h 是有害类别。
S 的取值覆盖 4 模态集合 M={T,I,A,V} 的全部非单例子集,共 11 种,包含 6 种 2 模态、4 种 3 模态和 1 种 4 模态。e 进一步写成 e=(C,k,ρ),k 表示单看一个模态就能判为有害的载体数量,C 是这些载体的集合,ρ 区分证据是局部可归因、跨模态联合涌现还是时序涌现。
由此自然得到 3 种体制:组合型有害(Composed Harm, k=0),即没有单个模态独立有害,有害只在组合中出现;稀释型有害(Diluted Harm, 0<k<|S|),即少数显式有害信号被大量良性上下文包围;完全有害(Full Harm, k=|S|),即每个活跃模态单独看都有害。这套符号让同一 s、h 可以在不同 S 下保持语义对齐,便于跨阶比较。
基准如何从场景走到可度量的攻击实例?
Multi2AV-Safety 本身不是一个生成模型,而是一套数据构造与评估流水线。输入是目标风险场景与条件组合,输出是带显式标注的多模态攻击实例,以及它在目标生成器上的安全度量。整体可看作 3 段式:场景策划与多模态实现、按攻击机制实例化、质量控制与评测。
第一段从模态无关的 s 与 h 出发,准备有害与良性的配对语义。第二段根据 S 与 a 生成具体的 {u_m},决定有害证据放在哪个模态、以何种隐蔽程度出现。第 3 段经过 2 阶段审核后,在 LTX-2 上生成音视频,并由专家在隐藏输入与攻击元数据的条件下做目标对齐标注,进而计算攻击成功率与防护残留率。
度量上论文沿用目标对齐的攻击成功率(Attack Success Rate, ASR)与防护通过后的残留有害输出率(Residual Harmful-output Rate, RHR),分别记为
\[\mathrm{ASR}=\frac{1}{N}\sum_{i=1}^{N}\mathbf{1}[Y_{i}=1].\]\[\mathrm{RHR}_{g}=\frac{1}{N}\sum_{i=1}^{N}\mathbf{1}[Y_{i}=1\ \wedge\ G_{i,g}=\mathrm{pass}],\]其中 Y_i=1 表示第 i 个输出既有害又与目标场景对齐,G_{i,g}=pass 表示防护 g 放行。ASR 越低越好,RHR 越低越好,防护召回则越高越好。
三个核心组件各自承担什么职责?
第一个组件是因子化设计,职责是让归因成为可能。它把模态维度、攻击维度与证据维度解耦,使同一有害意图可以在不同 S、不同 a、不同 k 与 ρ 下被复现。刻意让各模态表达场景的互补部分而非重复同一内容,正是为了让证据可定位或分布式存在,从而检验防护是否真的在做跨模态整合。
第二个组件是场景策划与多模态实现,职责是提供受控的语义来源与载体。文本侧有害种子主要来自 Adversarial Nibbler、I2P、T2I-RiskyPrompt、T2ISafety、SafeSora、T2VSafetyBench,经 Claude Sonnet 4.6 适配到音视频场景;每个有害场景再由 GPT-5 重写为保留事件但移除安全关键概念的良性配对,经专家校验一致性。载体实现上,图像由 Stable Diffusion 1.5 与 HiDream-O1-Image 生成,音频由 CosyVoice2 与 TTS-1 合成,视频由 LTX-2 与 daVinci-MagiHuman 生成,并通过跨模型家族多样化降低对单一生成器伪影的依赖。
第三个组件是多模态攻击构造,职责是按 a 把有害语义以不同方式投放。直接攻击(Direct)穷举所有非空载体子集 C⊆S,用于后续按载体基数分析;越狱攻击(Jailbreak)保留语义但降低显式性,并增设每个输入独立良性但联合有害的 joint 子集;对抗攻击(Adversarial)采用 GenBreak、DiffZOO、AdvWave 等文本与音频侧方法,图像与视频侧对抗扰动因在验证协议下向目标生成器迁移成功率不足而缺席;时序攻击(Temporal)遵循 SceneSplit,把决定性语义分散到有序序列,使单段不含完整事件,需要跨时序整合才能识别。

论文图 1。这张图来自原论文 Figure 1:,图示内容为“Overview of Multi2AV-Safety: 11,024 attacks spanning all 11 multimodal combinations of text, image, audio, and video, four attack mechanisms, five harm…”。请结合“三个核心组件各自承担什么职责?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。
没有训练阶段,这套基准如何完成计算?
这是一项基准与评测工作,没有需要从零训练的神经网络,也就没有优化器、学习率或批次大小等训练超参数。论文未报告训练损失或训练硬件,核心计算发生在数据合成与推理评测两端。
合成端复用已有的生成模型完成各模态载体的实现,推理端以 LTX-2 作为目标音视频生成器,对 11,024 个攻击实例逐一生成输出。所有输出由 3 位领域专家独立做目标感知评审,隐藏条件输入与攻击元数据,多数投票判定是否既有害又与目标对齐。
防护端则把同一组条件输入分别交给 4 种防护:Qwen3-Omni-30B-A3B-Instruct 与 GuardReasoner-Omni-3B 接收全量条件,GuardReasoner-VL-7B 与 GuardTrace-VL-3B 仅接收文本与图像作为受限访问对照。通过比较全模态与受限访问的召回差异,以及不同 k 与不同机制下的召回变化,来定位失效究竟来自看不见模态,还是看得见却整合不好。
用哪些数据、怎么划分、拿什么指标与谁对比?
根据论文正文与图中报告值整理,基准的样本构成与评测协议可概括如下。论文未提供官方表格下载链接,以下整理仅为对正文描述的结构化呈现。
| 维度 | 构成 | 数量与占比 | 备注 |
|---|---|---|---|
| 条件阶数 | 2 模态 / 3 模态 / 4 模态 | 8,849 / 1,500 / 675,共 11,024 | 覆盖全部 11 种非单例 T/I/A/V 组合 |
| 攻击机制 | Direct / Jailbreak / Adversarial / Temporal | 6,475 (58.7%) / 2,849 (25.8%) / 975 (8.8%) / 725 (6.6%) | 对抗的图像与视频载体系统性缺席 |
| 证据体制 | Composed Harm (k=0) / Diluted Harm / Full Harm | 1,450 (13.2%) / 7,224 (65.5%) / 2,350 (21.3%) | k 为单模态独立有害的载体数,ρ 区分 local/joint/temporal |
| 有害类别 | 暴力与血腥 / 性内容与裸露 / 非法活动 / 仇恨与歧视 / 政治敏感 | 2,366 / 2,214 / 2,159 / 2,150 / 2,135 | 近似均衡分布 |
| 质量控制 | Claude Opus 4.6 初审 + 3 位专家复审 | 未通过则再生 | 联合涌现要求各组件独立良性,时序要求单段不含完整事件 |
| 评测协议 | 目标生成器 LTX-2,专家多数投票判定目标对齐 | 指标 ASR 与 RHR,方向均为越低越好 | 防护召回衡量拦截敏感度,非平衡分类准确率 |
基线对比并非模型之间的性能竞赛,而是同一组攻击在不同防护可见性与不同证据密度下的对照。全模态防护与仅文本图像防护的对照用于分离模态缺失与整合失效,同一机制内按 k 分层则用于检验稀释效应是否稳定出现。
主结果在回答什么,反例又提示什么?
第一个要回答的问题是风险是否只出现在特定接口。结果显示生成侧的实现率在所有 11 种配置上都处于高位,总体 ASR 为 91.7%(10,104/11,024),2 模态 92.6%、3 模态 87.4%、4 模态 89.3%,区间为 83.7% 至 99.1%,其中 I+A 达 99.1%、A+V 达 98.5%。这说明只要条件集合中包含有害语义,生成器实现目标的概率并不随模态数降低。
第二个问题是防护是否随可见性提升而变好。恰好相反,残留风险随阶数上升。Qwen3-Omni 的 RHR 从 2 模态 32.8% 升至 4 模态 40.4%,GuardReasoner-Omni-3B 从 22.1% 升至 32.9%,而全模态召回在 4 模态仅 52.6% 与 61.2%,明显低于 2 模态的 63.1% 与 73.9%。可见性增加并未自动带来安全性增加,瓶颈更可能在如何整合证据。
根据论文正文与图中报告值整理,关键结果可按问题组织如下。
| 比较或条件 | 指标 | 明确报告值 | 这项数字支持什么 |
|---|---|---|---|
| 总体与分阶生成实现 | ASR 越低越好 | 总体 91.7%,2 模态 92.6%,4 模态 89.3% | 风险不局限于特定配置,生成侧普遍可实现 |
| 防护残留随阶数变化 | RHR 越低越好 | Qwen3-Omni 32.8%→40.4%,GR-Omni-3B 22.1%→32.9% | 模态增多后防护失效加剧,非生成侧单点问题 |
| 机制难度对照 | 召回越高越好 | 2 模态 Direct 74.2%/88.1%,Jailbreak 42.1%/50.7% | 越狱最难拦截,但同一机制内仍有约四成遗漏,难度不能解释全部失效 |
| 证据体制对照 | 召回越高越好 | 2 模态 k=0 召回 39.2%/46.2%,k=2 召回 82.6%/84.8% | 无单模态有害时最难拦截,显式证据越多越易拦截,指向组合感知不足 |
| 稀释效应在 Direct 内 | 召回越高越好 | 4 模态 k=1 召回 60.0%/56.0%,k=4 召回 96.0%/88.0% | 单载体有害被良性上下文稀释时最易漏检,且在多阶与多防护上单调成立 |
反例同样重要。即使是最易拦截的 Direct,2 模态仍有约一成至 2 成以上漏检;全模态防护在 4 模态也未突破 6 成左右召回。这表明把所有输入都交给防护,并不等于防护已经理解了输入之间的联合含义。
这套度量的边界在哪里?
论文自身指出的边界集中在攻击覆盖与数据敏感性上。对抗攻击的图像与视频侧扰动因迁移成功率不足而未纳入,越狱方法目前也不支持以视频作为载体输入,这使得 11 种配置的全覆盖在最具挑战的优化攻击维度上仍有缺口。基准包含高风险内容,发布需限制为研究用途并提供使用警告,部分高风险媒体可能受限访问。
从外部审视,验证闭环相对单薄。生成侧仅在 LTX-2 单一音视频生成器上度量 ASR,高位 ASR 是否带有模型特异性,缺少跨生成器对照难以判断。防护侧仅评估 4 个防护,且受限访问对照仅为文本与图像,缺少音频或视频单模态防护的细粒度消融。
样本与统计层面的限制也值得注意。3 模态与 4 模态样本量明显少于 2 模态,4 模态中 k=0 的组合型有害仅 50 例,统计稳定性有限。论文未报告标注者间一致性、显著性检验或多次采样方差,合成器与大模型的具体版本与参数也未公开,这对复现与偏置审计构成阻碍。此外,RHR 与召回依赖目标对齐标注,对未对齐但仍有害的输出如何计入风险,讨论并不充分。
若要复现,需要什么、缺什么?
可复现的部分在于流程与度量定义相对清晰。3 阶段流水线、因子化符号、ASR 与 RHR 的计算方式、专家多数投票的目标对齐判定,以及 4 种防护的可见性对照,都已在正文中说明。数据规模与分布也有明确计数,便于按相同比例重建评测集。
缺失的部分集中在实现细节与产物开放。论文未提供代码、模型权重或数据集下载链接,也未给出 HuggingFace 或 ModelScope 的发布地址。图像、音频、视频合成所用的具体版本、采样步数、温度、分辨率、时长等参数未披露,LTX-2 的推理配置同样未量化。
对刚进入方向的研究生而言,更务实的复现路径是先复现度量逻辑而非完整数据。可以用小规模自建的 T/I/A/V 配对,按 k 与 ρ 标注证据结构,再用同一组攻击分别测试全模态与受限访问防护,观察召回是否随 k 单调上升、是否在 k=0 时显著下降。若该模式在不同生成器上重复出现,对组合风险感知的结论会更可信。
回到起点,这项工作留下了什么可带走的方法论?
这项工作的核心判断在于把安全从单点检测转向集合推理。文本、图像、音频、视频各自可能无害,但它们的联合解释与时序展开可以构成完整有害事件;反过来,少数显式有害信号也可能被大量良性上下文稀释而被忽略。论文用 k 与 ρ 把这两种失效显式区分,使讨论不再停留在“防护不够强”的笼统归因。
对后续研究而言,可带走的是一套可复用的构造思路:先用有害与良性配对控制语义,再让各模态表达互补而非重复的场景片段,最后按攻击机制与证据结构分层度量。即使不照搬 11,024 例的规模,只要保持同一 s、h 在不同 S 下语义对齐,就能在自己的生成器与防护上做可归因的压力测试。
最终的启示也更贴近工程现实。把所有模态都喂给防护是必要条件,但不是充分条件。真正决定安全上限的,是防护能否在全量可见的前提下,正确地把分散在模态与时间中的证据拼成一个连贯的风险判断。
📎 论文与评分元数据
标签:#音视频生成 #多模态模型 #内容审核 #基准测试
7.3/10 | 创新 1.7/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
✅ 7.3/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频生成 | #多模态模型 | #内容审核 #基准测试 | arxiv
⚖️ 评分依据与证据(展开查看)
逐维得分、全文证据与扣分边界
创新性 (1.7/2):首次系统覆盖全部 11 种非单例 T/I/A/V 组合并以 k 与 ρ 正交解耦攻击机制与证据结构,提出 Composed Harm 与 Diluted Harm 双体制及有害-良性配对控制,相比仅覆盖 T 或 T+I 的既往基准形成可归因的组合风险度量框架,具备基准类方法创新。
技术严谨性 (1.3/1.5):因子化定义实例五元组 (s,S,{u_m},a,e,h) 与 e=(C,k,ρ) 及 local/joint/temporal 三类涌现,质量控制采用 Claude Opus 4.6 初审加 3 位专家复审并对联合涌现要求各组件独立良性、时序要求单段不含完整事件,标注隐藏输入与攻击元数据后多数投票判定目标对齐,逻辑自洽无推导错误。
实验充分性 (1.1/1.5):在 11024 例上报告总体 ASR 91.7% 及 2 模态 92.6% 3 模态 87.4% 4 模态 89.3% 分层,并以 Qwen3-Omni 与 GR-Omni-3B 全模态对比 T/I 受限 guard 及 k 分层与 Direct 内载体基数单调性支撑双失效模式归因,但验证仅基于 LTX-2 单生成器且 4 模态 k=0 仅 50 例、Adversarial I/V 系统性缺席且未报告一致性与显著性检验。
清晰度 (0.8/1):以因子化框架串联 11 种组合、4 种攻击机制与 3 种证据体制,符号 s,S,a,e,h 与 k,ρ 定义一致,表 1 与表 2 明确标注 ASR 与召回方向并保留分阶与机制分层,写作组织与图表表达清晰可核对。
影响力 (1.1/1.5):面向多模态条件音视频生成这一音频核心场景,揭示全模态可观测下 4 模态召回仅 52.6% 与 61.2% 且 RHR 随模态数上升至 40.4% 的组合风险感知瓶颈,为音视频生成 guard 的跨模态与时序证据整合提供可归因压力测试,对语音音频安全评测具直接迁移价值。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.3/0.5):披露三阶段流水线、LTX-2 目标生成器、3 位专家隐藏元数据多数投票及 ASR 与 RHR 定义,但未报告 Stable Diffusion 1.5 等合成器与 LLM 版本参数、采样步数温度分辨率时长等生成超参数及硬件与训练配置,关键复现配置大量缺失。
工程/实践价值 (1.0/1.5):给出从场景策划经多模态实现到按攻击机制实例化与两阶段审核的可复用流水线,并以跨家族模型多样化生成降低伪影依赖形成系统化基准构造方法,但未提供真实延迟吞吐资源测量且尚未发布可下载产物,工程价值以流水线可复用性为主。