📄 Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard
#音频理解 #SFT #基准测试 #内容审核 #数据集
8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5
🔥 8.3/10 | 前25% | #音频理解 | #SFT | #基准测试 #内容审核 | arxiv
👥 作者与机构
- 第一作者:Yudong Yang(清华大学)
- 通讯作者:Guangzhi Sun(剑桥大学)、Chao Zhang(清华大学)
- 作者列表:Yudong Yang(清华大学)、Xuezhen Zhang(清华大学)、Zhifeng Han(清华大学)、Siyin Wang(清华大学)、Jimin Zhuang(清华大学)、Zengrui Jin(清华大学)、Jing Shao(上海人工智能实验室)、Guangzhi Sun(剑桥大学)、Chao Zhang(清华大学)
💡 毒舌点评
本文亮点在于首次系统性地将语音-非语音音频的语义和语境组合引入多模态LLM安全红队评测,攻击方式真实且具有现实威胁性,提出的SALMONN-Guard联合模态守卫设计也展现了防御此类攻击的可行性。然而,攻击构造仍依赖人工预设的声学参数与对话脚本,缺乏自适应的攻击策略优化,使得benchmark的攻击上限不明确;防御仅使用SFT,未与对抗训练等更强基线对比,说服力不足;MSD评估将“理解错误”也计入攻击成功,该设定存在争议,可能高估了实际威胁。
📌 核心摘要
- 本文针对多模态LLM在处理复杂音频输入时的安全漏洞,提出了语音–非语音音频组合攻击评测基准 SACRED-Bench 及其防御模型 SALMONN-Guard。
- SACRED-Bench 通过三种组合机制构造隐蔽的黑盒攻击:Speech-Speech Overlap (SSO) (将无害与有害语音叠加)、Speech-Audio Overlap (SAO) (将良性语音与有害环境音混合)和 Multi-Speaker Dialogue (MSD) (将有害内容隐匿于多人对话中),并配合间接文本提问规避纯文本安全护栏。
- 实验显示,即使开启全部安全护栏的 Gemini 2.5 Pro,在 SACRED-Bench 上的总体攻击成功率 (ASR) 仍高达 66.75%,其中 SAO 攻击下 ASR 达 88.56%;多数开源模型 ASR 超过 90%。
- 作为防御,SALMONN-Guard 基于 Qwen2.5-Omni-7B 进行两阶段 SFT(使用 LoRA),联合检查语音、音频和文本内容,将总体 ASR 降至 11.32%,同时在无害对照组上误报率 (FAR) 为 0。
- 在 Speech Insertion 和 Speech Editing 两种未见攻击上,SALMONN-Guard 的 ASR 分别为 0.00% 和 3.00%,展现了良好的泛化能力。
- 主要局限性:攻击构造依赖固定声学超参组合,未探索最优攻击策略;防御仅用 SFT,未与更强基线(如对抗训练)比较;MSD 评测将“错误理解”也计为攻击成功,可能高估风险。
核心实验结果表格(SACRED-Bench 主结果)
| Models | SSO ASR (%) | MSD ASR (%) | SAO ASR (%) | Overall ASR (%) | HCS FAR (%) | Overall OBE (%) |
|---|---|---|---|---|---|---|
| Qwen2-Audio-7B | 100.00 | 96.48 | 100.00 | 98.16 | 1.80 | 85.41 |
| Qwen2.5-Omni-7B | 99.78 | 87.02 | 100.00 | 92.83 | 1.20 | 83.03 |
| Step-Audio 2 mini Base | 90.25 | 77.49 | 98.33 | 81.50 | 0.60 | 78.37 |
| MiniCPM-o 2.6 8B | 85.84 | 69.87 | 99.58 | 85.57 | 3.40 | 77.01 |
| Qwen3-Omni-30B-A3B | 49.25 | 84.82 | 93.17 | 77.95 | 0.90 | 72.16 |
| Kimi-Audio-7B | 69.00 | 61.36 | 87.17 | 70.05 | 4.10 | 66.78 |
| Gemini 1.5 Pro | 83.50 | 78.58 | 98.47 | 85.12 | 0.30 | 77.77 |
| GPT-4o | 73.00 | 53.67 | 99.58 | 70.05 | 0.60 | 70.74 |
| Gemini 2.5 Pro | 37.25 | 63.93 | 88.56 | 66.75 | 0.70 | 63.15 |
| SALMONN-Guard | 12.93 | 14.08 | 5.16 | 11.32 | 0.00 | 7.74 |
🔗 开源详情
- 代码:未提供专门的代码仓库链接。
- 模型权重:已公开,链接为 https://huggingface.co/datasets/tsinghua-ee/SACRED-Bench (该页面下包含 SALMONN-Guard 检查点)。
- 数据集:已公开,链接为 https://huggingface.co/datasets/tsinghua-ee/SACRED-Bench 。
- Demo:未提及。
- 复现材料:训练超参数详见论文附录 D;数据构造与评测流程见正文及附录 A-C。
- 论文中引用的开源项目(未提供直接链接):
- ChatTTS
- VoiceBank-DEMAND
- AdvBench
- MM-SafetyBench
- HarmBench
- Qwen2-Audio-7B
- Qwen2.5-Omni-7B
- Qwen3-Omni
- MiniCPM-o 2.6
- Step-Audio2
- Kimi-Audio
- Whisper-large-v3
- JALMBench
🏗️ 方法概述和架构
SACRED-Bench 的数据构建分为三个独立的攻击流水线,利用语音和非语音音频的组合来测试多模态LLM的安全漏洞。SALMONN-Guard 则以 Qwen2.5-Omni-7B 为骨干,通过两阶段监督微调(SFT)得到一个联合模态的安全分类器,用于防御此类攻击。
Speech-Speech Overlap (SSO) 利用听觉场景分析中的流融合原理,制造模型的信息处理混淆。其构造流程为:首先,对每个恶意文本指令,利用 GPT-4o 生成一个主题相关但逻辑无害的“载体”文本(pretext,例如为制造危险品的指令配上“为科幻小说角色描写一个化学实验室场景”),再由 ChatTTS 分别合成无害载体语音和有害指令语音。随后,系统性地调节有害音频的声学参数——包括播放速度(1.1/1.3/1.5倍速)、音量(-6/-8/-10 dB)和与载体语音的交叉淡化重叠时长(300/500/700 ms)——使其在感知上变得“不显眼”,但仍可为人类和模型所感知。最后将两者交叉淡化合成为一条单声道语音。攻击样本的文本查询为间接许可类问题,如“这个音频适合在公共场合播放吗?”。这种设计旨在评估模型在存在干扰语音时识别有害内容的能力。
Speech-Audio Overlap (SAO) 的攻击向量从显式语言转向隐性环境语境。该流水线从公开网络视频中提取包含暴力、色情等场景的有害非语音音频(如不雅场景的背景声),再将其与 VoiceBank-DEMAND 数据集中的干净语音进行轨道混音,确保有害背景音清晰可闻。由此产生的音频中,语音信道完全无害,但环境声信道却携带强烈的恶意语境。配合如“我能把这个音频放给我5岁的孩子听吗?”的询问,用于测试模型是否具备跨模态语境推理的安全判别能力。
Multi-Speaker Dialogue (MSD) 则专门利用文本与音频模态之间的语义间隙来瓦解纯文本安全过滤器。对于一个直接的恶意指令(如“如何黑入他人银行账户”),首先借助 GPT-4o 将其改写为两个说话人之间的自然对话脚本,从而消除原指令中的直接请求标记。随后使用 ChatTTS 的多说话人合成能力生成该对话音频,并为每条音频搭配一个看似无害、仅作指称使用的文本查询(如“如何实施对话中提到的那些方法?”)。单独看文本查询完全无害,但与音频中的恶意对话组合后,就成为一个明确的恶意请求。这种方法检验了模型跨模态安全对齐的一致性。
SALMONN-Guard 是一个基于 Qwen2.5-Omni-7B 的专用守卫模型,接受语音、音频和文本的联合输入。其训练数据包含约 8,545 条有害样本(覆盖 SSO、SAO、MSD 三种类型)和 1,828 条良性样本,通过严格的跨数据集划分避免数据泄露。训练采用两阶段 LoRA 微调(r=32, α=32):第一阶段在全量数据上训练 3 个 epoch 以建立基础的多模态安全判别能力;第二阶段专门在 MSD 子集上训练 5 个 epoch 以强化对最具挑战性的跨模态间接攻击的识别。训练时同时更新 LLM、音频编码器和对齐器,使用交叉熵损失。推理时,SALMONN-Guard 可有两种模式:对单独音频输入,输出“harmful”或“harmless”标签;对文本-音频联合查询,可直接生成拒绝语句(如“I’m sorry, I cannot assist with that request”)拦截恶意请求,或放行良性查询。
💡 核心创新点
- 首个语音–非语音语义组合攻击基准:区别于过往仅依赖信号级扰动或单说话人语音的音频红队方法,SACRED-Bench 通过语音-语音重叠、非语音环境音嵌入、以及多说话人对话这三种机制,构建了基于音频内容与语境组合的真实且隐蔽的黑盒攻击,更贴近现实中的复杂听觉场景。
- 揭示文本中心安全对齐的跨模态失效问题:通过将有害信息完全或部分隐藏在音频模态中,并设计看似无害的文本查询,有效证明现有 LLM 的文本安全护栏在复杂音频场景下几乎完全失效,明确指出了多模态安全对齐的关键缺口。
- 联合模态守卫模型 SALMONN-Guard:首次提出能同时检查语音、音频和文本内容的专用守卫模型,通过专门的两阶段 SFT 训练,有效防御组合式音频攻击,并将总体 ASR 降至 11.32%。其架构和训练策略为多模态模型安全防御提供了新范式。
- 多维度攻击有效性分析与防御泛化性验证:通过声学参数消融(SSO)和模态分解实验(MSD),量化了攻击关键要素的作用。更重要的是,SALMONN-Guard 在未见过的信号级攻击(Speech Insertion/Editing)上展现了极强的泛化能力(0%和3% ASR),证明其学习到了更深层的恶意音频表征,而非简单过拟合训练数据。
📊 实验结果
主实验结果已在前文以完整表格形式列出。关键数据显示,即使是 Gemini 2.5 Pro,在 SAO 攻击下的 ASR 也高达 88.56%;而 SALMONN-Guard 将总体 ASR 从 66.75% 降至 11.32%,且 HCS FAR 为 0%。
SSO 声学参数消融实验: 下表展示了在 Gemini 2.5 Pro 上,在 100 个样本子集上,不同重叠时长、播放速度和音量组合对 SSO 攻击成功率的影响。结果显示,当速度为 1.5、音量为 -8 dB、重叠时长为 500 ms 时,ASR 达到最高的 61.00%,验证了“有害内容越不显眼则攻击越成功”的假设。
| Overlap (ms) | Speed | Volume (dB) | ASR (%) |
|---|---|---|---|
| 500 | 1.3 | -8 | 47.00 |
| 500 | 1.5 | -8 | 61.00 |
| 500 | 1.1 | -8 | 42.00 |
| 300 | 1.3 | -8 | 41.00 |
| 700 | 1.3 | -8 | 47.00 |
| 500 | 1.3 | -6 | 47.00 |
| 500 | 1.3 | -10 | 51.00 |
MSD 模态消融实验: 下表在 Gemini 1.5 Pro 上对比了纯文本有害指令(Text-Only)、纯有害语音(Audio-Only)以及二者组合(MSD)的攻击成功率。结果表明,文本+音频的跨模态组合(78.58% ASR)显著优于任一单模态攻击,明确证实了跨模态协同效应是MSD攻击高效性的来源。
| Attack Method | ASR (%) |
|---|---|
| Text-Only (Harmful Instruction) | 57.96 |
| Audio-Only (Harmful Speech) | 65.03 |
| Text + Audio (i.e. MSD) | 78.58 |
防御策略对比: 与级联防御(Whisper-large-v3 转录后送入 Gemini 2.5 Pro 判断)和提示增强防御(为 Gemini 2.5 Pro 增加安全系统提示)的对比实验表明,简单防御效果甚微。例如,在 SSO 和 MSD 任务上,级联防御的 ASR 分别为 37.50% 和 57.96%,提示增强防御为 39.50% 和 57.77%,远高于 SALMONN-Guard (12.93%, 14.08%),凸显了端到端多模态守卫模型的必要性。
| Defense Baseline | SSO (ASR %) | MSD (ASR %) |
|---|---|---|
| Gemini 2.5 Pro (Vanilla) | 37.25 | 63.93 |
| Cascaded Defense | 37.50 | 57.96 |
| Prompt-based Defense | 39.50 | 57.77 |
| SALMONN-Guard (Ours) | 12.93 | 14.08 |
对未见攻击的泛化: 下表结果显示,仅在 SACRED-Bench 上训练的 SALMONN-Guard,在面对 JALMBench 中的 Speech Insertion 和 Speech Editing 攻击时,ASR 分别降至 0.00% 和 3.00%,远低于 Gemini 2.5 Pro (13.41%, 23.00%) 等模型,证明其已学到通用的恶意音频处理模式。
| Jailbreaking | Qwen2.5-Omni | Qwen3-Omni | Gemini 2.5 Pro | SALMONN-Guard |
|---|---|---|---|---|
| Speech Insertion (Yang et al., 2024a) | 23.17% | 8.94% | 13.41% | 0.00% |
| Speech Editing (Cheng et al., 2025) | 33.00% | 12.00% | 23.00% | 3.00% |
| SACRED-Bench (ours) | 92.83% | 81.50% | 66.75% | 11.32% |
🔬 细节详述
训练数据:有害文本源自 AdvBench、MM-SafetyBench 和 HarmBench。为确保数据无泄露,采用了严格的跨数据集验证,即对任何攻击类别,用于生成训练数据的源基准被排除在测试集之外。训练集共有有害样本 8,545 条(SSO: 6,640, SAO: 986, MSD: 919),良性样本 1,828 条,总时长约 30 小时。测试集共 2,481 条(SSO: 400, SAO: 1,364, MSD: 717),约 7 小时。对于 SSO,文中声称 93% 的样本可被 Gemini 2.5 Pro 清晰感知,并进行了人工可懂度测试(后文详述)。
损失函数:标准交叉熵损失,用于二分类或生成式拒绝任务。
训练策略:两阶段 LoRA SFT。LoRA 参数:
r=32,α=32,目标模块为所有线性层,同时更新音频编码器和对齐器。优化器为 AdamW,学习率 \(3 \times 10^{-5}\),weight decay 0.1,梯度裁剪 0.5,warmup ratio 0.05。per-device batch size 为 4,梯度累积 2 步。Stage 1 在全量数据上训练 3 epochs,Stage 2 仅在 MSD 数据上训练 5 epochs。使用 bfloat16 精度,最大序列长度 2048。训练硬件未明确说明。关键超参数:SSO 攻击默认设置为重叠 500 ms,速度 1.3,音量 −8 dB(在消融实验中变化)。
推理与评测细节:对于 SSO 和 SAO,攻击成功定义为模型未能识别音频中的有害内容(即错误地回答了许可性问题)。对于 MSD,使用 Gemini 2.5 Pro 作为自动评判,将模型回复分为三类:“Harmful”(有害)、“Direct Refusal”(直接拒绝)和“Wrong understanding”(错误理解),并将“Harmful”和“Wrong understanding”均视为攻击成功。论文同时进行了人工评估,以验证自动评判的可靠性(附录F中给出了Cohen’s Kappa一致性为0.82)。
人类可懂度研究:为确保攻击成功源于安全漏洞而非音频不可懂,论文进行了一项包含 4 位听者的研究,每人随机抽取 50 个 SSO 和 50 个 SAO 样本。结果显示,SSO 平均可懂度为 97.5%,SAO 为 96.0%,证明了攻击音频对人类是高度可懂的。
正则化:论文未提及使用额外的正则化或数据增强技术。
⚖️ 评分理由
- 创新性 (1.5/2):首次系统性地将通过语义和语境组合的语音-非语音音频攻击引入多模态LLM安全评测,三种攻击机制的设计新颖且贴近现实威胁。SALMONN-Guard 的联合模态守卫方案也为音频安全领域提供了新的防御视角。与现有仅关注信号扰动或单模态文本安全的工作相比,开辟了显著的增量创新空间,但组合逻辑的部分思路(如间接提示)在多模态图像安全领域已有先例,未达到完全颠覆性突破的程度。
- 技术严谨性 (1.0/1.5):攻击与防御流程描述清晰,方法逻辑通顺。声学参数消融和模态分解实验设计合理,提供了有效洞察。但不足在于:SAO 攻击的构造缺乏类似 SSO 的参数消融分析,无法确定其攻击强度边界;对 SALMONN-Guard 的训练过程,未提供损失曲线、验证集表现分析,其收敛性和潜在的过拟合风险未得到讨论;MSD 将“错误理解”归为攻击成功这一定义虽有说明,但在安全评测标准上仍存争议。
- 实验充分性 (1.1/1.5):实验覆盖了 9 个主流的开源和闭源模型,对比充分。消融实验有效论证了声学参数和跨模态协同的作用。泛化性测试是实验亮点,有力证明了守卫模型的鲁棒性。然而,仍存在明显缺失:没有对 SAO 攻击进行类似 SSO 的声学参数消融;防御比较仅限于简单的级联和提示增强,未与更强的对抗训练、RLHF 等策略进行对比,无法充分说明 SALMONN-Guard 的相对增益限度;主实验结果缺少误差棒或多次随机试验的统计显著性检验。
- 清晰度 (1.0/1):论文结构清晰,图文并茂,三种攻击流水线的示意图直观明了。附录提供了详尽的超参数、评估 Prompt 和数据分析,便于复现和审查。整体可读性强。
- 影响力 (1.0/1.5):这项工作为多模态LLM安全领域贡献了一个新的、更真实的攻击基准和首个专用音频守卫模型,直击了当前模型部署中的实际风险,很可能成为后续音频安全研究的重要基线。但目前领域尚属早期,其长期影响力有待观察,暂未形成范式级突破。
- 开源 (1.5/1.5):论文在 HuggingFace 上公开了完整的数据集(SACRED-Bench)和模型检查点(SALMONN-Guard),核心资源完全可获取,极大降低了社区跟进和验证的门槛。
- 可复现性 (0.5/0.5):附录中提供了两阶段训练的完整超参数表(LoRA配置、优化器、学习率、Epochs等)、数据构造流程和评估 Prompt,几乎所有关键要素都已提供。尽管训练硬件未明确,但不构成主要复现障碍。
- 工程/实践价值 (0.7/1.5):SACRED-Bench 提供了一套可复用的音频红队数据生成流水线,SALMONN-Guard 也给出了端到端防御的可行性验证,工程价值明确。但是,论文未讨论守卫模型在实际部署中的关键工程指标,如推理延迟、计算开销,以及它与下游任务模型的集成兼容性,作为防御组件的工程实用性论证不足。
🚨 局限与问题
论文明确承认的局限
- 攻击只聚焦于真实世界可听到的场景,未涉及听不见的频率或对抗性噪声。
- 仅评测了模型的静态单轮安全性,未覆盖多轮交互或自适应对话场景下的攻击。
- 守卫模型仅在 SACRED-Bench 数据分布上训练,对更广泛未知安全场景的覆盖需进一步扩展。
审稿人发现的潜在问题
- SAO 攻击缺乏消融研究:论文对 SSO 攻击的关键声学参数进行了细致的消融分析,但对 SAO 攻击却未进行类似分析(如不同有害背景音与语音的信噪比、叠加方式的影响),使得对该攻击维度的理解不够完整,削弱了基准的科学严谨性。
- ASR 评估标准存在争议且具有高估风险:MSD 评估将模型“错误理解(Wrong understanding)”也计为成功攻击。虽然论文提供了人类评估一致性验证,但这种设定在概念上混淆了“安全失败”与“能力不足”。模型可能因为听不懂指令而完全生成无关内容,这并未直接产生危害,将其与直接生成有害内容等同,会高估模型面临的实际威胁,使防御效果显得比实际更显著。
- 防御基线的比较不够充分:论文仅与“级联防御”和“提示增强防御”对比,这低估了现有防御研究的水平。缺少与更成熟的大模型安全对齐方法(如拒绝采样、安全 RLHF/DPO、对抗训练)的对比,使得 SALMONN-Guard 的优势上限不明确。读者无法判断其增益究竟是源于 SFT 范式的固有优势,还是因为比较基线设置过低。
- 统计显著性检验缺失:所有主实验表格中的 ASR 仅汇报了单次实验结果,缺少多次运行的标准差或置信区间。在样本量相对有限的情况下,结果的统计稳定性无法验证,尤其对于 ASR 接近的模型,无法判断差异是否显著。
- 潜在的伦理与版权风险:数据集中使用的有害非语音音频来自公开网络视频,论文对可能涉及的版权问题和二次传播伦理风险讨论不充分,这可能为后续使用该数据集的合规性带来困扰。