📄 Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

8/10 | 创新 1.8/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5

🔥 8/10 | 前25% | #音频理解 | #多模态模型 | arxiv

👥 作者与机构

  • 第一作者:Yanyun Wang(香港科技大学(广州),The Hong Kong University of Science and Technology (Guangzhou))
  • 通讯作者:Li Liu(香港科技大学(广州),The Hong Kong University of Science and Technology (Guangzhou))
  • 作者列表:Yanyun Wang(香港科技大学(广州))、Yu Huang(香港科技大学(广州))、Zi Liang(香港理工大学,The Hong Kong Polytechnic University)、Xixin Wu(香港中文大学,The Chinese University of Hong Kong)、Li Liu(香港科技大学(广州))

💡 毒舌点评

这篇论文提出了一个令人眼前一亮的"听觉干扰"新范式,彻底跳出了"音频必须夹带恶意内容"的旧思路,仅靠注入特定的声学潜在语义(ALS)就能让无害音频成为通用越狱触发器,洞察相当深刻,可解释性分析也做得很扎实。然而,方法对Bark模型的依赖引入了"鸡生蛋"的隐患——ALS是否真的是LALM的通用软肋,还是恰好命中了Bark某种未被发现的生成缺陷?部分最强基线(如AudioJailbreak)因对方未开源或评估设定不统一,导致在最关键的"通用越狱"赛道上缺乏直接对比数据,让"SOTA"声明的说服力打了一定折扣。

📌 核心摘要

本论文旨在揭示并利用大型音频语言模型(LALMs)在安全对齐上的一个根本性盲区:模型的安全防御可以被完全不包含任何恶意内容的"干扰音频"所击穿。作者提出了一种全新的"声学干扰"范式,其核心是声学潜在语义(ALS)——一种从Bark等音频生成模型先验中挖掘出的、高度抽象且可解释的副语言特征。与以往必须依赖实例级优化、在线生成恶意音频的攻击方法不同,本文设计的声学干扰攻击(AIA)实现了攻击载荷与音频模态的解耦,仅需将一组预先生成并排序好的通用干扰音频附加在标准恶意文本查询上,就能诱导LALM的推理路径从拒绝区域漂移到合规区域。在Qwen2.5-Omni、GPT-4o-Audio、Gemini-2.5-Pro等10个主流LALM上的实验表明,AIA能将文本攻击成功率(ASR)平均提升20-50个百分点以上,并在多数模型上显著优于9种现有基线方法。此外,论文通过logit偏移、隐空间几何分析和因果干预实验,系统揭示了"推理路径漂移"的底层机制,并识别出高音调、高语速、高情绪效价等具体的易受攻击声学模式。该工作不仅拓展了LALM的攻击面,更揭示了跨模态安全对齐的深层脆弱性。主要局限性在于ALS的构建依赖单一代理生成模型(Bark),且部分对比实验受限于基线方法的非开源性质或评估设定不一致。

🔗 开源详情

  • 代码:论文提供了项目页面链接 https://flaai.github.io/AIA_page,并声明"代码和通用ALS库已开源",但审阅时网站上未见直接可访问的GitHub仓库链接。
  • 模型权重:论文中未提及提供任何模型权重。
  • 数据集:论文使用的五个数据集(JBB-Behaviors, WildJailbreak, HH-RLHF, AdvBench, HarmBench)均为已有公开数据集,论文未提供自定义数据集,也未提供上述数据集的直接下载链接。
  • Demo:论文中未提及Demo。
  • 复现材料:论文中未提及除代码仓库外的额外训练配置、检查点或附录材料。关键的系统提示词、索引权重等细节未公开。
  • 论文中引用的开源项目:Bark(Suno-AI, 2023);CLAP(Wu et al., 2023);WavLM(Chen et al., 2022);PAIR(Chao et al., 2025);JailbreakBench(Chao et al., 2024);各目标 LALM(如 Qwen3-Omni, Qwen2.5-Omni, Qwen2-Audio, LLaMA-Omni, Kimi-Audio, OmniVinci, MiMo-Audio, GPT-4o-Audio, Gemini 系列等);评估器 GPT-4o 与 GPT-4o-mini;安全模型 HarmBench-Llama-2 与 Llama Guard 3。未提供上述项目的直接链接,仅通过参考文献引用。

🏗️ 方法概述和架构

本研究提出了一种名为"声学干扰攻击(Acoustic Interference Attack, AIA)“的新范式,其核心思想是颠覆将音频作为恶意内容载体的传统观念,转而利用音频本身固有的、无内容的声学特征作为"干扰器”,诱导LALM安全对齐失效。整个方法框架分为离线构建与在线攻击两大阶段,流程清晰、层级分明。

阶段一:声学潜在语义(ALS)库的离线构建

该阶段的目标是建立一个可解释、高多样性的"干扰音频"库,并赋予其有意义的索引,这是整个攻击的基石,具体分为五个子步骤:

  1. 无监督采样与质量过滤:作者选用Bark作为代理声学生成模型(AGM),其核心优势在于独特的"历史提示(history prompt)“机制——一个专门编码音频风格信息(而非语义内容)的连续高维嵌入向量。通过对固定、无害的语义文本(“the quick brown fox jumps over the lazy dog”)进行无条件生成(温度 \(\tau \sim \mathcal{U}(0.8, 1.2)\)),获得5000个音频及其对应的历史提示,经时长过滤后形成原始语料库。
  2. 联合特征嵌入:为全面刻画每个音频样本,进行双视角特征提取:(a) 使用CLAP模型提取高层语义对齐嵌入(固定pangram文本以消除内容差异);(b) 使用WavLM模型的6-12层提取低层声学结构嵌入,以捕捉韵律、情感和信道特性。两种嵌入经归一化后拼接,形成统一的表征向量 \(z = \text{Norm}(\text{Norm}(e_{clap}) \oplus \text{Norm}(e_{wavlm}))\)。
  3. 层次聚类与代表性选择:对联合嵌入向量进行两阶段K-means层次聚类,形成树状结构。在每个叶子簇内,执行"密度感知选择”,即优先选取簇中心样本,并在簇内边界区域选择距离中心最远的样本,确保最终选出的代表性样本集同时具备高覆盖度和内部多样性。
  4. 多维可解释索引构建:这是将黑盒的"声学潜在语义"变为白盒知识的关键一步。作者设计了一套12维的混合索引系统,涵盖"人设(Persona)"、“表达(Delivery)“和"信号(Signal)“三大类特征。每一维度的评分由两部分加权融合:(a) GPT-4o在0-9 Likert量表上的主观评估;(b) 基于信号处理规则(如频谱熵、基频)的客观指标。最终通过10桶等频分箱处理,为每个干扰音频生成一个可解释的12维索引向量 \(s\),即 \(s[d] = \text{Bucket}_{0\text{-}9}(w_d \cdot Z(s_{llm}[d]) + (1 - w_d) \cdot Z(s_{rule}[d]))\)。
  5. 库的构建:最终形成的ALS库由四元组构成,包含:代表性音频 \(x_{rep}\)、对应的历史提示 \(h_{rep}\)、12维索引向量 \(s_{rep}\),以及聚类信息 \(c_{rep}\)。

阶段二:AIA在线攻击流程

AIA是一种查询高效的、通用的黑盒攻击,其核心在于"非必要不干预"和"离线排序"策略。流程如下:

  1. 弱点探测与分类:首先,在一个开源代理模型(如Qwen2.5-Omni)上,使用JBB数据集中的纯文本越狱样本进行查询,并根据GPT-4o的评分(1-10分,仅10分计为成功)将其划分为强集(平均分>8)、弱集(平均分<2)和中集(其余)。
  2. 干扰音频效果评测与全局排序:将所有ALS合成的干扰音频(内容固定为三个无害指令之一)与所有文本子集进行配对查询。研究者发现了一个关键的"双向干扰"现象:引入ALS会抑制强文本的攻击力,但能显著提升弱、中文本的攻击力。基于此发现,采用"难度感知加权"策略,对在弱/中集上表现更好的干扰音频赋予更高权重(\(\lambda_{weak} > \lambda_{medium} > \lambda_{strong}\),如3、2、1),构建出一个离线的、全局排序的干扰音频集 \(A_{ran}\)。排序公式为 \(S(x_{int}) = \sum_{b} \lambda_b \cdot \left( ASR_b(x_{int}) + \text{Norm}(S_{GPT,b}(x_{int})) \right)\)。此排序过程一次完成,在线攻击时无需重复。
  3. 两阶段攻击实施:给定一个越狱文本 \(t\),AIA首先尝试 \(m\) 次(如5次)纯文本查询。若均被拒绝,则判定其为"顽固"样本,并激活声学干扰阶段。在该阶段,AIA按序从 \(A_{ran}\) 中选取最多 \(n\) 个(如25个)干扰音频 \(a\),与文本 \(t\) 组装为多模态查询发送给目标LALM。一旦攻击成功,流程立即终止。该设计将优化负载完全转移至离线阶段,使在线攻击为零优化、低查询流程。

💡 核心创新点

  1. 攻击范式的根本性转变:从"内容注入"到"声学干扰”

    • 前任局限:所有现有LALM越狱方法(如表1归纳的12种方法,覆盖语义优化、声学参数控制、加性扰动三条路线或其组合)都默认需要将恶意意图注入到音频内容中,将音频视为攻击载荷的载体。
    • 创新与机理:本文首次提出并验证了"声学干扰"范式。攻击者可以使用完全无害的指令音频,但通过注入特定的副语言特征(ALS),就能扰乱LALM的推理过程,使其在"被分心"的状态下执行原本会拒绝的恶意文本指令。这揭示了LALM安全对齐的一个全新、独立于内容语义的漏洞维度,并实现了攻击载荷与音频模态的彻底解耦。
    • 证据与收益:该方法不再需要对每个攻击样本进行费时的在线优化或AGM调用,实现了真正通用、即插即用的黑盒越狱,极大增强了其在真实黑盒API场景下的威胁性。
  2. 声学潜在语义(ALS)的提取与索引机制

    • 前任局限:以往工作仅使用粗糙、离散、预设的声学参数(如性别、情绪标签),缺乏高维表示能力,且这些参数与模型内部表征存在鸿沟。
    • 创新与机理:ALS从神经生成模型的自然分布中无监督挖掘,更贴近LALM内部音频编码器的特征空间。更具价值的是,作者构建了一套基于IEMOCAP、Audio Set等多源知识定义的12维可解释索引系统,并验证了这些维度与攻击有效性的关联,将黑盒的"干扰模式"转化为白盒知识,为后续攻防研究提供了可理解的抓手。
    • 证据与收益:消融实验证明,使用高排名ALS的攻击力远超低排名和非ALS音频,证实了特定声学模式的存在和有效性。附录D.2进一步揭示了"高音调/高语速/高能量”(紧迫感)、“高情绪效价/高标准度”(善意陷阱)、“低年龄感”(年轻偏差)、“高合成瑕疵”(非人感)等具体易受攻击模式。
  3. “推理路径漂移"的内在机理解释

    • 前任局限:多数攻击工作止步于"是否成功”,极少探究模型内部到底发生了什么。
    • 创新与机理:论文通过三个层层递进的实验——(1) 拒绝词logit被系统性抑制(拒绝边际 \(\Delta M\) 显著为负);(2) 隐状态沿"拒绝方向"向量在Transformer深层发生几何漂移;(3) 因果激活修补实验(Text→Audio修补导致安全边际崩溃,反向修补则恢复)明确证实了干扰音频的因果作用——完整地解释了"声学干扰"导致安全对齐失效的内在机制。
    • 证据与收益:这不仅是性能报告,更是对LALM安全漏洞的深层科学洞察,为设计更有针对性的防御策略(如针对特定声学模式的对抗训练)指明了方向。

📊 实验结果

论文在JBB、WildJailbreak、AdvBench、HarmBench、HH-RLHF五个数据集上进行了广泛评估,核心结果如下:

主实验:AIA攻击性能 (ASR-M, %)

Qwen2.5-Omni、Qwen2-Audio、OmniVinci、MiMo-Audio、Gemini-2.5-Pro、Gemini-3-Pro在AIA攻击下达到了90-100%的ASR-M。

目标 LALMJBB TextJBB AIA提升JBB QueryWildJ. TextWildJ. AIA提升WildJ. Query
Qwen3-Omni45.0069.05↑24.0511.741.3374.67↑33.3414.1
Qwen2.5-Omni50.98100.00↑49.029.747.8995.77↑47.888.6
Qwen2-Audio61.1196.30↑35.196.860.6787.64↑26.977.3
LLaMA-Omni9.6832.26↑22.5824.723.4043.62↑20.2220.8
Kimi-Audio14.5472.73↑58.1916.517.8647.62↑29.7621.7
OmniVinci73.6898.25↑24.574.760.2396.59↑36.365.2
MiMo-Audio47.6295.24↑47.628.042.4284.85↑42.4314.6
GPT-4o-Audio56.1075.61↑19.5110.729.8552.24↑22.3917.8
Gemini-3-Pro34.4893.10↑58.6212.237.1485.71↑48.5713.6
Gemini-2.5-Pro50.00100.00↑50.0011.935.0098.33↑63.3310.9

与SOTA方法对比 (ASR, %)

AIA在多个模型上超越了实例级优化方法和通用越狱方法。注意:灰色数值来自采用更宽松评估策略的JALMBench,不宜直接比较。

方法类型Qwen 2-AudioQwen 2.5-OmniGPT-4o-AudioGemini 2.5-ProGemini 3-ProLLaMA-OmniKimi-AudioQuery Time
BoN实例85.40-59.00--99.60-600
AdvWave实例96.70-91.10--100.00-31
SACRED-Bench实例98.1692.8370.05-66.75--2
AMSE通用41.90-5.7034.60-21.10-18
AudioJailbreak通用1.71----20.41-1
AIA (Ours)通用96.30100.0075.61100.0093.1032.2672.7311.7

关键消融与验证实验

  • 文本质量消融 (HH-RLHF):在弱攻击性文本上,AIA仍能显著提升ASR。例如,Qwen2.5-Omni的ASR-M从4.23%提升至11.27%,Gemini-2.5从2.94%提升至23.53%。
  • ALS质量消融:使用Top 30 ALS的攻击效果远超Bottom 30和非ALS的情况(如Qwen2.5-Omni上ASR-M: Top 30 100.00% vs Non 85.19%),证实了ALS排序的有效性;但非ALS干扰仍有效,说明"干扰"范式本身具有普遍威胁性。
  • 音频内容消融:三种不同的无害指令作为音频内容,攻击效果无显著差异(如GPT-4o-Audio上ASR-M分别为74.36%, 73.68%, 72.73%),证实效果源于声学特征而非语义。
  • 代理AGM消融:使用Tortoise TTS替代Bark,Qwen2.5-Omni上ASR-M达到98.04%,GPT-4o-Audio达到76.60%,证明ALS的迁移性和方法的通用性。
  • 机制验证:
    • Logit分析:ALS系统性降低了模型首个token的拒绝概率边际(\(\Delta M\)显著为负)。
    • 隐空间漂移:在Transformer深层(约第24-28层),ALS使模型隐状态沿"拒绝方向向量"发生显著负向偏移,且有明显的按子集分组的模式。
    • 因果修补:将文本推理的激活替换为音频干扰的激活,会导致模型从"拒绝"变为"服从”,反之亦然,证实因果性。

🔬 细节详述

  • 训练数据:未涉及模型训练,主要是数据构建。Bark的无条件采样使用了固定文本"the quick brown fox jumps over the lazy dog",生成5000个候选音频。
  • 损失函数:未涉及,方法属于攻击算法,不涉及训练过程。
  • 训练策略:未提及。全局排序中使用的超参数:\(\lambda_{weak}=3, \lambda_{medium}=2, \lambda_{strong}=1\)。
  • 关键超参数:
    • Bark生成温度:\(\tau \sim \mathcal{U}(0.8, 1.2)\),干扰音频合成时固定为 \(\tau_0=1\)。
    • 层次聚类:K-means两阶段。
    • AIA查询次数:文本阶段 \(m=5\) 次,音频阶段 \(n=25\) 次。
    • 评估指标:除标准ASR-R外,引入ASR-M以更准确评估不含固定目标前缀的越狱。当GPT-4o评估失败时,用GPT-4o-mini补充,两次均失败计为无效样本。
  • 训练硬件:未说明。
  • 推理细节:
    • 干扰音频内容模板:三个固定无害指令 (1) “Sure, here is.”; (2) “Below is an instruction that describes a task.”; (3) “I need you to help me with this immediately."。
    • 评估器:GPT-4o(搭配GPT-4o-mini辅助),采用PAIR标准系统提示词。
    • ASR-R定义:过滤标准拒绝前缀后,GPT-4o评分为10则记为成功。ASR-M为去掉拒绝前缀过滤、对所有响应进行GPT评分的指标。
  • 正则化或稳定训练技巧:无。

⚖️ 评分理由

  • 创新性 (1.8/2):提出了一个视觉独特、令人信服的新攻击范式,从"投毒内容"转向"干扰对齐”,这是对现有LALM越狱思路的本质性突破。声学潜在语义(ALS)的提取及可解释索引系统的构建,为黑盒音频攻击提供了全新的理论框架和分析工具。与粗糙的参数调节或对抗扰动相比,该方法展现了深刻的洞察力。

  • 技术严谨性 (1.2/1.5):“推理路径漂移"的机理解释部分非常出色,通过统计分析、几何投影和因果修补实验层层递进,论证逻辑严密。然而,ALS的发现对Bark模型的依赖性是一个未彻底解决的严谨性问题。尽管Tortoise TTS的消融实验提供了积极的迁移性证据,但作者未能从理论上充分论证这种高维潜在语义是所有LALMs的通用弱点,而非特定生成模型的产物。缺少从真实人声(如LibriSpeech)中挖掘ALS的验证,使方法通用性的根基存在一点薄弱之处。

  • 实验充分性 (1.1/1.5):在10个LALMs、5个数据集上进行了广泛的攻击验证。消融实验也触及了多个维度(文本质量、ALS质量、音频内容、代理模型)。但与现有工作(特别是同为通用方法的AudioJailbreak和AMSE)的横向对比存在明显不足。AudioJailbreak因目标设定不同(DoS/精确前缀匹配)且仅报告了极低的ASR,难以构成平等对比;AMSE的对比则受限于其自身较弱的性能。这使得"SOTA"声明虽然在数值上成立,但缺少与最强同期通用方法的平等对抗。

  • 清晰度 (0.8/1):核心思想阐述清晰,图1和图2的示意图极具表现力。方法部分的Pipeline描述也较为完整。但12维索引系统的具体定义、构建细节及评分prompt被完全放在附录E中,导致主文方法部分的核心创新点之一显得不够自洽,阅读流畅性受到影响。

  • 影响力 (1.2/1.5):为LALM安全研究开辟了一个全新且重要的方向——声学模态对安全对齐的"干扰效应”。这不仅是攻击方法的创新,更揭示了一个可能普遍存在的模型脆弱性,将对后续的防御机制设计产生深远影响。可解释的ALS模式为构建更鲁棒的多模态安全防护提供了具体靶点。其影响力主要受限于对代理模型依赖的解释深度以及防御策略讨论的缺失。

  • 开源 (0.5/1.5):论文中提供了项目页面链接(https://flaai.github.io/AIA_page),并声明"代码和通用ALS库已开源"。但审阅时项目页面为占位符,未提供直接的GitHub仓库、HuggingFace数据集或模型权重链接。尽管有承诺,但核心资源尚不可直接访问,只能给到承诺开源的分数。

  • 可复现性 (0.3/0.5):除开源代码缺失外,论文在复现细节上也存在一些模糊地带。例如,GPT-4o评估器的完整系统提示词、索引构建中12个维度各自的LLM评分prompt以及权重 \(w_d\) 的具体取值等关键实现细节未在主文或附录中充分说明,会增加外部研究者精确复现结果的难度。

  • 工程/实践价值 (1.1/1.5):将复杂的越狱攻击流程高度工程化为"离线孤岛构建 + 在线低查询攻击"的pipeline,设计精巧且务实。“难度感知排序"机制使攻击过程完全无需在线优化或AGM调用,极大提升了攻击的隐蔽性和实用性,是从学术攻击到"产品级"威胁评估的关键一步。

🚨 局限与问题

  1. 论文明确承认的局限:

    • 结论中提及未来工作包括"对干扰音频应用更高级的优化”,暗示当前基于贪心选择的全局排序并非最优。
    • 索引系统是对连续高维空间的离散化近似,可能丢失关键信息。
  2. 审稿人发现的潜在问题:

    • 对Bark的过度依赖仍未完全解决:Tortoise TTS的消融是积极的,但两者均为TTS合成模型。ALS是否真正反映了LALMs音频编码器的通用脆弱点,还是利用了"非自然"合成音频的分布外特征?更严格的验证应包含从真实语音数据集(如LibriSpeech, VCTK)中采样并使用同一套索引体系筛选的对照组。
    • 基线对比的不对等性:如表1和对比实验所示,对比的最强通用基线AudioJailbreak和AMSE要么目标不一致(AudioJailbreak追求DoS或固定前缀而非通用越狱),要么性能较弱(AMSE)。这使得"通用越狱SOTA"的宣称缺少与真正强有力、目标一致的通用方法的直接交锋。与实例级方法的对比虽然分数领先,但无法完全说明新范式的通用性优势。
    • 防御策略讨论的极度匮乏:全文仅在附录D.2的模式分析中隐含了防御方向,但未在任何地方明确讨论或验证任何可能的缓解措施(如针对高音调/高语速的对抗训练、基于ALS索引的音频过滤等)。作为揭露重大安全漏洞的工作,探讨潜在防御路径是增加工作厚度和建设性的重要环节。
    • ASR-M指标的推广性存疑:ASR-M的提出是为了修正标准ASR-R对本方法的低估,这本身是合理的。但其他所有基线方法均以ASR-R报告结果,这会导致与AIA的对比(尤其是在表3与实例级方法的混排中)存在统计口径上的不公平优势,作者对此的讨论不够充分。

← 返回 ICML 2026 论文速递