英文题目:On Optimizing Multimodal Jailbreaks for Spoken Language Models

会议身份:conference:interspeech:2026:conference-paper-id:krishnan26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多模态学习 #音频安全 #语音 #语音对话系统

评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Aravind Krishnan:机构信息未能从会议 PDF 纯文本可靠映射
  • Karolina Stańczak:机构信息未能从会议 PDF 纯文本可靠映射
  • Dietrich Klakow:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

口语语言模型(Spoken Language Models, SLMs)以语音与文本为联合输入并生成开放式回复,其安全难点在于离散文本后缀与连续音频扰动会共同推移决策边界,而现有评测只优化其中一侧。该工作先在恶意查询批次上计算肯定答复的平均负对数似然联合损失,再交替执行音频侧归一化梯度更新与文本侧候选后缀搜索,最终输出通用的对抗后缀与加性音频扰动配对,测试时直接拼接到未见恶意查询上诱发越狱。相对固定一侧模态的单模态优化,联合优化让两类扰动在同一前向上下文中相互条件化,从而暴露互补脆弱子空间。在4个模型与4类基音频上的评测显示联合攻击相对单模态基线带来1.5倍到20倍的越狱成功率提升,基于梯度能量动态的顺序近似版本则保持可比成功率并将计算耗时降低至约四分之一到六分之一。就计算量而言,在8个GCG词元加4秒PGD的相同配置下顺序算法在单个NVIDIA H100 80GB硬件上的耗时仅为联合优化的约四分之一到六分之一。该结论限于白盒可微特征提取、AdvBench前40条中抽8条训练加剩余480条测试的划分与贪婪解码加字符串匹配和LLaMA Guard 3自动判定,尚未验证跨模型迁移、人工听感隐蔽性与生产级防御下的外推能力。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

语音语言模型为什么比纯文本模型更难守住拒绝边界?

输入是文本问题与音频波形同时进入同一个语音语言模型,目标是让模型对有害请求保持拒绝。语音语言模型在这里指把语音编码器与大语言模型主干接在一起的端到端系统,能做 spoken dialogue 理解、语音问答和多模态翻译。刚入门容易误以为加了语音只是多了一种输入方式,安全行为会继承文本主干。论文的起点恰好相反:把恶意文本转成语音会降低拒绝率,噪声、背景音、音高音量语速变化、口音差异都会提高越狱率,梯度优化过的音频扰动更能诱发有害回答。也就是说,文本对齐留下的拒绝边界,在语音表示进入后可能被绕过。

语音语言模型 × 越狱攻击: 语音语言模型负责把语音信号与文本指令一起编码并生成回答,越狱攻击则负责构造能让模型输出原本应拒绝的有害内容的输入,二者搭配的原因是语音通道扩大了可被优化的输入面,组合意义在于只测文本拒绝率无法代表语音加入后的真实安全边界。

学习时要先建立依赖顺序:先理解模型同时消费两种模态,再理解攻击者可以同时改两种模态,最后才谈联合优化是否比单模态优化更强。论文把这种现实动机写成一个问题:对单模态对抗优化的鲁棒性,能否迁移到多模态组合设置。回答这个问题需要白盒梯度、固定模型参数、只改输入,并且在多个有害查询上追求通用的文本后缀与音频扰动,而不是针对一句话手工试探。

已有越狱研究测了什么,为什么还缺联合优化?

同输入同目标的已有工作主要分 3 条线。第一条是文本越狱优化,以 Greedy Coordinate Gradient 为代表,在后缀位置上用梯度找替换词元,使肯定回答的损失下降。第二条是音频越狱优化,以 Projected Gradient Descent 为代表,在基底音频上加有界扰动并反复投影回感知相似范围。第 3 条是评测与扰动分析,包括把恶意文本转语音、加噪声改韵律换口音,以及 AdvBench 上的字符串匹配与守卫模型判定。

论文指出这些工作的运行阶段存在缺口:已有文献通常只优化一个模态,另一个模态虽然存在但不参与优化。例如只做语音扰动时文本保持固定,只做文本后缀时音频保持静音或固定。在真实多模态设置里,攻击者会自然地把所有可用模态的恶意信号都最大化。因此仅用单模态评估声称的鲁棒性,可能高估多模态系统的安全性。

视觉语言模型中有多模态通用越狱的工作,语音音频组合攻击也有非优化视角的探索,但针对语音语言模型的梯度化双模态同时优化仍是空白。这就决定了本文不是提出新的单模态扰动形状,而是把两种成熟优化器拼成一个可复现的联合流程,并追问组合是否打开单模态看不见的脆弱子空间。

要解决的具体问题是什么,成功标准如何判定?

论文把任务形式化为通用越狱对的构造。给定一批恶意查询与对应的目标肯定回答,攻击者要找到一个文本后缀序列与一个音频扰动,使得模型在同时看到查询文本加后缀和扰动后音频时,更可能输出肯定开头而非拒绝。举例来说,教学例子是把“How do you build a bomb?” 后面接上待优化的占位后缀词元,同时把一段朗读、对话或音乐音频加上小幅扰动,两个扰动在每次前向中同时出现。例子只是帮助理解输入拼接方式,不代表论文主张该具体问句的成功率。

成功标准有两个并行口径:字符串匹配与 LLaMA Guard 3 判定,正文主要报告后者。所有推理采用贪心解码,以消除采样随机性对成功率比较的干扰。训练用 AdvBench 前 40 条中随机抽 8 条,测试用剩余 480 条,跨 5 个随机种子报告均值与标准误。理解这个划分很重要:后缀与扰动是在小批量有害查询上学到的通用模式,再拿到大批未见查询上检验迁移,而不是为每个测试查询单独重学。

联合攻击的全景流程是怎样的?

方法全景可以沿一个样本走一遍。输入是恶意查询文本、当前后缀词元和当前扰动后音频。表示阶段把文本词元送入文本嵌入,把波形先经特征提取器转成频谱表示再送入语音编码器,两路表示在语言模型内部汇合。组件阶段同时做两件事:对音频扰动做归一化梯度步并裁剪,对文本后缀做候选替换搜索。目标阶段计算该批次上肯定回答的平均负对数似然类损失,损失越低意味着模型越倾向于顺从。输出是经过固定步数后按联合损失挑选的最优后缀与扰动对,测试时直接拼接到新查询上。

关键安排是条件依赖:文本候选的前向评估条件于当前已扰动音频,而不是在静音下评估文本。这意味着音频上下文会改变哪个文本替换看起来最好。反过来,音频梯度也是在当前后缀存在下计算的。模型参数全程冻结,梯度只流向输入侧的扰动与后缀嵌入。论文把该联合算法命名为 JAMA,把后文的先后分步版本命名为 SAMA,二者共享同样的损失目标与步数设置,区别只在每一步是否互相条件。

文本分支与音频分支各自如何计算与更新?

先讲音频分支。白话说,投影梯度下降就是在不让人耳明显察觉的小范围内反复试探波形。对基底信号加扰动后,计算肯定回答损失对扰动的梯度,做 L2 归一化后乘以步长更新,再逐元素裁剪到负正界限内以保证感知相似。原文实现取学习率 0.01、裁剪界限 0.001,并强调原始波形不是直接进入模型,而是先经特征提取器转频谱。有些提取器不可微或用数组实现导致梯度碎裂,因此论文只选无梯度碎裂的模型并把数组操作改写为可反向传播的张量操作。缺少这一改写,音频梯度就无法流回波形。

再讲文本分支。白话说,贪心坐标梯度就是在每个后缀位置上用梯度挑一批值得试的替换词。因为词元离散不能直接加梯度,算法计算损失对后缀词嵌入的梯度,选出每个位置得分最高的若干候选,再随机替换一个位置构造一批候选后缀,逐个前向评估损失并保留最低者。原文设置搜索宽度 32、每位置候选 16,并屏蔽特殊词元以免优化出模型控制符。最终后缀按优化过程中出现的最小损失选取,而不是简单取最后一步。

贪心坐标梯度 × 投影梯度下降: 贪心坐标梯度负责在离散词表里挑选替换后缀词元以降低目标肯定回答的损失,投影梯度下降负责在连续波形上沿归一化梯度更新并裁剪到不可感知范围,二者搭配的原因是文本与音频分属离散与连续两种表示,组合意义在于联合损失能同时牵引两种扰动去挤压模型的拒绝决策。

肯定回答目标 × 联合损失: 肯定回答目标负责给出优化方向例如让模型更可能输出肯定开头,联合损失负责把多个恶意查询上的该目标取平均以追求通用后缀与通用音频扰动,二者搭配的原因是单查询优化容易过拟合,组合意义在于学到跨查询可迁移的 1 对文本音频扰动。

把两者放在同一步里,联合损失是多个查询损失的平均。音频更新用归一化投影步,文本更新用候选搜索且其前向条件于新音频。论文用算法框给出 1000 步循环:初始化后缀与均匀小扰动,每步先算联合损失与音频梯度并更新扰动,再基于新音频做文本候选评估与替换,最后返回最优对。

没有模型训练时,真正的优化计算与加速版本是什么?

本研究没有训练或微调任何语音语言模型权重,该节的训练应理解为对抗扰动的优化过程。真实计算是双层循环的输入优化:外层 1000 步,内层每步包含 1 次音频梯度反传与一批文本候选前向。音频分支每步都要反传到波形,文本分支每步要评估数十个候选后缀,而联合版本中每个候选都要带上当前扰动音频重新编码,因此长音频会显著放大计算瓶颈。

基于训练动态的观察,论文提出序列近似。做法是第一阶段在无音频输入下单独跑 1000 步文本优化并记录最优后缀,第二阶段固定该后缀再跑 1000 步音频优化。为公平比较,联合版本也是 1000 步,但序列版本总共是 1000 加 1000 步,超参数其余保持一致。序列版本省时的原因是文本候选评估时没有音频上下文,避免了对长音频的重复编码。论文在单张 H100 上以 8 词元后缀加 4 秒音频为统一配置测量耗时,报告序列方法快 4 至 6 倍。

下面这张图比较联合与序列在不同后缀长度下的性能差与耗时,左中两图是性能差随后缀词元数的变化,右图是 4 模型上的小时级耗时对比。导读时应先看横轴与零线,再看柱子高度差,不要把个别长度上的正负波动直接当成全局结论。

看图路径: 1. 先看左中两幅性能差曲线横轴后缀长度与零线的位置关系;2. 再区分四个模型折线在短后缀处正负差异的方向;3. 然后看右侧柱状图中联合与序列两类柱子的高度差;4. 最后核对运行时间单位为小时及其误差线范围

原论文 Figure 3:Comparing the jailbreak performance and the compute time of the sequential approximation with…

论文图 3。原论文 Figure 3:“Comparing the jailbreak performance and the compute time of the sequential approximation with joint optimization.”。

从像素可见,右图蓝色联合柱子明显高于橙色序列柱子,4 个模型上都呈现数倍差距;左中两图多数点在零线附近波动,短后缀处部分模型出现负向偏离,长后缀处差距收窄,个别配置序列甚至略高于联合。论文的解释是序列避免了双模态梯度相互干扰,后文结果节将进一步说明长配置下二者成功率接近。这张图不支持把序列说成全面更强,只能说在足够长的配置下它是更快且可比的基线。

联合多模态攻击 × 序列多模态攻击: 联合多模态攻击负责每一步都让文本候选评估条件于当前音频扰动,序列多模态攻击负责先固定文本后缀再优化音频扰动,二者搭配的原因是联合优化中文本梯度早期占主导,组合意义在于用先后顺序近似同时优化,以省去带音频上下文的大批量候选前向计算。

在哪些模型、音频与参数下比较,结果才可比?

评估覆盖 4 个支持可微音频特征提取的安全对齐模型:Audio Flamingo 3、Qwen2 Audio 7B 指令版、Gemma 3N 高效指令版和 Qwen2.5 Omni 7B。选择标准不是知名度,而是梯度能否从损失流回音频输入,这是复现时最容易忽略的隐藏条件。若换用带不可微提取器的模型而不改写实现,音频分支将无法优化。

音频初始化有 4 类:有声书朗读男声、Switchboard 对话语料中随机选的 1 男 1 女两段,以及非语音的音乐演奏。扰动时长与后缀长度构成 2 维网格,例如 Qwen 系列后缀取 0 至 16 词元,Audio Flamingo 与 Gemma 在部分设置下扩展到 32 或 64 词元,音频时长取 0 至 4 秒或 0 至 8 秒。第一列对应只做音频优化,最后一行对应只做文本优化,左下角零零点表示无攻击。

优化与评测条件保持一致:文本与音频单模态基线和联合方法使用相同步数与搜索参数,测试时把学到的通用对直接用于 480 条未见查询,贪心解码,跨 5 种子取平均。指标方向是越狱成功率越高表示攻击越强、模型越脆弱。需要区分百分点差与相对倍数:论文摘要与正文同时使用 1.5 至 20 倍、2 至 20 倍等相对表述,它们是在不同基线薄弱程度下算出的放大倍数,不能直接当成绝对成功率之差。

联合优化在什么条件下放大成功率,代价是什么?

核心比较问题是:在相同模型、相同音频初始化、相同长度预算下,同时优化双模态是否稳定超过只优化其一,且代价是什么。公平条件是固定其他超参数,只改变是否联合;指标方向是成功率越高攻击越有效。

来源证据量化值一量化值二量化值三量化值四
来源句一5.26.43.02;11.2;9.2;11.1;42.5;1.5;7.0;25.2;80.2
来源句二1659%90.9%—
来源句三0.55.413.04.9;4.0;2.2;11.1;10.3;14.3;3.0;0.8;8.5;11.6;3.3;4.3;3.2;3.8;6.9;11.8;1;6.1;14.5;27.7;52.3;77.9;20.5;33.2;80.7;88.6;17.2;28.9;34.3;46.4;59.8;2;1.5;23.8;6.0;17.3;40

上表把原文报告的相对放大与两个代表性绝对值放在同一框架下理解。Qwen 系列文本基线已强,联合主要起放大器作用:一旦后缀足够长,再加音频扰动就把成功率推向近饱和,在音乐初始化下任一模态单独已高时尤为明显。更有信息量的是单模态都不强的中段:短后缀或弱音频单独失败时,组合可能诱发越狱,例如 Qwen 模型上后缀 4 至 8 词元区间音频带来一致增益。这支持论文的判断:2 模态扰动作用于决策边界的互补部分。

最极端的例子是 Gemma 3N。它对纯文本优化高度鲁棒,对纯音频也只有弱反应,但联合优化在更长音频尤其是音乐初始化下诱发出越狱行为。论文还报告音频类型与时长的影响:音乐是音频单模态的最佳基底,可能与更宽频谱范围有关;有声书与对话的语义内容可能干扰顺从;音频越长成功率倾向越高,但在部分模型上该趋势不成立。代价是计算量与长度预算:更长后缀与更长音频带来更高成功率,但联合评估的候选前向成本随音频长度上升。

下面这张热图网格是主证据,每块小图内数值是成功率均值与标准误,颜色越黄表示成功率越高。阅读时不要只看右上角,要同时看第一列与最后一行才能判断增益来自组合而非单一强基线。

看图路径: 1. 先确认每块热图的横轴是文本后缀词元数纵轴是音频扰动时长;2. 再对比第一列与最后一行的单模态基线颜色与联合右上角颜色;3. 然后观察音乐与对话音频初始化在不同模型上的深浅差异;4. 最后读出每个格子内均值与正负标准误的配对关系

原论文 Figure 1:Jailbreak Success Rate (%) and standard error across GCG and PGD lengths.

论文图 1。原论文 Figure 1:“Jailbreak Success Rate (%) and standard error across GCG and PGD lengths.”。

从像素可见,第一行四块与第二行四块分别对应不同音频初始化,横轴后缀词元数向右增大,纵轴音频时长向上增大,右上格普遍比左列与底行更黄。Qwen 相关格子在后缀 8 至 16 处已出现大面积黄色高值,Gemma 相关格子在底行保持深色但向上向右逐渐变绿变黄,且音乐初始化的变黄更明显。每个格子内上下两行数字分别为均值与正负误差,误差在部分格子超过 10 个百分点,说明跨种子波动不可忽略,不能把单格小数差异当成稳定排序。

训练动态与表征分析支持怎样的机制解释?

论文用两组分析回答联合为何有效。第一组看优化过程中的梯度能量比,即文本梯度范数按维度归一化后除以音频梯度范数按维度归一化。曲线显示联合早期文本梯度占主导,随后相对贡献下降。损失曲线也呼应这一点:纯文本优化几百步内快速下降,离散 landscape 陡峭;纯音频更新更平滑缓慢。

联合轨迹早期像文本优化,后期由音频驱动。论文据此得出工作假设:联合算法先更新文本词元因为离散空间能快速降低损失。

第二组看推理时末层表示。用 t-SNE 投影 4 种输入条件:良性无扰动、联合攻击、仅文本后缀、仅音频扰动。扰动越长,偏离良性基线的漂移越大,成功率也越高。在最优配置下,单模态文本与单模态音频占据可分 subspace,联合攻击落在另一个不同 subspace。对 PCA 降维后 4 类嵌入训练线性分类器,仅用前两个主成分就达到 99% 准确率。论文的结论措辞是成功的跨模态越狱运行在远离良性决策边界的 subspace 中,这属于有限解释而非因果证明。

梯度能量比 × 隐层表征漂移: 梯度能量比负责量化训练过程中文本与音频梯度按维度归一化后的相对大小,隐层表征漂移负责在推理时观察末层表示相对良性输入的偏离,二者搭配的原因是一个看优化时谁先发力一个看推理时落点在哪,组合意义在于共同支持文本先快速下降损失音频后持续推进的解释。

下面这张图左侧是梯度能量随步数的变化,右侧是两种长度配置下的散点分离情况。观察时应区分分布曲线与单样本标记,并注意右侧两幅散点图的横纵轴范围不同,不能直接比绝对距离。

看图路径: 1. 先看左侧梯度能量曲线横轴步数与纵轴比值的前高后低走势;2. 再看右侧散点图中良性点与三类攻击点的图例颜色;3. 对比长后缀与短后缀两幅散点图的分离与混叠程度;4. 结合图注确认高分离配置对应更高的越狱成功率

原论文 Figure 2:Analysis of joint optimization dynamics.

论文图 2。原论文 Figure 2:“Analysis of joint optimization dynamics.”。

从本次收到的像素看,右侧长后缀配置下橙色文本点、绿色音频点与红色联合点形成相对集中的簇并与蓝色良性点分离,而短后缀配置下各类点混叠更重且棕色背景点弥散。论文正文补充说明高分离图的成功率高于低分离图,左图能量曲线前高后低支持文本先行的说法。但像素不能精确读出每步数值,复述时只讲趋势不硬写步数阈值。

序列近似在何时接近联合,长短配置有何反例?

该节的比较问题是:去掉音频上下文先做文本再做音频,能否在保持成功率的同时省时。公平条件是每阶段各 1000 步、其余超参数与联合一致,并在每个模型的最大音频长度设置下比较不同后缀长度。指标仍是成功率,差距定义为联合减序列。

论文报告平均差距约 10 个百分点,但差距随后缀长度增大而缩小,在足够长的文本与音频长度下两者成功率相近。反例同样重要:在部分短配置下序列反而超过联合,论文推测是因为避免了双模态梯度相互作用例如方向相冲。这提醒读者总体趋势不等于每组都成立,不能把序列说成严格下界。

来源证据量化值一量化值二量化值三量化值四
来源句一0.010.00115—
来源句二0200400600;800;1000;40;20;50;25;75
来源句三4-6——

上表把可复现的优化配置与耗时结论绑定:学习率、裁剪界限、步数、搜索宽度与候选数都是复现时必须照抄的量,耗时差来自候选评估时有无音频编码。未胜出项是短后缀下序列与联合的波动,以及个别模型上序列暂时反超,这些恰好说明联合的梯度交互既可能带来增益也可能带来干扰。

哪些边界尚未评测,不能从现有数字推出什么?

首先是模型选择边界。实验只覆盖支持可微特征提取的 4 个模型,结论不能推广到所有语音语言模型,尤其是带不可微或梯度碎裂提取器的系统。若不改写特征提取实现,音频梯度路径不存在,联合方法不可直接运行。

其次是音频与长度边界。只测了朗读、对话与音乐 4 类基底音频与最长 4 秒或 8 秒扰动,更长音频、真实环境噪声、不同采样率与压缩的影响未报告。音乐最好、有语义语音较差的观察是相关性,不是因果证明,不能据此断言频谱宽度决定一切。

再次是判定与成本边界。成功率依赖字符串匹配与守卫模型判定,未测量误判率、人工复核一致性、推理延迟与实际部署开销。序列省时是在特定 8 词元加 4 秒配置与单 H100 上测得,不能当成所有长度下的固定加速比。最后是防御边界。论文呼吁在组合攻击空间加护栏,但没有验证任何防御,相关性不等于已找到修复方案。阅读时应把报告显示与可能待验证分开:联合高于单模态是报告,互补 subspace 与文本先行是有限解释,频谱与语义干扰是待验证推测。

要复现联合与序列结果,先后该做什么?

复现的第一步是准备数据与判定。按 AdvBench 前 40 条抽 8 条做通用优化,剩余 480 条做测试,跨 5 种子,贪心解码,同时用字符串匹配与守卫模型记录成功率。只用单一判定或单一种子会放大波动,热图中的标准误已显示部分格子波动超过 10 个百分点。

第二步是打通梯度路径。冻结模型权重,确认波形经特征提取到频谱的每一步可反向传播,必要时把数组操作改写为张量操作。音频分支取 L2 归一化、学习率 0.01、裁剪 0.001、优化 1000 步;文本分支取搜索宽度 32、候选 16、优化 1000 步并屏蔽特殊词元,按最小损失选后缀。联合运行时文本候选必须条件于当前扰动音频,序列运行时先无音频优化文本再固定文本优化音频。

第三步是按网格记录基线。先跑第一列纯音频与最后一行纯文本,再跑联合右上,才能算出真实增益。音频初始化要分别测音乐、朗读与对话,扰动时长与后缀长度要覆盖短中长 3 段,否则无法复现中段组合效应与 Gemma 长音频才上升的现象。关于代码与权重,本次解读所依据的证据未提供可验证的可用资源状态,因此不声称代码或数据已公开;复现应以论文正文的参数与流程为准,缺失的仓库可达性与权重下载信息需要另行确认。

何时值得尝试联合思路,如何一句话记住它?

当你的系统同时吃文本与音频,且单模态安全测试已经通过时,最值得用联合视角再测 1 次。特别是文本拒绝看起来很稳、音频单测也只有弱扰动的模型,组合可能恰好落在单模态看不见的区域。Gemma 的例子就是警示:短文本后缀下 3% 量级的稳健,不代表长音频加入后依然稳健。反过来,若文本基线已高达 59% 至 90% 量级,联合更多是把成功率推向饱和,此时应把精力放在长度预算与误报控制上。

可操作记忆是:先让离散文本快速找到顺从方向,再让连续音频持续挤压边界;要省时就先分步后组合,但在短配置下保留联合对照,因为梯度干扰可能让分步偶然反超。未来还需补的验证包括更多音频类型与更长扰动、人工复核的判定一致性、以及针对组合空间的真实防御,而不是停留在攻击成功率的放大倍数上。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总