Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization
📄 Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization #模型剪枝 #可解释性 5.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.9/10 | 前50% | #模型剪枝 | #模型剪枝 | #可解释性 | arxiv 👥 作者与机构 第一作者:Zheng Fang(武汉大学) 通讯作者:Shenyi Zhang(武汉大学数学与人工智能研究所) 作者列表:Zheng Fang(武汉大学)、Xiaosen Wang(华中科技大学)、Shenyi Zhang(武汉大学数学与人工智能研究所)、Shaokang Wang(上海交通大学)、Zhijin Ge(西安电子科技大学) 💡 毒舌点评 本文以一个直观的梯度能量集中现象为切入点,提出稀疏token选择优化替代传统密集波形更新,想法简单,实验在三款主流ALM上也展示了不错的攻击成功率。但问题同样刺眼:整个方法深绑白盒威胁模型,离实际攻防场景太远;更致命的是无代码、无模型、无Demo,连复现的最小诚意都没有,让其宣称的“促进安全对齐研究”显得像个空口号。 📌 核心摘要 本文研究音频语言模型(ALM)的越狱攻击,质疑密集波形更新的必要性。通过分析token对齐的梯度能量,发现梯度高度集中在少数音频token上(例如Qwen3-Omni上前16% token占90%梯度能量)。据此提出Token-Aware Gradient Optimization (TAGO),在每步迭代中仅保留梯度能量最高的top-k token对应的波形区域进行稀疏更新,并辅以模型兼容的前缀模板和早停(EOS)抑制。在Qwen3-Omni、Qwen2.5-Omni和LLaMA-Omni上,TAGO在token保留率0.25时仍能维持86%的LLM-Judge ASR(Qwen3-Omni),远超随机后剪枝的Post-hoc prune基线,且攻击扰动SNR均在20dB以上,不易察觉。结果表明密集波形更新存在大量冗余,稀疏token级优化足以实现高效越狱。不足之处在于仅适用于白盒设定,且完全未提供开源代码或模型权重。 ...