Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

📄 Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization #模型剪枝 #可解释性 5.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.9/10 | 前50% | #模型剪枝 | #模型剪枝 | #可解释性 | arxiv 👥 作者与机构 第一作者:Zheng Fang(武汉大学) 通讯作者:Shenyi Zhang(武汉大学数学与人工智能研究所) 作者列表:Zheng Fang(武汉大学)、Xiaosen Wang(华中科技大学)、Shenyi Zhang(武汉大学数学与人工智能研究所)、Shaokang Wang(上海交通大学)、Zhijin Ge(西安电子科技大学) 💡 毒舌点评 本文以一个直观的梯度能量集中现象为切入点,提出稀疏token选择优化替代传统密集波形更新,想法简单,实验在三款主流ALM上也展示了不错的攻击成功率。但问题同样刺眼:整个方法深绑白盒威胁模型,离实际攻防场景太远;更致命的是无代码、无模型、无Demo,连复现的最小诚意都没有,让其宣称的“促进安全对齐研究”显得像个空口号。 📌 核心摘要 本文研究音频语言模型(ALM)的越狱攻击,质疑密集波形更新的必要性。通过分析token对齐的梯度能量,发现梯度高度集中在少数音频token上(例如Qwen3-Omni上前16% token占90%梯度能量)。据此提出Token-Aware Gradient Optimization (TAGO),在每步迭代中仅保留梯度能量最高的top-k token对应的波形区域进行稀疏更新,并辅以模型兼容的前缀模板和早停(EOS)抑制。在Qwen3-Omni、Qwen2.5-Omni和LLaMA-Omni上,TAGO在token保留率0.25时仍能维持86%的LLM-Judge ASR(Qwen3-Omni),远超随机后剪枝的Post-hoc prune基线,且攻击扰动SNR均在20dB以上,不易察觉。结果表明密集波形更新存在大量冗余,稀疏token级优化足以实现高效越狱。不足之处在于仅适用于白盒设定,且完全未提供开源代码或模型权重。 ...

2026-07-04 · 更新于 2026-07-29 · 2 min · 323 words

SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations

📄 SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations #音频理解 #语音识别 8.4/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.4/10 | 前25% | #音频理解 | #自监督学习 | #语音识别 | arxiv 👥 作者与机构 第一作者/通讯作者:Xiaoyu Yang(Department of Engineering, University of Cambridge) 作者列表:Xiaoyu Yang(University of Cambridge)、Yifan Yang(Shanghai Jiao Tong University)、Zengrui Jin(Tsinghua University)、Ziyun Cui(Tsinghua University, Shanghai Artificial Intelligence Laboratory)、Wen Wu(Shanghai Artificial Intelligence Laboratory)、Baoxiang Li(Shanghai Artificial Intelligence Laboratory)、Chao Zhang(Tsinghua University, Shanghai Artificial Intelligence Laboratory)、Phil Woodland(University of Cambridge) 💡 毒舌点评 SPEAR 用多码本矢量量化(MVQ)这把快刀,把语音和音频两个域的知识剁成离散 token,再让 Zipformer 用掩码预测全吞下去。思路直接有效,在 SUPERB 和 HEAR 上双线刷榜,token mixing 更是让分离任务表现惊艳。但整个框架的命门在于强依赖教师模型质量,训练 pipeline 重得像个工程怪兽,且音频数据仅 13k 小时,想在纯音乐或环境声上压制音频大模型还差火候。说是统一框架,但目前还是个理解专才,生成任务的门都没摸到。 ...

2026-07-04 · 更新于 2026-07-29 · 5 min · 1028 words

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard

📄 Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard #音频理解 #SFT #基准测试 #内容审核 #数据集 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 🔥 8.3/10 | 前25% | #音频理解 | #SFT | #基准测试 #内容审核 | arxiv 👥 作者与机构 第一作者:Yudong Yang(清华大学) 通讯作者:Guangzhi Sun(剑桥大学)、Chao Zhang(清华大学) 作者列表:Yudong Yang(清华大学)、Xuezhen Zhang(清华大学)、Zhifeng Han(清华大学)、Siyin Wang(清华大学)、Jimin Zhuang(清华大学)、Zengrui Jin(清华大学)、Jing Shao(上海人工智能实验室)、Guangzhi Sun(剑桥大学)、Chao Zhang(清华大学) 💡 毒舌点评 本文亮点在于首次系统性地将语音-非语音音频的语义和语境组合引入多模态LLM安全红队评测,攻击方式真实且具有现实威胁性,提出的SALMONN-Guard联合模态守卫设计也展现了防御此类攻击的可行性。然而,攻击构造仍依赖人工预设的声学参数与对话脚本,缺乏自适应的攻击策略优化,使得benchmark的攻击上限不明确;防御仅使用SFT,未与对抗训练等更强基线对比,说服力不足;MSD评估将“理解错误”也计入攻击成功,该设定存在争议,可能高估了实际威胁。 ...

2026-07-04 · 更新于 2026-07-29 · 4 min · 738 words

Spherical Procrustes Alignment for Reliable Medical Audio Diagnosis

📄 Spherical Procrustes Alignment for Reliable Medical Audio Diagnosis #音频分类 #音频事件检测 #低资源 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.2/10 | 前25% | #音频分类 | #知识蒸馏 | #音频事件检测 #低资源 | arxiv 👥 作者与机构 第一作者:Ying Wang(Faculty of Applied Sciences, Macao Polytechnic University, Macao SAR, China) 通讯作者:Xiaochen Yuan(Faculty of Applied Sciences, Macao Polytechnic University, Macao SAR, China) 作者列表:Ying Wang(Faculty of Applied Sciences, Macao Polytechnic University)、Guoheng Huang(School of Computer Science and Technology, Guangdong University of Technology)、Chan-Tong Lam(Faculty of Applied Sciences, Macao Polytechnic University)、Xiaochen Yuan(Faculty of Applied Sciences, Macao Polytechnic University) 💡 毒舌点评 这篇论文精准地抓住了医疗音频模型过度自信的几何病根——范数偏差,用球形约束和动态Procrustes对齐的组合拳切断了特征幅度与置信度的虚假耦合,理念清晰且动机扎实。实验校准效果惊人,将BEATs的ECE从28.51%拉低到4.44%,且做到了零额外推理成本,这一点很漂亮。然而,方法论层面更多是已知几何工具(L2归一化、ETF、SVD)在特定问题上的精巧组装,而非基础性突破。此外,验证局限于两个公开的呼吸音/心音数据集,在标签噪声、跨中心/跨设备泛化上的鲁棒性论证几乎为零,结论的临床闭环说服力仍需大量补充。 ...

2026-07-04 · 更新于 2026-07-29 · 5 min · 901 words

Stable Spectral Copula Alignment for Robust Multimodal Learning

📄 Stable Spectral Copula Alignment for Robust Multimodal Learning #鲁棒性 #多模态模型 5.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.4/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 📝 5.2/10 | 后50% | #鲁棒性 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Hongkang Zhang(Tsinghua Shenzhen International Graduate School, Tsinghua University) 通讯作者:Shao-Lun Huang(Tsinghua Shenzhen International Graduate School, Tsinghua University) 作者列表:Hongkang Zhang, Shao-Lun Huang, Yanlong Wang, Ercan Engin KURUOGLU(均为Tsinghua Shenzhen International Graduate School) 💡 毒舌点评 这篇论文试图构建一个“可审计”的多模态对齐协议,利用Copula理论与光谱扰动理论提供一种部署阶段抵御分布偏移的稳定契约精神。将错误的溯源与可执行的门控决策结合起来,想法在MLOps导向的多模态学习里算是有新意。然而,作品的写作风格沉重拖沓,导论部分沉迷于宏观宣誓而技术细节被稀释殆尽;更致命的是,全文完全没有提供任何形式的代码或数据链接,在这个号称“可审计”的协议里,自身的可复现性却是零。实验虽覆盖了不少漂移场景,但主要聚焦于情感分析和图像-文本检索,在音频处理的核心高地(如语音识别/分离)上毫无建树,这让它在多模态社区内难以跨越“小圈子自嗨”的界限。 ...

2026-07-04 · 更新于 2026-07-29 · 2 min · 356 words

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

📄 STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation #音频生成 7.9/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 ✅ 7.9/10 | 前25% | #音频生成 | #变分自编码器 | arxiv 👥 作者与机构 第一作者:Huadai Liu(香港科技大学、阿里巴巴通义 Fun Team) 通讯作者:Wei Xue(香港科技大学) 作者列表:Huadai Liu(香港科技大学、阿里巴巴通义 Fun Team)、Wen Wang(阿里巴巴通义 Fun Team)、Kaicheng Luo(阿里巴巴通义 Fun Team)、Qian Chen(阿里巴巴通义 Fun Team)、Xiangang Li(阿里巴巴通义 Fun Team)、Wei Xue(香港科技大学) 💡 毒舌点评 这篇论文将音频 VAE 中一个被长期默认的实践——各通道均等 KL 惩罚——上升到"三元悖论"的理论高度,并用一个幂律增长的通道方向约束场(Gamma-Growth)优雅地重构了潜在空间拓扑。洞察清晰、动机扎实,实验也相当全面。然而,方法核心高度依赖对 γ=2.0 这一具体取值的经验消融,缺乏信息论或谱分析层面的严格理论支撑来解释"为何是幂律而非其他函数族",更缺少对该参数的数据驱动自适应机制;且论文将 STAR 包装为"适用于任何 VAE 架构"的通用正则化器,但在纯 CNN 上的收益幅度远小于结合 Mamba 的跃升,通用性声明的力度可能需要更审慎的限定。此外,无开源代码和模型权重,在当前顶会生态中属于较大减分项。 ...

2026-07-04 · 更新于 2026-07-29 · 7 min · 1335 words

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

📄 STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits #音视频生成 #语音合成 #扩散模型 #自回归模型 #多模态模型 6.8/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | #音视频生成 | #扩散模型 | #语音合成 #自回归模型 | arxiv 👥 作者与机构 第一作者:Foivos Paraperas Papantoniou(Imperial College London, UK) 通讯作者:Foivos Paraperas Papantoniou(Imperial College London, UK) 作者列表:Foivos Paraperas Papantoniou(Imperial College London, UK)、Stathis Galanakis(Imperial College London, UK)、Rolandos Alexandros Potamias(Imperial College London, UK)、Bernhard Kainz(Imperial College London, UK; FAU Erlangen–Nürnberg, Germany)、Stefanos Zafeiriou(Imperial College London, UK) 💡 毒舌点评 这篇论文把一个音频驱动说话人脸生成和一个新视角合成任务塞进了同一个框架,工程整合能力值得肯定,自强迫训练策略和纯ID驱动生成确实让动画没那么“僵尸”了。但本质上,它就是拿Arc2Face当骨架,套上AnimateDiff的时间层,加个ReferenceNet,再用自强迫和唇读损失微调一下——每个组件都是现成的,论文没在理论或架构上给出让人眼前一亮的新洞见。最致命的还是不提供代码和模型,在如今“没有开源就别想拿高分”的顶会气氛下,这种做法无异于自断一臂,尤其是实验结果里那些微小的LSE-C领先,没给置信区间,完全是给人留质疑的把柄。 ...

2026-07-04 · 更新于 2026-07-29 · 4 min · 761 words

Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage

📄 Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage #流式处理 7.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | #流式处理 | #流式处理 | arxiv 👥 作者与机构 第一作者:Siddhant Arora(Meta AI / Carnegie Mellon University) 通讯作者:Siddhant Arora(siddhana@meta.com)、Zhaojiang Lin(zhaojiang@meta.com) 作者列表:Siddhant Arora(Meta AI, USA / Carnegie Mellon University, USA)、Haidar Khan(Meta AI, USA)、Kai Sun(Meta AI, USA)、Xin Luna Dong(Meta AI, USA)、Sajal Choudhary(Meta AI, USA)、Seungwhan Moon(Meta AI, USA)、Xinyuan Zhang(Meta AI, USA)、Adithya Sagar(Meta AI, USA)、Surya Teja Appini(Meta AI, USA)、Kaushik Patnaik(Meta AI, USA)、Sanat Sharma(Meta AI, USA)、Shinji Watanabe(Carnegie Mellon University, USA)、Anuj Kumar(Meta AI, USA)、Ahmed A Aly(Meta AI, USA)、Yue Liu(Meta AI, USA)、Florian Metze(Meta AI, USA)、Zhaojiang Lin(Meta AI, USA) 💡 毒舌点评 本文提出了一种将语音对话系统的工具调用从“端点后”推进到“流式并行”的工程框架,其“边听边查”的思路以及对延迟的大幅改善(结合vLLM后达57%)无疑是务实且有效的。然而,这也是一篇典型的工业界系统工程论文:核心的Model-Triggered策略本质上是对LLM的一次精巧适配和指令微调,学术深度有限,未能对“为何流式查询不损害准确率”提供理论层面的洞见。此外,论文回避了Reflector机制在关键实体后置时的失效问题,且对多轮、嘈杂环境的鲁棒性验证严重不足,使其宣称的泛化能力打了折扣。 ...

2026-07-04 · 更新于 2026-07-29 · 3 min · 570 words

SURF: Separation via Unsupervised Remixing Flow

📄 SURF: Separation via Unsupervised Remixing Flow #语音分离 #生成模型 #自监督学习 #无监督学习 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.2/10 | 前50% | #语音分离 | #流匹配 | #生成模型 #自监督学习 | arxiv 👥 作者与机构 第一作者:Henry Li (Google), 共同一作:Robin Scheibler (Google DeepMind) 通讯作者:Henry Li (lihenry@google.com) 作者列表:Henry Li (Google)、Robin Scheibler (Google DeepMind)、Efthymios Tzinis (Google)、Matt Shannon (Google DeepMind)、Arnaud Doucet (Google DeepMind)、John R. Hershey (Google DeepMind) 备注:Arnaud Doucet 与 John R. Hershey 为共同高级作者 (equal senior contribution) 💡 毒舌点评 这篇论文用Wake-Sleep给“借鸡生蛋”的Remixing套上了一层概率外衣,又将Flow Matching的生成能力引入无监督分离,想法很漂亮,画面很美好。但现实很骨感:AudioSet上三四个源的场景直接“掉链子”,理论分析的强假设(人口极限B→∞)在实际中脆弱得像纸糊,加上代码闭源、关键超参数缺失,让人严重怀疑这套花哨的pipeline复现起来是不是一场工程噩梦。 ...

2026-07-04 · 更新于 2026-07-29 · 5 min · 1043 words

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

📄 T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation #基准测试 #多模态模型 #音视频生成 7.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.7/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.9/10 | 前25% | #音视频生成 | #多模态模型 | #基准测试 | arxiv 👥 作者与机构 第一作者:Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang(并列一作,均标注为南京大学) 通讯作者:Jiaheng Liu(南京大学) 其他作者:Yuanxing Zhang(快手科技 Kling Team)、Jiahao Wang(南京大学)、Jialu Chen(快手科技 Kling Team)、Miao Deng(南京大学)、Chenxi Liao(南京大学)、Yize Zhang(南京大学)、Yubin Guo(南京大学)、Zhaoxiang Zhang(中国科学院自动化研究所) 💡 毒舌点评 这篇论文在 T2AV 评估领域迈出了扎实的一步:500条高复杂度prompt配合同一框架下的双层级评估,确实暴露了SOTA模型在“音频真实感”和“长时叙述”上的系统性瓶颈,诊断价值明确。但MLLM-as-a-Judge的可靠性验证仅覆盖50个样本且音频Realism一致性较弱(L1高达1.420),若不能规模化解决judge bias,这套框架的权威性就只能停留在“参考级”而非“标准级”。 ...

2026-07-04 · 更新于 2026-07-29 · 4 min · 663 words