Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

📄 Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs 标签:#模型剪枝 #多模态模型 #高效推理 #模型压缩 8.4/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.4/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #模型剪枝 | #多模态模型 | #高效推理 #模型压缩 | arxiv 👥 作者与机构 第一作者:Kyeongyoon Lee(标注机构1,论文未提供机构名称) 通讯作者:未说明 作者列表:Kyeongyoon Lee(机构1)、Hongyeob Kim(机构1)、Youngeun Kim(机构2)、Sungeun Hong(机构1) 说明:所有机构仅以编号形式出现,论文原文未给出机构名称。 💡 毒舌点评 把“何时压缩”和“压缩哪个模态”拆开处理是本文最值得肯定的洞察:音频保留到查询条件化之后再用 query attention 剪枝,确实比所有 pre-LLM 统一压缩更合理。短板也很明显:所有对比都限定在 training-free 方法,缺少与可学习压缩/蒸馏方案的对照;“code will be released upon acceptance”意味着当前无法直接核验实现细节。此外,全部实验只在 Qwen2.5-Omni 单一骨干上进行,跨架构泛化尚未验证。 ...

2026-08-11 · 更新于 2026-09-04 · 5 min · 915 words

Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

📄 Allocation Before Ranking: Decoupled Token Compression for OmniLLMs 标签:#音视频理解 #模型剪枝 #音频理解 #Transformer #模型评估 8.1/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #模型剪枝 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者及通讯作者:Zhenghui Guo(University of Houston, Department of Computer Science) 作者列表:Zhenghui Guo(University of Houston, Department of Computer Science)、Yilin Yang(University of Houston, Department of Computer Science)、Yuanbin Man(The University of Texas at Arlington, Department of Computer Science and Engineering)、Miao Yin(The University of Texas at Arlington, Department of Computer Science and Engineering)、Weidong Shi(University of Houston, Department of Computer Science)、Rabimba Karanjai(University of Houston, Department of Computer Science)、Omprakash Gnawali(University of Houston, Department of Computer Science)、Chengming Zhang(University of Houston, Department of Computer Science) 通讯作者:论文未单独注明通讯作者,根据惯例及机构信息,第一作者 Zhenghui Guo 通常也是通讯作者。 💡 毒舌点评 这篇文章的洞察力令人印象深刻:敏锐地指出共享注意力中“一次打分,两次决策”的结构性缺陷,将全模态 token 压缩从一个单一的排序问题重新提炼为“先分配容量,后模态内排序”的优化问题,理论分解干净利落。实验也相当扎实,跨 backbone 验证和与 OmniZip 的 Pareto 对比都做得不错。但短板同样明显:方法严重依赖固定的超参(如 α、读层),缺乏针对不同输入分布的在线自适应策略;实验基线虽具代表性,但并未囊括所有近期的训练式压缩方法。这些问题削弱了其实用性闭环论证,离“即插即用”的终极目标还有一步之遥。 ...

2026-08-04 · 更新于 2026-09-04 · 4 min · 681 words

QR-Erase: Efficient Subspace-Based Machine Unlearning with Layer Localization

📄 QR-Erase: Efficient Subspace-Based Machine Unlearning with Layer Localization 标签:#说话人验证 #模型剪枝 #音频理解 #Transformer #模型评估 6.0/10 | 创新 0.9/2 | 严谨 1.1/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #说话人验证 | #模型剪枝 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Tyler Lizzo(未说明) 通讯作者:未说明 作者列表:Tyler Lizzo(未说明)、Larry Heck(未说明) 💡 毒舌点评 本文的核心贡献是用Pivoted QR替代SVD来做子空间遗忘,本质上是一个“平替”工作。这个替换确实省了约65%的分解时间,层局部化策略也带来了不错的性能提升。但问题在于,全文的价值逻辑高度依赖“与SVD性能接近”来论证,缺乏对方法自身核心能力的独立定义。审稿人一眼就能看穿,这只是把数值线性代数中一个成熟的、有现成scipy包的API替换,移植到了机器遗忘的管道里。更大的隐患在于,这个“接近”是在一些极为有利却未受检验的条件下得出的(比如固定且极低的秩 k=4),一旦这些条件不成立,性能是否会坍塌?这让人对整个故事的稳固性存疑。最致命的是完全没有提供任何代码,考虑到这类工作强烈的工程导向,这让所有亮眼的效率数据都变成了无法检验的单方面声明,极大地损害了论文的信誉。 📌 核心摘要 本文旨在研究子空间机器遗忘中的两个核心问题:最优的低秩重构(如SVD)是否必要,以及任务特定知识在模型中是否均匀分布。针对此,作者提出了QR-Erase框架,核心是用计算效率更高的列主元QR分解(CPQR)替代SVD来恢复任务子空间,并进一步提出层局部化(Layer-Localized)策略,仅对任务能量高于平均值的层进行遗忘更新。方法在文本任务遗忘、跨语言事实遗忘和语音说话人遗忘三个场景进行了评估。实验结果显示,QR-Erase在遗忘-保留权衡上与基于SVD的方法差距保持在5%以内,而分解时间减少了60%以上;层局部化策略能显著提升性能,例如在Qwen3-Omni样本遗忘上将遗忘集准确率从53.1%降至15.7%。作者的核心观点是,在机器遗忘中,准确的子空间恢复比最优重构更重要,且识别知识“在哪”比“用什么方法忘”对性能影响更显著。主要局限性在于该方法完全依赖LoRA构建任务向量,且在单轮运行且固定低秩(k=4)的设定下得出结论,泛化边界和统计显著性均未讨论,同时代码未开源。 ...

2026-08-04 · 更新于 2026-09-04 · 2 min · 385 words

Efficient Text-to-Audio Generation via Pruning

📄 Efficient Text-to-Audio Generation via Pruning 标签:#音频生成 #模型剪枝 #扩散模型 #高效推理 #音频理解 7.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #模型剪枝 | #扩散模型 #高效推理 | arxiv 👥 作者与机构 第一作者:Arshdeep Singh(萨里大学) 通讯作者:未说明 作者列表:Arshdeep Singh(萨里大学)、Yi Yuan(萨里大学)、Yun Chen(萨里大学)、Wenwu Wang(萨里大学)、Mark D. Plumbley(萨里大学) 💡 毒舌点评 论文将成熟的模型剪枝技术系统性地应用于音频扩散模型,通过聚焦U-Net深层块实现了显著的压缩,并细致分析了剪枝对语义类别的影响,这一应用工作有一定价值。然而,其核心贡献存在明显短板:1)方法层面缺乏创新,使用的是最基础的、基于ℓ1范数的被动剪枝,未与当前先进的剪枝方法(如基于泰勒展开、梯度、结构化剪枝或自适应剪枝率等)进行任何对比,增量贡献有限;2)声称的“轻量级微调”实则需要1M步,其计算成本与训练小型模型相比未见优势;3)对其他模型的对比(如与AudioLDM2)在数据、配置公平性上存在疑问,且效率指标(MACs、推理速度)对比不完整。论文的实验洞察(如安全关键声音受影响)有价值,但解决方案(微调)过于常规。 📌 核心摘要 本文旨在解决基于扩散模型的文本到音频生成模型(如AudioLDM)计算成本高昂、难以部署的问题。核心方法是采用基于ℓ1范数的滤波器剪枝技术,针对模型中参数和计算最集中的U-Net深层卷积块(b3, b4)进行模型压缩,并辅以轻量级微调以恢复性能。实验结果表明,该方法能移除高达83%的U-Net参数和39%的乘加运算(MACs),经过微调后,模型的FAD和KL散度指标优于未剪枝的基线模型。此外,研究发现剪枝会影响模型生成某些声音事件(尤其是安全关键声音)的能力,但通过微调可大部分恢复。主要局限性包括:剪枝策略相对基础,缺乏与其它先进剪枝方法的对比;微调代价高昂(1M步);效率评估维度(如不同硬件延迟)不足;与其他模型的对比存在公平性疑问。 ...

2026-07-16 · 更新于 2026-09-04 · 2 min · 304 words

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

📄 Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization #模型剪枝 #可解释性 5.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.9/10 | 前50% | #模型剪枝 | #模型剪枝 | #可解释性 | arxiv 👥 作者与机构 第一作者:Zheng Fang(武汉大学) 通讯作者:Shenyi Zhang(武汉大学数学与人工智能研究所) 作者列表:Zheng Fang(武汉大学)、Xiaosen Wang(华中科技大学)、Shenyi Zhang(武汉大学数学与人工智能研究所)、Shaokang Wang(上海交通大学)、Zhijin Ge(西安电子科技大学) 💡 毒舌点评 本文以一个直观的梯度能量集中现象为切入点,提出稀疏token选择优化替代传统密集波形更新,想法简单,实验在三款主流ALM上也展示了不错的攻击成功率。但问题同样刺眼:整个方法深绑白盒威胁模型,离实际攻防场景太远;更致命的是无代码、无模型、无Demo,连复现的最小诚意都没有,让其宣称的“促进安全对齐研究”显得像个空口号。 📌 核心摘要 本文研究音频语言模型(ALM)的越狱攻击,质疑密集波形更新的必要性。通过分析token对齐的梯度能量,发现梯度高度集中在少数音频token上(例如Qwen3-Omni上前16% token占90%梯度能量)。据此提出Token-Aware Gradient Optimization (TAGO),在每步迭代中仅保留梯度能量最高的top-k token对应的波形区域进行稀疏更新,并辅以模型兼容的前缀模板和早停(EOS)抑制。在Qwen3-Omni、Qwen2.5-Omni和LLaMA-Omni上,TAGO在token保留率0.25时仍能维持86%的LLM-Judge ASR(Qwen3-Omni),远超随机后剪枝的Post-hoc prune基线,且攻击扰动SNR均在20dB以上,不易察觉。结果表明密集波形更新存在大量冗余,稀疏token级优化足以实现高效越狱。不足之处在于仅适用于白盒设定,且完全未提供开源代码或模型权重。 ...

2026-07-04 · 更新于 2026-09-04 · 2 min · 323 words