Efficient Text-to-Audio Generation via Pruning
📄 Efficient Text-to-Audio Generation via Pruning 标签:#音频生成 #模型剪枝 #扩散模型 #高效推理 #音频理解 7.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #模型剪枝 | #扩散模型 #高效推理 | arxiv 👥 作者与机构 第一作者:Arshdeep Singh(萨里大学) 通讯作者:未说明 作者列表:Arshdeep Singh(萨里大学)、Yi Yuan(萨里大学)、Yun Chen(萨里大学)、Wenwu Wang(萨里大学)、Mark D. Plumbley(萨里大学) 💡 毒舌点评 论文将成熟的模型剪枝技术系统性地应用于音频扩散模型,通过聚焦U-Net深层块实现了显著的压缩,并细致分析了剪枝对语义类别的影响,这一应用工作有一定价值。然而,其核心贡献存在明显短板:1)方法层面缺乏创新,使用的是最基础的、基于ℓ1范数的被动剪枝,未与当前先进的剪枝方法(如基于泰勒展开、梯度、结构化剪枝或自适应剪枝率等)进行任何对比,增量贡献有限;2)声称的“轻量级微调”实则需要1M步,其计算成本与训练小型模型相比未见优势;3)对其他模型的对比(如与AudioLDM2)在数据、配置公平性上存在疑问,且效率指标(MACs、推理速度)对比不完整。论文的实验洞察(如安全关键声音受影响)有价值,但解决方案(微调)过于常规。 📌 核心摘要 本文旨在解决基于扩散模型的文本到音频生成模型(如AudioLDM)计算成本高昂、难以部署的问题。核心方法是采用基于ℓ1范数的滤波器剪枝技术,针对模型中参数和计算最集中的U-Net深层卷积块(b3, b4)进行模型压缩,并辅以轻量级微调以恢复性能。实验结果表明,该方法能移除高达83%的U-Net参数和39%的乘加运算(MACs),经过微调后,模型的FAD和KL散度指标优于未剪枝的基线模型。此外,研究发现剪枝会影响模型生成某些声音事件(尤其是安全关键声音)的能力,但通过微调可大部分恢复。主要局限性包括:剪枝策略相对基础,缺乏与其它先进剪枝方法的对比;微调代价高昂(1M步);效率评估维度(如不同硬件延迟)不足;与其他模型的对比存在公平性疑问。 ...