英文题目:Towards Data-free and Training-free Compression for Speech Foundation Models Using Parameter Clustering

会议身份:conference:interspeech:2026:conference-paper-id:xu26h_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#模型压缩 #语音大模型 #高效推理 #语音 #语音识别

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Haoning Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhaoqing Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Huimeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Youjun Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Chengxi Deng:机构信息未能从会议 PDF 纯文本可靠映射
  • Mengzhe Geng:机构信息未能从会议 PDF 纯文本可靠映射
  • Xunying Liu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音基础模型压缩的输入是 HuBERT-large 与 Whisper-large-v3 中 Transformer 线性层权重,输出是注意力头数与前馈中间维更小的稠密紧凑权重,难点在于无原始数据、无再训练时按重要性孤立剪枝易误删协同有用参数且忽略相似冗余。该方法先将多头自注意力模块(Multi-Head Self-Attention,MHSA)、交叉注意力模块与前馈网络模块(Feed-Forward Network,FFN)内关联矩阵拼接展平为结构单元,再用 k-means 聚类将 N 个单元合并为 K 个质心并回填重构权重,随后按模块组内拼接矩阵参数方差将各层分为高、中、低三档并倾斜重分配保留数。与基于 L2 范数(L2-norm)的幅度剪枝相比,其机制差异是用相似融合保留集体信息而非孤立丢弃低分单元。LibriSpeech 评测中 HuBERT-large 在 50% 均匀稀疏免训练下聚类相对幅度剪枝在 test-clean、test-other 降低 27.73%、18.61% 绝对词错率(Word Error Rate,WER),微调 3 轮后仍低 0.19%、0.79%;Whisper-large-v3 在 10% 混合稀疏免训练下相对幅度剪枝降低 2.86%、5.02% 且与未压缩基线无显著差异。该结论边界是 HuBERT 在 60% 与 Whisper 在 30% 稀疏后均灾难性退化,且仅在 LibriSpeech 英文朗读语音验证。原文未披露训练时长与推理延迟实测,仅给 GFLOPs 理论分析。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

语音基础模型为什么难压缩到端侧设备上?

输入是连续语音,目标是自动语音识别的词错误率。研究生首先要建立的依赖是:wav2vec2.0、HuBERT、WavLM 这类自监督模型和 Whisper 这类弱监督模型,本质都是 Transformer 堆叠,参数集中在多头自注意力与前馈网络的线性层。论文的研究对象就是这两类模块中的线性权重,不碰卷积特征提取器和嵌入层。

输出是可核对的压缩动作:给定全局稀疏率,把每层的注意力头数量和前馈中间维度变窄,使总参数量和 Transformer 部分浮点运算量下降,同时尽量不抬高在 LibriSpeech 开发集和测试集上的词错误率。必须保留的信息是实验条件:是否用了原始音频、是否做了梯度训练、稀疏度如何定义、比较基线是否可运行。

本文解读按学习依赖展开:先讲已有压缩路线为何依赖数据,再讲聚类全景,再拆注意力头拼接、前馈拼接、k-means 目标和方差分配,最后讲 LibriSpeech 上的协议、主结果、反例与复现清单。教学中举的例子会明确标为例子,不引入原文没有的数值。

已有压缩路线在什么条件下成立?

第一条路线是低比特量化,用低精度数值替代浮点权重,节省内存但一般需要校准数据决定缩放因子或做量化感知训练。第二条路线是结构压缩,包括低秩分解、知识蒸馏和模型剪枝。低秩分解改写矩阵形状,知识蒸馏需要教师模型和训练过程,非结构化剪枝能做到细粒度稀疏但产生不规则零模式。

论文把已有语音剪枝工作的 3 个局限讲得很具体。第一是孤立打分:基于重要性的剪枝逐个评估头或通道,即使两个高分权重功能冗余也不会同时处理。第二是依赖数据:即使免微调的方法往往仍要原始数据做校准,当训练数据不可用时就被卡住。第三是不利部署:非结构化稀疏需要专用硬件或库加速,在手机等端侧设备上拿不到实际加速。

因此本文选择的是结构化粗粒度路线:压缩后模型仍然是稠密的小矩阵,不需要特殊算子,也不需要教师模型。这一定位决定了后文的基线必须是同样结构化的幅度剪枝,而不是拿非结构化方法做不公平对比。

无数据免训练压缩到底要解决什么矛盾?

矛盾在于:一方面要删掉约三成到五成的结构化单元,另一方面不允许看原始训练音频,也不允许用梯度更新权重。传统幅度剪枝在这种条件下只能看权重幅度做一次性决定,丢掉的低幅度单元可能与其他单元协同工作,丢弃不可逆。

论文把任务形式化为预算分配问题。设全局稀疏率 sp 在 0 到 1 之间,某模块原来有 N 个结构化单元,则该模块要保留的目标数 K 等于对 N 乘以 1 减 sp 四舍五入。压缩比为 1 除以 1 减 sp。均匀稀疏度是对所有层用同一个 sp,混合稀疏度是在总预算不变的前提下给不同层不同的 K。

评价矛盾是否缓解的标准是词错误率方向越低越好,并用 MAPSSWE 在显著性水平 0.05 下判断差异是否显著。论文同时报告微调前和微调后,目的是把压缩算子本身的质量与有监督恢复的能力分开。

参数聚类方法全景:一个样本走完全流程

沿一个 Transformer 层走一遍。输入是该层的拼接权重矩阵。对注意力模块,把 Wq、Wk、Wv 和 Wout 的转置在特征维拼接成 MHSA 拼接矩阵,集合中的每个元素是一个注意力头,形状为头维度乘以 4 倍隐藏尺寸。对前馈模块,把 Wfc1 和 Wfc2 的转置拼接成 FFN 拼接矩阵,每个元素是一个中间单元,形状为 1 乘以 2 倍隐藏尺寸。解码器中的交叉注意力与自注意力走完全相同的拼接与展平规则。

表示阶段把每个单元用展平操作变成 1 维向量,保证距离可比。组件阶段对这 N 个向量做 k-means,目标是最小化簇内平方和,即每个单元到其最近簇中心的平方欧氏距离之和。优化过程是硬分配与中心更新交替迭代,得到 K 个中心。输出阶段把原单元替换为中心,再把压缩后的拼接矩阵拆回 Wq、Wk、Wv、Wout 或 Wfc1、Wfc2,层变窄但保持稠密。

多头自注意力 × 前馈网络: 多头自注意力的分工是把 Wq、Wk、Wv 和 Wout 转置拼接后以注意力头为单位压缩,前馈网络的分工是把 Wfc1 和 Wfc2 转置拼接后以中间通道为单位压缩;搭配理由是两者都占 Transformer 绝大多数参数且都是线性层堆叠,组合意义在于只压缩这两类结构化单元就能得到通用硬件可直接部署的窄模型。

这种做法的数据依赖为零:聚类只读权重,不读语音,不算梯度,不更新任何参数统计量之外的量。训练依赖也为零:主结果在压缩后直接解码,只有专门的分析实验才做 3 轮微调以对比起点质量。

聚类如何替代剪枝:距离、目标与重构操作是什么?

幅度剪枝的操作是计算每个头或通道的 L2 范数之和,保留前 K 个,删掉其余。注意力头的重要性是对属于该头的切片在 Wq、Wk、Wv 和 Wout 转置上求欧氏范数再求和,前馈单元的重要性是对对应行在 Wfc1 和 Wfc2 转置上求范数再求和。给定全局 sp,同样用 K 等于 N 乘以 1 减 sp 决定保留数。

聚类的操作不同。它不打分排序,而是把 N 个展平向量聚成 K 类。目标函数是簇内平方和最小,簇中心是同类单元的均值向量,保留了该类共同方向。重构时用中心堆叠出更窄的拼接矩阵,再切分回各权重,保持输入输出维度衔接。论文的论点是:相似部件被融合而非删除,集体信息得以保留。

参数聚类 × 幅度剪枝: 幅度剪枝的分工是按 L2 范数给每个结构单元打重要性分并直接丢弃低分单元,参数聚类的分工是把向量化后的单元按相似度分组并用簇中心替代整组;二者搭配比较的理由是它们输入相同的拼接矩阵和相同的保留预算 K,组合意义在于说明保留集体信息比孤立丢弃更能在无数据条件下维持识别能力。

初学者容易误解为聚类也是剪枝。关键区别是剪枝的输出是原单元的子集,聚类的输出是新算出的中心向量,形状相同但数值是平均后的结果。这也是后文 L2 范数分析的起点:聚类后的平均范数抬升幅度小于剪枝,论文报告显示这与更好的词错误率对应,但原文只称支持关系,未声称因果。

方差混合稀疏度如何给不同层分配不同 K?

直觉是拼接矩阵内参数方差大,说明各单元信息差异大,需要更多 K 来保存。操作分 3 步。第一步按功能把相同模块跨层聚合为模块组:HuBERT-large 形成编码器自注意力和前馈 2 组,每组 24 个模块;Whisper-large-v3 形成编码器自注意力、前馈、解码器自注意力、前馈、交叉注意力 5 组,每组 32 个模块。第二步在组内按参数方差排序并均匀分成低中高 3 个子组。第 3 步给高方差组分配下取整的 Kbase 乘以 1 加 s,给中组分配 Kbase,给低组分配 2 倍 Kbase 减去高组数,保证 3 组总数与均匀分配一致。

原文所有实验取 s 为 0.2,Kbase 就是均匀稀疏度下的目标数。若高组计算值超过原单元数 N 则截断为 N。论文强调混合与均匀的总体稀疏度相同,只是预算在组内再分配,因此对比是公平的。同样的分组与分配也被套用到幅度剪枝上,以验证策略通用性。

混合稀疏度 × 均匀稀疏度: 均匀稀疏度的分工是对所有层使用同一个全局稀疏率 sp 计算 K,混合稀疏度的分工是按模块组内方差把层分成低中高 3 组并给高方差组更多 K;搭配理由是总压缩量相同只做预算再分配,组合意义在于用可测量的层间差异解释何时自适应分配能超过一刀切。

举例帮助理解,明确标为例子:若某层 Kbase 为 10,s 为 0.2,则高组取 12,中组取 10,低组取 8,3 组平均仍是 10。例子数值仅用于说明算术,不代表原文某层的真实 K。

没有训练时方法做了什么计算?微调时又更新了什么?

本研究的主压缩阶段没有神经网络训练。需要明确说明未训练的部分:k-means 不使用 LibriSpeech 音频和文本,不构造交叉熵或对比损失,不做反向传播,不更新 Transformer 权重之外的可学习门控。真实计算是确定性流程之外的迭代优化:对每个拼接矩阵反复执行最近中心分配和均值更新,直到簇内平方和收敛到局部最优,然后一次性重写权重。单卡 NVIDIA A40 即可完成,因为只涉及矩阵距离计算。

无数据压缩 × 聚类后微调: 无数据压缩的分工是在不看 LibriSpeech 音频和文本、不算梯度的条件下直接用 k-means 重写权重,聚类后微调的分工是用 100 小时干净子集跑 3 轮 AdamW 恢复精度;搭配理由是前者验证初始化质量、后者验证起点优劣,组合意义在于区分方法本身的效果和有监督恢复带来的增益。

聚类后微调是独立的分析实验,只对 HuBERT-large 进行。数据是 LibriSpeech 100 小时干净子集,优化器为 AdamW,学习率为 2e-4,批量为 16,前 10% 步数线性预热后线性衰减到零,共 3 轮。基线是先微调 20 轮的 HuBERT-large-ll60k,压缩后再微调的对比起点一致。Whisper-large-v3 主结果不做任何微调,直接解码验证无数据免训练的有效性。原文未报告梯度是否冻结某些层,因此解读不推定冻结范围,只按原文说全部参与微调恢复。

不能把无训练等同于确定性求解:k-means 初值不同可能得到不同局部最优,原文未报告多次随机种子方差,这是复现时需要补记的缺项。

数据、基线与指标条件如何对齐?

数据条件是 LibriSpeech 开发集与测试集的干净子集和其他子集,共 4 个子集。HuBERT 基线从 Hugging Face 下载 facebook HuBERT-large-ll60k 并微调 20 轮,Whisper 基线下载 openai whisper-large-v3。评价指标是词错误率,越低越好,显著性用 MAPSSWE 在 0.05 水平检验。计算量用 GFLOPs 报告,HuBERT 按 1 秒音频评估编码器,Whisper 按自回归生成 100 个文本长度评估,包含解码器交叉注意力随生成步数累积的开销。

基线对齐方面,幅度剪枝与聚类使用相同的结构化单元定义、相同的 K 计算和相同的混合分组,保证可运行策略之间的对比公平。论文明确稀疏度指所有模块组上的平均稀疏度,不含未压缩的卷积和嵌入部分,因此参数量下降幅度不能直接等同于稀疏度数值。

下表整理复现必须固定的超参数与计算条件,数值均来自原文连续表述,单位保留原文写法。

条件指标基线取值本方法取值比较对象
混合系数s0.20.2均匀分配
微调数据时长100-hour100-hour未压缩基线
微调轮数epoch33微调前
优化器学习率2e-42e-4相同
批量batch size1616相同

上表说明复现时先固定混合系数与微调预算,再比较压缩算子差异;若改变学习率或轮数,则不再是原文报告的可比条件。表中微调仅针对 HuBERT 分析实验,Whisper 主结果无此开销。

HuBERT-large 上聚类何时明显超过幅度剪枝?

要回答的比较问题是:在相同均匀或混合稀疏度、相同 K 预算下,聚类相对幅度剪枝能否降低 4 个子集的词错误率,指标方向越低越好。公平条件是两者都不看数据、不训练,直接解码;微调后则都用相同 3 轮协议恢复。

条件指标幅度剪枝参数聚类相对幅度剪枝的绝对下降
50% 均匀稀疏微调前 test-cleanWER高退化中退化27.73%
50% 均匀稀疏微调前 test-otherWER高退化中退化18.61%
50% 均匀稀疏微调后 test-cleanWER基准更低0.19%
50% 均匀稀疏微调后 test-otherWER基准更低0.79%
全子集平均微调前 50% 稀疏WER基准更低23.50%

上表概括了原文报告的最大增益与微调后残留增益:微调前在 50% 均匀稀疏度上绝对下降 27.73% 对应相对 34.37%,另一子集 18.61% 对应相对 21.91%,四子集平均绝对下降 23.50%;微调后优势收窄但仍存在,分别为 0.19% 对应相对 3.36% 和 0.79% 对应相对 4.62%。代价是绝对词错误率仍高于未压缩基线,且 60% 稀疏度下两者都严重退化,混合分配也无法挽回。未胜出项是低稀疏度段:30% 以下两者差距小,10% 至 20% 时混合策略对两者都有改善但聚类优势不突出,这是适用边界。

Whisper-large-v3 上免训练压缩能否不损伤基线?

比较问题是:在 10% 总体压缩下,聚类相对幅度剪枝和相对未压缩基线的位置如何,4 个子集是否都有统计显著退化。公平条件是两者都不用数据、不训练,混合组划分方式相同。

条件指标幅度剪枝参数聚类相对幅度剪枝的绝对下降
10% 混合稀疏 test-cleanWER高退化接近基线2.86%
10% 混合稀疏 test-otherWER高退化接近基线5.02%
20% 混合稀疏 test-cleanWER灾难退化轻微上升11.66% 相对均匀
20% 混合稀疏 test-otherWER灾难退化轻微上升18.29% 相对均匀
20% 混合相对未压缩 test-clean/test-otherWER 增量大1.62%/2.66%仅聚类可接受

上表解释主要收益与具体代价:10% 混合稀疏下聚类相对幅度剪枝下降 2.86% 和 5.02%,且相对未压缩基线在 4 个子集均无统计显著上升,这是无数据免训练可用的直接证据;20% 混合稀疏下聚类相对未压缩仅上升 1.62% 和 2.66%,而幅度剪枝已灾难退化。但反例同样明确:稀疏度超过 20% 至 30% 后聚类无论是否混合都会灾难退化,不能把 10% 的结论推广到高压缩。硬件方面 Transformer 部分 GFLOPs 随头数和维度成比例下降,但含卷积的系统总 GFLOPs 下降慢,这是结构化压缩的固有代价。

混合分配与方差解释了什么?什么情况下失效?

消融要测的是混合相对均匀是否在总预算不变时带来增益,以及方差能否解释 HuBERT 与 Whisper 上幅度剪枝表现差异。HuBERT 上 10% 到 50% 范围内混合优于均匀,无论聚类还是幅度剪枝,微调后 20% 以上混合持续占优。Whisper 上 20% 混合相对均匀在测试集下降 11.66% 绝对量对应相对 76.16%,另一子集下降 18.29% 对应相对 73.34%,说明再分配在该点非常关键。

层内方差 × L2 范数: L2 范数的分工是衡量单个头或通道的幅度大小以决定剪枝去留,层内方差的分工是衡量拼接矩阵内各单元之间信息分散程度以决定层间预算;搭配理由是幅度区分个体、方差区分层,组合意义在于解释为何在 Whisper 上幅度失效而方差分配仍能减少退化。

方差视角的证据是:HuBERT 编码器自注意力和前馈的总体均值方差在 1.5 乘以 10 的负 2 次方和 1.8 乘以 10 的负 2 次方量级,范围跨 0.7 到 2.4;Whisper 5 个模块组均在 2.9 到 4.8 乘以 10 的负 4 次方量级,范围更窄。原文据此解释幅度剪枝在 Whisper 上更易误伤,因为个体幅度难以区分重要性。L2 范数对照显示 30% 均匀稀疏下剪枝与聚类都抬高了层平均范数,但聚类抬升更小且词错误率更低,原文表述为支持关系。失效边界是 60% 稀疏度的 HuBERT 和 30% 稀疏度的 Whisper,此时方差分配不足以保留关键参数,两种方法都崩溃。

哪些结论不能从现有证据中推出?

首先不能推出每组每步都成立。总体趋势是聚类在 30% 以上占优,但低稀疏度差距小,极高稀疏度两者都失效,混合增益也非单调。其次不能把词错误率改善等同于延迟改善:原文只报告 GFLOPs,未测量实际端侧延迟、内存峰值和误判率分布,总体浮点下降不等于每句解码都加速。

其次缺失证据不是技术错误,但必须指出:k-means 初始化与多次运行方差未报告,Whisper 未做微调对照,交叉注意力与自注意力共用规则是否最优未消融,方差分组固定为 3 组且 s 固定 0.2,未搜索组数敏感性。相关性不是因果:方差小与幅度剪枝失效同时出现,但原文未证明降低方差必然导致失效,只能说支持该解释。

最后资源状态必须如实写:本次收到的证据中未发现来源绑定且完成验证的开源资源,不得声称代码、模型或数据已公开。复现只能依赖论文文字与 Hugging Face 上已知的基线权重名称自行实现。

复现时先做什么才能得到可比数字?

先固定基线:下载 HuBERT-large-ll60k 并按原文微调 20 轮得到未压缩基线,下载 whisper-large-v3 不做改动;评价固定为 LibriSpeech 4 个子集的词错误率,显著性用 MAPSSWE 在 0.05 水平判断。切勿用不同的语言模型重打分,否则数字不可比。

再实现压缩算子:对每层构造 MHSA 拼接与 FFN 拼接,展平每个头或通道后做 k-means,K 按全局 sp 计算;混合实验先按功能分组、组内按方差排序分 3 组,再按公式分配高、中、低预算并保证总数不变,s 取 0.2。幅度剪枝用相同 K 和相同分组实现 L2 范数排序保留,作为可运行对照。必须保留未压缩卷积与嵌入不压缩,稀疏度只在模块组上平均。

最后补三项验证:多次 k-means 种子测方差,记录 Transformer 与系统总 GFLOPs 分开报告,60% 和 30% 极端点确认崩溃边界。若要微调,只用 100 小时干净子集跑 3 轮 AdamW,学习率 2e-4,批量 16,前 10% 预热。任何超参数改动都应另行标注,不能替代原文的可部署收益。

何时值得尝试聚类压缩?

当训练音频不可用、不能做梯度训练,但能接受一次性权重重写,且目标是通用硬件可部署的稠密窄模型时,值得尝试参数聚类。HuBERT 上 30% 至 50% 稀疏度、Whisper 上 10% 至 20% 稀疏度是原文验证过的区间,超出后需补新的验证。

复现优先级是先跑均匀 10% 与 50% 两个锚点,确认相对幅度剪枝的方向,再开混合分配看增益是否复现。若低稀疏度无差距或极高稀疏度崩溃,应视为与原文一致的边界,而非实现错误。后续还需补延迟实测、多次种子方差和组数敏感性,才能把词错误率优势转化为端侧可用的结论。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总