英文题目:PRUNING AS REGULARIZATION: SENSITIVITY-AWARE ONE-SHOT PRUNING IN ASR

会议身份:conference:eusipco:2026:conference-paper-id:0000146

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#模型剪枝 #鲁棒性 #语音 #语音识别

评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Irigoyen, Julian:机构信息未能从会议 PDF 纯文本可靠映射
  • Söhler, Arthur:机构信息未能从会议 PDF 纯文本可靠映射
  • Søeborg Kirkedal, Andreas:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

自动语音识别需将连续声学帧输入映射为离散词序列输出,Whisper-small类编码器-解码器Transformer因过参数化易在训练域声学模式上过拟合,导致噪声与口音条件下泛化受损。该方法先在LibriSpeech验证集子集上计算归一化梯度敏感度与对角Fisher敏感度,以量化各组件与各层的剪枝脆弱性与冗余度。再按编码器、解码器及层块独立执行一次性非结构化幅度剪枝,并以词错误率验证各配置的性能变化,从而筛选出冗余位置。随后将LibriSpeech上选定的稀疏掩膜不经重算直接复用于Common Voice与TED-LIUM,以检验跨语料泛化。与全局均匀剪枝不同,该方法按组件与层分配稀疏度,保护脆弱的解码器前馈网络而集中剪枝冗余的解码器自注意力和末端编码器层。在TED-LIUM测试集下,Late Enc(9-12)的WER为5.86%,低于Baseline的WER 6.43%。其适用边界受限于Whisper-small英文朗读与演讲语料的无微调一次剪枝,多模型与多语言外推尚未验证。计算量从4.55降至2.77 GFLOPs且所用硬件为NVIDIA H100,而非结构化掩膜未被稠密核加速故推理开销上实时因子不变。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么难声学条件才是主战场?

这篇论文只研究 1 个任务:用编码器解码器结构的自动语音识别模型,把连续语音转写成文字。输入是原始音频经前端处理得到的梅尔频谱帧序列,输出是按自回归方式逐个生成的词或子词序列。研究对象是公开的 Whisper-small 检查点,244M 参数量级,编码器与解码器各 12 层,解码用论文所述 Whisper 标准束搜索流水线。初学者容易把注意力放在干净语音上,但论文把主报告指标定在 LibriSpeech test-other,因为它是声学条件更复杂、口音与噪声变化更大的集合,更能暴露过参数化带来的泛化问题。

评价用词错误率和字符错误率,词错误率越低越好,字符错误率越低越好。论文要回答的不是能不能把模型变小,而是定位哪些参数删掉反而更准。输入是已训练好的权重与校准用验证集,目标是找到可剪且有益的部位,输出是每个部位独立剪枝后的词错误率变化,以及跨语料复用的剪枝掩码。本文没有收到代码与数据可用性验证,因此所有复现动作只依据正文描述的模型、数据划分与剪枝规则,不声称代码已公开。

同任务同阶段的已有路线与本文的切分点在哪里?

语音识别剪枝的常见路线是压缩导向:结构化剪枝追求推理效率,多语言自适应剪枝追求跨语言取舍,稀疏大语音基础模型追求 1 次非结构化稀疏。这些工作与本文同输入、同目标,都是在 Transformer 语音模型上做剪枝,但运行阶段的优化目标不同,它们以保精度降成本为成功标准。本文的切分点是把 1 次幅度剪枝当作正则化手段,在不做任何微调的情况下报告词错误率改善。

另一条相关路线是剪枝即正则化的讨论,例如继续训练后先掉后升的现象,或把收益归因于更长训练加更小模型。本文把该讨论推到训练后 1 次剪枝、无微调的设定,用更严格的条件验证收益是否仍然存在。第三条路线是 1 次性与灵敏度剪枝,包括彩票假设、SNIP 按连接灵敏度选掩码、GraSP 与 SynFlow 保梯度流,以及 WoodFisher 与 Group Fisher 用 2 阶近似指导剪枝。

本文继承了 1 阶梯度与 2 阶费舍尔的思想,但不是在初始化时找可训练子网络,也不是为压缩而直接剪全局,而是先做模块与层级的诊断,再做组件级实证剪枝验证。理解这个切分很重要:同样是幅度剪枝,全局均匀分配会崩,灵敏度感知的非均匀分配才能保精度。

要诊断的问题是什么,什么算改善,什么算崩溃?

论文要诊断的是过参数化在 Whisper-small 内部的分布不均。编码器占约 36.47% 参数,解码器占约 63.53% 参数,但参数多不等于更耐剪。作者把问题形式化为:给定目标稀疏度,保留绝对值最大的部分权重并将其余置零,其余参数不变,不更新任何参数,不做微调,然后看词错误率相对未剪枝基线的变化。负的变化表示改善,正的变化表示退化。崩溃指词错误率陡增到不可用的水平,例如全局剪枝在 30% 到 40% 之间失效,解码器单独剪枝在 40% 稀疏度达到 30.11% 词错误率。

改善指在 50% 这种激进稀疏度下仍然下降,例如解码器自注意力与编码器后 4 层。论文还设置了一个更难的检验:用 LibriSpeech 选出的掩码原样搬到 Common Voice 与 TED-LIUM,不重新计算掩码,不用目标集标签做选择,看改善是否跨声学环境成立。这个设计把数据集特异的偶然增益与架构性冗余区分开。

方法全景:先诊断灵敏度,再独立试剪,最后定分配

完整流程沿一个样本走一遍最清楚。取一条语音与其转写,先用当前 Whisper-small 权重做前向得到交叉熵损失,再反向得到每个模块的梯度。作者在 LibriSpeech 验证集的子集上重复这个过程,只做分析不更新权重,得到 1 阶归一化梯度灵敏度与费舍尔对角估计的 2 阶灵敏度。数值高的模块被判为剪枝脆弱,数值低的被判为可能有冗余。

接着进入实证试剪:对每个架构组件内部按权重绝对值排序,把最小的对应比例置零,其他参数不动,分别评估编码器整体、解码器整体、早期 1 到 4 层、中期 5 到 8 层、晚期 9 到 12 层,以及自注意力、前馈、交叉注意力、层归一化、偏置、卷积前端、位置嵌入、词嵌入与输出投影。每个组件独立试验,稀疏度从 0% 起按 10% 步长扫描到失效,论文因篇幅只报告能说明正则化增益或失效模式的关键点。

最后把诊断与试剪对齐:脆弱部位给低稀疏度或不剪,弹性部位给高稀疏度,拼出总稀疏度约 40.8% 的定制压缩方案。

幅度剪枝 × 隐式正则化: 幅度剪枝的分工是按权重绝对值排序并把最小的一部分置零,直接缩小可用的表示容量;隐式正则化的分工是不在损失里加显式惩罚项,而是通过限制模型结构减少对噪声或虚假相关的记忆。两者搭配的理由是低幅值参数往往对应训练语料特有的细碎拟合,去掉它们等于确定性地关掉一条过拟合通道;组合后的新增作用是无需微调即可在难声学条件下词错误率下降,把压缩操作变成了架构诊断工具。

下面这张图是诊断阶段的核心证据,它同时给出了 1 阶与 2 阶在干净与困难语音上的模块级对比,读图时要先确认编码器与解码器的相对高低,再看声学难度是否改变排序。

看图路径: 1. 先对比左图一阶与右图二阶两个面板,确认编码器与解码器的柱高顺序是否一致;2. 再对比蓝色 test-clean 与橙色 test-other 在同一模块内的高低,判断难声学条件是否放大敏感度;3. 最后读出四个模块柱顶标注的数值与误差线长度,判断解码器估计的不确定性是否更大

原论文 Figure 1:reports module-level sensitivity for encoder and decoder using both first-order (gradient) and…

论文图 1。原论文 Figure 1:“reports module-level sensitivity for encoder and decoder using both first-order (gradient) and second-order (Fisher) criteria.”。

从像素可见,左图 1 阶灵敏度中编码器两根柱分别标注 0.088 与 0.101,解码器两根柱分别标注 0.176 与 0.203,解码器明显更高;右图 2 阶灵敏度中编码器为 0.060 与 0.080,解码器为 0.200 与 0.230,差距更大且解码器误差线更长。这支持编码器解码器非对称的判断:在两种准则、两种声学条件下,解码器都更敏感。误差线还提示 2 阶估计在解码器上的不确定性更大,因此不能只看点估计就定分配,必须用后文独立试剪做实证校准。

三个诊断量各自算什么,阈值与掩码如何复现?

第一个量是 1 阶梯度灵敏度。对模块 m,取 N 个校准样本的交叉熵损失对该模块参数的梯度二范数,除以该模块参数二范数做尺度归一,再对 N 平均。白话说,就是单位参数规模下损失对扰动的平均斜率。第二个量是 2 阶费舍尔灵敏度。对负对数似然损失,用每个样本对单个参数梯度的平方在 N 上平均来近似费舍尔信息矩阵对角,再在模块内对所有参数求平均。

白话说,就是平均曲率,曲率大意味着参数被卡紧,剪枝容忍度低。第三个量是实证剪枝灵敏度,直接把某组件按目标稀疏度剪完看词错误率是升还是降,用来发现隐式正则化机会。复现掩码的规则是完全确定性的:给定目标稀疏度和组件 c,计算该组件内所有权重绝对值的分位数阈值,把绝对值小于等于阈值的权重置零,其余不动。论文强调这是非结构化 1 次幅度剪枝,每个组件独立排序,不跨组件比较绝对值。校准只用 LibriSpeech 验证子集,不更新参数。

初学者常误以为阈值是全局统一的,实际复现必须按组件分别计算,否则会把脆弱组件误伤。

1 阶灵敏度 × 2 阶灵敏度: 1 阶灵敏度的分工是用归一化梯度范数刻画损失对模块参数微小扰动的即时反应,数值越大说明一剪就疼;2 阶灵敏度的分工是用费舍尔信息矩阵对角估计局部曲率,数值越大说明参数被损失 landscape 卡得越紧。搭配的原因是 1 阶只看斜率容易漏掉平坦但狭窄的谷底,2 阶补上曲率约束;组合后可以同时从斜率和平坦程度判断编码器与解码器谁更脆弱,为后文把稀疏度集中到弹性部位提供依据。

编码器与解码器的功能差异是理解非对称的关键,编码器并行看全句声学帧,解码器串行生成文字,前者冗余可分摊,后者误差会沿序列放大。

编码器 × 解码器: 编码器的分工是并行处理全部梅尔频谱帧,用非因果自注意力和残差通路产生上下文嵌入,信息分布在多头多层多时间步;解码器的分工是自回归逐词生成转写,每一步的状态都会被后续步骤复用。1 阶与 2 阶诊断都显示解码器更敏感,搭配比较的意义在于揭示非对称鲁棒性:编码器有重叠冗余可吸收扰动,解码器一旦在早期被剪就会沿 token 序列级联放大误差。

本研究训练了什么,没有训练什么,真实计算是什么?

本研究没有训练任何模型,也没有微调 Whisper-small,没有更新权重,没有优化器步骤,没有学习率与训练轮数。必须明确指出这一点,否则会误把词错误率改善当成继续训练的功劳。真实计算只有两类。第一类是诊断计算:在冻结权重下做前向与反向,累积梯度范数与梯度平方以得到 1 阶与 2 阶灵敏度,这一步不改变模型。第二类是掩码构造与评估计算:按组件内幅度排序生成二值掩码,置零后用标准束搜索解码测试集并统计词错误率与字符错误率。

论文未报告校准子集的具体样本数与随机种子,未报告束宽与长度惩罚的具体取值,只说使用 Whisper 标准束搜索流水线,这些是复现时的缺项,需要按公开 Whisper 默认解码补齐并记录。非结构化掩码在常规稠密推理核上不带来实时因子变化,论文明确说明实时因子不变,因此不能把参数量下降直接理解为已测得的延迟下降。

数据、划分、基线与指标方向如何对齐才可比?

主评估用 LibriSpeech test-clean 与 test-other,前者干净,后者困难,主报告是 test-other。跨语料验证用从 Common Voice 第 15 版英文随机抽的 2000 条,以及 TED-LIUM 第 3 版,分别对应带口音的众包录音与带混响的会议演讲,检验声学多样性下的泛化。关键公平条件是掩码复用:用 LibriSpeech 灵敏度分析选出的配置原样评估,不在新语料上重算掩码,不用目标集标签选型。基线是未剪枝 Whisper-small,在 test-other 上词错误率为 11.64%,所有变化量都相对该基线,负值表示改善。稀疏度定义为置零比例,10% 步长扫描,论文只报告关键点。

比较对象包括全局幅度剪枝、仅编码器剪枝、仅解码器剪枝、按层块剪枝与按组件剪枝。指标方向是词错误率与字符错误率越低越好,稀疏度越高压缩越激进,但必须同时看精度是否崩溃。硬件预算按正文为丹麦国家高性能计算设施的 H100 节点,但这只说明实验环境,不构成可复现的超参数。百分点变化与相对百分比是不同量,论文同时给出绝对下降与相对改善,阅读时不要混淆。

哪些部位剪掉反而更准,数字在什么条件下成立?

先看最强的两个正则化证据。解码器自注意力在 50% 稀疏度下改善最大,编码器后 4 层在 50% 稀疏度下也有明显改善,两者都不需要微调。下表把这两个配置放在同一基线与同一评估集下对比,指标方向都是越低越好,变化为负表示改善。

剪枝部位稀疏度评估集相对词错误率改善
解码器自注意力50%LibriSpeech test-other20.44% relative
编码器后 4 层 9-1250%LibriSpeech test-other14.8% relative

表后解释需要同时给出收益与代价。收益是激进稀疏度下仍然改善,且解码器自注意力在 60% 时仍保持改善,说明不是单点运气。

代价是同为 50% 稀疏度,编码器自注意力会退化,解码器前馈在 40% 时灾难性失效,早期解码器层在 50% 时退化极大,因此改善高度依赖剪对地方。未胜出的对照是编码器整体在 30% 时仅轻微改善,说明整体剪不如精准剪。基线锚点是未剪枝 Whisper-small 在 test-other 上 11.64%,所有改善都相对该值,跨表比较时必须回到同一基线,不能把不同组件的绝对词错误率直接排序而忽略稀疏度不同。

词错误率 × 字符错误率: 词错误率的分工是按词统计替换删除插入,反映可懂度与任务成败;字符错误率的分工是按字符统计,更细粒度地反映声学对齐与拼写稳定性。两者搭配的原因是剪枝可能改变分词边界,单看词级会漏掉字符级改善或恶化;组合后论文才能同时报告灵敏度感知压缩在 test-other 上词错误率微升 0.20% 而字符错误率反而改善 1.06%,说明压缩没有系统性破坏底层声学表示。

灵敏度感知压缩如何在 40% 量级保精度而全局剪枝崩溃?

压缩问题与正则化问题用同一套诊断,但目标不同:前者要在总稀疏度给定时保精度,后者要在单部位上找改善。下表对比总稀疏度相近时的可部署策略,公平条件是都是 1 次剪枝、无微调、同为 test-other 评估,指标方向是词错误率越低越好。

策略总稀疏度test-other 词错误率表现参数规模计算量
未剪枝 Whisper-small 基线011.64%241M4.55
全局幅度剪枝40%61.32% WER--

表后解释要读出具体代价。

定制方案把参数从 241M 降到 143M,计算从 4.55 降到 2.77 GFLOPs,test-other 词错误率仅恶化 0.20%,字符错误率反而改善 1.06%,而全局均匀剪枝在 40% 稀疏度直接崩到 61.32% 词错误率。论文给出的可复现分配是编码器卷积 20%、自注意力 40%、前馈 55%,解码器自注意力 50%、交叉注意力 45%、前馈按早中晚分别 25%、45%、30%,词嵌入 25%、输出投影 25%。未胜出项是全局剪枝,它证明了均匀分配不可行。限制是这里的参数与 GFLOPs 是理论稀疏规模,非结构化掩码在标准稠密核上不改变实时因子,论文已明确实时因子不变,因此不能把该表读成已测延迟收益。

层块与组件的消融如何证明哪里脆弱哪里冗余?

层块消融把 12 层按 1 到 4、5 到 8、9 到 12 切分。编码器重要性随深度下降,早期层负责底层声学特征提取相对脆弱,中期接近持平,晚期反而改善,支持深层编码器是增量精修而非不可或缺。解码器呈 U 形脆弱:早期层要承接编码器上下文并塑造后续每一步的状态,晚期层要输出最终词分布,都很关键,中期相对耐剪。组件消融进一步分开自注意力与前馈:编码器前馈在 40% 可轻微改善,解码器前馈超过 30% 就崩;编码器自注意力在 50% 以上失效,解码器自注意力在 50% 达到最大增益。

论文的假设是剪掉冗余或冲突的注意力头会让注意力更聚焦,但这属于有限解释而非直接测量,因为没有报告头级注意力图谱的前后对比。辅助组件中层归一化小稀疏度与输出投影中等稀疏度也有增益,偏置在 10% 就大幅退化,卷积前端在 50% 可保持不退,位置与词嵌入相对敏感。

自注意力 × 前馈网络: 自注意力的分工是决定不同位置之间信息如何汇合,前馈网络的分工是对每个位置的表示做逐点非线性变换与容量扩展。论文发现两者在编码器与解码器中角色互换:编码器前馈相对可剪而自注意力较脆,解码器则相反,自注意力可大幅剪而前馈极脆。搭配分析的理由是不能只按层深分配稀疏度,必须按组件类型区分;组合意义是得到可部署的非均匀分配,即把高稀疏度压到解码器自注意力和编码器深层前馈,把解码器前馈保护起来。

跨数据集验证把 LibriSpeech 选出的掩码直接搬到另外两个声学环境,比较问题是改善是否只是拟合了 LibriSpeech。结果是解码器自注意力 50% 在两个新集上仍是最大绝对下降,晚期编码器与输出投影也有可靠小增益,支持冗余是架构性的而非数据集特异的。但要注意这仍是英语语料内的验证,多语言场景是否保持尚未验证。

哪些结论尚未验证,哪些数字不能推广?

第一,模型范围局限在 Whisper-small,论文提到对 Parakeet、wav2vec 2.0 与 Conformer 的初步试验显示各模型组件敏感性不同,但全面多模型验证尚未完成,因此编码器深层可剪、解码器前馈脆弱的结论不能直接搬到其他架构。第二,语言范围局限在英语语料,多语言表示可能改变各模块的剪枝弹性,论文建议在小规模目标语言校准集上重算灵敏度,但尚未执行。

第三,诊断粒度停在模块与组件级,没有头级、通道级或 token 级的因果证据,解码器自注意力改善被解释为去掉冗余冲突头,这只是与现象一致的假设,待验证。第四,成本证据缺失:未测量误判率分布、实际延迟、内存带宽与能耗,稀疏尺寸从 922.3 MB 降到 545.9 MB 是存储规模,不是已测推理加速。第五,校准与解码细节缺项:校准子集大小、随机种子、束搜索超参数未完整报告,复现时需固定并公开这些选择。

最后,总体趋势不等于每条语音都改善,论文只报告集合平均词错误率,没有按说话人、噪声类型或句子长度分组,不能把平均增益推广到每组必胜。

复现先做什么,后做什么,如何判定成功?

第一步复现基线:下载公开 Whisper-small,用标准束搜索跑 LibriSpeech test-clean 与 test-other,确认 test-other 词错误率接近 11.64%,并记录解码超参数与随机性处理。第二步复现诊断:在 LibriSpeech 验证子集上冻结权重做前向反向,计算归一化梯度灵敏度与费舍尔对角平均,确认解码器高于编码器,且困难集高于干净集。第三步复现单部位正则化:对解码器自注意力内部独立排序并置零 50%,其余不动,评估 test-other 是否出现约 2.38% 绝对下降;再对编码器 9 到 12 层独立置零 50%,看是否出现约 1.72% 绝对下降。

若方向一致但数值有小偏移,优先检查分位数阈值是否按组件内计算、是否误伤了偏置与层归一化。第四步复现跨语料:把 LibriSpeech 得到的掩码原样用于 Common Voice 抽样 2000 条与 TED-LIUM,不重算掩码,看解码器自注意力 50% 是否仍是最大下降。第五步复现压缩:按正文给出的组件稀疏度拼出总稀疏度 40.8% 方案,对比全局 40% 均匀剪枝是否崩到 61.32% 量级,而定制方案仅恶化约 0.20%。判定成功以方向与量级同时成立为准,不要求小数点后完全一致。

需要补的验证是多随机种子下的方差、按噪声与口音分组的效果,以及头级剪枝对照,以确认正则化假设。

何时值得尝试这种剪枝,首选动作与止损线是什么?

当你的编码器解码器语音模型在困难声学集上停滞,且怀疑深层或注意力存在冗余时,值得先做 1 次无微调的灵敏度诊断,而不是直接上全局稀疏。首选动作是保护解码器前馈、早期解码器层、偏置与交叉注意力,把试验预算放在解码器自注意力与编码器晚期层块,用 50% 量级的独立试剪看是否出现词错误率下降。止损线很明确:如果 1 阶与 2 阶同时指向解码器高敏感,且早期解码器试剪已大幅退化,就不要再加解码器整体稀疏度。

如果全局 30% 到 40% 已出现陡增,应立刻转回组件级非均匀分配。下表把论文中可直接复用的跨条件对照收拢为第三张表,帮你在换声学环境时快速判断改善是否跟随掩码走。

评估环境剪枝配置来源复用方式观察到的趋势脆弱对照
Common Voice 与 TED-LIUMLibriSpeech 灵敏度分析相同掩码不重算解码器自注意力 50% 下降最大早期解码器 50% 退化 67.50%
LibriSpeech test-other仅编码器剪枝40% 稀疏度保持接近基线 12.49%解码器单独剪枝 40% 达 30.11% WER
LibriSpeech test-other输出投影与晚期编码器小至中等稀疏度较小但可靠增益解码器前馈 40% 退化 40.99%

表后总结是方法论层面的:剪哪里与剪多少同等重要。论文把 1 次幅度剪枝从压缩工具提升为架构分析工具,用可复现的诊断加独立试剪定位冗余,再用非均匀分配实现无微调的正则化与压缩。

对研究生而言,可核对的收获是阈值按组件内分位数计算、变化量相对 11.64% 基线、跨语料必须复用掩码;待补的功课是多模型多语言验证、头级机制证据与真实延迟测量。只有补齐这些,才能把平均词错误率改善变成可部署的效率收益。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 2 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 2 页

区域 2 · 查看论文原页

原文数学表达区域 3,PDF 第 2 页

区域 3 · 查看论文原页

另有 4 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eusipco-2026 论文汇总