英文题目:Pruning as Regularization: Sensitivity-Aware One-Shot Pruning in ASR
会议身份:
conference:interspeech:2026:conference-paper-id:irigoyen26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#模型剪枝 #正则化 #鲁棒性 #语音 #语音识别
评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Julian Irigoyen:机构信息未能从会议 PDF 纯文本可靠映射
- Arthur Söhler:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Søeborg Kirkedal:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别需将多样声学输入转写为文本,过参数化编码器解码器Transformer在口音与混响等域外条件下易泛化不足。本文以公开Whisper-small检查点为对象,先在LibriSpeech验证集上用负对数似然损失计算一阶梯度敏感度与费希尔信息矩阵对角二阶曲率以区分剪枝脆弱与鲁棒组件,再对各组件独立执行一次性非结构化幅度剪枝并以词错率验证增益,最后将固定掩码不重算直接迁移跨语料检验泛化,前步诊断输出决定后步稀疏分配。与全局均匀剪枝不同,该方法按组件敏感度分配稀疏度,只剪鲁棒区而保护解码器前馈网络等脆弱区,使剪枝起隐式正则化作用而非单纯压缩。在LibriSpeech test-other评测设置下,解码器自注意力50%剪枝的WER为9.26%,低于未剪枝基线的WER 11.64%。编码器后段与整体敏感度引导压缩亦保持相近正则化与保精度趋势,并在Common Voice与TED-LIUM语料上保持提升。结论适用边界受限于英语Whisper-small受控设置,Parakeet、wav2vec 2.0、Conformer的完整验证尚未验证,编码器主导的基于连接时序分类的系统亦不适用。部署上非结构化掩码未被稠密核加速,推理开销上实时率不变,而压缩后计算量从4.55降至2.77 GFLOPs且无需微调训练。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么难做?
这篇论文研究的输入是连续语音波形或其声谱特征,输出是对应的文字转写序列,任务是端到端自动语音识别。研究对象是 Whisper-small,一个 244M 参数规模的编码器加解码器 Transformer,有 12 层编码器和 12 层解码器,解码时采用论文所述的标准束搜索流程。对刚入门的读者,白话解释是编码器负责听,把整段声音变成一组向量表示,解码器负责写,一个词一个词地根据声学表示和已写出的词生成下一个词。评价用词错误率,英文为 Word Error Rate,简称 WER,数值越低越好,还有字错误率,英文为 Character Error Rate,简称 CER。
难点在于声学条件多变,朗读、口音、混响和自发讲话都会让模型在训练集上记住的细微模式在测试时失效。论文把过参数化带来的冗余看作泛化受损的一个来源,提出用有选择的删除参数来纠正过拟合,而不是只把剪枝当作压缩手段。本次解读的输入是论文原文证据与两张官方原图像素,目标是把方法动作、实验条件和可复述细节讲清楚,输出是 1 篇按学习依赖展开的技术解读。
必须保留的信息包括模型规模、剪枝粒度、稀疏度定义、基线数值、数据集划分和免微调条件,所有数字都以原文为准。
同任务同目标的前人走了哪几条路?
第一条路是为压缩而剪枝。早期工作从减少模型尺寸和计算量出发,Transformer 注意力头冗余分析发现部分头可以去掉,相关综述指出幅度剪枝在压缩与精度权衡上不输复杂方法。论文与这条路的输入和操作相似,都是删权重,但目标不同,这里首先关心删除后在难声学条件下的词错误率是否下降。第二条路是把剪枝看作正则化。已有研究把剪枝后即时精度下降与继续训练后的更大提升联系起来,或把提升归因于更长训练加更小模型。
论文把该视角推进到训练后 1 次性剪枝且不做任何微调,直接报告词错误率改善。第 3 条路是 1 次性与敏感度剪枝。彩票假设启发了在初始化时用梯度或信息流找掩码的 1 次性方法,单次剪枝代表 SNIP,英文为 Single-shot Network Pruning,梯度流保持代表 GraSP,免数据流保持代表 SynFlow,2 阶方法用 WoodFisher 等近似海森矩阵做决策。论文继承了用 1 阶和 2 阶信号做诊断的思路,但把它们放在训练后用于发现正则化机会,而不是在初始化时找可训练子网络。第四条路是语音识别剪枝。
已有工作做结构化剪枝提效、多语言自适应剪枝和稀疏语音基础模型,目标仍是效率。论文的差异是明确报告免微调精度提升,并给出组件级分配方案。按同输入同目标同监督对照,这些工作都处理语音到文字映射,但只有本文把免微调词错误率下降作为主证据。
论文要回答的具体问题是什么?
论文要回答的问题是对于编码器加解码器语音 Transformer,1 次性非结构化幅度剪枝在不微调时能否起正则化作用,如果能,冗余在哪个组件、哪几层。非结构化幅度剪枝的白话解释是只看每个权重绝对值大小,把最小的一部分置零,不要求整行整列整头一起删。稀疏度用希腊字母 ρ 表示,取值在 0 到 1 之间,保留比例为 1 减 ρ。举例说明时明确标为例子,例如某组件有 1000 个权重、目标稀疏度为 50%,就把绝对值最小的 500 个置零,其余不动,这只是帮助理解的例子,不是论文的实验数值。
论文把经验风险加显式惩罚的经典正则化与直接删参数的隐式正则化区分开,前者如权重衰减对参数范数加惩罚,后者如本文通过容量约束去掉低幅值参数。关键约束是全程不做微调,敏感度诊断只用验证集算梯度和 Fisher 信息,不更新参数,剪枝掩码在 LibriSpeech 上确定后直接搬到其他数据集验证,不重新计算。这样才能把跨语料增益归因于架构冗余,而不是针对目标数据的调参。
方法全景:一个样本走完全流程
沿一个样本走一遍,输入是一段朗读音频与对应参考文本,模型先用卷积前端做局部特征提取,再经编码器多层自注意力和前馈网络得到声学表示,解码器用自注意力维护已生成词的上下文,用交叉注意力从编码器表示中取信息,用前馈网络加工后经输出投影预测下一个词,损失是负对数似然,也就是交叉熵损失。
敏感度分析阶段不改权重,只在验证集子集上做前向加反向,得到每个模块的 1 阶梯度敏感度和 2 阶 Fisher 敏感度,再做组件级 1 次性剪枝验证,看剪完后词错误率是变好还是变坏。实证剪枝时对每个目标组件独立操作,按该组件内权重绝对值的百分位数定阈值,把低于阈值的置零,其他参数保持不变。编码器和解码器分开评估,还按早期 1 到 4 层、中期 5 到 8 层、晚期 9 到 12 层切块评估。最终把鲁棒组件的高稀疏度组合成整体压缩方案,脆弱组件保持低稀疏或不剪。
幅度剪枝 × 隐式正则化: 幅度剪枝的分工是按权重绝对值大小保留大权重、置零小权重,形成确定性容量约束;隐式正则化的分工是描述这种删参数行为对泛化的改善作用,不通过显式惩罚项实现。二者搭配的理由是过参数网络中低幅值参数多为冗余或冲突模式,直接删除比持续惩罚更彻底;组合意义在于把压缩操作同时用作正则化手段,在免微调条件下也能提升跨声学条件的词错误率。
诊断与实证的关系是诊断先给出哪里可能安全,实证剪枝再用词错误率增量确认,增量为负表示改善。论文强调该流程不依赖 Whisper 特有结构,原则上可搬到其他 Transformer 语音架构,但每个架构的敏感度分布必须单独验证,不能直接套用本文的分配比例。
两个诊断量具体算什么,怎么用?
第一个量是 1 阶梯度敏感度。白话解释是看损失对某个模块参数有多敏感,做法是在验证集 N 个样本上算每个样本的交叉熵损失对该模块参数的梯度,取范数后平均,再除以该模块参数范数做归一化。归一化的作用是让大小不同的模块可比,避免参数多的模块天然显得敏感。数值越大表示小扰动越易引起损失变化,剪枝更脆弱。第二个量是 2 阶 Fisher 敏感度。
白话解释是看损失曲面的弯曲程度,做法是利用负对数似然下 Fisher 信息对角可用梯度平方期望近似的性质,对每个参数把多样本的梯度平方平均得到对角估计,再在模块内平均。数值越大表示局部曲率大、参数被约束得紧,容忍删除的能力更低。第 3 个动作是经验剪枝敏感度,也就是真剪 1 次看词错误率变化。3 个信号互补,梯度看斜率,Fisher 看曲率,实剪看最终指标。
论文在 LibriSpeech 开发集的干净与困难子集上都算了这两个诊断,发现解码器在两个诊断下都明显高于编码器,提示编码器加解码器不对称。诊断计算约 11 分钟,论文报告是在 H100 计算节点上完成,不涉及训练。
1 阶梯度敏感度 × 2 阶 Fisher 敏感度: 1 阶梯度敏感度的分工是衡量损失对模块参数微小扰动的即时斜率反应,数值越大说明剪枝更易引起损失跳变;2 阶 Fisher 敏感度的分工是近似损失曲率,用梯度平方均值估计对角 Fisher 信息,数值越大说明参数被损失 landscape 卡得越紧。二者搭配的原因是斜率只看 1 阶变化、曲率补充平坦或尖锐的局部形状;组合意义是共同判定剪枝脆弱与剪枝鲁棒组件,避免只看梯度而误剪高曲率模块。
编码器 × 解码器: 编码器的分工是并行处理整段声学序列,通过非因果自注意力和残差通路把信息分散到多头多层多时间步;解码器的分工是自回归逐词生成转写结果,每一步的状态都会被后续步骤复用。二者搭配的理由是语音识别需要先形成稳定的声学表示再做语言生成;组合意义在于解释剪枝不对称性,编码器上层可剪而解码器早期块扰动会被逐步放大。
本研究训练了什么,没有训练什么?
本研究没有训练任何模型,没有更新 Whisper-small 的权重,没有做微调,也没有学习剪枝掩码。使用的检查点是公开发布的 Whisper-small,评估时直接调用其标准束搜索解码流程。真实发生的计算只有 3 类,第一类是诊断计算,在 LibriSpeech 验证数据子集上做前向与反向得到梯度与 Fisher 估计,只用于分析。第二类是 1 次性掩码构造,对选定组件按绝对值百分位数算阈值并置零,全程 1 次完成,不迭代。第 3 类是解码评估,在各稀疏度下跑语音识别得到词错误率与字错误率。
原文未报告优化器、学习率、训练轮数等训练超参数,因为不存在训练阶段,这不是缺项,而是方法设计的明确边界。也不能把参数冻结理解为系统输出确定,束搜索仍有搜索不确定性,论文比较的是同一流程下的配对增量。由于非结构化稀疏掩码未被标准稠密推理核利用,论文明确报告实时因子没有变化,不能把参数量下降直接理解为延迟下降。
数据、基线、指标与公平条件是什么?
主评估用 LibriSpeech 的 test-clean 与 test-other,前者是干净朗读,后者声学条件更难,论文把 test-other 作为主要报告指标。跨语料验证用 Common Voice 第 15 版英文随机抽取的 2000 条众包录音,覆盖多口音多条件,以及 TED-LIUM 第三版的会议演讲,带自然混响与自发语音。基线是作者自己流程下的未剪枝 Whisper-small,在 test-other 上词错误率为 11.64%,论文明确说明该基线反映其归一化与打分流程,不追求复现原始论文报告的数值,结论依赖配对增量。指标方向是词错误率越低越好,增量为负表示改善。
相对改善用绝对下降除以基线计算,例如 2.38 除以 11.64 约 20.4%,百分点与相对百分比含义不同,不能混用。剪枝配置在 LibriSpeech 上确定后,以相同掩码、不重新计算的方式搬到另外 2 个数据集,且不用目标数据集标签做决策,这是跨语料公平条件的关键。稀疏度以 10% 为步长从 0% 扫到失效,论文因篇幅只报告能说明正则化增益或失效模式的关键点。每个组件的各稀疏度评估约 15 分钟,同样在 H100 节点上完成。
资源状态方面,本次未发现来源绑定且完成验证的代码模型数据资源,不得声称代码模型或数据已公开。
主结果:剪哪里能变好,统一剪会怎样?
先看最强的正则化证据。在 LibriSpeech test-other 上,解码器自注意力在 50% 稀疏度下词错误率下降 2.38% 绝对量,编码器最后 4 层即 9 到 12 层在 50% 稀疏度下下降 1.72% 绝对量。把这两个数字放在一起比较的问题是,同为 50% 稀疏度,不同位置的剪枝收益是否都成立,公平条件是同一基线同一解码流程且都不微调,指标方向是增量越负越好。下表把这两个可核对的增益与整体压缩的保持精度放在同一宽度下呈现,便于对照位置特异性与整体分配的差异。
表前说明已满足至少 15 个汉字的比较问题与公平条件要求,表后将解释收益与代价。
| 配置 | 稀疏度 | 数据集 | 词错误率变化 | 论文判断 |
|---|---|---|---|---|
| 解码器自注意力 | 50% | LibriSpeech test-other | 2.38% 绝对改善 | 最大正则化增益 |
| 编码器晚期 9 到 12 层 | 50% | LibriSpeech test-other | 1.72% 改善 | 晚期编码冗余 |
| 敏感度感知压缩整体 | 40.8% 稀疏度 | LibriSpeech test-other | 接近基线 | 全局剪枝崩溃处保持精度 |
表后解释是解码器自注意力的大幅改善支持了注意力冗余假设,论文解释为剪掉冗余或冲突头后注意力更聚焦,但这属于有限解释,用支持表达更稳妥。
编码器晚期改善支持上层增量精修冗余的判断。代价是这种增益高度依赖位置,换到脆弱组件同样稀疏度会灾难性变差,不能推广为剪哪里都好。
全局幅度剪枝 × 敏感度感知压缩: 全局幅度剪枝的分工是对全模型权重统一按绝对值排序取阈值,操作简单但不区分组件脆弱性;敏感度感知压缩的分工是先用梯度与 Fisher 诊断加实证剪枝验证定位鲁棒区,再把稀疏度集中分配到鲁棒组件、避开脆弱组件。二者搭配比较的理由是只有同稀疏度下对比才能说明分配策略的价值;组合意义是在约 40% 整体稀疏度下前者崩溃、后者保持接近基线精度,说明知道在哪里剪与剪多少同样重要。
为理解诊断与实证的一致性,先看模块级敏感度图的导读,该图左右两板分别是 1 阶与 2 阶诊断,横轴是编码器与解码器,纵轴是归一化重要度,颜色区分干净与困难验证子集。
看图路径: 1. 先对比左图一阶敏感度中编码器与解码器的柱高,再看 test-clean 与 test-other 两色是否同向;2. 再对比右图二阶敏感度中解码器柱的数值与误差线长度,确认曲率诊断是否一致指向解码器更脆弱;3. 沿纵轴归一化重要度读出编码器约 0.06 到 0.10 量级、解码器约 0.17 到 0.23 量级的大致差距;4. 注意该图只是诊断信号,不能直接读出剪枝后词错误率升降,需与后续实证剪枝曲线对照
论文图 1。原论文 Figure 1:“First-order (gradient) and second-order (Fisher) sen- sitivity for encoder/decoder on LibriSpeech dev-clean and dev- other validation subsets.”。
该图显示解码器柱明显高于编码器柱,1 阶约 0.17 到 0.20 对 0.08 到 0.10,2 阶约 0.20 到 0.23 对 0.06 到 0.08,且困难子集略高于干净子集,误差线在 2 阶更长。这支持解码器整体更脆弱的判断,但注意这只是平均到整个编码器或解码器的诊断,后续组件细分会发现解码器自注意力反而是鲁棒的,说明粗粒度诊断不能代替细粒度实剪。
跨语料与整体压缩:增益能搬走吗?
跨语料验证的问题是 LibriSpeech 上找到的掩码能否不加改动地在口音与混响条件下仍有效,公平条件是相同掩码、不重新计算、不用目标标签、不微调。下表把整体压缩的资源变化与精度保持放在同一宽度下呈现,列数达到五列,便于同时核对参数、算力与指标。表前比较问题是同为约 40% 稀疏度,敏感度感知分配与全局均匀分配的结局是否不同,指标方向是词错误率越低越好、字错误率越低越好。
| 模型 | 参数量 | 计算量 | 稀疏度 | 精度变化 |
|---|---|---|---|---|
| Whisper-small | 241M | 4.55 GFLOPs | 0 | 基线 11.64% 词错误率 |
| 敏感度感知剪枝 | 143M | 2.77 GFLOPs | 40.8% 稀疏度 | 词错误率仅恶化 0.20%,字错误率改善 1.06% |
| 全局幅度剪枝 | 未单独列出 | 未单独列出 | 40% 稀疏度 | 崩溃至 61.32% 词错误率 |
表后解释是主要收益是在参数从 241M 降到 143M、算力从 4.55 降到 2.77 GFLOPs 时仍接近基线,稀疏尺寸从 922.3 MB 降到 545.9 MB,而全局剪枝在相近稀疏度崩溃。具体分配是编码器卷积 20%、自注意力 40%、前馈 55%,解码器自注意力 50%、交叉注意力 45%、前馈按早中晚分别 25%、45%、30%,词嵌入 25%、输出投影 25%。
代价是这仍是权重数量与理论算力的下降,由于稠密核未利用稀疏,实际延迟没有改善。跨数据集方面,解码器自注意力 50% 在 TED 演讲与众包英文上都带来最大下降,在 Common Voice 英文上下降 2.54%、在 TED 上下降 0.64%,晚期编码器与输出投影也有小而稳定的增益,输出投影在 TED 上甚至微增 0.05%,说明不是每个配置在每个数据集都赢,但冗余具有跨声学条件的共性。
分层与分组件:脆弱点与鲁棒点在哪里?
层块实验把编码器与解码器各切成早期、中期、晚期三块,在 50% 稀疏度下测试。编码器重要性随深度下降,早期加 1.25%,中期加 0.20%,晚期减 1.72%,论文把早期脆弱归因于低层声学特征提取,晚期改善归因于对训练声学模式的过拟合被剪枝纠正。解码器呈 U 形脆弱分布,早期在 50% 时恶化 67.50%,晚期恶化 8.90%,中期恶化 0.99%,早期极端脆弱被归因于承接编码器上下文的交叉注意力计算不可压缩。
组件细分显示编码器前馈在 40% 时改善 0.52%,解码器前馈在 40% 时恶化 40.99%,编码器自注意力在 50% 以上失效,解码器自注意力在 50% 改善最大、在 60% 仍改善 1.43%。辅助组件中层归一化在 10% 改善 0.63%,输出投影在 20% 改善 1.10%,偏置在 10% 就恶化 7.53%,卷积前端在 50% 无退化。未胜出项必须指出,偏置、位置嵌入与词嵌入都对剪枝敏感,不能作为压缩重点。为对照均匀剪枝的失效,先看整模型与分开剪枝的曲线导读,横轴是剪枝比例,纵轴是词错误率,3 条线分别是整模型、仅编码器、仅解码器,中间有临界阈值带。
看图路径: 1. 先沿横轴剪枝比例从 0% 看到 50%,确认三条曲线的起点都收敛在基线附近;2. 再看 30% 到 40% 之间的浅红临界阈值带,比较整模型剪枝与仅解码器剪枝的上扬斜率差异;3. 读出 40% 处整模型约 61.32%、仅解码器约 30.11%、仅编码器约 12.49% 的纵轴词错误率分层;4. 最后看仅编码器曲线在 50% 仍保持低位,确认编码器整体更耐受均匀稀疏
论文图 2。原论文 Figure 2:“WER vs. sparsity when pruning the whole model vs. encoder/decoder in isolation on LibriSpeech test-other.”。
该图显示 30% 之前三线都贴近基线,30% 到 40% 之间整模型急剧上扬,40% 处整模型约 61.32%、仅解码器约 30.11%、仅编码器约 12.49%,50% 处整模型与仅解码器都到 100.00%、仅编码器约 13.08%。这证明崩溃主要由解码器驱动,尽管解码器参数占比约 63.53%、编码器约 36.47%,参数多反而更脆弱。编码器在 30% 时还出现比基线好的点,增量为负 0.57%,为选择性剪枝提供初步证据。
前馈网络 × 自注意力: 前馈网络的分工是在每个位置做通道维度的非线性变换与记忆,解码器侧直接影响输出词分布质量;自注意力的分工是计算位置间依赖权重,决定关注哪些帧或哪些已生成词。二者搭配的原因是 Transformer 每层都靠注意力搬运信息、靠前馈加工信息;组合意义在于论文发现二者的剪枝特性相反,编码器前馈可剪而解码器前馈脆弱,解码器自注意力可大幅剪枝而编码器自注意力相对脆弱,不能按同一比例统一处理。
哪些结论还不能下,边界在哪里?
论文明确报告的范围是 Whisper-small 上的英文实验,这是为隔离剪枝即正则化效应而做的受控选择。作者提到在其他架构上的试点运行发现每个模型有各自的组件级敏感度,框架通用但分布需单独验证,完整跨模型验证仍在进行中,因此不能把编码器加解码器不对称直接搬到无自回归解码器的纯编码器 CTC 系统,论文以胡 Bert 类系统为例说明该不对称不直接迁移,但敏感度框架仍可用。多语言场景下语言特异表示可能改变组件韧性,尚未验证。
敏感度与微调的交互也未研究,本文全程免微调,不能推断加微调后增益会更大还是消失。统计方面原文未报告多次随机种子的方差或显著性检验,跨语料只用了固定抽样,2000 条众包样本的抽样波动未量化。成本方面只报告了诊断与评估耗时,没有训练开销,因为没有训练,推理开销只讨论了理论算力与尺寸,没有实测加速。把总体趋势推广到每层每头都成立是错误的,解码器整体脆弱但其自注意力鲁棒就是反例。
要复现先做什么,需要哪些信息条件?
复现的第一步是准备与作者相同的信息条件,包括公开发布的 Whisper-small 检查点、LibriSpeech 的测试与验证划分、相同的束搜索解码与归一化打分流程,先跑出未剪枝基线并记录 test-other 的 11.64% 作为配对起点,不要纠结是否与原始 Whisper 论文数值一致。第二步是在验证集子集上算 1 阶与 2 阶诊断,不更新参数,确认解码器整体高于编码器。第三步是对每个组件独立做 1 次性幅度剪枝,按组件内绝对值百分位数定阈值,从 10% 起按步长扫到失效,重点复刻解码器自注意力 50%、编码器晚期 50%、编码器前馈 40% 等关键点。
第四步是把 LibriSpeech 上确定的掩码原样搬到 Common Voice 与 TED-LIUM 验证,不重新算掩码。关键超参数是稀疏度阈值与层块划分,整体压缩的分配比例已在上节列出,可直接采用。缺项是原文未给出诊断用验证子集的具体样本数与随机种子,也未给出束宽等解码细节的完整配置,复现时需固定自己的种子并记录。代码与权重可用性方面,本次没有验证到可用的开源链接,只能按论文文字流程自行实现,不应声称官方代码已公开。
何时值得尝试,一句话收束
当你的编码器加解码器语音模型在难声学条件下词错误率偏高,又不允许微调时,值得先花十几分钟算梯度与 Fisher 诊断,再对解码器自注意力、编码器晚期层和输出投影做小范围 1 次性剪枝验证,因为这些位置在本文中显示出正则化潜力。如果模型是纯编码器 CTC 结构或多语言模型,不要直接套用本文的哪里可剪结论,应重跑诊断。第三张表把两个最强正则化点与整体压缩放在一起,便于按需选择只求精度还是兼顾尺寸。
| 目标 | 稀疏度 | 位置 | 词错误率变化 | 适用条件 |
|---|---|---|---|---|
| 求精度提升 | 50% | 解码器自注意力 | 2.38% 绝对改善 | 免微调 LibriSpeech test-other |
| 求精度提升 | 50% | 编码器晚期 9 到 12 层 | 1.72% 改善 | 免微调 LibriSpeech test-other |
| 求压缩保精度 | 40.8% 稀疏度 | 敏感度感知分配 | 接近基线 | 全局剪枝崩溃处仍可用 |
表后总结是剪枝在这里既是删除冗余的压缩动作,也是纠正过拟合的正则化动作,但前提是避开解码器前馈、早期解码器层和偏置等脆弱点。
常见误解是参数量下降等于速度提升,本文因稠密推理核未利用稀疏而实时因子不变,尺寸与理论算力下降不能直接报成延迟优化。另一个误解是把某处改善当成处处可剪,实证显示同样 50% 在不同组件结局完全相反。收束判断是理解在哪里剪与剪多少同样重要,诊断加实剪的流程比单一全局阈值更安全。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

