英文题目:Measuring the Redundancy of Decoder Layers in SpeechLLMs
会议身份:
conference:interspeech:2026:conference-paper-id:moumen26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#模型剪枝 #大语言模型 #语音 #语音识别 #语音翻译
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Adel Moumen:机构信息未能从会议 PDF 纯文本可靠映射
- Guangzhi Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Philip C Woodland:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音大模型将语音编码器表示经投影器映射到大语言模型解码器,再自回归生成文本,其解码器占比超90%但是否为语音任务必需尚不清楚,而跨模态表征不对齐使直接评估剪枝后兼容性尤为困难。本文以层冗余为切入点,先用角距离度量相邻层隐状态相似性以定位可删连续块,再沿最优剪枝路径剪枝并通过低秩适配与投影器重对齐进行愈合,最后在识别与翻译任务上验证保留性能。相对已有大语言模型剪枝工作,关键差异在于证明冗余继承自文本预训练且不受语音路由改变,并揭示解码器加投影器联合愈合不可或缺,从而可用廉价纯文本前向确定语音可剪位置。在LibriSpeech训练的Llama 3.1 8B系统上,移除43.8%解码器层后测试集词错率仅从2.65%升至3.28%,且推理提速约35%。结论限于SLAM框架下英语朗读语音识别与两对CoVoST2翻译方向,未验证对话、推理与噪声场景的外推能力。原文仅报告推理峰值显存由15.72 GiB降至10.37 GiB,未披露完整训练时长成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要解决什么语音任务?
这篇解读的对象是刚接触语音与大模型结合的研究生,先把任务边界讲清楚。输入是一段波形,采样率为 16 千赫兹的英文朗读语音,目标是输出对应的文字转写,这就是自动语音识别。另一组任务是语音翻译,输入是英语或法语语音,目标是输出德语或英语文本。论文使用的框架把语音编码器输出接到一个预训练大语言模型解码器上,解码器按自回归方式逐词生成目标。
需要保留的关键信息是,解码器占总参数的 90% 以上,而传统语音系统用小得多的模型也能工作,因此问题不是能不能跑,而是这么大的解码器容量对语音任务是否必需。输出是一份可复述的方法与条件说明,不做超出证据的优劣断言。资源状态方面,本次收到的证据中没有发现来源绑定且完成安全验证的资源,因此不得声称代码、模型或数据已公开,只能按正文将来通过工具包发布的计划来理解,当前可用性无法确认。
已有压缩路线与本文的切入点有何不同?
在进入方法前,需要把相关路线放在相同的输入、目标与运行阶段下对照。第一条路线是纯文本大模型的层剪枝,已有工作用隐状态相似性找可删层,发现深层往往更冗余,本文直接沿用了角距离选块的思路,但把输入从文本换成语音加提示加目标的拼接序列,并用语音识别与翻译性能验证。
第二条路线是语音编码器压缩与知识蒸馏,例如对语音编码器做结构化剪枝,或把大型识别系统蒸馏为更小系统并去掉约一半层,这说明语音专用系统本身也有冗余,但研究对象是编码器或端到端识别器,不是大模型解码器。第三条路线是语音大模型的轻量适配,例如只训练投影器或加低秩适配,目标是降低训练代价而非度量冗余。
本文的差异在于不追求新的架构,而是把层删除作为测量工具:如果删掉连续多层后性能下降很小,就认为这些容量对当前任务是多余的。这种以删除验证冗余的逻辑,后文的修复对照与跨任务迁移都是围绕它展开的。
冗余如何定义,删多少算可接受?
论文把冗余操作化为一个可测量的量:在下游指标只出现小幅退化的前提下,能够删除的最大连续层比例。自动语音识别用词错误率衡量,越低越好,判定标准是相对变化量不超过 25%,且要求在多个评测集上同时满足。选择 25% 的理由在正文有明确交代,它对应相邻尺寸档次之间的平均相对差距,因此剪枝后不至于跌到下一个更小档次之下。
语音翻译用得分衡量,越高越好,判定标准是相对下降不超过 10%,目的是让绝对分数仍接近未剪枝水平。举例来说,这里的例子仅用于理解阈值含义:假设基线词错误率为 2%,相对上升 25% 意味着剪枝后约为 2% 点五,而不是直接加 25 个百分点。相对百分比与百分点的区别必须分清,论文用的都是相对变化。
另一个容易误解的是数值相同不代表条件相同,同样是删除三成层,在域内干净语音与域外多样语音上的含义不同,必须同时看数据集、基线与聚合对象。
从一条语音样本走完全流程需要哪几步?
先沿一个样本走完输入到输出,再谈剪枝。波形进入语音编码器,得到长度大幅缩短的特征序列,连续多帧在特征维度拼接实现降采样。实验中使用的降采样因子为五,对应约 10 赫兹的帧率。拼接后的特征进入投影器,这是一个带中间非线性激活的单隐层多层感知机,把语音维度映射到大模型嵌入维度。然后语音嵌入、提示嵌入与目标嵌入拼接成完整输入序列,送入由多层因果变换器组成的解码器。
以八 B 规模为例,解码器可达 32 层,是参数主体。训练采用教师强制,最小化目标词上的负对数似然。标准做法冻结解码器,只训练投影器;低秩适配变体则在注意力投影上加小参数旁路。推理时使用贪心解码。
剪枝阶段先在代表性验证集上计算每对层的角距离,取序列最后一个位置的隐状态做平均,对每个块大小选距离最小的起始层,形成随删除深度变化的最优剪枝路径。删除时去掉起始层之后到块末之前的层,把起始层的输出直接接到块后第一层。
角距离 × 最优剪枝路径: 角距离负责度量第 l 层与第 l+n 层在序列最后一个位置隐状态的方向差异,作为块可删性的廉价代理;最优剪枝路径负责对每个块大小 n 选出角距离最小的起始层 l*,形成随剪枝深度变化的删除方案。二者搭配是因为直接按性能搜索所有块代价太高,先用几何相似性缩小候选,再按路径逐级删除验证,组合意义是把冗余度量转化为可执行的剪枝顺序。
编码器、投影器与解码器各自负责什么?
这一节把 3 个组件的分工固定下来,后文不再混用名称。语音编码器负责声学建模,实验主体使用在大规模自监督预训练基础上得到的编码器,翻译部分对法语到英语改用多语表示更强的另一编码器,以检验结论是否依赖特定编码器。投影器负责模态对齐,是标准训练中唯一更新的部件,学习把语音表示搬到解码器内部表示附近。解码器负责语言生成与任务执行,层数多、容量大。
组合机制的理由是编码器与大模型独立设计训练,表示空间本来不对齐,若直接拼接会让解码器读不懂语音,因此需要投影器做桥接。新增作用在于,一旦桥接完成,解码器可以用原有的文本生成能力处理语音任务,而不必重新训练整个大模型。理解这一点后,才能明白后文为何要做投影器重对齐:剪枝改变了解码器动态,原来对齐好的投影器会变陈旧。
语音编码器 × 投影器: 语音编码器负责把波形变成较短的连续特征序列,保留声学内容但维度与大模型词嵌入不对齐;投影器是单隐层非线性映射,负责把降采样后的语音特征搬到解码器的嵌入空间。二者搭配的原因是各自独立预训练、表示空间不一致,需要一个轻量可训练的桥接层来实现语音向文本空间的对齐,组合后解码器才能像读文本一样读语音。
训练与剪枝后修复具体更新了哪些参数?
训练条件按原文交代,不从模型名字推定实现。初始语音识别训练只更新投影器,解码器冻结。使用两块显存八十吉字节的图形处理器,每卡批量为八,优化器为自适应矩估计,参数为 0.9 与 0.98,梯度裁剪为 1.0,峰值学习率为万分之五并带线性衰减。训练 50000 步,约 3 个轮次;其中大尺寸模型用 75000 步与更长的衰减比例。
低秩适配变体在解码器查询、键、值与输出投影上加秩 64 的适配器,缩放系数 64,丢弃率 0.05,其余超参数保持一致。剪枝后修复是关键的第二阶段:可选地在接收块的多层感知机上加同样秩的低秩适配,和可选地解冻投影器,用相同训练数据再训练 5000 步,超参数与之前相同。梯度路径因此只经过接收块适配器和投影器,不更新整个解码器。原文未报告投影器隐层宽度等全部细节,缺失处只能指出缺项,不猜测具体数值。
接收层 × 剪枝后修复: 接收层指被删块之后紧接着的第 l*+n 块,它原本期待前一层的输入分布,删除后会直接接到更早的层输出;剪枝后修复负责在该接收块的 MLP 上加低秩适配并可选解冻投影器,用少量训练补偿接口错位。二者搭配的原因是几何接近不等于接口兼容,必须在错位发生的局部做残差修正,同时让投影器重新对齐新的解码器动态,组合后才能区分真冗余与未补偿的失配。
训练与评估的资源账本如何记录?
为检验跨任务剪枝路径是否一致,下面整理原文直接报告的翻译分数随删除比例变化的结果,重点对比最优路径与跨任务迁移路径在相同删除比例下的差异。
| 剪枝比例 | Fr→En 最优路径 | En→De 最优路径 | Fr→En 迁移路径 | En→De 迁移路径 |
|---|---|---|---|---|
| – | 39.03 | 27.66 | 39.03 | 27.66 |
| 10.7% | 37.23 | 27.46 | 37.23 | 27.40 |
| 21.4% | 36.09 | 25.57 | 36.09 | 25.55 |
| 32.1% | 36.12 | 25.40 | 36.12 | 25.40 |
表后解释代价与边界:该表显示跨任务迁移路径与最优路径分数几乎一致,说明同一解码器层块在不同任务间存在冗余;但结论仅限已测试的翻译方向与编码器组合,不能外推到其他语言或任务,且原文未报告训练耗时与能耗,因此不能承诺训练成本下降。
数据、评测与基线条件是否可比?
实验按问题组织,先讲测什么、与谁比、条件是否一致。语音识别训练用 960 小时的朗读英语,域内评测用干净与困难测试集,域外评测用聚合多来源英语的多样集合的开发集,该集合测试部分包含前述朗读数据,因此用开发集做域外评估以避免重叠。语音翻译用多语语音翻译语料的英语到德语与法语到英语,训练时长分别为四百二十八与 264 小时。解码统一用贪心解码,识别用英语文本规范器统一,翻译用标准工具报告得分。
模型覆盖两个大模型家族、3 个尺寸档,共 6 个主干,层数与宽度配置不同,便于观察规模趋势。比较的公平条件是同一主干、同一训练数据、同一解码与同一指标,只改变删除层数与修复策略。指标方向要记牢:词错误率下降为好,相对增量越小越好;翻译得分上升为好,相对下降越小越好。阈值线在图中用灰色虚线标出,超过即判定为不可接受。
相对退化 × 剪枝容忍度: 相对退化负责把剪枝后分数与未剪枝基线归一化比较,识别用词错误率上升比例或翻译得分下降比例;剪枝容忍度负责给出可接受的最大可删层比例,识别用词任务要求同时满足多个评测集退化不超过阈值。二者搭配是因为绝对分数受基线强弱影响,直接比绝对值不公平,组合意义是用统一的相对阈值判定不同规模模型谁的冗余更多。
冗余来自哪里,深层为何更可删?
第一个要回答的问题是冗余的来源。论文比较了纯文本输入与语音接入后的层间角距离热图,做法是在验证集上平均,观察不同起始层与块大小下的距离。导读如下:该图有 4 个面板,前 3 个是同一七 B 模型的纯文本、冻结语音接入与适配后语音接入,第 4 个是另一架构的八 B 模型,横轴为层索引,纵轴为块大小,颜色越黄表示距离越小、越可能冗余。
看图路径: 1. 先看横轴层索引与纵轴块大小构成的三角热图,黄色为低角距离区域;2. 对比面板 a 纯文本与面板 b 语音接入时低距离块的位置是否重合;3. 观察面板 c 适配后黄色区域是否更亮或更宽,面板 d 换架构后深层是否仍最黄;4. 注意最右侧包含最后一层的列是否为深紫色高距离
论文图 1。原论文 Figure 1:“Angular distance between decoder layers land l+ n, averaged over LibriSpeech dev-clean and dev-other.”。
对可见内容的解释需要紧扣像素:前两个面板的黄色低距离区位置几乎重合,平均差异约 0.007,最优剪枝路径也高度一致,报告显示语音路由没有实质改变层相似结构,支持冗余主要继承自预训练大模型的判断。深层块普遍更黄,而包含最后一层的块呈现最深的紫色高距离,这与深层更可删、最后一层敏感的已有观察一致。
第 3 个面板适配后被剪块的平均距离从 0.36 与 0.35 降到 0.32,黄色更明显,说明适配放大了表示相似性,但后文显示其剪枝容忍度反而下降,因此几何相似不等于功能可替代。第 4 个面板换架构后仍呈现深层低距离、尾层高距离的三角形态,支持跨架构存在类似结构。更大的模型黄色区域更宽,提示 избыточная容量随规模增大,但这只是几何提示,最终仍需性能验证。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句二 | 28.6 | 2.36 | 4.83 | 14.91 |
| 来源句四 | 17.9 | 2.02 | 4.26 | 13.01 |
该表把来源中的主结果数值按原文证据句整理,数值和方向只适用于当前验证条件,不能外推到其他数据。
不同规模与翻译任务上能删多少层?
翻译任务的泛化用另一张五列表格检验,指标为翻译得分越高越好,比较语音最优路径与识别最优路径在相同删除比例下是否一致。表前问题是跨任务、跨语言、跨编码器后可删位置是否相同;公平条件是同一七 B 主干与同一联合修复;指标方向是得分越高越好,相对下降不超过 10%。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 39.03 | 27.66 | — | — |
| 来源句二 | 10.7% | 37.23 | 27.46 | 27.40 |
| 来源句三 | 2 | 21.4% | 36.09 | 25.57;25.55 |
| 来源句四 | 32.1% | 36.12 | 25.40 | — |
| 来源句五 | 42.9% | 32.87 | 17.08 | 32.93;17.07 |
| 来源句六 | 4 | 32.1% | — | — |
表后解释:按更严格的翻译阈值,法语到英语可删 32.1% 层,而英语到德语在表中未明确给出独立阈值点,只能说在 32.1% 处仍接近基线,到 42.9% 时英德从 27.66 跌到 17.08 左右,明显超出可接受范围。关键证据是两条路径在每一行几乎逐点重合,支持相同层块在识别与翻译中同时冗余,允许单个剪枝主干加任务适配器支撑多任务。限制是仅验证了 2 个方向与两种编码器,不能推广到所有语言与任务。
不修复、只修一处与两处同修差多少?
第二个问题是修复机制,这是决定剪枝结论是否稳健的对照。3 个策略沿同一最优路径比较:不修复、只修接收层解码器、解码器加投影器联合修复。导读如下:该图按行分模型家族、按列分 3 个评测集,横轴为删除层比例,纵轴为相对词错误率增量,数值为二意味着达到基线 2 倍,灰色虚线为 0.25 阈值,线型区分修复策略,颜色区分尺寸。
看图路径: 1. 先确认横轴为删除层比例,纵轴为相对词错误率增量,灰色虚线为 0.25 阈值;2. 对比同一子图内虚线无修复与点线联合修复曲线的分叉高度;3. 观察上行与下行在阈值以下能走多远,判断哪个规模更耐剪;4. 检查橙色纯文本路径与语音路径在阈值内是否基本重合
论文图 2。原论文 Figure 2:“Relative WER degradation as a function of the fraction of decoder layers removed, for each evaluation set (columns) and model family (rows).”。
像素层面的趋势很清晰:不修复的细虚线在删除比例很小时就冲出图顶,相对退化常超过 50%;只修解码器的实线能稳定一段,但在大删除比例下仍显著上升;联合修复的点线在阈值以下走得最远。具体数字上,七 B 模型在干净集删除约 2% 18.6 层时,联合修复词错误率为 2% 点三六,而只修解码器为 5.93%,差距直接决定了是否满足阈值。
只修投影器与不修复相当,报告显示其有限容量无法补偿被删层,支持联合修复中投影器重对齐是必要的,但不是充分的。跨尺寸看,大模型在阈值内能删更多,小模型曲线更早抬头。纯文本路径的橙色曲线与语音路径在阈值内几乎重合,支持可删层可从廉价纯文本前向中识别。需要强调的反例是适配后的七 B 模型容忍度从 2% 18.6 降到 10% 7.9,尽管几何相似性更强,说明适配引入了角距离捕捉不到的功能依赖。
冻结解码器 × 低秩适配: 冻结解码器指标准 SLAM 做法中只训练投影器、保持大模型参数不动,以保留文本能力并降低训练量;低秩适配指在注意力投影上加小参数旁路做轻量微调,允许解码器小幅适应语音。搭配比较的原因是想检验冗余是否来自预训练本身、微调是否改变可删结构,组合意义是通过对照冻结与适配两种训练条件,观察角距离结构是被保持还是被放大。
哪些结论还不能推广,缺了什么验证?
需要把直接报告、有限解释与未验证推测分开。直接报告的是在给定数据、模型与阈值下可删比例与路径重合度;有限解释的是投影器重对齐与正则化效应,它们能解释趋势但没有因果干预证明,只能用支持一词。未验证的是更广的任务外推,原文提到问答与推理可能延续深层冗余,但本次没有测量,属于待验证推测。
缺失的验证包括误判率分布、逐层延迟分解、不同解码策略下的稳定性,以及统计显著性方法,原文未报告置信区间,不能把单次贪心解码结果当成全条件成立。总体趋势不等于每组都成立,小模型与适配模型的反例已经说明阈值与结构选择会影响结论。成本方面只给了训练步数、批量与加速显存快照,没有完整训练能耗与推理帧率曲线,讨论加速时必须限定为报告的硬件与删除比例。
此外,原文表格与图注之间没有发现算术冲突,但翻译部分英语到德语的可删阈值点不如法语到英语明确,复述时应如实保留这种不对称,不自行补一个对称数字。
要复现这套剪枝流程先做什么?
复现顺序应遵循学习依赖,先跑通基线再做剪枝。第一步按 SLAM 配方训练投影器,冻结解码器,确认在干净与困难集上的基线词错误率与原文同量级,注意文本规范器必须一致,否则跨表对比会失真。第二步在验证集上对每个块大小计算角距离,取最后一个词位置的隐状态平均,得到最优剪枝路径;为省钱可先用纯文本前向近似,因为报告显示两条路径在阈值内几乎一致,但最终仍需用语音验证。
第三步按路径从小块到大块逐级删除,每次删除后做联合修复,即在接收块加低秩适配并解冻投影器,用原数据训练 5000 步,再用贪心解码评估 3 个集的相对退化。何时值得尝试:如果解码器占参数主体且部署显存紧张,或想用一个主干支撑识别加翻译,大模型优先尝试深层块;如果模型已很小或已做任务适配,应降低预期,因为小模型与适配模型的容忍度明显更低。
还需补的验证是换编码器、换语言方向与域外集复测,以及记录每次删除的绝对分数而非只看相对值,避免强基线掩盖绝对退化。
核心判断与下一步验证是什么?
综合全部证据,中心判断是解码器冗余主要继承自预训练大模型,语音接入与冻结训练没有重塑层相似结构,微调反而放大相似但降低容忍度,因此几何相似只是必要不充分条件。方法上的关键是把角距离作为廉价筛选,把联合修复作为稳健性保障,缺少任一环节都会高估或低估冗余。规模趋势支持越大越可剪,但阈值选择决定了具体数字,换阈值结论会变,复述时必须连阈值 1 起引用。
跨任务路径重合支持存在更全局的冗余结构,使单个剪枝主干支撑多任务成为可能,但目前仅在两个翻译方向与两种编码器上得到验证。下一步值得补的是更多家族、更多语言与非转写类任务,以及误判类型分析与延迟分解,才能判断深层冗余是普遍现象还是特定数据与指标下的结果。对于刚入门的研究生,记住一条可操作原则:先用纯文本角距离找候选深层块,再用语音性能加联合修复做实证,任何只看热图不做修复验证的剪枝结论都不完整。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

