英文题目:AdaTS: Adaptive Token Sampling for Efficient Speech Language Models
会议身份:
conference:interspeech:2026:conference-paper-id:sannigrahi26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#模型剪枝 #高效推理 #长音频处理 #语音识别 #音频问答
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Sonal Sannigrahi:机构信息未能从会议 PDF 纯文本可靠映射
- Giuseppe Attanasio:机构信息未能从会议 PDF 纯文本可靠映射
- André F. T. Martins:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音语言模型的任务是以连续语音波形经梅尔滤波器组特征为输入,输出转录、翻译或问答文本,但每20ms一帧的高频语音编码送入大语言模型后,长音频下上下文爆炸且大量语音词元时间冗余,静态池化又会损伤内容密集区。所提自适应词元采样先由 Wav2Vec2Bert 编码得到特征序列,再计算相邻词元余弦相似度并按阈值切分连续子组,最后对子组内词元做逆相似度加权合并后送入投影器与解码器。与均匀卷积下采样和基于联接时间分类的迭代融合不同,该机制在冗余区形成粗粒度表示而在内容区保留细粒度分辨率。在 FLEURS 英译多语语音翻译上其 COMET-22 达 82.0,超过同解码器的卷积池化与窗口级 Q-Former 基线,同时平均压缩约 2 倍,最大约 4.16 倍。该结论主要在 30s 内英文短音频训练、小规模解码器和英译多语设置下验证,长音频泛化与多语口音鲁棒性尚未充分证明。推理侧 10s 音频约需 2.14 TFLOPS,比卷积下采样的 3.23 TFLOPS 低约 34%。
🔗 开源与复现资源
- 代码相关资源:https://github.com/sonalsannigrahi/AdaTS — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,读完要能复述什么?
本文的输入是一段连续语音,目标是让大语言模型直接读语音并完成转写、翻译和问答。需要保留的关键信息是语音 token 为什么长、为什么冗余、压缩放在哪里、用什么标准合并、训练分哪两段、评测条件是否一致。读完这篇解读,你应当能复述出从波形到编码器表示,再到相似度计算、合并、适配器映射、拼接任务标记、解码生成的完整链路,并能说出阈值、合并权重和训练阶段 3 个可调点的原文做法。
论文研究对象是高效语音语言模型,不是通用音频生成,也不做声纹或情感分类。文中例子是为了帮助理解,比如把嗨、嗯、how、啊这类填充词和静音段看作低信息区,把实词看作高信息区,但这只是教学例子,不代表论文统计过每个词的压缩比。全文围绕 3 个任务展开:自动语音识别检验内容是否丢,语音问答和语音翻译检验理解是否在,另有长语音问答检验长上下文是否可用。输出是文本,解码时用束搜索和任务标记约束,不开放式闲聊。
理解这条主线后,后面所有消融都是在问同一个问题:在 token 预算减半时,哪里的信息可以合,哪里的必须留。
已有路线为什么在长语音上会两难?
已有工作大致分两类。第一类是静态下采样,用时域池化或带步长的卷积把序列均匀压短,做法简单但对所有位置一视同仁。第二类是按内容剪枝,常见做法是看注意力累计分删掉不重要的 token,或用联结时序分类解码器指导合并。论文指出静态方法存在压缩率与语义保留的根本矛盾,压得越多越容易把内容关键区和低信息区一起压扁。内容相关方法能缓解这个问题,但有的依赖大解码器才能发挥,换小解码器差距明显。
另一条背景是小规模语言模型做语音文本学习的可行性,论文选择在小解码器上验证压缩是否成立,而不是一味放大模型。教学上可以这样记:静态方法是闭眼均匀抽稀,内容方法是睁眼按需合并,本文属于后者,但选择了无参数的相似度规则,不引入额外训练的打分器。
静态下采样 × 自适应采样: 静态下采样负责用固定步长的卷积或窗口把所有位置同等压缩,自适应采样负责按信息密度决定哪里多压哪里少压;二者分工是均匀缩短与按需缩短,搭配理由是语音中内容与冗余分布不均,组合意义是论文用实验证明均匀方法会把关键区和低信息区一起挤掉,而自适应能缓解压缩率与语义保留的矛盾。
这组对照决定了后文基线的选择:卷积下采样和窗口级查询变换器代表静态路线,快速长语音模型代表内容相关路线,比较时固定同样的语音编码器和同规模解码器,才能看出压缩策略本身的差别。
语音 token 长且冗余,具体卡在哪里?
论文给出的问题有两个且相互咬合。第一是 token 密集,现代语音编码器每 20 毫秒或更细取 1 帧,1 分钟音频就是数千个 token,10 分钟可超过三万,逼近很多语言模型的有效上下文上限,长语音问答变得不现实。第二是时域冗余,大量相邻帧内容重复,真正被模型关注的不足一半,等于花了 2 次注意力的计算去看重复信息。直接后果是推理开销大、长任务做不了。论文把解决问题的操作点放在编码器输出之后、语言模型之前,而不是改注意力本身或改编码器结构。
这样做的好处是即插即用,既可在训练中用,也可在推理时用。需要明确的是,论文没有声称解决所有长上下文问题,也没有测量误判率或端到端延迟,只是报告 token 压缩率和浮点运算量下降。把问题讲准,下一步才能理解为什么用局部成对相似度而不是全局注意力分。
AdaTS 把一段语音变短的全流程是什么?
沿一个样本走一遍最清楚。输入波形先过冻结或可训练的音频编码器,得到一串高维向量,记为从第一个到第 n 个的序列。接着计算相邻 token 的余弦相似度,得到每个位置与前一个的相似分。设定阈值 t,例如 0.85,把相似度高于 t 的连续位置划为一个局部子组。然后对每个子组做合并,用一个加权平均向量替换原来多个向量,权重是相似度的反函数,也就是越不相似权重越高,越相似权重越低。
合并后的序列更短,再过模态适配器映射到解码器的输入嵌入空间,与语言标记、任务标记和长度提示拼接,一起送入小语言解码器生成文本。图前导读如下:下图展示了从波形到解码器的纵向主路,以及右侧相似度合并的放大细节,重点看冗余区如何变粗、内容区如何保留,理解自适应与均匀池化的区别。
看图路径: 1. 先沿底部波形向上看音频编码器到语音采样器再到模态适配器的主路径;2. 再看右侧放大的相似度小格,确认高于阈值的相邻位置被标注为合并;3. 对比合并前后底部色块宽度,确认冗余区变宽变少而内容区保持较细;4. 最后看顶部解码器输入中语音 token 与语言任务标记的拼接位置
论文图 1。原论文 Figure 1:“Illustration of ADATS including the sampling module which consists of three steps: obtaining representations from the audio encoder, computing pairwise cosine similarity, and…”。
从像素看,主路自下而上是波形、音频编码器、橙色梯形语音采样器、模态适配器、红色语音 token 序列,再与语言、任务和长度提示拼接后进入顶部浅蓝色小语言解码器,绿色圆点代表文本 token。右侧放大框上方给出示例词与静音标记,中间一行是编码器色块与相似度数值,红框标出高相似位置并写明合并,下方合并后色块在对应位置变宽,说明多个低信息向量被压成一个,而深色内容块保持独立。这正是全文核心:粗表示给冗余区,高分辨率留给内容区。论文强调该采样模块无参数,不增加可学习权重,相似度用余弦是因为编码器本身用对比余弦损失训练。
相似度算什么,合并权重怎么定?
组件分 3 步。第一步是表示,编码器输入 80 维 Mel 滤波器组帧,输出多维嵌入,论文固定用 Wav2Vec2Bert,解码器在不同实验中换用 Qwen2.5 1.5B、Llama 3.2 1B 和 EuroLLM 1.7B 的基础版本。第二步是打分,对每 1 对相邻向量算余弦相似度,即点积除以模长乘积,值越接近一越相似。第 3 步是合并,先按阈值划子组,等全部相似度算完再统一替换,避免边算边合改变邻居关系。
合并公式是归一化加权和,分母是所有权重之和,分子是每个向量乘以一减相似度,论文还对比了 3 种池化做法:全组简单平均、按一减相似度加权平均、只保留子组第一个 token 的剪枝。结果是加权平均最好,简单平均也很强,只留首 token 也出乎意料地有效,侧面说明被合并的子组确实信息密度低。
语音编码器 × 语言解码器: 语音编码器负责把 80 维 Mel 滤波器组帧变成高维语音表示,语言解码器负责读语音加文本嵌入并生成转写、翻译或回答;二者分工是声学建模与语言生成,搭配理由是直接拼接会让语音 token 挤占上下文,组合意义是中间用采样器与模态适配器先压缩再对齐,让小规模解码器也能处理长音频。
成对余弦相似度 × 加权合并: 成对余弦相似度负责度量相邻 token 是否表达同一段冗余语音,加权合并负责把相似度高于阈值的连续子组合成一个 token;二者分工是判断与压缩,搭配理由是编码器用对比余弦损失训练故余弦是自然距离,组合意义是在静音和填充词处形成粗粒度表示、在内容密集处保留细粒度。
需要提醒初学者:权重设计不是注意力学出来的,而是手工规则,阈值在 0.7 到 0.9 之间以 0.05 步长调节,默认重点分析 0.85。原文没有给出梯度是否流过合并操作的细节,也没有说采样器在反向时是否可导,因此复述时只讲前向替换,不猜梯度路径。
两阶段训练各冻结谁,各学什么?
论文沿用多模态编码器解码器的标准两段做法。第一段是模态对齐,冻结语音编码器和语言解码器,只训练线性投影构成的多层感知机适配器,用自动语音识别数据把语音空间对到文本空间,编码器前的预处理层按引文超参可训练。第二段是指令微调,把音频嵌入拼到文本输入嵌入上,解冻语言模型并用英语转写、英语问答和英语到 10 种语言的翻译混合数据全量微调。
优化器用 AdamW,1 阶矩 0.9、2 阶矩 0.95,混合精度用 bfloat16,学习率编码器、解码器和适配器分别取不同量级。关键消融是采样模块放在哪一段:只放对齐段、只放微调段、还是两段都放。论文报告最好的是对齐用全序列、微调用压缩序列,只在对齐段压缩会导致下游明显变差,解释是冗余 token 在对齐时仍提供有用的语音信号量,过早压掉会损失对齐质量。
模态对齐 × 指令微调: 模态对齐负责冻结编码器和解码器只训练适配器,把语音空间拉到文本嵌入空间,指令微调负责解冻解码器学习具体任务;二者分工是先对齐再学任务,搭配理由是未对齐就压缩会丢失可学信号,组合意义是论文发现对齐用全序列、微调用压缩序列效果最好。
下表整理原文明确给出的优化器与学习率设置,用于复现时先对齐超参,表中条件、指标与数值均来自原文连续句子,不自行换算。
| 条件 | 指标 | 编码器 | 解码器 | 适配器 |
|---|---|---|---|---|
| 2 阶段通用 | 学习率 | 6 × 10−6 | 2 × 10−5 | 2 × 10−4 |
| 2 阶段通用 | 优化器矩 | β1 = 0.9 | β2 = 0.95 | 交叉熵加余弦调度 |
表后说明:该表的价值是锁定复现起点,学习率分层设置意味着适配器步子最大、编码器最小,直接照抄可避免对齐不稳。
代价是原文对预热步数与梯度累积的描述存在排版粘连,本解读不猜具体数字,只保留能逐字核对的 3 组学习率与优化器矩,缺失的批量与步数视为待补项,需看开源仓库确认。 数据方面,论文称共收集 80000 小时,覆盖转写、问答和翻译,强调使用知识共享署名许可数据以利复现。对齐用 LibriSpeech、VoxPopuli 和 CommonVoice,微调再加 Peoples Speech、GigaSpeech 和多语言 LibriSpeech 英语部分。翻译用 CoVoST-2 英德金标加伪标签语料补其他语言对,问答用 SpokenSQuAD、SLUE 问答和 LibriSQA,并用大模型把部分答案改写成独立句子。
测什么任务,和谁比,条件对齐了吗?
评测覆盖四块:短语音识别、短语音问答、语音翻译和长语音问答。识别在 LibriSpeech 测试集、VoxPopuli 和 FLEURS 上报词错率,越低越好。问答在 SpokenSQuAD 上报 F1、在 SLUE 上报答案片段 F1,越高越好。翻译在 FLEURS 英到多语方向上报 COMET-22,越高越好。长问答用 LongSpeechEval,平均 2 分钟,用大模型打分协议。
解码统一用零样本任务标记提示,任务标记限于转写、翻译和回复 3 种,语言用对应代码约束,束搜索宽度三,重复惩罚 1.6,最多生成 1024 token。基线分静态与内容相关两类:3 层步长二的卷积、窗口级查询变换器,以及用联结时序分类融合的快速长语音模型的 1.5 B 和七 B 版本。为公平,静态基线固定同样的编码器和 1.5 B 解码器。论文默认报告阈值 0.85、加权合并、微调段压缩的配置,解码器默认指 Qwen2.5 1.5B,除非另有说明。
数据划分、采样细节与显著性检验原文未展开,这是复述时必须点明的缺项,不能把数值相同当成口径相同。
压缩一半后,内容和理解保住了吗?
主结论是平均约 2 倍压缩下,识别、问答和翻译多项超过均匀池化,且在部分设置下超过更大解码器的内容相关基线。识别上自适应方法对子采样最不敏感,换小解码器仍有竞争力,说明音素细节被保留。问答上池化差距最大,窗口查询变换器明显好于卷积,快速长语音在问答上强于识别,说明它保整体语义但丢细粒度音素,而 AdaTS 两端都更好。长问答上,用平均短于 30 秒音频训练的 AdaTS 能与七 B 的长语音模型打平,这是支持长上下文能力的关键证据。需要区分直接报告与有限解释:数字是报告,机制解释是支持,跨数据集泛化是待验证。
语音内容保持 × 语音理解: 语音内容保持负责用 ASR 词错率检验音素级细节是否还在,语音理解负责用问答与翻译检验整体语义是否可用;二者分工是细粒度与粗粒度,搭配理由是仅看问答会掩盖转写退化,组合意义是论文同时报告两类任务,显示 AdaTS 在两类上都超过池化和内容相关基线。
下表聚焦推理开销这一可核对维度,比较相同 10 秒音频下 3 种策略的浮点运算量,数值与单位均来自原文连续句子,方向是越低越好。
| 条件 | 指标 | 卷积下采样 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 10s 音频推理 | TFLOPs | 3.23 TFLOPs | 2.14 TFLOPS | 8.54 TFLOPs |
| 平均压缩 | 压缩率 | 静态约 2 倍 | 2x | 长语音模型 4 倍算力 |
| 相对节省 | 下降幅度 | 基准 | 34% | 4 times |
表后解释:主要收益是本方法比卷积下采样省约三成算力,而七 B 内容相关模型需约 4 倍算力才能达到可比性能,具体代价是压缩率与数据集相关,问答与识别在同一阈值下实际压缩不同,不能把平均 2 倍当成每条必达。
未胜出项也要点名:在部分翻译方向上窗口查询变换器与本方法接近,说明静态方法并非全败,选型要看任务对细粒度的敏感度。
阈值、合并方式和训练阶段哪个最敏感?
阈值消融显示三任务同趋势但敏感度不同。识别和翻译对阈值更敏感,阈值调低性能掉得快,问答更鲁棒,大幅下采样仍可用。教学含义是需保内容的任务要细调阈值,只需大意的任务可压得更狠。图前导读如下:下图是阈值横轴从 0.7 到 0.9 的性能曲线,左中右分别对应识别、问答和翻译,重点看低阈值段的斜率差异与高阈值段是否走平,不要把纵轴方向弄反。
看图路径: 1. 先确认横轴是相似度阈值从 0.7 到 0.9,纵轴左侧是问答分数右侧是翻译分数;2. 对比蓝色与红色两条问答曲线随阈值升高的斜率,确认低阈值段下降更快;3. 观察翻译曲线在 0.85 到 0.9 之间是否走平,判断继续放宽阈值的收益
论文图 2。原论文 Figure 2:“Performance vs. Threshold for ASR, SQA, and ST.”。
从可见像素看,问答面板中有两条线,蓝色圆点代表 SpokenSQuAD,红色方块代表 SLUE,横轴经 0.8、0.85 到 0.9,两条线都随阈值上升而上升,在 0.85 附近斜率放缓。翻译面板纵轴是 COMET 22,刻度从六十到九十,蓝色折线同样从 0.7 向 0.9 爬升,到 0.85 后趋平。这支持原文判断:0.85 是兼顾压缩与性能的折中点,继续放宽到 0.9 收益有限。合并方式上加权平均最优,简单平均接近,只留首 token 也可用。训练阶段上微调段压缩最好,两段都压次之,只在对齐段压最差。
下表把阈值区间的原文表述整理成可执行检查项,便于复现时按步扫描。
| 条件 | 指标 | 下限 | 优选 | 上限 |
|---|---|---|---|---|
| 相似度阈值 | 取值 | 0.7 | t = 0.85 | 0.9 |
| 扫描步长 | 增量 | 0.05 | 固定后测合并 | 0.05 |
| 趋势 | 方向 | lower values degrade | 最优附近走平 | 高阈值保留更多 |
表后说明:该表的收益是给出可直接运行的扫描网格,先粗扫再在 0.85 附近细看合并策略。代价是原文未报告每次阈值的精确压缩率与方差,不能据此承诺某阈值必得某分数,复现时应同时记录压缩率与指标,避免只看分数。
哪些结论还不能下,边界在哪里?
第一,压缩率是数据集相关的,同一阈值在识别、问答和翻译上压出的倍数不同,平均 2 倍不等于每条 2 倍,更不等于最长可达 4 倍处处成立。第二,阈值与合并方式的最优值是在所用编码器和数据混合下得到的,换编码器或语言对可能要重调。第三,长语音评估用模型打分,平均 2 分钟,训练平均短于 30 秒,结论支持泛化但不等同于在 10 分钟会议转写上验证过。
第四,开销只报告了浮点运算量,没有报告实际延迟、显存峰值和误判率,不能直接承诺线上延迟下降三分之一。第五,对齐与微调的数据许可、伪标签质量和答案改写步骤会影响可比性,复现时要保留同一数据混合。把相关当因果是常见误读,例如把问答鲁棒当成识别也鲁棒,或把总体趋势当成每组都成立,读图时应回到分任务曲线逐条确认。
要复现,先跑通哪几步,需要什么?
先准备编码器与解码器权重,固定语音编码器为 Wav2Vec2Bert,解码器先用 Qwen2.5 1.5B 基础版,这是论文默认最强的组合。再实现采样器:提编码器输出、算相邻余弦、按阈值划连续子组、全部算完后用一减相似度加权平均替换,阈值先扫 0.7 到 0.9、步长 0.05,重点看 0.85。训练按两段走,对齐冻结两端只训适配器,微调再解冻解码器,对齐用全序列、微调用压缩序列,优化器与学习率照抄上表。解码时加上语言与任务标记约束,用束搜索宽度三、重复惩罚 1.6。
代码方面,资源状态显示代码仓库当前可用,地址为论文注明的开源链接,可用于核对超参和数据处理,但本解读不把仓库可达当成权重可下载或一键可运行,是否能端到端运行还需按仓库说明验证。验证时至少记录三件事:每任务的实际压缩率、对应指标、10 秒音频的浮点运算量,三者齐了才能判断收益是否复现。
何时值得试 AdaTS,一句话怎么记?
当语音输入挤占上下文、且长任务做不动时值得试,特别是识别要求细、问答要求全的混合场景。记住一句话:先用余弦找出重复的邻居,冗余处合得多、内容处合得少,对齐时别压、微调时再压,阈值从 0.85 起调。选择解码器时优先复现 Qwen2.5 1.5B 的结果,再换其他小模型看是否稳定。还需要补的验证是更长音频的端到端延迟、更多语言对的阈值稳定性,以及与窗口查询变换器在翻译上的细粒度对比。回到开头的问题:不是把声音丢给模型就结束,而是先决定哪些帧值得占位置,AdaTS 给的答案是让信号自己投票,相似的就合并不占位,不相似的就保留。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

