英文题目:Systematic PTQ Study of Integer and Floating-Point Formats for On-Device Whisper ASR
会议身份:
conference:interspeech:2026:conference-paper-id:choi26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#模型量化 #高效推理 #端侧运行 #语音识别
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Woosuk Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Dohyeon Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Taehyung Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Hyukjun Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
编码器-解码器Whisper需将30秒梅尔频谱输入映射为文本输出,编码器激活离群更强且移动端内存受限,使低比特后训练量化能否沿用W4A16范式并不明确。作者先用SmoothQuant做跨通道重分布将离群能量从激活搬向权重,再对全部线性层与键值缓存投影注入伪量化噪声以统一比较INT8/4/3与FP8/FP4/NVFP4/MXFP4,然后在LibriSpeech上以确定性束搜索评估词错率与解析模型尺寸。与仅关注权重的LLM量化研究不同,该工作把激活格式与位宽作为一等变量,并对比整数与浮点激活通路的硬件面积含义。在LibriSpeech test-clean评测设置下,base.en经SmoothQuant的INT8的WER为4.64%,低于FP32基线的WER 4.81%。激活位宽是主导因素,保持16比特激活远优于降至8比特,而INT16与FP16激活路径精度等价,使浮点数据通路更具面积效率。该结论适用边界受限于仅在tiny.en与base.en上验证,MXFP4在标准后训练量化下严重退化与INT3崩溃构成失败条件,更大变体与需校正训练的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
端侧语音识别为什么要先谈压缩?
输入是这篇论文要解决的部署矛盾,目标是让刚入门的读者能复述实验做了什么。必须保留的信息是模型、格式范围、评价集与解码条件,输出是一套可核对的格式选择依据。Whisper 是编码器加解码器结构的语音识别模型,输入是梅尔频谱图,输出是文本,论文选用 tiny.en 约 39M 参数与 base.en 约 74M 参数两个英文小模型。它们要装进手机、助听器与边缘设备,原始浮点 32 模型分别约 145.7 MB 与 282.4 MB,内存与带宽都不允许直接部署。
白话先讲训练后量化,英文叫 post-training quantization,缩写 PTQ。做法是不重新训练,只拿少量数据定出缩放系数与截断范围,再把权重与激活的数值映射到低比特网格,前向时注入截断与舍入误差来模拟低精度效果。论文还区分两种模式,权重只量化而激活保持高精度的记作 W4A16,权重与激活同时量化的记作 W8A8 或 W4A8,前者省存储,后者还省计算。
训练后量化 × 微调感知量化: 训练后量化分工是不再更新权重,只用少量校准数据定缩放与截断,直接把已训模型压到低比特;微调感知量化分工是保留训练循环让模型适应量化噪声。两者搭配理由是前者部署成本最低,适合先摸清格式上限,论文因此只做训练后量化,把需要重训的 3 比特以下问题留给后续验证,组合意义是先用低成本扫描定出值得再投入训练的格式区间。
论文的起点是已有大语言模型量化结论是否能搬到语音编码器加解码器模型。语音模型有更强的激活离群与频谱输入特性,解码是自回归逐词生成,前一步的对数概率扰动会累积。学习依赖是先理解任务与压缩目标,再看方法如何控制变量,最后才读词错误率数字,否则容易把不同激活精度下的数字直接对比。
同输入同目标的前人工作卡在哪里?
相关工作按同输入、同目标、同运行阶段来对照。第一类是大语言模型整数与浮点量化,做法包括 LLM.int8、ZeroQuant、GPTQ、AWQ,以及 FP8 优于 INT8 应对变换器离群的结论,还有 MXFP4 标准与 NVFP4 引入。它们的输入是文本解码器模型,目标是语言建模压缩,运行阶段多为权重只量化加高精度激活,没有覆盖编码器加解码器语音模型。
第二类是语音专用量化。Feng 等人在 Whisper 上测了 8 种整数 PTQ 方法,激活精度有变化但未纳入任何浮点格式。Andreyev 比较了 INT4 到 INT8 但没有做粒度与激活全面扫描。Wagner 与 An 刻画了语音编码器与大模型的离群模式,论文确认在 Whisper 中复现了类似模式。按论文的总结表,没有前人工作同时覆盖 NVFP4 与 MXFP4 权重格式,又做完整激活精度扫描,还以编码器加解码器语音识别为目标。
这个对照的教学意义是类别差异不能当同条件胜负。大模型上 W4A16 是主流范式,不等于语音上自动成立。论文的增量正是把权重格式、激活格式、量化粒度 3 维联合扫描补上,80 余组配置都在同一校准与解码条件下比较。
两个待回答的设计问题是什么?
论文提出两个开放问题。第一,激活精度重要吗,语音专用工作试过降低激活精度,但没有在 Whisper 上隔离出激活位宽的独立影响。第二,整数激活与浮点激活哪个更合适,多数移动端神经网络处理器如 Arm Ethos-U85 与高通 Hexagon 依赖 INT8 或 INT16,但引用的硬件研究显示同位宽下浮点乘法器面积更小,提示浮点可能更划算。
举例说明问题切法,例子仅为教学虚构。假设有两个方案,方案甲把权重从 8 比特压到 4 比特但激活保持 16 比特,方案乙保持权重 8 比特但激活压到 8 比特,若只看模型尺寸会觉得甲更激进,但论文要问的是哪个方案词错误率涨得更多。这个例子不带具体数值,数值必须回到原文实验。
为回答这两个问题,论文固定其他条件,只动权重格式、激活格式与粒度。激活格式覆盖 INT4、INT8、INT16 与 FP8、FP16,权重格式覆盖 INT8、INT4、INT3 与 FP8、FP4、NVFP4、MXFP4,粒度覆盖每张量、每通道与每组。评价指标是词错误率,英文 word error rate,缩写 WER,数值越低越好。
联合扫描的方法全景如何组织?
方法全景是沿一个样本走完输入到输出。输入是 LibriSpeech 语音,经梅尔频谱进入编码器自注意力与前馈网络,再经解码器自注意力、交叉注意力与前馈网络生成文本。量化目标是所有线性层的权重,包括查询、键、值、输出投影与每层前馈的两层全连接,查询、键、值投影输出还被量化以模拟低精度键值缓存。计算过程采用仿真量化,英文 FakeQuant,前向注入截断与舍入误差但算术仍跑在浮点 32,目的是做与硬件无关的格式比较。
预处理只用 SmoothQuant,因为它同时作用于权重与激活且与格式无关,适用于整数与浮点全部配置。权重专用的 AWQ 与 GPTQ 被明确留作未来工作,不进入本次激活精度扫描。模型尺寸按解析式估计,线性层权重数乘权重位宽加缩放因子数乘缩放位宽,再除以 8 换算字节,其中 INT 与 FP4 组缩放按 FP16 计,NVFP4 块缩放按 FP8 计,每通道 INT8 与 FP8 缩放按 FP32 计,SmoothQuant 的每通道向量吸收进权重矩阵不增加存储。
选择浮点激活通路的硬件动机来自乘法器面积对比,以下柱状图给出同位宽下整数与浮点乘法器的面积关系,是理解后文指南第一条的直接依据。
看图路径: 1. 先看横轴位宽分组,确认同位宽下红色整数柱与蓝色浮点柱的配对关系;2. 再看纵轴对数面积,体会 8 比特处差距被放大的真实倍数;3. 最后读绿色标注的面积比,核对 16 比特、8 比特、4 比特三处数值
论文图 1。原论文 Figure 1:“Multiplier area (45 nm CMOS, log scale) for INT vs. FP at matched bit-widths [12]. FP is consistently smaller: 1.40× at 16-bit, 2.43× at 8-bit, and 1.84× at 4-bit.”。
该图在 45 纳米工艺、对数纵轴下比较乘法器面积,横轴从 INT32、FP32 一直到 INT4、FP4。可见同位宽下蓝色浮点柱系统性低于红色整数柱,论文转述为 16 比特处 1.40 倍、8 比特处 2.43 倍、4 比特处 1.84 倍。教学上不要把对数轴误读为线性差距,8 比特处视觉差距被压缩,但标注倍数仍是最大的一档,这正是论文主张浮点激活通路每平方毫米算力更高的原因。
格式与平滑组件各自算什么?
组件分三块。整数格式采用对称量化处理权重,缩放等于最大绝对值除以量化上限,量化值为缩放乘截断舍入结果,激活因后 GeLU 分布非零中心而加零点做非对称量化。INT8 在多数神经网络处理器与图形处理器上有加速,INT4 与 INT3 压缩更高但动态范围更窄。浮点 FP8 取 E4M3,即 1 位符号、4 位指数、3 位尾数,最大值 448,非均匀网格在零附近密集又能覆盖大幅值离群,这是应对重尾权重的关键。
FP4 本身只有 E2M1 的 16 个值,单独不够,必须加块缩放。NVFP4 做 2 级缩放,全局浮点 32 张量缩放乘每块 FP8 块缩放再乘量化值,每倍频程约 7 个不同层级。MXFP4 做单级 E8M0 的 2 的幂块缩放,每倍频程只有 1 个层级,硬件简单但表达粗糙。论文指出若真实缩放落在两个 2 的幂之间,最近可用值最多偏 1.41 倍,而 NVFP4 拟合更紧。
SmoothQuant × 激活离群值: 激活离群值分工是制造难量化的大幅值通道,它撑大量程让大部分小值分不到刻度;SmoothQuant 分工是把离群通道的幅度按比例搬一部分到权重上,让激活变平滑、权重变难一点。搭配理由是离群是结构性偏斜,单侧截断必丢信息,双侧分摊才能两边都可量化,组合后 8 比特整数与浮点才能同时恢复精度。
NVFP4 × MXFP4: NVFP4 分工是用全局浮点 32 缩放加每块浮点 8 指数 4 尾数 3 块缩放提供细粒度动态范围,MXFP4 分工是用 8 位指数 0 尾数的 2 的幂块缩放简化硬件。搭配比较理由是两者都是 4 比特权重加块缩放,但块缩放的粒度决定拟合能力,组合意义是论文用同一 Whisper 权重分布证明粗粒度在 2 的幂间隙处误差大,需要额外算法修正才能用。
沿样本再走 1 次平滑的作用。离群通道先被统计出来,SmoothQuant 把它的幅度按系数分给权重,激活量程缩小后 8 比特刻度不再被单个大值撑爆,权重虽然难了一点但仍在可量化范围。这个操作与格式无关,因此 8 比特整数与浮点、4 比特整数与浮点都能用同一预处理公平比较。
本研究训练了什么,没有训练什么?
本研究没有训练阶段,没有更新任何 Whisper 权重,没有优化器、梯度路径、学习率与重置时机的报告,不能把仿真量化等同于确定性求解。真实计算过程是调用已有 tiny.en 与 base.en 权重,做校准、搜索缩放、注入量化误差再解码。校准用 LibriSpeech 训练集中的 400 条样本,明确避开测试集以防泄漏,评价用 test-clean 全部样本与 test-other 全部样本,解码用确定性束搜索,束宽 3,不采样,因此词错误率差异只归因于量化。
构造过程还包括尺寸估计与帕累托整理。尺寸只计线性层解析估计,不计非线性与控制开销。帕累托前沿是按模型尺寸与词错误率找非支配点,用于 20 到 80 MB 预算下的选型。硬件是英伟达 RTX 3080 与 4090、PyTorch 2.4.1,均为推理与仿真环境,非训练资源。缺项是论文未报告校准样本的选取随机种子聚合方式与缩放搜索细节,未测量延迟与功耗,因此不能从尺寸缩小推定延迟同比下降。
数据划分与公平比较条件是什么?
数据按原文交代。校准 400 条来自训练划分,评价分干净集 test-clean 与噪声集 test-other,主结果报 test-clean,test-other 单独成节做泛化。指标是标准文本归一化后的词错误率,越低越好。解码固定为束宽 3 的确定性解码,消除采样随机性。聚合对象是全测试集平均词错误率,未报告置信区间与显著性检验,这是复现时需补的统计验证。
比较公平条件是同一模型、同一校准集、同一解码器、同为仿真量化前向,只有权重格式、激活格式、组大小与是否用 SmoothQuant 不同。组大小 G 指每 G 个元素共享一个缩放,块大小 b 在 NVFP4 与 MXFP4 中对应块缩放粒度。组越细误差越小但缩放开销越大,模型尺寸随之上升。论文还固定量化目标为全部线性层加低精度键值缓存模拟,避免只压部分层造成的不公平。
资源状态是正文开源声明的唯一依据,本次未发现来源绑定且完成 HTTPS 状态验证的资源,不得声称代码、模型或数据已公开。复现只能依赖论文描述的模型名、数据集名与解码配置自行搭建仿真流程。
主结果中谁决定精度,谁决定尺寸?
先看 8 比特。以下比较要回答的问题是在同为 W8A8 下,整数激活与浮点激活谁更稳,公平条件是同模型同解码,指标方向是词错误率越低越好。
| 模型 | 指标 | FP32 个基线 | 对比格式词错误率 | 备注 |
|---|---|---|---|---|
| tiny.en | 词错误率 | 5.88% | 6.39% | FP8 未用平滑 |
| tiny.en | 词错误率 | 5.88% | 6.07% | INT8 未用平滑 |
| base.en | 词错误率 | 4.81% | 4.64% | INT8 加平滑反超基线 |
该表显示未用 SmoothQuant 时 FP8 在 tiny.en 上退化明显,INT8 相对更稳,加平滑后两者都大幅恢复,base.en 的 INT8 加平滑甚至低于浮点 32 个基线。代价是平滑本身不改变模型尺寸,8 比特尺寸约 36.6 MB 与 70.8 MB 量级,收益来自算法而非比特。未胜出项是未加平滑的 FP8,它在小模型上最差,说明不能离开预处理谈格式优劣。
W4A16 × W4A8: W4A16 分工是只压权重到 4 比特、激活保持 16 比特,主攻存储与访存;W4A8 分工是权重与激活同时低比特,主攻计算通路。搭配理由是端侧同时受内存与算子面积约束,必须分清瓶颈在哪,组合意义是论文证明在 Whisper 上保激活比细化权重分组更划算,16 比特激活是第一优先级。
再看 4 比特整数。论文报告激活位宽是主导因素,W4A16 系统性优于 W4A8 与 W4A4,而 INT16 与 FP16 激活路径词错误率几乎相同。base.en 的 W4A16 加平滑在组 8 时做到 4.89% 左右,接近浮点 32。更细的组从 64 到 32 的增益不足 0.4 个百分点却增加约 2 MB,紧预算下应选粗组。
整数激活通路 × 浮点激活通路: 整数激活通路分工是靠定点乘加器跑推理,现有手机神经网络处理器支持成熟;浮点激活通路分工是用浮点乘法器处理重尾分布,对离群更友好。搭配理由是同位宽下两者精度在论文中测得基本无差,但面积差决定硬件选型,组合意义是既然精度打平,就应选面积更小的浮点通路换取单位面积算力。
以下散点图把尺寸与词错误率放在一起,是判断大模型量化是否反超小模型的直接证据。
看图路径: 1. 先看横轴模型尺寸与纵轴词错误率,确认右下为更优方向;2. 再按形状区分三角形 tiny.en 与圆形 base.en 的分布高度;3. 最后沿黑色虚线帕累托前沿看 20 到 50 MB 区间由哪些颜色主导
论文图 2。原论文 Figure 2:“Model size vs. WER (WER ≤20%).”。
该图横轴是模型尺寸 MB,纵轴是词错误率,只显示 20% 以下点,颜色区分 FP32 到 MXFP4,形状区分三角形 tiny.en 与圆形 base.en,黑色虚线是聚焦帕累托前沿。可见 8 比特点聚在左下低误差区,4 比特同尺寸下因格式与激活不同垂直散开,NVFP4 的 W4A16 主导 4 比特前沿,约 36 MB 以上圆形 base.en 系统性低于三角形 tiny.en,支持内存允许时优先压大模型的结论。
消融与失败条件划出可用边界吗?
消融按激活、粒度、平滑三轴组织。激活轴上 4 比特权重配 16 比特激活比配 8 比特好 1 到 3 个百分点,配 4 比特更差,证明保激活优先。粒度轴上 NVFP4 从组 8 到 128 逐步退化,INT4 细组收益递减。平滑轴上 8 比特下稳定增益,NVFP4 下增益不一致,有时甚至波动,说明平滑不是万能。
3 比特是可用性极限。W3A3 灾难性崩溃,词错误率超 100%,tiny.en 在任何配置下都不可接受,base.en 仅 W3A8 加平滑在组 4 时做到 5.34% 左右,但细粒度让尺寸超过 INT4 替代方案,无内存收益,论文判断需量化感知训练才实用。
以下两组数字专门标出最强点与失效点,比较条件都是标准训练后量化、无额外算法修正,指标仍是词错误率越低越好。
| 模型 | 配置 | 词错误率 | 与基线差距 | 压缩倍数 |
|---|---|---|---|---|
| base.en | NVFP4 W4A16 组 16 | 4.88% | 0.07% | 6.4× |
| base.en | INT4 W4A16 加平滑组 8 | 4.89% | 0.08% | 权重 4 比特 |
| base.en | FP32 个基线 | 4.81% | 基准 | 1× |
该表的主要收益是 NVFP4 的 W4A16 以 6.4 倍压缩做到接近无损,具体代价是需要细块缩放与浮点重缩放硬件支持。反例在下一表,MXFP4 在标准流程下严重退化,tiny.en 达 38% 到 94%,base.en 达 12% 到 24%,test-other 上 base.en 达 38% 到 60%、tiny.en 达 86% 到 269%,确认是 E8M0 粗糙而非数据集特异。
| 模型 | 配置 | 词错误率区间 | 测试集 | 结论 |
|---|---|---|---|---|
| tiny.en | MXFP4 W4A8 | 38%–94% | test-clean | 需算法修正 |
| base.en | MXFP4 W4A8 | 12%–24% | test-clean | 需算法修正 |
| 全模型 | 基线对比 | 2.2×–2.5× | test-other 高于 clean | 噪声集压缩差距 |
表后解释是 test-other 基线本身高 2.2 到 2.5 倍,量化差距被吸收,激活优势从 1 到 3 个百分点收窄到约 0.1 个百分点,因此格式比较应以干净集为准。未评测边界是更大 Whisper 变体、真实设备延迟与 3 比特训练方案,论文均未覆盖。
哪些结论不能推广?
论文直接报告的是 tiny.en 与 base.en 英文模型在 LibriSpeech 上的仿真量化结果,有限解释是激活位宽主导与浮点通路面积优势,待验证推测是该规律能否外推到大模型、多语与流式场景。缺失证据不是技术错误,但相关性不是因果,例如尺寸缩小不等于延迟下降,词错误率打平不等于听感无差。
限制有四。第一,只做仿真,前向仍是浮点 32 算术,未测真实神经网络处理器延迟与功耗。第二,只用束宽 3 确定性解码,未测贪心与采样下的误差累积差异。第三,未做统计显著性,0.07 与 0.08 个百分点差距是否稳定需多次校准重复。第四,MXFP4 结论限于标准训练后量化,加算法修正后可能恢复,论文引用前人工作提示需额外修复,不能直接判该格式无用。
总体趋势不等于每组都成立,例如 SmoothQuant 在 NVFP4 下增益不一致,细组有时更差。训练资源、推理开销、输出帧率与实际延迟应分别讨论,论文只给了尺寸解析估计与面积引用,未测键值缓存超过 5% 的长音频情形,固定 30 秒窗口是其权重主导结论的前提。
复现先做什么,后补什么验证?
何时值得尝试是内存预算在 20 到 80 MB、能接受 16 比特激活通路、且可用 NVFP4 块缩放的端侧语音项目。若只能优化一件事,先保激活 16 比特,再谈权重 4 比特。若预算高于约 36 MB,优先量化 base.en 而非 tiny.en,论文给出 base.en 约 44.1 MB 做到 4.88%,优于 tiny.en 约 27.3 MB 的 6.22%。
复现先做 5 步。第一,按论文装 tiny.en 与 base.en,锁定全部线性层加键值缓存量化目标。第二,用训练划分取 400 条做校准,不碰测试集。第三,实现对称权重与非对称激活网格,FP8 用 E4M3,NVFP4 做全局浮点 32 加 FP8 块缩放,MXFP4 做 E8M0 2 的幂缩放。第四,固定束宽 3 确定性解码跑 test-clean 得基线 5.88% 与 4.81% 量级。第五,先跑 W8A8 与 W4A16 两条主线,核对激活 16 到 8 比特的 1 到 3 个百分点落差是否复现。
还需补的验证是多次随机校准的方差、test-other 上的区间、以及细组下每组浮点重缩放的硬件成本。区分代码开源、权重下载与系统可运行,本次无可用资源状态,只能自建仿真,不能声称官方代码已公开。关键超参数与信息条件是组或块大小、是否用 SmoothQuant、激活用整数还是浮点精度,三者必须同表记录,否则数字不可比。
六条部署指南如何收束?
论文收束为 6 条指南。第一,激活通路选浮点而非整数,INT16 与 FP16 精度几乎无差,但浮点乘法器小 1.4 到 2.4 倍。第二,激活位宽是最重要的旋钮,16 到 8 比特掉 1 到 3 个百分点,细化权重组收益小。第三,块缩放质量与位宽同等重要,MXFP4 的 2 的幂缩放需额外修正,NVFP4 的 FP8 块缩放无需额外步骤做到 4.88%。第四,细组需双精度硬件支持,组小于等于 16 时低精度累加后要逐组浮点重缩放。
第五,Whisper 内存由权重主导,固定 30 秒窗口下键值缓存不足 5%,压权重是主杠杆,这与自回归大模型不同。第六,有疑问时压大模型,40 到 50 MB 预算即可接近无损。
对初学者的特有误解要澄清。误解一是位宽越低越省就越好,正解是激活 8 比特的计算节省要用 1 到 3 个百分点精度换,是否值得看场景。误解二是浮点一定贵,正解是在同位宽乘法器面积上浮点反而小,贵的是细粒度带来的缩放与控制。误解三是 MXFP4 失败是实现 bug,正解是标准流程下 E8M0 表达力不够,需算法级修正。
最终判断是 W4A16 加 NVFP4 是当前最稳的端侧组合,INT16 与 FP16 可互换给硬件留出灵活性。未来工作按论文点到大模型变体、3 比特量化感知训练与真机延迟测量,初学者若要跟进,应先补统计重复与硬件实测,再谈新格式。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

