英文题目:Pushing the Limits of Compression: Sub-1-Bit Conformer via Variable-Rank Binary Decomposition
会议身份:
conference:interspeech:2026:conference-paper-id:yeo26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#模型量化 #高效推理 #端侧运行 #语音 #语音识别
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jinsu Yeo:机构信息未能从会议 PDF 纯文本可靠映射
- Banseok Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Youngmin Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为语音声学特征、输出为词序列的Transducer识别面临编码器冗余而预测网络敏感的结构不对称,整数舍入最近邻量化(Round-to-Nearest,RTN)被1比特下限锁死而无法继续压缩。所提LittleASR先以校准集任务损失梯度平方均值计算层敏感度,再以预算偏差与敏感度加权秩惩罚做可微比特搜索并经标量偏移二分搜索严格对齐目标平均比特,最后将优化比特映射为二值低秩分解之秩并做量化感知训练(Quantization-Aware Training,QAT)。与整数网格不同,秩步进以约0.002比特粒度调节有效位宽,使编码器进入亚1比特而解码器保持高秩。优化器将冗余编码器浅层压至低比特而深层语义层与值投影保留较高保真度,从而实现细粒度预算再分配并维持识别精度。在LibriSpeech上混合秩1.0比特dev-other词错率(Word Error Rate,WER)为6.01%,优于张量粒度AbsMean基线的6.30%,并可下探至7.1 MB。该结论仅在约120M参数Conformer-Transducer Large与英文朗读语音验证,未覆盖噪声、口音、流式与多语外推。原文明确承认硬件收益仅为理论运算量,未做实测时延、吞吐与功耗评估。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么端侧放不下?
这篇论文研究的输入是连续语音,目标是自动语音识别。研究生可以这样建立第一印象:麦克风进来的是一串随时间变化的声学特征,模型要输出对应的文字序列。论文用的骨干是 Conformer-Transducer,它把卷积擅长的局部特征抽取和 Transformer 擅长的全局上下文建模放在一起,再用 Transducer 结构处理语音与文字长度不对齐的问题。
端侧难点的关键在存储与搬运。论文报告的起点模型是 120,000,000 参数级别的 Conformer-Transducer Large,浮点基线需要数百兆字节。手机或耳机这类设备内存带宽与功耗受限,大模型不仅存不下,而且推理时反复搬运权重本身就很贵。压缩的目标因此很具体:在尽量不升高词错误率的前提下,把模型尺寸压到十几兆甚至个位数兆字节。
这里要先固定评价语言。后文词错误率越低越好,模型尺寸越小越好。论文主要在 LibriSpeech 的 dev-other 与 test-other 等划分上报告词错误率,同时报告模型尺寸。dev-other 是更难的开发集,常被用来选检查点与画帕累托前沿;test 集用来确认泛化。理解这一点,后面看到 6% 与 11% 的数字才知道是在哪个难度下比较。
附录:术语速查与符号指向
词错误率是识别错词比例,越低越好;有效每权重比特数是把压缩后总存储折算到每个权重的平均比特,可小于 1;内秩是二值因子中间维度,越大容量越大。编码器、预测网络解码器、联合网络是 Transducer 三大部件,敏感度是层梯度平方均值,预算是目标平均比特。
符号指向为复述服务:权重矩阵的行列维度决定秩步长对应的比特粒度;行缩放、列缩放、隐缩放分别补偿输出、输入与基向量重要性;二值矩阵只存正负 1。阅读公式时先认输入与输出,再认缩放的广播位置,最后认秩的宽窄含义,不要把缩放当成偏置。
已有压缩路线走到哪里,为什么卡在 1 比特?
进入压缩前,先把相关路线按相同任务与相同运行阶段对照。论文对比的直接路线是权重整数量化。白话说,整数量化是给每个权重只留几个离散档位,例如 4 比特、2 比特、1 比特。英文常写作 quantization,舍入到最近整数的基线写作 Round-to-Nearest,缩写 RTN。论文还对比了 AbsMean 二值化,它把权重变成正负 1 并用均值类缩放恢复幅度,分组与整张张量两种缩放都在比较之列。
这些方法的共同约束是离散网格。整数位宽只能取 1、2、4 这样的整数,最小就是每权重 1 比特。论文把这称为结构下限。实验上,4 比特 RTN 还能保持精度,2 比特开始掉点,1 比特 AbsMean 在约 18 至 22 兆字节附近徘徊,但再往下就没有整数档位可用。小于 10 兆字节的极端需求对应小数比特,例如 0.4 或 0.2 比特,整数框架在物理上表达不出来。
另一条背景是 Transducer 内部不对称。编码器负责声学特征,相对鲁棒;预测网络与联合网络负责自回归的语言上下文,一旦近似误差累积就容易上下文崩塌。因此前人多用保守混合精度:编码器压到 1 至 4 比特,解码器留在 4 至 16 比特。论文指出这会形成僵局:解码器不敢动,总尺寸要再降,只能继续压编码器,但编码器又撞上 1 比特墙。
整数 round-to-nearest 量化 × 二值低秩分解: 整数 round-to-nearest 量化负责把已有权重就近映射到离散整数网格,分工是简单直接但最小只能到 1 比特每权重;二值低秩分解负责把大矩阵写成两个正负 1 小矩阵加浮点缩放,分工是用秩控制近似容量;搭配理由是前者被网格锁死无法进入亚 1 比特,后者把位宽换成秩这个准连续旋钮,组合意义是让编码器可以用 0.3 至 0.8 比特工作而解码器保留更高秩。
这就引出论文的选择:不继续在整数网格里找更巧的舍入,而是换表示,用秩来获得准连续的预算。
附录:与整数量化对照的阅读方法
对照时坚持同输入、同目标、同运行阶段。整数量化与本文都是权重压缩、都是离线压缩后部署、都在 LibriSpeech 上测词错误率,因此尺寸与词错误率可比。若换成流式或噪声集,则条件已变,不能直接引用本文的胜负。
类别差异不当胜负。GenPTQ 类的混合精度最终回到整数,而本文映射到秩,两者优化目标相似但执行空间不同;AbsMean 的分组缩放与张量缩放精度不同,比较时要指明是哪一种。本文在 1.0 比特胜过张量级 AbsMean,不等于胜过所有二值化变体。保留基线全称与配置,才能让后人可核对。
压缩僵局到底卡在哪一个矛盾上?
把问题收敛成一句话:总预算要降,敏感部件不敢降,不敏感部件已降到整数下限。论文的 Conformer-Transducer 包含编码器、预测网络解码器与联合网络。编码器层数多、参数占比大,是省预算的主力;解码器虽小,但决定自回归稳定性。
举一个教学用的例子,不代表论文数值:假设总预算只剩原来十分之一,若均匀降位,解码器会先崩;若只保解码器,编码器按整数最低 1 比特仍然太大。这就是论文所说的压缩僵局。解决思路必须同时满足两点:第一,能让编码器进入亚 1 比特;第二,能把省下的预算定向补给解码器。
编码器 × 预测网络解码器: 编码器负责从声学特征抽取鲁棒表示,对量化噪声不敏感,分工是可激进压缩的对象;预测网络解码器负责自回归维护语言上下文,对近似误差高度敏感,分工是必须保 fidelity 的对象;搭配理由是两者敏感度不对称,组合意义是把总预算从编码器省出来补贴解码器才能在极小总尺寸下维持识别。
论文因此把任务形式化为在给定目标平均比特下为每一层选秩。目标平均比特是硬件能接受的总尺寸换算,层秩是执行变量,敏感度是引导信号。后文的方法、训练与实验都是围绕这个分配问题展开。
LittleASR 全景:一个样本如何走完压缩后的前向?
先沿一个样本走完全程。输入是一段语音的声学特征,先进 Conformer 编码器做声学建模,再与预测网络给出的历史文字状态在联合网络汇合,输出每个时刻的文字概率。论文不动整体流程,只替换占参数大头的线性变换,包括前馈线性层、点卷积经重整后的矩阵乘法以及长短期记忆网络门投影。
替换后的前向不再重建稠密大矩阵。白话说,原来是 1 次大矩阵乘法,现在拆成 2 次小的二值矩阵乘法加几次逐元素缩放。输入先乘列缩放,再过二值矩阵,再乘隐缩放,再过另一个二值矩阵,最后乘行缩放。这样内存搬运的主要部分变成正负 1,浮点只剩 3 个向量。论文强调这对边缘推理重要,因为瓶颈是带宽而非单纯计算。
有效每权重比特数 × 内秩: 内秩负责决定二值因子中间维度的大小,分工是结构容量控制器;有效每权重比特数负责把该容量折算成和整数量化可比的存储代价,分工是预算语言;搭配理由是层尺寸固定时秩加一仅对应约 0.002 比特变化,组合意义是绕开 1 比特整数步长实现 0.1 至 2.0 比特的细粒度预算。
下面先看分解的结构图,再理解敏感度如何决定每层用多大的秩。
这段导读对应分解架构图,左侧是待压缩的大权重,右侧是分解后的缩放向量与二值因子,中间秩是宽窄控制器,阅读时重点看浮点与二值在图例中的区分。
看图路径: 1. 先看左侧大方块标注的输出维乘输入维,确认被分解对象是稠密权重;2. 再看右侧从外到内 h、Ub、l、Vb、g 的排列与下方图例的浮点向量和二值张量区分;3. 注意中间 l 下方标注的 r,理解它是控制宽窄的秩
论文图 2。原论文 Figure 2:“Architecture of LittleASR (Binary SVD). We replace the weight matrix W with a product of two low-rank binary ma- trices (Ub, V⊤”。
从像素看,左侧浅色大方块代表稠密权重,右侧从左到右依次是行缩放、第一个二值梯形、中间隐缩放、第二个二值梯形与列缩放,图例明确区分浮点张量、浮点向量与正负 1 二值张量。中间隐缩放下方标注的秩越小,两个梯形越窄,对应有效比特越低;秩越大,越接近高保真重建。这解释了为什么调秩就能连续调尺寸,而不需要换整数档位。
分解与分配各管什么,为什么能进入亚 1 比特?
分解部分管表示。每个权重矩阵近似为行缩放对角阵乘第一个二值矩阵,再乘隐缩放对角阵,再乘第二个二值矩阵转置,最后乘列缩放对角阵。二值矩阵只存符号,取值为正负 1,作为隐浮点矩阵的符号;3 个缩放都是浮点向量,其中隐缩放学习每个二值基向量的重要性,用来补偿语音特征动态范围大带来的误差。训练时二值离散点用直通估计器传梯度,这是后文训练节的前提。
分配部分管预算。论文先在小校准集上累积梯度,计算每层参数梯度平方的均值作为敏感度分数。假设是梯度大的层更怕量化噪声。经验上编码器浅层敏感度低,深层逐渐升高,解码器与联合网络显著更高。接着把比特分配写成连续优化问题:一项迫使平均比特接近目标,另一项按敏感度惩罚敏感层减秩。
与 GenPTQ 不同,论文不把优化结果 rounding 到整数,而是直接映射到细粒度内秩。对 512 乘 2048 这类层,秩加一仅对应约 0.002 比特,因此称为准连续。
最后用二分搜索找一个全局偏移,保证加权总比特严格等于目标总尺寸。投影操作把每层比特裁到可行区间。论文强调这一步让最终模型能精确命中例如 20 兆或 10 兆的硬件预算,这是离散量化难以做到的。
这段导读对应总览图,左中右三块分别讲部件分工、连续曲线与高低秩结构,阅读时先看左边的保真与激进标注,再看中间黄色曲线如何穿过 1 比特线。
看图路径: 1. 先看左面板编码器在下、联合网络与解码器在上的连接与保真度标注;2. 再看中面板横轴敏感度到纵轴比特宽度的黄色连续曲线与灰色阶梯基线的区别;3. 对比右面板小编码器与大解码器两行结构中 l 宽度的变化
论文图 3。原论文 Figure 3:“Overview of LittleASR. (a) Sensitivity-Guided Allocation: Unlike discrete RTN, our continuous rank adaptation unlocks the sub-1-bit regime for the robust Encoder while allocating…”。
从像素看,左面板把编码器标为允许激进压缩,把联合网络与解码器标为需要保真;中面板横轴是敏感度,纵轴是比特宽度,灰色虚线阶梯是 RTN 基线在 1 比特处截断,黄色连续曲线从编码器区的约 0.35 比特平滑上升到解码器区的约 1.9 比特,直观展示亚 1 比特区如何被解锁;右面板上下两行对比小编码器与大解码器的隐维度宽度,配文说明秩是连续滑杆,低秩给编码器,高秩给解码器。
梯度敏感度 × 秩分配: 梯度敏感度负责用校准集上每层参数梯度平方均值估计该层怕压缩的程度,分工是给出先验排序;秩分配负责在总平均比特目标下决定每层用多大的内秩,分工是执行预算;搭配理由是敏感层减秩惩罚大、不敏感层减秩惩罚小,组合意义是优化器自动形成编码器低秩、解码器高秩的分布。
需要提醒的是,敏感度只是先验,不是因果证明。后文消融用反向分配验证了它的必要性,但梯度大等于怕压缩仍是启发式假设。
秩如何搜出来,权重如何练出来?
训练与构造分 3 个阶段,动作要分清。第一阶段是校准,不更新模型权重,只在 80 条校准语音上跑前反向,累积每层梯度平方得到敏感度并归一化。论文明确用 80 条,这是复现时必须保留的预算条件。
第二阶段是可微秩搜索。把每层有效比特初始化为目标值,使预算项初始为零,再用 Adam 优化器最小化预算偏差加敏感度加权惩罚,权重分别取 100 与 1,重罚尺寸以严格命中目标。每步后把比特投影到每层上下界。目标不同,搜出的秩分布不同,因此 0.2、0.4、0.6、0.8、1.0 比特各是 1 次独立分配结果,不能把一组秩直接缩放当成另一组。
第三阶段是固定秩后的量化感知训练。论文对 Conformer-Transducer Large 做权重-only 训练,跑 100 轮,余弦退火,学习率 5.0 乘 10 的负 4 次方,用 8 块 A100,按 dev-other 词错误率选检查点。Conv2d 层用 RTN 定到 4 比特,深度卷积与嵌入层留在 16 位浮点,分解的缩放向量也留在 16 位浮点且计入模型尺寸。点卷积与门投影先在数学上等价改写为矩阵乘法再分解。
直通估计器 × 量化感知训练: 直通估计器负责在反向时绕过正负 1 离散化的不可微点,分工是让二值因子能收到梯度;量化感知训练负责在已定秩结构下继续用任务损失微调缩放与因子,分工是补偿分解误差;搭配理由是只定秩不微调会留残差,只微调不定秩则找不到亚比特结构,组合意义是先搜秩再训练得到可部署的小模型。
论文未报告梯度在缩放与隐因子之间的逐路细节,也未给出搜索迭代数与校准之外的随机种子处理,复现时应把这些记为缺项,不要从模型名推定实现。
在什么数据与基线上测,指标方向是什么?
数据是 LibriSpeech,基于公开有声书的语音识别语料。论文报告 dev-clean、dev-other、test-clean、test-other 上的词错误率,帕累托图聚焦更难的 dev-other。模型起点是 NVIDIA NeMo 的 STT 英文 Conformer-Transducer Large LibriSpeech 版本,约 120,000,000 参数。资源状态方面,本次没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,只能按论文文字复述 NeMo 与 LibriSpeech 的来源描述。
基线覆盖可运行的整数量化:浮点基线、通道级 RTN 的 4 比特与 2 比特、AbsMean 的分组与整张张量 1 比特,以及 LittleASR 自身的均匀秩与梯度感知混合秩。比较的公平条件是都经过量化感知训练,且模型尺寸把缩放向量开销计入。指标方向固定:词错误率越低越好,尺寸与有效比特越小越好。
论文特有细节有两类值得初学者注意。第一是目标层选择,只对参数重的点卷积、门投影与线性层做极端压缩,轻量模块不动,这是尺寸与精度的折中。第二是预算表达,论文同时用有效每权重比特与兆字节报告,例如 0.2 比特对应约 7.1 兆,0.4 比特对应约 10.0 兆,1.0 比特对应约 18.8 兆,便于对照硬件预算。
主结果:亚比特到底赢在哪里,输在哪里?
比较问题很直接:在相近或更小尺寸下,混合秩能否在难集上保持更低的词错误率,且能否进入整数基线去不了的尺寸。公平条件是同为 LibriSpeech 上的 Conformer-Transducer Large 经量化感知训练,指标是词错误率越低越好。
这段导读对应帕累托前沿图,横轴向左是尺寸变小,纵轴向下是词错误率变低,阅读时先找左侧整数基线孤点,再看两条 LittleASR 曲线向小尺寸延伸的长度。
看图路径: 1. 先确认横轴是模型尺寸、纵轴是开发集其他子集词错误率,越左下越好;2. 再区分均匀秩蓝色空心线与混合秩红色实心线在小尺寸端的分叉;3. 观察左侧整数量化基线点与右侧亚比特区间的可达性差异
论文图 1。原论文 Figure 1:“Pareto Frontier of WER vs. Model Size.”。
从像素看,纵轴是 dev-other 词错误率百分比,横轴是模型尺寸,左上方有两个高位孤点对应 RTN 与 AbsMean 基线,中间偏右是 1.0 比特附近的混合秩与均匀秩点,红色混合秩实线在向 10 兆以内延伸时明显低于蓝色均匀秩空心线,红色线上还标注 0.8、0.6、0.4 比特,说明混合分配在极端区拉开差距,且曲线进入了整数方法没有点的亚比特区间。
下表把论文文字中可逐字核对的关键点整理成可比形态,表头单位按原文保留,数据格保留裸值以避免擅自添单位,阅读时重点对比同比特下混合与均匀的差值以及跨尺寸的代价。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 1.0 有效比特,开发集其他 | 词错误率 | 均匀秩 6.34 | 混合秩 6.01 | 张量级绝对均值 6.30 |
| 0.8 有效比特,开发集其他 | 词错误率 | 整数 2 比特舍入最近 7.08 | 均匀秩 6.93 | 模型尺寸 33.0 兆对 15.8 兆 |
| 0.2 有效比特 | 模型尺寸 | 整数基线无法运行 | 7.1 兆 | 极端压缩区间 0.2 至 0.6 |
该表显示,在 1.0 比特处混合秩以 6.01% 胜过均匀秩的 6.34% 与张量级基线的 6.30%,支持敏感度分配的有效性;在 0.8 比特处均匀秩以 6.93% 胜过 2 比特 RTN 的 7.08%,同时尺寸从 33.0 兆降到 15.8 兆,支持二值分解本身的效率;代价同样清楚,0.4 与 0.2 比特下词错误率快速上升到 8% 至 16% 量级,且论文未给出延迟与功耗实测,不能把理论操作数下降直接当成端侧加速。未胜出项也要记住:在 1.0 比特附近混合秩相对均匀秩只是可比到小胜,真正拉开差距的是 0.2 至 0.6 比特的极端区。
附录:数字核对口径
核对每个数字时同时确认数据集、模型、阶段、指标与聚合对象。6.01% 与 6.34% 都是 1.0 比特下 dev-other 词错误率,前者混合秩,后者均匀秩;6.93% 是 0.8 比特均匀秩 dev-other,7.08% 是 2 比特 RTN dev-other;7.1 兆对应 0.2 比特混合秩总尺寸。百分点差值与相对百分比不同,本文的差距应表述为百分点,不能写成相对提升。
不同指标差值不混放。模型尺寸差与词错误率(%)差各说各的,不能把 33.0 兆到 15.8 兆的缩小与词错误率下降放在同一列比较。自动词错误率不是人评可懂度,低词错误率不等于端侧体验好,部署前还需补延迟与功耗实测。
分配做对了吗,反向分配会怎样?
消融要回答预算给谁才对。论文固定总尺寸为 10 兆即 0.4 比特,对比 3 种策略:均匀分配、反向优先级即编码器高比特解码器低比特,以及本文的编码器低比特解码器高比特。指标仍是词错误率越低越好。
这段导读对应层敏感度与比特分配图,上面板是敏感度,下面板是有效比特,横轴都是编码器层号加右侧解码器部件,阅读时先看敏感度随层加深上升,再看比特是否同向上升。
看图路径: 1. 先看上面板对数纵轴的层敏感度随编码器层号上升的趋势与右侧解码器高点;2. 再看下面板有效比特分配同样随层加深而上升的对应关系;3. 注意图例颜色区分自注意力、前馈、卷积与联合网络,线型区分子部件
论文图 4。原论文 Figure 4:“Visualization of the learned bit allocation.”。
从像素看,上面板纵轴为对数刻度的敏感度,编码器 0 至 16 层各颜色曲线总体上扬,右侧解码器与联合网络的菱形点显著更高;下面板纵轴为有效比特,同样随层号上升,早期编码器层多在 0.3 至 0.5 比特,深层升至 1.25 至 2.0 比特,右侧联合网络与预测网络点保持高位。图例颜色区分自注意力、前馈、卷积与联合网络,线型区分子部件,细节上注意力值投影高于键查询投影,说明内容载荷比路由逻辑更需要精度。
下表整理固定预算下的反证,表头保留原文条件,数值保留裸值,阅读时重点看反向分配是否一致变差。
| 预算 10 兆 0.4 比特 | 编码器精度 | 解码器精度 | 纯净集词错误率 | 其他集词错误率 |
|---|---|---|---|---|
| 均匀 | 0.4 | 0.4 | 5.08 | 11.07 |
| 反向优先级 | 高 | 低 | 5.72 | 12.79 |
| 本文混合 | 低 | 高 | 3.57 | 8.75 |
表后解释必须同时讲收益与代价。收益是本文分配在纯净集与其他集上分别以 3.57% 与 8.75% 明显胜过均匀的 5.08% 与 11.07%,而反向分配以 5.72% 与 12.79% 差于均匀,支持解码器保真关键的判断。代价与边界是该结论只在 10 兆预算与 LibriSpeech 上验证,未测试其他预算下反向是否同样差,也未评测噪声或口音等分布外条件,不能推广为所有语音任务都该如此分配。
哪些量没测,哪些结论不能推广?
先划清论文直接报告与待验证推测。直接报告的是尺寸与词错误率的权衡,以及固定预算下分配方向的反证。有限解释是梯度敏感度揭示编码器冗余、解码器敏感,这得到分配结果支持,但敏感度本身是启发式,未做因果检验。
未测量项要明确。论文的计算效率分析是理论操作数:以 512 乘 2048 前馈层在 0.5 比特秩约 205 为例,浮点操作从约 2.10 兆降到约 0.52 兆,另有约 0.52 兆二值操作。原文明确说这只是理论计数,不是实测延迟、吞吐或功耗,硬件级评估留待未来工作。因此不能声称端侧一定更快更省电。同样,误判率之外的公平性、长尾词、流式延迟都没有报告。
适用边界也要收紧。结论依赖 Conformer-Transducer Large 与 LibriSpeech 英文朗读语音,深层语义层需要更高秩的观察可能不适用于噪声对话或多语场景。缩放向量与部分卷积仍为浮点,极端尺寸下这部分占比不可忽略。训练需要 100 轮量化感知训练与 8 卡资源,复现成本不低,小实验室需评估预算。
要复现,先固定什么,再跑什么?
复现清单按学习依赖排序。先固定起点:NVIDIA NeMo 的 Conformer-Transducer Large LibriSpeech 检查点、LibriSpeech 划分与词错误率聚合口径,以及模型尺寸把浮点缩放计入的口径。基线至少复现通道级 RTN 与 AbsMean 分组与张量级,并确认浮点基线在 dev-other 与 test-other 上的位置,避免用不同解码配置比较。
再跑分配:用 80 条校准语音计算层梯度平方均值,检查编码器浅层低、深层高、解码器更高的排序是否出现;用预算权重 100 与敏感度权重 1 搜秩,再二分偏移精确命中目标平均比特。建议先复现 1.0 与 0.4 比特两个点,前者验证混合相对均匀的小胜,后者验证反向分配变差的反证。
最后做训练:固定秩后跑量化感知训练,直通估计器处理二值点,余弦退火从 5.0 乘 10 的负 4 次方开始,按 dev-other 选点。记录每层的有效比特与最终兆字节,核对 0.2 比特约 7.1 兆、0.4 比特约 10.0 兆的数量级。若敏感度排序不出现或尺寸对不上,应先查校准采样与投影区间,而不是调大解码器秩凑数。
何时值得尝试这种亚比特路线?
当硬件预算明确卡在 10 兆左右且整数 1 比特仍太大时,这条路线值得尝试。它的核心动作是把压缩单位从整数档位换成秩,用编码器的冗余换解码器的稳定。LibriSpeech 上的证据支持它能进入 0.2 至 0.6 比特区间并在混合分配下保持相对更稳的词错误率。
当解码器本身很大、任务对上下文极敏感,或没有量化感知训练预算时,应谨慎。此时硬压编码器可能连带损害深层语义,理论操作数下降也不等于实测延迟下降。先做小预算验证:固定 10 兆对比均匀、反向与混合三者,若混合未胜出,说明敏感度假设在你的数据上不成立,不必继续往 0.2 比特走。
记住论文特有的误解:亚 1 比特不是每层都小于 1 比特,而是平均值小于 1 比特,解码器与联合网络仍高于 1 比特;准连续不是真正连续,秩仍是整数,只是步长远小于 1 比特。抓住平均与分布的区别,才能正确复述方法。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



