标签:#语音识别 | #模型量化 | #端侧运行 | #高效推理 | #语音
评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
👥 作者与机构
- Taichi Nishimura:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
输入为80维对数梅尔谱图Log-Mel Spectrogram,输出为联结时序分类Connectionist Temporal Classification(CTC)转写,难点是0.6B参数Conformer的归一化、Softmax与非线性仍需浮点回退而无法完全卸载到移动端神经网络处理器Neural Processing Unit(NPU)。方法链分三步:先将内容分支与位置分支按各自量化尺度重归一到统一分数网格并把相对位移实现为整数索引搬移,再用极小化极大准则直接拟合Swish输出的多项式近似,最后对批量归一化Batch Normalization(BN)输出与预编码器分别采用宽网格与分位数定标。相对已有整数推理仅拟合Sigmoid或Tanh且忽视双分支异尺度的做法,该工作把误差目标对准最终激活输出并保留全整数数据流。在LibriSpeech test-other上整数整机系统相对浮点基线损失约1.21个百分点并实现远低于实时的延迟,证明现代Conformer可摆脱浮点推理。该结论目前仅在特定手机与静态图分段编译下验证,长语音、噪声与多语言外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
第三方资源:https://github.com/mudler/parakeet.cpp — 链接可访问(HTTP 200)
第三方资源:https://www.cpplab.net/web/dsp/ — 链接不可用(HTTP 403)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要保留什么?
这篇解读的输入是编号 2609.30846v1 的论文原文证据,目标是让刚进入语音识别与音频建模的研究生能够核对关键做法并用自己的话复述方法。必须保留的信息包括研究对象是参数量 0.6B 的 Parakeet-CTC,部署性质是整数推理,即全网没有浮点算子也没有中央处理器回退,运行位置是消费级智能手机的神经网络处理器,评价指标是词错误率、实时率与峰值内存。输出是 1 篇按学习依赖展开的中文技术解读,不做营销式判断,不补充证据之外的数值。
学习路径是先理解自动语音识别要把可变长的对数梅尔频谱变成文字,再理解 Conformer 为何同时需要自注意力抓全局依赖和卷积抓局部依赖,再进入整数化带来的 3 个具体障碍,最后对照手机实测与仿真消融。白话来说,整数化不是简单把权重变小,而是要求编译时就为每个张量固定一张整数网格,运行时只做整数乘加、乘固定点系数再右移、查表与搬移。
如果某处仍需浮点做归一化、Softmax 或非线性,整条链路就不能完全卸载到整数加速器,这正是论文要解决的部署性质问题。
已有路线解决了什么,还剩什么没在真机上验证?
已有路线可以分成 3 条。第一条是量化压缩,用 8 比特整数存权重,把 Parakeet-CTC 从单精度下的 2.4 GB 压到 600 MB 左右,缓解内存压力,但多数做法在计算时又把权重反量化回半精度或单精度,用于稳定归一化、Softmax 和非线性等对数值敏感的操作。第二条是整数核设计,以 I-BERT 为代表,为层归一化、Softmax 和 GELU 设计整数算子,并扩展到语音识别的卷积与 Conformer 模型,但论文指出这类工作的硬件证据停留在图形处理器,没有回答整数 Conformer 是否真能在手机神经网络处理器上跑起来。
第 3 条是工具链自动转换,用高通等厂商软件开发包把同一检查点转成半精度或 8 比特训练后量化,但论文报告这两条现成路径在该模型上都得到 100.0 的词错误率,说明工具默认的浮点范围与量化策略不足以覆盖该模型的激活分布。因此剩下的缺口很具体:相对位置自注意力的双分支不同尺度如何融合,Swish 应该按什么误差准则拟合,以及哪几个张量的动态范围需要特殊网格。把这三点讲清,就能理解论文贡献为何是三项而不是一项。
为什么 0.6B 的 Conformer 难以直接搬到手机 NPU?
困难来自规模与数值敏感性同时存在。规模上,编码器有 24 个 Conformer 块,模型维度是 1024 维,输入是 80 维对数梅尔频谱,预编码器先用 3 次步长卷积把帧率降为八分之一,再投影到模型维度,得到长度为输入帧数除以 8 向上取整的特征序列。每个 Conformer 块按残差顺序经过前馈、相对位置多头自注意力、卷积块和第二个前馈,中间穿插多个层归一化,卷积块内部又是逐点卷积、门控线性单元、深度卷积、批量归一化、Swish 与逐点卷积的 5 段流水线。
数值敏感性上,层归一化要做均值方差,Softmax 要做指数归一化,Swish 内部包含 Sigmoid,这些操作在低精度下容易溢出或损失分辨率。手机神经网络处理器要求静态形状与整数网格,如果某个张量的最大值远超主体分布,统一网格就会被离群值撑大,主体只剩很少量化等级。论文用校准集上的逐层范围分析把问题定位到两处:一是卷积块中批量归一化输出的通道缩放系数跨越 4 个数量级,二是预编码器激活的最大值与 99.9 百分位之比达到 11 到 21 倍,而编码器内部该比值只有 2 到 3 倍。
这就解释了为何默认的 8 比特最大值截断会显著退化,而把所有张量都加宽又会损害吞吐,必须做有针对性的补救。
I-Parakeet 的全景做法是什么,先沿一个样本走一遍
沿一个样本走一遍最容易建立全景。输入是一段语音的 80 维对数梅尔频谱,帧数为输入帧数。预编码器用 3 次带步长的卷积加 ReLU 把帧数压缩到约八分之一,再经线性层投影到 1024 维,得到特征序列。接着 24 个 Conformer 块逐块变换表示,每个块内部先做层归一化再进子模块,并用残差相加保留原信息,最后由线性连接时序分类头把每帧映射到词表大小,再用贪心解码得到转录。
整数化的全景是为每个张量离线定好截断范围与量化步长,权重按通道定范围,激活按张量定范围,默认 8 比特,只在批量归一化输出处用 16 比特,只在预编码器处用百分位截断。线性层与卷积在运行时只做整数矩阵乘、在 32 位整数中累加、再乘离线算好的定点乘子并右移 16 位,不出现浮点比值与除法。层归一化与 Softmax 沿用 I-BERT 的整数核,相对位置注意力用新推导的融合重整化,Swish 用新优化的多项式逼近。这样整网在编译时就是整数图,可以整体卸载到神经网络处理器。
理解这条主路径后,再看 3 个组件各自解决哪一段的尺度与近似问题,就不会迷失在公式细节中。
双分支分数如何换到同一网格再做相对位移?
相对位置自注意力是 Conformer 的核心。对一个注意力头,先由块输入经线性投影得到查询、键与值,再由正弦相对位置嵌入投影得到位置矩阵,并带有两个可学习的偏置向量。注意力分数拆成内容分支与位置分支,前者是查询加偏置后与键相乘,后者是查询加另一偏置后与位置矩阵相乘再经相对位移操作对齐到绝对键位置,两者相加除以键维度的平方根后做 Softmax,再与值相乘得到输出。
整数化的难点是两个分支在编译时各自独立定标,内容分支近似为内容尺度乘内容整数,位置分支近似为位置尺度乘位置整数,两个尺度一般不相等,因此不能直接把两个整数分数相加。论文的做法是给定融合分数的目标网格,把换算、相加与除以平方根 fused 成 1 次重整化:内容整数乘内容系数、位移后的位置整数乘位置系数,两个系数都是离线算好的定点数,运行时只做乘法定点系数再右移。
实现上有两点优化:位置投影只与序列长度有关,可离线量化为 8 比特常量存下;相对位移只搬移数值并补零,不做算术,且搬移与量化可交换顺序,因此可直接对整数张量做静态索引映射。后续 Softmax 与乘值沿用整数核与线性层规则,整个多头注意力就没有浮点。
相对位置自注意力 × 整数重整化: 相对位置自注意力负责把内容分支与位置分支相加后再做加权,整数重整化负责把两个分支不同的量化尺度换算到同一分数网格再相加,二者搭配的原因是直接把整数分数相加会混淆尺度,组合后才能在不出现浮点比值的情况下完成加分与相对位移。
白话复述就是:先承认两条分支各有各的尺子,再离线算好两把尺子到公共尺子的换算系数,运行时只做整数换算与加法,位移只是提前定好的搬运表。
Swish 的整数逼近为何要直接对输出做极小化最大误差?
每个前馈与卷积块都有 Swish 激活,其定义是输入乘以 Sigmoid,Sigmoid 没有整数核。沿用 I-BERT 的思路,把 Sigmoid 写成含双曲正切的形式,再用 2 次多项式逼近双曲正切。因为双曲正切是奇函数,只需在非负半轴拟合再镜像到负半轴。多项式取顶点在截断点并取值为 1 的形式,大于截断点直接截断为 1。先前做法用最小二乘拟合双曲正切本身,优化的是双曲正切的平均平方误差。
论文指出这对 Parakeet-CTC 不是最优,理由有两层:第一,Swish 输出是输入乘以 Sigmoid,同样大小的 Sigmoid 误差在输入幅值大时会放大,例如在输入为 4 处的误差影响是在 0.1 处的 40 倍,因此平均误差会忽视大输入处的重要误差;第二,拟合双曲正切最好的系数不一定是拟合 Swish 输出最好的系数。于是论文直接优化 Swish 输出的最大绝对误差,在截断区间上数值求解得到系数约为负 0.1240 与 2.4632。
仿真消融显示最大输出误差的排序与词错误率排序一致,拟合 Swish 输出优于拟合双曲正切,极小化最大误差优于最小二乘,而 Hard-Swish 的误差最大且词错误率最差。这说明准则选择不是细节,而是直接影响精度的机制。
Swish 激活 × 极小化最大误差多项式: Swish 激活负责在前馈网络和卷积块中提供非线性,极小化最大误差多项式负责用整数可算的 2 次多项式逼近其中的 Sigmoid 部分,二者搭配的原因是 Sigmoid 没有整数核而 Swish 输出误差会随输入幅值放大,组合后把最大输出误差压到 0.039 并降低词错误率。
复述时要强调:优化目标从中间函数的平均误差改为最终输出的最大误差,是该组件的关键判断。
哪两个位置需要特殊网格,具体怎么改?
逐层范围分析发现默认的 8 比特最大值网格在两处失效。第一处是卷积块中批量归一化输出。批量归一化在部署时折叠进前面的深度卷积,其输出系数是通道缩放除以方差加小常数的平方根,不同通道的该系数最大值与中位数之比在若干层超过 4 个数量级。若用单张逐张量 8 比特网格覆盖极端通道,其余通道几乎分不到量化等级。论文把该张量的位宽从 8 改为 16,称为逐张量 16 比特,默认称为逐张量 8 比特,两者都只指批量归一化输出一处。
逐通道 16 比特精度略好但在该神经网络处理器上对激活不可部署,因此可部署的选择是逐张量 16 比特。第二处是预编码器激活。预编码器中最大值与 99.9 百分位之比达到 11 到 21 倍,说明 0.1% 的尾部撑大了范围,而编码器内部该比值只有 2 到 3 倍。因此在预编码器用 99.9 百分位确定截断范围,在编码器保留最大值范围,称为混合定标。消融显示混合定标优于全用最大值,而全用百分位则大幅变差,说明截断只在重尾处有益。
批量归一化输出 × INT16 网格: 批量归一化输出负责把深度卷积后的通道按学到的缩放系数重新拉伸,INT16 网格负责给该张量更密的量化格点,二者搭配的原因是该系数在通道间相差 4 个数量级以上而单张 INT8 网格会被极端通道撑大,组合后其余通道仍能分到有效量化等级。
预编码器激活 × 百分位定标: 预编码器激活负责把 80 维对数梅尔谱经 3 次降采样卷积变成 1024 维特征序列,百分位定标负责用 99.9 百分位而非最大值确定截断范围,二者搭配的原因是预编码器最大值与 99.9 百分位之比达到 11 到 21 倍而最大值定标会把网格浪费在极少数尾部,组合后保留主体精度并恢复词错误率。
复述时要分清:一个改的是格点密度,另一个改的是截断位置,前者应对通道间 spread,后者应对时间与样本上的离群尾部,其余张量保持 8 比特以保吞吐。
本研究训练了什么,没有训练什么,真实计算是什么?
本研究没有训练新的语音识别模型,也没有微调 Parakeet-CTC 的权重,这是一个纯推理侧的整数化与部署工作,必须明确说明以免误解为量化感知训练。真实计算过程包括 4 类。第一类是校准,用 LibriSpeech 的 dev-other 数据离线统计每个激活张量的截断范围,默认取最大值,预编码器取 99.9 百分位,权重按通道取范围。
第二类是离线求解与预计算,包括数值求解 Swish 多项式的两个系数,为每个线性层与卷积预计算定点乘子,把位置投影量化为常量,把相对位移写成静态索引表,把批量归一化折叠进深度卷积。第三类是仿真验证,用 PyTorch 实现与部署图镜像的整数算术,其中 Swish 仍用多项式,用于隔离每个设计选择的精度影响,并在 LibriSpeech 与 Common Voice 上评价。
第 4 类是真机编译与运行,用高通软件开发包把静态形状的整数图编译到 Nothing Phone 3a 的神经网络处理器,按 3 秒到 35 秒编译多张图,每条语音路由到能容纳它的最小图,填充的静音特征会计入实时率。由于没有梯度路径与参数更新,不存在冻结与解冻、监督来源与重置时机的报告缺项,复现时应把重点放在校准划分、定点位移位数与静态图路由上。
在什么手机、什么基线、什么口径下比较?
手机端评价使用中端消费级智能手机 Nothing Phone 3a,芯片为骁龙 7s Gen 3,神经网络处理器运行时为 QNN 软件开发包。词错误率用 Whisper 英文文本归一化器计算,实时率是处理时间除以音频时长,值越小越快,峰值内存单位为 MiB。由于神经网络处理器要求静态形状,作者按输入时长 3 秒到 35 秒编译多张图,每条语音选最小可容纳的图,静音填充使处理帧数增加 23%,所有实时率都包含该开销。
基线包括中央处理器上的 parakeet.cpp 两线程运行,权重分别为半精度与 8 比特零量化但计算仍为单精度,以及同一检查点经厂商工具链转换的半精度与 8 比特训练后量化。仿真评价使用 LibriSpeech 与 Common Voice,比较浮点 Parakeet-CTC、I-BERT 配方、朴素 8 比特与 I-Parakeet,其中 I-BERT 配方指全 8 比特最大值范围加最小二乘拟合双曲正切,朴素 8 比特指同样量化但换用本文的极小化最大 Swish,因此朴素 8 比特与 I-Parakeet 之差就是两处范围补救的贡献。
资源状态方面,论文引用的第三方 parakeet.cpp 链接当前可用,状态码为 200,而定点算术介绍的 cpplab 链接当前不可用,状态码为 403,复现时应以论文正文与可用代码为准,本次未能确认后者可达性之外的额外内容。
手机上到底多快、多准、多少内存?
要回答的主问题是整数全卸载是否同时带来速度与内存收益,以及精度代价多大。公平条件是同一测试集 LibriSpeech test-other,同一手机端口径,指标方向是词错误率越低越好,实时率越低越快,峰值内存越低越好。下表整理手机端可运行策略的对比,最后一行仿真仅作参照。表前的问题意识是:权重变小本身不一定加速,关键看计算是否真正离开中央处理器。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| LibriSpeech test-other 手机端 | 词错误率 | 3.76 | 4.97 | 中央处理器半精度 |
| LibriSpeech test-other 手机端 | 实时率 | 0.36 | 0.048 | 中央处理器半精度 |
| LibriSpeech test-other 手机端 | 峰值内存 MiB | 1517 | 612 | 中央处理器半精度 |
| LibriSpeech test-other 手机端 | 词错误率 | 100.0 | 4.97 | 厂商工具半精度 |
| LibriSpeech test-other 手机端 | 词错误率 | 100.0 | 4.97 | 厂商工具 8 比特训练后量化 |
正文表 1:手机端主结果对照,数值来自原文证据逐字引用。表后解释是:I-Parakeet 全程在神经网络处理器上运行且无中央处理器回退,相对半精度中央处理器基线快 7.5 倍,峰值内存少约 60%,词错误率高 1.21 个百分点。
权重 8 比特但计算仍单精度的中央处理器路径并未加速,说明收益来自整数计算与卸载,而非单纯权重变小。两个厂商工具链路径均为 100.0,论文将其归因于预编码器激活超出半精度范围以及默认训练后量化不足,但这属于有限解释而非严格因果,仍需待验证。未胜出项是精度绝对值仍落后于中央处理器浮点基线,且仿真词错误率(%)5.32 略高于真机 4.97,论文说明真机用硬件查找表算 Swish 中的 Sigmoid 而非多项式,这构成仿真与部署的实现差异,比较时不能混为同一条件。
整数推理 × NPU 卸载: 整数推理负责保证全网没有浮点算子与中央处理器回退,NPU 卸载负责把矩阵乘、移位、查表和整数归一化全部放在神经网络处理器上执行,二者搭配的原因是只要有一个浮点算子就无法完全利用整数加速器,组合后才实现 7.5 倍于中央处理器基线的实测加速。
仿真中精度损失来自哪里,范围补救贡献多少?
第二个结果问题是隔离整数化各部分的精度影响。比较条件是同一 PyTorch 整数仿真,同一 LibriSpeech 与 Common Voice 划分,指标为词错误率。下表把浮点、可运行整数基线与本文方法放在一起,重点看相对恢复而非绝对最优。表前要明确:仿真中的 Swish 仍是多项式,因此与真机的硬件查找表存在差异,排序意义大于绝对值。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| LibriSpeech test-clean 仿真 | 词错误率 | 1.87 | 2.61 | 浮点 |
| LibriSpeech test-other 仿真 | 词错误率 | 3.76 | 5.32 | 浮点 |
| Common Voice test 仿真 | 词错误率 | 10.55 | 14.70 | 浮点 |
| LibriSpeech test-other 仿真 | 词错误率 | 6.38 | 5.32 | 朴素 8 比特 |
| LibriSpeech test-other 仿真 | 词错误率 | 7.41 | 5.32 | I-BERT 配方 |
正文表 2:仿真精度与基线对照,数值来自原文证据逐字引用。表后解释是:I-Parakeet 在 test-clean 与 test-other 上分别落后浮点 0.74 与 1.56 个百分点,相对朴素 8 比特恢复 0.40 与 1.06 个百分点,该恢复即两处范围补救的贡献,同一排序在 Common Voice 上成立。I-BERT 配方最差,说明旧的 Swish 拟合与全最大值定标在该模型上都不够。
限制是仿真未报告统计显著性与解码超参数敏感性,且 Common Voice 绝对词错误率本身较高,跨数据集的差值不能直接理解为同一难度下的退化幅度。教学上应把仿真结论表述为支持而非证明:范围补救与 Swish 准则改进支持精度恢复,但未验证在其他说话人、噪声与采样率下的泛化边界。
Swish 准则、位宽与定标各自改变了什么?
消融按 1 次只改一处组织,测试集为 LibriSpeech test-other,指标为 Swish 输出最大绝对误差与词错误率,误差越小越好,词错误率越低越好。表前问题是:拟合目标与范数是否独立贡献,位宽加到哪里才值得,截断应该只用在重尾处还是全网。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| Swish 逼近仿真 | 最大误差 | 0.073 | 0.039 | 最小二乘拟合双曲正切 |
| Swish 逼近仿真 | 词错误率 | 5.95 | 5.32 | 最小二乘拟合双曲正切 |
| 批量归一化输出 | 词错误率 | 5.91 | 5.32 | 逐张量 8 比特 |
| 预编码器与编码器定标 | 词错误率 | 5.64 | 5.32 | 全用最大值 |
| 预编码器与编码器定标 | 词错误率 | 8.03 | 5.32 | 全用 99.9 百分位 |
正文表 3:3 组消融对照,数值来自原文证据逐字引用。
表后解释是:Swish 侧,对 Swish 输出做极小化最大误差得到 0.039 与 5.32,对 Swish 输出做最小二乘得到 0.045 与 5.49,对双曲正切做极小化最大得到 0.068 与 5.81,对双曲正切做最小二乘得到 0.073 与 5.95,Hard-Swish 为 0.142 与 6.33,最大误差排序与词错误率排序一致,且范数轴与目标轴独立贡献。位宽侧,批量归一化输出用逐张量 8 比特退到 5.91,用逐张量 16 比特回到 5.32,与不可部署的逐通道 16 比特的 5.29 仅差 0.03,说明可部署选择几乎无损。
定标侧,混合定标的 5.32 优于全最大值的 5.64,而全百分位的 8.03 大幅变差,构成明确反例:截断只在重尾的预编码器有益,在分布较紧的编码器会误删信息。未评测边界包括多项式阶数、截断点搜索范围与百分位阈值的连续敏感性,论文只报告了选定点的对照。
哪些结论不能推广,哪些代价仍在?
首先是静态图与填充代价。真机要求静态形状,作者用多张图覆盖 3 秒到 35 秒并路由到最小可容纳图,填充使处理帧数增加 23%,实时率已包含该开销,但这意味着短语音的相对开销更大,且超过 35 秒的长语音如何切分与拼接未在证据中交代,不能默认同样实时率。其次是仿真与真机实现不一致。仿真用多项式逼近 Swish,真机用硬件查找表算 Sigmoid,真机 4.97 优于仿真 5.32 恰好反映该差异,因此不能把仿真绝对值当作部署保证,也不能把真机增益全部归因于多项式系数。
第三是基线失败的解释限度。厂商半精度与 8 比特训练后量化均为 100.0,论文称前者与预编码器激活超出半精度范围一致,后者说明工具默认量化不足,这属于与观测一致的有限解释,不是受控因果证明,也未报告工具链的校准集与配置。第四是覆盖范围。评价集中在 LibriSpeech 与 Common Voice 的词错误率,没有报告误判率分解、延迟分布、功耗实测与噪声鲁棒性,不能承诺这些量同步改善。最后是位宽取舍。
仅一处用 16 比特而其余保持 8 比特是为了保吞吐,若把更多张量加宽,论文明确指出会损害吞吐,因此精度与速度的权衡仍在,总体趋势不等于每层加宽都值得。
要复现应先做什么,需要哪些超参数与信息条件?
复现的第一步是拿到 Parakeet-CTC 0.6B 检查点与 LibriSpeech 划分,用 dev-other 做校准,用 test-clean、test-other 与 Common Voice test 做评价,并固定 Whisper 英文文本归一化器的版本,否则词错误率不可比。第二步是实现整数仿真:权重按通道定范围,激活按张量定范围,默认 8 比特,线性与卷积累加在 32 位整数中,定点乘子按 16 位移位预计算,层归一化与 Softmax 用整数核,相对位置注意力按融合重整化实现,位置投影存为 8 比特常量,相对位移做成静态索引。
第三步是求解 Swish 系数并验证最大输出误差,目标值约为负 0.1240 与 2.4632,最大误差约为 0.039,再检查词错误率排序是否与误差排序一致。第四步是做两处范围补救:批量归一化输出改为逐张量 16 比特并折叠进深度卷积,预编码器用 99.9 百分位而编码器用最大值,并复现混合定标优于全最大值、全百分位最差的对照。第五步才是真机编译:按时长编译多张静态图并实现最小容纳路由,记录含填充的实时率与峰值内存。
关键信息条件是定点移位数为 16,模型维度 1024,预编码器降采样因子 8,填充开销约 23%。代码方面,第三方 parakeet.cpp 链接本次确认可用,可作中央处理器基线参考,但整数 NPU 链路需按论文自行实现,不能默认厂商工具的默认量化即等价。
何时值得尝试这个方案,如何一句话复述方法?
当模型必须完全卸载到整数加速器、且不允许任何浮点回退时,该方案值得尝试,尤其适用于含相对位置注意力与 Swish 的 Conformer,以及观测到少数张量重尾而其余分布较紧的情形。若硬件允许浮点或已有成熟的混合精度流水线,则不必为追求整数性质支付静态图与特殊网格的工程代价。
一句话复述方法是:为双尺度注意力分数算好到公共网格的定点换算并把位移做成索引,直接对 Swish 输出优化最大误差求多项式,再对批量归一化输出给 16 比特网格、对预编码器用百分位截断,其余保持 8 比特最大值网格,从而整网只用整数运算跑在手机神经网络处理器上。记住 3 个核对点:双分支不能直接相加必须先换算,Swish 准则看输出最大误差而非中间平均误差,范围补救只动两处而非全网加宽。
缺失证据不是技术错误,若要进一步验证,应补测长语音切分、功耗与噪声下的稳定性,以及百分位阈值与多项式阶数的敏感性,再判断该整数化路线是否适用于自家数据与芯片。
📎 论文与评分元数据
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses