英文题目:Acoustic Progress Propagation for Long-Horizon Speculative Decoding in ASR
标签:#语音识别 | #动态计算与早退 | #高效推理 | #语音
评分:8.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Yuanyuan Jia:机构信息未在 arXiv HTML 中可靠披露
- Qianqian Yang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动语音识别需将连续语音声学表示转写为离散文本,轻量草稿模型在多步前滚中难以跟踪每个词元对应的音频位置,导致音频交叉注意力漂移与长程接受长度饱和。第一步由目标解码器第21层注意力峰值初始化时间锚点a1,其复用目标正常解码权重且无需额外前向,输出的锚点位置作为递推起点进入第二步。第二步由进度预测器依据上一进度与当前自注意力后表示递推非负增量并累加得到ak,其未裁剪值用于状态传递与监督,裁剪后位置进入第三步。第三步将裁剪位置转为高斯对数偏置注入音频交叉注意力,检索到的声学上下文经草稿状态影响下一步进度预测形成闭环。与仅做单步对齐监督的AnchorDraft相比,该机制把定位从每步全局重检索改为沿时间前向传播的状态跟踪,并配合变长horizon联合训练学习进度转移。在 5 个英文测试集上以 Qwen3-ASR-0.6B 为目标时宏平均端到端加速比为 1.657x,相对 AnchorDraft 提升 34.3%,接受长度相对提升 46.6%;以 Qwen3-ASR-1.7B 为目标时分别为 1.227x、9.0% 和 16.3%,全程保持与目标自回归解码完全一致的无损词错误率。该结论限于贪婪解码、批量大小为 1 的英文朗读与演讲域,超过 8 的更长草稿验证开销已抵消接受增益,噪声、口音、多语、束搜索与流式场景尚未验证。
🔗 开源与复现资源
- 代码相关资源:https://github.com/yuanyuanjia71-spec/ProgDraft — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
ASR 为什么需要推测解码?一次转写要走多少串行步?
论文研究的是自回归语音识别的推理加速。目标模型如 Qwen3-ASR 把语音编码成声学表示,再用 Transformer 解码器逐个生成转写 token。这种逐 token 串行方式在实时转写和语音助手场景下延迟较高。推测解码的思路是先用轻量草稿器 1 次提议多个候选 token,再让目标模型在一个前向中并行验证,接受其中与目标贪婪预测一致的最长连续前缀,若首个不一致则追加修正 token,若全部接受则追加奖励 token,从而减少串行轮数。
初学者可以把目标模型理解为负责拍板的慢而准的转写员,草稿器理解为先打草稿的快而轻的助手,验证环节只保留助手草稿中从头开始连续正确的部分。论文强调 ASR 草稿还有一层困难:不同 token 对应不同长度的语音段,文本上前进一步不直接告诉模型下一步该看语音的哪里,草稿器必须在多步中自己跟踪声学位置。原文指出即使能看到全部音频上下文,草稿器的音频注意力在 rollout 中也常漂离正确位置,导致靠后的步骤接受率下降,这就是后文要解决的长 horizon 饱和。
已有 ASR 草稿路线在对齐上做了什么?
按同输入、同目标、同运行阶段对照,论文提到的相关路线有 3 条。第一条是 Whisper-Medusa,把 Medusa 式多头预测扩展到 ASR,属于不显式跟踪声学位置的多头并行提议。第二条是 SpecASR,通过自适应草稿长度和草稿复用来加速,属于调度层面的优化。第 3 条是 AnchorDraft,在训练时对草稿器的音频注意力加逐步监督以提高每步声学定位准确性。
论文对 AnchorDraft 的判断是直接报告的观察:提高单步对齐准确性不等于改变推理时的定位方式,因为每步仍需用当前状态在全量声学上下文中重新识别下 1 token 对应的区域,短 horizon 上对得准不保证长轨迹上能持续跟踪。另一条对照是 SpeechSpec-EAGLE3,使用原生 5 步训练展开,论文在共享训练语料设置下报告其未能实现端到端加速。还有作为对照的 Base Drafter,即单层循环块加无约束音频交叉注意力,不做对齐监督、进度预测与进度偏置。
这些对照的共同点是输入都是目标编码语音与已验证前缀,目标都是无损加速,区别在于是否建模跨步的声学推进以及训练 horizon 是否可变。
长 horizon 饱和具体指什么现象?
论文提出的问题是长 horizon 饱和。举一个教学例子帮助理解,不代表论文数值:假设草稿长度 K 从 3 加到 8,理想情况下每轮能多接受几个 token,但如果第 2 个候选就与目标预测不一致,验证只接受连续匹配前缀,后面再长的草稿也被截断,额外草稿步几乎不带来解码进展。论文报告 AnchorDraft 的接受长度随 K 增大很快饱和,继续加长草稿收益很小。机制解释是逐步对齐监督只提高了定位准确性,没有改变每步重新在全量上下文中定位的做法,也没有显式传递已经走到语音哪里了的信息。
于是论文把研究目标定为让草稿器显式传播声学进度,并用变长训练让它在不同长度 rollout 上学会这种推进,再看接受长度能否在基线饱和之后继续增长,以及端到端加速是否随之提高。
方法全景:一个样本如何走完提议到验证?
沿一个样本走一遍。输入是语音 X 经目标模型编码得到的 Ha,以及已验证前缀 y_≤t。草稿器先融合最后已确认 token 的词嵌入 E(y_t) 与目标解码器若干块处理该 token 后的隐特征 F,得到第一步输入 x1,再用一个共享的单层 Transformer 解码器块做因果自注意力、在 Ha 上的交叉注意力与前馈网络,得到草稿状态 z_k,经冻结的目标 LM 头取 argmax 得到候选 y_hat_{t+k},下一步输入为 z_k 加新 token 嵌入。如此提议 K 个候选后,目标模型并行验证并按贪婪预测接受最长连续前缀。
论文的新增部分是在上述循环之外加了一条声学进度线:每轮先从目标注意力得到初始锚点 a1,后续每步递推预测 a_k 并把它转成高斯偏置加到交叉注意力分数上,检索到的声学上下文又通过 uk+1 影响下一步进度,形成反馈。训练时目标参数冻结,只训练草稿器与进度预测器,并在可变 horizon 上联合优化 token 交叉熵、特征匹配与进度损失。
推测解码 × 声学进度传播: 推测解码的分工是用轻量草稿器先提议 K 个候选再由目标模型并行验证以减少串行步数,声学进度传播的分工是在草稿步之间递推一个估计当前语音时间位置的状态 aka_k 并把它作为偏置反馈回音频交叉注意力,二者搭配的原因是 ASR 草稿每步要重新在全量语音中定位下一 token 对应的音频段,仅靠单步对齐监督仍会在长 rollout 中漂移,组合后检索到的声学上下文又影响下一步的隐状态与进度预测,形成闭环以支撑更长的有效接受前缀。
草稿器输入与单步计算:特征从哪里来?
草稿器的起点不是从零学声学表示,而是复用目标模型已经算好的信息。论文用最后已确认 token 的嵌入与多个目标解码器块的隐状态拼接后经线性投影 W_f 得到 x1,所选块在实现中是零索引的第 0、9、18、27 块。单步块内先做因果自注意力得到 u_k,再做对 Ha 的交叉注意力与前馈得到 z_k。目标 LM 头冻结并与草稿器共享隐维度,草稿状态与自注意力缓存跨步携带。重启特征在单 token 目标上下文更新时抽取,计时包含该过程与批量验证。下式是原文给出的初始输入构造,符号含义是 E 为词嵌入,F_{l}(t) 为目标第 l 块在位置 t 的隐特征,W_f 为投影矩阵,分号表示拼接。
\[x_{1}=W_{f}\bigl[E(y_{t});F_{\ell_{1}}(t);\cdots;F_{\ell_{m}}(t)\bigr],\]下一步输入构造是把当前草稿状态与新预测 token 的嵌入相加,符号 z_k 为当前步草稿状态,E(y_hat_{t+k}) 为新 token 嵌入,相加后作为下一步输入 x_{k+1}。这种加法让文本信息与检索到的声学信息都进入下一步自注意力,从而让进度预测能看到两者。
\[x_{k+1}=z_{k}+E(\hat{y}_{t+k}).\]本文没有收到 Figure 像素,因此不描述图 1 中模块的相对位置与颜色,仅依据正文与图注归因:图注称图 1 含草稿加验证流水线与共享草稿步内的声学进度预测与反馈,解读以上述文字链为准。
声学进度如何初始化、递推与反馈回注意力?
进度线的第一步是初始化。论文沿用先前工作做法,从目标第 21 层零索引层、位于最后已确认前缀 token 处的查询出发,对有效音频键集合 A 上的多头注意力权重按头平均后取峰值对应时间戳作为 a1。这些权重复用正常目标解码已算好的注意力,不做额外前向。后续步骤不再查询目标注意力,完全由草稿器自己递推。下式是该初始化,符号 A 为有效音频键,s_j 为键 j 的时间戳,alpha^{tar}_{h,j}为头 h 的注意力权重,N_h 为头数,j* 为平均权重最大的键,a1 为其时间。
\[j^{\star}=\arg\max_{j\in\mathcal{A}}\frac{1}{N_{h}}\sum_{h=1}^{N_{h}}\alpha^{\mathrm{tar}}_{h,j},\qquad a_{1}=s_{j^{\star}}.\]k≥2 时的递推遵循单调位置更新思想:把上 1 位置除以 utterance 时长 T 归一化后与 u_k 拼接,送入进度预测器 f_theta 再经 Softplus 得到非负增量 Delta_k,加到上 1 位置得到 a_k。位置与增量以秒为单位,只有预测器的位置输入做了除以 T 的归一化。检索时把 a_k 截断到[0,T] 得到 a_bar_k,再对每个音频键 j 构造高斯对数偏置负的平方距离除以 2σ²,加到原始交叉注意力分数 S_{k,j}上再做 softmax,σ 控制时间宽度。偏置让注意力偏向 a_bar_k 附近但仍保留访问全部 Ha 的能力,递推与监督用的是未截断的 a_k。通过式 2 的递推,检索到的声学上下文会影响 u_{k+1}进而影响下一步进度,闭合反馈环。
音频交叉注意力 × 高斯对数偏置: 音频交叉注意力的分工是在全量编码语音 Ha 上按内容相似度取回与当前解码状态相关的声学信息,高斯对数偏置的分工是以截断后的进度位置 a_bar_k 为中心按时间距离平方惩罚远处音频键,二者搭配的原因是内容注意力在长草稿中容易漂移到错误时间,时间偏置保留全量可达性的同时把分数重心拉回进度附近,组合意义是检索既不丢全局上下文又受时间先验约束。
为什么起点用目标锚点而后面只用自预测?
这个安排的理由是原文明确给出的:起点处有已验证前缀对应的目标注意力可用且可信,复用它不需要额外前向;一旦进入草稿 rollout,后续 token 尚未被目标验证,若每步都回查目标注意力就破坏了推测解码减少目标前向的初衷,因此后面只用草稿预测的进度。进度预测器输入同时包含上 1 位置与当前自注意力后表示,目的是让推进量同时受时间连续性与语义内容的约束。
举例说明,不添加无源数值:若上 1 token 是短促的功能词,模型可学到较小的 Delta_k,若是长元音或停顿后的内容词,则可学到较大的 Delta_k,但具体增量完全由训练学到,高斯宽度 σ 固定为 0.2 秒。截断只用于构造偏置,避免超出 utterance 时长的位置直接参与距离计算,而监督与递推保留未截断值以保持梯度与单调性。
目标注意力锚点 × 进度增量预测: 目标注意力锚点的分工是每轮草稿开始时复用目标模型在已确认前缀处的第 21 层注意力峰值位置作为 a1 的无额外前向初始化,进度增量预测的分工是在 k≥2 时用自注意力后表示 uk 与上一位置 ak-1 经 Softplus 输出非负增量 Delta_k 并累加得到 ak,二者搭配的原因是起点需要可信的已验证位置而后续需要单调向前且依赖文本语义的步进,组合后形成从目标锚点出发、由草稿自身递推的声学轨迹。
联合训练如何构造数据、监督与变长展开?
训练时目标冻结,只训练草稿器与进度预测器。数据是目标生成的贪婪轨迹,教师强制把真实下 1 token 嵌入 E(y_{t+k}) 喂给下一步,而进度走自己的递推不做强制对齐重置。Token 交叉熵在每个展开深度上施加,特征匹配每个 rollout 1 次,比较 z_{i,1}与目标最终归一化解码器状态在位置 t 的值并在隐维度上平均。
进度监督的来源是 TorchAudio 的 MMS 强制对齐器把目标生成转写与音频对齐,每个 token 取其对齐时间段中点作为 a*{i,k},对 k≥2 比较未截断的 a{i,k}与该中点,单位为秒,无有效对齐的 token 不计入,损失为 Smooth L1 且 beta 为 1,token 损失的梯度也会经反馈通到预测器。变长展开是对每个锚点 i 独立采样 K_i 并按剩余 token 数 R_i 取实际展开 Kact 为二者最小值,含结束符 EOS,未执行的步骤损失为零,目标函数按经验出现率 q_k 与衰减 gamma^{k-1}加权以平衡不同深度的样本量。
变长 horizon 训练 × 进度监督: 变长 horizon 训练的分工是对每个锚点独立采样 Ki 并按实际剩余长度展开 Kact 步以让模型见过不同长度的 rollout,进度监督的分工是用 MMS 强制对齐得到的 token 时间中点 a*_i,k 对未截断的 ak 做 Smooth L1 约束,二者搭配的原因是只在固定短长度上训练学不到长程转移而只有 token 损失学不到时间推进,组合意义是让递推器在不同展开深度下都学会从锚点出发的单调推进。
实现细节是训练 45 轮共 14760 次更新,有效批量 12,优化器为 AdamW 且学习率为 10 的负 3 次方加余弦衰减,采样为 3 到 8 的均匀分布,超参数为 sigma0.2 秒、gamma0.7、lambda_f0.5、lambda_p0.1,草稿器参数量在 0.6B 目标上 17.85M、在 1.7B 目标上 71.34M。这些取值的效果在结果节用对照验证,论文未报告学习率搜索或对齐器误差分析,这是复现时需留意的缺项。
在什么数据、模型与计时条件下比较?
比较问题是不同草稿策略在相同目标、相同测试语音与相同计时口径下谁的无损加速更高。公平条件包括冻结 Qwen3-ASR-0.6B 与 1.7B 两个目标,在 3933 条英文语音上训练草稿器,测试为每个测试划分取 200 条共 1000 条,覆盖 LibriSpeech clean 与其他、TED-LIUM3、GigaSpeech 与 FLEURS 英文。基线包含 Base Drafter、AnchorDraft、AnchorDraft 加运行时修正 RC 以及 SpeechSpec-EAGLE3,草稿器共享各自目标生成的语料。指标方向是端到端加速比越高越好,接受长度 tau 越高越好,且所有测试序列与目标单步自回归完全一致以保证词错率与字错率不变。计时条件为单张 H100 80 GB、批量 1、目标用 FP32 eager 注意力、草稿器用 BF16 自动混合精度,推理草稿长度 K 为 8。
| 配置项 | 取值 | 适用对象 | 作用阶段 | 备注 |
|---|---|---|---|---|
| 训练语音量 | 3,933 条英文 | 两个目标各自草稿器 | 训练 | 含 LibriSpeech 等四来源 |
| 测试语音量 | 200 条每划分共 1,000 条 | 所有方法 | 测试 | FLEURS 为 en-us |
| 草稿器参数量 | 17.85M 与 71.34M | 0.6B 与 1.7B 目标 | 训练与推理 | 对应目标大小 |
| 目标特征块 | 0,9,18,27 块 | 本方法草稿器 | 推理输入 | 零索引 |
表后解释主要代价与边界:统一语料与统一计时让加速比较更可信,但训练量仅 3933 条英文且测试每集 200 条,限制了向其他语言与长语音的推广;BF16 只用于草稿器而目标保持 FP32 eager,计时结论依赖该精度组合与单批量条件,改变批量或注意力实现可能改变相对收益;特征块与超参数按原文固定,未报告在其附近扰动的敏感性。论文同时指出 SpeechSpec-EAGLE3 在该共享语料设置下未实现端到端加速,说明原生多步展开不直接适用于此 ASR 目标与数据量,不能把该负结果推广为该方法在一切设置下无效。
主结果:更长的草稿是否换来更高的无损加速?
要回答的问题是本方法在 5 个测试集与两个目标上是否同时提高接受长度与端到端加速,且是否在基线饱和后继续增长。论文报告在推理 K 为 8 时,本方法在全部 5 个集与两个目标上均为最高。宏平均层面,本方法相对目标单步自回归的加速为 0.6B 上 1.657 倍、1.7B 上 1.227 倍,相对 AnchorDraft 的宏平均加速提升分别为 34.3% 与 9.0%,接受长度提升分别为 46.6% 与 16.3%,且所有序列与目标单独解码一致因而无损。Horizon 扫描显示 AnchorDraft 加变长训练在 K 为 6 附近 plateau,而本方法在每个测试 horizon 上加速最高并在 K 为 8 处达到峰值,超过该点后接受增益抵不过更长草稿加验证轮的成本上升。
接受长度 × 端到端加速比: 接受长度 tau 的分工是统计每轮接受的草稿前缀 Ar 加上修正或奖励 token br 的平均值以衡量草稿质量,端到端加速比的分工是把目标单步自回归解码的总耗时与草稿加验证的总耗时相比以衡量实际收益,二者搭配的原因是高接受长度还要扣除草稿计算与验证开销才能换成加速,组合意义是论文同时报告两者以区分长草稿带来的接受增益与每轮成本上升之间的权衡。
| 条件 | 指标 | 基线策略 | 本方法 | 相对提升 |
|---|---|---|---|---|
| Qwen3-ASR-0.6B 五集宏平均 | 端到端加速比 | AnchorDraft | 1.657× | 34.3% |
| Qwen3-ASR-1.7B 五集宏平均 | 端到端加速比 | AnchorDraft | 1.227× | 9.0% |
| Qwen3-ASR-0.6B 五集宏平均 | 接受长度 tau | AnchorDraft | 更长 | 46.6% |
| Qwen3-ASR-1.7B 五集宏平均 | 接受长度 tau | AnchorDraft | 更长 | 16.3% |
| 推理条件 | 草稿长度 | 所有方法 K 为 8 | 本方法 K 为 8 峰值 | 无损且 WER 与 CER 不变 |
表后解释收益与代价:收益是长 horizon 利用率提高,接受长度在基线饱和后继续增长并转化为端到端加速;代价是每轮草稿计算与验证成本随 K 上升,本方法峰值在 K 为 8 而非更大,说明不能无限制加长。未胜出项是 AnchorDraft 加运行时修正在两个指标上均低于 AnchorDraft,论文将其作为反例表明推理时用验证注意力中心化下一轮声学窗口并未带来增益;SpeechSpec-EAGLE3 在该设置下加速低于 1,属于负结果,支持轻量单层块加进度偏置在此数据与目标下更有效,但不证明其他训练语料下仍如此。
拿掉进度、反馈、递推或联合训练会发生什么?
消融在 Qwen3-ASR-0.6B 的 1000 条测试上用推理 K 为 8 比较。论文设置 6 个变体:去掉声学进度即回到 Base 结构但用变长与重加权 token 损失从头训练;去掉进度反馈但保留预测与监督;绝对位置预测即用 g_phi(u_k) 直接预测 a_k 而不递推;冻结最终 Base 草稿器后只训随机初始化预测器,先做 5 轮纯位置训练选第 3 轮再做 5 轮可变 horizon 联合训练。
固定 K 为 3 训练;固定 K 为 8 训练。论文用文字报告的趋势是递推优于绝对位置预测且监督与反馈都保留时最好,仅有监督而无反馈与去掉进度建模相当,说明显式位置参考加反馈比从隐状态恢复绝对位置更容易跟踪;冻结草稿器变体低于联合训练,但作者明确指出两者训练计划不同因而不单独证明联合优化的贡献;变长训练在相同最大 horizon 下优于固定 K 为 8,固定 K 为 8 又优于固定 K 为 3,说明增益不止来自见过更长草稿。
由于原文消融数值仅在表格矩阵中而全文连续原句未逐字给出这些数字,按证据规则这里不复述具体消融数值,只保留方向性结论以避免无源引用。未评测边界是预测器宽度、sigma 与其他 gamma 取值的敏感性,以及冻结计划对齐后的公平联合对照,复现时需补做。
哪些结论有边界?什么还没有被验证?
论文直接报告的是在两个 Qwen3-ASR 目标、5 个英文测试集、单批量 H100 计时下的无损加速与接受长度提升,支持声学进度传播超出局部对齐的判断。有限解释是变长训练优于固定 K 为 8 的结论支持变长本身有增益,但固定 K 为 8 也比 K 为 3 好,说明长暴露与变长各有一部分作用,不宜把全部增益归于递推。待验证的是三点:其一,进度监督依赖 MMS 强制对齐的中点,对齐误差与无有效对齐 token 的剔除如何影响长尾语音尚未测量。
其二,计时依赖 FP32 目标加 BF16 草稿器与批量 1,训练资源、推理开销、输出帧率与实际延迟需分别讨论,总体趋势不等于每组每步都成立;其三,相对百分比与百分点不同,不同指标的差值不能混放,阅读时应把加速比、接受长度与相对提升分开。缺失证据不是技术错误,但未测量误判率之外的延迟分布与成本时,不应承诺这些量必然改善。
复现先做什么?代码、权重与计时如何对齐?
资源状态是正文开源声明的唯一依据,本次收到的资源状态为可用且状态码 200,因此可写当前可用。代码地址为论文给出的 ProgDraft 仓库,复现第一步是按该仓库的说明准备 Qwen3-ASR-0.6B 与 1.7B 目标权重与 5 个测试集的 1000 条划分,并确认目标冻结、草稿器分别训练。关键超参数按原文固定:目标特征块 0、9、18、27,初始锚点取目标第 21 层注意力峰值,sigma0.2 秒,gamma0.7,lambda_f0.5,lambda_p0.1,AdamW 学习率 0.001 余弦衰减,45 轮 14760 次更新,有效批量 12,K 在 3 到 8 均匀采样,推理 K 为 8,贪婪解码。计时需对齐单 H100 80 GB、批量 1、目标 FP32 eager、草稿器 BF16,且把单 token 目标上下文更新与批量验证都计入。
验证先检查测试序列与目标单独解码完全一致,再比较接受长度与端到端加速。若基线用固定 K 为 3 训练而本方法用变长训练,需另加 AnchorDraft 加变长训练的对照以分离训练 horizon 的影响。
| 对照项 | 基线做法 | 本方法做法 | 需固定的条件 | 待补验证 |
|---|---|---|---|---|
| 训练展开 | 固定 K 为 3 或原生 5 步 | K 在 3 到 8 均匀采样 | 同一目标生成语料 | sigma 与 gamma 敏感性 |
| 对齐监督 | AnchorDraft 逐步监督 | MMS 中点加 Smooth L1 | 同一对齐器与剔除规则 | 对齐误差影响 |
| 推理修正 | AnchorDraft 加 RC 中心化窗口 | 递推进度加高斯偏置 | 同一推理 K 为 8 | 更大 K 的成本曲线 |
| 计时口径 | 目标 FP32 eager | 草稿器 BF16 | 单 H100 批量 1 | 多批量与流式延迟 |
| 无损检查 | 与目标 AR 一致 | 与目标 AR 一致 | WER 与 CER 不变 | 长语音与噪声鲁棒性 |
表后说明:该表整理的是原文明确报告的可运行策略,不含搜索最优或事后最优值;固定 K 为 3 与原生 5 步是实际可运行的基线训练做法,变长采样是本方法的可部署做法。复现时若改动精度、批量或注意力实现,应重新测量而不能沿用原文加速比。论文特有的误解是把运行时修正当成免费增益,原文显示它降低了两项指标,因此复现不应默认加上该修正。
何时值得尝试这种进度递推?
当 ASR 推测解码出现加长 K 但接受长度 plateau,且单步注意力尚能对准而长 rollout 逐渐漂移时,值得尝试这种从目标锚点出发的递推进度加高斯偏置,因为它不改变验证无损性,只改变每步在全量语音中取回上下文的重心,且训练上用变长展开让递推见过不同长度。尝试前应确认有可靠的强制对齐可作进度监督,并能复用目标注意力做初始化而不增加目标前向。若目标很小或草稿开销占比已高,应先测 K 为 6 到 8 的加速峰值而非直接设最大 K。若在新语言或长语音上使用,还需补做对齐质量、sigma 宽度与采样范围的验证,不能把英文短句上的相对提升直接当成跨场景承诺。
📎 论文与评分元数据
排名:前25% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses