英文题目:Scalable Keyword Spotting via Modular Network Expansion
会议身份:
conference:interspeech:2026:conference-paper-id:khaymonenko26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#持续学习 #高效推理 #端侧运行 #语音 #关键词检测
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Viktor Khaymonenko:机构信息未能从会议 PDF 纯文本可靠映射
- Dzmitry Saladukha:机构信息未能从会议 PDF 纯文本可靠映射
- Aliaksei Rak:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Rostov:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为16 kHz单声道1秒级语音,输出为核心词表与新增词表各自加背景类的类别,难点是扩展时原始训练音频不可用且已部署触发器的阈值行为不允许任何回归。方法链分三步:先在核心词表上训练约150k参数的小型流式基座并冻结全部权重与批归一化仿射参数和运行统计,再从冻结编码器多层抽取激活送入轻量扩展分支经时序卷积残差变换与时序池化送入独立新词头产生新词表对数几率,最后采用核心优先决策规则保证已发布阈值行为逐输入不变。与持续学习软约束和参数高效微调改动共享通路不同,该设计通过物理隔离计算路径实现构造性无回归。在Google Speech Commands测试集评测条件下,完全微调的错误率为69.08%,高于基座模型的错误率2.71%。该结论仅在Google Speech Commands v2单轮双词扩展与1%错误接受率标定下成立,多轮扩展、跨语言与强噪声外推尚未验证。扩展分支与新词头新增参数控制在10k预算内,最终模型约160k参数,最坏推理开销的计算量为16.34M乘加操作。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,哪些信息必须原样保留?
这篇解读的输入是论文正文文字与 3 张官方原图像素,目标是让刚进入语音与音频方向的研究生能复述出可核对的方法与实验条件。必须保留的信息包括任务约束、冻结范围、参数预算、训练数据可得性、推理决策顺序与评测校准方式。
输出是一套能照着做实验的理解。关键词检测的白话含义是设备一直在听,只在听到事先约定的触发词时才唤醒或执行动作,英文叫关键词检测,缩写为 KWS。嵌入式场景的输入是 16 千赫单通道音频,输出是对每个已部署关键词是否出现的判决。
难点在于模型要小、要一直开、延迟固定,而且用户已经依赖的老词一个都不能变差。论文研究的是类增量关键词扩展,英文为 class-incremental keyword expansion,白话就是出货后在不拿回老数据的前提下加新词。
举例来说,假设出货时支持 8 个词,后来要加左与右,这个例子只是帮助理解任务形态。论文把已部署词记为集合 Y1,新词记为集合 Y2,二者不相交,再加一个背景标签表示都不是。基座在只含 Y1 加背景的数据 D1 上训练,扩展阶段只能看到只含 Y2 加背景的数据 D2。
约束有两条,第一是严格无退化,即扩展后对老词的输出与阈值行为对任何输入都与发货版本完全一致。第二是增长有上界,即新增参数不超过 10k,基座约 150k,最终约 160k。凡是会改写基座通路或需要老音频的方法都不满足约束。
已有哪些路线,为什么它们不能直接拿来用?
先按同输入同目标同运行阶段对照,才能看清取舍。第一条路线是固定词表的小模型,包括卷积网络与流式单值分解滤波器网络,英文为 singular value decomposition filter,缩写为 SVDF。这类模型在紧延迟与内存下精度强,但加词通常要重训并仔细平衡类别。
重训可能让老词退化。第二条路线是开放词表与查询式检测,英文为 open-vocabulary and query-based KWS。它们能检用户自定义短语,但在嵌入式噪声下或遇到发音相近词时,稳健性往往不如固定词表系统。
第 3 条路线是迁移与小样本度量学习,例如原型网络,英文为 prototypical networks。它们用少量标注音频加新词很灵活,但老词稳定性在模型被更新且老数据不可用时仍然难保证。第四条路线是持续学习,英文为 continual learning。
基于正则的方法如弹性权重巩固与无遗忘学习,英文为 elastic weight consolidation 与 learning without forgetting,缩写为 EWC 与 LwF,通过约束参数漂移给软保护。基于回放的方法要存老数据或生成样本,与老数据不能存不能用的设定直接冲突。
第五条路线是参数高效微调,例如适配器与低秩适配,英文为 adapters 与 low-rank adaptation,缩写为 LoRA。它们训练参数少,但仍会改变共享计算路径,因此不能保证老词行为不变。第六条路线是渐进神经网络,英文为 progressive neural networks。
它冻结老列并加新列加侧向连接,但通常假设推理时已知任务标识,而本文是单个常开固定时延检测器,没有任务标识可查。
持续学习 × 模块化扩展: 持续学习负责在只有新数据时约束或回放以减轻灾难性遗忘,但通常只给软性保护且回放与无原始数据约束冲突;模块化扩展负责冻结老通路并另开参数封顶的新通路,二者搭配的理由是把遗忘问题从优化约束转为结构隔离,组合意义是在嵌入式固定时延检测器中得到按构造保证的老词不变性。
论文的判断是,在老数据不可用且老词判决必须逐输入一致的条件下,软约束与回放都不够用。只有结构隔离能给出按构造的保证,这就引出了冻结整条基座另开分支的方案。
要解决的扩展问题如何形式化?
把问题写成可执行的形式有助于复现。记单条语音为 x,基座模型为 fbase,参数为 theta_base,在 D1 上训练。基座输出核心逻辑值,经 Softmax 得到核心概率,对应老词加背景。
扩展模型为 fexp,新增参数为 theta_exp,只在 D2 上训练,输出两组概率,核心概率与新词概率分别对应老词加背景与新词加背景。目标是在新增参数封顶、只用 D2 训练的条件下,让新词性能尽量好。
同时满足对所有 x 都有核心逻辑值恒等,即扩展后的核心逻辑值等于基座的核心逻辑值,从而核心概率也逐项相等。训练目标只在新头上做交叉熵,即最小化在 D2 上负对数似然的期望,只更新 theta_exp。
推理不只保留逻辑值,还要保留发货时的逐词阈值决策规则,因此采用核心优先,英文为 core-first decision rule。先算每个老词的核心分数并取最大值对应的词,若超过该词发货阈值就直接输出该老词。
只有核心判为背景时才查新头,若新词最大分数超过对应新阈值则输出新词,否则输出背景。这个顺序是安全保证的一部分,不是可有可无的后处理。评测的工作点固定为在独立负样本集上每词 1% 误接受率,英文为 false accept rate,缩写为 FAR。
再在测试正样本上算宏平均漏检率,英文为 false reject rate,缩写为 FRR。漏检越低越好,但前提是误接受率已对齐,否则阈值松紧会直接搬运错误。
方法全景:一个样本如何走完两条通路?
沿一个 1 秒语音样本走一遍最清楚。样本先算成 40 维对数梅尔滤波器组,英文为 log-mel filterbanks,帧窗 25 毫秒,帧移 10 毫秒。特征进入冻结的编码器堆叠,每块做瓶颈压缩、SVDF 时序建模、批归一化、硬 Swish 激活与丢弃。
编码器输出经线性层与全局最大池化送入核心头,得到老词逻辑值,这条就是发货时的老路,参数与运行统计全部冻结。扩展阶段另开一条蓝色新路,它在选定深度上抽取冻结块的激活,与上一块扩展输出拼接。
再做轻量残差变换,最后池化送入新词头得到新词逻辑值。训练时只有蓝色部分与新词头可学,老路不产生梯度更新,也不更新批归一化的仿射参数与滑动统计。推理时先跑老路做阈值判决,老路通过则直接返回,不再跑新路。
老路拒绝才跑新路。这种先老后新的顺序让最坏情况计算量等于两路之和,但常见老词命中时只付老路成本。下面的基座结构图把主路径与块内顺序画了出来,可对照文字逐框核对。
下面这段先说明基座主路径从特征到分类的纵向顺序,再引出右侧编码器块的内部细节,读图时重点核对箭头方向与模块堆叠是否与正文一致。
看图路径: 1. 先从顶部对数梅尔滤波器组沿黑色箭头向下追踪主路径的五个方框;2. 再看右侧橙色编码器块内部从瓶颈层到丢弃层的五个子模块顺序;3. 确认左侧主路径中编码器块标注的重复次数符号与右侧细节的对应关系
论文图 1。原论文 Figure 1:“Base model and Encoder Block for core-keyword clas- sification.”。
该图左侧显示自上而下依次为对数梅尔滤波器组、可重复多次的编码器块、线性层、全局最大池化与 Softmax。右侧把单个编码器块展开为瓶颈层、SVDF、批归一化、硬 Swish 与丢弃的垂直链。
像素可见橙色块表示可堆叠的编码器,白色方框为具体算子,黑色箭头均为自上而下单向流动,没有横向旁路。这个结构是后文冻结对象的全集,冻结意味着图中所有橙白模块的参数与统计在扩展阶段都不变。新能力只能从抽取这些模块的中间激活中生长出来。
扩展块内部做了什么计算?
扩展块是唯一新增的可训练表示部件,需要讲清输入、拼接与变换。每个扩展块取两路输入,一路是对应深度的冻结基座块激活,另一路是上一个扩展块的输出,沿通道维拼接。
拼接后做 1 维时序卷积,英文为 Conv1D,核小,只看时间邻域,再做批归一化与硬 Swish。第一个扩展块是特例,它没有上一个扩展输出,只有冻结编码器激活,此时拼接退化为恒等。
块输出作为下一扩展块的输入之一,最后一个扩展块输出经时序池化送入新头。新头是独立的线性分类器,输出维度为新词数加一,对应新词加背景。新增参数总量为所有扩展块加新头,上限 10k。
论文在新词为左与右时测试了扩展块数的影响,发现只抽浅层时错误率高,抽到 4 个块时中位数最低。继续加深则持平或略降,解释是基座最深层已过度专用于老词表,对新词迁移价值有限。后续比较统一用四块扩展。
扩展块的并排结构与块内算子顺序由下图给出,可对照拼接位置与双路汇合方式。下面这段先点明左图双塔分叉与右图块内 4 步变换的观察顺序,再引出对拼接与残差含义的解释。
看图路径: 1. 先看左图顶部共享编码器之后如何分叉为橙色老路与蓝色新路;2. 再看左右两路各自经过线性层全局最大池化与 Softmax 的对称结构;3. 最后看右图扩展块内部从拼接经一维卷积批归一化到激活的垂直顺序
论文图 2。原论文 Figure 2:“Expanded model. Each Expanded Block taps a frozen Base Block activation, merges it with the previous expanded state, and applies a lightweight residual transform.”。
该图左半显示顶部共享若干编码器块后分叉,左侧橙色继续走原编码器、线性、池化与 Softmax 的老路。右侧蓝色走扩展块、线性、池化与 Softmax 的新路,中间有多条从橙色指向蓝色的抽取箭头。
右半把单个扩展块展开为拼接、1 维卷积、批归一化与硬 Swish,顶部有两个汇入拼接的箭头,分别对应冻结激活与上一扩展状态。像素可见蓝色底块为新增可训练部分,橙色仍为冻结部分,左右两塔在底部各有独立 Softmax。
两组概率分头归一化,不共享归一化分母。这个双 Softmax 加核心优先的组合是无退化的关键,任何把两组词放在同一个 Softmax 里重训的做法都会改变老词分母从而破坏恒等。
训练时冻结什么、更新什么、监督从哪里来?
训练分两个阶段,信息条件必须分开。基座阶段用 D1 训练 40 轮,优化器为 Adam,学习率为余弦调度,英文为 cosine schedule。特征上直接做 SpecAugment 的时间掩蔽与频率掩蔽,英文为 time masking、frequency masking。
基座约 150k 参数,训练目标是老词加背景的交叉熵。扩展阶段只用 D2 训练 10 轮,同样用 Adam 与余弦调度,同样在对数梅尔特征上做 SpecAugment。冻结范围是整条基座通路,包括批归一化的仿射参数与滑动均值方差。
扩展时不更新也不重估。可训练的是扩展块与新词头,监督只来自 D2 的新词加背景标签,损失为新头交叉熵。论文未报告扩展分支的具体学习率初值、权重衰减、丢弃率与掩蔽超参数的具体数值。
复现时需先按基座常用设置起步并以验证集调参,同时明确记录这些缺项,不从模型名推定实现。基线中全量微调会更新全部参数,EWC 需要基于 D1 估计的 Fisher 信息因此严格说违反了无 D1 设定。
论文将其仅作上下文参考。头-only 只训新分类头相当于零块的特例,独立集成则另训一个约 10k 参数的独立小模型再用同样的核心优先规则组合。适配器与低秩适配在本研究中被放在并行分支上 feeding 新头。
核心优先决策 × 新词头: 新词头负责在新词加背景的标签空间上输出概率,只在核心检测器判为背景时才被查询;核心优先决策负责先用发货时的每词阈值判断老词,只有核心拒绝才看新词分数,二者搭配的理由是推理顺序本身就是安全机制,组合意义是即使新词头过自信也不会覆盖已确认的老词判决。
记住这个冻结与更新分界,后面看到核心短语结果完全不变时就知道不是偶然。而是参数与决策顺序共同锁定的结果,这也是判断方法是否满足部署约束的检查点。
数据、划分与指标如何保证比较公平?
实验条件是复现的基准,必须逐项核对。语音数据为谷歌语音命令第二版,英文为 Google Speech Commands v2,缩写为 GSC,采用官方训练验证测试划分。目标词表为 10 个命令,分别为左、右、开、关、停、走、上、下、是、否。
GSC 中其余词与静音段都映射为背景标签。扩展任务做成 5 个留出词对以降低对单组词选择的敏感并覆盖不同易混模式,每次把 1 对作为新集,剩下 8 个作为核心集。词对分别为左与右、开与关、停与走、上与下、是与否。
基座在 GSC 训练集中只含核心加背景的子集 D1 上训练,扩展只用 GSC 训练集中只含新词加背景的子集 D2,不接触 D1 音频。为得到比 GSC 自身更无偏的负分布,误接受率校准用的负样本来自 Mozilla Common Voice 第 17 版测试集。
英文为 Mozilla Common Voice v17,缩写为 CV。所有报告结果的正样本来自 GSC 测试集,阈值校准用的负样本来自 CV 测试集。每个关键词的阈值选到在 CV 上 1% 误接受率,用的是对应头的分数。
老词用核心头,新词用新头。阈值固定后在 GSC 测试集上算漏检率,并在被评估集合内宏平均。每个方法与词对组合重复 8 个随机种子,报告样本均值与用 t 统计量的 95% 置信区间。
新增容量一律封顶 10k,推理成本按部署的核心优先流水线统计 1 秒语音的最坏情况乘加操作数,英文为 multiply-accumulate operations,缩写为 MACs。
冻结基座 × 扩展分支: 冻结基座负责原封不动地复用已发货的编码器激活、批归一化统计与核心分类头,保证老词逻辑与阈值对任何输入都不变;扩展分支负责从冻结激活中抽取可复用的语音表示并用轻量时序卷积学出只服务新词的残差特征,二者搭配的理由是把稳定性与可塑性拆到两条物理上不互相改写的通路上,组合意义是用单向抽取边实现严格无退化下的新词能力增长。
误接受率 × 漏检率: 误接受率负责度量在非目标音频上错误触发的比例,用于为每个关键词定阈值;漏检率负责度量在目标关键词出现时没有触发的比例,用于在阈值固定后比较检测能力,二者搭配的理由是关键词检测必须先固定工作点再谈漏检,否则阈值松紧可以直接互换两类错误,组合意义是所有方法都在 1% 误接受率校准后比较宏平均漏检率,保证比较公平。
上述划分意味着核心与新词的正负来源不同,阈值在 CV 上定、漏检在 GSC 上测。任何把阈值与测试混在同一分布上调的做法都会改变工作点,不能与本文数字直接比较。
主结果:在同预算下谁的新词漏检更低,老词是否真不动?
比较的问题是,在新增参数都不超过 10k 且都只能看新数据的前提下,新词宏平均漏检谁最低。老词是否保持发货水平,指标方向为漏检率越低越好,计算量越低越好。公平条件包括同为核心优先推理、同为 1% 误接受率校准、同为 5 个词对上的多种子平均。
全量微调与 EWC 会改写核心因此单独看老词退化,头-only、独立集成、适配器、低秩适配与本文方法都冻结核心因此老词与基座完全一致。下表整理部署流水线下的参数与最坏情况计算量,可看出同为约 160k 参数时计算开销并不相同。
| 方法 | 参数量 | 最坏情况计算量 | 相对计算量 | 核心是否冻结 |
|---|---|---|---|---|
| 基座模型 | 150 | 15.08 | 1.00× | 是 |
| 独立集成 | 160 | 16.14 | 1.07× | 否 |
| 本文方法 | 160 | 16.34 | 1.08× | 是 |
| 适配器分支 | 160 | 18.45 | 1.22× | 是 |
| 低秩适配分支 | 160 | 20.52 | 1.36× | 是 |
表中可见本文方法在同为 160k 参数量级时最坏情况为 16.34M,低于适配器的 18.45M 与低秩适配的 20.52M。只比独立集成的 16.14M 略高 0.20M,相对倍率分别为 1.08 倍、1.22 倍、1.36 倍与 1.07 倍。
收益是精度提升没有用更多计算换来,代价是最坏情况仍比只跑基座多约 8%。论文只报告最坏情况,未报告平均触发率下的实际平均计算量与真实延迟,这是部署时需补测的缺项。低秩适配计算最高但新词精度次优,说明参数量相同不等于推理开销相同。
第二个比较问题是新词漏检的绝对水平与稳定性,条件同样为 5 个留出词对、每词 1% 误接受率、宏平均与多种子区间。下表按词对列出新词漏检率与平均值,单位为百分比,数值保留原文 1 位小数与括号内区间写法。
| 方法 | 左与右 | 开与关 | 停与走 | 上与下 | 是与否 | 平均 |
|---|---|---|---|---|---|---|
| 全量微调 | 2.86(±0.48) | 2.14(±0.46) | 1.60(±0.50) | 3.33(±0.70) | 1.82(±0.47) | 2.35(±0.27) |
| 仅训新头 | 42.55(±16.44) | 28.11(±11.68) | 18.61(±10.88) | 12.13(±2.43) | 10.11(±2.20) | 22.30(±4.27) |
| 独立集成 | 8.77(±2.00) | 3.81(±0.99) | 6.68(±1.91) | 5.82(±0.73) | 7.21(±1.17) | 6.46(±0.42) |
| 适配器 | 13.38(±1.68) | 8.95(±1.61) | 6.68(±2.01) | 5.74(±0.65) | 5.52(±0.80) | 8.05(±0.35) |
| 低秩适配 | 9.88(±1.36) | 5.84(±1.28) | 6.61(±2.11) | 5.12(±1.78) | 4.61(±0.86) | 6.41(±0.66) |
| 本文方法 | 6.69(±1.04) | 2.68(±0.39) | 4.56(±0.86) | 4.57(±0.73) | 3.36(±0.38) | 4.37(±0.33) |
平均值显示本文方法为 4.37%,比可部署的独立集成基线 6.46% 低 2.09 个百分点。比低秩适配 6.41% 与适配器 8.05% 都低,比仅训新头的 22.30% 大幅降低。分词对看,本文方法在开与关上为 2.68%,接近全量微调的 2.14%。
在左与右上为 6.69% 仍高于全量微调的 2.86%,说明提升不是在每组都追平无约束上限。全量微调新词平均 2.35% 看似最好,但它把老词平均漏检从基座的 2.71% 推高到 69.08%,属于灾难性遗忘,英文为 catastrophic forgetting,不可部署。
EWC 把老词退化缓解到平均 4.47%,但新词平均仍为 7.95%,且它用了来自 D1 的信息,违反严格无 D1 设定,只能作参考。未胜出项是低秩适配在是与否上为 4.61%,与本文方法的 3.36% 差距较小。
说明在某些发音区分度高的词对上差距会缩小,不能把平均优势推广为每组必胜。
适配器微调 × 低秩适配: 适配器微调负责在主干中插入小瓶颈模块以低参数量学新任务,低秩适配负责用低秩旁路更新近似全量微调,二者在本研究中都被放在分叉的新词分支上以避免直接改写核心头,但仍需额外推理计算,分工都是参数高效,搭配比较的理由是检验同为增加约 10k 参数时谁的新词泛化与计算开销更优,组合意义是凸显复用冻结激活的残差扩展在精度与乘加操作数上的同时优势。
综合判断是,报告显示在严格冻结与同预算下模块化扩展的新词检测更优且计算更少。但该支持限于 GSC 加 CV 的评测分布与 1% 工作点,噪声与连续语音流中的表现待验证。
扩展多深才够:抽取层数如何影响新词错误?
消融问题是扩展分支抽取多少个冻结块时新词漏检最低,是否越深越好。实验固定新词为左与右,只改变扩展块数,其余训练与阈值条件不变。指标仍为新词漏检率,箱体反映多种子分布。
浅层直觉是底层特征偏声学抽象不足,深层直觉是顶层已专用于老词表,对新词迁移价值下降,中间某处可能最优。下面箱线图展示块数从 1 到 7 的分布变化,可直接观察中位数落差与离散程度。
下面这段先说明横轴为块数纵轴为漏检率百分比,再提示先看前三箱与后四箱的整体落差,最后引出对四块最优与之后饱和的判断,读图时不要把须线长度直接当成方法好坏的唯一依据。
看图路径: 1. 先确认横轴为扩展块数量从 1 到 7 纵轴为新词漏检率百分比;2. 再比较前三个箱体中位数与上下须线明显高于后四个箱体的落差;3. 最后观察块数为 4 到 7 时中位数趋平且箱体变窄的饱和形态
论文图 3。原论文 Figure 3:“New-keyword FRR (%) vs. Expanded Blocks L for Y2 = left,right.”。
该图像素显示横轴为 1 至 7 的整数块数,纵轴为漏检率百分比,7 个蓝色箱体自左向右排列。块数为 1 时箱体中位数约 12.5%,上须线超过 20%,下须线约 8.5%,箱体跨度最大。块数为 2 与 3 时中位数降至约 9.5% 与 8.2%,但上须线仍较高。
块数为 4 时中位数骤降至约 4.9%,箱体与须线明显收窄。块数为 5 至 7 时中位数在 5.2% 附近徘徊,块 6 箱体最窄但中位数未再下降,块 7 中位数略升。可见从 3 到 4 存在 1 次阶跃式改善,4 之后趋平或轻微波动。
论文据此采用四块扩展作为后续比较的固定配置。这个结论支持特征复用深度需要折中,但仅在左与右单组上展示箱体。其余 4 组是否同样在四块最优,原文未给出完整曲线,不能推广为所有词对的最优深度。
哪些边界没有测,哪些数字不能外推?
先区分直接报告、有限解释与未验证推测。直接报告的是 5 个词对在固定工作点下的宏平均漏检、参数量与最坏情况乘加操作数。以及全量微调的老词灾难性遗忘与 EWC 仍有残留退化。
有限解释的是对扩展深度的讨论,论文用浅层语义抽象不足与深层过度专用于老词来解释先降后平。但这只是与观察一致的解释,没有逐层相似度或探针实验证据,只能写成可能原因。
未验证推测包括多阶段连续加词、紧延迟下的真实功耗与唤醒延迟、噪声与远场下的稳健性。论文在结尾明确把多阶段扩展列为未来工作,说明当前只验证单次加一组新词。
没有验证第二次、第三次扩展时参数如何分配、老扩展是否也被冻结、误差是否累积。资源状态方面,本次没有发现来源绑定且完成超文本传输安全协议状态验证的资源。不得声称代码、模型或数据已公开,只能按论文文字复现特征、划分与训练轮数。
另一个边界是阈值校准依赖 CV 测试负样本,若部署环境的负分布与 CV 差异大,1% 工作点会漂移。漏检数字也会变。还有平均计算量缺失,最坏情况不等于每次推理都跑双路。
实际平均成本取决于核心拒绝率,而核心拒绝率在不同信噪比下会变,未测量就不能承诺延迟改善。最后是统计口径,区间基于 8 种子 t 统计,不同种子上方差不小。
例如仅训新头在左与右上区间达正负 16.44 个百分点,说明单种子结果波动大,复现时必须多种子平均。
要复现这套结果,先做什么、按什么顺序做?
复现清单按学习依赖排序,每一步都对应原文明确条件。第一步准备数据,下载 GSC 第二版并用官方划分。目标 10 词按 5 个留出对切分,每次八词加背景为 D1、1 对加背景为 D2。
其余词与静音映射为背景,再准备 CV 第 17 版测试集只作负样本校准,不参与训练。第二步做特征,16 千赫单声道,40 维对数梅尔,25 毫秒窗 10 毫秒移。训练时在特征上做 SpecAugment 的时间与频率掩蔽。
第三步训基座,SVDF 风格编码器加线性、全局最大池化与 Softmax,约 150k 参数。Adam 加余弦调度训 40 轮,目标为老词加背景交叉熵。记录每词在 CV 上 1% 误接受率的阈值与在 GSC 上的宏平均漏检,基座平均约 2.71% 可作检查。
第 4 步冻基座,包括批归一化仿射参数与滑动统计,搭建四块扩展分支与新词头。总新增不超过 10k,只用 D2 训 10 轮,只更新新增参数。第五步推理实现核心优先,先用发货阈值判老词。
老词命中直接返回,只有判背景才跑新路并用新阈值判新词。最坏情况乘加操作数按 1 秒语音统计,核对 160k 参数下约为 16.34M。第六步对比基线,同预算实现头-only、独立约 10k 小模型集成、适配器分支与低秩适配分支。
同为核心优先与同工作点,每组跑 8 种子并按 t 统计报区间。缺项需单独记录,包括扩展分支学习率、掩蔽宽度、丢弃率、权重衰减与早停。原文未给,只能在验证集上调参并如实报告。
没有像素时不要猜模块宽度与卷积核尺寸,应以参数预算反推并保证总数不超 10k。
何时值得尝试这种冻结加分支的思路?
回到中心矛盾,嵌入式关键词检测要同时满足出货后可长大与已发货体验逐输入不变。前者要求可塑,后者要求不可变,常规重训与软约束都把两者放在同一组参数里互相拉扯。
本文把它们拆到两条通路上,用冻结换不变性,用抽取加轻量变换换可塑性。并用核心优先的推理顺序把不变性从逻辑值延伸到阈值判决。当你的场景同时具备 3 条时值得尝试。
第一是老音频因隐私或存储拿不回来,第二是老词退化不可接受,第三是新增预算与计算有硬上限。例如 10k 参数与约 8% 最坏情况增量可接受。尝试时先验证基座在你的词表与负分布上能否达到可接受的老词漏检。
再做单次扩展的四块消融,因为最优深度与词表相似度有关,不能默认四块全局最优。还需补的验证包括连续多轮扩展的累积误差、真实流式音频下的误触发与功耗。
以及与你环境匹配的负样本校准,只有这些补齐后,才能把论文在 GSC 加 CV、1% 工作点上的 2.09 个百分点平均增益外推为产品收益。反之,若老数据可用且允许短暂回滚重训,或新词与老词发音高度重叠需要联合建模。
冻结分支的收益会变小,应优先考虑联合重训或更大容量的分支,并重新评估计算与延迟。总之,该方法提供了一种按构造保老词、可核对、可复述的扩展范式,适用边界清晰,复现路径明确。剩余不确定性也已点名,这正是初学者可以接着动手的部分。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


