英文题目:LLM-HB: Language-Aware LLM-Guided Hotword Biasing for Code-Switching ASR
会议身份:
conference:interspeech:2026:conference-paper-id:he26c_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#混合专家模型 #大语言模型 #多语言 #语音识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Yuxuan He:机构信息未能从会议 PDF 纯文本可靠映射
- Genshun Wan:机构信息未能从会议 PDF 纯文本可靠映射
- Pengcheng Li:机构信息未能从会议 PDF 纯文本可靠映射
- Gongping Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Jian-Qing Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Yanmin Qian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
中英码切换语音识别需在单句内转写中英文交替语音,难点在于语言边界处声学混淆与英文实体及中文命名实体等热词稀少难识别。该工作以 Whisper-medium 编码器提取声学特征后经混合专家适配器做语言特化映射,再与热词嵌入拼接输入经 LoRA 微调的 Qwen3-4B 解码,同时以辅助语言头约束大语言模型隐状态保留语言判别性。热词以提示方式注入并辅以偏置损失强化目标位置的生成概率,从而在解码端实现自适应上下文偏置。与仅做单语建模或解码后融合的已有码切换方法不同,该机制将语言分离与大语言模型条件偏置联合优化,使双语热词信号反向影响专家分配。在 ASRU2019 码切换测试集 15 个干扰词设置下,完整模型混合错误率达到 5.85%,相对自家基线 7.34% 降低 20.30%,其中偏置混合错误率从 22.11% 降至 8.99%。该结论目前仅在该单数据集及固定热词构造下验证,对近音词、大规模热词库及跨数据集泛化的表现尚未证明。原文未披露推理延迟与部署成本,训练规模差异下作者声明不宜与先前工作直接比较。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
任务是什么:为什么码切换比单语识别更难?
输入是一段中英文混读的语音,目标是输出混排的文字转写。论文研究的是句内也会切换的码切换语音识别,难点在于相邻音节就可能换语言,声学发音与语言模型都会互相干扰。举例来说,同样一段英文人名放在中文句子里,单语中文模型容易按拼音规律误写,单语英文模型又缺少中文上下文,这就是跨语言干扰。评价时不能只用中文字符错误率或英文词错误率其一,论文用混合错误率把两者按语言分别统计再合并,方向是越低越好。
码切换 × 混合错误率: 码切换指一句话内中英文交替出现,识别器要在相邻帧或相邻词之间切换语言模型;混合错误率是为这种混合文本定的总体指标,对中文按字算字符错误率、对英文按词算词错误率再混合统计。二者搭配的原因是单看中文字符错或英文单词错都会偏袒一方,只有混合统计才能反映跨语言干扰的真实代价,组合意义是后文所有改进都要同时接受中文与英文两部分的检验。
本文的输入条件、目标与输出都围绕这个混合转写任务展开。输入是梅尔频谱图,输出是中英混排词序列,中间必须保留语言边界信息与稀有词信息。后续所有模块都可以理解为两件事:先让声学表示分得清当前是中文还是英文,再让语言模型在给定热词名单时更愿意生成名单中的稀有形式。研究生复述时要先说清这一点,再进入具体结构,否则容易把热词偏置误解为单纯的词汇表扩大。
已有路线走到哪里:声学分离与热词偏置为何各做各的?
在码切换识别一侧,已有工作主要缓解声学与语言建模的混淆。代表性做法有用两个独立预训练编码器分别建模中文与英文的双编码器结构,有用语言感知框架动态特化表示,有用混合专家适配器做动态专家分工,还有把帧级或词级语言后验拼回声学表示,或做语音与生成式码切换文本的跨模态对齐。这些工作的共同输入输出与本文相同,但监督多放在转写与语言区分上,没有显式考虑上下文偏置。
在上下文偏置一侧,已有工作主要解决命名实体与稀有词的识别。按大模型出现前后可分两类:早期把热词嵌入与声学表示在解码中融合,位置可以在语音编码器内、编码器后或识别解码器前;引入大模型后,一类先生成初版转写再检索语义相似热词做修正,另一类用对比学习对齐声学与热词嵌入空间再用近邻检索给大模型做条件。这些方法多为单语识别设计,没有处理双语名单与语言切换的交互。论文明确指出,已有把偏置引入码切换的工作很少,也没有充分利用大模型做自适应多语偏置,这就是本文的切入点。
本文要解决的具体矛盾是什么?
矛盾是两类误差同时存在但已有方法分开处理。一方面语言切换造成声学表示混淆,需要语言特化的声学建模;另一方面稀有英文词与中文命名实体在训练中出现少,需要名单驱动的偏置。如果只做语言分离,热词仍会被高频常见词压制;如果只做单语偏置,双语名单会引入新的跨语言干扰。
论文因此提出语言感知的大模型引导热词偏置框架,要在一个端到端目标里同时优化转写准确、语言区分与热词强调。理解这一点后,就能明白为什么模型同时需要混合专家、语言头与热词提示 3 个部件,缺任何一个都会只解决一半问题。
方法全景:一个样本如何从语音走到文字?
沿一个样本走一遍有助于建立整体依赖。输入是梅尔频谱图,先经预训练的 Whisper 编码器提取声学特征,训练中该编码器会微调。再经混合专家适配器做语言特化变换,得到与大模型维度对齐的语音嵌入。同时热词名单加特殊无偏置符号经冻结的大模型分词器分词,再经可微调的大模型文本编码器得到热词嵌入;训练时真实转写文本走同样分支得到目标文本嵌入。
推理与训练的输入拼接方式是把语音嵌入、热词开始符、热词嵌入、转写开始符、目标文本嵌入与结束符按顺序送入低秩适配的大模型,大模型输出隐状态再经输出投影层预测词,同时经辅助语言头预测语言。红色虚线框内的辅助语言头与真实文本编码分支只在训练时使用,推理时去掉,这是复现时必须保留的信息条件。
下面这张总体框架图把 3 路嵌入、一体化大模型与两个训练期分支画在了一起,读图时先抓主路再看训练期附加分支,就能避免把推理结构想复杂。
看图路径: 1. 先从左下语音波形沿 Whisper 编码器向上追踪到 MoE 适配器再到语音嵌入的声学主路;2. 再看中间热词名单经分词器与文本编码器得到热词嵌入的第二路,以及右侧转写文本只在训练时出现的第三路;3. 核对顶部可训练与冻结图例,确认分词器冻结而编码器与大模型低秩适配部分可训练;4. 观察右侧 MoE 子图路由器如何用门控权重把同一输入分配给不同专家再聚合
论文图 1。原论文 Figure 1:“The framework of the proposed large language model-guided hotword biasing method and MoE adaptor.”。
从像素可见,左路是语音经 Whisper 编码器与混合专家适配器得到语音嵌入,中路是热词名单经分词器与文本编码器得到热词嵌入,右路是转写文本分支并用红色虚线标出训练期专用。中间橙色长条是低秩微调的大模型,顶部绿色块分别是辅助语言头与输出投影层,图例用雪花与火焰区分冻结与可训练参数。右侧子图单独展开混合专家,底部路由器根据输入产生门控权重,多个前馈专家并行处理后再经聚合块与层归一化得到最终语音嵌入。这种画法对应的真实计算是声学路提供语言可分的连续表示,热词路提供离散名单的语义表示,两者在提示序列中汇合后由大模型统一解码。
声学如何分语言:混合专家与辅助语言头做了什么?
混合专家适配器的计算分 3 步。给定声学特征,路由器计算前 K 个门控权重,被选中的专家各自用前馈网络独立处理输入,再按权重加权求和得到中间表示,最后经前馈层加层归一化得到最终语音嵌入。论文实现是稠密双专家加取前二门控,把 1024 维声学嵌入投到 2560 维以匹配大模型输入空间。辅助语言头的计算是把大模型隐状态经层归一化加前馈再做柔性最大化,输出每个词位置属于普通话、英语与其他的三分类分布,用交叉熵做监督。
混合专家适配器 × 辅助语言头: 混合专家适配器负责把声学特征动态分配给不同专家做语言特化变换,提供容量与分流能力;辅助语言头负责从大模型隐状态预测当前词属于普通话、英语还是其他,为融合后表示提供显式语言监督。二者搭配的原因是路由本身没有语言标签监督,容易学成无意义分工,语言头通过反向传播让融合表示保留语言可分性,从而间接引导门控按语言分流,组合意义是容量与监督互补,专家分化是隐式涌现而非硬性指定。
关键细节是监督路径。路由机制本身没有显式监督,语言预测损失加在专家聚合之后的大模型共享表示上,梯度经融合嵌入反向传播回门控网络,促使门控按语言更一致地分配。由于注入的热词横跨中文与英文,偏置目标也会与语言监督相互作用,强化专家向语言对齐模式分化。论文把这种分化表述为隐式涌现,不是硬性指定每个专家负责哪种语言,复述时不应写成专家一负责中文、专家二负责英文的确定性结论。
名单如何起作用:热词提示与偏置损失的计算目标是什么?
热词偏置的输入是声学与热词集合,目标是提高解码时热词对应词的后验概率。具体做法是把热词嵌入作为提示拼入大模型输入,损失只对目标序列中属于热词的位置求负对数似然,非热词位置仍由标准识别损失建模。这样模型被鼓励在偏置相关位置优先生成名单形式,同时保留对普通区域的常规建模。
热词偏置 × 大模型提示: 热词偏置指在解码时提高给定名单中稀有词或命名实体的后验概率,分工是解决长尾词被常见词淹没的问题;大模型提示指把热词嵌入与语音嵌入拼接成输入序列交给大模型,分工是利用大模型的上下文建模能力做自适应加权。二者搭配的原因是传统偏置多在声学端融合嵌入,难以处理中英双语名单的语义差异,而提示方式可以直接注入双语热词并与偏置损失配合,组合意义是在保持非热词建模的同时定向增强热词位置的生成概率。
训练时每个小批量中每条语音有 50% 概率被选做偏置,从中随机采样 1 至 4 个词组成热词名单。评估时热词名单的构造是取测试集中全部英文词,再用中文分词命名实体工具抽取中文命名实体,每条语音配 15 个干扰词。这种构造方式意味着评估名单同时包含中英两种语言,正好检验双语偏置能力。需要提醒的是,名单规模与干扰词数量是实验条件的一部分,更大词表下的行为论文未验证,不能直接推广。
联合训练如何组织:哪些参数更新、损失如何加权?
总体目标是识别损失加偏置损失加语言损失的加权和,权重分别设为 0.6 与 0.3。识别损失是目标转写词上的标准交叉熵,语言损失是每词语言分布上的交叉熵,偏置损失是热词位置上的负对数似然。参数方面,Whisper 编码器微调,混合专家适配器可训练,热词与文本编码器部分微调,大模型主体用低秩适配微调,分词器冻结。优化器用 AdamW 加三角学习率调度,一个周期 47040 步,共训练两周期 94080 步,峰值学习率 1.5 乘 10 的负 4 次方,约 2200 小时语音用 8 张加速卡训练。
偏置损失 × 识别损失: 识别损失是对全部转写词的标准交叉熵,分工是保证整体转写正确;偏置损失是只对热词对应位置求负对数似然,分工是定向拉高热词的生成概率。二者搭配的原因是只用识别损失时热词样本少、梯度被稀释,只用偏置损失会牺牲通用识别,需要用权重 λ1 平衡,组合意义是论文用联合目标同时优化转写准确、语言区分与热词强调,λ1 增大则英文词错误下降但中文字符错误可能回升。
论文用权重 λ1 调节偏置强度,后文消融显示较小偏置权重有利于总体混合错误率,较大权重会让中英文误差更均衡。复现时应先固定 0.6 做主结果,再扫权重观察权衡,不要把单次最优直接当可部署默认。原文未报告梯度裁剪、权重衰减等全部优化细节,缺项应如实记录,不从模型名称推定实现。
实验条件是什么:在什么数据与指标下比较?
数据用 3 个基准:1000 小时中文 AISHELL-2、960 小时英文 LibriSpeech 与 200 小时码切换 ASRU2019。训练有两种设置,一是只用 200 小时码切换集,二是三者联合约 2200 小时,评估始终在 ASRU2019 码切换测试集上进行。语音编码器用 Whisper 中等规模,大模型用 Qwen3-4B。指标包括混合错误率、中文字符错误率、英文词错误率,以及只统计热词区间的偏置混合错误率、偏置字符错误率与偏置词错误率,方向都是越低越好。基线是 Whisper 中等编码器加线性投影层加冻结大模型,不含混合专家、语言头与热词提示,后续变体逐个加入以保证可比性。
关于资源可得性,本次收到的证据中未发现来源绑定且完成网络状态验证的资源,不得声称代码、模型或数据已公开。论文正文提到热词名单的匿名链接,但按本次核对规则应写本次未能确认可达,不作为可复现的公开保证。热词名单的抽取依赖英文全选加中文工具抽取,工具版本与分词差异会影响名单构成,复现时需记录具体实现。
主结果说明什么:总体与热词各改善多少?
比较的问题是完整框架相对基线在相同大训练与相同 15 干扰词条件下是否同时改善通用与热词指标。公平条件是同测试集、同名单构造、同混合错误率统计口径,指标方向越低越好。下表把大训练下的通用与偏置指标放在一起,重点看混合错误率与偏置混合错误率的对照。
| 训练条件 | 指标 | 基线 | 本方法 | 偏置区间变化 |
|---|---|---|---|---|
| 三集联合约 2200 小时 | 混合错误率 | 7.34% | 5.85% | 相对下降 20.30% |
| 三集联合约 2200 小时 | 偏置混合错误率 | 22.11% | 8.99% | 区间大幅下降 |
| 三集联合约 2200 小时 | 字符错误率 | 基线对应值 | 4.94% | 相对下降 1.98% |
| 三集联合约 2200 小时 | 词错误率 | 基线对应值 | 13.21% | 相对下降 49.29% |
| 三集联合约 2200 小时 | 偏置字符与偏置词错误率 | 19.26% 与 22.90% | 3.01% 与 10.93% | 双语热词均改善 |
表后解释需要同时给出收益与代价。报告显示完整模型达到 5.85% 混合错误率,对应相对基线 7.34% 下降 20.30%,同时 4.94% 字符错误率与 13.21% 词错误率分别相对下降 1.98% 与 49.29%,支持偏置对英文词改善更显著的判断。偏置指标从 22.11% 降到 8.99%,偏置字符错误率从 19.26% 降到 3.01%,偏置词错误率从 22.90% 降到 10.93%,说明双语热词都受益。代价与限制是英文词错误率改善远大于中文字符错误率,说明增益不均衡;且大训练下通用与偏置差距缩小,支持泛化改善,但未胜出项是单看中文字符错误率时相对增益较小,不能把总体趋势说成每种语言同等改善。
偏置混合错误率 × 通用混合错误率: 通用混合错误率统计整句所有中英文的错误,分工是反映系统整体可用性;偏置混合错误率只统计热词区间的错误,分工是反映名单定制是否生效。二者搭配的原因是只看通用指标会掩盖热词改进,只看偏置指标会忽略对非热词的损伤,必须对照阅读,组合意义是判断偏置是否真正带来定向收益而没有破坏通用识别,例如本文大训练下通用混合错误率下降的同时偏置混合错误率下降幅度更大。
哪些部件真正起作用:小数据与权重扫描给出什么反证?
先看 200 小时小训练的反证。同样基线与变体在有限数据下表现分化,混合专家单独加入时混合错误率从 9.59% 升到 9.65%,显示额外参数在小数据下难优化;语言头与热词提示分别能降到 9.30% 与 7.48%,三者联合进一步到 7.36%。这支持热词提示是小数据下最强单项,而混合专家的收益需要大训练才能释放。下表整理小数据下的关键对照,条件是同为仅码切换训练集与同 15 干扰词评估。
| 训练条件 | 指标 | 基线 | 单部件 | 完整框架 |
|---|---|---|---|---|
| 仅 200 小时码切换 | 混合错误率 | 9.59% | 混合专家 9.65% | 完整 7.36% |
| 仅 200 小时码切换 | 混合错误率 | 9.59% | 热词提示 7.48% | 完整 7.36% |
| 仅 200 小时码切换 | 偏置混合错误率 | 26.91% | 热词提示 16.00% | 联合进一步改善 |
| 仅 200 小时码切换 | 语言头单项 | 基线对应值 | 9.30% | 与偏置互补 |
| 仅 200 小时码切换 | 结论 | 小数据难训专家 | 提示最显著 | 联合仍有效 |
再看偏置权重的权衡。实验在主干加偏置提示配置上扫描 λ1 从 0.0 到 1.0,记录混合错误率、字符错误率与词错误率。下图展示 3 条曲线的不同走向,是理解权重选择的直接证据。
下面这张权重扫描图横轴是偏置损失权重,纵轴左右分别对应不同误差,读图时不要把曲线向下直接等同于所有语言都变好,要分开看中英文各自走势。
看图路径: 1. 先确认横轴是偏置损失权重 λ1 从 0.0 到 1.0,左纵轴是混合错误率与字符错误率,右纵轴是词错误率;2. 对比红色混合错误率曲线在 0.1 附近最低而后波动上升的走势;3. 观察黄色英文词错误率随 λ1 增大总体下降,绿色中文字符错误率随 λ1 增大总体上升的交叉趋势
论文图 2。原论文 Figure 2:“Performance of backbone + hotword prompt models with different λ1 using MER, CER and WER.”。
从像素可见,红色混合错误率在 λ1 为 0.1 处最低,随后在 0.4 附近回升再缓慢上升;黄色英文词错误率从 0.0 到 0.1 急剧下降,此后总体继续下行;绿色中文字符错误率则从 0.1 后总体上行。在 0.6 处混合错误率为 7.50%,略高于最优,但字符错误率 6.14% 与词错误率 18.62% 比 0.1 处的 5.95% 与 20.08% 更均衡。论文因此在完整模型中取 0.6 以换取双语均衡,这是用总体最优换平衡的显式折中。专家数量消融也给出反例:双专家取二达到 7.19% 混合错误率,优于单专家 7.23%、双专家取一 7.21%、四专家取二 7.47% 与四专家取四 7.33%,支持双语任务中两个专家已够、更多专家增加优化难度而无明确表示收益的判断。
| λ1 设置 | 混合错误率 | 字符错误率 | 词错误率 | 与最优的差距 |
|---|---|---|---|---|
| 0.1 最优 | 7.48% | 5.95% | 20.08% | 总体最低但英文偏高 |
| 0.6 均衡 | 7.50% | 6.14% | 18.62% | 混合略升英文改善 |
| 趋势 | 先降后升 | 总体上升 | 总体下降 | 中英文权衡 |
| 选择 | 小权重保总体 | 大权重伤中文 | 大权重利英文 | 取 0.6 求均衡 |
| 适用 | 追求最低混合 | 追求中文 | 追求英文热词 | 按任务选权重 |
表后解释要指出未胜出项。λ1 为 0.1 时总体最优但英文词错误率仍高,λ1 为 0.6 时牺牲少量混合错误率换来英文改善,代价是中文字符错误率上升。专家配置中四专家未胜出,说明容量不等于效果。这些反例共同限制了把单点最优推广为通用最优的做法。
边界在哪里:哪些结论不能推广?
直接报告的是在 ASRU2019 测试集、15 干扰词、约 2200 小时训练下的混合错误率(%)与偏置指标改善。有限解释是混合专家加语言监督促进语言一致分流,因为路由没有显式标签,分化是隐式涌现,论文用表示监督与反向传播解释,但未提供专家与语言的定量对应统计,应表述为支持而非证明。未验证的推测包括更大热词词表、近音词混淆与实时延迟,论文在结尾把近音词与更大词表列为未来工作,说明当前未评测这些边界。
未测量误判率、推理开销与实际延迟时,不承诺这些量得到改善。总体趋势不等于每组都成立,例如中文字符错误率相对增益小,四专家配置未带来增益,都提醒不能把平均改善推广到所有子条件。
复现先做什么:最小可运行路径与必记参数是什么?
先复现评估流水线再复现训练。第一步按论文构造热词名单:取测试集全部英文词,用中文命名实体工具抽取中文命名实体,每条语音配 15 个干扰词并保留无偏置符号,记录工具版本与随机种子以保证名单一致。第二步搭建基线:Whisper 中等编码器加线性投影加冻结大模型,确认在联合训练与小训练两种数据量下的混合错误率量级,再逐个加入混合专家、语言头与热词提示。
第 3 步固定损失权重 0.6 与 0.3、双专家取二、峰值学习率与训练步数,训练时每条语音 50% 概率采样 1 至 4 个热词,推理时去掉真实文本分支与语言头的训练期输出。何时值得尝试是当任务同时存在语言切换与稀有实体,且能提供双语热词名单时;若只有单语或无名单,偏置分支的收益可能无法复现。还需补的验证是更大干扰词数量下的偏置稳定性、近音词误触发率与不同分词工具下的名单敏感性。
收束:如何一句话记住方法与证据?
记住一条依赖链:声学路用双专家提供语言特化容量,语言头用显式监督引导分流,热词提示用名单加偏置损失定向拉高稀有词,三者经大模型统一解码并用加权损失联合训练。最强证据是大训练下混合错误率从 7.34% 到 5.85% 相对下降 20.30%,且偏置混合错误率从 22.11% 到 8.99%,同时小训练下热词提示仍能把混合错误率降到 7.48% 并把偏置混合错误率从 26.91% 降到 16.00%。主要代价与条件是混合专家依赖大数据、偏置权重需要在总体最优与双语均衡之间选择、四专家与更大词表未显示额外收益。
复述时先讲任务矛盾,再沿样本走完输入到输出,最后用两类训练规模与权重扫描限定结论适用范围,就完成了可核对的方法复述。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

