英文题目:Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR

会议身份:conference:interspeech:2026:conference-paper-id:banerasroux26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#领域适应 #大语言模型 #低资源 #语音 #语音识别

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Thibault Bañeras-Roux:机构信息未能从会议 PDF 纯文本可靠映射
  • Sergio Burdisso:机构信息未能从会议 PDF 纯文本可靠映射
  • Esaú Villatoro-Tello:机构信息未能从会议 PDF 纯文本可靠映射
  • Dairazalia Sánchez-Cortés:机构信息未能从会议 PDF 纯文本可靠映射
  • Shiran Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Severin Baroudi:机构信息未能从会议 PDF 纯文本可靠映射
  • Shashi Kumar:机构信息未能从会议 PDF 纯文本可靠映射
  • Hasindri Watawana:机构信息未能从会议 PDF 纯文本可靠映射
  • Manjunath K E:机构信息未能从会议 PDF 纯文本可靠映射
  • Kadri Hacioglu:机构信息未能从会议 PDF 纯文本可靠映射
  • Petr Motlicek:机构信息未能从会议 PDF 纯文本可靠映射
  • Andreas Stolcke:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为目标域语音,输出为对应转写文本,难点在于目标域文本丰富但配对语音稀缺,而仅用纯文本微调大语言模型(Large Language Model, LLM)会使其脱离语音投影器输出的噪声表示。方法链分三步:先在源域配对数据上训练语音投影器以建立语音文本对齐,再冻结声学侧并以低秩适配(Low-Rank Adaptation, LoRA)微调LLM,最后以混合组批同时喂入源域辅助数据、目标域损坏文本和少量目标域配对语音以保持对齐。与纯文本适配相比,该机制差异在于用真实目标语音锚定表示分布而非仅学习领域语言先验。在DefinedAI银行域测试集评测设置下,配对语音文本适配的词错率WER为4.55%,低于纯文本适配的词错率WER6.38%。结论仅在英语银行、农业和乐器三类域内验证,未覆盖强口音、噪声或跨语言外推。该结论的适用边界受限于源域预训练对齐质量,强噪声与重口音下的失败条件尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

本文解读的对象是 1 篇关于大模型语音识别领域适配的论文,输入是论文正文文字和 3 张官方原图,目标是让刚进入语音或音频方向的研究生能复述方法并核对实验条件。需要保留的关键信息包括系统结构、批次组成、冻结与更新规则、数据划分、评价指标方向和主要字错率数字,输出是 1 篇按学习依赖展开的中文技术解读。大模型语音识别在这里指用一个预训练语音编码器加一个可训练投影层,再接一个大语言模型来做转写。

传统端到端语音识别做新领域往往需要大量配对语音文本,而许多实际场景是文本多、录音少,例如银行客服话术可以大量收集,但对应录音标注成本很高。论文要回答的是,能不能主要用文本做适配,只加一点点录音就保住语音和文本之间的对齐。评价用字错率,数值越低越好,相对改善和绝对百分点是两个不同概念,不能混用。

后续各节先讲任务与相关路线,再讲方法全景和组件计算,然后讲训练组织与实验条件,最后讲结果、反证与复现建议,例子会明确标为例子,不引入原文没有的数值。

同类路线已经做了什么,本文的切入点有何不同?

先说大模型语音识别这条路线。常见做法是把 wav2vec 2.0、HuBERT 或 WavLM 这类自监督语音编码器,通过线性投影或查询变换器风格的连接器映射到 LLaMA 或 Vicuna 这类大模型的嵌入空间。论文把这个可训练的连接器统一叫作语音投影层,把整体叫作大模型语音识别系统。已有工作显示,即使不重训整个大模型,只训练轻量连接器也能在 LibriSpeech 等基准上取得有竞争力的字错率,本文沿用的基座框架是 SLAM-ASR。再说低资源领域适配。

金融、医疗、法律等领域的术语和表达与通用语料差异大,而录音收集贵,因此出现只用领域文档、词汇表或转写文本去适配语言模型或解码策略的做法。近期工作把零样本和半监督适配、文本去噪、软提示和软离散化都纳入尝试,证明只用文本也能降低领域字错率。但原文指出,只用干净文本微调大模型,会让模型不再适应投影层产生的带噪表示,造成对齐退化和转写质量下降,这就是模态鸿沟。

已有软提示工作大多假设纯文本设定,没有系统研究如果能拿到少量目标域语音,是否足以保住跨模态对齐。本文的不同在于明确设置目标域文本充足、语音稀缺的条件,对比域内和跨域,考察在混合批次中加入有限配对语音文本的效果,并给出批次比例与遗忘之间的实践指导。

要解决的具体问题与对照条件是什么?

问题可以表述为,先在一个源域上用配对语音文本训练好基座系统,再适配到目标域,目标域有大量文本但只有很少或没有语音。适配的目标是提高目标域识别,同时尽量保持源域性能。论文比较 3 种策略,一是纯文本适配,二是配对语音文本适配也就是标准语音识别微调,三是混合批次同时用两种数据。

举一个教学例子,假设要把通用客服系统适配到银行,银行话术文本很多,但银行录音只有几小时,这正是论文设定的银行分区情形,例子中的小时数只是示意,具体数值以后文实验条件为准。关键对照是训练起点必须一致,论文明确所有适配策略都从同一个源域基座模型出发,这样不同域和不同语音比例之间的比较才是受控的。另一个对照是数据量,混合批次与标准适配在比较时要说明目标语音用了百分之多少,而不是只看绝对字错率。

论文还区分域内适配和跨域适配,域内指源域 DefinedAI 的银行、保险、医疗混合训练后,再适配到其中银行分区,跨域指适配到 SlideSpeech 的农业和乐器,这两类难度和声学分布都不同,不能直接比大小。

混合批次的整体安排是怎样的?

方法全景分 2 个阶段。第一阶段是在源域配对数据上训练基座,学到初始语音文本对齐,作为后续一切适配的起点。第二阶段是目标域适配,按批次组织数据。论文沿用前人提出的混合批次思想,把每批分成源域部分和目标域部分。源域部分是辅助数据,用来防止遗忘和维持对齐,目标域部分负责领域特化。

本文的扩展是在目标域部分里加入真实目标语音。白话说,大语言模型是只懂文本嵌入的解读者,语音投影层是把语音翻译成它能读的便签的翻译员,纯文本适配相当于长期只给解读者看干净打印稿,突然让他读翻译员手写的潦草便签就会读错,混合批次相当于每批都同时给他看打印稿和少量潦草便签,保持阅读能力。

模态鸿沟 × 纯文本适配: 纯文本适配指只用目标域转写文本微调大模型而不给语音,模态鸿沟指此时大模型见不到投影层产生的带噪语音表示,推理时却要处理这种表示而导致失配,二者搭配讨论的原因是纯文本能学领域词汇但会破坏原有对齐,组合意义是必须在训练批次里保留语音信号来锚定对齐。

沿一个样本走一遍,输入可以是源域录音、目标域录音、投影映射得到的离散 token 序列,或合成损坏的文本,输出都是对应的干净转写,大模型按转写语音为文本的指令模板自回归生成。目标域占比用符号 tau 表示,源域占比用 sigma 表示,论文后续通过实验确定目标部分占一半左右时比较平衡,具体比例选择在消融节结合原图说明。

编码器、投影层和大模型各自做什么计算?

系统有 3 个主要部件。第一是预训练语音编码器,输入一段语音,输出随时间变化的声学表示序列。为了更好匹配大模型按 token 处理的方式,这个序列按因子 k 做时间降采样,帧数从 T 压缩到 N。第二是线性语音投影层,把降采样后的表示映射到大模型的嵌入空间,得到可以直接喂给大模型的语音嵌入。第三是大语言模型,它同时接收投影后的语音嵌入和任务提示,按指令生成转写。

提示模板是固定的指令式格式,大意是用户要求把语音转写为文本,语音槽位放投影嵌入,助手槽位放转写,格式与指令预训练保持一致。基座训练时编码器冻结,只微调投影层来学习声学到文本嵌入的对齐。适配阶段反过来,编码器和投影层都冻结,只更新插入大模型的低秩适配器,这样既做领域特化,又不动已经学好的对齐。

白话说,编码器是耳朵,负责听出声音特征,投影层是翻译,负责把声音特征写成大模型能读的便签,大模型是写稿人,负责根据便签和指令写出转写。

语音编码器 × 语音投影层: 语音编码器负责把输入语音转成帧级声学表示,语音投影层负责把降采样后的声学表示映射到大模型的词嵌入空间,二者搭配是因为大模型只能理解文本嵌入,必须有一个可训练的桥把连续语音变成它能消费的向量,组合意义是基座训练阶段只更新投影层就初步建立了语音文本对齐。

需要提醒的是,原文没有给出降采样因子 k 的具体取值和投影层维度等细节,这属于未报告项,不能从模型名字推定实现。梯度路径按原文描述理解为只流经低秩适配器,不更新冻结部件,但原文未给出优化器类型和学习率,因此复现时需要把这部分记为缺项。

批次里有哪些数据,冻结与更新规则是什么?

训练组织是本文最需要复述的部分。基座和适配都训练 5 个轮次,批次大小为 10,编码器用 WavLM-Large,大模型用 Llama-3.2-3B-Instruct。基座用源域配对数据训练,更新的是投影层。适配时只更新低秩适配器。批次组成按原文可分为 5 类。

源域部分有 3 段,一是配对源域语音文本,输入是源域录音,输出是对应转写,用来保持基座学到的音频文本对齐。二是投影诱导噪声 token,做法是把每个语音投影映射到大模型嵌入空间中最邻近的离散 token 作为输入,输出干净转写,帮助模型理解来自投影的离散文本。三是合成损坏的源域转写,用字符级随机扰动生成损坏输入,输出干净原文,模拟投影表示的不规则性。

目标域部分有两段,一是配对目标语音文本,输入是目标域录音,输出对应转写,引入真实目标声学并保持对齐。二是损坏目标转写,输入是同样方式损坏的目标域文本,输出干净转写,承担领域语言建模。符号上源域 3 段用 sigma 相关比例表示,目标域两段用 tau 相关比例表示,tau 是目标域总量占比,tau 下标 a 是其中语音部分,tau 下标 t 是其中文本部分。

混合批次 × 低秩适配器: 混合批次负责按比例组织源域配对语音文本、投影噪声 token、合成损坏文本、目标域少量语音和目标域损坏文本,低秩适配器负责在适配阶段作为大模型内唯一可更新的参数,二者搭配是因为要冻结编码器和投影层以保住对齐,只让大模型侧以少量参数学习领域,组合意义是实现参数高效且可控的领域特化。

字符扰动通过 nlpaug 的随机字符增强器实现,原文说参数与前人论文相同,但没有在本文列出具体参数,这也是复现缺项。损坏文本的监督来源是干净原文,语音样本的监督来源是人工转写,重置时机就是每个批次重新按比例采样,原文未说明是否对辅助数据做去重或加权之外的处理。

数据、划分与评价条件如何设置?

实验用两个语料。源域来自 DefinedAI,包括银行、保险和医疗 3 个分区,用于预训练投影层并在适配时做辅助数据。目标域一是 DefinedAI 的银行分区,用于域内适配,二是 SlideSpeech 的农业和乐器分区,用于跨域且标注语音有限的情形。论文给出训练、验证和测试的语句数与时长分布,源域总量约几十小时,目标域银行约三十多小时,农业约二十多小时,乐器约 8 个半小时,具体划分数字见下表整理。评价指标是字错率,越低越好,同时在源域和目标域测试集上评价,前者看遗忘,后者看适配。

比较公平性要求起点一致、轮次和批次大小一致、提示模板一致,区别只在适配数据的组成和目标语音比例。 下表提出的问题是,在语音稀缺时不同域各有多少可用语音,混合批次用 10% 语音时对应多少小时,以及训练轮次与批次大小是否一致,指标方向是字错率越低越好。

条件指标基线本方法比较对象
Banking 目标语音 10%时长全量语音3h37Agriculture 2h55,MI 50m
训练组织轮次与批次基座与适配一致5 epochs,batch size 10不同适配策略间一致
评价字错率方向越低越好目标域下降源域保持
数据语料来源DefinedAI 源域SlideSpeech 跨域域内与跨域分别评价
方法批次组成标准微调混合批次纯文本适配

该表把 10% 语音对应的小时数与训练组织放在一起,是为了说明少量语音的绝对量级很小,但比较仍在同一训练预算下进行。

表后需要强调代价与边界,10% 对应时长在乐器域只有 50 分钟,这么少的语音能起作用支持了对齐信号的解释,但也意味着结论依赖于文本量充足和辅助源域数据存在,如果目标文本也很少或源域完全不同,效果可能不同。论文未报告多次随机种子的方差和统计显著性,也未报告训练时长与硬件预算,这限制了对稳定性和成本的判断。

少量语音带来多大改善,与全量语音微调相比如何?

先看模态鸿沟的直接证据。在银行域,配对语音文本适配明显优于纯文本适配,原文报告两者相差 1.83 个绝对百分点,约 29% 相对改善,具体为 4.55% 对 6.38%,这说明只用文本会留下较大差距。再看混合批次是否能弥合差距。论文用不同语音比例做曲线,横轴是目标语音使用比例,从 0% 纯文本到 100% 配对语音文本,纵轴是字错率。结果是混合批次始终优于只用同样数量配对语音的标准适配,把语音加到文本适配模型上的收益,大于只用同样语音从头做标准适配。

只用 10% 适配语料包含语音时,就达到与全量语音相当或更好的性能,这 10% 对应银行 3 小时 37 分、农业 2 小时 55 分、乐器 50 分钟。 下图导读关注银行域两条曲线的分离与收敛,横轴是目标语音比例,纵轴是字错率,蓝色是标准适配,绿色是混合批次,另有基线虚线和全量语音虚线作为参照。

看图路径: 1. 先区分蓝色方块标准适配与绿色三角混合批次两条曲线;2. 再沿横轴目标语音比例从 0% 看到 100% 时两条曲线的下降速度;3. 最后核对橙色虚线全量语音水平线与绿色曲线何时相交

原论文 Figure 2:Performance of the base ASR and adapted models.

论文图 2。原论文 Figure 2:“Performance of the base ASR and adapted models.”。

从可见像素看,左侧银行面板中绿色三角在 0% 附近已明显低于蓝色方块,随着语音比例增加,绿色曲线快速下降后趋平,蓝色曲线下降较慢,到 100% 时两者接近。原文补充的收敛数字是混合批次与配对语音文本适配分别为银行 4.19% 对 4.55%,农业 15.91% 对 16.04%,乐器 16.97% 对 15.97%,表明语音充足时两者趋同,域内银行仍略有优势,可能得益于同域辅助数据。需要同时说明未胜出项,在乐器域全量语音下混合批次 16.97% 略差于标准适配 15.97%,不能说混合批次在所有条件下都最好。

下表提出的问题是,在相同目标域上纯文本、标准语音适配与混合批次的字错率高低如何,条件是同一基座和同一评价集,指标越低越好。

条件指标基线本方法比较对象
Banking 纯文本WER6.38%混合批次 4.19%配对语音 4.55%
Banking 差距绝对差1.83%相对约 29%4.55% 对 6.38%
AgricultureWER配对 16.04%混合 15.91%两者接近
MIWER配对 15.97%混合 16.97%混合略差
语音量10% 效果全量相当少量对齐全量微调

表后解释是,主要收益来自文本提供领域词汇、少量语音提供对齐,代价是当语音充足时额外文本和噪声转写的增益变小,甚至在乐器域出现轻微反转。

论文把 60% 配对比例附近出现峰值归因于合成噪声转写带来的输入多样性,但这属于有限解释而非因果证明,待进一步消融验证。

配对语音文本适配 × 文本主导适配: 配对语音文本适配指只用标注语音加转写做标准微调,文本主导适配指以大量目标域文本为主、只掺入少量语音的混合批次,二者分工是前者提供真实声学监督,后者提供领域语言建模,搭配理由是标注语音稀缺时文本可以补语言知识,组合意义是少量语音提供对齐信号,文本提供词汇信号,共同降低目标域字错率。

目标文本放多少合适,多了或少了会怎样?

消融先看纯文本设定下目标文本比例的影响,此时不加目标语音,批次剩余部分均匀分配给各类源域文本。论文在银行域扫描不同比例,发现性能呈先升后降的折中。比例太低时过度依赖辅助数据,可能反复采样而过拟合,比例太高时辅助数据不足,可能欠拟合并出现部分遗忘。基于该扫描,后续实验把目标总量固定为 50%,源域部分均匀分布。 下图导读关注目标文本比例与字错率的 U 形关系,横轴是目标文本比例,纵轴是字错率,圆点是实测,曲线是 2 次拟合,顶部虚线是基线。

看图路径: 1. 先看横轴目标文本比例与纵轴字错率的坐标含义;2. 再找绿色圆点实测值与二次拟合曲线的最低点位置;3. 最后对比顶部灰色基线与星形最优点的高低关系

原论文 Figure 1:Effect of different target text proportions (τt) on mixed-batch adaptation on DefinedAI Banking.

论文图 1。原论文 Figure 1:“Effect of different target text proportions (τt) on mixed-batch adaptation on DefinedAI Banking.”。

从像素看,横轴从 0% 到约 90%,纵轴字错率从接近 8% 下降到约 6.5% 再回升到约 6.9%,拟合曲线最低点在 50% 到 60% 之间,星形标记的最优点在 50% 附近,顶部灰色基线对应 8.02%。这支持 50% 是兼顾领域学习与对齐保持的折中,而不是越大越好。

目标域占比 × 灾难性遗忘: 目标域占比指每批中来自目标域的样本比例,灾难性遗忘指适配后在源域上字错率明显上升,二者搭配的原因是目标比例太低学不到领域,太高则见不到源域辅助数据而遗忘,组合意义是用批次比例在目标特化和源域保持之间做权衡。

另一个消融是语音比例,混合批次在约 60% 配对语音时达到峰值,之后增益略降,论文推测合成噪声转写增加了多样性,有助于学到更鲁棒的映射,但这同样是可能而非已证实的解释。未评测的边界包括目标比例与语音比例的联合网格、不同噪声强度和不同辅助数据源的影响,原文没有给出这些结果。

适配会遗忘源域吗,混合批次的代价是什么?

遗忘分析同时在源域和目标域测试,源域是 DefinedAI 的银行保险医疗混合,目标是其中银行分区。基座在源域字错率为 12.8%,在目标域为 8.0%,说明目标测试集本身更容易。只用 20% 目标语音做配对微调时,目标域改善但源域明显退化,这是灾难性遗忘的证据。相比之下,纯文本混合批次和语音文本混合批次在改善目标域的同时,对源域的退化较小。 下图导读关注 4 种训练设置下源域与目标域柱状的变化,蓝色是源域,绿色是目标域,灰色虚线是源域基线,橙色柱标出遗忘。

看图路径: 1. 先确认横轴四种训练设置与纵轴字错率的分组方式;2. 再对比每组内蓝色源域柱与绿色目标域柱的高低变化;3. 最后观察最右侧橙色遗忘柱与灰色基线虚线的偏离幅度

原论文 Figure 3:Performances of base system and adapted model with text-only, paired speech-text and mixed-batch…

论文图 3。原论文 Figure 3:“Performances of base system and adapted model with text-only, paired speech-text and mixed-batch adaptation. For both audio-adaptation settings, the share of speech data is 20%.”。

从像素看,从左到右 4 组为基座、纯文本混合批次、语音文本混合批次和标准微调,前 3 组蓝色柱从 12.8% 降到 11.5% 和 11.3%,绿色柱从 8.0% 降到 6.4% 和 4.5%,最右侧标准微调的源域柱跳到 17.4% 并标为遗忘,目标域为 6.0%。这显示混合批次用 20% 语音就同时改善两侧,而标准微调以牺牲源域为代价换目标改善。 下表提出的问题是,基座与 3 种适配在源域保持和目标改善上如何权衡,条件是同一源域基座和银行目标,指标越低越好。

条件指标基线本方法比较对象
语音比例设置20%混合批次标准微调
权衡方向目标降源域保遗忘代价

表后要指出限制,遗忘分析只在域内银行上做,没有给出农业和乐器跨域的源域保持数字,不能把域内结论推广到跨域。论文也未测量推理延迟、误判类型和训练成本,因此不能承诺这些量得到改善。

总体趋势是混合批次更好,但不等于每个比例和每个域都成立,乐器全量下的轻微反转就是反例。

要复现这套流程,先做什么,需要补哪些验证?

复现先搭基座。用 WavLM-Large 做编码器并冻结,接线性投影层,用源域配对数据训练 5 轮,批次大小 10,提示用转写语音为文本的指令模板,目标是学会投影到大模型嵌入的映射。然后做适配,冻结编码器和投影层,只在大模型中加入低秩适配器并更新,按目标总量 50%、源域均匀分配的原则组织批次,目标部分再按实验切分语音与损坏文本的比例。

损坏文本用字符级随机扰动生成,投影噪声 token 用最近邻映射得到,原文说扰动参数与前人一致但未列出,需要去查前人论文或做参数扫描补齐。评价要在源域和目标域分别算字错率,记录不同目标语音比例下的曲线,并与纯文本和标准语音适配对比。当前可用性方面,论文脚注给出代码仓库链接,但本次收到的资源状态显示没有完成可达性验证的绑定资源,因此不能写代码已公开可用,只能写原文提供了仓库地址,本次未能确认可达。

权重下载、数据许可和硬件预算在原文中未完整交代,属于缺项。还需补的验证包括多种子方差、显著性检验、跨域遗忘、不同噪声强度和不同大模型规模下的稳定性,以及 10% 语音结论在其他领域是否成立。

何时值得尝试这种方法,如何一句话记住它?

当目标域文本充足但录音很少,且已有源域基座和辅助数据时,值得尝试混合批次。做法是每批保留一半目标数据,一半源域辅助数据,目标内部再用少量真实语音锚定对齐,其余用损坏文本学领域词汇,适配时只更新大模型侧低秩适配器。支持的判断是少量语音提供很强的对齐信号,在银行、农业和乐器上用 10% 语音就接近全量微调,同时更好地保持源域。

限制是目标比例需要调到 50% 附近,语音太多时增益收敛,跨域遗忘和成本尚未充分测量,噪声多样性的解释待验证。一句话记住,文本教词汇,少量语音教对齐,混合批次让大模型同时听到两种声音。后续工作可以补全优化器、扰动参数和统计检验,再考察更多领域和更大语音比例下的行为。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总