英文题目:Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR

会议身份:conference:interspeech:2026:conference-paper-id:magoshi26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#领域适应 #大语言模型 #语音 #语音识别

评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Ryo Magoshi:机构信息未能从会议 PDF 纯文本可靠映射
  • Takashi Maekaku:机构信息未能从会议 PDF 纯文本可靠映射
  • Yusuke Shinohara:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

基于大语言模型的语音识别以音频提示为条件解码文本,当目标域仅有文本时,适配阶段缺失声学上下文,会在推理重新引入音频提示时产生模态失配,难点在于仅用文本合成与真实提示分布一致的训练信号。TE2SL先将目标文本词嵌入上采样至音频提示帧长实现时间对齐,其输出进入由Conformer编码器与线性层组成的精炼模块以映射到音频提示隐空间,该模块在源域配对数据上以帧级均方误差拟合音频编码器与投影器输出。精炼后的伪音频提示再经时域掩蔽正则化后与指令拼接输入大语言模型进行目标域微调,使上一步的分布对齐结果直接作为解码条件。与仅启发式上采样掩蔽相比,该机制显式建模了音频编码器与投影器管线的输出特性,因而兼顾样本相关性与架构感知,具有跨语言可扩展的实际意义。在LibriSpeech到SPGISpeech的跨域适配评测任务下,TE2SL的WER为8.5%,低于Upsample-and-Mask基线的WER 9.1%。该结论仅在朗读到金融电话会议和讲演等有限域移下验证,对强口音噪声及未见编码器的外推尚未证明。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么只给文本不够?

这篇论文的输入和目标要先分清。输入是语音识别任务:给定一段波形,输出对应的文字转写。目标是跨域适配:在源域有大量语音加转写配对数据,目标域只有纯文本,没有可用的配对语音时,仍然把识别器搬到目标域。必须保留的信息是目标域的语言风格和新词,例如金融电话会议中的公司名和数字表达,以及学术演讲中的专业术语。

只用目标域文本去微调大语言模型,看似简单,但会丢掉一个关键条件。基于大语言模型的语音识别不是只看文字,它在解码每个词时,前面都拼接了一段音频提示。这段提示来自冻结的音频编码器加可训练的投影层,把语音帧映射到与词嵌入相同维度。如果适配阶段完全不放任何提示,模型学到的是无声条件下的文字概率,测试时突然加入真实音频提示,条件分布就对不上了。论文把这称为模态失配。

因此学习依赖是先理解识别器的条件结构,再理解 3 条已有路线为何不完整,最后才看新方法如何补上对齐。输出是一个可复述的流程:如何构造伪音频提示,如何训练映射器,如何在只有文本时继续微调,以及在什么数据和指标下验证有效。修辞上的好坏不重要,重要的是每一步的监督从哪里来,哪些参数冻结,哪些更新。

已有的纯文本适配路线各自解决了什么,又缺了什么?

第一条路线是只微调大语言模型,不放任何音频提示。做法是直接用目标域文本最大化似然,让模型记住新领域的语言先验。优点是流程简单,不需要语音合成。但正如前文所述,适配时没有声学上下文,推理时再引入真实提示就会出现失配。论文的对比表把这类方法记为无伪提示、无样本相关、无编码器感知。

第二条路线是用语音合成系统生成伪音频。典型做法是用文语转换模型合成波形或梅尔谱,再送入编码器得到提示。提示质量高,但依赖训练好的合成器。在多语种或低资源场景下,高质量合成器本身就不存在,可扩展性受限。论文因此把它归为另一个分支,不作为低成本方案的直接对照。

第 3 条路线是基于嵌入的合成,不做波形合成。一种是可训练的软提示,在适配期间保持一段固定向量作为提示,另一种是把词嵌入上采样并掩码,拉长到语音帧长度来冒充提示。前者保证了提示的存在,但同一段向量对所有样本都一样,不反映单个句子的内容,也不反映编码器和投影层的具体输出特性。后者反映了样本特性,因为不同句子的词嵌入不同,但仍然只是启发式变换,没有学习编码管线的行为。

伪音频提示 × 模态失配: 伪音频提示是在适配阶段没有真实语音时,用目标域文本合成出来冒充音频提示的占位输入;模态失配是指适配时只见文本、测试时突然加入真实音频提示导致分布不一致。搭配的原因是如果适配阶段完全去掉提示,解码器学到的条件分布就缺了一块,加入与真实提示形状相近的伪提示,才能让训练和推理的输入结构保持一致。

论文的判断是,非合成方法已经做到了样本相关,但还没有做到编码器加投影器感知。缺的正是显式建模语音与文本的对齐,让伪提示更接近真实音频提示的分布。这也是新方法要补的位置。

任务的形式化条件是什么,什么算成功?

形式化条件分两个阶段。第一阶段在源域训练,数据是配对的语音波形和转写序列,模型包含音频编码器、投影层和大语言模型。第二阶段是目标域适配,数据只有目标域的纯文本句子,没有对应波形,模型需要在保持识别能力的前提下偏移到新领域。成功有两个维度,一是总体错误率下降,英文用词错误率,日文用字错误率,数值越低越好,二是域外词召回率上升,即源域词表中没有、只出现在目标域的新词被正确恢复的比例,数值越高越好。

论文特别定义了域外词召回率的计算方式,这对初学者容易误解。它不是整句准确率,而是先用源域训练文本建词表,英文按空格分词,日文用形态分析工具分词,然后把参考和假设都过滤到只剩不在词表中的词,再做编辑距离对齐,用参考域外词数减去替换和删除后除以总数。插入不计入。这种定义聚焦新词恢复,但忽略了插入错误,因此必须和总体错误率一起看。

一个常见的误解是把总体错误率下降等同于新词学会了。实际上语言模型变顺也可能降低错误率,而新词仍错。论文同时报告两个指标,就是为了区分这两种进步。另一个误解是认为文本越多越好,但如果伪提示质量差,大量文本可能只强化了无声条件下的语言模型,反而加重失配。

整体识别器和新方法在样本层面如何走通?

先沿一个样本走完基于大语言模型的语音识别主路径。输入是一段波形,先送入冻结的音频编码器得到帧级特征,再做帧堆叠降采样,例如降到 10 赫兹左右的提示长度,再经两层线性加激活的投影层,得到维度与大语言模型一致的音频提示。这段提示与指令词嵌入拼接在前,历史转写词嵌入拼接在后,一起送入大语言模型逐词预测下一个词。训练时投影层和大语言模型上的低秩适配器更新,编码器冻结。

下面这张图展示了上述拼接结构,是理解后续伪提示替换位置的基础。图中下方的声学分支与右侧的文本分支最终在解码器入口汇合,火焰标记表示可训练部件。

看图路径: 1. 从底部 Audio 经 Audio Encoder 到 Projector 再到 LLM Decoder 追踪声学主路径;2. 观察右侧 Text prompt 与 Text tokens 如何转为词嵌入并与音频提示拼接;3. 确认 LoRA 与 Projector 旁火焰标记表示的可训练位置

原论文 Figure 1:Overview of the LLM-based ASR framework.

论文图 1。原论文 Figure 1:“Overview of the LLM-based ASR framework. The au- dio encoder and projector generate audio prompts that are con- catenated with token embeddings and processed by the LLM.”。

这张图的可执行读法是,先确认声学分支是唯一的语音信息来源,再确认文本分支包含指令和历史词,最后确认解码器看到的是拼接后的长序列。适配阶段的问题就在于声学分支没有输入,拼接序列缺了一截。新方法的思路是在适配时用一段伪音频提示补上这一截,让解码器始终看到相同结构的输入。

音频提示 × 大语言模型解码器: 音频提示负责把语音波形经音频编码器和投影层转成与大语言模型维度 1 致的连续向量,提供声学上下文;大语言模型解码器负责在该提示加指令加历史词的条件下逐词预测转写。二者搭配的原因是解码器本身只懂词嵌入空间,必须靠提示把变长语音压缩成同空间的前缀,组合后模型才能在推理时同时看到声音和文字约束。

TE2SL 的全景分两步。第一步在源域学习映射:把转写的词嵌入上采样到与真实音频提示相同的帧长,送入精炼模块,输出伪提示,用它与真实提示之间的帧级均方误差训练精炼模块。第二步在目标域适配:没有语音,只有目标域句子,把句子嵌入随机上采样,送入已冻结的精炼模块,再做时间掩码,得到伪提示,与目标文本组成伪配对数据,继续微调大语言模型。关键是精炼模块在第二步冻结,只做推理。

上采样、精炼模块和掩码各自做什么计算?

上采样解决长度对齐。词嵌入序列长度是词数,音频提示长度是降采样后的帧数,通常长得多。做法是把每个词嵌入重复若干帧,拉长到目标长度。在训练精炼模块时,拉长目标是对应语音的真实提示帧长,以保证帧级损失可以逐帧相减。在适配阶段没有真实帧长,只能随机上采样,模拟不同的语速和停顿,再做掩码正则化。掩码是把时间轴上若干段直接置零,防止模型死记硬背伪提示的每帧细节。

精炼模块是核心的可学习部件。论文报告它由输入输出线性层加 16 层 Conformer 编码器组成,隐层 256 维,总参数 18.6M。它的输入是上采样后的文本嵌入,输出是同形状的伪音频提示,目标是模仿音频编码器加投影层管线的输出特性。选择 Conformer 的原因在原文没有展开消融,但从结构上看,它同时有卷积捕捉局部平滑和自注意力捕捉长程依赖,适合把阶梯状的重复词嵌入变成更连续的类语音隐表示。

上采样与掩码 × 精炼模块: 上采样与掩码负责把离散的词嵌入按长度拉长到接近音频提示帧数并随机遮挡部分时间段,保留样本相关的文本内容;精炼模块负责用可学习的 Conformer 把拉长后的嵌入进一步变换到音频编码器加投影层输出所在的隐空间。二者搭配的原因是启发式拉长只能解决长度对齐,不能弥补文本嵌入与音频提示之间的模态差距,组合后才能同时保留样本特性并感知具体编码管线的输出特性。

计算目标要区分清楚。精炼模块训练时的目标是最小化伪提示与真实提示的帧级均方误差,监督来自源域配对数据,梯度只更新精炼模块,不更新编码器和投影层。适配阶段的目标是标准的语言模型 next-token 预测,监督来自目标域纯文本,伪提示只作为条件输入,不提供额外损失。原文没有给出精炼模块内部的注意力头数和卷积核等细节,复现时需要按常规 Conformer 默认值补齐并记录,这属于原文缺项,不应猜测为论文的特定选择。

精炼模块如何训练,适配阶段参数如何冻结与更新?

训练分 3 个子过程,不要混淆。第一个是源域基础识别训练,用源域配对数据训练投影层和大语言模型上的低秩适配器,音频编码器始终冻结。第二个是精炼模块训练,用同样的源域配对数据,一边算真实音频提示,一边算上采样后的文本嵌入经精炼模块的输出,算均方误差并更新精炼模块。原文报告精炼模块训练的学习率为 4 乘 10 的负 4 次方,批量为 32。第 3 个是目标域适配,用目标域纯文本生成伪提示,继续微调大语言模型,精炼模块冻结。

下图把左边的训练与右边的适配并排放出,左侧强调有配对监督,右侧强调只有文本,中间的精炼模块在左右两边颜色不同表示训练与冻结的区别。

看图路径: 1. 对比左图训练阶段的真实音频分支与右图适配阶段的纯文本分支;2. 沿 Random Upsampling 经 Linear 加 Conformer 到 Random Masking 追踪伪提示生成链;3. 确认左图 MSE Loss 两端分别连接的真实提示与变换后文本分支

原论文 Figure 2:Overview of TE2SL. (a) Training phase: the refinement module learns alignment from LLM token…

论文图 2。原论文 Figure 2:“Overview of TE2SL. (a) Training phase: the refinement module learns alignment from LLM token embeddings to audio prompts with pre-trained audio encoder/projector characteristics.”。

读这张图时,先看左侧最下方的配对数据如何分叉成音频和转写两路,再看两者在顶部均方误差处汇合,这就是映射学习的监督闭环。然后看右侧最下方的纯文本如何只走文本一路,经随机上采样和精炼模块后变成提示,再与原文本一起进入解码器。右侧顶部的随机掩码表示正则化,右侧解码器旁的低秩适配器标记表示适配阶段的更新位置。

参数冻结需要按证据说明。音频编码器在训练和适配阶段都冻结,论文明确使用 WavLM-Large 且保持冻结。投影层在基础训练后一般冻结,适配阶段主要更新的是大语言模型的低秩适配器,秩为 8。精炼模块只在第二步训练,在适配时冻结。原文没有报告适配时投影层是否完全冻结,也没有给出梯度是否流经伪提示回传到精炼模块,但按冻结描述应理解为不回传。未报告的部分应记为缺项,不从模型名称推定。

数据、模型和优化条件如何配置,指标如何聚合?

实验覆盖 3 个跨域场景。英文源域是朗读有声书 LibriSpeech,目标域分别是金融电话会议 SPGISpeech 和演讲录像 SlideSpeech。日文源域是自发语音语料库的自发部分,目标域是同一语料库的学术演讲部分,测试用官方的两个评测集。模型统一用指令微调过的 Llama-3.2 3B,加低秩适配器作用于查询和值投影矩阵。音频编码器统一用 WavLM-Large,即使在日文任务上也保持一致,论文脚注说明这可能导致日文基线偏弱。

源域配对数据 × 目标域纯文本: 源域配对数据提供语音和转写一一对应的样本,用于训练基础识别模型和精炼模块的映射关系;目标域纯文本只提供新领域的句子,没有对应语音,用于继续微调大语言模型。搭配的原因是先用源域建立语音到文字的对齐,再用目标域文本加伪提示去偏移语言分布,组合后才能在不采集新语音的情况下完成跨域迁移。

下表整理了源域时长与目标域纯文本句数,是核对数据规模和复现采样量的关键。表头单位要保留,时长单位是小时,句数单位是百万或千,裸数值不能自行追加百分号。

源语言源域配对数据源域时长目标域纯文本目标域句数
英文LibriSpeech960hSPGISpeech1.93M
英文LibriSpeech960hSlideSpeech482k
日文CSJ 自发部分257hCSJ 学术演讲部分130k

表后需要说明公平条件。所有方法共享同一基础模型和同一源域训练,区别只在适配阶段如何使用目标域文本。基线是不适配,上采样与掩码用启发式伪提示,软提示先学一段固定提示再适配,TE2SL 用精炼后的伪提示。优化器统一用 AdamW,源域训练与各方法适配的学习率和批量分开设置,TE2SL 适配学习率为 5 乘 10 的负 5 次方。训练持续到验证集错误率饱和,取验证最优检查点评测,软提示的学习阶段固定轮数。指标聚合是测试集整体错误率加域外词召回率,没有报告多次随机的方差。

原文没有说明硬件型号和训练时长,也没有报告统计显著性检验,这属于可复现性缺项。SlideSpeech 虽是视听语料,但论文明确未用视觉模态,因此不能把多模态信息计入效果。

主结果测了什么,谁在什么条件下赢了多少?

主结果回答的问题是,在相同基础模型和相同目标域文本下,加入架构感知的精炼伪提示是否同时改善总体准确率和新词恢复。比较对象是 3 个可运行策略:不适配基线、固定软提示、上采样与掩码启发式伪提示。指标方向是错误率越低越好,域外词召回率越高越好。条件一致性在于目标域文本相同,解码器结构相同,区别只在提示构造方式。

目标域场景指标基线上采样与掩码TE2SL
SPGISpeech词错误率11.19.18.5
SPGISpeech域外词召回率39.445.650.1
SlideSpeech词错误率17.016.314.0
SlideSpeech域外词召回率50.851.057.3
CSJ 评测集 1字错误率21.521.519.6
CSJ 评测集 2字错误率20.219.417.5

表后解释主要收益与代价。TE2SL 在 4 个评测上都是最优,英文 SPGISpeech 上相对基线错误率下降约 2.6 个百分点,域外词召回率提升约 10 个百分点,SlideSpeech 上错误率从 17.0 降到 14.0,召回率从 50.8 升到 57.3。日文两个评测集上字错误率分别降到 19.6 和 17.5,召回率升到 19.7 和 21.0。论文报告显示这种双提升支持了架构感知精炼 bridging 模态差距的解释。代价是需要额外训练 18.6M 参数的映射器,并承担源域训练的全部开销。

词错误率 × 域外词召回率: 词错误率负责衡量整句转写的总体准确程度,日文则用字错误率;域外词召回率负责单独衡量源域词表之外的目标域新词被正确恢复的比例。二者搭配的原因是总体错误率下降可能来自常见词变好,掩盖了新领域关键词仍错的问题,组合观察才能判断适配是否真正学到了领域词汇而不仅是语言模型变顺了。

就近说明未胜出项。软提示在日文上有轻微改善,但在英文 SPGISpeech 上几乎与基线持平,说明固定提示不能替代样本相关的声学条件。上采样与掩码在 SPGISpeech 上已明显优于基线,但在日文评测集 1 上与基线持平,说明启发式变换在某些领域不够稳定。TE2SL 没有在所有对比中拉开同样幅度,例如 SlideSpeech 的基线召回率已达 50.8,说明该领域新词恢复的起点较高,方法的增量需要结合基线强度理解。

如果拿掉精炼,效果会回落到哪里?

论文没有单独的模块消融表,但上采样与掩码基线实际上承担了拿掉精炼模块的对照作用。两者共享上采样加掩码的流程,唯一区别是中间是否经过可学习的 Conformer 映射。因此两者的差距可以直接读作精炼带来的增量。在 SPGISpeech 上,这个增量是错误率(%)从 9.1 到 8.5,召回率从 45.6 到 50.1。在 SlideSpeech 上,是 16.3 到 14.0 和 51.0 到 57.3。在日文上,也有约 1 到 2 个百分点的错误率下降和约 3 到 4 个百分点的召回率提升。

这种对照的公平性在于两者都使用样本相关的伪提示,都不依赖语音合成,区别只在是否感知编码器加投影器特性。支持的判断是,显式对齐确实比启发式变换更具表达力。但限制是原文没有报告只用精炼不用掩码、或改变 Conformer 层数的结果,也没有报告随机上采样分布变化的影响,因此不能断言掩码和随机策略各自贡献多少。

另一个隐含反证是软提示的失败。它有提示但无样本相关,效果远弱于两种样本相关方法,这从反面支持了样本相关条件的必要性。但这只是有限解释,不是因果证明,因为软提示的训练轮数和学习率与其它方法不同,不能完全排除优化差异的影响。

哪些边界没有测,哪些结论不能推广?

首先是合成路线的缺席。论文没有与基于语音合成的伪音频方法在同条件下对比,因此不能说 TE2SL 超过了高质量合成,只能说在不依赖合成器的可扩展路线中表现最好。对于有高质量合成器的语言,合成仍可能是更强的选择,这属于未评测边界。

其次是编码器一致性带来的偏差。日文任务仍用只在英文上预训练的 WavLM,论文脚注承认这可能导致基线退化。这意味着日文上的大幅改善部分来自起点偏弱,不能直接推广到使用日文编码器的系统。跨语言可扩展性的结论需要待验证。

第三是成本与效率缺项。原文报告了精炼模块参数量和各阶段学习率,但没有报告训练时长、显存占用、推理延迟和输出帧率。总体错误率下降不等于延迟改善,伪提示生成在适配时只用 1 次,但在推理时并不使用,因此推理开销不变,这个区分要讲清。未测量误判率和延迟时,不应承诺这些量得到改善。

最后是统计稳健性。原文只报告单次验证最优检查点的结果,没有多次随机种子方差和显著性检验。趋势成立不等于每组每步都成立,复现时应补做多次运行。

要复现这套流程,先做什么,需要哪些关键超参数?

复现的第一步是搭好基础识别器。用 WavLM-Large 做冻结编码器,帧堆叠做 5 倍降采样得到约 10 赫兹的提示,两层 3072 维线性加激活做投影,大语言模型用 Llama-3.2 3B 指令版,加秩 8 的低秩适配器。先在源域配对数据上训练投影和适配器,优化器用 AdamW,贝塔参数 0.9 和 0.999,权重衰减 0.001,学习率按论文分阶段设置,动态分桶批量。验证集错误率饱和即停,取最优检查点。

第二步训练精炼模块。把源域转写送入词嵌入层,上采样到对应真实提示帧长,送入 16 层隐层 256 维的 Conformer 加前后线性层,输出与真实提示算帧级均方误差。学习率 4 乘 10 的负 4 次方,批量 32。注意此时编码器和投影层冻结,只更新精炼模块。

第三步做目标域适配。取目标域纯文本,随机上采样后送入冻结的精炼模块,加时间掩码得到伪提示,与文本组成伪配对数据,继续微调低秩适配器,TE2SL 适配学习率 5 乘 10 的负 5 次方。评测时用真实语音加真实提示解码,报告词或字错误率和按源域词表过滤的域外词召回率。

资源状态需要如实说明。本次收到的证据中没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开。复现需自行实现扩展自语音处理工具包的训练流程,并记录缺失的 Conformer 细节和硬件预算。

何时值得尝试这个方法,如何一句话记住它?

当你面对的场景是源域有配对语音、目标域只有大量文本,且没有可用的高质量语音合成器时,这个方法值得尝试。典型例子是金融会议和学术演讲这类新词多、风格差异大的领域。它的本质是用源域学到的文本到语音隐空间的映射,把目标域句子翻译成更像真实音频提示的向量,再拿这些向量去适配大语言模型,从而保持训练和推理的输入结构一致。

需要记住的适用条件是,目标域文本量要足够大,英文实验用了百万级句子,日文用了十万级句子,小数据下映射误差可能主导效果。还需要接受额外的映射器训练成本,以及编码器与目标语言不匹配时的不确定性。如果已有高质量合成器,应先对比合成路线,如果目标域能采集少量配对语音,应优先考虑半监督微调。

回到中心矛盾:纯文本适配的难点不是语言模型学不会新词,而是适配时缺失的声学条件导致推理时分布偏移。TE2SL 的回答是让伪提示同时保留样本内容和编码管线特性。4 个场景的双指标提升报告支持了这个回答,但合成对比、跨编码器泛化和统计稳健性仍待验证。复现时先重建对齐损失,再验证新词召回是否与总体错误率同向改善,才能确认你复现的是同一机制而非单纯的语言模型变顺。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总