英文题目:SEAM: Bridging the Temporal-Semantic Granularity Gap for LLM-based Speech Recognition
会议身份:
conference:eacl:2026:conference-paper-id:2026.findings-eacl.112
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#注意力机制 #大语言模型 #语音 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Junseok Oh:机构信息未能从会议 PDF 纯文本可靠映射
- Ji-Hwan Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
自动语音识别需将连续声学语音转写为离散文本,难点在于语音表征随时间时长扩展而文本词元随语义密度变化,固定速率输入偏离了大语言模型预训练分布。本文提出语音编码器解码器对齐模块SEAM,先以冻结Whisper-large-v2编码器抽取语音特征,再以可训练解码器经交叉注意力以文本嵌入为查询生成语义空间对齐嵌入。该对齐嵌入经最近邻查找离散化后作为语音条件上下文,连同转写指令送入经LoRA指令微调的冻结Qwen3-4B-Instruct完成转写,并辅以首词元引导纠正起始偏差。与投影加下采样和固定查询Q-Former的时长决定速率机制不同,该方法以语义密度决定序列长度从而匹配自然文本分布,平均约2.99词元每秒。在TED-LIUM-v2跨域评测设置下,SEAM的WER为4.7%,低于SLAM-ASR的8.8%。该结论适用边界受限于仅用LibriSpeech960小时英语朗读语音训练并泛化至TED演讲的验证,尚未验证多语言、自发对话及噪声场景的外推能力。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么要引入大模型?
这篇论文研究的输入是英文语音波形,目标是输出对应的英文转写文字,评价用词错率,越低越好。学习对象是刚接触语音识别的研究生,需要先分清两类知识来源:配对语音文本数据提供声学到文字的对应,但规模有限;纯文本大模型提供广泛的语言知识,但没有听过声音。论文的动机是端到端语音识别的语言建模能力受限于配对数据规模,在遇到领域变化、罕见词或发音相近词时容易出错,因此希望把大模型的语言知识引进来。
输入条件是 16 kHz 重采样、80 维对数梅尔频谱、25 毫秒窗长与 10 毫秒帧移;输出是按大模型词表切分的转写序列。必须保留的关键信息是训练只用 LibriSpeech960 小时朗读语音,跨域测试用 TED-LIUM-v2 的即兴演讲,二者领域不同。本文解读按学习依赖展开:先讲现有路线为何产生粒度失配,再讲 SEAM 的全景与组件计算,然后讲 3 阶段训练与推理,最后讲实验条件、结果与复现要点。资源状态方面,本次没有发现来源绑定且完成验证的开源资源,因此不声称代码、模型或数据已公开。
同样做语音接大模型,已有路线卡在哪里?
已有路线按同输入、同目标、同运行阶段可以分成 3 类。第一类是投影法,以 SLAM-ASR 为代表,用线性投影加下采样把语音特征变换后直接送给大模型。它的优点是简单、在域内数据上容易训好,缺点是输出嵌入数量由音频时长决定,与语义密度无关。第二类是查询法,以 SALMONN 的窗级 Q-Former 为代表,用固定可学习查询在固定时间窗内压缩语音。它的分工是用查询做信息瓶颈,但同样按时间窗产生固定速率的表示,没有解决长度随语义变化的问题。
第 3 类是更复杂的对齐尝试,包括同时处理表示空间与长度问题的方法和跨模态正则,但论文指出把注意力编解码结构系统用于语音到大模型的跨模态对齐仍较少。教学例子是朗读慢而内容稀疏的句子与语速快而信息密集的演讲:同样 10 秒音频,前者自然文本词元少,后者多,但定速方法给两者几乎相同数量的嵌入,大模型在预训练中从未见过这种与语义无关的均匀 pacing,因此产生分布失配。
相关工作对照说明类别差异不能直接当同条件胜负,后文实验会固定训练数据量来比较跨域表现。
时间按秒走、语义按密度走,错配如何度量?
论文把困难拆成两个层面:一是连续声学特征与离散词元嵌入处于不同表示空间,二是时间语义粒度失配导致的序列长度不一致。前者是模态差,后者是节奏差。度量节奏差的一个可操作办法是统计每秒产生几个向量。论文在 LibriSpeech 测试集 5559 条语音上报告,自然文本转写平均每秒 2.71 个词元,而下采样系数为 5 的投影法每秒产生 10.0 个嵌入,约为 3.3 倍冗余。也就是说,大模型被迫处理比预训练更长、更均匀的前缀。SEAM 要解决的正是把序列长度从时长解耦,让生成速率跟随语义密度。
时间语义粒度差 × 变速率生成: 时间语义粒度差指语音表示长度随音频时长线性增长,而文本词元长度随语义内容密度变化,两者分工不同:前者是按帧率铺开的声学时间轴,后者是按语义切分的离散符号。变速率生成负责把输出长度从时长解耦,依据语义密度决定产生几个嵌入,使大模型看到的序列长度分布接近预训练时的自然文本,从而减少定速输入带来的结构约束。
理解这个问题要沿一个样本走一遍:一段 10 秒朗读进入冻结语音编码器得到按时间铺开的特征,若用定速压缩仍是按秒给向量;若用变速率生成,则按需要输出两三个词元对应的嵌入,数量随内容增减。论文强调这与视频语言中帧级特征对句子级语义的层级失配类似,只是这里发生在语音帧与文本词元之间。
SEAM 把语音变成大模型能读的前缀,全景如何走通?
SEAM 的全称是语音编码器解码器对齐模块,做法可以概括为三块加 2 阶段推理。三块是冻结的 Whisper-large-v2 语音编码器、可训练的对齐解码器、冻结的 Qwen3-4B-Instruct 大模型。对齐解码器沿用 Whisper 解码器结构但随机初始化,输出再投影到大模型维度。训练时同时给音频与文本,让解码器学会用文本嵌入做查询去聚合语音;推理时只给音频与起始标记,从起始标记开始自回归地产生语音条件嵌入,再把这些嵌入作为前缀交给指令微调后的大模型生成转写。
预训练部件在全程保持冻结,这是保留原有知识的关键安排。图 1 展示了这种变速率如何让大模型处理方式接近预训练场景。
读图前先明确:该图上半是横向的大模型,下半是黄色的 SEAM,左侧是波形输入,下方是起始标记与示例词,图例区分两种嵌入,虚线表示自回归回路。
看图路径: 1. 先从左侧波形箭头进入黄色 SEAM 框,再看向上进入大模型的黑色实线箭头;2. 对照图例区分斜纹的语音条件嵌入与浅绿的文本嵌入;3. 看右侧灰色虚线框标注的 Hello 与 world 回路,确认自回归时文本如何回灌 SEAM;4. 注意
<BOA>作为起始标记在上下两路的位置

论文图 1。原论文 Figure 1:“Overview of SEAM approach. SEAM bridges the temporal-semantic granularity gap through variable- rate generation that matches natural text token distri- butions, enabling LLM…”。
从像素看,左侧波形箭头进入 SEAM 后有一条黑色实线箭头向上指向一组斜纹方块,说明语音条件嵌入是逐个生成的;右侧浅绿方块对应文本嵌入,<BOA>、Hello、world 自下而上经虚线回路返回,说明每生成一个词就作为下一步查询。这种画法把输入到表示到输出的主路径与回灌路径分开,有助于理解长度为何不再由时长直接决定,而是由生成步数决定。
编码器、解码器与投影各管什么,计算如何发生?
先沿一个样本走完输入到输出。波形经对数梅尔变换得到特征矩阵,送入冻结的 Whisper-large-v2 编码器,卷积带来 2 倍下采样,输出维度 1280 的语音表示。目标文本经冻结的 Qwen3 词嵌入表得到维度 2560 的文本嵌入,先经投影降到 1280 作为解码器查询,解码器用交叉注意力聚合语音键值,输出再经输出投影升回 2560,得到与目标嵌入同空间的预测嵌入。推理时没有目标文本,查询来自已生成的离散词元的嵌入。
交叉注意力 × 语义嵌入空间: 交叉注意力负责以文本嵌入为查询、以语音特征为键和值,自适应地从局部时间跨度聚合声学信息;语义嵌入空间指冻结的大模型词嵌入所在的表示空间。两者搭配的理由是只做线性投影只能变换维度而不能改变长度节奏,而把预测目标定在语义嵌入空间并用注意力按词元聚合语音,能同时解决表示空间差异和序列长度不一致,使每个生成的向量在几何上接近对应词元。
3 种集成的结构差异可用图 3 对照。读图前先明确:三列自下而上都是语音编码器到中间模块再到大模型,顶部虚线都是文本返回,区别在中间模块如何决定数量。
看图路径: 1. 从下向上比较三列:左列下采样加线性投影,中列可学习查询的 Q-Former,右列 SEAM;2. 注意右列底部语音编码器输出与 SEAM 之间的左右回路箭头;3. 看顶部虚线回路,表示大模型输出文本如何作为下一步查询返回;4. 对比三列进入大模型的小方块数量是固定还是随步变化

论文图 3。原论文 Figure 3:“Comparison of speech-LLM integration approaches: (a) Projection-based methods use lin- ear transformations with fixed downsampling; (b) Q- Former approaches use fixed learnable…”。
从像素看,左列经下采样与线性投影后方块数仍多且固定,中列经 Q-Former 加可学习查询后方块数减少但仍固定,右列 SEAM 输出的方块用虚线框表示且有底部回路,说明数量随自回归步数变化。下方公式给出训练时映射的抽象形式,符号含义是语音表示与文本嵌入共同决定预测嵌入,目标是让预测嵌入在语义空间接近真实嵌入。
\[ˆE = fθ(S, E),\]具体到注意力实现,查询来自投影后的文本嵌入,键值来自语音表示,注意力头维度为 64,解码器用因果掩蔽保持自回归性质。编码器输出维度与解码器维度同为 1280 因此可直连,输出投影矩阵负责 1280 到 2560 的维度衔接。
最近邻查找 × 自回归推理: 最近邻查找负责把连续预测嵌入映射到词表中距离最近的离散词元,避免直接回灌连续误差;自回归推理负责一步一步以已生成词元为查询继续产生下一个嵌入。搭配理由是连续嵌入直接反馈会累积估计误差,离散化后再取其嵌入作为下一步输入,既保持自回归所需的因果性,又阻断误差在连续空间的漂移。
需要提醒的误解是冻结不等于输出确定:冻结只说明参数不更新,解码与采样仍有随机性与搜索策略的影响,不能从冻结推定系统输出确定。
三阶段如何分工,损失与首词引导做了什么?
训练分成 3 个阶段,优化目标互相分离。第一阶段是语音条件对齐,只训练对齐模块与投影层,冻结语音编码器与大模型词嵌入,目标是让预测嵌入在数值大小与方向上都接近目标嵌入。第二阶段是指令微调,冻结对齐模块,只训练加在大模型查询、键、值与前馈层的低秩适配器,指令为转写该音频,损失只算在回答的转写部分,指令词元只做上下文。第 3 阶段是精调,用第一阶段自回归最近邻解码产生的转写对应的嵌入做输入,再施加掩蔽与删除扰动,仍用教师强制学习纠正不完美对齐,掩蔽概率 0.05、删除概率 0.1。图 2 展示了各阶段可训练部件的切换。
读图前先明确:中间橙色虚线框是第一阶段的可训练范围,右上角低秩模块是第二阶段的可训练点,第 3 阶段的扰动施加在第一阶段输出上,全程预训练编码器与大模型主体冻结。
看图路径: 1. 先看中间橙色虚线框内的语音编码器、SEAM 与下方词元化器的上下箭头;2. 确认交叉注意力箭头从语音编码器指向 SEAM 解码器;3. 看左侧指令文本如何直接进入大模型,与中间语音嵌入形成两路上下文;4. 注意 SEAM 框右侧标注的 Stage-1 可训练与 Stage-2 冻结切换

论文图 2。原论文 Figure 2:“SEAM architecture overview. Dashed box: trainable components in Stage 1 (alignment module).”。
从像素看,中间 SEAM 框同时标注第一阶段火焰与第二阶段雪花,说明同一模块在不同阶段冻结状态不同;左侧指令经词元化器直达大模型,中间语音嵌入经多箭头进入大模型,右侧转写词自下而上对应,表明语音前缀与指令共同构成上下文。第一阶段损失同时约束幅度与方向,权重各占一半;第二与第 3 阶段损失都是对真实转写的负对数似然,只是第 3 阶段输入是扰动后的嵌入。
语音条件对齐 × 指令微调: 语音条件对齐负责第一阶段只训练对齐模块,把语音映射到大模型能理解的嵌入;指令微调负责第二阶段冻结对齐模块、只用低秩适配器让大模型学会按指令转写。分开的原因是同时优化对齐与语言生成会互相干扰,先学跨模态对应再学对话格式,可以保留预训练的声学与语言知识,新增作用是让语音嵌入作为上下文前缀被大模型稳定消费。
第一阶段损失的形式如下,符号中预测嵌入与目标嵌入逐位置比较,均方误差管幅度,余弦距离管方向。
\[Lstage1 = λ∥ˆE−E∥2\]第二阶段损失的形式如下,符号中回答词元逐个在给定指令与语音嵌入条件下预测,指令不计损失。
\[Lstage2 = −1\]首词引导要单独理解:指令微调后的大模型在仅靠语音嵌入预测第一个回答词元时缺少语言上下文,准确率偏低。做法是先用第一阶段最近邻得到预测首词,把该词的嵌入插到回答起始标记之后,再让大模型从该起点继续生成后续词。这是一个可运行的推理技巧,不需要额外训练。
精调 × 首词引导: 精调指第 3 阶段对第一阶段输出做随机掩蔽与删除后再做教师强制训练,负责降低模型对严格长度对应的依赖;首词引导负责把第一阶段最近邻解码预测的首个词嵌入显式插到回答起始位置。两者搭配是因为精调处理整体长度鲁棒性,而首词错误会连锁影响后续自回归,首词引导新增的作用是给无语言上下文的第一个生成步提供明确起点。
原文未报告梯度在交叉注意力内部的具体截断位置与第 3 阶段扰动后长度的聚合口径,这些缺项在复现时需按代码实际行为核对,不从模型名称推定实现。
在什么数据、模型与指标下比较,条件是否一致?
训练数据是 LibriSpeech960 小时朗读语音,评估用其测试集的干净子集与其他子集,以及跨域的 TED-LIUM-v2 即兴演讲。比较对象包括 Whisper-large-v2、SLAM-ASR 与 SALMONN。指标是词错率,用 Whisper 英文文本归一器做归一化,数值越低越好。需要特别注意 TED-LIUM-v2 上 Whisper-large-v2 出现过度幻觉,论文括号内给出 Whisper-medium 的 7.7% 作为参照,阅读时不能把不同规模混为同一基线。模型配置是冻结 Whisper-large-v2 编码器约 629M 参数与 Qwen3-4B 约 4058M 参数,对齐解码器约 839M 加投影约 72M 在第一阶段可训练,第二阶段只训练约 62M 的低秩适配器,秩 32、缩放 64、丢弃 0.1。
优化用 AdamW、学习率 5e-4、权重衰减 0.01、梯度裁剪 1.0、混合精度,在 6 张 RTX A6000 上训练。评估分两种解码:第一阶段用自回归最近邻直接衡量对齐质量,完整模型用两段自回归先产生语音嵌入再由大模型生成转写。论文还报告了速率统计:在 LibriSpeech 测试集上自然文本 2.71 词元每秒,SEAM 为 2.99 词元每秒,定速法为 10.0 嵌入每秒。
主结果显示什么,跨域收益与代价是什么?
要回答的核心问题是:在只用域内朗读数据训练时,变速率对齐能否在域内保持可用并在跨域借助语言知识获得更好鲁棒性。比较的公平条件是各方法在 LibriSpeech 上的训练量不同需分别注明,指标方向是词错率越低越好。下表保留原文的必要基线与 SEAM 的可运行策略,包括不带大模型的第一阶段最近邻、完整 3 阶段不带首词引导与带首词引导的版本。
| Method | test-clean | test-other | TED-LIUM-v2 |
|---|---|---|---|
| SLAM-ASR (Ma et al., 2024) | 1.9 | 3.6 | 8.8 |
| SALMONN (Tang et al., 2023) | 2.2 | 5.7 | 4.8 |
| SEAM w/o LLM (Stage-1) | 2.7 | 5.9 | 7.2 |
| SEAM (Full, Stage-3, w/o FTG) | 3.1 | 6.0 | 5.7 |
| SEAM (Full, Stage-3, w/ FTG) | 2.6 | 5.2 | 4.7 |
表后解释需要同时看到收益与代价。收益方面,带首词引导的完整模型在干净集 2.6%、其他集 5.2%,与基线编码器相当;在跨域 TED-LIUM-v2 上取得 4.7%,优于 SLAM-ASR 的 8.8% 与 Whisper-medium 的 7.7%,与在 4400 小时上训练的 SALMONN 的 4.8% 相当,论文据此认为语言知识补偿了有限语音数据的不足,这属于有限解释而非因果证明。代价方面,不带首词引导的完整模型为 3.1% 与 6.0%、跨域 5.7%,说明首词误差会拖累整体;仅用对齐模块最近邻已达 2.7% 与 5.9%、跨域 7.2%,说明对齐本身有效但跨域仍需大模型精调。
未胜出项是 SLAM-ASR 在域内干净集 1.9% 明显更好,说明在域内充分拟合时定速投影仍有优势,不能把跨域结论推广为全场景最优。不同指标差值不能混算,百分点差异不等于相对百分比提升。
速率与首词引导的对照拆开了什么机制?
这一节按两个机制问题组织:序列长度是否真的解耦时长,首词引导是否带来可部署改进。第一个问题测每秒向量数,比较对象是自然文本速率与定速法速率,条件是同一 LibriSpeech 测试集。下表把三者的速率与含义并列,数值单位保留原文写法,裸值不擅自添加百分号。
| 方法与条件 | 生成方式 | 平均速率与单位 | 原文表述 | 与自然文本关系 |
|---|---|---|---|---|
| 自然文本转写 | 词元化 | 2.71 tokens per second | LibriSpeech averages | 基准 |
| SLAM-ASR 下采样 | 固定下采样 | 10.0 embeddings per second | produces 10.0 embeddings per second | 约 3.3 × redundancy |
| SEAM 第一阶段最近邻 | 变速率自回归 | 2.99 tokens/sec | averaging 2.99 tokens/sec | closely matching |
表后解释是速率证据支持长度解耦的判断:10.0 对 2.71 显示定速法冗余,2.99 接近 2.71 显示变速率更符合预训练分布。但总体趋势不等于每条语音都成立,原文只报告平均值,未给出分布与方差,这是适用条件的限制。第二个问题测首词引导的增量,比较同一完整模型开关该技巧的前后,条件同为 3 阶段后推理。下表整理可运行策略的词错率,单位保留百分号写法。
| 模型条件 | test-clean | test-other | TED-LIUM-v2 | 策略差异 |
|---|---|---|---|---|
| Full Stage-3 w/ FTG | 2.6% | 5.2% | 4.7% | 有首词引导 |
表后解释是首词引导在三项上均有下降,跨域从 5.7% 到 4.7% 幅度最大,支持首词准确率影响整体的解释。同时要看到负结果:即使有引导,其他集 5.2% 仍未超过 SLAM-ASR 的 3.6%,说明该技巧不能弥补所有声学建模差距。未评测边界包括多轮对话与长语音,原文未报告这些条件下的表现。
哪些结论不能推广,哪些开销必须正视?
论文明确报告的局限包括仅评估英文语音识别、仅使用特定预训练组合、两段自回归带来延迟。第一段自回归由对齐模块逐词产生嵌入并做最近邻查找,第二段由大模型生成转写,延迟高于单阶段方法,限制实时应用。训练资源与推理开销要分开讨论:训练涉及约 911M 可训练参数的第一阶段与约 62M 适配器的第二阶段,推理开销则来自双重自回归步数与最近邻搜索,输出帧率不等于实际延迟。
另一个潜在混杂是测试集污染:大模型预训练可能见过公开语音数据集的文本,但论文用第一阶段不经大模型生成的最近邻仍取得 2.7% 与 5.9% 来说明对齐本身有效,这属于支持性证据而非排除污染的证明。第 3 阶段掩蔽删除的影响在多样域上缺乏更全面的分析。缺失证据不是技术错误,但未测量延迟毫秒数与误判率分解时,不应承诺这些量得到改善。相关性不等于因果,跨域提升可能同时来自对齐结构与大模型知识,需更多消融才能拆分。
要复现先做什么,需要哪些信息条件?
复现的第一步是固定数据与归一化:用 LibriSpeech960 小时训练,在其干净与其他测试集及 TED-LIUM-v2 上评估,统一用 Whisper 英文文本归一器,否则词错率不可比。第二步是固定冻结关系:冻结 Whisper-large-v2 编码器与 Qwen3-4B 主体与词嵌入,第一阶段只更新随机初始化的解码器与投影,第二阶段冻结对齐模块只更新低秩适配器,第 3 阶段用第一阶段自回归输出加扰动做精调。关键超参数包括解码器 32 层 20 头维度 1280、输出投影 1280 到 2560、低秩秩 32 缩放 64 丢弃 0.1、精调掩蔽 0.05 删除 0.1、学习率 5e-4 权重衰减 0.01 梯度裁剪 1.0。
推理要实现最近邻距离同时考虑均方误差与余弦相似且权重各半,以及首词引导的插入位置。还需补的验证是扰动概率的敏感性、不同编码器与大模型组合的系统性测试、非英文与自发语音的泛化。由于本次未确认可达的开源资源,不得声称代码或权重已公开,复现应从论文文字与公式出发搭建流程并记录实际运行环境。
何时值得尝试 SEAM,何时坚持定速方法?
当训练语音局限于朗读域但测试涉及演讲等自发域,且可以使用大模型语言知识时,值得尝试 SEAM 的变速率对齐加 3 阶段流程,预期在跨域鲁棒性上获得补偿。复现时先验证速率是否接近自然文本,再验证首词引导的增量,最后看跨域词错率是否稳定下降。当任务是域内高精度转写且延迟敏感时,定速投影可能更简单有效,SLAM-ASR 在域内干净集的优势就是例证。论文特有的误解需要澄清:变速率不是让模型说话更快或更慢,而是指输出嵌入数随语义密度变化。
冻结大模型不是不用大模型,而是只用其嵌入空间与生成能力而不改其主体参数;首词引导不是给出正确答案,而是用第一阶段预测降低首步不确定性。总体判断是 SEAM 报告了一种可运行的粒度对齐方案并给出跨域证据,但其实时性、多语言与多任务能力仍待验证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses