英文题目:Learning to Wait: Real Streaming Speech-to-Text Translation with an LLM
会议身份:
conference:interspeech:2026:conference-paper-id:zhang26u_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#Transformer #大语言模型 #流式处理 #语音 #语音翻译
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Shucong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Titouan Parcollet:机构信息未能从会议 PDF 纯文本可靠映射
- Rogier van Dalen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式语音到文本翻译需在音频到达过程中逐块读入声学流并增量输出目标译文,实际难点是语速快慢不定且麦克风提前打开引入的前置静音会使固定节拍强行输出而幻觉或掉队。本文在Bestow架构上引入可学习等待策略,先由两层卷积加二十二层Conformer编码器将滤波组特征逐级下采样至每秒12.5帧的语音嵌入并做自监督预训练与翻译微调。接着等待策略以已听语音嵌入与已生成词为输入逐步预测等待或发射,若判等待则读入新的音频块继续累积,若判发射则进入下一步。最后条件网络以交叉注意力将语音嵌入注入文本嵌入,再送入冻结大语言模型生成下一个目标词,实现听译交错进行。相对固定等待策略等待1.28秒后每640毫秒输出一词,该机制能在静音时等待、在语义完整时发射,具有真实场景鲁棒意义。在前置5秒噪声的SilFleurs评测场景下,学习等待策略的COMET分数为0.745,高于固定等待策略的COMET分数0.593。该结论适用边界受限于短句Fleurs及其SilFleurs变体验证,尚未验证长演讲、语中停顿与真实麦克风噪声下的外推表现。训练成本为在四块A100硬件上以Adam优化器训练180000步,延迟方面学习策略平均逻辑延迟为1.72秒。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,流式为何多了一个决策?
这篇论文研究的输入是连续到达的英语语音,目标是在说话还没有结束时就逐步输出法语或韩语文本。输出不是等整句结束再 1 次性给,而是一边听一边决定此刻是继续等下一段音频,还是已经有足够信息可以写出下一个词。必须保留的信息包括已经听到的音频、已经生成的译文词,以及两者之间的对应进度,输出则是交错的等待动作和生成动作序列。离线系统可以看完全部音频再翻译,流式系统必须在信息不完整时做决策,这就多了一个等待策略模块。
等待策略不是翻译模型本身,而是控制节奏的开关,它决定何时调用大语言模型生成词、何时继续积累音频。对于刚入门的读者,可以把任务想象成同声传译的文字版:听一点、写一点,但不能在没听到内容时编造,也不能在说话人讲得很快时越落越远。论文要解决的正是固定节拍在真实麦克风条件下的这两种失败。
此前路线如何处理语音翻译和等待时机?
传统路线是级联式,先用语音识别得到英文假设,再送入文本到文本翻译系统。它的等待问题可以数词,因为输入输出都是词。后来出现端到端编码器解码器路线,直接把语音表示换成文本词,减少了级联误差,也有可能利用韵律等非文本信息。近年预训练大语言模型流行,做法是把语音输入条件化到大语言模型上,做语音识别或语音到文本翻译,本文继承的 Bestow 就属于这一支。无论是否用大语言模型,流式都额外需要等待策略。
文本翻译中等待 k 策略是等 k 个输入词再按 1 比 1 生成,语音翻译中则改为数音频块。论文指出这种固定策略在标准测试集上容易显得可用,因为测试句短且前后静音比较一致,但在真实世界没有理由让语速与固定节拍匹配。另一类学习型等待策略是连续积分发放,但论文明确不采用,理由是它不以已输出词为条件,相当于在不知道要发什么词的情况下决定何时发词,作者认为这是根本缺陷。
动态等待策略 AlignAtt 作为基线出现,它根据当前词与语音嵌入之间交叉注意力分数的最大值位置决定等待或生成,但它只是解码算法不同,模型仍按固定策略训练。
固定节拍在真实音频前会怎样失效?
论文用两个具体动作讲清失效。第一是麦克风提前打开,几秒内没有语音,固定策略等待固定时长后仍被迫按节拍输出,只能幻觉出文本。第二是语速变化,说话慢或犹豫时同样会编造多余词,说话快或连续讲几分钟时则越落越远并漏译。为此论文构造了 SilFleurs 作为可复现的反例:在 Fleurs 测试集每条语音前拼接 5 秒低电平噪声,模拟提前开麦。例子意义是教学性的:它不是真实部署的全部情况,而是把固定策略的脆弱性放大到可测量的程度。
固定策略的等待 k 实现是先等 1280 毫秒再每 640 毫秒输出一词,这种与内容无关的节奏在静音段必然触发幻觉。学习型策略的目标就是让等待决策同时依赖已听音频和已生成文本,在静音时选择等待,在证据充足时选择生成。论文强调这不是加一个静音词就能修补的,因为慢速、口头禅、快速长语音都会带来同样的节拍错配,SilFleurs 只是最容易复现的一种。
系统全景:一个样本如何从音频走到译文?
沿一个样本走一遍,输入是按块到达的音频,输出是交替的等待与生成动作加译文词。音频先经语音编码器变成编码音频序列,译文词历史先经自注意力聚合,再经交叉注意力读取截至当前时刻的编码音频,等待策略据此输出等待或生成的二分类分布。如果判为等待,系统读入下一音频块并再次询问等待策略;如果判为生成,则调用大语言模型在完整历史条件下选出下一个词,再把新词反馈给等待策略。
条件网络位于大语言模型之前,用交叉注意力把语音嵌入注入文本嵌入,使冻结的大语言模型获得语音条件而不必把底层改成交叉注意力。下面的导读帮助读者把右图的完整系统、中图的等待策略和左图的注意力块对应起来,重点看音频、词历史、等待决策、大语言模型四者的连接。
等待策略 × 大语言模型: 等待策略负责在每一步决定是等待下一个音频块还是调用模型生成下一个词,大语言模型负责在被允许生成时根据语音条件和已生成文本给出下一个词,二者搭配的原因是语音到达速度与文本生成速度不一致,必须由前者控制节奏、后者保证语言质量,组合后系统既能流式输出又能避免固定节拍的抢答和掉队。
看图路径: 1. 沿右图底部音频块经语音编码器到编码音频再到等待策略的箭头走一遍主路径;2. 观察等待策略输出的等待与生成序列如何分别触发等待下一块或调用大语言模型;3. 对照中图自注意力在下而交叉注意力在上的堆叠,确认词历史先自聚合再读音频;4. 查看左图注意力块的归一化与残差位置,确认预归一化结构
论文图 1。原论文 Figure 1:“The structure of the proposed system. Left: the attention layer. Middle: the wait policy. Right: the complete system.”。
左中右三栏实际上是同一系统的不同放大倍数。右栏显示音频块经语音编码器得到编码音频,同时已生成词送入条件网络再进入大语言模型,等待策略同时接收编码音频、条件网络和词历史的信息并输出等待或生成序列。中栏放大等待策略内部,可见底部自注意力先处理词历史,上方两层交叉注意力依次读取编码音频,顶部输出等待或生成的分布。左栏再放大单层注意力,显示归一化、注意力、前馈与残差的预归一化连接。绿色连线表示词历史同时影响条件网络和等待策略,这是理解信息条件的关键。
等待策略与条件网络各自算什么?
等待策略是一个改过的 Transformer 解码器,输入是截至当前时间的编码音频和截至当前已生成的词,输出是下一步动作的 2 维概率分布。它的计算顺序是先对词做带因果掩码的自注意力,再以词表示为查询、以语音嵌入为键做交叉注意力,最后经前馈得到等待或生成的打分。条件网络是加在大语言模型起始处的两层 Transformer 解码器层,每层按归一化、自注意力、交叉注意力、前馈的顺序组织,用旋转位置编码,负责把语音嵌入条件化到文本嵌入上。
语音编码器本身是 22 层 Conformer 共约 300,000,000 参数,前端用两层 2 维卷积把梅尔滤波器组从每秒 100 帧降到每秒 25 帧,编码器后再拼接降到每秒 12.5 帧。大语言模型是自研的 3,000,000,000 参数模型,参数冻结并对所有稠密层加秩为 8 的低秩适配。等待策略约 30,000,000 参数,从零训练。条件网络每层有 8 个注意力头,维度 1536,两端各有投影层在 3072 与 1536 之间转换,并向语音嵌入序列加入特殊的语音结束嵌入以告知音频流结束。
语音编码器 × 条件网络: 语音编码器负责把梅尔滤波器组音频变成低帧率的连续表示,条件网络负责用交叉注意力把这些语音表示注入文本嵌入再送入大语言模型,二者搭配的原因是不改动大语言模型底层的自注意力结构也能获得语音条件,组合后冻结的大语言模型仍能按语音内容做翻译。
固定等待策略 × 学习型等待策略: 固定等待策略按等待若干音频块后每块输出一词的固定节拍工作,学习型等待策略在每一步看已听音频和已输出词后输出等待或生成的二分类分布,二者分工都是控制时机但信息条件不同,搭配比较的意义是揭示固定策略在测试集短句上看似可行、在真实静音和快慢变化下必然失效,而学习型策略能按内容自适应等待。
交叉注意力 × 自注意力: 自注意力负责在已生成词内部建立历史依赖,交叉注意力负责以词表示为查询去读取截至当前时刻的编码音频,二者在等待策略和条件网络中先后使用,搭配的原因是决策既要知道已经说了什么又要知道已经听到了什么,组合后每一步的等待或生成判断同时受语言历史和声学证据约束。
把组合说透彻一点:语音编码器只管把声音变成可检索的键,条件网络只管把键的内容注入文本查询,等待策略只管根据查询与键的匹配程度决定是否已可生成,大语言模型只管在被允许时选词。固定策略跳过了匹配判断,直接按时间计数触发大语言模型,所以静音时也会触发。学习型策略恢复了匹配判断,静音时交叉注意力找不到可支撑新词的音频证据,就会倾向等待。
训练时如何同时学等待和翻译?
训练与解码的信息条件不同。解码时必须交错执行等待策略和大语言模型,因为下一步音频与下一步词都依赖上一步的等待或生成决定。训练时参考对齐和目标词序列都已知,不必交错,可以 1 次算完。等待策略的监督来自目标对齐,翻译的监督来自目标词序列,两部分损失相加形成多任务目标。实现上等待策略的自注意力部分对全部词用因果掩码 1 次前向,交叉注意力部分需要在音频时刻与词位置的组合上求值。
对齐共有音频块数加目标词数个步骤,意味着交叉注意力要在重复的时刻与位置对上求值:第一层交叉注意把上一层自注意的输出按词序号序列重复,并按时刻序列给出交叉注意力掩码。目标对齐的构造分两步,先用英伟达 NeMo 神经强制对齐器得到英语语音到英语文本及时间戳,再用问答模型把英语文本与目标译文匹配成短语并把英语词的时间映射到目标短语。
训练数据是 LibriSpeech、CommonVoice14.0 和 MuST-C 的拼接约 3700 小时音频,其中 LibriSpeech 和 CommonVoice 的目标译文是用大模型从英文转写自动翻译得到,英韩用 GPT-4,英法用千问 14B。论文未报告等待损失与翻译损失的加权系数、标签平滑、学习率等细节,这部分是复现时的缺项,只能按原文给出的优化器和步数先对齐大框架。
用什么数据、基线和指标比较流式效果?
语言方向是英语到法语和英语到韩语,分别考察相近语言和差异较大语言。训练用上述 3 数据集拼接,评估用 Fleurs 的韩语和法语验证与测试集,另加自造的 SilFleurs,即在 Fleurs 测试集每条前拼接 5 秒来自 Musan 数据集的无噪声音频并降到负 20 分贝。模型比较包括离线拼接基线、离线 Bestow、固定等待的流式 Bestow、AlignAtt 动态解码的 Bestow,以及本文学习型等待的 Bestow。拼接基线把提示、语音嵌入和翻译词直接拼接送入大语言模型上下文,Bestow 则用交叉注意力条件化。固定策略首词在 1280 毫秒后发出,之后每 640 毫秒一块。
AlignAtt 窗口设为 32,仅改变解码算法。所有 Bestow 模型在 CoLiMu 数据集上用 Adam 训练 180,000 步,批按总时长 600 秒计,用 4 块 A100,拼接基线训练 120,000 步,用 SpeechBrain 实现。指标一是翻译质量,用 wmt22-comet-da 模型的 COMET 分数,0 到 1 越高越好,给定参考译文、参考转写和预测译文打分。二是流式延迟,用平均逻辑延迟,类似按时间计算的平均滞后,逻辑发射时间是模型获得足够信息可发该词的音频时刻,对测试集全部词取平均而非仅音频结束前发出的词,以便与离线系统比较,参考是假设词均匀分布在音频中的理想系统。
SilFleurs 上的延迟不直接比较,因为会整体平移所加静音时长。
主结果:质量、延迟与静音鲁棒性如何权衡?
比较问题是:在保持可比训练和评估条件下,学习型等待是否在标准集上更快或更准,并在前置静音下不崩塌。公平条件是同一语音编码器和大语言模型族、同一 Fleurs 与 SilFleurs 划分,指标方向是 COMET 越高越好、逻辑延迟越低越好。下表整理英法方向的关键数字,条件列区分标准 Fleurs 与 SilFleurs,数值保留原文写法。
| 条件 | 指标 | 离线拼接 | 离线 Bestow | 固定流式 Bestow | 学习型流式 Bestow |
|---|---|---|---|---|---|
| Fleurs 测试 | COMET | 0.821 | 0.782 | 0.767 | 0.767 |
| Fleurs 测试 | 延迟 | 5.20 s | 5.20 s | 3.57 s | 1.72 s |
| SilFleurs | COMET | 0.821 | 0.781 | 0.593 | 0.745 |
| 音频节拍 | 首词与块长 | 离线无 | 离线无 | 1280 ms 首词、640 ms 每块 | 按内容自适应 |
表后解释需要同时讲收益与代价。
英法上固定流式把延迟从 5.20 秒降到 3.57 秒但质量从离线水平降到 0.767,前置静音后进一步掉到 0.593,论文报告为强制幻觉所致。学习型策略在标准集保持 0.767 的同时把延迟降到 1.72 秒,在 SilFleurs 上为 0.745,基本不受静音影响。代价是学习型在标准集上也没有超过固定策略的质量,只是持平加更快;离线拼接质量仍最高但不流式。未胜出项是离线 Bestow 在 SilFleurs 上从 0.782 到 0.781 也有轻微波动,说明即使离线条件化也非完全不受前置噪声影响。
逻辑延迟 × 翻译质量: 逻辑延迟度量模型获得足够信息从而可以输出每个词的音频时刻再对全集取平均,翻译质量用给定参考译文和转写的 COMET 分数度量,二者搭配的原因是流式系统必须同时回答准不准和快不快,组合后才能判断延迟下降是否以质量崩塌为代价,以及静音测试是否只影响质量而不应计入可比延迟。
下图导读先看英韩方向的条形对比,它把质量差异画成条长,重点是固定策略在两种条件下的断裂。
看图路径: 1. 先确认纵轴六行分别对应离线拼接、离线 Bestow、固定流式和学习型流式的 Fleurs 与 SilFleurs 条件;2. 比较固定策略在 Fleurs 长条与 SilFleurs 极短条之间的落差,定位静音导致的崩塌;3. 观察学习型策略两条红条长度基本一致,确认对前置静音不敏感
论文图 2。原论文 Figure 2:“English →Korean: the effect on the translation per-”。
该图纵轴从上到下是离线拼接、离线 Bestow、固定流式、学习型流式,每类各有 Fleurs 与 SilFleurs 两条。可见离线两类在两种条件下条长基本不变,固定流式在 Fleurs 有中等长度条而在 SilFleurs 缩成极短并用虚线连接,学习型两条红条长度基本一致。像素不能读出精确 COMET 数值,精确数以下表为准。图的教学价值是把表格中固定策略崩塌与学习型稳定的对比可视化,但不能把条长直接当延迟,横轴是质量方向而非时间方向。下表给出英韩方向的对应数字,同样保留原文精度。
| 条件 | 指标 | 离线拼接 | 离线 Bestow | 固定流式 Bestow | 学习型流式 Bestow | AlignAtt |
|---|---|---|---|---|---|---|
| Fleurs 测试 | COMET | 0.889 | 0.881 | 0.814 | 0.820 | 0.840 |
| Fleurs 测试 | 延迟 | 5.20 s | 5.20 s | 2.59 s | 2.37 s | 2.60 s |
| SilFleurs | COMET | 0.882 | 0.882 | 0.486 | 0.820 | 0.675 |
| 构造 | 前置静音 | 5 seconds、−20 dB | 5 seconds、−20 dB | 5 seconds、−20 dB | 5 seconds、−20 dB | 5 seconds、−20 dB |
英韩故事相似但有一点不同:韩英差异大,学习型策略更常等完整短语结束,延迟为 2.37 秒,只比固定的 2.59 秒略低,质量 0.820 略高于固定的 0.814。AlignAtt 在标准集达到 0.840 且延迟 2.60 秒,但在 SilFleurs 掉到 0.675,说明仅靠注意力最大值的解码启发式不能解决训练与测试的节拍错配。固定策略在 SilFleurs 掉到 0.486,是全场最严重的崩塌。学习型在两种条件下都是 0.820,显示在停顿期间做了正确的等待决策。
需要说明固定策略延迟随输出词数变化,跨系统延迟差不能完全归因于等待逻辑本身。
哪些对照说明增益来自等待决策而非其他改动?
论文没有做逐模块消融,但用 3 组对照逼近归因。第一组是离线拼接与离线 Bestow 的比较,区分条件化方式的影响:拼接把语音当词送入上下文,Bestow 用交叉注意力条件化,英法上拼接质量更高,说明流式增益不是因为换了更强的条件化方式。第二组是固定流式与 AlignAtt 的比较,两者模型相同、仅解码算法不同,AlignAtt 在英韩标准集更高但在 SilFleurs 仍大跌,说明仅改解码启发式不够,必须在训练中学习等待。
第 3 组是固定流式与学习型流式的比较,两者都是流式且共享编码器与大语言模型族,差异在等待决策是否以音频与词历史为条件,结果是标准集持平或略优、延迟更低、静音鲁棒性差距巨大,支持增益来自等待决策。论文还讨论了一个可能的反驳:在训练中加静音词能否让固定策略通过 SilFleurs。
作者认为这只是治标,因为真实世界还有慢速、迟疑、快速长语音等多种节拍错配,固定节拍总会在某一种下被迫幻觉或掉队,而学习型策略从机制上解决了按内容等待的问题。这个判断属于有限解释,因为论文只实测了前置静音一种,未实测慢速与快速长语音下的延迟累积,推广到所有真实条件仍待验证。
证据边界:哪些量没有测,哪些结论不能推广?
首先是延迟口径的边界。逻辑延迟是模型有足够信息可发词的时刻,不是用户感知的 wall-clock 延迟,不含编码、前向、解码搜索与音频分块的计算开销,也未报告输出帧率与实时因子,不能据此承诺部署后体感更快。其次是统计与聚合的边界。论文报告的是测试集平均 COMET 与平均逻辑延迟,未报告置信区间、显著性检验或按语速、句长、噪声水平的分桶结果,总体趋势不等于每组都成立。再次是数据构造的边界。
训练目标译文部分由大模型自动翻译,等待监督依赖强制对齐加短语匹配的自动流水线,对齐误差会进入监督,论文未量化对齐质量与误触发率。再其次是语言与时长的边界。评估集中在英法、英韩的 Fleurs 短句及 5 秒前置静音,未评测几分钟长语音、连续对话、重叠语音与真实麦克风噪声,固定策略掉队与学习型策略长程稳定性都未被直接测量。最后是资源声明的边界。
本次收到的证据中没有绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开,只能按论文文字复现思路,不能假设可下载权重或一键运行。
若要复现,先重建哪些步骤与参数?
先重建数据与对齐。准备 LibriSpeech、CommonVoice14.0 和 MuST-C 约 3700 小时音频,对后两者用大模型从英文转写生成目标译文,再用神经强制对齐得英语词时间戳并匹配到目标短语,形成每个目标短语的音频时刻监督。评估时准备 Fleurs 法语与韩语验证测试集,再用 Musan 的指定噪声以负 20 分贝在每条测试音频前拼接 5 秒得到 SilFleurs,注意保持采样率与电平计算可重复。模型侧先预训练 Conformer 编码器,遵循 BEST-RQ 自监督与动态块训练,再与系统联调做翻译微调。
等待策略从零训练,文本与语音嵌入先经线性投影与归一化到相同维度,自注意力用旋转位置编码、维度 768、前馈 1024 加高斯误差线性单元,之后两块交叉注意力加前馈,文本为查询、语音为键,训练时按对齐展开全部时刻与位置组合并加因果与交叉掩码。条件网络在语言模型前加两层解码器层,每层 8 头、维度 1536,两端投影在 3072 与 1536 之间转换。大语言模型冻结并加秩 8 低秩适配。训练用 Adam 共 180,000 步、批按总时长 600 秒计,拼接基线 120,000 步,4 块 A100,用 SpeechBrain 实现。
解码时实现等待与生成的交错循环,等待则读下一 640 毫秒块,生成则调大语言模型并更新词历史。复现时先跑离线与固定流式基线对齐质量与延迟,再切学习型策略并在 Fleurs 与 SilFleurs 双条件报告,以验证静音鲁棒性是否复现。
何时值得尝试这种学会等待的思路?
当部署条件满足三点时值得尝试:麦克风开启时刻不可控、语速与停顿变化大、需要低延迟逐步输出而非等整句。此时固定节拍的失败是结构性的,不是调大等待块数能解决的,因为调大只会增加延迟而调小只会增加幻觉,学习型等待把节拍决定权交还给内容匹配。复现时优先做双条件评估,不要只看标准测试集,因为标准集短句与一致静音会掩盖固定策略的缺陷,至少要加前置静音、慢速与长语音 3 种压力测试。
还需补的验证是真实延迟与计算开销的联合测量、长语音下的漏译率、以及对齐噪声对等待决策的影响,这些在原文中未充分报告。常见误解是把 AlignAtt 这类注意力解码技巧等同于学会等待,实际上它没有在训练中学习以词历史为条件的等待分布,在分布外静音下仍会大跌。另一个误解是把逻辑延迟等同于体感延迟,前者只回答何时有足够信息,后者还取决于每步前向耗时与输出帧率。把握住等待决策的信息条件与监督来源,就抓住了这篇论文可复述的核心。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

