英文题目:Plan and Double-Check: Streaming Multimodal Q-Former for Online Robot Action Generation

会议身份:conference:interspeech:2026:conference-paper-id:hori26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多模态学习 #流式处理 #音视频 #音视频理解

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Chiori Hori:机构信息未能从会议 PDF 纯文本可靠映射
  • Ryosuke Korekata:机构信息未能从会议 PDF 纯文本可靠映射
  • Motonari Kambara:机构信息未能从会议 PDF 纯文本可靠映射
  • Yoshiki Masuyama:机构信息未能从会议 PDF 纯文本可靠映射
  • Siddarth Jain:机构信息未能从会议 PDF 纯文本可靠映射
  • Radu Corcodel:机构信息未能从会议 PDF 纯文本可靠映射
  • Diego Romeres:机构信息未能从会议 PDF 纯文本可靠映射
  • Jonathan Le Roux:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理未切分烹饪演示视频的在线理解问题,输入为连续到达的视频与音频流,输出为单臂机器人可执行的微步动作序列与面向人确认的自然语言描述,难点在于无显式切分时仍需低延迟决定何时说话。本文方法先按 1 秒切块抽取多模态特征并交织,再由流式查询变换器 Querying Transformer(Q-Former)融合左上下文生成查询嵌入,最后由冻结大语言模型 Large Language Model(LLM)逐块自回归生成或输出结束符以等待下一块。与离线 AVBLIP 相比,关键差异是用块因果交叉与自注意力掩码实现并行训练,并用采样或损失阈值选择提前生成时刻而无需重训 LLM 解码器。在 YouCook2 验证集上,损失选择流式模型动作序列 BLEU-2 为 0.328,相对离线基线下降不足 10%,平均提前约 2.92 秒触发。该结论仅适用于烹饪演示域与文本相似度指标,未验证真实机器人执行成功率与对话纠错效果。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,机器人要输出什么?

这篇论文的输入是连续的、没有预先切分的音视频流,典型例子是人类做菜的演示视频,包含人手动作、物体外观、环境声音与说话内容。输出是两类文本,一类是机器人微步动作序列,另一类是给人看的确认句。微步动作序列不是自由文本,而是由单臂动作、目标物体、介词和地点 4 个槽位组成的受控短语,例如拿起勺子、把蘑菇放进锅里、搅拌锅中米饭。确认句则是把同一计划用人话再说一遍,例如我要把切好的蘑菇放进锅里搅拌,对吗。

必须保留的信息是动作发生的先后顺序、涉及的物体与容器、以及计划与当前画面的对应关系,丢掉其中任何一项都会导致执行错误。目标是在视频还在播放时就逐块输出,而不是等整段视频结束再 1 次性输出。离线做法要求事先给出每段动作的开始与结束时间,这在真实交互中做不到,因为机器人不知道人何时开始、何时讲完。流式做法要求模型自己决定何时开口,何时闭嘴。

初学者容易误以为把音视频丢给大模型就能直接出动作,实际上还需要解决 3 个依赖,先把变长多模态特征压缩成定长嵌入,再把嵌入翻译成受控动作词表,最后在没有精确帧词对齐的情况下学会提前输出的时机。本文后续就按这个依赖顺序展开,先讲任务与路线,再讲整体结构与组件,最后讲训练对齐、实验条件与结果边界。

已有路线解决了什么,还缺哪一块?

第一条路线是演示驱动的视觉语言模型,直接从视觉与语言输入生成机器人动作,把感知与规划放在端到端策略里,例如从操作视频映射到可执行微动作。这类方法的感知接地较好,但多数是离线处理切分好的短片段。第二条路线是基于大语言模型的符号规划,把大模型当高层规划器生成组合式文本计划,通过重复提示提高可执行性,优点是组合与语义泛化强,缺点是计划抽象,需要额外接地模块才能在真机上执行。

第三条路线是视觉语言动作模型,把感知与动作统一在具身框架内,有的加入音频,有的做层次化分解以支持开放指令跟随。第四条路线是人机回圈重规划,失败后再通过对话纠正,属于事后补救。还有一类工作把确认生成直接放进多模态规划,让机器人在执行前主动说出计划供人验证,属于事前降低风险,本文的离线基础正是这类工作。

与同输入、同目标、同监督的对照相比,本文的输入同样是 YouCook2 烹饪视频与人工指令,目标同样是微步动作与确认描述,监督同样是人工标注的动作短语,不同的是运行阶段从离线整段改为在线逐块。与符号规划的对照不是同条件胜负,因为后者需要额外接地且不在本文数据集上评测。与流式语音识别中交错编码做法的对照是方法借鉴,原文明确说明跟随了逐帧或逐块交替编码与生成的思路,但扩展到带查询变换器的多模态结构,且不重训解码器。

理解这些对照可以避免一个误解,流式带来的精度变化不能直接与符号规划或视觉动作模型的数字对比,只有离线与流式在同一特征、同一解码器下的对比才是公平的。

为什么离线切分在真实交互中不可用?

举一个教学例子而非论文新数据,假设一段 19 秒的视频记录了加蘑菇并搅拌,人工标注给出开始 1 分 10 秒结束 1 分 35 秒。离线模型训练与测试都依赖这个起止时间,先把该区间内所有帧特征拼好再生成全部动作。真实机器人面对的是不间断的摄像头与麦克风,没有人告诉它动作从哪 1 秒开始。它必须每来 1 秒新画面就更新 1 次内部表示,并在合适的块输出开始符与后续词,否则就会一直沉默或在错误时刻抢答。

难点有三,一是特征是流式的,查询嵌入必须只依赖左上下文,不能看到未来;二是目标是延迟敏感的,早说可能看错,晚说失去在线意义;三是对齐是缺失的,烹饪动作不像语音那样有可靠的帧词对齐工具,无法用连接时序分类或传感器模型直接估计每个词对应哪 1 帧,人与机器人的对话数据也不足以学习自然应答时机。论文把问题形式化为块级生成,每块输出查询嵌入,解码器据此决定输出结束符表示本块无话可说,或输出开始符并延续确认加动作序列。

评估时不仅看生成文本与真值的相似度,还要看开始生成时刻相对原始片段结束时间的提前量,以及完全没有输出的漏检率。提前量为负表示早于标注结束,漏检表示模型全程只输出结束符。这两个量与文本质量共同决定在线可用性,缺一不可。

整体如何做到边看边说边计划?

整体流程可以沿一个样本走一遍,输入是一段连续烹饪视频,按 1 秒切块,每块分别抽取图像、视频、音频特征,投影后交错拼成该块的多模态序列。序列进入流式查询变换器,结合左上下文历史生成固定数量的查询嵌入,例如 16 个。查询嵌入经全连接层映射到冻结大模型的嵌入空间,大模型逐块自回归生成词,若判为结束符则进入下一块,若判为开始符则在本块继续生成确认句与微步动作。这种设计让模型不需要显式切分就能决定说话时机。下面先看论文用一张场景图讲清的动机,该图展示了人类演示、机器人误解、人类纠正、机器人修正计划并执行的闭环。

看图路径: 1. 先看左侧人类切菜演示与粉色对话气泡确认的输入侧;2. 再看中间机器人先误判卷心菜后被纠正为生菜的两轮计划;3. 接着看底部灰色云图中未来计划与最终执行动作序列的差别;4. 最后看右侧机器人知识库如何回连到中间的训练大脑模块

原论文 Figure 1:Multimodal large language models generate robot action confirmations together with the micro-step…

论文图 1。原论文 Figure 1:“Multimodal large language models generate robot action confirmations together with the micro-step action se- quences, enabling transparent communication and verification of the…”。

上图左侧是人类切菜演示与两轮对话,中间是机器人先计划切卷心菜后经纠正改为切生菜,底部对比了错误未来计划与修正后执行序列,右侧是机器人知识库回连训练模块。它的教学价值在于说明确认句不是装饰,而是执行前的可验证接口,微步序列不是开放描述,而是可执行槽位。回到方法全景,离线基线是 1 次性拼接整段特征再生成,流式版本是逐块交错再生成,区别只在特征组织与掩码,不重训解码器。

确认句生成 × 微步动作序列: 确认句生成负责把计划翻译成人可核验的自然语言描述,微步动作序列负责把同一计划翻译成单臂机器人可执行的四元组动作;二者搭配的原因是直接执行易因感知偏差失败,先说后做允许人在执行前纠正,组合意义是同一组查询嵌入同时驱动语言确认与可执行动作,保持语义一致。

需要强调的是字幕在本研究中被刻意去掉,原文说明在线场景通常拿不到字幕,用流式语音识别补字幕会使系统与评估复杂化,留作未来工作。因此当前结果是在无字幕条件下的表现,不能与用了字幕的既往数字直接比较。

三路特征与查询变换器各自做什么?

组件按输入到输出的顺序有 4 步。第一步是 3 路冻结编码器,图像特征用对比语言图像预训练模型抽取,视频特征用全模态视频模型抽取,音频特征用音频频谱变换器抽取,维度分别是 768、3806 与 527。这些编码器在第二阶段训练中保持冻结,只提供原始感知。第二步是投影与拼接,离线时把整段 3 路特征投影后拼成一条长序列,流式时对每个 1 秒块分别做同样的投影与交错拼接,保证每块都有图像、视频、音频三部分。

第三步是查询变换器,它用一组可学习查询通过自注意力交互,再通过交叉注意力读取多模态特征,最后输出固定数量的嵌入。查询变换器用预训练语言模型的权重初始化,自注意力部分共享多模态与文本两个子模块,交叉注意力随机初始化,训练时微调而解码器冻结,总量约 1 亿 88,000,000 参数。第 4 步是冻结的大语言模型解码器,采用 2,700,000,000 参数的开放预训练变换器,加一层前馈映射,把查询嵌入翻译成确认句与动作序列,损失是针对真值序列的交叉熵。 下面看离线结构图,它是理解流式改动的基础。

看图路径: 1. 自下而上跟踪视频输入到三路特征抽取器的箭头;2. 观察拼接节点如何把三色特征条带汇成一条输入 Q-Former;3. 对比下方冻结雪花标记与中间火焰标记的参数状态差异;4. 确认顶部输出同时包含确认句与动作序列两类文本

原论文 Figure 2:Q-former-based confirmation sentence generation and action planning model \\[24\\].

论文图 2。原论文 Figure 2:“Q-former-based confirmation sentence generation and action planning model [24].”。

上图自下而上是视频输入同时进入 3 个特征抽取器,经拼接进入查询变换器,再经映射进入解码器输出确认加动作序列。图中雪花标记表示冻结,火焰标记表示可训练,可以直接看到只有查询变换器是训练对象。这种冻结解码器的选择是为了复用大模型的推理能力,避免为动作任务重训大模型。

Q-Former × 大语言模型解码器: Q-Former 的分工是用可学习查询从变长音视频特征中抽取固定数量的任务相关嵌入,大语言模型解码器的分工是利用冻结的语言推理能力把嵌入展开为确认句与动作词序列;搭配理由是不重训大模型也能获得语言生成能力,组合意义是冻结解码器只微调 Q-Former 即完成多模态到语言的对齐与生成。

初学者常问为何不用普通拼接融合,原文指出查询变换器式融合在视觉语言对齐中已被证明更高效,且能把变长输入压缩为定长,这是它被选为瓶颈的原因。

如何训练才能并行又不偷看未来?

训练分两个阶段,第一阶段是多模态与语言表示学习,此时多模态编码器冻结;第二阶段是多模态到语言的生成学习,此时大模型解码器冻结,只连接查询变换器做动作序列生成。流式扩展的关键是掩码设计,它让训练可以并行而推理保持因果。第一组是查询变换器与原始解码器自注意力的因果掩码,只允许看过去。第二组是查询变换器交叉注意力的块掩码,每块查询可以看到过去所有块,看不到未来块,从而使查询嵌入是左上下文相关的。

第 3 组是流式解码器自注意力的块掩码,大模型只关注当前块的查询嵌入与本块已生成词,示例中假设回答从第三块开始。解码时查询变换器逐块接收特征并复用缓存的历史隐状态,解码器对当前块自回归生成,若预测到结束符则进入下一块,全程用贪心解码立即输出。对齐是训练难点,合理但朴素的做法是把所有目标词对齐到片段最后一块,但这不鼓励早说。

论文研究两种提前方法,一是采样法,每段随机选一个早于末块的块作为回答时刻,并限制最多提前 5 秒以避免过于激进;二是基于损失的选择,先采样一个时刻并计算损失,再计算末块损失,若采样损失经长度归一化后与原始损失之差小于阈值 0.002 则用采样位置反传,否则用末块位置反传,后者计算量更大但能避开无关时刻。下面看流式结构图,它把分块、交错与逐块生成画在了一起。

看图路径: 1. 先看底部交错条如何把三路特征按块对齐为等宽小块;2. 再看每块查询嵌入向上进入解码器后输出结束符或开始符的规律;3. 跟踪中间确认加动作序列跨块延续的虚线与回连箭头;4. 注意只有中间块真正展开长序列其余块只输出结束符

原论文 Figure 3:Online streaming Q-former-based confirmation sen- tence generation and action planning model.

论文图 3。原论文 Figure 3:“Online streaming Q-former-based confirmation sen- tence generation and action planning model.”。

上图底部是 3 路特征按块交错,中间是查询变换器每块输出查询嵌入,顶部是解码器每块输出结束符或在中间块展开确认加动作序列。注意虚线表示跨块延续,回连箭头表示已生成序列对后续块的影响,这正是块掩码要控制的信息流。

分块处理 × 交错拼接: 分块处理的分工是把连续视频切成例如 1 秒的短块逐块抽取特征以支持流式输入,交错拼接的分工是把每块的图像、视频、音频特征投影后拼成一个统一序列再送入 Q-Former;搭配理由是 3 路特征长度与采样不同必须先对齐到同一时间块,组合意义是离线拼接变为按块重复的在线拼接而不改变 Q-Former 接口。

因果掩码 × 块掩码: 因果掩码的分工是保证自注意力只能看到当前及过去位置以维持自回归顺序,块掩码的分工是把可见范围放宽到块级别,允许当前块查询看到过去所有块但看不到未来块;搭配理由是流式训练要并行又不能偷看未来,组合意义是 3 组掩码分别约束 Q-Former 自注意力、Q-Former 交叉注意力与解码器自注意力,实现可并行的流式训练。

采样对齐 × 基于损失的选择: 采样对齐的分工是在训练时随机把目标回答提前到片段结束前最多 5 秒的某块以鼓励早输出,基于损失的选择的分工是比较采样块损失与原始末块损失,仅当采样损失足够接近才用采样位置反传;搭配理由是过早输出可能对应无关画面,组合意义是用损失差阈值过滤掉不合理的提前对齐,兼顾低延迟与可学性。

补充一个未报告的缺项,原文没有给出优化器类型、学习率与训练轮次细节,只说明用交叉验证选最优轮次,因此复现时需按常规做法自行搜索并记录。

数据、特征与评测条件如何固定?

实验用 YouCook2 烹饪视频与人工指令,人工指令被映射为单臂微步动作。微步动作由 12 种原始单臂动作、目标物体、介词与地点组成,目标物体尽量取自对应人工指令中的名词。数据规模与质量决定了结论适用范围,先看划分与特征配置。训练集有 1173 个视频 8743 个片段,验证集有 416 个视频 3117 个片段,平均片段时长分别为 19.7 秒与 19.8 秒。因为测试集标注未公开,论文把验证集对半切做交叉验证,一半选最优轮次,另一半测性能,最终分数是 2 次平均。

动作词表包含 2790 个独特动作短语,涉及 195 个动词、2229 个物体、33 个介词与 1002 个地点,说明这是一个开放词表生成任务而非小集合分类。特征按 1 秒块抽取,离线基线把 10 到 20 秒片段的特征拼好再生成,流式按块交错再生成。解码方面,基线与流式都用贪心解码,而引用的既往最优用了束宽 5 的束搜索,这是数字略低的一个已知原因。评测指标用双词蓝值与气象度量,计算生成与真值序列之间的相似度,沿用机器人领域做法。

流式额外评测延迟与漏检,做法是在每段前后各拼接 5 到 10 秒的前后文,若与相邻片段重叠则缩短,模拟连续流,延迟定义为开始生成时刻相对原始片段结束时间的差,漏检率定义为除结束符外什么都没生成的片段比例。下面看掩码图,它是训练并行与因果的直接证据。

看图路径: 1. 先确认三幅小图的横轴为输入键纵轴为输出查询;2. 观察左图下三角绿色因果掩码的形状;3. 对比中图阶梯状块交叉掩码允许看到过去块的范围;4. 再看右图对角小绿块表示解码器只看本块查询与已生成词

原论文 Figure 4:Attention masks for training the online Q-former.

论文图 4。原论文 Figure 4:“Attention masks for training the online Q-former. The green area allows attention between input (keys) and output (queries) while the gray area blocks the attention.”。

上图左中右分别是查询变换器自注意因果掩码、查询变换器交叉注意块掩码、解码器自注意块掩码,绿色允许注意,灰色阻断。横轴为输入键,纵轴为输出查询,可以看到中图阶梯允许看过去块,右图对角小块只允许看本块,这是流式不偷看未来的实现。

在线生成损失了多少精度,换来了多少提前?

要回答的核心问题是流式相对离线下降多少,以及不同对齐策略的延迟与漏检差异。比较的公平条件是同一特征、同一冻结解码器、同一无字幕输入,指标方向是蓝值与气象度量越高越好,延迟越负表示越提前,漏检率越低越好。下表整理了数据划分与模型配置等可核对条件,另一张主结果表整理了动作序列与描述质量、延迟与漏检。

表前需要明确,离线三行用于验证结构改动无损,在线三行用于比较对齐策略,最后一行既往工作因用了束搜索与可能不同的字幕条件,只能作参考而非同条件胜负。

划分视频数片段数平均时长秒特征维度
训练集1173874319.7音频 527 图像 768 视频 3806
验证集416311719.8查询数 16 隐层 768

表后解释,该表说明训练与验证规模相当且平均时长接近,验证集对半交叉验证可减少划分偏差。

特征维度与查询数决定了每块嵌入的信息瓶颈,188M 可训练参数全部集中在查询变换器,解码器冻结意味着在线延迟主要来自块等待与自回归步数,而非重训大模型。主结果表的比较问题是,在保持可部署贪心解码的前提下,哪种对齐能在精度下降可接受范围内实现更早更稳的输出。

模型配置动作 BLEU-2动作 METEOR描述 BLEU-2描述 METEOR延迟秒与漏检率
离线基线0.3570.2510.2210.154无延迟定义无漏检

表后解释,离线基线动作蓝值 0.357,流式损失选择为 0.328,相对下降约 8%,描述蓝值从 0.221 到 0.212,相对下降约 4%,原文报告所有指标相对下降不到 10%,表中数字支持该判断。延迟方面,末块训练只提前 0.78 秒,采样提前 2.12 秒,损失选择提前 2.92 秒且标准差从 2.72 降到 2.20,说明损失过滤让输出时机更早更稳。

代价是流式偶尔在无关画面提前开口或全程只输出结束符,导致漏检 4% 到 5%,这是精度下降的主要来源。未胜出项是采样法在动作气象度量上最低,说明随机提前若无损失把关会损害质量。需要指出,总体趋势不等于每段都提前,延迟标准差 2 秒以上表明不同片段波动大,不能把平均提前推广为每步都提前。

哪些对照证明改动本身没有损害离线能力?

论文做了两个关键消融来分离结构改动与在线改动的影响。第一个是交错但仍离线训练的对照,它把特征按 1 秒交错却仍用离线方式生成,动作蓝值 0.354 相对基线 0.357 几乎无差,说明交错拼接本身不损害性能。第二个是流式结构但强制在原始结束块生成的离线用法,动作蓝值 0.356 同样与基线持平,说明块掩码与左上下文查询在离线使用时没有丢失信息。这两个对照支持一个判断,流式在线的精度下降主要来自提前输出的时机选择,而非特征组织或掩码容量。

进一步比较 3 种在线对齐,末块、采样、损失选择的动作蓝值分别为 0.321、0.319、0.328,损失选择在四项质量指标上全部最好,且延迟最早、漏检最低、波动最小,支持损失差阈值能过滤不合理提前的解释。反证是即使最好的损失选择仍低于离线基线,说明在缺失精确帧词对齐时,提前必然伴随一定的误触发与漏检,无法靠掩码完全消除。

另一个细节是既往工作数字 0.370 高于本文基线 0.357,原文明确归因于对方用束搜索而本文用贪心,这提醒读者解码策略必须一致才能比较,束搜索的增益不能算作模型的在线收益。论文特有的第二类细节是字幕缺失的影响,既往用了字幕而本文为模拟在线去掉字幕,因此跨论文数字差异包含输入条件差异,不能解读为方法退步。

还有哪些边界没有测,结论不能推广到哪里?

首先是数据边界,实验只在 YouCook2 烹饪视频上进行,且只用验证集对半交叉验证,没有公开测试集结果,也没有真机执行成功率,因此文本相似度提升不等于抓取成功率提升。其次是输入边界,去掉字幕更接近在线,但也没有接入流式语音识别补字幕,真实厨房噪声下的音频鲁棒性未评测。第三是解码边界,全程用贪心解码,束搜索、采样解码或重排序的效果未知,延迟与漏检只在人工拼接 5 到 10 秒前后文的仿真流上测得,不是全天连续直播。

第四是资源边界,原文未报告训练耗时、显存占用、每块推理耗时与输出帧率,无法从参数量推定实际延迟,188M 只是可训练部分,总推理还包括 3 路编码器与 2,700,000,000 参数解码器。第五是对齐边界,最大提前 5 秒与阈值 0.002 是按预实验选取,换场景是否仍适用待验证,阈值附近的敏感性没有完整曲线。缺失证据不是技术错误,但相关性不是因果,例如延迟更早与漏检更低同时出现在损失选择上,不能直接断定早输出导致低漏检,更合理的解释是损失过滤同时改善了两者。

这些限制意味着何时值得尝试的回答是,当任务允许提前 1 到 3 秒输出且能容忍约一成文本质量波动与约 4% 漏检时,流式查询变换器值得尝试;当任务要求零漏检或必须精确到帧的对齐时,还需补真机与长流评测。

要复现先固定什么,再跑什么?

复现先固定数据与特征,再固定掩码与对齐,最后固定评测。数据方面,按训练 1173 视频 8743 片段、验证 416 视频 3117 片段切分,验证对半交叉验证,一半选轮次一半测试并平均,平均时长 19.7 与 19.8 秒用于检查切分是否正确。特征方面,对每 1 秒块分别抽取音频、图像、视频特征并投影拼接,维度 527、768、3806,查询数 16、隐层 768,查询变换器用基础语言模型权重初始化、交叉注意力随机初始化,解码器用 2,700,000,000 参数开放模型并冻结。

掩码方面,按三图实现因果与块掩码,离线对照先验证交错与流式结构在强制末块生成时与基线持平,再切到在线。 对齐方面,先实现最多提前 5 秒的随机采样,再实现阈值 0.002 的损失选择,比较采样与末块损失差,长度归一化后小于阈值才用采样位置反传。评测方面,文本用双词蓝值与气象度量,流式加测相对原始结束时间的延迟与漏检率,仿真流拼接 5 到 10 秒前后文并处理重叠。

关于可用性,原文证据清单中没有完成超链接状态验证的资源,因此不得声称代码、模型或数据已公开,复现应按上述超参数与信息条件从零搭建,并明确记录优化器、学习率与轮次等原文未报告的缺项。还需补的验证是换阈值与最大提前的敏感性、束搜索下的延迟变化、以及在噪声音频与长连续流上的稳定性。

一句话之后,还应带走什么判断?

回到中心矛盾,机器人要边看边说,又不能因早说而说错。本文的选择是用块级查询嵌入加结束符机制让模型自定说话时机,用 3 组掩码保证训练并行且不偷看未来,用损失过滤的采样对齐在提前与准确之间取舍。最强证据是损失选择的在线模型在提前 2.92 秒、漏检 4.40% 的条件下,四项质量指标相对离线下降不到 10%,且输出时机波动最小。主要代价是提前必然带来误触发与漏检,以及贪心解码与无字幕条件下的绝对分数低于既往束搜索数字。

学习依赖可以复述为,输入块经 3 路编码与交错拼接得到块序列,块序列经左上下文查询变换器得到定长嵌入,嵌入经冻结解码器按块决定结束或展开,训练用块掩码并行,对齐用采样加损失阈值,评测同时看文本相似度、延迟与漏检。若后续要改进,优先补精确对齐估计或流式字幕,而不是增大查询数,因为当前瓶颈在时机而非容量。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总