英文题目:ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
会议身份:
conference:acl:2026:conference-paper-id:2026.findings-acl.1153
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#多模态学习 #实时处理 #流式处理 #音视频 #音视频交互
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告
👥 作者与机构
- Tian Xueyun:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Bingbing Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Heng Dong:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanzhuo Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Huawei Shen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
流式音视频理解输入为连续到达的音频流与视频流,需同时输出被动问答回答与主动预警/旁白文本,难点在于音频稠密连续而视频稀疏离散的粒度失配,以及只能依据历史前缀实时决定是否发声。ROMA先将每1秒音频与同窗2 fps视频帧打包为同步多模态单元,并用分块时间对齐旋转位置编码延续全局时间线,再送入Omni骨干逐单元累积上下文。接着轻量发声头在每个单元输出二分类触发概率以决定是否发声,触发后才调用语言模型头生成内容,从而将时机判断与内容生成解耦并避免用静默词隐式决策的生成偏置。与仅支持被动应答或缺乏自主监控的流式基线相比,该显式触发机制保留了音频同步并支持事件预警与实时旁白,具有实际意义。在QVHighlights基准下,ROMA的mAP指标为53.7,高于MMDuet的31.3。该结论适用边界受限于2 fps采样、1秒决策粒度、32K上下文与短中视频,尚未验证数小时长流、音画异步与信号退化下的稳定性。训练成本为冻结编码器分两阶段在32张H20上完成,单单元编码延迟约0.37秒、首词延迟约0.48秒,属分块近实时而非严格双工实时。
🔗 开源与复现资源
- 模型相关资源:https://huggingface.co/EurekaTian/ROMA — 暂时无法访问
- 演示资源:https://eureka-maggie.github.io/ROMA_show/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要解决的矛盾是什么?
本文的输入是连续到达的通用音频加视频流,以及开头的文字或语音指令。目标是在流展开过程中同时做好两件事。一是被动问答,即查询到达后依据已看到的历史作答。二是主动监测,即按指令持续观察,只在条件满足时自主开口。
必须保留的关键信息是两种交互都只能用流前缀,不能偷看未来。音频是稠密连续信号,视频是稀疏离散帧,天然同步但粒度不同。输出是触发时刻与回应文本。举例来说,指令为当鸟从树后出现时提醒,模型应先沉默消费输入,再在出现区间内提醒。
主动交互 × 被动问答: 主动交互指模型先收到持续监测指令,再只在条件满足时自主决定时机与内容,如事件提醒与实时解说;被动问答指查询到达后模型依据已累积的历史上下文作答。搭配原因是真实流式助手两种范式必须共存,组合意义是统一评估与统一模型必须同时处理触发时刻与回答质量。
为理解主动与被动为何难统一,可以先看任务示意如何区分时刻精度与历史定位。主动部分要求时刻精度,解说部分要求增量连贯,被动部分要求历史回溯,三者对时间的用法各不相同。
看图路径: 1. 先看上方绿色事件提醒块中鸟出现前后提醒标记的分布位置;2. 再看中部紫色实时解说块中镜头操作变化处文本出现的时间点;3. 对比下方橙色被动问答块中查询波形与回答文本的先后顺序
论文图 1。原论文 Figure 1:“ROMA’s streaming understanding capabil- ities. It supports proactive tasks, including event alerts and narration, alongside reactive question answering.”。
该图把 3 类行为放在同一时间轴上展示。上方事件提醒在目标出现后连续打出提醒标记,中部实时解说在镜头操作变化处生成简短描述。下方被动问答在查询出现后回溯定位做菜步骤。可见主动输出依赖事件边界,被动输出依赖查询到达,这是后文用独立说话头解耦时机的直观依据。
已有路线在输入、目标与运行阶段上有何不同?
按同输入、同目标、同监督与同运行阶段对照,可把相关工作分成 3 类。第一类是语音为中心的流式模型,输入多为音频加文本,目标是低延迟语音生成,不处理视频感知。因此与本文的音视频联合输入不同。
第二类是视频流式理解,输入为文本加视频,常用记忆机制或键值缓存压缩保持长程上下文。运行阶段多为问答注入式,即在预定时间提问再用此前上下文作答,不做自主触发决策。第 3 类是少数主动视频大模型,支持提醒或解说,但多为纯视频,忽略同步音频。
本文附表梳理显示,只有本文同时支持文本加视觉加音频输入与提醒、解说、问答 3 种能力。教学上要注意类别差异不等于同条件胜负。记忆与缓存类解决长上下文效率,主动类解决何时说话,二者指标与协议不同,不能直接比大小。
为什么粒度与时机是两个真挑战?
第一个挑战是跨模态对齐。音频每秒都有密集采样,视频每秒只有几帧。若直接拼接,模型难以知道某段声音对应哪几帧画面,融合时易错位。保持鲁棒的跨模态对应需要精确同步。
第二个挑战是流式决策。模型每到 1 秒就要根据前缀决定说还是沉默,且一旦开口还要继续生成,时机与内容相互牵制。若把是否说话也当成下一个词预测,生成偏置会让模型倾向于说或沉默,难以校准。
原文因此把问题形式化为按同步单元顺序消费前缀,并在每个单元步做二分类时机判断,生成只在触发后启动。这种定义把评估也分成主动的时刻与内容精度、被动的基于因果历史的理解精度,为后文统一评测提供依据。
ROMA 让一个样本走完输入到输出经历什么?
以 1 秒为步长跟踪一个样本更易理解全景。假设视频以每秒 2 帧采样,音频连续到达。系统先把同一秒内的视频帧特征与音频特征取出,用特殊标记包裹成一个多模态单元。再按时间顺序送入统一大模型主干,主干维护跨步的键值缓存,不断累积前缀上下文。
每处理完一个单元,轻量说话头根据主干隐状态输出一个概率。若超过阈值则激活语言模型头生成至多 25 个词,不足则继续沉默并读入下 1 秒。若回应超长,则在后续单元继续生成,用结束标记区分未说完与真正结束。推理时处理当前单元与采集下一单元流水并行,以逼近实时。
为建立上述流程的整体结构,需要先看模型架构图如何组织编码主干与双头。图中同时给出触发与沉默分支,是理解后文训练与推理的关键。
看图路径: 1. 沿底部时间轴看 t1 到 tn 加 2 加 m 的视频帧与音频流如何组成粉框单元;2. 看中间编码器到统一主干再到说话头与语言模型头的两条箭头走向;3. 对比 0.95 与 0.89 触发和 0.25 与 0.31 保持沉默的阈值判断分支
论文图 2。原论文 Figure 2:“Model Architecture. Streaming inputs are processed as aligned multimodal units.”。
该图自下而上显示了时间轴、粉框多模态单元、视频与音频编码器、统一主干,以及每个时刻并列的说话头与语言模型头。图中给出 0.95 与 0.89 超过阈值触发叙述、0.25 与 0.31 低于阈值保持沉默的例子。说明时机判断独立于内容生成,且已生成文本会作为后续上下文回流,这是理解阈值与滑窗的依据。
对齐与说话判断具体怎么算?
对齐部分包含两层操作。第一层是单元封装,沿用基础模型的多模态输入格式,把 1 秒内的视频 token 与音频 token 放在视觉与音频起止符之间。这样使音频 grounding 在前面的视觉上下文中。第二层是分块时间位置编码,在时间对齐旋转位置编码基础上改为按块累加。
同一单元内多帧视觉经编码融合后共享恒定时间编号,音频保留 40 毫秒分辨率的细粒度时间编号。块边界处起止符共享基准编号,下一单元从上一单元最大编号延续,从而在增量到达时仍保持全局时间轴。
多模态单元 × 分块 TMRoPE: 多模态单元负责把每 1 秒内的视频帧与音频信号打包成按时间顺序输入的块,解决稠密音频与稀疏视频帧粒度不一致的切分问题;分块 TMRoPE 负责给块内视觉与音频 token 分配可累加的 3 维时间位置,使跨块仍保持同一时间轴。二者搭配的原因是只有先切成同步块,才能对块内做细粒度时间编号,组合后新增的作用是流展开时增量编码仍保持音画对应。
为看清位置编号如何在相邻单元之间延续并保持音画对应,可以仔细观察分块编码示意图中的编号标注与块间连接方式。
看图路径: 1. 先看左右两个粉框内视觉分块与音频波形的左右排列关系;2. 再看视觉 token 共享恒定编号而音频保留细粒度编号的标注差异;3. 最后看块间从最大编号延续实现时间轴无缝拼接的连接线
论文图 3。原论文 Figure 3:“Chunked TMRoPE. Seamlessly extends the global timeline to streaming inputs by assigning cumu- lative positional IDs across discrete units.”。
该图展示相邻两块的多模态单元 token 与累加位置编号,视觉部分以块为单位推进,音频部分以更细步长推进。块间通过延续最大编号实现无缝拼接,起止符对齐保证边界一致。这解释了为何模型在只看到前缀时仍能保持音画对应,并为增量编码提供时间基础。
说话头部分用两层多层感知机实现,并行于语言模型头。输入不是仅用最后一层,而是最后 4 层隐状态的可学习加权组合,依据是高层编码更多语义。每个单元输出一个概率,超过阈值触发,配合滑窗可抑制瞬时波动。
消融显示只用最后一层会明显降低定位与动态触发,而对给定时间戳的理解影响较小。这支持多层聚合对时机更重要的判断。
说话头 × 语言模型头: 说话头负责在每个多模态单元后输出是否需要回应的二分类概率,只管时机;语言模型头负责在被触发后生成回应文本,只管内容。搭配理由是若用同一生成头同时决定说不说和说什么,生成偏置会干扰时机判断,解耦后新增的作用是可以用阈值与滑窗独立调节触发灵敏度而不改写生成能力。
语言建模目标的符号与输入如下,目标是对流式前缀下的回答序列做自回归似然优化。
\[LLM = −E(X,Y )∼DQA\]该式中 X 为按单元重排的流式输入,Y 为回答序列,参数包含主干与生成相关部分,编码器在 2 阶段均冻结。理解该式后才能明白第一阶段只优化生成、第二阶段才联合优化时机的分工。
数据如何构造,两阶段如何训练与推理?
数据集共 676731 条,分为主动提醒 27000 余条、主动解说 109000 余条、被动问答 540000 余条。提醒数据由 DiDeMo、OOPS 与 Charades-STA 改写为当某事件发生时提醒我,并重标注精确起止。每秒落在真值窗口内标为正触发。
解说数据由 MM-DuetIT、COIN、YouCook2 与 ActivityNet 构造,做法是切除无标注空隙后拼接成稠密流,只在分段切换处生成简短描述,避免密集监督。问答数据聚合 InternVid、CogStream 等多源,覆盖过去事件、时序与未来推理,并把文字查询经语音合成叠加到原音频上,以训练音频指令跟随。
为理解数据配比与标签含义,需要先看数据集总览中数量条与正负标签示例。该图是理解 2 阶段使用不同损失的直接来源。
看图路径: 1. 先看顶部总数 676731 与三段数量条的长度比例关系;2. 再看左侧主动数据的提醒与解说样例中标签 1 与 0 的分布;3. 对比右侧被动数据的回溯前向预测与模态对齐三类问法
论文图 4。原论文 Figure 4:“Overview of ROMA’s Streaming Dataset. Statistics, task taxonomy, and sample formats.”。
该图顶部显示 3 类数量条,左侧给出提醒与解说的视频块与说话头标签示例,右侧给出回溯、前向预测与模态对齐 3 类问法。可见主动数据同时提供触发标签与文本,问答数据主要提供文本。主动标签为 1 表示该秒应触发,为 0 表示应沉默,这种标注直接对应后文二分类监督。
第一阶段模板对齐 × 第二阶段时间感知决策: 第一阶段模板对齐负责用被动问答数据让主干适应按单元顺序输入的流式格式,保留音视频理解;第二阶段时间感知决策负责激活说话头学习何时回应,并混入少量问答数据维持语言能力。搭配原因是直接联合学格式与时机易受触发稀疏干扰,分阶段后新增的作用是先稳定表示再校准触发概率。
训练分 2 阶段且编码器冻结。第一阶段用问答数据适应流式单元格式,只优化生成损失。第二阶段激活说话头学习时机,用加权二元交叉熵处理触发稀疏,正权重由统计得到,实验取 3。并混入少量问答数据以维持语言能力,总目标为时机损失加权生成损失。
时机损失对每个单元的预测概率与 0 或 1 标签计算加权交叉熵,目标是校准何时说。
\[Ltime = −EX∼Dstream\]总目标在时机损失上加一项只在混入问答样本上计算的生成损失,系数平衡二者。
\[Ltotal = Ltime + λ · LLM\]推理严格沿用训练配置,视频 2 帧每秒,单帧像素不超过 65536,维护持久键值缓存,每步只编码当前单元。编码一单元平均约 0.37 秒,研究代码下无回应路径每单元约 0.42 秒,有回应到首词约 0.48 秒。原文强调此处实时指分块流式低延迟,而非保证视频帧率的双工延迟。
用什么条件测主动与被动,指标方向是什么?
评估分为主动与被动。主动含事件提醒与实时解说。静态定位沿用 QVHighlights 与 Charades-STA,模型逐单元输出概率。前者按归一化概率排序报平均精度与首位命中,后者阈值化取段报重叠 0.5 与 0.7 召回,越高越好。
动态流式决策要求严格因果,只能用当前及此前单元,覆盖 OmniMMI、StreamingBench、OVO-Bench 的单次与重复提醒。用滑窗平滑,成功判据为触发时刻落入真值区间或在问询后等待到证据线索后才答。解说用拼接的 YouCook2 与 OVO-Bench 子任务,在分段切换处触发并把输出追加为上下文。
解说报时间 F1、语义 BERT 分数与 GPT-4o 打分的连贯、对齐、简洁均值,越高越好。
事件驱动提醒 × 实时解说: 事件驱动提醒负责检测瞬态目标事件并立即通知,评价触发时刻是否落入真值区间;实时解说负责在事件演变中增量总结且不能用未来信息,评价分段边界处的生成连贯与对齐。二者搭配原因是同属主动交互但一个重时刻精度、一个重持续内容,组合后可检验说话头在单次与多次触发下的稳定性。
被动问答用 OVO-Bench 与 StreamingBench 的文本查询保证与纯视频基线公平,报准确率。再用 Video-MME 无字幕与 EgoSchema 的合成语音查询测全模态,开放回答由 GPT-4o 按是否同义或可推断判 0 或 1。基线分 3 组,主动只比具流式能力的模型,被动加长视频模型,全模态加开源全模态模型。
超参数经验证集确定,各任务窗口与阈值不同,例如 QVHighlights 窗口 5,Charades 窗口 3 阈值 0.45,解说阈值约 0.97。复现时须按任务分别设置,不能用同一阈值套用全部任务。
延迟与资源按什么协议测量?
成本分训练与推理分别讨论。训练用 LLaMA-Factory,序列长 32K,32 张 H20,全局批量 512。第一阶段 3000 步,第二阶段同硬件批量再 500 步,编码器冻结。主动样本按多轮对话组织,以处理单流多次触发。
推理在单张 H20 上测 1000 样本均值,含缓冲 1 秒、预处理、增量编码、说话头判定与生成首词时间。总体趋势是计算小于缓冲窗口可维持吞吐,但不等同于每步都低延迟。首词时间含当前块编码开销,现有代码仍有可优化余量。
输出帧率与实际延迟需区分。2 帧采样与 65K 像素上限控制编码量,每单元生成上限 25 词控制延迟,超长跨单元续写会增加尾延迟。原文未承诺在更弱设备或更长上下文下同样实时,部署时需重测。
主结果在什么条件下支持何种判断?
先看全模态被动问答的公平条件。均为语音查询加音视频输入,Video-MME 无字幕与 EgoSchema 开放回答由同一规则评分,方向为越高越好。问题是模型能否在保留音频的流式输入下同时定位与推理。下表保留可运行的开源全模态基线与本文方法。
| Overall, ROMA | strengthens temporal | awareness |
|---|---|---|
| Method | Video-MME | EgoSchema |
| Qwen2.5-Omni | 20.50 | 58.40 |
| VITA-1.5 | 28.56 | 45.40 |
| MiniCPM-o | 19.37 | 55.20 |
| Ours | 33.30 | 55.40 |
表中本文在 Video-MME 得 33.30,超过所列 3 个基线,在 EgoSchema 得 55.40,低于 Qwen2.5-Omni 但高于另两者。支持的判断是联合音视频建模在无字幕长视频上更稳,但第一视角长程推理仍有边界,不能推广为全面超越。
再看主动的静态与动态结果。静态上原文报告在 QVHighlights 达 53.7 平均精度,在 Charades 达 44.3 与 19.9。解说在 YouCook2 的 F1 为 35.21,在 OVO 子任务为 14.54,均高于所比流式视频基线。为避免逐行复述,整理如下对照表聚焦可复述的数字与条件。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| QVHighlights 静态排序 | 平均精度 | 未报告 | 53.7 | MMDuet 等流式视频基线 |
| Charades 静态定位 | 重叠 0.5 与 0.7 召回 | 未报告 | 44.3 与 19.9 | 同上 |
| YouCook2 在线解说 | 时间 F1 | 18.82 与 17.81 | 35.21 | VideoLLM-Online 与 MMDuet |
| OVO 解说子任务 | 时间 F1 | 10.24 与 9.02 | 14.54 | 同上 |
该表的收益是触发精度与边界对齐同时提升,代价是解说 BERT 分数多在 0.83 附近未拉开。说明内容语义优势小于时机优势,且 GPT 均值依赖模型打分,不等同于人评。
时长分箱与阈值敏感性还有哪些细节?
表中 0 至 200 秒箱 900 条得 47.00,长段多在 20 余波动,并非单调下降。支持有限上下文下未完全崩溃,但长依赖仍受限。另一细节是 QVHighlights 窗口从 3 到 7 时平均精度稳定,首位命中波动更大。解说阈值在 0.965 至 0.985 间 F1 变化仅约 1,支持可用固定值而不必精调。
拿掉分阶段、说话头与多层聚合会发生什么?
反证围绕 3 组展开。第一组比较单阶段混合训练与 2 阶段课程,前者在动态决策与解说上一致下降,尤其重复提醒与解说 F1 掉得最多。这支持先适应格式再学时机的必要性。第二组把说话头换成沉默词的下词预测,发现动态提醒与解说大幅下降,而给定时间戳的被动理解影响小。
第 3 组把说话头输入从最后 4 层改为仅最后一层,静态定位与动态触发下降,被动理解基本不变。这支持多层聚合提供更稳的触发信号。正权重扫描显示主动任务对权重敏感,被动与全模态不敏感,取 3 最均衡。过大或过小会偏向漏报或误报。
触发误差按早、晚、漏、重复统计,非互斥,重复可与早晚共存。下表问题是错误集中在何处,条件为动态主动协议,指标为准确率与 4 类错误发生率。
| [0, 200) | 900 | 47.00 | 8.15 | 127.87 |
|---|---|---|---|---|
| [200, 400) | 306 | 33.66 | 248.52 | 395.40 |
| [400, 600) | 297 | 27.27 | 400.30 | 597.98 |
| [600, 800) | 225 | 29.33 | 601.45 | 785.08 |
| [800, 1000) | 60 | 21.67 | 804.68 | 891.45 |
| [1000, 1200) | 12 | 33.33 | 1043.08 | 1090.00 |
| [1600, 1800) | 12 | 25.00 | 1711.23 | 1799.00 |
表中 PA 准确 37.50 但漏报 39.0 最高,说明单事件弱证据易错过。PO 准确 53.60 且漏报仅 4.8,但早触发 31.2,说明证据积累好但偏急。CRR 晚触发为 0 而早触发 37.5,说明倾向等待线索。REC 漏 28.8 晚 24.6,说明重复边界仍难切分。复现时应优先调窗口与阈值。
为完整呈现延迟与触发误差的原始分布,还需展示另一张原文宽表的选择结果。该表用于核对多任务准确率与误差共存关系。
| PA | 0.50 | 22.00 | 37.50 | 18.0 | 7.5 | 39.0 | 19.0 |
|---|---|---|---|---|---|---|---|
| PO | 4.13 | 29.44 | 53.60 | 31.2 | 10.4 | 4.8 | 17.2 |
| CRR | 27.08 | 16.67 | 35.42 | 37.5 | 0.0 | 27.1 | 4.2 |
| REC | 14.29 | 12.77 | 33.81 | 12.8 | 24.6 | 28.8 | 5.5 |
该表与上一张形成互补,一张聚焦时长分箱的准确率变化,一张聚焦触发误差的类型分布。共同的代价是 PA 漏报与 REC 晚触发仍高,未胜出项明确,不能只看平均准确率就认为触发已解决。
哪些没有测,哪些不能承诺?
原文明确的三项局限需如实保留。一是信号退化与音画异步仍会干扰,模型为流式交互优化但未解决失真鲁棒性。二是极长跨小时依赖受有限上下文与记忆约束,分箱结果也显示长段准确率偏低。三是严格资源下效率与质量权衡仍需未来工作,现有延迟基于 H20 研究代码,不代表生产服务。
未测量方面,误判率的人工代价、隐私与监控滥用风险未量化。伦理声明指出仅供研究、关键应用需人工监督,主动监测可能被误用于未经授权监视。相关性不等于因果,音频保留与解说提升相关,但不能断言音频必然导致每组提升。
总体趋势不等于每步成立,阈值固定在多数任务稳,不代表所有事件类型最优。把曲线向下直接当变差,或把平均精度等同于问答准确率,或把演示可用当成权重可下载,都属于误读,需回到数据集、指标与聚合对象核对。
要复现应先做什么,需要补哪项验证?
何时值得尝试。当任务需要同一模型同时做语音查询理解与自主提醒解说,且能接受 1 秒决策粒度时,可参考本路线。若只需离线问答或纯音频对话,则不必引入说话头。
复现先做 4 步。第一步按 1 秒单元重排数据,视频 2 帧每秒、单帧像素上限 65536,音频查询经语音合成对齐到单元,保持与推理一致。第二步冻结编码器,先用问答数据做流式格式适应,再激活说话头联合训练。正权重从 3 起调,混入少量问答维持语言。
第三步按任务设窗口与阈值,提醒类窗口 2 至 5、阈值 0.2 至 0.7,解说阈值约 0.97,并用滑窗抑制抖动。第 4 步用因果协议评估,动态任务只许用前缀,成功以触发落入区间为准。资源状态方面,演示页当前可用,模型链接本次未能确认可达。
因此应以论文描述与演示为准,不可写权重已公开。还需补的验证是真实噪声与异步下的触发精度、更长流的记忆保持,以及在目标硬件上的端到端延迟与人评解说质量。
如何一句话记住方法与证据边界?
记住一条主线。把不同粒度的音视频先切成同步的 1 秒单元,再用可累加的位置编码保持时间轴,最后用独立于生成的说话头决定何时开口。证据边界是主动时刻精度提升最大,被动与语义提升较小,长流与弱信号仍是短板。
初学者复述时应先说输入只能用前缀,再说单元、位置、双头的分工,最后说 2 阶段先适应格式再学时机。并能指出 PA 漏报高、PO 偏早、REC 边界难的反例。若把演示可用当成权重可下载,或把自动指标当成人评,都需回到原文核对。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



