📄 PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
#音视频问答 #基准测试 #多模态模型 #流式处理 #数据集
7.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5
✅ 7.3/10 | 前50% | #音视频问答 | #多模态模型 | #基准测试 #流式处理 | arxiv
👥 作者与机构
- 第一作者:Xudong Lu(香港中文大学 MMLab)
- 通讯作者:Rui Liu(华为研究,liu.rui2@huawei.com)、Hongsheng Li(香港中文大学 MMLab,hsli@ee.cuhk.edu.hk)
- 作者列表:Xudong Lu(香港中文大学 MMLab)、Huankang Guan(华为研究)、Yang Bo(华为研究)、Jinpeng Chen(华为研究)、Xintong Guo(华为研究)、Shuhan Li(华为研究)、Fang Liu(香港城市大学)、Peiwen Sun(香港中文大学 MMLab)、Xueying Li(上海交通大学)、Wei Zhang(上海交通大学)、Xue Yang(上海交通大学)、Rui Liu(华为研究)、Hongsheng Li(香港中文大学 MMLab)
💡 毒舌点评
这篇论文发现了一个真实且普遍的“模型太猴急”问题,用精心设计的流式基准把主流 MLLM 都打回了原形,Forward 任务的惨淡分数极具说服力。但作为 benchmark 论文,它过度依赖 Gemini 3 Pro 做数据生成和 Qwen3-235B 做评估,一旦这两个闭源/强模型更新,基准的稳定性和公平性就很微妙;而且在多模态流式领域,作者把“音频”当成了加分项来宣传,结果消融实验却显示开音频反而让 Forward 性能更差,这个自曝其短的结论让人既敬佩又哭笑不得。
📌 核心摘要
论文旨在解决当前多模态大模型在真实移动端流式场景中缺乏有效评估基准的问题,特别是模型“何时回答”而非“回答什么”的能力评估。
提出了 PhoStream 基准,包含 578 个视频、5,572 个开放式 QA 对,涵盖 YouTube Vlog、Phone Tutorial、Phone Record、EgoBlind 四种移动场景,将问答分为 Backward、Instant、Forward 三类,重点考察模型的时间推理能力。该基准平均视频时长 13.3 分钟,远超现有流式基准。
与现有流式基准相比,PhoStream 首次统一屏幕内和屏幕外移动场景,使用开放式 QA 替代多选,引入严格的时间截断机制和在线推理管道来真实模拟流式助手行为。
主要实验结果显示,当前最强模型存在严重的时间不对称性:Gemini 3 Pro 在 Instant 和 Backward 任务上得分超过 80,但 Forward 任务仅 16.40;Qwen3-Omni 的 Forward 得分甚至只有 1.26,早期响应率高达 97.89%。Doubao-Seed-1.6 以 44.26 的 Forward 得分成为该任务最优模型。
| 模型 | Param | Instant | Backward | Forward | Overall |
|---|---|---|---|---|---|
| Gemini 3 Pro | - | 80.83 | 82.19 | 16.40 | 48.70 |
| Doubao-Seed-1.6 | - | 71.28 | 62.94 | 44.26 | 56.01 |
| Doubao-Seed-1.8 | - | 80.45 | 77.31 | 33.38 | 56.15 |
| Qwen3-Omni-30B-A3B | 30B | 77.18 | 77.24 | 1.26 | 39.02 |
| Qwen3-VL-8B | 8B | 75.22 | 71.50 | 7.18 | 40.25 |
| Qwen3-VL-30B-A3B | 30B | 73.38 | 69.46 | 5.25 | 38.33 |
| Qwen2.5-Omni-7B | 7B | 67.71 | 65.20 | 1.81 | 34.06 |
| Dispider | 7B | 44.24 | 42.90 | 3.53 | 23.50 |
| VideoLLM-online-8B | 8B | 24.88 | 24.72 | 0.00 | 12.34 |
| MMDuet2 | 3B | 8.76 | 8.30 | 1.39 | 4.96 |
- 实际意义在于为移动 AI 助手(如豆包、Gemini)的真实流式交互能力提供了统一评估平台,揭示了当前模型“忍不住抢答”的普遍缺陷,指明了流式训练中需要关注的关键行为目标——响应时机的决策能力。
- 主要局限包括:评估依赖 LLM-as-a-Judge,可能引入 judge 模型的自身偏见;数据生成管道依赖 Gemini 3 Pro,标注质量受限于单一生成模型;Forward 任务的设计本质上惩罚了所有“提前回答”,但某些场景下提前预测可能是合理的助手行为。
🔗 开源详情
- 代码:https://github.com/Lucky-Lance/PhoStream (承诺公开,当前未发布)
- 模型权重:论文中未提及(本工作为基准数据集,不涉及模型权重发布)
- 数据集:PhoStream 数据集随代码一同在 https://github.com/Lucky-Lance/PhoStream 承诺公开,包含 5,572 条开放式问答对及对应视频元数据
- Demo:论文中未提及
- 复现材料:代码仓库承诺提供自动生成流水线、在线推理流水线、LLM-as-a-Judge 评估脚本等复现所需材料,具体使用方式见仓库说明
- 论文中引用的开源项目:
- Qwen2.5-Omni (7B) – https://github.com/QwenLM/Qwen2.5-Omni
- Qwen3-VL (8B, 30B-A3B) – https://github.com/QwenLM/Qwen3-VL
- Qwen3-Omni (30B-A3B) – https://github.com/QwenLM/Qwen3-Omni
- Dispider – https://github.com/MMDUET/Dispider
- VideoLLM-online – https://github.com/showlab/VideoLLM-online
- MMDuet2 – https://github.com/MMDUET/MMDuet2
- Qwen3-235B-A22B (作为评判模型) – https://github.com/QwenLM/Qwen3
- MP4Box (GPAC) – https://github.com/gpac/gpac
🏗️ 方法概述和架构
PhoStream 是一个以 基准构建管道 + 在线推理评估协议 为核心的流式评测体系,而非单一的模型架构。其方法分为两大阶段:
第一阶段:自动化生成管道(Automated Generative Pipeline)
视频预处理:下载原始高帧率视频后,使用 NVIDIA NVENC 重新编码为 HEVC(H.265)MP4 格式,以稳定帧时序并修复常见损坏问题。随后将视频降采样至 2 FPS,作为所有后续步骤的规范流式输入,这一帧率高于 Gemini 默认的 1 FPS,以减少快速动作的信息丢失。
视频分割:使用 MP4Box 将每个 2 FPS 视频分割为小于 30MB 的片段,以适配并行处理的存储和传输约束。
场景总结与脚本生成:针对每个视频片段,调用 Gemini 3 Pro 生成场景摘要和粗粒度的场景步骤说明脚本。
候选 QA 生成:基于生成的脚本和对应视频片段,使用预设的提示模板(包含问题示例,覆盖UI 导航、动作识别、音视频整合、细粒度视觉感知等类别)生成候选 QA 对,每个 QA 对包含问题、答案、任务类型(Backward / Instant / Forward)和相关时间戳。任务类型中,Backward 问题使用过去上下文(包括回顾特定早期事件的回顾性问题,和整合从视频开始到提问时刻更长跨度的综合性问题),Instant 问题聚焦于当前 1-2 秒窗口,Forward 问题在所需证据出现之前提出。
自动化 QA 验证:这是流水线的核心质量关卡。自动检查器对每个 QA 进行二次验证,通过仅提供截断时间戳之前的视频内容和对话历史给 Gemini 3 Pro,重新判断答案的成立性。对于 Backward/Instant 问题,截断点为提问时间戳(Timestamp Question);对于 Forward 问题,截断点为最早可回答时间戳(Timestamp Proactive)。检查器接受仍然正确的 QA、修正仍可成立的 QA,丢弃违反时间约束或无法被视频证据支撑的 QA,从而确保无未来信息泄露。最终仅保留通过验证的 QA,并将其映射回源视频片段。
第二阶段:在线推理管道与 LLM-as-a-Judge 评估
在线推理管道:模拟真实移动使用场景,模型以每 1 秒为间隔接收视频和音频流。模型仅能访问最近 60 秒的滑动窗口视频帧,以降低内存开销,但完整的文本对话历史始终可用。每个问题仅在提问时间戳向模型发送一次。此后模型持续监控流式输入,在每个更新步决定输出严格指定的
`Silent`以保持静默,或输出回答。这种设计统一处理 Backward(应立刻答)、Instant(应立刻答)和 Forward(应等待至证据出现再答)三类问题,避免了现有基准中重复查询的低效协议。响应窗口判定:Backward/Instant 问题的有效响应必须精确位于提问时间戳;Forward 问题的有效响应窗口为最早可回答时间戳起 2 秒内。任何在有效窗口之前的非静默/非占位符输出均被标记为 Early Response(ER),得分为 0。窗口内无任何有效输出则标记为 No Response(NR),得分也为 0。占位符响应(如"收到,我会留意的"等)被过滤为非信息性输出,不影响 ER/NR 判定。仅窗口内的有效响应进入 LLM 评判。
LLM-as-a-Judge 评分:使用 Qwen3-235B-A22B-Instruct 作为评判模型,依据固定的评分准则对有效响应打分。准则强调因果推理的正确性、事实支撑和与问题的相关性,而非与参考答案的字面重叠。得分 0-5 分(后乘以 20 转换为 0-100 标度),5 分为完全准确完整的解释,4 分为核心因果逻辑存在但省略次要细节,3 分为部分相关但错失部分核心因果链,2 分为推测性且缺乏扎实依据,1 分为事实错误,0 分为未尝试回答或完全离题。
关键设计动机:整个方法体系的设计核心在于对“流式时间约束”的严格执守,这在之前的多选题流式基准或短时离线基准中是缺失或软化的,PhoStream 将“响应时机的正确性”提升为与“回答内容的正确性”同等重要的一级评估目标。
💡 核心创新点
- 首次统一屏幕内与屏幕外移动场景的流式基准:此前基准如 StreamingBench、OVO-Bench 主要覆盖通用视频,OmniMMI 和 ProactiveVideoQA 各有所偏,PhoStream 同时纳入 Phone Tutorial/Record(屏幕内)和 YouTube Vlog/EgoBlind(屏幕外),弥补了移动助手评测的场景覆盖空白。此外,平均视频时长 13.3 分钟、平均每视频 9.6 个问题,是现有流式基准中视频密度和长度最高的。
- 严格的三类时间推理任务定义:将流式问答形式化为 Backward、Instant、Forward 三者的统一协议,并通过时间戳截断机制强制执行“无未来信息泄露”约束。尤其是 Forward 任务的占比约 50%,突出了主动等待能力这一被忽视的评测维度。Backward 问题还细分为回顾性和综合性两类,增加了任务多样性。
- 自动化生成+多层验证的基准构建管道:提出了“Gemini 3 Pro 生成 → 时间截断自检 → 10 名人类专家双轮验证”的规模化和质量控制流程。起始 523 个源视频,分割为 589 个片段,生成 6,042 个候选 QA,自动检查器移除 218 个,人类两轮审核后最终保留 578 个视频和 5,572 个 QA。在降低人工标注成本的同时保证了时间戳的准确性和安全性。
- 揭示“早期响应偏见”作为流式 MLLM 的核心失效模式:通过严密的在线推理协议和 Early Response/No Response 指标分解,首次量化并证实了当前强模型普遍存在“宁可猜错也不等待”的倾向。例如,更强的 Instant/Backward 能力往往与更高的 Forward ER 率正相关(Qwen3-Omni 在 Instant/Backward 上得分 77+,但 Forward ER 率高达 97.89%),指明了流式训练需要优化的新目标——响应时机的决策能力。
📊 实验结果
主要实验在 PhoStream 全量 5,572 个 QA 上进行,以 LLM-as-a-Judge 评分(0-100 标度)为主要指标,并辅以 Forward 任务上的 Early Response (ER)、No Response (NR)、Partly Correct (PC) 三类行为分析。共有三类基线:商用 MLLM(Gemini 3 Pro、Doubao-Seed-1.6/1.8)、开源 MLLM(Qwen2.5-Omni-7B、Qwen3-VL-8B/30B-A3B、Qwen3-Omni-30B-A3B)、开源流式 MLLM(Dispider、VideoLLM-online-8B、MMDuet2)。
主结果表(已在上方核心摘要中呈现):关键发现是 Forward 任务得分远低于 Instant 和 Backward,且 ER 率与 Backward/Instant 能力呈正相关趋势。流式专用模型(如 VideoLLM-online)倾向于输出连续描述性评论,导致 Forward 场景下 ER 率接近 100%。 [图4]
场景细粒度分析:论文在附录中给出了按四个场景(YouTube Vlog、Phone Tutorial、Phone Record、EgoBlind)拆分的详细结果,所有模型的一致性趋势是 Forward 得分在所有场景均显著低于 Instant 和 Backward。
能力类别分析:论文进一步按 10 个能力类别(Action & Activity、Audio-Visual、Entity & Knowledge、Fine-grained Visual、Physical & Causal、Scene & Context、Social & Emotional、Sequential & Procedural、UI & Digital Interface、Visual Text Understanding)拆分结果。Doubao-Seed-1.6 在 UI & Digital Interface 的 Forward 上得分 51.89,在 Visual Text 的 Forward 上得分 59.28,展现了最强的 Forward 能力。
音频消融实验:在 Gemini 3 Pro 和 Qwen3-Omni 上移除音频输入后的结果显示,音频显著提升了 Instant(+3.37 / +3.08)和 Backward(+9.35 / +6.32)的得分,但轻微降低了 Forward 得分(-2.39 / -0.07),同时增加了 ER 率(+3.78 / +0.21 个百分点)。论文分析认为,音频线索可能先于决定性视觉证据出现,只提供部分语义信息,从而鼓励过早假设和提前响应。 [图6]
| 模型 | 音频 | Instant | Backward | Forward | ER(↓) | NR(↓) | PC(↑) | Overall |
|---|---|---|---|---|---|---|---|---|
| Gemini 3 Pro | ✓ | 80.83 | 82.19 | 16.40 | 79.12 | 0.11 | 20.77 | 48.70 |
| Gemini 3 Pro | × | 77.46 | 72.84 | 18.79 | 75.34 | 0.71 | 23.95 | 47.03 |
| Qwen3-Omni-30B | ✓ | 77.18 | 77.24 | 1.26 | 97.89 | 0.07 | 2.03 | 39.02 |
| Qwen3-Omni-30B | × | 74.10 | 70.92 | 1.33 | 97.68 | 0.14 | 2.18 | 36.87 |
人类评估验证:在 200 个采样视频(每个场景 50 个)上的人工评测结果与 LLM-Judge 的结论趋势高度一致。Doubao-Seed-1.6 获得最高的 Forward 分(47.86),Qwen3-Omni 的 Forward 分仅为 1.10,证实了时间决策能力是流式模型的核心瓶颈。人类评估还揭示了一些模型无响应(NR)的问题,如 Dispider 在人类评估中 NR 达 19.98%。
上下文窗口消融:仅对 Backward 问题,将 Gemini 3 Pro 的滑动窗口从 30s 增至 60s,得分从 79.8 提升至 82.2(+2.4),进一步增至 120s 仅微升至 83.1(+0.9),说明中长窗口对回溯类问题有益但收益递减,中等长度已能捕获大部分有用信息。 [图7] [图8]
失败案例分析:论文在附录中提供了丰富的定性分析(图A.2-A.5),展示了 Forward 场景下过早响应、Forward 场景下无响应、需要音频信息时的理解失败、以及需要全视频聚合理解时的挑战。
🔬 细节详述
- 训练数据:不适用,本文为基准测试论文。
- 损失函数:不适用。
- 训练策略:无模型训练,仅在评估基线的在线推理管道中设定了 60s 滑动视频上下文窗口和 1 秒步进。
- 关键超参数:视频处理帧率设为 2 FPS;视频分割片大小 < 30MB;Forward 问题有效响应窗口为 2 秒;响应窗口判定中占位符响应列表见论文 Listing A.1(包括"收到,我会留意的"、“No problem, I’ll remind you then.“等常见回应)。
- 训练硬件:未说明评估所用具体硬件型号。
- 推理细节:在线推理中,模型在每个 1 秒步进接收最新帧,并决定输出
`Silent`或答案。为提高效率,对 Instant/Backward 问题仅在提问时间戳构建上下文并执行一次推理;对 Forward 问题,在提问时间戳和最早可回答时间戳各进行 3 次推理(+0, +1, +2 秒偏移),共 6 次推理。论文排除了 StreamingVLM,因为其不支持开放式问答。 - 正则化或稳定训练技巧:不适用。
- 数据集构建流水线详情:起始于 523 个唯一源视频,分割为 589 个片段,自动生成 6,042 个候选 QA。自动化检查器移除 218 个违规候选(包括答案与视频/音频证据不一致、幻觉细节、依赖截断时间戳后内容等),保留 5,824 个。10 名人类专家(具有多模态视频理解经验,至少硕士学历,时薪 20 美元)进行两轮审核:第一轮后保留 578 个视频和 5,611 个 QA;第二轮后最终确定 5,572 个 QA。过滤标准包括有害内容(色情、暴力、政治宣传、仇恨言论)、模糊不清、缺乏证据和存在多种合理解释等情况。QA 能力标签由 Qwen3-235B-A22B 自动标注为 10 个类别。
⚖️ 评分理由
创新性 (1.2/2):提出“Forward 任务”作为流式评估的核心维度和“早期响应偏见”这一具体而深刻的问题定义,是本文最亮眼的洞察,直面了当前流式系统“何时说”的关键挑战。与现有流式基准相比,统一屏幕内外场景及开放式 QA 的设计也有所贡献,但构建方法(自动生成+人工验证)的增量贡献大于范式级别的绝对创新。
技术严谨性 (1.2/1.5):时间截断机制、在线推理协议和三类任务的定义逻辑严密且执行度高,自动化生成管道的多层验证流程(Gemini 生成→自检→双轮人审)设计合理。但完全依赖 LLM-as-a-Judge 作为最终评判标准,虽有人类评估作为验证,但仅采样 200 个视频(占全量约 34.6% 的视频数,但 QA 占比未说明),未深入分析 judge 模型在特定能力类别上的潜在偏见。
实验充分性 (1.2/1.5):涵盖了三类(商用、开源、流式专用)共 10 个模型的全面对比,场景/能力细分和音频消融实验也提供了有价值的洞察。上下文窗口消融虽简单但针对性强。附录中提供了丰富的失败案例定性分析。不足之处在于未与离线方式运行 Transformer 的基线对比(如预编码全视频后“伪装”流式以判别信息增益),也未探索不同的滑动窗口策略或显式的时间决策机制对 Forward 性能的影响。
清晰度 (0.8/1):整体行文逻辑流畅,图和表清晰传达了基准构成与主要发现。但在线推理管道流程图(图 5)的视觉呈现稍显杂乱,时间轴、问题和响应状态的对应关系不够一目了然。
`Silent`等协议细节在正文中有解释,但预期响应格式对模型性能的约束影响未展开讨论。影响力 (0.8/1.5):该基准聚焦音视频流式交互,对语音/音乐/音频领域读者而言,直接相关性属中等偏上(音频是关键模态但并非绝对核心)。鉴于来自华为研究与 CUHK 的组合,以及这个特定问题对工业界移动助手(豆包等)直接而迫近的指导意义,工作具有较强的实际推动潜力。但因其主要贡献领域在“流式视频理解”,在纯音频研究中下游影响力有限。论文是 ICML 2026 接收论文,顶会成绩已证明其社区认可度。
开源 (0.5/1.5):论文中明确承诺“Code and datasets will be made publicly accessible at https://github.com/Lucky-Lance/PhoStream”,但提供的链接当前不可访问(404),因此实际为承诺开源但尚未发布状态,得 0.5 分。
可复现性 (0.3/0.5):自动生成管道的流程步骤描述足够详细,在线推理协议清晰。但评估基线模型时的具体 API 调用参数、生成配置(如温度)、硬件环境等关键细节缺失,这让他人精确复现实验结果存在障碍。
工程/实践价值 (1.3/1.5):构建了完整的工业级基准生成、验证和评估 pipeline,整合了视频预处理(降帧率、转码、分片)、基于 Gemini API 的规模化 QA 生成与自检闭环,以及模拟真实移动流媒体环境的在线推理和 LLM 评审协议,这套工程流程对需要在企业内部自建类似流式评测基准的团队有直接、显著的参考和重用价值。
🚨 局限与问题
论文明确承认的局限:
- 评估主要依赖 LLM-as-a-Judge,可能引入 judge 模型自身的偏见和不稳定性。
- 基准构建依赖 Gemini 3 Pro 生成初始 QA,数据的多样性和覆盖度受限于该模型的性能边界。
- 实验中使用的 60 秒滑动窗口仅为一种工程折衷,未详尽探索不同窗口策略对性能的影响。
审稿人发现的潜在问题:
- 基准的时间演变脆弱性:整个数据集生成和验证都深度绑定 Gemini 3 Pro,且评估依赖 Qwen3-235B。当这两个闭源或强模型更新/退役时,基准的可复现性和相对排名可能发生变化,降低了其作为长期社区标准基石的稳定性。
- Forward 任务定义的二元化惩罚:“在最早可回答时间戳之前任何非
`Silent`回答都算 0 分”的规则虽然严苛,但在某些人机对话场景中,助手基于生活常识做出合理预测并提前提醒可能恰恰是用户需要的。当前规则完全否定了这种“有用的预测”,与真实产品体验存在一定断层。虽然论文选择了最严格的定义以确保实验的对照性,但这一局限确实影响了基准与实际用户体验的对齐度。 - 音频模态的深入分析不足:消融实验仅对比了有/无音频的结果,但未细致拆解音频中的子类别信息(如环境音、语音、音乐)分别对 ER 倾向的贡献,也未讨论不同音频编码/特征提取方式带来的鲁棒性变化。论文仅在附录 A.5 中给出定性分析,未进行定量子类别测试。
- 非模型基准的通用局限:作为一个静态数据集基准,它无法评估模型在交互中随着用户反馈动态修正理解的能力,而这在真实移动助手中极为关键。即使一个模型在这个基准上拿到满分,也未必能处理真实世界中用户改口、补充信息等复杂交互。
- 音频缺失的 ProactiveVideoQA 对比:论文声称 ProactiveVideoQA 的大多数自我中心视频缺少音频模态,但未量化对比其自身基准中音频存在比例或音频信息丰富度,使得与 ProactiveVideoQA 的差异化对比略显笼统。