PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
📄 PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios #音视频问答 #基准测试 #多模态模型 #流式处理 #数据集 7.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.3/10 | 前50% | #音视频问答 | #多模态模型 | #基准测试 #流式处理 | arxiv 👥 作者与机构 第一作者:Xudong Lu(香港中文大学 MMLab) 通讯作者:Rui Liu(华为研究,liu.rui2@huawei.com)、Hongsheng Li(香港中文大学 MMLab,hsli@ee.cuhk.edu.hk) 作者列表:Xudong Lu(香港中文大学 MMLab)、Huankang Guan(华为研究)、Yang Bo(华为研究)、Jinpeng Chen(华为研究)、Xintong Guo(华为研究)、Shuhan Li(华为研究)、Fang Liu(香港城市大学)、Peiwen Sun(香港中文大学 MMLab)、Xueying Li(上海交通大学)、Wei Zhang(上海交通大学)、Xue Yang(上海交通大学)、Rui Liu(华为研究)、Hongsheng Li(香港中文大学 MMLab) 💡 毒舌点评 这篇论文发现了一个真实且普遍的“模型太猴急”问题,用精心设计的流式基准把主流 MLLM 都打回了原形,Forward 任务的惨淡分数极具说服力。但作为 benchmark 论文,它过度依赖 Gemini 3 Pro 做数据生成和 Qwen3-235B 做评估,一旦这两个闭源/强模型更新,基准的稳定性和公平性就很微妙;而且在多模态流式领域,作者把“音频”当成了加分项来宣传,结果消融实验却显示开音频反而让 Forward 性能更差,这个自曝其短的结论让人既敬佩又哭笑不得。 ...