Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

📄 Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos 标签:#音视频理解 #多模态模型 #音视频问答 #数据集 #课程学习 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频理解 | #多模态模型 | #音视频问答 #数据集 | arxiv 👥 作者与机构 第一作者:Sreyan Ghosh(NVIDIA, USA;University of Maryland, USA) 通讯作者:未说明 作者列表:Sreyan Ghosh(NVIDIA, USA;University of Maryland, USA)、Arushi Goel(NVIDIA, USA;University of Maryland, USA)、Kaousheik Jayakumar(University of Maryland, USA)、Lasha Koroshinadze(University of Maryland, USA)、Nishit Anand(University of Maryland, USA)、Siddharth Gururani(NVIDIA, USA)、Hanrong Ye(NVIDIA, USA)、Pritam Biswas(NVIDIA, USA)、Yuanhang Su(NVIDIA, USA)、Ehsan Hosseini-Asl(NVIDIA, USA)、Sang-gil Lee(NVIDIA, USA)、Zhifeng Kong(NVIDIA, USA)、Jaehyeon Kim(NVIDIA, USA)、Sungwon Kim(NVIDIA, USA)、Karan Sapra(NVIDIA, USA)、S Sakshi(University of Maryland, USA)、Ramani Duraiswami(University of Maryland, USA)、Dinesh Manocha(University of Maryland, USA)、Andrew Tao(NVIDIA, USA)、Mohammad Shoeybi(NVIDIA, USA)、Bryan Catanzaro(NVIDIA, USA)、Ming-Yu Liu(NVIDIA, USA)、Wei Ping(NVIDIA, USA) 💡 毒舌点评 论文在工程和开源上堪称模范生,提供了从数据集、训练代码到模型权重的完整“全家桶”,对音视频理解领域的研究者极具实用价值。然而,其核心创新更接近于一个精心设计的系统集成和工程优化,而非原理性突破,方法的新颖性相对有限。 ...

2026-07-20 · 更新于 2026-07-24 · 4 min · 700 words

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

📄 OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models #多模态模型 #模型压缩 #音视频问答 5.9/10 | 创新 1/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.9/10 | 前50% | #音视频问答 | #模型压缩 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Shijie Cao(School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences; Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences) 通讯作者:论文中未明确标注通讯作者,但根据邮箱模式与作者排序推断,Yaojie Lu 为 senior 作者,通常担任通讯作者。 作者列表:Shijie Cao(University of Chinese Academy of Sciences; Institute of Software, Chinese Academy of Sciences)、Qingyu Zhang(Institute of Software, Chinese Academy of Sciences)、Boxi Yu(University of Limerick)、Yuzhong Zhang(CUHK, Shenzhen)、Boxi Cao(Institute of Software, Chinese Academy of Sciences)、Yaojie Lu(Institute of Software, Chinese Academy of Sciences)、Hongyu Lin(Institute of Software, Chinese Academy of Sciences)、Xianpei Han(Institute of Software, Chinese Academy of Sciences)、Le Sun(Institute of Software, Chinese Academy of Sciences) 💡 毒舌点评 本文提出了一个思路清晰但技术深度一般的训练无关 token 压缩策略。亮点在于正确识别了单模态(音频)引导压缩会系统性地损害视觉模态性能的问题,并给出了直觉上合理的对称解决方案。然而,方法本质上是基于余弦相似度的启发式采样,缺乏理论创新,且在“前沿模型全量微调”和“关键任务精度”这两端都不讨好,其性能优势在多数 benchmark 上仅 1-2 个百分点,属于典型的边缘提升,难以在顶级会议中产生显著吸引力。提交时未提供可用的代码或复现材料,进一步削弱了其可信度。 ...

2026-07-07 · 更新于 2026-07-24 · 4 min · 718 words

E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs

📄 E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs #音视频问答 #基准测试 #多模态模型 #强化学习 6.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.5/1 | 影响 0.4/1.5 | 开源 0.8/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 ✅ 6.9/10 | 前50% | #音视频问答 | #强化学习 | #基准测试 #多模态模型 | arxiv 👥 作者与机构 第一作者:Xianjie Liu(阿里巴巴淘宝天猫集团阿里妈妈技术部,实习期间完成此项工作) 通讯作者:Yiman Hu(阿里巴巴淘宝天猫集团阿里妈妈技术部, 项目负责人)、Liang Wu(阿里巴巴淘宝天猫集团阿里妈妈技术部)、Jian Xu(阿里巴巴淘宝天猫集团阿里妈妈技术部)、Bo Zheng(阿里巴巴淘宝天猫集团阿里妈妈技术部) 作者列表: Xianjie Liu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Yiman Hu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Liang Wu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Ping Hu(Vin University,未说明具体学院/实验室) Yixiong Zou(华中科技大学,未说明具体学院/实验室) Jian Xu(阿里巴巴淘宝天猫集团阿里妈妈技术部) Bo Zheng(阿里巴巴淘宝天猫集团阿里妈妈技术部) 💡 毒舌点评 这篇论文精准切入了一个被顶会圈子长期忽视、却蕴藏巨大商业价值的领域——电商短视频理解。其提出的多模态密度评估框架是整个工作的点睛之笔,为“这任务为什么难”提供了量化的、有说服力的证据。然而,如果说方法部分展现的是专业团队的水准,那么论文呈现的排版质量则近乎草稿级别:严重的文本渲染错乱和表格乱码问题,贯穿全文,这不仅严重损害了专业形象,也让人怀疑作者对细节的态度。更关键的是,对于音频领域的读者而言,本文对语音信号的处理极其“粗暴”——将丰富的人类语言表达(韵律、情感、强调)简化为一串被计数的词汇,这与现代语音/副语言分析的前沿水平存在显著断层。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 587 words

FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs

📄 FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs #音视频问答 #指令微调 8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 1.1/1.5 | 开源 1.1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8/10 | 前25% | #音视频问答 | #指令微调 | arxiv 👥 作者与机构 第一作者:Qian Chen(复旦大学,上海) 通讯作者:Jinlan Fu(复旦大学,上海) 作者列表:Qian Chen(复旦大学,上海)、Jinlan Fu(复旦大学,上海)、Changsong Li(复旦大学,上海;上海创新研究院)、Min Zhang(哈尔滨工业大学,深圳)、See-Kiong Ng(新加坡国立大学)、Xipeng Qiu(复旦大学,上海;上海创新研究院) 💡 毒舌点评 FutureOmni 精准地抓住了当前多模态 LLM 评估中“回顾性理解”泛滥而“前瞻性预测”缺失的真实痛处,尤其是首次将音频拉入未来预测评估的核心,这使得它天生比纯视觉的未来预测基准高出一个段位。然而,OFF 训练策略本质是标准指令微调加上因果推理数据,在方法论上缺乏令人惊喜的架构创新,更像是一次精心设计的数据集和评估框架贡献,而非全新的建模范式。 📌 核心摘要 要解决的问题:现有多模态大语言模型(MLLM)评估主要聚焦于回顾性理解,忽视了从音视频联合上下文中预测未来事件的能力,尤其是音频模态在预测中的关键作用长期未被系统性地评估。 方法核心:构建了首个面向 Omni-modal 未来预测的基准测试 FutureOmni(含 919 个视频、1,034 条多选 QA),并提出 OFF (Omni-Modal Future Forecasting) 训练策略。该策略基于 7, 761 条指令微调数据,训练模型基于历史音视频片段进行因果推理和预测。 与已有方法的不同:区别于纯视觉(VLEP、IntentQA)或纯文本的未来预测基准,FutureOmni 首次将音频模态作为预测的核心信息来源。引入了四种对抗性干扰项(仅视觉、仅音频、延迟、逆因果),迫使模型进行真正的跨模态因果推理。 主要实验结果:在 20 个模型上进行了评估,表现最佳的商用模型 Gemini 3 Flash 准确率仅为 64.8%,而最强开源 Omni 模型 Qwen3-Omni 为 53.05%。OFF 训练策略使得 Qwen2.5-Omni 在语音密集型场景中提升了近 10%(37.83% → 47.75%) ,video-SALMONN 2 提升了 3.87%。此外,OFF训练还展现了对通用音视频基准的泛化能力提升。 模型 Cartoon Edu Emerg Surv Daily Movie Game Doc Avg AVicuna 7B 31.62 39.00 26.09 35.21 32.81 28.19 33.73 20.83 30.37 VideoLLaMA2 7B 43.59 47.00 29.35 53.52 40.62 32.60 57.83 31.94 40.75 Qwen2.5-Omni 3B 37.61 51.00 29.35 57.75 35.94 32.16 51.81 25.00 38.91 video-SALMONN 2 7B 43.59 55.00 39.13 57.04 48.44 40.97 57.83 34.72 46.03 Qwen3-Omni 30B 52.94 68.00 32.88 62.71 59.05 45.60 62.65 49.25 53.05 Gemini 3 Flash 62.71 75.00 58.70 80.28 68.75 59.03 65.06 53.47 64.80 GPT-4o (video-only) 44.06 65.00 34.78 57.74 52.34 50.22 51.80 36.11 49.70 实际意义:为多模态 LLM 的预测推理能力提供了标准化的评估框架,有望推动自动驾驶、人机交互等需要前瞻性感知的应用场景研究。 主要局限性:数据集规模相对较小(919个视频),视频时长分布不均,中长视频样本不足导致分析结论可能不稳定。OFF 训练策略创新性有限。评估仅限选择题形式,缺乏开放式生成评估,可能无法完整反映模型的预测能力。 🔗 开源详情 代码:提供了 GitHub 链接:https://github.com/OpenMOSS/FutureOmni 模型权重:未提供 OFF 微调后的模型检查点。 数据集:FutureOmni 评测基准和 FutureOmni-7K 指令微调数据集可通过上述 GitHub 仓库获取。 Demo:未提及。 复现材料:训练和推理配置见附录,代码仓库提供了实现脚本。论文本身未提供可直接运行的完整训练配置文件或详细的数据预处理脚本。 🏗️ 方法概述和架构 FutureOmni 的核心方法包括基准构建流水线、评估框架设计和 OFF 训练策略三大部分。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 632 words

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

📄 OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models #音视频问答 #模型压缩 7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | #音视频问答 | #模型压缩 | arxiv 👥 作者与机构 第一作者(共一):Yue Ding(中国科学院自动化研究所模式识别国家重点实验室;快手科技Kling团队)与 Yiyan Ji(南京大学) 通讯作者:Qiang Liu(中国科学院自动化研究所模式识别国家重点实验室) 作者列表:Yue Ding(中科院自动化所;快手科技)、Yiyan Ji(南京大学)、Jungang Li(香港科技大学(广州))、Xuyang Liu(四川大学)、Xinlong Chen(中科院自动化所)、Junfei Wu(中科院自动化所)、Bozhou Li(北京大学)、Bohan Zeng(北京大学)、Yang Shi(北京大学)、Yushuo Guan(快手科技)、Yuanxing Zhang(快手科技)、Jiaheng Liu(南京大学)、Qiang Liu(中科院自动化所)、Pengfei Wan(快手科技)、Liang Wang(中科院自动化所) 💡 毒舌点评 这篇论文的“视觉先行、再引导音频”两阶段压缩,直觉干净,实验也漂亮——35% tokens就能战平甚至略超 full-token baseline,效率提升显著。但自信别太早:核心实验全在 Qwen2.5-Omni 上跑,换到 Qwen3-Omni 马上掉点(DailyOmni 70.5 vs. 70.8 full),说明方法的普适性没那么神。STVP 那套“按位置算余弦距离就当时间显著性”的操作,本质上仍在像素级做差分,真正的物体运动、遮挡这些时序动态它根本没建模,却好意思标榜“temporal redundancy”处理。Chunk 级剪枝更是直接摆烂,跨 chunk 长程依赖直接放弃,这可是 long-form 理解的基本盘。想法好、工程值钱,但别急着说自己是范式开创者。 ...

2026-07-04 · 更新于 2026-07-24 · 7 min · 1345 words

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

📄 OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention #音视频问答 #强化学习 #后训练 #对比学习 #自监督学习 7.5/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | #音视频问答 | #强化学习 | #后训练 #对比学习 | arxiv 👥 作者与机构 第一作者:Zhangquan Chen(清华大学,THU;实习于腾讯HY) 通讯作者:Ruqi Huang(清华大学深圳国际研究生院,sz.tsinghua.edu.cn)、Jiale Tao(腾讯HY,jialetao.std@gmail.com) 作者列表:Zhangquan Chen(清华大学)、Jiale Tao(腾讯HY)、Ruihuang Li(腾讯HY)、Yihao Hu(湖南大学,HNU)、Ruitao Chen(腾讯HY)、Zhantao Yang(腾讯HY)、Xinlei Yu(新加坡国立大学,NUS)、Haodong Jing(西安交通大学,XJTU)、Manyuan Zhang(香港中文大学,CUHK)、Shuai Shao(腾讯HY)、Biao Wang(腾讯HY)、Qinglin Lu(腾讯HY)、Ruqi Huang(清华大学深圳国际研究生院) 💡 毒舌点评 这篇论文精准地抓住了“多模态模型一加音频就变傻”的痛点,提出的两阶段RL框架,特别是用自监督时间-字幕对齐来驱动查询密集型局部定位,设计思路相当巧妙,拿掉了过程级标注这个昂贵的门槛。然而,死穴和亮点一样突出:整个奖励函数几乎把身家性命都押在了外部judge模型的质量上,论文对judge偏差传播和reward hacking的风险几乎没有展开讨论,这让人对训练信号的可靠性打上一个大大的问号;更致命的是,所有代码、模型权重和训练数据均未开源,号称“第一个RL框架”却把复现门槛拉满,使得那些漂亮的SOTA数字目前只能被视为“纸上SOTA”,在第三方验证之前说服力大打折扣。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 439 words

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

📄 PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios #音视频问答 #基准测试 #多模态模型 #流式处理 #数据集 7.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.3/10 | 前50% | #音视频问答 | #多模态模型 | #基准测试 #流式处理 | arxiv 👥 作者与机构 第一作者:Xudong Lu(香港中文大学 MMLab) 通讯作者:Rui Liu(华为研究,liu.rui2@huawei.com)、Hongsheng Li(香港中文大学 MMLab,hsli@ee.cuhk.edu.hk) 作者列表:Xudong Lu(香港中文大学 MMLab)、Huankang Guan(华为研究)、Yang Bo(华为研究)、Jinpeng Chen(华为研究)、Xintong Guo(华为研究)、Shuhan Li(华为研究)、Fang Liu(香港城市大学)、Peiwen Sun(香港中文大学 MMLab)、Xueying Li(上海交通大学)、Wei Zhang(上海交通大学)、Xue Yang(上海交通大学)、Rui Liu(华为研究)、Hongsheng Li(香港中文大学 MMLab) 💡 毒舌点评 这篇论文发现了一个真实且普遍的“模型太猴急”问题,用精心设计的流式基准把主流 MLLM 都打回了原形,Forward 任务的惨淡分数极具说服力。但作为 benchmark 论文,它过度依赖 Gemini 3 Pro 做数据生成和 Qwen3-235B 做评估,一旦这两个闭源/强模型更新,基准的稳定性和公平性就很微妙;而且在多模态流式领域,作者把“音频”当成了加分项来宣传,结果消融实验却显示开音频反而让 Forward 性能更差,这个自曝其短的结论让人既敬佩又哭笑不得。 ...

2026-07-04 · 更新于 2026-07-24 · 4 min · 836 words

V-LynX: Token Interface Alignment for Video+X LLMs

📄 V-LynX: Token Interface Alignment for Video+X LLMs #音视频问答 #LoRA #参数高效微调 #多模态模型 7.8/10 | 创新 1.4/2 | 严谨 1.4/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 0.6/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 ✅ 7.8/10 | 前25% | #音视频问答 | #LoRA | #参数高效微调 #多模态模型 | arxiv 👥 作者与机构 第一作者:Jungin Park(Yonsei University, Seoul, South Korea) 通讯作者:Jiyoung Lee(Ewha Womans University, Seoul, South Korea)、Kwanghoon Sohn(Yonsei University, Seoul, South Korea) 作者列表:Jungin Park(Yonsei University)、Jiyoung Lee(Ewha Womans University)、Kwanghoon Sohn(Yonsei University) 💡 毒舌点评 这篇论文的立意相当精巧:不搞那些“缝合怪”式的多模态堆叠,而是发现并利用了Video LLM内部天然存在的“Token Interface”——一个连续的几何流形。这相当于告诉你,LLM处理视觉信号时,并不是在翻译词汇,而是在一个“特区”里搞特殊运算。基于此,作者仅用LoRA + 无标签单模态数据,就将音频、3D等新模态像U盘一样即插即用到了视频模型上,参数效率惊人。不过,别高兴太早,这个方法对视觉证据有极强的“路径依赖”,纯音频概念(如BGM里的乐器识别)直接抓瞎,因为它的接口底层逻辑就是“视觉特区”。这限制了它能覆盖的真实世界场景广度。 ...

2026-07-04 · 更新于 2026-07-24 · 2 min · 419 words

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

📄 video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM #音视频问答 #测试时自适应 #流式处理 #基准测试 #多模态模型 7.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.3/10 | 前50% | #音视频问答 | #测试时自适应 | #流式处理 #基准测试 | arxiv 👥 作者与机构 第一作者:Guangzhi Sun(清华大学、剑桥大学) 通讯作者:Chao Zhang(清华大学,cz277@tsinghau.edu) 作者列表:Guangzhi Sun(清华大学、剑桥大学)、Yixuan Li(剑桥大学)、Xiaodong Wu(剑桥大学)、Yudong Yang(剑桥大学)、Wei Li(字节跳动)、Zejun Ma(字节跳动)、Chao Zhang(清华大学) 💡 毒舌点评 这篇工作将Test-Time Training首次引入流式视频理解做长期记忆增强,确实聪明且有效,TTT_MEM在极低内存预算下碾压了传统token合并方法。但作为ICML投稿,实验规模偏小、训练和推理细节多处模糊,作者对ELViM基准的创建过程讳莫如深(人工审核标准、过滤比例等一概不提),这让整个benchmark的可信度打了折扣。 📌 核心摘要 该论文旨在解决流式长视频理解中,由于固定内存预算导致的累积信息丢失问题,特别是模型在长时间跨度上难以保持对早期内容的记忆。 核心方法是首次在流式视频LLM中引入Test-Time Training作为长期记忆机制,提出TTT_MEM层,通过快速权重更新将短期多模态表征持续转化为内嵌于模型参数的长期记忆。 与现有token合并或丢弃的流式方法不同,TTT_MEM新增了长跨度预测目标以强化长距依赖建模,辅以两阶段训练策略和模态感知的记忆读取机制,在不增加显存的同时保留了更完整的历史信息。 主要实验结果显示,在16k内存token设定下,video-SALMONN S在Video-MME长视频集上达71.3%(超过非流式基线的69.6%),在LVBench上达55.4%,在VideoEvalPro上达55.8%;在自建ELViM基准上,以46.7%的绝对准确率相比非流式基线提升14.2%,相比PEMF流式基线提升8.5%。消融实验中TTT_MEM在2k内存token时即达到与普通merging在16k token时相当的精度水平。 实际意义在于为需要长期连续运行的视频AI代理(如智能监控、教学辅助、远程协作)提供了更有效的记忆机制,同时不突破显存限制,为端侧部署长期视频理解提供了一种新范式。 主要局限性包括:ELViM基准仅包含约1000个目标视频,规模偏小且类别集中在生活技能类,泛化性存疑;训练和推理配置细节缺失较多,复现门槛较高;TTT_MEM目前仅处理视觉token,音频信息完全绕开,尚未充分利用多模态互补性。 🔗 开源详情 代码:https://github.com/bytedance/SALMONN/tree/video-salmonn-S-MEM ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 523 words

Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

📄 Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought #音视频问答 #多模态模型 #跨模态推理 #幻觉缓解 #强化学习 #链式思维 ✅ 6.0/10 | 前50% | #音视频问答 | #结构化推理 | #多模态模型 #跨模态推理 | arxiv 学术质量 6.0/8 | 影响力 0.4/2 | 可复现性 0.3/1 | 置信度 高 👥 作者与机构 第一作者:Xuanchen (未说明) 通讯作者:未说明 作者列表:Xuanchen Li (未说明), Yuheng Lu (未说明), Chenrui Cui (未说明), Tianrui Wang (未说明), Zikang Huang (未说明), Yu Jiang (未说明), Long Zhou (未说明), Longbiao Wang (未说明), Jianwu Dang (未说明) 💡 毒舌点评 论文针对音视频LLM中的跨模态干扰和幻觉问题,提出了一个结构清晰、动机合理的“先分离后融合”框架。其核心贡献在于将“模态分离推理”的文本结构与“模态非对称注意力掩码”的底层计算约束相结合,并用两阶段强化学习进行训练。然而,其创新性更多体现在对已有技术(结构化CoT、自定义注意力掩码、RL奖励工程)的针对性组合与应用,而非提出根本性的新机制。此外,论文声称的“state-of-the-art”性能建立在与并非当前最强基线的对比之上,且实验缺乏统计显著性检验,这在一定程度上削弱了结论的强度。 ...

2026-05-12 · 更新于 2026-07-24 · 4 min · 660 words