EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

📄 EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory 标签:#音视频问答 #大语言模型 #多模态模型 #音视频 #基准测试 7.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频问答 | #大语言模型 | #多模态模型 #音视频 | arxiv 👥 作者与机构 第一作者:Le Zhang(University of Michigan, Ann Arbor) 通讯作者:未说明 作者列表:Le Zhang(University of Michigan, Ann Arbor)、Ke Sun(University of Michigan, Ann Arbor) 💡 毒舌点评 这项工作把“索引条目本身不完整”和“检索只看语义、不看时间意图”这两个真实瓶颈讲得很清楚。EgoScheme 在写入索引前用局部多模态上下文消解指代和省略,EgoIndex 用动作、活动、言语、对话四个视图做多粒度划分,EgoRetrv 用软时间衰减和双智能体把“last / usually / this morning”从 prompt 修辞变成检索分数,三个基准上的准确率和证据命中率提升也基本连贯,成本账算得漂亮。短板是,它高度依赖 EgoLife 的人工 dense captions、身份先验,以及 GPT-5.4、Gemini-3.1-Pro 等闭源模型,不少领先数字锁定在特定 API 版本和定价结构上;对语音/音频领域读者来说,它仍更接近一个以视频多模态记忆与检索为中心的系统。 ...

2026-08-14 · 更新于 2026-08-14 · 4 min · 785 words

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

📄 Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA 标签:#音视频问答 #多模态模型 #音频大模型 #参数高效微调 #鲁棒性 6.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频问答 | #多模态模型 | #音频大模型 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Maryam Dehdashti(Inference Matter Labs) 通讯作者:Maryam Dehdashti(Inference Matter Labs;dehdashti@inferencematter.ai) 作者列表:Maryam Dehdashti(Inference Matter Labs) 💡 毒舌点评 这篇论文最有价值的不是又一个 Qwen 变体,而是用受控消融把“音频表示是否保留局部时间细节”与 AVQA 精度强关联起来,并且单卡约 5 小时的可复现成本很吸引人。短板也同样突出:所有结论锁死在 MUSIC-AVQA 的非标准可用视频子集上,Whisper vs PANNs 的 26 点差距被架构、预训练和池化差异共同污染,作者自己也承认这不是干净的因果实验;此外,AVQA 微调会牺牲 ASR 能力,说明得到的“多模态能力”在任务迁移和通用性上仍有明显边界。因此这篇工作更像一次有洞察的系统层观察和务实的模块化适配,而非方法学突破。 ...

2026-08-13 · 更新于 2026-08-14 · 5 min · 1043 words

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

📄 Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models 标签:#音视频问答 #多模态模型 #空间音频 #强化学习 6.7/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.7/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频问答 | #多模态模型 | #空间音频 #强化学习 | arxiv 👥 作者与机构 第一作者:Zhi Zeng(标注为共同一作,机构编号 1;机构名称未在正文中说明) 共同一作:Cheng Zhang、Zesheng Yang(机构编号 1)、Rendong Pi(机构编号 2) 作者列表:Zhi Zeng¹、Cheng Zhang¹、Zesheng Yang¹、Rendong Pi²、Jiaying Wu³、Di Zhang¹、Zihan Ma¹、Guodong Li⁴、Zhou Yang¹、Yu Xiang²、Yifei Zheng⁵、Minnan Luo¹(前四位标注 equal contribution;通讯作者未说明;1–5 为机构编号,机构名称未在论文中给出) 💡 毒舌点评 亮点:把"移动声源的时空跟踪与视觉绑定"正式定义为四级 QA 任务,并用模态必要性约束从构造上堵死单模态捷径,定位精准;ST-Omni-R1 平均 77.83% 领先最强闭源基线 Gemini-2.5-Pro(37.28%)达 40.55 个百分点,差距显著。 短板:核心产物(ST-OmniQA 数据、STA-encoder 代码、模型权重)完全未开源,一个基准论文拿不出基准本身,是最大的硬伤;全部数据来自 Matterport3D+SoundSpaces 2.0 单一仿真管线,真实场景只有音频模态的部分迁移证据;高度相关的近作 ST-AudioLM 在正文中被点名却未入表对比;且所有通用基线均为零样本,与经过同分布 SFT 的本文方法并不对等,“碾压式"领先需要打折解读。 📌 核心摘要 要解决的问题:现有音频语言模型(LALM)多以全局事件语义表示整段音频,视觉语言模型缺乏空间音频线索,SELD 则受限于固定词表与结构化输出,三者均无法对移动声源执行"定位—跟踪—跨模态绑定"的联合开放推理。 方法核心:构建 ST-OmniQA 基准(40K 全景视频 + 400K QA,四级能力 A/B/C/D,式 (2) 模态必要性约束),提出 ST-Omni-R1 模型,由 STA-encoder(1 个语义 token + 40 个时序轨迹 token)、Qwen2.5-VL-7B-Instruct 视频分支、两层 MLP 音频连接器组成,经 Stage A→D 渐进课程学习与推理树强化学习(RT-GRPO)训练。 新在哪里:基准层面要求答案仅在联合视听证据下唯一可解(\(|\mathcal{C}_A|>1, |\mathcal{C}_V|>1, |\mathcal{C}_{AV}|=1\));表示层面将 FOA 的时变声强向量转为有序轨迹 tokens,并与全景视觉实例绑定。 主要实验结果:ST-OmniQA 上 ST-Omni-R1(SFT+RT-RL)平均语义准确率 77.83%,最强闭源基线 Gemini-2.5-Pro 为 37.28%;TAU-NIGENS/L3DAS22/STARSS23 三个公开空间音频基准上总体均优于 BAT(注意 TAU-NIGENS 的 Elevation 子项上 BAT 50.00 略高于本文 49.50)。 实际意义:为"空间音频+全景视频"的动态声源推理提供了基准与基线系统,可能推动音视频问答、具身智能中声源跟踪与视觉绑定方向的研究。 主要局限:训练与评测均来自 Matterport3D+SoundSpaces 2.0 同一仿真引擎,真实场景仅有音频/音视频迁移的部分证据;模型、数据、代码均未开源;RT-GRPO 奖励权重与树节点打分细则未披露;Level C 仅 55.70% 且无失败模式分析。 下图展示了ST-OmniQA基准中的一个单源音频-视觉接地任务示例。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 493 words

C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

📄 C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models 标签:#音视频问答 #多模态模型 #基准测试 #数据集 #可解释性 5.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.5/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.5/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频问答 | #多模态模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Swapnanil Mukherjee(Microsoft Research India) 通讯作者:Swapnanil Mukherjee(Microsoft Research India,论文提供联系邮箱为 swapnanil.mukherjee12@gmail.com) 作者列表:Swapnanil Mukherjee(Microsoft Research India)、Agyeya Negi(IIIT Hyderabad)、Tanuja Ganu(Microsoft Research India)、Ponnurangam Kumaraguru(IIIT Hyderabad) 💡 毒舌点评 用自动管道造了一个看似覆盖全模态、实际由 Gemini 单方生成并单方审计的 C3PO 基准,再用这个基准宣称“Gemini-3.1-Pro 最强”,存在明显的循环评价风险。不过其 IC/CC 双轴设计与注意力熵分析确实触碰到了多模态模型“过早承诺单模态”这一真问题,且模板粒度很细,值得后续工作修正生成偏差后复用。如果作者不公开生成产物和完整模板逻辑,这个基准的实际影响力会大打折扣。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 690 words

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

📄 Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning 标签:#音视频问答 #多模态模型 #音频理解 #Transformer #模型评估 4.7/10 | 创新 0.8/2 | 严谨 0.7/1.5 | 实验 0.2/1.5 | 清晰 0.7/1 | 影响 0.2/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 4.7/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频问答 | #多模态模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Sahil Al Farib(未说明机构) 通讯作者:未说明 作者列表:Sahil Al Farib(未说明机构)、Momota Ahsana Meem(未说明机构)、Sheikh Redwanul Islam(未说明机构)、Md. Tanvir Raihan(未说明机构) 💡 毒舌点评 论文试图将证据锚定引入多模态教育知识图谱构建,审计性设计在逻辑上动机是好的。但实验部分仅有3个视频和3条查询,且无任何基线对比,这使其所有结论都停留在“初步探索”层面,远未达到顶会论文的最低实证标准。此外,核心任务是对讲座视频的结构化知识抽取与问答,音频信号处理仅作为ASR工具被被动调用,该工作与语音/音频领域核心问题关联极弱,难以在本领域产生影响力。 ...

2026-08-05 · 更新于 2026-08-14 · 2 min · 290 words

Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication

📄 Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication 标签:#音视频问答 #多模态模型 #音频理解 #Transformer #模型评估 6.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频问答 | #多模态模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Joohyuk Park(POSTECH, Department of Electrical Engineering) 通讯作者:Yo-Seb Jeon(POSTECH, Department of Electrical Engineering)、Jihong Park(Singapore University of Technology and Design) 作者列表:Joohyuk Park(POSTECH, Department of Electrical Engineering)、Junyong Shin(POSTECH, Department of Electrical Engineering)、Yongjeong Oh(Singapore University of Technology and Design)、Jihong Park(Singapore University of Technology and Design)、Yo-Seb Jeon(POSTECH, Department of Electrical Engineering) 💡 毒舌点评 亮点在于将无线通信中的 germ-grain 模型巧妙地迁移到了多模态 token 的几何对齐上,这个跨领域类比很有洞察力,且方法在 VQA/AVQA 任务上相比简单基线有显著提升。短板也很明显:整个框架严重依赖一个未验证的多查询共识假设(Hypothesis 1),其对感知任务性能的决定性作用被当作公理使用,缺乏深入的因果分析;更关键的是,论文研究多模态通信任务,但仅测试了视觉导向的 QA,完全避开了音频领域的主流 benchmark(如声源定位、音频场景分类),其"影响力"评估仅凭两个基准支撑,说服力不足。 ...

2026-08-05 · 更新于 2026-08-14 · 3 min · 488 words

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

📄 OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs 标签:#音视频问答 #模型压缩 #音视频理解 #高效推理 #多模态模型 7.0/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频问答 | #模型压缩 | #音视频理解 #高效推理 | arxiv 👥 作者与机构 第一作者:Haoyang Huang (浙江大学, 阿里巴巴通义应用) 通讯作者:Jun Zhang (阿里巴巴通义应用), Xinyi Hu (阿里巴巴通义应用), Meng Zhang (浙江大学) 作者列表:Haoyang Huang (浙江大学, 阿里巴巴通义应用), Wenjie Huang (浙江大学, 阿里巴巴通义应用), Tianqi Xu (卡内基梅隆大学, 阿里巴巴通义应用), Hongyaoxing Gu (中国科学院大学, 阿里巴巴通义应用), Kang Tan (浙江大学), Yikai Fu (浙江大学), Yuhao Shen (浙江大学, 阿里巴巴通义应用), Tianyu Liu (中国科学技术大学), Baolin Zhang (阿里巴巴通义应用), Jun Zhang (阿里巴巴通义应用), Xinyi Hu (阿里巴巴通义应用), Jun Dai (阿里巴巴通义应用), Shuang Ge (阿里巴巴通义应用), Lei Chen (阿里巴巴通义应用), Yue Li (阿里巴巴通义应用), Mingchen Wang (阿里巴巴通义应用), Meng Zhang (浙江大学) 💡 毒舌点评 作者用一个精心设计的诊断实验漂亮地揭露了OmniLLM压缩社区集体忽视的前置问题——预算分配先于token选择,动机部分堪称范本。然而,当读者期待一个纯粹训练无关(training-free)的优雅方案时,作者默默掏出了GPT-5.5-xhigh来完成技能池构建、查询分类和诊断标注,这相当于用F1赛车跑完了"自行车拉力赛"的第一段。整套方案完全闭源,技能池JSON不公布,所有声称的Pareto前沿推进都无法被独立验证——对于一篇声称建立新基线的论文来说,这是硬伤。此外,OmniDelta相比OmniZip的1个百分点平均提升,在缺乏置信区间的情况下,到底是真信号还是统计噪声,只有作者自己清楚。 ...

2026-07-29 · 更新于 2026-08-14 · 4 min · 794 words

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

📄 OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models 标签:#音视频问答 #模型压缩 #音频理解 #Transformer #模型评估 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频问答 | #模型压缩 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Jinsen Su(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院) 通讯作者:Xiaowu Zheng(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院) 作者列表:Jinsen Su(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院)、Yongdong Luo(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院、阿里巴巴集团)、Yuexiao Ma(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院、厦门大学信息学院)、Yibo Hu(阿里巴巴集团)、Meiguang Jin(阿里巴巴集团)、Xiaowu Zheng(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院) 💡 毒舌点评 这篇论文找到了一个很好的切入点:全模态压缩中不该让一个模态去指导另一个,因为音视频对同一个查询的“高光时刻”往往不同步。Attention可视化加相关性分布统计的Motivation做得扎实,直接命中了OmniZip等现有方法的软肋。不过,架构上对CLIP作为外部视觉评分器的依赖是最大的硬伤——明明音频侧可以复用模型内部表征做查询感知评分,视觉侧却要额外跑一个ViT-L,推理延迟在短生成场景下完全无法忽略。如果能用模型自身的视觉编码器替代CLIP,这篇工作的实用价值会再上一个台阶。 ...

2026-07-29 · 更新于 2026-08-14 · 3 min · 504 words

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

📄 Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos 标签:#音视频理解 #多模态模型 #音视频问答 #数据集 #课程学习 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频理解 | #多模态模型 | #音视频问答 #数据集 | arxiv 👥 作者与机构 第一作者:Sreyan Ghosh(NVIDIA, USA;University of Maryland, USA) 通讯作者:未说明 作者列表:Sreyan Ghosh(NVIDIA, USA;University of Maryland, USA)、Arushi Goel(NVIDIA, USA;University of Maryland, USA)、Kaousheik Jayakumar(University of Maryland, USA)、Lasha Koroshinadze(University of Maryland, USA)、Nishit Anand(University of Maryland, USA)、Siddharth Gururani(NVIDIA, USA)、Hanrong Ye(NVIDIA, USA)、Pritam Biswas(NVIDIA, USA)、Yuanhang Su(NVIDIA, USA)、Ehsan Hosseini-Asl(NVIDIA, USA)、Sang-gil Lee(NVIDIA, USA)、Zhifeng Kong(NVIDIA, USA)、Jaehyeon Kim(NVIDIA, USA)、Sungwon Kim(NVIDIA, USA)、Karan Sapra(NVIDIA, USA)、S Sakshi(University of Maryland, USA)、Ramani Duraiswami(University of Maryland, USA)、Dinesh Manocha(University of Maryland, USA)、Andrew Tao(NVIDIA, USA)、Mohammad Shoeybi(NVIDIA, USA)、Bryan Catanzaro(NVIDIA, USA)、Ming-Yu Liu(NVIDIA, USA)、Wei Ping(NVIDIA, USA) 💡 毒舌点评 论文在工程和开源上堪称模范生,提供了从数据集、训练代码到模型权重的完整“全家桶”,对音视频理解领域的研究者极具实用价值。然而,其核心创新更接近于一个精心设计的系统集成和工程优化,而非原理性突破,方法的新颖性相对有限。 ...

2026-07-20 · 更新于 2026-08-14 · 4 min · 700 words

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

📄 OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models #多模态模型 #模型压缩 #音视频问答 5.9/10 | 创新 1/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.9/10 | 前50% | #音视频问答 | #模型压缩 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Shijie Cao(School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences; Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences) 通讯作者:论文中未明确标注通讯作者,但根据邮箱模式与作者排序推断,Yaojie Lu 为 senior 作者,通常担任通讯作者。 作者列表:Shijie Cao(University of Chinese Academy of Sciences; Institute of Software, Chinese Academy of Sciences)、Qingyu Zhang(Institute of Software, Chinese Academy of Sciences)、Boxi Yu(University of Limerick)、Yuzhong Zhang(CUHK, Shenzhen)、Boxi Cao(Institute of Software, Chinese Academy of Sciences)、Yaojie Lu(Institute of Software, Chinese Academy of Sciences)、Hongyu Lin(Institute of Software, Chinese Academy of Sciences)、Xianpei Han(Institute of Software, Chinese Academy of Sciences)、Le Sun(Institute of Software, Chinese Academy of Sciences) 💡 毒舌点评 本文提出了一个思路清晰但技术深度一般的训练无关 token 压缩策略。亮点在于正确识别了单模态(音频)引导压缩会系统性地损害视觉模态性能的问题,并给出了直觉上合理的对称解决方案。然而,方法本质上是基于余弦相似度的启发式采样,缺乏理论创新,且在“前沿模型全量微调”和“关键任务精度”这两端都不讨好,其性能优势在多数 benchmark 上仅 1-2 个百分点,属于典型的边缘提升,难以在顶级会议中产生显著吸引力。提交时未提供可用的代码或复现材料,进一步削弱了其可信度。 ...

2026-07-07 · 更新于 2026-08-14 · 4 min · 718 words